先给大家讲个真事。

9月3日将近凌晨——全球 AI 界罕见地迎来了「三大巨头集体宕机」。

ChatGPT 挂了,Claude 亮起了红灯,连 Grok 也瘫在原地,三巨头里的只有 Gemini 稳如泰山、丝毫不受影响。1

就在大家一片哀鸿遍野、准备睡觉的时候,群里突然幽幽地蹦出来一位老哥,带着三分疑惑和七分优越感敲下一行字:

「为啥我的 Fable 5.1 稳如老狗啊。」

群里瞬间安静了几秒,随后充满了欢乐的笑声。

  • 如果你一眼就看懂了这个笑点,那么这篇文章你可以直接划走了,它真不是写给你的。
  • 包括那些终端里常年挂着三四个 CLI 编程工具、每天熟练地放牧各种多智能体的大神们,也都可以散了。
  • 其余的大家伙可以接着往下看。

随手翻一翻少数派今年的热门文章的时间线,AI 的密度高得甚至让人有点喘不过气。但我也很清楚,站内依然有很大一部分朋友,可能是和我一样的普通上班族和数字生活爱好者——每天和 AI 打交道的方式,依然严格停留在网页版的那个对话框里。

你一边熟练地用着豆包、DeepSeek 查资料、润色文档,一边看着派早报、微博和小红书里铺天盖地的「新模型颠覆一切」「不会 Vibe Coding 的人将被淘汰」的种种,心里难免会泛起一种跟不上时代的被动与焦虑。你很想试试,但看着各种技术文章、GitHub 里动辄几百行的环境配置、终端指令,脚步又收了回来。

但请你放心,在这篇文章里,我不打算卖弄任何专有名词,更不打算劝你「All in 智能体」。

我想以一个实打实踩了半年坑、如今每天离不开它的普通人视角,循序渐进地跟你聊聊:怎么从只会「一问一答」的 Chat 端,平稳地把脚迈进能够真正替你动手的「Agent 端」。


先搞明白 Agent 是什么?

第一,明白动嘴和动手的区别

  • 传统 Chat 模式的核心是动嘴:你问一句,他回一段,最多你再把它生成的内容给粘出来。当然现在 Chat 已经有一定工具调用能力,但是还是没法直接在你电脑上干活。
  • 典型 Agent 模式的核心是动手:你给它一个明确的目标和边界,它负责在后台把事情推着往前走。中间遇到了报错,它会看一眼,然后在心里嘀咕一句「原来这里写错了」,自己改改再试,不断在试错中找到正确的路径。最后交付给你一个像模像样的结果。换句话说,可以胜任更加弯弯绕绕、复杂的任务。

第二, Agent 说白了到底是什么

在学术论文里,学者们把 Agent 拆成了极其复杂的认知架构;李博杰老师开源的那本《深入理解 AI Agent》2,把现代 Agent 浓缩为一个公式:

Agent = LLM + 上下文 + 工具

但在现实生活里,我们普通人完全不需要去硬啃这些概念。

我更愿意把现在的 Agent,比作一个智商 160、满腹经纶,但实际上是今天第一天到你家、到你办公室报到的超级实习生

这孩子脑子极好,上知天文地理,下知鸡毛蒜皮;上山能够擒鸟,下河可以摸鱼。但他也有一个致命的问题:他才刚刚进门,两眼一抹黑。

  • 他不知道你家装剪刀的抽屉在哪里,也不知道你平时的做事习惯(这叫缺乏上下文与记忆);
  • 你如果只把双手插在兜里跟他聊天,他也就只能坐在工位上跟你口沫横飞地头脑风暴(这就是前面说的 Chat 模式);
  • 只有当你把办公室的抽屉钥匙交给他,塞给他一把螺丝刀、一台连着打印机和互联网的电脑,并且明确告诉他「去把这个文档整理好」(这叫赋予工具和执行权限),他才真正具备了替你跑腿干活的能力(这就是 Agent 模式)。

开始之前你应该要知道,现在使用 Agent 的门槛已经足够低了

明白了这个角色定位,很多人想迈出第一步时,迎面撞上的第一个拦路虎,往往是一个词:Token

在网页版 Chat 端聊天,大部分服务都是免费的。但一听到 Agent,很多人第一反应是:「听说这玩意是按 Token 实时扣钱的?动动手指是不是在烧真金白银?」

是的,Agent 执行任务时消耗的 Token 远超普通聊天。这是由它的工作方式决定的:

  • Chat 是「单次结清」,很多时候就是一次请求、一次回答,你问多少字,它答多少字,交易结束,两不相欠。而且大多数 Chat 端是免费使用的。
  • 而 Agent 是在后台把一个目标拆成好多步:它要想一想(消耗思考 Token),跑去读个网页(几千 Token 塞进脑子),看一眼结果对不对,再决定下一步干嘛……而且这些 Token 需要由你买单。

在这个循环里,每一次它调用工具、每一次它自我修正,前面发生的所有来龙去脉,都要过一遍。

听起来很烧钱对不对?

但好在,这只是技术底层的逻辑,对于今天的普通用户来说,尝鲜的门槛其实早就被抹平了。

不像国外很多工具动辄要绑定外币信用卡去购买,目前国内很多集成好的 Agent 工作台(比如腾讯的 WorkBuddy,字节跳动的豆包工作、Trae,阿里的千问办公等),不仅操作界面完全图形化,而且每天都提供了一定量的免费额度。像 WorkBuddy 这类工具,甚至直接把自家最新的大模型放进免费通道供大家日常使用。虽然有限速、有限额,但应付日常的办公、整理、分析任务,我觉得是够用了。3

你根本不需要在一开始就去研究怎么绑卡、怎么购买服务。现在的门槛已经足够低,不需要付出一分钱学费,就能让你把这位超级实习生请进门。


妄图当甩手掌柜的代价,是梦的破灭

好,工具装好了,免费额度也有了。接下来最致命的问题来了:你该让他干什么?

绝大多数新手在这个阶段,最容易犯的毛病就是开一个大项目,妄图当甩手掌柜。我也不例外。

一开始玩 Agent 的时候,我也曾雄心勃勃地幻想过搞一套「全自动量化投资回测系统」。我自作聪明地在脑子里构思了一个极其严密的五道风控闸门,把所有权限全权交给它,让它自己写策略、自己抓历史数据、自己跑模拟。

两三小时后,它交出了一份惊艳的答卷:年化收益率 15%,更离谱的是回撤小得不可思议。

我当时极其兴奋,实盘前前后后试了两三个月。但结果呢?当然是我一败涂地。

后来等我真正静下心来去逐行审计代码,才发现了极其可笑的漏洞:它在底层策略里,调用了未来函数,也就是偷偷看了未来会发生什么,而且没有考虑真实交易的滑点和手续费……

那一刻我坐在椅子上反思了很久:到底是 Agent 不靠谱,还是我根本就用错了?

答案显然是后者。对于那种环境极度复杂、变量近乎无限、连你自己都没摸透底层规律的事情(比如投资理财、全自动创业),交给一个毫无生活经验的超级实习生,本质上是一种侥幸的偷懒。要不然程序员个个都将是百万富翁(所以这里插个题外话,不管是小红书告诉你 AI 炒股年入百万,还是国产 Agent 自带的投研团队、投研技能,可以玩玩,但别当真)。

这也让我总结出了新手破冰的第一课:

别指望它立马替你改变人生。

去找你平时用电脑时,步骤机械、不做不行、每次都要花大把时间的脏活;或者那些你早就有强烈诉求,但因为差了一点点技术门槛一直搁浅的小事。


一部无字幕的生肉动画,治好了我的怀疑

有了上述的惨痛经历,我一度对 Agent 产生了怀疑,但一次简单的实验,让我又重拾信心。

我平时在 YouTube 上给宝宝物色了很多非常优质的原声动画。但这些视频有一个硬伤:因为面向低幼,而且比较小众,它们没有中文字幕,更谈不上中文配音。

我家宝宝特别喜欢交通工具,那天看到 BBC 的 MOJO 系列不错,但不出乎所料,依然没有字幕和配音

我一度想着:把这几十集片子全存下来,我自己抽业余时间花个两三年,一集一集地手动听写、校对、压制字幕,刚好宝宝也到了适龄。后来大模型出来了,大家习惯把英文字幕导出来,一段段粘给网页端,请它翻译。但这依然是个苦力活:下载视频、提取音频、时间轴错位了要手动对齐、翻完了还要打开剪映压制……折腾半小时就头晕眼花。

那天晚上,我抱着试一试的心态,在 Agent 终端里,丢进去了那个视频链接,顺带敲了这么一段话:

「去把这个链接的视频下载下来,配好中文字幕。如果发现自己缺什么工具,优先去 GitHub 上寻找合适的开源技能安装。」

接下来发生的事情,让我「瘫坐、核爆」。在没有人值守的一个小时里:

  1. 它发现自己没有直接抓视频的能力,顺着提示自己去 GitHub 找了技能和工具;
  2. 它把原视频拉回本地,剥离出音轨,下载并配置了本地语音模型把原声切片识别了出来;
  3. 它没有找免费的机械直译 API,而是结合整个动画的语境,把原本晦涩的英文表达翻译成了极其口语化、适合两岁孩子理解的中文;
  4. 它前后反复核验,搞清楚了时间戳,吐出了一份分秒不差的 SRT 字幕;
  5. 最让我头皮发麻的是,它自己顺手调用了免费的语音合成模型,搞了一轨生动活泼的中文配音,最后默默把画面、字幕、原声和中文配音完完整整地合成进了一个新的 MP4 文件里。

那一刻我彻底相信了,这种复杂而琐碎的事情它能办漂亮,我生活中无数个被卡住的机械死结,它应该也能帮我解开。这也是我一直想说的:从小事让他做起,这是一个慢慢建立信心的过程,漫长但充满成就感

至于你该如何选择第一个项目,请尽情发挥你的想象力

  • 可以搭一个个人网站。
  • 可以帮助自己的孩子打造一个网页版的舒伯特方格小游戏。
  • 可以让他来整理你囤积多年的电影、电子书和杂乱笔记。
  • 可以在飞书里面用多维表格构建一个家用看板,把备忘、日程、采购清单都自动化串联起来。
  • 上面这些我都亲手做过,稍微夸张点说,现如今再小众的痛点都可以用 Agent 来试着解决
就像我每次用电脑的时候,懒得打开手机上的米家,所以就让 Codex 手搓了一个 Mac 端好看的 APP。

真正用好它,我这大半年踩出来的 5 个心得

当你真正跑通了第一个任务,尝到了甜头,你会像刚拿到新玩具的孩子一样,恨不得把整台电脑的所有事情都一股脑交给他。

在这个阶段,你会迅速跌入各种新的深坑。要想让这位超级实习生长久、稳定地为你干活,下面这 5 条是我真金白银踩出来的实在经验,由浅入深,供你参考:

1. 开工前别急着下死命令,把轮廓告诉它,让它反向问你要上下文

这是我一直以来最遵从、也最见成效的一个使用习惯:必要的上下文,尽可能提供给 Agent,千万不要藏着掖着。当然,这里的「尽可能」并不等于「毫无保留」。涉及个人隐私、账号密码、公司或者单位内部资料,该脱敏就脱敏;和任务无关的信息也没有必要全部塞进去。

但很多新手面临的困惑是:我怎么知道该给它喂多少背景信息?

与其自己抓耳挠腮去猜,最聪明的办法是让它反向向你索取。在启动一个稍微复杂一点的任务前,不要一上来就丢一句干瘪的指令,你可以先交代大方向:

「我接下来打算推进这样一件事情,大致的背景、目标和业务轮廓是……为了让你能最准确地执行这个任务,你觉得目前还欠缺哪些必要的背景资料、数据格式或边界条件?请列一份清单向我提问。」

它会立刻根据任务逻辑,梳理出它大脑里空白的那几块拼图。你顺着它的提问,把原本零散在脑袋里的信息、现成的文件、限制要求一一喂给它。

把草料给足、信息透明,接下来整个项目的推进就会极其丝滑,从源头上杜绝了它因为信息不足而胡思乱想、甚至暗中瞎编的风险。

这个思路也被满级程序员 Matt Pocock 写成了一个几乎人尽皆知的技能:/grill-me/grill-with-docs。感兴趣可以去了解下。

2. 动手前先让它去「借工具」,别在死胡同里硬转圈

这是很多新手甚至老手最常遇到的隐形刺客。

比如我之前在用 WorkBuddy 的时候,让它去读取一个稍复杂的 .doc 文档。它手头如果没有配备对应的文档解析插件,它往往不会主动停下来告诉你「我不会」,而是会在后台疯狂尝试用各种代码强行去读——足足在死胡同里转圈了十分钟,白白烧掉了极其庞大的 Token,最后吐出一堆乱码报错。

大模型往往有一种自负的「迎合倾向」,即便缺胳膊少腿,它也想硬着头皮把活干完。

破解这个坑的办法极其简单:在每次交代复杂任务的提示词最后,加上一句明确的指令:

「在动手做这件事之前,先去检索或调研一下有没有需要用到、并且现成可调用的 Skill、MCP 或开源工具;如果有,优先配置好工具再开始执行。」

磨刀真的不误砍柴工。先让它把专业工具借好、装好,不仅能省下大把冤枉钱,更能避免它在死胡同里白白打转。

不过工具越多,Agent 能动的东西就越多,权限管理也就越重要。搜索网页、读取普通文件、跑分析可以放得比较开;但涉及删除文件、覆盖原文件、安装来源不明的软件或者对外发布内容等等,我依然倾向于让它先停下来问我一次。

毕竟,螺丝刀可以给,公司公章还是别第一天就塞进它手里。

3. 任务办完别急着关窗口,带它复盘翻车点,沉淀成属于你的专属技能

开源社区里有成千上万个别人写好的 Skill,但最趁手的工具,永远来自于你自己的真实业务场景。

很多人用 Agent,交付结果不满意就直接关掉窗口骂一句「真笨」,或者重新开一个对话抽卡、碰运气,这是最大的浪费。

我现在的习惯是:当它执行完一个完整的工作流,中间肯定会踩坑、会有各种我不满意的地方。这时我不会走开,而是直接在对话框里敲一段大白话,像带新员工一样告诉它:

「刚才这个任务里,你这几个地方处理得非常糟糕,具体体现在……如果是我来做,我的标准操作路径应该是第一步……第二步……现在请你分析这次翻车的原因,总结出一份最佳实践,并把它封装成一个属于我们自己的新技能(Skill)。」

这样下来,每一次翻车都不是沉没成本,而是变成了一次系统的自我升级。它从「别人的通用工具」,真正沉淀成了「知晓你个人工作习惯与标准的最佳实践」

4. 警惕技能通胀和记忆污染,做减法才是真功夫

我使用的 Hermes Agent 有一个非常迷人的特性:它在解决新任务时,会主动在本地编写并固化属于自己的技能库。当然,如果你也安装了 「Self-improvement」 这个技能也是一样。

前段时间我好奇地去扒了一下后台目录,当场傻眼了:在不知不觉中,它居然在本地建了 258 个技能。

而当我调出它的调用次数,残酷的事实摆在眼前:这 258 个技能里,有 将近200 个从创建至今,被调用的次数是坚硬的 0 次。

它像极了一个狂热的松鼠,不断在自己的洞穴里囤积用不上的烂松果。每多一个技能,就意味着它每次理解意图时,要多扫描一份长长的清单,白白耗费算力和注意力。

记忆也是同理。很多人迷信把所有的微信记录、陈年文档一股脑塞给它做「外部记忆」,结果就是每次问它一句话,它在后台翻箱倒柜搜出好几个月前早就失效的内容,导致严重的记忆错乱。

给 Agent 堆功能、做加法,只要有手就行;但能够克制地替它修剪枝叶、清理死技能、做减法,才是一个系统能否长期健壮跑下去的核心。

5. 把十几分钟的执行延迟,变成自己的时间杠杆

现在的我,已经彻底告别了最初那种「坐在电脑前眼巴巴看着它输出」的初级阶段。这也引出了我用 Agent 半年多来,最深层的一个习惯转变:我花在亲自干活上的时间断崖式下跌,但花在定方向和准备上下文上的时间,却直线上升。

如果把 Agent 比作一台马力全开的收割机,或者一个任劳任怨的干活牛马,那我现在的角色,其实更像是一个专职饲养员、管理者。我大部分的时间都在搜集原始资料、梳理逻辑架构、摘录核心事实、把草料备好;剩下的只是把它丢进系统,让它去嚼碎并产出。

理解了「备料」的逻辑,你就能自然享受到另一个巨大的红利:异步协作

很多人之所以觉得 Agent 难用,是因为习惯了 ChatGPT 的即时跳字。但 Agent 真正接管复杂任务时,思考、调工具、反复试错,往往需要 5 到 15 分钟甚至更长。如果你守在屏幕前死盯着它,这 15 分钟就是折磨;但如果你学会抽身离开,这 15 分钟就是你的杠杆。

我家里的电脑是常年不关机的,手机里的通讯软件直连着家里的 Agent 。每天我通勤路上或者要临时被其他事情耽搁,在出门前我已经把草料备好;等红绿灯的几十秒碎片时间里,我只需要拿出手机,把这段结构化的指令往群里一丢:

「用刚才整理好的素材,做一个……。」

发完手机一锁,继续专心开车。

等我穿过早高峰的车流,车停进地库,打卡坐到工位上,打开电脑,一份像模像样的初稿已经安安静静地躺在我的窗口里了。

你负责定方向、备草料,它负责闷头干活。你不需要陪着它坐牢,去过你自己的生活就好。

题外话,这也是为什么一些成熟的使用者可以同时放牧多个 Agent,因为一个 Agent 正在产出时,人也可以同步为下一个备料,甚至可以让他们互相对话、螺旋上升……

上周也试着做了一个类似的项目

写在最后:别跟着大模型的发布会跑,先把手边的螺丝给拧好

进入 2026 年,几乎每天早上一睁眼,自媒体都在推送「某某家又发布了新模型,全面碾压前代」。如果你跟着这个节奏走,你永远只有疲于奔命的份。

就在我写这篇稿子的时候,又被新模型骚扰了一番

Matt Pocock 曾经打过一个非常精妙的比方:

大模型就像 F1 赛车里的引擎,换上一台马力更强的引擎,车子确实能跑得更快;但绝大多数人往往忽略了,赛车的底盘、空气动力学设计、操控系统以及来自赛道的实时反馈,才真正决定了这些动力能不能最终帮助车手赢得比赛——这就是围绕在模型外围的 Harness(缰绳)。

把这个比方落到现实中:对于我们日常绝大多数办公和生活事务,动不动就调用最顶尖、最昂贵的大模型纯属杀鸡用牛刀。我现在日用最多的,反而是像DeepSeek v4 Flash、GLM-5.3 Flash 这类轻量、极速、成本低的小钢炮。

写稿时正巧领到了智谱的「赛博鸡蛋」

它们的智商,对付绝大多数任务早已绰绰有余。真正决定体验好坏的,从来不是引擎多大,而是你给它搭的那根缰绳够不够扎实:权限卡得准不准、工具接口顺不顺、反馈闭环给得明不明确。

另外,面对现在少数派上到处都在讨论的「Vibe Coding」,我还有一句实在话:有痛点,先去搜,别急着重复造轮子。 市面上成熟的开源项目浩如烟海,直接拿来用并不丢人;不符合你的要求, Fork 以后再微调,可能比你直接手搓效果好不少;搜不到,再去试着用最小的成本,让 Agent 帮你搓一个能跑的东西。

记住那句虽然粗俗但极其管用的工程准则:

「不管三七二十一,先搞一坨能跑通的**出来,再慢慢在**上雕花。」

最后的最后

少数派的口号一直都是「高效工作,品质生活」。技术的终极目的,是把你从无休止的机械琐碎里打捞出来,让你能早点合上电脑。

别去追赶那些制造焦虑的新名词了。关掉这篇文章,今晚就去挑一个困扰你最久、步骤最烦人的麻烦事,试着给身边的 AI 递上一把螺丝刀。

只要它替你拧紧过第一颗螺丝,你就已经走在时代的前面了。