自从我工作以来,心态真是一天比一天差,一直在我会不会试用期就被裁了。感觉自己完全融入不了自己的岗位,干自己不愿意干的事情真的很折磨……哎,挣钱嘛……

关于这个系列,本来想的是三个月更一次的,但是 LLM 发展得太快太快了,感觉之后一到两个月就得写一次了。

Agent

全面转冷

致敬传奇“来自未来”的 agent OpenClaw,在 2.0 发布之际无人关心,正式成为路边一条!OpenClaw 老师,我还记得你……让我们为席卷全球的、改变世界的、核弹爆炸的、AGI 开端的、再不用上就被淘汰的、创业者人手一亿个的 OpenClaw 献上最沉重的悼观,设敬!

最近的三个月,我们完全没有看到任何创新的 agent 产品出现,可喜可贺!真要说的话也不是没有,有一个叫 Prime Agent 的玩意,但是名字里带着 agent,侧重点却是 harness。当然提到 harness,DeepSeek Harness 又必不可不提了,让 PL 人来做 harness 吗,DeepSeek,你赢了,,,

那么主播主播,什么是 agent 什么是 harness?(胡闹 P 房.wav)一些个人的见解(暴论):agent 对工具动手,而 harness 对上下文结构动手。我将用最直接最不绕弯子的方式告诉你,做 harness 的人一定会做 agent,而嘴巴里喊自己在做多么伟大的 agent 的人,大多不会做 harness。

顺带一提,DeepSeek Harness 的作者是 bot 框架 Koishi 的 top contributor;已严肃记录笔记:做 QQ bot……可以……进 DeepSeek……

全面商业化

OpenClaw 之死给下场狂欢的无数大厂们当头一棒,他们在观察了部门的 OKR 和财务预算并深度思考 0.01 秒之后毅然决定:加速商业化进程。于是近一段时间,当初蹭 OpenClaw 蹭到起火星子的几个厂商们纷纷跳进染缸,推出了自己的 xxWork、xx 工作、xx 办公……并大幅提高了自己的套餐售价。

但话又说回来,咱就是得讲究这个落地应用,毕竟再不去让 LLM 制造一些实际价值的话,泡沫是真的会比核弹炸得还美丽的。而且,LLM 是可以创造一些实用价值的,而不是只能充当程序员的玩具。我们依旧需要更多的 LLM 落地场景。

Agent 的操作系统

三个月前我预想的 managed agent 热潮并没有及时出现,但现在大家看到的承载大规模 agent 任务的办公应用,其实大都是 managed agent 概念下的成果,毕竟往每个容器里塞一个 OpenClaw 还是太重量级了。

managed agent 其实可以换一个词语描述,就是 agent 的操作系统。你需要调度 agent 的优先级、运行时序;需要将底层的数据库、缓存等资源虚拟化为 agent 的记忆、知识库;需要隔离 agent 的运行时……我见到的一个很不错的范例是 Google 开源的 Agent Substrate,大概是我见到的第一个明确的做 agent 操作系统的项目了。随着 agent 商业化的加速,未来任何需要大规模做 agent 的项目,都需要一些具有操作系统天赋的人来参与。

Harness

想来想去,我想给 harness 单独开一个章节来讲我的认知。harness 这个词本身已经不能够并在 agent 里面了。

注意:本节包含大量的个人观点,而且存在大量的抽象表达,理解万岁!

「上下文」概念的终极进化

上文提到,harness 的本质是围绕 LLM 上下文构建的一套操控上下文的框架。LLM 的输入内容调优,从最开始 ChatGPT 时期的提示词工程,一路经历了上下文工程、agent 工程,最后落地在 harness 工程上。至于所谓的 loop 工程,更像是 agent 工程的一个很小的子集,而且我觉得这个词不配上桌与 harness 并论——它干得太少,噱头太大。

LLM 受限于其工作原理,必然难以处理高维度的信息,ARC-AGI 系列评测就证明了这一点(当然众所周知的是,GPT-6 Astra 已经将 ARC-AGI 刷满了,这个我们稍后再说)。将这个概念极端化可以说,假设人的思维运行在极高维度上,那么随着思维投影到低维度的文字上,必然会造成信息的丢失。那么 harness 做的事情就可以用一句设问概述了:我们该如何在低维度的载体上尽可能高效地投影高维度的信息而减少信息的损耗?既然 LLM 无法直接接触高维表达,那就只能够修改自己所处维度的信息,也就是文字上下文了。

关于这个问题,不同 harness 的解法正在逐步靠拢。从 Pi 到 Prime 再到 DeepSeek Harness,大家都开始认为,让 LLM 自己去迭代 harness,能够更好地做这个“投影”的工作——如果我认为当前的投影缺乏信息,那就再造一个工具去帮助我解析出新的信息,甚至直接修改我当前已经有的信息(也就是“记忆”)。

Harness 可能的未来

暴论:LLM 或许点错了科技树,上下文缓存或是阻碍 harness 发展的最大问题。

当然,在 LLM 典型的交互方式,也就是对话与 agent loop 下,上下文缓存似乎是必然诞生的技术,毕竟所有的 loop 场景都维护着一个不断增长的前缀。然而,当我们脱离纯粹 loop 的范式,开始把上下文当作一块画布对待的时候,仅仅依靠上下文缓存来降低成本是显然不够的。

我曾经有过这样一个 coding harness 设想:如果 coding harness 不再是 read-edit 循环,而是 open-edit-close 循环,会是怎样?LLM 调用 open 工具之后,harness 在当前上下文中的一个位置打开全长的文件 buffer,后续的编辑结果直接反映在这个 buffer 里,直到 close 释放这个 buffer 占用的上下文。不过这个设想十分的 naive,没有经历过实现和 benchmark。

模型

隐空间思维是 AGI 的前奏

本文最开始写作是在 GPT-6 Astra 之前,而写到这里的时候,Astra 发布已经过去了几天。放以前,我或许会讨厌所谓“AGI 快要来了”的标题党嗤之以鼻,而如今,我不得不眩晕瘫坐,并且严肃地思考,我们离 AGI 还有多远。

在之前,我就和我的朋友设想过,隐空间的思考过程究竟是怎样的?我们都觉得,这太难训练了。LLM 的思维链科技点在了文字上,多少是因为预训练的语料中就有文字表达的思考过程,只是 RL 强化了这部分文字 token 的 embedding 语义。换句话说,就是 LLM 的思维链就是“长”在文字上的,这种根深蒂固,看似无法拔起。

(顺便一提,我们所见到的 LLM 越来越不讲人话,也是 RL 的高速发展导致的——没办法,你想要模型思维高效,你就需要接受一部分文字 token 在表义上先富起来,甚至隐藏本不属于这个文字的表义)

GPT-6 Astra 在生产级别模型的隐空间思维迈出了第一步,它把循环深度(Recurrent Depth)首次从论文搬到了生产上。普遍认为 Astra 的 Recurrent Depth Reasoning 是 arXiv:2502.05171 这篇文章的生产级应用,也就是同一个 token 在被解码之前会在同一个块内反复跑,才被送出解码。这样一来,单一思维 token 的表义被大幅地加强了。极端点的营销号说法就是,我们或许还能看到思维链,但是我们很快就要看不懂思维链的内容了。

那么会不会存在这样一个模型,会将自己的一次输出,不解码成文字,直接进入下一轮的生成,直到思维链完成?目前的思维链还是长在文字上的,但是已经有一些用来压缩信息的技术出现了,例如 DeepSeek-OCR 提出的用图像 patch 压缩信息,和美团的 C3 提出的 latent token。我暂时无法想象到怎么把它用在思维链上,毕竟这真的会很难训练。但如果做到了,我们或许要见到真正在高维思考的 AGI 了。

人与 AGI 共处的未来

我写这段文字的时候接近凌晨三点,早上八点起床,我还要去上班。我上班的那个地方,所有人都在加速 AI 的使用;当然,出于成本原因,是有限制地加速。这就好像新规下的 F1,老板告诉你要狠狠地蹬,但你真的踩下了油门,你会发现在大直道的末尾首先会因为没配额了导致你大幅减速,那还怎么玩。

LLM 的发展平等地给所有人施加超载的信息,超载的信息给人施加脑雾的 debuff。严重脑雾干扰下的我,在稀里糊涂做着我的入职任务。老板说“AI 时代,代码都是 AI 写,人就一定要把原理琢磨透”,于是我就被要求从零搓出生产级可用的组件,一个支吾讲不出原理直接被打回重做。我开始迷茫。老板讲得其实没错,但是我或许确实接不住信息的黑流了。黑流,那些从信息的树海喷溅出的黑流,让我患上了叫作“模型病”的绝症,再无脱身的可能。

上个月的我,还在 AOSCC 2026 的讲台上侃侃而谈,讲大模型,讲它们怎么影响我们和开源社区,开源社区又该怎么办。我说,我们终将走向人与 AGI 共处的未来,但我们仍未知道怎么去面对它。而现在,或许我要开始试着去用我一文不值的生命,去尝试思考这个问题了。哈,人类一思考,上帝就发笑。

尾声

或许这篇文章就到这里结束了。熬夜写的,我的上下文窗口只剩下几个文字了,所以如果看到语焉不详的地方,还请原谅我。本来还想讲讲 DeepSeek v4 正式版的一些事情的,但无论怎么想都想不出怎么说,只能先这样了。

当然,还有最后一件事:我在看机会。

好吧,我承认这是饺子醋,但我真的很希望能够在一个能允许我像上面这样发疯的地方工作,那或许是我实现自我价值的一个办法。

当然,如果你觉得我不配,那就忽略我吧,因为我不会算法,不会工程,不会 infra。真的不配的。