Semantic 语义技术周报 · 26年第31周

作者:萧少聪 Scott

微信xiaoshaocong | 公众号Dataer数人

Cortrix 语义存储联合创始人;Postgres 中文社区及分会联合创始人;

前阿里云 RDS 产品负责人;前华为存储产业专家;前红帽 RHCA 认证讲师。

这一周,Agent 社区最值得看的变化,不是又多了一个 memory 产品,而是几个看似不相关的热门话题,都在问同一件事:当 Agent 开始长期运行、与人和其他 Agent 协作,什么才应该成为共享状态?

本文互动数是 2026-08-02 的公开快照,会随时间变化。X 上的厂商实验只按其自述引用,不视为独立验证。

不同的项目,把问题指向同一个边界

Hacker News 上,Y Combinator 开源的 qm 在截图时获得了 657 points 和 155 条评论。它没有把所有信息塞进一个公共记忆池,而是让不同的人、房间和项目分别管理 memory、files、permissions 和 durable sandbox,需要协作时再通过明确的 scope 共享。多 Agent 的共享状态,首先是所有权和范围问题,其次才是召回问题。

图 1|HN 原帖截图,采集于 2026-08-02 20:30(新加坡时间)。

LlamaIndex 发布的 Parse Gateway 又把视角往前推了一步:它按 PDF 页面复杂度选择不同的解析层。这不只是文档处理优化。如果表格、标题、脚注和版面关系在 ingestion 时已经丢失,后面的 embedding 和 reranking 再强,也只是在更准确地检索一份被错误理解的数据。

图 2|LlamaIndex 在 X 发布的 Parse Gateway 介绍。

Cortrix 也在这一周公开了首个预发布版本。我们把它定义为面向 AI Agent 的 Semantic Storage:把 ingestion、hybrid retrieval、memory、来源上下文,以及 HTTP/OpenAPI、MCP、Python SDK 等访问入口组织成一个可独立运行的数据层。它仍是 active pre-release,不是已经生产就绪的企业系统,但相关代码和 Quick Start 已经公开:github.com/cortrix/cortrix

图 3|Cortrix 公开 GitHub 仓库与 README 快照。

Jerry Liu 关于 loop engineering 的讨论获得约 10.58 万次浏览。讨论把长期 Agent 看成由 handoff、event 和 cron 持续推动的 loop,也提出了一个很实际的问题:一个 Agent 完成当前任务,到底需要多少上下文?自组织 wiki 能积累知识,也可能带来新的复杂度。更多上下文,不等于更好的上下文。

图 4|Jerry Liu 在 X 发起的 Loop Engineering 讨论。

把这四件事放在一起,我看到的不是“更大的记忆”,而是一个正在成形的数据边界:数据进入时要保留结构与来源,查询时要同时支持精确检索、全文、向量和重排,使用时还要回答谁能读写、更新、撤销和追溯。Semantic  并不是把 RAG 或 memory 换一个名字,而是把它们放回 Agent 长期运行所需要的数据系统里。

热度之外,还有两个不能忽略的反例

Mem0 发布了一组 Claude Code 持久记忆自测,称在同一 repo 的对照中将输入从 13,700 tokens 降到 445。这个 97% 降幅是厂商自测,不能直接外推。但它分清了两个容易混在一起的概念:/clear 清理的是当前 context,不是保存在外部的长期状态。一旦分开,过期、冲突、撤销和来源就都成了必须回答的问题。

图 5|Mem0 发布的自测结果,仅按厂商自述引用。

HN 上另一篇《I hate your fuzzy search》引发了大量讨论。很多人反对的不是模糊匹配本身,而是产品取消精确匹配、隐藏过滤条件,让人不知道结果为什么出现。对 Agent 也一样:语义相似度不能代替 ID、时间、权限、命名空间和来源。

图 6|后续截图时该帖已显示 [flagged],互动数更新为 95 points / 56 comments。本文引用其讨论主题,不把 flagged 当作事实真伪裁决。

本周的判断

Agent First 不是把原来的 API 再包一层,而是把 Agent 真正需要的状态、边界和失败方式设计清楚。Semantic 也不是让结果更“模糊”,而是在保留精确约束和来源的前提下,让不同 Agent 可以理解和复用持续变化的数据。

留给读者的问题

如果多个 Agent 需要共享上下文,你会把这个边界放在文件系统、数据库、memory service、知识图谱,还是独立的 Semantic 数据底座?又有哪些内容,你绝不会允许它们默认共享?欢迎在评论区进行讨论。