我原本只是想听听 GPT 对某段长视频有什么看法。
我告诉GPT那是一位我关注了一段时间的创作者。她经常提出一些让我意外、但又恰好感兴趣的观点;只是面对长视频,我偶尔缺少从头看到尾的耐心。
于是我产生了一个想法:能不能先把视频转写下来,再交给 AI 拆解观点?
这听起来只需要一次转写和摘要。但我很快发现,我真正想要的并不是“告诉我这段视频讲了什么”。
我有时会把同一份资料交给不同的模型,看看它们分别注意到了什么。如果第一个模型已经把自己的判断写进资料,第二个模型读到的就不再是原始材料,而是“材料加上前一个模型的解释”。几轮之后,我很难分辨哪些内容来自视频,哪些只是某个模型说得很像事实的判断。
而且,一次性摘要很难继续使用:视频下载过一次,转写过一次,换个模型又要重新整理;时间戳、关键画面和观点出处散落在不同对话中,对话结束后,材料本身也没有真正沉淀下来。
我也不想在 AI 完成分析后,再亲手创建目录、修改文件名、复制转写稿,并把零散产物搬进知识库。对我来说,理想的终点不是聊天窗口里出现一份答案,而是来源、转写、主张和评论已经按照固定结构直接落入我的 Obsidian Vault,成为以后仍能查找和继续处理的资料。
所以,我需要的不是另一个视频摘要器,而是一份可以反复交给不同 AI 审阅的中间材料。
把资料、解释和综合分开
最后形成的工作流叫做 Video Thought Digest。它是一个与模型无关的 Agent Skill,会把链接视频或本地视频整理成一个普通文件组成的资料包:
来源与溯源信息
-> 保留的媒体文件与 SHA-256
-> 带时间戳转写稿与清洁转写稿
-> 结构化主张与关键帧
-> 中立审阅包
-> 各模型独立评论
-> 跨模型综合这里最重要的不是文件数量,而是三个层次彼此分离:
- 资料层保存来源、媒体、转写稿、时间戳和关键帧。
- 评论层让每个模型独立阅读同一份中立材料,并把意见写进各自的文件。
- 综合层只在独立评论完成后,比较它们的共识、分歧和遗漏。
新的审阅者不需要先看其他模型的答案。这样做并不能保证 AI 一定正确,但至少能避免一种很隐蔽的干扰:后来的模型沿着前一个模型已经铺好的解释继续说下去,看起来形成了“共识”,实际上并没有真正独立判断。
生成物使用 Markdown、SRT、JSON 和普通媒体格式,不依赖专有数据库。资料库位置可以显式指定,也可以通过环境变量预先配置;一次任务完成后,结构化条目会直接落入我的 Obsidian Vault,不需要我再做一轮人工搬运。
在我明确授予文件访问权限的前提下,其他模型只需要知道我的意图和对应条目的路径,就可以直接读取同一套材料。我不必先消化一个模型的答案,再把它重新组织成提示词转述给下一个模型。即使以后不再使用当前的 Agent,已经整理好的材料仍然可以直接阅读,也可以继续交给其他模型或工具处理。
它不是一键摘要工具
这套流程显然比“粘贴链接,得到三句话总结”更麻烦。
如果只是想快速知道一个视频的大意,普通的转写或摘要工具更合适。Video Thought Digest 面向的是另一种需求:你希望保存原始材料、追溯某项判断来自哪里,或者让多个模型在互不影响的前提下分别审阅同一段内容。
它也不会把生成结果包装成法律意义上的证据。媒体哈希可以帮助识别重复文件,时间戳可以帮助回到原片核对,但事实核查仍然需要外部来源,AI 的评论也仍然只是评论。
视频获取同样不是它试图包办的事情。宿主 Agent 可以使用已有的浏览器、转写工具或 ffmpeg;在 macOS 上,如果检测到 Downie 已安装并可用,也可以把它作为可选入口。缺少某个工具时,工作流应当保留已经完成的产物,并清楚标记缺失项,而不是假装整条链路已经成功。
从个人流程到开源 Skill
这个项目最初只是为我自己的 Obsidian Vault 准备的一套资料目录。我提出需求、决定目录结构和验收标准,Codex 使用 GPT-5.6-sol 生成了初始代码、测试与文档;随后 Claude Fable 5 和独立的 Codex subagent 又进行了审阅。
我没有手写代码。这一点也被如实写进了仓库,因为它恰好是这个项目形成方式的一部分:人的工作不是假装自己敲下了每个字符,而是提出问题、识别不满意的地方、决定取舍,并对最终发布的内容负责。
在我的要求下,公开版本移除了个人目录和真实资料,并补充了 URL 凭证脱敏、符号链接防护、异常输入处理和自动测试。仓库只包含工作流本身与虚构示例,不包含下载的视频、私人转写稿、Cookie 或模型评论。
后来我意识到,也许还有一小部分人有类似需求:研究者、记者、分析者,或者只是习惯把同一份材料交给多个模型、又不希望它们互相抄答案的人。
于是我把它放到了 GitHub,使用 MIT 许可证公开。它目前仍然只是一个小工具,不是成熟产品,也不打算替代所有视频摘要工具。但它解决了一个对我来说真实存在的问题:先把材料保存好,再让 AI 发表意见。
