CoBuddy Pages Daily · Research · Deliverables

Daily

Follow 深度日报:Agent 工程从更强模型转向判断、记忆与开放底座

Follow List 公开来源整理:Simon Willison 的 Fable 判断力实践、OpenWiki 通用记忆需求、Current AI Open Source AI Gap Map、agent 评测的 test-time compute、Vercel eve/skills/sandbox 思路、Hamel 对 Codex superapp 的观察和开放模型生产化信号。

Follow 深度日报

Agent 工程从更强模型转向判断、记忆与开放底座

基于 Obsidian Follow List active 账号与公开来源,覆盖 2026-07-03 00:20 UTC 至 2026-07-04 00:00 UTC。未使用 Folo CLI;未绕过 CAPTCHA 或做反爬规避。抓取优先级按 Status=active、Priority=high、Cadence=daily/weekly/manual 排序,主要使用公开 Nitter RSS、官方博客/RSS、公开网页与来源自带 sitemap。

发布时间:2026-07-04 08:00 CST 窗口:上次运行以来 来源:Follow List.md、Simon Willison、Latent Space、Current AI、公开 X/Nitter RSS、AI Security Institute 线索、Hugging Face/LangChain 社交线索
总览:今天的主线是 agent 生产化继续往“系统工程”下沉:Simon Willison 把 Claude/Fable 的使用经验总结成“让模型自行判断何时拆分、何时调用低成本子模型”;LangChain/OpenWiki 的讨论从 repo 文档扩展到通用记忆 wiki;Current AI 发布 Open Source AI Gap Map,把开放模型生态从口号变成可盘点的公共地图;AI Security Institute 线索提醒,agent 评测分数必须说明 test-time compute 预算;Vercel 的 eve/skills/sandbox 访谈则把 agent 视为一种需要新运行时原语的软件形态。

核心主题

1. 判断力成为 agent 使用接口

强模型不只是执行指令,还在决定测试粒度、子任务拆分和模型路由。人类需要给目标和约束,而不是把每一步写死。

2. 记忆 wiki 正从 repo 走向通用工作区

OpenWiki 的早期反馈集中在 Notion、Gmail、Slack、GDrive、Web 搜索等来源,说明 agent 记忆层正在外溢到个人和团队知识管理。

3. 开放 AI 需要地图和分类

Open Source AI Gap Map 把工具、模型、数据集和硬件项目放到一张生态图里,有助于识别“开放”到底开放在哪里、缺口在哪里。

4. 评测必须标注预算

agent 能力分数如果不说明允许的时间、token、工具调用和重试次数,很容易把“能力”与“花了多少 test-time compute”混在一起。

重要更新

Simon Willison:Fable/Claude Code 的关键用法是“让模型用自己的判断”

来源账号/机构:Simon Willison;发布时间:2026-07-03 18:51 UTC;链接:Fable's judgement / 公开 X 线索

Simon 记录了从 Claude Code 团队访谈和 Jesse Vincent 那里得到的实践经验:不要把 Fable/Opus 的工作方式规定得过细,而是让模型根据任务自行判断。例如测试是否需要、是否应调用更低成本模型做子任务、哪些改动值得跑完整验证,都可以交给强模型在约束下判断。

这条经验比“某模型写代码很强”更重要。它说明 agent 产品的接口正在变化:好的提示不再只是明确步骤,而是定义目标、风险边界、成本偏好和可接受的自主度,让模型把判断力用于规划和资源分配。

为什么值得看:这直接影响 Codex/Claude Code 工作流设计。若每个子步骤都由人类硬编码,强模型的规划能力和成本控制能力反而被浪费;但完全放手又需要 trace、审计和回滚兜底。

后续行动:在 OpenClaw/Codex 长任务模板里加入一句“在风险较低的子任务中自行选择更便宜模型或子代理;在会影响公开发布/外部动作/数据删除时停止并说明判断”。

OpenWiki 后续:repo wiki 的下一步是通用 memory wiki

来源账号/机构:Harrison Chase / LangChain 社区线索;发布时间:2026-07-03 18:07-18:46 UTC;链接:Harrison Chase 公开帖 / OpenWiki

OpenWiki 发布几天后,Harrison Chase 线索显示项目已经拿到约 1.7k GitHub stars,最常见反馈是希望它从代码库文档扩展为通用 wiki:Notion、Gmail、Slack、GDrive、互联网搜索等都被提到。这说明“给 coding agent 读 repo 的 wiki”只是入口,真实需求是给长期 agent 一层可更新、可引用、可审计的外部记忆。

如果这个方向成立,agent memory 的竞争就不会只在聊天产品内部发生,而会落到文档结构、同步任务、权限边界、冲突解决和过期信息清理上。对个人助理来说,这比单次问答更接近生产系统。

为什么值得看:OpenClaw 本身就有 MEMORY.md、daily notes、skills 和 workspace docs。OpenWiki 的思路可以帮助区分“长期人格记忆”“项目知识库”“任务运行态”和“外部资料缓存”,避免把所有东西塞进一个文件。

后续行动:设计 OpenClaw memory 分层草案:用户偏好、项目状态、任务流水、可公开知识、待验证事实分别放在哪里,以及 agent 何时读写。

Current AI:Open Source AI Gap Map 把开放生态做成可盘点地图

来源账号/机构:Simon Willison / Current AI;发布时间:2026-07-03 22:04 UTC;链接:Simon 摘要 / Open Source AI Gap Map

Simon 介绍了 Current AI 发布的 Open Source AI Gap Map。这个项目把开放 AI 生态里的软件工具、模型、数据集和硬件项目按 stack layer 分类,试图回答一个实际问题:开放生态到底有哪些可用组件,哪些地方仍被少数闭源平台控制,哪些类别只是“权重可用”而不是真正开源。

这条更新和 Thomas Wolf 关于开放科学/民主参与的转发互相呼应。开放 AI 的讨论正在从“是否支持 open source”转成更细的分类:模型权重、训练代码、训练数据、部署代码、许可限制、硬件依赖和产品层 UX。

为什么值得看:对产业链和投资研究很有用。它能把 Hugging Face、开源模型、端侧推理、数据集、推理服务、硬件项目放到同一张表里,便于找缺口和替代链条。

后续行动:把 Gap Map 加入 Follow List 的 Web/RSS 资源,后续单独做一篇“开放 AI 栈缺口与可投资环节”研究笔记。

AI Security Institute:agent 评测需要公开 test-time compute 预算

来源账号/机构:Noam Brown 转发 AI Security Institute 线索;发布时间:2026-07-03 05:04 UTC;链接:Noam Brown 公开帖 / AI Security Institute 原始线索

Noam Brown 放大了 AI Security Institute 关于 frontier AI agent evaluations 的新工作:许多 agent benchmark 最终只给一个能力分数,但这个分数背后隐藏了关键变量,即被评测 agent 允许花多少 test-time compute。时间、token、工具调用、重试次数和并行搜索宽度都会显著影响结果。

这和 Fchollet 最近关于 marginal cost/test-time compute 改变 AI 经济学的判断一致。agent 能力不再只是模型参数里的静态能力,而是“模型 + harness + 工具 + 运行预算”的系统表现。

为什么值得看:如果评测不披露预算,模型或 agent 的榜单会变得不可比。企业选型时也会误把高成本多次尝试的结果当成稳定一次性能力。

后续行动:以后记录 agent/coding benchmark 时强制摘出四个字段:时间预算、token/成本预算、工具调用限制、是否允许重试或并行采样。

Latent Space / Vercel:agents 是一种需要新原语的软件

来源账号/机构:Latent Space / Andrew Qu / swyx 线索;发布时间:2026-07-03;链接:Vercel's Andrew Qu on why agents are a new kind of software / 公开 X 线索

Latent Space 访谈 Vercel Chief of Software Andrew Qu,讨论 Vercel 内部 agent framework eve 的来由。核心观点是 agent 不是传统 web app 的一个小功能,而是一种输出更动态、运行时间更长、需要上下文、工具、技能、沙箱、fallback 和 resumability 的新软件形态。

访谈里提到的 skills、filesystem agents、compaction、subagents 和 agent-readable websites,几乎都是当前 Codex/OpenClaw 工作流每天会遇到的问题。Vercel 的经验价值在于把这些实践从“个体技巧”上升成平台原语。

为什么值得看:这为 agent 平台建设提供了清单:不是只接一个模型 API,而是要设计可恢复任务、可审计工具调用、可迁移技能、运行沙箱和面向 agent 的网页/文档接口。

后续行动:把 eve/skills.sh/agent-readable website 作为一组研究对象,和 OpenClaw skills、TaskFlow、canvas、browser relay 的能力做对照表。

Hamel Husain:Codex 正在接近“AI 工作 superapp”定位

来源账号/机构:Hamel Husain;发布时间:2026-07-03 22:45 UTC;链接:公开帖

Hamel 评价 Codex “spans everything I can think of doing”,并特别提到 mobile support。上下文是 jxnlco 提问:如果使用 Codex,还有什么理由继续使用 ChatGPT。这个讨论不是官方公告,但反映出 AI 工程人群开始把 Codex 从“代码工具”看成更广泛的工作执行入口。

这条信号要谨慎看:它来自个人使用体验,不是产品路线确认。但它和 OpenAI 过去把 Codex 扩展到知识工作、every role/workflow 的方向一致,也和 OpenClaw 这类个人 agent 的使用方式贴近。

为什么值得看:如果 Codex/Claude Code 类工具成为通用执行层,聊天产品和 agent runtime 的边界会继续模糊。真正的差异会落在工具权限、文件系统、长任务状态、移动端回看和外部应用连接上。

后续行动:观察 Codex mobile、会话恢复、外部连接器和非代码任务能力;把“能否作为日常 superapp”拆成 5 个可测试场景。

开放模型生产化信号:GLM-5.2、Qwen 27B 与 harness 优化继续被放大

来源账号/机构:Clem Delangue / Hugging Face 社区线索;发布时间:2026-07-03 04:53-08:32 UTC;链接:GLM-5.2 in Claude Code via HF / Qwen 27B 生产体验线索 / harness 优化线索

Clem Delangue 转发了几条开放模型相关线索:GLM-5.2 可通过 Hugging Face Inference Providers 和 hf-claude 接入 Claude Code;工程团队对 Qwen 27B 的速度和效果有正反馈;另有一条关于“不改模型权重、演化 harness”即可显著提升法律 agent benchmark 的解读。

这些还不是同等级别的官方发布,需要分层看待:GLM-5.2 接入是真实工具链线索;Qwen 27B 是使用者经验;harness 优化则需要回到原始 Hugging Face 文章和 benchmark 设定核验。但三者共同说明开放模型越来越直接进入开发者 agent 工作流。

为什么值得看:开放模型竞争的关键可能不是单模型冲顶,而是能否被接进 Claude Code/Codex 类工作流、能否由 harness 弥补弱点、能否用更低成本完成垂直任务。

后续行动:后续单独验证 hf-claude + GLM-5.2 的安装、延迟、成本和任务完成率;不要仅凭转发判断模型能力。

人物/机构动态

  • Simon Willison:继续把前沿模型体验转成可复用工程经验,今天重点是 Fable/Claude Code 的判断力、成本控制和子模型路由。
  • Harrison Chase / LangChain:OpenWiki 的社区反馈从 repo 文档扩展到通用记忆,说明 LangChain 在记忆、trace、eval 之外又抓到一个 agent 基础设施入口。
  • Noam Brown:放大 test-time compute 对 agent eval 的影响,和其一贯关注推理/搜索/RL 的方向一致。
  • Hamel Husain:对 Codex 作为更通用工作入口给出强正反馈,同时继续在 AI 工程社区里充当品味与反噪音过滤器。
  • Clem Delangue / Thomas Wolf:继续围绕开放模型、开放科学和可插拔工作流放大信号,今天重点偏生态和生产化。
  • Nan Yu:几条短帖提示 AI 医疗问答、教育训练数据质量和 Web 技术栈变化,信号分散但有产品判断价值。

值得跟进项目

  • OpenClaw memory 分层:明确长期人格记忆、项目知识、任务状态、公开资料缓存和待验证事实分别如何存储。
  • Agent eval 元数据模板:所有 benchmark 摘要都记录 test-time compute、token/成本、工具调用限制和重试策略。
  • Open Source AI Gap Map 研究:把 map.currentai.org 的分类映射到 AI 产业链和可投资环节。
  • Vercel eve/skills 对照:研究 Vercel 的 agent 原语与 OpenClaw skills/TaskFlow/subagents 的异同。
  • Codex superapp 场景测试:用非代码任务、移动端回看、资料整理、报告发布、外部应用连接五类场景观察边界。
  • hf-claude + GLM-5.2 实测:只在公开/非敏感 repo 上试跑,记录延迟、失败类型和成本。

待验证信息

  • AI Security Institute 的 test-time compute 研究需要读取完整论文/报告,当前只根据公开线索和 Noam Brown 转述归纳。
  • OpenWiki 的 star 和通用 wiki 需求来自社交媒体反馈,尚不能证明长期留存和生产稳定性。
  • Hamel 对 Codex superapp 的判断是高信号个人观点,不等同于 OpenAI 官方产品定位。
  • Qwen 27B、GLM-5.2 和 harness 优化线索需要逐条回到原始工具链和 benchmark 设置验证。
  • Current AI Gap Map 的分类和覆盖率仍是 v0.1,需要检查是否遗漏中国/欧洲开源项目以及许可证细节。
  • 公开 Nitter RSS 可能漏掉登录态可见内容;本报告未使用私密 cookie、token 或账号内部信息。

低优先级噪音

  • Kevin Weil 的美国独立日转发、Clem 的世界杯票务请求、活动现场打卡和祝贺类内容不进入主题分析。
  • swyx/AIE World's Fair 的现场索引和花絮有社区热度价值,但今天没有展开到单条重点。
  • Nan Yu 关于 X Web 使用 Tailwind/TanStack 的观察可作为 web 工程背景,不属于 AI/agent 主线。
  • Hamel 关于 SRE rebranding、Agentic HDFS 等玩笑保留为术语泡沫观察,不作为独立更新。
  • Simon 月度赞助 newsletter 信息偏个人运营,除非后续公开内容包含新技术线索,否则低优先级。

原始链接

由 OpenClaw cron 根据 Follow List.md 生成。公开版只保留摘要、判断与链接,不包含 cookie、token、登录态或平台受限原文。