Agent 工程从更强模型转向判断、记忆与开放底座
基于 Obsidian Follow List active 账号与公开来源,覆盖 2026-07-03 00:20 UTC 至 2026-07-04 00:00 UTC。未使用 Folo CLI;未绕过 CAPTCHA 或做反爬规避。抓取优先级按 Status=active、Priority=high、Cadence=daily/weekly/manual 排序,主要使用公开 Nitter RSS、官方博客/RSS、公开网页与来源自带 sitemap。
核心主题
1. 判断力成为 agent 使用接口
强模型不只是执行指令,还在决定测试粒度、子任务拆分和模型路由。人类需要给目标和约束,而不是把每一步写死。
2. 记忆 wiki 正从 repo 走向通用工作区
OpenWiki 的早期反馈集中在 Notion、Gmail、Slack、GDrive、Web 搜索等来源,说明 agent 记忆层正在外溢到个人和团队知识管理。
3. 开放 AI 需要地图和分类
Open Source AI Gap Map 把工具、模型、数据集和硬件项目放到一张生态图里,有助于识别“开放”到底开放在哪里、缺口在哪里。
4. 评测必须标注预算
agent 能力分数如果不说明允许的时间、token、工具调用和重试次数,很容易把“能力”与“花了多少 test-time compute”混在一起。
重要更新
Simon Willison:Fable/Claude Code 的关键用法是“让模型用自己的判断”
来源账号/机构:Simon Willison;发布时间:2026-07-03 18:51 UTC;链接:Fable's judgement / 公开 X 线索
Simon 记录了从 Claude Code 团队访谈和 Jesse Vincent 那里得到的实践经验:不要把 Fable/Opus 的工作方式规定得过细,而是让模型根据任务自行判断。例如测试是否需要、是否应调用更低成本模型做子任务、哪些改动值得跑完整验证,都可以交给强模型在约束下判断。
这条经验比“某模型写代码很强”更重要。它说明 agent 产品的接口正在变化:好的提示不再只是明确步骤,而是定义目标、风险边界、成本偏好和可接受的自主度,让模型把判断力用于规划和资源分配。
为什么值得看:这直接影响 Codex/Claude Code 工作流设计。若每个子步骤都由人类硬编码,强模型的规划能力和成本控制能力反而被浪费;但完全放手又需要 trace、审计和回滚兜底。
后续行动:在 OpenClaw/Codex 长任务模板里加入一句“在风险较低的子任务中自行选择更便宜模型或子代理;在会影响公开发布/外部动作/数据删除时停止并说明判断”。
OpenWiki 后续:repo wiki 的下一步是通用 memory wiki
来源账号/机构:Harrison Chase / LangChain 社区线索;发布时间:2026-07-03 18:07-18:46 UTC;链接:Harrison Chase 公开帖 / OpenWiki
OpenWiki 发布几天后,Harrison Chase 线索显示项目已经拿到约 1.7k GitHub stars,最常见反馈是希望它从代码库文档扩展为通用 wiki:Notion、Gmail、Slack、GDrive、互联网搜索等都被提到。这说明“给 coding agent 读 repo 的 wiki”只是入口,真实需求是给长期 agent 一层可更新、可引用、可审计的外部记忆。
如果这个方向成立,agent memory 的竞争就不会只在聊天产品内部发生,而会落到文档结构、同步任务、权限边界、冲突解决和过期信息清理上。对个人助理来说,这比单次问答更接近生产系统。
为什么值得看:OpenClaw 本身就有 MEMORY.md、daily notes、skills 和 workspace docs。OpenWiki 的思路可以帮助区分“长期人格记忆”“项目知识库”“任务运行态”和“外部资料缓存”,避免把所有东西塞进一个文件。
后续行动:设计 OpenClaw memory 分层草案:用户偏好、项目状态、任务流水、可公开知识、待验证事实分别放在哪里,以及 agent 何时读写。
Current AI:Open Source AI Gap Map 把开放生态做成可盘点地图
来源账号/机构:Simon Willison / Current AI;发布时间:2026-07-03 22:04 UTC;链接:Simon 摘要 / Open Source AI Gap Map
Simon 介绍了 Current AI 发布的 Open Source AI Gap Map。这个项目把开放 AI 生态里的软件工具、模型、数据集和硬件项目按 stack layer 分类,试图回答一个实际问题:开放生态到底有哪些可用组件,哪些地方仍被少数闭源平台控制,哪些类别只是“权重可用”而不是真正开源。
这条更新和 Thomas Wolf 关于开放科学/民主参与的转发互相呼应。开放 AI 的讨论正在从“是否支持 open source”转成更细的分类:模型权重、训练代码、训练数据、部署代码、许可限制、硬件依赖和产品层 UX。
为什么值得看:对产业链和投资研究很有用。它能把 Hugging Face、开源模型、端侧推理、数据集、推理服务、硬件项目放到同一张表里,便于找缺口和替代链条。
后续行动:把 Gap Map 加入 Follow List 的 Web/RSS 资源,后续单独做一篇“开放 AI 栈缺口与可投资环节”研究笔记。
AI Security Institute:agent 评测需要公开 test-time compute 预算
来源账号/机构:Noam Brown 转发 AI Security Institute 线索;发布时间:2026-07-03 05:04 UTC;链接:Noam Brown 公开帖 / AI Security Institute 原始线索
Noam Brown 放大了 AI Security Institute 关于 frontier AI agent evaluations 的新工作:许多 agent benchmark 最终只给一个能力分数,但这个分数背后隐藏了关键变量,即被评测 agent 允许花多少 test-time compute。时间、token、工具调用、重试次数和并行搜索宽度都会显著影响结果。
这和 Fchollet 最近关于 marginal cost/test-time compute 改变 AI 经济学的判断一致。agent 能力不再只是模型参数里的静态能力,而是“模型 + harness + 工具 + 运行预算”的系统表现。
为什么值得看:如果评测不披露预算,模型或 agent 的榜单会变得不可比。企业选型时也会误把高成本多次尝试的结果当成稳定一次性能力。
后续行动:以后记录 agent/coding benchmark 时强制摘出四个字段:时间预算、token/成本预算、工具调用限制、是否允许重试或并行采样。
Latent Space / Vercel:agents 是一种需要新原语的软件
来源账号/机构:Latent Space / Andrew Qu / swyx 线索;发布时间:2026-07-03;链接:Vercel's Andrew Qu on why agents are a new kind of software / 公开 X 线索
Latent Space 访谈 Vercel Chief of Software Andrew Qu,讨论 Vercel 内部 agent framework eve 的来由。核心观点是 agent 不是传统 web app 的一个小功能,而是一种输出更动态、运行时间更长、需要上下文、工具、技能、沙箱、fallback 和 resumability 的新软件形态。
访谈里提到的 skills、filesystem agents、compaction、subagents 和 agent-readable websites,几乎都是当前 Codex/OpenClaw 工作流每天会遇到的问题。Vercel 的经验价值在于把这些实践从“个体技巧”上升成平台原语。
为什么值得看:这为 agent 平台建设提供了清单:不是只接一个模型 API,而是要设计可恢复任务、可审计工具调用、可迁移技能、运行沙箱和面向 agent 的网页/文档接口。
后续行动:把 eve/skills.sh/agent-readable website 作为一组研究对象,和 OpenClaw skills、TaskFlow、canvas、browser relay 的能力做对照表。
Hamel Husain:Codex 正在接近“AI 工作 superapp”定位
来源账号/机构:Hamel Husain;发布时间:2026-07-03 22:45 UTC;链接:公开帖
Hamel 评价 Codex “spans everything I can think of doing”,并特别提到 mobile support。上下文是 jxnlco 提问:如果使用 Codex,还有什么理由继续使用 ChatGPT。这个讨论不是官方公告,但反映出 AI 工程人群开始把 Codex 从“代码工具”看成更广泛的工作执行入口。
这条信号要谨慎看:它来自个人使用体验,不是产品路线确认。但它和 OpenAI 过去把 Codex 扩展到知识工作、every role/workflow 的方向一致,也和 OpenClaw 这类个人 agent 的使用方式贴近。
为什么值得看:如果 Codex/Claude Code 类工具成为通用执行层,聊天产品和 agent runtime 的边界会继续模糊。真正的差异会落在工具权限、文件系统、长任务状态、移动端回看和外部应用连接上。
后续行动:观察 Codex mobile、会话恢复、外部连接器和非代码任务能力;把“能否作为日常 superapp”拆成 5 个可测试场景。
开放模型生产化信号:GLM-5.2、Qwen 27B 与 harness 优化继续被放大
来源账号/机构:Clem Delangue / Hugging Face 社区线索;发布时间:2026-07-03 04:53-08:32 UTC;链接:GLM-5.2 in Claude Code via HF / Qwen 27B 生产体验线索 / harness 优化线索
Clem Delangue 转发了几条开放模型相关线索:GLM-5.2 可通过 Hugging Face Inference Providers 和 hf-claude 接入 Claude Code;工程团队对 Qwen 27B 的速度和效果有正反馈;另有一条关于“不改模型权重、演化 harness”即可显著提升法律 agent benchmark 的解读。
这些还不是同等级别的官方发布,需要分层看待:GLM-5.2 接入是真实工具链线索;Qwen 27B 是使用者经验;harness 优化则需要回到原始 Hugging Face 文章和 benchmark 设定核验。但三者共同说明开放模型越来越直接进入开发者 agent 工作流。
为什么值得看:开放模型竞争的关键可能不是单模型冲顶,而是能否被接进 Claude Code/Codex 类工作流、能否由 harness 弥补弱点、能否用更低成本完成垂直任务。
后续行动:后续单独验证 hf-claude + GLM-5.2 的安装、延迟、成本和任务完成率;不要仅凭转发判断模型能力。
人物/机构动态
- Simon Willison:继续把前沿模型体验转成可复用工程经验,今天重点是 Fable/Claude Code 的判断力、成本控制和子模型路由。
- Harrison Chase / LangChain:OpenWiki 的社区反馈从 repo 文档扩展到通用记忆,说明 LangChain 在记忆、trace、eval 之外又抓到一个 agent 基础设施入口。
- Noam Brown:放大 test-time compute 对 agent eval 的影响,和其一贯关注推理/搜索/RL 的方向一致。
- Hamel Husain:对 Codex 作为更通用工作入口给出强正反馈,同时继续在 AI 工程社区里充当品味与反噪音过滤器。
- Clem Delangue / Thomas Wolf:继续围绕开放模型、开放科学和可插拔工作流放大信号,今天重点偏生态和生产化。
- Nan Yu:几条短帖提示 AI 医疗问答、教育训练数据质量和 Web 技术栈变化,信号分散但有产品判断价值。
值得跟进项目
- OpenClaw memory 分层:明确长期人格记忆、项目知识、任务状态、公开资料缓存和待验证事实分别如何存储。
- Agent eval 元数据模板:所有 benchmark 摘要都记录 test-time compute、token/成本、工具调用限制和重试策略。
- Open Source AI Gap Map 研究:把 map.currentai.org 的分类映射到 AI 产业链和可投资环节。
- Vercel eve/skills 对照:研究 Vercel 的 agent 原语与 OpenClaw skills/TaskFlow/subagents 的异同。
- Codex superapp 场景测试:用非代码任务、移动端回看、资料整理、报告发布、外部应用连接五类场景观察边界。
- hf-claude + GLM-5.2 实测:只在公开/非敏感 repo 上试跑,记录延迟、失败类型和成本。
待验证信息
- AI Security Institute 的 test-time compute 研究需要读取完整论文/报告,当前只根据公开线索和 Noam Brown 转述归纳。
- OpenWiki 的 star 和通用 wiki 需求来自社交媒体反馈,尚不能证明长期留存和生产稳定性。
- Hamel 对 Codex superapp 的判断是高信号个人观点,不等同于 OpenAI 官方产品定位。
- Qwen 27B、GLM-5.2 和 harness 优化线索需要逐条回到原始工具链和 benchmark 设置验证。
- Current AI Gap Map 的分类和覆盖率仍是 v0.1,需要检查是否遗漏中国/欧洲开源项目以及许可证细节。
- 公开 Nitter RSS 可能漏掉登录态可见内容;本报告未使用私密 cookie、token 或账号内部信息。
低优先级噪音
- Kevin Weil 的美国独立日转发、Clem 的世界杯票务请求、活动现场打卡和祝贺类内容不进入主题分析。
- swyx/AIE World's Fair 的现场索引和花絮有社区热度价值,但今天没有展开到单条重点。
- Nan Yu 关于 X Web 使用 Tailwind/TanStack 的观察可作为 web 工程背景,不属于 AI/agent 主线。
- Hamel 关于 SRE rebranding、Agentic HDFS 等玩笑保留为术语泡沫观察,不作为独立更新。
- Simon 月度赞助 newsletter 信息偏个人运营,除非后续公开内容包含新技术线索,否则低优先级。
原始链接
- Simon Willison: Fable's judgement
- Simon Willison: Open Source AI Gap Map
- Current AI: Open Source AI Gap Map
- Latent Space: Vercel's Andrew Qu on why agents are a new kind of software
- Harrison Chase: OpenWiki general purpose memory wiki ask
- LangChain OpenWiki GitHub repo
- Noam Brown: AI Security Institute test-time compute eval line
- AI Security Institute: agent evaluation compute budgets
- Hamel Husain: Codex superapp observation
- Thomas Wolf: openness and concentrated power line
- Clem Delangue: open-source AI summer
- GLM-5.2 selectable in Claude Code via HF line
- Qwen 27B engineering feedback line
- Harness optimization line amplified by Clem
- Nan Yu: AI medical assistance framing