Follow 深度日报:Agent 发布后进入修正、记忆与开放栈竞争
基于 Obsidian Follow List active 账号与公开来源,覆盖 2026-07-10 00:00 UTC 至 2026-07-11 00:00 UTC。未使用 Folo CLI;未绕过 CAPTCHA 或做反爬规避。抓取优先级按 Status=active、Priority=high、Cadence=daily/weekly/manual 排序,主要使用公开 Nitter RSS、OpenAI RSS、作者/机构公开页面和源站链接。
核心主题
1. 发布后修正成为 agent 产品竞争力的一部分
ChatGPT Work/Codex 发布后的反馈集中在限额、默认模型、信息架构和 multi-agent 回归,说明强模型之外,产品可解释性和迁移体验会直接决定用户信任。
2. 并行 test-time compute 进入研究叙事
Sol Ultra 64 子代理求解数学猜想的线索,把前沿模型竞争从单次回答质量推向“能否组织大量推理分支并收敛到可审查产物”。
3. 企业 agent 栈转向可拥有的模型、记忆和运行时
LangChain/NVIDIA NemoClaw、OpenWiki personal brain、OpenSWE 与 LangSmith 观测组成一条完整路线:模型、harness、memory、runtime、eval 都要可控。
4. 开放生态也在做信息分发和网络效应
Hugging Face 不只发布模型和数据,还开始强调 HuggingNews、Gemma Challenge 和 agent network effects,开放平台正在争夺发现、协作和部署入口。
重要更新
OpenAI:ChatGPT Work/Codex 发布后快速修正,问题集中在限额、默认模型和信息架构
来源账号/机构:Sam Altman 转发 Tibo、Simon Willison、Greg Brockman;发布时间:2026-07-10 17:59-21:39 UTC;链接:Tibo 发布后修正说明 / Simon on sidebar/projects / Simon on Codex vs Work / Simon on UI vs capability
OpenAI 在 GPT-5.6、ChatGPT Work 和 Codex 合流后的 24 小时内公开承认几类摩擦:高算力设置太容易误用且限额影响不清楚,桌面端一次性重组让 chats/projects 难找,部分 Codex 用户误以为 Codex 会被 Work 淡化,多代理工作流和插件也出现回归。短期修正包括重置使用限额、调整默认和模型选择器、修复插件提交问题、重新突出 Codex,并承诺下周恢复更熟悉的 sidebar/projects 组织。
Simon Willison 的追问很实用:如果 ChatGPT 桌面里的 Codex 对工程师是 Work 的超集,何时该切到 Work Mode?随后他记录 OpenAI 内部人士的说法:能力和历史相同,差异主要是 UI 偏好。这意味着 OpenAI 正在把“同一底座能力如何包装成不同工作入口”作为产品层难题。
为什么值得看:这类发布后修正比发布稿更能暴露真实产品边界。Agent 工作台的胜负点不只是模型强弱,还包括默认成本、限额可见性、旧工作流兼容、插件可靠性和用户是否理解入口差异。
后续行动:把 ChatGPT Work/Codex 的反馈项转成 OpenClaw 工作台检查表:默认模型成本提示、任务限额、项目导航、agent 回归测试、插件提交/审批和“入口差异”说明。
GPT-5.6 Sol Ultra:64 子代理求解数学猜想,test-time compute 从延长思考转向并行编排
来源账号/机构:Greg Brockman、Noam Brown;发布时间:2026-07-10 18:19-19:55 UTC;链接:Greg Brockman / Noam Brown / Noam on parallel TTC
Greg Brockman 和 Noam Brown 放大一条线索:GPT-5.6 Sol Ultra 使用 64 个子代理,在约一小时内产出一个 50 年数学猜想的证明。Noam 的重点不是单纯“模型更聪明”,而是 test-time compute 从秒级扩展到周级时,延迟会成为瓶颈;Sol Ultra 的信号在于可并行化推理,把一天级搜索压到一小时级。
这条内容仍需要数学共同体验证证明质量,也需要官方说明任务设置、prompt、子代理角色、搜索空间和人工筛选程度。但从 agent 工程角度,它清楚展示了下一个前沿:模型不只是生成答案,而是调度多个推理分支、合并证据、输出可审查工件。
为什么值得看:如果并行 test-time compute 成为常规能力,科研、投研、代码迁移和安全审计都会从“问一个模型”变成“设计可预算、可回放、可验证的推理集群”。
后续行动:等待证明复核和技术细节;同时为 OpenClaw 设计一个小型 parallel reasoning harness,用同一问题跑多分支、汇总、交叉审查和成本统计。
Thinking Machines:Mira Murati 发布“人本、分布式、可塑形”的 AI 世界观
来源账号/机构:Mira Murati、Thinking Machines Lab;发布时间:2026-07-10 16:40 UTC;链接:Mira Murati / The Future Worth Building Is Human
Thinking Machines 的长文把使命定义为“扩展人的意志和判断”,反对把 AI 塑造成中心化、冻结、替人决策的系统。文章强调本地知识和默会知识无法简单集中化,未来应有许多由不同场景、不同人群、不同反馈塑造的 AI,而不是一个平均化的统一代理。
Mira 的配套帖还回顾 Thinking Machines 一年来的方向:多模态 AI、自定义模型、开放科学、Tinker 让用户训练开放权重模型、Connectionism 研究,以及未来几个月首个产品会包含重要开源组件。这和 OpenAI 的 Work/Codex 合流形成有趣对照:一个偏中心化工作入口,一个强调分布式塑形和本地知识。
为什么值得看:这可能成为 Thinking Machines 与 OpenAI/Anthropic/Google 差异化的哲学和产品底座:AI 不是替你完成所有工作,而是被个人、组织和社区持续塑形。
后续行动:跟踪 Tinker、首个产品和开源组件;评估它对个人 agent memory、custom model、Obsidian 知识库和本地反馈循环的启发。
LangChain:NemoClaw、OpenWiki personal brain 与 OpenSWE 指向“可拥有的企业 agent 栈”
来源账号/机构:Harrison Chase、LangChain、Brace Sproul;发布时间:2026-07-10 15:24-21:51 UTC;链接:Harrison Chase launches / NemoClaw Deep Agents Blueprint / OpenWiki general purpose brain / Soft-Cache working paper
Harrison Chase 把本周 LangChain 发布归纳为两条线:开放模型与记忆。NemoClaw Deep Agents Blueprint 把 Deep Agents harness、NVIDIA Nemotron 3 Ultra 和 OpenShell governed runtime 组合起来,目标是让企业能拥有模型层、工具/上下文/评测/harness 层和安全运行时,而不是只租用闭源入口。
记忆线则围绕 OpenWiki personal brain 展开:它从 Gmail、互联网等来源主动生成通用 wiki memory,并和 Codex/Claude 这类“反应式记忆”互补。OpenSWE 的内部使用线索也值得记录:自 7 月 1 日以来,LangChain 内部 Slack 已经超过 700 次 tag OpenSWE,说明异步开源 coding agent 正在进入团队日常流程。
为什么值得看:LangChain 正把 agent 工程拆成企业可拥有资产:模型、harness、memory、runtime、trace、eval。这个框架比单个 demo 更接近真实生产落地。
后续行动:阅读 NemoClaw 评测细节,检查 0.86 score 与 10x 成本优势的任务定义;试跑 OpenWiki personal brain,评估它和 Obsidian/邮件/日报状态文件的连接方式。
Hugging Face:Gemma Challenge、HuggingNews 与开放模型默认化,开放平台也在争夺 agent 网络效应
来源账号/机构:Clem Delangue、Google Gemma、HuggingNews;发布时间:2026-07-10 15:38-22:18 UTC;链接:Clem on agent network effects / Gemma Challenge / HuggingNews / HuggingNews / open source American AI models
Clem Delangue 转发 Gemma Challenge 结果:100 多个 AI agents 和人类在 6 天内协作,把 Gemma 4 在单张 NVIDIA A10G 上的推理速度提高到约 5 倍,最快结果达到 491.8 TPS,最快无损结果为 315 TPS。Clem 的解读更关键:Hugging Face 可能不仅有用户网络效应,也会形成 agent 网络效应。
同一天,Clem 推出 HuggingNews:一个 AI-curated feed,用来筛选每天值得看的 AI 新闻,并计划基于 Hugging Face profile 做个性化。它本身还是早期产品,但代表开放平台不只想当模型仓库,也想控制“发现什么、谁来优化、agent 如何协作”的信息入口。
为什么值得看:开放生态的护城河正在从模型文件扩展到协作、评测、分发、优化和个性化信息流。如果 agent 能在 HF 上共同优化模型/推理/数据,平台网络效应会比单纯下载量更强。
后续行动:跟踪 Gemma Challenge 的代码和评测指标;试用 HuggingNews,但把其中未核实新闻列入待验证,不直接作为事实来源。
Google / Gemini:AI Studio 免费 pretty URL 与 Gemini macOS trusted testers 推进应用分发入口
来源账号/机构:Logan Kilpatrick、Josh Woodward;发布时间:2026-07-10 15:05-15:09 UTC;链接:AI Studio pretty URLs / Gemini Trusted Testers
Logan Kilpatrick 表示 Google AI Studio 正在为部署应用推出免费 pretty URL,每个 app 可以拿到类似 `your-own-url.ai.studio` 的地址。Josh Woodward 则更新 Gemini App Trusted Testers Program:第一批已 onboard,并开始邀请测试即将进入 macOS app 的未发布功能。
这两条看似小,但都围绕“从模型到可分享应用”的最后一公里。AI Studio 用免费部署和免费 URL 降低原型发布摩擦,Gemini 则用 trusted testers 加速桌面端体验打磨,延续昨天用户反馈 Top 10 的产品修正路线。
为什么值得看:AI agent/应用的竞争不只在 API,而在“能不能快速变成别人能打开、测试、反馈的工作流”。免费 URL、桌面端灰度和 tester program 都是在抢开发者分发入口。
后续行动:用 AI Studio pretty URL 试部署一个小工具,记录和 GitHub Pages/OpenClaw Sites/Cloudflare Pages 的差异;继续观察 Gemini macOS 是否补齐项目、文件和工具调用体验。
OpenAI / Deutsche Telekom:AI-native telco 线索继续把企业 agent 拉向客服、员工流和网络运营
来源账号/机构:OpenAI RSS;发布时间:2026-07-10 07:00 UTC;链接:How Deutsche Telekom is rewiring telecommunications with AI
OpenAI RSS 发布 Deutsche Telekom 案例,摘要指向四类落地:客户服务、员工工作流、网络运营和未来语音。虽然正文页面在当前环境需要 JavaScript/cookies,RSS 摘要已足够说明 OpenAI 正继续把 enterprise AI-native 转型案例推向大型传统行业。
电信场景值得单独看,因为它同时具备高频客服、复杂内部流程、网络告警/运维和语音入口。与 ChatGPT Work/Codex 的个人/知识工作入口相比,telco 案例更接近“agent 进入组织流程和运营系统”。
为什么值得看:AI-native telco 是企业 agent 的硬场景:权限复杂、遗留系统多、服务质量要求高、语音和网络运营都可直接影响成本。
后续行动:后续用浏览器或可读镜像复核完整案例,提取可量化指标:客服处理时长、员工自动化覆盖、网络事件响应、语音系统成本。
AI 工程判断:Hamel 与 Simon 都在提醒“自动化不是护城河,理解与数据才是”
来源账号/机构:Hamel Husain、Simon Willison、swyx 转发 AI Engineer 内容;发布时间:2026-07-10 17:42-21:00 UTC;链接:Hamel on data / Simon on AI browsers / Geoffrey Litt code understanding keynote
Hamel 的提醒很直接:如果一个工具能自动发现并修复所有问题,它也会给你的竞争对手做同样的事,产品差异最终还是来自数据和业务理解。Simon 则从 AI-enhanced browser 角度继续强调安全/隐私边界,倾向让 AI 使用独立浏览器,而不是进入用户自己的主浏览器。
swyx 转发 Geoffrey Litt 关于“仍然要理解 agent 写的代码”的演讲,和近期“AI 工程师是否还需要读代码”的争论呼应。三条合起来看,AI 工程主线不是放弃理解,而是把注意力从逐行打字转向数据、边界、审查和反馈设计。
为什么值得看:这是对过度自动化叙事的必要制衡。真正的个人/企业 agent 系统需要保留人类判断、数据优势和安全边界,否则只是把通用能力平铺给所有人。
后续行动:在日报和项目工作流里继续保留人工复核、来源链接、待验证区和行动项;对浏览器/邮件/私密数据类 agent 坚持隔离环境和最小权限。
人物/机构动态
- OpenAI:发布后快速修正 ChatGPT Work/Codex 体验;Greg 继续强化 mobile、voice、consumer-scale agents 和 Sol Ultra 叙事。
- Thinking Machines:通过长文和 Mira 的转发明确“人本、分布式、本地知识塑形”的世界观,首个产品和开源组件值得持续跟进。
- LangChain:把 NemoClaw、OpenWiki personal brain、OpenSWE、LangSmith 观测放到同一企业 agent 栈叙事里。
- Hugging Face:从模型仓库继续扩展到新闻发现、agent 协作优化、开放模型默认化和企业主权叙事。
- Google / Gemini:AI Studio pretty URL 和 Gemini macOS trusted testers 都指向应用部署与桌面体验打磨。
值得跟进项目
- ChatGPT Work/Codex 发布后修正清单:可转为 agent 产品回归测试表。
- Sol Ultra 64 subagents 数学证明线索:等待证明复核和技术细节。
- Thinking Machines world view:跟踪 Tinker、开放权重训练和首个产品。
- NemoClaw Deep Agents Blueprint:研究开放模型 + harness + runtime 的企业落地方式。
- OpenWiki personal brain:评估对 Obsidian/邮件/网页记忆的适配。
- HuggingNews:观察 AI 新闻聚合是否能和个人 follow list/state file 结合,但需严格事实复核。
待验证信息
- Sol Ultra 的数学证明需要独立数学审查;目前只按公开社媒线索记录,不视为已被学界确认。
- LangChain/NVIDIA 的 0.86 score 和 10x 成本优势需要检查 benchmark、任务集、模型价格、harness 调参和复现脚本。
- HuggingNews 中出现的部分新闻可能来自自动聚合或未核验来源,不能直接作为事实来源。
- OpenAI Deutsche Telekom 页面当前 curl 只能读取 RSS 摘要,完整案例指标需后续用可读页面复核。
- ChatGPT Work/Codex “能力相同、主要是 UI 偏好”的说法来自社媒转述,应以后续官方帮助文档为准。
低优先级噪音
- 围绕 GPT-5.6 Sol 的大量兴奋转发、玩笑和短评,只保留和成本、限额、并行推理、入口定位相关的部分。
- Nan Yu 的 “dog-barfing” 产品吐槽有趣,但缺少具体 AI/agent 落地信息,本期只作为低优先级产品语感观察。
- swyx 转发的 AIE 现场内容很多,适合作为发现入口;本期只保留“是否仍要读代码”和前沿策略相关线索。
- 个别 HuggingNews 榜单条目涉及市场/地缘/公司传闻,未进入重点更新,避免放大未验证信息。
原始链接
- Tibo: ChatGPT Work/Codex post-launch fixes
- Simon Willison on ChatGPT sidebar/projects
- Simon Willison on Codex vs Work
- Simon Willison on AI browsers and privacy
- Greg Brockman on Sol Ultra math proof
- Noam Brown on parallel test-time compute
- Thinking Machines: The Future Worth Building Is Human
- Mira Murati on Thinking Machines mission
- LangChain/NVIDIA NemoClaw Deep Agents Blueprint
- Harrison Chase: open models and memory launches
- OpenWiki
- Soft-Cache agent memory working paper
- Clem Delangue on agent network effects
- Google Gemma Challenge results
- HuggingNews
- Google AI Studio pretty URLs
- Gemini Trusted Testers Program update
- OpenAI: Deutsche Telekom AI-native telco
- Hamel Husain on data and differentiation
- AI Engineer / Geoffrey Litt keynote on understanding code