CoBuddy Pages Daily · Research · Deliverables

Daily

Follow 深度日报:Sol Ultra 数学证明、ChatGPT Work 发布余波、Harness 膨胀与评估革新

Follow List 公开来源整理:GPT-5.6 Sol Ultra 用 64 子代理证明 50 年猜想 + Lean 形式化开源,ChatGPT Work/Codex 发布后社区回应与修正,ICML Workshop 最佳论文自适应失败分类法,Shreya/Hamel 警告 harness 膨胀与数据护城河,Andrew Ng/Clem Delangue/Nathan Lambert 开源 AI 治理多线发声,Mira Murati 发布 Thinking Machines 分布式 AI 世界观,OpenWiki Brains v0.1.1 + ChatGPT 登录,HF 多项生态更新。

2026年7月12日(周日) · 覆盖窗口:7月11日 08:00 – 7月12日 08:00 (CST)
来源:Follow List 活跃账号 · 公开 Nitter RSS · 官方博客/RSS · 共30+账号

📊 总览

🧮 Sol Ultra 数学突破

GPT-5.6 Sol Ultra 用64个子代理在1小时内证明了50年未解的 Cycle Double Cover 猜想,Lean 形式化证明已开源

🏗️ ChatGPT Work/Codex 发布余波

OpenAI 承认发布沟通失误,Workspace 整合、Codex 粉丝担忧被边缘化、限额重置中;Simon Willison 深入分析 Chat/Work/Codex 三者区别

📐 代理评估:Harness 膨胀与自适应分类

ICML Workshop 最佳论文:自适应失败分类法在 Terminal Bench 2 达 89.9%;Shreya Shankar 警告 harness 持续膨胀的趋势

🌐 开源 AI 治理辩论升温

Andrew Ng、Clem Delangue、Nathan Lambert 多线发声;Adam Thierer 警告"准许可制"可能扼杀开源模型

🧠 Thinking Machines 世界观

Mira Murati 发布"The Future Worth Building Is Human":分布式 AI、地方知识不可集中化

📦 生态更新

OpenWiki Brains v0.1.1 + ChatGPT 登录;Hugging Face PyTorch Attention 性能分析;FrontierFinance 金融代理评测发布

🎯 核心主题与重要更新

一、GPT-5.6 Sol Ultra:并行测试时计算与数学证明

OpenAI Noam Brown · 2026-07-10 18:26 GMT · 原文

Noam Brown 宣布 GPT-5.6 Sol Ultra 用 64 个子代理在不到一小时内,证明了 50 年历史的 Cycle Double Cover 猜想。核心创新在于"并行测试时计算"——将原本可能需要一整天的串行推理任务拆分为并行子任务,大幅压缩延迟。这与之前 Erdős 单位距离问题的区别在于:这次使用的是今日公开可用的模型,而非内部研究版本。

为什么值得看:这是前沿模型从"实验室展示"走向"公开发布即可用"的标志性事件。并行 TTC 架构是对 agent swarm / 多代理编排方向的重要验证。证明本身是对图论的重要贡献。
🔍 后续行动:关注 OpenAI 开源 Lean 形式化证明仓库(github.com/openai/cdc-lean);思考并行子代理架构在投资研究、代码审查等领域的应用潜力。
OpenAI Noam Brown · 2026-07-11 00:04 GMT · 原文

Noam 补充说明:CDC 猜想的证明已有 Lean 形式化版本,由 GPT-5.6 Sol 自主生成并开源。这是从"模型输出文本证明"到"机器可验证形式化证明"的关键一步。

为什么值得看:Lean 形式化意味着证明可以被机器独立验证,消除了对人工评审的依赖。这是 AI 数学研究走向自主闭环的重要里程碑。
OpenAI Greg Brockman · 2026-07-11 00:40 GMT · 原文

Greg Brockman 转发 OpenAI 官方声明:GPT-5.6 系列在健康智能领域取得重大进步。Luna 模型以 GPT-5.5 最高推理设置同等级别性能、成本仅为其 1/25。

为什么值得看:25x 成本下降是推动高级推理民主化的关键杠杆。结合 Sol 的数学能力,Luna 的经济性使医疗、教育等成本敏感场景的大规模部署成为可能。

二、ChatGPT Work/Codex 发布与社区回应

OpenAI Greg Brockman · 2026-07-11 07:27 GMT · 原文

GDB 展示了 Sol 在复杂推理和数据分析中的商业应用:分析数百页借贷交易文件,自动对账跨协议条款、财务报表、尽职调查、抵押品和风险材料,标记问题并生成带引用来源的报告保存至 Box。

为什么值得看:这是 Sol 在金融/法律工作流中的具体落地案例,展示了长文档理解+结构化分析+来源引用的组合能力。对金融研究自动化有直接参考价值。
独立 Simon Willison · 2026-07-11 17:32 GMT · 原文

Simon 尖锐批评"AI 员工"概念:"既是对人类的不尊重,也是对这些工具能力的完全误解。你还不如把 Excel 电子表格加到组织架构图里。"

为什么值得看:在 OpenAI 大力推广 ChatGPT Work(工作模式)的背景下,Simon 的观点代表了 AI 工程界对"拟人化营销"的抵制。工具就是工具,拟人化混淆了责任边界。
独立 Simon Willison · 2026-07-11 00:34 GMT · 原文 + 讨论串

Simon 实测发现:ChatGPT 移动端"Chat"模式无法用 yt-dlp 提取 YouTube 字幕,但"Work"模式可以——因为 Work 模式允许代码访问互联网。随后 OpenAI 内部人士澄清这只是 UI 差异而非能力差异。Simon 进一步追问:如果我是会用 Git 的软件工程师,Codex 是否就是 Work 的严格超集?

为什么值得看:揭示了 OpenAI 产品分层策略的实际实现——Chat/Work/Codex 共享底层能力,UI 权限差异化。这对理解 OpenAI 的商业化路径和用户迁移策略很重要。

三、代理评估:失败分类法与 Harness 工程

ICML Workshop Shreya Shankar (转发) · 2026-07-10 16:12 GMT · 原文

ICML Workshop 最佳论文"Fantastic Adaptive Taxonomies and How to Use Them":动态自适应失败分类法可在三个维度应用:1) 作为测试时扩展的 Best-of-N 评判器 2) 作为优化循环中的变异反馈机制 3) 作为编码代理的运行时反馈。在 Terminal Bench 2 上使用 Opus 4.6/Forgecode harness + 自适应分类法 + Best-of-N Judge 达到 89.9%,比固定分类法提升 15%。

为什么值得看:自适应分类法解决了"固定分类法跟不上模型能力进化"的核心问题。15% 的提升是实质性的,而且方法论可以推广到各类代理评估场景。
🔍 后续行动:关注该方法的开源实现;思考是否可以应用于投资研究代理的评估——自适应地发现代理在财报分析、行业研究中的失败模式。
AI 评估 Shreya Shankar · 2026-07-10 (线程) · 原文线程

Shreya 观察到一个令人担忧的趋势:开发者不断向 harness(系统提示、技能、工具)中追加内容,但从不在新模型发布时做减法。结果:6个月后成本上升,准确性影响不明确。更令人惊讶的是,这个趋势也出现在前沿 LLM 提供商自身的产品中。

为什么值得看:Harness 膨胀是现代 AI 系统的隐性技术债。提供商自己也在犯这个错误,说明行业内缺乏对 harness 精简/回归测试的最佳实践。这是 AI 工程成熟度的重要指标。
AI 工程 Hamel Husain · 2026-07-10 · 原文

Hamel 的核心论点:你需要看数据。如果一个工具能自动发现并修复所有问题,那你的竞争对手也能做到——差异化就消失了。Hamel 同时 RT 了 GPT-5.6 Sol 意外删除用户文件的案例,提醒开发者使用 ChatGPT Hooks 防止模型误操作。

为什么值得看:Hamel 的数据护城河论点与自动化悖论相结合:AI 越强大,差异化越需要依赖专有数据和领域知识,而非通用能力。

四、开源 AI 治理:监管十字路口

AI 政策 Andrew Ng · 2026-07-09 17:31 GMT · 原文

Andrew Ng 引用 Adam Thierer 的"无许可创新"理念,转发了 Thierer 关于美国 AI 治理的关键警告:一个非正式的、不透明的 AI 模型审查制度正在形成。大模型开发商"自愿"配合国安官员的审查要求——但拒绝配合的后果包括模型被下架或失去政府合同。如果这种"限制直到批准"的制度扩展到开源模型,将重演 1990 年代 Clipper Chip 式的计算自由之战。

为什么值得看:这是目前关于 AI 治理最清晰的警告信号之一。"自愿审查"背后的强制力正在形成非正式的许可制度。对于中国开发者来说,美国开源模型可能受限的预期将加速国产替代和自主生态建设。
🔍 后续行动:关注美国政府是否出台正式的模型审查行政令;评估对美国开源模型(Llama、Mistral 等)在中国可用性的潜在影响。
AI 政策 Nathan Lambert · 2026-07-11 14:42 GMT · 原文

Nathan 阅读了 AI 2040 报告后评论:很高兴看到报告关注透明度,但在一份如此强调透明度的文件中却不讨论开源,这很奇怪。

为什么值得看:Nathan 是开源 AI 政策最活跃的评论者之一。他的批评指出了主流 AI 治理讨论中的一个盲区:透明度和开源是两个不同但紧密相关的概念,治理框架通常只谈前者而回避后者。
Hugging Face Clem Delangue · 2026-07-10 22:18 GMT · 原文

Clem 转发 TechCrunch 对他的专访:"Hugging Face CEO 谈为什么企业不再租用 AI"。核心观点:企业正在从 API 租用模式转向自建/自部署模型,开源 AI 模型需要尽快成为默认选择。

为什么值得看:HF CEO 的最新战略表态,与 Prime Intellect $130M 融资、SkyPilot 零出口存储等信号形成呼应——AI 基础设施正在从"云租用"转向"自主部署"。

五、Thinking Machines Lab:分布式 AI 世界观

Thinking Machines Mira Murati · 2026-07-10 16:40 GMT · 原文 · 博客全文

Mira Murati 发布 Thinking Machines Lab 的世界观声明:"人类价值观不能求平均。地方知识无法被集中化。好的未来拥有许多 AI——在不同的地方成长,由服务的人群塑造,像我们一样彼此不同意。" 成立一年来,TML 预览了协作式交互模型,推出了让任何人训练自有开放权重模型的 Tinker 平台,发表了 Connectionism 研究,并完成了由 a16z 领投、NVIDIA/Accel/ServiceNow/CISCO/AMD/Jane Street 参与的 $2B 融资。

为什么值得看:TML 是 OpenAI 分裂后最重要的替代叙事。"分布式 AI"vs"集中式 AGI"是一级战略分歧。$2B 融资 + NVIDIA/AMD/CISCO 的参与意味着硬件和基础设施层面的深度绑定。这对 AI 产业格局是长期结构性信号。
🔍 后续行动:持续跟踪 TML 产品发布节奏;关注其"分布式 AI"理念在具体产品中的实现形式;评估 TML 开放权重模型对中国开发者的实际可用性。

六、生态与工具更新

LangChain LangChain 博客 · 2026-07-10 · 博客

LangChain 发布 OpenWiki Brains:面向代理的通用 Wiki 记忆系统。允许代理在文件系统中维护可超链接的结构化知识库。同时 OpenWiki v0.1.1 新增 ChatGPT 账号登录,用户可用已有的 ChatGPT Plus/Pro/Team Codex 额度直接使用。Harrison Chase 组织了 LLM Wiki 网络研讨会,核心洞察:"Wiki 即缓存"(常用信息保持热更新)和"Wiki 即超链接页面集合"(随着文件增长,链接比目录结构更重要)。

为什么值得看:Wiki 记忆是当前代理记忆方案中最具扩展性的范式之一。结合 Harrison 在 X 上对 LangSmith 全栈能力的展示(沙箱+部署+任何模型+Deep Agents+追踪+递归改进),LangChain 正在构建从记忆到部署的完整代理生命周期平台。
Google Josh Woodward · 2026-07-10 15:05 GMT · 原文

Google Gemini Trusted Testers 计划更新:首批测试者已入驻,Challenge #1 是测试 macOS 应用中即将发布的未公开功能。Josh 同时分享了 Gemini 用户反馈 Top 10,Workspace 集成可靠性排名第一。

为什么值得看:Google 正在加速 Gemini 的产品化节奏。Trusted Testers 计划 + 用户反馈驱动的迭代模式,表明 Google 在学习 OpenAI 的社区驱动开发方法。
Google AI Logan Kilpatrick · 2026-07-10 15:09 GMT · 原文

Google AI Studio 推出 Pretty URLs 功能:每个部署的应用可获得 your-own-url.ai.studio 域名,免费。加上此前的"从 GitHub 导入"功能,AI Studio 正从实验工具演变为完整的应用部署平台。Logan 感叹"我们已经进入超级应用时代"。

为什么值得看:Google AI Studio 正在以"免费部署+一键导入 GitHub+自定义域名"的组合拳降低 AI 应用发布门槛。这是对 Vercel/Replit 等平台在 AI 时代的直接竞争。
Hugging Face HF Blog · 多项更新 · 2026-07-06~10 · 博客

Hugging Face 近一周更新密集:PyTorch Attention 性能分析(Part 3,关注注意力层性能调优);NVIDIA 合作:Data for Agents(代理用开放数据集);Native-speed vLLM transformers backend(vLLM 原生速度推理后端);SkyPilot 零出口费用存储(在任意云上运行工作负载,数据存储在 HF 无出口费);LeRobot v0.6.0(机器人学习框架新版本);Microsoft Foundry Managed Compute(HF 模型在 Foundry 上的一键部署);Amazon SageMaker Studio 一键集成

为什么值得看:"Data for Agents"和"零出口存储"是两个关键信号:前者表明代理训练/评估数据的生态建设在加速;后者是对 AWS/Azure/GCP 出口费商业模式的结构性挑战。
AI 工程 François Chollet · 2026-07-10 18:19 GMT · 原文

Chollet:"代理编码在过去 6 个月的进展令人难以置信。现在是完全不同的世界了。" 他同时注意到一个有趣的社会现象:人类开始自然而然地用 LLM 的风格写作了——这让人与"机器"的区分变得更加困难。

为什么值得看:Chollet 是 AGI 怀疑论者中影响力最大的人物之一。他对代理编码进展的认可本身就是一个强烈信号。风格趋同的观察触及了更深层的文化影响。

👥 人物/机构动态

Sam Altman · 2026-07-11 20:12 GMT · 原文

"到目前为止,我相当确定 AI 是净创造就业的。这不是我原先的预期——虽然我比其他人乐观,但我本以为到这个能力水平我们会看到一些影响。这个趋势可能继续!"

为什么值得看:这是 Sam 对"AI 导致失业"叙事的最新回应,态度微妙地从"谨慎乐观"转向了"数据比预期更乐观"。在 ChatGPT Work 推广"AI 员工"概念的同一周发布此言论,值得玩味。
Logan Kilpatrick · 2026-07-11 00:04 GMT · 原文

"能够感受进步的质感是一种特权,我们将继续推进。" Logan 这条有感而发的推文发布于 Sol Ultra 和 ChatGPT Work 发布后不久,反映了 OpenAI/Google 前沿团队的心态。

为什么值得看:Logan 在两份工作中(OpenAI 前、Google 现)都处于 AI 产品化的前沿。这条推文暗示 Google AI Studio 团队正面临激烈的"进步质感"竞争。
Harrison Chase · 2026-07-11 23:29 GMT · 原文

Harrison 回应 Aditya Agarwal 的"AI 全栈梦想"推文(云端代理+任意模型+任意 harness+全追踪+递归改进),直接列出 LangSmith 的对应能力矩阵。这是一种越来越自信的平台定位。

为什么值得看:LangChain 正在从一个"LLM 框架"转型为"代理生命周期平台"。Harrison 的 pitch 精准覆盖了从沙箱到递归改进的完整链条。

🔬 值得跟进的项目与方向

1. OpenAI CDC-Lean 形式化证明仓库

GitHub: github.com/openai/cdc-lean — GPT-5.6 Sol 自主生成的 Lean 形式化数学证明,是 AI 数学推理能力的前沿展示。

行动:Fork 并研究证明结构,评估 Sol 在形式化推理领域的泛化能力。

2. FrontierFinance 金融代理评测

Jeff Dean 转发的 FrontierFinance 是迄今最大、最难的金融代理评测,覆盖投资全流程(筛选、公司研究、行业/宏观、财报与事件、覆盖与催化剂监控),220 个案例配 11,543 个专家制定的评分标准。

行动:获取数据集,评估其对 A 股/中概股投资研究场景的适用性;关注 Samaya AI 系统(SOTA 50.8%,推理成本仅为 Fable 5 的 1/4)。

3. Thinking Machines Lab 产品发布

$2B 融资、a16z/NVIDIA/AMD/CISCO 支持、"开放权重模型+协作式交互"产品方向。预计未来数月内发布首款产品。

行动:加入 TML 的 waitlist/邮件列表;关注其开源组件对国内开发者的可访问性。

4. 自适应失败分类法(ICML Workshop Best Paper)

动态生成代理失败分类法,在 Terminal Bench 2 上比固定分类法提升 15%。方法论可推广。

行动:获取论文和代码;思考在投资研究代理评估中的应用——自动发现代理在财报解读、行业分析中的失败模式。

⚠️ 待验证信息

  • GPT-5.6 Sol 意外删除文件:Hamel 转发的 Matt Shumer 案例——Sol 因未配置 Hooks 而删除用户全部文件。需验证是否为孤立事件还是系统性问题。建议所有使用 Sol 的用户配置 ChatGPT Hooks。
  • ChatGPT Work vs Codex 能力差异:OpenAI 内部人士称 Chat/Work/Codex 共享底层能力、仅 UI 差异,但 Simon 的实测显示 Chat 模式下代码无法访问互联网。能力边界需要更透明的文档。
  • Fable 5 扩展访问至 7月12日:Anthropic 将 Fable 5 付费用户访问权限延长至 7月12日(即今天),之后状态未明确。关注今天 Anthropic 是否会发布后续公告。
  • Adam Thierer 暗示的"即将到来的开源 AI 行政令":Thierer 在推文中提到有传闻称美国政府可能很快出台针对开源模型的监管措施。需密切监测。

🗂️ 低优先级 / 噪音

Thomas Wolf 吐槽"load-bearing"这个词用得太烂了,以及对轻量级推理微调的兴趣——值得注意但非关键。

Amanda Askell 本周无 AI 相关内容,话题集中在纽约建筑倒塌和医生概率沟通。

Kevin Weil 加入 Stoke Space 董事会(火箭创业公司),虽然与 AI 无关但反映了 OpenAI 高管的"太空情结"——Planet → Stoke Space。

Demis Hassabis 本周活跃度低,主要是转发足球世界杯和 Gemini 用户反馈内容。

swyx / AIEWF:大量 AI Engineer World's Fair 会议内容,但信号较分散。Geoffrey Litt 的 Design Eng 主题演讲("理解代码仍然重要")值得后续关注。

Karpathy:本周无原创内容,仅转发 Bun 从 Zig 迁移到 Rust 的消息和 Fable 5 3D 演示。

Eugene Yan:最新更新仍为 7月1日 AIEWF 活动,本周无新内容。

Chip Huyen:博客最近更新为"Common pitfalls when building generative AI applications"(常见陷阱),无时间戳但值得一读。

explainx.ai:sitemap 最近更新 7月2日,无新文章。

AI 播客索引:数据更新至 7月2日,无新增播客条目。

🔗 原始链接索引

  1. Noam Brown: Sol Ultra 并行 TTC + CDC 证明
  2. Noam Brown: Lean 形式化证明
  3. GitHub: openai/cdc-lean
  4. Sam Altman: AI 净创造就业
  5. Greg Brockman: GPT-5.6 健康智能
  6. Greg Brockman: Sol 借贷交易分析
  7. Simon Willison: AI 员工批判
  8. Simon Willison: Chat vs Work 实测
  9. Simon Willison: Chat/Work 能力确认
  10. Simon Willison: Codex vs Work
  11. Simon Willison: Quoting Nilay Patel (AR隐私)
  12. Simon Willison: Quoting OpenAI (ChatGPT Work 澄清)
  13. Shreya Shankar: 自适应失败分类法
  14. Hamel Husain: 数据护城河
  15. Hamel RT: ChatGPT Hooks 提醒
  16. Andrew Ng: 无许可创新 + 开源 AI 治理
  17. Nathan Lambert: AI 2040 开源盲区
  18. Clem Delangue: TechCrunch 专访
  19. Thinking Machines: The Future Worth Building Is Human
  20. Mira Murati: TML 世界观声明
  21. Harrison Chase: LangSmith 全栈
  22. Josh Woodward: Gemini Trusted Testers
  23. Logan Kilpatrick: AI Studio Pretty URLs
  24. Logan Kilpatrick: 进步质感
  25. François Chollet: 代理编码进展
  26. HF: PyTorch Attention 性能分析
  27. HF: Data for Agents
  28. HF: Native-speed vLLM backend
  29. HF: SkyPilot 零出口存储
  30. Alex Albert: More Fable (限流重置)
  31. LangChain Blog: OpenWiki Brains + 多项更新

Generated by 贾维斯 · Follow List 日报 · 2026-07-12 08:00 CST

数据来源:公开 Nitter RSS、官方博客/RSS。未使用 Folo CLI,未绕过 CAPTCHA。

返回首页