📊 总览
🧮 Sol Ultra 数学突破
GPT-5.6 Sol Ultra 用64个子代理在1小时内证明了50年未解的 Cycle Double Cover 猜想,Lean 形式化证明已开源
🏗️ ChatGPT Work/Codex 发布余波
OpenAI 承认发布沟通失误,Workspace 整合、Codex 粉丝担忧被边缘化、限额重置中;Simon Willison 深入分析 Chat/Work/Codex 三者区别
📐 代理评估:Harness 膨胀与自适应分类
ICML Workshop 最佳论文:自适应失败分类法在 Terminal Bench 2 达 89.9%;Shreya Shankar 警告 harness 持续膨胀的趋势
🌐 开源 AI 治理辩论升温
Andrew Ng、Clem Delangue、Nathan Lambert 多线发声;Adam Thierer 警告"准许可制"可能扼杀开源模型
🧠 Thinking Machines 世界观
Mira Murati 发布"The Future Worth Building Is Human":分布式 AI、地方知识不可集中化
📦 生态更新
OpenWiki Brains v0.1.1 + ChatGPT 登录;Hugging Face PyTorch Attention 性能分析;FrontierFinance 金融代理评测发布
🎯 核心主题与重要更新
一、GPT-5.6 Sol Ultra:并行测试时计算与数学证明
Noam Brown 宣布 GPT-5.6 Sol Ultra 用 64 个子代理在不到一小时内,证明了 50 年历史的 Cycle Double Cover 猜想。核心创新在于"并行测试时计算"——将原本可能需要一整天的串行推理任务拆分为并行子任务,大幅压缩延迟。这与之前 Erdős 单位距离问题的区别在于:这次使用的是今日公开可用的模型,而非内部研究版本。
Noam 补充说明:CDC 猜想的证明已有 Lean 形式化版本,由 GPT-5.6 Sol 自主生成并开源。这是从"模型输出文本证明"到"机器可验证形式化证明"的关键一步。
Greg Brockman 转发 OpenAI 官方声明:GPT-5.6 系列在健康智能领域取得重大进步。Luna 模型以 GPT-5.5 最高推理设置同等级别性能、成本仅为其 1/25。
二、ChatGPT Work/Codex 发布与社区回应
GDB 展示了 Sol 在复杂推理和数据分析中的商业应用:分析数百页借贷交易文件,自动对账跨协议条款、财务报表、尽职调查、抵押品和风险材料,标记问题并生成带引用来源的报告保存至 Box。
Simon 尖锐批评"AI 员工"概念:"既是对人类的不尊重,也是对这些工具能力的完全误解。你还不如把 Excel 电子表格加到组织架构图里。"
Simon 实测发现:ChatGPT 移动端"Chat"模式无法用 yt-dlp 提取 YouTube 字幕,但"Work"模式可以——因为 Work 模式允许代码访问互联网。随后 OpenAI 内部人士澄清这只是 UI 差异而非能力差异。Simon 进一步追问:如果我是会用 Git 的软件工程师,Codex 是否就是 Work 的严格超集?
三、代理评估:失败分类法与 Harness 工程
ICML Workshop 最佳论文"Fantastic Adaptive Taxonomies and How to Use Them":动态自适应失败分类法可在三个维度应用:1) 作为测试时扩展的 Best-of-N 评判器 2) 作为优化循环中的变异反馈机制 3) 作为编码代理的运行时反馈。在 Terminal Bench 2 上使用 Opus 4.6/Forgecode harness + 自适应分类法 + Best-of-N Judge 达到 89.9%,比固定分类法提升 15%。
Shreya 观察到一个令人担忧的趋势:开发者不断向 harness(系统提示、技能、工具)中追加内容,但从不在新模型发布时做减法。结果:6个月后成本上升,准确性影响不明确。更令人惊讶的是,这个趋势也出现在前沿 LLM 提供商自身的产品中。
Hamel 的核心论点:你需要看数据。如果一个工具能自动发现并修复所有问题,那你的竞争对手也能做到——差异化就消失了。Hamel 同时 RT 了 GPT-5.6 Sol 意外删除用户文件的案例,提醒开发者使用 ChatGPT Hooks 防止模型误操作。
四、开源 AI 治理:监管十字路口
Andrew Ng 引用 Adam Thierer 的"无许可创新"理念,转发了 Thierer 关于美国 AI 治理的关键警告:一个非正式的、不透明的 AI 模型审查制度正在形成。大模型开发商"自愿"配合国安官员的审查要求——但拒绝配合的后果包括模型被下架或失去政府合同。如果这种"限制直到批准"的制度扩展到开源模型,将重演 1990 年代 Clipper Chip 式的计算自由之战。
Nathan 阅读了 AI 2040 报告后评论:很高兴看到报告关注透明度,但在一份如此强调透明度的文件中却不讨论开源,这很奇怪。
Clem 转发 TechCrunch 对他的专访:"Hugging Face CEO 谈为什么企业不再租用 AI"。核心观点:企业正在从 API 租用模式转向自建/自部署模型,开源 AI 模型需要尽快成为默认选择。
五、Thinking Machines Lab:分布式 AI 世界观
Mira Murati 发布 Thinking Machines Lab 的世界观声明:"人类价值观不能求平均。地方知识无法被集中化。好的未来拥有许多 AI——在不同的地方成长,由服务的人群塑造,像我们一样彼此不同意。" 成立一年来,TML 预览了协作式交互模型,推出了让任何人训练自有开放权重模型的 Tinker 平台,发表了 Connectionism 研究,并完成了由 a16z 领投、NVIDIA/Accel/ServiceNow/CISCO/AMD/Jane Street 参与的 $2B 融资。
六、生态与工具更新
LangChain 发布 OpenWiki Brains:面向代理的通用 Wiki 记忆系统。允许代理在文件系统中维护可超链接的结构化知识库。同时 OpenWiki v0.1.1 新增 ChatGPT 账号登录,用户可用已有的 ChatGPT Plus/Pro/Team Codex 额度直接使用。Harrison Chase 组织了 LLM Wiki 网络研讨会,核心洞察:"Wiki 即缓存"(常用信息保持热更新)和"Wiki 即超链接页面集合"(随着文件增长,链接比目录结构更重要)。
Google Gemini Trusted Testers 计划更新:首批测试者已入驻,Challenge #1 是测试 macOS 应用中即将发布的未公开功能。Josh 同时分享了 Gemini 用户反馈 Top 10,Workspace 集成可靠性排名第一。
Google AI Studio 推出 Pretty URLs 功能:每个部署的应用可获得 your-own-url.ai.studio 域名,免费。加上此前的"从 GitHub 导入"功能,AI Studio 正从实验工具演变为完整的应用部署平台。Logan 感叹"我们已经进入超级应用时代"。
Hugging Face 近一周更新密集:PyTorch Attention 性能分析(Part 3,关注注意力层性能调优);NVIDIA 合作:Data for Agents(代理用开放数据集);Native-speed vLLM transformers backend(vLLM 原生速度推理后端);SkyPilot 零出口费用存储(在任意云上运行工作负载,数据存储在 HF 无出口费);LeRobot v0.6.0(机器人学习框架新版本);Microsoft Foundry Managed Compute(HF 模型在 Foundry 上的一键部署);Amazon SageMaker Studio 一键集成。
Chollet:"代理编码在过去 6 个月的进展令人难以置信。现在是完全不同的世界了。" 他同时注意到一个有趣的社会现象:人类开始自然而然地用 LLM 的风格写作了——这让人与"机器"的区分变得更加困难。
👥 人物/机构动态
"到目前为止,我相当确定 AI 是净创造就业的。这不是我原先的预期——虽然我比其他人乐观,但我本以为到这个能力水平我们会看到一些影响。这个趋势可能继续!"
"能够感受进步的质感是一种特权,我们将继续推进。" Logan 这条有感而发的推文发布于 Sol Ultra 和 ChatGPT Work 发布后不久,反映了 OpenAI/Google 前沿团队的心态。
Harrison 回应 Aditya Agarwal 的"AI 全栈梦想"推文(云端代理+任意模型+任意 harness+全追踪+递归改进),直接列出 LangSmith 的对应能力矩阵。这是一种越来越自信的平台定位。
🔬 值得跟进的项目与方向
1. OpenAI CDC-Lean 形式化证明仓库
GitHub: github.com/openai/cdc-lean — GPT-5.6 Sol 自主生成的 Lean 形式化数学证明,是 AI 数学推理能力的前沿展示。
行动:Fork 并研究证明结构,评估 Sol 在形式化推理领域的泛化能力。
2. FrontierFinance 金融代理评测
Jeff Dean 转发的 FrontierFinance 是迄今最大、最难的金融代理评测,覆盖投资全流程(筛选、公司研究、行业/宏观、财报与事件、覆盖与催化剂监控),220 个案例配 11,543 个专家制定的评分标准。
行动:获取数据集,评估其对 A 股/中概股投资研究场景的适用性;关注 Samaya AI 系统(SOTA 50.8%,推理成本仅为 Fable 5 的 1/4)。
3. Thinking Machines Lab 产品发布
$2B 融资、a16z/NVIDIA/AMD/CISCO 支持、"开放权重模型+协作式交互"产品方向。预计未来数月内发布首款产品。
行动:加入 TML 的 waitlist/邮件列表;关注其开源组件对国内开发者的可访问性。
4. 自适应失败分类法(ICML Workshop Best Paper)
动态生成代理失败分类法,在 Terminal Bench 2 上比固定分类法提升 15%。方法论可推广。
行动:获取论文和代码;思考在投资研究代理评估中的应用——自动发现代理在财报解读、行业分析中的失败模式。
⚠️ 待验证信息
- GPT-5.6 Sol 意外删除文件:Hamel 转发的 Matt Shumer 案例——Sol 因未配置 Hooks 而删除用户全部文件。需验证是否为孤立事件还是系统性问题。建议所有使用 Sol 的用户配置 ChatGPT Hooks。
- ChatGPT Work vs Codex 能力差异:OpenAI 内部人士称 Chat/Work/Codex 共享底层能力、仅 UI 差异,但 Simon 的实测显示 Chat 模式下代码无法访问互联网。能力边界需要更透明的文档。
- Fable 5 扩展访问至 7月12日:Anthropic 将 Fable 5 付费用户访问权限延长至 7月12日(即今天),之后状态未明确。关注今天 Anthropic 是否会发布后续公告。
- Adam Thierer 暗示的"即将到来的开源 AI 行政令":Thierer 在推文中提到有传闻称美国政府可能很快出台针对开源模型的监管措施。需密切监测。
🗂️ 低优先级 / 噪音
Thomas Wolf 吐槽"load-bearing"这个词用得太烂了,以及对轻量级推理微调的兴趣——值得注意但非关键。
Amanda Askell 本周无 AI 相关内容,话题集中在纽约建筑倒塌和医生概率沟通。
Kevin Weil 加入 Stoke Space 董事会(火箭创业公司),虽然与 AI 无关但反映了 OpenAI 高管的"太空情结"——Planet → Stoke Space。
Demis Hassabis 本周活跃度低,主要是转发足球世界杯和 Gemini 用户反馈内容。
swyx / AIEWF:大量 AI Engineer World's Fair 会议内容,但信号较分散。Geoffrey Litt 的 Design Eng 主题演讲("理解代码仍然重要")值得后续关注。
Karpathy:本周无原创内容,仅转发 Bun 从 Zig 迁移到 Rust 的消息和 Fable 5 3D 演示。
Eugene Yan:最新更新仍为 7月1日 AIEWF 活动,本周无新内容。
Chip Huyen:博客最近更新为"Common pitfalls when building generative AI applications"(常见陷阱),无时间戳但值得一读。
explainx.ai:sitemap 最近更新 7月2日,无新文章。
AI 播客索引:数据更新至 7月2日,无新增播客条目。
🔗 原始链接索引
- Noam Brown: Sol Ultra 并行 TTC + CDC 证明
- Noam Brown: Lean 形式化证明
- GitHub: openai/cdc-lean
- Sam Altman: AI 净创造就业
- Greg Brockman: GPT-5.6 健康智能
- Greg Brockman: Sol 借贷交易分析
- Simon Willison: AI 员工批判
- Simon Willison: Chat vs Work 实测
- Simon Willison: Chat/Work 能力确认
- Simon Willison: Codex vs Work
- Simon Willison: Quoting Nilay Patel (AR隐私)
- Simon Willison: Quoting OpenAI (ChatGPT Work 澄清)
- Shreya Shankar: 自适应失败分类法
- Hamel Husain: 数据护城河
- Hamel RT: ChatGPT Hooks 提醒
- Andrew Ng: 无许可创新 + 开源 AI 治理
- Nathan Lambert: AI 2040 开源盲区
- Clem Delangue: TechCrunch 专访
- Thinking Machines: The Future Worth Building Is Human
- Mira Murati: TML 世界观声明
- Harrison Chase: LangSmith 全栈
- Josh Woodward: Gemini Trusted Testers
- Logan Kilpatrick: AI Studio Pretty URLs
- Logan Kilpatrick: 进步质感
- François Chollet: 代理编码进展
- HF: PyTorch Attention 性能分析
- HF: Data for Agents
- HF: Native-speed vLLM backend
- HF: SkyPilot 零出口存储
- Alex Albert: More Fable (限流重置)
- LangChain Blog: OpenWiki Brains + 多项更新