总览
Claude Opus 5 成为今日主线
Anthropic 发布 Opus 5,定位为面向长时程 agent、编码、专业工作和可视化产出的 Opus 层升级。官方称其接近 Claude Fable 5 的 frontier intelligence,价格约为 Fable 5 的一半。
GitHub Copilot 当天接入 Opus 5
GitHub 在 Copilot 中开放 Claude Opus 5,覆盖 VS Code、CLI、cloud agent、github.com、Mobile、JetBrains 等入口。模型发布和开发者入口正在更紧密地同步。
LangChain 把 Deep Agents 评测摆到台前
LangChain 发布 Deep Agents benchmark 文章、月度 newsletter 与 eval engineering skill,重点从“如何调用模型”转向如何用 repo context、traces、Harbor task 和沙箱持续改进 agent。
Simon 继续承担快速实测与安全解释层
Simon Willison 第一时间记录 Opus 5,并把它与 Fable 5、Opus 4.8、cyber safeguard、prompting guide 和实际生成效果放在一起看。
开放模型线索今天不是新增主线
Interconnects 和 Hugging Face RSS 本窗口无新的 24 小时高优先级 open-model 长文;Kimi K3、GLM、Nemotron、HF 安全事件仍作为背景保留。
X 覆盖继续不足
Nitter/RSSHub 类公开镜像对高优先级 X 账号本轮返回空内容。日报不把不可核验 X 贴文写成事实,只在待验证里记录缺口。
核心主题
一、Claude Opus 5:长时程 agent 竞争继续上探,但安全边界被明确写入发布叙事
Anthropic 发布 Claude Opus 5,称其是 Opus tier 的 step change improvement,面向 long-running agents、coding 和 professional work。官方将它描述为更 thoughtful/proactive 的模型,接近 Claude Fable 5 的 frontier intelligence,同时价格约为 Fable 5 的一半;与 Opus 4.8 同价,并继续提供更高成本的 fast mode。
官方强调 Opus 5 在软件工程、计算机使用、科研、金融、法律、视觉输出和更长任务中的稳定性提升,尤其是能更认真地验证自己的工作、迭代到成功。安全部分同样重要:Anthropic 表示 Opus 5 在发现漏洞方面更强,但没有针对 exploitation 训练,仍落后于 Mythos 5 的漏洞武器化能力。
二、GitHub Copilot 接入 Claude Opus 5:模型能力被直接推到编码工作入口
GitHub 宣布 Claude Opus 5 已进入 GitHub Copilot,面向复杂、长时程编码任务,强调 careful reasoning、tool use 和多步骤可靠执行。GitHub 早测里提到 Opus 5 在 agentic coding workflows 上表现强,包括自主代码更改、回归验证、多工具协调、定向修改和减少复杂任务中的不必要执行开销。
可用入口覆盖 VS Code、Visual Studio、Copilot CLI、GitHub Copilot cloud agent、GitHub Copilot app、github.com、GitHub Mobile、JetBrains、Xcode、Eclipse 等。Copilot Pro+、Max、Business、Enterprise 用户可用,企业和 Business 管理员需要在 Copilot settings 中启用 Claude Opus 5 policy。
三、Simon Willison 快速记录 Opus 5:实测入口、价格和安全边界比发布口号更重要
Simon Willison 当天记录 Claude Opus 5,引用 Anthropic 的定位并指出外部 buzz 偏正面,Artificial Analysis leaderboard 上 Opus 5 暂时领先,甚至排在 Fable 5 前面。他还注意到 Opus 5 价格与 Opus 4.8 相同,fast mode 仍是基础模型的两倍成本。
Simon 特别抓住两个点:一是 Opus 5 看起来继承了 Fable 式的 proactive 行为,例如官方案例里模型在没有直接查看图片的条件下自己写视觉 pipeline 提取几何信息;二是 cyber 能力边界,Opus 5 更会发现漏洞,但 Anthropic 声称没有训练它去利用漏洞。
四、LangChain Deep Agents Benchmark:agent 质量进入“运行数据 + eval 工程”阶段
LangChain 发布“How We Benchmark Deep Agents”,描述他们如何在 Harbor 里重新组织 Deep Agents 的评测,覆盖 coding、conversation、retrieval 等场景,并把结果用于实际发版决策。重点不只是跑 benchmark,而是用评测解释 agent 在复杂任务中的失败模式。
这条和过去几周的 IssueBench、trace judge、LangSmith coding-agent traces、agent sandbox 文章连起来看,LangChain 正把 agent 平台的竞争点从 framework API 扩展到可观测性、沙箱环境、trace mining、评测构造和部署治理。
五、LangChain Eval Engineering Skill:eval 从专家手工活变成可访谈、可生成、可运行的 agent workflow
LangChain 的 Eval Engineering Skill 会读取 agent repo 和 traces,通过访谈收集用户意图,提出 eval,并输出可运行的 Harbor tasks。发布时间略早于本窗口,但昨天日报没有展开,今天与 Deep Agents benchmark 一起形成完整主线。
这说明 eval engineering 正在从“少数工程师写脚本”变成 agent-assisted workflow:先读取代码和真实轨迹,再把失败样例、评测标准、任务环境和用户判断组织成可执行测试。
六、LangChain July Newsletter:agent 生态把沙箱、Slack、OpenWiki、RLM 和 voice tracing 串起来
LangChain 7 月 newsletter 汇总 NemoClaw Deep Agents blueprint、LangSmith Sandboxes free trial、Fleet Slack integration、voice tracing、OpenWiki Brains、Deep Agents 中的 RLMs 等更新。单看像产品月报,连起来看则是 agent 生产栈:安全执行环境、协作入口、记忆层、递归/子代理、语音交互和可观测性。
这和 Follow List 关注的“agent 进入真实工作流”一致。未来的竞争不是谁有一个 agent demo,而是谁能把 agent 放进 Slack、Linear、GitHub、企业知识库和受控沙箱里,并持续知道它做得对不对。
七、ExplainX sitemap 新增 agent/security/算力聚合线索:可作发现源,不作事实锚点
explainx.ai 的 blog sitemap 在 2026-07-24 出现多条与 Follow List 主线相关的新条目,包括 Claude voice/mode/tools、Claude/SharedRoot sandbox escape、ChatGPT AgentForger workspace agents、Block Buzz/Nostr agent workspace、Hugging Face The Stack v3、AMD/Anthropic 2GW MI450 等。
这些条目像是新闻聚合和 SEO 型解释文章,适合作为发现源,不适合作为事实锚点。正文未采用其中具体说法,避免把二手聚合当成一手发布;但它暴露了市场正在集中追逐的关键词:agent workspace、sandbox escape、Claude tools、AI infra capex、open data stack。
重要更新
- Anthropic:Claude Opus 5 发布,定位长时程 agent、编码、专业任务和可视化输出;官方将其放在接近 Fable 5、但成本更低的位置。
- GitHub:Claude Opus 5 进入 Copilot 多入口,包含 Copilot cloud agent 和移动端,企业管理员需启用模型 policy。
- Simon Willison:快速记录 Opus 5 的价格、leaderboard、prompting guide、proactive 行为和 cyber 安全边界,是本窗口最有价值的个人解读。
- LangChain:Deep Agents benchmark 与 July newsletter 同日发布,凸显 agent 平台正围绕 eval、沙箱、记忆、Slack/协作入口和 trace 可观测性竞争。
- ExplainX:sitemap 出现多条 agent workspace、sandbox、Claude tools、AI infra 关键词聚合,可作为线索池但需二次验证。
人物 / 机构动态
- Anthropic / Alex Albert 线:官方发布 Opus 5,开发者生态几乎同步响应;Follow List 中 Anthropic 产品/Claude 方向今天权重最高。
- GitHub Copilot:继 Linear GA、Mobile CI、Issues automation、MCP stateless 后,Copilot 又接入 Opus 5,说明 coding agent 的入口和模型层在同时加速。
- Harrison Chase / LangChain 线:Deep Agents、LangSmith、Harbor、OpenWiki、Fleet、Sandboxes 的组合越来越清晰,核心是企业 agent 运行栈。
- Simon Willison:继续提供高价值实测和安全解释,是本日报里最可靠的个人来源之一。
- Nathan Lambert / Interconnects:RSS 本窗口无 24 小时新增长文;Kimi K3、Qwen、GLM、开放模型政策和 RLHF book 继续作为背景跟踪。
值得跟进项目
- Opus 5 实测矩阵:coding、前端、调试、长文档、数据分析、工具调用、拒答与安全边界,和 Fable 5/GPT-5.6 Sol/Kimi K3 对照。
- Copilot 模型策略:记录 Opus 5 在 Copilot CLI、cloud agent、Mobile CI 中的可用性、计费、policy 和 rollout 差异。
- Agent eval pipeline:参考 LangChain,把真实 trace 转成可复跑测试,不再只靠主观体感评价 agent 质量。
- Sandbox threat model:结合 OpenAI/HF 事件、LangChain sandboxes、ExplainX 的 sandbox escape 线索,整理 agent 运行环境的最低安全要求。
- OpenClaw 产品映射:把入口、工具、记忆、审批、发布、可观测、eval 七层画成一张产品架构表,寻找可复用 skill/workflow。
待验证信息
- Opus 5 在不同产品中的真实可用性仍取决于 rollout、地区、账户等级和管理员 policy;本日报只确认 Anthropic/GitHub 公开发布。
- GitHub Copilot 中 Opus 5 的使用成本按 provider API list price/usage-based billing 计,实际团队账单影响需要看 Copilot 账户和模型定价页。
- Anthropic RSS 路径本轮返回 404/Next.js not found;使用官方新闻页面和 Simon 链接交叉确认。
- X/Nitter/RSSHub 抽样账号本轮返回空内容,不能宣称 Follow List 高优先级 X 账号“无更新”。
- ExplainX sitemap 新条目只作为发现线索;涉及 CVE、投资金额、算力合作、模型能力等内容必须回到一手来源验证。
低优先级噪音
- Google AI RSS 本窗口无 24 小时内新增 AI 主线,最新为 2026-07-22 Galaxy Unpacked 相关产品更新,今日不展开。
- Hugging Face RSS 最新项为 2026-07-23 Nunchaku/Diffusers,偏推理优化和图像模型生态,本日报只保留在背景源里。
- Interconnects 最新长文为 2026-07-22 开放模型 recap,价值高但已超出本窗口,今天不重复长篇展开。
- 大量 Claude Opus 5 二手转述和 leaderboard 截图缺少可复核上下文,未纳入重点。
原始链接
- Anthropic · Introducing Claude Opus 5
- GitHub · Claude Opus 5 is now available in GitHub Copilot
- Simon Willison · Introducing Claude Opus 5
- LangChain · How We Benchmark Deep Agents
- LangChain · Eval Engineering Skill
- LangChain · July 2026 Newsletter
- explainx.ai · Blog sitemap
- Hugging Face Blog RSS
- Interconnects AI RSS
- Google AI RSS