总览
今天不是新发布日,而是落地核验日
OpenAI GPT-5.6 页面已从 preview 进入可用性、定价、Codex/ChatGPT Work/API 能力说明阶段。对日报跟踪而言,重点从“有没有发布”转为“哪些入口可用、成本结构如何、agent runtime 怎样变”。
Agent 竞争继续收敛到三件事
能力、可靠性、成本。GPT-5.6 强调 Programmatic Tool Calling 与 multi-agent;Claude Opus 5 强调长任务 agentic coding;LangChain 则从 prompt caching 和 evals 两侧解释如何把 agent 跑得更便宜、更可测。
GitHub Copilot 是模型入口争夺的温度计
GitHub Changelog 最新 Copilot 区块里,Opus 5、Linear cloud agent、MCP spec、Issues automation、usage metrics、AI credits 连在一起。开发者入口正在把模型能力、企业治理和工单系统整合成一条产品线。
Prompt injection 仍是安全主线
OpenAI GPT-Red、Anthropic Opus 5 系统卡线索,以及 GitHub CodeQL 的 prompt injection detection 方向共同说明:长任务 agent 能力越强,越需要把红队、权限、上下文隔离和评测做进工程流程。
开放模型与 physical AI 没有新 24 小时大事件
Interconnects 最新强相关项仍是 Kimi K3/open-model recap;Hugging Face 强相关项仍是 NVIDIA Cosmos 3 Edge。今天保留为背景和待跟进,不重复包装旧新闻。
X 抓取仍是覆盖缺口
公开 X 页面和镜像源可用性不稳定。Sam Altman、Harrison Chase 等账号的公开搜索 snippet 可作发现线索,但不适合作为完整事实来源;本期重点内容均落到可打开链接。
核心主题
一、GPT-5.6 落地:模型分层、Programmatic Tool Calling 与 multi-agent 进入产品说明
OpenAI 的 GPT-5.6 页面给出了正式可用性:GPT-5.6 覆盖 ChatGPT、Codex 和 OpenAI API,并分为 Sol、Terra、Luna 三个能力/成本层级。Codex 和 ChatGPT Work 里,Free/Go 用户进入 Terra,Plus 及以上可选 Sol/Terra/Luna;API 侧同时强调 Programmatic Tool Calling 与 multi-agent beta。
最关键的不是单个 benchmark,而是运行时形态。Programmatic Tool Calling 允许模型在内存里写小程序来协调工具和处理中间结果;multi-agent 允许并发子代理并汇总结果。这两项如果稳定,会直接改变 agent 的成本、延迟、上下文污染和可控性。
二、GPT-5.6 Preview 里的安全信号:强 cyber 能力必须和分层发布绑定
GPT-5.6 Sol preview 页面把 coding、biology、cybersecurity 和 safeguards 放在一起讲:Sol 是旗舰模型,Terra 面向日常工作,Luna 面向速度和成本;preview 阶段先给小范围可信伙伴,同时说明将与政府框架和更广可用性衔接。
安全部分强调分层 safeguards、红队压力测试、账号级信号和持续监控。官方说法是,GPT-5.6 Sol 更擅长帮助防御者发现和修复漏洞,而不是可靠完成端到端攻击;这仍需要结合 system card 与实际策略测试核验。
三、Claude Opus 5 余波:长任务 agentic coding 是 Anthropic 的主定位
Anthropic Newsroom 最新强相关官方项仍是 7 月 24 日 Opus 5。页面把 Opus 5 定位为面向长时间、多步骤工作的 agentic coding model,并强调它能更好理解代码库、保持复杂任务上下文、澄清需求、完成 feature development 和 bug fixing。
今天没有看到比 Opus 5 更新的官方 Claude 发布。值得注意的是,发布页里多个客户/伙伴案例把 Opus 5 放在 Kiro、监控 agent、自主内存管理、生产异常复核等场景里,说明 Anthropic 不是单押 chat,而是在持续强调“能在真实系统里跑很久”。
四、GitHub Copilot:Opus 5、Linear、MCP、Issues automation 连成企业 agent 路线
GitHub Changelog 的最新 Copilot 更新集中在 7 月 24 日到 7 月 20 日:Claude Opus 5 进入 GitHub Copilot;Copilot cloud agent for Linear GA;GitHub MCP Server 支持下一版 MCP spec;GitHub Issues agent automation controls 进入 public preview;usage metrics impact dashboard 和 AI credit pools 也在同一组更新里。
这条组合比单个模型接入更重要。GitHub 正在把 coding agent 从 IDE 补全扩展为“模型选择 + issue/Linear 工单 + MCP 工具上下文 + 企业用量与预算管理”的工作系统。
五、LangChain Deep Agents:prompt caching 从模型特性变成 harness 能力
LangChain 的 Deep Agents prompt caching 文章把成本问题讲得很直接:长对话 agent 每一步都要重读 system prompt、工具描述、技能、历史消息和新输入,token 成本随轨迹增长很快。Deep Agents 的做法是根据不同模型供应商能力,尽量设置 cache breakpoint、利用 implicit caching,并组织 prompt 结构以提高 cache read。
文章给出的实测结论是,在 Deep Agents eval suite 上,prompt caching 对中端模型轨迹带来约 49% 到 80% 的 token cost 降幅。这个数字未必能直接迁移到所有业务,但方向很明确:长任务 agent 的成本治理必须进入 harness 层,而不是事后靠提示词节省。
六、OpenEvals / AgentEvals:评测正在从“输出对不对”走向“轨迹是否合理”
LangChain 的 OpenEvals 文章把 eval 分成 LLM-as-judge、结构化数据评测和 agent trajectory 评测。对 agent 来说,最终答案只是结果;工具选择、工具调用顺序、LangGraph 节点轨迹、结构化输出格式,都会影响系统能否稳定上线。
这对 AI engineering / evals 主线很重要:Shreya、Hamel、LangChain 等长期讨论的问题,正在从“写几个测试”变成“为 agent 行为建立可维护、可解释、可观测的评测层”。
七、开放模型与 physical AI:Kimi K3 / Cosmos 3 Edge 保持观察位
Interconnects 最新强相关公开项仍是 7 月 22 日的 open-model recap,讨论 Kimi K3、Qwen、GLM、中美模型竞争和开闭源差距。Hugging Face 强相关项仍是 NVIDIA Cosmos 3 Edge,聚焦 physical AI/world model 在边缘侧的部署约束。
今天不把这些旧内容包装成 24 小时新闻,但它们仍是中长期跟踪主线:开放模型要追的不只是聊天或 coding benchmark,还包括 agent 工具使用、post-training、部署许可、推理成本和机器人/世界模型场景。
重要更新
- OpenAI:GPT-5.6 页面明确 ChatGPT、Codex、API 可用性,Sol/Terra/Luna 分层,API 侧加入 Programmatic Tool Calling 和 multi-agent beta。
- OpenAI Safety:GPT-5.6 Sol preview 强调 cyber 能力、分层 safeguards、红队压力测试和 phased release,适合与 Anthropic Opus 5 system card 对照。
- Anthropic:Opus 5 仍是 Newsroom 最新强相关发布,定位长任务 agentic coding 与生产系统里的自主 agent。
- GitHub:Copilot 最新更新把 Opus 5、Linear cloud agent、MCP spec、Issues automation、usage metrics 和 AI credits 串成企业治理路径。
- LangChain:Deep Agents prompt caching 把 agent 成本治理做进 harness;OpenEvals/AgentEvals 把评测从输出扩展到结构化数据和工具轨迹。
人物 / 机构动态
- Sam Altman / OpenAI 线:公开 X snippet 显示其仍在回应 GPT-5.6 与文件删除/全权限模式等运行边界问题;因 X 页面不可稳定打开,本期只作为线索,事实部分以 OpenAI 官方页为准。
- Alex Albert / Anthropic 线:Opus 5 讨论仍在扩散,但本窗口未发现比 Anthropic 官方页更新的一手材料;继续关注 Claude Code、Kiro、Copilot 接入后的真实反馈。
- Harrison Chase / LangChain:Deep Agents 的 prompt caching 与 OpenEvals 文章说明 LangChain 正把 agent harness 的成本和评测做成开发者基础设施。
- Nathan Lambert / Open Models:Interconnects 最新 open-model recap 仍是判断 Kimi K3/Qwen/GLM 竞争态势的重要背景,今天无新增 24 小时强信号。
- NVIDIA / Hugging Face:Cosmos 3 Edge 继续作为 physical AI/world model 的开源观察点,短期重点应放在可复现实测而不是发布话术。
值得跟进项目
- 日报 pipeline harness 化:把 Follow List 解析、来源抓取、日期过滤、去重、摘要、Hugo 发布、状态写入、Feishu 通知拆成可测试步骤。
- Agent 安全对照表:整理 GPT-5.6、GPT-Red、Claude Opus 5、CodeQL prompt injection detection 的共同测试维度。
- 成本基线:记录日报和代码 agent 的上下文长度、重复静态 prompt、工具回合数、缓存可能命中位置,为 prompt caching/Programmatic Tool Calling 改造做依据。
- Copilot 企业启用清单:关注模型 policy、AI credit pool、usage metrics、Linear/Issues automation、MCP server 和审批规则。
- 开放模型观察:继续追 Kimi K3 权重/许可证/社区复现,以及 Cosmos 3 Edge 在 Jetson/RTX 上的真实推理表现。
待验证信息
- GPT-5.6 的实际可用性、价格、Programmatic Tool Calling 和 multi-agent beta 可能受账户、地区、计划和 API 权限影响;开发前必须回到控制台和官方文档核验。
- GPT-5.6 preview 的 cyber/safety 说法需要结合 system card、Preparedness Framework 和可复现实验,不能只按发布页外推。
- Opus 5 在 Copilot/Kiro/Claude Code 里的真实表现,需要用同一任务集、同一权限边界和同一测试标准比较。
- LangChain prompt caching 的 49% 到 80% 成本下降来自其 Deep Agents eval suite,迁移到其他 harness 前要做本地基线。
- X/Twitter 搜索 snippet 只可作为发现线索,不可替代可打开原文;本期未使用私密登录态、cookie 或反爬规避。
低优先级噪音
- 大量 Opus 5/GPT-5.6 二手转述没有新增一手信息,本期不收录。
- Google AI RSS/公开搜索本窗口未发现与 Gemini agent 主线强相关的新增官方发布,今日不展开。
- Hugging Face 社区榜单和泛 AI 趋势文很多,但与 Follow List 的 agent/evals/open models 主线相关度较低。
- X 热门讨论里关于模型“聪明/翻车”的短贴缺少可核验上下文,不纳入重点事实。
原始链接
- OpenAI · GPT-5.6
- OpenAI · Previewing GPT-5.6 Sol
- OpenAI · GPT-Red
- Anthropic Newsroom
- Anthropic · Introducing Claude Opus 5
- GitHub Changelog
- GitHub Changelog · Copilot
- LangChain · Prompt Caching with Deep Agents
- LangChain · Evaluating Large Language Models With OpenEvals
- Interconnects · Open models recap
- Hugging Face / NVIDIA · Introducing Cosmos 3 Edge