总览
OpenAI 把 Agent 叙事推向 ROI
OpenAI 新增 “agentic era” 投资管理文章和 ChatGPT Work 行业用例,重点从模型能力转向 useful work per dollar、团队流程和可扩展工作流。
Codex 进入可视化资产生成链路
Simon Willison 逆向并公开 Codex pet 的 sprite 生成过程,展示 GPT-5.6 Sol + gpt-image-2 如何把提示、参考图、动画帧和 QA 产物串成可检查仓库。
Coding agent 需要统一追踪层
LangChain/LangSmith 发布 coding-agent traces,覆盖 Claude Code、Codex、Cursor、Copilot、Pi、OpenCode 等,把多工具会话、成本、错误和重试统一进观测面。
自动 eval 不能替代产品判断
Hamel/Shreya 继续把注意力放在真实生产 trace、AI 写作质量和人类 taste 上:自动 eval 有价值,但需要迭代、人类反馈和领域判断。
Sol 增长压力成为策略信号
Sam Altman 转发 8M active users 说法并称 5.6 Sol 增长“insane”,提示新一代 agent 产品的瓶颈正在转向推理容量、限额和使用体验。
Google AI Studio 在补组织能力
Logan Kilpatrick 招聘 AI Studio TPM lead,并提出 ACE 是 IDE 的自然后继,说明 Google 仍在强化开发者产品和 agentic coding 入口。
核心主题
一、从模型发布转向“单位成本有效工作”
OpenAI 发布 “How to manage AI investments in the agentic era”,把企业 AI 投资的核心指标从单纯部署模型,转向 measuring useful work per dollar、效率提升和高价值工作流规模化。这个表述很值得注意:它把 agent 从“新工具采购”放进 CFO/业务负责人能理解的投入产出框架。结合 ChatGPT Work 的发布节奏,OpenAI 正在把 Codex/Work/Sol 从技术热度导向企业预算语言。
OpenAI Academy 连发两篇 ChatGPT Work 行业用例:数据科学团队可把真实工作输入变成 root-cause briefs、impact readouts、KPI memos、scoped analyses 和 dashboard specs;销售团队则对应 pipeline briefs、meeting prep、forecast reviews、account plans 和 stalled-deal diagnoses。这不是 coding agent 的典型叙事,而是把 Work 产品包装成跨职能知识工作台。
二、Codex 从写代码扩展到生成可审计视觉资产
Simon 记录自己在 Codex Desktop 里触发自定义 pet,并让 GPT-5.6 Sol xhigh 通过多轮 gpt-image-2 生成角色参考图、动画帧、sprite sheet、GIF 预览和过程说明。他公开了 prompts、运行目录、生成图像和 QA 预览,使这个例子不是“看起来很酷”的视频,而是可追溯的资产生成流水线。重点不在吉祥物本身,而在 Codex skill 如何把图像模型调用、文件组织、动画切片和产物说明自动化。
Simon 分享了用 `uvx` 跑 GitHub Actions 时更 cache-friendly 的做法:通过 `UV_EXCLUDE_NEWER` 固定依赖解析时间点,并把日期纳入缓存 key,避免每次运行都从 PyPI 拉取新版本。它看似是小技巧,但和 Dependabot cooldown、agent 生成 PR 激增放在一起看,说明自动化越多,依赖漂移和供应链噪音越需要主动治理。
三、Agent 可观测与评估进入真实 trace 阶段
LangChain 发布 “How to Debug Coding Agents with LangSmith Traces”,目标是把 Claude Code、Codex、Cursor、Copilot、Pi、OpenCode 等 coding agent 的会话统一追踪。核心能力包括识别稳定 session key、查看完整 run tree、追踪 turns/model calls/tools/subagents、记录 token 与成本,以及查询错误和重试。Harrison Chase 在 X 上强调他们做了很多工作来标准化 coding agents 到 LangSmith 的 trace。
Hamel 与 Antaripa Saha 的文章比较了 human-annotated traces 和自动 eval 系统。Hamel 在窗口内总结:自动 eval 能发现一些人类漏掉的问题,也能融入 trace 浏览和 LLM judge 创建流程;但它们常错过需要领域经验和 taste 的问题,缺乏从人类反馈学习的好机制,而且有些结果可以用 coding agent + 人在环里得到。结论不是不用,而是必须迭代、带人类反馈地用。
四、能力过剩、增长压力与新入口争夺
Sam Altman 称 5.6 Sol 增长“insane”,推理团队正在支撑需求,但短期可能出现 hiccups;随后转发 Tibo 关于 Codex 和 ChatGPT Work 达到 8M active users、再次重置用量限制的说法。即便具体数字仍需以官方长期披露为准,社媒信号已经很清楚:Sol/Work 的竞争进入容量、限额、稳定性和用户探索边界阶段。
Logan Kilpatrick 为 Google AI Studio 招聘 TPM lead,职责横跨 product、GTM、engineering 等,以加速 AI Studio 进展。他前一日还提出 Agentic Coding Environment 是 IDE 的自然后继,并在窗口内强调 AI 时代每三个月都需要提高 ambition。与 Google AI RSS 中 7 月 7 日 Managed Agents 扩展相比,这些个人动态显示 Google 正在补产品组织和开发者入口。
五、AI 生成内容的质量债开始反噬
Shreya 认为 AI-assisted writing/communication 是当下最重要的问题之一,核心批评是 AI 写作会稀释个人或组织 brand、滥用修辞、制造过多术语,让读者更难判断什么重要。Hamel 则测试了 Distribution Fine Tuning 相关 demo,认为它对“de-sloppifying”社媒文本有明显帮助。这条线和 eval/tooling 一样重要:AI 系统不只要把任务做完,还要让输出具有真实信息密度和可读性。
人物 / 机构动态
- OpenAI:新增 agentic-era 投资管理和 ChatGPT Work 行业用例,明确走向企业 ROI 与部门模板。
- Simon Willison:继续提供高质量可复现样本:Codex pet 多模态资产链路、`uvx` CI 缓存、Dependabot cooldown 观察。
- LangChain / Harrison Chase:把 coding agent 可观测推向统一 trace 层,目标覆盖多家 agent 工具。
- Hamel Husain / Shreya Shankar:重点转向自动 eval 的边界和 AI 写作质量,强调人类 taste 与反馈闭环。
- Sam Altman:强调 Sol 增长和推理容量压力,提示前沿 agent 产品的规模化挑战。
- Logan Kilpatrick:招聘 AI Studio TPM lead,并持续推动 ACE/AI Studio 作为开发者入口叙事。
值得跟进项目
Agent ROI 模板:把 useful work per dollar 落到实际字段,避免只看 demo 和 token 花费。
Codex pet / imagegen skill:研究其 prompt、sprite、QA 目录结构,评估能否迁移到游戏素材、课程动效或产品 mascot。
LangSmith coding-agent traces:试接入一个 Codex/OpenClaw 类任务,比较 trace 粒度、成本记录和错误定位能力。
自动 eval 实验:用真实 trace 做小规模人类标注,再测试自动 eval 工具的漏报/误报。
ACE 能力矩阵:持续跟踪 ChatGPT Work/Codex、Claude Code、Google AI Studio、Cursor、LangChain/OpenSWE。
待验证信息
8M active users:来自 Sam 转发的公开 X 信息,需等待 OpenAI 官方长期口径或产品数据披露。
Sol 增长与容量:Sam 提到可能有 hiccups,但具体限额、峰值需求、推理成本和用户留存仍无公开细节。
自动 eval 效果:Parlance Labs 文章基于真实 trace 对比,值得读原文方法;不能直接外推到所有行业和任务。
LangSmith 多 agent 支持:博客声称覆盖多个 coding agent,但实际接入质量取决于各工具输出日志、API 和 session 标准化程度。
低优先级噪音
窗口内个人账号有不少短评、转发、招聘和轻量产品反馈;未能落到可验证链接、技术细节或明确后续行动的,没有展开。Google Images 25 周年属于 AI 搜索/视觉入口背景信息,但与本 Follow List 的 agent/工程主线关联较弱,作为低优先级处理。
原始链接
- OpenAI: How to manage AI investments in the agentic era
- OpenAI Academy: How data science teams use ChatGPT Work
- OpenAI Academy: How sales teams use ChatGPT Work
- Simon Willison: simonw/pedalican
- GitHub: simonw/pedalican-pet
- Simon Willison TIL: Using uvx in GitHub Actions in a cache-friendly way
- LangChain: How to Debug Coding Agents with LangSmith Traces
- Parlance Labs: Do Automated Evals Work?
- Sam Altman: 5.6 Sol growth
- Sam Altman: Codex and ChatGPT Work 8M active users repost
- Logan Kilpatrick: Google AI Studio TPM lead hiring
- Logan Kilpatrick: Agentic Coding Environment
- Shreya Shankar: AI assisted writing and communication
- Hamel Husain: DFT / de-sloppifying writing
- Google AI RSS
- Hugging Face Blog RSS