CoBuddy Pages Daily · Research · Deliverables

Daily

Follow 深度日报:Agent 工作流进入可观测、可操作、可问责阶段

Follow List 公开来源整理:OpenAI Codex 经济研究、Gemini 3.5 Flash computer use、LangSmith Fleet/SmithDB、Lilian Weng scaling laws、Simon Willison AI liability 与 agent 工程数据管理。

Follow 深度日报

Agent 工作流进入可观测、可操作、可问责阶段

基于 Obsidian Follow List active 账号与公开来源,覆盖 2026-06-25 00:00 UTC 至 2026-06-26 00:00 UTC。未使用 Folo CLI;未绕过 CAPTCHA 或做反爬规避。抓取优先级按 Follow List 中 Status=active、Priority=high、Cadence=daily/weekly/manual 排序,使用官方页面/RSS、个人博客/Atom、公开 X URL 与 Nitter 公开镜像交叉确认。

发布时间:2026-06-26 08:00 CST 窗口:上次运行以来 来源:Follow List.md、OpenAI、Google、LangChain、Simon Willison、Nitter 公开镜像
总览:今天的主线从“agent 能不能做事”转向“agent 在组织里如何持续、安全、可审计地做事”。OpenAI 用 Codex 内部和外部使用数据说明 agentic AI 正把知识工作的单位从一次问答改成可委派的长任务;Google 把 computer use 内建进 Gemini 3.5 Flash,让模型能够直接观察屏幕并执行点击/输入;LangChain 则继续补生产层,把 Fleet on-call copilot、agent computer use、voice trace debugging、Deep Agents rubrics 和 SmithDB 检索基础设施放到同一套 LangSmith 叙事里。人物动态上,Lilian Weng 重启长文解释 scaling laws,Simon Willison 抓住 AI liability 和 sandbox 开源信任问题,Shreya/Hamel 继续围绕 AI 写作和失败样本构建 harness。

核心主题

1. Agent 成为工作量单位

OpenAI 的 Codex 研究不是普通产品宣传,而是试图量化“人委派给 agent 的工作时长”。当大量任务超过 30 分钟、1 小时甚至 8 小时,人类的角色会从输入 prompt 转向拆任务、排队、验收和治理。

2. Computer use 正在进入主模型

Google 将 computer use 作为 Gemini 3.5 Flash 的内建工具,说明浏览器/桌面操作不再只是实验模型的展示能力,而是 agent 平台的基础接口。安全确认、敏感操作边界和观测日志会随之变得更重要。

3. 生产 Agent 需要观测和检索底座

LangSmith Fleet 的 on-call copilot、voice trace debugging、experiment status tracking,以及 SmithDB 的全文检索,指向同一个工程需求:agent 工作流只有被记录、搜索、复盘,才可能持续改进。

4. 问责和信任开始追上能力

Simon Willison 转述 AI liability 判例、批评 sandbox 产品闭源风险,Shreya 提到 AI coding agents 产生海量 trace/sandbox 文件。这些都在提醒:agent 时代的问题不只是更聪明,还包括责任、可解释、数据管理和供应商信任。

重要更新

OpenAI:Codex 经济研究把 agent 从聊天工具重新定义为可委派劳动

来源账号/机构:OpenAI、Greg Brockman;发布时间:2026-06-25;链接:OpenAI 官方文章 / Greg Brockman 公开镜像

OpenAI 发布《How agents are transforming work》,核心观点是 agentic AI 正把知识工作的基本单位从短交互改成可独立运行数分钟到数小时的长任务。文章给出 Codex 使用数据:到 2026 年 5 月,抽样个人用户中 80.6% 至少发起过一个估计超过 30 分钟人类工作量的 Codex 请求,70.2% 发起过超过 1 小时的请求,25.6% 发起过超过 8 小时的请求。

OpenAI 还称 Codex 已在公司内部从工程部门扩展到 Legal、Finance、Recruiting 等非技术部门,并成为许多部门的主要 AI 工具。Greg Brockman 当天转发时强调 agents 在 OpenAI 内部已经快速采用并加速工作,这与过去几天的 Jalapeno 推理芯片、Ona 持久云环境形成一条完整链路:更长任务、更低成本、更可控执行环境。

为什么值得看:这篇文章把 agent adoption 从 anecdote 推向经济测量。虽然 task horizon 由模型估算,不能当精确工时,但它足以说明企业部署 agent 时要设计任务队列、验收机制、权限边界和跨职能工作流,而不是只采购一个聊天入口。

后续行动:下载并阅读 OpenAI 论文原文;把“超过 30 分钟/1 小时/8 小时”的任务分层映射到 OpenClaw/Codex 工作流,定义哪些任务需要自动跑、哪些需要中途确认、哪些必须人工 review。

Google:Gemini 3.5 Flash 内建 computer use,浏览器/桌面操作进入主线 agent 能力

来源账号/机构:Google、Google AI Studio、Logan Kilpatrick;发布时间:2026-06-24,本轮窗口继续发酵;链接:Google 官方文章 / Google AI Studio X Article

Google 宣布 computer use 成为 Gemini 3.5 Flash 的内建工具,开发者可以让模型观察屏幕、规划操作,并执行点击与文本输入。官方定位很明确:Gemini 已有函数调用、Search grounding 和 Maps grounding,现在补上真实计算环境操作能力,面向软件测试、企业应用自动化和长程多步任务。

这条消息与 NotebookLM 连接 secure cloud computer、Antigravity agent 平台、Gemini app study notebooks 形成同一方向:Google 正在把 agent 从 API 工具调用推进到“可操作计算机”的产品层。公开报道还提到确认提示和敏感操作防护,这会成为 Google 与 Anthropic/OpenAI 在 computer use 上竞争时的安全卖点。

为什么值得看:computer use 会扩大 agent 能做的事,也会扩大出错面。谁能把屏幕状态、点击动作、凭证范围、确认弹窗和审计日志做成稳定平台,谁就更接近真正的企业 agent runtime。

后续行动:跟踪 Gemini API computer use 文档和 demo;与 Claude Computer Use、OpenAI Codex 云环境、OpenClaw browser-relay 做能力矩阵,重点比较状态可见性、人工确认、失败恢复和日志导出。

LangChain:Fleet On-Call Copilot 和 computer use 把 agent 部署推进到运维现场

来源账号/机构:LangChain、Harrison Chase;发布时间:2026-06-25;链接:LangChain June Newsletter / Harrison Chase 公开镜像

LangChain 发布 2026 年 6 月 newsletter,重点包括 LangSmith Fleet On-Call Copilot、Fleet 中的 computer use、voice trace debugging、experiment status tracking、Deep Agents Rubrics、programmatic subagents 和 LangSmith Deployment 课程。Harrison Chase 同日也放大 LangChain agents deployment cookbook,强调本地 demo 容易,真正难的是把 agent 嵌入真实应用。

On-Call Copilot 的定位尤其值得看:它读取代码、traces 和 runbooks 来 triage alerts,并为人工 review 草拟更新。这不是泛泛的“智能助手”,而是把 observability、知识库、事故响应和人类审批串起来的生产场景。

为什么值得看:LangChain 正在从框架公司转向 agent operations 公司。Fleet、trace、computer use、rubrics、subagents 和 deployment cookbook 组合起来,就是企业 agent 从开发到部署到复盘的完整栈。

后续行动:阅读 deployment cookbook;把 OpenClaw 定时任务和报告系统抽象成一个 LangSmith-like 观测清单:输入、工具、trace、失败原因、人工决策点、复盘字段。

LangChain SmithDB:全文检索成为 agent trace 和运行数据的底层能力

来源账号/机构:LangChain;发布时间:2026-06-25;链接:SmithDB inverted index 文章

LangChain 同日发布 SmithDB 全文检索技术文章,介绍如何构建、压缩并查询 object-storage backed inverted index,并在本地 SSD 与对象存储之间做查询路由。表面上这是数据库工程文章,实际对应 agent 平台的关键需求:大量 trace、run、prompt、输出和元数据必须能低成本搜索。

这与前一天的 agent memory 文章可以连起来读。Trace 只有能被检索、聚合、挖掘,才可能变成 memory、eval 或产品修复;否则它只是堆在对象存储里的日志。

为什么值得看:agent memory 和 eval 不是纯模型问题,背后需要稳定的数据系统。谁拥有可检索、可压缩、可审计的运行数据,谁就能做持续学习、失败归因和客户可见的治理报告。

后续行动:把 SmithDB 文章加入 agent observability 资料夹;评估 OpenClaw 本地 memory、cron logs、session history 是否需要一个轻量全文索引,支持跨日报复盘。

Lilian Weng:重写 scaling laws 长文,提醒算力分配仍是模型研发核心变量

来源账号/机构:Lilian Weng;发布时间:2026-06-25;链接:Lilian Weng 公开镜像 / Lil'Log

Lilian Weng 发帖称发布了一篇拖了三年以上的 scaling laws 长文,主题是如何在大规模训练前用 scaling laws 推理数据量和模型尺寸之间的最优算力分配。她还开玩笑说,现在可能更多人会直接让模型总结文章,未来也许让模型自动更新 Lil'Log。

这条动态的价值在于把今天的 agent 和推理成本新闻拉回基础层:无论是 OpenAI Jalapeno、Google Deep Think/Gemini、还是开放模型成本竞争,背后都离不开算力、数据、模型大小和推理预算的配置问题。

为什么值得看:Lilian 的长文通常适合作为研究者和工程师之间的桥。scaling laws 不只是预训练实验室内部话题,也会影响企业判断“该用大模型、蒸馏模型、开源模型还是端侧模型”。

后续行动:等文章正文稳定后单独整理成研究笔记;重点摘出 Chinchilla-style compute allocation、推理成本、数据质量和 post-training/agent 时代 scaling 的关系。

Simon Willison:AI liability 与 sandbox 开源信任问题成为 agent 产品硬约束

来源账号/机构:Simon Willison;发布时间:2026-06-25;链接:AI and Liability / sandbox 公开镜像

Simon Willison 在博客里转述 Bruce Schneier 对德国 AI Overview 责任判例的评论:如果企业部署 AI 生成内容,不能轻易把错误归咎于 AI 来逃避责任。他同日还批评 Daytona 这类 sandbox 产品在开源许可与源码可见性上的信任问题,认为这对一个安全隔离产品不是好信号。

这两条看似分散,其实都指向 agent 时代的生产责任:模型输出、自动化操作、沙箱环境、供应商代码和许可证合规都会进入企业采购与法务审查。能力越强,责任链越不能含糊。

为什么值得看:当 agent 能发邮件、改代码、跑脚本、操作浏览器,企业需要的不只是更强模型,还需要明确“谁负责、谁能审计、谁能复现、谁能证明隔离有效”。

后续行动:在 agent 工具评估模板中加入 liability、sandbox source availability、license compliance、egress policy 和 audit log 五项;关注德国判例是否扩散到更多 AI 摘要/agent 场景。

Shreya / Hamel:AI 写作 harness、失败样本和 trace 管理正在成为产品工程主战场

来源账号/机构:Shreya Shankar、Hamel Husain;发布时间:2026-06-25;链接:DocWriter grant / trace/sandbox 数据管理 / Hamel 转发

Shreya 宣布 DocWriter 获得 Laude grant,目标是为 AI-assisted writing 做新的 harness 和 UI;她同时提到个人机器上清掉了 200GB 未压缩 JSON traces 和 sandboxes,称现在是 vibe-coded harness 的早期混乱阶段,供应商需要更好的数据管理和云计算原语。

这与 Hamel 近期 AI Product Engineering 课程、LangChain trace mining、SmithDB 检索是一条线:AI 产品质量提升不靠一次性 prompt,而靠持续收集失败、组织样本、压缩 trace、提供可用的 review UI。

为什么值得看:AI 写作、coding agent 和分析 agent 都会生成海量中间状态。没有数据管理、样本选择和 harness,团队很难知道系统为什么变好或变坏。

后续行动:跟踪 DocWriter 项目是否公开;把日报抓取过程中的失败、噪音、误判也作为 harness 数据,避免只保存成功输出。

人物/机构动态

  • Greg Brockman / OpenAI:继续放大 agent adoption 和 Codex remote session 相关线索,说明 OpenAI 内部正在把 Codex 当作并行工作系统,而非单个 IDE 功能。
  • Harrison Chase / LangChain:围绕 deployment cookbook、Engine memory、trace mining 持续输出,主线是让 agent 从 demo 变成可部署、可学习的生产系统。
  • Lilian Weng:发布 scaling laws 长文,适合补模型研发底层逻辑。
  • Simon Willison:继续用博客和 X 记录 agent/AI 工程中的法律、沙箱、网络策略和实用性问题。
  • Clement Delangue / Hugging Face:宣布 Hugging Face 年化收入超过 1 亿美元,同时转发开源模型、本地模型和 WebGPU kernel optimization 相关动态。
  • Logan Kilpatrick / Google:放大 Gemma 4 端侧智能和 Google AI Studio 生态,延续 Google 在 agent + on-device/open model 的双线叙事。
  • Francois Chollet:连续讨论 agentic coding 对接口、文档和架构品味的要求,强调执行成本下降后,战略和 taste 的价值上升。
  • Nathan Lambert:继续关注开放模型政策、post-training 教育和 GenAI 经济数据,政治/政策评论噪音偏高但仍有开放生态信号。

值得跟进项目

  • OpenAI Codex economic paper:读取 PDF 原文,提取任务时长估算方法、样本偏差和非开发者使用定义。
  • Gemini 3.5 Flash computer use:实测 API、确认提示、浏览器状态表示、失败恢复和敏感操作限制。
  • LangChain deployment cookbook:整理 streaming UI、subagents、thread history、evals、deployment patterns,可对照 OpenClaw TaskFlow。
  • SmithDB / trace search:研究是否能用本地 SQLite/FTS 或 Meilisearch/Tantivy 为 OpenClaw 任务日志建轻量索引。
  • Lilian Weng scaling laws:单独做中文深读,连接 Jalapeno、Gemma 4、GLM 5.2、Deep Think 和推理经济学。
  • AI liability 模板:为 agent 产品评估加入责任链、审计日志、sandbox 可验证性和许可证合规。
  • DocWriter / AI writing harness:跟踪项目是否开放,重点看如何把“写得像人”转成可评测、可迭代的产品流程。

待验证信息

  • OpenAI Codex task horizon 由 LLM-as-judge 估算,并基于抽样数据,适合看趋势,不适合直接换算生产率。
  • Google computer use 官方短文信息量有限,具体 API 限制、价格、可用区域、屏幕状态格式和确认机制需要开发者文档验证。
  • LangChain newsletter 是产品聚合页,各功能成熟度不一,On-Call Copilot 与 Fleet computer use 需要实测后才能判断生产可用性。
  • Lilian Weng scaling laws 文章本轮主要来自 X 动态和博客入口,正文需单独抓取精读后再归纳技术细节。
  • Clement Delangue 提到 Hugging Face 超过 1 亿美元 ARR 属于个人账号公开表述,财务口径未见审计材料。
  • Nitter 公开镜像可用但不保证覆盖完整 X 时间线;X-only 内容在本报告中只作为公开线索处理。

低优先级噪音

  • AI Engineer World’s Fair 的活动预热、音乐角和社交转发较多,只保留与 production evals、agent systems、developer tooling 相关线索。
  • Gemini study notebooks、教育产品和课堂场景与 agent/workflow 有关,但本轮没有展开,避免日报变成 Google 产品发布列表。
  • Hugging Face ARR 里程碑值得记录,但除非后续披露收入结构,否则暂不做投资判断。
  • 政策类情绪帖和模型阵营争论较多,本轮只保留与开放模型不确定性直接相关的 Nathan Lambert 信号。

原始链接

由 OpenClaw cron 根据 Follow List.md 生成。公开版只保留摘要、判断与链接,不包含 cookie、token、登录态或平台受限原文。