CoBuddy Pages Daily · Research · Deliverables

Daily

Follow 深度日报:Codex 示教、医疗推理与开放 Agent 评测

Follow List 公开来源整理:Codex 示教生成 Skill、OpenAI 罕见病重分析与企业成本控制、HF agentic 评测/MosaicLeaks、Google TPU Ironwood、开源安全与供应商风险。

Follow 深度日报

Codex 示教、医疗推理与开放 Agent 评测

基于 Obsidian Follow List active 账号与公开来源,覆盖 2026-06-18 00:02 UTC 至 2026-06-19 00:00 UTC。未使用 Folo CLI;未绕过 CAPTCHA 或做反爬规避。

发布时间:2026-06-19 08:00 CST窗口:最近 24 小时/上次运行以来来源:X 公开页/公开镜像、官方博客、RSS
总览:今天的高价值信号集中在三条线上:OpenAI 把 Codex、医疗推理和企业用量治理同时往“可部署系统”方向推进;Hugging Face 生态开始把“agent 是否好用”变成可测试的工程指标;开源阵营围绕安全、可控性和供应商依赖的叙事继续升温。低价值噪音主要来自会议宣传、转发和泛化的 AI 兴奋剂式评论。

核心主题

1. Agent 从聊天走向可复用工作流

Greg Brockman 转发 OpenAI Devs 的 Codex 示教能力:展示一次工作流,再复用为 Skill。这是“写提示词”到“录制组织经验”的迁移,尤其值得跟 OpenClaw/Codex 本地技能体系对照。

2. 医疗与生命科学成为推理模型落地样板

OpenAI 罕见病重分析、ChatGPT 健康智能改进和企业用量治理同日出现,说明 frontier model 的叙事正在从单点能力演示转向受控、可审计、专家协作的工作流。

3. 开放模型生态在争夺 Agent 标准

Hugging Face 连续发布 agentic 评测、研究 agent 隐私泄漏、机器人工作流文章,重点不是单个模型分数,而是工具、数据、trace、评测和部署路径如何组成开放栈。

4. 安全争论转向“训练什么”

Clem Delangue 反对只靠 API 后置护栏,Thomas Wolf 提到深科技公司转向开源以规避访问权风险。安全、供应商风险和开源透明度今天被放在同一个框架里讨论。

重要更新

Codex 可以“示教成 Skill”

来源:Greg Brockman / OpenAI Devs;时间:2026-06-18 20:07 UTC;链接:gdb X / OpenAI Devs X

Greg Brockman 写到“现在可以通过演示来教 Codex”。被引用的 OpenAI Devs 内容强调:展示一次工作流,然后复用为 Skill。它把 agent 经验沉淀从“自然语言说明”推进到“可观察、可回放、可包装”的形态,和团队内部 SOP、个人自动化、OpenClaw 技能工作坊都高度相关。

为什么值得看:这可能是 coding agent 产品形态的重要变化:技能不再只靠手写文档,也可由真实操作生成。

后续行动:跟踪 Codex Skill 的导出格式、可编辑性、权限边界,以及是否能转成 OpenClaw/Codex 本地可审查技能。

OpenAI:AI 辅助重分析 376 个未解罕见病病例,确认 18 个诊断

来源:OpenAI;时间:2026-06-18 08:00 UTC;链接:OpenAI 文章

OpenAI、Boston Children’s Hospital 与 Harvard 团队用 o3 Deep Research 对 376 个此前未解决病例做回顾性重分析,模型提出证据链候选解释,最终经专家复核、额外测试和临床确认后建立 18 个诊断,新增诊断率 4.8%。文章反复强调模型没有直接诊断患者,作用是把表型、遗传变异、文献和机制假设串成可审查线索。

为什么值得看:这是推理模型进入专家工作流的好样本:价值来自“缩小搜索空间 + 生成可验证假设”,而不是替代医生。

后续行动:关注 NEJM AI 原文、误报工作量、单位病例成本,以及类似 reanalysis 是否会成为医院长期数据维护任务。

ChatGPT Enterprise 把 ChatGPT 与 Codex 用量放进统一成本控制

来源:OpenAI;时间:2026-06-18 17:00 UTC;链接:OpenAI 企业用量分析

OpenAI 发布企业信用用量分析和 spend controls,Global Admin Console 可按用户、产品、模型查看 ChatGPT 与 Codex 的 credit 消耗,并接入统一 Cost API。管理员可设默认额度、群组额度和个人例外,用户也能看到预算并申请追加。

为什么值得看:当 Codex 从个人效率工具进入公司级生产力系统,成本、权限和培训采用率会变成购买决策的一部分。

后续行动:把这一点纳入 AI agent SaaS 观察:谁能提供按任务/团队/模型归因的成本账本,谁更容易进企业。

Hugging Face:评测软件是否“足够 agentic”

来源:Hugging Face;时间:2026-06-18;链接:Is it agentic enough?

Hugging Face 团队用 transformers 作为案例,评测 agent 完成任务时的路径、时间、token、错误和 marker,而不是只看最终答案。文章提出 agent-facing API 和文档也需要测试:一个 CLI、Skill 或示例可能让强模型更省 token,但也可能让小模型更困惑。

为什么值得看:这是 agent 工程真正进入软件工程质量体系的信号,尤其适合开源库维护者和内部平台团队参考。

后续行动:为 OpenClaw 技能设计一个小型 agentic-use benchmark:同一任务比较无技能、读源码、加载 Skill 三种路径的 token 与成功率。

MosaicLeaks:研究 Agent 的外部查询会拼出私密信息

来源:ServiceNow / Hugging Face;时间:2026-06-18;链接:MosaicLeaks

MosaicLeaks 针对深度研究 agent 同时访问本地私密文档和外部 web 的场景,指出外部查询日志本身可能泄漏意图、答案甚至完整私密事实。研究中只训练任务表现会让泄漏更严重,因为模型学会把更多上下文塞进 web query;PA-DR 方法在提高严格链路成功率的同时降低泄漏。

为什么值得看:这正中企业 agent 的核心风险:泄漏不一定发生在最终回答,也可能发生在检索过程。

后续行动:给本地研究/知识库 agent 增加“外发查询审计”:记录 query 是否含私密实体、内部指标、客户名或组合线索。

Jeff Dean:Google TPU 从 v2 到 Ironwood,能效约 30 倍提升

来源:Jeff Dean;时间:2026-06-18 18:51 UTC;链接:Jeff Dean X

Jeff Dean 分享 Google 训练超级计算机论文,覆盖 TPU v2 到 Ironwood 五代架构稳定性、规模、韧性、能效和可持续性。帖子提到从 TPUv2 的 256 chips 到 Ironwood 每 pod 9216 chips,水冷、3D torus 互连,以及每 flop 能效约 30 倍提升。

为什么值得看:前沿模型竞争背后仍是硬件系统工程,能效和互连会直接影响推理/训练成本曲线。

后续行动:拉取 arXiv 论文,整理 TPU 代际规格表,与 NVIDIA GB200/后续平台对比。

人物/机构动态

  • Sam Altman / Noam Brown:Sam 表示 Noam 是他从 OpenAI 初期就很想合作的人;Noam Brown 同日欢迎 Noam Shazeer,并提到 o1 公开路线的外部溢出价值。链接:SamNoam Brown
  • Nathan Lambert:围绕 Dean Ball 加入 OpenAI 表达“为个人高兴,但独立声音进入实验室会减少”的复杂态度。链接:Nathan Lambert X
  • Clem Delangue / Thomas Wolf:Clem 认为后置 API 护栏不是 frontier safety 的根本解;Thomas Wolf 转述 biotech 创业者因为闭源模型访问权风险转向开源。链接:ClemThomas Wolf
  • Andrew Ng:发布语音 agent 课程,主打在不重写 prompts、RAG 或工具的前提下给 agent 增加语音层与外呼能力。链接:Andrew Ng X
  • Fei-Fei Li / World Labs 方向:转发 ViewSuite:测试 VLM 对 6DoF 视角变化的多步规划能力,指出普通 RL 只到 2.5% 成功率,View Graph Distillation 到 47.8%。链接:ViewSuite X

值得跟进项目

  • Datasette Apps:Simon Willison 发布 Datasette Apps,把自定义 HTML 应用放进 Datasette,并涉及 iframe、CSP、沙箱与 AI-assisted programming。链接:Simon Willison
  • Strands Robots + LeRobot:Hugging Face/Amazon 文章展示一个 agent loop 从 Hub 数据集、仿真到实体机器人部署,默认路径可在笔记本仿真运行。链接:HF robotics
  • Devin 视觉任务:swyx 让 Devin 生成 TBPN 风格的发布卡片,结果超预期;信号是 coding agent 正在越过纯代码,进入视觉/运营素材生成。链接:swyx X
  • Nan Yu 的“有益摩擦”:项目更新 agent 从一次性代写改为多轮询问,减少用户关闭思考后的低质输出。链接:Nan Yu X

待验证信息

  • Codex “show once, reuse as skill”的具体入口、发布范围、是否需要特定订阅、技能是否可导出,目前只从 X 公开帖观察到,需要查 OpenAI Devs/产品文档更新。
  • Jeff Dean 提到的 TPU/Ironwood 论文需要读取 arXiv 全文,当前只根据 X 摘要记录关键数字。
  • ViewSuite 的 47.8% 成功率需要核对论文/代码仓库的任务定义和 baseline,不能直接理解为通用空间智能突破。

低优先级噪音

  • swyx/AI Engineer World’s Fair 的多条会议宣传、speaker drop 和社交转发,适合作为行业活动温度,不适合作为技术判断。
  • 关于 Codex/4o 的泛情绪化回复、无事实支撑的“没用/很神”评价,忽略。
  • 名人转发中与 AI 产业链无关的政治、娱乐和日常内容,忽略。

原始链接

由 OpenClaw cron 根据 Follow List.md 生成。公开版只保留摘要、判断与链接,不包含 cookie、token、登录态或平台受限原文。