Codex 示教、医疗推理与开放 Agent 评测
基于 Obsidian Follow List active 账号与公开来源,覆盖 2026-06-18 00:02 UTC 至 2026-06-19 00:00 UTC。未使用 Folo CLI;未绕过 CAPTCHA 或做反爬规避。
核心主题
1. Agent 从聊天走向可复用工作流
Greg Brockman 转发 OpenAI Devs 的 Codex 示教能力:展示一次工作流,再复用为 Skill。这是“写提示词”到“录制组织经验”的迁移,尤其值得跟 OpenClaw/Codex 本地技能体系对照。
2. 医疗与生命科学成为推理模型落地样板
OpenAI 罕见病重分析、ChatGPT 健康智能改进和企业用量治理同日出现,说明 frontier model 的叙事正在从单点能力演示转向受控、可审计、专家协作的工作流。
3. 开放模型生态在争夺 Agent 标准
Hugging Face 连续发布 agentic 评测、研究 agent 隐私泄漏、机器人工作流文章,重点不是单个模型分数,而是工具、数据、trace、评测和部署路径如何组成开放栈。
4. 安全争论转向“训练什么”
Clem Delangue 反对只靠 API 后置护栏,Thomas Wolf 提到深科技公司转向开源以规避访问权风险。安全、供应商风险和开源透明度今天被放在同一个框架里讨论。
重要更新
Codex 可以“示教成 Skill”
来源:Greg Brockman / OpenAI Devs;时间:2026-06-18 20:07 UTC;链接:gdb X / OpenAI Devs X
Greg Brockman 写到“现在可以通过演示来教 Codex”。被引用的 OpenAI Devs 内容强调:展示一次工作流,然后复用为 Skill。它把 agent 经验沉淀从“自然语言说明”推进到“可观察、可回放、可包装”的形态,和团队内部 SOP、个人自动化、OpenClaw 技能工作坊都高度相关。
为什么值得看:这可能是 coding agent 产品形态的重要变化:技能不再只靠手写文档,也可由真实操作生成。
后续行动:跟踪 Codex Skill 的导出格式、可编辑性、权限边界,以及是否能转成 OpenClaw/Codex 本地可审查技能。
OpenAI:AI 辅助重分析 376 个未解罕见病病例,确认 18 个诊断
来源:OpenAI;时间:2026-06-18 08:00 UTC;链接:OpenAI 文章
OpenAI、Boston Children’s Hospital 与 Harvard 团队用 o3 Deep Research 对 376 个此前未解决病例做回顾性重分析,模型提出证据链候选解释,最终经专家复核、额外测试和临床确认后建立 18 个诊断,新增诊断率 4.8%。文章反复强调模型没有直接诊断患者,作用是把表型、遗传变异、文献和机制假设串成可审查线索。
为什么值得看:这是推理模型进入专家工作流的好样本:价值来自“缩小搜索空间 + 生成可验证假设”,而不是替代医生。
后续行动:关注 NEJM AI 原文、误报工作量、单位病例成本,以及类似 reanalysis 是否会成为医院长期数据维护任务。
ChatGPT Enterprise 把 ChatGPT 与 Codex 用量放进统一成本控制
来源:OpenAI;时间:2026-06-18 17:00 UTC;链接:OpenAI 企业用量分析
OpenAI 发布企业信用用量分析和 spend controls,Global Admin Console 可按用户、产品、模型查看 ChatGPT 与 Codex 的 credit 消耗,并接入统一 Cost API。管理员可设默认额度、群组额度和个人例外,用户也能看到预算并申请追加。
为什么值得看:当 Codex 从个人效率工具进入公司级生产力系统,成本、权限和培训采用率会变成购买决策的一部分。
后续行动:把这一点纳入 AI agent SaaS 观察:谁能提供按任务/团队/模型归因的成本账本,谁更容易进企业。
Hugging Face:评测软件是否“足够 agentic”
来源:Hugging Face;时间:2026-06-18;链接:Is it agentic enough?
Hugging Face 团队用 transformers 作为案例,评测 agent 完成任务时的路径、时间、token、错误和 marker,而不是只看最终答案。文章提出 agent-facing API 和文档也需要测试:一个 CLI、Skill 或示例可能让强模型更省 token,但也可能让小模型更困惑。
为什么值得看:这是 agent 工程真正进入软件工程质量体系的信号,尤其适合开源库维护者和内部平台团队参考。
后续行动:为 OpenClaw 技能设计一个小型 agentic-use benchmark:同一任务比较无技能、读源码、加载 Skill 三种路径的 token 与成功率。
MosaicLeaks:研究 Agent 的外部查询会拼出私密信息
来源:ServiceNow / Hugging Face;时间:2026-06-18;链接:MosaicLeaks
MosaicLeaks 针对深度研究 agent 同时访问本地私密文档和外部 web 的场景,指出外部查询日志本身可能泄漏意图、答案甚至完整私密事实。研究中只训练任务表现会让泄漏更严重,因为模型学会把更多上下文塞进 web query;PA-DR 方法在提高严格链路成功率的同时降低泄漏。
为什么值得看:这正中企业 agent 的核心风险:泄漏不一定发生在最终回答,也可能发生在检索过程。
后续行动:给本地研究/知识库 agent 增加“外发查询审计”:记录 query 是否含私密实体、内部指标、客户名或组合线索。
Jeff Dean:Google TPU 从 v2 到 Ironwood,能效约 30 倍提升
来源:Jeff Dean;时间:2026-06-18 18:51 UTC;链接:Jeff Dean X
Jeff Dean 分享 Google 训练超级计算机论文,覆盖 TPU v2 到 Ironwood 五代架构稳定性、规模、韧性、能效和可持续性。帖子提到从 TPUv2 的 256 chips 到 Ironwood 每 pod 9216 chips,水冷、3D torus 互连,以及每 flop 能效约 30 倍提升。
为什么值得看:前沿模型竞争背后仍是硬件系统工程,能效和互连会直接影响推理/训练成本曲线。
后续行动:拉取 arXiv 论文,整理 TPU 代际规格表,与 NVIDIA GB200/后续平台对比。
人物/机构动态
- Sam Altman / Noam Brown:Sam 表示 Noam 是他从 OpenAI 初期就很想合作的人;Noam Brown 同日欢迎 Noam Shazeer,并提到 o1 公开路线的外部溢出价值。链接:Sam、Noam Brown
- Nathan Lambert:围绕 Dean Ball 加入 OpenAI 表达“为个人高兴,但独立声音进入实验室会减少”的复杂态度。链接:Nathan Lambert X
- Clem Delangue / Thomas Wolf:Clem 认为后置 API 护栏不是 frontier safety 的根本解;Thomas Wolf 转述 biotech 创业者因为闭源模型访问权风险转向开源。链接:Clem、Thomas Wolf
- Andrew Ng:发布语音 agent 课程,主打在不重写 prompts、RAG 或工具的前提下给 agent 增加语音层与外呼能力。链接:Andrew Ng X
- Fei-Fei Li / World Labs 方向:转发 ViewSuite:测试 VLM 对 6DoF 视角变化的多步规划能力,指出普通 RL 只到 2.5% 成功率,View Graph Distillation 到 47.8%。链接:ViewSuite X
值得跟进项目
- Datasette Apps:Simon Willison 发布 Datasette Apps,把自定义 HTML 应用放进 Datasette,并涉及 iframe、CSP、沙箱与 AI-assisted programming。链接:Simon Willison
- Strands Robots + LeRobot:Hugging Face/Amazon 文章展示一个 agent loop 从 Hub 数据集、仿真到实体机器人部署,默认路径可在笔记本仿真运行。链接:HF robotics
- Devin 视觉任务:swyx 让 Devin 生成 TBPN 风格的发布卡片,结果超预期;信号是 coding agent 正在越过纯代码,进入视觉/运营素材生成。链接:swyx X
- Nan Yu 的“有益摩擦”:项目更新 agent 从一次性代写改为多轮询问,减少用户关闭思考后的低质输出。链接:Nan Yu X
待验证信息
- Codex “show once, reuse as skill”的具体入口、发布范围、是否需要特定订阅、技能是否可导出,目前只从 X 公开帖观察到,需要查 OpenAI Devs/产品文档更新。
- Jeff Dean 提到的 TPU/Ironwood 论文需要读取 arXiv 全文,当前只根据 X 摘要记录关键数字。
- ViewSuite 的 47.8% 成功率需要核对论文/代码仓库的任务定义和 baseline,不能直接理解为通用空间智能突破。
低优先级噪音
- swyx/AI Engineer World’s Fair 的多条会议宣传、speaker drop 和社交转发,适合作为行业活动温度,不适合作为技术判断。
- 关于 Codex/4o 的泛情绪化回复、无事实支撑的“没用/很神”评价,忽略。
- 名人转发中与 AI 产业链无关的政治、娱乐和日常内容,忽略。