总览
Prompt injection 安全进入自动红队阶段
OpenAI 发布 GPT-Red,用自博弈训练红队模型寻找 prompt injection、工具输出投毒和 agent 外泄漏洞,并把攻击样本反哺 GPT-5.6 鲁棒性。
治理叙事从州法走向全国框架
OpenAI 同日提出以州法推动事实上的全国标准,同时强调联邦层面的前沿模型测试、独立审计、事故报告和安全标准。
Agent 需要自己的可控电脑
LangChain 连发 Fleet Slack 入口和 sandbox 长文,把 agent 从“聊天窗口”推向可运行、可审计、可限权、可协作的工作环境。
开放模型竞争回到大多模态
Thinking Machines 的 Inkling 在 Hugging Face 上公开,主打 1T 级参数、1M context、图像/音频/文本原生输入和 day-0 推理生态支持。
真实世界 voice eval 补足文字指标盲区
Real World VoiceEQ 强调语音 AI 不只是 WER 和延迟,还要衡量情绪、身份、噪声、口音和自然交互中的人类质量。
高风险行业 agent 给出架构样本
Ai2 Shippy 把 maritime agent 拆成 soul、skills、config 和可验证 live data,说明 agent 产品化的关键常常不是模型,而是边界、证据与验证。
核心主题
一、安全:从人工审查转向可扩展自动红队
OpenAI 发布 GPT-Red,把红队攻击从人工构造升级为自博弈强化学习:攻击模型和防守模型同时训练,攻击方尝试诱导 prompt injection、工具输出投毒、外泄或越权,防守方则要保持原任务并抵抗攻击。文章给出的关键信号是,GPT-Red 不只是评测工具,也被纳入生产模型训练,使 GPT-5.6 在直接 prompt injection、开发者工具和浏览场景上的失败率显著下降。更值得注意的是,OpenAI 将 GPT-Red 与真实 agent 系统相连,测试了售货机 agent 和 Codex 类 agent 的数据外泄场景。
Simon 记录 Ayush Paul 发现的 Claude web_fetch 外泄漏洞:Claude 原本限制 web_fetch 只能访问用户给定 URL 或 web_search 返回 URL,但攻击者可以通过已抓取页面内嵌的一串链接,引导模型逐字母导航并泄露记忆中的个人信息。Anthropic 表示已关闭该洞,方式是取消 web_fetch 跟随自身抓取内容中额外链接的能力。这个案例和 GPT-Red 同日出现,说明“工具可达 URL”是 agent 安全中非常具体、非常脆弱的边界。
OpenAI 讨论美国 AI 安全治理,提出一种“reverse federalism”路径:州法先形成方向一致的事实标准,再推动全国框架统一。文章支持联邦政府主导最先进模型测试,强调独立审计、事故报告、强安全标准、吹哨人保护,以及让 CAISI 这类机构具备持续评估能力。对行业来说,重点不是某个州法细节,而是前沿模型安全正从企业自律走向可重复的官方测试和合规结构。
二、Agent 产品:从通用聊天走向工作入口、权限和运行环境
LangChain 发布 Fleet agents 一键进入 Slack:团队成员可以用自然语言构建专用 agent,再让它以独立 Slack 身份进入频道和线程。重点是每个 agent 有清晰角色、描述、图标、权限和连接范围,能在同一线程追问、请求批准、返回文件或结果。它把 agent 从“个人聊天助手”放进团队协作流里,强调专用 agent 比通用 chat 更适合稳定重复工作。
LangChain 的 conceptual guide 直说:agent 需要自己的电脑,也就是具备文件系统、shell、包管理器、网络访问和持久状态的真实环境。文章把 coding、数据分析、研究 agent 的共同点归纳为“能运行真实步骤并检查真实结果”,同时警告不能直接把 agent 放到本地机或生产 infra 上,需要隔离、可丢弃、安全可控的 sandbox。这个观点和昨天的 coding-agent traces、今天的 GPT-Red 正好拼成一条完整链:能执行,才有价值;能执行,就必须隔离和观测。
Ai2 公开 Shippy maritime agent 的架构经验。Shippy 面向海事态势这类高风险决策,回答需要带边界来源、数据截止时间、查询时间和回到 Skylight 地图的验证链接。Ai2 将 agent 拆成 soul、skills 和 config:系统提示定义行为边界,skills 用 markdown/Agent Skills 规范描述任务能力,config 管模型、harness、运行时设置和密钥注入。文章明确说真正困难的不是模型,而是让系统保持正确、知道边界,并基于 live data 验证。
三、开放模型与多模态:Inkling 把开源竞争拉向 1T/1M context
Hugging Face 发布 Thinking Machines 的 Inkling 介绍:这是一个约 1T 参数的开放多模态模型,原生接收图像、文本和音频,支持 1M context,采用 decoder-only multimodal MoE,约 975B 总参数、41B active parameters、256 experts。文章强调 day-0 支持 transformers、SGLang、vLLM、llama.cpp/Unsloth,以及 BF16 和 NVFP4 版本。它的定位不是“小模型本地跑”,而是开放生态在超大多模态、长上下文和 agentic coding 上争夺前沿能力。
Real World VoiceEQ 提出语音 AI 的评估不应只看 word error rate、延迟或标准 benchmark。它覆盖 ASR、TTS、speech-to-speech 和 speech understanding,强调语调、情绪、说话人身份、背景噪声、口音和自然对话中的稳定性。文章称评估包含 40 多个 proprietary/open-source voice models、15+ 维度、60+ 指标,并基于超过百万个人类评分。
四、工程细节:AI 自动化放大依赖、文档和 shared understanding 的债
Simon 继续记录两条和 agent 工程强相关的小信号:GitHub Dependabot 默认对新版本等待三天再开 PR,降低供应链刚发布版本带来的噪音;Armin Ronacher 则提醒大型代码库的 shared understanding 不只是英文或 Python,而是边界、概念、所有权、约束和代码评审中形成的共同语言。AI coding agent 会降低改动摩擦,也会削弱人之间同步理解的机会。
人物 / 机构动态
- OpenAI:同日发布 GPT-Red 和 AI 安全治理文章,安全、政策与 agent 鲁棒性成为主线。
- Simon Willison:继续高信号跟踪 prompt injection、依赖治理和 agentic engineering 的组织影响。
- LangChain / Harrison Chase 生态:Fleet 进入 Slack,sandbox 叙事补齐,配合此前 trace/cost/eval 形成 agent 平台完整拼图。
- Thinking Machines / Hugging Face:Inkling 公开发布,成为开放多模态 frontier 模型的重要新变量。
- Ai2:Shippy 展示 OpenClaw + skills 规范在海事高风险场景的落地样本。
值得跟进项目
GPT-Red 方法:重点读 self-play 场景设计、attack success 定义和如何避免红队能力外泄。
Agent URL 安全:建立 URL provenance 规则:用户给定、可信搜索返回、工具返回、页面内链接分别不同权限。
Fleet/Feishu agent:按 Slack 入口模型设计飞书 agent 身份、权限、审批和线程回写。
Inkling:跟踪模型卡、license、推理成本、vLLM/SGLang 支持成熟度和独立评测。
Shippy 架构:把 soul/skills/config 与本地 OpenClaw skills 对齐,整理行业 agent 模板。
待验证信息
Inkling 实际能力:HF 文章是发布介绍,需等待第三方 benchmark、license 细则和部署成本验证。
GPT-Red 泛化:OpenAI 给出强结果,但企业自己的工具链、私有数据和 harness 仍需独立红队。
LangChain Fleet Slack:公开文章说明产品能力,实际权限边界、审计粒度、成本控制和企业集成质量需要试用确认。
Nitter/X 覆盖:本轮 Nitter RSS 对重点账号返回空内容;X-only 人物动态未能完整覆盖,只采用可公开核验的网页/RSS线索。
低优先级噪音
Google Images 25 周年属于 AI 搜索和视觉入口背景信息,但与本轮 agent、安全、开放模型主线关系较弱,未展开。HF 社区文章中的 3D agent/wallet、模型路由等值得扫一眼,但本轮优先级低于 Inkling、GPT-Red、LangChain runtime 和 Shippy。
原始链接
- OpenAI: GPT-Red: Unlocking Self-Improvement for Robustness
- OpenAI: The US is advancing AI safety through state and federal action
- Simon Willison: Claude web_fetch exfiltration
- LangChain: New in Fleet, deploy agents to Slack
- LangChain: Agents need their own computer
- Ai2: What building Shippy taught us about building agents
- Hugging Face: Welcome Inkling by Thinking Machines
- Hugging Face: Real World VoiceEQ
- Simon Willison: GitHub Dependabot cooldown
- Simon Willison: Armin Ronacher on shared understanding
- Google AI RSS
- Hugging Face Blog RSS
- Simon Willison Atom feed