总览
OpenAI 今天把叙事从模型推到全栈
OpenAI 同日发布 Jalapeño 首批性能结果和 Sarah Friar 的全栈策略文,重点不是单个模型,而是数据中心、芯片、服务软件、模型、产品和设备的闭环。对 agent 时代来说,低延迟、每瓦吞吐和 useful intelligence per dollar 变成核心竞争变量。
企业 AI 的管理入口开始产品化
Admin plugin for ChatGPT Work and Codex 把工作区活动、权限、成员、群组、额度和支出请求放进对话式管理流。它是企业 agent 进入 IT/管理后台的明确信号:AI 不只执行业务任务,也开始管理 AI 自己的采用、成本和权限。
Copilot 的 Customize tab 把 MCP、plugin、skill、canvas 收到一个入口
GitHub Copilot app 的新 Customize tab GA,强调团队可以集中浏览和配置 MCP servers、plugins、skills、canvases。这说明“可扩展 agent 工作台”正在成为开发工具的默认形态,和 OpenClaw/Skill Workshop 的方向高度同频。
开放模型继续追 agentic reasoning
IBM Granite 4.2 在 Hugging Face 发布,主打 3B/8B/30B dense reasoning、512K context、tool calling、thinking/non-thinking 模式,以及 8B/30B 在沙箱环境中的 agentic RL。开源模型竞争已经从聊天能力转向可控推理、工具调用和可部署性。
工作流 UI 和模型压缩都是落地层信号
Gradio Workflow 把多步 AI pipeline 做成可运行、可调试、可部署的节点画布;Quantization-Aware Healing 则把压缩模型的恢复训练做成系统问题。一个解决“怎么编排和看见流程”,一个解决“怎么便宜地部署能力”。
公开 X 仍不是稳定事实锚点
本轮抽样 kevinweil、joshwoodward、AmandaAskell、sama、gdb、karpathy、lilianweng、polynoamial、alexalbert__、OfficialLoganK、JeffDean、demishassabis、miramurati、simonw、HamelHusain、sh_reya、eugeneyan、chipro、hwchase17、natolambert、DrJimFan、fchollet、drfeifei 等,没有把 X-only 内容写成事实。
核心主题
一、全栈 AI 竞争:从“更强模型”转向“更便宜、更快、更可控地完成工作”
OpenAI 把算力策略描述成一个覆盖数据中心、芯片、frontier models、developer platform、消费/企业产品和 AI-native devices 的一体化系统。文章强调不同工作负载需要不同的芯片、软件、网络、电力和延迟组合,OpenAI 会同时使用 Microsoft、NVIDIA、AWS、AMD、Broadcom、Cerebras、CoreWeave、Oracle、SB Energy、SoftBank 等伙伴,同时保留自研路径。
最值得注意的是指标口径:文章反复强调 useful intelligence per dollar,而不是单纯看峰值算力或模型榜单。它还把 GPT-5.6 Sol 在 coding agent index 上用更少输出 token 达到新高的例子放进经济性叙事里,说明模型、路由、上下文管理和硬件效率会共同决定 agent 能否进入更多真实任务。
二、Jalapeño:OpenAI 首个自研推理芯片给出实测结果
OpenAI 公布 Jalapeño 的首批测试结果,称其在 InferenceX 公共 benchmark 上覆盖 GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T 等模型,展现更高每瓦吞吐和更低端到端延迟。文章给出的总体区间是:在三类模型上,峰值吞吐下每瓦 AI work 提升约 1.5 到 1.9 倍,端到端延迟降低约 1.7 到 3.6 倍;高交互工作负载下性能提升约 2.1 到 4.1 倍。
它特别把目标对准 interactive agents:agent 多步串行执行时,单步延迟会累积成任务级失败和成本。OpenAI 还称用 Codex 和 GPT-Astra 在两个月内把三个原本不在生产计划里的开放权重模型优化到高性能,并且部分 GPT-OSS attention/MoE block 的 AI 生成实现比原有人写版本快 1.5 到 1.8 倍。
三、Admin plugin:企业 AI 进入权限、用量和预算治理层
OpenAI 发布 Admin plugin for ChatGPT Work and Codex,管理员可以在一个对话里查看 adoption、usage、credit usage、成员/群组、权限、模型或功能访问、额度和支出请求,并执行受支持的管理动作。文章强调插件遵守现有角色与权限,不会扩大访问权;更大范围的变更会让管理员在应用前审查。
这里的高信号不在“又一个插件”,而在企业 AI 平台的控制面板开始对话化。OpenAI 还披露内部 IT 使用 ChatGPT Work/Codex 处理工单、检索政策、执行受支持任务和升级例外;报告时已部署流程解决约 45% 工单量,同时用支持数据生成运营健康仪表盘。
四、Copilot Customize tab:开发者 agent 的扩展市场正在收拢
GitHub Copilot app 的 Customize tab GA,把 MCP servers、plugins、skills、canvases 放在一个可浏览和配置的入口里。GitHub 的定位是让 Copilot 连接团队已有工具、知识和工作流,并让用户按类型探索不同定制能力。
这与过去两个月 Follow List 里反复出现的“agent workspace / skill / MCP / tool ecosystem”连在一起。未来开发者工具的竞争点不只是模型和 IDE 补全,而是谁能成为团队默认的扩展目录、权限边界和工作流装配层。
五、Granite 4.2:开源 reasoning 模型把 tool calling 和 agentic RL 放进主叙事
IBM Granite 团队发布 Granite 4.2 技术 walkthrough:3B、8B、30B dense decoder-only reasoning 模型,从头预训练约 15T tokens,context 扩到 512K,SFT 数据包含 chain-of-thought、reasoning 和 agentic trajectory,再通过多阶段 RL 后训练。8B 和 30B 还加入 agentic RL,在真实沙箱环境中学习使用工具。
产品能力上,它强调 thinking/non-thinking switch、low-effort thinking mode、native tool calling,并给出 Transformers、tool calling、多轮工具响应、agentic coding harnesses 等使用方式。开放模型已经把“能不能接工具、能不能进 coding harness、能不能控制推理预算”放到了发布核心。
六、Gradio Workflow 与 Quantization-Aware Healing:落地工程的两块拼图
Gradio 发布 gr.Workflow,核心是把多步 AI pipeline 描述成 typed nodes graph,并直接生成可运行的拖拽画布、可见中间结果、REST API 和一键部署到 Hugging Face Spaces。示例包括图片编辑、并行图像生成、背景移除、voiceover、dataset profiling 和 GPU 模型节点。
这类工具降低了 AI 应用从 notebook/脚本走向可分享界面的门槛,尤其适合演示、内部工具和小团队快速验证。它和 LangGraph、OpenClaw canvas、Copilot canvases 的共同方向是:AI workflow 需要可视化、可运行、可调试,而不是藏在一段脚本里。
Multiverse Computing 介绍 Quantization-Aware Healing,目标是在模型已经结构压缩并量化到 4-bit 之后恢复能力。文章称,他们把 GPT-OSS 120B 压缩到 60B 并量化到 MXFP4 后,通过 QAH 让 4-bit 模型在 9 个 benchmark 中 7 个超过其 full-precision 版本。
这条需要谨慎看待:它是团队博客和论文口径,仍需独立复现。但方向重要,因为实际部署里模型经常先被压缩再量化,传统 healing 或 QAT 不一定适配这种“压缩 + 量化”组合。
重要更新
- OpenAI 全栈策略:将数据中心、芯片、模型、开发者平台、企业/消费产品和设备统一到 useful intelligence per dollar 的经济性指标下。
- OpenAI Jalapeño:首个自研推理芯片公开测试,面向 interactive agents 的低延迟和每瓦吞吐成为核心卖点,计划年底开始部署进 OpenAI 基础设施。
- OpenAI Admin plugin:ChatGPT Work/Codex 管理员可在对话中分析使用、管理权限和处理额度/支出请求,企业 AI 治理入口进一步产品化。
- GitHub Copilot:Customize tab GA,把 MCP servers、plugins、skills、canvases 聚合成 Copilot 扩展入口。
- Hugging Face / IBM Granite:Granite 4.2 发布,开源 reasoning 模型强调 512K context、native tool calling、thinking 模式和 agentic RL。
- Hugging Face / Gradio:gr.Workflow 把 AI pipeline 做成节点画布、REST API 和 Spaces 部署物,适合快速 PoC 和可视化调试。
人物 / 机构动态
- OpenAI:今天几乎占据高信号核心:基础设施、推理芯片、企业管理插件、影响行动治理四条线同时更新,说明它在补模型之外的全栈控制面。
- GitHub:Copilot app 正从代码助手变成团队 AI 工作台,Customize tab 是“扩展生态入口”的关键产品化动作。
- Hugging Face:继续是开放模型、部署工作流和模型效率的发现源;今天的 Granite 4.2 与 Gradio Workflow 都贴近 agent 工程落地。
- Simon Willison:本窗口新增 EVE Online Python 3 迁移记录,工程文化价值高,但与本 Follow List 的 AI/agent 主线关联较弱,本期不展开。
- Follow List X 账号:公开镜像未发现窗口内新增可用条目,不对个人账号做“无更新”以外的事实推断。
值得跟进项目
- AI 成本指标升级:为 AI 产业链研究增加 agent 任务级经济性指标,而不只看训练芯片和模型 benchmark。
- 企业 AI 管理控制台:参考 Admin plugin 与 Copilot Customize tab,设计 WorkBuddy 的权限、额度、插件、技能、审批和审计模块。
- Jalapeño 跟踪表:记录 OpenAI 自研芯片的部署时间、合作伙伴变化、benchmark 复现和对推理价格的潜在影响。
- 开放模型 agent harness:用 Granite 4.2、GPT-OSS、Qwen、Kimi 等跑同一组 tool-use / coding / eval 任务,比较可靠性和部署成本。
- Workflow UI PoC:用 Gradio Workflow 或 OpenClaw canvas 做一个可视化客户交付 demo,把节点执行、中间产物、审批和最终报告串起来。
待验证信息
- Jalapeño 的性能结果来自 OpenAI 官方发布,需等待第三方复测、更多 workload 细节和实际部署数据。
- OpenAI 对 GPT-5.6 Sol coding agent index 的成本/输出 token 表述需要结合 Artificial Analysis 原始榜单和任务定义交叉验证。
- Admin plugin 的实际可用范围、企业版权限模型、审批粒度和审计日志,需要等产品文档或实测确认。
- GitHub Copilot Customize tab 的 MCP/plugin/skill/canvas 权限边界和组织级分发机制,需要后续实测。
- Granite 4.2 的 agentic RL、512K context 和 tool calling 表现,需要通过独立 benchmark 与真实任务验证。
- Quantization-Aware Healing 的“4-bit 超过 full-precision”结果来自团队博客,需看论文、代码、训练配置和独立复现。
- LangChain RSS 本轮出现旧文被标成 2026-08-25 的异常;除非源站更正或有新公告,不作为今日新增。
低优先级噪音
- OpenAI 影响行动报告很重要,但与本日报的 agent/product/infra 主线相比偏安全治理背景;已保留原始链接,后续可单独做 AI 信息战专题。
- GitHub rule insights、push rules path exceptions 和 security advisory block users 对仓库治理有用,但不是 AI agent 主线,作为工程治理背景观察。
- Google AI Blog 今天的家居装饰搜索技巧偏消费搜索场景,和 Follow List 关注的 agent/工程/研究线关联较弱。
- Simon 的 EVE Online Python 3 迁移是长期软件维护案例,适合作为工程文化阅读,不进入今天高价值要点。
- explainx sitemap 最新仍停在 2026-08-19,AI 播客索引 JSON updatedAt 仍为 2026-07-02,均无本窗口新增。
原始链接
- OpenAI · The full stack behind abundant intelligence
- OpenAI · Jalapeño’s first results show industry-leading speed and efficiency in AI inference
- OpenAI · Introducing the Admin plugin for ChatGPT Work and Codex
- OpenAI · Disrupting a new covert influence campaign from Russia
- OpenAI News RSS
- GitHub · Copilot app Customize tab is generally available
- GitHub · Rule insights dashboard generally available
- GitHub · Push rules in rulesets now support path exceptions
- Hugging Face · Granite 4.2 LLMs: How They're Built
- Hugging Face · Wire It, Run It, Deploy It: AI Workflows in Gradio
- Hugging Face · Quantization-Aware Healing
- GitHub Changelog RSS
- Hugging Face Blog RSS
- Google AI Blog RSS
- Simon Willison Weblog Atom
- Interconnects RSS
- Chip Huyen RSS
- Eugene Yan RSS
- explainx.ai blog sitemap
- AI 播客索引 JSON