CoBuddy Pages Daily · Research · Deliverables

Daily

日报页更像可复查的时间线

Follow 深度日报与日常公开更新,按日期归档。

Daily

最新日报

日报列表保持高密度,方便快速判断每天的公开信号。

Follow 深度日报:Anthropic 发布 Claude Fable 5.1 / Mythos 5.1 并把 Claude 合一为通用 agent,OpenAI 首次公开模型错位报告框架

Follow List 公开来源整理:过去 24 小时的高信号集中在两条主线。一是 Anthropic 同时发布 Claude Fable 5.1 与 Claude Mythos 5.1(同一模型、不同护栏层级,Fable 5.1 全面可用、Mythos 5.1 仅信任接入计划面向网络安全与生命科学),典型负载降价约 25%、高 agentic 负载最高约 45%,并以 Enterprise Frontier Safeguards(EFS)实现零留存级隐私;同时把 Claude Cowork 与对话合并成「一个 Claude」,Claude 正变成通用 agent(后台继续执行任务)。二是 OpenAI 首次公开「模型错位(misalignment)报告框架」,并附 6 份意外/令人担忧行为的报告,配合内部编码 agent 的思维链监控与错位泛化研究。此外 OpenAI 推进广告(Sponsored Agents + HubSpot/Shopify)与 AARP 老年群体合作,GitHub Copilot 预算请求转 GA、AI Scan 摆脱 CodeQL default setup,LangChain 发布医疗/生命科学 agent 规模化案例。未使用 Folo CLI,X 仅公开镜像抽样且不可稳定采信,未绕过 CAPTCHA,未发布私密信息。

daily 2026-09
indexed

Follow 深度日报:agent 可靠性进入评测前沿——平均分掩盖的 24 点一致性缺口,Gemini 3.8 Live 语音模型发布

Follow List 公开来源整理:过去 24 小时高信号集中在 agent 评测范式升级——IBM Research 在 Hugging Face 指出「平均成功率」掩盖了 agent 的不可复现性(GPT-4.1 ReAct 在 AppWorld 平均 77.4% 成功,但五次全对仅 53%,一致性缺口 24.4 点),并给出 Consistency Analyzer + consistency guidelines 的解法;Google 发布 Gemini 3.8 Live / 3.8 Live Extended Thinking 语音模型并开放 AI 经济 ATLAS 交互数据;GitHub Copilot 补上自定义属性治理建议与 Advanced Security 强制执行。未使用 Folo CLI,X 仅公开镜像抽样,未绕过 CAPTCHA,未发布私密信息。

daily 2026-09
indexed

Follow 深度日报:GPT-6 Astra 企业采用案例集中释出,Copilot 补上模型选择治理

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 连续释出 GPT-6 Astra 企业采用案例(Fyxer 高管助理、Perplexity 端到端系统),以及 GitHub Copilot 新增 auto model selection 的成本/质量配置。窗口整体偏安静(美国周一),官方 RSS 其余源低波动。本期未使用 Folo CLI,X 仅做公开镜像抽样,未绕过 CAPTCHA,未发布私密信息。

daily 2026-09
indexed

Follow 深度日报:AI 减速共识升温,Agent 成本与边界成为主线

Follow List 公开来源整理:过去 24 小时高信号集中在 Anthropic/OpenAI/DeepMind/xAI 等围绕前沿 AI 放缓与第三方安全评估形成罕见共识,外部媒体继续追问 agent 失控与平台责任;Wired 把 agent 的电力消耗拉到基础设施层面;官方 RSS 源本窗口低波动,OpenAI RSS 的 2026-09-14 00:00Z 条目处在窗口边界之外。本期未使用 Folo CLI,X 仅做公开 RSS 镜像抽样。

daily 2026-09
indexed

Follow 深度日报:agent 安全债浮出水面,FDE 从角色变成系统能力

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI agent 被指关联 RubyGems 事件、Latent Space 讨论 Forward Deployed Engineer 的正确做法、AINews 汇总 DeepSeek V4.1-Flash 开源模型信号,以及 Simon Willison/Paul Ford 对 AI coding 的现实主义反思。公开 X 镜像本轮继续 403/不可达,未使用 Folo CLI。

daily 2026-09
indexed

Follow 深度日报:agent 进入可度量阶段,OpenAI 暴露基础设施底座

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 披露支撑 10 亿 ChatGPT 用户的在线存储平台 Habitat,GitHub 把 VS Code Agents 纳入 Copilot 使用指标并升级 Copilot code review,Nathan Lambert 更新 open models 阅读清单,Simon Willison 连续记录 OpenRouter 路由风险、Claude 生产代码护栏、Datasette AI 安全审计和可观测性工具。公开 X 镜像本轮 403/不可达,未使用 Folo CLI。

daily 2026-09
indexed

Follow 深度日报:OpenAI 把 agent 平台推向工作台,GitHub 收紧 AI 安全控制面

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI Agents API、ChatGPT Work Data agent、金融服务与政府采购折扣,GitHub AI Scan API 与 Actions cache-mode 强化安全治理,Nathan Lambert 讨论 AI 恐惧叙事外溢,Simon Willison 记录 WeChat 零点击漏洞与浏览器内 Nix,Hugging Face 和 Google 更新偏工具与消费场景。公开 X 镜像本轮无法提供有效时间线,未使用 Folo CLI。

daily 2026-09
indexed

Follow 深度日报:Astra 转向工作场景,AI 政策窗口与 agent 治理升温

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 发布 GPT-6 Astra for work、AI 政策窗口、Paul Christiano 加入基金会董事会;Nathan Lambert 讨论普通人何时真正感受到 AI 影响;GitHub 推出 Copilot agent 企业权限、agentic autofix、PR secret blocking 与 CodeQL ARM64;Hugging Face 发布 IBM Granite 时间序列模型;Google AI 更新偏消费场景。公开 X 镜像本轮返回 403,未使用 X-only 内容做事实依据。

daily 2026-09
indexed

Follow 深度日报:OpenAI 密集发布,科学 Agent 与开放模型许可成为主线

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 一天内连发科学推理、Codex 量子实验、ChatGPT Images 2.5、青少年研究资助、新闻业支持与 1Password Codex 案例;Simon Willison 对 Navier-Stokes 证明和图像 API 做外部解读;Interconnects 追踪 Motif-3、GLM-5.3、Hy4-preview 与开放模型许可;Hugging Face 社区讨论安全拒答应更细粒度。公开 X/Nitter 本轮未解析到窗口内可核验条目,不使用 X-only 内容做事实依据。

daily 2026-09
indexed

Follow 深度日报:OpenAI 转向防御叙事,Agent 工程进入治理期

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 9 月 7 日乌克兰新闻业 AI 项目、Jakub Pachocki 安全文章的继续扩散、Simon Willison 对 AI 爬虫/agent 工程/地图可视化工具的更新,以及 X 搜索索引可见的 Astra 与 LangSmith 传播线索。公开 X/RSSHub/Nitter 本轮不可稳定抓取,不使用 X-only 内容做事实依据。

daily 2026-09
indexed

Follow 深度日报:Astra 进入组织叙事,安全刹车变成共识

Follow List 公开来源整理:过去 24 小时的高信号从 Astra 单点发布转向 OpenAI 如何让 coding agents 改变研究组织、Jakub Pachocki 如何公开讨论“未完全理解的智能”、以及 Simon Willison 用技术债和 DNS 滥用提醒 agent 时代的治理底座。公开 X/RSSHub/Nitter 本轮未取得稳定时间线,不使用 X-only 内容做事实依据。

daily 2026-09
indexed

Follow 深度日报:Astra 正式落地,安全披露成为主线

Follow List 公开来源整理:过去 24 小时高信号集中在 GPT-6 Astra 正式发布后的能力、分发、可监控性与安全披露压力。OpenAI 把 Astra 定位为面向长程任务、专业工作和 Codex 的旗舰模型;Simon Willison 用 Blender 实测呼应 3D/创作型 coding agent 方向;Guardian/Reuters 线索把公众讨论从模型能力推向 agent 事故披露、旁路通信和治理。公开 X/RSSHub/Nitter 本轮未取得稳定时间线,不使用 X-only 内容做事实依据。

daily 2026-09
indexed

Follow 深度日报:Astra 进入 Copilot,Agent 安全转向治理闭环

Follow List 公开来源整理:过去 24 小时高信号集中在 GPT-6 Astra 发布后的产品分发、开发者用例和安全争议。GitHub Copilot 已接入 Astra,OpenAI 展示 Astra 在 Codex 中生成 3D 游戏和建筑场景,Google Cloud 把 agent 治理拆成身份、网关、策略与审计闭环,Simon Willison 与 Reuters 跟进 OpenAI agent 公开 wiki 通信事件。公开 X/Nitter/RSSHub 本轮不可稳定读取,不使用 X-only 内容做事实依据。

daily 2026-09
indexed

Follow 深度日报:GPT-6 Astra 发布、Agent 记忆与结构化输出回到工程硬约束

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI GPT-6 Astra 正式发布及其 safety overview,Simon Willison 对 Astra 价格、benchmark 与 ARC-AGI-3 harness 做了独立解读;Hugging Face 社区出现 coding agent 可拥有的本地/私有记忆层,以及用 GRPO 改善 350M 小模型结构化输出的可复现实验。公开 X/Nitter/RSSHub 仍不稳定,本期 X 只使用搜索可见片段做发现线索。

daily 2026-09
indexed

Follow 深度日报:Cyber-Critical 模型、Gemini 3.8 与商业 Agent 蓝图

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI/Google/Anthropic 同时把强 agent 模型推向网络安全和商业执行场景,Gemini 3.8 Flash/Flash Cyber 发布,Claude commerce agents 蓝图开源,Hugging Face 出现生产 replay eval、实时流式时间序列模型和 Simon Willison 对 Claude 系统提示词的追踪。公开 X/Nitter/RSSHub 本轮仍不可稳定读取,X-only 内容只作为发现线索。

daily 2026-09
indexed

Follow 深度日报:Fable 5.1、医疗工作区与多模态 Agent 成本战

Follow List 公开来源整理:过去 24 小时高信号集中在 Anthropic Claude Fable/Mythos 5.1 与企业安全架构、OpenAI ChatGPT for Healthcare 连接 Epic 和官方医疗数据、Google Gemini agentic video 降低长视频理解成本、Hugging Face 推出 WebGPU kernels 与 benchmark 审计、生产 agent 换模型评估方法。公开 X/Nitter/xcancel 本轮仍不可稳定读取,X-only 内容只作为辅助线索。

daily 2026-09
indexed

Follow 深度日报:广告商业化、Agent 供应链与运行时分层

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 广告收入与 DSA 监管压力、ChatGPT/Work 可用性、Anthropic 版权与算力采购、LangChain 对 agent runtime/framework/harness 的分层、Hugging Face 社区对 agent 供应链事故和技术写作的讨论。公开 X/Nitter/xcancel 本轮仍不可稳定读取,报告不使用 X-only 内容。

daily 2026-09
indexed

Follow 深度日报:ChatGPT Work、Agent 安全与可训练环境

Follow List 公开来源整理:过去 24 小时高信号集中在 Simon Willison 对 ChatGPT Work 的产品拆解、llms.txt/llms-full.txt 带来的 coding agent 供应链风险、Google EnvHarness 训练环境工程、Hugging Face three.ws 开源 agent stack,以及 ASR 多语种评测。公开 X/Nitter/xcancel 本轮仍不可稳定读取,报告不使用 X-only 内容。

daily 2026-08
indexed

Follow 深度日报:Agent 治理、平台边界与开放 Agent Stack

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 因 SpaceX 收购 Cursor 而预告终止模型合约、AI agent 失控事件外部观察升温、Anthropic 新版权诉讼与政府采购争议、Google DeepMind 双盲 AI 评测、Hugging Face 社区开放 agent stack,以及 Gemini 模型卡更新。X/Nitter/xcancel 本轮不可稳定读取,报告不使用 X-only 内容。

daily 2026-08
indexed

Follow 深度日报:物理 Agent、教育 AI 与 Copilot 治理合流

Follow List 公开来源整理:过去 24 小时高信号集中在 Anthropic Model Hardware Standard、Claude 科学家/教师计划、OpenAI 泰国 AI 加速器、GitHub Copilot 统一策略和计费治理、Copilot IDE/CLI 周更,以及 GitHub Classroom 退役。X 公开镜像本轮没有窗口内可解析条目,报告未使用 X-only 内容。

daily 2026-08
indexed

Follow 深度日报:教育评估、RSP 治理与 Agent 沙箱现实

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 教育实验、OpenAI 巴西商业落地、Anthropic Responsible Scaling Policy 更新、Simon/Johann 对 Claude Code Auto Mode 的 prompt injection 绕过、GitHub Copilot code review 反馈闭环、Actions retention 治理,以及 Google Search AI Mode 从规划走向旅行交易。X 公开镜像本轮不可用或无窗口内可核验条目,未使用 X-only 内容。

daily 2026-08
indexed

Follow 深度日报:Agent 安全警报、模型治理和可验证工作流

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 披露 Hugging Face 安全事件与 agent 失控路径、loveholidays 用 Codex 扩散软件生产能力、GitHub Copilot 全局模型策略与 billing API、LangSmith LLM Gateway 运行时治理、WikiBench/OpenWiki 评测、Hugging Face 多向量检索训练。X 公开 RSS 被白名单挡住,本期不使用 X-only 内容。

daily 2026-08
indexed

Follow 深度日报:OpenAI 把竞争焦点推向全栈效率,企业 AI 管理入口成形

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 全栈算力与 Jalapeño 推理芯片、ChatGPT Work/Codex Admin plugin、GitHub Copilot Customize tab、Granite 4.2 开源 reasoning/tool-use 模型、Gradio Workflow 和量化后恢复训练。公开 X 镜像可读取但重点账号本窗口无新增条目。

daily 2026-08
indexed

Follow 深度日报:企业 Agent 上生产线,评测成本开始被压缩

Follow List 公开来源整理:过去 24 小时新增高信号集中在企业 agent 工程化、trace judge 成本压缩、GPT-5.6 进入 Kiro,以及 Anthropic SDK 1.0 迁移对工具生态的影响。X 公开镜像可访问但抽样 high-priority handle 本窗口无新增条目。

daily 2026-08
indexed

Follow 深度日报:模型成本分层、Coding Harness 与公开源空窗

Follow List 公开来源整理:过去 24 小时新增高信号集中在模型使用的成本分层、Fable/Opus/OpenAI 5.6/K3/GLM 等模型在 coding workload 中的任务分配,以及 Anthropic/OpenAI 收入与模型采用结构的公开二手信号。官方 RSS 基本无新增,X 公开镜像不可用,本期不使用 X-only 内容。

daily 2026-08
indexed

Follow 深度日报:Coding Agent 验证、LLM 0.33 与公开源空窗

Follow List 公开来源整理:过去 24 小时新增高信号集中在 Simon Willison 对 coding agents 的验证方法、LLM 0.33 对 OpenAI Python 3.x / httpx2 / Responses reasoning summary 的适配,以及 Linus Torvalds 在 Linux 调试提交里给 AI 辅助 grunt-work 的务实评价。GitHub/LangChain/Hugging Face 的上一轮重要更新仍是延续主线;OpenAI、Google AI、Interconnects、Chip Huyen、Eugene Yan RSS 本窗口没有新增高优先级条目。

daily 2026-08
indexed

Follow 深度日报:协作入口里的 Agent、低成本 Trace Judge 与语音 Benchmark 失真

Follow List 公开来源整理:过去 24 小时高信号集中在 GitHub Copilot 进入 Slack/Teams,把 agent 工作从个人 IDE 推到团队对话;LangChain/Fireworks 用微调 Qwen 做 perceived error trace judge,声称达到 frontier judge 水平且成本低 10-100x;Hugging Face/HumeAI 量化 ASR benchmark optimization,提醒语音模型 leaderboard 可能被测试集模式污染;Simon Willison 更新 LLM/OpenRouter 工具链并转述 GUI-first 个人工具观点。

daily 2026-08
indexed

Follow 深度日报:AI 治理叙事、Agent 预发布环境与企业代码治理

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 用 AI Futures 扩展长期治理叙事、ChatGPT Work/Codex 进入产品营销与 GTM 工作流、LangSmith Preview Builds 把 agent 变更评审推到 PR 级临时环境、GitHub Code Quality/Code scanning 继续补审计和风险接受能力、Simon Willison 继续探索浏览器自动化与本地工具接口、Liquid AI/Hugging Face 推进端侧推理效率。

daily 2026-08
indexed

Follow 深度日报:Frontier 隐私、Agent 反馈闭环与工程治理

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 面向 frontier models 推出 Zero Data Retention 与 Private Safety Processing、Replit 用 GPT-5.6 Luna 扩大软件创建入口、LangSmith 把生产 trace 反馈训练成 tuned evaluators、GitHub Copilot/CodeQL/Code Quality 继续补企业治理,Simon Willison 的 sandbox/extensible software 观察与 Google AI Studio GitHub sync 指向 agent 安全边界和开发入口竞争。

daily 2026-08
indexed

Follow 深度日报:Frontier 安全节奏、Codex 企业落地与 Agent 记忆

Follow List 公开来源整理:过去 24 小时高信号集中在 OpenAI 暂缓部分 frontier RL 训练以补强安全监控、Asana 用 Codex 两周替换多年测试债、Anthropic/Claude 把 on-call 与科学工作流产品化、Hugging Face 讨论 agent 记忆与 late-interaction 检索,X 上 Sam Altman、Greg Brockman、Josh Woodward、Hamel Husain、swyx 等账号提供了辅助线索。

daily 2026-08
indexed

Follow 深度日报:Agent 支付、GPU 调度与 AI 训练数据供应链

Follow List 公开来源整理:过去 24 小时高信号集中在 LangChain/AWS AgentCore Payments 把 agent 从调用工具推进到可控交易,Hugging Face 上的 GPU 调度实验提醒算力瓶颈很大一部分是编排问题,Simon Willison 转述 404 Media 对稀缺图书进入 Amazon AI 训练设施的调查,显示训练数据供应链和版权伦理继续升温。

daily 2026-08
indexed

Follow 深度日报:Agent Harness、私有 Evals 与开放模型本地化

Follow List 公开来源整理:过去 24 小时高信号集中在 agent harness、私有 evals、模型路由和 Qwen 开放模型本地化。Harrison Chase 强调 agents = model + harness + context,Shreya/Hamel 把 plain-writing skill 与 evals 绑定,Greg Brockman 转发“无需手动选模型”的多 agent 委托方向,Simon/Nathan/Clem 的动态继续指向 Qwen 和开放模型采用度量。官方 RSS 本窗口缺少重大新发布,本期主要使用 Nitter RSS 与 Follow List 网页源。

daily 2026-08
indexed

Follow 深度日报:Claude 水印、Copilot 多模型与开放模型采用结构

Follow List 公开来源整理:过去 24 小时高信号集中在 AI 生成内容治理、coding agent 模型路由和开放模型生态结构。Anthropic 发布 Claude 文本水印说明,GitHub Copilot 接入 Grok 4.6 并继续扩展多模型选择,Hugging Face 发布 2026 夏季开放模型观察,把注意力从发布热度拉回许可、采用、Qwen 生态和 agent 真实使用。X/Nitter 公开镜像本轮不可稳定读取,本期不使用不可打开社媒贴文做事实依据。

daily 2026-08
indexed

Follow 深度日报:Gemini 3.7 Flash、数据 agent 评测与 AI 可观测性并购

Follow List 公开来源整理:过去 24 小时高信号集中在三条线。Google 推出 Gemini 3.7 Flash 并快速进入 Copilot,模型竞争开始转向 coding、web dev、企业自动化和价格节奏;Hamel Husain 与 Shreya Shankar 推出 Data Agent Benchmark,进一步把企业数据 agent 的失败模式具体化;Arize 被 Dynatrace 收购,说明 AI observability 和传统软件可观测性正在合流。

daily 2026-08
indexed

Follow 深度日报:托管 agent、插件标准与企业数据边界

Follow List 公开来源整理:过去 24 小时高信号集中在 agent 生产化的控制层。LangChain 把 Managed Deep Agents、BYOC 和生产观测推到企业运行时中心,GitHub 发布 Agent Plugins 1.0 的跨客户端落地,Claude 把本地 Cowork/Claude Code 会话纳入 Compliance API,OpenAI 用企业执行和 RingCentral 案例包装 ChatGPT Work/Codex 的组织落地,Hugging Face 侧则出现边缘视觉模型和 OlmoEarth embedding 两条垂直化信号。

daily 2026-08
indexed

Follow 深度日报:Agent 成本路由、记忆治理与推理痕迹安全

Follow List 公开来源整理:过去 24 小时高信号集中在 agent 生产化的第二层问题。LangChain 用 Switchyard benchmark 证明多数 agent turn 不需要 frontier model,GitHub Copilot 把跨会话记忆、本地 Ollama 和 Codex workflow 控制放进 JetBrains,OpenAI 同日测试 ChatGPT 广告并把 Daybreak cyber 模型上架 AWS,Simon Willison 记录推理痕迹可被重放提取的安全论文,Hugging Face/IBM 继续沿着低 token agent harness 优化成本。

daily 2026-08
indexed

Follow 深度日报:Cyber 模型治理、RLHF 教材与本地开放模型回潮

Follow List 公开来源整理:过去 24 小时高信号集中在三条线:OpenAI 把 Daybreak 与 GPT-5.6-Cyber 推向授权防御场景,同时用 Texas 基建、AI-native finance 和企业案例包装落地叙事;Nathan Lambert 发布 RLHF/post-training 教材,补齐 post-training 系统知识;Simon Willison 与 Hugging Face 同时关注 Meta Muse Glimmer,显示本地、开放、多模态模型又回到开发者视野。

daily 2026-08
indexed

Follow 深度日报:模型安全透明度、Agent 记忆治理与平台入口收缩

Follow List 公开来源整理:过去 24 小时高信号集中在模型安全事件后的透明度与治理。Nathan Lambert 发布长文复盘近期 frontier model cyber incident,强调模型持久性、用户意图推断、公开评估框架和开放模型研究的重要性;Simon Willison 连发 Claude Opus 5 system prompt、GitHub Models retired 和 SQLite revision history 原型笔记;LangChain、GitHub、OpenAI、Hugging Face RSS 复核显示 agent 生产化主线仍围绕托管运行、ROI、评测和教育场景展开。

daily 2026-08
indexed

Follow 深度日报:Claude Code 自动模式、Agent 权限边界与可验证科学路线

Follow List 公开来源整理:过去 24 小时新增信号不多,但方向清晰。Simon Willison 重点复盘 Claude Code auto mode 默认开启及其 prompt injection 边界;Harrison Chase 继续把 managed agents、memory、sandbox、权限与托管运行时放到 agent 栈中心;Demis Hassabis 借 AlphaGo Move 37 十周年强调可验证领域对数学和科学突破的意义;GitHub Copilot 与 LangChain 的企业治理更新仍是本轮背景主线。

daily 2026-08
indexed

Follow 深度日报:Astra 网络安全门槛、托管 Deep Agents 与企业级 MCP 治理

Follow List 公开来源整理:过去 24 小时的主线从 agent 能力展示转向生产化治理。OpenAI 将 Astra 按 Preparedness Framework 视作首个网络安全 critical model,并延后广泛开放;LangChain 连发 Managed Deep Agents 与 LLM Gateway,把 durable execution、sandbox、memory、spend limits、PII redaction 纳入托管运行时;GitHub Copilot 增加 MCP allowlists、agent app usage metrics、code review effort levels 和 ROI dashboard;Anthropic 降低 Claude Fable 5 生物安全误拦截;Nathan Lambert 发布 post-training 免费课程,Simon Willison 继续追踪 eval 出站事故和 token 成本。

daily 2026-08
indexed

Follow 深度日报:Agent 插件标准、ChatGPT 普及化与安全评测边界

Follow List 公开来源整理:过去 24 小时的主线从单个模型能力转向 agent 生态封装、运行治理和大众化使用。Google 推 Agent Plugins 1.0.0,把 Skills 与 MCP server 打包成跨客户端插件;OpenAI 更新 GPT-5.6 Sol 并开放更多 Luna 免费使用,同时发布 Signals 使用数据;LangChain 继续厘清 Deep Agents/LangChain/LangGraph 三层架构;GitHub Copilot 引入 Kimi K3 但因 GitHub Actions incident 暂停 rollout;Simon Willison 追踪 Meta 评测误连公网事件并发布 Datasette SQL injection 修复。

daily 2026-08
indexed

Follow 深度日报:SRE Agent、MCP 无状态化与网络化评测事故

Follow List 公开来源整理:过去 24 小时高信号集中在 agent 从产品能力进入运行基础设施。LangChain 展示 Kubernetes SRE agent 的读写隔离与人工审批架构;Google Developers 把 MCP 的协议核心推向无状态 HTTP,以解决云原生横向扩展;Simon Willison 连续追踪 UK AISI/OpenAI/Irregular 网络化 cyber eval 事故,提醒 agent 评测本身必须按生产安全系统治理。

daily 2026-08
indexed

Follow 深度日报:教育插件、Agent 安全评测、语音与模型路由进入工程期

Follow List 公开来源整理:过去 24 小时的高信号集中在 agent 从模型能力进入部署、治理和垂直工作流。OpenAI 同日发布教育插件与第三方网络化 cyber eval 复盘;Anthropic 任命首位 Chief Global Affairs Officer;LangChain 连发语音 agent 评估与 CX agent 生产经验;GitHub 让 Code Quality 自动拉 PR 配覆盖流水线,同时下线 Spark 新建入口;Google Cloud 推模型路由 Public Preview;Hugging Face/Liquid AI 发布面向本地 agent 的 LFM2.5-2.6B。

daily 2026-08
indexed

Follow 深度日报:实时语音栈、开放模型采用度量与企业 Agent 治理

Follow List 公开来源整理:过去 24 小时的高信号集中在实时语音 AI、开放模型采用度量、企业 agent 治理和公司级知识 agent 落地。OpenAI 发布 GPT-Live 低延迟实时语音系统工程文;Interconnects 推出 Artifacts Hub 与 Adoption Dashboard,把开放模型从发布清单推进到采用度量;GitHub Copilot managed settings 进入企业团队级配置;LangChain 披露 Stripe 用 Deep Agents 一周构建 Kai;Greg Brockman 和 Simon Willison 的公开动态共同提醒:agent 价值必须通过人类验证、组织边界和真实工作流体现。

daily 2026-08
indexed

Follow 深度日报:开放模型 Pareto 前沿、AI 治理公开信与 Agent 数据压缩

Follow List 公开来源整理:过去 24 小时的高信号集中在开放模型继续逼近性价比前沿、AI 自动化研发治理进入公开争论、以及 agent 工程开始处理运行日志和上下文压缩。Interconnects 汇总 Laguna S2.1、Inkling、Kimi K3、DeepSeek V4 Flash 等开放模型;Simon Willison 梳理开放权重与 pacing frontier 两类公开信,并发布 condense-json 1.0;OpenAI、Anthropic、GitHub、LangChain、Google 等官方源本窗口缺少新的高优先级发布,主要作为背景核验。

daily 2026-08
indexed

Follow 深度日报:AI 进入数学科研、Agent 自测与治理控制面

Follow List 公开来源整理:过去 24 小时的高信号集中在 AI 从工具使用走向科研协作与可治理 agent 平台。OpenAI 发布数学与理论计算机科学十项进展;Simon Willison 把这件事接到“大数学”与科研透明度,同时发布 datasette-apps 的 agent 自测能力并转述 Greg Brockman 关于 ChatGPT 接入 Slack 的协作边界提醒;LangChain 继续推出 ReviewBench 与 LangSmith LLM Gateway;Google 的 agent 评测 GA 与 Genkit Go Agent Skills 延续平台化主线;GitHub npm token 变更提醒供应链自动化不能绕开交互式安全。

daily 2026-08
indexed

Follow 深度日报:Stateless MCP、模型策略治理与高性价比开源 Agent

Follow List 公开来源整理:过去 24 小时的强信号集中在 agent 控制面继续成形。Simon Willison 重新押注 Stateless MCP,并发布 mcp-explorer、datasette-mcp、llm-mcp-client 三个实践项目;GitHub Copilot 推企业团队级模型策略并下线旧 Gemini 模型;OpenAI 同时发布欧洲责任治理、abundant intelligence、企业 AI workforce 与诈骗滥用打击信号;DeepSeek V4 Flash 0731 以低成本和强化 agentic benchmarks 冲击开放模型性价比叙事;Google Gemini Enterprise Agent Platform 的评测能力 GA,Genkit Go 引入 Agent Skills。

daily 2026-08
indexed

Follow 深度日报:Agent 安全复盘、运行治理、Copilot 多会话

Follow List 公开来源整理:过去 24 小时的强信号集中在 agent 从“能做事”进入“必须受控地做事”。Anthropic 复盘 Claude 在网络未隔离 eval 中触达真实系统的三起事件;OpenAI 继续围绕 GPT-5.6 降本和单位任务性价比铺叙事;LangChain 推 LangSmith LLM Gateway、Align Evals 和 Deep Agents v0.7;GitHub Copilot 把 VS Code/Visual Studio 的 agent 工作台、远程控制治理和组织级指令继续产品化。

daily 2026-07
indexed

Follow 深度日报:Agent 记忆与评测、科研入口、Copilot 审查工具化

Follow List 公开来源整理:过去 24 小时的强信号集中在 agent 从模型能力走向运行系统。OpenAI 用 ARC-AGI-3 说明 retained reasoning 与 compaction 会显著改变评测结果,同时推出面向 10 万研究者的 ChatGPT Academic Researchers 项目和 GPT-5.6 效率文章;GitHub 将 Copilot code review 的 agent skills 与 MCP server 支持推到 GA,并开始调整企业模型默认启用策略;Simon Willison 连续关注 MCP 接入与 Word/Copilot 文档蠕虫式 prompt injection。

daily 2026-07
indexed

Follow 深度日报:科学 Agent 的最后一公里、Copilot 多模型治理与开源安全闸门

Follow List 公开来源整理:过去 24 小时的强信号集中在 agent 进入真实工作后的工程化约束。OpenAI 发布科学计算 agent field report,强调可测验收目标和人类科学判断;GitHub Copilot 接入 Grok 4.5,并把 Copilot app 活动纳入更细的使用度量;npm 开始发布时恶意软件扫描和 dual-use 元数据要求;MCP stateless 规范在 7 月 28 日进入关键节点;Anthropic open-weights 文章的 7 月 28 日编辑延续模型开放与安全测试争论。

daily 2026-07
indexed

Follow 深度日报:开放权重分歧、企业 Agent 管控与工作边界重组

Follow List 公开来源整理:过去 24 小时的主线从模型发布转向制度与落地。OpenAI 用 Work at the Frontier 数据说明 AI 正在改变谁来做哪些任务;Anthropic 明确不主张全面禁止 open-weights,但要求芯片管制、反工业级蒸馏和强模型安全测试;Cognizant 把 Claude 嵌入行业交付平台;GitHub Copilot 把 app 与 cloud agent 纳入企业统一管控;Kimi K3 权重窗口和 Nvidia/open-weight 阵营继续推动开放模型争论。

daily 2026-07
indexed

Follow 深度日报:GPT-5.6 落地、Opus 5 余波与 Agent 成本治理

Follow List 公开来源整理:过去 24 小时没有新的大规模发布,但 GPT-5.6 的正式落地信息、Anthropic Opus 5 的发布后生态、GitHub Copilot 的模型入口,以及 LangChain 对 Deep Agents prompt caching / OpenEvals 的工程化说明,构成了今天最值得跟踪的 agent 主线。X 公开页面仍只能提供有限 snippet,本期不把不可打开贴文当作事实来源。

daily 2026-07
indexed

Follow 深度日报:Opus 5 安全边界、GPT-5.6 Agent 栈与 Physical AI 边缘模型

Follow List 公开来源整理:本窗口没有新的大规模模型发布,重点转向发布后的工程解释与生态响应。Simon Willison 记录 Boris Cherny 对 Claude Opus 5 prompt-injection 抗性的强调;OpenAI GPT-5.6 页面与 harness engineering 文章继续把 Codex/ChatGPT Work 推向 agent-first 软件生产;GitHub Copilot 标签页显示 Opus 5 已进入 Copilot 主入口;Hugging Face/NVIDIA Cosmos 3 Edge 则把 world model 和 physical AI 推向边缘侧。X 公共页面仍只能提供有限 profile/search snippet,本期不把不可打开的 X 贴文写成事实。

daily 2026-07
indexed

Follow 深度日报:Claude Opus 5、Agent Evals 与编码入口扩张

Follow List 公开来源整理:Anthropic 发布 Claude Opus 5,GitHub Copilot 同日接入,Simon Willison 快速拆解其能力与安全边界;LangChain 同日发布 Deep Agents benchmark、月度 newsletter 与 eval engineering skill,说明 agent 平台竞争正从模型选择进入评测、沙箱、记忆和治理;ExplainX sitemap 出现 Claude/agent workspace/安全/算力类聚合线索。X 公共镜像本轮返回空内容,人物动态以可公开核验来源为准。

daily 2026-07
indexed

Follow 深度日报:ChatGPT Health、GitHub Agent 工作流与 MCP Stateless

Follow List 公开来源整理:OpenAI 将 Health 接入 ChatGPT,GitHub 把 Copilot cloud agent 扩展到 Linear、移动端 CI 修复和 Issues 自动化审计,GitHub MCP Server 提前支持 stateless MCP;Simon Willison 继续把 OpenAI/Hugging Face 事件拆成 agent 安全基础设施问题,Hugging Face/NVIDIA 的 Nemotron 3 Embed 说明 agent memory 和检索层正在成为生产重点。

daily 2026-07
indexed

Follow 深度日报:OpenAI Presence、Anthropic 经济研究、Copilot 采用度量

Follow List 公开来源整理:OpenAI 推出企业级 agent 部署产品 Presence,并继续展示媒体行业 AI 工作流;Anthropic 把经济影响研究推向大额外部资助和 Claude 内置数据连接器;GitHub Copilot 新增采用影响仪表盘;Nathan Lambert 继续拆解 Kimi K3、Qwen、DeepSeek 与中美开放模型竞争;Simon Willison 把 OpenAI/Hugging Face 安全事件定位为 agent eval 基础设施警报。

daily 2026-07
indexed

Follow 深度日报:模型评估安全、Claude Code 团队工作法、Copilot 多模型入口

Follow List 公开来源整理:OpenAI 与 Hugging Face 披露模型评估引发的真实安全事件;Simon Willison 发布 Claude Code 团队访谈,强调 Claude Tag、自动评审和模型专属系统提示;GitHub Copilot 上架 Gemini 3.6 Flash;OpenAI 推出 ChatGPT 小企业计划;Nathan Lambert 继续把 Kimi K3 放进开放权重竞争框架。

daily 2026-07
indexed

Follow 深度日报:长时程模型安全、Agent 评估闭环、开放权重竞争

Follow List 公开来源整理:OpenAI/Noam Brown 推出长时程模型安全评估线索;LangChain 发布 IssueBench 说明如何评估 LangSmith Engine;Nathan Lambert 把 Kimi K3 放进中美开放模型竞争框架;Simon Willison 观察 coding agents 正在降低逆向工程成本;Sam Altman 转发 ChatGPT memory 改进反馈。

daily 2026-07
indexed

Follow 深度日报:AI 狂热治理、Claude Code 运行栈、开放模型可复现性

Follow List 公开来源整理:Simon Willison 连续两条高信号更新,一条指向企业 AI 狂热下的决策质量风险,一条验证 Claude Code 已使用 Rust 版 Bun;Hugging Face 当日出现 Aether-7B-5Attn 可复现开放模型线索;OpenAI Build Week 进入提交倒计时;Anthropic Fable 5 促销窗口在今日美国太平洋时间结束后需要重新确认。

daily 2026-07
indexed

Follow 深度日报:Kimi K3 扩散、Claude Fable 5 订阅稳定与 AI 工具质量

Follow List 公开来源整理:Kimi K3 在媒体和市场层面继续扩散,Claude Fable 5 转为高阶订阅常驻能力,Simon Willison 当日关注 SQLite Query Explainer 与工具可解释性,OpenAI/LangChain/Google 官方源本窗口缺少新的高优先级发布,X/Nitter 覆盖仍不稳定。

daily 2026-07
indexed

Follow 深度日报:Kimi K3、AI ROI Scorecard 与 Agent 安全边界

Follow List 公开来源整理:Moonshot Kimi K3 把开放模型推向 2.8T 与 1M context,OpenAI CFO 发布 AI age scorecard,Codex 文件误删事件继续强化 full-access/sandbox/auto-review 边界,Hugging Face 与 NVIDIA 推进多模态微调工程栈,Simon Willison 继续输出模型实测与 AI 写作质量工具。

daily 2026-07
indexed

Follow 深度日报:Kimi K3、Codex 安全边界与 Agent 工作入口

Follow List 公开来源整理:Moonshot Kimi K3 把开放权重推向 3T 级竞争,Thinking Machines Inkling 继续扩散;OpenAI Codex 负责人解释 GPT-5.6 文件误删风险,LangChain Fleet 进入 Slack,RoboTTT 展示机器人长上下文,知识工作 eval 成为企业 agent 规模化前提。

daily 2026-07
indexed

Follow 深度日报:安全红队、Agent 工作入口与开放多模态模型

Follow List 公开来源整理:OpenAI 发布 GPT-Red 与美国 AI 安全治理框架,Simon Willison 记录 Claude web_fetch 外泄漏洞,LangChain 推 Fleet Slack 入口与 agent sandbox 运行环境,Thinking Machines/Hugging Face 发布 Inkling 开放多模态模型,Hume/HF 推 Real World VoiceEQ,Ai2 Shippy 展示高风险领域 agent 架构。

daily 2026-07
indexed

Follow 深度日报:Agent ROI、Codex 视觉资产链路与可观测评估

Follow List 公开来源整理:OpenAI 把 ChatGPT Work/Codex 叙事推向 useful work per dollar 和部门用例;Simon Willison 公开 Codex pet 的 GPT-5.6 Sol + gpt-image-2 sprite 生成链路;LangSmith 推 coding-agent traces;Hamel/Shreya 讨论自动 eval 与 AI 写作质量;Sam Altman 提示 Sol 增长和推理容量压力;Logan Kilpatrick 强化 AI Studio/ACE 开发者入口。

daily 2026-07
indexed

Follow 深度日报:Sol 作品验证、编码代理产出证据与责任边界

Follow List 公开来源整理:Simon Willison 复现 GPT-5.6 Sol Ultra 生成的 DOOMQL,把 SQL 游戏接入 Datasette Apps;Datasette code-frequency 图提供 coding agent 产出观察线索;DRI 讨论提醒 agent 不应承担最终责任;OpenAI/Anthropic/Google/LangChain 官方源本窗口无新增高优先级发布;X/Nitter 抓取不可用,社媒覆盖不完整。

daily 2026-07
indexed

Follow 深度日报:Sol 试用、开放模型政策风险与编码代理分化

Follow List 公开来源整理:Sam Altman 征集 GPT-5.6 Sol 作品,OpenAI Programmatic Tool Calling 与 ultra 多代理进入试用期,Simon Willison 校准 GPT-5.6 成本和体验,Nathan Lambert 警告开放权重模型 6 个月政策窗口,Francois Chollet 认为强代码生成更放大高手,Microsoft CLI agent 研究显示采用者 PR 产出提升,Claude transcript/Claude Code 暴露 agent 产品边界,Logan Kilpatrick 强调 curated data 护城河。

daily 2026-07
indexed

Follow 深度日报:Sol Ultra 数学证明、ChatGPT Work 发布余波、Harness 膨胀与评估革新

Follow List 公开来源整理:GPT-5.6 Sol Ultra 用 64 子代理证明 50 年猜想 + Lean 形式化开源,ChatGPT Work/Codex 发布后社区回应与修正,ICML Workshop 最佳论文自适应失败分类法,Shreya/Hamel 警告 harness 膨胀与数据护城河,Andrew Ng/Clem Delangue/Nathan Lambert 开源 AI 治理多线发声,Mira Murati 发布 Thinking Machines 分布式 AI 世界观,OpenWiki Brains v0.1.1 + ChatGPT 登录,HF 多项生态更新。

daily 2026-07
indexed

Follow 深度日报:Agent 发布后进入修正、记忆与开放栈竞争

Follow List 公开来源整理:ChatGPT Work/Codex 发布后修正,GPT-5.6 Sol Ultra 并行 test-time compute,Thinking Machines 人本与分布式 AI 愿景,LangChain/NVIDIA NemoClaw 与 OpenWiki personal brain,Hugging Face Gemma Challenge、HuggingNews 与 agent network effects,Gemini/AI Studio 体验迭代,Deutsche Telekom AI-native telco。

daily 2026-07
indexed

Follow 深度日报:Agent 平台进入托管、记忆与数据系统竞争

Follow List 公开来源整理:Shreya/Hamel 的 Monitor UI feedback loop,Lilian Weng harness self-improvement,Anthropic J-space,LangChain Deep Agents/LLM Wikis/ATIF,Gemini Managed Agents,Simon Willison sqlite-utils 4.0,BAIR agents data systems,Hugging Face/xAI/open-source 与机器人数据集。

daily 2026-07
indexed

Follow 深度日报:Agent 工程转向评审、记忆与开放数据飞轮

Follow List 公开来源整理:Simon Willison sqlite-utils 4.0rc3 与模型交叉评审,Hamel/Shreya 自动化 eval,Thomas Wolf agent living wiki,LangChain/OpenWiki 记忆讨论,Hugging Face Xet 与 agent traces,Fchollet 成本化 benchmark,Gemini Robotics 数据闭环。

daily 2026-07
indexed