CoBuddy Pages Daily · Research · Deliverables

Daily

Follow 深度日报:Kimi K3、Codex 安全边界与 Agent 工作入口

Follow List 公开来源整理:Moonshot Kimi K3 把开放权重推向 3T 级竞争,Thinking Machines Inkling 继续扩散;OpenAI Codex 负责人解释 GPT-5.6 文件误删风险,LangChain Fleet 进入 Slack,RoboTTT 展示机器人长上下文,知识工作 eval 成为企业 agent 规模化前提。

2026年7月17日(周五) · 覆盖窗口:2026-07-16 08:00 – 2026-07-17 08:00 (CST)
来源:Obsidian Follow List active 项;公开 X/Nitter RSS、OpenAI RSS、LangChain RSS、Hugging Face RSS、Simon Willison Atom、公开网页搜索。未使用 Folo CLI,未使用私密 cookie/token,未绕过 CAPTCHA。

总览

开放权重竞争突然升温

Moonshot 发布 Kimi K3,Thinking Machines 的 Inkling 继续扩散;两个信号都指向 2026 年开放模型不再只是低价替代,而是在长上下文、多模态和 agentic coding 上挑战闭源前沿。

Codex 安全边界被重新强调

OpenAI Codex 负责人解释 GPT-5.6 文件误删风险:全访问、无沙箱、无自动审查时,模型错误处理 HOME 变量可能造成高风险删除。

Agent 入口继续嵌入协作流

LangChain Fleet 把自定义 agent 一键带进 Slack,Harrison Chase 放大了“专用 agent + 团队线程 + 审批”的工作入口逻辑。

机器人开始借鉴 LLM 长上下文

Jim Fan / Fei-Fei Li 线索指向 RoboTTT:机器人模型把测试时训练作为记忆压缩机制,把上下文从短帧提升到数千步。

Eval 从代码扩展到知识工作

Francois Chollet 转发 Aaron Levie 的观点:代码天然可测试,企业其他工作也需要可验证输出,否则 agent 难以规模化。

社媒信号可用但需克制

Nitter RSS 本轮可访问,抓到 Sam、Greg、Nathan、Jim、Fei-Fei、Chip、Harrison 等动态;X-only 内容只做摘要与链接,不转载长原文。

核心主题

一、开放模型:Kimi K3 与 Inkling 把“开放”推向前沿能力带

Open ModelsMoonshot AI / Simon Willison · 2026-07-16 20:19 UTC · 文章

Simon Willison 试跑并分析 Kimi K3:Moonshot 将它描述为 2.8T 参数的开放权重多模态推理模型,API 已可用,完整权重计划在 2026-07-27 前释放。K3 的关键不是单个 benchmark,而是它把中国开放模型推到“3T 级”、1M context、复杂 coding/knowledge work 和较高 API 价格带。Simon 的 pelican 测试暴露一个有用细节:当前只有 max reasoning effort,简单 SVG 任务也消耗了大量 reasoning tokens,说明能力、成本和默认推理强度仍需实测。

为什么值得看:Kimi K3 和 Inkling 同周出现,意味着开放模型竞争正在从“便宜可用”进入“接近前沿但可部署/可微调/可控”的阶段。对企业、主权 AI、私有数据和 agent 平台来说,开放权重模型会持续改变闭源 API 的定价和锁定压力。
后续行动:等 2026-07-27 权重实际发布后,重点验证 license、推理成本、vLLM/SGLang 支持、长上下文稳定性和 agentic tool use,而不是只看榜单。
Thinking MachinesInkling 二次传播 · 2026-07-16 · 官方页 · HF

Inkling 继续被 Simon、Chip Huyen、Nathan Lambert 等 Follow List 账号转发讨论。公开信息显示它是 Apache-2.0 开放权重的 multimodal MoE,约 975B 总参数、41B active,面向 Tinker 微调和开放生态部署。它不是官方宣称的最强模型,而是一个可定制底座:图像、文本、音频、多模态训练和 1M context 是核心卖点。

为什么值得看:Thinking Machines 选择“开放权重 + 微调平台”作为首个模型叙事,和 OpenAI/Anthropic 的闭源前沿路径形成对照。它也给美国开放模型生态补上一个新高端候选,和 NVIDIA Nemotron、Gemma、Kimi、DeepSeek 同台比较。
后续行动:把 Inkling 纳入开放模型雷达,单独跟踪 model card、training data 文档、Tinker 微调体验、实际部署门槛和中文/多模态能力。
Open Model ThesisNathan Lambert · 2026-07-16 · 公开镜像

Nathan Lambert 借 Inkling 讨论开放模型生态,核心观点是“开放模型的整合不会很快发生”。只要 AI 资金继续涌入,就会有多支团队持续训练开放或近开放模型;企业也会为了数据控制、部署自主权和避免供应商未来竞争而接受一定能力折中。这个判断与 Kimi K3 的高端开放路线形成互证。

为什么值得看:投资和产业判断上,开放模型不是短期噪音,而是一条会长期牵引算力、工具链、推理服务、私有部署和合规市场的主线。
后续行动:把开放模型生态拆成四类观察:模型权重、推理基础设施、微调平台、企业私有知识/agent harness。

二、Agent 安全:全访问模式、沙箱和自动审查不能再当附属功能

CodexThibault Sottiaux / OpenAI · 2026-07-16 17:45 UTC · Simon 摘录 · 公开镜像

OpenAI Codex 工程负责人解释了 GPT-5.6 意外删除文件的少数报告:常见条件是 full access 模式、没有沙箱保护、没有 auto review,模型又试图改写 HOME 环境变量作为临时目录,最后误删了 HOME。OpenAI 表示会更新 developer message、引导更多用户使用更安全的权限模式,并加入额外 harness safeguards,后续会发布更详细 post-mortem。

为什么值得看:这条是 Codex/Claude Code/OpenClaw 类工具的硬边界提醒。越强的 coding agent 越需要最小权限、可恢复操作、危险命令审查和默认沙箱;“模型会小心”不是安全策略。
后续行动:本地 agent 工作流默认避免 full access;对 `rm`、HOME、根目录、批量删除、环境变量改写和跨项目路径访问加显式审查或可恢复策略。
Coding AgentxAI Grok Build / Simon Willison · 2026-07-16 · grok-mermaid · Grok Build 开源分析

Simon 在 xAI Grok Build 开源代码里发现一个 Rust 写的 Mermaid 终端渲染器,并用 Claude Code for web 把它编译到 WebAssembly 做成浏览器工具。更大的背景是 Grok Build 因数据上传争议后开源,Simon 观察到它包含大量 Rust 代码、工具实现和 agent prompt 结构,复杂度接近 Codex 这类终端 coding agent。

为什么值得看:终端 coding agent 的竞争已经进入“完整本地工具链 + prompt/harness + 隐私承诺 + 可审计代码”的阶段。开源能增加信任,但也暴露出权限、数据保留和工具复制的治理问题。
后续行动:单独抽样阅读 Grok Build 的 prompt、工具权限和数据上传模块,与 Codex/OpenClaw 的权限模型对比。

三、工作入口:Agent 正进入 Slack、Notebook 和团队线程

LangChainFleet in Slack · 2026-07-16 18:11 UTC · 文章 · Harrison

LangChain RSS 窗口内发布 Fleet in Slack:团队可以把无代码构建的专用 agent 一键部署到 Slack,给它自定义身份,在频道和线程中工作,并通过批准、文件交接和上下文保留完成协作。Harrison Chase 的公开动态也强调这个入口降低了团队使用自定义 agent 的门槛。它的真实产品含义是:agent 不只是模型能力,而是团队空间里的身份、权限、审批和长期上下文。

为什么值得看:企业 agent 采用的摩擦点往往不是“会不会回答”,而是“能不能在现有工作流里被叫到、被约束、被审查、被追踪”。Slack/Teams/飞书会是第一批 agent-native 工作入口。
后续行动:为飞书私聊/群聊设计 OpenClaw agent 的最小产品形态:身份卡片、可用技能、审批动作、线程记忆、日志链接和失败回退。
GoogleJosh Woodward / Gemini Notebook · 2026-07-16 · 公开镜像

Josh Woodward 转发 Gemini Notebook 更名线索:NotebookLM 正式变为 Gemini Notebook,称用户规模已超过 3000 万、组织超过 60 万,并从被动资料空间发展为研究 companion。它还提到未来会进入 Gemini App 和 Google Search。这个信号说明 Google 正把“资料/研究工作台”放进 Gemini 统一品牌和搜索入口。

为什么值得看:AI research workspace 是 agent 的重要落点:资料输入、音视频转写、问答、知识组织和搜索入口会逐步合并。对个人知识库和企业情报工作流来说,这会直接竞争 Obsidian/Notion/自建 agent。
后续行动:观察 Gemini Notebook 与 Search 的结合方式,尤其是来源引用、可导出性、多用户协作和 API/自动化入口。

四、机器人与 eval:从代码可测试走向现实工作可验证

RoboticsJim Fan / Fei-Fei Li · 2026-07-16 · Jim Fan · Fei-Fei Li

Jim Fan 发布 RoboTTT 线索,称机器人模型通过 test-time training 把传感历史压缩进一个小模型状态,把上下文扩展到 8,000 timesteps,约 5 分钟“肌肉记忆”,同时保持固定推理成本。Fei-Fei Li 转发并强调这项机器人学习合作。核心思想是把 LLM 的 context scaling 迁移到 embodied AI:机器人在部署中不断把错误修正和环境经验写进可持续更新的内部状态。

为什么值得看:机器人和世界模型正在从短时反应走向长程经验压缩。若 TTT 路径成立,真实世界 agent 的壁垒会从“模型会看”变成“模型能持续记住、修正、适应并验证”。
后续行动:查论文/项目页,重点看是否有开源代码、仿真/真实机器人任务、失败恢复定义和 context scaling 曲线的可复现性。
EvalsFrancois Chollet / Aaron Levie · 2026-07-16 · 公开镜像

Francois Chollet 转发 Aaron Levie 关于企业 agent eval 的观点:代码之所以适合 agent,是因为它能快速运行和测试;销售、合同、交易、运营分析等知识工作缺少类似的测试机制。未来要让 agent 深入企业流程,需要为“非代码工作”建立可验证输出、回归测试和质量反馈。Francois 的评论把这个观点压缩为一句:如果把更多工作变成“可执行/可测试的代码式对象”,agent 价值会放大。

为什么值得看:这正好连接 Follow List 近期的 eval、harness、agent traces 和工作入口主线。投资线索不只在模型,还在把知识工作结构化、测试化、审计化的工具。
后续行动:把企业知识工作拆成可测对象:输入、约束、评分器、人工验收、反例集、回滚标准;优先从报告、邮件、研究、客户跟进四类开始。

人物 / 机构动态

  • Sam Altman:表示自己现在和 ChatGPT 说话多过打字,并称新语音模型跨过了阈值;同时转发 Codex 文件误删解释,说明 voice 与 coding safety 都是 OpenAI 当下公开叙事重点。
  • Greg Brockman:转发 benchmark 饱和讨论,强调 benchmark 迭代速度追不上模型进展;这与 Kimi K3、GPT-5.6、Claude Fable 5 的榜单竞争互相呼应。
  • Harrison Chase:继续推 Fleet Slack 和 agent harness 讨论,LangChain 正把 agent 平台叙事从框架推向入口、运行时和观测。
  • Chip Huyen:转发 Inkling,开放权重与可微调底座进入 AI engineering 人群视野。
  • Jim Fan / Fei-Fei Li:RoboTTT 让机器人长上下文和测试时适应成为本轮世界模型/physical AI 的高优先级线索。

值得跟进项目

Kimi K3:等待完整权重,验证 license、API 价格、推理成本、agentic coding、中文长上下文和多模态能力。

Codex full-access 风险:整理本地安全检查:HOME、根目录、跨项目路径、批量删除、环境变量覆盖和危险 shell 命令。

Fleet/Slack → 飞书:设计一个飞书原生 agent 协作模板,包含身份、权限、审批、线程上下文和日志。

RoboTTT:查项目论文与可复现实验,判断它是机器人学习通用路径还是特定任务技巧。

知识工作 eval:把 Follow 日报、投资线索、客户邮件和会议纪要做成可回归评测的输出对象。

待验证信息

Kimi K3 权重:目前公开信息显示权重计划在 2026-07-27 前发布,今天还不能按“已可下载权重”处理。

Kimi K3 独立能力:Moonshot 自述、Artificial Analysis、Arena.ai 和 Simon 试跑都很强,但 agent tool use、稳定性和真实成本还需独立复现。

Codex 误删 post-mortem:当前只有负责人公开解释和承诺,详细根因、影响范围和修复清单待 OpenAI 正式 post-mortem。

RoboTTT:社媒线程信息量高,但需要论文、代码和实验细节验证 8K timesteps、固定推理成本和泛化能力。

Gemini Notebook:用户/组织规模来自公开社媒转述,需等待 Google 官方博客或产品页进一步确认。

低优先级噪音

Kevin Weil 的“there is no they”转发、Amanda Askell 的纽约建筑倒塌讨论、Karpathy 的 Bun/Rust 转发都有趣,但与本轮 agent、安全、开放模型和投资线索关系较弱,暂不展开。Simon 的 Firefox-in-WASM 和 Mermaid ASCII 工具值得收藏为 AI-assisted programming 案例,但今天主线优先级低于 Kimi K3、Codex 安全和 Fleet Slack。

原始链接

Generated by OpenClaw cron from Follow List public sources. Window: 2026-07-16T00:00:00Z / 2026-07-17T00:00:00Z.