AI 日报 | 2026-09-29
今日概览
过去 24–48 小时的主线很清楚:AI 行业正在从“更强模型”进入“可控代理 + 资本密集算力 + 中国开源追赶”的复合竞争。NVIDIA 把 agent 安全做成硬件/软件栈,Anthropic 继续推进 Claude 5.5 产品线并面向 IPO,OpenAI/Codex 叙事转向长周期 autonomous coding;中国侧,Qwen、GLM、Kimi 的节奏集中在开源模型、coding agent 和国产芯片/推理基础设施;Google/AWS/NVIDIA 的算力路线进一步分化到 TPU、Rubin/Vera、agent-native orchestration。
最重要 5 条
1. NVIDIA 发布 Open Agent Safety Platform,把 agent 安全下沉到全栈治理与硬件隔离
**摘要**:NVIDIA 9 月 28 日发布 Open Agent Safety Platform,定位为从测试到部署保护 AI agents 的开放软件平台和参考系统设计。
**关键细节**:平台围绕 OpenShell、BlueField/DPU、Sentry 类监控隔离能力构建,强调在 agent loop、sandbox、网络/硬件层实施边界控制。首发合作方超过 100 家,包括 Anthropic、Microsoft、Hugging Face、JPMorgan Chase、Palantir、Salesforce、SAP、CrowdStrike、Red Hat 等。Anthropic 提到 Claude Managed Agents 会把 agent loop 与执行 sandbox 分离,NVIDIA 平台再增加硬件/软件治理层。
**为什么重要**:这不是普通安全工具,而是 NVIDIA 试图把“agent 可控性”变成 AI factory 的默认基础设施。随着 coding agent、research agent、enterprise agent 开始接触真实凭据、网络和生产系统,agent 安全会从模型厂商的 alignment 问题,变成云、DPU、sandbox、审计和策略执行的系统工程问题。
**来源**:NVIDIA 官方发布;Reuters/AFP 对 agent 失控事件背景的报道。
2. Anthropic 推出 Claude Sonnet 5.5,继续强化低成本 agentic coding 层
**摘要**:Reuters 9 月 28 日报道,Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族的第二个模型。
**关键细节**:Sonnet 5.5 定价为每百万 input tokens 2 美元、output tokens 10 美元,与 Sonnet 5 相同;Anthropic 称其完成同类任务所需 token 更少。它被定位为 Claude Opus 5.5 的更快、低成本补充;Opus 5.5 上周发布,价格为每百万 input 4 美元、output 20 美元。
**为什么重要**:Anthropic 的路线是把 Opus 作为高端推理/复杂任务层,把 Sonnet 做成大规模 coding/agent 工作负载的经济执行层。对企业和开发者来说,真正影响采用率的不是峰值 benchmark,而是长任务成功率、token 效率、工具使用可靠性和单位任务成本。
**来源**:Reuters;Anthropic 官方模型发布页。
3. OpenAI Codex 强调 25 小时长周期任务:agent harness 正成为 coding 模型竞争核心
**摘要**:OpenAI Developers 发布文章,展示 GPT-5.3-Codex 在 Extra High reasoning 下连续约 25 小时运行、使用约 1300 万 tokens、生成约 3 万行代码,完成一个设计工具原型。
**关键细节**:OpenAI 把成功因素归结为 Codex agent loop:plan → edit → tests/build/lint → observe → repair → update docs/status → repeat。文章特别强调 durable project memory(spec/plan/constraints/status 的 markdown 文件)、milestone acceptance criteria、validation commands、worktrees、skills、automations 和中途可 steer 的能力。
**为什么重要**:AI coding 的竞争正在从“哪个模型单轮更会写代码”转向“哪个 harness 能维持长期状态、执行验证、可审计、可回滚、可并行”。这与用户近期关注的 handoff、agent harness、teams/orchestration 完全同向:模型只是底座,真实生产力来自可闭环的工作系统。
**来源**:OpenAI Developers Blog《Run long horizon tasks with Codex》。
4. Google Cloud Next ’26 推出 TPU 8t/8i 与 agent-native infra,TPU 路线继续挑战 GPU 单一路径
**摘要**:Google Cloud 在 Next ’26 宣布 AI infrastructure 扩展,包括第八代 TPU:TPU 8t 面向训练,TPU 8i 面向推理,并配套 Virgo 网络、Managed Lustre、Dedicated KV Cache、GKE agent-native orchestration 等。
**关键细节**:Google 称 TPU 8t 支持由 Pathways/JAX 编排的 100 万+ TPU 芯片级集群;TPU 8i 对比上一代 inference 性价比提升 80%。同时 Google 也推出 A5X bare metal,基于 NVIDIA Vera Rubin NVL72,说明其不是“去 NVIDIA”,而是 TPU + GPU 并行供应。
**为什么重要**:frontier model 的成本瓶颈已经不只是训练 FLOPS,而是 inference、KV cache、网络、文件系统、agent workload 的整体吞吐。Google 的拆分式 TPU(training/inference)和 agent-native GKE 是对“agentic era”的基础设施押注。
**来源**:Google Cloud Blog《AI infrastructure at Next ’26》。
5. 中国 AI 生态:Qwen、GLM、Kimi 继续围绕开源权重、coding agent 与国产算力形成差异化
**摘要**:最近更新显示,中国模型生态没有停在聊天模型竞争,而是集中进入 open-weight、coding agent、multimodal 和推理基础设施。
**关键细节**:Qwen 侧,QwenLM GitHub 继续高频更新 qwen-code,并在 9 月 24 日的 Qwen Code Weekly 中提到“查看哪些文件填满上下文、通过 SSH 编辑项目”等工程向能力;Qwen-Image-2.1 于 9 月 20 日发布,强调图像生成/编辑,首日支持 Diffusers、ComfyUI、vLLM-Omni。Z.ai/智谱 GLM-5.3-Flash 是 320B total / 18B active 的原生多模态模型,使用 sparse + linear attention、mHC、30T multimodal corpus,并称全部 ox-alpha/OpenRouter/OpenCode 流量由中国 AI 芯片承载;Moonshot/Kimi K3 已在 Amazon Bedrock GA,AWS 称其为 2.8T 参数、原生视觉、1M token context,适合长周期 coding 与知识工作。
**为什么重要**:中国厂商的突破口不是完全复制美国闭源 API 模式,而是用开源/开放权重、低价推理、coding agent 和国产芯片适配来形成生态面。GLM-5.3-Flash 的“10 万+ 国产 AI 加速卡生产推理”叙事尤其值得跟踪:如果属实,它代表中国模型厂商在制裁环境下对 inference stack 的纵向整合。
**来源**:Qwen GitHub/Qwen Code Docs;Z.ai 官方 GLM-5.3-Flash 与 infra blog;AWS Bedrock Kimi K3 公告;Moonshot AI 官网。