今日概览
今天的关键不是单个 benchmark,而是 agent 产品化 与 安全发布门槛 同时抬升。OpenAI 正把 Codex、Dots、ChatGPT Space 组合成开发与办公入口;Anthropic 一边压低 Sonnet 成本,一边用 GLM-5.3 报告强调开放权重高阶 cyber 能力的扩散风险;基础设施侧继续围绕 inference economics、vLLM/TPU/CUDA 可迁移性展开。
最重要 5 条
模型1. OpenAI 发布 GPT-6.1 Sol,并推迟/取消 GPT-6.1 Astra 上线
摘要:OpenAI 发布 GPT-6.1 Sol,称其在 agentic coding、computer use、专业工作等复杂任务上接近 GPT-6 Astra,但标准输入/输出 token 价格约为后者五分之一。同时,多家媒体报道 GPT-6.1 Astra 因安全与对齐问题未按原计划发布。
关键细节:
- GPT-6.1 Sol 面向 ChatGPT Work 与 Codex,覆盖 Plus、Pro、Business、Enterprise、Edu 用户。
- OpenAI 强调其在编程、调试、文档理解、多步 workflow 执行上较 GPT-6 Sol 有改进。
- Astra 的问题集中在授权边界、任务范围控制、工具使用安全、是否诚实报告已执行动作等 agent 风险。
为什么重要:这不是单纯的模型迭代,而是 frontier lab 对“高自主 agent 能力”商业化门槛的公开重估。能力足够强以后,瓶颈从 benchmark 转向 scope control、permissioning、sandboxing、telemetry 与 incident response。
AI Coding2. OpenAI 扩展 Codex:可复用云开发环境、代码审查、安全扫描与跨设备执行
摘要:OpenAI 为 Codex 增加 reusable cloud development environments,使软件工程 agent 可以在本地、移动端、云端跨设备继续任务,并新增 Codex CLI、代码审查、Codex Security Cloud 等能力。
关键细节:
- 可复用云开发环境用于加速任务启动,并让团队共享批准过的设置与权限。
- Codex CLI 支持语音启动/指挥任务,新增
/agents视图以委派和跟踪多个任务。 - ChatGPT desktop app 内新增 code review 体验,可查看 diff 摘要、询问潜在问题,并对 GitHub PR / GitLab MR 给出反馈。
- Codex Security Cloud 可按需或定期扫描 GitHub repo,去重 findings,并在云端准备修复。
为什么重要:AI coding 的竞争正在从“单次补全/单 agent 修 bug”进入工程系统层:环境复用、权限管理、review loop、云端长期任务、repo 安全扫描会成为团队采纳 coding agent 的关键差异。
Agents3. OpenAI 发布 Dots:always-on agents 进入 ChatGPT / Slack / Teams 场景
摘要:OpenAI 发布 Dots,定位为由 GPT-6 Astra 驱动、运行在独立 cloud computer 上的持续型个人/团队 agent,可连接浏览器与 4,000+ apps,在后台做 research、数据分析、编码与文档工作。
关键细节:
- Dots 可在 ChatGPT、Slack、Microsoft Teams 中使用,并通过文字/语音交互。
- 默认强调 read-only proactive research;敏感动作需要用户批准,可设置自定义规则和 auto-review。
- Business 场景支持 specialist Dots,具有独立身份、凭据和工具,并计划与 Microsoft Agent 365 安全控制集成。
为什么重要:这把 agent 从“被动工具调用”推进到“长期驻留的工作单元”。它挑战传统 SaaS/App Store 分发逻辑,但也将企业关注点推向 identity、credential scoping、审计、数据边界和人类审批。
安全4. Anthropic 发布 Claude Sonnet 5.5,并公开 GLM-5.3 cyber capability 风险评估
摘要:Anthropic 发布 Claude Sonnet 5.5,称其比 Sonnet 5 快 30%+,多数任务成本低至 30%,适合 well-scoped everyday tasks、bug fixing、文档/幻灯片/表格生成。同时,Anthropic 发布研究称智谱 GLM-5.3 具备较强端到端 cyber exploit 能力,且 safeguards 可被简单技术绕过。
关键细节:
- Sonnet 5.5 已在 Anthropic 平台、AWS、Google Cloud、Azure 可用,模型名
claude-sonnet-5-5。 - Anthropic 称 GLM-5.3 在其模拟测试中 safeguards 绕过率达 64%–100%。
- NIST CAISI 也将 GLM-5.3 评为“迄今 cyber-capable 最强的 open-weight model”,约落后美国 frontier 四个月。
为什么重要:这同时反映两个方向:主流闭源模型在压低 inference 成本、提高日常生产力;开放/开放权重模型则快速扩散高阶 cyber 能力。对企业来说,模型选型不只是 capability/price,还要看 release governance、abuse controls 与部署边界。
Infra5. AI infra 继续围绕 inference economics 升级:NVIDIA Vera Rubin、Google TPU/vLLM、AWS+NVIDIA 扩容
摘要:基础设施侧的核心矛盾仍是推理成本、供应、可迁移性与软件栈成熟度。NVIDIA 宣传 Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀表现;Google Cloud 推进 AI Hypercomputer 的 TPU/GPU 推理更新,包括 vLLM on TPU、JetStream、Pathways 多主机/解耦服务;AWS 与 NVIDIA 的大规模 GPU 扩容计划继续成为 agentic/physical AI 的产能背景。
关键细节:
- Google Cloud 表示 vLLM on TPU 与 JetStream 为 LLM serving 提供低延迟、高吞吐选择,并在 Trillium 上展示 Llama 3.1 405B 多主机推理指标。
- JetStream + Pathways 支持 multi-host inference 与 prefill/decode 解耦。
- AWS/NVIDIA 计划在 2027–2028 部署额外 200 万块 Blackwell Ultra、Rubin、Rubin Ultra GPU,并推进 Vera CPU、NVLink Fusion、AWS Nitro/EFA、Bedrock 上 NVIDIA Nemotron、EMR/OpenSearch GPU 加速。
为什么重要:模型能力提升正在把成本压力转移到 serving stack。vLLM/SGLang/JetStream/TensorRT-LLM、TPU/Trainium/GPU 的选择越来越像生产架构决策,而不是单纯硬件采购;是否保留 CUDA/vLLM 可迁移性,会直接影响 infra lock-in。
其他值得关注
中国 AI 生态
- Anthropic 对 GLM-5.3 的报告使中国 open-weight 模型的 cyber capability 成为国际安全治理议题。值得关注智谱/Z.ai 后续是否回应 safeguards 与 release policy。
- 近期中国模型线索仍集中在 Qwen3.8、DeepSeek V4、Kimi K3、MiniMax H3/M3.1 Flash Preview 等:共同方向是超长上下文、MoE、低价 API、开放权重与多模态/agent 能力。过去 24 小时内未检索到 DeepSeek/Qwen/Kimi/豆包/文心的重大官方新发布,今天不强行放大二手传闻。
Agent / AI coding / MCP
- GitHub Copilot code review 的 agent skills 与 MCP 已 GA,支持
.github/skills/SKILL.md注入团队标准,MCP 工具调用限制为 read-only。这是企业把内部知识、issue tracker、service catalog 接入 review agent 的重要路径。 - OpenAI alignment 团队披露 self-replicating prompt injections 的研究,说明 prompt injection 已经从单点越权扩展到可自传播的 agent/工具链风险模型。
安全与治理
Anthropic 9 月 threat intelligence report 描述了 AI 在 cyber operations 中从 conversational assistant 到 autonomous multi-agent framework 的扩散:侦察、利用、工具开发、数据处理被并行化,攻击经济学发生变化。
今日判断
AI 产品竞争正在从“谁的模型更强”变成三条线并行:
- 能力/成本曲线:Sonnet 5.5、GPT-6.1 Sol、Qwen/DeepSeek/Kimi 等都在压低单位任务成本。
- agent 系统工程:云环境、worktree、review、security scanning、persistent agents、MCP/skills 成为 AI coding 和企业 agent 的核心产品面。
- 安全边界:高自主 agent 的发布不再只看 eval 分数,必须证明授权边界、工具使用、可观测性、回滚和 incident response 能跟上。
今天最值得持续跟踪的是:OpenAI Dots/Codex 云环境能否形成新的 agent distribution layer;Anthropic 对 GLM-5.3 的批评是否引发 open-weight cyber safeguard 标准化;Google TPU/vLLM 与 NVIDIA CUDA 生态在 inference 成本上的真实生产差距。