AI 日报|2026-09-30

四板块修订版 r4|信息截止:北京时间 11:12|模型与产品 → 商业与政策 → 技术研究 → 核心博客

今日概览

OpenAI DevDay是本期主线:Dots把持久Agent、云电脑、跨渠道上下文和审批控制整合为产品;GPT-6.1 Sol降低agentic coding与computer use成本;ChatGPT Space、插件扩展和订阅额度跨工具使用强化平台入口。国内侧,Qwen Code、DeepSeek Harness继续推进持久运行时、接管和异步交互;DeepEP V2.5体现底层工程迭代。以下性能数字均区分厂商声明、媒体报道和个人观察,不是本次独立跑分。

模型与产品

国际|OpenAI DevDay:Dots成为长期工作型Agent

官方确认Dots由GPT-6 Astra驱动,有自己的云电脑和浏览器;通过插件生态连接应用,在ChatGPT、Slack、Teams间携带上下文,支持用户查看运行中的电脑,并在授权后连接用户笔记本。

控制边界值得关注:主动研究模式工具只读,不能发送消息或控制电脑;影响账号/信息共享的动作经过auto-review与自定义规则判断;更改密码等敏感操作留给用户。不能把24/7宣传理解为无限授权或无限任务额度。

在符合条件地区向Pro、Business Premium推出;Enterprise/Edu/Healthcare需管理员开启beta,默认关闭。首个Dot包含在对应套餐,但Codex/ChatGPT Work任务仍计入相关使用额度。首次配置需要桌面App或桌面浏览器,之后可用手机消息交互。

判断:真正竞争点是持久状态、权限边界、人工介入和跨应用执行,而不是换一个聊天界面。

来源:https://openai.com/index/introducing-dots/

国际|GPT-6.1 Sol:主打接近Astra的能力与更低任务成本

官方API模型名gpt-6.1-sol;每百万输入/缓存输入/输出token价格为2/0.10/10美元。官方称标准输入输出单价为Astra的五分之一。DeepSWE、AutomationBench、OSWorld 2.0等测试显示其能力成本改善,但均为厂商评测,具体任务需复测。

可用范围要读细:官方写明ChatGPT Work、Codex和API可用,尚未在Chat中开放;不能概括为所有ChatGPT聊天用户都能选择。Sol Ultrafast将在未来数日推出,不是已经全部开放。

判断:优先评估它能否承担更多常规执行任务,把最昂贵模型留给困难推理和研究;不要把单价比例等同所有任务成本比例。

来源:https://openai.com/index/introducing-gpt-6-1-sol/

国际|Codex云环境与ChatGPT Space:从个人工具走向团队工作台

官方DevDay回顾确认Codex可在电脑、手机远程及云端使用;可复用开发环境为团队共享设置和权限。Space将成员、ChatGPT和Dot围绕共享知识组织起来;移动端支持查找、阅读和分享,创建编辑尚待推出。

Plugin extensions允许开发者建立侧栏入口、交互面板和文件查看器。“Sign in with ChatGPT”允许参与工具使用Plus/Pro额度并设置分配限制,不等于第三方推理无限免费。回顾列出Agents API、Decisions API、Codex Security Cloud等方向;本期未逐项核验独立文档,不补造参数或可用范围。

来源:https://openai.com/index/devday-2026-recap/

国内|Qwen Code v0.24.7与DeepSeek Harness RC改善Agent执行基础

Qwen Code于北京时间9月29日22:02发布,包含Managed Workspace/Session、事件重放、持久运行时worker、会话接管协调、结构化记忆和远程桌面relay相关变更;部分功能有private、gated或opt-in限制。

DeepSeek Harness dsh-v0.2.0-rc.2于9月29日17:42发布,桌面端管理dsh与插件无需额外Node/pnpm;修复GUI启动的shell环境,增加手动开启的实验性异步问答:超时后Agent继续工作,用户稍后回答。RC不等于稳定版。

国内简讯:MiniMax CLI v1.0.27于9月29日适配M3.1 Flash Preview;只证明CLI适配,不证明模型当天首发。

来源:https://github.com/QwenLM/qwen-code/releases/tag/v0.24.7

来源:https://github.com/deepseek-ai/deepseek-harness/releases/tag/dsh-v0.2.0-rc.2

来源:https://github.com/MiniMax-AI/cli/releases/tag/v1.0.27

商业与政策

国际|AMD约82亿美元收购World Labs协议

官方9月28日16:05 EDT,即北京时间9月29日04:05宣布全股票协议,预计2026年底前交割,仍需监管等条件。交割后李飞飞任执行副总裁兼首席科学家。当前是达成协议,不是已完成收购。

判断:空间智能、仿真与机器人负载推动模型研究与芯片路线协同。AMD买的是World Labs团队和世界模型路线,也是在为AI compute之外的应用负载找锚点。

来源:https://ir.amd.com/news-events/press-releases/detail/1299/amd-to-acquire-world-labs-to-advance-the-future-of-ai-compute

国际|Reuters披露Anthropic财务与基础设施义务

CNBC转载Reuters称,2025年营收近46亿美元,运营亏损超80亿美元;约420亿美元净亏损包括约340亿美元融资相关会计费用,不能全部视作现金消耗。未来数年云、计算和基础设施义务约5180亿美元,两客户贡献近四分之一收入。不是本次直接读取监管文件,IPO估值是报道预期,不是已定价。

判断:收入增长之外,更要看客户集中、任务毛利和长期承诺。5180亿美元不是“下一年支出”。

来源:https://www.cnbc.com/2026/09/28/anthropics-ipo-prospectus-shows-sweeping-ai-vision-surging-costs-reuters.html

国内:本轮未核实足以收录的新政策原文,不将海外媒体未独立证实的传闻写成正式新规。

技术研究

国内|DeepEP V2.5代码提交:MoE通信和内存生命周期

北京时间9月29日13:22的官方提交增加EP、bucket、pipeline-parallel及Engram专用buffer和共享生命周期管理,支持NVLink冗余专家权重预取、梯度归约;GPU kernels通过DeepJIT运行时编译,移除旧V1及NVSHMEM依赖。是代码提交,不冒称正式Release或端到端倍速。

来源:https://github.com/deepseek-ai/DeepEP/commit/def865146e95aa9ea223e277c0a8a4c6b81e5ac7

跨国|Anthropic评估GLM-5.3网络安全能力:进展和风险需要分开看

9月29日署名研究称,GLM-5.3在ExploitBench完成50/410次端到端利用,对比Mythos Preview的56/410;内部100任务二进制利用测试中分别为4%与6%。这是Anthropic对中国开源模型的评估,不是智谱自评,也不是独立中立评测。

研究的能力测试采用隔离环境;部分防护绕过测试使用模拟工具且不执行生成代码,不能把模拟比例解释成真实入侵成功率。比较还涉及关闭防护的Claude版本与不同模型获取方式,不能据此推导总体模型排名。

判断:开源模型能力提升对防御者同样有价值;企业部署应测试权限隔离、日志、工具访问和监控,而非只依赖模型拒答。

来源:https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities

核心博客

核心博客检查结果

本轮已按白名单检查OpenAI、Anthropic、Google DeepMind、Meta AI、Mistral、DeepSeek、Qwen/阿里通义、智谱Z.ai、Moonshot AI/Kimi、MiniMax、字节Seed。除Anthropic上述研究博客外,未核验到其他足以新增收录的官方研究或工程博客更新。OpenAI DevDay属于产品发布,已归入“模型与产品”;不把Simon Willison、Lance Martin、媒体文章或Vercel等非模型公司内容放入本栏。

来源覆盖与访问缺口

本轮读取技能参考文件、今日基础稿和原始证据,并重新检查TLDR AI、The Rundown AI、Import AI、InfoQ AI快讯与机器之心入口。TLDR AI、The Rundown AI、Import AI可访问,主要作为发现线索;InfoQ AI快讯页面可带UA读取,但其“内容生产环节有AI参与处理”,只作补漏入口,不当一手证据。机器之心/articles本轮仍返回“数据服务”拦截页,HTTP 200不等于内容可用,未把该站页面当作已覆盖正文。OpenAI直连曾受限,本轮沿用已核验的官方正文证据;未独立运行厂商benchmark。