AI 日报|2026-09-30 最新版
信息截止:北京时间2026-09-30 08:40。范围:北京时间昨日+截至出稿的隔夜重大更新。OpenAI DevDay按美国当地9月29日事件收录;不再因跨时区漏掉。官方页面正文经Jina读取,页面元数据与现场时刻存在不一致,不用其推定准确发布分钟。
今日概览
OpenAI DevDay是本期主线:Dots把持久Agent、云电脑、跨渠道上下文和审批控制整合为产品;GPT-6.1 Sol降低agentic coding与computer use成本;ChatGPT Space、插件扩展和订阅额度跨工具使用强化平台入口。国内侧,Qwen Code、DeepSeek Harness继续推进持久运行时、接管和异步交互;DeepEP V2.5体现底层工程迭代。以下性能数字均区分厂商声明、媒体报道和个人观察,不是本次独立跑分。
模型与产品
国际|OpenAI DevDay:Dots成为长期工作型Agent
官方确认Dots由GPT-6 Astra驱动,有自己的云电脑和浏览器;通过插件生态连接应用,在ChatGPT、Slack、Teams间携带上下文,支持用户查看运行中的电脑,并在授权后连接用户笔记本。
控制边界值得关注:主动研究模式工具只读,不能发送消息或控制电脑;影响账号/信息共享的动作经过auto-review与自定义规则判断;更改密码等敏感操作留给用户。不能把24/7宣传理解为无限授权或无限任务额度。
在符合条件地区向Pro、Business Premium推出;Enterprise/Edu/Healthcare需管理员开启beta,默认关闭。首个Dot包含在对应套餐,但Codex/ChatGPT Work任务仍计入相关使用额度。首次配置需要桌面App或桌面浏览器,之后可用手机消息交互。
判断:竞争点在持久状态、权限边界、人工介入和跨应用执行,不在聊天界面换皮。
来源:https://openai.com/index/introducing-dots/
国际|GPT-6.1 Sol:主打接近Astra的能力与更低任务成本
官方API模型名gpt-6.1-sol;每百万输入/缓存输入/输出token价格为2/0.10/10美元。官方称标准输入输出单价为Astra的五分之一。DeepSWE、AutomationBench、OSWorld 2.0等测试显示其能力成本改善,但均为厂商评测,具体任务需复测。
可用范围要读细:官方写明ChatGPT Work、Codex和API可用,尚未在Chat中开放;不能概括为所有ChatGPT聊天用户都能选择。Sol Ultrafast将在未来数日推出,不是已经全部开放。
判断:优先看它能否接住常规执行任务,把最贵模型留给困难推理和研究。单价便宜不等于每个任务都会按同样比例降本。
来源:https://openai.com/index/introducing-gpt-6-1-sol/
国际|Codex云环境与ChatGPT Space:从个人工具走向团队工作台
官方DevDay回顾确认Codex可在电脑、手机远程及云端使用;可复用开发环境为团队共享设置和权限。Space将成员、ChatGPT和Dot围绕共享知识组织起来;移动端支持查找、阅读和分享,创建编辑尚待推出。
Plugin extensions允许开发者建立侧栏入口、交互面板和文件查看器。“Sign in with ChatGPT”允许参与工具使用Plus/Pro额度并设置分配限制,不等于第三方推理无限免费。回顾列出Agents API、Decisions API、Codex Security Cloud等方向;本期未逐项核验独立文档,不补造参数/可用范围。
来源:https://openai.com/index/devday-2026-recap/
国内|Qwen Code v0.24.7与DeepSeek Harness RC改善Agent执行基础
Qwen Code于北京时间9/29 22:02发布,包含Managed Workspace/Session、事件重放、持久运行时worker、会话接管协调、结构化记忆和远程桌面relay相关变更;部分功能有private/gated/opt-in限制。
https://github.com/QwenLM/qwen-code/releases/tag/v0.24.7
DeepSeek Harness dsh-v0.2.0-rc.2于9/29 17:42发布,桌面端管理dsh与插件无需额外Node/pnpm;修复GUI启动的shell环境,增加手动开启的实验性异步问答:超时后Agent继续工作,用户稍后回答。RC不等于稳定版。
https://github.com/deepseek-ai/deepseek-harness/releases/tag/dsh-v0.2.0-rc.2
国内简讯:MiniMax CLI v1.0.27于9/29适配M3.1 Flash Preview;只证明CLI适配,不证明模型当天首发。
https://github.com/MiniMax-AI/cli/releases/tag/v1.0.27
技术研究
国内|DeepEP V2.5代码提交:MoE通信和内存生命周期
北京时间9/29 13:22的官方提交增加EP、bucket、pipeline-parallel及Engram专用buffer和共享生命周期管理,支持NVLink冗余专家权重预取、梯度归约;GPU kernels通过DeepJIT运行时编译,移除旧V1及NVSHMEM依赖。是代码提交,不冒称正式Release或端到端倍速。
https://github.com/deepseek-ai/DeepEP/commit/def865146e95aa9ea223e277c0a8a4c6b81e5ac7
跨国|Anthropic评估GLM-5.3网络安全能力:进展和风险需要分开看
9/29署名研究称,GLM-5.3在ExploitBench完成50/410次端到端利用,对比Mythos Preview的56/410;内部100任务二进制利用测试中分别为4%与6%。这是Anthropic对中国开源模型的评估,不是智谱自评,也不是独立中立评测。
研究的能力测试采用隔离环境;部分防护绕过测试使用模拟工具且不执行生成代码,不能把模拟比例解释成真实入侵成功率。比较还涉及关闭防护的Claude版本与不同模型获取方式,不能据此推导总体模型排名。
判断:开源模型能力提升对防御者同样有价值;企业部署应测试权限隔离、日志、工具访问和监控,而非只依赖模型拒答。
https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
商业与政策
国际|AMD约82亿美元收购World Labs协议
官方9/28 16:05 EDT,即北京9/29 04:05宣布全股票协议,预计2026年底前交割,仍需监管等条件。交割后李飞飞任执行副总裁兼首席科学家。当前是达成协议,不是已完成收购。
判断:空间智能、仿真与机器人负载推动模型研究与芯片路线协同。
国际|Reuters披露Anthropic财务与基础设施义务
CNBC转载Reuters称,2025年营收近46亿美元,运营亏损超80亿美元;约420亿美元净亏损包括约340亿美元融资相关会计费用,不能全部视作现金消耗。未来数年云/计算/基础设施义务约5180亿美元,两客户贡献近四分之一收入。不是本次直接读取监管文件,IPO估值是报道预期,不是已定价。
判断:收入增长之外,更要看客户集中、任务毛利和长期承诺。5180亿美元不是“下一年支出”。
国内:本轮未核实足以收录的新政策原文,不将海外媒体未独立证实的传闻写成正式新规。
核心博客
国际|自动化eval/hillclimb与推理预算:避免假进步
Lance Martin的9/28工程文章提出生产任务抽样、人工校验grader、保留测试集、逐次单因素修改和置信区间;对已接近饱和的eval,应优化成本/延迟而非硬追分。
https://claude.dev/blog/automating-eval-design-and-hillclimbing/
Simon Willison的Sonnet个人实测记录Max effort消耗128,000思考token仍未完成SVG,而xhigh样例完成;这是单任务观察,不是系统benchmark。启示:Agent不应统一开最大effort,必须有预算/超时与升级策略。
https://simonwillison.net/2026/Sep/28/claude-sonnet-5-5/
国内原创实践本期主要由官方Release/代码提交支撑,不将媒体转述冒充原创技术博客。
社交媒体
本轮没有新增同时满足原帖正文、作者、日期可核验且与正文不重复的独立条目。InfoQ AI快讯已作为发现入口,其AI转述需追原文;不能把“页面分组9/29”直接认定为北京时间9/29发布。DevDay相关内容优先归并官方公告,不重复填充社交板块。
来源说明
OpenAI直连曾403,本轮经Jina读取官方原文;已对照官方回顾、Dots与Sol公告,修正现场博客对套餐和开放范围的简化说法。国内三项目最新Release已重新查询;其技术细节与商业条目沿用本会话刚读过的原始材料。TLDR/Rundown/Import AI作为发现来源,不要求每期强收;机器之心官网受限,标题RSS不能替代正文。未独立运行厂商benchmark。本版单独归档,不覆盖旧稿,尚未另行发布网页。