AI 日报|2026-10-02

截止:北京时间 2026-10-02 06:30

今日概览

模型与产品

Google 发布 Gemini 4 Argon,但先只给受信任的网络防御者

Google 10 月 1 日宣布 Gemini 4 Argon。官方说它面向长程复杂推理、软件工程、法律/金融知识工作和网络防御,输出上限从 64K 提到 1M tokens;计划价为每百万输入 $2、输出 $10,缓存输入按 95% 折扣。发布节奏很保守:先进入 Fairwind Program,并参与美国政府的预发布访问流程,开发者、企业和消费者要等后续放量。判断:这是 Google 把 frontier 模型发布和安全审查绑定的一次高调试水,重点不是“人人可用”,而是证明它在 coding/cyber/长程任务上重新进入第一梯队。

来源:Google Blog;The Rundown AI 补漏

OpenAI DevDay 后续:Dots、GPT-6.1 Sol 与 Codex Cloud 指向“持续代理”

OpenAI 新闻页和多家开发者报道显示,9 月 29 日 DevDay 之后,OpenAI 把产品重心推向 always-on agent:Dots 有自己的云端电脑,可在 ChatGPT、Slack、Teams 等入口承接持续任务;GPT-6.1 Sol 被定位为更便宜的日常 agentic workhorse;Codex Cloud 让编码任务在云端继续跑。需要保留限制:公开原始页面部分访问受 403 阻挡,本次以 OpenAI 新闻索引、二级报道和发布页摘要交叉核验;具体可用范围仍以 OpenAI 账号侧为准。

来源:OpenAI News;InfoWorld/WPS;Medianama;TLDR AI 补漏

Qwen 近期重点仍在开源 coding agent 生态,不是 10 月 1 日新模型

QwenLM 官方仓库近期最有价值线索仍是 Qwen3-Coder / Qwen Code:Qwen3-Coder-Next 面向 agentic coding 和本地开发,README 标注 256K 原生上下文、可扩到 1M;Qwen Code 则提供终端优先的开源编码 agent,支持 Skills、SubAgents 和多模型 provider。未发现 10 月 1 日新的 Qwen 大模型正式发布。

来源:QwenLM GitHub;搜索补漏

商业与政策

Anthropic 与 Barclays 扩大 Claude 企业部署,银行场景开始进入规模化指标

Anthropic 10 月 1 日宣布 Barclays 扩大战略合作。已上线的检索增强助手被 16,000 多名员工使用,累计处理超过 100 万次搜索;邮件处理平台每天约处理 120,000 封邮件;Barclays 预计 Claude Code 到 2026 年底覆盖 50% 开发者,2027 年覆盖多数软件工程师。判断:这类案例比“签约某某企业”更有信号,因为它给出了实际用量和开发者渗透目标,说明银行正在把 LLM 从试点推向生产流程。

来源:Anthropic 官方新闻

Google Argon 的受限发布也属于政策事件:frontier 模型先过政府与安全窗口

Gemini 4 Argon 没有直接开放给普通用户,而是先给 cyber defender,并走美国政府 voluntary pre-release access 流程。对行业的含义是,frontier 模型发布越来越像高风险软件/安全产品上线:能力、滥用风险、政府访问和商业放量被捆在一起。

来源:Google Blog;Reuters/Guardian 转述补充

NVIDIA/Meta 与 Anthropic 的安全监管分歧继续发酵

WSJ 转述的会后分歧被多家媒体跟进:NVIDIA、Meta 等更担心监管拖慢模型和基础设施部署,Anthropic 则继续主张更强的 frontier safeguards。该事件缺少可公开全文的一手会议记录,本次只作为“高可信媒体报道的商业/政策信号”处理,不扩写成确定政策变化。

来源:WSJ 转述媒体;TipRanks 摘要

技术研究

Google Research / Virginia Tech 的 WikiSkill:把 agent 失败经验整理成可复用技能 wiki

WikiSkill 在数学推理、网页搜索、电子表格、长文档问答和交互式家务任务上测试,用结构化 wiki 承接 agent 过去轨迹,再由 Skill Proposer 生成未来技能。报道给出的结果是:相对最强 skill-evolution baseline 提升 3.3 到 12 个百分点;在 Qwen 系列中,模型越大,WikiSkill 相对 no-skill baseline 的提升越明显。限制也清楚:技能仍注入 prompt,没有解决大规模 skill library 的检索/触发,wiki 自动剪枝和长时任务仍是开放问题。

来源:VentureBeat;Google Research 线索

RRSI:让 agent 优化自己的 harness,而不是改底座模型

RRSI(Regularized Recursive Self-Improvement of Agent Harnesses)由 Google Cloud AI Research 与 UNC、Stanford、Washington University in St. Louis 合作,论文 arXiv:2609.24972。它固定语言模型,只递归改 agent harness,并用正则化抑制过拟合 benchmark。公开摘要称 Terminal-Bench 2.1 从 74.2% 到 80.2%,SWE-bench Verified 从 82.0% 到 83.8%,policy tokens 比无正则演化少约 30%。这对 AI coding 很关键:下一轮提升未必来自更大模型,也可能来自更会自我改造的脚手架。

来源:arXiv;项目报道

Import AI 本周无新日报级独立条目,保留为背景源

Import AI 是周报源,窗口最多 7 天。本次检索到的研究线索与 Google/agent harness 主题重合,未发现需要独立新增且已一手核验的新条目。

来源:Import AI RSS

核心博客

【Anthropic】Barclays scales Claude:更像企业工程案例,不是模型研究博客

Anthropic 官方 10 月 1 日文章提供了企业部署指标:16,000+ 员工、100 万+ 搜索、每天 120,000 封邮件、Claude Code 覆盖目标。这条已放在商业与政策主栏,核心博客不重复展开。

来源:Anthropic News

【Google DeepMind】Gemini 4 Argon 官方发布文:产品发布,不重复进核心博客

Argon 官方文是模型发布和访问策略,已进入模型与产品、商业与政策。核心博客栏只记录“已核验,有更新,但不重复”。

来源:Google Blog

【OpenAI】新闻索引有 DevDay/模型条目,但完整页访问受限

OpenAI News 可见 9 月 29 日 GPT-6.1 Sol 等条目;部分原文受 403 阻挡。本次不把二手报道伪装成核心博客精读。

来源:OpenAI News index

【Qwen/阿里通义】【DeepSeek】【Moonshot AI/Kimi】【MiniMax】【智谱/Z.ai】【字节Seed】【Meta AI】【Mistral】未发现 24–48 小时内符合白名单标准的新官方研究/工程博客

已检查公开索引、GitHub/release 线索和搜索补漏;无合格新增,不硬凑。

来源:官方索引/搜索补漏

来源覆盖与访问缺口

已检查 TLDR AI、The Rundown AI、Import AI、InfoQ AI 快讯及模型公司官方入口。OpenAI 部分完整页 403;监管分歧按媒体报道性质标注。

原始来源