2026-08-15 · 北京时间 06:30

AI 日报 | 2026-08-15

面向熟悉 AI、技术与商业的读者:聚焦模型、Agent/AI coding、推理基础设施、中国 AI 生态与商业动态。

ModelsAgentsAI CodingInfraChina AIOpen Weights

今日概览

今天的主线是:模型发布继续向 coding/agent 倾斜,基础设施厂商把浏览器、推理网关、分离式推理与长上下文纳入 agent stack,中国模型生态则在 DeepSeek、GLM、Kimi、Qwen 之间形成“开放权重 + 编程/Agent 工具链”竞争。

最重要 5 条 + 其他值得关注

1

Google Gemini 3.7 Flash GA:面向 coding/agents 的 workhorse 模型

摘要:Google 在 Gemini API release notes 中宣布 gemini-3.7-flash 于 8 月 13 日 GA,定位为“最智能的 workhorse model yet for coding and agents”,强调软件工程、Web 开发与 agentic workflows 的显著提升,并配套 introductory price。

为什么重要:这表明 Google 正在把 Flash 线从低价快模型推向主力 agent/coding 生产模型,企业使用 Gemini API 构建长链路自动化时会更关注延迟、价格与工具调用稳定性的组合。

来源链接 ↗
2

DeepSeek-V4-Pro 登陆 Hugging Face:MIT、FP8、vLLM/SGLang 路径明确

摘要:DeepSeek-V4-Pro 模型卡显示模型已在 Hugging Face 可用,标注 MIT license、FP8、Transformers/Safetensors,并直接给出 vLLM 与 SGLang 的 OpenAI-compatible serving 示例。搜索与模型卡信息指向 8 月 13 日前后的 0813 版本。

为什么重要:中国开源/开放权重模型继续把“可自托管 + 低成本推理 + 长上下文/agent”作为差异化。对 infra 团队而言,官方模型卡直接给出 vLLM/SGLang 入口,比单纯 API 发布更利于快速纳入内部评测。

来源链接 ↗
3

智谱 GLM-5.3 发布:后训练 scaling,把重点押在编程与企业 Agent

摘要:中文科技媒体报道智谱 8 月 14 日发布 GLM-5.3,称基座模型相对 GLM-5.2 不变,但通过更长、更复杂任务环境与后训练 scaling 提升智能上界,编程能力较前代提升约 50%,并面向 GLM Coding Plan 与 ZCode 等编程/Agent 场景开放。

为什么重要:这是一条典型的“中国模型厂商从参数扩张转向后训练与工具链分发”的信号:模型发布本身和 IDE/订阅计划绑定,竞争焦点从 benchmark 扩展到开发者入口、上下文保持与命令执行闭环。

来源链接 ↗
4

GitHub Agent Plugins 1.0:Copilot/VS Code/CLI 的 Skills + MCP 打包格式

摘要:GitHub Changelog 8 月 12 日介绍 Agent Plugins 1.0,覆盖 VS Code、Copilot CLI 与 Copilot app;规范把 skills 与 MCP servers 标准化,并建议将 Copilot 特定文件放入 com.github.copilot/ 命名空间以保持跨客户端可移植。

为什么重要:Agent 生态正在从“每个 IDE 各写一套提示词和工具配置”走向可分发插件包。MCP 与 skills 被纳入通用结构后,团队可以把内部工具、代码库规则、review/checklist 作为可版本化资产管理。

来源链接 ↗
5

Cloudflare Agents Week:AI Gateway/Workers AI/Kitesurf 强化 agentic cloud

摘要:Cloudflare 近期 Agents Week 汇总提到 agent 是新的软件类别;相关发布包括把 AI Gateway 打造成统一 inference layer、Workers AI binding 与 14+ providers 模型目录,以及 Kitesurf——运行在 Workers/V8 isolates 上的 agent-first browser。

为什么重要:Agent 产品的瓶颈不只在模型,还在浏览器执行、安全边界、供应商路由和观测。Cloudflare 的路线把“模型调用、浏览器环境、权限隔离、网络边缘”合并为 infra 产品,直接对标企业 agent 平台需求。

来源链接 ↗
6

vLLM v0.27.x 与多硬件生态:DeepSeek V4、KV-transfer、分离式 prefill 成为热点

摘要:GitHub releases 页面显示 vLLM 最新版本线为 v0.27.1(8 月 11 日);同期 issue 中可见 DeepSeek V4、KV-transfer、MultiConnector、disaggregated prefill/decode 等部署问题。

为什么重要:推理框架竞争进入“支持最新 MoE/长上下文模型 + 分离式 prefill/decode + 多硬件后端”的工程深水区。新模型越依赖 1M context 与 agent 长任务,vLLM/SGLang/llama.cpp 的真实吞吐、显存和调度能力越影响成本。

来源链接 ↗
7

NVIDIA Nemotron 3 Super:开放 120B MoE 继续服务 agentic AI 成本曲线

摘要:NVIDIA 博客介绍 Nemotron 3 Super:120B 参数、12B active 的开放 hybrid MoE,针对 Blackwell 优化,1M token context,声称最高 5x throughput、2x accuracy,面向多 agent 工作流的 context explosion 与 thinking tax。

为什么重要:尽管发布时间早于本日报窗口,但过去 48 小时 NVIDIA/Reuters 仍围绕开放模型与 Nemotron 后续路线发酵。NVIDIA 正把 GPU 供应商位置延伸到可部署模型、NIM、企业 agent reference stack,从而影响云厂商和企业私有化选型。

来源链接 ↗
8

OpenAI 近况:GPT-5.6 Sol/Luna 扩展、Daybreak 模型上 AWS、ChatGPT Business premium seats

摘要:OpenAI 新闻页搜索摘要显示 8 月 10–12 日有 GPT-5.6 Sol 改进、GPT-5.6 Luna 扩展给免费用户、Daybreak models on AWS,以及 ChatGPT Business premium seats 等更新;帮助中心也提示旧模型逐步退役。

为什么重要:OpenAI 的节奏更像平台运营:模型家族、价格/访问层级、云分发和企业席位同时调整。对企业采购而言,AWS 分发与 Business seats 可能比单次模型 benchmark 更直接影响落地。

来源链接 ↗
9

Moonshot Kimi K3 余波:2.8T、1M context、开放权重继续改变中国模型叙事

摘要:Kimi 官方技术博客此前宣布 Kimi K3,并称 full model weights 于 7 月 27 日前发布;公开报道与 AA 文章称其为 2.8T 参数、1M context 的开放权重模型,在 agentic/knowledge benchmark 中接近前沿闭源模型。

为什么重要:这不是 24 小时内的新发布,但仍是最近中国 AI 生态比较的背景变量:DeepSeek、Kimi、GLM、Qwen 正在用开放权重、长上下文和 coding/agent 能力争夺开发者与企业私有化市场。

来源链接 ↗
10

Qwen Code 文档扩展:SubAgents、Skills、MCP、LSP、Worktrees、Scheduled Tasks

摘要:Qwen Code 文档站近期显示 VS Code Extension beta、SubAgents、Agent Arena、Skills、MCP、LSP、Worktrees、Headless Mode、Scheduled Tasks、Computer Use 等功能入口。

为什么重要:阿里 Qwen 不只在模型层竞争,也在复制/扩展 Claude Code、Codex、Copilot CLI 这类 coding agent harness。中国模型若要进入企业工程流程,IDE/CLI/权限/审计/上下文协议会变成关键分发层。

来源链接 ↗