今日概览
过去两天的主线不是单一“最大模型”发布,而是前沿模型进入价格/延迟优化,agentic coding 走向团队协作入口,开源 serving 层快速适配中美新模型,Cloudflare 等基础设施平台继续把多模型推理、网关、工具与安全边界打包成 agentic cloud。
最重要 3–5 条
#1
Google Gemini API changelog 更新至 2026-08-13
摘要:Google AI for Developers 的 Gemini API release notes 显示最近更新时间为 2026-08-13 UTC,叠加搜索结果中的 Gemini 3.7 Flash / 3.6 Flash 线索,说明 Google 正在继续把 Flash 系列作为 agentic workflow 的低延迟、低成本主线。
为什么重要:对开发者而言,Flash 线的意义不只是“便宜模型”,而是把 coding、tool use、长流程 agent 的默认模型层继续向下压成本。生产系统应关注 changelog 中模型别名、弃用、速率与上下文窗口变化,避免默认模型漂移。
来源:https://ai.google.dev/gemini-api/docs/changelog
#2
OpenAI GPT-5.6 家族进入效率/价格优化阶段
摘要:OpenAI 近期围绕 GPT-5.6 Sol/Terra/Luna 发布多篇更新:GPT-5.6 GA 后,7 月底宣布 Luna 价格下降 80%、Terra 下降 20%,并提升 Sol API 性能;另有 Ultrafast preview,称 GPT-5.6 Sol 最高 14x 加速、最高 750 output tokens/s。
为什么重要:前沿模型竞争从单点 benchmark 转向“能力 × 延迟 × 单 token 成本 × agent harness”。如果高端推理可通过服务层分档、推测解码或专用硬件显著降本,企业会更愿意把复杂 workflow 放到更强模型上。
来源:https://openai.com/index/gpt-5-6/
#3
Anthropic 强化 Claude Code / Claude Tag 与团队化 Agent
摘要:Anthropic 搜索结果显示 Claude Sonnet 5、Claude Tag、Claude Code 自主性升级仍是近期重点:Sonnet 5 标价 $2/M input、$10/M output,并提升 Chat、Cowork、Claude Code、Platform 限额;Claude Tag 让团队通过 @Claude 将 coding agent 纳入协作流。
为什么重要:Claude 的产品化路径越来越像“模型 + IDE/终端 + 协作入口 + 企业权限”。对 AI coding 市场,关键不是单次补全,而是能否在团队上下文、权限和长期任务中稳定接手工作。
来源:https://www.anthropic.com/news/claude-sonnet-5
#4
Cloudflare Agents Week:把边缘网络包装成 agentic cloud
摘要:Cloudflare 8 月 Agents Week 回顾强调面向 agents 的云原语;前序发布包括 Workers AI 与 AI Gateway 统一、在 Workers AI 上运行 Kimi/GLM 等开源模型、以及 inference/search/memory/voice/email/browser 等 agent 基础设施。
为什么重要:Cloudflare 的路线是把 agent 所需的推理、工具访问、观测和安全边界放到边缘平台里。对创业团队,这降低了把 agent 从 demo 推到生产的 DevOps 门槛;对模型厂商,则扩大多模型网关与开源模型分发入口。
来源:https://blog.cloudflare.com/agents-week-review-august-2026/
#5
vLLM v0.27.x:Kimi K3 支持与高吞吐推理栈继续前进
摘要:GitHub API 显示 vLLM v0.27.0 于 2026-08-10 发布,包含 561 commits / 242 contributors,重点是 Kimi K3 全栈支持:model files、kernels、Python/Rust frontends、AttnRes、DeepGEMM、compressed-tensors quantized checkpoints、DSpark AR fusion、shared expert sharding;v0.27.1 于 8 月 11 日追加 quantized DSpark Markov heads。
为什么重要:开源 serving 层正在快速追随中美大模型的新架构,尤其是 MoE、量化 checkpoint、speculative/AR fusion、专家并行。模型发布后的“可便宜跑、可大并发跑”正在成为开源生态的真正壁垒。
来源:https://github.com/vllm-project/vllm/releases
其他值得关注
#6
中国 AI 生态:Qwen3.8-Max、Kimi/GLM 部署入口与 DeepSeek Harness 信号
摘要:阿里云 8 月 3 日宣布 Qwen3.8-Max:2.4T 参数、最高 1M context、Text Arena 第五、Vision Arena 第二;Qwen Code 文档近一周持续更新。Cloudflare 近期文章将 Kimi 与 GLM 作为 Workers AI 上的大模型部署对象。DeepSeek GitHub 搜索结果显示 deepseek-harness 在 8 月 13 日有 MIT license 相关活动。
为什么重要:中国模型竞争已经分化为三条线:超大闭源/API 模型(Qwen Max、Kimi、GLM 等)、可部署/可服务化模型、以及 agent harness/coding 工具链。海外基础设施平台主动适配 Kimi/GLM,说明中国开源/开放权重模型正在成为全球 inference 栈的工作负载,而不只是本土替代品。
来源:https://www.alibabacloud.com/en/press-room/alibaba-unveils-qwen3-8-max
#7
商业新闻:Anthropic 据称洽购 Decart,估值约 60 亿美元
摘要:Bloomberg 8 月 13 日报道称 Anthropic 正在洽谈以约 60 亿美元收购以色列 AI startup Decart;多家转述称 Decart 方向涉及生成式视频、world models 与 GPU / inference 优化。
为什么重要:如果交易推进,含义不只是视频能力补齐,而是 inference efficiency 与世界模型能力成为前沿实验室的战略资产。随着 Claude 用户与企业用量增长,谁能压低推理成本、提升 GPU 利用率,谁就能在价格战中保住毛利。
来源:https://www.bloomberg.com/news/articles/2026-08-13/anthropic-said-in-talks-to-buy-ai-startup-decart-for-6-billion
来源链接