AI 日报 | 2026-08-04

北京时间 2026-08-04 发布
覆盖窗口:2026-08-02 至 2026-08-04 早间

今日概览

  1. DeepSeek V4 Flash 0731 正式发布:284B/13B-active MoE,Agent 微调后 benchmark 超越自家 V4-Pro Preview,定价 $0.14/$0.28/百万 tokens,MIT 开源权重、原生 Responses API + Codex 支持。这是过去一周讨论度最高的模型发布。
  2. Qwen 3.8 Max GA:8 月 3 日进入 General Availability,附带完整定价与 benchmark,阿里的最新旗舰级模型,代表中国模型生态的持续演进。
  3. Anthropic Claude Code 内幕故事 & Frontier Red Team:Anthropic 发布 Claude Code 从内部 CLI 到正式产品的深度叙事,同时公开三起真实世界网络安全攻防案例。
  4. GitHub Copilot:Agent Skills + MCP 正式 GA:Copilot Code Review 的 Agent Skills 和 MCP 支持已全面可用,coding agent 进入"企业级可定制"阶段。
  5. 推理基础设施加速分化:vLLM v0.26.0 发布 + Z.AI 纯国产芯片数据中心竣工,反映全球推理栈的异构化趋势。
模型发布开源AgentDeepSeek

1. DeepSeek V4 Flash 0731 正式发布:13B Active 在 Agent Benchmark 上超越 V4 Pro Preview

📅 2026-07-31 · 来源:DeepSeek 官方

DeepSeek 将 V4 Flash 从 Preview 正式推进到公开 Beta,同一个 284B / 13B-active MoE 架构,仅通过重新后训练(re-post-training),就在九项 Agent Benchmark 上超越更大规模的 V4 Pro Preview。

关键指标:

为什么重要:这是首次出现小主动参数模型通过 Agent 专项微调全面超越大模型的案例。它验证了一个关键趋势:Agentic 能力不一定需要更多参数,而是需要更针对性的后训练数据与 evaluation。该模型在 Codex CLI 上的原生兼容意味着它已进入 AI coding agent 的主流选项池,性价比极高。

模型发布中国 AIQwenAlibaba

2. Qwen 3.8 Max 全面可用:阿里旗舰模型进入 GA

📅 2026-08-03 · 来源:阿里云 / Qwen 官方

Qwen 3.8 Max 于 8 月 3 日正式进入 General Availability,附带完整定价与 benchmark 数据。此前的 Preview(7 月 19 日发布)仅在阿里 Token Plan、Qoder 和 QoderWork 中可用。GA 版本扩展了 API 可用性和完整文档。

为什么重要:Alibaba 的模型迭代节奏明显加快。Qwen 3.8 Max 标志着中国大模型从"追赶 benchmark"进入"产品化/定价竞争"阶段。Qwen 系列已在全球开发者社区中形成稳定影响力(Hugging Face、ModelScope、Ollama 等均有分发),GA 发布将进一步推动企业级部署。

📎 来源: OFox 分析 · Qwen 官方
AI 安全AgentAnthropicClaude Code

3. Anthropic:Claude Code 内幕故事 & Frontier Red Team 攻防实例公开

📅 2026-07-30 / 8 月初 · 来源:Anthropic Newsroom

Anthropic 近期发布了两篇重要内容:

背景补充:Claude Opus 5(7 月 24 日发布)定位为"比 Fable 5 便宜一半,但仍接近前沿智能"的中档推理模型,主要面向长时间运行的 Agent 工作负载。Claude Sonnet 5 的 introductory pricing(输入 $2 / 输出 $10 / 百万 tokens)持续到 8 月 31 日。

为什么重要:Anthropic 正在系统性地构建 Agent 生态心智——不仅发布模型,还公开工程经验(Claude Code 内幕)、安全实践(Frontier Red Team)和透明定价策略。这种"模型 + 工具 + 安全叙事"的组合对企业和开发者选型影响深远。

AI CodingMCPGitHubCopilot

4. GitHub Copilot:Agent Skills + MCP 正式 GA,Coding Agent 进入企业定制时代

📅 2026-07-29 · 来源:GitHub Changelog

GitHub 正式将 Copilot Code Review 的 Agent Skills 和 MCP Server 支持从 Preview 推进到 General Availability,覆盖 Copilot Pro、Pro+、Business 和 Enterprise 用户。

关键能力:

为什么重要:Copilot 从"代码补全工具"进化为"可编程的 Agent 平台"。Agent Skills + MCP 的组合意味着企业可以将自己的代码库知识、安全策略、架构规范注入到 AI review 流程中,而不只是依赖通用模型。这让 coding agent 从"开发者个人工具"变成"团队工程基础设施"。

推理基础设施开源芯片中国 AI

5. 推理基础设施分化:vLLM v0.26.0 + Z.AI 国产芯片数据中心

📅 2026-07-27 / 7 月下旬 · 来源:GitHub / Bloomberg

过去一周,推理基础设施领域出现两个标志性事件:

此外,Kimi K4(月之暗面 Moonshot AI 下一代模型)被报道需要比 K3 更大的训练规模,但受限于无法购买 NVIDIA Blackwell 芯片,凸显中国 AI 公司在算力获取上的结构性挑战。

为什么重要:推理栈的全球格局正在加速分化。vLLM 生态向 Agentic API 和异构硬件(Ascend 等国产加速器)推进;Z.AI 的全国产数据中心则是中国 AI 供应链独立性的试金石。两类发展都指向同一方向:推理基础设施不再单一依赖 NVIDIA + CUDA。

其他值得关注

🔄 Kimi K2.7 Code 加入 GitHub Copilot 模型池
Moonshot AI 的 K2.7 Code 模型已进入 Copilot 的付费模型阵容,代表中国 coding model 首次进入全球最大开发者平台的默认选项。
🔐 Anthropic Fable 5 全球恢复 + 联手微软/Google/AWS 制定越狱严重性评分框架
Anthropic 的 Fable 5 于 7 月 1 日全球恢复使用(此前因出口管制暂停)。同时,Anthropic 联合 Glasswing 计划成员(AWS、Microsoft、Google 等)提出行业级 jailbreak 严重性评分标准。
📊 中国 AI 生态监控
过去 48 小时内,DeepSeek(V4-Flash-0731 的后续技术讨论活跃)、Qwen(3.8 Max GA)、MiniMax(M3 开源权重 6 月发布后生态持续扩展)、智谱 GLM(GLM-5.2 在 coding benchmark 中表现稳定)、豆包/百度文心(未发现近期重大官方发布)构成了当前中国模型生态的主要竞争格局。建议持续跟踪各家的 API changelog、GitHub release 和官方定价页面,而非仅依赖二级媒体报道。
💰 AI 融资快照
Anthropic 在 5 月底完成 65B 美元 Series H(估值 965B),7 月初二级市场估值突破 1.2T 美元。同时,Baseten(1.5B Series F)、Fireworks AI(1.5B)等推理基础设施公司的密集融资继续推高整个 AI 栈的估值。Cerebras IPO 后表现强劲,5 月上市后与 AMD、CrowdStrike 签约合作。

来源链接