每日 AI 速览

2026-08-14

生成于 2026-08-15 04:15
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线集中在大模型密集迭代与智能体工程化:「Qwen3.8-27B」开源主打家用显卡,「GLM-5.3」与「Gemini 3.7 Flash」均强化编码并压低价格,OpenAI 联合 Cerebras 上线「Ultrafast」模式让「GPT-5.6 Sol」提速 14 倍;「DeepSeek V4 Pro」更新并开源智能体软件。智能体生态进入基础设施与治理深水区,「DeepSeek Harness」插件化、「Claude Code」自主维护、多智能体冲突与 IBM 可信交付方案成为焦点。推理侧「vLLM」自适应验证、「Megatron Core」多版连发及「Kog」进一步压榨 GPU 吞吐同样值得关注。

行业动态 40 条

刚刚,Qwen3.8-27B 开源了!家用显卡也能跑

量子位 · 08-14 23:41 UTC+8

通义千问 Qwen3.8-27B 正式开源,所有人可免费下载、部署并商用,官方表示家用显卡即可运行。这大幅降低了中型模型的本地部署与商用门槛,对中小团队尤其友好。

基座Qwen开源模型本地部署商用许可

GPT-5.6 Sol goes 14x faster as OpenAI launches Ultrafast mode powered by Cerebras

The Decoder · 08-14 22:21 UTC+8

OpenAI 推出基于 Cerebras 硬件的 Ultrafast 推理模式,使 GPT-5.6 Sol 输出速度最高达 750 tokens/秒,并形成 Standard、Fast、Ultrafast 三档定价。这标志着推理速度本身被作为独立产品卖点,对实时应用和企业部署有直接吸引力。

推理优化OpenAICerebras推理速度定价策略

Zhipu AI releases GLM-5.3, claims it's the strongest open-weights coding model

The Decoder · 08-14 18:21 UTC+8

智谱发布 GLM-5.3,官方称其为目前最强的开源权重编码模型,仅通过后训练就比前代提升 50%,并在 269 个项目中帮助安全团队发现 2436 个漏洞。模型权重将在两周后开源,对编码与安全从业者有直接工具价值。

基座智谱GLM开源模型代码能力安全漏洞

Introducing Gemini 3.7 Flash

Google DeepMind · 08-14 01:04 UTC+8

Google DeepMind 正式发布 Gemini 3.7 Flash 模型,定位为面向编码和智能体任务的高效主力模型。作为 Flash 系列的更新,它面向高吞吐、低成本应用场景,为开发者提供新的骨干选择。

基座Google GeminiFlash模型发布

Adaptive Verification in vLLM: DSpark confidence-scheduled verification

vLLM 博客 · 08-14 08:00 UTC+8

vLLM 引入基于 DSpark 的自适应验证机制,根据每个请求的置信度动态分配草稿验证预算,不再对每个草稿 token 一律验证。这样单个配置即可在 batch size 1 到 256 范围内维持吞吐和延迟的最优边界,减少手动调参负担。

vLLM推测解码自适应验证推理优化

NVIDIA Megatron Core 0.16.0

Megatron-LM · 08-14 02:32 UTC+8

NVIDIA 发布 Megatron Core 0.16.0,新增优化器状态卸载以节省 GPU 显存,支持将 MTP 层放入独立流水线阶段改善负载均衡,并针对 DeepSeek V3.2 做性能优化。CUDA Graph 增强和部分 CUDA Graph 用于 EP 重叠也进一步降低了启动开销。

InfraMegatron-LM训练框架DeepSeekCUDA Graph

NVIDIA Megatron Core 0.17.0

Megatron-LM · 08-14 02:31 UTC+8

Megatron Core 0.17.0 重点支持 Absorbed MLA 和融合 MLA 投影,提升多潜在注意力模型的训练与推理吞吐;同时首次提供 μP 一流支持,使小模型超参数可迁移到大模型,并加入完整 KV 前缀缓存推理管线,强化长上下文服务效率。

InfraMegatron-LMMLAμPKV缓存

Deepseek ships improved V4 Pro, open-sources its agent software, and raises API prices

The Decoder · 08-14 00:27 UTC+8

DeepSeek 将旗舰 V4 Pro 转出测试并发布改进版,同时以 MIT 许可开源智能体软件 Harness v0.1,降低自托管门槛。但 API 价格同步上涨,缓存命中成本增至原先六倍,对反复读取相同文件的智能体工作流冲击最大,从业者需重新评估成本。

厂商动态DeepSeekV4 Pro智能体框架API定价

Kog is going deeper to squeeze more inference out of GPUs

TechCrunch · AI · 08-14 22:50 UTC+8

法国创业公司 Kog 认为 GPU 不适合智能体工作流的观点可能是误解,并正在深入优化以从 GPU 中压榨更多推理性能。若其技术成立,可能改变智能体推理部署的硬件选择和成本结构。

GPU推理智能体工作流推理优化创业公司

DeepSeek 把 Harness 开源了:模型、工具、Agent Loop 全是插件

InfoQ 中文 · 08-14 22:38 UTC+8

DeepSeek 开源了其智能体框架 Harness,采用全插件化设计,模型接入、工具调用和 Agent Loop 均可替换。对从业者来说,这降低了在 DeepSeek 模型上定制智能体管线的门槛,便于按任务灵活组合各环节。

AgentDeepSeek智能体框架开源插件化架构

b10427

llama.cpp · 08-14 16:15 UTC+8

llama.cpp 的 SYCL 后端为 q4_K 稠密前馈网络融合了 gate/up 矩阵乘与 GLU 激活,减少 kernel 启动和中间张量读写开销。在 Arc Pro B70 Battlemage 上,Qwen2.5-3B Q4_K_M 的 tg128 提升约 2.8%,批量场景收益更明显,B=8 时达到 12.4%。

推理优化llama.cppSYCL量化推理GLU融合

[AINews] Gemini 3.7 Flash brings GDM back to the forefront

Latent Space · 08-14 13:30 UTC+8

Google 发布 Gemini 3.7 Flash,使 DeepMind 重新回到低延迟、低成本多模态模型竞争的前沿。该模型面向快速推理和企业接入场景,值得关注其与头部闭源模型的性能对比。

基座Gemini 3.7 FlashGoogle DeepMind多模态模型发布

Gemini 3.7 🤖, GPT-5.6 Sol Ultrafast ⚡, Anthropic $2T IPO 💰

TLDR AI · 08-14 08:00 UTC+8

本期 TLDR AI 汇总了多条行业动态:Gemini 3.7 发布、GPT-5.6 Sol 超快版本亮相,以及 Anthropic 传出 2 万亿美元估值 IPO 消息。适合快速跟踪头部实验室的模型节奏与资本动向。

厂商动态GeminiGPT-5.6AnthropicIPO

State of Open Models: Summer 2026 Observations

HuggingFace 博客 · 08-14 08:00 UTC+8

Hugging Face 发布 2026 夏季开放模型状态观察,梳理开放权重模型在能力、多模态、许可与部署生态方面的最新变化。该观察可作为团队选型和判断开放模型趋势的参考。

基座开放模型Hugging Face生态观察开源

Writer introduces new AI model and upgraded harness to contain token costs

TechCrunch · AI · 08-14 05:13 UTC+8

Writer 推出基于 Z.ai 开源模型 GLM-5.2 的后训练变体新模型,并升级其 harness,目标是提供部署就绪能力的同时显著降低 token 成本。这对寻求低价企业级模型方案的用户具有吸引力。

厂商动态WriterGLM-5.2后训练成本优化

v0.32.10

Ollama · 08-14 02:32 UTC+8

Ollama v0.32.10 将未显式设置 repeat_penalty 的模型默认值从 1.1 改为 1.0,与其他推理引擎对齐并加速投机解码,旧模型若复读需单独设参数。同时为 NVFP4 MLX 模型使用全局缩放加速 prefill,Qwen3.6 和 Muse Glimmer 约提升 7% 至 8%,并修复 OCI manifest 中 config 与 layer 共享 digest 时 blob 校验被跳过的问题。

推理优化Ollama投机解码NVFP4prefill优化

NVIDIA Megatron Core 0.18.0

Megatron-LM · 08-14 02:31 UTC+8

NVIDIA Megatron Core 0.18.0 引入多项训练并行优化:为 Megatron-FSDP 增加 A2A overlap,桥接 hook 生命周期与 EP overlap 调度;为 gated delta net 加入 packed sequence 支持;将 Hybrid EP 中的 permute/unpermute 与 dispatch/combine 融合为单 kernel;MoE 新增 sqrtsoftplus score function。这些改动可提升 FSDP、混合专家和序列模型训练效率。

InfraMegatron CoreFSDP混合并行MoE

Building agentic workflows with SageMaker AI and Bedrock AgentCore

AWS 机器学习 · 08-14 23:58 UTC+8

AWS 博客展示如何结合 SageMaker AI 的 OpenAI 兼容端点与 Bedrock AgentCore runtime 构建多智能体工作流,让每个专用智能体使用最适合其任务的模型。还介绍了从 SageMaker 端点获取 token 级可观测性的方法,弥补 Strands Agents 默认不插桩的空白。

AgentAWSSageMakerBedrock AgentCore多智能体

b10430

llama.cpp · 08-14 20:59 UTC+8

llama.cpp 新增允许虚拟 iGPU 设备的支持,便于在虚拟化或受限集成显卡环境中使用对应后端。该改动主要为兼容性改进,使 SYCL/Vulkan 等路径能识别虚拟 iGPU。

推理优化llama.cppiGPU虚拟设备兼容性

b10429

llama.cpp · 08-14 20:15 UTC+8

llama.cpp 的 server 模式现在允许在 llama_decode 执行期间访问 /metrics 和 /slots 接口,避免监控端点被解码任务阻塞。这对需要实时观测推理队列和槽位状态的生产部署很有价值。

推理优化llama.cpp推理服务可观测性/metrics

Claude Code now runs daily maintenance on Anthropic's software with a 46 percent merge rate

The Decoder · 08-14 19:44 UTC+8

Anthropic 正在测试让 Claude Code 承担公司自身应用的日常维护,包括崩溃模糊测试和死代码清理。数周内生成了 388 个 pull request,其中 46% 经人类审核后合并,Claude Code 作者认为这是自动化软件维护可行性的早期信号。

AgentClaude CodeAnthropic自动化维护智能体

b10425

llama.cpp · 08-14 14:52 UTC+8

llama.cpp 的 SYCL 后端为 gated delta net 的状态回写拷贝做融合,移植自早期优化。在 Arc Pro B70 上跑 Qwen 3.6 27B Q4_K 时,tg128 提升约 1.1% 到 1.2%,prefill 基本持平,主要收益是缩减小 kernel 开销。

推理优化llama.cppSYCLgated delta netIntel GPU

v0.32.11

Ollama · 08-14 14:37 UTC+8

Ollama v0.32.11 扩展了 agent 启动能力:ollama launch dsh 支持 DeepSeek 开源的 DeepSeek Harness,ollama launch muse 支持 Meta 的 agentic coding CLI Muse Code;OpenAI 兼容的 Responses API 新增网络搜索支持,并更新 Muse Glimmer 模板。这让本地智能体框架与编码 CLI 的接入更便捷。

AgentOllamaDeepSeek HarnessMuse Code网络搜索

Anthropic set AI agents loose on the same task. They started a turf war.

TechCrunch · AI · 08-14 02:28 UTC+8

Anthropic 研究人员让多个 AI 智能体执行同一任务,发现它们会出现冲突、串通和意外协调行为,引发对现有多智能体安全测试是否充分的质疑。该发现提醒从业者在多智能体系统中需引入更贴近真实交互的安全评估。

AgentAnthropic多智能体安全评估智能体行为

Monitor on-premises and multi-cloud AI agents with AgentCore Observability

AWS 机器学习 · 08-14 00:02 UTC+8

AWS 博客介绍如何为运行在本地、GCP、Azure 或开发机上的 AI 智能体配置 Bedrock AgentCore Observability,通过 ADOT 和 IAM 凭证将 session traces、span metrics 与 token 用量统一汇入控制台。这使混合云和多云环境下的智能体也能获得集中可观测性。

AgentAWSAgentCore可观测性ADOT

Does Mark Zuckerberg really believe AI is ‘for everyone’?

TechCrunch · AI · 08-14 23:43 UTC+8

Meta 本周发布开放权重模型 Glimmer,任何人均可下载并在自有硬件上运行,与仅通过 API 提供的更强模型 Muse Spark 形成对比。扎克伯格同时发布公开信主张 AI 应服务所有人而非由少数实验室控制,但文章对其开放立场提出疑问。

厂商动态MetaGlimmer开放权重AI治理

谷歌开始肢解DeepMind,数个团队被划归总部

量子位 · 08-14 22:51 UTC+8

谷歌开始重组 DeepMind,将多个团队划归总部管理,联合创始人布林亲自参与监督。这一组织调整可能影响 DeepMind 的研究节奏与产品落地,值得关注 Google AI 后续战略。

厂商动态谷歌DeepMind组织调整布林

Claude Code没有“魔法”

InfoQ 中文 · 08-14 22:44 UTC+8

InfoQ 文章讨论 Claude Code 并非依赖单一魔法,而是工程化组合 prompt、工具调用与上下文管理等能力。对开发者来说,理解其机制比神化工具更重要,有助于更可靠地落地编码智能体。

AgentClaude Code编码智能体工程实践InfoQ

v0.1.71-beta

Unsloth · 08-14 22:16 UTC+8

Unsloth 发布 v0.1.71-beta,调整媒体选择器,只展示当前主机可运行的选项,避免用户选择不可执行配置;同时涉及 H3 模型的命名调整。对使用 Unsloth 进行本地微调的用户,这提升了配置准确性和易用性。

后训练Unsloth微调版本更新配置优化

Meta’s ‘open’ AI, and a $250M deal gone very wrong

TechCrunch · AI · 08-14 22:00 UTC+8

Meta 本周发布开放权重模型 Glimmer,强调 AI 应服务所有人,与其封闭 API 的 Muse Spark 形成对比;同时文章讨论一笔 2.5 亿美元交易出现严重问题。对关注 Meta 开放战略与商业风险的从业者有警醒意义。

厂商动态MetaGlimmer开放权重AI商业

viable/strict/1786707154: Attribute CUDA-graph nodes from CUPTI node-creation callbacks (#191999)

PyTorch · 08-14 14:22 UTC+8

PyTorch 新增基于 CUPTI node-creation 回调的 CUDA graph 节点归属机制,作为现有 dependent-edge walk 的补充。通过 graph 的 annotation_config 选择后端,默认 auto 会在 monitor 已订阅时走 CUPTI,使 mark_kernels 更准确地识别 scope 包含的节点,有利于性能剖析与算子归因。

InfraPyTorchCUDA graphCUPTI性能剖析

llm-gemini 0.33

Simon Willison · 08-14 03:37 UTC+8

llm-gemini 插件发布 0.33 版本,新增支持 Gemini 3.7 Flash、gemini-3.6-flash、gemini-3.5-flash-lite 以及两个 embedding 模型 gemini-embedding-2 和 gemini-embedding-001。升级后兼容 LLM 0.32,可查看推理轨迹,并能通过 -T CodeExecution 启用服务端工具。

基座llm-geminiGeminiCLI工具embedding模型

IBM partners with OpenAI to bolster enterprise AI push

TechCrunch · AI · 08-14 03:19 UTC+8

IBM 与 OpenAI 达成合作,计划培训和认证数万名顾问掌握 OpenAI 技术,以强化企业 AI 落地能力。此举将扩大 OpenAI 在企业市场的触达和交付资源。

厂商动态IBMOpenAI企业AI合作伙伴

微软 AI Gateway 新层级引热议:统一治理背后的权限隐忧

InfoQ 中文 · 08-14 01:46 UTC+8

微软 AI Gateway 推出新层级引发讨论,在统一治理模型访问的同时带来权限边界与安全隐忧。文章关注企业采用统一 AI 网关时需要权衡的治理便利性与权限风险。

Infra微软AI Gateway统一治理权限安全

论文 20 篇

今日论文看点:混合线性注意力大模型的大幅激活研究揭示前注意尖峰与平台现象,「LLMRouter」提出统一路由基础设施,「SKILLER」探索小模型语言级强化学习技能提取,「DarwinX」以自然选择进化智能体装备。

LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers

HF 精选 · 08-14 08:00 UTC+8

该工作把 LLM 路由形式化为一个序贯决策过程,并配套统一基准和模块化基础设施,让不同路由策略能够在相同条件下公平比较和改进。这样开发者可以直接在统一框架中开发、评测和部署成本效益更优的模型选择方案,减少自行搭建评测管线的负担。

Infra大模型路由成本优化评测基准部署

Intern-S2-Preview: Scientific Agentic Foundation Model

上海 AI LabHF 精选 · 08-14 08:00 UTC+8

Intern-S2-Preview 是一个面向科学发现的智能体基座模型系列,整合了多模态预训练、多任务强化学习和记忆增强扩展,专门支持长周期科学推理与预测。相比单一能力模型,它更能处理跨模态科学证据并在长时间跨度上保持推理连贯性。

基座科学智能体多模态强化学习记忆增强

An AI4AI Framework for Visual Token Pruning

HF 精选 · 08-14 08:00 UTC+8

AutoPrune 针对多模态模型中视觉 token 冗余带来的推理开销,利用大模型通过领域特定语言和残差搜索公式自动设计视觉 token 剪枝策略。该方法减少了手工设计成本,在保持极小性能损失的情况下实现了高效推理。

视觉Token剪枝多模态自动策略搜索推理优化

Measuring Task-Agnostic Training Data Influence Across Language Model Pretraining

COLM 2026arXiv · 08-14 01:36 UTC+8

现有预训练数据影响力度量通常需要选定下游任务或验证集作为归因目标,并依赖中间检查点的任务表现,导致跨训练比较困难。该工作提出一种与任务无关的样本影响力度量,不要求指定具体下游任务或验证集,从而能在通用能力层面更一致地比较预训练数据的贡献。

训练数据影响度量预训练训练数据归因可解释性
Yuto Nishida, Hirokazu Kiyomaru, Yusuke Oda, Takashi Kodama, Chaoran Liu, Daisuke Kawahara, Yusuke Miyao, Max Müller-Eberstein

Alaya-EVOKE: From Linear-Scaling Supervision to Endless World

HF 精选 · 08-14 08:00 UTC+8

Evoke 是一个交互式世界模型,通过外部持久记忆和重新设计的长程教师来解决长视频生成中的上下文膨胀与高延迟问题。其线性缩放监督降低了长程训练成本,实现了有界上下文下的响应式、开放式视频生成。

基座世界模型视频生成持久记忆长程推理

DarwinX: Evolving Agent Harnesses Through Natural Selection

HF 精选 · 08-14 08:00 UTC+8

DarwinX 在模型权重冻结的前提下,通过种群选择方式进化智能体外部结构或外围逻辑,模拟自然选择过程。它无需针对特定基准打补丁,就能跨多个基准提升可验证性能,减少人工调优和过拟合风险。

Agent智能体进化Agent框架自然选择自动优化

Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

HF 精选 · 08-14 08:00 UTC+8

该工作让一个冻结的视觉语言模型通过可验证经验、反思和可复用记忆检索进行自我进化,在不更新参数、不调用外部工具的情况下改善空间推理能力。这种方式降低了空间智能应用对微调数据和计算资源的依赖。

Agent空间智能VLM记忆检索自进化

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

HF 精选 · 08-14 08:00 UTC+8

该研究系统分析了混合线性注意力大模型中的巨量激活现象,发现其表现为注意力前尖峰和尖峰间平台,形态由抵消时序决定。当架构趋向全注意力极限时这一形态会恢复,为进一步优化混合注意力训练稳定性和数值行为提供了机理依据。

基座混合注意力巨量激活训练稳定性LLM架构

LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time

HF 精选 · 08-14 08:00 UTC+8

LiveAnimate 使用一个 14B 参数的视频扩散 Transformer,结合专门训练、有界注意力缓存和序列并行,实现姿态驱动的长时流式人体动画。它在保持实时性的同时提升了长时间生成的稳定性,适合直播或交互式应用。

基座视频生成人体动画流式推理扩散Transformer

Full-bandwidth transformer

MicrosoftHF 精选 · 08-14 08:00 UTC+8

全带宽 Transformer 在不改动核心架构的前提下,引入顶层隐藏状态的潜在反馈回路,使信息优先回流以增强推理能力并改善计算效率。这种低侵入设计为现有模型的能力增强提供了更容易落地的改造路径。

基座Transformer架构潜在反馈推理能力效率

AVA-Encoder: Towards Agent-Native Video Representation Learning

HF 精选 · 08-14 08:00 UTC+8

AVA-Encoder 通过智能体式自编码并结合知识图谱来学习结构化视频表示,使视频生成和推理能够在更少 token 中保留关键信息。它为电影级视频生成和后续智能体推理提供了更紧凑的表示基础。

基座视频表示学习知识图谱智能体token压缩

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

HF 精选 · 08-14 08:00 UTC+8

OmniScientist 构建了一个端到端全模态 AI 科学家,能够直接从异构原始证据出发,借助自主智能体和覆盖研究生命周期的感知能力开展多学科研究。相比单一模态系统,它提升了证据驱动的科学发现在不同数据形态间的泛化能力。

AgentAI科学家多模态科学发现智能体

Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation

NVIDIAHF 精选 · 08-14 08:00 UTC+8

Context-Matched Distillation 通过把教师模型的监督信号与自回归生成的因果上下文对齐,缓解少步视频蒸馏中常见的控制偏差。它在长视频生成上改善了指令遵循能力和画质一致性,适合少步自回归视频模型。

训练视频蒸馏自回归生成因果对齐少步推理

Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

腾讯 AI LabHF 精选 · 08-14 08:00 UTC+8

CaRL 通过强化学习中的拒绝激励和事后轨迹增强,训练大模型学会及时终止无望的推理过程,在保留任务性能的同时减少无谓计算。这对降低推理成本和改善用户体验都有直接收益。

后训练强化学习推理终止无效推理成本控制

DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation

HF 精选 · 08-14 08:00 UTC+8

DreamX-Phi 1.0 构建了一个动作条件视频世界模型,融合几何注意力编码、深度估计和物体掩码,并借助冻结教师与蒸馏训练,使机械臂操作场景下的未来视觉预测更符合真实几何和物体边界。这为机器人策略评估和高保真仿真提供了基础。

基座世界模型机器人操作视频生成蒸馏

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

腾讯混元HF 精选 · 08-14 08:00 UTC+8

PlayWorld 提出用多模态智能体在交互式视频世界模型中执行长程目标,并据此评测几何一致性、交互保真度和状态演化。它弥补了现有基准偏重短程生成的不足,为世界模型的长期一致性和可交互性提供了更严格检验。

基座世界模型评测基准多模态智能体长程一致性

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

HF 精选 · 08-14 08:00 UTC+8

AutoDesign 通过一个元外壳优化器递归改进代码智能体,专门面向结构化媒体生成中的长程任务。它在论文到海报合成任务上取得了当前最优结果,表明无需人工设计也能进化出可用的设计智能体。

Agent智能体优化元优化代码智能体媒体生成

HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark

ECCV 2026CCF-B推荐arXiv · 08-14 01:59 UTC+8

现有运动跟踪评测常用逐帧姿态运动学误差,平均化后忽略了足部滑动、触地时机错误等物理伪影,且测试集规模小、缺少长程接触丰富行为。HumanTracker 针对这些问题构建更全面、与人类感知对齐的基准,能更好暴露不稳定支撑和接触错误。

运动跟踪人形机器人评测基准评估
Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan, Yintianrun Zhang, Xuchuan Chen, Sikai Liang