每日 AI 速览

2026-08-11

生成于 2026-08-12 04:11
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日,智能体领域迎来模型与框架的双重升级:NVIDIA 推出专为长时运行智能体优化的 Nemotron 3.5 Lightning,并发布 NeMo Switchyard 实现多模型动态路由;Meta 开源 Muse Glimmer 与 Spark 系列,探索开放权重的个人超智能。安全攻防侧,OpenAI 发布 GPT-5.6-Cyber 聚焦漏洞发现。基础设施层面,NVIDIA 以芯片价值担保撬动 5000 亿美元 AI 基建融资,GPU 金融化正式登场。微软则正式推出 Agent Framework Harness 与 Hosted Agents,加速智能体编排工程化落地。

行业动态 40 条

v0.5.17

SGLang · 08-11 11:17 UTC+8

SGLang v0.5.17 发布,从首日起原生支持 Kimi K3(2.8T 参数多模态 LatentMoE 模型),并集成了 DCP 分布式检查点、DSpark 推测解码、分块预填充与 TP 解码、KDA 感知前缀缓存等大量推理优化特性,为行业展示了对超巨型 MoE 模型的推理支持能力。

推理优化SGLang推理框架Kimi K3MoE

Route AI Agent Workloads Across Models with NVIDIA NeMo Switchyard

NVIDIA 开发者 · 08-11 21:00 UTC+8

NVIDIA 发布 NeMo Switchyard,能够根据成本、延时和能力动态将代理工作负载路由至不同模型,帮助企业复用多种模型以提升整体代理系统的效率。

AgentNVIDIANeMo Switchyard模型路由代理AI

Introducing Muse Glimmer

Simon Willison · 08-11 07:56 UTC+8

Meta 发布 30B 参数开源模型 Muse Glimmer,采用 Apache 2.0 许可,专精端到端代理任务,在 DeepSearch QA、MCP-Atlas 等代理基准上取得高成功率。

基座MetaMuse Glimmer开源模型Agent

v0.27.0

vLLM · 08-11 05:18 UTC+8

vLLM v0.27.0 发布,全面支持 Kimi K3 模型,新增 Qwen3 等模型,并引入 DeepGEMM 加速、多模态性能提升等多项改进,标志着对超大规模 MoE 推理的成熟支持。

InfravLLM推理框架Kimi K3多模态

OpenAI launches GPT-5.6-Cyber to help defenders find vulnerabilities before attackers do

The Decoder · 08-11 02:01 UTC+8

OpenAI 推出 GPT-5.6-Cyber,专为安全防御设计,能回答 98.5% 原本会被拦截的安全查询,并已发现两个此前未知的 Chrome 漏洞,帮助防御者在攻击者之前掌握情报。这缩短了防御窗口,但需身份验证才能使用。

基座GPT-5.6-Cyber网络安全漏洞挖掘防御者工具

Introducing Unsloth Desktop 🦥

Unsloth · 08-11 23:57 UTC+8

Unsloth 推出桌面应用,可在本地运行和训练模型,支持 Windows、macOS 和 Linux,集成自愈式工具调用和沙箱代码执行,将工具调用准确率提升高达 50%,并可运行 Muse Glimmer、Kimi K3 等最新模型以及生成视频和图像。这让开发者一站式完成研究、导出和部署。

InfraUnsloth Desktop本地训练工具调用桌面应用

v0.27.1

vLLM · 08-11 18:49 UTC+8

vLLM v0.27.1 作为补丁版本,新增对量化 DSpark Markov heads 的支持,进一步完善推理性能。

vLLM量化推理优化

Nvidia guarantees its own chips' value to unlock $500 billion in AI infrastructure financing

The Decoder · 08-11 17:41 UTC+8

英伟达联合 Apollo、BlackRock 等金融巨头为 AI 基础设施融资超 5000 亿美元,并为其硬件残值提供最高 25% 的保底担保,以吸引投资者。此举标志着 GPU 资产加速金融化,但英格兰银行已警告若 AI 行业受冲击可能引发系统性风险。

Infra英伟达基础设施融资GPU 金融化残值担保

v0.32.8

Ollama · 08-11 14:39 UTC+8

Ollama v0.32.8 将 Muse Glimmer 模型带到所有平台,并借助 MLX 引擎在 Apple Silicon 上提供最优性能,支持 DFlash 和图像输入,可直接驱动 Claude Code 等编码代理与长期助手,便于开发者在本地运行高性能代理。

推理优化OllamaMuse GlimmerMLXApple Silicon

b10357

llama.cpp · 08-11 13:19 UTC+8

llama.cpp 更新 OpenCL 后端,在局部内存中转置 K 分块来加速 FlashAttention 预填充核,从而提升推理效率。

llama.cppOpenCLFlashAttention推理优化

微软正式发布 Agent Framework Harness 和 Hosted Agents

InfoQ 中文 · 08-11 01:14 UTC+8

微软正式发布 Agent Framework Harness 和 Hosted Agents,为构建和托管智能体提供框架与服务。这标志着微软在智能体基础设施上进一步发力,方便从业者快速开发和部署智能体。

Agent微软Agent FrameworkHosted Agents智能体框架

Deploying Anthropic Claude apps gateway for AWS for enterprise workloads

AWS 机器学习 · 08-11 23:59 UTC+8

AWS 发布 Claude apps gateway 的生产参考部署,该自托管治理层连接 Claude Code 和 Claude Desktop 与 Amazon Bedrock,为企业安全使用 Claude 编码和桌面工具提供端到端架构、部署模式及成本方案。这对希望将 Claude 整合进企业工作流的团队有直接参考价值。

InfraClaudeAWS Bedrock治理网关企业部署

Thinking of ACE? We Can Do It with Fewer Tokens

HuggingFace 博客 · 08-11 21:37 UTC+8

HuggingFace 博客探讨 ACE 方法,声称用更少 Token 即可实现,暗示在推理效率和成本控制上有优化空间,对关注推理经济性的从业者有启发。

推理优化HuggingFaceACE推理效率Token 优化

v0.32.9

Ollama · 08-11 21:24 UTC+8

Ollama v0.32.9 集成了 NVIDIA Nemotron 3.5 Lightning,这是一个 30B 参数的 MoE 模型,仅 3B 活跃参数,专为常驻智能体设计,并配套 NemoClaw 安全栈。开发者可本地轻松运行高效代理,无需远程依赖。

InfraOllamaNemotron 3.5 LightningMoE代理模型

NVIDIA and Local AI Community Fuel Open Source Models and Intelligent Agents

NVIDIA 博客 · 08-11 21:00 UTC+8

NVIDIA 联合开源社区推动本地 AI 发展,发布开放模型与软件,赋能开发者构建和定制智能体,强调本地运行的趋势。这对追求隐私和低延迟代理的从业者是一大利好。

厂商动态NVIDIA开源模型本地 AI智能体

Anthropic signs $9.1 billion data center deal with Bitcoin miner Riot Platforms

The Decoder · 08-11 19:33 UTC+8

Anthropic 与比特币矿商 Riot Platforms 签订 91 亿美元数据中心租约,获取 191 兆瓦容量,并可扩展至 161 亿美元,反映出 AI 公司大规模抢占电力与算力基础设施的态势,对行业竞争格局有深远影响。

InfraAnthropic数据中心电力基础设施扩张

viable/strict/1786446300

PyTorch · 08-11 14:35 UTC+8

PyTorch Inductor 在融合搜索中缓存每个节点的分块内存,降低重复计算开销,提升编译效率。

InfraPyTorchInductor编译优化缓存

viable/strict/1786444485

PyTorch · 08-11 14:17 UTC+8

PyTorch Inductor 修复 FXIR 后端在处理复合符号整数图输入时的崩溃问题,增强了鲁棒性。

InfraPyTorchInductor崩溃修复FXIR

viable/strict/1786442923

PyTorch · 08-11 13:49 UTC+8

PyTorch 性能优化,在 SymNode.expr 和张量相关操作中避免重复计算不变量,减少不必要的开销,提升整体推理速度。

InfraPyTorch性能优化符号计算重复计算消除

viable/strict/1786441060

PyTorch · 08-11 13:20 UTC+8

PyTorch Inductor 的 addmm 自动调优现在能正确处理带偏置的示例输入,这对 PrismNet 等场景有直接性能改善。

InfraPyTorchInductor自动调优PrismNet

GPU开始金融化!黄仁勋拉上华尔街搞5000亿美元融资

量子位 · 08-11 12:31 UTC+8

英伟达拉上华尔街开启 5000 亿美元 AI 基础设施融资并担保 GPU 残值,让 GPU 像理财产品一样被金融化,可能改变 AI 算力的投资分配方式。

InfraGPU 金融化英伟达基础设施融资残值担保

b10356

llama.cpp · 08-11 10:47 UTC+8

llama.cpp CI 切换至 ROCm 7.14,该版本采用 TheRock 构建系统,支持多架构安装,并更新了 Windows 构建流程,为 AMD GPU 用户带来更稳定的发布。

Infrallama.cppROCmCI构建系统

Ray-2.57.0

Ray · 08-11 09:15 UTC+8

Ray 2.57.0 发布,Ray Data 默认启用 DataSourceV2 支持行组感知分块和谓词分割,同时 Hash Shuffle V2 用无状态任务替代聚合器池,改善内存管理与容错能力,提升数据处理效率。

InfraRay数据处理Shuffle优化新版本

b10355

llama.cpp · 08-11 07:17 UTC+8

llama.cpp 新增后端多输出采样支持,可配合 token 猜测提升效率,并修复了 CPU 与 GPU 采样不一致的问题,对需要推测解码的场景有直接价值。

推理优化llama.cpp采样优化多输出后端

b10353

llama.cpp · 08-11 06:02 UTC+8

llama.cpp 修复 CUDA 和 Metal 后端的 ROLL 操作因未检查连续输入而导致的静默错误,确保正确性,避免潜在计算偏差。

Infrallama.cpp错误修复ROLL操作CUDA/Metal

Unsloth v0.1.62-beta

Unsloth · 08-11 22:47 UTC+8

Unsloth 发布 v0.1.62-beta 版本,主要修复诸多错误,提升稳定性。

InfraUnsloth修复Beta

论文 20 篇

多篇论文聚焦智能体记忆蒸馏与自进化、KV 缓存前瞻性稀疏预取以及数学泛化融合训练等前沿方向。

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

HF 精选 · 08-11 08:00 UTC+8

Ouroboros 是一个自我进化的编码代理,其工具、提示、上下文组装和核心逻辑通过受审核的代码提交不断演化,这些提交直接成为后续工作的运行时。它支持递归自由进化和经验驱动进化两种模式,前者将改进本身作为任务、自动调度新一轮循环,后者利用日常任务和交互中暴露的缺陷与粗糙点来驱动核心修正,让代理的自我完善既灵活又有实用根基。

Agent自我进化Agent代码代理核心演化经验驱动

Motif 3: Technical Report

HF 精选 · 08-11 08:00 UTC+8

Motif 3 是一个大规模稀疏 MoE 语言模型,引入分组差分潜在注意力机制并结合一系列专门训练技术,在推理、编码和长上下文任务上取得了强劲表现。它的设计试图在极高效率下同时覆盖需要短程与超长程依赖的场景。

基座MoE差分潜在注意力长上下文大模型

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

HF 精选 · 08-11 08:00 UTC+8

Macaron-V1 是一套开放的代理模型家族,基于 Mixture-of-LoRA 架构和递归自我改进机制,使单个模型能够跨多个专业任务持续学习并协作,避免了灾难性遗忘和孤岛化。其核心思路是将不同技能的 LoRA 混合并与自进化流程结合,让持续学习从实验室走向实用。

Agent持续学习混合LoRA自我改进Agent模型

OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetching

MicrosoftHF 精选 · 08-11 08:00 UTC+8

OasisKV 将 LLM 推理期间完整的 KV 缓存存放在容量更大但速度较慢的内存层中,利用推测解码产生的前瞻序列来预测并只预取相关的键值对到 HBM,实现稀疏预取。这种方法有效突破 HBM 容量瓶颈,提升了长上下文推理的吞吐量。

KV缓存推理优化推测解码预取

Fusion Training for Mathematical Generalization in Large Language Models

ACL 2026CCF-A推荐arXiv · 08-11 01:41 UTC+8

该工作系统研究了思考模式融合(TMF)在大模型数学推理中的训练动态,重点分析了思维模式与非思维模式之间的数据配比和训练调度对模型泛化的影响。通过数学领域的实验,揭示了不同融合策略如何影响模型从简洁回答到长链推理的弹性切换能力。

训练思维模式融合训练动态数学推理模型融合
Congfeng Cao, Pengyu Zhang, Jelke Bloem

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

COLM 2026arXiv · 08-11 00:23 UTC+8

SWE-Bench ProMax 针对现有编码基准测试过饱和以及评估质量缺陷,构建了一个面向大型真实项目的多语言代码重构基准,要求代理执行长期规划、跨文件修改等更复杂的重构任务。它旨在迫使模型展现真正的软件工程能力,而非靠记忆训练数据中的补丁通过测试。

Agent代码重构多语言基准测试Agent评估
Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao

Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory

HF 精选 · 08-11 08:00 UTC+8

通过将大型教师代理的分层记忆结构直接蒸馏给小型语言模型,无需任何额外微调即可显著提升小模型的工具使用能力。这种记忆迁移保留了任务执行过程中积累的结构化知识,让小模型也能像大模型一样高效地调用工具。

Agent模型蒸馏记忆蒸馏小型模型工具使用

SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

HF 精选 · 08-11 08:00 UTC+8

SPOT 在策略蒸馏中采用稀疏探测,仅对模型预测不确定的位置进行针对性询问,并根据下游任务最终结果来校准蒸馏目标,从而避免无效采样。这一设计有效提升了推理模型蒸馏后的推理质量和生成覆盖度,在保持效率的同时防止模式坍缩。

后训练策略蒸馏推理蒸馏稀疏探测校准

Scaling Inherently Interpretable Language Models

HF 精选 · 08-11 08:00 UTC+8

该研究将可解释性作为训练约束,直接编码到模型结构或训练目标中,得到可扩展的解耦表征。这样训练出的模型不需要二次微调就能支持特征归因、知识检索和表征操控,为构建原生可解释的大模型提供了一条可行路径。

训练可解释性解耦表示表示学习模型操控

Evidence-RL: Towards Evidence-intensive Visual Reasoning

HF 精选 · 08-11 08:00 UTC+8

Evidence-RL 在视觉推理的强化学习后训练中引入反事实证据解耦,通过审计模型答案是否因果依赖于局部视觉证据,迫使模型真正“看”到关键区域。这种方法提升了视觉问答和解释的可靠性,减少语言偏见的干扰。

后训练视觉推理证据解耦强化学习可解释性

SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification

HF 精选 · 08-11 08:00 UTC+8

SymDiag 将 LLM 推理验证重新定义为故障诊断:先将思维链转为符号约束,再逐步检查可满足性,并能分离“翻译错误”和“推理错误”,提供可回溯的步骤级诊断证据。这让黑箱推理的调试变得可解释且可验证。

推理优化神经符号推理推理验证故障诊断可解释性

Omega-S: A Functional Resilience Index for LLM Fine-Tuning

HF 精选 · 08-11 08:00 UTC+8

Omega-S 是一种无数据依赖的轻量正则化项,用于 LoRA 等低秩微调,通过在训练中惩罚权重矩阵节点度的方差,有效抑制对原始能力的遗忘。它能在不掉点的情况下显著提升微调后模型的保留率。

后训练微调正则化LoRA灾难性遗忘模型能力保留

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

HF 精选 · 08-11 08:00 UTC+8

BDH-CQ 是一个仅 150M 参数的推理模型,它结合循环潜在推理和上下文学习,在 ARC-AGI-1 基准上达到了新的成本-准确率前沿,表明小模型通过精巧的推理机制也能挑战复杂推理任务。

推理优化小模型推理上下文学习潜在空间

Evo-Bench: Can Language Models Improve Agent Harness?

HF 精选 · 08-11 08:00 UTC+8

Evo-Bench 评估语言模型自主优化代理框架的能力,采用敏感性感知任务构造方式,揭示了不同领域间进化收益的巨大差异。它帮助研究者理解在哪些场景下让模型自动改进其工具和提示更有效。

Agent代理框架自动优化基准测试领域依赖

A^2E : An End-to-End Agent Auditing Engine

上海 AI LabHF 精选 · 08-11 08:00 UTC+8

A2E 是一套端到端代理审计引擎,采用标准化任务协议并采集执行轨迹,从效率、工具使用、规划和错误恢复四个维度全面评估代理框架的质量。它为代理系统的迭代提供了系统化的评测手段。

Agent代理评估审计端到端工具使用

The Loss Does Not See the Basis, but Adam Does

HF 精选 · 08-11 08:00 UTC+8

该研究揭示在分解矩阵的模型训练中,损失本身对坐标基底不敏感,但 Adam 等坐标式优化器会破坏低秩偏向,导致 Transformer 等模型中解发散。这一发现解释了为何不同优化器会在看似等价的表示空间中表现出截然不同的收敛行为。

训练优化器行为低秩偏差规范等变性Transformer训练

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

COLM 2026arXiv · 08-11 01:27 UTC+8

Sci-VBench 构建了包含 1253 个专家标注示例的科学视频生成基准,覆盖自然科学、医疗健康、社会科学和工程四大学科,要求模型生成符合科学知识与动态推理的视频。它为多模态模型的知识密集型视频合成提供了系统评估平台。

基座视频生成基准科学推理多模态评估
Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao

DSLE: A Learning Environment for Dark Souls Boss Encounters

AAAI 2026CCF-A推荐arXiv · 08-11 01:48 UTC+8

Dark Souls Learning Environment (DSLE) 将《黑暗之魂》全部 22 场首领战封装为 Gymnasium 接口的强化学习环境,提供实时战斗、高维视觉输入和稀疏奖励,用于评测游戏代理的感知与决策能力。同时定义了 DSLE-5 子集以便快速比较。

游戏AI强化学习环境基准测试视觉输入
Derin Gezgin, Jim O'Connor, Tanner Goodwin, Gary B. Parker