每日 AI 速览

2026-07-31

生成于 2026-08-01 04:12
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日最值得关注的主线有三:OpenAI 发布 GPT-5.6 并宣布降价最高达 80%,同步引入显式提示缓存,将模型性价比与推理成本双双推至新边界;智能体规模化落地加速,Qwen-UI-Agent 技术报告、Echoverse 训练环境与 Beacon 视觉推理等一系列工作齐发,叠加 Metis、Memory Decoder 等记忆基础模型及 TencentDB Agent Memory 开源,为自主智能构筑长期记忆与工具使用基座;多模态基座与视频生成侧创新汹涌,即梦 Seedance 2.5、MiniMax H3 手绘特效与 Chimera 扩散 Transformer 缩放方法,正在重塑创意生产工具链。厂商动态方面,月之暗面 Kimi K3 上架 AWS,米哈游蔡浩宇 AI 创业生变,行业格局持续激荡。

行业动态 40 条

v0.15.0

LMDeploy · 07-31 21:00 UTC+8

LMDeploy v0.15.0发布,新增长上下文与MTP前缀缓存命中、投机解码引导解码、内存分配器与对象缓存调度器整合、AgRs全对全后端,并正式支持DeepSeek V4,推理性能与功能均有显著增强。

InfraLMDeploy推理框架投机解码DeepSeek V4

Advancing the price-performance frontier with GPT‑5.6

Simon Willison · 07-31 07:58 UTC+8

OpenAI大幅下调GPT-5.6价格,Terra降价20%,Luna降价80%,降幅归因于GPT-5.6 Sol对负载均衡和模型前向计算的优化,使顶级智能以更低成本触达用户。

OpenAIGPT-5.6降价推理优化

viable/strict/1785512104

PyTorch · 07-31 21:46 UTC+8

PyTorch cuDNN可变长度注意力扩展支持分页KV缓存(block_table)和序列已用长度(seqused_k),提升变长序列场景下的显存利用率和推理效率。

推理优化PyTorchcuDNNKV缓存可变长度

GPT-5.6今起大降价,最大幅度80%!

量子位 · 07-31 11:01 UTC+8

OpenAI即日起对GPT-5.6 Luna实施80%的最大幅度降价,Terra同样下调20%,大幅降低先进模型的使用门槛。

推理优化GPT-5.6降价Luna

b10206

llama.cpp · 07-31 22:26 UTC+8

llama.cpp 为 DeepSeek V4 等 MLA 模型强制 K/V 缓存使用相同数据类型,并在 V 缓存量化时自动启用 FlashAttention,从而在保持显存效率的同时避免混合精度导致的注意力计算错误,对低比特部署场景尤其关键。

llama.cppDeepSeek V4FlashAttentionKV 缓存量化推理优化

b10205

llama.cpp · 07-31 21:28 UTC+8

ggml 的 ZenDNN 后端新增 group matmul 直接 API,专门为 MoE 模型的 mul_mat_id 操作加速,并根据专家数动态调整回退阈值,提升 CPU 上稀疏混合专家推理的吞吐与自适应能力。

推理优化ggmlZenDNNMoE 推理矩阵乘法CPU 优化

姚顺雨拿50年数学难题成绩单,招人了

量子位 · 07-31 14:54 UTC+8

知名研究者姚顺雨在攻克一项五十年未解的数学难题后,宣布为 AI for Science 方向招人,焦点是将 AI 能力深度融入数学与科学发现。

基座姚顺雨AI for Science数学推理科学发现

Autoscaling endpoints for LLM inference

Together AI · 07-31 08:00 UTC+8

Together AI 分享了推理端点自动伸缩的实践要点,指出 GPU 利用率正常时队列仍可能积压,并就伸缩指标选取、扩缩容窗口调优和冷启动预算给出了具体建议。

推理优化Together AI自动伸缩推理服务冷启动GPU 利用率

Deploying Kimi K3 on AWS

AWS 机器学习 · 07-31 01:22 UTC+8

AWS 官方文章介绍两种部署 Kimi K3 的方式:Amazon SageMaker HyperPod 和 Amazon EKS,为希望在 AWS 上运行该模型的团队提供了生产级指南。

推理优化AWSSageMakerEKSKimi K3模型部署

Echoverse: Deep, evolving environments for computer-use agents

Microsoft Research · 07-31 01:00 UTC+8

微软推出『Echoverse』,为计算机使用智能体提供深度演进的训练环境,让代理在持续变化的任务、测试与环境里应对多步工作流,弥补静态训练集无法覆盖真实动态的短板。

Agent微软EchoverseComputer-Use Agent训练环境多步工作流

Inference meta-monitoring for Amazon SageMaker AI endpoints with Amazon Quick

AWS 机器学习 · 07-31 00:10 UTC+8

该文展示如何为 SageMaker 端点建立推理元监控系统,持续追踪预测与数据质量、检测漂移,并整合延迟的真实标签与自动化性能仪表盘,形成一套 ML 推理的治理层。

推理优化AWSSageMaker推理监控数据漂移MLOps

EvoLib: Turning experience into evolving knowledge

Microsoft Research · 07-31 00:00 UTC+8

微软研究院的 EvoLib 将经验转化为可演进的知识,使 LLM 在部署后仍能不断提取可复用技能与洞见,从而跨任务持续学习,而非仅靠记忆更多数据。

后训练微软EvoLib演进知识持续学习LLM

b10203

llama.cpp · 07-31 20:16 UTC+8

llama.cpp 的 SYCL 后端补全了 q2 量化的矩阵乘法支持,覆盖更多 q2_0 场景,使得在 Intel GPU 上运行极低比特量化模型变得可行。

推理优化llama.cppSYCLQ2 量化矩阵乘法Intel GPU

Building a Policy-Governed Multi-Agent Financial Research Workflow with Omnigent

MarkTechPost · 07-31 12:44 UTC+8

本教程展示如何用 Omnigent 构建策略治理的多智能体金融研究工作流,集成实时汇率数据,实施层级代理委托与硬约束策略(成本预算、工具调用上限),在 Google Colab 即可运行。

AgentOmnigent多智能体系统金融研究策略治理智能体编排

trunk/437657ad1d23900c7e99894188ed8f9be8be0d85

PyTorch · 07-31 09:33 UTC+8

回退了先前尝试让 FlexGEMM 与 NVGEMM 共享 CuTeDSL epilogue 降落的提交,意味着该融合工作还需重新调整以兼容现有管线。

推理优化PyTorchNVGEMMCuTeDSLEpilogue代码回退

viable/strict/1785473837

PyTorch · 07-31 08:03 UTC+8

PyTorch 在 cuDNN SDPA 中将注意力掩码的 dtype 显式声明给 cuDNN,而非继承推断,避免因类型匹配错误导致的性能退化或数值问题。

PyTorchcuDNNSDPA注意力掩码推理优化

Run High-Performance Core Math at Scale with NVIDIA nvmath-python

NVIDIA 开发者 · 07-31 06:43 UTC+8

NVIDIA 发布 nvmath-python,桥接 Python 科学社区与 CUDA-X 数学库,使 Python 用户能直接调用高性能核心数学运算,大幅简化 GPU 加速的数值计算流程。

InfraNVIDIAnvmath-pythonCUDA-X高性能计算Python 科学库

Four Ways to Deploy More Secure AI Agents

NVIDIA 开发者 · 07-31 05:09 UTC+8

NVIDIA 开发者博客分享四种部署更安全 AI 代理的方法,针对知识工作者场景,强调身份验证、最小权限、输出护栏等实践,降低“数字同事”代理在企业落地的风险。

AgentNVIDIAAI 代理安全企业部署智能体安全

b10207

llama.cpp · 07-31 23:14 UTC+8

llama.cpp 的 SYCL 后端补全了数据拷贝操作中缺失的类型支持,增强在 Intel GPU 上通用张量操作的覆盖度与稳定性。

推理优化llama.cppSYCL数据拷贝类型支持

Building abundant intelligence

OpenAI · 07-31 23:00 UTC+8

OpenAI 阐述其全栈策略,通过模型、基础设施和生态的协同优化,让先进 AI 更强大、更便宜、更易用,对从业者而言意味着推理成本与接入门槛有望进一步降低。

厂商动态OpenAI全栈 AI成本降低模型能力

b10204

llama.cpp · 07-31 20:46 UTC+8

llama.cpp 为 SYCL 后端新增设备到设备内存拷贝支持(DEV2DEV_MEMCPY_FORWARD),避免在 Intel GPU 上不必要的回传主机,提升数据搬运效率。

推理优化llama.cppSYCL设备到设备复制Intel GPU

米哈游蔡浩宇AI创业生变

量子位 · 07-31 15:22 UTC+8

米哈游创始人蔡浩宇的 AI 创业公司出现策略调整,暂停多个项目,将九成资源集中押注 Agent 方向,反映出业界对智能体赛道的前景判断。

厂商动态米哈游蔡浩宇AI 创业智能体战略

论文 20 篇

今日论文看点:Qwen-UI-Agent 报告面向真实世界的 GUI 智能体,Metis 提出记忆基础模型,Chimera 将 Chinchilla 缩放律引入混合视觉扩散 Transformer,重访投机解码的损失验证则剖析了推理加速新机制。

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

HF 精选 · 07-31 08:00 UTC+8

面向真实设备、跨平台、结合GUI与CLI操作的长期自主智能体,提出《Qwen-UI-Agent》基座模型,能够在真实设备上可靠执行复杂工作流,并具备主动服务和低人工干预的自主改进能力。它将GUI智能体推向实际可用的下一代形态。

AgentGUI智能体基座模型跨平台自主改进

Metis: Memory Foundation Model

HF 精选 · 07-31 08:00 UTC+8

针对当前智能体记忆严重依赖外部模块的问题,提出记忆基座模型《Metis》,首次将记忆能力原生内化到基础模型中,使模型具备类似人类的长期记忆与检索机制,不再需要外部记忆库即可维持状态。

Agent记忆基座模型原生记忆智能体记忆长时记忆

PhiZero: A World Model Built Around Physical Language

HF 精选 · 07-31 08:00 UTC+8

针对现有世界模型在像素空间预测视频、忽视底层物理规律的问题,提出《PhiZero》物理世界模型,从野外视频中学习一种紧凑的离散物理语言来表示状态转换,实现显式的物理推理与预测。

基座世界模型物理语言离散表示视频预测

Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory

HF 精选 · 07-31 08:00 UTC+8

为解耦长时记忆与推理、独立扩展记忆容量,将《Memory Decoder》的参数化记忆模块规模扩展到69亿参数、3000亿token预训练;在如此大的数据规模下标准Faiss检索不可行,该工作探索了可扩展的记忆检索方案,使记忆模型能高效处理大规模长序列信息。

基座长时记忆参数化记忆规模扩展检索

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

HF 精选 · 07-31 08:00 UTC+8

从工具使用中的模式适应性和工具效果两个维度重新审视智能体视觉推理,提出《Beacon》框架,让多模态大模型学会判断何时真正需要调用工具,在不牺牲成功率的前提下避免多余推理开销。

Agent智能体视觉推理工具使用模式适应性多模态大模型

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

HF 精选 · 07-31 08:00 UTC+8

针对高分辨率图像、长视频和多模态生成中全注意力平方代价过高的问题,设计混合视觉扩散主干《Chimera》,结合具有O(N)复杂度的Kimi Delta Attention和交错多头潜在注意力,在统一流中处理图文视频token,并给出Chinchilla缩放配方,大幅降低计算开销。

基座视觉生成扩散Transformer混合架构缩放规律

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

HF 精选 · 07-31 08:00 UTC+8

在28个层级、语料库规模扩大约450倍的严格控制实验中,系统对比BM25词法检索、稠密检索、图索引和智能体搜索等RAG范式,发现在大规模语料下BM25的准确率和成本综合优势显著,打破了稠密检索一定更好的固有认知。

InfraRAGBM25检索范式缩放研究

Flux-OPD: On-Policy Distillation with Evolving Contexts

HF 精选 · 07-31 08:00 UTC+8

开放域训练缺乏可验证奖励时,用演化上下文传递任务偏好,提出《Flux-OPD》在策略蒸馏方法,让上下文随学生模型表现动态变化,并通过稳定机制避免蒸馏目标震荡,更可靠地将偏好蒸馏到模型中。

后训练策略蒸馏演化上下文对齐开放域训练

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

HF 精选 · 07-31 08:00 UTC+8

为了让视觉语言模型既具备细粒度空间理解又能完成高层任务决策,提出《SpatialCLI》框架,先利用专用空间工具进行推理训练,再逐步移除工具依赖,使模型内化精确的空间推理能力。

Agent空间推理视觉语言模型工具学习具身智能

β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

HF 精选 · 07-31 08:00 UTC+8

将标准的在策略自蒸馏(OPSD)揭示为策略优化族中KL惩罚权重β=1的特例,提出《β-OPSD》,通过调节β系数控制参考策略的锚定强度,显著改善了OPSD在实践中的脆弱性和不稳定性,使训练更鲁棒。

后训练策略优化自蒸馏KL正则化推理模型

Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

MicrosoftHF 精选 · 07-31 08:00 UTC+8

训练计算机使用智能体的瓶颈从环境数量转向环境质量,提出《Echoverse》,构建具有深度行为、针对交互目标并随智能体能力增长复杂度的合成环境,在这种可演化环境中的训练使智能体在真实应用上表现大幅提升。

Agent计算机使用智能体合成环境训练环境深度强化学习

Multi-Head Attention Residuals

HF 精选 · 07-31 08:00 UTC+8

标准Transformer的单一残差流迫使所有特征子空间共享同一跨层读取分布,提出多头注意力残差机制,让每个注意力头学习各自的历史读取softmax分布,增大了信息流动的灵活性和模型表达能力。

基座Transformer架构注意力残差多头注意力信息流

OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

HF 精选 · 07-31 08:00 UTC+8

在全模态大模型中,音频与视频的显著性经常在不同时刻达到峰值,单一模态指导的压缩易丢弃关键线索,因此提出无训练的《OmniScope》框架,以文本查询为共享锚点独立压缩各模态token,在极高压缩率下仍保留答案关键信息。

推理优化多模态大模型token压缩跨模态显著性无需训练

Algorithms for Structured Elections under Thiele Voting Rules

AAAI 2026CCF-A推荐arXiv · 07-31 01:37 UTC+8

研究Thiele投票规则下委员会选举胜者确定问题的计算复杂性,通过分析投票人批准集引出的候选人间依赖结构,揭示了最优解的结构特性,并给出参数化算法。

计算社会选择Thiele规则委员会选举算法复杂度
Alexandra Lassota, Krzysztof Sornat

Same Graph Cross-Task Transfer in GNNs: Protocols and Predictors

ICML 2026CCF-A推荐arXiv · 07-31 01:01 UTC+8

针对同一图上节点分类与链接预测跨任务迁移评估中因数据划分泄露等问题造成的不可靠结论,提出无泄漏的评估协议,并系统分析有效的迁移预测因子,为图神经网络的跨任务复用提供可靠基准。

图神经网络跨任务迁移节点分类链接预测
Neelam Akula, Surbhi Kumar, Murat Kantarcioglu, Baris Coskunuzer

Graph Neural Multilevel Preconditioners for Iterative Solvers

KDD 2026CCF-A推荐arXiv · 07-31 00:19 UTC+8

传统代数多重网格预条件器在不定或非对称线性系统上鲁棒性差,利用图神经网络的数据驱动优势构造多级预条件器,结合多级层次与GNN的表示能力,显著提升了迭代求解器的收敛速度和稳健性。

图神经网络预条件器多重网格科学计算
Zechen Zhang, Rui Peng Li, Yousef Saad