🗂 历史归档
每日 AI 速览

2026-07-21

生成于 2026-07-22 04:13
⚠️ 本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性

今日导语

今日聚焦基础设施与多模态发布浪潮:NVIDIA发布面向智能体时代的Vera Rubin新架构、Rubin GPU及Spectrum-6网络,并开源4B具身世界模型Cosmos 3 Edge;Google推出Gemini 3.6 Flash系列模型,同时被曝将Gemini架构直接硬化到Frozen v2芯片以提升效率。阿里Qwen则在多模态端侧发力,Qwen-Image-3.0与Qwen Audio 3.0 TTS相继亮相。训练方法与Agent研究方面,蒸馏强化学习、环境无关的API智能体数据合成以及多教师蒸馏校准工具调用等方法集中涌现。

🗞 行业动态 40 条

Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

Google DeepMind · 07-21 23:16 UTC+8

Google 发布 Gemini 新版本,包括 3.6 Flash 及 3.5 Flash 的 Lite 和 Cyber 变体,持续拓宽 Gemini Flash 系列的速度、成本与安全选项,为开发者提供更灵活的选择。

厂商动态GeminiGoogle模型发布

b10076

llama.cpp · 07-21 23:54 UTC+8

该提交为 llama.cpp 的 CUDA 后端 get_rows 操作引入了向量化复制,使用 int4 一次搬运 16 字节,并将行不变计算提取到循环外。对于同类型、连续数据场景,这能有效提升大规模嵌入查表的吞吐。

推理优化llama.cppCUDA 优化向量化推理加速

Setting a World Record for MoE Pre-Training on NVIDIA GB300 NVL72

NVIDIA 开发者 · 07-21 23:00 UTC+8

NVIDIA 宣布在 GB300 NVL72 系统上创造了 MoE 预训练的世界纪录,展示了该平台支撑万卡级混合专家模型训练的极致性能,为前沿模型训练提供了可复现的高效方案。

训练MoE 训练NVIDIA GB300世界纪录分布式训练

Environment-free Synthetic Data Generation for API-Calling Agents

Apple ML · 07-21 08:00 UTC+8

Apple 研究提出无环境合成数据生成方法,仅凭 API 规格即可用 LLM 模拟世界状态生成训练轨迹,消除环境搭建瓶颈,可加速 API 调用智能体的开发。

AgentApple合成数据API 智能体数据生成

Accelerating Text-to-Video Generation with Calibrated Sparse Attention

Apple ML · 07-21 08:00 UTC+8

Apple 的研究发现扩散视频生成器中许多时空注意力连接贡献极低且模式可预测,因此提出校准稀疏注意力,跳过大量无效计算,从而大幅加速文本到视频的生成,同时保持画质。

推理优化视频生成注意力优化推理加速Apple

Built for Vera Rubin, NVIDIA Spectrum-6 Arrives in Gigascale AI Factories

NVIDIA 博客 · 07-21 23:00 UTC+8

NVIDIA Spectrum-6 网络平台专为 Vera Rubin 架构和超大规模 AI 工厂设计,将网络性能与 token 生成紧密耦合,成为 gigascale 计算的关键乘法器,确保百万卡集群的高效互联。

InfraNVIDIA Spectrum-6网络互联AI 工厂gigascale

A Fireside Chat with Cat and Thariq from the Claude Code team

Simon Willison · 07-21 20:54 UTC+8

Simon Willison 在 AI Engineer World's Fair 上与 Anthropic Claude Code 团队的 Cat Wu 和 Thariq Shihipar 进行炉边对话,讨论了 Claude Code、Claude Tag、Fable 等工具,以及编码智能体安全、评估与工具设计。对话完整视频已在 YouTube 发布,为开发者理解 Anthropic 如何内部使用这些工具提供了直接视角。

AgentClaude Code智能体安全工具设计Anthropic

Alibaba's Qwen Audio 3.0 TTS Plus tops the competition in the text-to-speech rankings

The Decoder · 07-21 19:31 UTC+8

阿里通义实验室的 Qwen Audio 3.0 TTS Plus 登顶 Artificial Analysis 的 Speech Arena 排行榜,支持 16 种语言,并允许用户通过自然语言或标签控制说话风格。但其生成速度仅为每秒 16 个字符,远慢于竞争对手 Sonic 3.5 和 Simba 3.2。

厂商动态Qwen文本到语音TTS语音合成

NVIDIA Megatron Core 0.18.2

Megatron-LM · 07-21 18:57 UTC+8

NVIDIA Megatron Core 发布 v0.18.2 版本,新增快速 Hadamard 变换支持,将 flash_mla 指向 nv_dev 分支,并修复了 TE 交叉熵损失融合等问题,持续优化大模型训练框架。

训练Megatron Core训练框架NVIDIA大模型训练

AI’s most important protocol is getting a little bit easier to use

TechCrunch · AI · 07-21 04:50 UTC+8

AI 领域最重要的协议迎来易用性改进,服务端采用更宽松的无状态方式处理会话 ID,类似普通网站,降低了开发者集成门槛。此举很可能指向模型上下文协议 MCP。

AgentMCP协议智能体开发者工具

Patch release v4.4.2

ms-swift 魔搭 · 07-21 23:47 UTC+8

魔搭社区 ms-swift 微调框架发布 v4.4.2 补丁版本,修复问题并提升稳定性,为大模型高效微调提供更可靠的工具。

训练ms-swift微调框架魔搭社区大模型微调

trunk/06174e293ac0715a31f0883b9b38a0137904a20d

PyTorch · 07-21 22:49 UTC+8

PyTorch 的 MPS 后端新增对 layer_norm 前向和反向传播中混合精度仿射参数的支持,使 Mac 设备上的模型训练与推理更加灵活高效。

InfraPyTorchMPSlayer_norm混合精度

Nativ: Run AI models locally on your Mac

Simon Willison · 07-21 22:22 UTC+8

开发者 Prince Canuma 发布了基于 MLX 的 Mac 桌面应用 Nativ,支持本地运行视觉大语言模型,提供聊天界面和 localhost API 服务器,并能自动识别已缓存的模型,大幅降低了 Mac 上本地 AI 的使用门槛。

推理优化本地推理MacMLXAI 应用

trunk/6677704253c1058a54e4e8b7a104822f7fd0fc63

PyTorch · 07-21 18:36 UTC+8

PyTorch CUPTI 性能分析器更新,支持将图中捕获的内核重新分配到可插拔的逻辑流,增强了 GPU 性能分析的灵活性。

InfraPyTorchprofilerCUPTI性能分析

Xiaomi-Robotics-1 shows that more data beats bigger models when training robots to move

The Decoder · 07-21 16:56 UTC+8

小米训练机器人运动模型 Xiaomi-Robotics-1 时发现,使用超过 10 万小时的人类遥操作数据带来的性能提升远超单纯增大模型规模,且增益尚未见顶,但绝对成功率仍较低,凸显数据规模在具身智能中的重要性。

训练机器人数据驱动小米训练方法

viable/strict/1784642494

PyTorch · 07-21 15:07 UTC+8

PyTorch 为 torch.cuda.CUDAGraph 新增销毁回调与对象保留机制,使图的生命周期管理更精细,便于释放资源或复用内存。

InfraPyTorchCUDA 图内存管理推理优化

Anthropic’s landmark $1.5B copyright settlement is approved

TechCrunch · AI · 07-21 08:12 UTC+8

Anthropic 15 亿美元版权诉讼和解获最终批准,标志着该公司在版权争议上迈出一步,但并未解决使用版权作品训练 AI 模型这一更广泛的行业难题。

厂商动态Anthropic版权法律AI 训练

b10075

llama.cpp · 07-21 07:49 UTC+8

llama.cpp 为 Hexagon 后端新增 CLAMP 算子,扩展了在高通 DSP 等移动芯片上的算子覆盖度,提升移动端推理兼容性。

推理优化llama.cpp推理框架移动推理Hexagon

v0.32.2-rc0: cuda: add CC 10.0 for linux in CUDA v12 (#17025)

Ollama · 07-21 04:09 UTC+8

Ollama 发布 v0.32.2-rc0 预发布版,在 Linux CUDA v12 预设中添加计算能力 10.0,让 B200 等新一代 GPU 可以在不满足 CUDA v13 驱动最低要求时仍使用 CUDA v12 后端。

推理优化Ollama推理框架CUDAGPU

viable/strict/1784659629

PyTorch · 07-21 22:05 UTC+8

PyTorch 修复了 MPS 后端在 F.linear 带偏置且批次维度超过一定阈值时导致行数据损坏的问题,提升了 Mac 上模型运行的健壮性。

InfraPyTorchMPS错误修复线性层

📄 论文 20 篇

今日论文看点涵盖蒸馏RL用于LLM后训练、DeepSearch-World自蒸馏搜索智能体、掩码扩散语言模型作为智能体强化学习世界模型,以及Transformer语义空间连续几何框架等。

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

HF 精选 · 07-21 08:00 UTC+8

RynnBrain 1.1 系列具身基础模型覆盖 2B 到 122B-A10B 多种规模,在统一时空物理框架下实现了感知、定位、规划等能力。相比前代,该版本新增了接触点预测,并在小型号上引入原生 3D 对齐,使表征能更直接地服务于机器人操作。该工作为通用物理世界大模型提供了更完整的基准。

基座具身智能基础模型3D 对齐机器人操作
📖 阅读⬇ PDF

Distilled Reinforcement Learning for LLM Post-training

HF 精选 · 07-21 08:00 UTC+8

针对大模型后训练中强化学习粗粒度监督与在线蒸馏教师信号贫乏的两难,本文提出蒸馏强化学习,结合过程级奖励与教师知识。方法通过解耦信用分配与知识传递,缓解了单一范式下的学习瓶颈。在推理和对齐任务上,该方法能有效提升模型性能与泛化能力。

RLHF蒸馏后训练信用分配
📖 阅读⬇ PDF

DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment

HF 精选 · 07-21 08:00 UTC+8

为突破搜索智能体利用自身经验学习的瓶颈,该工作构建了一个可复现的确定性搜索环境 DeepSearch-World,并设计自蒸馏框架 DeepSearch-Evolve。智能体在 420K 多跳问答任务上迭代探索,从自身轨迹中蒸馏出更优策略,无需外部教师。实验表明该方法显著提升了深度搜索任务的成功率与效率。

Agent智能体自蒸馏搜索可验证环境
📖 阅读⬇ PDF

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

HF 精选 · 07-21 08:00 UTC+8

编程智能体在读取工具输出时,其内部表征本身就暗含了代码片段的关联程度。基于这一发现,SWE-Pruner Pro 省去了额外的分类器,直接在智能体内部附加轻量头来预测每个片段的保留价值,实现更轻量、更精准的上下文裁剪。该方法在维持代码修复性能的同时显著缩短上下文长度,对开发者而言意味着更低的推理成本。

推理优化SWE-agent上下文修剪代码智能推理效率
📖 阅读⬇ PDF

GigaChat Audio: Time-aware Large Audio Language Model

INTERSPEECH 2026CCF-B推荐HF 精选 · 07-21 08:00 UTC+8

GigaChat Audio 为长音频(最长 120 分钟)设计了时间感知机制,在音频令牌中交错插入周期性的时间标记,并通过级联合成监督训练,让模型能以显式时间戳回答问题。该模型在长短音频基准上都取得了领先的时间定位准确度,并能生成带时间锚点的片段描述,为语音助手等应用提供了精细的时间理解能力。

基座音频大模型时间定位长音频理解时间戳
📖 阅读⬇ PDF

Group Entropy-Controlled Policy Optimization

上海 AI LabHF 精选 · 07-21 08:00 UTC+8

在异质任务混合训练中,相同策略下的不同任务对探索程度需求不同,全局熵控制难以兼顾。本文提出分组熵控制策略优化,根据任务难度自适应调节各组熵预算,并重构 GRPO 的优势归一化。该方案在多个 LLM 对齐任务上比全局控制带来更稳定的训练与更好的最终性能。

后训练RLHF熵控制GRPO异构任务
📖 阅读⬇ PDF

LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

MicrosoftHF 精选 · 07-21 08:00 UTC+8

对于难以定义标量奖励的开放任务,本文将评分模型转化为「教练」,从每次生成中提取可迁移的经验教训,并以此调节教师模型,供策略模型内化。这种体验式学习避免了标量奖励的信息丢失,在非可验证任务上明显提升了生成质量与多样性。

后训练LLM 对齐体验式学习教练模型非可验证任务
📖 阅读⬇ PDF

Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift

HF 精选 · 07-21 08:00 UTC+8

TOPL 将后训练重新定义为词元级正确性预测,通过让模型学习区分回应中的好词与坏词来引导生成。这一设计规避了直接拟合离策略数据带来的分布偏移问题,在文档摘要任务上表现出很强的分布外忠实度,为可控生成提供了新思路。

后训练文本生成离策略学习忠实度摘要
📖 阅读⬇ PDF

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

HF 精选 · 07-21 08:00 UTC+8

该框架将互动文学模拟建模为角色与世界协同演化的长程过程,角色交互、场景推进,状态持续更新。EvolvingWorld 提供开放模式基准,可评测角色与环境在长期互动中的一致性与丰富性。相比静态角色扮演,它更接近真实文学世界的动态叙事,对游戏与创意写作具有启发。

Agent世界模型角色扮演交互叙事演化
📖 阅读⬇ PDF

GigaAM Multilingual: Foundation Model for Underrepresented Languages

INTERSPEECH 2026CCF-B推荐HF 精选 · 07-21 08:00 UTC+8

GigaAM Multilingual 针对哈萨克语、吉尔吉斯语和乌兹别克语等低资源语言,用 200 万小时音频预训练 Conformer 编码器,并引入簇级数据平衡和领域微调策略。它大幅缩小了与高资源语言的 ASR 性能差距,证明了长尾语言也能受益于大规模基础模型。

基座语音识别多语言低资源语言Conformer
📖 阅读⬇ PDF

ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams

HF 精选 · 07-21 08:00 UTC+8

现有视频记忆系统围绕帧而非持久实体组织,导致长时间推理受限。ReflectWorld-MM 提出面向实体的多模态记忆系统,持续累积并更新对象的视觉、位置等属性。智能体可以围绕实体回忆历史、进行问答,极大提升了开放视频流的长程理解与推理能力。

Agent多模态记忆视频理解实体中心长程推理
📖 阅读⬇ PDF

Environment-free Synthetic Data Generation for API-Calling Agents

AppleHF 精选 · 07-21 08:00 UTC+8

针对 API 调用智能体数据采集需要完整环境后端的问题,本文仅凭 API 规格即可用 LLM 动态模拟世界状态并生成交互轨迹。这种无环境合成数据方法消除了环境搭建瓶颈,在样本效率与任务成功率上不输给真实环境数据,将极大加速 API 智能体的开发。

Agent智能体合成数据API 调用世界模型
📖 阅读⬇ PDF

The Geometry of Semantic Space: A Continuous Geometric Framework for the Transformer Architecture

HF 精选 · 07-21 08:00 UTC+8

本文从「词元序列构成离散 1-流形」这一公设出发,将 Transformer 的核心组件统一为语义纤维丛上的积分微分方程,包括 RMSNorm、RoPE、注意力等。该连续几何框架提供了理解与设计 Transformer 的新视角,有助于导出更稳定的架构与训练方法。

基座Transformer几何深度学习理论分析架构设计
📖 阅读⬇ PDF

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

HF 精选 · 07-21 08:00 UTC+8

实时多模态应用需要将多个模型组合成流水线,并做出部署决策,现有服务系统优化选择有限。FlashRT 作为智能体部署的「马具」,能自动搜索最优的放置、流式传输和模型内并行策略,使开发者无需手工调优即可得到高性能实现,显著缩短新应用的部署周期。

Infra模型部署多模态自动并行推理服务
📖 阅读⬇ PDF

Diagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillation

蚂蚁HF 精选 · 07-21 08:00 UTC+8

多教师在策略蒸馏在训练工具使用智能体时,可能出现工具调用边界漂移的隐性行为偏移。本文诊断了这种现象,并提出校准方法,通过对齐教师间的决策边界确保学生模型稳定地掌握何时调用工具、何时直接回答。该工作为多教师蒸馏的实际落地扫清了关键隐患。

Agent智能体工具调用知识蒸馏多教师
📖 阅读⬇ PDF

Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL

HF 精选 · 07-21 08:00 UTC+8

为强化学习智能体提供多样化训练环境,世界模型很有前景,但自回归模型易产生模式坍塌。本文提出用掩码扩散语言模型作为文本世界模型,其非自回归生成方式带来更好的状态多样性,且可通过掩码引导进行细粒度操控。在智能体 RL 中,它能替代模拟器,并保持了与真实环境相当的训练效果。

Agent世界模型扩散语言模型智能体强化学习
📖 阅读⬇ PDF

It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief

ACL 2026CCF-A推荐arXiv · 07-21 01:58 UTC+8

该研究系统评估了 LLM 对用户不同信念表达形式的敏感性,包括预设、传信标记和语气等。提出类型学分类,发现某些表达会显著干扰模型坚持已知事实。这项工作揭示了对话微妙的语用因素对模型可信度的潜在影响,对安全部署有警示意义。

LLM 安全语用理解信念表达评估
Kevin Du, Clara Kümpel, Michelle Wastl, Alex Warstadt
📖 阅读⬇ PDF

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

HF 精选 · 07-21 08:00 UTC+8

视频 MLLM 常能描述内容,却难准确定位证据出现的时间。TimeLens2 定义了一种通用视频时间定位任务,要求模型预测变基数证据区间,并设计了贴合该集合预测的训练策略。新方法在多种视频长度、领域和查询下均表现出色,使视频问答进入可验证的证据级理解阶段。

视频理解时间定位多模态大模型证据定位
📖 阅读⬇ PDF

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

蚂蚁HF 精选 · 07-21 08:00 UTC+8

Open-AoE 提供了从手机采集到模型训练的全流程开源工具链和约 2000 小时的自我中心操作视频数据集,内含结构化操作注释。它填补了低成本高质量具身数据获取与复用工具的缺口,便于社区直接用于机器人操作学习,有望加速具身智能的普及。

训练具身智能自我中心视频数据集操作学习
📖 阅读⬇ PDF

O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

ECCV 2026CCF-B推荐arXiv · 07-21 00:36 UTC+8

工业视频异常检测面临复杂物体变换和严格规程,通用 VLM 方法效果下降。O-VAD 采取以物体为中心的跟踪与推理,显式建模帧间物体状态演化和过程约束,从而更可靠地检出违反规则的细微异常,为智能制造场景提供了更可靠的视觉质检方案。

视频异常检测工业视觉物体跟踪推理
Mei Yuan, Qi Long, Qifeng Wu, Zhenyang Li, Yizhou Zhao, Lei Wang, Yang Liu, Min Xu
📖 阅读⬇ PDF