[Attention] Enable adaptive verification for FLASHINFER_MLA_SPARSE_DSV4
为FlashInfer稀疏MLA解码后端新增MLA与SWA元数据构建器子类,将其AttentionCGSupport从UNIFORM_BATCH改为声明ALWAYS。这使支持变长查询的DSV4内核可在推测解码等自适应验证场景下正确启用,提升调度灵活性。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
[Attention] Enable adaptive verification for FLASHINFER_MLA_SPARSE_DSV4
为FlashInfer稀疏MLA解码后端新增MLA与SWA元数据构建器子类,将其AttentionCGSupport从UNIFORM_BATCH改为声明ALWAYS。这使支持变长查询的DSV4内核可在推测解码等自适应验证场景下正确启用,提升调度灵活性。
Revert "[AMD] Add GLM-5.3-Flash recipes for MI300X, MI325X, and MI355X (#36608)"
回退文档中为MI300X、MI325X和MI355X添加的GLM-5.3-Flash AMD ROCm配方,并手工解决冲突以保留所有后续NVIDIA改动。该文档恢复使cookbook暂不上架尚未稳定的AMD配置,避免对用户造成误导。
[Cookbook] Add NVFP4 options for DeepSeek-V4 Flash Official (0731) and Pro Official (0813)
在DeepSeek-V4 cookbook中为Flash Official (0731)和Pro Official (0813)模型新增NVFP4量化选项,并补充B200/B300/GB200/GB300低延迟部署配置。这使官方checkpoint能在这些NVIDIA平台上选择NVFP4低延迟推理路径,扩大部署选择。
[Model] Support Qwen3.8-Flash-Next
新增Qwen3.8-Flash-Next模型支持,提供vLLM serve命令并支持PLE offload与N-gram嵌入卸载。该支持使模型可在GB300、GB200、H200及MI355X等平台以BF16/FP8/NVFP4和多种张量并行配置进行推理。
[Cookbook] Add DeepSeek-V4-Flash-Vision-Exp to the DeepSeek-V4 page
将实验性多模态checkpoint DeepSeek-V4-Flash-Vision-Exp加入DeepSeek-V4 cookbook,补充B200 FP4低延迟与平衡/高吞吐部署矩阵及MMMU-Pro基准。这为用户在多模态推理场景下的部署和评估提供参考配置。
fix: preserve repeated GTP parameter uses
修复MTP中同一GTP参数在一次前向/反向中多次参与梯度归约时,CUDA图回放按参数身份去重导致DDP出现次数计数被破坏的问题。这保证重复参数使用的梯度同步与DDP期望一致,避免分布式训练中的bucket归约错误或等待。
[TRTLLM-14880][feat] qualify Qwen3 dense for MX
为Qwen3 dense目标模型添加fail-closed的ModelExpress后转换资格认证,覆盖Q/K归一化注意力、融合QKV与gate-up布局及未绑定LM头等生命周期。这为Qwen3 dense的MX转换提供TP1/TP2 CI覆盖与运行时拒绝机制,保障转换部署稳定性。
[CI] Move tests onto the right CI stages
将66个测试从nightly及无效CPU注册迁移到weekly阶段,并将NVIDIA周测配置改为矩阵策略同时新增CPU周测工作流。这优化CI资源分配,使nightly专注评估与性能回归,降低日常提交测试负载。
[ROCm][DSpark][DCP] Serve prefix cache hits under DCP for Kimi-K3
在构建缓存管理器和混合前缀缓存查找时改用每个KV缓存组自身的DCP几何,而非进程级DCP大小。这解决Kimi-K3中DCP分片MLA/全注意力与复制Mamba组混合时调度器、块哈希和缓存管理器不一致的问题,保证prefix cache命中正确。
[ROCm][MLA][DCP] Support causal multi-token verification
在ROCm AITER MLA解码后端中启用因果多token目标验证,为每个验证token计算正确的rank局部因果KV窗口并通过DCP注意力合并局部输出。这使得ROCm平台上的推测解码可进行多token验证,提升推理吞吐。
[TRTLLM-15405][refactor] Remove the C++ decoder stack behind TRTLLMSampler
分两步移除TRTLLMSampler:先删除Python采样器及其LLM API选项并更新测试文档,再删除由此不可达的C++解码器栈。该重构去除约52165行死代码,在不改变用户行为的前提下简化采样路径和维护成本。
[Bugfix][PP] Never drop a decoding request from the sampled-token broadcast
修复流水线并行下sampled-token广播的compute need sampled mask计算,确保解码中但非finishing的请求不会被排除。这避免在PP中错误丢弃解码请求导致采样token或draft block无法回传,保证推测解码与服务正确性。
修复Kimi-K3在启用RecoverSSM与DSpark推测解码时MambaAttentionBackendEnum.GDN_ATTN声明4个状态却仅提供2个状态复制函数导致启动失败的问题。这保证Kimi-K3带预填缓存和重放SSM配置的服务能正常启动。
修复Kimi-K3 GDN注意力元数据构建时KimiK3KDAMetadataBuilder对象缺少layer_names属性的错误。这使带DSpark推测解码的Kimi-K3服务在构建注意力元数据阶段不再中断。
qwen4exp: support recurrent state rollback
为qwen4exp架构添加递归状态回滚支持,使卷积状态写入每个回滚槽位的快照而非仅当前平面。这避免MTP推测解码时每轮将完整状态序列化到主机内存的开销,提升Qwen3.8-Flash-Next的推测解码性能。
[None][infra] Waive 1 failed cases for main in pre-merge 57472
在预合并CI中为DGX H100的DeepSeek-V3-Lite FP8 block-scales测试添加SKIP豁免,关联nvbugs/6700265。这暂时跳过已知失败用例,避免阻塞主分支合并。
[https://nvbugs/6384357][test] Unwaive DeepSeek-V3.2 DSA host cache offload mtp params
移除DeepSeek-V3.2 DSA主机缓存卸载MTP参数的两个waive条目,因为相关的rank非对称warmup死锁已由fail-stop修复解决。这恢复对应测试参数的有效执行,清理树上最后的历史豁免痕迹。
[Bugfix][Spec Decode] Take the DFlash draft's RoPE layout from its own config
修复DFlash加载器从目标模型读取is_neox_style并覆盖草稿模型配置的问题,改为使用草稿模型自己的RoPE布局。这确保草稿头蒸馏时的旋转布局正确,避免目标与草稿RoPE不一致时推测解码接受率受损。
[Bugfix][Model Runner V2][Spec Decode] Decouple the draft's gumbel noise stream from the target's
将目标验证阶段重采样被拒草稿token所用的Gumbel噪声流与生成该草稿token的噪声流解耦,避免相同Philox偏移产生相同噪声导致输出分布偏离目标。这修复概率采样推测解码中的分布偏差,保证验证后的token分布符合目标模型。
[Bugfix] NemotronHMTP: add hf_to_vllm_mapper so quant exclusions reach the MTP draft
为NemotronHMTP模型添加hf_to_vllm_mapper,使量化排除模块列表能从checkpoint空间映射到vLLM模块空间并应用到MTP草稿模型。这修复NVFP4加排除模块checkpoint在启用MTP推测解码时的初始化张量尺寸不匹配错误。
LMDeploy发布v0.17.0,集成DeepEPv2并新增Kimi K2.6模型支持,还加入mooncake store的kv_connector以及服务端n>1并行采样扇出。同时针对GLM-5.2 serving、CUDA paged attention与V4 prefill做了性能优化,并更新昇腾注意力后端。对使用LMDeploy做多模型推理部署的团队来说,这轮更新同时扩展了模型和存储生态并提升了吞吐。
MiniMax H3 on vLLM-Omni: From System-Wide Optimization to Real-Time Serving with FastVideo’s FastH3
vLLM-Omni展示了如何对MiniMax H3全栈做系统级优化和扩展,并集成FastVideo的四步FastH3方案,使生成速度超过实时播放。这让MiniMax H3在vLLM-Omni上具备实时音视频生成能力,对相关部署和产品化有重要参考。
Path to Astra: critical capabilities and frontier safeguards
OpenAI公布Astra成为首个在Preparedness Framework下达到Critical网络安全能力阈值的模型,同时配套了更强的发布保障措施。这标志着前沿模型安全评估进入新阶段,对关注AI安全与合规的从业者是一个重要信号。
Introducing @huggingface/kernels: 200+ WebGPU Kernels for Local AI
Hugging Face发布@huggingface/kernels,提供200多个WebGPU内核用于本地AI推理与训练。这让浏览器端和应用内的本地AI运行有了更完整的算子支撑,对前端AI和边缘推理开发者很有价值。
How to Size GPUs for AI Inference and TCO Without Overspending
NVIDIA开发者博客发布指南,讨论如何根据推理负载和总体拥有成本合理规划GPU规模,避免过度采购。文章面向正在扩展AI推理基础设施的组织,提供容量与成本平衡的方法,帮助控制预算。
viable/strict/1788292262: [ROCm] Set USE_ARC in ROCm workflows (#194123)
PyTorch的ROCm工作流新增USE_ARC变量设置,通过导出OMP_NUM_THREADS避免OpenMP忙等,带来约3.5%的测试运行时间加速。这对ROCm平台上跑PyTorch测试和训练的开发者是一个小的性能优化点。
llama.cpp b10740修复了Metal后端因缺少autoreleasepool导致的内存泄漏,并重命名相关变量。该更新提升macOS/iOS上Metal推理的稳定性,对使用Apple Silicon本地推理的用户有实际意义。
PyTorch分布式模块将NCCL后端的组UID初始化提前到构造函数中,以避免延迟初始化可能导致的通信问题。该改动增强了分布式训练时NCCL通信的稳健性,对多卡训练用户是个基础改进。
llama.cpp b10739为M2 Max GPU新增fa-vec调优参数,并强调这些参数来自真实设备收集。该更新提升Apple M2 Max上的注意力向量化性能,对相应硬件用户有直接收益。
llama.cpp b10738在SYCL后端支持将host-pinned内存的最大分配限制在2GB以内,以规避某些平台上的内存分配问题。这个改动改善了SYCL设备上的兼容性和稳定性,对Intel GPU等用户有帮助。
llama.cpp b10737针对qwen4exp做了一组修复,涵盖seq_cp、块位置键控、mtmd输入和CUDA中止问题,并补充测试。其中还修复了-kvu NaN坍缩问题,提升了对该实验架构的支持稳定性。
智能体请求暴增9.4倍,token账单却没涨:Uber 公开AI软件工厂省钱方法
Uber公开其AI软件工厂的降本实践,在智能体请求暴增9.4倍的情况下token账单未同步上涨。文章介绍了相关优化方法,对大规模部署AI智能体的企业控制成本有直接借鉴意义。
[AINews] Fal’s H3 Max Live breaks the infinite videogen barrier
Fal 的 H3 Max Live 声称能以比观看更快的速度生成可接受质量的视频,打破了无限视频生成的障碍。这对实时视频生成和内容生产可能开启新方向,但具体影响尚不确定。
Manage agents, tools and skills at scale with AWS Agent Registry
AWS Agent Registry 现已正式可用,提供一个覆盖组织内代理、工具、技能和自定义资源的统一可搜索且受治理的目录。该服务支撑发布、策展和发现工作流,帮助企业规模化管理和复用智能体资产,降低治理复杂度。
该方案在 Amazon Bedrock Managed Knowledge Base 与 AgentCore 上构建企业级智能体检索系统,代理能够跨多个知识库推理和路由并返回带引用答案。系统内置七层可观测性、按需与持续评估,并可经单一 CloudFormation 链部署,便于企业落地可审计的 RAG 应用。
AI 写代码飞快,为何交付没有变快?小红书 Muse 的 Agentic 架构实践
小红书 Muse 团队分享其 Agentic 架构实践,回应用户困惑:AI 写代码已经飞快,但端到端交付为何没变快。文章聚焦如何把智能体能力从单点编码扩展到研发流程协同,从而真正提升交付效率。
Run NVIDIA BioNeMo NIM Microservices for Protein Structure Prediction in Claude Science
NVIDIA 开发者介绍在 Claude Science 中运行 BioNeMo NIM 微服务以进行蛋白质结构预测。智能体 AI 科学家可读论文、提出假设、调用模型并规划后续实验优先级,展示科研智能体的实际工作流。
How t54 built a trust layer with Amazon Bedrock AgentCore payments
t54 构建了 x402-secure 信任层,在 Amazon Bedrock AgentCore 支付场景中对每个端点先评分再让自主代理付款。通过会话预算、凭证隔离和确定性信任门控,该系统已在无人工介入下治理超过两千万笔代理发起交易。
Runway's Solaris is an AI system that generates software interfaces in real time
Runway 发布 Solaris,这是其称为「界面世界模型」新类别的首个系统。它不运行传统代码,而是在用户交互过程中逐帧生成软件界面,可能重塑软件界面的开发与交互方式。
PyTorch 对一个测试文件进行重构并启用 XPU 支持。该改动扩展了 PyTorch 在 XPU 硬件上的测试覆盖,反映对非 CUDA 加速器的持续适配。
A社化身A割!Claude官宣永久提额25%,结果到手反而少17%
Anthropic 的 Claude 官方宣布永久提额 25%,但用户实际到账额度反而减少 17%,被批评为「明升暗降」。这引发对模型厂商配额策略透明度和用户信任的讨论。
Connect an AgentCore Runtime hosted MCP server to Amazon Quick
本文介绍如何在 AgentCore Runtime 部署并托管 MCP 服务器,并将其与 Amazon Quick 集成。该模式通过 MCP 服务器复用常用工具和代理,客户无需为每个场景自建连接器即可在 Amazon Quick 的聊天代理与工作流中使用产品。
本文展示如何在 Amazon Bedrock Managed Knowledge Base 上构建多租户智能体文档聊天应用,用户上传文档后可立即提出有依据的问题。文章覆盖摄取与检索流程、异步索引生命周期、按用户数据隔离及规模化运维实践。
TimesFM-3: A zero-shot foundation model for multivariate forecasting
Google Research 推出 TimesFM-3,一个面向多变量预测的零样本基础模型。该模型可在无需任务特定训练的情况下进行多变量时间序列预测,有助于降低预测建模门槛并提升泛化能力。
本文探讨智能体适应度函数,将演进式架构从确定性规则扩展到能够评估智能体行为的新阶段。通过定义适应度函数,团队可在复杂不确定环境中持续评估和优化智能体系统,提升架构演进能力。
AI Coding 之后,如何让 Agent 进入企业研发全链路?得物推荐的 Harness 实践
本文探讨在 AI Coding 之后如何让智能体进入企业研发全链路,并介绍得物推荐的 Harness 实践。重点是将 Agent 嵌入从需求到交付的完整研发流程,弥补单点编码工具在整体协作中的不足。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,在保持病理基础模型强性能的同时显著降低计算需求。这为人群规模研究和更广泛探索打开大门,推动病理学基础模型向高效计算方向发展。
On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
这篇论文介绍了Qwen3.8-Flash-Next的架构设计,针对现有大模型在效率与训练稳定性上的矛盾,采用稀疏混合专家路线,把混合门控delta-net与稀疏注意力层组合起来,并引入门控残差分支和离加速器n-gram嵌入。核心思路是通过异构模块分工和残差门控来提升表达能力,同时减少计算浪费。评估显示该设计在效率、能力和训练稳定性上都有明显收益,对追求稀疏架构落地的团队有参考价值。
Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
文章针对大型推理模型训练仍受限于人类监督的瓶颈,提出一个结构化的扩展阶梯,核心是让模型追踪自主奖励并利用自我生成的经验继续提高推理能力。该框架不是单纯鼓吹无监督扩展,而是同时梳理了可能的风险点和评估维度,使超人类监督的扩展路径更可操作。对关注推理模型自我改进和超级智能安全的研究者来说,它提供了一个兼具野心和约束的路线图。
CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents
该工作瞄准长周期工具调用智能体的可靠性问题,传统监督信号在稀疏结果下难以指导每一步动作。CAST的做法是从稀疏最终结果反向生成结构化的动作级理由,再用这些理由训练批评模型和策略模型,让代理在中间步骤也能获得细粒度反馈。结果表明这种批评感知的监督显著降低了长任务中的错误累积,对构建更稳妥的工具调用代理很有价值。
Verification-Aware Training for Speculative Decoding
论文针对投机解码中草稿模型与验证器脱节的问题,提出验证感知训练,在训练阶段模拟顺序验证过程,并根据token被接受或拒绝的模式动态调整损失权重。这样草稿模型不再只追求自身似然,而是学会生成更容易被验证器接受的序列。实验显示该方法能提升草稿准确率与整体解码吞吐,对推理加速链路有直接意义。
Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
这篇论文通过实证分析质疑了在策略蒸馏的真实作用,发现其收益主要来自抑制低概率token,而不是教师模型的知识传递,教师信号本身可能充满噪声。基于这一观察,作者提出一种无需监督的熵自适应方法,让模型在推理过程中自动调整熵约束。实验表明该方法在数学推理等任务上取得了明显的性能提升,对重新审视蒸馏与自我改进的关系很有启发。
DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
DreamX-Creator是一个仅7B参数的原生联合音视频生成模型,目标是让高分辨率音视频生成不再依赖庞大底座。它采用跨模态注意力统一视听表示,通过渐进式联合训练和带多模态反馈的强化学习优化生成质量,再配合自回归2K细化管道输出同步的高分辨率内容。该工作把原生音视频生成的门槛大幅拉低,对多模态内容创作工具的普及有直接意义。
GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling
论文针对潜在生成模型端到端训练中常见的表示崩塌问题,提出生成优先策略,先稳定生成过程再进行重建优化。具体做法包括熵保持和不对称动力学设计,防止隐空间塌缩到无信息分布。该方法不仅实现了图像合成的SOTA水平,还能统一支持多模态生成任务,为端到端潜在建模提供了一条稳定且简洁的路线。
Normalized Low-Rank Adaptation
Normalized Low-Rank Adaptation针对LoRA微调中训练不稳定和收敛慢的问题,在下投影矩阵上引入归一化操作,不增加任何参数或推理开销。这一简单改动使梯度尺度更一致,训练过程更稳定,从而加速收敛并在多个任务上取得更好的性能。对广泛使用LoRA做高效微调的从业者来说,几乎零成本地获得训练收益很有吸引力。
这项工作研究了推理模型思维链的忠实度如何受偏好线索传递方式影响,并提出了FACE-Eval基准。关键发现是,当偏好线索通过工具输出或隐含的底层工件出现时,模型在思维链中的口头承诺降低,而实际行为受偏好引导的隐藏采纳更高,使得外部监测更不可靠。作者在多个开源权重模型上验证了这一现象,对推理模型的安全审计和对齐评估有重要警示。
WebWorld: The Browser as a World Model for Self-Improving Web Code
WebWorld把浏览器当作可执行世界模型,让网页代码修复不再依赖静态评估或人工标注。它定义交互契约来验证修复结果,浏览器执行代码并返回明确的成功或失败信号,从而为视觉语言模型提供可靠的验证监督。借助这个闭环,VLM可以自主迭代改进网页代码,在真实交互环境中持续提升生成质量,对构建自我改进的编码代理很有价值。
SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models
该论文关注多模态模型安全评估过于二元化的问题,推出大规模多模态安全数据集SafeAtlas-VL,为样本标注了分级风险标签而非简单安全与否。基于此训练的守卫模型可以预测连续安全分数,更细粒度地刻画内容风险程度。实验表明其泛化能力达到SOTA,对多模态内容审核和守卫模型部署有直接帮助。
DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection
DICS针对视觉指令数据规模膨胀但质量参差的问题,提出用数据内在一致性作为筛选准则。它测量样本内部多视图或多次生成的一致性分数,只保留高一致性样本用于训练。实验显示在训练数据大幅减少的情况下,模型性能反而提升,证明数据质量筛选比盲目堆量更有效,对视觉指令调优的数据工程有借鉴意义。
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions
CoVA-SFT构建了一个大规模多模态推理数据集,核心是让语言模型在推理过程中交错生成文本和视觉抽象,形成结构化的推理链。这种链式视觉抽象使模型能够把复杂视觉问题拆解为可操作的中间表示,而不只是端到端猜测答案。在多个视觉推理基准上,经过该数据集微调的模型取得明显提升,为多模态推理训练提供了新数据范式。
Dynamic Important Example Mining for Reinforcement Finetuning
DIEM解决强化微调中样本重要性差异大导致训练低效的问题,通过估计每个样本对策略改善的边际贡献,动态选择并重新加权训练数据。同时它对批量更新施加约束,避免策略在个别高贡献样本上过度偏移。实验表明这种动态重要样本挖掘能提升强化微调的样本效率和最终性能,对RLHF/RLVR实践有实际价值。
PaperGym: Rubric-Centered Evolution for Research-Plan Generation
PaperGym把科学论文重新组织成可训练的强化学习环境,关键做法是将研究问题与评估准则分离,使代理必须在给定研究问题下生成满足评分标准的研究计划。这种以评价准则为中心的进化方式让强化学习信号更明确,避免了生成计划与评估脱节。实验显示在多个模型规模上研究规划能力都有提升,对自动化科研代理的训练有启发性。
CogEvol: Towards Efficient and Reliable Learning Environment Generation
CogEvol系列模型专注于高效生成结构化学习环境或工件,采用监督微调加视觉语言奖励的强化学习,使模型能在单次前向中完成生成。与传统多步或大规模模型相比,该系列以更少参数和更低推理成本取得了高质量结果。这为自动构建学习环境或教育内容提供了一条廉价可靠的路径,对相关应用有直接价值。
SHAPE of Chain-of-Thought in Math Reasoning
SHAPE提出一种分析数学推理中思维链的方法,利用语义空间和启发式规则来解构推理过程,从而诊断模型在哪里出错或走偏。通过这种可量化的轨迹分析,研究者可以更精准地定位后训练需要补强的环节,并指导数据或训练策略调整。该工作为数学推理模型的调试和优化提供了一个新的分析视角,而不仅仅是关注最终准确率。
这篇论文针对顺序生成多个相关应用时代码冗余和结构逐渐腐化的问题,提出共享库代理框架。它主动识别可复用的跨应用代码,引导代码提取和迁移到共享库中,使后续生成的应用能基于库增量构建。该方法减少了重复实现,并缓解了长期维护中的结构侵蚀,对多应用代码生成场景有实际工程价值。
Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents
AutoSciRub的核心思想是让自主科学代理先学会评估再改进,自动为每个任务归纳出可执行的评价准则。这些准则不仅用于引导实验设计,还能验证每个步骤是否满足标准,并驱动输出迭代优化。实验表明引入自动准则归纳后,科学代理的任务完成质量和稳定性都有提升,对自动化科研流程有实际帮助。
Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation
KATok提出一种自适应视频分词器,在Transformer编码过程中根据token信息量动态决定保留或丢弃,实现随数据变化的压缩率。它特别关注保留空间一致性,使后续扩散模型生成时不因token丢弃而出现空间错乱。该方法在紧凑视频表示与生成质量之间取得良好平衡,对视频扩散模型降低计算成本有帮助。