[4/N][warmup][DSv4] Migrate common attention kernels
将 DSv4 的注意力准备、缓存、索引器与稀疏注意力内核迁移到统一 warmup 契约,并定义内核自有编译键与 AST 追踪预热空间,新增免 dummy launch 的 compile-only 路径。这使推测解码相关内核的编译与预热更一致、可控,可减少启动开销并提升推理部署性能。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
[4/N][warmup][DSv4] Migrate common attention kernels
将 DSv4 的注意力准备、缓存、索引器与稀疏注意力内核迁移到统一 warmup 契约,并定义内核自有编译键与 AST 追踪预热空间,新增免 dummy launch 的 compile-only 路径。这使推测解码相关内核的编译与预热更一致、可控,可减少启动开销并提升推理部署性能。
[Bugfix][Spec Decode] Cache the Mamba state at the block-grid position of EAGLE resume
修复 EAGLE 恢复时 Mamba 状态未在当前块网格位置缓存的问题,使 Mamba 状态在 EAGLE 修剪候选后的精确位置可命中,而不是回退到上一块边界。这能提升推测解码与 Mamba 缓存的块级对齐精度,减少前缀缓存失效和额外重算,改善服务性能。
[AMD] gfx950 assembly attention for EAGLE verify, draft extend and decode
为 MI355X 新增手写 gfx950 汇编注意力内核,统一服务 EAGLE 验证、draft extend 与 decode 三个阶段的分页 FP8 KV 缓存读取。该内核相比 Triton split-K 路径提升缓存读取吞吐,可降低长上下文推测解码的注意力延迟并提升整体 decode 性能。
【NPU】Support EAGLE when PP enabled in prefill nodes
在 prefill 节点启用流水线并行时增加 EAGLE/MTP 兼容处理,使 prefill 阶段可同时使用 PP 与草稿 KV 生成,避免 decode 侧缺失部分草稿 KV。这能稳定 NPU 上 MTP 的接受率,改善流水线并行下推测解码的推理质量与吞吐。
[Model] add GLM-5.3-Flash support
为 vLLM 新增 GLM-5.3-Flash 模型支持,提供 Day0 模型接入及相应的 Docker 运行说明。这使推理服务能够加载该模型并开展推测解码等推理工作,扩展可用模型范围。
[https://nvbugs/6621358][test] Unwaive tests tracked by NVBug 6621358
从测试豁免列表中移除两个受 NVBug 6621358 跟踪的 DeepSeek-R1 LongBench V2 豁免项,使相关测试重新纳入常规验证。这有助于恢复对推测解码场景的正确性回归覆盖,提升 CI 的工程质量。
model : support Kimi-K3 recurrent-state rollback
为 Kimi-K3 开启推测解码中的有界循环状态回滚,保存每个回滚位置的卷积窗口并复用现有 helper 保存 KDA 状态快照。这使拒绝 draft token 后能正确恢复循环状态,避免多序列回滚损坏并提升推测解码正确性。
docs(cookbook): Qwen3.8-Flash-Next NVFP4 recipes for DGX Spark (1x, 2x) and RTX PRO 6000
为 Qwen3.8-Flash-Next 增加 DGX Spark 单卡/双卡及 RTX PRO 6000 的 NVFP4 推理配方,覆盖 RadixArk 与 nvidia ModelOpt 混合精度导出的高低吞吐和低延迟档位。这为不同硬件上的量化部署提供可复现命令,便于用户执行推测解码与低精度推理。
[None][test] add Kimi K3 feature matrix coverage
扩展 Kimi K3 的 W4A16/MXFP4 特性矩阵测试,覆盖 baseline、混合 KV 缓存复用和自推测解码,并将共享的 forced-token logits 处理与接受长度计算下沉到 accuracy core.py。这能统一测试实现并增强对推测解码、缓存复用等模式的正确性与性能回归监控。
[AMD] CI: fix Lean decode crash on the EAGLE path
修复 AMD ROCm 上 EAGLE 推测解码捕获路径因 ForwardMetadata 未填充 Lean persistent-grid buffer 导致 locks 为空并崩溃的问题,使 triton backend 传入与普通 decode capture 一致的 CUDA graph lean buffers。这恢复 AMD CI 中 EAGLE 测试执行,保障 ROCm 推测解码路径稳定性。
[None][fix] Make LlmRequest.is_generation_only_request a property to match the C++ binding
将 LlmRequest.is_generation_only_request 改为与 C++ 绑定一致的只读 property,避免 Python 子类以普通方法覆盖后被所有守卫误判为仅生成请求。这修复请求类型判断,提升推测解码等服务路径的控制流正确性。
[NPU] Enable non-greedy MTP sampling
为 NPU 的 MTP 验证新增非贪婪采样分支,在 eagle sample 中应用 temperature 缩放与 top-k/top-p 概率重归一化,并支持 EAGLE 树的 target-only 采样和经典拒绝采样。这使非贪婪请求在推测解码中正确生效,避免因采样策略不一致导致精度下降。
[AMD] Fix EAGLE crash when no kv_index_translator is bound on the DSA fp8 read door
修复 DSA 后端读取 MLA FP8 KV 缓存时无条件使用 kv_index_translator 而该后端未绑定 translator 导致的 EAGLE 崩溃,增加对 None 默认值的处理。这使 DSA/gfx950 上的草稿模型能安全读取 FP8 KV 缓存,避免统一池场景推理中断。
[Bugfix][Mamba] Clear deferred init metadata before speculative decode
在 EXTEND 到 DECODE 边界清理 Mamba 的延迟 clear/COW 索引,避免 DRAFT EXTEND V2 批次复制过期元数据并对 draft-pool 状态重放已完成的初始化操作。这修复混合 Mamba 模型在多层 EAGLE/MTP 推测解码中的状态污染,提升推理正确性。
[https://nvbugs/6702267][fix] Stage `kv_block_ids_per_seq` unrotated so the block table matches…
将 MTP/Eagle3 draft 循环中的 kv_block_ids_per_seq 改为不旋转的方式暂存,使 FlashMLA 块表与 kv_lens_cuda 的批次顺序一致,消除每步 draft 中 KV 长度与块指针错配。这修复对提议 draft token 的污染并恢复接受长度,提升混合推测解码的准确性与性能。
[ROCm][Quantization] Support AMD Quark per-block FP8 for fused MoE layers
让 AMD Quark 的 W8A8 FP8 fused MoE 层接受 per-block 量化模式,按 128x128 块网格分配权重 scale 并标记 FusedMoeWeightScaleSupported。这使 Quark per-block FP8 MoE checkpoint 能正常加载推理,扩展 ROCm 量化部署能力并改善 MoE 推理效率。
[Diffusion] Stream mapped weights on a shared host/device pool
在共享主机/设备内存池的集成平台上流式加载映射权重,避免同一权重在主机端重复驻留,复用页缓存页面直接供设备读取,并引入 MADV_WILLNEED 与 MemAvailable 控制。这降低大型扩散模型加载时的内存占用,使 DGX Spark 等统一内存平台可装载超出物理内存的权重并提升资源效率。
sglang-server remove opaque type
将 Rust server 中的 opaque type 按 Python MultiModality 类型镜像并以类型化方式重构,移除不透明封装。这改善服务端类型可维护性与接口清晰度,降低多模态请求处理中的解析开销和错误风险。
[ROCm][Perf][M3] Fused allreduce+GemmaRMSNorm fast path
在 ROCm 路径中接入 aiter 的 fused allreduce+GemmaRMSNorm 自定义算子,使原本拆成两个 kernel 的 allreduce 与 GemmaRMSNorm 合并为融合执行。这减少每层 kernel 启动开销,提升 MI355X 等多卡推理的通信与归一化性能。
[TRTLLM-15621][feat] Support in-graph sampling for temperature/top-k/top-p batches
为支持 temperature/top-k/top-p 的批次新增可选 in-graph 快速采样路径,引入 FAST/FULL 采样层级及相应的 CUDA graph capture、暂存和运行时解析,同时将不支持的采样特性保留在 eager FULL 路径。这降低采样对 CPU/eager 调度的依赖,提高高吞吐推理和推测解码场景下的采样效率与延迟稳定性。
OpenAI 详解 GPT-Live 架构如何实现了连续的有状态语音交互
OpenAI 公开了 GPT-Live 架构,详细说明其如何实现连续的有状态语音交互。该架构对实时语音助手、多轮语音交互等场景的从业者具有参考价值。
llama.cpp 新增对 Kimi-K3 循环状态回滚的支持,合入 PR #28466。该功能对运行 Kimi-K3 这类递归/混合模型的推理服务在状态管理和会话恢复上有帮助。
GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading in vLLM
vLLM 集成 HiSparse 作为压力驱动的内存层级,与 Hybrid Memory Allocator 和 KV offloading 协同工作,使 GLM 5.3 请求在 KV 缓存超出 GPU 显存时仍可继续解码,从而维持高并发。这是 GLM 5.3 推理优化系列的第一部分。
Simon Willison 的 llm 工具发布 0.35 版本,新增 OpenAI 模型 gpt-6-astra 支持,方便开发者通过命令行访问 GPT-6 Astra。对使用 llm 进行模型调用和实验的用户很有用。
OpenBMB 发布 MiniCPM5-2B,一个 25.17 亿参数稠密模型,原生 131K 上下文;在 34 项基准上平均 53.9,超过 Qwen3.5-4B 的 51.1,且在工具使用、编码智能体和长上下文检索上优势明显。后训练阶段使用 400B 深度思考 SFT、RL 教师和在线策略蒸馏将 16 个专家模型合并为一个 checkpoint,权重以 Apache 2.0 发布。
ms-swift v4.5.3 新增 Qwen3.8-Flash-Next 支持,这是一款 125B 总参数的多模态 MoE 模型,每 token 约激活 6B,包含可下放到 host 的 51B N-gram embedding 表,原生 262K 上下文,并支持 Megatron 训练。同时提供对应最佳实践,并支持多个新模型。
Introducing ChatGPT Images 2.5
OpenAI 推出 ChatGPT Images 2.5,可将用户的创意、草图和参考照片转化为更个性化、精细的图像,提升生成结果与用户意图的贴合度。该更新对多模态内容创作和图像生成用户有直接价值。
vLLM 发布 v0.29.0rc6 候选版本,修复混合模型默认 dense prefix cache 应用问题,改善混合架构模型的前缀缓存行为。
vLLM v0.29.0rc5 将 Mamba 等模型的 prefix_cache_retention_interval 默认值调整为 dense,优化前缀缓存保留策略。这对使用 Mamba 类模型的服务部署有性能影响。
Reducto Releases r-1: A Single Pass Document Parsing Model That Cuts Errors 20% at 1 Cent Per Page
Reducto 发布 r-1 单遍文档解析模型,将 OCR、版面检测、表格、格式化和 grounding 融入一次完整页面解析,替代其原先的多阶段 agentic 流水线。官方报告错误率降低 20%,每页成本固定 1 美分,低于旧流水线的 3 至 6 美分。
据 The Decoder 报道,Anthropic 在 11 个月内签署了高达 5170 亿美元的算力合同,但仍落后于 OpenAI 至 2030 年的 7500 亿美元计划。CEO Dario Amodei 曾在 2026 年初警告不要投资过快,现在 Anthropic 正加速追赶,而 Sam Altman 则对 neo-cloud 算力建设的不可持续行为发出警告。
llama.cpp 回滚了此前在 HIP 构建中恢复 prop.integrated 的 CUDA 更改,修复相关兼容性或稳定性问题。该提交对应 PR #28604。
llama.cpp 服务端修复 checkpoint min-step 淘汰逻辑,仅当 checkpoint 列表满时才应用间距淘汰,避免短 prompt 下混合/递归模型从先前 checkpoint 重新预填充的问题。该修复改进了服务端 checkpoint 管理和续推理的正确性。
Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
Hugging Face 博客讨论安全拒绝策略,主张模型应学会拒绝一个主题中的错误子集,而非整个主题。这与边界感知的拒绝训练思路一致,对安全对齐研究有启发。
llama.cpp 修复 Metal 后端 mul_mv_iq3_xxs 内核在 ne00 小于 1024 时的空闲线程问题,并新增 8 行 split kernel 处理小尺寸场景,提升 GPU 利用率。该修复对 Apple Silicon 上的量化推理有性能帮助。
OpenAI首曝“AI造AI”内部数据,2028年冲击AI研究员!黄仁勋高调祝贺:AGI已到来
据 InfoQ 报道,OpenAI 首次曝光内部 AI 造 AI 数据,并称 2028 年将冲击 AI 研究员岗位;黄仁勋高调祝贺并称 AGI 已到来。这一表态引发业内对自动化 AI 研究和算力竞争的新一轮讨论。
llama.cpp Vulkan 后端新增算子融合,将 UNARY(GELU/SIGMOID/SILU/SOFTPLUS) 与 MUL 融合执行,减少运行时分支和 kernel 调用开销,提升推理性能。该优化在 unary.comp 中通过静态 ifdef 和专用 pipeline 实现。
Introducing CUDA Rust: Two Tracks for Writing GPU Kernels
NVIDIA 宣布推出 CUDA Rust,提供两条编写 GPU 内核的原生 Rust 路径,将 Rust 语言引入 CUDA 生态。这对希望在 GPU 编程中使用内存安全特性的开发者具有重要意义。
AI Coding 在大型客户端工程中的落地实践——从通才模型到专才 Agent|QCon上海
InfoQ 分享 AI Coding 在大型客户端工程中的落地实践,探讨从通才模型到专才 Agent 的演进路线。该内容来自 QCon 上海,对工程团队落地 AI 编程智能体有参考价值。
trunk/60147cf18442b8858a728ab0d5f77235f24a3e69
PyTorch 编译器相关提交在 UserDefinedObjectVariable 的 tp_getset 中暴露 __class__,改进 Dynamo 对用户定义对象类的元编程处理。这是编译器功能增强。
llama.cpp 将 14 个专用模板解析器从 chat.cpp 拆分到 common/parsers 目录,chat.cpp 从 3915 行缩减到 1513 行,提升代码模块化和可维护性。
llama.cpp OpenCL 后端修复 conv2d 对非连续输入的处理,解决非连续 stride 场景下的计算错误,提升卷积相关推理的正确性。
OpenClaw 2.0 发布,简化配置并支持智能体协作,降低多智能体系统搭建门槛。对需要快速构建协作式智能体应用的开发者有实用价值。
PyTorch FSDP 修复 _override_module_m 中可变默认字典的危险用法,消除潜在共享状态 bug,提升分布式训练代码稳定性。
viable/strict/1788856484: [torchtitan hash update] update the pinned torchtitan hash (#195522)
PyTorch 更新 torchtitan 的固定哈希,保持与上游 torchtitan 仓库同步,属于日常依赖维护。
viable/strict/1788852547: Fix extract_scripts step-index zero-padding off-by-one (#187731)
PyTorch 修复 extract_scripts 工具中步索引零填充 off-by-one 问题,确保步数为 10 或 100 等幂次时文件名索引位数正确,避免排序错乱。
王云鹤创业后交出首个模型,技术路线是把多模型执行阶段积累的经验反哺到模型训练环节。对关注国内大模型创业动态的从业者来说,这标志着又一位资深研究者下场后的首份成果落地,其具体训练方法和能力表现值得继续观察。
这是 PyTorch 的一个底层修复提交,将 is_gpu() 和 device_need_guard() 的判断逻辑改为从 DeviceInterface 派生,以减少设备类型硬编码带来的不一致。对维护自定义设备或关注 PyTorch 设备抽象的开发者来说,这有助于让不同后端在设备判断上遵循统一接口。
Simon Willison 引用了 OpenAI 高管 Jakub Pachocki 的观点,认为继续快速训练更强模型的最重要理由是构建针对其他 AI 威胁的防御系统,包括实时防御 rogue agents、保护基础设施和发明新防护措施。这为 OpenAI 的部署重点提供了战略注脚,也反映出前沿实验室以防御必要性来论证持续扩大智能规模的叙事。
Latent Space 推出首个 Astra 项目「Frontier AEO Tracker」,追踪 Astra 等前沿模型在 AEO 趋势中的选择,这是创始人和开发者体验负责人高频询问的话题。对做 AI 可发现性或智能体生态的团队来说,该追踪器提供了跨模型行为对比和可操作的优化方向。
从 Harness 到 Loop:阿福 Agent 小队如何处理持续涌入的线上 Badcase|QCon上海
InfoQ 中文报道了 QCon 上海演讲,介绍阿福 Agent 小队如何从 Harness 演进到 Loop 机制,以处理持续涌入的线上 Badcase。这对做生产级 Agent 闭环优化的团队有借鉴意义,重点在于把线上失败案例转化为持续改进的循环。
Axis Robotics 发布基于浏览器的数据引擎 AXIS,将机器人演示采集从实验室硬件迁移到网页端,并把重计算放到后端 GPU,得到 207 个操作任务和 50,129 条经过验证的 Franka 轨迹。用这些数据做持续预训练,π0.5 在 LIBERO-Plus 上从 83.9 提升到 88.8,而同等数据量的 RoboCasa365 对照组只有 57.5,说明浏览器众包式采集和规模化数据质量对机器人策略训练价值明显。
GPT-6 Astra beat Portal start to finish without human help in under 24 hours
The Decoder 报道称 GPT-6 Astra 在设定初始目标后,完全独立地在约 24 小时内通关解谜游戏「传送门」,全程无需人类帮助,开发者 cozyblaze 已在 GitHub 公开代码和文档。他评价 Astra 是「我们未来会得到的最差模型」,这反映了前沿智能体在长程规划、环境交互和自主完成复杂任务上的能力跃升,也让从业者看到更强模型很快会继续拉高上限。
Cloudflare 扩展了 AI 搜索功能,以便客服代表和开发人员可以更轻松地搜索自定义数据
Cloudflare 扩展其 AI 搜索能力,让客服代表和开发人员能更便捷地检索自定义数据,降低在自有知识库上构建 AI 检索应用的接入成本。对于使用 Cloudflare 做边缘 AI 或 RAG 的团队来说,这意味着更直接的向量检索与数据接入路径。
AWS 开源 Kiro Crew,让 Coding Agent 异步跑起来
AWS 开源 Kiro Crew,目标是让 Coding Agent 支持异步执行,使编码智能体不必同步阻塞等待,从而提升任务并行度和开发流程效率。这对使用 AWS 生态构建 AI 编程助手的团队是一个可集成的组件。
TikTok SRE 技术负责人:AI Agents 说到底就是分布式系统
TikTok SRE 技术负责人提出观点:AI Agents 本质上就是分布式系统,意味着需要用分布式系统的方法论来设计智能体的可靠性、状态管理和容错。这对 Agent 工程实践是一个重要视角转换,有助于把 SRE 经验迁移到智能体运维。
“薄 Agent Loop,厚 Control Plane”:TiDB 用数据库思维重做 Harness
TiDB 团队提出「薄 Agent Loop,厚 Control Plane」的设计思路,用数据库思维重构 Harness,把智能体循环保持轻量,把复杂控制逻辑下沉到控制面。这为构建可扩展、可治理的 Agent 基础设施提供了来自数据库领域的架构参考。
PyTorch 修复了 Dynamo 中 assume_constant_result 返回 Tensor 时,跨图断裂重建字节码却因运行期全局变量缺少对应名称而报错的问题。修复让 Tensor 常量路径与 non-Tensor 路径一致地安装名称,保证 ConstantSource 在执行 LOAD_GLOBAL 时能正确解析。这对使用 torch.compile 并依赖常量折叠或 assume_constant_result 的开发者来说,能减少图断裂场景下的编译失败。
ASML locks in TSMC, Samsung, and Intel while Huawei races to break its grip
ASML 已争取到三星、台积电和英特尔转向更大尺寸光罩,使其最新 EUV 光刻机的吞吐量提升 40%。与此同时,华为正通过设备制造商宇量昇及自有供应商体系,协调中国突破对荷兰光刻技术依赖的替代策略。这反映了全球先进制程设备竞争和中美芯片供应链博弈的关键节点。
llama.cpp 修复了在 32 位目标上 Vulkan-Hpp 句柄使用问题,因为 Vulkan 非分派句柄在 32 位平台是 uint64_t,Vulkan-Hpp 出于类型安全禁止隐式转换。具体修复包括为 vk::Buffer 增加输出流操作符,并在调用 Vulkan-Hpp 的 CommandBuffer::copyBuffer 接口时直接传递 vk::Buffer 而非强转 VkBuffer。这对在 32 位嵌入式或边缘设备上跑 llama.cpp Vulkan 后端的用户很重要,能避免日志和拷贝路径的类型错误。
Unlocking Lossless Speedups in LLMs via Discrete Diffusion
针对自回归语言模型逐 token 串行解码导致的推理延迟,这篇论文提出用离散扩散增强自回归生成,通过蒸馏扩散权重和专用采样器实现并行 token 采样,无需草稿模型即可加速推理且保持质量无损。该方法为 LLM 无损推理加速提供了新路径。
FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience
面向推理模型强化学习训练中奖励信号不稳定的问题,FlowBalance 引入验证器校准的自我引导机制,利用轨迹级评分重加权和基于 profile 的轨迹平衡来调整更新目标,从而提升推理模型的自改进效果。对这类模型的对齐与强化训练具有参考价值。
One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation
这篇批判性综述聚焦数学推理中的在线策略自我蒸馏,指出其虽能利用特权信息在没有更大教师模型的情况下引导训练,但存在推理崩塌现象,并受 token 加权、特权上下文和引导动态三个因素共同影响。文章为理解该方法的失效边界和改进方向提供了系统分析。
Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation
针对在线策略蒸馏中教师提示质量不稳定导致训练效率下降的问题,该论文提出教师门控的在线策略蒸馏,先用验证器评分探针评估每个提示上教师的可靠性,再据此路由到稠密蒸馏或基于验证器的强化学习,从而提升训练效率和准确率。
Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal
针对安全对齐中模型要么过度拒绝、要么产生有害回复的边界模糊问题,该论文提出边界感知的自我蒸馏方法,利用自生成拒绝数据和边界对训练来精确控制模型拒绝边界,在提高目标拒绝能力的同时减少过度拒绝和有害输出。
EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents
针对机器人技能执行缺乏统一验证和闭环编排的问题,EmbodiedSkills 提出一个统一框架,通过固定接口对机器人技能执行进行验证与确认,支持闭环具身智能体在低层 VLA 策略上灵活切换。该框架为训练与部署可适应 VLA 智能体提供了基础设施。