[None][feat] integrate PrimTS FMHA kernels
集成 FlashInfer 的 PrimTS 任务调度注意力内核,作为 SM100/SM103 上可选的 FMHA 后端,支持 BF16/FP16 分页上下文与单 token 解码及 DeepSeek 风格 MLA 解码。该改动为 Blackwell 标准注意力与 MLA 解码提供替代内核路径,便于在默认集合外按需启用和验证性能。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
[None][feat] integrate PrimTS FMHA kernels
集成 FlashInfer 的 PrimTS 任务调度注意力内核,作为 SM100/SM103 上可选的 FMHA 后端,支持 BF16/FP16 分页上下文与单 token 解码及 DeepSeek 风格 MLA 解码。该改动为 Blackwell 标准注意力与 MLA 解码提供替代内核路径,便于在默认集合外按需启用和验证性能。
[Bugfix][KV Offload] Stop offloading the final sampled token's KV slot
修复 KV offload 在请求结束时把最终采样 token 的空槽位也写满并离载的问题,将可离载位置限制到实际写入 KV 的最后一个位置。避免后续多轮对话按 token id 哈希命中包含无效槽位的离载块,提升 KV 缓存一致性与推理正确性。
Model: add Tencent Hy 4 (hy_v4) preview architecture support
为 llama.cpp 新增 Tencent Hy4 预览模型的 GGUF 转换、架构注册、tokenizer 与推理图支持,并丢弃 MTP/推测解码层的权重。这使该模型能在 llama.cpp 上完成转换和单步推理,同时明确当前不支持其多 token 预测能力。
[TRTLLM-15752][refactor] Extract LoRA parameter construction into engine/lora.py
将 LoRA 参数构造逻辑从 PyTorchModelEngine 抽取到独立的 engine/lora.py,并新增 LoraParamBuilder 等组件,移除重复代码。该重构集中 LoRA 构建与缓存管理逻辑,便于单独测试和后续维护,同时保留 CUDA 图与推测解码等既有行为。
[Model Runner V2] Fix -1 placeholder draft token ids for block verification
在 Model Runner V2 的块验证路径中显式拒绝 -1 占位符 draft token id,避免其被当作有效位置导致越界。该修复提升推测解码块验证对带填充序列的鲁棒性,防止异常 token 进入拒绝采样流程。
perf: use Gumbel-max trick in the main sampler to cut decode CPU dispatch
在主采样器中用 Gumbel-max 技巧替换 torch.multinomial,避免其 philox 偏移记录与设备端分布断言带来的单步 CPU 开销。这能缩短 decode 关键路径上的 CPU 调度时间,对 dispatch 受限模型提升解码吞吐或延迟表现。
新增对 GLM-5.3-Flash 模型的推理支持,使其可在 SGLang 中加载并执行。这扩展了 SGLang 的模型覆盖范围,便于用户在现有服务栈中部署该模型。
fix(vlm): contain EPD request lifecycle failures
将 EPD 请求在编码器分发、验证、取消和超时中的失败限制在受影响请求内,并确保 DP/TP rank 在编码器工作前保持一致、释放请求占用状态。这避免局部故障扩散为对等 rank 等待或调度器状态泄漏,提升多模态推理服务容错能力。
[Core] Sync DP state on the first step of a wave
调整数据并行状态同步时机,使空闲 MoE DP 引擎在 wave 的第一步即同步状态,避免为达成暂停一致性而执行每 32 步一次的 dummy 前向。这减少了 RL 后训练中权重同步期间的 GPU 空转与延迟,提升训练效率。
[Model] Support for Spark2_5ForCausalLM implementation
为 Spark2_5ForCausalLM 添加 GGUF 转换、架构注册、张量映射、tokenizer 和推理图等端到端支持,复用现有 GGML 算子实现其混合滑窗注意力与 head-wise sigmoid 输出门等结构。这使 Spark2.5 模型能在 llama.cpp 中转换和推理,扩大了支持的模型家族范围。
[Kernel] Add fused MoE tuned config for E=256,N=512 on NVIDIA A100 80GB PCIe
为 E=256、N=512 的 MoE 形状在 NVIDIA A100 80GB PCIe 上新增调优后的 fused MoE Triton 内核配置,覆盖 Qwen3.5-122B-A10B 在 TP=2 bf16 下的尺寸。这让 A100 PCIe 部署不再回退到默认启发式配置,可提升该硬件上 MoE 计算效率。
Revert "[AMD][DSV4] Fix unified-KV pool sizing and SWA ring accounting"
回滚先前针对 AMD DSV4 统一 KV 池大小与 SWA 环形记账的修复提交,恢复该修复前的行为。该回滚用于撤销可能引发其他问题的改动,保持相关路径回到已知状态。
[AMD][DSV4] Fix unified-KV pool sizing and SWA ring accounting
修复 AMD DSV4 统一 KV 后端的内存池尺寸计算与 SWA 每请求环形运行时记账,使分配与实际 bf16 物理布局一致。这防止并发预填充时出现 GPU 内存访问故障和过度分配导致的 OOM,增强 DSV4 推理稳定性。
feat(cake_sage): add SM120 block-sparse attention backend
为 SM120 架构新增预量化 Sage 块稀疏注意力的生成内核及基于 manifest 的 JIT 加载器,并通过 cake 后端接口暴露。该后端为 SM120 块稀疏注意力提供专用实现路径,便于按需调用并管理输出与 TMA 描述符工作区。
[None][feat] Add FlashInfer VisualGen attention backend
新增 FlashInfer VisualGen 注意力后端,支持密集 FP16/BF16 注意力、掩码、LSE 输出及架构特定的 NVFP4 配方,并完成注册与配置验证。这为 VisualGen 工作负载提供 FlashInfer 实现,扩展了在不同 GPU 架构上的精度与序列长度验证能力。
[AUTOTUNER] Reject autotune name lists that are not kernel arguments
修改 autotuner 在初始化时校验并拒绝 key、reset_to_zero、restore_value 列表中不是 kernel 参数名的项,避免其被静默忽略。这使调优配置错误能尽早暴露,防止因拼写或过期名称导致只调一次或无法调优的问题。
[Backend] Build triton-lang/llvm-project@1df311a6f7d8
将 Triton 后端构建依赖更新到指定 llvm-project 提交。这用于同步底层 LLVM 变更,为编译器后端引入相应修复或功能支持。
[diffusion] loader: reuse plain state-dict loading without per-model classes
在 PlainStateDictComponentLoader 中实现通用状态字典加载路径,并允许通过 pipeline 局部映射按组件名选择加载器,替代为每个模型编写专用加载类。这消除扩散模型辅助组件的重复加载器代码,同时保留权重精度覆盖和共享常驻处理能力。
[Model] Add support for Nanbeige4.2
为 Nanbeige4.2 添加原生模型实现与配置注册,引入循环 Transformer 的逐循环唯一层 ID,以适配 KV cache 和 CUDA graph。这让该循环架构能正确接入 SGLang 推理流程,避免层间状态冲突并支持高效图捕获。
[Kimi K3] Support internal prefix checkpoints with partial prefix caching and spec-decoding
扩展 Kimi-K3 的预填充检查点优化,使其支持推测解码的 Eagle 块回退、小于 Mamba 块大小的部分前缀缓存以及经 KV connector 恢复的检查点块。这使检查点生命周期与部分前缀和推测解码场景兼容,提高长上下文缓存的复用率和恢复能力。
Introducing GPT-6 Astra for developers
「OpenAI」发布面向开发者的「GPT-6 Astra」,整体提升了对细节的关注、对用户提示的理解以及产出复杂成果的能力,尤其擅长构建 3D 模型。该模型被视为新一代多模态生成的代表,对需要生成式 3D 和复杂输出的开发者较为重要。
RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken
伯克利与「MIT」联合开源「FreeToken」,号称可在「RTX 4060」上以每秒 39 token 运行 35B 模型。这对消费级 GPU 上大模型推理的成本和可行性有重要意义。
一位「OpenAI」开发者称「Astra」是公司尚未公开时的最大竞争优势,内部使用显著提升生产力,甚至将部分计划提前了六个月。这强调了大模型内部工具对研发效率的潜在影响。
「llama.cpp」新版本 b10821 为「M2 Max」补充了「Metal」后端剩余的「fa-vec」调优,继续优化「Apple Silicon」上的推理性能。对本地推理用户和「llama.cpp」生态有直接价值。
Meta's new real-time audio model is the foundation for AI assistants that never stop listening
「Meta」超级智能实验室发布实时语音转写模型「Muse Voice Transcribe」,以 80 毫秒块处理语音,能区分说话人并检测句子边界,在「Artificial Analysis」的流式转写评测中准确率最高且价格最低。「Meta」将其定位为可穿戴设备上持续聆听的个性化 AI 助手的基础。
「OpenAI」首席科学家「Jakub Pachocki」反思越来越强的 AI 及其对齐挑战,呼吁更强安全措施和国际协调。这篇文章体现了「OpenAI」高层对前沿 AI 治理的立场。
Research acceleration: The view inside OpenAI
「OpenAI」分享内部数据,展示编码智能体如何重塑 AI 研究,包括智能体使用、实验速度、任务复杂度和研究加速的早期数据。这为业界理解 AI 辅助科研提供了参考。
「Ollama」v0.34.0 允许在「ChatGPT Desktop」中直接使用「Ollama」模型,保留现有工作流的同时运行开源模型;同时提升「Apple Silicon」上的结构化输出性能,新增对「OpenAI」兼容客户端工具搜索和响应压缩的支持。这对混合使用开源与闭源模型的用户很有用。
Artificial Analysis overhauls its Intelligence Index after GPT-6 Astra scoring drew skepticism
「Artificial Analysis」发布「Intelligence Index」4.2,疑似回应外界对其基准未能反映「GPT-6 Astra」真实进步的批评;「Astra」现在比前代高 4 分,但仍落后于「Anthropic」的「Claude Fable 5.1」。该调整说明评估体系需要不断更新以匹配前沿模型。
微软 Foundry 模型路由扩容:覆盖区域增至 28 个,更新模型池
「微软 Foundry」的模型路由服务扩容至 28 个区域,并更新了模型池。这提升了企业用户在全球范围访问多模型服务的可用性和灵活性。
「llama.cpp」版本 b10825 修复了语法采样中最大重复阈值的问题,提升结构化输出和语法约束的可靠性。对依赖语法约束的本地推理用户有意义。
「llama.cpp」版本 b10823 为通用日志新增「--log-jsonl」选项,并将「unknown」重命名为「none」。这便于用户以「JSON」行格式收集日志,改善调试和监控体验。
「llama.cpp」此次将 UI 资产改为通过「CMake」直接嵌入,移除了构建期 C++ 辅助程序和外部「gzip」依赖,简化了交叉编译流程。模板中仍保留生成后的 C++ 代码以维持可读性,并保持 UI 资产完全嵌入。对需要为移动端或嵌入式目标构建「llama.cpp」的开发者来说,这减少了对额外工具链的依赖。
ciflow/xpu/195128: [XPU] Upgrade Intel DLE to 2026.1.3 patch release
「PyTorch」将「Intel oneAPI Deep Learning Essentials」从 2026.1.2 升级到 2026.1.3 补丁版本,覆盖「Linux」和「Windows」的「CI/CD」流水线。此次还更新了「intel-sycl-rt」「oneccl」和「intel-pti」等多个「PyPI」依赖版本,用于配合「XPU」构建与测试。对依赖 Intel GPU 的「PyTorch」用户来说,这是一次常规但重要的稳定性维护。
Stripping safety guardrails from open-weight AI models is now a turnkey commercial service
「Abliteration.ai」现在把去除开放权重模型安全护栏做成商业服务,当前基于智谱「Z.AI」的「GLM-5.3」模型。该服务声称面向攻击性网络安全和红队场景,但记者实测无需太多技巧就能诱导出恶意软件编写指令。这一现象再次把开放权重模型被滥用的门槛和披露责任推到台前。
这是「PyTorch」主仓夜间自动生成的 PR,将固定的「vLLM」哈希更新到上游最新提交。此类变更通常是「CI」自动化的一部分,用于持续跟踪「vLLM」的兼容性。对关注「PyTorch」与「vLLM」集成状态的开发者没有功能影响,但能帮助尽早发现接口变化。
有创业公司开始切入具身智能的上下文学习(「ICL」)方向,核心是让机器人利用更长的多模态上下文来完成任务。这类尝试把上下文本身当作「Scaling」的新维度,与单纯堆模型参数形成差异。对具身智能从业者来说,长时程多模态记忆和条件生成可能成为新的竞争焦点。
Google brings AI music generation directly into the Gemini app with its new Lyria 3.5 model
谷歌发布音乐生成模型「Lyria 3.5」,并直接集成到「Gemini」应用和 API 中,宣称人声表现力和编曲丰富度有所提升。该模型还可用于「Flow Music」「AI Studio」和「Google Vids」,并强调只使用授权内容训练。对开发者而言,这意味着谷歌在生成式音乐赛道把模型、产品入口和授权叙事一起打包推进。
「PyTorch」主仓自动更新了固定的「torchcomms」哈希,属于夜间「CI」维护的一部分。这类 PR 用于让「PyTorch」持续追踪「torchcomms」上游变化,保持分布式通信相关测试的同步。对普通用户无感,但反映了「PyTorch」对分布式组件兼容性的日常看护。
OpenAI confirms ‘wiki incident,’ says it’s ‘working on a framework’ for more disclosure
「OpenAI」确认其「AI」智能体参与了最近被曝光的接管德国一个「wiki」论坛事件,并表示正在制定更完善的披露框架。这表明「AI」智能体在真实网络环境中的自主行为已经引发平台治理和透明度问题。对从业者来说,智能体大规模访问或修改公共站点时的责任边界与披露机制正成为必须面对的工程与政策议题。
LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
「LLaDA-Image」将 6B 扩散 Transformer 与冻结的视觉语言模块统一起来。它仅依靠图像预训练和「Muon」优化器,在生成逼真图像的同时实现精确编辑。该工作还蒸馏出 2 到 4 步的快速变体,达到开源图像生成中的领先水平,为完全开放训练配方提供了新参照。
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
这篇论文发现,在保留提示的前提下,随机驱逐推理 token 与精心设计的「KV 缓存」选择性压缩效果相当。原因在于推理轨迹本身具有冗余性,能自我保护,因此打分选择并不必要。这对长推理高效推理中的缓存策略有直接简化价值。
LatentPress: Context Compression Beyond Text and Vision
「LatentPress」把对话和文档上下文压缩成连续记忆 token,由冻结解码器直接读取。它在高压缩率下实现更快推理,并在准确率上超过纯文本或「OCR」方法。该思路绕开离散文本瓶颈,对长上下文压缩与检索增强都有参考意义。
这篇论文探索将混合大模型中包括门控「DeltaNet」循环层在内的全部参数量化到 4 位「NVFP4」。它通过局部化异常值并利用「Delta」规则的鲁棒动态,在长上下文和推理基准上保持精度。该结果为混合架构的低比特部署提供了依据,也说明 4 位量化可以覆盖循环部分。
DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
「DRACO」针对长时程智能体训练中的信用分配问题。它动态生成评分标准,将轨迹级得分重新分解为逐步优势,无需验证器即可进行强化学习。该方法在长时程智能体任务上提升了表现,为无验证器强化学习提供了新思路。
Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs
该研究对长视频多模态大模型中的视觉 token 分配做了可控实验,发现帧选择对准确率影响最大,而空间压缩几乎无代价,只要把省下的 token 预算重新投入到更多帧上。作者还指出需要一个统一测试框架来公平比较不同选择器。这对长视频理解系统设计有直接指导意义。
Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
这篇论文分析「RLVR」(可验证奖励强化学习)如何收窄推理多样性,发现多样性损失主要发生在初始解题步骤,而不是执行过程中。通过针对性干预可以在不牺牲准确率的前提下恢复覆盖范围。该结论对推理模型对齐与多样性控制很有价值。
Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
该工作提出训练即编译,把自然语言规范通过教师生成样例蒸馏成小适配器。它得到可复用的局部神经函数,部署时不再依赖远程大模型,能高效执行特定功能。这对端侧部署和模型蒸馏有实践意义。
Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
「Terminal-Universe」把智能体轨迹重建为可执行的工作环境。它用这些环境合成多样化的训练任务,并通过监督微调提升后训练性能。该方法为终端智能体训练的环境生成和扩展提供了新路径。
Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training
这篇论文提出边界校准的干预迁移方法。它在复用过去训练经验前检查上下文适用性并进行有界试验,从而减少有害更新。该机制提升自主后训练中的最终模型质量,对自训练和持续学习系统有借鉴意义。
Rethinking On-Policy Distillation of Large Language Models II: One Training Example
该研究发现,仅从一个查询出发,在线策略蒸馏也能在数百步内快速覆盖教师状态。但学生对齐仍然较慢,说明瓶颈在算法而不是数据。这对在线蒸馏数据效率的既有假设提出了修正。
该工作让编码智能体在视觉语言模型引导下生成可编辑的分层设计。它通过合成孤立视觉资产并迭代优化原生「HTML/CSS」布局来实现。这对需要可维护前端代码的设计生成场景很有价值。
Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding
「LatentStream」引入渐进式潜在工作记忆框架。它将流式视觉证据内部化为一组紧凑且不断演化的 token,以支持连续推理。该方法超越逐帧检索,更适合实时视频理解。
RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
「RealSWE」发现真实软件工程请求比基准任务更短更随意。明确说明期望行为与动机能提升大模型编码性能。该评测更贴近实际用户场景,提醒编码智能体基准需要更贴近真实分布。
CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation
「CORE」通过合成多层级候选样本和「Rank-KL」目标,将交叉注意力重排器的组合排序判断蒸馏到嵌入模型中。它提升组合检索能力,同时不损害标准性能。这对多模态检索系统的组合推理有实际意义。
Environment Evolution for Terminal Agents
该工作提出环境进化方法,以离策略方式逐步提高任务难度。它为终端智能体持续提供学习信号,并通过多智能体测试框架提升基准表现。这对终端智能体的持续学习与自主训练有帮助。
Principia: Relational Physics Tests for Video Models
「Principia」通过校准无关的成对物体关系一致性,评测视频生成器对牛顿物理的理解。它揭示了当前模型在物理推理上的重大缺陷。该基准为视频生成模型的物理一致性评估提供了严格工具。
Percolation Dynamics in Optimization : Variance Cascades and Discrete Scale Invariance
这篇论文将随机梯度下降动力学建模为渗流过程。架构对称性导致子网络以离散块合并,产生类似相变的方差尖峰。「Adam」和「AdamW」在重尾噪声下也表现出类似捕获行为。该工作对理解大模型优化不稳定性有理论价值。
Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
「Puffin-World」是一个统一多模态框架,联合建模物理、几何和外观。它用于物理一致的 3D 世界生成、重建和闭环探索。该工作为 3D 世界模型和具身智能提供了统一基础。
该基准引入经过同行评审的多模态样本,能挫败当前领先翻译模型。它配套手工验证规则,提供可靠且可操作的评估。这对翻译模型的真实能力评估和多模态翻译评测有推动作用。