[Config] Round 5.1: the published-side readers ask the bags, and a platform fact gets one address
将配置读取侧改为从只读配置袋读取并移除原始 server args 字段访问,同时把平台事实(如 SM100)收敛为单一地址。这消除了不同模块各自持有同一平台事实导致的推理后端选择不一致,并为后续按模型拆分配置模块扫清障碍。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
[Config] Round 5.1: the published-side readers ask the bags, and a platform fact gets one address
将配置读取侧改为从只读配置袋读取并移除原始 server args 字段访问,同时把平台事实(如 SM100)收敛为单一地址。这消除了不同模块各自持有同一平台事实导致的推理后端选择不一致,并为后续按模型拆分配置模块扫清障碍。
dflash: pass missing NVFP4 scales to attention operations
在 dflash.cpp 中补齐向 KV 注入、解码器注意力和输出投影等图操作传递 NVFP4 权重 scale 的缺失代码。修复 NVFP4 草稿模型因缺少量化 scale 而几乎无法产生被接受投机 token 的问题,恢复投机解码的有效性。
[mem_cache] Settle extend `kv_committed_len` inside `alloc_for_extend`
把 extend 与 decode 路径的 kv_committed_len 更新分别移入 alloc_for_extend 和 alloc_for_decode,与 kv allocated len 写入合并为同一步骤。这使得非投机 owned-kv 记账在分配阶段一次性完成,改善内存缓存状态管理的局部性且不改变执行顺序。
[TRTLLM-15405][refactor] BREAKING: Remove TRTLLMSampler and sampler_type
移除 TRTLLMSampler、SampleState、SamplerType 及相关配置,将 TorchSampler 设为唯一常规采样后端并更新 AutoDeploy/executor 构造路径。这简化了采样与投机解码的度量处理,消除双采样后端的同步与验证负担,降低维护复杂度。
[ROCm][MLA] Reach FULL cudagraphs for AITER MLA speculative decoding
修正 TritonMLAMetadataBuilder 对 DSpark draft 组 token 模式的报告,使 MLA 推测解码中的 forward mqa 组满足 UNIFORM BATCH 条件。这消除了单个注意力组将整引擎降级出 FULL cudagraphs 的问题,使 ROCm 上的 AITER MLA 推测解码能启用完整 CUDA 图。
[CI] Mark L4 GPU test steps with device: l4 for EKS migration
在 .buildkite 测试区域中为全部 39 个单节点 L4 GPU 测试步骤添加 device: l4 路由元数据。该改动对现有 CI 为无操作,为后续按环境门控将测试路由到 EKS 集群的迁移提供所需标记。
[Config] Round 5.2: the per-model declarations get their own modules
将 overrides.py 中 27 个 handler 和约 992 行代码按模型家族机械拆分为独立模块。这解除了各模型家族配置在同一文件中的耦合,新增模型时不再需要修改所有家族共用的文件,提升配置可维护性。
[AMD] Update v4 amd cookbook 0830
更新 AMD v4 cookbook,启用 TORCH_BLAS_PREFER_HIPBLASLT 环境变量,将 tp8 下的 chunk size 从 8192 调至 16384 并升级镜像版本至 0829。这些调整旨在改善 AMD 平台上的 BLAS 后端选择与张量并行分块配置。
[Bugfix] Hold references to fire-and-forget tasks in disaggregation
在 srt/disaggregation 模块中保存五个 asyncio.create_task() 创建任务的强引用,避免仅依赖事件循环弱引用。防止 fire-and-forget 任务在完成前被垃圾回收而消失,提升 disaggregation 异步执行的可靠性。
[Bugfix][MoE] Enable cuBLAS out_dtype router GEMM on all CUDA archs (fixes family-120/GB10)
将 cuBLAS out_dtype router GEMM 的可用性门控从仅限 Hopper/SM100 的 specialized_router_gemm 中拆出,允许所有 CUDA 架构使用融合路径。修复 family-120/GB10 上 bf16→fp32 router GEMM 回退到独立拷贝核并舍入 router logits 的问题,恢复精度与融合性能。
[AMD] fix: do not emit a shared-expert marker twice on the per-rank slot path
修复 per-rank fused shared-slot 路径上 gate 与 fused append 同时发射 shared-expert marker 的问题,仅保留 fused append 一侧。消除重复 marker 导致的 top-k 路由专家丢失和 expert id 越界,保证 AMD 分布式专家路由的正确性。
[Kernel] Fix SM90 FP8 decode regression with benchmarked M/K/N routing
将 SM90 FP8 GEMM 的 Torch/NVJet 路由限制到经基准测试的大 prefill 形状包络内,避免仅凭 K/N 将 decode GEMM 路由到 torch.scaled_mm。修复 H100 上 W8A8 decode 因选择错误 kernel 而导致的吞吐下降,恢复小 M decode 场景的 AOT 内核性能。
[Bugfix][Kernel] Keep packed GDN decode beta in FP32
在 packed GDN decode kernel 中移除将 FP32 sigmoid(b) 结果舍入到输入 dtype 再转回 FP32 的操作,直接保持 beta 为 FP32。避免 BF16 输入下每个循环状态更新被扰动并随长上下文累积误差,改善 Qwen3.5 至 Qwen3.8 系列长解码准确度。
[Diffusion] Make component execution options fail closed
将扩散模型组件执行选项改为 fail-closed 契约,要求显式配置必须被实际运行路径支持,否则在回退或使用前直接失败,覆盖并行布局、注意力 override、offload 和 PipelineConfig。这防止了组件配置被静默忽略或错误回退,增强配置安全性和可诊断性。
[ROCm] Fix QuickReduce fp16 saturation corrupting bf16 all-reduces (106M non-finite -> 0, +0.3%)
为 QuickReduce 启用 FP16 溢出饱和模式,并在 CodecFP 中增加 FP32 缩放-窄化-输出的幂次范围守卫,防止 BF16 转 FP16 时产生 inf。这修复了 BF16 all-reduce 中高幅值数据被量化为非有限值并传播的问题,提升 ROCm 集合通信的数值稳定性。
Use Flashinfer 0.6.18 release for CUDA 13.4 package
将 CUDA 13.4 包的 Flashinfer 依赖从已删除的 rc10 wheel 切换到正式 0.6.18 版本,并引入主 Dockerfile 的 dynamo 安装配置。修复因预发布 wheel 被移除导致的构建失败,确保 CUDA 13.4 包可正常构建。
[Perf] Tune the W4AFP8 DeepEP low-latency requant launch geometry
调整 W4AFP8 DeepEP low-latency 重量化内核的 launch 几何(如 warp 数、tile 宽度)以恢复 8 字节向量化访存并优化 scale 寻址。降低 per-token 到 per-tensor FP8 转换的纯流式内存开销,提升 W4A8 GEMM 前处理吞吐。
[BACKEND] Add per-kernel NVPTX register-pressure scheduling
为 NVIDIA 后端新增可选的每内核 sched4reg 寄存器压力调度设置,将调度策略通过线程局部状态传递到 LLVM 汇编生成。允许按内核精细控制寄存器压力调度,并确保并发编译任务互不影响。
[https://nvbugs/6640776][fix] Bump CUTLASS DSL to 4.6.2 to unblock FA4 split-KV
将 nvidia-cutlass-dsl 从 4.6.1 升级至 4.6.2,并新增可捕获该问题的回归测试。修复了 DSL 在 sm100 split-KV kernel 上因分支类型不稳定而编译失败的问题,使 VisualGen FA4 注意力配置能正常加载。
将 sgl-deep-gemm 版本升级至 v0.1.6,并基于 DeepGemm 官方 main 分支进行 rebase。跟进上游 DeepGemm 最新代码,获取后续修复与优化。
腾讯发布开源权重文本大模型「Hy4」预览版,总参数770B、激活49B、支持1M上下文,模型体积达1.56TB;相比7月发布的「Hy3」,参数规模、上下文长度都大幅提升。这对关注大规模开源基座、长上下文能力的从业者是一个重要发布。
「llama.cpp」新增针对「M3 Ultra」的「fa-vec」调优提交,优化 Apple Silicon 上的相关算子性能。这对使用 Mac 进行本地大模型推理的用户有直接加速意义。
「llama.cpp」为「M3 Pro」添加「fa-vec」调优,关联问题编号为27668,进一步改善 Apple Silicon 上的推理性能。该改动延续了对不同 M 系列芯片做针对性算子优化的方向。
「llama.cpp」的「Hexagon」后端新增设备发现和按需创建会话能力,支持运行时发现可用「NPU」核心、延迟会话分配与清理,并在初始化阶段提前拒绝不存在的设备。这提升了在高通「Hexagon NPU」上运行的灵活性和稳定性。
「llama.cpp」的「SYCL」后端在「TOP_K」操作中改为拆分长行,取代原先每行一个工作组的实现,以改善并行效率和性能。这对使用 Intel GPU 等 SYCL 设备的推理用户可以带来吞吐提升。
「PyTorch」新增参数连续的全收集通信接口「symm_mem.all_gather_offset」,支持参数连续场景下的「all-gather」操作。这对分布式训练中的通信优化和参数布局有实际价值。
「llama.cpp」修复了「Apple RDMA」在拆解阶段产生大量错误输出刷屏的问题,使使用远程内存直接访问的集群推理在退出时更干净。对依赖「RPC」和「RDMA」的多机部署场景是稳定性改进。
「llama.cpp」修复了旧版 macOS 在「pre-RDMA」路径上的兼容性问题,避免在不支持相关特性的系统上出错。这提高了跨 macOS 版本部署的健壮性。
AI agents have no sense of time and are not aware of it
一项新研究发现「Claude Code」和「Codex」等 AI 编码助手没有时间感,会系统性高估任务所需时长,其中「Codex」的估计误差可达实际时长的十倍,同时自我评分也偏高约20个百分点;这对长程自主任务的监督和排期构成实际风险。
Anthropic's Claude Code limit change is a raise on paper but a cut in practice
「Anthropic」实际上将「Claude Code」的每周用量限额削减了约17%:临时50%的提升将于9月14日到期,由永久25%的提升取代;官方承诺在用量控制和透明度上有所补偿。这对重度依赖该工具的开发者影响较大。
viable/strict/1788067484: [CUDA] Add non-overlapping fast path for avg_pool2d backward (#191086)
「PyTorch」为「avg_pool2d」反向添加了非重叠快速路径的「CUDA」核函数,当池化窗口精确平铺输入,如步长等于核大小且无填充时,每个输入元素只对应唯一输出窗口,可将原本的逐窗口扫描简化为单次加载和除法,从而显著加速常见下采样场景的反向计算。
Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
针对「GRPO」在推理训练中容易覆盖不足的问题,该工作分析了进化策略在推理覆盖上的表现,发现通过稀疏的函数式更新和种群多样性可以缓解策略坍缩,扩大推理多样性并提升「Pass@K」;相比「GRPO」覆盖更广,并支持混合训练路线。
Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models
针对空间世界模型在强化学习后训练阶段缺乏可执行验证和长程轨迹数据的问题,该工作提出用游戏引擎充当可验证轨迹数据引擎,为智能体在游戏环境中执行并提供长时程交互轨迹,从而支撑世界模型后训练;这种思路也推动了以人类工程验证为中心的世界模型扩展范式。
TTPO: Test-Time Policy Optimization
针对数学推理在测试时通常缺乏标签、难以继续优化的问题,「TTPO」通过非对称蒸馏一致的多条采样轨迹并惩罚不一致轨迹,实现无标签的测试时策略优化;实验表明其效果可以匹配监督训练的性能,为推理阶段自我提升提供了低标注成本路径。
Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
针对流匹配模型在多目标对齐中往往依赖任务特定教师模型的问题,「Self-OPD」去除教师依赖,利用自探索得到的随机分支和归一化优势来直接优化速度场,实现多目标对齐;该方案避免了为每个任务额外训练教师,同时保持了策略在线更新的稳定性。
What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents
针对智能体数据生成中盲目扩大规模而忽略质量的问题,该工作提出「ACE」视角,将数据生成视为在分解后的经验元组上做约束分布设计,强调执行落地准确性、相对于学习者复杂度的适配性以及多样性,而不是单纯堆数据量;这为构建更有效的智能体训练语料提供了原则。
GameWAM: A World Action Model for Video Games
针对视频游戏原生控制中视觉预测和动作生成通常分离、缺乏统一建模的问题,「GameWAM」提出统一的世界动作模型,采用块因果流匹配同时预测未来画面和可执行的键盘鼠标动作,并引入模态特定分布和块循环重规划机制,以适应长程游戏决策。
PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
针对长程智能体在运行中难以持续自我改进的问题,「PILOT」允许监督者实时介入并引导活跃工作器,同时把执行经验蒸馏成可复用技能,使智能体在任务执行过程中就能提升准确率和效率;这种人在回路的在线学习机制适合需要长期自主运行的场景。
WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
针对智能体经验容易丢失、难以跨任务复用的问题,「WikiSkill」让可复用智能体技能与持久知识库协同演化,把执行中积累的经验系统化沉淀为可查询知识,从而在不同模型上也能复用并持续提升表现。
CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes
针对推理时提升大模型能力通常伴随高生成和 token 成本的问题,「CritICL」利用较弱小模型的结构化失败模式作为批评式引导,在推理阶段实现从弱到强的泛化,同时降低生成量和 token 消耗;这为低成本推理增强提供了新思路。
FrontierChallenge: Evaluating Scientific Workflow Completion
针对现有评测往往只覆盖孤立能力、忽视完整科学工作流的问题,「FrontierChallenge」跨多个领域评估端到端科学工作流完成情况,结果显示前沿模型虽然部分得分较高且经常声称完成,但实际端到端完成率只有约20%,暴露出长程科学任务上的显著差距。
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
针对固定「harness」难以适配不同大模型和任务的问题,「JIT-Agent」提出一个可训练模型,能够即时为现成大语言模型合成自适应「harness」,从而提升跨模型和跨任务的表现;这相当于把「harness」智能本身也变成了可学习对象。
Agent-G^2: Gaussian Guidance for Agentic Reinforcement Learning
针对长程任务强化学习中估计提示深度往往需要额外探测、增加交互成本的问题,「Agent-G²」把提示深度建模为一个从已有轨迹在线估计的高斯分布,利用该先验引导策略学习,无需额外探测即可改善长程任务上的强化学习效果。
D^3-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation
针对多教师蒸馏中静态域采样容易导致收敛缓慢和资源浪费的问题,「D³-MOPD」通过监测每个域的反向「KL」轨迹动态调整域采样比例,使训练更聚焦于难以对齐的域,从而提高收敛效率,并大幅缩小学生模型与教师模型之间的性能差距。
Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
针对在无思维链数据场景下「next-chunk」推理强化学习是否真的优于监督微调的问题,该工作重新审视训练策略,发现混合监督微调在组合推理语料上训练,相比「next-chunk」强化学习在效率和最终准确率上都更优,覆盖数学和域外任务;这提示应谨慎选择推理训练范式。
V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
针对视觉语言模型答案可能脱离图像、缺乏视觉忠实度的问题,「V-Rubrics」提出基于评分量规的强化学习方法,从视觉忠实性、推理一致性和指令遵循三个维度给答案打分,并使用结构化部分得分进行优化,从而提升模型的视觉接地能力。
SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
针对现有编码评测很少覆盖长程、全仓库级别的软件栈迁移问题,该工作引入「SWE Refactor Bench」基准,评估编码智能体自主完成软件迁移的能力;结果表明当前模型很少能正确完成整个迁移过程,揭示了长时程代码改造的短板。
PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
针对世界模型概率对齐缺乏形式化定义和统一评测的问题,该工作形式化了概率对齐概念,并推出「PAWBench」和「PAWEval」,将视频生成器视为随机采样器来评估其是否匹配参考行为分布;结果显示当前模型普遍无法匹配目标分布,距离可靠世界建模仍有差距。
UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City
针对多模态语言模型智能体在真实尺度城市环境中的空间代理能力问题,「UrbanGround」在逼真的3D城市复刻中评测持续导航和空间推理,发现模型虽然具备局部感知能力,但无法组合成面向目标的长期行为;这为空间智能体的评测和训练提供了新视角。
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
针对紧凑模型难以适应不断变化的数字人「harness」配置的问题,该技术报告提出「Harness-Aware Training」,让模型在训练阶段就感知并适应多种「harness」配置,在保持低延迟的同时获得高准确率,适合数字人实时交互场景。
Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
针对机器人操作需要快速泛化到未见任务的问题,「Zero-WAM」将因果视频动作模型条件化于上下文人类视频指导,无需针对新任务微调即可执行操作,并配合自动生成的数据集和未来块预测目标进行训练,实现开放任务泛化。