每日 AI 速览

2026-08-30

生成于 2026-08-31 04:12
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日内容聚焦智能体与训练方法两条主线。智能体侧,可验证轨迹数据引擎、世界动作模型与实时自我改进密集出现,数据质量、长程规划和评测基准成为热点;训练侧,进化策略对比「GRPO」、测试时策略优化、弱到强泛化等推理优化方法引人关注。工程与产品上,「Claude Code」额度调整引发讨论,「Hy4 Preview」发布值得留意。

AI Infra 动态 20 条

主流训推框架主分支 PR,按前沿价值与性能影响降序。
SGLang #37086 MERGED

[Config] Round 5.1: the published-side readers ask the bags, and a platform fact gets one address

本日合并至 main · 08-30 17:18 UTC+8 · @ch-wan

将配置读取侧改为从只读配置袋读取并移除原始 server args 字段访问,同时把平台事实(如 SM100)收敛为单一地址。这消除了不同模块各自持有同一平台事实导致的推理后端选择不一致,并为后续按模型拆分配置模块扫清障碍。

推测解码 硬件适配服务与推理
llama.cpp #28000 MERGED

dflash: pass missing NVFP4 scales to attention operations

本日合并至 master · 08-30 16:34 UTC+8 · @JamePeng

在 dflash.cpp 中补齐向 KV 注入、解码器注意力和输出投影等图操作传递 NVFP4 权重 scale 的缺失代码。修复 NVFP4 草稿模型因缺少量化 scale 而几乎无法产生被接受投机 token 的问题,恢复投机解码的有效性。

推测解码 算子与内核性能优化
SGLang #37085 MERGED

[mem_cache] Settle extend `kv_committed_len` inside `alloc_for_extend`

本日合并至 main · 08-30 14:14 UTC+8 · @hnyls2002

把 extend 与 decode 路径的 kv_committed_len 更新分别移入 alloc_for_extend 和 alloc_for_decode,与 kv allocated len 写入合并为同一步骤。这使得非投机 owned-kv 记账在分配阶段一次性完成,改善内存缓存状态管理的局部性且不改变执行顺序。

推测解码 硬件适配服务与推理
TensorRT-LLM #18232 MERGED

[TRTLLM-15405][refactor] BREAKING: Remove TRTLLMSampler and sampler_type

本日合并至 main · 08-30 06:03 UTC+8 · @zhaoyangwang-nvidia

移除 TRTLLMSampler、SampleState、SamplerType 及相关配置,将 TorchSampler 设为唯一常规采样后端并更新 AutoDeploy/executor 构造路径。这简化了采样与投机解码的度量处理,消除双采样后端的同步与验证负担,降低维护复杂度。

推测解码 控制流优化服务与推理
vLLM #51171 MERGED

[ROCm][MLA] Reach FULL cudagraphs for AITER MLA speculative decoding

本日合并至 main · 08-30 10:49 UTC+8 · @yudigege86

修正 TritonMLAMetadataBuilder 对 DSpark draft 组 token 模式的报告,使 MLA 推测解码中的 forward mqa 组满足 UNIFORM BATCH 条件。这消除了单个注意力组将整引擎降级出 FULL cudagraphs 的问题,使 ROCm 上的 AITER MLA 推测解码能启用完整 CUDA 图。

推测解码 硬件适配
vLLM #54326 MERGED

[CI] Mark L4 GPU test steps with device: l4 for EKS migration

本日合并至 main · 08-30 19:40 UTC+8 · @khluu

在 .buildkite 测试区域中为全部 39 个单节点 L4 GPU 测试步骤添加 device: l4 路由元数据。该改动对现有 CI 为无操作,为后续按环境门控将测试路由到 EKS 集群的迁移提供所需标记。

算子与内核 控制流优化硬件适配分布式训练
SGLang #37087 MERGED

[Config] Round 5.2: the per-model declarations get their own modules

本日合并至 main · 08-30 17:24 UTC+8 · @ch-wan

将 overrides.py 中 27 个 handler 和约 992 行代码按模型家族机械拆分为独立模块。这解除了各模型家族配置在同一文件中的耦合,新增模型时不再需要修改所有家族共用的文件,提升配置可维护性。

算子与内核 控制流优化硬件适配性能优化
SGLang #37092 MERGED

[AMD] Update v4 amd cookbook 0830

本日合并至 main · 08-30 14:55 UTC+8 · @1am9trash

更新 AMD v4 cookbook,启用 TORCH_BLAS_PREFER_HIPBLASLT 环境变量,将 tp8 下的 chunk size 从 8192 调至 16384 并升级镜像版本至 0829。这些调整旨在改善 AMD 平台上的 BLAS 后端选择与张量并行分块配置。

算子与内核 硬件适配性能优化服务与推理
SGLang #33048 MERGED

[Bugfix] Hold references to fire-and-forget tasks in disaggregation

本日合并至 main · 08-30 14:26 UTC+8 · @noron12234

在 srt/disaggregation 模块中保存五个 asyncio.create_task() 创建任务的强引用,避免仅依赖事件循环弱引用。防止 fire-and-forget 任务在完成前被垃圾回收而消失,提升 disaggregation 异步执行的可靠性。

算子与内核 控制流优化硬件适配服务与推理
vLLM #54048 MERGED

[Bugfix][MoE] Enable cuBLAS out_dtype router GEMM on all CUDA archs (fixes family-120/GB10)

本日合并至 main · 08-30 10:18 UTC+8 · @hclsys

将 cuBLAS out_dtype router GEMM 的可用性门控从仅限 Hopper/SM100 的 specialized_router_gemm 中拆出,允许所有 CUDA 架构使用融合路径。修复 family-120/GB10 上 bf16→fp32 router GEMM 回退到独立拷贝核并舍入 router logits 的问题,恢复精度与融合性能。

算子与内核 硬件适配分布式训练服务与推理
SGLang #36515 MERGED

[AMD] fix: do not emit a shared-expert marker twice on the per-rank slot path

本日合并至 main · 08-30 09:09 UTC+8 · @karverma-amd

修复 per-rank fused shared-slot 路径上 gate 与 fused append 同时发射 shared-expert marker 的问题,仅保留 fused append 一侧。消除重复 marker 导致的 top-k 路由专家丢失和 expert id 越界,保证 AMD 分布式专家路由的正确性。

算子与内核 硬件适配性能优化分布式训练
SGLang #37018 MERGED

[Kernel] Fix SM90 FP8 decode regression with benchmarked M/K/N routing

本日合并至 main · 08-30 07:59 UTC+8 · @RunFMe

将 SM90 FP8 GEMM 的 Torch/NVJet 路由限制到经基准测试的大 prefill 形状包络内,避免仅凭 K/N 将 decode GEMM 路由到 torch.scaled_mm。修复 H100 上 W8A8 decode 因选择错误 kernel 而导致的吞吐下降,恢复小 M decode 场景的 AOT 内核性能。

算子与内核 性能优化服务与推理
vLLM #53877 MERGED

[Bugfix][Kernel] Keep packed GDN decode beta in FP32

本日合并至 main · 08-30 22:15 UTC+8 · @CherryLemon

在 packed GDN decode kernel 中移除将 FP32 sigmoid(b) 结果舍入到输入 dtype 再转回 FP32 的操作,直接保持 beta 为 FP32。避免 BF16 输入下每个循环状态更新被扰动并随长上下文累积误差,改善 Qwen3.5 至 Qwen3.8 系列长解码准确度。

算子与内核 服务与推理
SGLang #37049 MERGED

[Diffusion] Make component execution options fail closed

本日合并至 main · 08-30 21:06 UTC+8 · @mickqian

将扩散模型组件执行选项改为 fail-closed 契约,要求显式配置必须被实际运行路径支持,否则在回退或使用前直接失败,覆盖并行布局、注意力 override、offload 和 PipelineConfig。这防止了组件配置被静默忽略或错误回退,增强配置安全性和可诊断性。

算子与内核 硬件适配
SGLang #34484 MERGED

[ROCm] Fix QuickReduce fp16 saturation corrupting bf16 all-reduces (106M non-finite -> 0, +0.3%)

本日合并至 main · 08-30 13:08 UTC+8 · @alexnails

为 QuickReduce 启用 FP16 溢出饱和模式,并在 CodecFP 中增加 FP32 缩放-窄化-输出的幂次范围守卫,防止 BF16 转 FP16 时产生 inf。这修复了 BF16 all-reduce 中高幅值数据被量化为非有限值并传播的问题,提升 ROCm 集合通信的数值稳定性。

算子与内核 硬件适配
SGLang #37073 MERGED

Use Flashinfer 0.6.18 release for CUDA 13.4 package

本日合并至 main · 08-30 12:06 UTC+8 · @trevor-m

将 CUDA 13.4 包的 Flashinfer 依赖从已删除的 rc10 wheel 切换到正式 0.6.18 版本,并引入主 Dockerfile 的 dynamo 安装配置。修复因预发布 wheel 被移除导致的构建失败,确保 CUDA 13.4 包可正常构建。

算子与内核 硬件适配
SGLang #35760 MERGED

[Perf] Tune the W4AFP8 DeepEP low-latency requant launch geometry

本日合并至 main · 08-30 07:03 UTC+8 · @alexnails

调整 W4AFP8 DeepEP low-latency 重量化内核的 launch 几何(如 warp 数、tile 宽度)以恢复 8 字节向量化访存并优化 scale 寻址。降低 per-token 到 per-tensor FP8 转换的纯流式内存开销,提升 W4A8 GEMM 前处理吞吐。

算子与内核 性能优化
Triton #11477 MERGED

[BACKEND] Add per-kernel NVPTX register-pressure scheduling

本日合并至 main · 08-30 03:37 UTC+8 · @ThomasRaoux

为 NVIDIA 后端新增可选的每内核 sched4reg 寄存器压力调度设置,将调度策略通过线程局部状态传递到 LLVM 汇编生成。允许按内核精细控制寄存器压力调度,并确保并发编译任务互不影响。

算子与内核 控制流优化
SGLang #36998 MERGED

Bump sgl-deep-gemm to v0.1.6

本日合并至 main · 08-30 10:51 UTC+8 · @Fridge003

将 sgl-deep-gemm 版本升级至 v0.1.6,并基于 DeepGemm 官方 main 分支进行 rebase。跟进上游 DeepGemm 最新代码,获取后续修复与优化。

算子与内核

行业动态 11 条

Introducing Hy4 Preview

Simon Willison · 08-30 07:53 UTC+8

腾讯发布开源权重文本大模型「Hy4」预览版,总参数770B、激活49B、支持1M上下文,模型体积达1.56TB;相比7月发布的「Hy3」,参数规模、上下文长度都大幅提升。这对关注大规模开源基座、长上下文能力的从业者是一个重要发布。

基座腾讯开源权重大模型发布Hy4

b10697

llama.cpp · 08-30 22:26 UTC+8

「llama.cpp」新增针对「M3 Ultra」的「fa-vec」调优提交,优化 Apple Silicon 上的相关算子性能。这对使用 Mac 进行本地大模型推理的用户有直接加速意义。

推理优化llama.cppApple Silicon性能优化M3 Ultra

b10696

llama.cpp · 08-30 22:01 UTC+8

「llama.cpp」为「M3 Pro」添加「fa-vec」调优,关联问题编号为27668,进一步改善 Apple Silicon 上的推理性能。该改动延续了对不同 M 系列芯片做针对性算子优化的方向。

推理优化llama.cppApple Silicon性能优化M3 Pro

b10693

llama.cpp · 08-30 20:45 UTC+8

「llama.cpp」的「Hexagon」后端新增设备发现和按需创建会话能力,支持运行时发现可用「NPU」核心、延迟会话分配与清理,并在初始化阶段提前拒绝不存在的设备。这提升了在高通「Hexagon NPU」上运行的灵活性和稳定性。

Infrallama.cppHexagonNPU设备发现

b10692

llama.cpp · 08-30 20:23 UTC+8

「llama.cpp」的「SYCL」后端在「TOP_K」操作中改为拆分长行,取代原先每行一个工作组的实现,以改善并行效率和性能。这对使用 Intel GPU 等 SYCL 设备的推理用户可以带来吞吐提升。

推理优化llama.cppSYCLTOP_K性能优化

viable/strict/1788065415

PyTorch · 08-30 08:48 UTC+8

「PyTorch」新增参数连续的全收集通信接口「symm_mem.all_gather_offset」,支持参数连续场景下的「all-gather」操作。这对分布式训练中的通信优化和参数布局有实际价值。

InfraPyTorch分布式训练all-gather通信优化

b10698

llama.cpp · 08-30 22:49 UTC+8

「llama.cpp」修复了「Apple RDMA」在拆解阶段产生大量错误输出刷屏的问题,使使用远程内存直接访问的集群推理在退出时更干净。对依赖「RPC」和「RDMA」的多机部署场景是稳定性改进。

Infrallama.cppRPCApple RDMABug修复

b10694

llama.cpp · 08-30 21:08 UTC+8

「llama.cpp」修复了旧版 macOS 在「pre-RDMA」路径上的兼容性问题,避免在不支持相关特性的系统上出错。这提高了跨 macOS 版本部署的健壮性。

Infrallama.cppRPCmacOS兼容Bug修复

AI agents have no sense of time and are not aware of it

The Decoder · 08-30 18:41 UTC+8

一项新研究发现「Claude Code」和「Codex」等 AI 编码助手没有时间感,会系统性高估任务所需时长,其中「Codex」的估计误差可达实际时长的十倍,同时自我评分也偏高约20个百分点;这对长程自主任务的监督和排期构成实际风险。

AgentAI编码助手时间感知任务估计监督问题

Anthropic's Claude Code limit change is a raise on paper but a cut in practice

The Decoder · 08-30 17:05 UTC+8

「Anthropic」实际上将「Claude Code」的每周用量限额削减了约17%:临时50%的提升将于9月14日到期,由永久25%的提升取代;官方承诺在用量控制和透明度上有所补偿。这对重度依赖该工具的开发者影响较大。

厂商动态AnthropicClaude Code用量限额政策变化

viable/strict/1788067484: [CUDA] Add non-overlapping fast path for avg_pool2d backward (#191086)

PyTorch · 08-30 09:20 UTC+8

「PyTorch」为「avg_pool2d」反向添加了非重叠快速路径的「CUDA」核函数,当池化窗口精确平铺输入,如步长等于核大小且无填充时,每个输入元素只对应唯一输出窗口,可将原本的逐窗口扫描简化为单次加载和除法,从而显著加速常见下采样场景的反向计算。

InfraPyTorchCUDA池化反向性能优化

论文 20 篇

今日暂无当天新论文。周末或节假日 arxiv 不公告、HuggingFace 每日精选也不更新。以下为近期精选 20 篇

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

HF 精选 · 08-28 08:00 UTC+8

针对「GRPO」在推理训练中容易覆盖不足的问题,该工作分析了进化策略在推理覆盖上的表现,发现通过稀疏的函数式更新和种群多样性可以缓解策略坍缩,扩大推理多样性并提升「Pass@K」;相比「GRPO」覆盖更广,并支持混合训练路线。

后训练进化策略推理训练GRPOPass@K

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

HF 精选 · 08-28 08:00 UTC+8

针对空间世界模型在强化学习后训练阶段缺乏可执行验证和长程轨迹数据的问题,该工作提出用游戏引擎充当可验证轨迹数据引擎,为智能体在游戏环境中执行并提供长时程交互轨迹,从而支撑世界模型后训练;这种思路也推动了以人类工程验证为中心的世界模型扩展范式。

后训练世界模型游戏引擎强化学习后训练轨迹数据

TTPO: Test-Time Policy Optimization

HF 精选 · 08-28 08:00 UTC+8

针对数学推理在测试时通常缺乏标签、难以继续优化的问题,「TTPO」通过非对称蒸馏一致的多条采样轨迹并惩罚不一致轨迹,实现无标签的测试时策略优化;实验表明其效果可以匹配监督训练的性能,为推理阶段自我提升提供了低标注成本路径。

后训练测试时训练策略优化数学推理无标签学习

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

HF 精选 · 08-28 08:00 UTC+8

针对流匹配模型在多目标对齐中往往依赖任务特定教师模型的问题,「Self-OPD」去除教师依赖,利用自探索得到的随机分支和归一化优势来直接优化速度场,实现多目标对齐;该方案避免了为每个任务额外训练教师,同时保持了策略在线更新的稳定性。

后训练流匹配在线策略蒸馏无教师学习多目标对齐

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

HF 精选 · 08-28 08:00 UTC+8

针对智能体数据生成中盲目扩大规模而忽略质量的问题,该工作提出「ACE」视角,将数据生成视为在分解后的经验元组上做约束分布设计,强调执行落地准确性、相对于学习者复杂度的适配性以及多样性,而不是单纯堆数据量;这为构建更有效的智能体训练语料提供了原则。

训练智能体数据数据生成执行准确性分布设计

GameWAM: A World Action Model for Video Games

HF 精选 · 08-28 08:00 UTC+8

针对视频游戏原生控制中视觉预测和动作生成通常分离、缺乏统一建模的问题,「GameWAM」提出统一的世界动作模型,采用块因果流匹配同时预测未来画面和可执行的键盘鼠标动作,并引入模态特定分布和块循环重规划机制,以适应长程游戏决策。

基座世界动作模型视频游戏控制流匹配块因果建模

PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

HF 精选 · 08-28 08:00 UTC+8

针对长程智能体在运行中难以持续自我改进的问题,「PILOT」允许监督者实时介入并引导活跃工作器,同时把执行经验蒸馏成可复用技能,使智能体在任务执行过程中就能提升准确率和效率;这种人在回路的在线学习机制适合需要长期自主运行的场景。

Agent长程智能体在线自改进人在回路技能蒸馏

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

HF 精选 · 08-28 08:00 UTC+8

针对智能体经验容易丢失、难以跨任务复用的问题,「WikiSkill」让可复用智能体技能与持久知识库协同演化,把执行中积累的经验系统化沉淀为可查询知识,从而在不同模型上也能复用并持续提升表现。

Agent智能体技能知识库经验积累跨模型迁移

CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

HF 精选 · 08-28 08:00 UTC+8

针对推理时提升大模型能力通常伴随高生成和 token 成本的问题,「CritICL」利用较弱小模型的结构化失败模式作为批评式引导,在推理阶段实现从弱到强的泛化,同时降低生成量和 token 消耗;这为低成本推理增强提供了新思路。

推理优化推理时改进弱到强泛化失败模式批评引导

FrontierChallenge: Evaluating Scientific Workflow Completion

HF 精选 · 08-27 08:00 UTC+8

针对现有评测往往只覆盖孤立能力、忽视完整科学工作流的问题,「FrontierChallenge」跨多个领域评估端到端科学工作流完成情况,结果显示前沿模型虽然部分得分较高且经常声称完成,但实际端到端完成率只有约20%,暴露出长程科学任务上的显著差距。

Agent评测基准科学工作流前沿模型端到端完成率

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

HF 精选 · 08-27 08:00 UTC+8

针对固定「harness」难以适配不同大模型和任务的问题,「JIT-Agent」提出一个可训练模型,能够即时为现成大语言模型合成自适应「harness」,从而提升跨模型和跨任务的表现;这相当于把「harness」智能本身也变成了可学习对象。

Agent智能体框架即时演化harness模型适配

Agent-G^2: Gaussian Guidance for Agentic Reinforcement Learning

HF 精选 · 08-27 08:00 UTC+8

针对长程任务强化学习中估计提示深度往往需要额外探测、增加交互成本的问题,「Agent-G²」把提示深度建模为一个从已有轨迹在线估计的高斯分布,利用该先验引导策略学习,无需额外探测即可改善长程任务上的强化学习效果。

后训练强化学习长程任务高斯引导提示深度

D^3-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation

HF 精选 · 08-27 08:00 UTC+8

针对多教师蒸馏中静态域采样容易导致收敛缓慢和资源浪费的问题,「D³-MOPD」通过监测每个域的反向「KL」轨迹动态调整域采样比例,使训练更聚焦于难以对齐的域,从而提高收敛效率,并大幅缩小学生模型与教师模型之间的性能差距。

后训练多教师蒸馏动态调度反向KL收敛效率

Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data

HF 精选 · 08-27 08:00 UTC+8

针对在无思维链数据场景下「next-chunk」推理强化学习是否真的优于监督微调的问题,该工作重新审视训练策略,发现混合监督微调在组合推理语料上训练,相比「next-chunk」强化学习在效率和最终准确率上都更优,覆盖数学和域外任务;这提示应谨慎选择推理训练范式。

后训练推理训练监督微调强化学习无思维链数据

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

HF 精选 · 08-27 08:00 UTC+8

针对视觉语言模型答案可能脱离图像、缺乏视觉忠实度的问题,「V-Rubrics」提出基于评分量规的强化学习方法,从视觉忠实性、推理一致性和指令遵循三个维度给答案打分,并使用结构化部分得分进行优化,从而提升模型的视觉接地能力。

后训练视觉语言模型强化学习评分量规视觉忠实度

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

HF 精选 · 08-27 08:00 UTC+8

针对现有编码评测很少覆盖长程、全仓库级别的软件栈迁移问题,该工作引入「SWE Refactor Bench」基准,评估编码智能体自主完成软件迁移的能力;结果表明当前模型很少能正确完成整个迁移过程,揭示了长时程代码改造的短板。

Agent编码智能体评测基准软件迁移长程任务

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

HF 精选 · 08-28 08:00 UTC+8

针对世界模型概率对齐缺乏形式化定义和统一评测的问题,该工作形式化了概率对齐概念,并推出「PAWBench」和「PAWEval」,将视频生成器视为随机采样器来评估其是否匹配参考行为分布;结果显示当前模型普遍无法匹配目标分布,距离可靠世界建模仍有差距。

基座世界模型概率对齐评测基准视频生成

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

HF 精选 · 08-28 08:00 UTC+8

针对多模态语言模型智能体在真实尺度城市环境中的空间代理能力问题,「UrbanGround」在逼真的3D城市复刻中评测持续导航和空间推理,发现模型虽然具备局部感知能力,但无法组合成面向目标的长期行为;这为空间智能体的评测和训练提供了新视角。

Agent多模态智能体空间推理导航评测城市环境

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

HF 精选 · 08-28 08:00 UTC+8

针对紧凑模型难以适应不断变化的数字人「harness」配置的问题,该技术报告提出「Harness-Aware Training」,让模型在训练阶段就感知并适应多种「harness」配置,在保持低延迟的同时获得高准确率,适合数字人实时交互场景。

Agent智能体训练数字人harness演化紧凑模型

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

HF 精选 · 08-28 08:00 UTC+8

针对机器人操作需要快速泛化到未见任务的问题,「Zero-WAM」将因果视频动作模型条件化于上下文人类视频指导,无需针对新任务微调即可执行操作,并配合自动生成的数据集和未来块预测目标进行训练,实现开放任务泛化。

基座世界动作模型机器人操作上下文学习视频指导