每日 AI 速览

2026-08-31

生成于 2026-09-01 05:10
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日最受关注的是 GPT-6 灰测 demo 刷屏、周四发布在即,同时 OpenAI 与 Cursor 关系生变并可能全面断供,模型竞合与生态博弈成为主线。AI Infra 侧,英伟达以 35 亿美元下注联发科应对大厂自研芯片,中国 CXMT 推出首款 HBM3E,Triton 3.8 发布,国产算力合作升温。Agent 方向,OpenAI 等采购数万台 Mac mini 训练计算机使用智能体,但 Meta 数据显示智能体仍难替代员工,落地更趋务实。

AI Infra 动态 20 条

主流训推框架主分支 PR,按前沿价值与性能影响降序。
SGLang #35588 MERGED

[Bugfix] Fix full prefill CUDA graph padding and EAGLE capture

本日合并至 main · 08-31 12:30 UTC+8 · @aurickq

修复全量 prefill CUDA graph 在固定 token bucket 下未注册并填充 num_token_non_padded 的问题,并在 FullCG 下为 EAGLE target prefill 捕获完整 hidden states。避免 padded 行在捕获图中传播而破坏掩码模型,同时防止 EAGLE target prefill 回退到 eager 执行,保障推测解码在 CUDA graph 路径的正确性与性能。

推测解码 控制流优化硬件适配服务与推理
TensorRT-LLM #16214 MERGED

[None][feat] Support custom masks in TRTLLM attention

本日合并至 main · 08-31 10:24 UTC+8 · @yuxianq

为 PyTorch TRTLLM attention 后端新增自定义掩码支持,添加 Triton custom-mask context FMHA 并与后续 causal-generation provider 配对,同时保持 TRTLLM-gen 内核处理因果生成。使混合非 MLA 批次及 Gemma4 H512 上下文预处理能在 FP8 等优化路径下使用自定义注意力掩码,扩展推理服务对模型和输入模式的硬件适配。

推测解码 算子与内核硬件适配性能优化
SGLang #33614 MERGED

[Spec] Fix Dspark and Dflash state divergence across TP rank

本日更新,目标 main · 08-31 07:23 UTC+8 · @JackZeng0208

修复 Dspark/Dflash 在张量并行多 rank 下因默认跳过采样 token 跨 rank 同步而导致的状态分歧,并升级 NCCL 至 2.30.7。保证各 rank 的草稿 token、接受长度和 KV 状态一致,避免后续集合通信死锁,提升推测解码在分布式推理中的稳定性。

推测解码 硬件适配性能优化分布式训练
vLLM #54418 MERGED

[Bugfix][Spec Decode] Keep default CUDA graph sizes memory-safe

本日合并至 main · 08-31 02:02 UTC+8 · @khluu

将 speculative decode 产生的 uniform-decode CUDA graph 捕获尺寸限制在平台既有默认上限内,修复此前引入的默认图内存膨胀。避免 H200 等平台上默认配置触发 CUDA graph OOM 或耗尽 KV cache,保障推测解码默认设置下的内存安全与可用性。

推测解码 控制流优化硬件适配性能优化
SGLang #31041 MERGED

[Spec] Add LFM2 and LFM2-MoE DSpark speculative decoding support

本日合并至 main · 08-31 11:04 UTC+8 · @tugot17

为 LFM2 与 LFM2-MoE 混合模型新增 DSpark 推测解码支持,并在 fused RMSNorm+RoPE 内核中添加 interleaved RoPE 旋转路径。扩展 DSpark 到 ShortConv+attention 混合架构的 dense/MoE 目标,提升此类模型的自回归解码吞吐与硬件算子适配。

推测解码 算子与内核分布式训练
SGLang #35281 MERGED

[PD] Align defensive protocol behavior across Mooncake, NIXL, and Mori

本日合并至 main · 08-31 10:57 UTC+8 · @jambow0320

在不改动 Common 状态机、线格式和 Transport 架构的前提下,对齐 Mooncake、NIXL、Mori 后端的防御性协议行为,补齐缺失超时并修复本地竞态或布局问题。减少 PD 分离部署中不同传输后端之间的行为差异和潜在死锁或竞态,提升预填/解码分离服务的可靠性。

推测解码 硬件适配服务与推理
SGLang #33722 MERGED

[KDA] Fused-accept state advance for FlashInfer KDA MTP verify

本日合并至 main · 08-31 16:11 UTC+8 · @yuan-luo

将 FlashInfer KDA MTP 验证路径的接受后状态推进融合,避免按请求逐层将完整 recurrent state 从 scratch 散射回持久池。消除 bs=1 MTP inter-phase 缝隙中的冗余状态写回与内核启动,降低推测解码时延并提高小 batch 下的执行效率。

推测解码 算子与内核
SGLang #36897 MERGED

Decouple speculative draft capacity from runtime state

本日合并至 main · 08-31 14:31 UTC+8 · @merrymercy

新增算法级 hook 来解析最大草稿 token 容量,并将启动时容量快照到 runtime config,使其与运行时活跃宽度解耦。使自适应和插件式推测解码算法能声明并预留大于初始宽度的 KV 容量,避免动态调整草稿宽度时容量冲突或越界。

推测解码
vLLM #49445 MERGED

[Core] Add `max_num_queued_reqs` and `max_num_queued_tokens` for queue size management

本日合并至 main · 08-31 22:26 UTC+8 · @NickLucche

在 vLLM 核心引擎中新增 max_num_queued_reqs 与 max_num_queued_tokens 两个排队规模准入控制参数,使引擎能在 IPC 链早期拒绝请求。提供引擎内队列上限机制,避免无界排队导致 TTFT 恶化,并让上游负载均衡器能快速感知实例过载进行重试。

算子与内核 控制流优化性能优化服务与推理
FlashInfer #4664 MERGED

fix(attention): make PrimTS paged block-sparse metadata live

本日合并至 main · 08-31 21:32 UTC+8 · @heyuhhh

将 paged PrimTS block-sparse attention 中的元数据从 plan 时静态保存改为在 run 时读取实时 page indptr、page IDs、KV 长度、BSR 路由及有效性位,仅 plan 保留静态几何与容量。使可复用 wrapper 能正确适配动态请求对应的分页 KV 和块稀疏路由,避免使用过期元数据导致越界,提升服务与推理中的正确性。

算子与内核 控制流优化硬件适配服务与推理
llama.cpp #27621 MERGED

CUDA: extend MOE fusion to specdec, earlier MOE glu fusion and topk-router fusion were restricted to 1 token

本日合并至 master · 08-31 19:22 UTC+8 · @ynankani

将 CUDA 后端原本限制为单 token 的 MoE GLU 融合与 topk-router 融合扩展到 speculative decoding 的 2–8 个 token 批次。使 MTP/Dflash 等多 token 推测解码能复用更重的 MoE 算子融合,降低门控投影与路由开销,从而在支持的量化与草稿宽度下获得端到端解码加速。

算子与内核 硬件适配分布式训练服务与推理
vLLM #54040 MERGED

[Kernel] Retire the DSv3 router GEMM CUDA kernel

本日合并至 main · 08-31 15:15 UTC+8 · @jeejeelee

移除 vLLM 中 DeepSeek-V3 风格路由器 GEMM 的 CUDA 专用内核。简化相关 MoE 路由计算的代码路径与维护负担,可能依赖更通用实现或已合并算子替代该专用内核。

算子与内核 硬件适配性能优化服务与推理
SGLang #34613 MERGED

feat(unified-memory): read unified pool from attention backends fa3/flashinfer/trtllm_mha/flashmla

本日合并至 main · 08-31 14:58 UTC+8 · @caihuali95

将统一内存池的读取路径从 Triton-only 迁移到 FA3、FlashInfer、TRTLLM MHA 与 FlashMLA 等多个 attention 后端,使这些后端无需自带 id-space 逻辑。扩大统一内存池在服务端的后端支持范围,简化各注意力后端的地址空间处理并提升异构部署灵活性。

算子与内核 硬件适配性能优化服务与推理
DeepSpeed #8241 MERGED

[AutoTP] Replace tp_shard process-wide globals with per-model AutoTPMeta

本日合并至 master · 08-31 11:48 UTC+8 · @delock

将 AutoTP 中原先进程级全局的 KV 头数、注意力头数、嵌入维度与 TP grain size 状态重构为每个模型独立持有的 AutoTPMeta 对象,并在线程化分片路径中传递。避免同一进程加载多个 AutoTP 模型时全局状态互相覆盖,保障多模型分片与 checkpoint 转换的正确性。

算子与内核 硬件适配分布式训练服务与推理
SGLang #27551 MERGED

[dLLM] Make FDFO a framework capability for all dLLM algorithms

本日更新,目标 main · 08-31 11:29 UTC+8 · @Hayden727

将原本专属于某一算法的 FDFO 调度提升为框架级执行模式,使任意携带跨步状态的扩散 LLM 算法均可启用。允许先完成解码的请求立即退出批次而不必等待慢请求,减少同步批处理中的队头阻塞并提升扩散 LLM 推理吞吐与 GPU 利用率。

算子与内核 控制流优化性能优化分布式训练
SGLang #35244 MERGED

[Fix] Transformers-fallback (GPT-NeoX) + KV pool config (DeepSeek-VL2)

本日合并至 main · 08-31 11:05 UTC+8 · @pavansivaram

修复 Transformers fallback 层的 gpt_neox 与 embed_out 键映射、GPT-NeoX backbone/lm_head 加载路径,以及 DeepSeek-VL2 的 KV pool 配置三处单行问题。提升 Pythia/NeoX 等无原生 SGLang 实现的模型通过 Transformers fallback 运行的准确性,并修正多模态模型 KV 缓存配置。

算子与内核 硬件适配性能优化分布式训练
FlashInfer #4535 MERGED

feat(cake_kda): add native unbounded-softplus Kimi-Linear kernels

本日合并至 main · 08-31 10:07 UTC+8 · @yyihuang

为 Kimi-Linear 的 unbounded-softplus 门控新增原生 FlashInfer cake_kda 内核,并在 SM100a/SM103a 上按 local H4/H8/H16/H32 头数路由到专用冻结内核。直接消费打包 Q/K/V 及独立 strided gate/beta 视图,支持非连续状态池与 checkpoint 对齐的 prefill recurrence,提升 Kimi-Linear 类模型在 Blackwell 上的推理适配与执行效率。

算子与内核 硬件适配性能优化分布式训练
FlashInfer #4695 MERGED

feat(attention): add variant_owns_mask for JIT variants that own the full mask

本日合并至 main · 08-31 10:06 UTC+8 · @lesj0610

新增 variant_owns_mask 能力,使自定义 JIT attention variant 可在 REGISTER LOGITS MASK 钩子内从紧凑侧信息直接生成完整注意力掩码,而无需向 plan() 传入具体 mask tensor。避免为仅需按查询范围生成的掩码显式物化 custom mask 或 packed mask 张量,降低内存占用并提升 FA2 prefill 中自定义掩码路径的灵活性。

算子与内核 硬件适配性能优化服务与推理
SGLang #37141 MERGED

[Diffusion] Fuse FLUX.2 token concatenation and NVFP4 quantization

本日合并至 main · 08-31 21:33 UTC+8 · @BBuf

将 FLUX.2 单流输出中 attention 与 swiglu 两个 BF16 分支的拼接及 FlashInfer NVFP4 量化融合为一个 SM103 JIT 内核,直接输出 E2M1 值与 E4M3 scale 给 FP4 out GEMM。消除每块全宽度 BF16 物化和独立量化读取,在支持的形状与设备上降低扩散模型内存带宽与计算开销。

算子与内核 硬件适配性能优化
SGLang #37159 MERGED

[Kernel] Add GB300 Triton MoE configs for GLM-4.5 FP8

本日合并至 main · 08-31 21:31 UTC+8 · @BBuf

为 GLM-4.5-FP8 在 GB300 上的 per-channel FP8 Triton MoE 新增针对 E=161、N=192、topk=9 的 Triton 3.7.1 稀疏配置映射,替代通用启发式。为特定 TP8 几何与 FP8 量化提供调优后的 GEMM 配置,提升该模型在 GB300 上的 MoE 算子效率与分布式推理性能。

算子与内核 性能优化分布式训练

行业动态 36 条

China's CXMT makes its first HBM3E chips, closing the AI memory gap

The Decoder · 08-31 23:17 UTC+8

长鑫存储首次小批量生产 HBM3E,这一高速内存用于当前许多人工智能处理器,意味着中国在 AI 内存供应上缩小差距,对缓解国内算力硬件对外依赖有重要意义。

InfraHBM长鑫存储AI 硬件国产芯片

「GPT-6」灰测demo刷屏!周四发布在即

量子位 · 08-31 12:47 UTC+8

OpenAI 的 GPT-6 灰测演示刷屏,发布时间预计在周四;若属实,新一代模型的能力和发布节奏将对行业产生重大影响。

基座OpenAIGPT-6大模型发布灰测

v1.3.0rc25

TensorRT-LLM · 08-31 11:31 UTC+8

TensorRT-LLM 发布 v1.3.0rc25,为 DeepSeek V3、V4、Kimi K2.5、K3、MiniMax M2、M3、GLM-5、GPT-OSS、Qwen3-Next、Qwen3.5、Qwen3.8、Mistral Large 3、Gemma 3 和 Gemma 4 等模型默认启用 KV Cache Manager V2。新架构提升可扩展性和稳定性,对部署这些大模型做推理的后端团队是重要更新。

推理优化TensorRT-LLMKV Cache推理引擎版本发布

b10720

llama.cpp · 08-31 23:30 UTC+8

llama.cpp 的 ROCm 后端为长行实现了 radix TOP_K 内核,可加速 AMD GPU 上长序列推理中常用的 token 选择操作。这对 llama.cpp 在 ROCm 平台的性能优化是具体改进。

推理优化llama.cppROCmTOP_K推理性能

b10718

llama.cpp · 08-31 22:24 UTC+8

llama.cpp 将 MoE 融合扩展到投机解码,之前 MoE GLU 融合和 topk-router 融合仅支持单 token,现在支持多 token 情况,并加入 SWIGLU_CLAMP 分支。这能提升 MoE 模型在投机解码中的 CUDA 推理效率。

推理优化llama.cppCUDAMoE投机解码

b10715

llama.cpp · 08-31 18:13 UTC+8

llama.cpp 把 DFlash 编码器融进 KV 缓存注入的 decode 阶段,原来是单独的 encode 操作,会造成一次设备到主机往返和额外的图构建。融合后目标特征直接进入 llama_decode,减少开销,对使用 DFlash 的推理流程有性能改进。

llama.cppKV 缓存DFlash推理优化

Triton 3.8.0 Release Notes

Triton · 08-31 08:12 UTC+8

Triton 发布 3.8.0,新增 aggregate 类型为公开 API,包括继承字段、默认值、生成构造函数和不可变实例,并覆盖方言前端、后端编译器等多方面改进。对依赖 Triton 写自定义 kernel 的团队是一个功能更完整的版本。

InfraTriton编译器内核开发版本发布

OpenAI Cursor split 💔, self-improving AI 🧠, GPT-6 Astra 🚀

TLDR AI · 08-31 08:00 UTC+8

本期通讯聚焦 OpenAI 与 Cursor 的合作裂痕、自改进 AI 以及传闻中的 GPT-6 Astra 三个话题。虽然正文未提供细节,但这些线索反映出 AI 工具竞争和模型自改进方向的持续升温。

基座OpenAICursor自改进 AIGPT-6

viable/strict/1788204145

PyTorch · 08-31 23:15 UTC+8

PyTorch 的一个 CI 版本修复了半结构化 bitmask 转换中硬编码 cuda 设备的问题,使设备类型处理更灵活。这属于框架底层修复,对稀疏权重和半结构化稀疏训练推理有稳定性价值。

InfraPyTorch稀疏CUDAbug 修复

b10719

llama.cpp · 08-31 23:06 UTC+8

llama.cpp 为 Apple Silicon M1 添加了 fa-vec 调优,可在 Metal 后端上改善相关 kernel 性能。这对在 Mac 上运行本地模型的用户是一个针对性优化。

llama.cppMetalApple Silicon推理优化

viable/strict/1788202219: [AOTInductor] Fix user-managed constant handle leak (#194480) (#194480)

PyTorch · 08-31 22:59 UTC+8

PyTorch AOTInductor 修复了用户管理常量句柄泄漏问题,改用 RAIIAtenTensorHandle 管理 ConstantMap 条目,避免张量包装和底层存储引用泄漏。该修复在保持零拷贝和调用方所有权的同时,消除了长期运行中的内存泄漏隐患,对使用 AOTInductor 部署模型的团队很重要。

PyTorchAOTInductor内存泄漏推理优化

自研Runtime、Agent Loop、Infra:一家通用Agent公司的全栈赌注

InfoQ 中文 · 08-31 22:47 UTC+8

报道一家通用 Agent 公司选择自研 Runtime、Agent Loop 和底层 Infra,进行全栈投入,以构建可控性和性能更强的智能体系统。这反映出 Agent 竞争正从模型能力转向系统工程与基础设施层面,对从业者理解技术壁垒有信号意义。

AgentRuntimeInfra全栈

Kubeflow扩展了AI功能,项目临近CNCF毕业

InfoQ 中文 · 08-31 21:31 UTC+8

Kubeflow 新增了 AI 相关功能,并且项目已临近 CNCF 毕业,表明其稳定性和社区采用度达到成熟阶段。对 MLOps 和 AI Infra 从业者来说,这意味着 Kubeflow 将成为更可靠的企业级机器学习平台选择。

InfraKubeflowMLOpsCNCFAI Infra

b10717

llama.cpp · 08-31 19:21 UTC+8

llama.cpp 增强 SYCL 后端,通过 Level Zero 和 SYCL API 获取 Intel GPU 的空闲内存信息,并更新了相关文档。这改善了在 Intel GPU 上运行 llama.cpp 时的显存监控能力,便于资源管理。

推理优化llama.cppSYCLIntel GPU显存管理

viable/strict/1788187801

PyTorch · 08-31 18:50 UTC+8

PyTorch 修复了 MPS 后端中 pad 操作对秩大于 4 且内部元素数超过 2^16 的张量造成数据损坏的问题。该修复提升了 MPS 设备上张量操作的可靠性,对使用 Apple Silicon 进行高阶张量计算的开发者很重要。

InfraPyTorchMPSbug修复张量操作

OpenClaw 2.0 brings simplified setup, a rebuilt browser app, and multiplayer sessions

The Decoder · 08-31 18:46 UTC+8

OpenClaw 基金会发布开源 AI 平台 2.0 版本,累计超过 1.6 万个拉取请求,新增租用机器上的云会话、实时协作和从零重写的浏览器应用,并在安装时自动检测已有的 API 密钥和 AI 订阅。这些改进大幅简化了部署和协作体验,对开源 Agent 平台用户具有吸引力。

AgentOpenClaw开源Agent平台协作

b10714

llama.cpp · 08-31 17:41 UTC+8

llama.cpp 针对 AMD Strix Halo 和 RDNA3 架构调优 Vulkan 后端的矩阵-向量乘法行数,在四列以上场景固定为 4 行,实测比默认值更快。这一优化能提升批量推理性能,对使用 AMD 集成显卡或 APU 运行本地模型的用户有益。

llama.cppVulkanRDNA3推理优化

OpenAI and rival AI labs are buying tens of thousands of Mac minis to train computer-use agents

The Decoder · 08-31 16:55 UTC+8

OpenAI 等 AI 实验室大量采购 Mac mini 和 Mac Studio 用于训练计算机操作智能体,Anthropic 也依赖苹果硬件,导致高端型号数月售罄,苹果 Mac 营收大幅增长。这表明 Apple Silicon 在某些 Agent 训练负载上成为英伟达 GPU 的替代选择,对算力选型有参考意义。

厂商动态OpenAIAnthropicMacAgent训练

OpenAI买几万台Mac搞强化训练!英伟达的活被苹果抢了

量子位 · 08-31 11:24 UTC+8

报道称 OpenAI 购买数万台 Mac 用于强化学习训练,指出在某些 Agent 训练负载中苹果硬件替代了英伟达 GPU 和谷歌 TPU 的角色。这反映出苹果芯片在特定 AI 工作负载中的竞争力,值得算力规划者关注。

后训练OpenAIMac强化学习算力

gfx950-tutorial-v2.1

Triton · 08-31 11:20 UTC+8

Triton 发布 gfx950 教程 v2.1,将教程基准更新到上游主分支,并添加 AMD gfx950 架构下对 LLIR 调度器和 amdgcnas 插件的支持,引入相关编译标志。这为开发者针对 AMD 新架构优化 kernel 提供了更完整的工具链指导。

InfraTritonAMD gfx950编译器教程

Understanding ChatGPT Work

Simon Willison · 08-31 07:59 UTC+8

Simon Willison 解析 OpenAI 的 ChatGPT Work 产品,指出其实际包含云端版和桌面版两个产品,云端版可通过网页或移动端访问,产品迭代快但功能强大且令人困惑。这对从业者理解 ChatGPT Work 的产品形态和定位有帮助。

OpenAIChatGPT Work产品分析Agent

b10721

llama.cpp · 08-31 23:56 UTC+8

llama.cpp 修复了 WebGPU 后端在张量获取时 offset 非 4 字节对齐导致的崩溃问题,提高了 WebGPU 推理的稳定性。对使用浏览器端本地推理的开发者来说,这一修复能避免特定情况下程序退出。

Infrallama.cppWebGPUbug修复推理

viable/strict/1788182929

PyTorch · 08-31 17:30 UTC+8

PyTorch 清理了 autoheuristic fuzzer 中残留的 mixed_mm 代码,移除已废弃的混合矩阵乘法相关逻辑。这有助于简化模糊测试工具,减少维护负担并提升代码清晰度。

InfraPyTorchautoheuristic代码清理模糊测试

viable/strict/1788180922

PyTorch · 08-31 16:56 UTC+8

PyTorch 的 nativert 组件在 JSON 标量类型转换中新增对 UINT64、UINT32 和 FLOAT8E8M0FNU 类型的处理。这增强了原生运行时对多种数据类型的支持,对使用相关序列化功能的开发者有帮助。

InfraPyTorchnativert数据类型JSON转换

论文 20 篇

论文方面,从视觉语言动作模型的表示中心持续预训练、滑动窗口优于线性注意力、低成本 Puro-2B,到工具调用智能体自蒸馏、安全护栏和细粒度强化学习,覆盖多模态基座、推理架构与智能体训练等热点。

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

HF 精选 · 08-31 08:00 UTC+8

VLAct 针对视觉语言动作模型在跨本体机器人数据上持续预训练时容易冲掉原有视觉语言先验、动作语义难以对齐的问题,提出以表征为中心的训练策略,在多源机器人数据上保留视觉语言先验并共享动作语义。这样不必一味堆数据规模,在有限算力下就能在多个仿真环境和未见过的机器人本体上取得较强表现,对机器人基座模型研究者有参考价值。

基座视觉语言动作模型持续预训练机器人基座表征学习

J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data

HF 精选 · 08-31 08:00 UTC+8

J-Zero 解决语言模型在可验证和不可验证任务上自改进时缺乏可靠反馈的问题,让任务生成器、求解器和评判器三者以对抗方式协同进化,仅依赖预定义偏好对而无需人工标注数据。通过挑战者不断生成难题、评判器给出判断,模型可以跨领域自我提升,降低了自训练对真实奖励或外部验证器的依赖。

后训练自改进对抗协同进化任务生成无数据训练

Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

HF 精选 · 08-31 08:00 UTC+8

Puro-2B 给出了一套低成本开源预训练方案,在消费级 RTX 5090 上训练 2B 参数模型,总成本压到 7000 美元以内,性能接近更大规模的基线模型。作者还从实验中归纳出成本扩展定律,并研究了不同数据课程对效果的影响,对算力有限的研究团队复现预训练很有价值。

训练预训练低成本训练数据课程开源模型

Sliding-window beats linear attention

HF 精选 · 08-31 08:00 UTC+8

这项工作比较了滑动窗口注意力和线性注意力在长上下文任务上的表现,发现带 sink 的滑动窗口注意力在不重新训练的情况下,就能超过后训练得到的线性注意力。这意味着推理部署时可以直接用更成熟的滑动窗口方案,既降低成本又更稳定,不必为了长上下文专门训练线性注意力。

长上下文注意力机制推理优化线性注意力

DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents

HF 精选 · 08-31 08:00 UTC+8

DART-SD 把多轮工具调用的执行过程建模为钻石拓扑图,而不是简单线性轨迹,从而更准确定位关键失败点。在此基础上做局部自蒸馏,保留合理的推理片段,只修正错误步骤,避免整体重训导致的能力退化。这种方法对提升工具调用智能体的多轮稳定性和效率很有意义。

Agent工具调用多轮智能体自蒸馏故障定位

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL

HF 精选 · 08-31 08:00 UTC+8

ContextPilot 面向长程智能体推理中上下文窗口拥挤、旧信息丢失的问题,扩展了上下文编辑工具集,让模型学会主动增删和压缩上下文。训练上采用带分支采样的强化学习,识别哪些上下文操作对最终结果最关键,据此前置监督信号。这样能提升长程任务的推理稳定性和成功率。

Agent长程推理上下文管理强化学习智能体

Fast Weight Attention for Continual Learning

HF 精选 · 08-31 08:00 UTC+8

这篇论文从在线学习规则的角度分析了循环快速权重记忆和选择性状态空间模型在自回归语义下的表现,提出一类带稳定重归一化的归一化更新族。该方法在长度外推上取得了改进,有助于模型在持续学习中保持对长序列的稳定记忆。

基座持续学习快速权重状态空间模型长度外推

StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

HF 精选 · 08-31 08:00 UTC+8

StepGuard 针对智能体执行动作前缺少细粒度安全审计的问题,训练一个步骤级守卫模型,在执行前对单步动作进行风险判断。它通过自动生成轨迹构造监督信号,并用平衡安全与效用的强化学习训练,能够在显著降低攻击成功率的同时只损失很少的效用。

后训练安全守卫智能体安全步骤级审计强化学习

Rubric-to-Code Credit Assignment for Reinforcement Learning

HF 精选 · 08-31 08:00 UTC+8

RCCA 解决交互式网页应用生成中整体奖励无法精确归因到具体代码区域的问题,提出基于细则反馈把信用分配到代码片段,作为强化学习的奖励信号。这种局部化信用分配相比仅看整体成功与否有明显的基准提升,对代码生成智能体训练很有价值。

后训练强化学习代码生成信用分配网页应用

Language Chain in Alignment: Cross-lingual Ranking Preference Optimization

HF 精选 · 08-31 08:00 UTC+8

针对多语言对齐中英文偏好知识难以迁移到目标语言的问题,该工作提出跨语言排序偏好优化,通过层级排序目标把英文偏好信号传递到其他语言。该方法能改善多语言模型在非英语语言上的对齐质量,减少逐语言标注成本。

后训练多语言对齐偏好优化跨语言迁移RLHF

Training, learning and inference: unified dynamics of neural systems

HF 精选 · 08-31 08:00 UTC+8

论文将神经系统的训练、学习和推理统一成动态过程,用原子生成事实构建图来支持递归科学过程,并在 nanoGPT 上刻画了训练学习动力学:状态条件参数更新、持续功能重组以及冻结推理投影。该框架在多个架构上得到验证,为理解模型内部动态提供了新视角。

训练训练动力学神经网络统一框架模型分析

Lost in Compression: A Controlled Cross-Lingual Audit of Extractive Prompt Compressors

HF 精选 · 08-31 08:00 UTC+8

这项审计发现,在英文数据上训练的提示压缩器会不成比例地损害非英语上下文,加大不同语言间的 token 成本差距;而多语言训练和确定性压缩方法可以缩小这种偏差。对需要多语言大型语言模型推理部署的团队,这是在选择提示压缩方案时要注意的公平性和成本问题。

推理优化提示压缩多语言成本偏差模型审计

LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering

HF 精选 · 08-31 08:00 UTC+8

LoopArena 评测的是控制器模型在长时间任务中指导另一个编码智能体的能力,结果显示严格成功率普遍很低,但有些配置能大幅降低成本。该基准为设计更实用的双智能体开发流程和运行时代理控制提供了参照。

Agent编码智能体控制器模型基准测试多智能体

Agentic Artifact Creation: Systems, Evaluation, Principles, and Opportunities

HF 精选 · 08-31 08:00 UTC+8

这是一篇综述,把智能体式工件创建定义为人工智能系统通过有状态、反馈驱动的过程构建可交付成果,分析了 259 篇工作,涵盖不同工件类型、环境和评估方式。作者还提出了可问责控制的原则,为理解和设计这类系统提供了框架。

Agent智能体工件生成综述评估原则

LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation

HF 精选 · 08-31 08:00 UTC+8

LayerRecall 针对长视频生成中前后一致性差的问题,设计了一个状态条件记忆路由,有选择地把远距离历史记忆注入视频扩散模型的具体层。通过跨时域预测匹配进行监督,该方法能改善长视频的时间一致性和记忆保持。

基座视频生成长时序一致性扩散模型记忆路由

Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models

HF 精选 · 08-31 08:00 UTC+8

这篇论文指出视觉语言动作模型的行动解码器主要靠行为克隆训练,监督的是演示出的具体运动命令,却没有显式建模指令背后的局部行为意图。作者提出蒸馏行为意图,把未来帧、隐式观测、轨迹或运动表示等未来监督信号融入动作学习。这相比只克隆行为更关注行为背后的目的,有助于提升机器人策略的泛化。

后训练视觉语言动作行为蒸馏机器人学习意图建模

Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents

HF 精选 · 08-31 08:00 UTC+8

EASEL 通过参考引导重构和语义任务来评测多模态智能体的精细视觉工具使用能力,发现现有模型在闭环精度和轨迹稳定性上表现不佳。该基准为需要精确视觉操控的智能体系统提供了更有挑战的评估。

Agent多模态智能体视觉工具使用基准测试精细操作