每日 AI 速览

2026-09-07

生成于 2026-09-08 04:14
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日看点集中在智能体与训练方法:『Dr. Claw』打造 AI 科学家工作台,『τ^τ-Bench』引入端到端真实 Agent 构造评测,博弈式多智能体反思与办公 Agent 报告也同步升温;训练侧『RISE』自外推策略蒸馏、Group Adaptive Clipping 推进策略优化。AI Infra 侧层稀疏训练推理、TPU 智能体核生成以及 vLLM 对 Tenstorrent 的适配值得关注。厂商端『GPT-6』Sol 内测提速、千问办公多人工作台与智象具身世界模型释放信号。

AI Infra 动态 20 条

主流训推框架主分支 PR,按前沿价值与性能影响降序。
vLLM #53906 MERGED

[Model] add GLM-5.3-Flash support

本日更新,目标 main · 09-07 20:47 UTC+8 · @ZJY0516

在 vLLM 中新增对 GLM-5.3-Flash 模型的 day0 支持。使该新模型能够直接在 vLLM 推理栈上运行,便于后续部署与性能优化。

推测解码 控制流优化硬件适配性能优化
vLLM #53586 MERGED

[Bugfix] DSv4 MXFP4 selector: stop narrowing explicit aliases to their BF16 variant

本日合并至 main · 09-07 15:19 UTC+8 · @lucifer1004

修复 DSv4 MXFP4 selector,不再将显式别名收窄到 BF16 变体,而是回退到 W4A8(MXFP4 权重 + MXFP8 激活)等支持变体。避免 SM100+/SM120 上 FlashInfer CUTLASS BF16 变体因 SM90 限制导致的死路,提升 DeepSeek-V4 类 MoE 模型在新硬件上的后端兼容性。

推测解码 算子与内核性能优化分布式训练
llama.cpp #28208 MERGED

convert : write explicit recurrent_layers for Qwen3-Next / Qwen3.5

本日合并至 master · 09-07 15:12 UTC+8 · @devvexus

转换器现在为 Qwen3-Next / Qwen3.5 写出显式的 recurrent_layers 数组,而不是仅写全注意力间隔。防止非均匀层配置被错误重建为循环层,避免全注意力层丢失 KV cache,保障模型推理正确性。

推测解码 性能优化分布式训练服务与推理
SGLang #37601 MERGED

[AMD] support qlen>1 for aiter gluon path for Kimi K3

本日合并至 main · 09-07 10:25 UTC+8 · @billishyahao

为 AMD 平台的 Kimi K3 在 aiter gluon 路径上扩展 qlen 支持,并在不满足条件时回退到 mla asm ps。提升 AMD GPU 上 Kimi K3 的算子覆盖与执行效率,增强长上下文推理能力。

推测解码 算子与内核控制流优化硬件适配
SGLang #38238 MERGED

chore: update CI test est_time values

本日合并至 main · 09-07 08:49 UTC+8 · @sglang-bot

从 CI stats model.json 刷新测试 est_time 字面量,更新约 203 项。保持 LPT 负载均衡算法对测试分片的准确性,减少并行 CI job 的时间波动。

推测解码 硬件适配性能优化服务与推理
llama.cpp #26254 MERGED

mtmd: support Qwen3-TTS (note: breaking change to llama-tts binary)

本日更新,目标 master · 09-07 13:49 UTC+8 · @ngxson

在 mtmd 中新增 Qwen3-TTS 支持,加入 --tts-lang、--tts-speaker-file 等参数,并调整 llama-tts 二进制接口。使 llama.cpp 具备 Qwen3-TTS 语音合成能力,扩展多模态与语音本地推理场景。

推测解码 性能优化服务与推理
vLLM #55272 MERGED

[Qwen3.8-Flash-Next] Remove torch.compile for NVIDIA implementation

本日合并至 main · 09-07 12:57 UTC+8 · @gau-nernst

移除 Qwen3.8-Flash-Next NVIDIA 实现中的 torch.compile 装饰器及自定义 op 注册。避免 torch.compile 对 embedding op 自动调优造成额外约 50GB 激活峰值,使 FP8 checkpoint 可在单块 GB300 上加载,并降低显存压力。

推测解码 算子与内核性能优化
SGLang #35629 MERGED

[NPU] Adapt DFlash2 speculative decoding to Ascend NPUs

本日合并至 main · 09-07 09:08 UTC+8 · @syd520zy

将 DFlash2 推测解码的 draft 与 verification 路径适配到 Ascend NPU,修复目标验证元数据处理。使 DFlash2 检查点可在昇腾 NPU 上服务,同时保持现有 CUDA 行为不变,扩展硬件支持。

推测解码 算子与内核硬件适配
vLLM #55369 MERGED

[Bugfix][Spec Decode] Resolve n_predict from text_config for Qwen3.5 multimodal MTP

本日合并至 main · 09-07 21:28 UTC+8 · @somuai

在 SpeculativeConfig.hf 配置覆盖中新增从 text_config 解析 mtp_num_hidden_layers 的回退逻辑。修复 Qwen3.5/3.6 多模态 MTP 检查点 n_predict 未解析的问题,恢复后续 divisibility checks,保障推测解码正确性。

推测解码 服务与推理
TensorRT-LLM #18554 MERGED

[https://nvbugs/6676406][fix] Fix DSV4 disagg MTP accuracy

本日合并至 main · 09-07 00:11 UTC+8 · @mikeiovine

修复 DSV4 分离式 MTP 中 gen worker 低估已分配 token 数导致 scratch_blocks 为 0 的问题,并纠正 block ids 裁剪逻辑。避免在 beam 搜索等路径中因块列表过长导致的错误,保障 MTP 推理的准确性。

推测解码
vLLM #55124 MERGED

[Docs] Clarify admission control limits apply server-wide, not per DP rank

本日合并至 main · 09-07 22:08 UTC+8 · @NickLucche

更新文档,明确 max_num_queued_reqs 和 max_num_queued_tokens 是服务级限制,而非每个 DP rank 的限制。帮助运维正确设置队列上限,避免因复用 max_num_seqs 值而提前拒绝请求。

算子与内核 控制流优化性能优化服务与推理
SGLang #37373 MERGED

[NPU] Add NPU arch35 support and enhance DSV4 processing in DeepSeek-V4

本日合并至 main · 09-07 21:08 UTC+8 · @AndyLi429

为昇腾 Atlas A5/Arch35 添加 DeepSeek-V4 的量化、稀疏注意力、FP8 KV cache 及 MXFP4 MoE 等执行路径。使 DeepSeek-V4 能在昇腾 A5 硬件上高效推理,扩展 NPU 硬件适配范围。

算子与内核 硬件适配性能优化服务与推理
FlashInfer #4955 MERGED

feat(sm120): add NVFP4 sparse MLA support for DeepSeek V4 Flash

本日合并至 main · 09-07 19:35 UTC+8 · @tiffany940107

在 SM120/SM121 上为 DeepSeek V4 Flash attention 添加原生 NVFP4 稀疏 MLA 支持,并新增 384 字节 token 的 paged NVFP4 cache ABI。降低 KV cache 内存占用,并在 Blackwell 上提供新的量化路径以提升性能。

算子与内核 控制流优化硬件适配性能优化
SGLang #37926 MERGED

[Perf] Unified memory: close the DCP decode gap on Blackwell

本日合并至 main · 09-07 16:10 UTC+8 · @ch-wan

将统一内存路径上的 write-loc translate 从 eager op chain 改为优化实现,减少 decode 上下文并行下的 CPU 侧 launch 开销。缩小 Blackwell 上统一内存与静态池的 decode 性能差距,提升动态内存管理场景的推理效率。

算子与内核 硬件适配性能优化服务与推理
SGLang #37691 MERGED

[AMD] Support aiter fa mha chunked kv for Kimi-K3

本日合并至 main · 09-07 15:31 UTC+8 · @billishyahao

为 AMD 平台 Kimi-K3 添加 aiter fa mha chunked kv 支持,以修复 HIP OOM 崩溃。避免长上下文推理时 AMD GPU 显存不足,支撑 1M 上下文基准测试。

算子与内核 硬件适配性能优化服务与推理
SGLang #38279 MERGED

[Sampling] Allow sampling-mask replay with DisallowedTokensLogitsProcessor

本日合并至 main · 09-07 14:56 UTC+8 · @ByronHsu

在 sampling-mask replay 中引入显式 allowlist,允许 DisallowedTokensLogitsProcessor 参与重放。防止 Qwen3.5 等模型在 RL 训练中采样到未映射 token ID,保证训练数据有效性与策略稳定性。

算子与内核 控制流优化硬件适配性能优化
SGLang #38278 MERGED

Tiny Update CI Permission

本日合并至 main · 09-07 13:17 UTC+8 · @Fridge003

对 SGLang 的 CI 权限配置做出小幅更新。优化 CI 流水线的权限管理,便于授权用户触发与合并流程。

算子与内核 硬件适配性能优化服务与推理

行业动态 31 条

b10840

llama.cpp · 09-07 22:33 UTC+8

llama.cpp 对 CUDA 后端 Q4_K 和 Q5_K 量化格式做了无分支解包优化,避免 mmvq 中每个列重复解包 scale,提升批处理大于 1 时的性能。同时为 DGX Spark 增加 L2 预取,并对 MUSA 和 HIP 等平台做了保护。这对本地量化推理用户意味着低比特矩阵向量乘更快,批处理场景改善尤为明显。

推理优化llama.cpp量化推理CUDA性能优化

Qwen-Drive 1.0 tells you why it brakes, just don't expect the explanation to match the maneuver

The Decoder · 09-07 20:15 UTC+8

阿里研究团队发布 Qwen-Drive 1.0,在单一系统里集成环境感知、交通问答和路线规划。研究者强调文本图像模型不会天然具备三维空间理解,必须专门训练空间感知能力,目标是让同一个模型同时驱动座舱与驾驶系统。对自动驾驶与多模态模型从业者来说,这表明空间智能需要显式设计,不能仅靠通用图文预训练迁移。

基座Qwen自动驾驶多模态空间智能

GPT-6不只Astra!Sol内测结果曝光,速度快6倍

量子位 · 09-07 17:04 UTC+8

消息称 OpenAI 研究院人均配置约 3 个 AI 实习生,同时 GPT-6 不仅有 Astra,内部测试中的 Sol 速度据报快 6 倍。该动态反映 OpenAI 正在把 AI 智能体大规模嵌入自身科研流程,并同步推进下一代模型的高效版本。对行业而言,这既展示智能体在组织内部的产出拐点,也提示前沿模型推理效率竞争正在加速。

厂商动态OpenAIGPT-6AI智能体推理速度

菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3

量子位 · 09-07 16:36 UTC+8

菲尔兹奖得主入局大模型研究,其团队用 4B 手机端 Qwen 与云端 GLM 组合在 ARC-AGI 3 上取得突破性成绩。相关观点指出,要在两个模型之间找到数学上的共同基础其实非常困难。这显示了小型端侧模型与云端大模型协同求解抽象推理基准的潜力,也把数学家的理论视角引入到 AGI 评测中。

基座ARC-AGIQwenGLM端云协同

Serving LLMs on Tenstorrent Hardware: Inside the vLLM TT Plugin

vLLM 博客 · 09-07 08:00 UTC+8

Tenstorrent 加速器以 out-of-tree 平台插件形式加入 vLLM,其实现围绕 mesh 架构做出多项选择:分阶段调度、Galaxy 上的单进程数据并行、设备端采样加主机回退,以及异步解码重叠。这对 vLLM 生态意味着更多非英伟达硬件可以共享同一套高效 serving 栈,也给差异化 AI 芯片接入提供了一种可参考的插件化路径。

推理优化vLLMTenstorrent推理框架AI芯片

阿里前销售总监在美失踪逾半月后确认身亡;5天10万元!外国高管涌入中国“工厂游”;传DeepSeek计划采购16万颗昇腾芯片|AI周报

InfoQ 中文 · 09-07 22:05 UTC+8

该周报汇集多条动态,其中与 AI 产业直接相关的是传闻 DeepSeek 计划采购 16 万颗昇腾芯片,显示国产算力在大模型训练中的地位持续上升。同时外国高管涌入中国工厂游也折射出全球对供应链与制造能力的关注。对关注算力自主和芯片替代的人有参考价值。

厂商动态DeepSeek华为昇腾国产芯片AI算力

OpenAI reports AI "research interns" and warns about its own pace at the same time

The Decoder · 09-07 21:05 UTC+8

OpenAI 称其内部的 AI 智能体已能完成相当于每名人类工作日 3.1 个工作日的产出,并宣称达到自动化研究实习生的目标。同时首席科学家 Pachocki 警告,目前没有任何实验室能足够好地掌握对齐与监控,因此不应以最高速度继续扩展。这种一边展示智能体生产效率、一边呼吁放缓节奏的表态,反映了大模型前沿研发中能力与安全治理的紧张关系。

厂商动态OpenAIAI智能体对齐研发自动化

viable/strict/1788784700

PyTorch · 09-07 16:52 UTC+8

PyTorch 侧提交为 Inductor 的 FlyDSL 新增 gfx950 Grouped GEMM 以及 F.grouped_mm 相关支持。这有助于在特定 AMD 图形或计算架构上加速分组矩阵乘法,并进一步把 FlyDSL 编译路径与高层 API 对齐。对 AI 编译器用户而言,是算子覆盖和硬件适配上的增量改进。

InfraPyTorchInductorFlyDSLGEMM

trunk/123739aa495079403f3891233abbba374afee3a7

PyTorch · 09-07 16:52 UTC+8

PyTorch 主干提交为 Inductor 的 FlyDSL 添加 gfx950 Grouped GEMM 与 F.grouped_mm 接口支持,扩展了面向 gfx950 架构的分组矩阵乘编译能力。该改动与另一个 viable/strict 分支提交内容一致,属于同一算子能力在主干上的合并。对使用 AMD gfx950 硬件做编译优化的开发者有实际意义。

InfraPyTorchInductorFlyDSLGEMM

b10835

llama.cpp · 09-07 16:11 UTC+8

llama.cpp 的 ggml-cuda 修复了 f16 flash attention 中的分歧 barrier 问题,并避免重复设置元数据指针。这类低层 CUDA 修复直接关系到自注意力 kernel 在部分硬件上的稳定性,能减少长上下文或特定 batch 下偶发的死锁和错误结果。对依赖本地推理和轻量栈的用户是可靠性改进。

推理优化llama.cppCUDAflash attention推理稳定

原生全模态技术战略闭环,智象(HiDream.ai)发布具身世界模型HiDream-O1-Embodied

量子位 · 09-07 14:03 UTC+8

智象(HiDream.ai)发布具身世界模型 HiDream-O1-Embodied,声称形成原生全模态技术战略闭环。虽然原文未给出细节,这一发布显示该公司正在把全模态生成能力延伸到具身智能与世界模型方向。对关注多模态基座和具身智能融合的从业者,这是国内玩家在该方向的一次产品化信号。

基座HiDream世界模型具身智能多模态

Hugging Face太重要,绝不能落入英伟达手中?黄仁勋:我本想让它独立,但有其他竞购者

InfoQ 中文 · 09-07 22:07 UTC+8

黄仁勋谈及 Hugging Face 收购相关话题,表示自己本希望它保持独立,但同时存在其他竞购者,并强调其重要性。这凸显了 Hugging Face 作为模型与数据集分发基础设施在 AI 生态中的战略位置。对从业者而言,平台归属可能影响模型发布、权重分发和社区协作的中立性。

厂商动态Hugging Face英伟达开源生态AI平台

viable/strict/1788794812

PyTorch · 09-07 19:20 UTC+8

PyTorch 合并一个 AI Codemod 改动,跳过未使用的 old_storage_nbytes 查询,避免在相关路径上进行不必要的存储字节数计算。这有助于减少动态图或 AOT 编译过程中的开销。

InfraPyTorchAI Codemod性能优化存储查询

b10839

llama.cpp · 09-07 19:16 UTC+8

llama.cpp Vulkan 后端此前在张量 backing-buffer 偏移加 view_offs 未按最小存储缓冲对齐时,GET_ROWS shader 会触发断言并导致硬崩溃,影响 Qwen3-TTS、Qwen3-VL 等模型。现在 supports_op() 在不对齐场景返回 false,让调度器自动回退到 CPU,避免崩溃。

推理优化llama.cppVulkanGET_ROWSQwen3-VL推理稳定性

viable/strict/1788791284

PyTorch · 09-07 18:21 UTC+8

PyTorch 对 test_opaque_obj_v2.py 进行重构,并在 XPU 上启用相关测试。该改动把测试覆盖扩展到非 CUDA 加速器,有助于保证跨设备行为一致性。

InfraPyTorch测试重构XPU

b10837

llama.cpp · 09-07 16:37 UTC+8

llama.cpp 合并 PR #28511,在模板检查字符串时重新检查 caps 的 typed content。该修复解决某些模板渲染场景下 typed content 判断不一致的问题,提升模板处理正确性。

推理优化llama.cppcaps模板引擎修复

b10834

llama.cpp · 09-07 15:20 UTC+8

llama.cpp 的 ggml 后端允许输入不额外创建 split,减少多后端混合执行时不必要的图切分和调度开销。这对使用 CPU、Vulkan、ROCm 等多后端组合的推理场景有实际收益。

推理优化llama.cppggml后端调度性能优化

b10833

llama.cpp · 09-07 14:51 UTC+8

llama.cpp Vulkan 后端新增 RMS_NORM 融合机会,支持 RMS_NORM 后接 MUL 加 ADD 或 VIEW 加 SET_ROWS 等模式,并把 ROPE 融合扩展到 IMROPE。作者在 gemma4 上观察到约 4% 的性能提升,降低了小算子分派开销。

推理优化llama.cppVulkan算子融合RMS_NORMROPE

b10831

llama.cpp · 09-07 13:21 UTC+8

llama.cpp Vulkan 后端新增 TQ1_0 量化类型支持,覆盖 mm、mat-vec、mat-vec-id、dequant 和 get_rows 等路径。实现上把 TQ1_0 中 3 的幂常数打包进一个 32 位常量,以避免常量数组占用寄存器;在 gfx1151 上相关后端测试全部通过。

推理优化llama.cppVulkanTQ1_0量化GPU 推理

viable/strict/1788773762: [MPS] Add naive triangular_solve for complex numbers (#195861)

PyTorch · 09-07 13:15 UTC+8

PyTorch MPS 后端的 MPSMatrixSolveTriangular 仅支持浮点,因此新增自定义 Metal kernel 处理 complex64 三角求解。该实现引入 conjugate 标志,使复数 cholesky_solve 使用伴随转置 A^H,并修复非连续 out 处理问题,同时校验输入与输出都在 MPS 上。

InfraPyTorchMPS复数运算三角求解Metal kernel

业内首个!“千问办公”推出“多人工作台”

量子位 · 09-07 13:04 UTC+8

阿里巴巴旗下 Agent 产品「千问办公」推出业内首个「多人工作台」,支持多用户在同一办公 Agent 环境中协同工作。这对办公 Agent 从单人辅助走向团队协作场景具有重要意义。

千问办公阿里巴巴Agent多人协同办公 Agent

viable/strict/1788771294: [dynamo] Preserve is_inference in after-AOT repros (#193565)

PyTorch · 09-07 13:04 UTC+8

PyTorch Dynamo 在生成 after-AOT 重现代码时,之前会丢失 is_inference 参数,导致推理编译失败的图在重放时以默认 is_inference=False 重新编译,行为改变且难以复现。该修复将 is_inference 贯穿图转储、序列化、重放、最小化、隔离和分析路径,提升调试保真度。

InfraPyTorchDynamoAOT 重放调试推理编译

viable/strict/1788758887: [dynamo] Fix FP64 softmax repro arguments (#194595)

PyTorch · 09-07 09:57 UTC+8

PyTorch Dynamo 修复 FP64 softmax 重放参数问题,在 softmax 和 log-softmax 输入提升为 FP64 后禁用 half_to_float,避免重放时类型转换行为不一致。新增回归测试覆盖默认与 out 重载及位置与关键字参数。

InfraPyTorchDynamoFP64softmax调试

Claude proves Fermat 🧮, automated AI researcher 🔬, Z1 efficiency chip ⚡

TLDR AI · 09-07 08:00 UTC+8

本期 TLDR AI 主题聚焦 Claude 在费马相关命题上的证明能力、自动化 AI 研究员以及 Z1 效率芯片。这三个方向分别对应模型数学推理、自主科研与推理硬件能效,对关注这些前沿领域的从业者有参考价值。

厂商动态TLDR AIClaude自动化研究员Z1 芯片

Research acceleration: The view inside OpenAI

Simon Willison · 09-07 07:57 UTC+8

Simon Willison 报道 OpenAI 内部将今天称为 RSI 日,即递归自我改进,并提及首席科学家 Jakub Pachocki 的文章「An Alien Mind」。报道还披露 OpenAI 研究团队使用编程 Agent 的细节,显示 2026 年 agentic 工程在 OpenAI 内部显著加速。

厂商动态OpenAI递归自我改进Agent编码智能体AI 研究

b10830

llama.cpp · 09-07 07:30 UTC+8

llama.cpp 在 HF 到 GGUF 转换脚本中新增 --fuse-qkv 标志,可在转换阶段将 Q、K、V 权重融合为 QKV 张量。这有助于减少后续推理中的张量切分和调度开销,尤其利于注意力计算优化。

Infrallama.cppGGUF模型转换QKV 融合推理优化

微软将人工智能治理从政策层面转向运行时执行

InfoQ 中文 · 09-07 20:35 UTC+8

InfoQ 中文报道微软将 AI 治理从政策层面转向运行时执行,意味着治理策略被嵌入到模型推理和运行环节。这对关注合规与模型安全落地的从业者具有参考意义。

厂商动态微软AI 治理运行时执行合规

论文 20 篇

今日论文看点:『RISE』递归自外推策略蒸馏、『Don't Drop Dropout』层稀疏优化、『τ^τ-Bench』真实 Agent 构造评测与博弈式多智能体反思方法各具新意。

Iris: Climbing to the Search Frontier

HF 精选 · 09-07 08:00 UTC+8

该工作针对搜索智能体在复杂网络基准上落后于闭源方案的问题,提出多阶段训练管线:先监督微调,再对真实搜索引擎进行强化学习,并用严格轨迹过滤和推理时上下文管理来稳定训练与部署。两个大规模搜索智能体由此在复杂网页基准上取得当前开源最好成绩,表明把真实检索反馈纳入强化学习并治理上下文质量,是提升搜索智能体上限的有效路径。

Agent搜索智能体强化学习监督微调开源模型

RISE: Recursive Improvement via Self-Extrapolating Policy Distillation

HF 精选 · 09-07 08:00 UTC+8

针对后训练中高质量稠密监督难以获取且依赖外部教师模型的问题,RISE 从模型自身的强化学习轨迹里通过自外推递归生成 token 级稠密监督。这种自蒸馏式闭环摆脱了外部教师,并让语言模型后训练可以持续自我改进。对希望避开昂贵教师标注并提升强化学习数据利用率的从业者,它提供了一种可递归迭代的训练方案。

后训练策略蒸馏强化学习自改进

MaxKernel: Agentic Kernel Generation for TPUs

GoogleHF 精选 · 09-07 08:00 UTC+8

TPU 算子开发高度依赖专家经验、自动化程度不足,MaxKernel 用多智能体系统把内核生成转成协作式、自主式和基于图的搜索三类范式。该系统在多个基准上达到专家级表现,说明多智能体协作与图式搜索空间建模能有效降低专用加速器算子开发门槛。对 AI Infra 团队而言,这意味着 TPU 内核优化可部分从手工调优转向智能体自动挖掘。

Infra多智能体TPU算子生成AI Infra

Group Adaptive Clipping Policy Optimization

EMNLP 2026CCF-B推荐HF 精选 · 09-07 08:00 UTC+8

在可验证奖励的强化学习中,低成功率样本常因重要性采样裁剪过强而丢失梯度信号,拖累策略探索。GAPO 根据 rollout 的优势值自适应调整裁剪阈值,让低成功率群体保留更强的更新信号。该方法不引入额外奖励模型,而是修正策略优化的梯度估计方式,对 RLVR 场景下提升尾部任务成功率有直接意义。

后训练RLVR策略优化重要性采样强化学习

Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems

HF 精选 · 09-07 08:00 UTC+8

针对多智能体 LLM 系统中协调机制常缺乏理论保证、评估易失真的问题,该研究用双层博弈与随机记忆反射来形式化建模智能体协调。作者提出带收敛保证的 SRMA 算法和一种有依据的评估门控,并在 SWE-bench 上验证。其价值在于把多智能体协作从经验启发推向有博弈收敛性质的框架,并让评估更贴近真实协调能力。

Agent多智能体博弈论SWE-bench强化学习

Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference

ICML 2026CCF-A推荐HF 精选 · 09-07 08:00 UTC+8

该工作反对完全抛弃 dropout,主张用层级稀疏性同时优化大模型训练和推理效率。具体做法是利用层丢弃提升训练效率,并在推理端配合早退和投机解码来加速,而不损害精度。其关键贡献在于把通常只用于正则化的 dropout 重新定位成一种贯穿训练和推理的稀疏优化手段,对低成本部署有实际参考价值。

推理优化训练效率推理加速早退投机解码

When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference

HF 精选 · 09-07 08:00 UTC+8

低精度量化下的循环网络推理会出现状态写回规则抑制小更新,进而破坏记忆的问题。作者发现用误差反馈和残差记忆机制可以在不重新训练的情况下恢复精度,并在 GRU 与 LSTM 架构上都得到验证。这项研究为量化循环模型的时间序列推理提供了无需重训的修复路径,对边缘端低比特部署很有价值。

量化循环神经网络推理优化误差反馈

Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs

EMNLP 2026CCF-B推荐HF 精选 · 09-07 08:00 UTC+8

针对思维链只在行为层面被评估、内部推理操作缺乏可解释性的问题,该研究发现语言模型中不同推理操作在隐藏表示上具备几何可分性。这些结构会跨层涌现,并且依赖当前推理上下文。它把 CoT 从黑盒输出推进到可定位、可区分的机制解释层面,为后续编辑或诊断推理错误提供了表示级抓手。

基座可解释性思维链机制解释隐藏表示

Dr. Claw: An AI Scientist Workspace for Vibe Research

EMNLP 2026CCF-B推荐HF 精选 · 09-07 08:00 UTC+8

现有命令行编码智能体虽能读写文件和维持长会话,但完整研究流程仍被拆散在聊天、IDE、终端和写作工具之间,关键决策难以审计。Dr. Claw 没有再造一个自主智能体,而是把已有编码智能体执行器包进一个开源工作区,提供可控、可审计的人类在环流程,并持久保存状态。这对希望把 AI 科研流程从随意探索变成可复现、可追踪范式的团队尤其重要。

AgentAI科学家工作流智能体工具人类在环

τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction

HF 精选 · 09-07 08:00 UTC+8

该基准把评估重点从会写代码转向能否端到端构建真实客服智能体:编码智能体需要基于业务记录、客户需求和生产 API 组装出可工作的系统。结果显示当前智能体与专家表现之间仍存在明显差距。它为智能体构建能力提供了更贴近实际交付的评价环境,能暴露从代码生成到系统集成的全链路短板。

Agent智能体评测基准测试客服智能体代码生成

When Models Edit Too Much: On the Fidelity of Minimal Code Edits

EMNLP 2026CCF-B推荐HF 精选 · 09-07 08:00 UTC+8

大模型在修复代码时往往过度编辑,改动了本不该动的部分,增加维护负担和潜在回归风险。该工作表明,通过保留指令和强化学习可以在不牺牲正确率的前提下提高编辑保真度,让改动更接近最小必要修改。这对自动代码修复工具落地很关键,因为更小、更克制的 diff 才更容易被开发者审查和接受。

后训练代码修复强化学习代码编辑开发工具

ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding

HF 精选 · 09-07 08:00 UTC+8

面向流式视频理解中全模型逐帧处理带来的高延迟问题,ShallowStream 提出先利用多模态大模型浅层构建轻量流式索引,再按需调用深层进行回答。这样把索引构建和深度推理解耦,在保持视频检索精度的同时显著降低在线延迟。对实时视频问答和监控场景,该设计提供了一种不牺牲准确率的加速思路。

多模态流式视频视频检索推理优化

Knowing What Not to Answer: Selective Non-Compliance in Vision-Language Models

EMNLP 2026CCF-B推荐HF 精选 · 09-07 08:00 UTC+8

视觉语言模型在混合查询中常常要么过度拒绝、要么该拒的不拒,选择性不遵从能力缺乏系统评估。KoNA 专门评测 VLM 在面对混合请求时的选择性拒绝表现,并通过定向微调提升其对合法请求的遵从度。该工作把安全拒绝问题从纯文本扩展到多模态,并强调模型需要学会区分哪些视觉上下文下应当不回答。

后训练视觉语言模型安全对齐选择性拒绝多模态

Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models

EMNLP 2026CCF-B推荐HF 精选 · 09-07 08:00 UTC+8

安全微调后的模型常见误拒绝,把询问原因的安全问题也当成攻击。作者把安全响应结构分解为拒绝声明与理由说明两部分,发现仅用理由部分进行训练即可在保持安全性的同时降低误拒绝率。这为安全对齐提供了更细粒度的数据构造视角,让模型学会解释边界而不是机械地拒绝。

后训练安全对齐误拒绝指令微调可解释性

Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue

HF 精选 · 09-07 08:00 UTC+8

语音对话与全身动作通常被分开建模,导致口型、节奏和姿态难以对齐。Motion-Omni 提出端到端框架,从共享隐藏状态同时生成口语对话和全身协同动作,并借助可扩展伪标签与统一评测协议实现实时对齐响应。它把多模态生成从独立流水线推进到联合建模,对数字人和具身交互系统有直接应用价值。

基座多模态生成语音合成动作生成数字人

The Attention Triangle in Audio-Video Models

HF 精选 · 09-07 08:00 UTC+8

音视频扩散模型中,音频和视频模态之间存在跨模态注意力带来的双向语义泄漏,导致生成内容互相污染。该研究提出可通过注意力派生信号来诊断这种泄漏,并在推理阶段施加对齐干预来缓解,无需重新训练。这为多模态生成中的模态一致性问题提供了可解释的诊断与轻量修正途径。

基座多模态生成扩散模型注意力机制音视频对齐

Enoki: Efficient Multi-Level Hallucination Detection

HF 精选 · 09-07 08:00 UTC+8

幻觉检测通常把整句验证和细粒度定位分成两套模型,重复计算且资源开销大。Enoki 采用开放信息抽取框架,通过共享关系事实把断言级验证和片段级幻觉定位统一起来。这样在降低资源消耗的同时提升了检测准确率,并为大模型输出提供可追溯的证据级判断。

幻觉检测信息抽取事实核查效率优化

Ask Before You Optimize: Dynamic Pre-Formulation Clarification for Interactive Optimization

HF 精选 · 09-07 08:00 UTC+8

在交互式优化建模中,智能体常常在需求尚未明确时就匆忙写模型,导致后续返工。该工作提出 OR-Clarify 基准来评估建模前澄清能力,并设计 InterOPT 指导智能体依据缺失的公式关键信息决定提问或停止。它把优化建模的瓶颈从求解阶段前移到需求澄清,有助于提高自动建模任务的成功率和效率。

Agent智能体优化建模基准测试交互式系统

Training-Free Speech-Centric Omni Understanding with Frozen VLMs

HF 精选 · 09-07 08:00 UTC+8

让现有视觉语言模型获得以语音为中心的视听理解能力通常需要重训或改架构,成本高昂。TFO 通过模块化转录文本路由,在冻结 VLM 的前提下实现语音中心的音视频理解,无需任何再训练。这为快速扩展多模态模型能力提供了一种即插即用方案,尤其适合已有大规模 VLM 的团队。

基座多模态视觉语言模型语音理解免训练

HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals

HF 精选 · 09-07 08:00 UTC+8

HarvestBench 用农场模拟评测 LLM 智能体在无成本伤害动物与支付燃料费用避开动物之间如何选择,考察其道德偏好是否受价格和任务说明影响。结果显示不同模型的杀害率对价格和简报条件高度敏感,说明智能体的价值权衡并不稳定。该基准从具身决策角度为 AI 价值观对齐提供了新的测量工具。

Agent智能体评测价值观对齐伦理决策基准测试