每日 AI 速览

2026-09-08

生成于 2026-09-09 04:15
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线聚焦多模态与端侧模型、推理优化及 Agent 工程:OpenAI 公开「GPT-Live」语音架构并推出「ChatGPT Images 2.5」,「OpenBMB」发布端侧「MiniCPM5-2B」;「GLM 5.3」在「vLLM」引入混合「HiSparse」卸载,「CUDA Rust」为 GPU 内核开发提供新路径;Agent 侧「OpenClaw 2.0」「AWS Kiro Crew」「TiDB」等落地,且「Anthropic」被曝签下 5170 亿美元算力协议。

AI Infra 动态 20 条

主流训推框架主分支 PR,按前沿价值与性能影响降序。
vLLM #50176 MERGED

[4/N][warmup][DSv4] Migrate common attention kernels

本日合并至 main · 09-08 22:25 UTC+8 · @LopezCastroRoberto

将 DSv4 的注意力准备、缓存、索引器与稀疏注意力内核迁移到统一 warmup 契约,并定义内核自有编译键与 AST 追踪预热空间,新增免 dummy launch 的 compile-only 路径。这使推测解码相关内核的编译与预热更一致、可控,可减少启动开销并提升推理部署性能。

推测解码 算子与内核性能优化服务与推理
vLLM #53945 MERGED

[Bugfix][Spec Decode] Cache the Mamba state at the block-grid position of EAGLE resume

本日合并至 main · 09-08 21:59 UTC+8 · @akshaver

修复 EAGLE 恢复时 Mamba 状态未在当前块网格位置缓存的问题,使 Mamba 状态在 EAGLE 修剪候选后的精确位置可命中,而不是回退到上一块边界。这能提升推测解码与 Mamba 缓存的块级对齐精度,减少前缀缓存失效和额外重算,改善服务性能。

推测解码 控制流优化性能优化服务与推理
SGLang #37465 MERGED

[AMD] gfx950 assembly attention for EAGLE verify, draft extend and decode

本日合并至 main · 09-08 18:10 UTC+8 · @zijiecode

为 MI355X 新增手写 gfx950 汇编注意力内核,统一服务 EAGLE 验证、draft extend 与 decode 三个阶段的分页 FP8 KV 缓存读取。该内核相比 Triton split-K 路径提升缓存读取吞吐,可降低长上下文推测解码的注意力延迟并提升整体 decode 性能。

推测解码 算子与内核硬件适配服务与推理
SGLang #32207 MERGED

【NPU】Support EAGLE when PP enabled in prefill nodes

本日合并至 main · 09-08 15:45 UTC+8 · @cen121212

在 prefill 节点启用流水线并行时增加 EAGLE/MTP 兼容处理,使 prefill 阶段可同时使用 PP 与草稿 KV 生成,避免 decode 侧缺失部分草稿 KV。这能稳定 NPU 上 MTP 的接受率,改善流水线并行下推测解码的推理质量与吞吐。

推测解码 算子与内核硬件适配性能优化
vLLM #53906 MERGED

[Model] add GLM-5.3-Flash support

本日更新,目标 main · 09-08 15:25 UTC+8 · @ZJY0516

为 vLLM 新增 GLM-5.3-Flash 模型支持,提供 Day0 模型接入及相应的 Docker 运行说明。这使推理服务能够加载该模型并开展推测解码等推理工作,扩展可用模型范围。

推测解码 控制流优化硬件适配性能优化
TensorRT-LLM #18829 MERGED

[https://nvbugs/6621358][test] Unwaive tests tracked by NVBug 6621358

本日合并至 main · 09-08 15:20 UTC+8 · @yizhang-nv

从测试豁免列表中移除两个受 NVBug 6621358 跟踪的 DeepSeek-R1 LongBench V2 豁免项,使相关测试重新纳入常规验证。这有助于恢复对推测解码场景的正确性回归覆盖,提升 CI 的工程质量。

推测解码 控制流优化性能优化服务与推理
llama.cpp #28466 MERGED

model : support Kimi-K3 recurrent-state rollback

本日合并至 master · 09-08 11:31 UTC+8 · @soulmachine

为 Kimi-K3 开启推测解码中的有界循环状态回滚,保存每个回滚位置的卷积窗口并复用现有 helper 保存 KDA 状态快照。这使拒绝 draft token 后能正确恢复循环状态,避免多序列回滚损坏并提升推测解码正确性。

推测解码 硬件适配性能优化分布式训练
SGLang #37995 MERGED

docs(cookbook): Qwen3.8-Flash-Next NVFP4 recipes for DGX Spark (1x, 2x) and RTX PRO 6000

本日合并至 main · 09-08 06:33 UTC+8 · @Jiminator

为 Qwen3.8-Flash-Next 增加 DGX Spark 单卡/双卡及 RTX PRO 6000 的 NVFP4 推理配方,覆盖 RadixArk 与 nvidia ModelOpt 混合精度导出的高低吞吐和低延迟档位。这为不同硬件上的量化部署提供可复现命令,便于用户执行推测解码与低精度推理。

推测解码 算子与内核控制流优化硬件适配
TensorRT-LLM #18699 MERGED

[None][test] add Kimi K3 feature matrix coverage

本日更新,目标 main · 09-08 01:36 UTC+8 · @cascade812

扩展 Kimi K3 的 W4A16/MXFP4 特性矩阵测试,覆盖 baseline、混合 KV 缓存复用和自推测解码,并将共享的 forced-token logits 处理与接受长度计算下沉到 accuracy core.py。这能统一测试实现并增强对推测解码、缓存复用等模式的正确性与性能回归监控。

推测解码 控制流优化性能优化服务与推理
SGLang #37119 MERGED

[AMD] CI: fix Lean decode crash on the EAGLE path

本日更新,目标 main · 09-08 13:41 UTC+8 · @mqhc2020

修复 AMD ROCm 上 EAGLE 推测解码捕获路径因 ForwardMetadata 未填充 Lean persistent-grid buffer 导致 locks 为空并崩溃的问题,使 triton backend 传入与普通 decode capture 一致的 CUDA graph lean buffers。这恢复 AMD CI 中 EAGLE 测试执行,保障 ROCm 推测解码路径稳定性。

推测解码 算子与内核服务与推理
SGLang #32495 MERGED

[NPU] Enable non-greedy MTP sampling

本日合并至 main · 09-08 11:18 UTC+8 · @cl-vv-h

为 NPU 的 MTP 验证新增非贪婪采样分支,在 eagle sample 中应用 temperature 缩放与 top-k/top-p 概率重归一化,并支持 EAGLE 树的 target-only 采样和经典拒绝采样。这使非贪婪请求在推测解码中正确生效,避免因采样策略不一致导致精度下降。

推测解码 硬件适配
SGLang #38318 MERGED

[AMD] Fix EAGLE crash when no kv_index_translator is bound on the DSA fp8 read door

本日合并至 main · 09-08 04:03 UTC+8 · @jiaryang

修复 DSA 后端读取 MLA FP8 KV 缓存时无条件使用 kv_index_translator 而该后端未绑定 translator 导致的 EAGLE 崩溃,增加对 None 默认值的处理。这使 DSA/gfx950 上的草稿模型能安全读取 FP8 KV 缓存,避免统一池场景推理中断。

推测解码 性能优化
SGLang #37165 MERGED

[Bugfix][Mamba] Clear deferred init metadata before speculative decode

本日合并至 main · 09-08 03:41 UTC+8 · @aurickq

在 EXTEND 到 DECODE 边界清理 Mamba 的延迟 clear/COW 索引,避免 DRAFT EXTEND V2 批次复制过期元数据并对 draft-pool 状态重放已完成的初始化操作。这修复混合 Mamba 模型在多层 EAGLE/MTP 推测解码中的状态污染,提升推理正确性。

推测解码 服务与推理
TensorRT-LLM #18564 MERGED

[https://nvbugs/6702267][fix] Stage `kv_block_ids_per_seq` unrotated so the block table matches…

本日合并至 main · 09-08 23:56 UTC+8 · @trtllm-agent

将 MTP/Eagle3 draft 循环中的 kv_block_ids_per_seq 改为不旋转的方式暂存,使 FlashMLA 块表与 kv_lens_cuda 的批次顺序一致,消除每步 draft 中 KV 长度与块指针错配。这修复对提议 draft token 的污染并恢复接受长度,提升混合推测解码的准确性与性能。

推测解码
vLLM #52263 MERGED

[ROCm][Quantization] Support AMD Quark per-block FP8 for fused MoE layers

本日合并至 main · 09-08 18:30 UTC+8 · @jimmy-adams

让 AMD Quark 的 W8A8 FP8 fused MoE 层接受 per-block 量化模式,按 128x128 块网格分配权重 scale 并标记 FusedMoeWeightScaleSupported。这使 Quark per-block FP8 MoE checkpoint 能正常加载推理,扩展 ROCm 量化部署能力并改善 MoE 推理效率。

算子与内核 硬件适配性能优化分布式训练
SGLang #38441 MERGED

[Diffusion] Stream mapped weights on a shared host/device pool

本日合并至 main · 09-08 17:52 UTC+8 · @mickqian

在共享主机/设备内存池的集成平台上流式加载映射权重,避免同一权重在主机端重复驻留,复用页缓存页面直接供设备读取,并引入 MADV_WILLNEED 与 MemAvailable 控制。这降低大型扩散模型加载时的内存占用,使 DGX Spark 等统一内存平台可装载超出物理内存的权重并提升资源效率。

算子与内核 控制流优化硬件适配性能优化
SGLang #38095 MERGED

sglang-server remove opaque type

本日合并至 main · 09-08 15:41 UTC+8 · @rainj-me

将 Rust server 中的 opaque type 按 Python MultiModality 类型镜像并以类型化方式重构,移除不透明封装。这改善服务端类型可维护性与接口清晰度,降低多模态请求处理中的解析开销和错误风险。

算子与内核 硬件适配性能优化服务与推理
vLLM #54787 MERGED

[ROCm][Perf][M3] Fused allreduce+GemmaRMSNorm fast path

本日合并至 main · 09-08 15:21 UTC+8 · @benenzhu

在 ROCm 路径中接入 aiter 的 fused allreduce+GemmaRMSNorm 自定义算子,使原本拆成两个 kernel 的 allreduce 与 GemmaRMSNorm 合并为融合执行。这减少每层 kernel 启动开销,提升 MI355X 等多卡推理的通信与归一化性能。

算子与内核 硬件适配性能优化分布式训练
TensorRT-LLM #18437 MERGED

[TRTLLM-15621][feat] Support in-graph sampling for temperature/top-k/top-p batches

本日合并至 main · 09-08 15:13 UTC+8 · @zhaoyangwang-nvidia

为支持 temperature/top-k/top-p 的批次新增可选 in-graph 快速采样路径,引入 FAST/FULL 采样层级及相应的 CUDA graph capture、暂存和运行时解析,同时将不支持的采样特性保留在 eager FULL 路径。这降低采样对 CPU/eager 调度的依赖,提高高吞吐推理和推测解码场景下的采样效率与延迟稳定性。

算子与内核 控制流优化硬件适配性能优化

行业动态 40 条

b10853

llama.cpp · 09-08 12:00 UTC+8

llama.cpp 新增对 Kimi-K3 循环状态回滚的支持,合入 PR #28466。该功能对运行 Kimi-K3 这类递归/混合模型的推理服务在状态管理和会话恢复上有帮助。

推理优化llama.cppKimi-K3循环状态推理引擎

GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading in vLLM

vLLM 博客 · 09-08 08:00 UTC+8

vLLM 集成 HiSparse 作为压力驱动的内存层级,与 Hybrid Memory Allocator 和 KV offloading 协同工作,使 GLM 5.3 请求在 KV 缓存超出 GPU 显存时仍可继续解码,从而维持高并发。这是 GLM 5.3 推理优化系列的第一部分。

vLLMGLM 5.3显存卸载推理优化

llm 0.35

Simon Willison · 09-08 07:54 UTC+8

Simon Willison 的 llm 工具发布 0.35 版本,新增 OpenAI 模型 gpt-6-astra 支持,方便开发者通过命令行访问 GPT-6 Astra。对使用 llm 进行模型调用和实验的用户很有用。

基座llmOpenAIGPT-6 Astra工具

OpenBMB Releases MiniCPM5-2B: A 2.52B Dense Model Averaging 53.9 Across 34 Benchmarks and Built to Run On Device

MarkTechPost · 09-08 03:18 UTC+8

OpenBMB 发布 MiniCPM5-2B,一个 25.17 亿参数稠密模型,原生 131K 上下文;在 34 项基准上平均 53.9,超过 Qwen3.5-4B 的 51.1,且在工具使用、编码智能体和长上下文检索上优势明显。后训练阶段使用 400B 深度思考 SFT、RL 教师和在线策略蒸馏将 16 个专家模型合并为一个 checkpoint,权重以 Apache 2.0 发布。

基座MiniCPMOpenBMB端侧模型知识蒸馏

v4.5.3

ms-swift 魔搭 · 09-08 22:36 UTC+8

ms-swift v4.5.3 新增 Qwen3.8-Flash-Next 支持,这是一款 125B 总参数的多模态 MoE 模型,每 token 约激活 6B,包含可下放到 host 的 51B N-gram embedding 表,原生 262K 上下文,并支持 Megatron 训练。同时提供对应最佳实践,并支持多个新模型。

厂商动态ms-swiftQwenMoE多模态

Introducing ChatGPT Images 2.5

OpenAI · 09-08 19:30 UTC+8

OpenAI 推出 ChatGPT Images 2.5,可将用户的创意、草图和参考照片转化为更个性化、精细的图像,提升生成结果与用户意图的贴合度。该更新对多模态内容创作和图像生成用户有直接价值。

基座OpenAIChatGPT图像生成多模态

v0.29.0rc6

vLLM · 09-08 16:34 UTC+8

vLLM 发布 v0.29.0rc6 候选版本,修复混合模型默认 dense prefix cache 应用问题,改善混合架构模型的前缀缓存行为。

推理优化vLLM混合模型前缀缓存Bugfix

v0.29.0rc5

vLLM · 09-08 16:20 UTC+8

vLLM v0.29.0rc5 将 Mamba 等模型的 prefix_cache_retention_interval 默认值调整为 dense,优化前缀缓存保留策略。这对使用 Mamba 类模型的服务部署有性能影响。

推理优化vLLMMamba前缀缓存

Anthropic reportedly signs $517 billion in compute deals after Dario Amodei warned rivals about reckless risk

The Decoder · 09-08 02:12 UTC+8

据 The Decoder 报道,Anthropic 在 11 个月内签署了高达 5170 亿美元的算力合同,但仍落后于 OpenAI 至 2030 年的 7500 亿美元计划。CEO Dario Amodei 曾在 2026 年初警告不要投资过快,现在 Anthropic 正加速追赶,而 Sam Altman 则对 neo-cloud 算力建设的不可持续行为发出警告。

厂商动态AnthropicOpenAI算力合同战略

b10865

llama.cpp · 09-08 23:14 UTC+8

llama.cpp 回滚了此前在 HIP 构建中恢复 prop.integrated 的 CUDA 更改,修复相关兼容性或稳定性问题。该提交对应 PR #28604。

推理优化llama.cppCUDAHIP回滚

b10864

llama.cpp · 09-08 22:33 UTC+8

llama.cpp 服务端修复 checkpoint min-step 淘汰逻辑,仅当 checkpoint 列表满时才应用间距淘汰,避免短 prompt 下混合/递归模型从先前 checkpoint 重新预填充的问题。该修复改进了服务端 checkpoint 管理和续推理的正确性。

推理优化llama.cpp检查点混合模型推理服务

Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic

HuggingFace 博客 · 09-08 22:23 UTC+8

Hugging Face 博客讨论安全拒绝策略,主张模型应学会拒绝一个主题中的错误子集,而非整个主题。这与边界感知的拒绝训练思路一致,对安全对齐研究有启发。

后训练安全对齐HuggingFace拒绝策略

b10863

llama.cpp · 09-08 22:01 UTC+8

llama.cpp 修复 Metal 后端 mul_mv_iq3_xxs 内核在 ne00 小于 1024 时的空闲线程问题,并新增 8 行 split kernel 处理小尺寸场景,提升 GPU 利用率。该修复对 Apple Silicon 上的量化推理有性能帮助。

推理优化llama.cppMetal量化推理GPU 内核

b10858

llama.cpp · 09-08 20:08 UTC+8

llama.cpp Vulkan 后端新增算子融合,将 UNARY(GELU/SIGMOID/SILU/SOFTPLUS) 与 MUL 融合执行,减少运行时分支和 kernel 调用开销,提升推理性能。该优化在 unary.comp 中通过静态 ifdef 和专用 pipeline 实现。

llama.cppVulkan算子融合推理优化

Introducing CUDA Rust: Two Tracks for Writing GPU Kernels

NVIDIA 开发者 · 09-08 20:00 UTC+8

NVIDIA 宣布推出 CUDA Rust,提供两条编写 GPU 内核的原生 Rust 路径,将 Rust 语言引入 CUDA 生态。这对希望在 GPU 编程中使用内存安全特性的开发者具有重要意义。

InfraNVIDIACUDARustGPU 编程

trunk/60147cf18442b8858a728ab0d5f77235f24a3e69

PyTorch · 09-08 19:01 UTC+8

PyTorch 编译器相关提交在 UserDefinedObjectVariable 的 tp_getset 中暴露 __class__,改进 Dynamo 对用户定义对象类的元编程处理。这是编译器功能增强。

InfraPyTorchDynamo编译器

b10856

llama.cpp · 09-08 18:50 UTC+8

llama.cpp 将 14 个专用模板解析器从 chat.cpp 拆分到 common/parsers 目录,chat.cpp 从 3915 行缩减到 1513 行,提升代码模块化和可维护性。

Infrallama.cpp解析器重构代码组织

b10855

llama.cpp · 09-08 18:06 UTC+8

llama.cpp OpenCL 后端修复 conv2d 对非连续输入的处理,解决非连续 stride 场景下的计算错误,提升卷积相关推理的正确性。

推理优化llama.cppOpenCL卷积Bugfix

OpenClaw 2.0 发布:简化配置,支持智能体协作

InfoQ 中文 · 09-08 17:11 UTC+8

OpenClaw 2.0 发布,简化配置并支持智能体协作,降低多智能体系统搭建门槛。对需要快速构建协作式智能体应用的开发者有实用价值。

AgentOpenClaw多智能体协作工具

viable/strict/1788863288

PyTorch · 09-08 15:01 UTC+8

PyTorch FSDP 修复 _override_module_m 中可变默认字典的危险用法,消除潜在共享状态 bug,提升分布式训练代码稳定性。

InfraPyTorchFSDPBugfix

王云鹤创业后交出首个模型

量子位 · 09-08 10:14 UTC+8

王云鹤创业后交出首个模型,技术路线是把多模型执行阶段积累的经验反哺到模型训练环节。对关注国内大模型创业动态的从业者来说,这标志着又一位资深研究者下场后的首份成果落地,其具体训练方法和能力表现值得继续观察。

基座王云鹤模型训练多模型执行创业动态

viable/strict/1788845240

PyTorch · 09-08 09:14 UTC+8

这是 PyTorch 的一个底层修复提交,将 is_gpu() 和 device_need_guard() 的判断逻辑改为从 DeviceInterface 派生,以减少设备类型硬编码带来的不一致。对维护自定义设备或关注 PyTorch 设备抽象的开发者来说,这有助于让不同后端在设备判断上遵循统一接口。

InfraPyTorchDeviceInterfaceGPU设备抽象

Quoting Jakub Pachocki

Simon Willison · 09-08 06:26 UTC+8

Simon Willison 引用了 OpenAI 高管 Jakub Pachocki 的观点,认为继续快速训练更强模型的最重要理由是构建针对其他 AI 威胁的防御系统,包括实时防御 rogue agents、保护基础设施和发明新防护措施。这为 OpenAI 的部署重点提供了战略注脚,也反映出前沿实验室以防御必要性来论证持续扩大智能规模的叙事。

厂商动态OpenAIAI 安全模型训练Jakub Pachocki

The Frontier AEO Tracker: What Astra Chooses (and every other frontier model, and what you can do about it)

Latent Space · 09-08 05:32 UTC+8

Latent Space 推出首个 Astra 项目「Frontier AEO Tracker」,追踪 Astra 等前沿模型在 AEO 趋势中的选择,这是创始人和开发者体验负责人高频询问的话题。对做 AI 可发现性或智能体生态的团队来说,该追踪器提供了跨模型行为对比和可操作的优化方向。

AgentAEOAI 可发现性Latent Space前沿模型

Axis Robotics Releases AXIS: A Browser-Based Data Engine With 207 Robot Manipulation Tasks and 50,129 Trajectories

MarkTechPost · 09-08 02:38 UTC+8

Axis Robotics 发布基于浏览器的数据引擎 AXIS,将机器人演示采集从实验室硬件迁移到网页端,并把重计算放到后端 GPU,得到 207 个操作任务和 50,129 条经过验证的 Franka 轨迹。用这些数据做持续预训练,π0.5 在 LIBERO-Plus 上从 83.9 提升到 88.8,而同等数据量的 RoboCasa365 对照组只有 57.5,说明浏览器众包式采集和规模化数据质量对机器人策略训练价值明显。

训练机器人数据AXISπ0.5持续预训练

GPT-6 Astra beat Portal start to finish without human help in under 24 hours

The Decoder · 09-08 01:39 UTC+8

The Decoder 报道称 GPT-6 Astra 在设定初始目标后,完全独立地在约 24 小时内通关解谜游戏「传送门」,全程无需人类帮助,开发者 cozyblaze 已在 GitHub 公开代码和文档。他评价 Astra 是「我们未来会得到的最差模型」,这反映了前沿智能体在长程规划、环境交互和自主完成复杂任务上的能力跃升,也让从业者看到更强模型很快会继续拉高上限。

AgentGPT-6Astra游戏智能体自主任务

AWS 开源 Kiro Crew,让 Coding Agent 异步跑起来

InfoQ 中文 · 09-08 00:32 UTC+8

AWS 开源 Kiro Crew,目标是让 Coding Agent 支持异步执行,使编码智能体不必同步阻塞等待,从而提升任务并行度和开发流程效率。这对使用 AWS 生态构建 AI 编程助手的团队是一个可集成的组件。

AgentAWSKiro CrewCoding Agent异步执行

TikTok SRE 技术负责人:AI Agents 说到底就是分布式系统

InfoQ 中文 · 09-08 00:18 UTC+8

TikTok SRE 技术负责人提出观点:AI Agents 本质上就是分布式系统,意味着需要用分布式系统的方法论来设计智能体的可靠性、状态管理和容错。这对 Agent 工程实践是一个重要视角转换,有助于把 SRE 经验迁移到智能体运维。

AgentAI Agents分布式系统SRETikTok

“薄 Agent Loop,厚 Control Plane”:TiDB 用数据库思维重做 Harness

InfoQ 中文 · 09-08 00:10 UTC+8

TiDB 团队提出「薄 Agent Loop,厚 Control Plane」的设计思路,用数据库思维重构 Harness,把智能体循环保持轻量,把复杂控制逻辑下沉到控制面。这为构建可扩展、可治理的 Agent 基础设施提供了来自数据库领域的架构参考。

AgentTiDBAgent LoopControl PlaneHarness

trunk/8368a088aeaec7fd68f9eef843876de15748c3be: Fix assume_constant_result tensor constants after graph breaks (#185373)

PyTorch · 09-08 23:50 UTC+8

PyTorch 修复了 Dynamo 中 assume_constant_result 返回 Tensor 时,跨图断裂重建字节码却因运行期全局变量缺少对应名称而报错的问题。修复让 Tensor 常量路径与 non-Tensor 路径一致地安装名称,保证 ConstantSource 在执行 LOAD_GLOBAL 时能正确解析。这对使用 torch.compile 并依赖常量折叠或 assume_constant_result 的开发者来说,能减少图断裂场景下的编译失败。

InfraPyTorchDynamo图断裂常量折叠

ASML locks in TSMC, Samsung, and Intel while Huawei races to break its grip

The Decoder · 09-08 23:11 UTC+8

ASML 已争取到三星、台积电和英特尔转向更大尺寸光罩,使其最新 EUV 光刻机的吞吐量提升 40%。与此同时,华为正通过设备制造商宇量昇及自有供应商体系,协调中国突破对荷兰光刻技术依赖的替代策略。这反映了全球先进制程设备竞争和中美芯片供应链博弈的关键节点。

InfraASMLEUV华为光刻机

b10857

llama.cpp · 09-08 19:38 UTC+8

llama.cpp 修复了在 32 位目标上 Vulkan-Hpp 句柄使用问题,因为 Vulkan 非分派句柄在 32 位平台是 uint64_t,Vulkan-Hpp 出于类型安全禁止隐式转换。具体修复包括为 vk::Buffer 增加输出流操作符,并在调用 Vulkan-Hpp 的 CommandBuffer::copyBuffer 接口时直接传递 vk::Buffer 而非强转 VkBuffer。这对在 32 位嵌入式或边缘设备上跑 llama.cpp Vulkan 后端的用户很重要,能避免日志和拷贝路径的类型错误。

推理优化llama.cppVulkan32 位GGML

论文 6 篇

今日论文聚焦「on-policy」自蒸馏与自改进的验证器门控及安全边界,兼有离散扩散无损加速与「VLA」智能体统一框架。

Unlocking Lossless Speedups in LLMs via Discrete Diffusion

HF 精选 · 09-08 08:00 UTC+8

针对自回归语言模型逐 token 串行解码导致的推理延迟,这篇论文提出用离散扩散增强自回归生成,通过蒸馏扩散权重和专用采样器实现并行 token 采样,无需草稿模型即可加速推理且保持质量无损。该方法为 LLM 无损推理加速提供了新路径。

推理优化离散扩散推理加速并行采样自回归模型

FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

腾讯 AI LabHF 精选 · 09-08 08:00 UTC+8

面向推理模型强化学习训练中奖励信号不稳定的问题,FlowBalance 引入验证器校准的自我引导机制,利用轨迹级评分重加权和基于 profile 的轨迹平衡来调整更新目标,从而提升推理模型的自改进效果。对这类模型的对齐与强化训练具有参考价值。

后训练推理模型自我改进验证器校准强化学习

One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation

HF 精选 · 09-08 08:00 UTC+8

这篇批判性综述聚焦数学推理中的在线策略自我蒸馏,指出其虽能利用特权信息在没有更大教师模型的情况下引导训练,但存在推理崩塌现象,并受 token 加权、特权上下文和引导动态三个因素共同影响。文章为理解该方法的失效边界和改进方向提供了系统分析。

后训练在线策略蒸馏数学推理推理崩塌综述

Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation

HF 精选 · 09-08 08:00 UTC+8

针对在线策略蒸馏中教师提示质量不稳定导致训练效率下降的问题,该论文提出教师门控的在线策略蒸馏,先用验证器评分探针评估每个提示上教师的可靠性,再据此路由到稠密蒸馏或基于验证器的强化学习,从而提升训练效率和准确率。

后训练在线策略蒸馏教师门控验证器强化学习

Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal

HF 精选 · 09-08 08:00 UTC+8

针对安全对齐中模型要么过度拒绝、要么产生有害回复的边界模糊问题,该论文提出边界感知的自我蒸馏方法,利用自生成拒绝数据和边界对训练来精确控制模型拒绝边界,在提高目标拒绝能力的同时减少过度拒绝和有害输出。

后训练安全对齐自我蒸馏拒绝边界过度拒绝

EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents

HF 精选 · 09-08 08:00 UTC+8

针对机器人技能执行缺乏统一验证和闭环编排的问题,EmbodiedSkills 提出一个统一框架,通过固定接口对机器人技能执行进行验证与确认,支持闭环具身智能体在低层 VLA 策略上灵活切换。该框架为训练与部署可适应 VLA 智能体提供了基础设施。

Agent具身智能VLA 智能体统一框架机器人