每日 AI 速览

2026-09-03

生成于 2026-09-04 05:23
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日关注四条主线:基座模型密集发布,Meta Muse Spark 1.3 低价对标前沿,Gemini 3.8 Flash 与 GPT-6 Astra 相继亮相,Qwen3.8-Flash、GLM-5.3-Flash 借 MTP 实现两倍加速;AI 基础设施加速整合,Nvidia 以 129 亿美元收购 Hugging Face,Anthropic 与 Lambda 达成 350 亿美元算力合作;智能体自主进化、评测与代码竞赛后训练成为论文热点;视频世界模型与多模态编码器亦有开放进展。

AI Infra 动态 20 条

主流训推框架主分支 PR,按前沿价值与性能影响降序。
llama.cpp #25444 MERGED

model: add NVIDIA Nemotron-3-Puzzle-75B-A9B (NemotronHPuzzle) support

本日合并至 master · 09-03 14:53 UTC+8 · @YanissAmz

为 llama.cpp 添加 NVIDIA Nemotron-3-Puzzle-75B-A9B 混合架构支持,复用 NemotronH MoE 机制并处理逐层异构的 mamba2/attention/MoE 配置。使推理栈能够加载并运行该异构 MoE 模型,扩展模型与硬件适配范围。

推测解码 硬件适配性能优化分布式训练
TensorRT-LLM #18375 MERGED

[TRTLLM-15160][feat] Add post-attention o_proj gate hook to shared MLA base and make trtllm::kda_decode inplace-only

本日合并至 main · 09-03 11:26 UTC+8 · @WeiHaocheng

将 trtllm::kda_decode 改为仅就地写入调用方提供的缓冲区,并在共享 MLA 基类增加注意力后 o_proj 门控 hook,分配上移到 Python 包装器并复用持久缓冲。减少解码路径的重复分配与同步,为 CUDA graph 和 torch.compile 提供更稳定的算子契约。

推测解码 算子与内核控制流优化硬件适配
SGLang #37210 MERGED

[CI][RFC] Replace black-jupyter with ruff-format

本日合并至 main · 09-03 10:46 UTC+8 · @alexnails

将 CI lint 中的 black-jupyter 替换为 ruff-format,使用 ruff 原生格式化笔记本并统一到已固定的 ruff 工具链。消除逐文件重格式化开销并显著减少 lint 作业耗时,降低 CI 排队与资源消耗。

推测解码 算子与内核硬件适配性能优化
vLLM #54566 MERGED

[New model][Multimodal] Add DeepSeek-V4-Flash-Vision-Exp support

本日合并至 main · 09-03 02:09 UTC+8 · @Isotr0py

为 vLLM 增加 DeepSeek-V4-Flash-Vision-Exp 多模态模型支持,并配套 TP=4、expert parallel、fp8 KV cache 与 dspark 推测解码配置。使 GB200 等多卡环境能直接服务该模型,提升大规模多模态推理的部署效率。

推测解码 算子与内核性能优化分布式训练
SGLang #37667 MERGED

[Speculative Decoding] Add native UNO serving support

本日合并至 main · 09-03 20:08 UTC+8 · @akhauriyash

在 SGLang 中为 UNO 扩散增强 LLM 添加原生服务支持,通过 AR 权重加 LoRA 扩散路径并行起草、AR 路径验证实现无独立草稿模型的推测式解码。使 UNO 的无损并行解码可直接部署到 SGLang 推理服务,提升生成吞吐。

推测解码 算子与内核服务与推理
SGLang #37329 MERGED

Improve CUDA graph and speculative execution output handling

本日合并至 main · 09-03 08:25 UTC+8 · @merrymercy

改进 CUDA graph 与推测执行的输出处理,保留重叠前向的自定义张量输出,并增加层选择与 target-hidden 预聚合 hook,按实际 token bucket 调整解码图状态。使 CUDA graph 捕获与 dspark 推测路径更可靠,减少跨前向的张量错配。

推测解码 控制流优化硬件适配
vLLM #55054 MERGED

Optimize PLE MTP metadata transfers

本日合并至 main · 09-03 23:03 UTC+8 · @byshiue

将 Qwen4Exp PLE 推测解码元数据构建中的多个同步 host-to-device 小张量传输改为异步 h2d,并复用设备端请求索引张量。消除解码步中的流同步点与 GPU 内核间隙,降低推测解码关键路径延迟且不改变请求顺序或数学。

推测解码 性能优化
SGLang #27862 MERGED

Support speculative decoding on CPU

本日更新,目标 main · 09-03 13:45 UTC+8 · @htzo

为 SGLang CPU 后端添加 EAGLE2、MTP、N-Gram 和 Standalone 推测解码支持,新增 CPU 内核与 Intel AMX 注意力后端的 TARGET VERIFY/DRAFT EXTEND 路径。使推测解码能力从 GPU 扩展到 CPU,提升 x86 平台的推理吞吐与硬件适配范围。

推测解码 算子与内核
SGLang #35546 MERGED

[EAGLE] Prune draft-extend logits to selected rows

本日合并至 main · 09-03 06:10 UTC+8 · @YAMY1234

在 EAGLE draft-extend CUDA graph 执行中,将 LM head 前仅保留推测验证器消费的行,裁剪掉多余的整词表 logits 计算。减少解码关键路径的图执行时间与临时显存占用,同时保持隐藏状态和推测状态演化不变。

推测解码 硬件适配
SGLang #35368 MERGED

Update GLM-5.2 NVFP4 B200/B300 for AgentX HiCache

本日合并至 main · 09-03 05:39 UTC+8 · @faradawn

为 GLM-5.2 NVFP4 添加 AgentX MTP 与 HiCache DRAM 卸载方案,并适配 B200/B300。使 B200/B300 上的 GLM-5.2 推断可利用 MTP 推测与 DRAM 卸载缓存,扩大可服务模型规模及提升推理效率。

推测解码 硬件适配
FlashInfer #4081 MERGED

feat(gdn): u/d cache spec-decode kernels for replayssm

本日更新,目标 main · 09-03 01:43 UTC+8 · @ameynaik-hub

为 GDN 模型新增两个 CuTe-DSL 内核,在推测解码中仅保存每 token 的 u/k/g 小成分环形缓冲,而非每 draft 位置的完整循环状态副本。大幅降低草稿回滚所需的内存容量与带宽,使 GDN 推测解码更高效且可扩展。

推测解码 服务与推理
Megatron-LM #6912 MERGED

Support multiple CP layout batch views and fix THD+CP bug in MTP

本日合并至 main · 09-03 13:16 UTC+8 · @Mellonta

修复 THD+CP 将打包 batch 当作单个平面序列分片的问题,支持多种 CP 布局视图,同时为 MTP 保留 zigzag 布局并复用 THD 重分布计划。保证 MTP 在上下文并行下 token 分片与物理布局一致,避免注意力 padding 场景的训练错误并降低布局转换开销。

推测解码
SGLang #36752 MERGED

[Spec] Publish the final multi-layer EAGLE shared-read event

本日合并至 main · 09-03 06:57 UTC+8 · @paulzhang-tm

在多步 multi-layer EAGLE 的最后草稿步骤发布 shared-read 完成事件,并覆盖单图回放路径。使 overlap 调度器能使用更精确的依赖事件而非较粗的前向流 fence,提升推测解码与重叠调度的并行度。

推测解码
SGLang #37471 MERGED

[Bugfix] Load Qwen3.5 MTP embedding under PP

本日合并至 main · 09-03 06:19 UTC+8 · @YAMY1234

修复 Qwen3.5 MTP 在流水线并行下草稿位于最后 PP stage 时未加载共享目标 embedding 的问题,兼容 text 与 VL checkpoint 命名。避免草稿 embedding 查找时使用未初始化张量产生 NaN,提升 PP 下 MTP 推测解码的正确性与稳定性。

推测解码
SGLang #37332 MERGED

[Diffusion][minimax-h3] Add SM120 support for SubBlock sparse attention

本日合并至 main · 09-03 22:05 UTC+8 · @tristan-me

为 MiniMax-H3 扩散模型的 SubBlock 稀疏注意力添加 SM120 路径,通过 FlashInfer 的 blk64 算子与设备 dispatch 支持 compute capability 12.0。使新一代 Blackwell GPU 能利用稀疏注意力降低推理延迟,扩展硬件适配范围并保持图像质量。

算子与内核 硬件适配性能优化服务与推理
SGLang #36735 MERGED

[multimodal_gen] feat: support key masks on USPAttention's replicated-prefix path

本日合并至 main · 09-03 20:13 UTC+8 · @AgainstEntropy

为 USPAttention 的 replicated-prefix 路径添加 key mask 支持,解决 breakable CUDA graph 与 sequence parallelism 组合下 Qwen-Image 请求失败的问题。使可中断 CUDA graph 在多头序列并行下能正确运行多模态生成,提升图像推理的灵活性与稳定性。

算子与内核 硬件适配性能优化服务与推理
SGLang #35922 MERGED

[diffusion] feat: add maybe_record_function profiler spans for request phases

本日合并至 main · 09-03 20:12 UTC+8 · @AgainstEntropy

在扩散请求各阶段添加 maybe_record_function profiler span,用于在 torch profiler trace 中区分请求处理区域。提高推理性能分析的可视化粒度,便于定位扩散推理各阶段的性能瓶颈。

算子与内核 硬件适配性能优化服务与推理
vLLM #55111 MERGED

[Bugfix] Account for PCP in multi-node world size validation

本日合并至 main · 09-03 18:52 UTC+8 · @DebugSy

修复 vLLM 多节点 world size 校验未计入 prefill context parallel size 的问题,使本地重算值与权威 ParallelConfig.world_size 一致。避免 TP/PP 较小但启用 PCP 时的启动误报错误,确保多节点并行配置能正常启动。

算子与内核 控制流优化性能优化服务与推理

行业动态 40 条

Nvidia buys the front door to open AI as closed labs increasingly design their own silicon

The Decoder · 09-03 22:25 UTC+8

NVIDIA 宣布以约 129 亿美元收购 Hugging Face,将控制这个拥有超过 1800 万开发者和 20 万家公司的开放模型核心平台。黄仁勋承诺保持平台开放和硬件中立,但这也为 NVIDIA 提供了触达海量开发者的算力分发渠道。对从业者来说,这既可能强化开放生态的算力支持,也引发开放平台被单一硬件厂商主导的担忧。

InfraNVIDIAHugging Face收购开放模型

NVIDIA to Acquire Hugging Face

NVIDIA 博客 · 09-03 19:56 UTC+8

NVIDIA 官方确认以 129.303 亿美元收购 Hugging Face,计划扩展其平台、基础设施并让全球开发者更容易获取 AI 能力。这一官方声明意味着收购已从传闻进入确定阶段,对开放模型生态和开发者工具链的未来走向有直接影响,尤其是平台是否继续中立值得关注。

InfraNVIDIAHugging Face收购开放模型

Safety overview: GPT-6 Astra

OpenAI · 09-03 08:00 UTC+8

OpenAI 发布安全概览,宣布 GPT-6 Astra 是其迄今能力最强的大规模部署模型,并且首次在网络安全能力上达到公司准备框架中的 Critical 级别。这一定级意味着模型具备可能被用于高级网络攻击的潜在能力,对从业者而言,安全评估、红队测试和访问控制策略将成为部署该模型时的核心关注点。

基座OpenAIGPT-6 Astra安全评估网络安全

Nvidia confirms it will buy Hugging Face for $12.9 billion

TechCrunch · AI · 09-03 20:42 UTC+8

NVIDIA 确认将以 129 亿美元收购 Hugging Face,并披露该平台目前托管超过 300 万个模型、服务超过 1800 万开发者。这一数据凸显了 Hugging Face 在开放模型分发中的关键地位,收购完成后 NVIDIA 将直接掌握全球最大的模型与开发者入口,对开源 AI 生态的中立性带来新的不确定性。

InfraNVIDIAHugging Face收购开发者生态

b10785

llama.cpp · 09-03 20:21 UTC+8

llama.cpp 在 Metal 后端为 Flash Attention 向量核加入稀疏注意力支持,新增基于 n_kv_max 的稀疏 mask 提示,并把有限 mask 条目压缩为逐行索引列表以走稀疏计算路径。该更新能让 Apple Silicon 设备在支持稀疏 KV 掩码的推理场景中减少无效注意力计算,对长上下文和结构化稀疏推理有实际加速价值。

推理优化llama.cppMetal稀疏注意力Flash Attention

Meta closes in on the top with Muse Spark 1.3, and undercuts rivals on price

The Decoder · 09-03 19:45 UTC+8

Meta 发布 Muse Spark 1.3,这是五个月内该系列的第四个模型,在智能体基准上提升最为明显,但仍落后于 Claude Fable 5.1 等头部模型。它最具竞争力的地方是价格,每个任务约 0.55 美元,低于所有同分段对手,对成本敏感的企业用户非常有吸引力。从业者关注它可以作为高性价比的智能体任务选择。

基座MetaMuse Spark模型定价智能体基准

2x Faster Qwen3.8-Flash + GLM-5.3-Flash MTP

Unsloth · 09-03 04:27 UTC+8

Unsloth 宣布为 Qwen3.8-Flash-Next 和 GLM-5.3-Flash 加入 MTP 支持并默认开启,可将这两款模型推理速度提升最多 2 倍。新版本还包含 170 多项训练、聊天、硬件和性能改进,涉及模型加载稳定性、界面响应速度以及工具调用保留等。对本地部署和微调这些新模型的用户来说,这是一次值得升级的实用更新。

推理优化UnslothMTP推理加速

OpenAI’s new reasoning technique alarms AI safety experts

TechCrunch · AI · 09-03 04:19 UTC+8

OpenAI 的新模型 Astra 将采用一种名为 recurrent depth 的技术,使其推理过程不再局限于多数推理模型所采用的顺序思维模式。这一技术路线引发 AI 安全专家的警觉,因为它可能让模型产生更难预测和审计的思维路径。对从业者而言,这既是推理机制上的前沿探索,也意味着对齐与可解释性面临新的挑战。

基座OpenAIAstra推理技术AI安全

The Modern CUDA Toolbox in Practice: A Step-by-Step Optimization Walkthrough

NVIDIA 开发者 · 09-03 01:15 UTC+8

NVIDIA 发布了一篇面向开发者的 CUDA 优化实践文章,通过一个完整示例逐步演示现代 CUDA 工具箱中的性能调优思路。内容覆盖从初始实现到利用内存层级、线程组织和异步操作等关键优化手段,适用于科学模拟和大规模 AI 训练等 GPU 密集型场景。对需要深入理解 CUDA 性能瓶颈的工程师具有教学参考意义。

InfraCUDAGPU优化NVIDIA并行计算

Gemini 3.8 Flash is Google's third budget model in six weeks while frontier models remain MIA

The Decoder · 09-03 00:59 UTC+8

Google 推出 Gemini 3.8 Flash,这是六周内第三款 Flash 系列模型,在一些智能体编码基准上以更低单价对标 Claude Opus 5。但其更努力的推理方式使每个任务多消耗约 30% 的输出 token,即使 token 单价不变,实际使用成本反而可能高于前代。这对按任务评估成本的企业用户来说是个容易忽略的陷阱。

基座GoogleGemini 3.8 Flash模型定价智能体编码

Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

Google DeepMind · 09-03 00:18 UTC+8

Google DeepMind 正式发布 Gemini 3.8 Flash 及 3.8 Flash Cyber 两款模型,进一步扩充其轻量级 Flash 系列。Cyber 版本可能针对网络安全或安全任务进行专门优化。对开发者而言,新的低成本模型提供了更多选择,尤其在智能体编码和安全场景值得关注。

基座Google DeepMindGemini 3.8 Flash新模型发布

Co-Designing AI Models Using Speculative Decoding for Faster LLM Inference

NVIDIA 开发者 · 09-03 00:04 UTC+8

NVIDIA 开发者博客发布 AI 模型协同设计系列的第三篇文章,聚焦如何通过投机解码在不牺牲准确率的前提下加速大模型推理。文章讨论了模型架构与解码策略之间的协同优化,为推理系统设计者提供了减少延迟和提高吞吐的实战参考。对于正在优化服务性能的团队,这是一份结合理论与工程经验的实用资料。

推理优化投机解码推理加速NVIDIA大模型

Diagrid Catalyst 2.0 发布,为 AI 智能体新增持久化、可验证的执行能力

InfoQ 中文 · 09-03 22:05 UTC+8

Diagrid 发布 Catalyst 2.0,为其 AI 智能体执行平台加入持久化与可验证执行能力,使智能体工作流在中断后可恢复并具备审计追踪。这对需要长时运行、多步工具调用和合规审计的生产级智能体应用有直接价值。

AgentAI 智能体工作流持久化可验证执行Diagrid

NeoMME: an efficient Multimodal-native and Multilingual Encoder

HuggingFace 博客 · 09-03 21:13 UTC+8

HuggingFace 发布 NeoMME,定位为多模态原生、多语言且高效的编码器,目标是在统一嵌入空间里同时处理多模态输入与多语言文本。对需要跨模态检索或多语言表示学习的场景,可作为基础编码器候选。

基座多模态编码器多语言HuggingFace高效模型

viable/strict/1788450620

PyTorch · 09-03 20:10 UTC+8

PyTorch 的 LocalTensor 为集合通信新增 ReduceOp.PREMUL_SUM 支持,允许在 Local 后端对归约操作执行预乘求和。这补齐了本地张量路径下的通信原语,有利于某些分布式训练优化下沉到 LocalTensor 实现。

InfraPyTorch分布式通信LocalTensorReduceOp

b10782

llama.cpp · 09-03 18:28 UTC+8

llama.cpp 此 CUDA 改动允许多 GPU 场景按 split 使用并发流,并恢复此前被误跳过的 CUDA 图优化;由于图已按设备拆分、优化按 split 执行,该放开更合理。多卡推理用户可因此获得更高效的流调度和短 kernel 合并收益。

推理优化llama.cppCUDA多GPU推理图优化

Anthropic ramps up Claude infrastructure with $35 billion Lambda deal

The Decoder · 09-03 16:22 UTC+8

Anthropic 与英伟达支持的云服务商 Lambda 签署 350 亿美元云计算协议,用于扩展 Claude 基础设施。该交易表明 Anthropic 继续加码算力供给,也强化了英伟达生态中的新云厂商地位,对 AI 算力市场和推理成本有信号意义。

厂商动态AnthropicClaudeAI 基础设施算力合作

[AINews] Muse Spark 1.3 matches GPT-5.6-Sol, confirming Meta Superintelligence as the newest Frontier Lab, >90% discount for training

Latent Space · 09-03 12:38 UTC+8

Latent Space 报道 Meta 的 Muse Spark 1.3 在能力上追平 GPT-5.6-Sol,被视为 Meta Superintelligence 重回前沿实验室的标志,并声称训练成本折扣超九成。这则信息强调 Meta 在大模型基座竞赛中的回归,对关注模型性价比和前沿格局的从业者有参考价值。

基座MetaMuse Spark前沿模型训练成本

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

HuggingFace 博客 · 09-03 08:00 UTC+8

HuggingFace 博客展示用约 100 步 GRPO 微调一个 3.5 亿参数模型,即可改善结构化输出能力。对资源有限的团队,这表明小模型无需大规模 RLHF 也能在 JSON 等结构化生成上获得明显提升,是低成本对齐路径的实用案例。

后训练GRPO结构化输出小模型微调HuggingFace

v0.33.3-rc2: gemma4: image and audio input support

Ollama · 09-03 06:07 UTC+8

Ollama 在 v0.33.3-rc2 中为 gemma4 的 MLX 引擎增加图像和音频输入支持,图像走 26B、31B、e 系列的 transformer tower 或 12B 的 encoder-free 统一嵌入器,音频则复用现有 API 的 WAV、OpenAI input_audio 和转录上传路径。这使 Apple MLX 用户也能在本地跑 gemma4 多模态问答,覆盖视觉和语音输入。

推理优化OllamaGemma4多模态输入MLX

Claude Fable 5.1 decoded a centuries-old royalist message hidden in plain sight since 1653

The Decoder · 09-03 22:15 UTC+8

Anthropic 的 Claude Fable 5.1 据称破解了一个自 1653 年以来隐藏的保皇党数字谜题,该密码此前被研究者视为未解。这展示了模型在历史密码分析和符号推理上的能力,不过作为单一案例,更多是能力演示而非可泛化基准。

基座Claude Fable密码破译Anthropic推理能力

viable/strict/1788457839: [dynamo] Migrate DispatchKeySetVariable methods to tp_methods (#195168)

PyTorch · 09-03 22:05 UTC+8

PyTorch Dynamo 将 DispatchKeySetVariable 的方法分派从手写 if-chain 迁移到声明式 tp_methods,并把 has 和 highestPriorityTypeId 改为 Method handler;has 仍仅在参数为常量时做常量折叠。这个内部重构简化了符号变量逻辑、降低后续维护成本,对普通用户无感,但有助于 Dynamo 跟踪稳定性。

InfraPyTorch Dynamo编译器重构符号跟踪

b10786

llama.cpp · 09-03 20:45 UTC+8

此提交将 mtmd 预处理类中的 const 属性进一步传播,使多模态预处理器接口在只读上下文下更明确,便于编译器优化和 API 安全。对使用 llama.cpp 多模态推理的开发者而言,这是接口整洁性改进,不改变运行行为。

Infrallama.cpp多模态代码重构const 传播

OpenAI CEO Sam Altman warns of "unsustainable silliness" in compute buildout

The Decoder · 09-03 20:00 UTC+8

Sam Altman 警告全球 AI 数据中心建设出现「不可持续的愚蠢行为」,太多新云厂商在没有客户支撑的情况下宣布巨大容量,且算力成本下降可能让今天数十亿美元项目变成坏账。这对算力投资和 AI Infra 扩张有警示意义,也透露出 OpenAI 自身对重资产风险的担忧。

InfraOpenAIAI 算力数据中心行业风险

Legora reviewed 41 documents in minutes with GPT-6 Astra

OpenAI · 09-03 20:00 UTC+8

法律科技公司 Legora 使用 GPT-6 Astra 在几分钟内审阅 41 份文档,找出了全部 4 个预埋错误,并在该财务审阅工作流中实现近 40% 的性能提升。这是 OpenAI 展示 GPT-6 Astra 在专业文档密集型场景中效率与准确率的案例,对金融法律自动化有参考意义。

厂商动态OpenAIGPT-6 Astra文档审阅AI 应用案例

Playco cut manual fixes 50% prototyping games with GPT-6 Astra

OpenAI · 09-03 20:00 UTC+8

游戏公司 Playco 用 GPT-6 Astra 从一个灰盒基础搭建出三个主题游戏原型,并报告手动修复量比上一代模型减少 50%。这展示了该模型在代码生成和游戏原型迭代上的可用性提升,对开发者工具和创意原型有直接价值。

厂商动态OpenAIGPT-6 Astra游戏开发代码生成

b10784

llama.cpp · 09-03 19:54 UTC+8

该提交修复了 Metal 后端在 ne00 等于 1 时 GLU 激活内核的分发错误,并禁用了一个定义不清的测试。对在 Apple Silicon 上运行 llama.cpp 且使用 GLU 类算子的用户,这个修复可以避免特定形状下走错内核导致错误或崩溃。

Infrallama.cppMetalGLU 激活Apple Silicon

b10783

llama.cpp · 09-03 19:18 UTC+8

此提交在多个 mtmd 相关函数中将上下文标记为 const,尤其是 tokenize 系列接口,便于编译器判断安全性并提高代码可读性。这是 API 语义收紧,有助于多模态推理路径的维护和优化,对用户行为无直接影响。

Infrallama.cpp多模态API 设计const 正确性

b10781

llama.cpp · 09-03 17:59 UTC+8

该修复针对 Vulkan 后端 Flash Attention 反量化路径的触发条件,当 ne[3] 为 1 时跳过 nb[3] 检查,避免旧逻辑导致该路径仅在 KV 缓存满时才启用。修复后,Vulkan 推理在单流情况下也能正确走 FA 反量化路径,提升相关 GPU 上的性能表现。

推理优化llama.cppVulkanFlash Attention反量化

v0.29.0rc2

vLLM · 09-03 17:41 UTC+8

vLLM 在 v0.29.0rc2 候选版本中修复了多模态请求在共享内存 worker 缓存里前缀覆盖项的处理问题,避免因缓存命中边界情况导致多模态输入数据错误。对使用 vLLM 部署多模态模型且开启共享内存缓存的团队,这个修复提高了服务稳定性。

推理优化vLLM多模态推理Bugfix共享内存缓存

b10780

llama.cpp · 09-03 17:35 UTC+8

该提交增强了 SYCL 后端的 API,使其支持设备间 peer-to-peer 拷贝,便于在多 GPU、多卡或不同加速器之间直接搬运张量。对在 Intel SYCL 生态中跑多卡 llama.cpp 推理的用户,这可以减少通过主存的转接、降低通信延迟。

推理优化llama.cppSYCLP2P 拷贝多卡推理

Cursor 推出 Origin:面向智能体的 GitHub 替代方案

InfoQ 中文 · 09-03 17:09 UTC+8

Cursor 发布 Origin,定位为面向智能体的代码托管与协作平台,被称为 GitHub 替代方案。这意味着代码仓库从面向人类 PR 流程转向支持 AI 智能体自主提交、审查与协作,对开发者工具和智能体软件开发范式有潜在重塑作用。

AgentCursor智能体代码托管开发者工具

b10778

llama.cpp · 09-03 16:59 UTC+8

该提交修复了模型加载阶段内存峰值过高的问题,避免加载大型模型时 RAM 短暂飙升导致 OOM。对在内存受限环境本地部署大模型的用户,这能提升加载稳定性和资源利用率。

推理优化llama.cpp模型加载内存优化本地推理

viable/strict/1788439121: [MPS] migrate log softmax to metal (#195441)

PyTorch · 09-03 16:55 UTC+8

PyTorch 将 MPS 后端的 log softmax 迁移到 Metal 实现,新增 row、partial、finalize 等多个 kernel,按 reduction dim 大小和行数选择不同策略以减少内存占用并保持 GPU 饱和。这对在 Apple Silicon 上使用 MPS Graph 进行模型训练或推理的用户,可降低显存压力并提升 log softmax 效率。

推理优化PyTorchMPSMetallog softmax

viable/strict/1788434653

PyTorch · 09-03 15:35 UTC+8

该 PR 调整 Inductor 的 AOTI cpp wrapper,使嵌套区域在代码生成时保留其独立的 Inductor 配置,而不是被外层配置覆盖。这有助于 AOTInductor 在包含不同优化设置的内联区域时生成正确代码,提升 Ahead-of-Time 编译路径的灵活性。

InfraPyTorch InductorAOTI编译器代码生成

viable/strict/1788431310

PyTorch · 09-03 14:28 UTC+8

PyTorch Dynamo 的 guards 机制新增对浮点值按位相等匹配和复数分量感知的比较支持。这可以更精确地识别张量值或参数变化,减少因浮点或复数比较不准确导致的误重编译,提升动态图捕获的性能。

InfraPyTorch DynamoGuards编译优化浮点比较

viable/strict/1788427814: Update torch-xpu-ops commit pin (#195708)

PyTorch · 09-03 13:26 UTC+8

PyTorch 更新了 XPU 算子库的提交指针,修复 safe-softmax 在输入含 NaN 时错误清零整行的问题,并修正 int4 打包矩阵乘法在 XPU 上的结果。对使用 Intel GPU 进行训练或推理的用户,这些修复直接影响数值正确性和低精度量化算子的可用性。

推理优化PyTorchIntel XPUsafe-softmaxint4 量化

viable/strict/1788424570

PyTorch · 09-03 12:27 UTC+8

该 PR 修复了 setBackend 在复用后端时对缺失后端解引用的错误,避免后端未注册时引发空指针或崩溃。对在 PyTorch 运行时切换或复用设备后端的开发者,这是一个提升后端管理稳健性的修复。

InfraPyTorch后端管理Bugfix运行时

Muse Spark 1.3 ✨, Gemini 3.8 Flash ⚡, intelligence vs cost 📊

TLDR AI · 09-03 08:00 UTC+8

TLDR AI 本期聚焦 Muse Spark 1.3、Gemini 3.8 Flash 以及智能水平与成本的权衡。对于需要快速跟踪前沿模型和成本效率趋势的从业者,这是一份当日要点速览,标题即点出最值得关注的发布与议题。

基座AI 新闻Muse SparkGemini成本效率

论文 20 篇

论文看点:『Language Models Can Control Their Own Attention』探索注意力控制,『Cliff』从首个错误学习过程奖励,『Post-Training Language Models for Gold-Medal Performance in Coding Competitions』推进竞赛级后训练,另有视频世界模型、智能体自进化与早停评测等方向。

Language Models Can Control Their Own Attention

HF 精选 · 09-03 08:00 UTC+8

这篇论文针对大模型推理时注意力读取「KV cache」的开销,提出让模型在推理过程中显式声明相关上下文区域,从而跳过大部分无关的「KV cache」读取。这种声明式注意力机制能显著降低实际参与计算的 token 数量,并以较小的准确率损失换取更快的解码速度。对长上下文和高吞吐批量推理场景尤其有实用价值。

推理优化注意力机制KV缓存推理加速大模型

Cliff: Learning Process Rewards from the First Mistake

HF 精选 · 09-03 08:00 UTC+8

这篇论文针对可验证奖励强化学习中过程奖励信号稀疏的问题,提出「Cliff」方法,利用现成的语言模型自动定位推理轨迹中的第一个错误。随后它根据首个错误位置来重新构造 token 级优势函数,使训练信号能更精细地引导模型修正中间步骤。相比只依赖最终结果奖励的做法,该方法能提供更稳定的过程监督,从而提升推理模型的强化学习效率。

后训练强化学习过程奖励推理模型RLVR

Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation

HF 精选 · 09-03 08:00 UTC+8

这篇论文解决推理模型蒸馏过程中采样 token 导致多样性下降的问题,提出「影响导向自适应在线策略蒸馏」。其核心是区分熵扩展型更新和熵收缩型更新,保留前者以维持生成多样性,同时用自适应优势收缩替代后者以稳定训练。这样可以在不牺牲推理性能的前提下,把教师模型的多样行为更完整地迁移给学生模型。

后训练知识蒸馏推理模型多样性在线策略

Post-Training Language Models for Gold-Medal Performance in Coding Competitions

HF 精选 · 09-03 08:00 UTC+8

这篇论文提出一条面向竞赛编程的后训练流水线,融合精选题目、合成推理数据、监督微调和强化学习,专门训练能解决高难度算法竞赛题的模型。配合迭代式测试时细化策略,这些模型在国际信息学奥林匹克评测基准上超过了顶尖人类选手的得分。该工作展示了后训练而非单纯扩大模型规模在极限代码推理上可以达到的高度。

代码模型强化学习竞赛编程后训练

CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing

EMNLP 2026CCF-B推荐HF 精选 · 09-03 08:00 UTC+8

这篇论文针对长上下文稀疏注意力中预填充阶段的路由质量问题,提出「CRISP」方法。它不再依赖间接的路由代理,而是引入一个直接的结构质量指标,并配合 sink 感知阈值来过滤背景噪声 token。该方法在保持或提升检索准确率的同时实现了显著的预填充加速,为超长上下文处理提供了更可靠的选择性注意力方案。

推理优化稀疏注意力长上下文预填充检索加速

SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models

HF 精选 · 09-03 08:00 UTC+8

这篇论文针对交互式视频世界模型训练数据分散、缺少统一方法的问题,提出「SolarWM」开放框架和统一训练配方。它支持多种数据来源和生成器骨干,并提供可扩展训练方案,使模型能够进行长时程的实时推演。该工作降低了视频世界模型的研究门槛,为开放环境下的具身智能和模拟器构建提供了基础。

基座视频世界模型开放数据训练框架生成模型

It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning

AppleHF 精选 · 09-03 08:00 UTC+8

这篇论文提出「CoGR」方法,训练大语言模型同时为查询和物料生成紧凑的关键词表示,使得检索可以直接在倒排索引上完成,无需传统稠密向量检索的索引结构。它通过查询侧和物料侧的协同进化强化学习进行优化,让两端生成器互相适应。该方法兼顾了生成式检索的灵活性和倒排索引的高效性,对大规模检索系统有实际价值。

Infra生成式检索倒排索引强化学习大模型

NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference

NVIDIAHF 精选 · 09-03 08:00 UTC+8

这篇论文提出「NeoMME」,一类单塔、多模态原生、多语言的小型双向编码器,采用掩码离散扩散进行预训练。它在视觉文档检索任务上表现强劲,同时能把后期交互嵌入压缩到很高程度,从而降低下游微调和推理成本。该工作为需要高效多模态文本表示的检索与排序场景提供了更轻量的基础编码器选择。

基座多模态编码器离散扩散视觉文档检索模型压缩

Debias-SparseGPT: Bias-Aware Pruning for Large Language Models

EMNLP 2026CCF-B推荐HF 精选 · 09-03 08:00 UTC+8

这篇论文关注大模型剪枝压缩过程中可能放大的人口统计偏差问题,提出「Debias-SparseGPT」。它在训练后稀疏化的同时引入表示层去偏机制,使压缩后的模型在保持稀疏度的前提下降低对特定群体的偏见。对于需要部署轻量模型又必须兼顾公平性的场景,该方法提供了一条可落地的路径。

推理优化模型剪枝公平性去偏后训练压缩

Small Language Models as Judges for Rubric-Based Reinforcement Learning

EMNLP 2026CCF-B推荐HF 精选 · 09-03 08:00 UTC+8

这篇论文研究基于评分标准的强化学习奖励模型是否可以小型化,发现用小型探针式判别器可以替代大型生成模型来打分。这些小模型在保持与大型评判器一致性和跨任务迁移性的同时,显著降低了训练和推理开销。该结果意味着许多需要密集奖励信号的强化学习流程不必依赖昂贵的大模型评判。

后训练奖励模型小模型强化学习评估

Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills

HF 精选 · 09-03 08:00 UTC+8

这篇论文提出「DisCo」研究智能体,其核心思路是从 GitHub 仓库中把可操作的知识蒸馏成可复用的技能单元,供后续自动化研究调用。通过积累和组合这些技能,DisCo 在多个自主机器学习研究基准上取得了显著性能提升。该工作展示了将社区代码经验转化为智能体长期能力的一种路径。

AgentAI智能体技能蒸馏自动化研究GitHub

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

HF 精选 · 09-03 08:00 UTC+8

这篇论文提出「HarnessDev」基准,不再只看智能体的最终任务结果,而是评测它们自己搭建并迭代改进执行基础设施的能力。实验发现,不同模型自建的执行容器在能力和效率上差异很大,而且这些自建组件跨模型迁移时表现不佳。这一基准促使研究者关注智能体在工具基础设施层面的工程能力,而不只是单次任务表现。

Agent智能体评测执行基础设施基准大模型

Aspire: Can Models Self-Evolve from Vague Goals?

HF 精选 · 09-03 08:00 UTC+8

这篇论文提出「ASPIRE」基准,用于评估大模型智能体能否仅凭模糊的自然语言目标实现自我进化。基准覆盖目标解释、训练数据选择和权重级稳定改进等关键环节,实验揭示了这些环节中的明显困难。该工作为研究智能体自主设定和优化自身目标提供了系统性测试平台。

Agent自我进化智能体基准目标理解

EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction

HF 精选 · 09-03 08:00 UTC+8

这篇论文针对智能体评测需要完整跑完任务导致成本高的问题,提出「EarlyEval」方法。它根据智能体的中间行为轨迹预测最终结果,并在高置信度时提前终止运行,从而节省算力和时间。实验表明,该方法能在几乎不损失评测准确率的情况下大幅降低评估开销,对大规模智能体基准测试尤其有用。

Agent智能体评测成本优化结果预测早停

On the Design Fundamentals of Pixel Text Representation Learning

EMNLP 2026CCF-B推荐HF 精选 · 09-03 08:00 UTC+8

这篇论文系统改进了像素级文本表示学习,提出「Pixel Linguist II」。它引入可变分辨率训练、自然图像与文本的对齐、布局感知渲染和多语言课程四项关键设计,让模型更好地理解图像中的文字。该方法在多个基准上达到当前最优,并对图像压缩表现出很强的鲁棒性,适合文档理解和视觉文本检索等实际任务。

基座视觉文本编码多模态OCR表示学习

Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering

HF 精选 · 09-03 08:00 UTC+8

这篇论文针对知识型视觉问答中仅靠表面视觉相似度检索知识效果有限的问题,提出「KBMR」方法。它利用多模态语言模型将图像按语义身份而非外观特征进行嵌入,并通过连续蒸馏和困难负样本采样来训练检索器。这一方法在检索相关知识和视觉问答任务上都取得了明显提升,有助于模型回答需要外部知识的图像问题。

Infra多模态检索视觉问答知识增强实体对齐

S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?

HF 精选 · 09-03 08:00 UTC+8

这篇论文构建了「S³Gym」基准,用于测试大模型智能体是否能把自我测试和自我判断转化为真正的自我改进。通过在多种文字游戏中的交互实验,作者发现有效的自我改进高度依赖于任务结构以及经验如何被表示和利用。该工作为理解智能体自主能力边界以及设计自我进化系统提供了实证依据。

Agent智能体自我改进基准强化学习

Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers

HF 精选 · 09-03 08:00 UTC+8

这篇论文提出一个模块化流水线,用于从历史报纸扫描件中提取结构化文本和元数据。它采用小型可解释模型分阶段处理版面分析和文字识别,最终构建了一个包含数十亿高质量 token 的开放数据集。该数据集为训练和评估面向历史文本的语言模型提供了宝贵资源,也展示了低成本处理大规模扫描文献的可行方案。

训练数据工程OCR历史文档数据集

DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation

EMNLP 2026CCF-B推荐ApplearXiv · 09-03 00:31 UTC+8

这篇论文指出传统手语处理系统只做句子级翻译,忽略了对手语理解至关重要的语篇现象,因此提出「DiscoSign」框架。它基于模块化大语言模型,重点处理空间共指消解等三个语篇级现象,使文本到手语注释的翻译更符合真实手语表达习惯。该工作将语言学研究成果融入神经翻译框架,对手语机器翻译的连贯性和自然度有实际提升。

手语翻译语篇建模大模型多语言
Vasileios Baltatzis, Mert Inan, Connor Gillis, Raja Kushalnagar, Lorna Quandt, Leah Findlater, Colin Lea

HyperStyler: Low-resource Authorship Style Transfer via Context-aware Style Navigation and Hypernetworks

EMNLP 2026CCF-B推荐arXiv · 09-03 00:07 UTC+8

这篇论文解决低资源作者风格迁移中,只用少量参考样本难以同时保持目标风格和原文语义的问题。现有方法把多个参考压缩成单一静态作者嵌入,丢失了上下文相关的风格变化;「HyperStyler」改用上下文感知的风格导航和超网络来动态生成风格控制参数。这样可以在低资源条件下更精细地分离风格与内容,提升风格保真和语义一致性。

文本风格迁移低资源超网络可控生成
Jongkyung Shin, Minguk Jeon, Chanwoo Park, Chiehyeon Lim