model: add NVIDIA Nemotron-3-Puzzle-75B-A9B (NemotronHPuzzle) support
为 llama.cpp 添加 NVIDIA Nemotron-3-Puzzle-75B-A9B 混合架构支持,复用 NemotronH MoE 机制并处理逐层异构的 mamba2/attention/MoE 配置。使推理栈能够加载并运行该异构 MoE 模型,扩展模型与硬件适配范围。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
model: add NVIDIA Nemotron-3-Puzzle-75B-A9B (NemotronHPuzzle) support
为 llama.cpp 添加 NVIDIA Nemotron-3-Puzzle-75B-A9B 混合架构支持,复用 NemotronH MoE 机制并处理逐层异构的 mamba2/attention/MoE 配置。使推理栈能够加载并运行该异构 MoE 模型,扩展模型与硬件适配范围。
将 trtllm::kda_decode 改为仅就地写入调用方提供的缓冲区,并在共享 MLA 基类增加注意力后 o_proj 门控 hook,分配上移到 Python 包装器并复用持久缓冲。减少解码路径的重复分配与同步,为 CUDA graph 和 torch.compile 提供更稳定的算子契约。
[CI][RFC] Replace black-jupyter with ruff-format
将 CI lint 中的 black-jupyter 替换为 ruff-format,使用 ruff 原生格式化笔记本并统一到已固定的 ruff 工具链。消除逐文件重格式化开销并显著减少 lint 作业耗时,降低 CI 排队与资源消耗。
[New model][Multimodal] Add DeepSeek-V4-Flash-Vision-Exp support
为 vLLM 增加 DeepSeek-V4-Flash-Vision-Exp 多模态模型支持,并配套 TP=4、expert parallel、fp8 KV cache 与 dspark 推测解码配置。使 GB200 等多卡环境能直接服务该模型,提升大规模多模态推理的部署效率。
[Speculative Decoding] Add native UNO serving support
在 SGLang 中为 UNO 扩散增强 LLM 添加原生服务支持,通过 AR 权重加 LoRA 扩散路径并行起草、AR 路径验证实现无独立草稿模型的推测式解码。使 UNO 的无损并行解码可直接部署到 SGLang 推理服务,提升生成吞吐。
Improve CUDA graph and speculative execution output handling
改进 CUDA graph 与推测执行的输出处理,保留重叠前向的自定义张量输出,并增加层选择与 target-hidden 预聚合 hook,按实际 token bucket 调整解码图状态。使 CUDA graph 捕获与 dspark 推测路径更可靠,减少跨前向的张量错配。
Optimize PLE MTP metadata transfers
将 Qwen4Exp PLE 推测解码元数据构建中的多个同步 host-to-device 小张量传输改为异步 h2d,并复用设备端请求索引张量。消除解码步中的流同步点与 GPU 内核间隙,降低推测解码关键路径延迟且不改变请求顺序或数学。
Support speculative decoding on CPU
为 SGLang CPU 后端添加 EAGLE2、MTP、N-Gram 和 Standalone 推测解码支持,新增 CPU 内核与 Intel AMX 注意力后端的 TARGET VERIFY/DRAFT EXTEND 路径。使推测解码能力从 GPU 扩展到 CPU,提升 x86 平台的推理吞吐与硬件适配范围。
[CI] Remove deleted nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 and its arch aliases
从 vLLM CI 测试注册表中删除已从 Hugging Face 移除的 Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 及其三个架构别名。避免参数化测试因 404 校验失败,恢复 CI 稳定性并移除无有效 checkpoint 的死架构。
[EAGLE] Prune draft-extend logits to selected rows
在 EAGLE draft-extend CUDA graph 执行中,将 LM head 前仅保留推测验证器消费的行,裁剪掉多余的整词表 logits 计算。减少解码关键路径的图执行时间与临时显存占用,同时保持隐藏状态和推测状态演化不变。
Update GLM-5.2 NVFP4 B200/B300 for AgentX HiCache
为 GLM-5.2 NVFP4 添加 AgentX MTP 与 HiCache DRAM 卸载方案,并适配 B200/B300。使 B200/B300 上的 GLM-5.2 推断可利用 MTP 推测与 DRAM 卸载缓存,扩大可服务模型规模及提升推理效率。
feat(gdn): u/d cache spec-decode kernels for replayssm
为 GDN 模型新增两个 CuTe-DSL 内核,在推测解码中仅保存每 token 的 u/k/g 小成分环形缓冲,而非每 draft 位置的完整循环状态副本。大幅降低草稿回滚所需的内存容量与带宽,使 GDN 推测解码更高效且可扩展。
Support multiple CP layout batch views and fix THD+CP bug in MTP
修复 THD+CP 将打包 batch 当作单个平面序列分片的问题,支持多种 CP 布局视图,同时为 MTP 保留 zigzag 布局并复用 THD 重分布计划。保证 MTP 在上下文并行下 token 分片与物理布局一致,避免注意力 padding 场景的训练错误并降低布局转换开销。
[https://nvbugs/6693811][test] Unwaive DeepSeekV3Lite disagg guided_decoding mtp test
恢复 DeepSeekV3Lite 解聚式 guided decoding MTP 测试,不再因 UCX 1.22 多轨 RoCE 布线回归而豁免。使推理精度/功能测试重新覆盖 MTP 引导解码场景,同时澄清根因在于通信依赖而非模型或测试代码。
[Spec] Publish the final multi-layer EAGLE shared-read event
在多步 multi-layer EAGLE 的最后草稿步骤发布 shared-read 完成事件,并覆盖单图回放路径。使 overlap 调度器能使用更精确的依赖事件而非较粗的前向流 fence,提升推测解码与重叠调度的并行度。
[Bugfix] Load Qwen3.5 MTP embedding under PP
修复 Qwen3.5 MTP 在流水线并行下草稿位于最后 PP stage 时未加载共享目标 embedding 的问题,兼容 text 与 VL checkpoint 命名。避免草稿 embedding 查找时使用未初始化张量产生 NaN,提升 PP 下 MTP 推测解码的正确性与稳定性。
[Diffusion][minimax-h3] Add SM120 support for SubBlock sparse attention
为 MiniMax-H3 扩散模型的 SubBlock 稀疏注意力添加 SM120 路径,通过 FlashInfer 的 blk64 算子与设备 dispatch 支持 compute capability 12.0。使新一代 Blackwell GPU 能利用稀疏注意力降低推理延迟,扩展硬件适配范围并保持图像质量。
[multimodal_gen] feat: support key masks on USPAttention's replicated-prefix path
为 USPAttention 的 replicated-prefix 路径添加 key mask 支持,解决 breakable CUDA graph 与 sequence parallelism 组合下 Qwen-Image 请求失败的问题。使可中断 CUDA graph 在多头序列并行下能正确运行多模态生成,提升图像推理的灵活性与稳定性。
[diffusion] feat: add maybe_record_function profiler spans for request phases
在扩散请求各阶段添加 maybe_record_function profiler span,用于在 torch profiler trace 中区分请求处理区域。提高推理性能分析的可视化粒度,便于定位扩散推理各阶段的性能瓶颈。
[Bugfix] Account for PCP in multi-node world size validation
修复 vLLM 多节点 world size 校验未计入 prefill context parallel size 的问题,使本地重算值与权威 ParallelConfig.world_size 一致。避免 TP/PP 较小但启用 PCP 时的启动误报错误,确保多节点并行配置能正常启动。
Nvidia buys the front door to open AI as closed labs increasingly design their own silicon
NVIDIA 宣布以约 129 亿美元收购 Hugging Face,将控制这个拥有超过 1800 万开发者和 20 万家公司的开放模型核心平台。黄仁勋承诺保持平台开放和硬件中立,但这也为 NVIDIA 提供了触达海量开发者的算力分发渠道。对从业者来说,这既可能强化开放生态的算力支持,也引发开放平台被单一硬件厂商主导的担忧。
NVIDIA to Acquire Hugging Face
NVIDIA 官方确认以 129.303 亿美元收购 Hugging Face,计划扩展其平台、基础设施并让全球开发者更容易获取 AI 能力。这一官方声明意味着收购已从传闻进入确定阶段,对开放模型生态和开发者工具链的未来走向有直接影响,尤其是平台是否继续中立值得关注。
OpenAI 发布安全概览,宣布 GPT-6 Astra 是其迄今能力最强的大规模部署模型,并且首次在网络安全能力上达到公司准备框架中的 Critical 级别。这一定级意味着模型具备可能被用于高级网络攻击的潜在能力,对从业者而言,安全评估、红队测试和访问控制策略将成为部署该模型时的核心关注点。
Nvidia confirms it will buy Hugging Face for $12.9 billion
NVIDIA 确认将以 129 亿美元收购 Hugging Face,并披露该平台目前托管超过 300 万个模型、服务超过 1800 万开发者。这一数据凸显了 Hugging Face 在开放模型分发中的关键地位,收购完成后 NVIDIA 将直接掌握全球最大的模型与开发者入口,对开源 AI 生态的中立性带来新的不确定性。
llama.cpp 在 Metal 后端为 Flash Attention 向量核加入稀疏注意力支持,新增基于 n_kv_max 的稀疏 mask 提示,并把有限 mask 条目压缩为逐行索引列表以走稀疏计算路径。该更新能让 Apple Silicon 设备在支持稀疏 KV 掩码的推理场景中减少无效注意力计算,对长上下文和结构化稀疏推理有实际加速价值。
Meta closes in on the top with Muse Spark 1.3, and undercuts rivals on price
Meta 发布 Muse Spark 1.3,这是五个月内该系列的第四个模型,在智能体基准上提升最为明显,但仍落后于 Claude Fable 5.1 等头部模型。它最具竞争力的地方是价格,每个任务约 0.55 美元,低于所有同分段对手,对成本敏感的企业用户非常有吸引力。从业者关注它可以作为高性价比的智能体任务选择。
2x Faster Qwen3.8-Flash + GLM-5.3-Flash MTP
Unsloth 宣布为 Qwen3.8-Flash-Next 和 GLM-5.3-Flash 加入 MTP 支持并默认开启,可将这两款模型推理速度提升最多 2 倍。新版本还包含 170 多项训练、聊天、硬件和性能改进,涉及模型加载稳定性、界面响应速度以及工具调用保留等。对本地部署和微调这些新模型的用户来说,这是一次值得升级的实用更新。
OpenAI’s new reasoning technique alarms AI safety experts
OpenAI 的新模型 Astra 将采用一种名为 recurrent depth 的技术,使其推理过程不再局限于多数推理模型所采用的顺序思维模式。这一技术路线引发 AI 安全专家的警觉,因为它可能让模型产生更难预测和审计的思维路径。对从业者而言,这既是推理机制上的前沿探索,也意味着对齐与可解释性面临新的挑战。
The Modern CUDA Toolbox in Practice: A Step-by-Step Optimization Walkthrough
NVIDIA 发布了一篇面向开发者的 CUDA 优化实践文章,通过一个完整示例逐步演示现代 CUDA 工具箱中的性能调优思路。内容覆盖从初始实现到利用内存层级、线程组织和异步操作等关键优化手段,适用于科学模拟和大规模 AI 训练等 GPU 密集型场景。对需要深入理解 CUDA 性能瓶颈的工程师具有教学参考意义。
Gemini 3.8 Flash is Google's third budget model in six weeks while frontier models remain MIA
Google 推出 Gemini 3.8 Flash,这是六周内第三款 Flash 系列模型,在一些智能体编码基准上以更低单价对标 Claude Opus 5。但其更努力的推理方式使每个任务多消耗约 30% 的输出 token,即使 token 单价不变,实际使用成本反而可能高于前代。这对按任务评估成本的企业用户来说是个容易忽略的陷阱。
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
Google DeepMind 正式发布 Gemini 3.8 Flash 及 3.8 Flash Cyber 两款模型,进一步扩充其轻量级 Flash 系列。Cyber 版本可能针对网络安全或安全任务进行专门优化。对开发者而言,新的低成本模型提供了更多选择,尤其在智能体编码和安全场景值得关注。
Co-Designing AI Models Using Speculative Decoding for Faster LLM Inference
NVIDIA 开发者博客发布 AI 模型协同设计系列的第三篇文章,聚焦如何通过投机解码在不牺牲准确率的前提下加速大模型推理。文章讨论了模型架构与解码策略之间的协同优化,为推理系统设计者提供了减少延迟和提高吞吐的实战参考。对于正在优化服务性能的团队,这是一份结合理论与工程经验的实用资料。
Diagrid Catalyst 2.0 发布,为 AI 智能体新增持久化、可验证的执行能力
Diagrid 发布 Catalyst 2.0,为其 AI 智能体执行平台加入持久化与可验证执行能力,使智能体工作流在中断后可恢复并具备审计追踪。这对需要长时运行、多步工具调用和合规审计的生产级智能体应用有直接价值。
NeoMME: an efficient Multimodal-native and Multilingual Encoder
HuggingFace 发布 NeoMME,定位为多模态原生、多语言且高效的编码器,目标是在统一嵌入空间里同时处理多模态输入与多语言文本。对需要跨模态检索或多语言表示学习的场景,可作为基础编码器候选。
PyTorch 的 LocalTensor 为集合通信新增 ReduceOp.PREMUL_SUM 支持,允许在 Local 后端对归约操作执行预乘求和。这补齐了本地张量路径下的通信原语,有利于某些分布式训练优化下沉到 LocalTensor 实现。
llama.cpp 此 CUDA 改动允许多 GPU 场景按 split 使用并发流,并恢复此前被误跳过的 CUDA 图优化;由于图已按设备拆分、优化按 split 执行,该放开更合理。多卡推理用户可因此获得更高效的流调度和短 kernel 合并收益。
Anthropic ramps up Claude infrastructure with $35 billion Lambda deal
Anthropic 与英伟达支持的云服务商 Lambda 签署 350 亿美元云计算协议,用于扩展 Claude 基础设施。该交易表明 Anthropic 继续加码算力供给,也强化了英伟达生态中的新云厂商地位,对 AI 算力市场和推理成本有信号意义。
Latent Space 报道 Meta 的 Muse Spark 1.3 在能力上追平 GPT-5.6-Sol,被视为 Meta Superintelligence 重回前沿实验室的标志,并声称训练成本折扣超九成。这则信息强调 Meta 在大模型基座竞赛中的回归,对关注模型性价比和前沿格局的从业者有参考价值。
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
HuggingFace 博客展示用约 100 步 GRPO 微调一个 3.5 亿参数模型,即可改善结构化输出能力。对资源有限的团队,这表明小模型无需大规模 RLHF 也能在 JSON 等结构化生成上获得明显提升,是低成本对齐路径的实用案例。
v0.33.3-rc2: gemma4: image and audio input support
Ollama 在 v0.33.3-rc2 中为 gemma4 的 MLX 引擎增加图像和音频输入支持,图像走 26B、31B、e 系列的 transformer tower 或 12B 的 encoder-free 统一嵌入器,音频则复用现有 API 的 WAV、OpenAI input_audio 和转录上传路径。这使 Apple MLX 用户也能在本地跑 gemma4 多模态问答,覆盖视觉和语音输入。
Claude Fable 5.1 decoded a centuries-old royalist message hidden in plain sight since 1653
Anthropic 的 Claude Fable 5.1 据称破解了一个自 1653 年以来隐藏的保皇党数字谜题,该密码此前被研究者视为未解。这展示了模型在历史密码分析和符号推理上的能力,不过作为单一案例,更多是能力演示而非可泛化基准。
viable/strict/1788457839: [dynamo] Migrate DispatchKeySetVariable methods to tp_methods (#195168)
PyTorch Dynamo 将 DispatchKeySetVariable 的方法分派从手写 if-chain 迁移到声明式 tp_methods,并把 has 和 highestPriorityTypeId 改为 Method handler;has 仍仅在参数为常量时做常量折叠。这个内部重构简化了符号变量逻辑、降低后续维护成本,对普通用户无感,但有助于 Dynamo 跟踪稳定性。
此提交将 mtmd 预处理类中的 const 属性进一步传播,使多模态预处理器接口在只读上下文下更明确,便于编译器优化和 API 安全。对使用 llama.cpp 多模态推理的开发者而言,这是接口整洁性改进,不改变运行行为。
OpenAI CEO Sam Altman warns of "unsustainable silliness" in compute buildout
Sam Altman 警告全球 AI 数据中心建设出现「不可持续的愚蠢行为」,太多新云厂商在没有客户支撑的情况下宣布巨大容量,且算力成本下降可能让今天数十亿美元项目变成坏账。这对算力投资和 AI Infra 扩张有警示意义,也透露出 OpenAI 自身对重资产风险的担忧。
Legora reviewed 41 documents in minutes with GPT-6 Astra
法律科技公司 Legora 使用 GPT-6 Astra 在几分钟内审阅 41 份文档,找出了全部 4 个预埋错误,并在该财务审阅工作流中实现近 40% 的性能提升。这是 OpenAI 展示 GPT-6 Astra 在专业文档密集型场景中效率与准确率的案例,对金融法律自动化有参考意义。
Playco cut manual fixes 50% prototyping games with GPT-6 Astra
游戏公司 Playco 用 GPT-6 Astra 从一个灰盒基础搭建出三个主题游戏原型,并报告手动修复量比上一代模型减少 50%。这展示了该模型在代码生成和游戏原型迭代上的可用性提升,对开发者工具和创意原型有直接价值。
该提交修复了 Metal 后端在 ne00 等于 1 时 GLU 激活内核的分发错误,并禁用了一个定义不清的测试。对在 Apple Silicon 上运行 llama.cpp 且使用 GLU 类算子的用户,这个修复可以避免特定形状下走错内核导致错误或崩溃。
此提交在多个 mtmd 相关函数中将上下文标记为 const,尤其是 tokenize 系列接口,便于编译器判断安全性并提高代码可读性。这是 API 语义收紧,有助于多模态推理路径的维护和优化,对用户行为无直接影响。
世界生成模型来了3D头部玩家,可进入生产管线的场景级生成时代来临!
量子位报道一款可进入生产管线的 3D 世界生成模型,主打单图直出场景,源自顶会最佳论文落地。该能力意味着从单张图像到可编辑 3D 场景的生成正在接近实际生产管线,对 3D 内容、数字孪生等行业有直接影响。
该修复针对 Vulkan 后端 Flash Attention 反量化路径的触发条件,当 ne[3] 为 1 时跳过 nb[3] 检查,避免旧逻辑导致该路径仅在 KV 缓存满时才启用。修复后,Vulkan 推理在单流情况下也能正确走 FA 反量化路径,提升相关 GPU 上的性能表现。
vLLM 在 v0.29.0rc2 候选版本中修复了多模态请求在共享内存 worker 缓存里前缀覆盖项的处理问题,避免因缓存命中边界情况导致多模态输入数据错误。对使用 vLLM 部署多模态模型且开启共享内存缓存的团队,这个修复提高了服务稳定性。
该提交增强了 SYCL 后端的 API,使其支持设备间 peer-to-peer 拷贝,便于在多 GPU、多卡或不同加速器之间直接搬运张量。对在 Intel SYCL 生态中跑多卡 llama.cpp 推理的用户,这可以减少通过主存的转接、降低通信延迟。
Cursor 推出 Origin:面向智能体的 GitHub 替代方案
Cursor 发布 Origin,定位为面向智能体的代码托管与协作平台,被称为 GitHub 替代方案。这意味着代码仓库从面向人类 PR 流程转向支持 AI 智能体自主提交、审查与协作,对开发者工具和智能体软件开发范式有潜在重塑作用。
该提交修复了模型加载阶段内存峰值过高的问题,避免加载大型模型时 RAM 短暂飙升导致 OOM。对在内存受限环境本地部署大模型的用户,这能提升加载稳定性和资源利用率。
viable/strict/1788439121: [MPS] migrate log softmax to metal (#195441)
PyTorch 将 MPS 后端的 log softmax 迁移到 Metal 实现,新增 row、partial、finalize 等多个 kernel,按 reduction dim 大小和行数选择不同策略以减少内存占用并保持 GPU 饱和。这对在 Apple Silicon 上使用 MPS Graph 进行模型训练或推理的用户,可降低显存压力并提升 log softmax 效率。
该 PR 调整 Inductor 的 AOTI cpp wrapper,使嵌套区域在代码生成时保留其独立的 Inductor 配置,而不是被外层配置覆盖。这有助于 AOTInductor 在包含不同优化设置的内联区域时生成正确代码,提升 Ahead-of-Time 编译路径的灵活性。
PyTorch Dynamo 的 guards 机制新增对浮点值按位相等匹配和复数分量感知的比较支持。这可以更精确地识别张量值或参数变化,减少因浮点或复数比较不准确导致的误重编译,提升动态图捕获的性能。
viable/strict/1788427814: Update torch-xpu-ops commit pin (#195708)
PyTorch 更新了 XPU 算子库的提交指针,修复 safe-softmax 在输入含 NaN 时错误清零整行的问题,并修正 int4 打包矩阵乘法在 XPU 上的结果。对使用 Intel GPU 进行训练或推理的用户,这些修复直接影响数值正确性和低精度量化算子的可用性。
该 PR 修复了 setBackend 在复用后端时对缺失后端解引用的错误,避免后端未注册时引发空指针或崩溃。对在 PyTorch 运行时切换或复用设备后端的开发者,这是一个提升后端管理稳健性的修复。
Muse Spark 1.3 ✨, Gemini 3.8 Flash ⚡, intelligence vs cost 📊
TLDR AI 本期聚焦 Muse Spark 1.3、Gemini 3.8 Flash 以及智能水平与成本的权衡。对于需要快速跟踪前沿模型和成本效率趋势的从业者,这是一份当日要点速览,标题即点出最值得关注的发布与议题。
Language Models Can Control Their Own Attention
这篇论文针对大模型推理时注意力读取「KV cache」的开销,提出让模型在推理过程中显式声明相关上下文区域,从而跳过大部分无关的「KV cache」读取。这种声明式注意力机制能显著降低实际参与计算的 token 数量,并以较小的准确率损失换取更快的解码速度。对长上下文和高吞吐批量推理场景尤其有实用价值。
Cliff: Learning Process Rewards from the First Mistake
这篇论文针对可验证奖励强化学习中过程奖励信号稀疏的问题,提出「Cliff」方法,利用现成的语言模型自动定位推理轨迹中的第一个错误。随后它根据首个错误位置来重新构造 token 级优势函数,使训练信号能更精细地引导模型修正中间步骤。相比只依赖最终结果奖励的做法,该方法能提供更稳定的过程监督,从而提升推理模型的强化学习效率。
这篇论文解决推理模型蒸馏过程中采样 token 导致多样性下降的问题,提出「影响导向自适应在线策略蒸馏」。其核心是区分熵扩展型更新和熵收缩型更新,保留前者以维持生成多样性,同时用自适应优势收缩替代后者以稳定训练。这样可以在不牺牲推理性能的前提下,把教师模型的多样行为更完整地迁移给学生模型。
Post-Training Language Models for Gold-Medal Performance in Coding Competitions
这篇论文提出一条面向竞赛编程的后训练流水线,融合精选题目、合成推理数据、监督微调和强化学习,专门训练能解决高难度算法竞赛题的模型。配合迭代式测试时细化策略,这些模型在国际信息学奥林匹克评测基准上超过了顶尖人类选手的得分。该工作展示了后训练而非单纯扩大模型规模在极限代码推理上可以达到的高度。
CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing
这篇论文针对长上下文稀疏注意力中预填充阶段的路由质量问题,提出「CRISP」方法。它不再依赖间接的路由代理,而是引入一个直接的结构质量指标,并配合 sink 感知阈值来过滤背景噪声 token。该方法在保持或提升检索准确率的同时实现了显著的预填充加速,为超长上下文处理提供了更可靠的选择性注意力方案。
SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models
这篇论文针对交互式视频世界模型训练数据分散、缺少统一方法的问题,提出「SolarWM」开放框架和统一训练配方。它支持多种数据来源和生成器骨干,并提供可扩展训练方案,使模型能够进行长时程的实时推演。该工作降低了视频世界模型的研究门槛,为开放环境下的具身智能和模拟器构建提供了基础。
It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning
这篇论文提出「CoGR」方法,训练大语言模型同时为查询和物料生成紧凑的关键词表示,使得检索可以直接在倒排索引上完成,无需传统稠密向量检索的索引结构。它通过查询侧和物料侧的协同进化强化学习进行优化,让两端生成器互相适应。该方法兼顾了生成式检索的灵活性和倒排索引的高效性,对大规模检索系统有实际价值。
这篇论文提出「NeoMME」,一类单塔、多模态原生、多语言的小型双向编码器,采用掩码离散扩散进行预训练。它在视觉文档检索任务上表现强劲,同时能把后期交互嵌入压缩到很高程度,从而降低下游微调和推理成本。该工作为需要高效多模态文本表示的检索与排序场景提供了更轻量的基础编码器选择。
Debias-SparseGPT: Bias-Aware Pruning for Large Language Models
这篇论文关注大模型剪枝压缩过程中可能放大的人口统计偏差问题,提出「Debias-SparseGPT」。它在训练后稀疏化的同时引入表示层去偏机制,使压缩后的模型在保持稀疏度的前提下降低对特定群体的偏见。对于需要部署轻量模型又必须兼顾公平性的场景,该方法提供了一条可落地的路径。
Small Language Models as Judges for Rubric-Based Reinforcement Learning
这篇论文研究基于评分标准的强化学习奖励模型是否可以小型化,发现用小型探针式判别器可以替代大型生成模型来打分。这些小模型在保持与大型评判器一致性和跨任务迁移性的同时,显著降低了训练和推理开销。该结果意味着许多需要密集奖励信号的强化学习流程不必依赖昂贵的大模型评判。
Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
这篇论文提出「DisCo」研究智能体,其核心思路是从 GitHub 仓库中把可操作的知识蒸馏成可复用的技能单元,供后续自动化研究调用。通过积累和组合这些技能,DisCo 在多个自主机器学习研究基准上取得了显著性能提升。该工作展示了将社区代码经验转化为智能体长期能力的一种路径。
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
这篇论文提出「HarnessDev」基准,不再只看智能体的最终任务结果,而是评测它们自己搭建并迭代改进执行基础设施的能力。实验发现,不同模型自建的执行容器在能力和效率上差异很大,而且这些自建组件跨模型迁移时表现不佳。这一基准促使研究者关注智能体在工具基础设施层面的工程能力,而不只是单次任务表现。
Aspire: Can Models Self-Evolve from Vague Goals?
这篇论文提出「ASPIRE」基准,用于评估大模型智能体能否仅凭模糊的自然语言目标实现自我进化。基准覆盖目标解释、训练数据选择和权重级稳定改进等关键环节,实验揭示了这些环节中的明显困难。该工作为研究智能体自主设定和优化自身目标提供了系统性测试平台。
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
这篇论文针对智能体评测需要完整跑完任务导致成本高的问题,提出「EarlyEval」方法。它根据智能体的中间行为轨迹预测最终结果,并在高置信度时提前终止运行,从而节省算力和时间。实验表明,该方法能在几乎不损失评测准确率的情况下大幅降低评估开销,对大规模智能体基准测试尤其有用。
On the Design Fundamentals of Pixel Text Representation Learning
这篇论文系统改进了像素级文本表示学习,提出「Pixel Linguist II」。它引入可变分辨率训练、自然图像与文本的对齐、布局感知渲染和多语言课程四项关键设计,让模型更好地理解图像中的文字。该方法在多个基准上达到当前最优,并对图像压缩表现出很强的鲁棒性,适合文档理解和视觉文本检索等实际任务。
Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering
这篇论文针对知识型视觉问答中仅靠表面视觉相似度检索知识效果有限的问题,提出「KBMR」方法。它利用多模态语言模型将图像按语义身份而非外观特征进行嵌入,并通过连续蒸馏和困难负样本采样来训练检索器。这一方法在检索相关知识和视觉问答任务上都取得了明显提升,有助于模型回答需要外部知识的图像问题。
S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?
这篇论文构建了「S³Gym」基准,用于测试大模型智能体是否能把自我测试和自我判断转化为真正的自我改进。通过在多种文字游戏中的交互实验,作者发现有效的自我改进高度依赖于任务结构以及经验如何被表示和利用。该工作为理解智能体自主能力边界以及设计自我进化系统提供了实证依据。
这篇论文提出一个模块化流水线,用于从历史报纸扫描件中提取结构化文本和元数据。它采用小型可解释模型分阶段处理版面分析和文字识别,最终构建了一个包含数十亿高质量 token 的开放数据集。该数据集为训练和评估面向历史文本的语言模型提供了宝贵资源,也展示了低成本处理大规模扫描文献的可行方案。
DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation
这篇论文指出传统手语处理系统只做句子级翻译,忽略了对手语理解至关重要的语篇现象,因此提出「DiscoSign」框架。它基于模块化大语言模型,重点处理空间共指消解等三个语篇级现象,使文本到手语注释的翻译更符合真实手语表达习惯。该工作将语言学研究成果融入神经翻译框架,对手语机器翻译的连贯性和自然度有实际提升。
这篇论文解决低资源作者风格迁移中,只用少量参考样本难以同时保持目标风格和原文语义的问题。现有方法把多个参考压缩成单一静态作者嵌入,丢失了上下文相关的风格变化;「HyperStyler」改用上下文感知的风格导航和超网络来动态生成风格控制参数。这样可以在低资源条件下更精细地分离风格与内容,提升风格保真和语义一致性。