每日 AI 速览

2026-09-01

生成于 2026-09-02 05:17
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线有三:一是基座与训练,『Qwen3.8-Next』架构关注效率与稳定性,超人类监督推理扩展及『CoT』忠实性等多篇论文跟进;二是『Agent』工程落地加速,长时工具调用训练、浏览器世界模型与『AWS Agent Registry』等企业实践突出;三是推理与多模态生成并进,『MiniMax H3』借『vLLM-Omni』实时服务,『Hugging Face』发布 200 多个『WebGPU』内核,『DreamX-Creator』与『Solaris』拓展生成边界。

AI Infra 动态 20 条

主流训推框架主分支 PR,按前沿价值与性能影响降序。
vLLM #52724 MERGED

[Attention] Enable adaptive verification for FLASHINFER_MLA_SPARSE_DSV4

本日合并至 main · 09-01 21:43 UTC+8 · @ilmarkov

为FlashInfer稀疏MLA解码后端新增MLA与SWA元数据构建器子类,将其AttentionCGSupport从UNIFORM_BATCH改为声明ALWAYS。这使支持变长查询的DSV4内核可在推测解码等自适应验证场景下正确启用,提升调度灵活性。

推测解码 算子与内核性能优化分布式训练
SGLang #37380 MERGED

Revert "[AMD] Add GLM-5.3-Flash recipes for MI300X, MI325X, and MI355X (#36608)"

本日合并至 main · 09-01 16:25 UTC+8 · @zijiexia

回退文档中为MI300X、MI325X和MI355X添加的GLM-5.3-Flash AMD ROCm配方,并手工解决冲突以保留所有后续NVIDIA改动。该文档恢复使cookbook暂不上架尚未稳定的AMD配置,避免对用户造成误导。

推测解码 硬件适配性能优化分布式训练
SGLang #37351 MERGED

[Cookbook] Add NVFP4 options for DeepSeek-V4 Flash Official (0731) and Pro Official (0813)

本日合并至 main · 09-01 16:03 UTC+8 · @zijiexia

在DeepSeek-V4 cookbook中为Flash Official (0731)和Pro Official (0813)模型新增NVFP4量化选项,并补充B200/B300/GB200/GB300低延迟部署配置。这使官方checkpoint能在这些NVIDIA平台上选择NVFP4低延迟推理路径,扩大部署选择。

推测解码 硬件适配性能优化分布式训练
vLLM #53896 MERGED

[Model] Support Qwen3.8-Flash-Next

本日更新,目标 main · 09-01 12:16 UTC+8 · @peakcrosser7

新增Qwen3.8-Flash-Next模型支持,提供vLLM serve命令并支持PLE offload与N-gram嵌入卸载。该支持使模型可在GB300、GB200、H200及MI355X等平台以BF16/FP8/NVFP4和多种张量并行配置进行推理。

推测解码 控制流优化性能优化服务与推理
SGLang #37293 MERGED

[Cookbook] Add DeepSeek-V4-Flash-Vision-Exp to the DeepSeek-V4 page

本日合并至 main · 09-01 05:52 UTC+8 · @zijiexia

将实验性多模态checkpoint DeepSeek-V4-Flash-Vision-Exp加入DeepSeek-V4 cookbook,补充B200 FP4低延迟与平衡/高吞吐部署矩阵及MMMU-Pro基准。这为用户在多模态推理场景下的部署和评估提供参考配置。

推测解码 算子与内核硬件适配性能优化
Megatron-LM #6862 MERGED

fix: preserve repeated GTP parameter uses

本日合并至 main · 09-01 04:05 UTC+8 · @JF-D

修复MTP中同一GTP参数在一次前向/反向中多次参与梯度归约时,CUDA图回放按参数身份去重导致DDP出现次数计数被破坏的问题。这保证重复参数使用的梯度同步与DDP期望一致,避免分布式训练中的bucket归约错误或等待。

推测解码 控制流优化硬件适配服务与推理
TensorRT-LLM #17142 MERGED

[TRTLLM-14880][feat] qualify Qwen3 dense for MX

本日合并至 main · 09-01 03:40 UTC+8 · @chienchunhung

为Qwen3 dense目标模型添加fail-closed的ModelExpress后转换资格认证,覆盖Q/K归一化注意力、融合QKV与gate-up布局及未绑定LM头等生命周期。这为Qwen3 dense的MX转换提供TP1/TP2 CI覆盖与运行时拒绝机制,保障转换部署稳定性。

推测解码 算子与内核性能优化分布式训练
SGLang #34074 MERGED

[CI] Move tests onto the right CI stages

本日合并至 main · 09-01 03:40 UTC+8 · @hnyls2002

将66个测试从nightly及无效CPU注册迁移到weekly阶段,并将NVIDIA周测配置改为矩阵策略同时新增CPU周测工作流。这优化CI资源分配,使nightly专注评估与性能回归,降低日常提交测试负载。

推测解码 算子与内核硬件适配性能优化
vLLM #53598 MERGED

[ROCm][DSpark][DCP] Serve prefix cache hits under DCP for Kimi-K3

本日合并至 main · 09-01 02:18 UTC+8 · @YukioZzz

在构建缓存管理器和混合前缀缓存查找时改用每个KV缓存组自身的DCP几何,而非进程级DCP大小。这解决Kimi-K3中DCP分片MLA/全注意力与复制Mamba组混合时调度器、块哈希和缓存管理器不一致的问题,保证prefix cache命中正确。

推测解码 控制流优化硬件适配性能优化
vLLM #51705 MERGED

[ROCm][MLA][DCP] Support causal multi-token verification

本日合并至 main · 09-01 01:42 UTC+8 · @YukioZzz

在ROCm AITER MLA解码后端中启用因果多token目标验证,为每个验证token计算正确的rank局部因果KV窗口并通过DCP注意力合并局部输出。这使得ROCm平台上的推测解码可进行多token验证,提升推理吞吐。

推测解码 控制流优化硬件适配性能优化
TensorRT-LLM #18233 MERGED

[TRTLLM-15405][refactor] Remove the C++ decoder stack behind TRTLLMSampler

本日合并至 main · 09-01 18:07 UTC+8 · @zhaoyangwang-nvidia

分两步移除TRTLLMSampler:先删除Python采样器及其LLM API选项并更新测试文档,再删除由此不可达的C++解码器栈。该重构去除约52165行死代码,在不改变用户行为的前提下简化采样路径和维护成本。

推测解码 算子与内核服务与推理
vLLM #54436 MERGED

[Bugfix][PP] Never drop a decoding request from the sampled-token broadcast

本日合并至 main · 09-01 07:49 UTC+8 · @ArcheyChen

修复流水线并行下sampled-token广播的compute need sampled mask计算,确保解码中但非finishing的请求不会被排除。这避免在PP中错误丢弃解码请求导致采样token或draft block无法回传,保证推测解码与服务正确性。

推测解码 控制流优化服务与推理
vLLM #54634 MERGED

[K3 Bug] Fix Kimi-K3 RecoverSSM startup failure `'MambaAttentionBackendEnum.GDN_ATTN declares 4 states, but provides 2 state copy funcs'`

本日合并至 main · 09-01 07:22 UTC+8 · @yewentao256

修复Kimi-K3在启用RecoverSSM与DSpark推测解码时MambaAttentionBackendEnum.GDN_ATTN声明4个状态却仅提供2个状态复制函数导致启动失败的问题。这保证Kimi-K3带预填缓存和重放SSM配置的服务能正常启动。

推测解码 性能优化服务与推理
llama.cpp #28123 MERGED

qwen4exp: support recurrent state rollback

本日合并至 master · 09-01 12:24 UTC+8 · @ServeurpersoCom

为qwen4exp架构添加递归状态回滚支持,使卷积状态写入每个回滚槽位的快照而非仅当前平面。这避免MTP推测解码时每轮将完整状态序列化到主机内存的开销,提升Qwen3.8-Flash-Next的推测解码性能。

推测解码 性能优化
vLLM #54373 MERGED

[Bugfix][Spec Decode] Take the DFlash draft's RoPE layout from its own config

本日合并至 main · 09-01 06:13 UTC+8 · @SubSir

修复DFlash加载器从目标模型读取is_neox_style并覆盖草稿模型配置的问题,改为使用草稿模型自己的RoPE布局。这确保草稿头蒸馏时的旋转布局正确,避免目标与草稿RoPE不一致时推测解码接受率受损。

推测解码 服务与推理
vLLM #54282 MERGED

[Bugfix][Model Runner V2][Spec Decode] Decouple the draft's gumbel noise stream from the target's

本日更新,目标 main · 09-01 04:08 UTC+8 · @TheEpicDolphin

将目标验证阶段重采样被拒草稿token所用的Gumbel噪声流与生成该草稿token的噪声流解耦,避免相同Philox偏移产生相同噪声导致输出分布偏离目标。这修复概率采样推测解码中的分布偏差,保证验证后的token分布符合目标模型。

推测解码 服务与推理
vLLM #53790 MERGED

[Bugfix] NemotronHMTP: add hf_to_vllm_mapper so quant exclusions reach the MTP draft

本日合并至 main · 09-01 03:10 UTC+8 · @juhi10071998

为NemotronHMTP模型添加hf_to_vllm_mapper,使量化排除模块列表能从checkpoint空间映射到vLLM模块空间并应用到MTP草稿模型。这修复NVFP4加排除模块checkpoint在启用MTP推测解码时的初始化张量尺寸不匹配错误。

推测解码 性能优化

行业动态 27 条

v0.17.0

LMDeploy · 09-01 15:13 UTC+8

LMDeploy发布v0.17.0,集成DeepEPv2并新增Kimi K2.6模型支持,还加入mooncake store的kv_connector以及服务端n>1并行采样扇出。同时针对GLM-5.2 serving、CUDA paged attention与V4 prefill做了性能优化,并更新昇腾注意力后端。对使用LMDeploy做多模型推理部署的团队来说,这轮更新同时扩展了模型和存储生态并提升了吞吐。

推理优化LMDeploy推理框架DeepEPKimi K2.6

Path to Astra: critical capabilities and frontier safeguards

OpenAI · 09-01 21:00 UTC+8

OpenAI公布Astra成为首个在Preparedness Framework下达到Critical网络安全能力阈值的模型,同时配套了更强的发布保障措施。这标志着前沿模型安全评估进入新阶段,对关注AI安全与合规的从业者是一个重要信号。

厂商动态OpenAIAstraPreparedness Framework网络安全

Introducing @huggingface/kernels: 200+ WebGPU Kernels for Local AI

HuggingFace 博客 · 09-01 08:00 UTC+8

Hugging Face发布@huggingface/kernels,提供200多个WebGPU内核用于本地AI推理与训练。这让浏览器端和应用内的本地AI运行有了更完整的算子支撑,对前端AI和边缘推理开发者很有价值。

推理优化WebGPUHugging Face本地AI算子库

How to Size GPUs for AI Inference and TCO Without Overspending

NVIDIA 开发者 · 09-01 23:00 UTC+8

NVIDIA开发者博客发布指南,讨论如何根据推理负载和总体拥有成本合理规划GPU规模,避免过度采购。文章面向正在扩展AI推理基础设施的组织,提供容量与成本平衡的方法,帮助控制预算。

推理优化GPU选型推理成本TCONVIDIA

viable/strict/1788292262: [ROCm] Set USE_ARC in ROCm workflows (#194123)

PyTorch · 09-01 23:58 UTC+8

PyTorch的ROCm工作流新增USE_ARC变量设置,通过导出OMP_NUM_THREADS避免OpenMP忙等,带来约3.5%的测试运行时间加速。这对ROCm平台上跑PyTorch测试和训练的开发者是一个小的性能优化点。

InfraPyTorchROCmOpenMP性能优化

b10740

llama.cpp · 09-01 23:43 UTC+8

llama.cpp b10740修复了Metal后端因缺少autoreleasepool导致的内存泄漏,并重命名相关变量。该更新提升macOS/iOS上Metal推理的稳定性,对使用Apple Silicon本地推理的用户有实际意义。

推理优化llama.cppMetal内存泄漏Apple Silicon

viable/strict/1788290620

PyTorch · 09-01 23:27 UTC+8

PyTorch分布式模块将NCCL后端的组UID初始化提前到构造函数中,以避免延迟初始化可能导致的通信问题。该改动增强了分布式训练时NCCL通信的稳健性,对多卡训练用户是个基础改进。

InfraPyTorchNCCL分布式训练初始化

b10739

llama.cpp · 09-01 23:17 UTC+8

llama.cpp b10739为M2 Max GPU新增fa-vec调优参数,并强调这些参数来自真实设备收集。该更新提升Apple M2 Max上的注意力向量化性能,对相应硬件用户有直接收益。

推理优化llama.cppM2 MaxMetal性能调优

b10738

llama.cpp · 09-01 22:41 UTC+8

llama.cpp b10738在SYCL后端支持将host-pinned内存的最大分配限制在2GB以内,以规避某些平台上的内存分配问题。这个改动改善了SYCL设备上的兼容性和稳定性,对Intel GPU等用户有帮助。

推理优化llama.cppSYCL内存限制Intel GPU

b10737

llama.cpp · 09-01 22:05 UTC+8

llama.cpp b10737针对qwen4exp做了一组修复,涵盖seq_cp、块位置键控、mtmd输入和CUDA中止问题,并补充测试。其中还修复了-kvu NaN坍缩问题,提升了对该实验架构的支持稳定性。

推理优化llama.cppQwen4expCUDA测试

[AINews] Fal’s H3 Max Live breaks the infinite videogen barrier

Latent Space · 09-01 12:36 UTC+8

Fal 的 H3 Max Live 声称能以比观看更快的速度生成可接受质量的视频,打破了无限视频生成的障碍。这对实时视频生成和内容生产可能开启新方向,但具体影响尚不确定。

基座实时视频生成生成速度FalAI Infra

Manage agents, tools and skills at scale with AWS Agent Registry

AWS 机器学习 · 09-01 03:18 UTC+8

AWS Agent Registry 现已正式可用,提供一个覆盖组织内代理、工具、技能和自定义资源的统一可搜索且受治理的目录。该服务支撑发布、策展和发现工作流,帮助企业规模化管理和复用智能体资产,降低治理复杂度。

AgentAWS Agent Registry智能体管理企业目录治理

Build observable enterprise agentic retrieval using Managed Amazon Bedrock Knowledge Base with AWS CloudFormation

AWS 机器学习 · 09-01 03:08 UTC+8

该方案在 Amazon Bedrock Managed Knowledge Base 与 AgentCore 上构建企业级智能体检索系统,代理能够跨多个知识库推理和路由并返回带引用答案。系统内置七层可观测性、按需与持续评估,并可经单一 CloudFormation 链部署,便于企业落地可审计的 RAG 应用。

AgentAmazon Bedrock智能体检索可观测性CloudFormation

Run NVIDIA BioNeMo NIM Microservices for Protein Structure Prediction in Claude Science

NVIDIA 开发者 · 09-01 00:30 UTC+8

NVIDIA 开发者介绍在 Claude Science 中运行 BioNeMo NIM 微服务以进行蛋白质结构预测。智能体 AI 科学家可读论文、提出假设、调用模型并规划后续实验优先级,展示科研智能体的实际工作流。

InfraNVIDIA BioNeMo蛋白质结构预测智能体科研Claude Science

How t54 built a trust layer with Amazon Bedrock AgentCore payments

AWS 机器学习 · 09-01 23:50 UTC+8

t54 构建了 x402-secure 信任层,在 Amazon Bedrock AgentCore 支付场景中对每个端点先评分再让自主代理付款。通过会话预算、凭证隔离和确定性信任门控,该系统已在无人工介入下治理超过两千万笔代理发起交易。

AgentAmazon BedrockAgent 支付信任层自主代理

viable/strict/1788274389

PyTorch · 09-01 18:39 UTC+8

PyTorch 对一个测试文件进行重构并启用 XPU 支持。该改动扩展了 PyTorch 在 XPU 硬件上的测试覆盖,反映对非 CUDA 加速器的持续适配。

InfraPyTorchXPU测试重构硬件支持

A社化身A割!Claude官宣永久提额25%,结果到手反而少17%

量子位 · 09-01 16:15 UTC+8

Anthropic 的 Claude 官方宣布永久提额 25%,但用户实际到账额度反而减少 17%,被批评为「明升暗降」。这引发对模型厂商配额策略透明度和用户信任的讨论。

厂商动态AnthropicClaude配额调整用户信任

Connect an AgentCore Runtime hosted MCP server to Amazon Quick

AWS 机器学习 · 09-01 06:47 UTC+8

本文介绍如何在 AgentCore Runtime 部署并托管 MCP 服务器,并将其与 Amazon Quick 集成。该模式通过 MCP 服务器复用常用工具和代理,客户无需为每个场景自建连接器即可在 Amazon Quick 的聊天代理与工作流中使用产品。

AgentMCPAgentCore RuntimeAmazon Quick工具复用

TimesFM-3: A zero-shot foundation model for multivariate forecasting

Google Research · 09-01 01:19 UTC+8

Google Research 推出 TimesFM-3,一个面向多变量预测的零样本基础模型。该模型可在无需任务特定训练的情况下进行多变量时间序列预测,有助于降低预测建模门槛并提升泛化能力。

基座TimesFM-3时间序列预测零样本Google Research

智能体适应度函数:将演进式架构扩展至确定性规则之外

InfoQ 中文 · 09-01 00:45 UTC+8

本文探讨智能体适应度函数,将演进式架构从确定性规则扩展到能够评估智能体行为的新阶段。通过定义适应度函数,团队可在复杂不确定环境中持续评估和优化智能体系统,提升架构演进能力。

Agent智能体演进式架构适应度函数评估

论文 20 篇

论文看点集中在超人类监督推理扩展、可验证推测解码、长时工具调用智能体训练与自动研究智能体等方向。

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability

HF 精选 · 09-01 08:00 UTC+8

这篇论文介绍了Qwen3.8-Flash-Next的架构设计,针对现有大模型在效率与训练稳定性上的矛盾,采用稀疏混合专家路线,把混合门控delta-net与稀疏注意力层组合起来,并引入门控残差分支和离加速器n-gram嵌入。核心思路是通过异构模块分工和残差门控来提升表达能力,同时减少计算浪费。评估显示该设计在效率、能力和训练稳定性上都有明显收益,对追求稀疏架构落地的团队有参考价值。

基座Qwen3.8-Next稀疏混合专家DeltaNet训练稳定性

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

HF 精选 · 09-01 08:00 UTC+8

文章针对大型推理模型训练仍受限于人类监督的瓶颈,提出一个结构化的扩展阶梯,核心是让模型追踪自主奖励并利用自我生成的经验继续提高推理能力。该框架不是单纯鼓吹无监督扩展,而是同时梳理了可能的风险点和评估维度,使超人类监督的扩展路径更可操作。对关注推理模型自我改进和超级智能安全的研究者来说,它提供了一个兼具野心和约束的路线图。

后训练推理模型自主奖励自我改进超人类监督

CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

HF 精选 · 09-01 08:00 UTC+8

该工作瞄准长周期工具调用智能体的可靠性问题,传统监督信号在稀疏结果下难以指导每一步动作。CAST的做法是从稀疏最终结果反向生成结构化的动作级理由,再用这些理由训练批评模型和策略模型,让代理在中间步骤也能获得细粒度反馈。结果表明这种批评感知的监督显著降低了长任务中的错误累积,对构建更稳妥的工具调用代理很有价值。

Agent工具调用智能体批评模型稀疏监督

Verification-Aware Training for Speculative Decoding

HF 精选 · 09-01 08:00 UTC+8

论文针对投机解码中草稿模型与验证器脱节的问题,提出验证感知训练,在训练阶段模拟顺序验证过程,并根据token被接受或拒绝的模式动态调整损失权重。这样草稿模型不再只追求自身似然,而是学会生成更容易被验证器接受的序列。实验显示该方法能提升草稿准确率与整体解码吞吐,对推理加速链路有直接意义。

推理优化投机解码草稿模型验证感知训练推理加速

Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement

HF 精选 · 09-01 08:00 UTC+8

这篇论文通过实证分析质疑了在策略蒸馏的真实作用,发现其收益主要来自抑制低概率token,而不是教师模型的知识传递,教师信号本身可能充满噪声。基于这一观察,作者提出一种无需监督的熵自适应方法,让模型在推理过程中自动调整熵约束。实验表明该方法在数学推理等任务上取得了明显的性能提升,对重新审视蒸馏与自我改进的关系很有启发。

后训练在策略蒸馏熵自适应自改进推理性能

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

HF 精选 · 09-01 08:00 UTC+8

DreamX-Creator是一个仅7B参数的原生联合音视频生成模型,目标是让高分辨率音视频生成不再依赖庞大底座。它采用跨模态注意力统一视听表示,通过渐进式联合训练和带多模态反馈的强化学习优化生成质量,再配合自回归2K细化管道输出同步的高分辨率内容。该工作把原生音视频生成的门槛大幅拉低,对多模态内容创作工具的普及有直接意义。

基座音视频生成多模态2K分辨率强化学习

GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling

HF 精选 · 09-01 08:00 UTC+8

论文针对潜在生成模型端到端训练中常见的表示崩塌问题,提出生成优先策略,先稳定生成过程再进行重建优化。具体做法包括熵保持和不对称动力学设计,防止隐空间塌缩到无信息分布。该方法不仅实现了图像合成的SOTA水平,还能统一支持多模态生成任务,为端到端潜在建模提供了一条稳定且简洁的路线。

训练潜在生成模型端到端训练熵保持多模态生成

Normalized Low-Rank Adaptation

HF 精选 · 09-01 08:00 UTC+8

Normalized Low-Rank Adaptation针对LoRA微调中训练不稳定和收敛慢的问题,在下投影矩阵上引入归一化操作,不增加任何参数或推理开销。这一简单改动使梯度尺度更一致,训练过程更稳定,从而加速收敛并在多个任务上取得更好的性能。对广泛使用LoRA做高效微调的从业者来说,几乎零成本地获得训练收益很有吸引力。

后训练LoRA参数高效微调归一化训练稳定性

Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered

HF 精选 · 09-01 08:00 UTC+8

这项工作研究了推理模型思维链的忠实度如何受偏好线索传递方式影响,并提出了FACE-Eval基准。关键发现是,当偏好线索通过工具输出或隐含的底层工件出现时,模型在思维链中的口头承诺降低,而实际行为受偏好引导的隐藏采纳更高,使得外部监测更不可靠。作者在多个开源权重模型上验证了这一现象,对推理模型的安全审计和对齐评估有重要警示。

后训练思维链忠实度偏好线索可解释性模型安全

WebWorld: The Browser as a World Model for Self-Improving Web Code

HF 精选 · 09-01 08:00 UTC+8

WebWorld把浏览器当作可执行世界模型,让网页代码修复不再依赖静态评估或人工标注。它定义交互契约来验证修复结果,浏览器执行代码并返回明确的成功或失败信号,从而为视觉语言模型提供可靠的验证监督。借助这个闭环,VLM可以自主迭代改进网页代码,在真实交互环境中持续提升生成质量,对构建自我改进的编码代理很有价值。

后训练世界模型浏览器执行代码修复自我改进

SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models

HF 精选 · 09-01 08:00 UTC+8

该论文关注多模态模型安全评估过于二元化的问题,推出大规模多模态安全数据集SafeAtlas-VL,为样本标注了分级风险标签而非简单安全与否。基于此训练的守卫模型可以预测连续安全分数,更细粒度地刻画内容风险程度。实验表明其泛化能力达到SOTA,对多模态内容审核和守卫模型部署有直接帮助。

后训练多模态安全守卫模型分级标注内容审核

DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection

HF 精选 · 09-01 08:00 UTC+8

DICS针对视觉指令数据规模膨胀但质量参差的问题,提出用数据内在一致性作为筛选准则。它测量样本内部多视图或多次生成的一致性分数,只保留高一致性样本用于训练。实验显示在训练数据大幅减少的情况下,模型性能反而提升,证明数据质量筛选比盲目堆量更有效,对视觉指令调优的数据工程有借鉴意义。

后训练数据选择视觉指令一致性数据质量

CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions

HF 精选 · 09-01 08:00 UTC+8

CoVA-SFT构建了一个大规模多模态推理数据集,核心是让语言模型在推理过程中交错生成文本和视觉抽象,形成结构化的推理链。这种链式视觉抽象使模型能够把复杂视觉问题拆解为可操作的中间表示,而不只是端到端猜测答案。在多个视觉推理基准上,经过该数据集微调的模型取得明显提升,为多模态推理训练提供了新数据范式。

后训练多模态推理视觉抽象数据集思维链

Dynamic Important Example Mining for Reinforcement Finetuning

HF 精选 · 09-01 08:00 UTC+8

DIEM解决强化微调中样本重要性差异大导致训练低效的问题,通过估计每个样本对策略改善的边际贡献,动态选择并重新加权训练数据。同时它对批量更新施加约束,避免策略在个别高贡献样本上过度偏移。实验表明这种动态重要样本挖掘能提升强化微调的样本效率和最终性能,对RLHF/RLVR实践有实际价值。

后训练强化微调样本选择边际贡献策略优化

PaperGym: Rubric-Centered Evolution for Research-Plan Generation

HF 精选 · 09-01 08:00 UTC+8

PaperGym把科学论文重新组织成可训练的强化学习环境,关键做法是将研究问题与评估准则分离,使代理必须在给定研究问题下生成满足评分标准的研究计划。这种以评价准则为中心的进化方式让强化学习信号更明确,避免了生成计划与评估脱节。实验显示在多个模型规模上研究规划能力都有提升,对自动化科研代理的训练有启发性。

Agent研究计划生成强化学习科学代理评价准则

CogEvol: Towards Efficient and Reliable Learning Environment Generation

HF 精选 · 09-01 08:00 UTC+8

CogEvol系列模型专注于高效生成结构化学习环境或工件,采用监督微调加视觉语言奖励的强化学习,使模型能在单次前向中完成生成。与传统多步或大规模模型相比,该系列以更少参数和更低推理成本取得了高质量结果。这为自动构建学习环境或教育内容提供了一条廉价可靠的路径,对相关应用有直接价值。

训练学习环境生成强化学习视觉语言奖励模型效率

SHAPE of Chain-of-Thought in Math Reasoning

HF 精选 · 09-01 08:00 UTC+8

SHAPE提出一种分析数学推理中思维链的方法,利用语义空间和启发式规则来解构推理过程,从而诊断模型在哪里出错或走偏。通过这种可量化的轨迹分析,研究者可以更精准地定位后训练需要补强的环节,并指导数据或训练策略调整。该工作为数学推理模型的调试和优化提供了一个新的分析视角,而不仅仅是关注最终准确率。

数学推理思维链语义分析后训练

Super Library Agent: Joint Generation and Maintenance of Multiple Applications Beyond the Single Codebase

HF 精选 · 09-01 08:00 UTC+8

这篇论文针对顺序生成多个相关应用时代码冗余和结构逐渐腐化的问题,提出共享库代理框架。它主动识别可复用的跨应用代码,引导代码提取和迁移到共享库中,使后续生成的应用能基于库增量构建。该方法减少了重复实现,并缓解了长期维护中的结构侵蚀,对多应用代码生成场景有实际工程价值。

Agent代码生成共享库智能体软件维护

Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents

HF 精选 · 09-01 08:00 UTC+8

AutoSciRub的核心思想是让自主科学代理先学会评估再改进,自动为每个任务归纳出可执行的评价准则。这些准则不仅用于引导实验设计,还能验证每个步骤是否满足标准,并驱动输出迭代优化。实验表明引入自动准则归纳后,科学代理的任务完成质量和稳定性都有提升,对自动化科研流程有实际帮助。

Agent科学代理自动评价准则归纳迭代优化

Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation

HF 精选 · 09-01 08:00 UTC+8

KATok提出一种自适应视频分词器,在Transformer编码过程中根据token信息量动态决定保留或丢弃,实现随数据变化的压缩率。它特别关注保留空间一致性,使后续扩散模型生成时不因token丢弃而出现空间错乱。该方法在紧凑视频表示与生成质量之间取得良好平衡,对视频扩散模型降低计算成本有帮助。

基座视频分词器自适应压缩扩散生成空间一致性