论文 20 篇
「PlanBench-XL」面向大规模工具生态评测大模型工具调用智能体的长程规划,呼应当下Agent能力边界探索,值得一读。
PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems
HF 精选 · 06-23 08:00 UTC+8
针对智能体在工具数量庞大、可见性受限、还会动态出故障的真实环境里规划易崩溃的痛点,「PlanBench-XL」搭建了一个大规模工具生态下的长程规划评测,专门考察智能体在干扰下重新规划、适应变化的能力。它不只看一次性能否给出可行计划,而是把工具不可见、中途失效等扰动注入进来,逼出模型在长链路任务里的脆弱性。结果显示当前模型在工具一多、环境一动起来就明显掉链子,为工具型智能体的鲁棒性研究提供了更贴近落地的标尺。
Agent智能体评测工具调用长程规划
OpenRath: Session-Centered Runtime State for Agent Systems
HF 精选 · 06-23 08:00 UTC+8
多智能体系统的运行状态往往散落难追、出错难复现,「OpenRath」借鉴 PyTorch 的编程范式,把「会话(Session)」抽象成系统的中心运行时对象,让 fork、merge、replay 这些操作变成显式可控的一等公民,并完整记录执行状态。这样一来开发者既能像写深度学习代码一样组织多智能体逻辑,又能随时分叉探索、合并分支或回放复盘,对调试和可观测性是实打实的改善。
Agent多智能体智能体框架运行时
Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention
HF 精选 · 06-23 08:00 UTC+8
「分组查询专家(GQE)」把 MoE 思路引入到 GQA 自注意力里,根据 token 内容选择性地激活查询头,相当于在注意力层面做稀疏化。它在省算力的同时保留了分组查询注意力对 KV 缓存友好的特性,等于让模型按需调度注意力容量而不牺牲推理时的显存与吞吐优势,是把专家混合从 FFN 延伸到注意力机制的一次有意思的尝试。
基座模型架构MoE注意力机制
EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory
HF 精选 · 06-23 08:00 UTC+8
长上下文检索和智能体记忆里,静态嵌入难以随语境演化,「EvoEmbedding」提出一种可演化的动态嵌入模型,靠一份持续更新的潜在记忆来生成自适应表示,让同一段内容的向量随上下文不断微调。这种「会进化」的表示在长上下文场景下提升了检索效果,思路上把检索向量从一次性编码变成了带状态的动态过程,对做智能体记忆和长文档检索的人有参考价值。
Agent向量检索智能体记忆长上下文
HydraHead: From Head-Level Functional Heterogeneity to Specialized Attention Hybridization
HF 精选 · 06-23 08:00 UTC+8
「HydraHead」从注意力头功能异质性这一可解释性观察出发,在头粒度上把全注意力和线性注意力混搭起来,用可解释性驱动的方式挑选哪些头该用哪种注意力,再通过尺度归一化做融合。这种细到单个头的混合既拿到了线性注意力的长序列效率,又靠少量全注意力头守住表达力,最终在长上下文任务上表现更好且训练开销更低,是混合注意力架构里一个落点很细的方案。
基座注意力机制模型架构长上下文
Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation
通义千问HF 精选 · 06-23 08:00 UTC+8
针对自蒸馏只学正确答案、丢掉了错误中可学信号的问题,「TAPO」让模型从自己的错误里学习:构造出保留错误推理、再附上自然语言诊断与纠正的「微反思轨迹」,把「错在哪、怎么改」显式写进训练数据。这样模型练到的不只是正确路径,还有纠错能力,在推理任务上超过了传统自蒸馏方法,对想提升推理鲁棒性的训练实践是个可借鉴的数据构造思路。
后训练推理训练自蒸馏强化学习
Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark
HF 精选 · 06-23 08:00 UTC+8
物理科学研究的「深度研究」智能体到底行不行?「PhySciBench」基准给出的答案是当前 LLM 智能体表现相当有限,于是作者顺势提出「DelveAgent」框架,靠模块化设计加上物理学接地的机制来提升准确率。它把通用智能体在硬核科研场景里的短板量化出来,也示范了用领域知识约束智能体行为的做法,对想把智能体推进到严肃科研领域的人是一份有针对性的参考。
Agent科研智能体智能体评测多智能体
Tapered Language Models
HF 精选 · 06-23 08:00 UTC+8
「锥形语言模型(Tapered LM)」挑战了 Transformer 各层均匀分配参数的惯例,提出把更多参数堆在靠前的层、靠后的层逐渐变瘦,在总参数量和算力都不增加的前提下提升性能。这等于在不加预算的情况下重新分配模型容量,背后暗示不同深度的层对参数的「胃口」并不一样,是一个改动小、潜在收益直接的架构调参思路。
基座模型架构预训练参数效率
FastMix: Fast Data Mixture Optimization via Gradient Descent
HF 精选 · 06-23 08:00 UTC+8
训练数据各来源该按什么比例混合,长期靠人工试错,「FASTMIX」把它变成可自动求解的问题:将混合比例选择建模为双层优化,用梯度下降同时迭代更新混合系数和模型参数,让数据配比在训练过程中自己找到最优。相比反复跑实验调配比,这种边训边优化的方式大幅省去了搜索成本,对做预训练数据工程的团队是个能直接降本的工具。
训练数据工程预训练数据配比
DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams
HF 精选 · 06-23 08:00 UTC+8
面对原始多模态数据流高熵、杂乱难用的问题,「智能体式数据裁剪」范式用可学习的数据处理把这些数据结构化整理,配套的「DataClaw_0-9B」模型经过 SFT 加 GRPO 训练,在新提出的基准上拿到了稳健的对齐效果。它把数据清洗整理从固定流水线升级成会学习、能适应的智能体行为,对苦于多模态数据预处理的从业者提供了一条新路径。
后训练多模态数据工程数据处理
EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions
HF 精选 · 06-23 08:00 UTC+8
「EnterpriseClawBench」从真实职场会话里提炼出 852 个可复现任务,给企业级智能体搭了一个贴近实际工作流的评测基准,并强调要用一整套综合指标去看智能体表现,而不是只盯单一分数。它的价值在于评测数据来自真实工作场景而非人造任务,更能暴露企业落地时的真实短板,对想把智能体部署进办公流程的团队有直接参考意义。
Agent智能体评测企业智能体基准测试
CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents
上海 AI LabHF 精选 · 06-23 08:00 UTC+8
为了给终端(命令行)智能体造训练数据,「CLI-Universe」设计了一套可验证的任务合成引擎,靠多维能力分类体系加上证据引导的研究流程来批量生成高质量终端任务,并蒸馏出一份数据集。用这份数据训练 LLM 能带来明显的性能提升,思路上把「怎么造出又难又对的可验证任务」系统化了,对做命令行/工具型智能体训练的人是一份现成的数据生产方法论。
Agent终端智能体数据合成智能体训练
Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding
通义千问HF 精选 · 06-23 08:00 UTC+8
自回归生成历来只用最后一层做 token 预测,这篇工作指出更深不一定更好,提出按熵引导搜索动态选择更可靠的中间层来解码,以此缓解对齐税。方法几乎不增加额外计算,却能提升推理表现,等于在不改模型、不加训练的前提下,靠「选对出口层」就把性能捡回来一些,是一个轻量又实用的解码侧技巧。
解码策略推理优化对齐
SkillHarness: Harnessing Safe Skills for Computer-Use Agents
HF 精选 · 06-23 08:00 UTC+8
电脑操作类智能体在动态环境里学技能、用技能时容易出格甚至闯祸,「SkillHarness」给它套上安全缰绳:把安全约束嵌进技能学习与执行,再配上自适应的技能选择机制,让智能体既能学会新技能又不越界。它瞄准的是 computer-use 智能体落地时绕不开的安全可控问题,对想让屏幕操作智能体真正敢放到生产环境里的人是个值得关注的框架。
Agent电脑操作智能体智能体安全技能学习
SP-Mind: An Autonomous Reasoning Agent for Spatial Proteomics Analysis
ICML 2026CCF-A推荐arXiv · 06-23 15:24 UTC+8
空间蛋白质组学能在单细胞分辨率上刻画组织里的蛋白表达,对理解肿瘤微环境、指导精准医疗很关键,但分析流程零碎、严重依赖专家手工串联各种工具,难以规模化和复现。「SP-Mind」是首个面向这一领域的自主推理智能体,试图把整条空间蛋白质组学分析流水线统一编排起来,让原本割裂的工具链由智能体自动驱动,为生物医学科研自动化提供了一个领域专用的智能体范例。
Agent科研智能体生物医学AI自主推理
Yucheng Yuan, Yuanfeng Ji, Zhongxiao Li, Ruijiang Li
Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification
ACL 2026CCF-A推荐arXiv · 06-23 03:27 UTC+8
知识型视觉问答需要把图像问题接地到画面之外的外部知识,现有多模态 RAG 方法常把实体辨别和证据排序硬塞进同一步,导致细粒度实体和证据层的接地都不到位。这篇「先接地再排序」的工作把流程拆成两步、且免训练:先做实体识别精准定位,再做章节级证据排序,解耦后两件事各自做得更准。这种训练无关、分步接地的设计对做多模态检索增强的人是个简洁有效的改法。
多模态视觉问答检索增强
Qian Ma, Qiong Wu, Zhengyi Zhou, Yao Ma
Natural Identifiers for Privacy and Data Audits in Large Language Models
ICLR 2026arXiv · 06-23 18:45 UTC+8
审计大模型隐私一直很难:差分隐私审计通常要在训练时插入特制的「金丝雀」数据,对已经训好的模型几乎没法用,除非重训;数据集推断又离不开一份私有的非成员留出集。这篇工作提出用「自然标识符」来做隐私与数据审计,绕开人工注入金丝雀和外部留出集的硬性前提,让针对现成模型的隐私核查更具可操作性,对关注模型合规与数据来源审计的人很有现实意义。
模型隐私差分隐私数据审计
Lorenzo Rossi, Bartłomiej Marek, Franziska Boenisch, Adam Dziedzic
MGI: Member vs Generated Inference
ECCV 2026CCF-B推荐arXiv · 06-23 03:15 UTC+8
当生成模型产出的样本和真人内容已难以区分,又会记忆并复现训练数据时,怎么判断一个样本到底是训练集里的真实成员还是模型自己生成的?这篇工作把它形式化为「成员 vs 生成推断(MGI)」这一新问题,专门处理记忆与复现造成的混淆。它给数据溯源、记忆评估和版权争议提供了一个新的分析框架,是把成员推断攻击往生成时代又推进了一步的概念性贡献。
成员推断模型记忆数据溯源
Bihe Zhao, Michel Meintz, Juangui Xu, Franziska Boenisch, Adam Dziedzic
Data Augmentation: A Fourier Analysis Perspective
COLT 2026CCF-B推荐arXiv · 06-23 18:54 UTC+8
数据增强靠对输入施加群变换来利用已知不变性,简单且与模型无关,但当对称群很大时,做完整的群规模增强计算开销会迅速爆炸。这篇工作从傅里叶分析的视角重新审视数据增强,把增强对学习的作用放到频域里去理解,为「群一大就算不动」的代价提供了理论刻画,也为如何高效近似全群增强指明了方向,对关心增强背后原理而非只调参的研究者很有价值。
数据增强傅里叶分析机器学习理论
Behrooz Tahmasebi, Melanie Weber, Stefanie Jegelka
Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints
ECCV 2026CCF-B推荐arXiv · 06-23 17:43 UTC+8
自动驾驶的鸟瞰图感知目前多被困在闭集场景里,遇到训练集外的类别就抓瞎。这篇工作提出开放词表鸟瞰图分割(OVBS),引入视觉语言模型来识别训练集之外的新类别,同时用 3D 感知的几何约束守住 BEV 感知的精度和实时性。它把开放词表能力带进了对几何精度和速度都很苛刻的 BEV 感知,让自动驾驶感知在面对不可预测的真实路况时更有韧性,是把 VLM 能力落到驾驶感知的一个务实尝试。
自动驾驶开放词表多模态
Hojun Choi, Seulbin Hwang, Dae Jung Kim, Kisung Kim, Hyunjung Shim, Jinhan Lee