论文 20 篇
论文方面,StateM 等聚焦智能体基准突破,多篇工作探索 GUI 智能体、世界模型校准与流式视频推理。
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
HF 精选 · 08-18 08:00 UTC+8
针对长程智能体执行中状态易失、失败难恢复以及过程控制薄弱的痛点,StateM 在不修改模型权重的前提下引入持久化状态、可恢复运行手册和可强制执行的过程控制,并通过 harness scaling 将 Terminal-Bench 2.1 原始准确率提升至 95.3%,一次 Frontier 运行成本约为 15 美元。这套运行时系统为长任务智能体的稳定复现和低成本评测提供了直接可用的工程方案。
Agent智能体运行时长程执行Terminal-Bench成本优化
MOSS-VL Technical Report
HF 精选 · 08-18 08:00 UTC+8
针对现有视觉语言模型在实时交互中首 token 延迟高、流式体验不足的问题,MOSS-VL 在生成阶段通过门控交叉注意力按需访问视觉信息,并构造合成交互语料与分阶段课程训练,在维持较强流式性能的同时显著降低首 token 延迟。作为一个开放权重的视觉语言模型系列,它给需要低延迟多模态对话的从业者提供了可复用的基座选择。
基座视觉语言模型实时交互流式推理首Token延迟
Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
AppleHF 精选 · 08-18 08:00 UTC+8
针对视频推理中显式生成视觉思维链带来的高延迟与计算浪费,该方法在后训练阶段训练多模态模型预测未来帧嵌入,将视觉思考内化到隐空间;推理时无需合成中间图像即可直接输出答案,延迟降低五倍以上。这为主动式视频推理提供了一条兼顾效率与能力的路径,尤其适合实时视频理解场景。
推理优化多模态推理视频理解隐式视觉思维推理延迟优化
VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?
腾讯 AI LabHF 精选 · 08-18 08:00 UTC+8
针对多模态智能体能否端到端构建三维开放世界这一能力缺口,作者提出统一框架,让智能体完成意图推断、3D 场景规划、工具调用和反馈反思,并配套基准与训练流程;强化学习训练后的开源模型表现超过闭源前沿模型,说明开放模型在开放式 3D 世界构建任务上有明显提升空间。该工作为 3D 生成与智能体结合提供了可量化的评测与训练范式。
Agent多模态智能体3D世界构建强化学习开源模型
Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization
HF 精选 · 08-18 08:00 UTC+8
针对多奖励策略优化中某些目标已经饱和、继续优化会浪费算力并挤压其他目标的问题,SA-MRPO 对多目标奖励做独立标准化,并自适应地给已饱和目标降权,把优化重心转向尚未充分优化的目标。这样在保持整体策略质量的同时,能更均衡地提升多个奖励维度,尤其适合 RLHF 与 RLVR 中常见的目标冲突和不平衡场景。
后训练多目标优化策略优化RLHF奖励加权
ClawGym II: Exploring Black-Box RL on Agent Harness
HF 精选 · 08-18 08:00 UTC+8
针对通用智能体在复杂任务 harness 上做黑盒强化学习时训练不稳定、难以规模化的问题,ClawGym II 提出统一框架,通过沙箱执行、轨迹重建和混合 harness 训练实现稳定且可扩展的智能体优化。这为无法访问内部权重的 agent 系统提供了一条与模型无关的 RL 优化路线,降低长程智能体任务的调优门槛。
Agent黑盒强化学习智能体优化沙箱执行轨迹重建
UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations
HF 精选 · 08-18 08:00 UTC+8
针对开放权重 GUI 智能体在长程办公任务中可靠性不足的问题,UI-Mate 采用环境扎根训练和上下文演示学习,让模型在真实界面环境下学会利用少量演示快速适应任务。它在多个 computer-use 基准上取得当前最优结果,表明开放权重模型可以通过训练与推理期的演示机制逼近甚至超越闭源 GUI 智能体。
AgentGUI智能体上下文学习开放权重计算机操作基准
Agentic Transaction: Towards ACID-Compliant Agent Systems
HF 精选 · 08-18 08:00 UTC+8
针对长程 LLM 智能体工作流在执行中缺乏事务性保证、容易因中途失败导致状态不一致的问题,该框架为智能体事务引入 ACID 语义保证,使长时间运行的智能体流程具备可靠、隔离和持久化的执行特性。它借鉴数据库事务思路来管理 LLM 智能体的状态变更与回滚,对构建生产级多步智能体系统尤为重要。
Agent智能体事务ACID长程工作流可靠性
How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks
HF 精选 · 08-18 08:00 UTC+8
作者在 100 个真实前沿科研任务上对自主研究智能体做端到端诊断,覆盖完整科学生命周期后发现,这些系统在元认知层面的自我纠正能力普遍缺失,失败模式并非单一环节造成。研究据此提出新基准和失败分类法,为后续提升科研智能体的自主性与可靠性提供了明确诊断维度。
Agent科研智能体评测基准元认知失败分析
VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding
HF 精选 · 08-18 08:00 UTC+8
针对现有多模态基准主要测单轮视频问答、难以反映真实智能体视频理解能力的问题,VideoGAIA 引入多轮、工具增强的评测基准,让模型在复杂真实任务中完成需要规划、检索和跨轮记忆的视频理解。该基准为高级多模态助手在智能体场景下的视频能力提供了更严格的度量。
Agent多模态基准视频理解智能体评测工具调用
DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs
HF 精选 · 08-18 08:00 UTC+8
作者探索用退役 GPU 组成低成本集群来运行 LLaMA-70B 等大模型推理,硬件成本可低至单卡 60 美元级别;但实际经济性与环境收益高度依赖本地电价与电力碳强度,并非在所有地区都划算。这给预算有限但追求本地化推理的从业者提供了硬件选型和选址上的量化参考。
Infra低成本推理退役GPULLaMA-70B能耗成本
StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding
HF 精选 · 08-18 08:00 UTC+8
针对流式视频理解在低延迟与低记忆约束下性能不足的问题,StreamOPD 提出一种后训练方案,结合可验证奖励驱动的在线策略蒸馏和时空线索门控机制,在推理时不依赖额外记忆即可接近教师模型表现。该方法为部署实时视频理解模块提供了一条兼顾精度和资源占用的后训练路径。
流式视频理解后训练蒸馏时序门控
CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated?
字节 SeedancearXiv · 08-18 01:14 UTC+8
视频世界模型常用生成采样近似物理结果的随机分布,但现有基准要么只评单个生成、要么在整个数据集上粗粒度比较分布,无法检验特定现象的细粒度偶然不确定性。CaliBench 把评分放到物理可解释的离散空间,例如桶编号、骰子面、花色或颜色,而非 FID 式的学习特征空间,从而更精确地度量世界模型对物理随机性的校准程度。该工作为视频世界模型的物理可靠性提供了更严格的测试工具。
基座世界模型物理校准评测基准随机不确定性
Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice, Sirish Srinivasan, Benjamin Graham, Jeffrey Hawke
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
HF 精选 · 08-18 08:00 UTC+8
针对视觉世界模型评估主观性强、结果难以追溯的问题,HarnessEval-W 用层次化子智能体把评估拆解为可验证的推理链,每个评分都有透明证据支撑。这让世界模型评测从单一分数升级为可审计的诊断过程,对需要可靠筛选生成式视觉模型的团队更有实际价值。
Agent世界模型评估多智能体可验证推理评分透明
Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search
HF 精选 · 08-18 08:00 UTC+8
针对开放式科学发现空间巨大、传统搜索难以高效探索的问题,该循环大型发现模型把生成式候选提议与贝叶斯非参数奖励代理相结合,在分子、蛋白质和程序等多个领域进行不确定性感知的主动搜索。这种基于模型的搜索能以更少实验预算找到有价值候选,对 AI 驱动的材料与药物发现等场景有直接价值。
基座科学发现贝叶斯优化生成式搜索不确定性感知
An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models
HF 精选 · 08-18 08:00 UTC+8
针对像素空间文本到图像扩散模型训练成本高、收敛慢的问题,研究者提出 latent-to-pixel 的训练策略,先在潜在空间学习通用结构,再迁移到像素空间,从而加速收敛并提高推理速度。这一经验性研究为需要高分辨率像素级控制、又受限于训练预算的图像生成团队提供了可复用的训练范式。
训练扩散模型图像生成训练策略像素空间
GenRouter: Unified Workflow Routing for Agentic Image Generation
HF 精选 · 08-18 08:00 UTC+8
针对智能体图像生成中存在多种工作流但缺少统一调度、成本与质量难以兼顾的问题,GenRouter 提出统一路由框架,根据提示自适应选择最优的 agentic 图像生成工作流,在降低成本和延迟的同时提升视觉对齐度,并支持路由策略持续自进化。这对需要规模化生成图像且对成本敏感的团队是一个实用的调度层。
Agent图像生成工作流路由成本优化智能体调度
Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs
HF 精选 · 08-18 08:00 UTC+8
针对托管开放权重模型 API 可能存在静默降级、尤其在长程智能体任务中保真度下降的问题,Ventor-QTest 采用威胁模型驱动的黑盒探测,通过重复与长序列请求测量平均和极端保真度损失。这为使用第三方托管模型的企业提供了一种无需访问权重的持续审计方法,能提前发现供应商侧的性能退化。
InfraAPI审计黑盒测试模型保真度长程智能体
R^3-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets
HF 精选 · 08-18 08:00 UTC+8
该工作指出,多个推理任务共享同一计算预算时,推理智能体的表现会显著低于单个任务独立预算下的能力,在数学、编程和抽象推理上均如此。R³-Bench 专门刻画这种资源理性推理场景,提示当前 LLM 推理策略在预算分配与跨任务调度上仍存在明显短板。这对设计多任务推理智能体和推理预算管理有直接参考意义。
推理优化推理智能体计算预算资源理性评测基准
Beyond $L_2$: Generalizing Abductive Latent Explanations to Diverse Prototype-Based Architectures
ECML-PKDD 2026CCF-B推荐arXiv · 08-18 00:20 UTC+8
原型神经网络素来被认为具备可解释性,但现有 Abductive Latent Explanations 的形式化保证依赖欧几里得潜在空间的距离上界,难以覆盖更广泛的原型架构。该研究将 ALE 推广到非欧几里得潜在空间,为多样化原型网络提供数学上严格且人类可读的解释,扩大形式化可解释方法的适用范围。这对医疗等高风险领域需要可验证解释的场景尤其重要。
可解释性原型网络形式化保证潜在空间
Jules Soria, Alban Grastien, Romain Xu-Darme, Julien Girard-Satabin, Zakaria Chihani, Daniela Cancila