每日 AI 速览

2026-08-18

生成于 2026-08-19 04:13
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线聚焦智能体评测、视频世界模型与低成本推理。智能体方面,StateM 在 Terminal-Bench 上实现低价高准确率,UI-Mate 推进开源 GUI 智能体,AutoResearch 诊断失败模式,ACID 交易强调可靠性;Stripe 收购 OpenRouter、阿里钉钉上下文及 DeepSeek Harness 教程推高工具链热度。视频侧,内化视觉思维、流式视频后训练与世界模型校准形成连续研究线。Infra 侧,DumpsterCluster 在 60 美元 GPU 上服务 70B 模型,集群利用率提升与 Groq 转型强化降本。Qwen 3.8 27B、Nemotron 3.5 等动态值得关注。

行业动态 40 条

Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Index

Simon Willison · 08-18 07:58 UTC+8

Qwen 3.8 27B 在 Artificial Analysis 智能指数上得 52 分,与 GPT-5.6 Luna(max)持平,仅比 GLM-5.2(max)和 DeepSeek V4 Pro 0813(max)低 1 分,而后者参数量分别是 753B 和 1.7T,Luna 规模未知但大概率远大于 27B。一个 27B 模型能追平头部超大模型,说明小参数高效模型在推理能力上的进展非常显著,对部署成本和端侧场景是重要信号。

基座Qwen模型评测小模型Artificial Analysis

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

Apple ML · 08-18 08:00 UTC+8

苹果机器学习团队对 GRPO 在非英语与多语言场景下进行了大规模实证研究,覆盖多种基座模型、训练语言和推理语言奖励设置,发现让模型用母语进行推理训练能带来更稳的收益。该结果为 RLVR 训练从英语中心走向多语言提供了系统依据,对在多语言市场部署推理模型很有参考价值。

后训练GRPO多语言RLVR推理训练

[AINews] Stripe buys OpenRouter for $7B

Latent Space · 08-18 07:13 UTC+8

Stripe 以 70 亿美元收购 OpenRouter,后者不拥有 GPU 或自研智能体,核心资产是模型路由与分发基础设施。这一收购说明在模型层竞争之外,稳定的推理路由和开发者分发渠道正成为极具战略价值的中间层。

InfraOpenRouterStripe收购推理路由

Same Cluster, 33 Points More Utilization: What Changed Was the Order

HuggingFace 博客 · 08-18 03:46 UTC+8

Hugging Face 博客分享了一个集群调度洞察:在相同硬件上仅通过调整任务执行顺序,就把利用率提升了 33 个百分点。对 AI Infra 团队来说,这意味着不增加 GPU 也能从现有集群中挤出可观算力,调度策略优化是低成本提效的关键。

Infra集群调度利用率优化AI InfraGPU资源管理

Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer

NVIDIA 开发者 · 08-18 02:12 UTC+8

NVIDIA 发布使用 Model Optimizer 和 QAD 将 Nemotron 3.5 Lightning 量化为 NVFP4 的开发方法,帮助团队根据延迟、速度、内存和算力目标定制模型。NVFP4 代表了低精度推理在 NVIDIA 硬件上的进一步压缩,对高吞吐 agentic 工作负载降本有直接价值。

推理优化NemotronNVFP4量化NVIDIA Model Optimizer

NVIDIA Nemotron 3.5 Lightning now available in Amazon SageMaker JumpStart

AWS 机器学习 · 08-18 02:06 UTC+8

AWS 宣布 NVIDIA Nemotron 3.5 Lightning 已上线 SageMaker JumpStart,30B 总参数、3B 活跃参数的 MoE 模型面向高容量 agentic 工作负载,提供最高 4 倍吞吐和高达 30% 的任务完成速度提升。这对在 AWS 上部署常驻智能体的团队意味着更快、更省地获得最新开放模型能力。

基座NemotronSageMaker JumpStartMoE智能体推理

v0.1.2

llama.cpp · 08-18 18:23 UTC+8

llama.cpp 发布 v0.1.2,包含 ggml 版本提升到 0.20.2、构建修复、DGX Spark 上 dense 模型的 CUDA MMVQ 优化等,语义化版本仍在完善中。该版本继续打磨 CUDA 推理性能与构建稳定性,对本地部署用户是常规但值得跟进的更新。

Infrallama.cppCUDA本地推理版本发布

人人都能写好听的歌,阿里发布AI音乐模型HappyShrimp

量子位 · 08-18 17:38 UTC+8

阿里巴巴于 8 月 17 日发布 AI 音乐模型 HappyShrimp,主打让普通用户也能生成好听的歌曲。这表明阿里在多模态生成领域继续扩展音乐创作场景,对消费级 AI 创作工具的普及有实际意义。

基座阿里巴巴AI音乐音乐生成多模态创作

b10481: CUDA: MMVQ nwarps=8 for bs=1 for dense models on DGX Spark (#26843)

llama.cpp · 08-18 12:15 UTC+8

llama.cpp 合并了针对 DGX Spark 上 dense 模型 batch size 为 1 场景的 CUDA MMVQ 优化,将 nwarps 设为 8,并跳过 MoE expert、根据 k 几何允许少量空闲尾部,同时把相关参数重命名为 GB10。该改动直接提升边缘设备上单样本推理效率,对本地低延迟场景有帮助。

llama.cppCUDADGX Spark推理优化

DeepSeek V4 Pro 0813 vs GPT-5.6 Sol on DeepSWE: Cost, Coding, and Routing

Together AI · 08-18 08:00 UTC+8

Together AI 在 DeepSWE 上跑了 904 次 rollouts,对比 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol:Sol 的 pass@1 领先 10 个百分点,但成本是 Pro 的 35 倍;Pro 在 pass@4 上反超,Pro-first 级联路由可冲到 83.0%。这说明用低成本模型做多轮验证或级联调度,能在软件工程任务上以极小预算获得接近或超过顶级模型的结果。

推理优化DeepSWEDeepSeekGPT-5.6路由策略

Build OpenClaw agents that transact with Amazon Bedrock AgentCore payments

AWS 机器学习 · 08-18 00:19 UTC+8

AWS 介绍了如何给 OpenClaw 智能体接入 Amazon Bedrock AgentCore 支付能力,让自主智能体在设定消费护栏内为付费 API、MCP 服务器和网页内容付费。通过 x402 协议和 aws-agents-pay 插件,开发者可以让智能体完成有界、经人工批准的小额支付,为 agent 商业化闭环提供基础设施。

Agent智能体支付Bedrock AgentCoreMCPx402

viable/strict/1787070441: Match Triton Python float signatures for user-defined kernels (#190340)

PyTorch · 08-18 20:33 UTC+8

PyTorch Inductor 修复了用户自定义 Triton kernel 的 wrapper codegen,使其 Python float 字面量启动参数遵循 Triton 标准 fp32 签名,而不是被强制走 Inductor 的 fp64 策略;普通 Inductor 签名仍保留 fp64 默认以保持精度。该改动对写自定义 kernel 的开发者来说减少类型不匹配问题,提升与 Triton 原生行为的兼容性。

InfraPyTorchTriton自定义内核代码生成

viable/strict/1787068774: [inductor] Preserve input placeholders during graph cleanup (#193708)

PyTorch · 08-18 20:01 UTC+8

该修复针对 Inductor 图清理阶段误删输入占位符的问题:remove_redundant_views 会擦除所有零用户节点,包括占位符,导致编译函数参数数量减少而运行时仍按原参数调用,从而触发崩溃。修复方式是跳过占位符节点,与 FX 自身 eliminate_dead_code 对非纯节点的处理保持一致。

InfraPyTorch Inductor图清理FX编译正确性

b10488

llama.cpp · 08-18 19:07 UTC+8

llama.cpp 将 OpenVINO 后端升级到 2026.3 并更新设备驱动,同时跳过 Nemotron-H 回滚测试,原因是 OpenVINO 不支持 SSM_SCAN 算子,导致循环状态回滚图被拆分后无法保持缓存输出形状。qwen35 的 OpenVINO 回滚覆盖仍被保留,其他后端测试不受影响。

推理优化llama.cppOpenVINONemotron-HCI

Pacing model development in an era of cyber-critical capabilities

OpenAI · 08-18 19:00 UTC+8

OpenAI 宣布正在加强对前沿模型在网络安全关键能力方面的监控、对齐和安全防护,以调节模型开发节奏。此举表明前沿实验室开始将网络滥用风险正式纳入发布治理框架。

厂商动态OpenAI安全对齐前沿模型网络安全

b10486

llama.cpp · 08-18 18:45 UTC+8

修复 mtmd 模块中 LFM2 图像分块阈值的错误,重构相关测试,并解决 Windows 上的构建问题。该修复直接影响多模态模型中图像切分与编码的正确性。

Infrallama.cpp多模态LFM2图像分块

b10485

llama.cpp · 08-18 18:10 UTC+8

本提交仅同步 ggml 子模块,无具体功能变更,属于 llama.cpp 的常规依赖更新。

Infrallama.cppggml依赖同步

b10483

llama.cpp · 08-18 17:26 UTC+8

修复 xcframework 构建问题,移除 mtmd 中未使用的 include 路径,并在 CMake 中为所有 vendor 库添加带命名空间的别名目标,以绕开 CMake 对双冒号目标名的限制。

Infrallama.cpp构建系统CMakexcframework

AI systems quietly drop user instructions when they compress context

The Decoder · 08-18 16:22 UTC+8

研究发现 AI 系统在压缩长对话时平均丢失 83% 的用户规则,例如未经批准不得发邮件这类限制。宾州州立大学团队基于 Qwen3.5-9B 提出一个轻量附加模块,可将这些限制保留率提升到 90% 以上,对依赖系统提示约束的 Agent 应用是个重要提醒。

推理优化上下文压缩指令遵循Qwen3.5-9BAgent记忆

viable/strict/1787048801

PyTorch · 08-18 13:32 UTC+8

PyTorch Inductor 在组合内核内存规划上改用调度优先的有界区域方案,旨在改善调度顺序与内存复用。标题未给出更多实现细节,但从 PR 方向看属于组合内核内存优化。

InfraPyTorch Inductor组合内核内存优化调度

viable/strict/1787041685

PyTorch · 08-18 12:16 UTC+8

PyTorch 为 CUDA 可扩展内存段引入按流粒度的预留缩容机制,允许在不同流上独立调整预留容量。该改动有望提升显存占用弹性,改善分配器在大规模推理或训练场景下的内存管理。

InfraPyTorchCUDA内存分配器显存优化

viable/strict/1787038138

PyTorch · 08-18 11:31 UTC+8

为 QNNPACK 增加面向 aarch64 的 1 到 4 乘 8 动态量化 q8gemm 微内核,主要服务于小批量或窄矩阵的量化 GEMM 计算。该微内核可提升移动端和终端设备的动态量化推理效率。

推理优化PyTorchQNNPACKaarch64量化推理

Multi-Vector (Late Interaction) Embedding Models with Sentence Transformers

HuggingFace 博客 · 08-18 08:00 UTC+8

HuggingFace 博客介绍如何在 Sentence Transformers 中使用多向量晚交互嵌入模型。这类模型保留更细粒度的 token 级交互,检索精度通常优于单向量,但会带来更高的存储和计算成本。

InfraHuggingFaceSentence Transformers多向量嵌入晚交互

b10472

llama.cpp · 08-18 01:18 UTC+8

llama.cpp 在 HIP 构建中跳过统一内存访问覆盖逻辑,原因是 AMD APU 可以通过 hipMemGetInfo 获得准确显存信息,而使用 MemAvailable 在小显存划拨系统上会过度承诺。该修复解决了相关已知问题。

Infrallama.cppHIPAMD APU统一内存

Amazon, which started off selling books, is destroying rare texts to train AI

TechCrunch · AI · 08-18 00:38 UTC+8

TechCrunch 报道亚马逊正在销毁稀有实体书籍用于训练 AI,因为这些文本尚未出现在公开网络语料中,对扩充 LLM 训练数据具有稀缺价值。该行为引发版权和文化遗产保护方面的争议。

训练亚马逊训练数据语料版权

Groq raises $350M to fuel its pivot from AI chips to neocloud

TechCrunch · AI · 08-18 00:15 UTC+8

Groq 以 35 亿美元估值完成 3.5 亿美元融资,用于支持其从 AI 芯片公司向 neocloud 服务商转型,并扩大基于英伟达 GPU 的数据中心规模。这表明 Groq 不再完全押注自研 LPU,推理云竞争进一步加剧。

InfraGroq融资NeocloudAI芯片推理云

阿里云的野心,不在 Agent Builder

InfoQ 中文 · 08-18 23:32 UTC+8

InfoQ 文章提出阿里云的战略重心并非在应用层做 Agent Builder 工具,而是更聚焦底层平台与生态能力。这一视角有助于理解大厂在 Agent 浪潮中的差异化布局。

厂商动态阿里云Agent平台战略AI基础设施

OpenAI launches a safer ChatGPT for teens — years after teens started using it

TechCrunch · AI · 08-18 21:50 UTC+8

OpenAI 面向青少年推出更安全的 ChatGPT,加入适龄安全措施、家长控制和学习工具,以减少有害内容并防止青少年用 AI 作弊。不过产品上线时间远晚于青少年实际使用,存在明显滞后。

厂商动态OpenAIChatGPT青少年安全家长控制

OpenAI launches a ChatGPT version built for teens

The Decoder · 08-18 19:27 UTC+8

OpenAI 发布面向 13 至 17 岁用户的 ChatGPT 版本,强化保护机制与家长控制,定位为更适合青少年的学习工具。

厂商动态OpenAIChatGPT青少年安全

模型跑起来之后:视觉 AI 还需要哪些系统能力?

InfoQ 中文 · 08-18 19:17 UTC+8

InfoQ 文章讨论视觉 AI 模型部署后除推理之外还需要补齐的系统能力,例如图像数据接入、处理管线、监控与运维等,为视觉 AI 的工程化落地提供思路。

Infra视觉AI系统能力工程化InfoQ

论文 20 篇

论文方面,StateM 等聚焦智能体基准突破,多篇工作探索 GUI 智能体、世界模型校准与流式视频推理。

StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

HF 精选 · 08-18 08:00 UTC+8

针对长程智能体执行中状态易失、失败难恢复以及过程控制薄弱的痛点,StateM 在不修改模型权重的前提下引入持久化状态、可恢复运行手册和可强制执行的过程控制,并通过 harness scaling 将 Terminal-Bench 2.1 原始准确率提升至 95.3%,一次 Frontier 运行成本约为 15 美元。这套运行时系统为长任务智能体的稳定复现和低成本评测提供了直接可用的工程方案。

Agent智能体运行时长程执行Terminal-Bench成本优化

MOSS-VL Technical Report

HF 精选 · 08-18 08:00 UTC+8

针对现有视觉语言模型在实时交互中首 token 延迟高、流式体验不足的问题,MOSS-VL 在生成阶段通过门控交叉注意力按需访问视觉信息,并构造合成交互语料与分阶段课程训练,在维持较强流式性能的同时显著降低首 token 延迟。作为一个开放权重的视觉语言模型系列,它给需要低延迟多模态对话的从业者提供了可复用的基座选择。

基座视觉语言模型实时交互流式推理首Token延迟

Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

AppleHF 精选 · 08-18 08:00 UTC+8

针对视频推理中显式生成视觉思维链带来的高延迟与计算浪费,该方法在后训练阶段训练多模态模型预测未来帧嵌入,将视觉思考内化到隐空间;推理时无需合成中间图像即可直接输出答案,延迟降低五倍以上。这为主动式视频推理提供了一条兼顾效率与能力的路径,尤其适合实时视频理解场景。

推理优化多模态推理视频理解隐式视觉思维推理延迟优化

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

腾讯 AI LabHF 精选 · 08-18 08:00 UTC+8

针对多模态智能体能否端到端构建三维开放世界这一能力缺口,作者提出统一框架,让智能体完成意图推断、3D 场景规划、工具调用和反馈反思,并配套基准与训练流程;强化学习训练后的开源模型表现超过闭源前沿模型,说明开放模型在开放式 3D 世界构建任务上有明显提升空间。该工作为 3D 生成与智能体结合提供了可量化的评测与训练范式。

Agent多模态智能体3D世界构建强化学习开源模型

Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

HF 精选 · 08-18 08:00 UTC+8

针对多奖励策略优化中某些目标已经饱和、继续优化会浪费算力并挤压其他目标的问题,SA-MRPO 对多目标奖励做独立标准化,并自适应地给已饱和目标降权,把优化重心转向尚未充分优化的目标。这样在保持整体策略质量的同时,能更均衡地提升多个奖励维度,尤其适合 RLHF 与 RLVR 中常见的目标冲突和不平衡场景。

后训练多目标优化策略优化RLHF奖励加权

ClawGym II: Exploring Black-Box RL on Agent Harness

HF 精选 · 08-18 08:00 UTC+8

针对通用智能体在复杂任务 harness 上做黑盒强化学习时训练不稳定、难以规模化的问题,ClawGym II 提出统一框架,通过沙箱执行、轨迹重建和混合 harness 训练实现稳定且可扩展的智能体优化。这为无法访问内部权重的 agent 系统提供了一条与模型无关的 RL 优化路线,降低长程智能体任务的调优门槛。

Agent黑盒强化学习智能体优化沙箱执行轨迹重建

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

HF 精选 · 08-18 08:00 UTC+8

针对开放权重 GUI 智能体在长程办公任务中可靠性不足的问题,UI-Mate 采用环境扎根训练和上下文演示学习,让模型在真实界面环境下学会利用少量演示快速适应任务。它在多个 computer-use 基准上取得当前最优结果,表明开放权重模型可以通过训练与推理期的演示机制逼近甚至超越闭源 GUI 智能体。

AgentGUI智能体上下文学习开放权重计算机操作基准

Agentic Transaction: Towards ACID-Compliant Agent Systems

HF 精选 · 08-18 08:00 UTC+8

针对长程 LLM 智能体工作流在执行中缺乏事务性保证、容易因中途失败导致状态不一致的问题,该框架为智能体事务引入 ACID 语义保证,使长时间运行的智能体流程具备可靠、隔离和持久化的执行特性。它借鉴数据库事务思路来管理 LLM 智能体的状态变更与回滚,对构建生产级多步智能体系统尤为重要。

Agent智能体事务ACID长程工作流可靠性

How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

HF 精选 · 08-18 08:00 UTC+8

作者在 100 个真实前沿科研任务上对自主研究智能体做端到端诊断,覆盖完整科学生命周期后发现,这些系统在元认知层面的自我纠正能力普遍缺失,失败模式并非单一环节造成。研究据此提出新基准和失败分类法,为后续提升科研智能体的自主性与可靠性提供了明确诊断维度。

Agent科研智能体评测基准元认知失败分析

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

HF 精选 · 08-18 08:00 UTC+8

针对现有多模态基准主要测单轮视频问答、难以反映真实智能体视频理解能力的问题,VideoGAIA 引入多轮、工具增强的评测基准,让模型在复杂真实任务中完成需要规划、检索和跨轮记忆的视频理解。该基准为高级多模态助手在智能体场景下的视频能力提供了更严格的度量。

Agent多模态基准视频理解智能体评测工具调用

DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs

HF 精选 · 08-18 08:00 UTC+8

作者探索用退役 GPU 组成低成本集群来运行 LLaMA-70B 等大模型推理,硬件成本可低至单卡 60 美元级别;但实际经济性与环境收益高度依赖本地电价与电力碳强度,并非在所有地区都划算。这给预算有限但追求本地化推理的从业者提供了硬件选型和选址上的量化参考。

Infra低成本推理退役GPULLaMA-70B能耗成本

StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding

HF 精选 · 08-18 08:00 UTC+8

针对流式视频理解在低延迟与低记忆约束下性能不足的问题,StreamOPD 提出一种后训练方案,结合可验证奖励驱动的在线策略蒸馏和时空线索门控机制,在推理时不依赖额外记忆即可接近教师模型表现。该方法为部署实时视频理解模块提供了一条兼顾精度和资源占用的后训练路径。

流式视频理解后训练蒸馏时序门控

CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated?

字节 SeedancearXiv · 08-18 01:14 UTC+8

视频世界模型常用生成采样近似物理结果的随机分布,但现有基准要么只评单个生成、要么在整个数据集上粗粒度比较分布,无法检验特定现象的细粒度偶然不确定性。CaliBench 把评分放到物理可解释的离散空间,例如桶编号、骰子面、花色或颜色,而非 FID 式的学习特征空间,从而更精确地度量世界模型对物理随机性的校准程度。该工作为视频世界模型的物理可靠性提供了更严格的测试工具。

基座世界模型物理校准评测基准随机不确定性
Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice, Sirish Srinivasan, Benjamin Graham, Jeffrey Hawke

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

HF 精选 · 08-18 08:00 UTC+8

针对视觉世界模型评估主观性强、结果难以追溯的问题,HarnessEval-W 用层次化子智能体把评估拆解为可验证的推理链,每个评分都有透明证据支撑。这让世界模型评测从单一分数升级为可审计的诊断过程,对需要可靠筛选生成式视觉模型的团队更有实际价值。

Agent世界模型评估多智能体可验证推理评分透明

Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search

HF 精选 · 08-18 08:00 UTC+8

针对开放式科学发现空间巨大、传统搜索难以高效探索的问题,该循环大型发现模型把生成式候选提议与贝叶斯非参数奖励代理相结合,在分子、蛋白质和程序等多个领域进行不确定性感知的主动搜索。这种基于模型的搜索能以更少实验预算找到有价值候选,对 AI 驱动的材料与药物发现等场景有直接价值。

基座科学发现贝叶斯优化生成式搜索不确定性感知

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

HF 精选 · 08-18 08:00 UTC+8

针对像素空间文本到图像扩散模型训练成本高、收敛慢的问题,研究者提出 latent-to-pixel 的训练策略,先在潜在空间学习通用结构,再迁移到像素空间,从而加速收敛并提高推理速度。这一经验性研究为需要高分辨率像素级控制、又受限于训练预算的图像生成团队提供了可复用的训练范式。

训练扩散模型图像生成训练策略像素空间

GenRouter: Unified Workflow Routing for Agentic Image Generation

HF 精选 · 08-18 08:00 UTC+8

针对智能体图像生成中存在多种工作流但缺少统一调度、成本与质量难以兼顾的问题,GenRouter 提出统一路由框架,根据提示自适应选择最优的 agentic 图像生成工作流,在降低成本和延迟的同时提升视觉对齐度,并支持路由策略持续自进化。这对需要规模化生成图像且对成本敏感的团队是一个实用的调度层。

Agent图像生成工作流路由成本优化智能体调度

Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs

HF 精选 · 08-18 08:00 UTC+8

针对托管开放权重模型 API 可能存在静默降级、尤其在长程智能体任务中保真度下降的问题,Ventor-QTest 采用威胁模型驱动的黑盒探测,通过重复与长序列请求测量平均和极端保真度损失。这为使用第三方托管模型的企业提供了一种无需访问权重的持续审计方法,能提前发现供应商侧的性能退化。

InfraAPI审计黑盒测试模型保真度长程智能体

R^3-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets

HF 精选 · 08-18 08:00 UTC+8

该工作指出,多个推理任务共享同一计算预算时,推理智能体的表现会显著低于单个任务独立预算下的能力,在数学、编程和抽象推理上均如此。R³-Bench 专门刻画这种资源理性推理场景,提示当前 LLM 推理策略在预算分配与跨任务调度上仍存在明显短板。这对设计多任务推理智能体和推理预算管理有直接参考意义。

推理优化推理智能体计算预算资源理性评测基准

Beyond $L_2$: Generalizing Abductive Latent Explanations to Diverse Prototype-Based Architectures

ECML-PKDD 2026CCF-B推荐arXiv · 08-18 00:20 UTC+8

原型神经网络素来被认为具备可解释性,但现有 Abductive Latent Explanations 的形式化保证依赖欧几里得潜在空间的距离上界,难以覆盖更广泛的原型架构。该研究将 ALE 推广到非欧几里得潜在空间,为多样化原型网络提供数学上严格且人类可读的解释,扩大形式化可解释方法的适用范围。这对医疗等高风险领域需要可验证解释的场景尤其重要。

可解释性原型网络形式化保证潜在空间
Jules Soria, Alban Grastien, Romain Xu-Darme, Julien Girard-Satabin, Zakaria Chihani, Daniela Cancila