每日 AI 速览

2026-08-29

生成于 2026-08-30 04:15
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线聚焦 Agent 自我改进与数据闭环:从 ACE 视角筛选智能体数据、PILOT 与 JIT-Agent 让智能体在循环中进化,Google WikiSkill 与多篇技能图谱工作则沉淀错误记忆与可复用经验;Anthropic 研究员亦透露自改进 AI 与硬件协议布局。世界模型与视觉推理成为另一热点,LAION 放出千万小时视频数据,GameWAM、Zero-WAM 与 VBVR-Pro 等推动视频理解和世界动作建模。训练与推理侧,进化策略对比 GRPO、测试时策略优化以及 Triton 3.8、TensorRT Model Connect 值得关注。

行业动态 35 条

LAION drops massive open video dataset with 10 million hours of footage for AI research

The Decoder · 08-29 17:36 UTC+8

「LAION」发布「Big Video Dataset」,包含「8000」万个视频、「1000」万小时时长和「5500」万个自动描述片段,是目前规模最大的开放视频研究数据集之一。用该数据集训练的模型在基准上比「InternVid」最高提升「2.1」个百分点;法律上其非商业研究用途可能受「2024」年汉堡法院裁决支持。这对开源视频模型训练和数据生态是一大利好。

训练开放数据集视频数据LAION模型训练

腾讯混元 Hy4 preview 开源,参与“训练自己”!WorkBuddy实测:有了小型团队交付实力,但还得有人盯

InfoQ 中文 · 08-29 00:09 UTC+8

腾讯混元「Hy4 preview」宣布开源,并强调可通过「训练自己」机制持续进化;「InfoQ」的「WorkBuddy」实测结果显示,该模型已具备小型团队的交付能力,但在复杂任务中仍需人工盯防。这对关注国内大模型开源和智能体落地的从业者具有参考价值。

基座腾讯混元开源模型智能体实测模型发布

Google's WikiSkill gives AI agents a persistent memory of past mistakes to sharpen future performance

The Decoder · 08-29 20:51 UTC+8

「Google Research」推出「WikiSkill」框架,让「AI」智能体在每次运行后将失败与成功经验写入类「Wiki」的持久知识库,从而在后续任务中持续改进。实验显示,较大模型提升更明显,而配备「WikiSkill」的小模型也能达到未使用该框架的大模型性能,为智能体长期记忆与能力积累提供了实用方案。

Agent谷歌智能体记忆WikiSkill持续学习

Anthropic wants to do for physical hardware what its Model Context Protocol did for software

The Decoder · 08-29 17:14 UTC+8

「Anthropic」推出「Model Hardware Standard」,意图像「MCP」统一软件工具那样为机械臂、实验仪器等物理硬件提供统一的智能体接入接口。早期测试中设备集成时间从数周缩短到数小时,但「Claude」在物理因果理解上仍有局限,目前仍需人工监督,显示出软硬件智能体标准化的潜力与挑战。

AgentAnthropicMHS智能体硬件接口标准

trunk/4078ac41bdf75d5da306a8214384bfa54c85c4b6: [c10d] Make nccl2 the default NCCL backend (#192281)

PyTorch · 08-29 09:05 UTC+8

「PyTorch」提交将「nccl2」设为默认「NCCL」后端,不再要求用户通过环境变量显式开启。未设置变量或设为「TORCH_DIST_USE_NCCL2=1」时走「nccl2」,设为「0」或显式指定「nccl-legacy」仍可回退;默认切换也暴露出包括跨「rank」复用设备「0」在内的若干兼容性缺口。该变更让新版「NCCL」后端成为分布式训练默认路径,有助于收敛性能与维护成本。

InfraPyTorchNCCL分布式训练后端默认

An Anthropic researcher just gave us a peek at self-improving AI

TechCrunch · AI · 08-29 03:30 UTC+8

「Anthropic」研究员展示了自我改进「AI」的初步成果:在「10」个针对特定错位行为的基准上,自动化系统均实现性能提升,同时未损害整体表现。这表明通过自动化优化循环可以在不牺牲通用能力的前提下针对性地修正模型行为,对「AI」安全与对齐研究有参考意义。

后训练Anthropic自我改进AI对齐行为基准

Google Deepmind's AI Co-Scientist now plans experiments, runs lab equipment, and writes scientific papers

The Decoder · 08-29 02:46 UTC+8

「Google DeepMind」扩展「Co-Scientist」,使其从单纯的假设生成器发展为能规划实验、操作实验设备并撰写科学论文的实验室研究系统。在材料合成、医学「AI」架构自主开发等三个学科中,这个基于「Gemini」的多智能体系统均产出了经实验验证的结果,标志「AI」科学发现从辅助建议迈向闭环实验执行。

Agent谷歌DeepMindAI科研多智能体系统实验自动化

Triton 3.8.0 Release Notes

Triton · 08-29 02:26 UTC+8

「Triton」发布「3.8.0」版本,涉及前端方言、编译器后端、「AMD/HIP」与「NVIDIA」后端、「Gluon」布局以及性能分析等多个模块的更新。其中「@triton.aggregate」和「@gluon.aggregate」成为公共「API」,聚合类型支持继承字段、默认值、生成构造函数和不可变实例等特性,为「GPU」内核开发提供更强抽象能力。该版本对使用「Triton」编写和优化高性能算子的一线开发者较为重要。

InfraTriton版本发布GPU编程聚合类型

b10684

llama.cpp · 08-29 23:59 UTC+8

「llama.cpp」的「SYCL」后端改进了「--fit」算法,使其更好地遵循「--fit-target」,准确计算给定上下文大小下的实际峰值「VRAM」需求。修复后,报告的上下文大小可能下降但能避免「OOM」,同时减少因过度保守而预留过多显存的问题,该改动已在「Arc B70」上测试。这有助于「SYCL/Intel GPU」用户在显存有限时更合理地分配上下文。

推理优化llama.cppSYCL显存优化上下文

viable/strict/1788032998

PyTorch · 08-29 23:57 UTC+8

该「PyTorch」提交为流水线并行的调度动作添加「mark_kernels」注释,用于在「CUDA Graph」中标记内核边界。这一改动可改善流水线调度与「CUDA Graph」捕获的兼容性,降低训练时的内核启动开销,对使用「PyTorch」流水线并行的大模型训练用户有实际价值。

InfraPyTorch流水线并行CUDA Graph性能优化

b10683

llama.cpp · 08-29 23:26 UTC+8

「llama.cpp」的「Vulkan」后端合并了重复的「fastdiv」函数,并重命名了用于小除数优化的版本,删除了多余实现。这是代码清理和小幅优化,有助于降低「Vulkan」后端维护复杂度并可能带来轻微性能收益,对使用「Vulkan」推理的用户影响有限但保持代码库健康。

推理优化llama.cppVulkan代码优化后端维护

b10682

llama.cpp · 08-29 23:02 UTC+8

llama.cpp 合并了针对 M1 Max 的 Metal 后端 fa-vec 调优补丁,为 Apple Silicon 上的 flash attention 向量化路径增加特定优化。该变更纳入 macOS Apple Silicon 构建矩阵,有助于提升 M1 Max 设备上的推理吞吐。

llama.cppMetalM1 Max推理优化

b10681

llama.cpp · 08-29 22:36 UTC+8

该提交将 Vulkan 后端的 mul_mat_id 内核 padding 策略从 N 维改为 K 维。因为该内核通过共享内存查找表间接访问行索引,不会产生行坐标越界,但 K 维缺少边界检查,改 padding 后可避免潜在越界。目前该修复已覆盖多组 Vulkan 构建矩阵。

推理优化llama.cppVulkanGPU内核内存安全

viable/strict/1788028080

PyTorch · 08-29 22:33 UTC+8

PyTorch ROCm 相关变更,为 native BMM 外积内核的启动增加保护,以规避 HIP 工作项在特定 shape 或参数下触发的问题。该 guard 主要提升 ROCm 平台上批量矩阵乘法路径的稳定性。

InfraPyTorchROCmHIP矩阵乘法

viable/strict/1788025796: [MPS] Fix linear backward SIGABRT with a 1-D weight (#187989)

PyTorch · 08-29 22:03 UTC+8

修复 PyTorch MPS 后端在 linear 权重为 1-D 形状时的反向崩溃。前向已通过 unsqueeze 将权重扩展为 [1, in_features],反向此前未镜像该处理,导致 rank-1 与 rank-1 非法 matmul,触发 MPSGraph 验证失败 SIGABRT。修复后 1-D 权重的线性层在 macOS GPU 上可正常求导训练。

InfraPyTorchMPS反向传播Bug修复

AI本地部署不如官方版的元凶找到了:734个依赖包,每一个都可能坑

量子位 · 08-29 21:11 UTC+8

文章指出本地部署模型输出与官方版不一致的常见根源在于整个推理软件栈差异,涉及 734 个依赖包。任意依赖版本的微小变化都可能改变最终 token 输出,提示从业者在本地复现官方结果时必须严格控制环境一致性。

推理优化本地部署推理一致性软件依赖Token差异

Nvidia’s AI advantage is moving beyond the GPU

TechCrunch · AI · 08-29 21:00 UTC+8

Nvidia 的 AI 竞争力正从单纯 GPU 算力扩展到数据中心系统级能力。新一代系统通过更智能的流量控制与互连调度来提升效率,而不是只靠增加处理器周期,说明网络和系统架构正成为 AI 基础设施的关键壁垒。

InfraNvidia数据中心网络互连算力效率

Claude开始训练Claude!4美元一小时,跑赢150美元人类研究员

量子位 · 08-29 20:50 UTC+8

量子位报道 Claude 开始参与训练 Claude 自身,成本约 4 美元一小时,表现超过 150 美元一小时的人类研究员。这种 AI 自进化路径有望显著降低高质量模型迭代所需的研究成本。

训练AnthropicClaude自进化训练成本

Coding不再是程序员专属!阿里Qoder这波有点绝

量子位 · 08-29 20:11 UTC+8

阿里 Qoder 将编码能力开放给非程序员,强调 Coding 正在变成 AI 世界的数字执行力。该工具或模型让用户以自然语言驱动可执行任务,降低创意落地的门槛。

厂商动态阿里Qoder代码生成Agent执行力

trunk/454d00cb0b23ad1da94e7ca96a7af69fbe3e2269

PyTorch · 08-29 13:46 UTC+8

PyTorch 修复 XPU Inductor loader fallback 路径中的外部运行库路径保留问题,可避免在 Intel GPU 等加速器上动态加载运行库时路径丢失。该变更提升 XPU 编译与运行时的库解析稳定性。

InfraPyTorchXPUInductor运行时库

viable/strict/1787985328: Revert "Drop unused includes in c10 (#194959)"

PyTorch · 08-29 08:49 UTC+8

回滚了 c10 清理未使用头文件的 PR #194959,因为移除 c10/util/Exception.cpp 中的头文件导致内部构建报错 std::cerr 未声明。说明即使静态分析提示 unused,仍可能隐藏实际的符号依赖。

InfraPyTorchc10构建修复回滚

viable/strict/1787982632

PyTorch · 08-29 08:10 UTC+8

PyTorch 刷新了 pr_time_benchmarks 中的 add_loop_eager_dynamic 和 add_loop_inductor 基准数据,用于跟踪 eager 与 Inductor 动态路径的性能变化。此类基准更新为持续性能回归监控提供基线。

InfraPyTorch基准测试性能跟踪

b10680: snapdragon: python SDK setup (Windows) (#27903)

llama.cpp · 08-29 05:01 UTC+8

llama.cpp 将 Snapdragon 平台的 Windows SDK 安装脚本从 PowerShell 移植到 Python setup-sdk.py,方便安装 Hexagon 与 OpenCL SDK。同时重命名脚本并修正日志输出,提升高通平台在 Windows 上的开发体验。

推理优化llama.cppSnapdragonHexagonWindows

b10679

llama.cpp · 08-29 03:24 UTC+8

llama.cpp 的 bench 工具新增 --tensor-read-lazy 选项,并将相关 lazy mode 别名重命名为 LLAMA_LAZY_MODE_*。该选项有助于按需读取张量,可能降低测试或运行时的显存压力。

推理优化llama.cppbench延迟加载显存优化

b10678

llama.cpp · 08-29 02:53 UTC+8

llama.cpp 针对 qwen4exp 模型减少了计算图切分数量,以降低调度开销并提升推理效率。该优化对 Qwen 系列实验模型的部署性能有直接帮助。

llama.cppQwen计算图推理优化

Spreading the load: How Salesforce met Multi-AZ HA with SageMaker Inference Components

AWS 机器学习 · 08-29 00:20 UTC+8

Salesforce 借助 SageMaker Inference Component 的 SchedulingConfig 参数将模型副本分布到多个可用区,实现 Multi-AZ 高可用合规。该方法保留多模型共宿主机的成本优势,无需牺牲效率即可满足高可用要求。

推理优化AWS SageMaker推理托管高可用Salesforce

Agent 时代,为什么有人开始重新造 Google?

InfoQ 中文 · 08-29 20:00 UTC+8

InfoQ 中文讨论了 Agent 时代为什么有人开始重新构建类似 Google 的信息入口。随着智能体需要结构化、可调用的信息源,搜索和浏览的交互模式可能被重新定义,催生新的信息聚合平台。

Agent搜索引擎信息检索智能体入口

v0.33.2

Ollama · 08-29 04:58 UTC+8

Ollama v0.33.2 发布,app 恢复跟随系统外观并修复深色模式,macOS 应用会正确交接给已运行实例,避免启动第二个进程。同时 Claude Desktop 代理在模型目录更新时不再中断进行中的请求。

推理优化Ollama版本更新macOSClaude Desktop

下一层抽象:从UX角度思考Agentic OS的样貌

InfoQ 中文 · 08-29 02:00 UTC+8

InfoQ 中文从用户体验角度探讨 Agentic OS 的下一层抽象,分析智能体操作系统在交互方式、界面组织和信息架构上应如何适配多智能体工作流。文章关注的是面向用户的操作系统层抽象而非底层框架。

AgentAgentic OS用户体验抽象层智能体交互

Token消耗减少75%,千问办公创造了新的“省钱模式”

InfoQ 中文 · 08-29 00:54 UTC+8

千问办公实现 Token 消耗减少 75%,形成新的成本节省模式。这对将千问用于文档处理、表格分析等办公场景的团队有直接参考价值,也在大模型推理成本优化上提供了实践案例。

厂商动态千问Token优化成本节省办公场景

How Decathlon runs demand forecasting at scale with Chronos-2

AWS 机器学习 · 08-29 00:22 UTC+8

迪卡侬在 AWS 上部署 Chronos-2 进行大规模周度需求预测,覆盖数万种产品和多个大洲。该方案将预测准确率提升 11 到 15 个百分点,并在仅用 CPU 实例的情况下每周推理成本约 0.03 美元,同时降低运维复杂度。

基座Chronos-2AWS需求预测时间序列

论文 20 篇

今日暂无当天新论文。周末或节假日 arxiv 不公告、HuggingFace 每日精选也不更新。以下为近期精选 20 篇

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

HF 精选 · 08-28 08:00 UTC+8

针对「GRPO」在推理多样性上的局限,该工作探索进化策略,通过稀疏功能更新和维持种群多样性,使模型在推理任务中覆盖更广的解空间并提升「Pass@K」指标。结果表明这种进化式训练可与现有强化学习方法形成混合方案,为提升大模型推理覆盖率和探索效率提供新思路。

后训练进化策略推理训练多样性混合训练

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

HF 精选 · 08-28 08:00 UTC+8

该工作提出把游戏开发当作可验证轨迹数据引擎,利用游戏引擎的可执行验证能力生成长程交互轨迹,服务于空间世界模型的强化学习后训练。这种思路将人的工程验证引入数据生成闭环,有望规模化地产出适合世界模型训练的高质量监督信号。

后训练世界模型强化学习后训练游戏引擎轨迹数据

TTPO: Test-Time Policy Optimization

HF 精选 · 08-28 08:00 UTC+8

针对测试时无法获得标签的问题,「TTPO」提出在推理阶段对策略进行优化:对多次「rollout」中答案一致的样本进行非对称蒸馏,对不一致样本施加惩罚,从而无需人工标注即可调整模型。在数学推理任务上,该方法达到了与监督训练相当的性能,为测试时自适应和持续改进提供了新途径。

后训练测试时优化数学推理无标签训练策略优化

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

HF 精选 · 08-28 08:00 UTC+8

针对流匹配模型通常依赖任务专属教师模型的问题,「Self-OPD」提出无教师的在策略蒸馏:通过自探索产生的随机分支和归一化优势函数来优化速度场,实现多目标对齐。这样既省去了额外教师模型的训练和部署成本,又能在策略更新中稳定提升生成质量与目标一致性。

后训练流匹配在策略蒸馏无需教师多目标对齐

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

HF 精选 · 08-28 08:00 UTC+8

该论文从「ACE」视角重新框架智能体数据生成,将其视为对分解后的经验元组进行约束分布设计。作者指出高质量智能体数据应具备执行可验证的准确性、相对学习者能力的复杂度以及充分的多样性,而不是单纯追求数据规模。这为构建高效智能体训练集提供了可操作的筛选与合成原则。

Agent智能体数据数据生成ACE分布设计

PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

HF 精选 · 08-28 08:00 UTC+8

针对长程智能体难以在线自我改进的问题,「PILOT」框架引入人在环监督:监督者可以实时引导正在执行任务的「worker」,系统再将执行经验蒸馏成可复用技能。这种闭环使智能体在长任务中持续提升准确率和效率,并在后续任务中复用已学技能。

Agent长程智能体人在环自我改进技能蒸馏

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

HF 精选 · 08-27 08:00 UTC+8

该工作针对现有「LLM」智能体依赖固定「harness」导致跨模型泛化差的问题,提出可训练的「JIT-Agent」,它能根据具体模型和任务即时合成自适应「harness」。这一方法无需修改基础「LLM」即可提升多模型多任务上的智能体表现,增强了「harness」的智能化和可扩展性。

Agent智能体框架harness演化即时生成跨模型泛化

Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data

HF 精选 · 08-27 08:00 UTC+8

针对无思维链数据场景下「下一块推理强化学习是否优于监督微调」的争论,该研究重新对比了两种训练策略。实验发现,在混合了多种推理语料的监督微调上训练,其效率和最终准确率均超过下一块推理强化学习,且在数学及分布外任务中同样成立。这提示在某些数据受限情况下,精心组织的「SFT」可能是更优选择。

后训练推理训练监督微调强化学习无思维链数据

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

HF 精选 · 08-28 08:00 UTC+8

该工作将世界模型的概率对齐问题形式化,提出用「PAWBench」和「PAWEval」基准把视频生成器当作随机采样器来评估,看其输出分布是否与参考行为分布一致。评测显示当前视频生成模型在概率对齐上明显不足,未能匹配参考分布,揭示了世界模型在随机行为和分布级建模上的短板。

基座世界模型概率对齐基准评测视频生成

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

HF 精选 · 08-28 08:00 UTC+8

该研究构建了一个真实尺度的「3D」城市环境「UrbanGround」,用来检验多模态语言模型智能体能否维持可靠的导航与空间推理。结果发现,虽然模型在局部感知任务上表现尚可,但这些局部技能难以组合成持续的、目标导向的空间行为。这暴露了从感知到空间自主行动之间的能力断层,为后续空间智能体研究提供基准。

Agent空间智能多模态智能体导航基准评测

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

HF 精选 · 08-28 08:00 UTC+8

该技术报告提出「Harness-Aware Training」,让紧凑模型能够在数字分身「harness」配置不断演化的条件下保持适配,实现低延迟和高准确率的智能体行为。相比固定训练模式,这种方法使模型能随环境编排变化动态调整,适合实时数字人场景。

Agent数字分身harness演化紧凑模型低延迟

GameWAM: A World Action Model for Video Games

HF 精选 · 08-28 08:00 UTC+8

针对视频游戏原生控制,「GameWAM」提出统一的世界-动作模型,联合预测未来画面和可执行的键盘鼠标动作。技术上采用块因果流匹配、模态特定分布以及块周期重规划,使模型能直接输出可操作的键鼠控制。这为通用游戏智能体提供了一种从视觉观察到动作执行的端到端建模路径。

基座世界动作模型游戏控制流匹配键鼠动作

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

HF 精选 · 08-28 08:00 UTC+8

针对机器人难以泛化到开放任务的问题,「Zero-WAM」提出以人类示范视频作为上下文条件,驱动因果视频-动作模型完成对未见任务的操控。该方法配套自动生成的数据集和未来块预测目标,使机器人无需针对新任务重新训练即可利用人类演示泛化执行。

基座机器人操控上下文学习世界动作模型任务泛化

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

HF 精选 · 08-28 08:00 UTC+8

该工作提出「WikiSkill」框架,通过让可复用智能体技能与持久的「wiki」式知识库共同演化,系统性地积累每次执行的成功与失败经验。模型在后续任务中检索并运用这些知识,从而跨模型提升智能体性能。它为智能体长期记忆和技能演化提供了一种可扩展的机制。

Agent智能体记忆技能演化知识库跨模型泛化

CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

HF 精选 · 08-28 08:00 UTC+8

该论文提出「CritICL」,一种推理时的弱到强泛化方法:从较小语言模型的结构化失败模式中提取批判性指导,用于改善大模型的推理过程。与需要完整生成或额外标注训练相比,「CritICL」在推理时即可干预,并降低生成步骤和「token」成本,适合低成本提升推理能力。

推理优化推理时优化弱到强泛化批判性指导成本降低

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval

HF 精选 · 08-28 08:00 UTC+8

针对智能体技能检索中关系不准确和规模扩大的问题,「CaSKG」提出用反事实因果图来校准程序性技能之间的依赖与顺序关系。这样得到的技能图更紧凑且可执行,能够提升「LLM」智能体在技能选择和组合时的检索质量,支持可扩展的技能库管理。

Agent技能图谱反事实因果智能体检索可扩展性

EditaLive! Unified Character Video Editing for Live Streaming

HF 精选 · 08-28 08:00 UTC+8

该工作解决了人物直播视频实时编辑的难题,「EditaLive」将图像动画模型改造为因果流式生成架构,并引入蒸馏的两步采样与稀疏注意力。这使得模型能在直播场景下以实时速度完成统一的人物视频编辑,同时保持较好的编辑质量,为直播特效和虚拟人应用提供支持。

推理优化实时视频编辑直播流式生成图像动画模型

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

HF 精选 · 08-27 08:00 UTC+8

该工作推出一个面向原生视觉推理的闭环节测试平台,通过跨多种视觉基底的生成过程,实现可扩展、可验证且可控的推理评测。它让研究人员可以在统一框架下衡量模型从生成到验证的完整闭环能力,弥补现有视觉推理基准难以控制变量的问题。

基座视觉推理测试平台闭环验证生成式评测

VGI-Bench: Probing Visual Intelligence in Video Generation Models

HF 精选 · 08-27 08:00 UTC+8

「VGI-Bench」通过「27」项任务系统探测视频生成模型内部的视觉推理能力,覆盖多种可能考察的场景。评测结果显示当前视频生成模型在视觉推理的可靠性和自我纠正能力上仍很有限,为理解视频模型的认知能力提供了量化依据。

基座视频生成模型视觉推理基准评测自我纠正

FrontierChallenge: Evaluating Scientific Workflow Completion

HF 精选 · 08-27 08:00 UTC+8

「FrontierChallenge」构建了跨多个领域的端到端科学工作流评测,考察前沿模型能否真正完成从问题到结果的全流程。结果发现,尽管模型经常宣称完成并取得较高的部分分数,实际端到端完成率只有约「20%」,揭示了当前模型在复杂科学任务上的可靠性差距。

Agent科学工作流前沿模型评测端到端任务完成率