每日 AI 速览

2026-08-02

生成于 2026-08-03 04:08
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日智能体技术全面进阶:阿里千问发布「Qwen-UI-Agent」技术报告,推动基础 GUI 智能体迈向真实世界交互;Anthropic「Claude Opus 5」则实现从提示词直接生成可玩 3D 游戏原型。记忆成为智能体长程可靠性的关键,多篇论文提出「Metis」记忆基础模型、参数化长期记忆及多智能体记忆「Σ-Mem」,Meta 更用第二智能体充当记忆教练。AI Infra 方面,AMD 开源 MoE 模型 Instella-MoE-16B-A3B,NVIDIA 推出 PyTorch 原生智能体强化学习框架 Molt,推测解码的有损验证研究也揭示推理加速的潜在风险。

行业动态 25 条

Claude Opus 5 pushes prompt-to-game AI from rough color blocks to full 3D prototypes with physics and music

The Decoder · 08-02 16:51 UTC+8

Anthropic的Claude Opus 5仅凭单个提示就能生成包含物理效果和音乐的完整3D游戏(如第一人称射击、卡丁车赛、Minecraft克隆),无需任何外部资产,几何体、纹理、物理乃至音乐均以代码形式在浏览器中运行。与GPT-5.6 Sol和Kimi K3的对比显示,Opus 5生成的细节更丰富,将指令到游戏的生成推向了可玩的3D原型阶段。

厂商动态Claude Opus 53D游戏生成提示到产品Anthropic

AMD Releases Instella-MoE-16B-A3B: A Fully Open Mixture-of-Experts LLM With 2.8B Active Parameters Trained On Instinct GPUs

MarkTechPost · 08-02 03:01 UTC+8

AMD发布了完全开源的混合专家语言模型Instella-MoE-16B-A3B,总参数160亿,每次仅激活2.8B参数,并采用了Gated MLA和FarSkip-Collective技术。该模型在Instinct MI300X和MI325X GPU上从头训练,同时公开了所有训练阶段的权重、数据配比、配置和推理代码,为开源社区提供了完整的MoE训练与部署参考。

基座AMD混合专家模型开源Instinct GPU

Kimi K3 + DeepSeek-V4 Flash + Deep Research + Parallel Chat

Unsloth · 08-02 22:46 UTC+8

Unsloth宣布本地运行Kimi K3和DeepSeek V4 Flash,通过动态GGUF支持多GPU设置,并能并行进行多个聊天。新增深度研究模式可利用本地模型规划、阅读和引用来源,还改进了AMD和Intel GPU支持、DoRA训练等,为开源社区提供了更灵活、高效的高性能模型本地部署方案。

InfraUnslothKimi K3DeepSeek V4本地推理

NVIDIA AI Releases Molt: A PyTorch-Native Agentic Reinforcement Learning Framework

MarkTechPost · 08-02 14:21 UTC+8

NVIDIA发布了Molt,一个PyTorch原生的智能体强化学习框架,仅约8600行RL代码,通过组合Ray、vLLM和NeMo AutoModel构建异步训练循环,避免了算法修改时频繁改动分布式后端和rollout胶水代码。其吞吐量在统计上与Megatron堆栈相当,为研究人员提供更敏捷的Agent RL实验环境。

AgentMolt强化学习框架智能体NVIDIA

Ten advances in mathematics and theoretical computer science

Simon Willison · 08-02 04:34 UTC+8

先是Anthropic用Claude找到密码学弱点,现在OpenAI展示其下一代模型Astra内部版,解决了十个此前未有进展的数学问题。这一波AI驱动的新突破表明前沿模型正成为数学研究的有力工具,并引发对数学文化影响的讨论。

基座OpenAIAstra数学发现理论计算机科学

AI keeps cracking unsolved math problems, and mathematicians have mixed feelings

The Decoder · 08-02 00:01 UTC+8

OpenAI推翻单位距离猜想后,AI接连攻克未解数学难题,菲尔兹奖得主Timothy Gowers称GPT 5.6 Pro首次尝试就解决了他苦思已久的两题。他警示这可能破坏数学文化,而另一些人将其视为生产力工具,反映了数学界对AI的矛盾态度。

基座数学猜想AI辅助GPT 5.6 Pro数学文化

b10228

llama.cpp · 08-02 21:30 UTC+8

llama.cpp最新更新加入了对DeepseekV4 MTP和DSpark的支持,并提供了覆盖macOS、iOS、Linux、Android和Windows的多个预构建二进制,包含多种GPU加速后端,进一步扩展了开源LLM推理的硬件和模型覆盖范围。

Infrallama.cppDeepseekV4推理引擎多平台

OpenAI Presence wants to make AI agents production-ready for businesses

The Decoder · 08-02 21:10 UTC+8

OpenAI推出面向企业的Presence服务,旨在将AI智能体部署到客服和内部工作流的生产环境,与现有Workspace Agents不同,它面向外部部署,且复杂案例可由OpenAI工程师直接介入,这将加速商业智能体从实验到落地的进程。

厂商动态OpenAI Presence企业智能体生产部署客户服务

Meta AI uses a second AI agent as a memory coach to keep long tasks on track

The Decoder · 08-02 20:57 UTC+8

Meta AI为防止智能体在复杂任务中重复已诊断的错误或失败步骤,引入一个独立记忆智能体,维护结构化记忆库并决定何时提醒主智能体。该方案在两个基准上将得分最多提升了8.3个百分点,展示了辅助记忆对长程任务稳定性的价值。

AgentMeta AI记忆智能体长任务跟踪多智能体

b10229

llama.cpp · 08-02 22:33 UTC+8

llama.cpp修复了OpenCL后端的一个引用计数bug,确保程序结束时能正确刷新和写入性能剖析数据,改进了调试和性能分析体验,体现了开源社区对推理引擎稳定性的持续关注。

Infrallama.cppOpenCL后端修复推理引擎

b10227

llama.cpp · 08-02 17:45 UTC+8

llama.cpp新增了针对Qwen3的专用聊天解析器,支持标记思考工具调用,改进了工具调用、连续上下文生成的触发模式,并重构了一些辅助功能,提升了Qwen3系列模型在聊天场景下的交互准确性和流畅度。

Infrallama.cppQwen3工具调用聊天解析器

b10225

llama.cpp · 08-02 16:32 UTC+8

llama.cpp 新增优化:仅在模型实际使用 MiMo V2 的多 Token 预测 (MTP) 张量时才加载它们,避免无关张量占用内存,在推理框架层面对内存使用进行了精细化控制。

llama.cppMiMo V2推理优化内存优化

datasette-apps 0.2a0

Simon Willison · 08-02 05:23 UTC+8

Simon Willison 发布 Datasette Apps 0.2a0,为 Datasette Agent 新增 app_debug() 和 app_list() 两个工具:前者可在一个透明且无交互的 iframe 中运行 JavaScript 以测试应用,后者允许 Agent 列出并编辑用户有权限的应用,增强了 Agent 的应用管理能力。

DatasetteAgent工具调用Datasette Agent

b10226

llama.cpp · 08-02 16:16 UTC+8

llama.cpp 修复了 SYCL 后端中集成 GPU (iGPU) 的分类判断逻辑,使 Intel 集显等设备在 SYCL 路径上能被正确识别与调度。

Infrallama.cppSYCLGPU修复

b10224

llama.cpp · 08-02 15:06 UTC+8

llama.cpp 的 ggml WebGPU 后端新增对 f16 数据类型的 repeat 操作支持,扩展了 WebGPU 推理路径的张量操作覆盖。

Infrallama.cppWebGPUggmlf16

viable/strict/1785670939

PyTorch · 08-02 14:29 UTC+8

PyTorch Dynamo 修复了在嵌套图断裂场景下,对非张量输入调用 mark_static_input 时发生的崩溃,提升了动态图编译的健壮性。

InfraPyTorch Dynamo图断裂崩溃修复mark_static_input

trunk/71a28959709e94d86c365716fe1cbec5cf9881ec

PyTorch · 08-02 14:29 UTC+8

PyTorch Dynamo 在主干分支中修复了嵌套图断裂时 mark_static_input 对非张量输入的崩溃问题,与另一提交协同完成修复。

InfraPyTorch Dynamo图断裂崩溃修复

Open letters about AI development

Simon Willison · 08-02 12:16 UTC+8

Simon Willison 总结了近期多封 AI 发展公开信,特别提到微软主导、235 家 AI 相关公司签署的「Open Weights and American AI Leadership」公开信,该信旨在为美国开放权重 AI 的立场辩护,涉及英伟达、亚马逊、Y Combinator 及 Linux 基金会等。

厂商动态公开信开放权重AI 政策美国 AI 领导力

viable/strict/1785661358

PyTorch · 08-02 11:33 UTC+8

PyTorch Dynamo 对线程局部存储的 _guards 属性设置默认值,使编译调用路径中的 try_get() 方法能避免不必要的同步操作,优化编译调用性能。

InfraPyTorch Dynamo线程局部存储性能优化

viable/strict/1785654730

PyTorch · 08-02 10:54 UTC+8

PyTorch Inductor 在启用确定性算法模式时禁止使用 split scan,以确保计算结果严格可复现,牺牲一定性能换取确定性。

InfraPyTorch Inductor确定性扫描操作

b10223

llama.cpp · 08-02 06:50 UTC+8

llama.cpp 修复了若干持续集成 (CI) 测试中的错误,提升了多平台构建的稳定性。

Infrallama.cppCI测试修复

论文 20 篇

今日暂无当天新论文。周末或节假日 arxiv 不公告、HuggingFace 每日精选也不更新。以下为近期精选 20 篇

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

HF 精选 · 07-31 08:00 UTC+8

针对现有GUI智能体难以在真实设备上可靠运行、跨平台工作、结合CLI与GUI、执行长程任务等问题,Qwen-UI-Agent提出了以真实世界为中心的基座GUI智能体,通过原生支持设备操控、跨应用工作流、主动服务和自我进化等能力,实现了更贴近实际使用场景的GUI自动化。该智能体在多项现实任务中展现出一致的稳定性和泛化性,为构建下一代通用数字执行器提供了参考。

AgentGUI智能体真实世界自动化多平台自我进化

Metis: Memory Foundation Model

HF 精选 · 07-31 08:00 UTC+8

当前智能体记忆主要依赖外部模块,尚未将记忆能力内化到基础模型中。本文首次提出记忆基础模型的概念,让模型原生具备记忆能力,通过构建记忆编码、存储、检索和整合的完整机制,使通用模型能够在持续交互中积累并利用经验。实验表明,Metis在长程对话和任务执行中显著提升了上下文连贯性和知识复用效率,为智能体的长期自主运行奠定基础。

Agent记忆基础模型原生记忆长程智能体上下文持续学习

Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory

HF 精选 · 07-31 08:00 UTC+8

Decoder-only语言模型将长程记忆与推理混在单一参数集中,难以独立扩展记忆容量。本文在前期Memory Decoder基础上,将参数化长程记忆模块扩展到69亿参数、300B词元的预训练规模,并解决了大规模索引和检索的成本问题。该工作证明可独立扩展的记忆模块在长文本理解与知识密集型任务上保持性能优势,为解耦记忆与推理提供了可行路径。

基座参数化记忆预训练规模记忆扩展长文本理解

Multi-Head Attention Residuals

HF 精选 · 07-31 08:00 UTC+8

传统Transformer仅通过单一残差流传递信息,每个子层只能读取最近状态,而注意力残差虽允许跨层读取,却用同一查询分布服务所有特征子空间,导致不同子空间对读取深度的偏好被迫妥协。本文提出多头注意力残差,为每个头分配独立的学习查询,使不同特征子空间可各自关注不同的历史层。该方法在语言建模和长程任务中提升了表示质量,并缓解了深度利用的不平衡问题。

基座注意力残差多头机制深层表示信息流

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

HF 精选 · 07-31 08:00 UTC+8

面向递归自我改进(RSI)的AI系统需能改进构建AI的过程,机器学习工程(MLE)为此提供了可执行测试。本文构建了OpenMLE完整系统,包含可验证任务环境、操作学习和长程搜索,并在该栈上后训练了Frontis-MA1(35B)作为元进化智能体,使其能够迭代优化自身训练流程。实验显示该模型在多种MLE子任务上实现自动改进,向AI驱动的AI研发迈出一步。

后训练递归自我改进AI4AI机器学习工程元进化

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

HF 精选 · 07-31 08:00 UTC+8

现有智能视觉推理方法常引入复杂但低效的范式,未能权衡何时需要工具以及工具的实际效果。本文从模式适应性(MA)和工具效果(TE)两个维度反思了智能视觉推理,并提出Beacon框架,使多模态大模型能够识别工具调用必要性并按需调用,从而在避免不必要开销的同时提高成功率。在多个视觉问答基准上,Beacon以更少的推理步骤获得更高准确率。

Agent智能视觉推理工具调用模式适应性多模态大模型

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

HF 精选 · 07-31 08:00 UTC+8

不同RAG范式(词汇检索、稠密检索、图索引、智能搜索)通常在不同语料规模下被评估,缺乏公平的精度-成本缩放对比。本研究在28个严格嵌套的语料规模层级上,控制问题与相关/对抗文档不变,对比发现随着语料增大,经典的BM25词汇检索在准确率和效率上反而优于复杂的稠密检索和智能搜索方法。这一发现提醒业界不应忽视简单基线在大规模场景下的竞争力。

InfraRAG范式语料规模BM25检索效率

Flux-OPD: On-Policy Distillation with Evolving Contexts

HF 精选 · 07-31 08:00 UTC+8

在开放域训练大语言模型时缺乏可验证奖励,而上下文可传递偏好但被蒸馏后即失去额外监督作用。本文提出Flux-OPD,一种利用随学生模型性能不断演化的上下文进行策略蒸馏的方法,通过稳定化机制解决了演化上下文带来的不稳定和分布冲突问题。在偏好对齐任务上,该方法比静态上下文蒸馏获得了更好的奖励和泛化性。

后训练策略蒸馏演化上下文偏好对齐自监督

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

HF 精选 · 07-31 08:00 UTC+8

视觉语言模型在具身智能中要么擅长整体任务推理却忽略空间细节,要么能捕捉空间细节却无法做任务级决策。SpatialCLI提出一个框架,先让模型学习调用空间工具(如深度估计、目标检测)进行辅助推理,再逐步内化这些能力,最终在不依赖外部工具的情况下完成空间推理。实验表明该训练方式显著提升了模型在长程操作任务上的成功率。

Agent空间推理视觉语言模型工具调用能力内化

β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

HF 精选 · 07-31 08:00 UTC+8

同策略自蒸馏(OPSD)在实际中往往难以稳定工作。本文指出OPSD本质上是策略优化家族中β=1的特例,其中β控制学生锚定到参考策略的KL惩罚权重,进而将难调的隐式参数转变为可控调节旋钮。通过调整β,该方法可平衡探索与稳定性,使自蒸馏训练在数学推理等任务中更鲁棒且性能更高。

后训练同策略自蒸馏策略优化KL惩罚推理语言模型

Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems

HF 精选 · 07-31 08:00 UTC+8

现有多智能体记忆系统大多存储交互内容,却未建模智能体间的可信度,导致中心模型无法有效甄别协作同伴的响应。Σ-Mem提出在线可靠性记忆,记录每个同伴的历史能力证据与关系证据,从而动态评估并筛选可靠信息。在需要协作推理的任务中,该机制提升了多智能体系统输出的准确性和鲁棒性。

Agent多智能体系统可靠性记忆信任建模协作推理

Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

MicrosoftHF 精选 · 07-31 08:00 UTC+8

训练计算机使用智能体需要大量可交互、可重置的应用程序环境,但关键应用往往需登录且有状态,合成环境虽是替代,但瓶颈已从数量转向环境内涵。本文提出Echoverse,一种生成具有深度行为、针对当前智能体交互短板且不断演化的环境的方法,让训练信号更丰富。由此训练的智能体在真实网站任务上的成功率比在静态合成环境中训练显著提高。

Agent计算机使用智能体合成环境行为深度演化训练

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

HF 精选 · 07-31 08:00 UTC+8

长视觉上下文下,视觉语言模型性能随干扰增多而下降,且全图token计算开销巨大。ReToken引入一个可学习的嵌入token作为显式检索目标,从预填充的视觉KV缓存中动态筛选出与查询最相关的稀疏视觉token集合。该方法仅需少量图像QA数据训练,就能在图像和视频检索基准上取得一致提升,并大幅降低计算量。

推理优化视觉检索长上下文token筛选视觉语言模型

Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes

HF 精选 · 07-31 08:00 UTC+8

推测解码中引入的有损验证以放松分布匹配为代价换取速度,但其对生成质量的影响尚不明确。本文系统分析了有损验证背后的机理、加速与质量间的权衡以及潜在的失败模式,发现其静默改写了解码分布,可能造成严重的质量下降。作者提出了检测和缓解这些风险的策略,为工业部署提供了指导原则。

推理优化推测解码有损验证生成质量推理加速

OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

HF 精选 · 07-31 08:00 UTC+8

现有全模态大模型在token压缩时常依赖一种模态指导另一种模态,但音频和视频的相关性往往在不同时刻达到峰值,这种跨模态显著度不匹配导致激进压缩时丢失关键线索。OmniScope提出训练免的token压缩框架,以查询为桥梁分别独立压缩各模态token,避免跨模态干扰。在视听问答等任务上,该方法以更高压缩比保持了准确率。

推理优化全模态模型token压缩跨模态不匹配视听理解

Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

HF 精选 · 07-31 08:00 UTC+8

深度研究智能体可执行长链信息搜集与报告生成,但在开放信息环境中,看似可信但事实错误的知识是否会被采纳为结论尚不明。本文构建MisKnow-Agent框架,研究误导性知识在规划、检索、综合等环节的传播,发现当前智能体极易被诱导产生错误结论。该工作量化了信息污染的风险,为提升深度研究可靠性提供了基准。

Agent深度研究智能体信息可靠性事实错误报告生成

Beyond Geometric Complementarity: Coherent Overlap in Sparse Mixture-of-Experts Routing

HF 精选 · 07-31 08:00 UTC+8

稀疏混合专家(MoE)模型通常认为联合选择的专家应贡献互补的表示方向,但其收益可能来自路由一致性、候选质量等多重因素。本文通过提出专家子空间分离指数等分析工具和干预实验,发现成功的路由并非追求互补,反而是专家间表示的重叠(相干性)与更高的下游表现相关。这一发现挑战了传统几何互补假设,为改进MoE路由提供了新视角。

基座混合专家路由机制表示重叠专家选择

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

HF 精选 · 07-31 08:00 UTC+8

具身智能数据瓶颈在于现有数据集割裂了第一人称感知、全身运动、灵巧操作、物体状态、声音和触觉等随时间演化的全貌。Ambient Capture Engine将真实家居环境转化为多传感器捕捉空间,同步记录人实现目标过程中的全感觉-行动闭环数据。由此构建的ACE-Data-0数据集为训练真正整合多模态物理交互的模型提供了高质量来源。

训练具身数据引擎多模态捕捉感知-行动闭环灵巧操作

RefCaptioner: Multi-Reference Image-Grounded Video Captioning

HF 精选 · 07-31 08:00 UTC+8

现有视频描述模型无法将局部视觉元素显式关联到多张参考图像。本文提出多参考图像视频描述新任务,要求短语级引用定位,并设计了RefCaptioner两阶段后训练框架,结合混合数据SFT与层级覆盖折扣GRPO,共同优化引用选择与描述准确性。在多个基准上,该模型显著提升了描述的事实性和引用精度。

视频描述多参考图像视觉定位后训练

See2Think: Do Multimodal Models Really Use Intermediate Visual States?

HF 精选 · 07-31 08:00 UTC+8

多模态大模型在推理时越来越多地使用草图、标注和中间图像,但缺乏诊断其是否真正依赖这些视觉状态的方法。See2Think构建了一个统一评估框架,不仅评估最终答案,还分析中间视觉状态的生成、渲染和利用情况,揭示出多数模型仅表面使用中间图像,甚至存在文本捷径。这为改进多模态推理提供了可解释性工具。

基座多模态推理中间视觉状态评估框架可解释性