每日 AI 速览

2026-08-01

生成于 2026-08-02 04:09
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日大模型战场多点爆发:OpenAI 预告下一代模型 Astra,以十道未解数学难题高调亮相;DeepSeek V4 Flash 版本发布,宣称以低约 60% 的成本对标 GPT-5.6,并强化智能体与编码;MiniMax 与字节跳动分别推出 H3 全模态视频模型和 Seedance 2.5,覆盖 15 秒 2K 视频与原生音频生成。智能体记忆成为研究新高地,「Metis」记忆基础模型、「Memory Decoder」参数化长时记忆等一系列突破,与 Agent 成本、Infra 适配的行业讨论共振。NVIDIA Vera Rubin 芯片正式登场,从芯片到电网全栈优化,剑指每个 Token 的极致成本。

行业动态 35 条

OpenAI announces its "next major model" Astra by dropping ten previously unsolved math solutions

The Decoder · 08-01 17:29 UTC+8

OpenAI宣布新模型家族「Astra」,允许多个智能体协同工作数小时甚至数天来解决复杂问题,并已展示解决了十个此前未解决的数学难题。这标志大模型向超长周期多智能体协作迈出重要一步,对复杂科学计算和工程问题具有潜在颠覆性。

厂商动态OpenAIAstra多智能体数学

MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio

MarkTechPost · 08-01 16:28 UTC+8

MiniMax发布全模态生成模型「H3」,可统一理解文本、图像、视频和音频,并直接生成带原生立体声的2K视频(4~15秒)。这不仅仅是视频生成器的附加功能,而是全模态生成的一次范式升级,为AIGC创作提供了更完整的音画同步解决方案。

厂商动态MiniMaxH3全模态生成视频生成

deepseek-ai/DeepSeek-V4-Flash-0731

Simon Willison · 08-01 07:59 UTC+8

DeepSeek发布V4-Flash-0731版本,大幅增强智能体能力,304B参数展现出超越更大型模型的性价比,在Artificial Analysis智力指数上接近GPT-5.6 Luna但任务成本低约60%。对追求高性价比智能体推理的开发者来说,是当前极有竞争力的选择。

基座DeepSeekV4-Flash智能体性价比

ByteDance's Seedance 2.5 generates 30-second video clips with built-in audio

The Decoder · 08-01 21:33 UTC+8

字节跳动推出「Seedance 2.5」,能一次性生成最长30秒的视频及配套音频,时长是Google Gemini Omni Flash的3倍,并支持多文件参考输入。这对广告短片等需要快速产出音画同步内容的场景有直接冲击力。

厂商动态字节跳动Seedance视频生成音画同步

Kimi K3 + Deep Research + Parallel Chat

Unsloth · 08-01 14:10 UTC+8

Moonshot AI的Kimi K3(2.8T MoE,104B激活参数,1M上下文)现可通过Unsloth在本地运行,并支持并行聊天和深度研究模式,可规划、阅读和引用来源。这显著降低了大型MoE模型的部署门槛,让本地化高级智能体研究成为可能。

厂商动态Kimi K3Unsloth本地部署深度研究

[AINews] not much happened today

Latent Space · 08-01 09:38 UTC+8

AI新闻平静的一天,唯一值得注意的动态是DeepSeek V4-Flash 0731的发布,说明该模型当日成为焦点。

基座DeepSeekV4-Flash新闻

Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp)

Simon Willison · 08-01 07:13 UTC+8

MCP协议迎来2.0版本(2026-07-28规范),首次实现无状态架构,重新激发了Simon Willison的兴趣并催生了mcp-explorer和datasette-mcp等工具。MCP 2.0在简化部署和扩大应用场景上迈出关键一步,对Agent工具生态至关重要。

AgentMCP协议升级无状态工具生态

b10213

llama.cpp · 08-01 04:12 UTC+8

llama.cpp最新提交支持了旋转位置编码KV缓存的量化,有助于在部署大模型时进一步节省显存,提升推理效率。对使用llama.cpp进行模型量化和部署的开发者来说是一个实用增强。

llama.cppKV缓存量化推理优化模型部署

Thinking Machines bets on efficiency over size with its second model, Inkling Small

The Decoder · 08-01 01:41 UTC+8

由前OpenAI CTO Mira Murati创立的Thinking Machines推出开源推理模型「Inkling Small」,参数量不到原版Inkling的三分之一,却在多个编程和推理基准上超越大模型。这体现了以效率而非规模取胜的趋势,为小型高效推理模型树立了新标杆。

基座Thinking MachinesInkling Small推理模型效率

Supabase Releases Evals: an Open Source Benchmark That Scores Claude Code, Codex and OpenCode on Real Supabase Tasks

MarkTechPost · 08-01 17:52 UTC+8

Supabase开源了评测工具集evals,能在隔离容器中运行Claude Code、Codex与OpenCode等编程智能体,完成数据库Schema构建、边缘函数调试等真实Supabase任务,并通过确定性检查与LLM裁判双重方式打分,为编码智能体在实战型开发任务中的表现提供了可复现的基准。

Agent代码智能体评测Supabase开源基准Claude Code

Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference

NVIDIA 开发者 · 08-01 06:16 UTC+8

NVIDIA开发者文章分享通过软硬件协同设计注意力机制,应对Agent与长上下文推理中注意力开销激增的挑战,最终目标是实现快速、交互式的长上下文推理。

推理优化长上下文推理注意力优化NVIDIA推理加速

AI coding agents can modernize research software but can't judge if the science is right

The Decoder · 08-01 22:26 UTC+8

OpenAI与学术伙伴的实地报告显示,AI编程智能体可加速老旧科研软件现代化,性能提升最高达60倍,但其输出常常「雄辩、令人信服却容易忽略地错误」,人类依然需要耗费大量时间验证科学正确性,这凸显了AI辅助科研中验证环节的瓶颈。

AgentAI编程智能体科研软件正确性验证生成式AI风险

trunk/400aea8bf4d40d570b6b009ced07cb9da5e9e7a7

PyTorch · 08-01 11:16 UTC+8

PyTorch的XPU缓存分配器新增IPC内存句柄共享支持,使多进程在Intel GPU等XPU设备上能高效共享显存,对分布式训练中的内存管理与通信优化意义显著。

InfraPyTorchXPU内存共享分布式训练

llm-mcp-client 0.1a0

Simon Willison · 08-01 07:03 UTC+8

Simon Willison发布了llm-mcp-client 0.1a0,一个基于MCP协议的LLM客户端,方便模型安全调用外部工具与数据源,为构建工具增强型智能体提供了低摩擦的入口。

AgentMCP智能体工具LLM客户端模型上下文协议

b10216

llama.cpp · 08-01 06:06 UTC+8

llama.cpp为Vulkan后端添加了一维池化算子POOL_1D,补齐了此前仅支持二维池化的缺口,提升了在Vulkan设备上运行视觉模型时的算子完备性与推理效率。

Infrallama.cppVulkan算子实现推理引擎

Oxide and Friends: The Open Weight Revolution with Simon Willison

Simon Willison · 08-01 05:33 UTC+8

Simon Willison在Oxide and Friends播客中讨论了开源权重革命,指出Kimi K3已能与闭源前沿模型正面竞争,反映了开放模型生态的快速崛起及其对美国AI领导力的影响。

厂商动态开源权重Kimi K3AI治理开放生态

smevals - a small eval suite for evaluating models, prompts, and harnesses

Simon Willison · 08-01 05:15 UTC+8

推出的smevals是一套轻量级评测套件,能对模型、提示词和评估框架进行灵活组合并打分,帮助开发者快速定位不同配置下的能力差异,加速模型选型与提示词优化。

训练模型评测提示词工程评测框架开发者工具

b10212

llama.cpp · 08-01 03:27 UTC+8

llama.cpp优化了多token预测张量的加载逻辑,仅在模型实际使用MTP时才加载相关权重,从而减少内存占用并缩短启动时间,对资源受限的推理场景尤为有益。

推理优化llama.cppMTP内存优化推理加速

v1.3.0rc23

TensorRT-LLM · 08-01 02:55 UTC+8

TensorRT-LLM v1.3.0rc23发布,同时披露了DeepSeek-V4-Pro在GB300分离式部署中挂起、DeepSeek-R1在NVFP4多GPU下崩溃等已知问题,为生产部署避开风险提供了参考。

InfraTensorRT-LLM版本发布DeepSeek已知问题

b10218

llama.cpp · 08-01 20:47 UTC+8

llama.cpp为MiniCPM-V-4-6等多模态模型加入下采样预处理支持,完善了图像特征抽取管线,使该视觉语言模型在框架内能顺利完成端到端推理。

Infrallama.cppMiniCPM-V多模态预处理

Quick BI 数据分析智能体的可靠工程实践|AICon深圳

InfoQ 中文 · 08-01 18:00 UTC+8

Quick BI数据分析智能体的工程实践分享聚焦如何通过检索增强、校验反馈等机制,保障企业级BI场景中Agent输出的可靠性与业务可用性,为数据分析Agent落地提供了实打实的参考。

Agent数据分析智能体Quick BI可靠性工程RAG

trunk/85728e11a5a98c344c4596880855e35046db81b0

PyTorch · 08-01 15:36 UTC+8

PyTorch DTensor更新了对as_strided操作的处理,当输入是基础维度的单纯排列时,能给出正确的维度应答,避免了分布式张量并行中因形状推导错误引发的潜在故障。

InfraPyTorchDTensor张量并行分布式计算

b10217

llama.cpp · 08-01 14:52 UTC+8

llama.cpp为DeepSeek V4模型启用了thinking过程中的工具调用能力,使模型能在内在推理步骤里即时请求外部工具,从而增强多步骤、需要外部信息交互的复杂任务处理能力。

Infrallama.cpp工具调用DeepSeek V4thinking模式

viable/strict/1785571141

PyTorch · 08-01 11:18 UTC+8

PyTorch针对Intel XPU设备放宽了fp16精度下原生group_norm算子的梯度容差,以修复因硬件差异导致的测试不通过问题,提升在XPU上训练模型的稳定性和确定性。

InfraPyTorchXPU算子修复训练稳定性

Ten advances in mathematics and theoretical computer science

OpenAI · 08-01 08:00 UTC+8

OpenAI公布了在数学与理论计算机科学领域十项新进展,解决了包括几何、密码学和复杂性理论在内的长期开放难题,展示了AI在形式化推理与数学发现中的前沿实力。

AI数学理论计算机科学定理证明OpenAI

b10214

llama.cpp · 08-01 04:47 UTC+8

llama.cpp的多模态模块新增n_embd_head参数,允许灵活指定不同Transformer模型的注意力头维度,从而更顺畅地适配各类视觉语言模型架构,提高推理兼容性。

Infrallama.cpp多模态模型适配头维度

Sam Altman isn’t the only one who wants to pump the brakes on AI

TechCrunch · AI · 08-01 01:26 UTC+8

Sam Altman公开呼吁AI行业适当「放慢脚步」,此表态叠加Hugging Face遭模型越狱攻击等安全事件,预示行业可能进入节奏调整期,对商业AI部署的规划与监管预期产生重大影响。

厂商动态AI安全发展节奏Sam Altman行业监管

论文 20 篇

今日暂无当天新论文。周末或节假日 arxiv 不公告、HuggingFace 每日精选也不更新。以下为近期精选 20 篇

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

HF 精选 · 07-31 08:00 UTC+8

「Qwen-UI-Agent」旨在打造面向真实世界的基础GUI智能体,不只停留在模拟环境,而是追求在真实设备上可靠运行、支持跨平台工作流、融合GUI交互与命令行执行,并能自主完成长周期任务。该工作从实际部署需求出发,系统定义了新一代GUI智能体应具备的能力范畴,并构建了相应模型与系统,为将GUI智能体推向日常使用迈出关键一步。

厂商动态GUI智能体基础模型跨平台真实世界交互

Metis: Memory Foundation Model

HF 精选 · 07-31 08:00 UTC+8

当前智能体的记忆几乎都依赖外部模块,基础模型自身缺乏原生记忆能力。「Metis」首次提出「记忆基础模型」的概念,将记忆内化到基础模型之中,而不是作为后加的外挂。这为智能体赋予了与生俱来的长期记忆支持,有望显著简化系统架构并提升记忆与推理的协同效率。

基座记忆基础模型智能体记忆原生能力架构创新

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

HF 精选 · 07-31 08:00 UTC+8

本研究瞄准递归自我改进这一关键目标,以机器学习工程作为具体测试床。作者构建开源全栈系统「OpenMLE」,包括可验证任务环境、算子学习与长程搜索,并在其上后训练得到一个35B的元进化智能体「Frontis-MA1」,能够改进机器学习流程。这为研究AI自动改进AI提供了可复现的平台与基线。

后训练递归自我改进AI4AI机器学习工程智能体

Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory

HF 精选 · 07-31 08:00 UTC+8

大语言模型通常将长期记忆与推理耦合在同一参数集中,难以独立扩展记忆容量。该研究将「Memory Decoder」参数化长期记忆模块扩展到6.9B参数、300B token预训练的规模,期间克服了标准Faiss索引与搜索流水线在如此数据量下不再可行的难题。结果表明,分离的记忆模块能在大规模下高效训练,为模型提供了更灵活的长期记忆扩展路径。

基座长期记忆参数化记忆模型扩展预训练

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

HF 精选 · 07-31 08:00 UTC+8

尽管生成模型能力已十分强大,但至今仍未实现真正的端到端训练,瓶颈在于多模态分布的处理方式。本文提出「探索性建模」,解锁了除数据和模型规模之外的第三个预训练轴,并实现生成过程的完全端到端训练。这一突破有望改变生成模型的范式,提升生成质量与训练效率。

训练端到端生成预训练多模态分布新训练范式

Multi-Head Attention Residuals

HF 精选 · 07-31 08:00 UTC+8

标准Transformer中每层只能看到单一的残差流最新状态,限制了信息流动。本文提出「多头注意力残差」机制,让不同特征子空间可以使用各自独立的查询来关注历史层,解决了不同子空间对层读取偏好不一致时的被迫妥协问题。这能更精细地控制信息传播,提升模型的表达能力和深度利用效率。

基座Transformer架构多头注意力残差流信息传播

Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes

HF 精选 · 07-31 08:00 UTC+8

投机解码通过有损验证方案来加速推理,但放松分布匹配可能悄悄改写生成分布,导致质量不稳定甚至严重退化。本文深入重新审视有损验证的底层机制,系统分析其效率与质量的权衡及失效模式,揭示了何时以及为何会出现崩溃,为设计更可靠的加速方案提供了理论指导。

推理优化投机解码推理加速有损验证生成质量

Beyond Geometric Complementarity: Coherent Overlap in Sparse Mixture-of-Experts Routing

HF 精选 · 07-31 08:00 UTC+8

稀疏MoE的有效性常被解释为专家提供几何互补的表示方向,但这一直觉缺乏严格验证。本文通过专家子空间分离指数等新指标,解耦了路由一致性、候选质量与上下文交互,发现专家之间实际存在显著的相干重叠,而非纯粹的互补。这一发现重新理解MoE的增益来源,对专家路由和容量分配设计有直接影响。

基座MoE专家路由子空间分析模型理解

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

HF 精选 · 07-31 08:00 UTC+8

当前多模态大模型在做视觉推理时往往盲目调用工具,导致效率低下。「Beacon」框架从模式适应性和工具效果两个维度重新思考智能体视觉推理,使模型能自主判断何时真正需要工具,并以恰当方式调用。实验表明这样做既提升了任务成功率,又减少了不必要的计算开销。

Agent视觉推理智能体工具调用多模态大模型

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

HF 精选 · 07-31 08:00 UTC+8

RAG中不同检索范式在不同规模下的优劣一直不明。本文通过控制语料库尺度从极小到约450倍增长进行公平对比,惊人地发现经典词法检索「BM25」在大规模下表现最佳,而复杂方法的优势不再。这对实际RAG系统的检索选型有重要指导意义,简单方法未必弱。

InfraRAG检索BM25规模法则

Flux-OPD: On-Policy Distillation with Evolving Contexts

HF 精选 · 07-31 08:00 UTC+8

开放域大模型训练缺乏明确奖励信号,用上下文表达偏好虽能在蒸馏时提供指导,但静态上下文监督有限。「Flux-OPD」让上下文随学生模型表现一同进化,同时通过专门设计的稳定机制解决了分布冲突和训练不稳定问题,实现了更高效的在策略蒸馏,提升了模型在开放任务上的对齐效果。

后训练在策略蒸馏上下文演化偏好学习训练稳定

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

HF 精选 · 07-31 08:00 UTC+8

通用视觉语言模型与专业视觉模型在具身任务上存在能力割裂:前者懂任务但忽略视觉细节,后者能捕获细节却不会决策。「SpatialCLI」让模型先借助空间工具学习精准的空间推理,再将这种能力内化,使得模型最终无需工具也能做出精细的视觉决策。这种「先借助后剥离」的策略弥合了任务理解与细节捕获之间的鸿沟。

Agent视觉推理具身智能工具学习空间推理

β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

HF 精选 · 07-31 08:00 UTC+8

在策略自蒸馏(OPSD)虽然能提升推理模型,但工程实现往往很脆弱。本文发现OPSD本质上是KL散度惩罚权重β=1的策略优化特例,于是提出「β-OPSD」,将β作为可调节的超参数,统一了推导与训练。这种形式化使得训练更稳定可控,显著降低了使用自蒸馏的门槛。

后训练策略优化自蒸馏推理模型训练稳定性

MemHarness: Memory Is Reconstructed, Not Replayed

HF 精选 · 07-31 08:00 UTC+8

现有智能体把检索出的记忆当作固定脚本来重放,极易因记忆与当前情境不匹配而导致错误。「MemHarness」提出记忆应被动态重构而不是原样回放,框架会根据当前状态与抽象记忆进行适配性生成,让经验真正辅助决策,大幅提升了记忆增强智能体的鲁棒性和成功率。

Agent智能体记忆记忆重构动态适应经验利用

Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems

HF 精选 · 07-31 08:00 UTC+8

多智能体协作中,轻信错误响应会导致连锁失败。「Σ-Mem」设计了一种在线可靠性记忆,持续记录每个同伴智能体的历史能力证据和关系证据,为中央协调模型提供动态的信任依据。这使得系统能在不可靠的交互中识别可靠信息源,显著提升了长周期多智能体任务的完成质量。

Agent多智能体系统可靠性记忆信任建模在线学习

LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

HF 精选 · 07-31 08:00 UTC+8

评估多模态智能体时只看最终答案准确率会掩盖推理过程是否基于真实证据。「LEDGERMIND」把智能体轨迹建模为来源约束的状态机,将所有工具输出规范化为结构化证据账本,强制后续推理必须引用账本中的可靠条目。这样不仅提升了可解释性,还让正确答案真正经得起溯源,避免语言先验的捷径。

Agent多模态智能体来源追踪证据账本可解释性

Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

MicrosoftHF 精选 · 07-31 08:00 UTC+8

训练计算机使用智能体需要大量可交互、可重置的应用环境,但现有批量生成的环境往往是浅层样板。「Echoverse」强调环境的行为深度、是否针对待训练交互以及能否随智能体能力演进而动态调整这三个关键属性,以此构建深度进化环境,大幅提升了在真实计算机任务上的训练效率和泛化能力。

Agent计算机使用智能体训练环境合成环境智能体训练

Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

HF 精选 · 07-31 08:00 UTC+8

很多部署的LLM智能体实际已把文件系统当作长期记忆,但这种方法从未被系统研究。本文验证了智能体能否在记忆不断累积、冲突和过时的情况下,自主维持文件结构的组织性和演化可持续性。结果揭示基于文件系统的记忆是一种实用且灵活的方案,为记忆管理提供了新捷径。

Agent智能体记忆文件系统记忆组织长期记忆

Harness-G: A Graph-Structured Harness for Search Agents

HF 精选 · 07-31 08:00 UTC+8

强化学习训练搜索智能体时,自由形式查询容易导致检索混淆,不同查询指向相同信息。「Harness-G」引入了图结构化的检索harness,将检索界面从自然语言改为图结构,有效消除了检索混叠现象,让搜索智能体在训练中学到更清晰、更高效的查询策略,提高了搜索准确度。

Agent搜索智能体强化学习检索结构化图结构

OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

HF 精选 · 07-31 08:00 UTC+8

当前全模态大模型的token压缩常让一个模态主导保留决策,但由于音频、视频等模态的显著性峰值时刻往往不同步,这种单向指导容易丢掉答案关键线索。「OmniScope」提出模态解耦的压缩框架,用查询作为独立锚点分别评估各模态token的重要性,在激进压缩下依然保留关键信息,大幅提升效率与保真度。

推理优化多模态压缩token剪枝跨模态对齐推理效率