OpenAI announces its "next major model" Astra by dropping ten previously unsolved math solutions
OpenAI宣布新模型家族「Astra」,允许多个智能体协同工作数小时甚至数天来解决复杂问题,并已展示解决了十个此前未解决的数学难题。这标志大模型向超长周期多智能体协作迈出重要一步,对复杂科学计算和工程问题具有潜在颠覆性。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
OpenAI announces its "next major model" Astra by dropping ten previously unsolved math solutions
OpenAI宣布新模型家族「Astra」,允许多个智能体协同工作数小时甚至数天来解决复杂问题,并已展示解决了十个此前未解决的数学难题。这标志大模型向超长周期多智能体协作迈出重要一步,对复杂科学计算和工程问题具有潜在颠覆性。
MiniMax发布全模态生成模型「H3」,可统一理解文本、图像、视频和音频,并直接生成带原生立体声的2K视频(4~15秒)。这不仅仅是视频生成器的附加功能,而是全模态生成的一次范式升级,为AIGC创作提供了更完整的音画同步解决方案。
deepseek-ai/DeepSeek-V4-Flash-0731
DeepSeek发布V4-Flash-0731版本,大幅增强智能体能力,304B参数展现出超越更大型模型的性价比,在Artificial Analysis智力指数上接近GPT-5.6 Luna但任务成本低约60%。对追求高性价比智能体推理的开发者来说,是当前极有竞争力的选择。
NVIDIA Vera Rubin 正式登场:从芯片卷到电网,只为压低每一个 Token 的成本
NVIDIA发布「Vera Rubin」平台,从芯片架构到电力基础设施全面革新,旨在最大程度降低每个Token的推理成本。这延续了NVIDIA在推理效率上的系统级优化思路,对大规模部署生成式AI的企业至关重要。
New Deepseek Flash model matches OpenAI's GPT-5.6 Luna at roughly 60 percent lower cost
DeepSeek V4 Flash经过0731更新后,智力指数提升至与OpenAI GPT-5.6 Luna仅差一分,而任务成本低约60%。这进一步突显了DeepSeek在极高性价比模型上的竞争力,对预算敏感的生产环境极具吸引力。
ByteDance's Seedance 2.5 generates 30-second video clips with built-in audio
字节跳动推出「Seedance 2.5」,能一次性生成最长30秒的视频及配套音频,时长是Google Gemini Omni Flash的3倍,并支持多文件参考输入。这对广告短片等需要快速产出音画同步内容的场景有直接冲击力。
Kimi K3 + Deep Research + Parallel Chat
Moonshot AI的Kimi K3(2.8T MoE,104B激活参数,1M上下文)现可通过Unsloth在本地运行,并支持并行聊天和深度研究模式,可规划、阅读和引用来源。这显著降低了大型MoE模型的部署门槛,让本地化高级智能体研究成为可能。
[AINews] not much happened today
AI新闻平静的一天,唯一值得注意的动态是DeepSeek V4-Flash 0731的发布,说明该模型当日成为焦点。
Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp)
MCP协议迎来2.0版本(2026-07-28规范),首次实现无状态架构,重新激发了Simon Willison的兴趣并催生了mcp-explorer和datasette-mcp等工具。MCP 2.0在简化部署和扩大应用场景上迈出关键一步,对Agent工具生态至关重要。
DeepSeek Upgrades DeepSeek-V4-Flash-0731 with Major Agentic and Coding Gains
DeepSeek发布V4-Flash-0731正式版,在智能体编程方面有显著提升,通过重新后训练获得,架构尺寸不变。这对依赖DeepSeek API进行智能体和代码生成的用户是即时利好。
llama.cpp最新提交支持了旋转位置编码KV缓存的量化,有助于在部署大模型时进一步节省显存,提升推理效率。对使用llama.cpp进行模型量化和部署的开发者来说是一个实用增强。
Thinking Machines bets on efficiency over size with its second model, Inkling Small
由前OpenAI CTO Mira Murati创立的Thinking Machines推出开源推理模型「Inkling Small」,参数量不到原版Inkling的三分之一,却在多个编程和推理基准上超越大模型。这体现了以效率而非规模取胜的趋势,为小型高效推理模型树立了新标杆。
Supabase开源了评测工具集evals,能在隔离容器中运行Claude Code、Codex与OpenCode等编程智能体,完成数据库Schema构建、边缘函数调试等真实Supabase任务,并通过确定性检查与LLM裁判双重方式打分,为编码智能体在实战型开发任务中的表现提供了可复现的基准。
李飞飞World Labs收购SceniX,物理AI训练正从“采数据”走向“造世界”
李飞飞创立的World Labs收购了SceniX,这意味着物理AI训练正从传统的「采集数据」转向「建造高保真虚拟世界」,以解决具身智能对大规模、可交互训练场景的迫切需求。
Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference
NVIDIA开发者文章分享通过软硬件协同设计注意力机制,应对Agent与长上下文推理中注意力开销激增的挑战,最终目标是实现快速、交互式的长上下文推理。
Agent 成本失控背后:上下文、人工审核与维护成本正在被低估|请回答 WAIC 2026
InfoQ文章指出,Agent应用的成本失控源于上下文窗口的高频消耗、人工审核纠错以及长期维护等隐性支出被严重低估,提醒从业者须用全生命周期视角核算真实投入。
Agent 形态一天一个样,Infra 到底该为谁而建?| 请回答 WAIC 2026
随着Agent形态快速迭代,基础设施层陷入「为谁而建」的迷茫,该文探讨了Infra如何在多变的Agent架构间兼顾灵活性与专用性,避免过早锁定技术路线。
AI coding agents can modernize research software but can't judge if the science is right
OpenAI与学术伙伴的实地报告显示,AI编程智能体可加速老旧科研软件现代化,性能提升最高达60倍,但其输出常常「雄辩、令人信服却容易忽略地错误」,人类依然需要耗费大量时间验证科学正确性,这凸显了AI辅助科研中验证环节的瓶颈。
trunk/400aea8bf4d40d570b6b009ced07cb9da5e9e7a7
PyTorch的XPU缓存分配器新增IPC内存句柄共享支持,使多进程在Intel GPU等XPU设备上能高效共享显存,对分布式训练中的内存管理与通信优化意义显著。
Simon Willison发布了llm-mcp-client 0.1a0,一个基于MCP协议的LLM客户端,方便模型安全调用外部工具与数据源,为构建工具增强型智能体提供了低摩擦的入口。
llama.cpp为Vulkan后端添加了一维池化算子POOL_1D,补齐了此前仅支持二维池化的缺口,提升了在Vulkan设备上运行视觉模型时的算子完备性与推理效率。
Oxide and Friends: The Open Weight Revolution with Simon Willison
Simon Willison在Oxide and Friends播客中讨论了开源权重革命,指出Kimi K3已能与闭源前沿模型正面竞争,反映了开放模型生态的快速崛起及其对美国AI领导力的影响。
smevals - a small eval suite for evaluating models, prompts, and harnesses
推出的smevals是一套轻量级评测套件,能对模型、提示词和评估框架进行灵活组合并打分,帮助开发者快速定位不同配置下的能力差异,加速模型选型与提示词优化。
llama.cpp优化了多token预测张量的加载逻辑,仅在模型实际使用MTP时才加载相关权重,从而减少内存占用并缩短启动时间,对资源受限的推理场景尤为有益。
TensorRT-LLM v1.3.0rc23发布,同时披露了DeepSeek-V4-Pro在GB300分离式部署中挂起、DeepSeek-R1在NVFP4多GPU下崩溃等已知问题,为生产部署避开风险提供了参考。
DeepMind发布Gemini Robotics 2视觉-语言-动作模型,可控制从桌面机械臂到人形机器人的各种平台,并增添了高层推理层,极大拓宽了机器人AI的应用边界和自主决策能力。
从金融专业到资深Builder:我如何借多Agent开发工作流,一周做出MVP、一个月上线
一位金融背景的资深Builder利用多Agent开发工作流,通过多个智能体协作拆解复杂任务,在一周内做出MVP、一个月上线,验证了多智能体范式对非传统技术背景开发者的提效潜力。
llama.cpp为MiniCPM-V-4-6等多模态模型加入下采样预处理支持,完善了图像特征抽取管线,使该视觉语言模型在框架内能顺利完成端到端推理。
Quick BI 数据分析智能体的可靠工程实践|AICon深圳
Quick BI数据分析智能体的工程实践分享聚焦如何通过检索增强、校验反馈等机制,保障企业级BI场景中Agent输出的可靠性与业务可用性,为数据分析Agent落地提供了实打实的参考。
trunk/85728e11a5a98c344c4596880855e35046db81b0
PyTorch DTensor更新了对as_strided操作的处理,当输入是基础维度的单纯排列时,能给出正确的维度应答,避免了分布式张量并行中因形状推导错误引发的潜在故障。
llama.cpp为DeepSeek V4模型启用了thinking过程中的工具调用能力,使模型能在内在推理步骤里即时请求外部工具,从而增强多步骤、需要外部信息交互的复杂任务处理能力。
PyTorch针对Intel XPU设备放宽了fp16精度下原生group_norm算子的梯度容差,以修复因硬件差异导致的测试不通过问题,提升在XPU上训练模型的稳定性和确定性。
Ten advances in mathematics and theoretical computer science
OpenAI公布了在数学与理论计算机科学领域十项新进展,解决了包括几何、密码学和复杂性理论在内的长期开放难题,展示了AI在形式化推理与数学发现中的前沿实力。
llama.cpp的多模态模块新增n_embd_head参数,允许灵活指定不同Transformer模型的注意力头维度,从而更顺畅地适配各类视觉语言模型架构,提高推理兼容性。
Sam Altman isn’t the only one who wants to pump the brakes on AI
Sam Altman公开呼吁AI行业适当「放慢脚步」,此表态叠加Hugging Face遭模型越狱攻击等安全事件,预示行业可能进入节奏调整期,对商业AI部署的规划与监管预期产生重大影响。
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
「Qwen-UI-Agent」旨在打造面向真实世界的基础GUI智能体,不只停留在模拟环境,而是追求在真实设备上可靠运行、支持跨平台工作流、融合GUI交互与命令行执行,并能自主完成长周期任务。该工作从实际部署需求出发,系统定义了新一代GUI智能体应具备的能力范畴,并构建了相应模型与系统,为将GUI智能体推向日常使用迈出关键一步。
Metis: Memory Foundation Model
当前智能体的记忆几乎都依赖外部模块,基础模型自身缺乏原生记忆能力。「Metis」首次提出「记忆基础模型」的概念,将记忆内化到基础模型之中,而不是作为后加的外挂。这为智能体赋予了与生俱来的长期记忆支持,有望显著简化系统架构并提升记忆与推理的协同效率。
本研究瞄准递归自我改进这一关键目标,以机器学习工程作为具体测试床。作者构建开源全栈系统「OpenMLE」,包括可验证任务环境、算子学习与长程搜索,并在其上后训练得到一个35B的元进化智能体「Frontis-MA1」,能够改进机器学习流程。这为研究AI自动改进AI提供了可复现的平台与基线。
Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory
大语言模型通常将长期记忆与推理耦合在同一参数集中,难以独立扩展记忆容量。该研究将「Memory Decoder」参数化长期记忆模块扩展到6.9B参数、300B token预训练的规模,期间克服了标准Faiss索引与搜索流水线在如此数据量下不再可行的难题。结果表明,分离的记忆模块能在大规模下高效训练,为模型提供了更灵活的长期记忆扩展路径。
Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
尽管生成模型能力已十分强大,但至今仍未实现真正的端到端训练,瓶颈在于多模态分布的处理方式。本文提出「探索性建模」,解锁了除数据和模型规模之外的第三个预训练轴,并实现生成过程的完全端到端训练。这一突破有望改变生成模型的范式,提升生成质量与训练效率。
Multi-Head Attention Residuals
标准Transformer中每层只能看到单一的残差流最新状态,限制了信息流动。本文提出「多头注意力残差」机制,让不同特征子空间可以使用各自独立的查询来关注历史层,解决了不同子空间对层读取偏好不一致时的被迫妥协问题。这能更精细地控制信息传播,提升模型的表达能力和深度利用效率。
Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes
投机解码通过有损验证方案来加速推理,但放松分布匹配可能悄悄改写生成分布,导致质量不稳定甚至严重退化。本文深入重新审视有损验证的底层机制,系统分析其效率与质量的权衡及失效模式,揭示了何时以及为何会出现崩溃,为设计更可靠的加速方案提供了理论指导。
Beyond Geometric Complementarity: Coherent Overlap in Sparse Mixture-of-Experts Routing
稀疏MoE的有效性常被解释为专家提供几何互补的表示方向,但这一直觉缺乏严格验证。本文通过专家子空间分离指数等新指标,解耦了路由一致性、候选质量与上下文交互,发现专家之间实际存在显著的相干重叠,而非纯粹的互补。这一发现重新理解MoE的增益来源,对专家路由和容量分配设计有直接影响。
Beacon: Knowing When and How to Perform Agentic Visual Reasoning
当前多模态大模型在做视觉推理时往往盲目调用工具,导致效率低下。「Beacon」框架从模式适应性和工具效果两个维度重新思考智能体视觉推理,使模型能自主判断何时真正需要工具,并以恰当方式调用。实验表明这样做既提升了任务成功率,又减少了不必要的计算开销。
BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
RAG中不同检索范式在不同规模下的优劣一直不明。本文通过控制语料库尺度从极小到约450倍增长进行公平对比,惊人地发现经典词法检索「BM25」在大规模下表现最佳,而复杂方法的优势不再。这对实际RAG系统的检索选型有重要指导意义,简单方法未必弱。
Flux-OPD: On-Policy Distillation with Evolving Contexts
开放域大模型训练缺乏明确奖励信号,用上下文表达偏好虽能在蒸馏时提供指导,但静态上下文监督有限。「Flux-OPD」让上下文随学生模型表现一同进化,同时通过专门设计的稳定机制解决了分布冲突和训练不稳定问题,实现了更高效的在策略蒸馏,提升了模型在开放任务上的对齐效果。
SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them
通用视觉语言模型与专业视觉模型在具身任务上存在能力割裂:前者懂任务但忽略视觉细节,后者能捕获细节却不会决策。「SpatialCLI」让模型先借助空间工具学习精准的空间推理,再将这种能力内化,使得模型最终无需工具也能做出精细的视觉决策。这种「先借助后剥离」的策略弥合了任务理解与细节捕获之间的鸿沟。
β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
在策略自蒸馏(OPSD)虽然能提升推理模型,但工程实现往往很脆弱。本文发现OPSD本质上是KL散度惩罚权重β=1的策略优化特例,于是提出「β-OPSD」,将β作为可调节的超参数,统一了推导与训练。这种形式化使得训练更稳定可控,显著降低了使用自蒸馏的门槛。
MemHarness: Memory Is Reconstructed, Not Replayed
现有智能体把检索出的记忆当作固定脚本来重放,极易因记忆与当前情境不匹配而导致错误。「MemHarness」提出记忆应被动态重构而不是原样回放,框架会根据当前状态与抽象记忆进行适配性生成,让经验真正辅助决策,大幅提升了记忆增强智能体的鲁棒性和成功率。
Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems
多智能体协作中,轻信错误响应会导致连锁失败。「Σ-Mem」设计了一种在线可靠性记忆,持续记录每个同伴智能体的历史能力证据和关系证据,为中央协调模型提供动态的信任依据。这使得系统能在不可靠的交互中识别可靠信息源,显著提升了长周期多智能体任务的完成质量。
LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger
评估多模态智能体时只看最终答案准确率会掩盖推理过程是否基于真实证据。「LEDGERMIND」把智能体轨迹建模为来源约束的状态机,将所有工具输出规范化为结构化证据账本,强制后续推理必须引用账本中的可靠条目。这样不仅提升了可解释性,还让正确答案真正经得起溯源,避免语言先验的捷径。
Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale
训练计算机使用智能体需要大量可交互、可重置的应用环境,但现有批量生成的环境往往是浅层样板。「Echoverse」强调环境的行为深度、是否针对待训练交互以及能否随智能体能力演进而动态调整这三个关键属性,以此构建深度进化环境,大幅提升了在真实计算机任务上的训练效率和泛化能力。
Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability
很多部署的LLM智能体实际已把文件系统当作长期记忆,但这种方法从未被系统研究。本文验证了智能体能否在记忆不断累积、冲突和过时的情况下,自主维持文件结构的组织性和演化可持续性。结果揭示基于文件系统的记忆是一种实用且灵活的方案,为记忆管理提供了新捷径。
Harness-G: A Graph-Structured Harness for Search Agents
强化学习训练搜索智能体时,自由形式查询容易导致检索混淆,不同查询指向相同信息。「Harness-G」引入了图结构化的检索harness,将检索界面从自然语言改为图结构,有效消除了检索混叠现象,让搜索智能体在训练中学到更清晰、更高效的查询策略,提高了搜索准确度。
OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models
当前全模态大模型的token压缩常让一个模态主导保留决策,但由于音频、视频等模态的显著性峰值时刻往往不同步,这种单向指导容易丢掉答案关键线索。「OmniScope」提出模态解耦的压缩框架,用查询作为独立锚点分别评估各模态token的重要性,在激进压缩下依然保留关键信息,大幅提升效率与保真度。