每日 AI 速览

2026-08-25

生成于 2026-08-26 04:14
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线聚焦推理优化与智能体。OpenAI 自研芯片「Jalapeño」首测展现领先的推理速度与效率,量化感知修复方案让 4-bit 压缩模型反超全精度原版,「TileMix」等混合精度注意力继续压低推理成本。Agent 侧从能力到安全全面铺开,记忆注入攻击、状态化工作流基准、多智能体交互税等研究集中出现。训练方法上,「SRPO」自反思策略优化与环境正则化为长程推理提供新解。

行业动态 40 条

STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation

Apple ML · 08-25 08:00 UTC+8

Apple ML 提出「STARFlow2」,将语言模型与归一化流桥接起来做统一多模态生成,试图解决现有方案中离散 token 损视觉保真、文本生成与扩散去噪结构不对称、以及生成适配损伤预训练理解的问题。它为文本-图像交织序列生成提供了一条新路径。

基座多模态生成归一化流「Apple」统一模型

Granite 4.2 LLMs: How They're Built

HuggingFace 博客 · 08-25 23:14 UTC+8

Hugging Face 博客发布「Granite 4.2」大语言模型的构建细节,介绍其架构、训练流程等关键选择。对关注开源企业模型和训练方法的技术人员,这是一份可参考的工程说明。

基座「Granite」「LLM」「HuggingFace」模型构建

CUDA Python 1.0: Stable APIs, One Foundation, Full Platform Access

NVIDIA 开发者 · 08-25 23:00 UTC+8

NVIDIA 发布「CUDA Python 1.0」,提供稳定 API 和统一基础,让 Python 开发者无需深入 CUDA C++ 工具链即可获得全平台 GPU 访问能力。这对扩大 GPU 编程生态和降低开发门槛有重要意义。

Infra「CUDA Python」「NVIDIA」GPU编程开发工具

OpenAI’s Jalapeño chip is built for fast inference at scale, benchmarks show

TechCrunch · AI · 08-25 22:22 UTC+8

在 SemiAnalysis 的「InferenceX」基准上,OpenAI 的「Jalapeño」据称在每用户 token 数和每千瓦吞吐两项指标上超过现有最先进芯片。该结果强化了 OpenAI 自研推理硬件在规模推理效率上的竞争力。

推理优化推理芯片「OpenAI」基准能效

v0.3.0

llama.cpp · 08-25 18:29 UTC+8

「llama.cpp」发布 v0.3.0,加入「dots3-note」多模态模型与新的「DSA-ISWA」KV cache,支持「GLM-4.5-Air」的 MTP,并修复「DeepSeek 4」的 tensor-split 和多序列回滚问题。「ggml」与「mtmd」也迎来多项底层更新,对本地推理用户是重要版本升级。

推理优化「llama.cpp」推理框架多模态版本更新

开源国产8B模型,比肩闭源Image 2了!

量子位 · 08-25 14:53 UTC+8

量子位报道开源的国产 8B 模型「SenseNova U1.5 Lite」宣称性能可媲美闭源「Image 2」。如果属实,这为中小规模开源模型在多模态或视觉任务上提供了高性价比选择。

基座国产模型开源「SenseNova」小模型

v0.5.18

SGLang · 08-25 07:08 UTC+8

SGLang 发布 v0.5.18,新增「Muse Glimmer」「Intern-S2-Mobius」「SANA-Video」「LingBot-Video-MoE」「LTX-2.5」「Cosmos3 Edge 与 Distilled」「LongCat-Image」等模型支持,并补充「Qwen3.8」「Ling-3.0」「Nemotron 3.5 Lightning」的示例。对需要快速接入新多模态和扩散模型的推理服务开发者很有帮助。

推理优化「SGLang」推理框架多模态版本更新

Nvidia says its Groq 3 LPX is four times faster than Cerebras, but the math is more complicated

The Decoder · 08-25 20:27 UTC+8

Nvidia 的「Groq 3 LPX」推理芯片进入全面生产,官方称在「Gemma 4 31B」上达到 3400 tokens/s,比 Cerebras 快四倍,但达到该性能需要 64 个加速器,而 Cerebras 只需一到两个。架构在大型 MoE 模型上的可扩展性仍是未决问题。

推理优化「Nvidia」推理芯片「Cerebras」性能对比

viable/strict/1787680605: [inductor] Vendor and adapt QuACK symmetric GEMM (#194177)

PyTorch · 08-25 19:15 UTC+8

「PyTorch」的 inductor 后端引入并适配了 QuACK 对称 GEMM 内核,针对 X @ X.T 这类对称矩阵乘法,只计算一个三角并同时写入对称位置,支持 FP16 和 BF16。这能减少冗余计算,提升相关算子的性能。

Infra「PyTorch」「Inductor」「GEMM」性能优化

b10621

llama.cpp · 08-25 18:18 UTC+8

llama.cpp 发布 0.3.0 版本,更新了 CI 发布默认描述并新增脚本用于生成发布摘要。这是本地推理框架的一个重要版本节点,聚合了近期 Metal、SYCL 等后端改进,对依赖 llama.cpp 做端侧或本地 LLM 推理的开发者值得跟进。

推理优化llama.cpp版本发布本地推理AI Infra

SpaceXAI 推出面向自主 AI 智能代理的 Grok Bot

InfoQ 中文 · 08-25 17:00 UTC+8

SpaceXAI 推出面向自主 AI 智能代理的 Grok Bot,将 Grok 模型能力包装为可自主执行任务的代理形态,但原文未展开具体开放细节。这反映模型厂商继续向工具调用与自主代理场景推进,关注 Agent 落地的团队可重点观察其能力边界。

AgentGrok BotAI Agent模型厂商动态自主代理

The full stack behind abundant intelligence

OpenAI · 08-25 15:05 UTC+8

OpenAI CFO Sarah Friar 阐释了芯片、算力、模型和产品层面的进步如何复合,以更大规模、更低成本交付更实用的智能。这种全栈飞轮视角帮助从业者理解 OpenAI 的成本下降逻辑与基础设施投资方向。

厂商动态OpenAI成本与规模AI Infra战略

viable/strict/1787655491: [Inductor] Add gfx950 FlyDSL GEMM and torch.mm autotuning (#190903)

PyTorch · 08-25 14:47 UTC+8

PyTorch Inductor 为 AMD gfx950 集成基于 FlyDSL 模板的 FP16/BF16 GEMM 内核,并接入 torch.mm 的 max-autotune 路径,新增默认与穷举 tile 配置启发式、对齐检查及按配置缓存编译调度器。这将提升 AMD 新硬件在 PyTorch 自动调优下的矩阵运算效率,对 ROCm 训练与推理用户是直接利好。

InfraPyTorchROCmGEMM编译器优化

v0.33.0

Ollama · 08-25 12:01 UTC+8

Ollama 0.33.0 强化与 Claude Desktop 的集成,可在菜单栏开关本地 Ollama 模型、直接在 Claude 内选择本地模型,并新增 Apps 视图管理集成与可复制命令;同时改进缓存并修复 agent 客户端取消长 prefill 时的挂起,prefill 恢复点改为按构造可信。这提升了本地模型与 Claude 混合使用体验,对个人开发者和团队都更稳定。

推理优化OllamaClaude Desktop本地推理Agent

b10615

llama.cpp · 08-25 05:54 UTC+8

llama.cpp 为 Metal 后端 flash-attention vec 路径加入按设备调优的 (Q, NE) 分派表,新增 53 个 f16 实例使 vec 数从 80 增至 133,并将调优扩展到量化 KV cache,同时加入 SMEM 上限回退。这有助于提升 Apple Silicon 长上下文注意力性能与稳定性。

推理优化llama.cppMetalFlash AttentionApple Silicon

Introducing new Ray capabilities on SageMaker HyperPod

AWS 机器学习 · 08-25 03:32 UTC+8

AWS SageMaker HyperPod 在 Amazon EKS 上推出托管 Ray 支持,可在 SageMaker Studio 中创建和监控 Ray 集群、连接 JupyterLab 与 Code Editor、获得开箱即用的可观测性,并运行弹性分布式训练与加速推理。这降低了在 AWS 上使用 Ray 的运维门槛,对分布式 AI 工作负载团队是重要补充。

InfraAWSSageMaker HyperPodRay分布式训练

Agentic Resource Discovery (ARD): An open specification for agent discovery

AWS 机器学习 · 08-25 00:22 UTC+8

AWS 推出 Agent Registry 集中式可搜索目录,用于管理 agent、工具和技能,并基于开放的 Agentic Resource Discovery 规范支持跨环境发现与治理。这有助于企业多智能体资产标准化和规模化治理,也推动 agent 发现协议走向开放。

AgentAWSAgent RegistryMCP/协议智能体治理

Bug Fixes + Auto compaction + LAN Remote Access

Unsloth · 08-25 21:42 UTC+8

Unsloth 发布包含 170 多个 PR 的修复版本,修复 MLX 与 Mac 运行问题、AMD GPU 相关 bug,并新增实验性自动压缩以支持超出上下文长度的长对话,以及无需 Cloudflare 的 LAN 远程访问预览。这些改动提升了本地微调与推理的稳定性和长对话可用性。

后训练UnslothBug修复长上下文本地推理

Accel-backed Keenable is indexing the web for AI agents

TechCrunch · AI · 08-25 21:00 UTC+8

Keenable 走出隐身模式,获得 Accel 支持的 2600 万美元种子轮,为 AI agent 构建大规模网络搜索索引。这表明 agent 对实时、可访问的网页数据基础设施需求正在升温,对做检索增强或搜索类 agent 的团队有参考意义。

AgentAI Agent搜索索引融资检索增强

b10622

llama.cpp · 08-25 20:19 UTC+8

llama.cpp 修复了 Metal 后端缓冲分配未做空指针检查导致的 OOM 硬崩溃问题,使显存分配失败时不再触发 EXC_BAD_ACCESS 而是可恢复。这提升了 Apple Silicon 上加载大模型时的鲁棒性。

推理优化llama.cppMetalOOM修复稳定性

Bug Fixes + Auto compaction + LAN Remote Access

Unsloth · 08-25 20:14 UTC+8

Unsloth 发布修复更新,包含 170 多个 PR,修复 MLX、Mac 运行时以及 AMD Strix Halo 和 RDNA GPU 等问题,新增实验性自动压缩与无需 Cloudflare 的局域网远程访问预览,并提升聊天速度。这对使用 Unsloth 微调或推理的用户是一次全面的稳定性与体验改善。

后训练UnslothAMDBug修复长上下文

b10620

llama.cpp · 08-25 17:37 UTC+8

llama.cpp 执行了 ggml 子模块同步,并发布包含多平台构建产物的更新。对以 llama.cpp 为底层推理引擎的项目,保持 ggml 同步有助于获得最新内核修复与优化。

推理优化llama.cppggml同步AI Infra

viable/strict/1787664910: Add XPU dispatch for linalg.polar (#188253)

PyTorch · 08-25 17:22 UTC+8

PyTorch 为 linalg.polar 算子新增 XPU 后端分派,解决 Intel torch-xpu-ops 的 issue,合并后 XPU 后端上 40 个测试用例可取消跳过。这补全了 Intel GPU/XPU 上 PyTorch 线性代数功能,对 XPU 用户是实用改进。

InfraPyTorchXPU算子支持Intel

viable/strict/1787663255

PyTorch · 08-25 15:18 UTC+8

PyTorch 将 export/test_torchbind.py 测试泛化并在 XPU 后端启用,扩展了 torchbind 相关导出功能在 Intel XPU 上的测试覆盖。这有助于保证 PyTorch 导出路径在 XPU 硬件上的兼容性。

InfraPyTorchXPU测试导出

b10618

llama.cpp · 08-25 15:09 UTC+8

llama.cpp 修复 GBNF 语法解析器对字符类中连字符转义的处理,使生成的工具调用语法不再因连字符被拒绝而解析失败。这对使用约束解码生成结构化工具调用的开发者很重要,避免特殊字符导致 schema 失效。

推理优化llama.cppGBNF工具调用约束解码

viable/strict/1787658955: [CI] Add gfx950 FlyDSL Inductor test shard (#193473)

PyTorch · 08-25 14:51 UTC+8

PyTorch CI 增加 gfx950 FlyDSL Inductor 专用测试分片,安装固定版本 FlyDSL wheel,并在 ROCm 环境或 gfx950 设备不可用时提前失败而非静默跳过 GEMM 覆盖。这保障了 AMD gfx950 上 Inductor 与 FlyDSL GEMM 路径的持续验证。

InfraPyTorchROCmCIGEMM

b10617

llama.cpp · 08-25 14:47 UTC+8

llama.cpp 在 SYCL 后端中将 tq2_0 量化类型标记为不支持,并更新各平台构建产物。这为 Intel SYCL 设备用户提供了明确的能力边界,避免使用不受支持的量化格式导致错误。

推理优化llama.cppSYCL量化兼容性

viable/strict/1787650059

PyTorch · 08-25 13:34 UTC+8

PyTorch 对 NCCL CFT 测试增加门控,只在支持 CFT 的 GPU、驱动和 CUDA 栈上运行。这避免在无能力环境上误报失败,提升分布式通信测试的可靠性。

InfraPyTorchNCCL分布式通信测试

viable/strict/1787648571

PyTorch · 08-25 12:07 UTC+8

PyTorch AOTInductor 改进了 aoti_inference 测试中不支持设备路径的处理。这有助于提升 AOTInductor 在多种后端环境下测试的健壮性,减少误报。

InfraPyTorchAOTInductor测试后端兼容

viable/strict/1787644925

PyTorch · 08-25 11:14 UTC+8

PyTorch 删除了 THP_PyFrame_New_NoTrack 中不可达的版本分支。这属于代码清理,降低维护噪音,帮助开发者更清晰地理解 CPython 版本兼容路径。

InfraPyTorch代码清理CPython维护

viable/strict/1787643145: [dynamo] Support types.SimpleNamespace (#193719)

PyTorch · 08-25 11:11 UTC+8

PyTorch Dynamo 新增对 types.SimpleNamespace 的建模支持,解决此前构造 SimpleNamespace 会触发图断裂、17 个相关测试被标记为预期失败的问题。这有助于更多使用 SimpleNamespace 的代码在 torch.compile 下顺利成图,减少图断裂。

InfraPyTorchDynamo图捕获torch.compile

论文 20 篇

今日论文看点:长程策略优化、量化恢复、「TileMix」推理加速与 Agent 记忆安全等方向尤为密集,值得精读。

SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning

ICML 2026CCF-A推荐arXiv · 08-25 00:55 UTC+8

该工作面向长程推理任务的后训练,提出「SRPO」框架,让模型分析自身完整轨迹、把错误凝练成简短的反思补丁,并用反思条件下的教师分数来优化策略。相比只依赖稀疏结果反馈,它把自我反思能力内化到策略优化过程中,目标是更细粒度地分配功劳,从而提升长程任务上的学习效率和表现。

自我反思策略优化长程推理后训练
Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

EMNLP 2026CCF-B推荐通义千问HF 精选 · 08-25 08:00 UTC+8

针对语言模型强化学习中稳定性与探索性的两难,提出「ERPO」方法,用输入侧的查询分布控制替代动作侧的策略正则化。这样做在稳定训练的同时保留响应空间的探索,对「RLHF」类流程的收敛和多样性有实用价值。

后训练强化学习策略正则化探索稳定性「RLHF」

Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs

HF 精选 · 08-25 08:00 UTC+8

本文提出量化感知修复方法,直接从原始未压缩模型中蒸馏,以更快、更稳的方式恢复 4 位压缩 LLM 的能力。与量化感知训练相比,它避免了从头调整的代价,能在压缩模型上找回接近甚至超过全精度的表现,对低比特部署很有意义。

推理优化量化模型压缩知识蒸馏「4-bit」

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

HF 精选 · 08-25 08:00 UTC+8

「TileMix」在融合稠密注意力内部以 tile 为单位,把注意力分数路由到 FP16 或 INT8 混合精度计算。它在不重训练的前提下恢复长上下文精度,同时提升 prefill 吞吐,是推理侧注意力优化的一个轻量方案。

推理优化混合精度注意力机制长上下文

InjecMEM: Memory Injection Attack on LLM Agent Memory Systems

COLM 2026arXiv · 08-25 00:37 UTC+8

论文提出「InjecMEM」记忆注入攻击,展示只需一次交互、无需读取或编辑记忆库,就能把后续相关查询的回复引向预设输出。它利用了记忆系统的检索-生成机制,对当前 LLM 智能体普遍引入持久记忆的趋势提出了安全警示。

Agent智能体安全记忆系统对抗攻击「LLM」
Hanling Tian, Gengyu Zhang, Zeyang Sha, Jingying Wang, Yuhang Liu, Zhehao Huang, Kun Yang, Xiaolin Huang

Apodex 1.1: Scaling Agentic Intelligence for Complex Work

HF 精选 · 08-25 08:00 UTC+8

「Apodex 1.1」通过扩展可执行环境,并训练智能体协调长程工作流中的状态维护与恢复,来提升复杂真实任务上持续、可验证的进展。它强调智能体不仅要会单步操作,还要能稳定推进长周期目标。

Agent智能体长程任务环境扩展状态维护

EchoWM: Open and Enterable Omnimodal World Models

HF 精选 · 08-25 08:00 UTC+8

「EchoWM」是一个可进入的全模态世界模型,能在连续 6-DoF 导航轨迹下同步生成高分辨率视频、声音、音乐和语音,并支持第一人称和第三人称视角。这为具身智能和交互式世界模拟提供了统一的多模态生成底座。

基座世界模型全模态生成具身导航多模态

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

HF 精选 · 08-25 08:00 UTC+8

「MobilePA-Bench」是一个交互式沙盒基准,专门评估移动端规划智能体在工具调用、子代理协作、记忆使用和复合技能调用上的实际表现,并引入真实运行时约束。它帮助衡量智能体在复杂移动任务中的综合规划能力。

Agent智能体基准移动规划工具调用沙盒

Prime Agent: A Self-Improving RLM Harness

HF 精选 · 08-25 08:00 UTC+8

「Prime Agent」是一个开源的自我改进「RLM」harness,借助递归子代理、持久计算和代理间协调来扩展语言模型在编码与推理任务上的长程能力。对想要构建自改进智能体系统的研究者,它提供了一个可复现的框架。

Agent智能体框架「RLM」长程推理开源

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

HF 精选 · 08-25 08:00 UTC+8

论文指出,能完成一次任务不代表可靠,尤其是在代码之外的业务工作中,智能体必须多轮收集缺失信息、遵循领域策略、协调依赖工具并正确完成持久状态转换。为此提出「Thinkingbox」沙盒与基准,专门评估有状态业务工作流中的这些能力。

Agent智能体基准业务工作流状态管理可靠性

Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress

HF 精选 · 08-25 08:00 UTC+8

「R2-OPD」改进在策略蒸馏,通过轨迹内的排序比较,过滤掉与推理进度相冲突的教师奖励信号。这让蒸馏过程更关注真正推动推理前进的步骤,从而提升策略学习质量。

后训练知识蒸馏策略优化推理奖励过滤

The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams

ICML 2026CCF-A推荐arXiv · 08-25 01:45 UTC+8

该工作讨论多智能体 LLM 交互的收益与代价,认为已有矛盾部分源于缺少对交互是否保留多样性的区分。它提出交互税概念:通信可能抹平团队内部的多样性,从而抵消多智能体协作带来的增益。

Agent多智能体交互税多样性协作
Summer Eunhyung Ann, Haokun Liu, Chenhao Tan

What's the Catch? Evaluating Temporal Consistency in Vision-Language Models

ACLCCF-A推荐arXiv · 08-25 00:40 UTC+8

论文从异常检测角度考察视觉语言模型对时间一致性的敏感性,提出「TimeCatch」基准,通过交换连续帧或替换为高斯噪声帧构造异常。这样可以更受控地测试 VLM 是否真正理解时序结构,而不只是单帧内容。

基座视觉语言模型时间一致性异常检测评测
Marek Hradil, Danae Sánchez Villegas

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

HF 精选 · 08-25 08:00 UTC+8

「TLive-Omni」面向电商直播场景,通过时间戳 token 分组统一图像、视频、音频和文本,配合分阶段监督训练与可验证反馈的强化微调,实现实时全模态理解。这对直播电商中的自动解说、商品识别等应用有直接价值。

基座全模态理解电商直播强化微调多模态

GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

腾讯混元HF 精选 · 08-25 08:00 UTC+8

「GameXpert-Bench」评估编码代理在游戏开发三个阶段——生成、修复和优化——上的能力,采用交互式与行为测试。结果显示代理能搭建可玩的基础,但在缺陷发现和回归保持上仍然薄弱,为游戏方向编码智能体指出了短板。

Agent编码代理游戏开发基准回归

AutoResearch: Insight In, Hallucination Out

HF 精选 · 08-25 08:00 UTC+8

「AutoResearch」是一个两阶段自主研究系统,将研究想法与集成生成、基于证据的执行结合起来,以减少幻觉并提高实验可靠性和可测量结果。它试图把科研流程中的想法落地为可验证的实验闭环。

Agent自主研究智能体实验可靠性科研自动化

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

HF 精选 · 08-25 08:00 UTC+8

「LongWoF-Bench」评估 EvoMap 方法,它把验证过的执行经验外化为可复用的结构化「Gene」,以提升长工作流任务完成率并减少 token 消耗。这套机制让模型在长流程任务中复用经验,改善效率。

Agent长工作流智能体经验复用结构化记忆

Robustness of IR Models to Collection Growth

CIKM 2026CCF-B推荐arXiv · 08-25 00:00 UTC+8

论文形式化了一个理想性质:向检索集合中添加非相关文档不应降低检索器有效性。作者合并两个主题几乎不重叠的集合进行实证评估,并推测检索模型对排名如何依赖其他文档的条件方式会影响这一鲁棒性。

Infra信息检索鲁棒性集合增长评估
Emmanouil Georgios Lionis, Debasis Ganguly, Sean MacAvaney

MetaCaster: Meta-Harness-Optimized Agent for End-to-End Few-Shot Learning of Lightweight Time Series Forecasters

EMNLP 2026CCF-B推荐arXiv · 08-25 00:40 UTC+8

面对资源受限场景下轻量时间序列预测器训练数据不足的问题,提出「MetaCaster」,一个由元 harness 优化的智能体,用于端到端的小样本学习。它旨在让紧凑预测器在数据稀缺、缓慢积累或隐私敏感的领域也能落地。

Agent时间序列小样本学习智能体元优化
ChengAo Shen, Wenchao Yu, Fangyu Wu, Dongjin Song, Hanghang Tong, Dongsheng Luo, Wei Cheng, Haifeng Chen