每日 AI 速览

2026-08-22

生成于 2026-08-23 04:16
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线聚焦智能体与多模态基座:DeepSeek 发布实验性 Flash 视觉模型,在智能体评测上对标 Opus 4.8,Meta 则开源支持视觉与工具调用的本地智能体模型,开源多模态竞争升温。智能体基础设施被推至台前,Nvidia 与多篇研究强调「harness」与模拟正成为新的扩展律,推动多智能体强化学习、自我博弈与自主环境生成。推理优化方面,FlashPrefill V2 提出块稀疏预填充注意力,面向长上下文服务降本增效;视频生成侧 MiniMax Design 试图切入 Adobe、Canva 腹地。

行业动态 40 条

本地运行、支持视觉与工具调用:Meta 开源智能体模型

InfoQ 中文 · 08-22 01:00 UTC+8

Meta 发布一款开源智能体模型,强调可在本地运行,并支持视觉理解与工具调用。这使开发者能在自有环境中部署多模态 Agent,尤其适合对数据隐私和 API 成本敏感的工作流。

基座Meta开源模型本地运行多模态智能体

v0.5.18

SGLang · 08-22 08:09 UTC+8

SGLang 发布 v0.5.18,合并了来自 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge 与 Distilled、LongCat-Image 等多个模型支持。该版本还补充了 Qwen3.8 系列、Ling-3.0、Nemotron 3.5 Lightning 的 cookbook 配方。这显著扩展了多模态和扩散模型在统一推理框架中的覆盖。

推理优化SGLang推理框架多模态模型版本发布

DeepSeek 发布多模态模型,“小鲸鱼”长出了眼睛

InfoQ 中文 · 08-22 03:34 UTC+8

DeepSeek 发布了一款多模态模型,为原有文本能力加入视觉理解,被社区称为小鲸鱼长出了眼睛。这意味着 DeepSeek 在多模态基座上继续补齐能力,可能影响后续 Agent 和视觉问答场景的评测竞争。

基座DeepSeek多模态模型视觉理解

Deepseek releases experimental Flash vision model that rivals Opus 4.8 on agent benchmarks

The Decoder · 08-22 03:08 UTC+8

DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp,在 V4-Flash 文本能力上增加图像理解,公司多模态智能体基准中接近甚至有时超过 Opus 4.8。这为开发者提供了新的低成本视觉 Agent 测试选项,也反映 DeepSeek 在多模态 Agent 评测上的积极布局。

基座DeepSeek多模态模型视觉Agent新模型发布

b10584

llama.cpp · 08-22 23:07 UTC+8

llama.cpp b10584 修复了在非统一 KV cache 下 draft context 容量计算错误的问题,并让 fit 与 n_streams 参数协同。此前 draft context 以 n_ctx=0 创建并回退到 n_ctx_train/n_streams,一旦 slot 超过该值会导致 draft batch 解码失败并返回 500。该修复提升了草稿模型解码的稳定性。

推理优化llama.cpp投机解码KV cachebug修复

b10577

llama.cpp · 08-22 16:15 UTC+8

llama.cpp b10577 修复了 draft-mtp 与 embeddings 结合时的问题,确保草稿多 token 预测在嵌入场景下正常工作。对使用投机解码和嵌入推理的用户有直接帮助。

推理优化llama.cppdraft-mtpembeddingsbug修复

b10576

llama.cpp · 08-22 15:50 UTC+8

llama.cpp b10576 为 SYCL 后端重新添加 Q2_K 重排 MMVQ 和 ESIMD 内核,并加入 gate 参数。该改动改善了 Intel GPU 等 SYCL 设备上的量化矩阵向量乘性能和可用性。

推理优化llama.cppSYCL量化内核Intel GPU

viable/strict/1787382165: support min, max in maybe mark dynamic (#194091)

PyTorch · 08-22 11:09 UTC+8

PyTorch 为 torch._dynamo.maybe_mark_dynamic 新增 min 和 max 参数,允许将维度标记为动态并给定初始范围,而不强制该维度必须保持动态。这样 guards 可以在该范围内窄化,维度仍可特化。

InfraPyTorch动态编译torch._dynamoAPI更新

Reduce RAG costs on Amazon Bedrock with query-aware compression

AWS 机器学习 · 08-22 00:59 UTC+8

AWS 机器学习博客介绍在 Amazon Bedrock 上通过查询感知压缩降低 RAG 成本的方法。检索后先用较小模型根据查询过滤检索块,再由主模型回答,从而减少输入 token 和成本,同时保持答案质量。

InfraRAG成本优化Amazon Bedrock查询感知压缩

More than just code review

Simon Willison · 08-22 23:56 UTC+8

Simon Willison 提出高效使用编码智能体的关键不是逐行审查代码,而是能自信地指示修改方向并验证修改是否正确落地。文章指出验证代码变更还有多种方式,逐行检查往往不是最有效的。

Agent编码智能体代码审查工作流

b10585

llama.cpp · 08-22 23:42 UTC+8

llama.cpp b10585 新增 json.h 抽象,并迁移 common、server、Jinja 适配和测试相关代码。该改动还修复了 server 崩溃并进行清理,为后续 JSON 处理统一化奠定基础。

Infrallama.cppJSON抽象代码重构server修复

b10582

llama.cpp · 08-22 20:59 UTC+8

「llama.cpp」恢复「Ubuntu」平台的「ROCm」CI 任务,并把「ccache」的编译器检查改为按内容匹配。由于「ROCm」工具链每次「pip」重装都会改变「clang」二进制时间戳,原默认的按时间戳检查会让热构建缓存命中率只有约七成,改成内容哈希后缓存可跨工具链重装复用。

Infra「llama.cpp」「ROCm」「CI」「ccache」

Study explains why AI agents benefit from "skills" and when they fail

The Decoder · 08-22 20:15 UTC+8

普林斯顿大学和加州大学圣迭戈分校的研究指出,智能体技能库带来的提升主要来自结构化工作流,而不是额外知识。但随着技能库变大,智能体越来越难检索到合适指令,这解释了技能机制在什么条件下会失效。

Agent智能体技能库结构化工作流多智能体

How Claude Watermarks AI-Generated Text

Ahead of AI · Raschka · 08-22 19:11 UTC+8

该视频讲解「Claude」如何给 AI 生成文本加水印,覆盖「token」采样、水印检测与移除三个环节。对关注生成内容溯源、模型合规与检测的从业者是一份直观入门材料。

厂商动态「Claude」文本水印「LLM」生成内容溯源

b10581

llama.cpp · 08-22 18:14 UTC+8

「llama.cpp」新增对「bailingmoe3」模型的「DSpark」支持,使该「MoE」模型能够在相关后端加载和运行。对本地部署该模型的用户提供了更直接的兼容路径。

Infra「llama.cpp」模型支持「MoE」「DSpark」

b10580

llama.cpp · 08-22 17:35 UTC+8

「llama.cpp」的多模态模块新增「dots3-note」模型的视觉和音频支持,覆盖转换初始化与「GGUF」张量映射更新。这使本地推理栈可以加载该多模态模型的音视输入。

Infra「llama.cpp」多模态视觉音频「GGUF」

b10578

llama.cpp · 08-22 17:12 UTC+8

「ggml」优化了「concat」算子,把逐元素内存拷贝改成按行连续块拷贝,并修复了行级拷贝的偏移,增加行连续性断言。拼接张量是推理和数据处理中的常见操作,该改动可降低拷贝开销。

推理优化「ggml」算子优化内存拷贝「llama.cpp」

viable/strict/1787403784

PyTorch · 08-22 17:12 UTC+8

「PyTorch」修复了图输出包含张量子类时「opaque constant」被损坏的问题,提升张量子类在图编译场景下的稳定性。对使用子类输出的自定义模型和编译器后端有实际意义。

Infra「PyTorch」图编译张量子类缺陷修复

World models that ignore human beliefs predict the wrong actions, new research shows

The Decoder · 08-22 17:00 UTC+8

研究指出「Sora」「Genie」等现有世界模型只模拟物理,而忽略人的信念、意图和感受,会预测出错误动作。新框架「Mental World Modeling」加入心理变量后,即使更弱的语言模型也能超过没有心理建模的更强模型,当前最大瓶颈是物理状态与心理状态的联合演化预测。

基座世界模型心理建模「Sora」「Genie」

The Evolution of the Agent Harness

Latent Space · 08-22 15:30 UTC+8

文章认为智能体框架的能力正不断被模型吸收进权重,未来「harness」会从模型外挂变成争夺人类注意力的层。这对理解「Agent」架构演进和产品设计有启发。

Agent智能体「Agent Harness」模型能力架构演进

viable/strict/1787399597

PyTorch · 08-22 15:26 UTC+8

「PyTorch」在「C++ API」一致性测试中加入「privateuse1」后端的支持,方便第三方后端验证与主「API」的行为一致性。对开发「out-of-tree」后端的团队有帮助。

Infra「PyTorch」私有后端「C++ API」测试

Psychological methods reveal major weaknesses in AI security testing

The Decoder · 08-22 15:00 UTC+8

英国 AI 安全研究所用心理测量方法发现,主流语言模型安全基准并没有测量一致的安全特质;全面拦截请求会人为抬高安全分数,却让模型日常实用性下降。研究还提出识别模型在测试时比日常使用更谨慎的方法。

后训练「AI」安全安全评测心理测量「LLM」

v0.2.0

llama.cpp · 08-22 14:54 UTC+8

「llama.cpp」发布 v0.2.0,开始采用一致的语义化版本号,新的「vX.Y.Z」标签表示稳定版本,原有「b」标签继续作为接近每次提交的「nightly」或「dev」版本。这让下游项目能更简单地选择分发和使用的版本。

推理优化「llama.cpp」语义化版本版本管理稳定版

viable/strict/1787389033

PyTorch · 08-22 12:58 UTC+8

「PyTorch」将「multihead_attention」测试改为设备无关,以便「out-of-tree」后端复用该测试。这有助于不同设备后端验证多头注意力实现的一致性。

Infra「PyTorch」测试设备无关「OOT」后端

v0.33.0-rc1

Ollama · 08-22 08:21 UTC+8

「Ollama」 v0.33.0-rc1 对模型推荐端点进行签名,增强该接口的安全性和防篡改能力。对使用模型推荐功能的部署方来说,能降低接口被伪造的风险。

推理优化「Ollama」模型推荐「API」签名安全

Simulation: the new Scaling Law — Joon Sung Park, Simile AI

Latent Space · 08-22 07:37 UTC+8

「Simile AI」CEO 从病毒式传播的「Generative Agents」研究讲到打造 80 亿人类数字孪生的计划,认为仿真正成为新的扩展律,并已从有趣探索变成严肃商业。

Agent仿真数字孪生「Generative Agents」扩展律

v0.33.0-rc0

Ollama · 08-22 06:04 UTC+8

「Ollama」 v0.33.0-rc0 加入「Claude」模型管理功能,便于在本地工具中配置和使用「Claude」模型。对希望统一管理不同模型源的开发者是实用更新。

推理优化「Ollama」「Claude」模型管理

Nvidia just showed that the harness, not the AI model, is now the real hero

TechCrunch · AI · 08-22 03:43 UTC+8

「Nvidia」的研究表明,通过微调,即使底层模型在任务上并不出色,AI 智能体也能表现良好且不失控。这说明外部「harness」和微调策略可能比模型本身更关键。

Agent「Nvidia」智能体微调「Agent Harness」

Agentic Data Operations Platform (ADOP): Data engineering into hours

AWS 机器学习 · 08-22 01:06 UTC+8

「AWS」推出基于「Amazon Bedrock」的「ADOP」参考架构,用专用 AI 智能体自动化「Bronze-to-Silver-to-Gold」数据管道全生命周期,将新数据源接入从数周压缩到数小时,同时保持治理与合规控制。这对数据工程团队向智能体化转型有参考价值。

Agent「AWS」「Amazon Bedrock」数据管道智能体

Govern AI agent tool access with Amazon Bedrock AgentCore Gateway

AWS 机器学习 · 08-22 01:02 UTC+8

该文介绍用「Amazon Bedrock AgentCore」构建受治理的智能体工具网关,按「Connect」「Control」「Catalog」「Harden」四个成熟度阶段推进,为智能体提供可审计的企业工具访问,且无需整合底层基础设施。

Agent「AWS」「Amazon Bedrock AgentCore」智能体治理工具访问

llm-openrouter 0.7

Simon Willison · 08-22 00:58 UTC+8

「llm-openrouter」0.7 发布,兼容「LLM」0.32,可显示「OpenRouter」模型的推理轨迹,并改用「OpenRouter」的「Responses API」。新增「Shell」「WebFetch」「WebSearch」三个服务端工具,可通过 -T 选项启用。

Agent「LLM」「OpenRouter」推理轨迹命令行工具

JetBrains详细阐述了控制AI支出快速增长的首批举措

InfoQ 中文 · 08-22 17:05 UTC+8

「JetBrains」详细说明其控制 AI 支出快速增长的首批举措,涉及内部 AI 使用和成本管理。对关注企业 AI 成本治理的团队有参考价值。

厂商动态「JetBrains」成本控制「AI」支出

Anthropic’s Opus 4.6 is a smut-machine

TechCrunch · AI · 08-22 07:07 UTC+8

「TechCrunch」测试发现,「Anthropic」虽禁止「Claude」生成露骨内容,但「Opus 4.6」较容易绕过限制。这对内容安全策略和模型越狱防护提出了警示。

厂商动态「Anthropic」「Claude」内容安全越狱

论文 20 篇

今日暂无当天新论文。周末或节假日 arxiv 不公告、HuggingFace 每日精选也不更新。以下为近期精选 20 篇

FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving

HF 精选 · 08-21 08:00 UTC+8

FlashPrefill V2 针对长上下文大模型服务中 prefill 阶段注意力计算成本过高的问题,提出均值校正的块稀疏注意力近似,并配套优化了 GPU 算子和框架集成。它通过稀疏选择与均值修正减少长上下文预填充的计算量,同时尽量保持注意力质量。相比密集基线实现了显著加速,对长上下文 LLM 的 serving 吞吐有直接收益。

推理优化长上下文推理稀疏注意力GPU算子serving优化

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

HF 精选 · 08-21 08:00 UTC+8

SWE-bench Science 把代码智能体的评测扩展到科学软件修复场景,用于检验编码 Agent 能否处理科研工程任务。它揭示出这些 Agent 在科学软件问题上的典型失败机制,并发现引入科学领域指导的效果并不一致。该基准为科研软件自动化修复和 Agent 能力边界提供了更细粒度的参照。

Agent代码智能体科学软件基准评测软件修复

Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See

HF 精选 · 08-21 08:00 UTC+8

这篇研究探索低资源语言微调对专家混合模型推理行为的影响,发现 SFT 会让模型把推理过程迁移到低资源语言中,但不会损害准确率。进一步用可验证奖励做强化学习时,模型能修复输出格式错误和泄漏缺陷。这揭示了 SFT 与 RL 在语言迁移和推理质量上各自的作用边界。

后训练低资源语言SFTRLVR推理迁移

Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization

HF 精选 · 08-21 08:00 UTC+8

IAR 提出三阶段后训练框架,解决把文档知识内化到模型后容易损伤通用能力以及依赖外部检索库的问题。框架先注入结构化文档知识,再将模型对齐到无检索问答形式,最后恢复通用能力。它在领域准确率和通用性能上同时带来提升,适合需要离线知识内部化的场景。

后训练知识内部化文档理解领域微调

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

HF 精选 · 08-20 08:00 UTC+8

Co-RL 面向无监督推理场景,通过多智能体协作强化学习从同侪反馈中构造奖励信号,避免对人工标注真值的依赖。该方法在文本和视觉任务上都取得了性能提升。它为缺乏 ground-truth 标签时训练推理能力提供了一条新路径。

训练多智能体强化学习无监督推理奖励建模

SPADE: Self-Play in Adaptive Synthetic Executable Environments

HF 精选 · 08-20 08:00 UTC+8

SPADE 让语言模型通过自博弈方式设计自适应可执行训练环境,并学习求解这些环境,再用遗憾值驱动环境选择来聚焦自身薄弱点。这样模型可以持续生成对自己有挑战的任务,提升推理与工具使用表现。该方法为可扩展的自我对弈训练提供了一个闭环框架。

后训练自我对弈强化学习环境生成工具使用

FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents

HF 精选 · 08-20 08:00 UTC+8

FM-Bench 构建了一个长周期管理基准,让 LLM 智能体在 20 年时间跨度里运营一家足球俱乐部。评测结果显示,影响绩效的主要是经理行为,而不是模型规模或 token 支出。这对长期决策智能体的评估和资源投入方向有重要参考价值。

Agent长周期决策智能体评测LLM基准

Looped Language Models Improve Compositional Tool Calling

HF 精选 · 08-20 08:00 UTC+8

循环语言模型通过循环计算改进多步组合式工具调用,解决传统模型在多步工具使用中的规划与组合难题。它还引入自适应推理,在准确率和计算成本之间做动态平衡。该工作展示了循环结构对复杂工具调用流程的增益。

Agent循环语言模型工具调用自适应推理

EnvHarness: Awakening Static Worlds for Agent Learning

GoogleHF 精选 · 08-21 08:00 UTC+8

EnvHarness 和 EnvRigger 针对静态学习环境难以针对智能体弱点进行调整的问题,利用可编程插件动态重塑环境。这样环境能针对智能体弱点生成训练场景,并与强化学习共同进化。它提升了 Agent 在动态环境中的学习效率和泛化能力。

Agent智能体训练动态环境强化学习共进化

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis

HF 精选 · 08-21 08:00 UTC+8

FACET 解决终端任务合成中指令、解法和验证器容易脱离真实环境导致不可执行的问题。它保留原始任务意图,并在修复后的共享环境中对齐指令、解法和验证器。这使得终端任务可用于大规模智能体训练,提高可扩展性。

Agent终端任务合成智能体训练环境对齐

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

HF 精选 · 08-21 08:00 UTC+8

MemTrapBench 研究检索到的记忆会诱导大模型产生推理错误和信念扭曲的认知陷阱。它提出一种推理时策略,能在保持基准性能的同时帮助模型避开这些陷阱。这为记忆增强 LLM 的可靠性和安全性提供了新视角。

Agent记忆增强认知陷阱推理时策略LLM评测

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

腾讯 AI LabHF 精选 · 08-21 08:00 UTC+8

SkillEvo 利用多轮交互反馈来改进智能体技能,并通过主动治理机制维持进化梯度。该方法旨在解决多轮学习中反馈稀疏和技能退化的问题。它为持续自我改进的智能体技能库更新提供了机制。

Agent智能体技能多轮反馈自我进化

Repo0: Design-Driven Zero-to-All Code Generation

HF 精选 · 08-21 08:00 UTC+8

Repo0 提出双图架构状态和模块化导向的结构演化方法,从自然语言需求生成完整软件仓库。它针对传统代码生成只覆盖单文件或局部功能的问题,提升整体功能覆盖率。该工作对自动化软件工程和仓库级代码合成有实际意义。

Agent代码生成仓库级合成双图架构

EXIMO: VLM Guided Exploration of VLA Policies

HF 精选 · 08-21 08:00 UTC+8

EXIMO 聚焦大规模视觉语言动作机器人策略的高效微调,将 VLM 引导探索、编排数据上的模仿学习和残差离线策略强化学习结合起来。这种组合可以减少对高质量机器人数据的依赖,同时提升策略学习效率。对机器人基础模型微调有借鉴价值。

AgentVLA模型机器人策略VLM引导离线强化学习

Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses

HF 精选 · 08-21 08:00 UTC+8

Hierarchical Self-Improvement 针对冻结 LLM Agent 的特定任务执行框架进行自动进化,通过分层自修改来更新任务专用 harness。在中等难度任务上取得显著提升,但也受反馈质量和基座模型能力限制。该方法为在不训练大模型的前提下增强 Agent 能力提供了思路。

Agent分层自改进冻结LLMAgent框架任务专用harness

τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

HF 精选 · 08-21 08:00 UTC+8

τ_0-VLA 提出分层视觉语言动作模型,面向长视程机器人操作任务,用世界模型引导测试时搜索来扩展高层子任务决策的计算量。它解决了固定策略在长程操控中规划不足的问题。结果在长程机器人操作上获得改进。

基座VLA模型世界模型测试时计算机器人操作

PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents

HF 精选 · 08-21 08:00 UTC+8

PolicyGuide 处理客服 LLM 智能体必须遵循组织政策的问题,指出合规失败既来自禁止动作,也来自遗漏身份核验或确认等程序要求。运行时单动作护栏无法引导多步流程,而工作流系统主要关注流程完成而不是政策合规。PolicyGuide 从只保护单个动作转向引导整个工作流,以改善政策合规性。

Agent政策合规LLM智能体工作流引导运行时护栏

Chain-of-Experience for Continual LLM Improvement

字节 SeedHF 精选 · 08-21 08:00 UTC+8

Chain-of-Experience 提出通过迭代的测试时反馈回路让大模型持续改进,而不是一次性推理。该方法相比零样本基线表现更好,成本更低且 token 效率更高。它为推理时持续优化提供了轻量方案。

Agent测试时优化反馈回路持续改进

The Embedder's Dilemma: LLMs Are Better, but at What Cost?

COLM 2026HF 精选 · 08-21 08:00 UTC+8

这篇研究针对嵌入选型中的成本与性能权衡,比较了 LLM 与专用嵌入模型。它们在多样任务上的聚合性能几乎一致,但专用嵌入模型更便宜、更快。作者建议按任务类型进行分工,这为 RAG 和向量检索系统的成本优化提供了依据。

Infra嵌入模型LLM嵌入成本优化向量检索

QuoteBench: How Matched Scores Can Hide Command-Path Failures

HF 精选 · 08-21 08:00 UTC+8

QuoteBench 揭示执行边界解析错误会显著降低 LLM 编码智能体的成功率,即使匹配分数看起来不错。公开边界信息有助于恢复性能,说明评测必须考虑部署配置而非把匹配分数当作模型固有属性。这对代码生成评测和部署有提醒作用。

Agent代码生成评测部署配置边界解析编码智能体