每日 AI 速览

2026-08-04

生成于 2026-08-05 04:07
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线聚焦三大方向:大模型厂牌动作频频,阿里Qwen 3.8 Max与27B等开源模型重磅发布,主打编码与协作能力,DeepSeek低价策略引发海外平台跟进,Anthropic则拿下百亿美元算力订单。智能体生态加速演进,Y Combinator开源多智能体框架QM,Orchard推出可扩展智能体框架,论文方面LongHorizon-Harness与DeepVoyager-VL等探索长程任务执行与视觉闭环搜索。训练与推理优化同样密集,CMuon加速扩散Transformer训练,GPTQ-2D改进量化方法,稀疏事件KV平衡计算与内存瓶颈。

行业动态 33 条

Orchard: An open framework for scalable agentic AI

Microsoft Research · 08-04 00:00 UTC+8

微软研究院开源 Orchard 框架,为多类型智能体的训练和评估提供统一且可复用的基础设施,降低复杂度同时支持小模型获得强性能,加速智能体研究从实验到规模化的过渡。

Agent智能体框架开源微软研究院训练评估

b10267

llama.cpp · 08-04 23:56 UTC+8

llama.cpp 重构了推测解码配置的公共初始化函数以减少代码重复,保持现有服务器测试全部通过,优化了推理后端的代码结构。

llama.cpp推测解码代码重构推理优化

How to Secure AI Agents, MCP Servers, and LLM Apps in Production

MarkTechPost · 08-04 04:16 UTC+8

面向生产环境的 AI 安全实战指南,覆盖智能体、MCP 服务器和 LLM 应用的五层攻击面、12 项配置检查以及运行时护栏,并映射 NIST/Owasp 等标准,为安全建设提供完整落地框架。

AgentAI安全智能体安全MCP安全实践

NVIDIA Vera Storage Benchmarks: Faster Encryption, Compression, Integrity Checking, and Recovery for AI-Native Storage

NVIDIA 开发者 · 08-04 00:00 UTC+8

NVIDIA 公布了 Vera 存储基准测试,展示了针对 AI 原生存储的加密、压缩、完整性检查和数据恢复的加速性能。对于构建 agentic AI 工作流的从业者,这可以帮助评估存储层在处理持久记忆和 KV 缓存时的速度与可靠性,从而优化数据管线的整体效率。

推理优化AI 存储Agent 工作流性能基准数据加速

Deploy local agents everywhere with LFM2.5-2.6B

HuggingFace 博客 · 08-04 21:58 UTC+8

HuggingFace 推出了 LFM2.5-2.6B 模型,支持在各类设备上本地部署智能体,无需云端依赖。这为注重隐私、低延迟和离线运行的应用场景大幅降低了 agent 的部署门槛,并拓展了设备端智能体生态。

本地部署Agent轻量模型边缘计算

b10262

llama.cpp · 08-04 21:56 UTC+8

llama.cpp 为 Vulkan 后端新增了 GATED_LINEAR_ATTN 算子支持,扩展了线性注意力模型在 GPU 上的推理路径。这让在资源受限的 Vulkan 环境中运行更先进的注意力机制成为可能,提升了模型兼容性与推理灵活性。

推理优化llama.cpp推理框架Vulkan线性注意力

开源版Claude Science来了!零依赖、MIT协议,内置30+项科研Skills

量子位 · 08-04 21:14 UTC+8

北京大学与元空AI Agent联合实验室发布了开源版「Claude Science」,采用 MIT 协议且零依赖,内置 30 余项科研技能。该工具让研究人员可以在本地离线环境下使用类 Claude 的科研辅助能力,并方便二次开发,降低了学术领域的智能体应用门槛。

Agent开源工具科研 AgentMIT 协议本地运行

给 Agent 装上方向盘和刹车,Harness 时代的工程新范式

InfoQ 中文 · 08-04 17:59 UTC+8

InfoQ 提出为智能体引入类似“方向盘和刹车”的工程化控制机制,探索安全可信的 Agent 治理新范式。这有助于企业解决智能体行为不可控和风险高等落地难题,为 Agent 规模化应用提供更细粒度的管控手段。

AgentAgent 安全工程范式智能体治理企业落地

b10258

llama.cpp · 08-04 17:24 UTC+8

llama.cpp 重构了采样器内部结构,将 n_vocab 字段从通用采样数据迁移至 penalty_sampler,以保持与 logit_bias 和 mirostat 采样器一致的设计。这次变更提升了代码的可维护性,且不影响现有推理性能。

推理优化llama.cpp采样器重构代码优化

腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

量子位 · 08-04 16:58 UTC+8

腾讯发布了混元 Hy ASR 3.0 预览版,实现上下文感知的语音识别能力,并已集成到元宝应用中。该技术能够提升噪音环境下的识别准确率和对话理解水平,为语音助手等场景提供更鲁棒的基础支撑。

基座语音识别上下文感知腾讯混元ASR

DeepSeek低价风暴打服硅谷!海外平台争相倒贴V4 Flash

量子位 · 08-04 16:18 UTC+8

DeepSeek 极具竞争力的定价策略迫使海外云平台纷纷推出 DeepSeek V4 Flash 的免费或补贴方案,在硅谷引发热议。这显示出开源低价模型对商业闭源模式的冲击,加速了推理服务的成本下探与价格竞争。

厂商动态DeepSeek定价策略推理成本开源模型

Building an Advanced AI Skill Security Auditing Pipeline with NVIDIA SkillSpector, LangGraph, YARA Rules, SARIF, and CI Policy Gates

MarkTechPost · 08-04 16:12 UTC+8

本文讲解如何利用「NVIDIA SkillSpector」和「LangGraph」构建 AI 技能安全审计流水线,通过自定义 YARA 规则检测提示注入、凭证访问等风险并设置 CI 部署门禁。该方案为 AI agent 技能的安全合规提供了可操作的自动化实践,有助于企业安全地引入智能体能力。

AgentAI 安全Agent 审计LangGraphNVIDIA SkillSpector

New ways to learn and teach with ChatGPT Work and Codex

OpenAI · 08-04 08:00 UTC+8

OpenAI 为「ChatGPT Work」和「Codex」推出教育类插件,支持 K-12 教师、大学师生进行学习、教学、研究和项目构建。这扩展了 ChatGPT 和 Codex 在教育领域的结构化应用场景,为教学互动提供了新的可能性。

厂商动态OpenAI教育工具ChatGPTCodex

Evaluating Multimodal Vision Models with Moonshot PerceptionBench Using Robust Data Loading and Automated Judging

MarkTechPost · 08-04 06:26 UTC+8

本教程展示了如何为「Moonshot PerceptionBench」搭建端到端评估工作流,该基准覆盖 OCR、计数、定位、上下文推理等细粒度多模态感知任务。通过自动化加载与评判,从业者可以高效衡量视觉模型的感知能力,提升评测效率。

基座多模态评测视觉模型PerceptionBench自动化评估

Design Arena creators raise $7.9 million to bring taste to AI models

TechCrunch · AI · 08-04 03:28 UTC+8

「Design Arena」的创建者融资 790 万美元,旨在将人类的审美与“品味”判断注入 AI 模型,已有 530 万用户参与提供关键的人类评估数据。这凸显了人类反馈在提升模型主观判断能力中的重要性,也为前沿实验室提供了高质量的对齐信号。

后训练人类反馈模型对齐设计评估融资

NVIDIA Alpamayo 2 Super, the Frontier Open Model for Robotaxis and Autonomous Vehicles, Now Available for Commercial Use

NVIDIA 博客 · 08-04 23:00 UTC+8

NVIDIA 发布面向 Robotaxi 和自动驾驶的开放前沿模型「Alpamayo 2 Super」,并开放商业使用,它特别擅长处理罕见的复杂长尾场景,需要情境理解与因果推理。这为自动驾驶公司提供了可直接商用的高性能基座模型,加速复杂决策系统的落地。

厂商动态自动驾驶开放模型长尾场景NVIDIA

Agent 记忆,不能只靠聊天记录

InfoQ 中文 · 08-04 22:37 UTC+8

InfoQ 文章强调智能体记忆不能仅依赖对话记录,需要引入更结构化的记忆管理机制。这对构建能保持长期上下文和个性化能力的智能体至关重要,决定了其在持续交互场景中的可用性。

AgentAgent 记忆记忆管理长期上下文智能体设计

Silicon Valley’s rift over open source pushes back contemplated White House bans on Chinese AI

The Decoder · 08-04 20:23 UTC+8

硅谷内部就白宫可能对中国开放权重 AI 模型实施制裁和云禁令产生严重分歧,OpenAI 和 Anthropic 主张限制,而 Nvidia、Google 和 Meta 强烈反对,最终白宫暂时搁置相关计划。这一事件凸显了开源模型在国际竞争与政策博弈中的战略地位,开发者需密切关注后续走向。

厂商动态开源模型政策博弈地缘政治AI 监管

中国软件行业领军人物、深开鸿CEO王成录博士确认出席AICon深圳,将分享“让 AI 拥有身体:从大模型迈向物理 AI”

InfoQ 中文 · 08-04 18:00 UTC+8

深开鸿 CEO 王成录博士将在 AICon 深圳分享“让 AI 拥有身体:从大模型迈向物理 AI”的主题演讲,探讨如何将大模型能力延伸至物理世界。这为关注具身智能和物理 AI 落地的从业者提供了来自行业领军人物的实践视角与战略思考。

基座具身智能物理 AI大模型落地行业会议

From weeks to minutes: How Formula 1® uses agentic AI on AWS to accelerate data operations

AWS 机器学习 · 08-04 01:24 UTC+8

F1 与 AWS 合作利用「Amazon Bedrock AgentCore」构建 Data Accelerator,将数据源上线时间从 8 周缩短至约 40 分钟,并实现了 schema 演化自动化与全链路可观测性。这一案例展示了智能体 AI 在数据工程中的巨大加速潜力,为数据密集型团队提供了可复用的参考架构。

AgentAgent 应用数据工程Amazon Bedrock效能优化

Automated Reasoning policy refinement in Amazon Bedrock

AWS 机器学习 · 08-04 00:30 UTC+8

Amazon Bedrock 新增自动推理策略精炼功能,能自动诊断失败的权限测试并生成形式逻辑修正建议,用户确认后即可生效。这帮助安全团队更高效地维护 IAM 与合规策略,减少手工梳理的复杂度和出错概率。

InfraAmazon Bedrock自动推理策略管理安全合规

论文 20 篇

今日论文集中在智能体长程规划、技能训练蒸馏与高效推理,如DeepVoyager-VL的视觉闭环搜索、SKT的验证合成数据技能训练、GPTQ-2D的量化优化。

DiffusionGemma Technical Report

GoogleHF 精选 · 08-04 08:00 UTC+8

DiffusionGemma 是一种基于离散扩散的开放权重语言模型,用并行迭代精炼 256 个 token 块的方式生成文本,打破了自回归模型的顺序解码瓶颈。它通过对 MoE 架构的 Gemma 4 进行微调得到,激活参数 3.8B,在极高速度下保持生成质量,为非自回归路线的大模型高效推理提供了新的实践参考。

基座离散扩散文本生成模型微调MoE

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

HF 精选 · 08-04 08:00 UTC+8

LongHorizon-Harness 将长周期智能体执行重新定义为任务状态管理问题,通过把任务状态评估与上下文解耦,解决传统框架中状态跟踪困难和错误自评扩散的问题,从而提升长程多步任务的完成可靠性与可跟踪性。

Agent长周期智能体任务状态管理智能体评估上下文管理

DAPD: Dual-Anchored Policy Distillation

上海 AI LabHF 精选 · 08-04 08:00 UTC+8

DAPD 针对在线策略蒸馏中教师拥有特权信息导致的「特权幻觉」——学生学会依赖推理时无法获得的信息而性能退化——提出双锚定蒸馏,通过矫正学生行为的锚点使策略更忠实于推理上下文,消除信息不对称带来的性能下降。

后训练知识蒸馏特权幻觉在线策略学习语言模型后训练

SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation

上海 AI LabHF 精选 · 08-04 08:00 UTC+8

SKT 提出一种经过验证的合成数据管线,从大规模技能库中自动构建技能锚定任务和可执行轨迹,为模型提供识别、应用和协调多种技能的训练数据,解决有技能但不会用的问题,大幅提升智能体的技能使用能力。

Agent技能使用合成数据智能体训练多技能协调

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

HF 精选 · 08-04 08:00 UTC+8

WCM 针对 VLA 模型强化学习中评论家只能基于单帧观测、忽视部分可观测性的痛点,提出世界评论家模型,利用世界模型融入观测历史估计价值,避免指数复杂度,显著提升机器人操作策略的学习效果。

后训练VLA强化学习世界模型评论家机器人

GPTQ-2D: Cubic-Time Two-Sided Adaptive Rounding

HF 精选 · 08-04 08:00 UTC+8

GPTQ-2D 将经典的自适应舍入扩展到两侧有非奇异基矩阵作用的一般情形,提出立方时间算法,使 GPTQ 类量化能处理更复杂的舍入问题,拓展了自适应舍入在模型压缩中的应用范围。

推理优化模型量化自适应舍入GPTQ矩阵舍入

Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV

HF 精选 · 08-04 08:00 UTC+8

该工作直接检验长周期智能体中「保留的 KV 缓存事件在原始观察消失后仍有信息量」这一前提,发现缺失早期观察时答案显著偏移,警示现有记忆剔除策略需重新审视事件与语境的关联性。

推理优化KV缓存记忆管理长周期智能体事件记忆

Progressive Agent Skill Generation via Reinforcement Learning

HF 精选 · 08-04 08:00 UTC+8

本文用强化学习的执行改善信号替代手工启发式,实现渐进式智能体技能生成,无需针对不同证据源单独设计,为异构来源的技能统一生成提供了学习驱动的新路径。

Agent智能体技能生成强化学习技能学习渐进式生成

UEmbed: Unified Sparse and Dense Multimodal Embeddings

HF 精选 · 08-04 08:00 UTC+8

UEmbed 提出解码器式多模态统一嵌入模型,同时支持稀疏和稠密检索,摆脱以往稀疏检索对编码器架构和辅助跨模态模块的依赖,为搜索和 RAG 提供更简洁的统一检索方案。

基座稀疏检索稠密检索多模态嵌入统一模型

SWE-Touch: Benchmarking Coding Agents When Users Touch the Code

HF 精选 · 08-04 08:00 UTC+8

SWE-Touch 引入「反编辑」机制,模拟真实共享工作区中用户中途修改代码的场景,测试编码智能体对代码变更的理解和响应,为协作式编程智能体评估提供了更现实的基准。

Agent编码智能体软件工程基准共享工作区反编辑

Analytic Planning under Uncertainty with Moment Closure

UAI 2026CCF-B推荐arXiv · 08-04 01:17 UTC+8

本文提出用矩闭包进行分析式不确定性规划,放松了传统解析传播全状态分布对策略和奖励的限制,在避免采样高方差和点估计忽视不确定性的同时,拓展了深度 MBRL 中分析规划的可能性。

基于模型强化学习不确定性传播矩闭包分析规划
Shishir Sharma, Doina Precup

Aggregate-then-Calibrate for Human-centered Assessment with Theoretical Guarantees

ICLR 2026arXiv · 08-04 00:30 UTC+8

AtC 两阶段框架先聚合人类判断和模型分数,再通过理论驱动的校准消除异质专家水平与标度不一致的影响,为缺乏真值基准的主观评估任务提供无偏且理论可保证的优化方案。

人本评估聚合校准无偏估计理论保证
Zejun Xie, Xintong Li, Guang Wang, Desheng Zhang