每日 AI 速览

2026-08-20

生成于 2026-08-21 04:17
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线聚焦 Agent 自主与训练方法演进。Kimi K3 以 18 个 Agent 构成自主科研闭环逼近 Opus 5,论文侧从自适应可执行环境、组合工具调用到多智能体安全,推动 Agent 走向可检验、可委托。合成数据与后训练同样密集:Sutton 警示合成数据局限,GLM 5.3 相关讨论指向后训练扩展律,多语言合成数据与混合预训练约束并行出现。厂商方面,OpenAI 被曝因安全停训 GPT-6,Qwen 在办公 Agent 实测中综合第一。今日论文看点:『SPADE』以自博弈生成自适应可执行环境,『Co-RL』展示无监督推理可从多智能体强化学习多样群体中涌现,呼应上述双主线。

行业动态 40 条

闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5

量子位 · 08-20 17:46 UTC+8

该新闻指出 Kimi K3 通过包含 18 个智能体的自主科研 Harness,能力逼近闭源 Opus 5,经典 RSI(递归自我改进)剧本开始动摇。对从业者而言,这显示大规模多智能体科研流程正在成为缩小与闭源前沿模型差距的有效路线。

厂商动态Kimi K3多智能体自主科研递归自我改进

NVIDIA Megatron Core 0.19.0

Megatron-LM · 08-20 07:38 UTC+8

NVIDIA Megatron Core 0.19.0 发布,新增 MoE Quantile Balancing 路由器,利用分位数估计的专家路由偏置实现无辅助损失的负载均衡;同时加入共享专家融合 MLP、打包序列 MoE 分发以及训练和推理路由 trace 分析。这些特性对 MoE 模型的大规模训练和分布式推理优化很有价值。

InfraMegatron Core专家混合负载均衡共享专家

Frontier Radar #4: China has caught up, so what's left of the Western AI lead?

The Decoder · 08-20 22:08 UTC+8

The Decoder 第四期 Frontier Radar 分析中国模型 Kimi K3 和 GLM-5.3 已接近美国最佳模型水平,西方实验室将部分原因归于蒸馏,且文中认为有实际证据支撑。其核心结论是模型领先无法防御,并对哪些能力仍可构成壁垒进行讨论。

厂商动态Kimi K3GLM-5.3中美AI竞争蒸馏

KI-Pioneer Sutton calls synthetic data a "big mistake" in the face of an infinitely complex world

The Decoder · 08-20 20:14 UTC+8

图灵奖得主 Richard Sutton 认为用合成数据扩展大模型是「大错误」,因为世界无限复杂,任何对世界的模拟都过于微小,人类专业知识还会成为真正扩展的瓶颈。他主张智能体应当持续从自身经验中学习,而不是依赖固定的冻结模型。

训练Richard Sutton合成数据持续学习缩放定律

b10514

llama.cpp · 08-20 19:19 UTC+8

llama.cpp 更新 b10514,新增对 GraniteSWAForCausalLM 和 GraniteMoeSWAForCausalLM 模型的支持,并加入 rope_pattern 数组的转换基础设施。这对希望在本地或边缘端部署 IBM Granite SWA 系列模型的开发者很有用。

Infrallama.cppGranite滑动窗口注意力模型转换

Scaling Laws for Mixture Pretraining Under Data Constraints

Apple ML · 08-20 08:00 UTC+8

Apple 机器学习团队发布数据受限条件下混合预训练的缩放定律研究,分析稀缺目标数据与丰富通用数据混合时的权衡:目标数据比例过低会导致领域欠拟合,过高则重复样本过多、收益递减。这对低资源语言和垂直领域预训练具有直接指导意义。

训练缩放定律混合预训练数据受限Apple

Post-Train NVIDIA Cosmos 3 Edge for On-Device Robot Control

NVIDIA 开发者 · 08-20 00:00 UTC+8

NVIDIA 发布关于对 Cosmos 3 Edge 进行后训练并用于端侧机器人控制的方案,强调机器人策略需要适配传感器、环境和任务,同时运行在车载计算硬件上。这对具身智能边缘部署和世界模型后训练有实用参考价值。

NVIDIA Cosmos机器人控制后训练端侧部署

pre-split-full: Merge main into studio-mmproj-fit

Unsloth · 08-20 19:30 UTC+8

Unsloth 仓库将 main 合并到 studio-mmproj-fit 分支,解决了三个小冲突,包括 llama_cpp.py 中两组独立新增、mmproj 回退测试以及 image-input-support.ts 的导入。其中缺失 .ts 后缀是此前前端测试失败的原因,上游已修复。

后训练Unsloth合并多模态投影器前端修复

viable/strict/1787231279: [MPS] fail loudly on large reductions (#194082)

PyTorch · 08-20 18:51 UTC+8

该 PyTorch PR 修复了 MPS 后端在 2.14 版本中大型张量 reduction 从原先部分报错、部分静默错误变为全部静默失败的问题,改为显式 loud 报错。这对 Mac GPU 上的训练和推理用户有稳定性意义。

InfraPyTorchMPS归约操作错误处理

Anthropic's most capable model, codenamed "Model 2," is for internal use only

The Decoder · 08-20 18:04 UTC+8

The Decoder 报道 Anthropic 内部使用一个未发布的模型,代号「Model 2」,其能力超过任何公开可用的 Claude 版本。这说明前沿实验室最先进的模型能力可能长期保留在内部,不对外公开,对产业竞争格局有参考意义。

厂商动态Anthropic内部模型Claude前沿模型

保存历史不等于形成记忆:KDC 的长期运行主张

InfoQ 中文 · 08-20 18:00 UTC+8

文章讨论长期运行智能体或知识系统中,仅保存历史交互记录并不等于形成有效记忆。KDC 主张需要构建可提取、可索引、可应用的记忆层,才能支撑长程任务中的上下文利用与决策。

Agent智能体记忆长期运行KDC

v0.28.0rc1

vLLM · 08-20 17:30 UTC+8

vLLM 发布 v0.28.0rc1 候选版本,包含安全修复,对加载 OpenVINO 2 处理器相关逻辑增加远程信任解析保护。升级可降低推理服务中远程代码执行风险。

推理优化vLLM安全修复推理框架

viable/strict/1787221610

PyTorch · 08-20 16:12 UTC+8

PyTorch 移除了阻止部分 vmap 分解注册的条件,使更多算子能够注册 vmap 分解规则。这扩大了 functorch 的函数式变换覆盖范围,减少自定义算子的兼容障碍。

InfraPyTorchvmap函数式变换

OpenAI builds safety system that catches misuse without storing customer data

The Decoder · 08-20 16:01 UTC+8

OpenAI 计划向企业客户提供最先进模型,同时上线不存储客户数据的安全系统,仍能检测滥用行为。这对金融、医疗等敏感行业采用前沿模型有吸引力,缓解数据隐私与安全合规矛盾。

厂商动态OpenAI数据隐私安全检测

viable/strict/1787218092

PyTorch · 08-20 15:28 UTC+8

PyTorch FX 对符号二元算术的结果表达式引入缓存,避免重复构造相同符号表达式。这降低了动态形状或导出场景下的编译开销,提升符号推导效率。

InfraPyTorchFX符号推导编译优化

b10509

llama.cpp · 08-20 14:54 UTC+8

llama.cpp 新增 ggml_rope_set_offset 算子,并在 Metal、CUDA、Vulkan 等后端实现支持,同时补充测试与参数传递。这为动态调整 RoPE 位置偏移提供跨后端能力,便于长上下文或序列拼接场景。

推理优化llama.cppRoPEGGML多后端

b10524

llama.cpp · 08-20 11:40 UTC+8

llama.cpp 在 OpenCL 后端对 MoE 专家散播操作做了确定性修复,避免并行执行导致结果不确定。对需要可复现推理或调试 MoE 模型的用户很重要。

推理优化llama.cppOpenCLMoE确定性

b10507

llama.cpp · 08-20 11:23 UTC+8

llama.cpp 多模态模块新增 mtmd_bitmap_set_mergeable 接口,允许位图对象在合并时标记为可合并。这提升了多模态处理中内存或元数据管理的灵活性。

推理优化llama.cpp多模态内存管理

b10506

llama.cpp · 08-20 10:59 UTC+8

llama.cpp 在 Metal 后端使用 packed types 优化 q8_0 量化的反量化操作。这可以提升 Apple Silicon 上 q8_0 模型推理性能,减少访存或指令开销。

推理优化llama.cppMetal量化反量化优化

b10505

llama.cpp · 08-20 10:38 UTC+8

llama.cpp 的 server 新增 dedup-cache-models 预设选项,用于在缓存中去除重复模型加载,优化多模型服务时的内存占用和启动效率。有利于部署多个模型的运维场景。

推理优化llama.cpp服务器模型缓存内存优化

华尔街实测8款全球主流Agent:千问办公综合排名第一

量子位 · 08-20 09:06 UTC+8

华尔街对 8 款主流 Agent 进行实测,阿里千问在办公场景综合排名第一,同时指出成本正成为 Agent 商业化的重要考量因素。这表明国产模型在办公智能体赛道具竞争力,也提示关注推理成本与商业闭环。

AgentAgent评测千问办公智能体成本

Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions

Apple ML · 08-20 08:00 UTC+8

Apple 提出一种在目标语言数据受限时通过词汇干预增强多语言知识迁移的方法,帮助低资源语言从高资源语言获取科学推理、常识和世界知识。相比需要大规模数据的方法,该思路能缓解数据约束。

训练多语言知识迁移低资源语言Apple

Building Federated Multimodal AI Workflows with NVIDIA FLARE

NVIDIA 开发者 · 08-20 01:50 UTC+8

NVIDIA 开发者博客介绍使用 NVIDIA FLARE 构建联邦多模态 AI 工作流,使视觉语言模型能在数据不出域的情况下完成训练或推理。这解决了医疗、金融等场景的数据隐私与合规问题。

InfraNVIDIA FLARE联邦学习多模态隐私保护

Meet the startup helping Wall Street put a price on AI compute

TechCrunch · AI · 08-20 01:26 UTC+8

创业公司 Silicon Data 试图为 AI 算力定价,并让华尔街机构能对冲算力价格波动风险。随着数据中心和 GPU 支出成为 AI 产品最大成本,这为算力金融化提供了新工具。

Infra算力定价AI基础设施华尔街Silicon Data

Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator

NVIDIA 开发者 · 08-20 00:00 UTC+8

NVIDIA 推出 SkillEvaluator,用于评估 AI Agent 的技能执行效果,特别是上下文质量对任务效率的影响。它帮助开发者量化 Agent 在步骤效率、信息检索等方面的表现。

AgentNVIDIAAgent评测技能评估上下文质量

viable/strict/1787248611: fix-193938-align-randn bug (#194118)

PyTorch · 08-20 23:31 UTC+8

PyTorch 修复了 CUDA 上编译后的 torch.randn 和 torch.randn_like 在启用 align_random_eager 时被错误降级为均匀随机的问题,现在只对 rand 模式使用 eager 对齐路径,保证编译模型与 eager 行为一致。

InfraPyTorch随机数CUDA编译修复

viable/strict/1787243284

PyTorch · 08-20 21:55 UTC+8

PyTorch 将 CPU 的 ideep 后端回退到 torch 2.13 版本,以解决性能回退问题。这说明新版 ideep 在部分场景引入性能损失,维护者选择保守回退。

InfraPyTorchCPU后端ideep性能回退

b10516

llama.cpp · 08-20 21:22 UTC+8

llama.cpp 在 Vulkan 后端命令池清理函数中增加空指针检查,防止空队列指针导致崩溃。这是稳定性修复,尤其保护资源释放边界条件。

Infrallama.cppVulkan稳定性修复

Introducing AI Futures

OpenAI · 08-20 15:00 UTC+8

OpenAI 推出新博客「AI Futures」,专注探讨变革性 AI 对权力、治理、经济和个体自由的影响。这表明 OpenAI 将更公开参与 AI 社会影响与政策讨论。

厂商动态OpenAIAI治理博客社会影响

smolmachines / smolvm as a sandbox for untrusted Python & JavaScript

Simon Willison · 08-20 07:16 UTC+8

Simon Willison 使用 Claude 对 smolmachines/smolvm 进行测试,评估其作为不可信 Python 和 JavaScript 代码的安全沙箱能力,重点考察 CPU/内存限制、禁止网络访问和文件系统白名单。

Agent代码沙箱smolvm安全不可信代码执行

Domain and publish date filters for Web Search on AgentCore

AWS 机器学习 · 08-20 06:13 UTC+8

Amazon Bedrock AgentCore 的 Web Search 新增域名和发布日期过滤,开发者可在每次调用时控制允许的网站来源和内容时效,并由服务端强制生效。该功能同时扩展到欧洲(爱尔兰)和亚太(东京)区域。

AgentAWSAgentCoreWeb检索过滤

OpenAI seeks to one-up Anthropic with new customer privacy protections

TechCrunch · AI · 08-20 06:10 UTC+8

OpenAI 与 Anthropic 正在竞争谁能为企业客户提供更好的数据隐私保护,OpenAI 试图通过新隐私功能超越对手。这反映大模型厂商将企业数据合规作为差异化卖点,影响企业选型。

厂商动态OpenAIAnthropic数据隐私企业竞争

How Fanatics Betting and Gaming built a multi-agent customer support system

AWS 机器学习 · 08-20 04:40 UTC+8

Fanatics Betting and Gaming 在 AWS 上构建多智能体客服系统,应对体育博彩中州级法规差异、实时负责任博彩检查和重大赛事流量高峰。文章阐述架构与 AWS 服务组合,为多智能体客服提供模式借鉴。

AgentAWS多智能体客服系统体育博彩

论文 18 篇

『SPADE』以自博弈生成自适应可执行环境,『Co-RL』展示无监督推理可从多智能体强化学习多样群体中涌现,呼应上述双主线。

SPADE: Self-Play in Adaptive Synthetic Executable Environments

HF 精选 · 08-20 08:00 UTC+8

SPADE 针对语言模型在推理和工具使用上训练环境固定、难以随模型能力增长而调整的问题,让同一个模型既设计可执行环境又作为求解者进行自我博弈,并通过基于遗憾值的目标选择持续生成更有挑战的环境。这样训练分布不再依赖人工收集的静态数据,而能自适应地匹配模型薄弱环节。论文显示该方法能提升推理与工具调用性能。

后训练自我博弈强化学习环境生成工具调用

Looped Language Models Improve Compositional Tool Calling

HF 精选 · 08-20 08:00 UTC+8

该工作针对多步组合工具调用中错误易沿长链路累积、且固定深度推理成本较高的问题,提出用循环语言模型在循环计算中迭代求解。模型可以根据任务难度动态决定循环步数,在准确率与计算成本之间做自适应权衡,而不是像传统一次性生成那样无法纠错。

Agent循环语言模型工具调用自适应推理多步组合

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation

HF 精选 · 08-20 08:00 UTC+8

SemaPLC 针对 PLC 代码生成缺乏项目上下文、文本生成结果难以保证可编译可运行的问题,提出一个验证门控的智能体框架,通过外部编译和实时运行执行来校验生成的 PLC 逻辑。只有通过验证的候选才能作为最终输出,因此在验证通过率上显著优于基线方法。这对工业控制领域里的可落地代码生成具有直接价值。

AgentPLC代码生成验证门控智能体工业自动化

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

HF 精选 · 08-20 08:00 UTC+8

OmniScientist 针对现有多数 AI 科学家只能处理单一模态或单一学科、难以从异构原始证据中直接发现知识的问题,提出端到端的全模态 AI 科学家框架。它利用自主智能体和生命周期级感知,在多学科环境中直接操作原始证据,减少人工预处理造成的信息损失,改善了跨模态、证据驱动的科学发现能力。

AgentAI科学家多模态自主智能体科学发现

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

HF 精选 · 08-20 08:00 UTC+8

Co-RL 解决无标签条件下推理能力难以涌现的问题,用多智能体协作强化学习替代对 ground-truth 标签的依赖。其核心是由多样同伴组成的 cohort 提供同伴派生奖励,形成互相纠错和探索的激励。在文本和视觉任务上均取得了性能提升。

后训练多智能体强化学习无监督推理同伴奖励协作学习

Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

HF 精选 · 08-20 08:00 UTC+8

该工作针对单步逆合成中模型常生成化学上不合理或多样性不足的反应,结合 Top-K 提示与化学合理性感知训练来提升候选反应质量。在一个大型已核实反应数据集上达到当前最优结果,并指出其输出适合作为后续集成系统的基础。

后训练逆合成化学合理性大语言模型Top-K提示

FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents

HF 精选 · 08-20 08:00 UTC+8

FM-Bench 提出一个长视野管理基准,让 LLM 智能体在长达 20 年的时间跨度内管理足球俱乐部,并与其他竞争智能体互动。评测发现决定表现的关键因素是管理行为本身,而不是模型规模或 token 消耗,这为评估长周期决策智能体提供了新视角。

Agent基准测试长视野决策LLM智能体竞争环境

The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning

HF 精选 · 08-20 08:00 UTC+8

AdaPop 针对 LLM 遗忘学习中不同事实被记忆强度不同、统一梯度压力容易导致遗忘不彻底或已遗忘内容泄露的问题,根据事实流行度自适应调整梯度压力。同时它自动平衡遗忘与保留目标,从而降低被遗忘内容的泄漏概率。

后训练机器遗忘自适应梯度事实流行度大语言模型

SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents

HF 精选 · 08-20 08:00 UTC+8

SkillGate 解决长视野智能体在技能选择中 selector 因信用分配问题而早期被饿死、进而学到误导性技能的问题。它把执行 token 的结果信用与技能命名 token 的局部优势分离开来,稳定技能选择策略的训练。结果提高了成功率并减少了误导性技能的暴露。

Agent技能选择信用分配长视野智能体强化学习

LLMs Get Smarter from Targeted Synthetic Multilingual Data

HF 精选 · 08-20 08:00 UTC+8

HOTFIXR 是一个数据生成框架,针对多语言推理能力的具体薄弱环节定向合成训练数据,而不是简单混合更多平行语料。它能在不牺牲模型整体能力的前提下提升跨语言性能,尤其适合低资源语言推理增强。

训练数据合成多语言推理跨语言性能大语言模型

Bounded Agents: Delegation Security for Multi-Agent AI Systems

HF 精选 · 08-20 08:00 UTC+8

该工作针对多智能体系统中权限委派可能被滥用、多个单独看似安全的动作组合后产生危害的问题,提出 Agentic Principal Chain。它执行会话感知的授权检查,在委派链上持续校验权限,从而阻止有害动作组合和委派滥用。

Agent多智能体安全授权检查委派安全LLM智能体

Temporal Multi-Signal Fusion for Token-Level Hallucination Detection

HF 精选 · 08-20 08:00 UTC+8

该工作针对幻觉常被当作孤立 token 处理、但实际上常表现为时间上延续片段的问题,用序列标注方式在多个外部特征融合基础上检测幻觉片段。它不依赖模型内部访问,跨模型鲁棒性较好,能识别连续时间尺度上的幻觉。

训练幻觉检测序列标注多信号融合跨模型

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation

HF 精选 · 08-20 08:00 UTC+8

SemComp-Bench 针对现有视频生成评测偏重视觉质量、忽略任务完成语义的问题,提出语义任务完成视角的评测基准。它评估生成视频是否真正达成预期结果,并配有人工整理数据集和基于视觉语言模型的自动评测器。

基座视频生成语义任务完成基准测试视觉语言模型

Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

HF 精选 · 08-20 08:00 UTC+8

Zetta 针对具身智能中高层推理与实时物理执行之间脱节、控制频率不足的问题,构建闭环具身 harness,在线进化运行时批评器和恢复技能,在动作频率层面直接治理物理执行。它在机器人基准上取得高成功率,同时推理更快,并能规模化自我探索。

Agent具身智能闭环控制自进化机器人

Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification

HF 精选 · 08-20 08:00 UTC+8

该工作针对开放权重模型难以判断是否真正源自某一预训练 lineage、还是独立训练或蒸馏的问题,发现兼容的开放权重检查点会在权重空间中留下可检测的祖先信号。通过中心化残差签名,无需数据即可区分真实 lineage 与独立或蒸馏模型。

基座模型溯源权重空间开放权重签名验证

Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion

CIKM 2026CCF-B推荐HF 精选 · 08-20 08:00 UTC+8

该框架针对创意写作数据多围绕故事展开、文体和体裁单一的问题,将主题种子与体裁形式控制分离,生成跨 13 个体裁的多样化高质量写作数据。用这些数据训练后,LLM 的创意写作表现得到改善。

训练创意写作数据生成体裁扩展大语言模型

Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention

TMLRarXiv · 08-20 01:50 UTC+8

Lévy Attention 针对不规则采样时间序列模型能在任意连续时间点给出预测、却无法报告预测可信度的问题,提出一种交叉注意力算子,其输出是对非齐次泊松过程的随机积分。在同一前向传播中就能以闭合形式得到预测不确定性,不增加额外计算成本,为连续时间注意力带来了单次推理中的不确定性估计能力。

基座时间序列注意力机制不确定性估计随机过程
Sotirios P. Chatzis, Loukas Papadoulas

Discretizing Continuous Time Series for Imputation with Masked Diffusion Training

NeurIPS 2026CCF-A推荐arXiv · 08-20 01:16 UTC+8

该工作针对时间序列插补中缺失值与观测值在同一表示空间中混淆、以及连续扩散模型只学习预测噪声而非原始信号的问题,提出离散化表示和掩码扩散训练方法。其目标是显式分离缺失与观测结构,直接重建原始信号,从而在复杂时序和噪声条件下提升插补可靠性。

时间序列插补掩码扩散离散化表示分离
Dongbin Kim, Seungyun Lee, Geonwoo Shin, Jaewook Lee