每日 AI 速览

2026-06-23

生成于 2026-06-24 11:11
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线集中在三处。其一,国产大模型密集迭代:字节「豆包2.1」以Agent自主运行十八小时完成芯片设计代码引发关注,智谱「GLM 5.2」上线模型中心并将上下文扩展三倍。其二,厂商竞争白热化,「OpenAI」称新版「GPT-5.5-Cyber」在网络安全基准上超越「Anthropic」的「Mythos」,「xAI」推出「Grok Skills」并新增长程自主执行的「goal」能力,「Sakana AI」以编排模型「Fugu」路由多家前沿模型对标头部水平。其三,Infra层值得留意,「Prime Intellect」发布「prime-rl 0.6.0」支持万亿参数「MoE」的智能体强化学习训练,「NVIDIA」借「DFlash」推测解码在「Blackwell」上将推理提速至十五倍,且「Anthropic」与「Micron」拟联合设计AI内存架构,软硬协同趋势明显。

行业动态 40 条

Prime Intellect Releases prime-rl 0.6.0 to Train Trillion-Parameter MoE Models on Agentic RL Workloads

MarkTechPost · 06-23 15:20 UTC+8

Prime Intellect 发布开源框架「prime-rl 0.6.0」,面向万亿参数 MoE 模型的异步强化学习训练。它在 28 个 H200 节点上、以最高 131k 序列长度和 256 路 rollout 训练「GLM-5」做 SWE 任务,单步时间压到 5 分钟以内,背后是 FP8 推理、宽专家并行、prefill/decode 分离、router replay 以及 FSDP+EP+CP 三维并行等一整套优化。对做大规模智能体 RL 训练的团队来说,这是一份能直接参考的开源工程范本。

训练强化学习训练框架MoE

Boost Inference Performance up to 15x on NVIDIA Blackwell Using DFlash Speculative Decoding

NVIDIA 开发者 · 06-23 23:00 UTC+8

NVIDIA 介绍了在 Blackwell 平台上用「DFlash」投机解码把推理性能最高提升 15 倍的做法,瞄准的是 AI 从单轮交互走向多智能体协同工作流后对低延迟推理日益增长的需求。对在 Blackwell 上做 LLM serving、追求降低延迟的工程团队,这是一条值得评估的推理加速路线。

投机解码推理优化GPU

刚刚,豆包2.1发布!Agent自己跑18个小时搞定芯片设计代码

量子位 · 06-23 21:37 UTC+8

字节跳动发布「豆包 2.1」,主打编程能力,官方称已可比肩 Opus 4.7,并展示了其 Agent 自主运行 18 小时独立完成芯片设计代码的案例。这一长程自主执行的演示把模型能力的关注点从单次问答推向了能扛住超长任务链的智能体表现,是国产大模型在编程与 Agent 方向上的一次高调发力。

厂商动态大模型发布编程能力智能体

OpenAI says new GPT-5.5-Cyber outperforms Anthropic's Mythos on cybersecurity benchmark

The Decoder · 06-23 18:43 UTC+8

OpenAI 扩展其「Daybreak」网络安全计划,推出更新版「Codex Security」插件、完整的「GPT-5.5-Cyber」模型,以及一个汇集 25 家以上安全公司和多家政府机构的合作网络,并称在网络安全基准上胜过 Anthropic 的「Mythos」。值得注意的是其重心从「找漏洞」转向「自动修复漏洞」,对关注 AI 在安全攻防中角色演进的从业者是个明确的方向信号。

基座网络安全厂商动态OpenAI

ByteDance's Seedance 2.5 breaks the 30-second barrier for AI video generation

The Decoder · 06-23 20:15 UTC+8

字节跳动在火山引擎 FORCE 大会上一口气发布五款 AI 模型,重头戏是视频模型「Seedance 2.5」,据称突破了 30 秒时长的门槛,计划于 7 月初上线。对做 AI 视频生成的人来说,单段时长从几秒级拉长到 30 秒以上,意味着可用场景和叙事完整度的实质性扩展。

基座视频生成多模态厂商动态

ParallelKernelBench: Frontier LLMs can't write fast multi-GPU kernels (yet)

Together AI · 06-23 08:00 UTC+8

Together AI 推出「ParallelKernelBench」,用 87 个真实工作负载考察大模型能否写出高性能的多 GPU CUDA 内核,结果是最强的模型也只解出不到三分之一。不过个别生成的内核竟跑赢了所有公开实现,说明模型在这件硬核系统编程任务上整体还很弱、但偶有惊艳。对关心 AI 写底层算子、自动优化 kernel 的人,这个基准既泼了冷水也指出了上限。

Infra代码生成CUDA推理优化

xAI Launches /goal in Grok Build, Adding Long-Running Autonomous Execution With Built-In Verification for Multi-Step Coding Tasks

MarkTechPost · 06-23 04:34 UTC+8

xAI 在 Grok Build 中推出「/goal」模式,支持长程自主执行:你只交付一个目标,智能体自己规划方案、按进度清单逐项执行,并对结果做内置验证直到目标达成。它把「带自我验证的长链路编程任务执行」做成产品化能力,是各家在长程自主编程智能体上竞逐的又一落子。

智能体编程能力厂商动态

xAI发布Grok Skills并更新用于工具调用的Responses API

InfoQ 中文 · 06-23 00:49 UTC+8

xAI 发布「Grok Skills」并更新了用于工具调用的「Responses API」,把技能机制和工具调用接口一并推进。对在 Grok 上做智能体和工具集成的开发者来说,这意味着可以用更规整的技能抽象和调用接口来组织模型的外部能力。

工具调用厂商动态智能体

GLM 5.2 + Model Hub + 3x longer contexts

Unsloth · 06-23 00:07 UTC+8

Unsloth Studio 新增对「GLM-5.2」的支持,全部推理档位可用,并靠配合 MTP 的自动适配算法把可用上下文长度拉长到原来的三倍以便更长对话,同时上线了模型发现中心、可分叉与可排队的对话、绕过权限模式、并行模块以及 HTTPS Cloudflare 全球访问等一批功能。对用 Unsloth 做本地微调与部署的人,这是一次覆盖模型支持、长上下文和易用性的集中更新。

基座微调长上下文开源工具

谷歌LiteRT-LM通过Gemma 4多Token预测将本地推理速度提升了最高2.2倍

InfoQ 中文 · 06-23 19:11 UTC+8

谷歌「LiteRT-LM」借助「Gemma 4」的多 Token 预测,把本地端侧推理速度最高提升了 2.2 倍。对做端侧、移动端大模型部署的开发者而言,多 Token 预测在轻量运行时上的落地意味着同样的硬件能换来更流畅的本地推理体验。

端侧推理推理优化谷歌

Sakana AI's Fugu orchestrates multiple LLMs to match Anthropic's Fable and Mythos benchmarks

The Decoder · 06-23 18:03 UTC+8

日本初创 Sakana AI 推出「Fugu」,能动态编排协调多个大模型协同工作,以此对标 Anthropic 的「Fable 5」和「Mythos」等头部模型的基准表现,同时刻意降低对任何单一模型供应商的依赖。它代表了一条「不靠单一超强模型、而靠多模型动态组合」的技术路线,对在意供应商绑定风险的团队是个有意思的思路。

Agent多模型编排厂商动态推理

NVIDIA Megatron Core 0.18.0

Megatron-LM · 06-23 08:16 UTC+8

NVIDIA 发布「Megatron Core 0.18.0」,本次更新以 CI 修复、文档规范化和若干推理相关修复为主,包括修复 checkpoint inspector、融合 RMSNorm 残差下的细粒度可调用项等工程改进。对依赖 Megatron 做大规模训练的团队,这是一次以稳定性和工程细节打磨为主的版本迭代。

训练训练框架分布式训练开源工具

SpaceX Colossus deal 🚀, GPT-5.5 Cyber launch 🛡️, Codex as workspace 🤖

TLDR AI · 06-23 08:00 UTC+8

TLDR AI 当日要闻速览,三条最值得关注:SpaceX 据称达成与「Colossus」相关的算力/基建合作,延续马斯克阵营在 AI 算力上的大手笔;OpenAI 推出主打网络安全攻防的「GPT-5.5 Cyber」,把前沿模型能力专门收敛到安全领域;以及 Codex 正向「工作空间」形态演进,从单纯代码生成走向承载完整开发流程的智能体平台。对从业者而言,三件事分别指向算力、垂直安全模型和编程智能体产品化三条主线。

厂商动态行业动态OpenAI编程智能体

Prompt Injection as Role Confusion

Simon Willison · 06-23 07:59 UTC+8

Simon Willison 推荐了一篇把提示注入重新理解为「角色混淆」的研究及其配套通俗解读:模型很难可靠区分包裹在 system 等角色标签里的特权文本与外部输入,攻击者正是利用这种边界模糊来越权。文章顺带称赞作者给硬核论文配了篇可读博客版,认为这种「论文 + 易读版」的写法能显著放大研究影响力。对做安全和对齐的人来说,它点明了角色边界本身就是注入攻击的根因。

Agent提示注入AI 安全对齐

Red-Teaming after Mythos — Zico Kolter & Matt Fredrikson, Gray Swan

Latent Space · 06-23 05:06 UTC+8

Latent Space 请来 OpenAI 董事会成员、CMU 教授 Zico Kolter 与 Gray Swan CEO Matt Fredrikson,讨论为什么「AI 安全」不等于「带 AI 的网络安全」。两位红队与对抗攻击领域的资深研究者借此区分模型层面的越狱、对齐与红队问题,对关注前沿模型安全治理的从业者有参考价值。

后训练AI 安全红队访谈

Sakana AI Launches Sakana Fugu: An Orchestration Model That Routes Tasks Across a Swappable Pool of Frontier LLMs

MarkTechPost · 06-23 02:42 UTC+8

Sakana AI 发布编排模型「Fugu」及「Fugu Ultra」,核心思路是把任务在一个可热插拔的前沿大模型池中做路由分发,让每个子任务交给最合适的底层模型来做,而非依赖单一模型。官方称其在编程、推理和智能体类基准上领先多数对手。这代表「模型路由 / 编排层」正成为一条独立产品线,对做多模型调度和成本性能权衡的团队有直接参考。

厂商动态模型路由Sakana智能体

Google makes Interactions API the default interface for Gemini models and agents

The Decoder · 06-23 02:11 UTC+8

Google DeepMind 把全新的「Interactions API」设为 Gemini 模型与智能体的默认接口,取代旧的 generateContent,用带类型的「分步」schema 替换原先基于角色的结构,且后续新智能体能力只通过该接口发布。对接 Gemini 的开发者需要尽快迁移,因为这是面向智能体场景重构调用范式、而非简单换名的接口升级。

厂商动态GoogleGeminiAPI

Anthropic and Micron want to co-design AI memory architecture

The Decoder · 06-23 01:18 UTC+8

美光参与 Anthropic 的 Series H 融资,并拿下多年期供货协议,为 Claude 基础设施提供内存,双方还要联合设计面向 AI 的内存架构;Anthropic 联创 Tom Brown 称内存对训练和运行 Claude 至关重要。美光股价一年内涨超十倍,也有批评者认为这类「你投我、我买你」的循环交易在吹大泡沫。对 Infra 从业者,这凸显内存正成为大模型训练推理的关键瓶颈与战略资源。

InfraAnthropicAI Infra存储

Shared infrastructure, isolated tenants: Pool model multi-tenancy with Amazon Bedrock AgentCore

AWS 机器学习 · 06-23 23:43 UTC+8

AWS 这篇实战文讲如何用 Amazon Bedrock AgentCore 搭建生产级多租户智能体系统,采用「共享基础设施、隔离租户」的池化模式,并以服务多家诊所和医院的医疗 AI 智能体为例演示具体模式。对要把 Agent 应用做成 SaaS、又必须保证租户间数据隔离的团队有落地参考。

AgentAWS多租户智能体

Build an AI Scientist for Life Science Discovery with NVIDIA BioNeMo Agent Toolkit

NVIDIA 开发者 · 06-23 21:30 UTC+8

NVIDIA 介绍用 BioNeMo Agent Toolkit 构建面向生命科学发现的「AI 科学家」智能体,这类 Agent 能读论文、写代码、生成假设、调用 API、检查文件,把科学计算包装成一个会自主操作的新交互界面。对做科研自动化和领域 Agent 的人,这给出了一套在生物医药场景串联工具链的工程范式。

AgentNVIDIAAI 科学家智能体

Build real agentic apps using CUGA: two dozen working examples on a lightweight harness

HuggingFace 博客 · 06-23 20:51 UTC+8

HuggingFace 放出 CUGA,一个轻量级智能体运行框架,并附带约两打可直接跑通的真实示例应用,主打「拿来就能搭真正能干活的 agentic 应用」。对想快速上手 Agent 工程、又不想被重型框架绑架的开发者,这是个低门槛、示例丰富的起点。

AgentHuggingFace智能体框架开源

Cursor announces its own AI model, a new Git platform, and a mobile app

The Decoder · 06-23 20:12 UTC+8

Cursor 公布了首个完全自研训练的 AI 模型细节,并同时推出自有 Git 平台和移动 App 两款新产品。这意味着 Cursor 正从套壳第三方模型的编辑器,转向自研模型 + 代码托管 + 移动端的全栈编程平台,对编程智能体赛道的竞争格局有直接影响。

厂商动态Cursor编程智能体自研模型

b9768

llama.cpp · 06-23 18:50 UTC+8

llama.cpp 发布 b9768 版,新增对 IBM「Granite Speech Plus」语音模型的转换支持,并扩展 granite_speech 以支持多层特征拼接。提交记录还显示这些改动大量借助 OpenCode 加 Qwen3.6-35b 由 AI 协助完成。对本地部署语音多模态模型的用户,这扩大了 llama.cpp 的模型覆盖面。

Infrallama.cpp语音模型本地推理

Dropbox发布Nova:用于大规模运行AI编程智能体的内部平台

InfoQ 中文 · 06-23 17:40 UTC+8

Dropbox 发布内部平台「Nova」,用于大规模运行 AI 编程智能体。这反映出大厂正把编程 Agent 从单点工具升级为统一的内部基础设施平台,以便在工程组织内规模化调度和管理众多自动化编码任务。

AgentDropbox编程智能体平台

NVIDIA Powers Over 400 of the World’s 500 Fastest Supercomputers

NVIDIA 博客 · 06-23 17:00 UTC+8

据 ISC 高性能计算大会最新 TOP500 榜单,全球最快的 500 台超算中有逾 400 台、占比 81% 采用 NVIDIA 技术。这一数字再度印证 NVIDIA 在高性能计算与 AI 训练底层算力上的统治地位,是 Infra 层供应格局的重要风向标。

InfraNVIDIA超算TOP500

b9767

llama.cpp · 06-23 17:00 UTC+8

llama.cpp b9767 版优化了 WebGPU 后端:针对小批量改走 mat-vec 路径提升 MTP 推理性能,并在 mul-mat-vec 的列循环中补加 barrier。对在浏览器或 WebGPU 环境跑本地模型、关注小 batch 解码效率的用户是一次实打实的提速。

llama.cppWebGPU推理优化

马斯克又盯上AI基建:特斯拉要卖“算力积木”了

量子位 · 06-23 14:02 UTC+8

据曝光的新商标,特斯拉/马斯克再次盯上 AI 基建,计划推出可像「积木」一样拼装的算力产品。这延续了马斯克阵营在自有算力供给上的扩张动作,若落地将为市场再添一家自研算力硬件玩家。

Infra特斯拉AI 基建算力

NVIDIA Brings Trusted, 24/7 AI Agents to Telecom Operations

NVIDIA 博客 · 06-23 14:00 UTC+8

NVIDIA 推出面向电信运营的全天候可信 AI 智能体,主张把电信运维从「按步骤自动化」推进到真正的「自主化」——不再只是加速预设流程,而是让 Agent 自主关联洞察并决定下一步。对做行业垂直 Agent 落地的人,电信网络运维是个数据密集、规则复杂的典型试验场。

AgentNVIDIA电信智能体

How Telcos Build Autonomous Networks with Agentic AI

NVIDIA 开发者 · 06-23 14:00 UTC+8

NVIDIA 开发者博客详解电信运营商如何用 agentic AI 构建自主网络,覆盖网络运维、客户服务和后台流程,并指出多数运营商仍处于走向自主化的早期阶段。与其面向电信的可信 Agent 公告相呼应,提供了更偏工程实现的视角。

AgentNVIDIA电信自主网络

Metric-Dependent Annotation Saturation for Learning from Label Distributions

Apple ML · 06-23 08:00 UTC+8

Apple 这项研究指出,当标注者对标签产生分歧时,分歧本身就是信号,而捕捉它所需的标注人数取决于评测指标。作者在提供每条 100 份独立标注的「ChaosNLI」上微调 NLI 模型,发现「指标相关的饱和」现象:要让模型识别出哪些样本会引发分歧(熵相关)约需 20 到 50 名标注者才收敛,而其他指标所需人数不同。这给从标签分布学习、设计标注预算的人一个量化依据:该标几个人,得看你优化什么指标。

训练数据标注评测NLI

Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels

Apple ML · 06-23 08:00 UTC+8

Apple 这项研究戳破了「LLM 评审团」的可靠性幻觉:人们以为多模型投票更稳健,但作者构建框架量化其真实信息量后发现,在三类自然语言推理数据集上,一个由 7 个模型家族、9 个前沿 LLM 组成的评审团,因为彼此犯错高度相关,实际只相当于约 2 张独立有效票。对依赖 LLM-as-a-judge 做评测的人是个警示:堆模型数量并不等于堆出独立性,相关误差会严重稀释多评委的价值。

后训练LLM 评审评测对齐

Porting the Moebius 0.2B image inpainting model to run in the browser with Claude Code

Simon Willison · 06-23 07:43 UTC+8

Simon Willison 用 Claude Code 把 0.2B 的轻量图像修复模型「Moebius」从原本依赖 PyTorch 和 CUDA 的形态移植到浏览器里跑,借助 WebGPU 实现了可在线试用的 demo。这是个很有代表性的小模型「去重型依赖、搬进浏览器端推理」实践,展示了用编程智能体辅助完成移植工程的效率。

推理优化WebGPU图像修复端侧推理

b9763

llama.cpp · 06-23 05:33 UTC+8

llama.cpp b9763 版为其 server 的工具调用响应补上了 id 字段,使返回结果更贴合 OpenAI 兼容的 tool call API 规范。对依赖 llama.cpp server 做本地工具调用 / 函数调用的开发者,这是个提升接口兼容性的小修复。

Agentllama.cpp工具调用服务端

Building pay-per-intelligence for AI agents: How Ampersend uses Amazon Bedrock AgentCore Payments

AWS 机器学习 · 06-23 01:53 UTC+8

AWS 这篇文章介绍 Ampersend 如何在 Amazon Bedrock AgentCore Payments 之上构建「按智能付费」的路由层:AI 智能体自主把任务路由到最有效的模型、按请求付费,并在预算约束内运行,文中还拆解了端到端的「两跳支付」模式。对探索 Agent 自主消费、模型计费与成本治理的团队是个具体范式。

AgentAWS智能体支付模型路由

Embed the world: Multimodal AI for searchable aerial imagery at scale

AWS 机器学习 · 06-23 00:32 UTC+8

AWS 分享了一套面向大规模航拍影像的多模态语义检索系统:基于 Amazon Bedrock 与 OpenSearch Serverless 构建,并用 OpenStreetMap 真值搭了评测方法,通过四组实验对比了嵌入模型、融合策略、图像描述与检索方式,结论之一是 Nova 多模态嵌入表现最佳。对做地理空间检索或多模态向量搜索的人,给出了哪些设计选择真正影响效果的实证指南。

基座AWS多模态检索向量搜索

CCCL Runtime: A Modern C++ Runtime for CUDA

NVIDIA 开发者 · 06-23 00:00 UTC+8

NVIDIA 推出「CCCL Runtime」,为 CUDA 提供一套现代 C++ 运行时,是其 CUDA 核心计算库的一部分,旨在给 C++ 和 Python 开发者更顺手高效的 CUDA 抽象。对做 GPU 底层算子和高性能计算的工程师,这降低了直接用现代 C++ 写 CUDA 的复杂度。

InfraNVIDIACUDAC++

b9773

llama.cpp · 06-23 23:45 UTC+8

llama.cpp b9773 版为 Vulkan 后端新增对 GET_ROWS_BACK 算子的支持,进一步补全在 Vulkan 上的算子覆盖。对依赖 Vulkan 做跨平台 GPU 推理的用户,这是持续完善后端能力的一步。

Infrallama.cppVulkan算子

b9771

llama.cpp · 06-23 21:29 UTC+8

llama.cpp b9771 版把 Vulkan 矩阵乘 mul_mm 的 ALIGNED 改成 spec constant,借此削减着色器变体的爆炸式增长并减小二进制体积。对在意构建产物大小和着色器编译开销的 Vulkan 用户是一次实用的工程瘦身。

Infrallama.cppVulkan推理优化

b9770

llama.cpp · 06-23 20:27 UTC+8

llama.cpp b9770 版修复了 server 端远程预设(remote preset)的处理逻辑并补加了对应测试。属于面向 server 使用者的稳定性修复,让远程预设配置能正确工作。

推理优化llama.cpp服务端修复

b9769

llama.cpp · 06-23 19:45 UTC+8

llama.cpp b9769 版修复了一处链接问题:开启 GGML_VULKAN_CHECK_RESULTS 或 RUN_TESTS 调试路径时,会调用定义在 ggml-cpu 里的 CPU 参考计算符号,但 ggml-vulkan 未链接该库导致链接失败,此次补上链接以修复该回归。对在这些调试开关下构建 Vulkan 后端的开发者解决了构建报错。

推理优化llama.cppVulkan构建修复

论文 20 篇

「PlanBench-XL」面向大规模工具生态评测大模型工具调用智能体的长程规划,呼应当下Agent能力边界探索,值得一读。

PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems

HF 精选 · 06-23 08:00 UTC+8

针对智能体在工具数量庞大、可见性受限、还会动态出故障的真实环境里规划易崩溃的痛点,「PlanBench-XL」搭建了一个大规模工具生态下的长程规划评测,专门考察智能体在干扰下重新规划、适应变化的能力。它不只看一次性能否给出可行计划,而是把工具不可见、中途失效等扰动注入进来,逼出模型在长链路任务里的脆弱性。结果显示当前模型在工具一多、环境一动起来就明显掉链子,为工具型智能体的鲁棒性研究提供了更贴近落地的标尺。

Agent智能体评测工具调用长程规划

OpenRath: Session-Centered Runtime State for Agent Systems

HF 精选 · 06-23 08:00 UTC+8

多智能体系统的运行状态往往散落难追、出错难复现,「OpenRath」借鉴 PyTorch 的编程范式,把「会话(Session)」抽象成系统的中心运行时对象,让 fork、merge、replay 这些操作变成显式可控的一等公民,并完整记录执行状态。这样一来开发者既能像写深度学习代码一样组织多智能体逻辑,又能随时分叉探索、合并分支或回放复盘,对调试和可观测性是实打实的改善。

Agent多智能体智能体框架运行时

Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention

HF 精选 · 06-23 08:00 UTC+8

「分组查询专家(GQE)」把 MoE 思路引入到 GQA 自注意力里,根据 token 内容选择性地激活查询头,相当于在注意力层面做稀疏化。它在省算力的同时保留了分组查询注意力对 KV 缓存友好的特性,等于让模型按需调度注意力容量而不牺牲推理时的显存与吞吐优势,是把专家混合从 FFN 延伸到注意力机制的一次有意思的尝试。

基座模型架构MoE注意力机制

EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory

HF 精选 · 06-23 08:00 UTC+8

长上下文检索和智能体记忆里,静态嵌入难以随语境演化,「EvoEmbedding」提出一种可演化的动态嵌入模型,靠一份持续更新的潜在记忆来生成自适应表示,让同一段内容的向量随上下文不断微调。这种「会进化」的表示在长上下文场景下提升了检索效果,思路上把检索向量从一次性编码变成了带状态的动态过程,对做智能体记忆和长文档检索的人有参考价值。

Agent向量检索智能体记忆长上下文

HydraHead: From Head-Level Functional Heterogeneity to Specialized Attention Hybridization

HF 精选 · 06-23 08:00 UTC+8

「HydraHead」从注意力头功能异质性这一可解释性观察出发,在头粒度上把全注意力和线性注意力混搭起来,用可解释性驱动的方式挑选哪些头该用哪种注意力,再通过尺度归一化做融合。这种细到单个头的混合既拿到了线性注意力的长序列效率,又靠少量全注意力头守住表达力,最终在长上下文任务上表现更好且训练开销更低,是混合注意力架构里一个落点很细的方案。

基座注意力机制模型架构长上下文

Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation

通义千问HF 精选 · 06-23 08:00 UTC+8

针对自蒸馏只学正确答案、丢掉了错误中可学信号的问题,「TAPO」让模型从自己的错误里学习:构造出保留错误推理、再附上自然语言诊断与纠正的「微反思轨迹」,把「错在哪、怎么改」显式写进训练数据。这样模型练到的不只是正确路径,还有纠错能力,在推理任务上超过了传统自蒸馏方法,对想提升推理鲁棒性的训练实践是个可借鉴的数据构造思路。

后训练推理训练自蒸馏强化学习

Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark

HF 精选 · 06-23 08:00 UTC+8

物理科学研究的「深度研究」智能体到底行不行?「PhySciBench」基准给出的答案是当前 LLM 智能体表现相当有限,于是作者顺势提出「DelveAgent」框架,靠模块化设计加上物理学接地的机制来提升准确率。它把通用智能体在硬核科研场景里的短板量化出来,也示范了用领域知识约束智能体行为的做法,对想把智能体推进到严肃科研领域的人是一份有针对性的参考。

Agent科研智能体智能体评测多智能体

Tapered Language Models

HF 精选 · 06-23 08:00 UTC+8

「锥形语言模型(Tapered LM)」挑战了 Transformer 各层均匀分配参数的惯例,提出把更多参数堆在靠前的层、靠后的层逐渐变瘦,在总参数量和算力都不增加的前提下提升性能。这等于在不加预算的情况下重新分配模型容量,背后暗示不同深度的层对参数的「胃口」并不一样,是一个改动小、潜在收益直接的架构调参思路。

基座模型架构预训练参数效率

FastMix: Fast Data Mixture Optimization via Gradient Descent

HF 精选 · 06-23 08:00 UTC+8

训练数据各来源该按什么比例混合,长期靠人工试错,「FASTMIX」把它变成可自动求解的问题:将混合比例选择建模为双层优化,用梯度下降同时迭代更新混合系数和模型参数,让数据配比在训练过程中自己找到最优。相比反复跑实验调配比,这种边训边优化的方式大幅省去了搜索成本,对做预训练数据工程的团队是个能直接降本的工具。

训练数据工程预训练数据配比

DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams

HF 精选 · 06-23 08:00 UTC+8

面对原始多模态数据流高熵、杂乱难用的问题,「智能体式数据裁剪」范式用可学习的数据处理把这些数据结构化整理,配套的「DataClaw_0-9B」模型经过 SFT 加 GRPO 训练,在新提出的基准上拿到了稳健的对齐效果。它把数据清洗整理从固定流水线升级成会学习、能适应的智能体行为,对苦于多模态数据预处理的从业者提供了一条新路径。

后训练多模态数据工程数据处理

EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions

HF 精选 · 06-23 08:00 UTC+8

「EnterpriseClawBench」从真实职场会话里提炼出 852 个可复现任务,给企业级智能体搭了一个贴近实际工作流的评测基准,并强调要用一整套综合指标去看智能体表现,而不是只盯单一分数。它的价值在于评测数据来自真实工作场景而非人造任务,更能暴露企业落地时的真实短板,对想把智能体部署进办公流程的团队有直接参考意义。

Agent智能体评测企业智能体基准测试

CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents

上海 AI LabHF 精选 · 06-23 08:00 UTC+8

为了给终端(命令行)智能体造训练数据,「CLI-Universe」设计了一套可验证的任务合成引擎,靠多维能力分类体系加上证据引导的研究流程来批量生成高质量终端任务,并蒸馏出一份数据集。用这份数据训练 LLM 能带来明显的性能提升,思路上把「怎么造出又难又对的可验证任务」系统化了,对做命令行/工具型智能体训练的人是一份现成的数据生产方法论。

Agent终端智能体数据合成智能体训练

Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding

通义千问HF 精选 · 06-23 08:00 UTC+8

自回归生成历来只用最后一层做 token 预测,这篇工作指出更深不一定更好,提出按熵引导搜索动态选择更可靠的中间层来解码,以此缓解对齐税。方法几乎不增加额外计算,却能提升推理表现,等于在不改模型、不加训练的前提下,靠「选对出口层」就把性能捡回来一些,是一个轻量又实用的解码侧技巧。

解码策略推理优化对齐

SkillHarness: Harnessing Safe Skills for Computer-Use Agents

HF 精选 · 06-23 08:00 UTC+8

电脑操作类智能体在动态环境里学技能、用技能时容易出格甚至闯祸,「SkillHarness」给它套上安全缰绳:把安全约束嵌进技能学习与执行,再配上自适应的技能选择机制,让智能体既能学会新技能又不越界。它瞄准的是 computer-use 智能体落地时绕不开的安全可控问题,对想让屏幕操作智能体真正敢放到生产环境里的人是个值得关注的框架。

Agent电脑操作智能体智能体安全技能学习

SP-Mind: An Autonomous Reasoning Agent for Spatial Proteomics Analysis

ICML 2026CCF-A推荐arXiv · 06-23 15:24 UTC+8

空间蛋白质组学能在单细胞分辨率上刻画组织里的蛋白表达,对理解肿瘤微环境、指导精准医疗很关键,但分析流程零碎、严重依赖专家手工串联各种工具,难以规模化和复现。「SP-Mind」是首个面向这一领域的自主推理智能体,试图把整条空间蛋白质组学分析流水线统一编排起来,让原本割裂的工具链由智能体自动驱动,为生物医学科研自动化提供了一个领域专用的智能体范例。

Agent科研智能体生物医学AI自主推理
Yucheng Yuan, Yuanfeng Ji, Zhongxiao Li, Ruijiang Li

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

ACL 2026CCF-A推荐arXiv · 06-23 03:27 UTC+8

知识型视觉问答需要把图像问题接地到画面之外的外部知识,现有多模态 RAG 方法常把实体辨别和证据排序硬塞进同一步,导致细粒度实体和证据层的接地都不到位。这篇「先接地再排序」的工作把流程拆成两步、且免训练:先做实体识别精准定位,再做章节级证据排序,解耦后两件事各自做得更准。这种训练无关、分步接地的设计对做多模态检索增强的人是个简洁有效的改法。

多模态视觉问答检索增强
Qian Ma, Qiong Wu, Zhengyi Zhou, Yao Ma

Natural Identifiers for Privacy and Data Audits in Large Language Models

ICLR 2026arXiv · 06-23 18:45 UTC+8

审计大模型隐私一直很难:差分隐私审计通常要在训练时插入特制的「金丝雀」数据,对已经训好的模型几乎没法用,除非重训;数据集推断又离不开一份私有的非成员留出集。这篇工作提出用「自然标识符」来做隐私与数据审计,绕开人工注入金丝雀和外部留出集的硬性前提,让针对现成模型的隐私核查更具可操作性,对关注模型合规与数据来源审计的人很有现实意义。

模型隐私差分隐私数据审计
Lorenzo Rossi, Bartłomiej Marek, Franziska Boenisch, Adam Dziedzic

MGI: Member vs Generated Inference

ECCV 2026CCF-B推荐arXiv · 06-23 03:15 UTC+8

当生成模型产出的样本和真人内容已难以区分,又会记忆并复现训练数据时,怎么判断一个样本到底是训练集里的真实成员还是模型自己生成的?这篇工作把它形式化为「成员 vs 生成推断(MGI)」这一新问题,专门处理记忆与复现造成的混淆。它给数据溯源、记忆评估和版权争议提供了一个新的分析框架,是把成员推断攻击往生成时代又推进了一步的概念性贡献。

成员推断模型记忆数据溯源
Bihe Zhao, Michel Meintz, Juangui Xu, Franziska Boenisch, Adam Dziedzic

Data Augmentation: A Fourier Analysis Perspective

COLT 2026CCF-B推荐arXiv · 06-23 18:54 UTC+8

数据增强靠对输入施加群变换来利用已知不变性,简单且与模型无关,但当对称群很大时,做完整的群规模增强计算开销会迅速爆炸。这篇工作从傅里叶分析的视角重新审视数据增强,把增强对学习的作用放到频域里去理解,为「群一大就算不动」的代价提供了理论刻画,也为如何高效近似全群增强指明了方向,对关心增强背后原理而非只调参的研究者很有价值。

数据增强傅里叶分析机器学习理论
Behrooz Tahmasebi, Melanie Weber, Stefanie Jegelka

Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints

ECCV 2026CCF-B推荐arXiv · 06-23 17:43 UTC+8

自动驾驶的鸟瞰图感知目前多被困在闭集场景里,遇到训练集外的类别就抓瞎。这篇工作提出开放词表鸟瞰图分割(OVBS),引入视觉语言模型来识别训练集之外的新类别,同时用 3D 感知的几何约束守住 BEV 感知的精度和实时性。它把开放词表能力带进了对几何精度和速度都很苛刻的 BEV 感知,让自动驾驶感知在面对不可预测的真实路况时更有韧性,是把 VLM 能力落到驾驶感知的一个务实尝试。

自动驾驶开放词表多模态
Hojun Choi, Seulbin Hwang, Dae Jung Kim, Kisung Kim, Hyunjung Shim, Jinhan Lee