🗂 历史归档
每日 AI 速览

2026-07-27

生成于 2026-07-28 04:07
⚠️ 本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性

今日导语

今日聚焦四大主线。大模型基座与多模态方面,NVIDIA Nemotron 3 Ultra、Kimi K3、蚂蚁百灵 Ling-3.0-Flash 等新模型密集发布,Black Forest Labs 推出可统一预测图像、视频、音频与机器人动作的 FLUX 3 多模态流模型,论文《原生多模态预训练从零开始》也探索了端到端训练范式。AI Infra 上,vLLM 0.26.0 实现 Kimi K3 的 Day-0 高效支持,Molt 框架专为智能体强化学习打造可扩展训练,AMD 首款 2nm GPU 获 OpenAI、Meta 等巨头站台。Agent 生态全方位升级,亚马逊云科技开源 Loom 平台用于企业级代理管理,Agentic Context Management 将记忆与成本视为生命周期与架构问题,METR 发布新指标精确衡量何时代理比人类更昂贵。训练方法上,Skill Self-Play 通过技能协同进化推动 LLM 能力前沿。

🗞 行业动态 33 条

v0.26.0

vLLM · 07-27 14:52 UTC+8

vLLM v0.26.0 发布,新增对 Inkling 模型族的全栈支持,包括基础建模、投机解码(MTP=1)、LoRA 及 NVFP4 量化,同时针对 DeepSeek-V4 推出定制路由内核与融合算子,在多个 GPU 厂商硬件上显著改善了端到端延迟。

vLLM版本发布模型支持推理优化

Kimi K3 Is Here: Efficient Day-0 Support on vLLM

vLLM 博客 · 07-27 08:00 UTC+8

vLLM 实现对 Kimi K3 的 Day-0 高效推理支持,整合混合 KDA 前缀缓存、DSpark 投机解码及生产级分解式架构,同时针对 NVIDIA 和 AMD GPU 优化内核,保障千亿参数模型的服务吞吐与延迟。

推理优化Kimi K3vLLM推理部署投机解码

蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-Flash

量子位 · 07-27 09:57 UTC+8

蚂蚁百灵发布新一代原生混合推理模型 Ling-3.0-Flash,预计其结合了快速推理与深度思考的双重能力,为移动端与低延迟场景下的智能体应用提供更高效的基座。

基座蚂蚁百灵混合推理模型大模型发布Ling-3.0-Flash

b10152

llama.cpp · 07-27 22:15 UTC+8

llama.cpp 更新,改进多 Token 预测(MTP)时的 GPU 层分配逻辑,确保前置层始终驻留在 GPU,减少 CPU-GPU 数据搬运,进一步提升大模型预测效率。

llama.cpp推理优化MTPGPU 内存管理

b10150

llama.cpp · 07-27 20:47 UTC+8

llama.cpp 修复算子卸载至权重后端的逻辑错误,并纠正 DeepSeek V4 图编译的若干问题,提升模型在多后端环境下的推理稳定性与兼容性。

llama.cpp算子卸载DeepSeek V4推理优化

b10146

llama.cpp · 07-27 18:16 UTC+8

llama.cpp 在 PowerPC CPU 上开启 BF16 分块矩阵乘优化,使得该指令集架构也能享受低精度计算带来的推理加速,扩大了 llama.cpp 的硬件适配范围。

推理优化llama.cppBF16PowerPC性能优化

v1.9.1

HF TRL · 07-27 00:49 UTC+8

HF TRL v1.9.1 修复了 vLLM 服务器模式通讯初始化、DeepSpeed CPU 卸载优化器崩溃及 Liger 内核在早于 Ampere 架构 GPU 上的兼容性问题,并新增 Gemma4 响应模板,显著提升强化学习训练器的稳定性与模型覆盖度。

后训练HF TRL版本更新RLHF 训练Bug 修复

b10153

llama.cpp · 07-27 23:58 UTC+8

llama.cpp 新增对 Nanbeige4.2 模型的原生支持,进一步丰富其可推理的开源模型库,方便开发者在该轻量级推理框架上快速部署。

Infrallama.cpp模型支持Nanbeige4.2

trunk/6584e189842429d351835706e1f6cc22d17ee7fa

PyTorch · 07-27 22:51 UTC+8

PyTorch 主干回退了感应器(inductor)中关于布局消费者提前重索引的提交,以避免在特定场景下引入的融合错误或性能退化。

InfraPyTorch编译优化代码回退

b10148

llama.cpp · 07-27 19:16 UTC+8

llama.cpp 修复在同时指定显式草稿模型和 repo 侧车解析时的优先级问题,确保手动指定的 --model-draft 参数不会被动地被侧车解析覆盖,提高了 CLI 配置的确定性。

推理优化llama.cpp模型配置Bug 修复

b10145

llama.cpp · 07-27 17:30 UTC+8

该提交为 llama.cpp 新增 `-lm mlock` 参数,允许在内存锁定但不使用内存映射的情况下加载模型,便于精细控制物理内存占用,对追求低延迟与稳定推理的部署场景有参考价值。

llama.cpp内存管理推理优化

Six Agent Harness Capabilities for Higher Model Performance

NVIDIA 开发者 · 07-27 17:00 UTC+8

NVIDIA 开发者博客总结了提升 AI Agent 性能的六种支架能力,涵盖上下文渲染、工具执行编排等关键环节,为构建更高效的智能体系统提供了实践指引。

AgentAgent 框架性能优化NVIDIA

trunk/33812ece06e2b0d597f73fbe41de03a83f9109f9

PyTorch · 07-27 16:48 UTC+8

PyTorch 的 Triton 后端代码更新,改进了自定义算子在 HOP 突变分析中对数据读写的处理,有助于保证编译优化后的执行正确性。

InfraPyTorchTriton编译优化

b10144

llama.cpp · 07-27 14:15 UTC+8

llama.cpp 服务端修复了模型名包含斜杠时流式路由无法匹配会话的问题,将会话 ID 移至查询字符串,从而保证多模型路由下断点续传等功能的稳定性。

推理优化llama.cpp服务部署Bug 修复

v0.32.5-rc0

Ollama · 07-27 07:59 UTC+8

Ollama 0.32.5-rc0 预发布版主要更新了 MLX 后端,预计将提升 Mac 上模型的推理效率,Apple Silicon 用户可以关注后续正式版本。

推理优化OllamaMLXApple Silicon

b10151

llama.cpp · 07-27 21:26 UTC+8

llama.cpp 的 SYCL 后端构建过程改为并行调用 ocloc 编译器,能够显著减少 Intel GPU 用户的编译等待时间,改善开发体验。

Infrallama.cppSYCLIntel GPU构建优化

曝梁文锋不满内部会议泄露,DeepSeek或暂停融资;Karpathy入职Anthropic仅两月疑离职;日媒拆解宇树G1后认输:短期内赶不上中国|AI周报

InfoQ 中文 · 07-27 19:46 UTC+8

InfoQ 周报摘要:传 DeepSeek 创始人因内部会议泄露不满,可能暂停第二轮融资;前 OpenAI 成员 Karpathy 入职 Anthropic 仅两月疑已离开;日媒拆解宇树 G1 机器人后承认短期内难以追赶中国技术水平。

厂商动态DeepSeekAnthropic人形机器人AI 周报

DeepSeek被曝主动叫停了第二轮融资签约

量子位 · 07-27 12:29 UTC+8

量子位报道称 DeepSeek 已主动叫停第二轮融资签约,该轮融资原计划募资至少 100 亿元,可能与内部信息泄露事件引发的管理层疑虑有关。

厂商动态DeepSeek融资AI 创企

How AI is expanding what people do at work

OpenAI · 07-27 11:30 UTC+8

OpenAI 新研究揭示 ChatGPT 等 AI 工具正在拓宽人类的工作范畴,用户开始承担跨职能任务,重塑职业角色和工作边界。

厂商动态OpenAIAI 劳动力ChatGPT

GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks

Apple ML · 07-27 08:00 UTC+8

Apple 机器学习团队提出 GH-ESD 方法,采用假设驱动的方式在实例级视觉任务中发现模型系统性失败的语义切片,弥补了传统聚类方法无法处理空间与上下文关系缺陷,为检测与分割模型的诊断提供了更精准的工具。

训练Apple模型诊断目标检测错误分析

📄 论文 13 篇

今日论文看点:Skill Self-Play 让 LLM 通过技能共同进化自主突破能力上限,原生多模态预训练从零开始探索规模化训练,Agentic Context Management 重新定义智能体记忆与成本架构。

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

HF 精选 · 07-27 08:00 UTC+8

针对现有自进化方法难以兼顾任务多样性与验证可靠性的困境——环境约束的方法反馈精确但领域狭窄,开放生成则缺乏可靠奖励信号导致训练污染——论文提出「技能自博弈」(Skill Self-Play),让智能体在共同进化的技能空间中交互博弈,以可验证的中间技能作为双向锚点,既保证奖励可信度又不断扩展能力边界,为突破LLM极限提供了一条训练更稳定的新路径。

后训练自我进化技能自博弈强化学习验证可靠性
📖 阅读⬇ PDF

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

NVIDIAHF 精选 · 07-27 08:00 UTC+8

智能体强化学习研究中,算法、估计器、部署流程的频繁改动使研究者每次都要穿透训练器、分布式后端与 rollout 胶水代码。Molt 是一个纯 PyTorch 原生的训练框架,把上述复杂性封装得足够简洁,研究员甚至 AI 编程助手都能轻松阅读和修改,大幅降低了快速迭代的工程成本。

Infra智能体训练PyTorch 原生强化学习框架Molt
📖 阅读⬇ PDF

Scaling Native Multimodal Pre-Training From Scratch

HF 精选 · 07-27 08:00 UTC+8

纯文本预训练限制了LLM对物理世界的感知,而原生多模态预训练能从输入端开始深度融合图文等模态,但该范式的缩放规律尚不清晰。本文通过大规模实验首次系统研究了原生多模态模型随参数、数据与计算量变化的缩放行为,为后续大规模多模态基座训练提供了关键指导。

基座多模态预训练缩放规律多模态基座训练范式
📖 阅读⬇ PDF

DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

HF 精选 · 07-27 08:00 UTC+8

训练数据品质直接决定LLM能力,但此前缺乏统一基准来端到端评估LLM或智能体工作流的数据准备水平。DataPrep-Bench 将数据准备分解为「数据构建」与「数据质量评估」两大互补能力,并构建多维度测试集,为数据工程领域的 LLM 应用提供了可复现的衡量标尺。

训练数据工程基准测试数据质量训练数据准备
📖 阅读⬇ PDF

Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

HF 精选 · 07-27 08:00 UTC+8

LLM 作为智能体时需要在推理过程中动态决策:继续推理、委托更强模型、请求外部信息、调用工具或主动放弃,而现有解决方案多依赖提示路由或外部编排,缺乏统一接口。该论文提出「多头潜在控制」,以紧凑的潜在向量统一表达这些决策,使智能体在保持端到端可训的同时获得更细粒度的行为控制。

Agent智能体架构推理决策多头潜在控制LLM Agent
📖 阅读⬇ PDF

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

HF 精选 · 07-27 08:00 UTC+8

视觉语言模型处理过多视觉 token 导致推理延迟和显存开销过大。VisCo 另辟蹊径,不引入外部压缩模块,而是利用 LLM 本身的表示能力作为内在编码器对视觉 token 进行压缩,在保持高压缩比的同时显著降低性能退化,且避免了重新训练主干网络的成本。

推理优化视觉 token 压缩多模态推理VLM 加速VisCo
📖 阅读⬇ PDF

Interactive Training 2: Auditable Control Plane for Live Model Training

HF 精选 · 07-27 08:00 UTC+8

以往对正在进行的训练进行干预往往需要模型专属的代码,缺少通用控制手段。Interactive Training 2 构建了一个可审计的控制平面,训练应用通过声明式接口暴露可调参数与动作,经统一协议接收人类或自动化控制器的请求,并在安全检查点动态应用,结合定制化的 Aim 工作区实现训练过程的实时操控与记录。

Infra交互式训练控制平面实验管理训练流程
📖 阅读⬇ PDF

Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

HF 精选 · 07-27 08:00 UTC+8

生产环境中的 AI 智能体常因上下文无限膨胀而耗尽记忆、推高 token 成本,现有方案多将其视为单纯的存储检索问题。论文提出「智能体上下文管理」,将记忆和成本问题重新定义为生命周期与架构问题,从系统层面设计更可持续的上下文组织方式,有望从根本上缓解智能体遗忘与成本失控。

Agent智能体记忆上下文管理成本优化智能体架构
📖 阅读⬇ PDF

IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation

HF 精选 · 07-27 08:00 UTC+8

现有科研想法生成系统往往只独立优化「质量」或「多样性」,导致生成的想法趋同或质量参差不齐。IDEAgent 将想法生成本身建模为多目标搜索问题,利用质量-多样性联合搜索算法,让智能体在想法空间中主动探求新颖且科学严谨的方向,在自动科研 ideation 上展现出更均衡的创新潜力。

Agent科研想法生成质量多样性搜索智能体搜索科学发现
📖 阅读⬇ PDF

SceneActBench: Can Agents Act on the 3D Scenes They See?

腾讯混元HF 精选 · 07-27 08:00 UTC+8

现有 3D 基准大多仅评估文本描述或单一物体操作,无法检验 VLM 智能体对完整多物体三维场景的真正行动能力。SceneActBench 构建了一个统一的智能体-环境交互环,覆盖五种 3D 任务,首次系统测试智能体基于视觉在三维世界中执行多步操作的水平,为具身智能评估填补了空白。

Agent3D 智能体视觉语言模型基准测试具身交互
📖 阅读⬇ PDF

LAMAR: An Open Language-Aware Multilingual Alignment Reranker

HF 精选 · 07-27 08:00 UTC+8

多语言 RAG 场景下,现有重排序器在语义等同时并不优先选择与查询语言一致的文档,影响答案生成质量。LAMAR 通过语言感知的对齐训练,使重排序器能显式考虑文档语言,在保持语义相关性的前提下显著提升同语言文档的排位,增强多语言检索的最终可用性。

后训练多语言 RAG重排序语言感知对齐训练
📖 阅读⬇ PDF

Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering

HF 精选 · 07-27 08:00 UTC+8

自回归生成式渲染在长时间序列中,当相机重访已生成过的区域时会出现画面不一致。该论文在不重新训练的前提下提出「重访一致性循环闭合」方法,通过巧妙地利用历史生成帧的隐式约束来修正新帧,大幅提升了长镜头在相同视点下的时空连贯性。

推理优化生成式渲染自回归视频一致性校正无训练方法
📖 阅读⬇ PDF

Spectral Prior for Reducing Exposure Bias in Diffusion Models

HF 精选 · 07-27 08:00 UTC+8

扩散模型在迭代采样时会累积误差(暴露偏差),研究发现这一偏差在频域中呈现随模型和时间步变化的系统性失配。提出的 Spectral Alignment 是一种轻量级引导方法,直接在频域校准噪声预测,无需重训练即可有效减少误差累积,提升生成样本的真实度与稳定性。

训练扩散模型暴露偏差频谱对齐采样优化
📖 阅读⬇ PDF