🗂 历史归档
每日 AI 速览

2026-07-28

生成于 2026-07-29 04:08
⚠️ 本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性

今日导语

今日聚焦月之暗面重磅开源旗舰模型 Kimi K3,其性能直逼前沿闭源模型,并同步公开分布式智能体训练系统 AgentENV;多篇论文深入长程规划与行动蒸馏,如「多轮长程规划物理」与通过程序状态提升计算机使用智能体的 StateAct,推动 Agent 能力边界;AI Infra 方面,英伟达投资 SSI 加码 Scaling,微软发布 5B 参数网络安全模型,同时 Sol-Attn 等推理优化技术持续涌现。

🗞 行业动态 33 条

Kimi K3、Unlimited OCR包揽全球前二,中国开源模型持续刷屏海外

量子位 · 07-28 16:17 UTC+8

月之暗面开源的 Kimi K3 和 Unlimited OCR 等多款模型在海外评测中包揽全球前二,这标志着中国开源模型已跻身世界顶尖梯队,为开发者提供了可直接使用与二次开发的一流基座和视觉文本工具。

基座大模型厂商动态Kimi开源视觉模型

moonshotai/Kimi-K3

Simon Willison · 07-28 07:39 UTC+8

月之暗面在 HuggingFace 上正式发布 Kimi K3 完整权重,总容量 1.56TB,并采用修改后的 MIT 许可证,要求较大商业实体声明归属,这对希望集成该模型的团队明确了许可与使用条件。

基座大模型厂商动态Kimi开源许可发布

b10165

llama.cpp · 07-28 23:31 UTC+8

llama.cpp 合并 Vulkan 后端对 iq4_nl 量化的 FlashAttention 支持,并修复相关兼容性问题,使得在 Vulkan 驱动的设备上运行低比特量化模型的推理更高效、更稳定。

AI Infrallama.cpp推理优化量化

LFM2.5-Encoders for Fast Long-Context Inference on CPU

HuggingFace 博客 · 07-28 23:01 UTC+8

LFM2.5 发布编码器模型,针对 CPU 上的长上下文推理进行专门优化,为无 GPU 环境下快速处理长文本提供了实用方案,有助于降低长上下文应用的门槛。

推理优化AI Infra长上下文CPU推理新模型发布

b10164

llama.cpp · 07-28 22:30 UTC+8

llama.cpp 加入 CUDA 分块 SSD 矩阵乘法,加速 Mamba-2 模型的预填充阶段,对部署状态空间模型和降低长序列推理延迟具有直接提升。

AI Infrallama.cppMamba推理优化

Beyond RAG: Task-aware knowledge compression for enterprise AI on AWS

AWS 机器学习 · 07-28 00:11 UTC+8

AWS 提出任务感知知识压缩方法,可将整个知识库预先压缩为多级保真度表示并缓存,再按需路由查询,突破传统 RAG 在跨数百份文档的分析任务上的瓶颈,且提供了可部署的开源实现,对需要处理海量文档的企业有直接价值。

InfraRAG知识压缩企业AIAWS

Codex from 0 to 10M Users: Building ChatGPT Work — Akshay Nathan, OpenAI

Latent Space · 07-28 23:26 UTC+8

OpenAI 核心产品工程负责人分享 ChatGPT Work 从零到千万用户的建设历程,涵盖站点、记忆、子智能体、金融及无代码等关键功能,为构建通用智能体产品提供了宝贵的实战经验。

厂商动态大模型厂商动态OpenAI智能体产品经验

英伟达重构工程软件栈:Agent、PhysicsNeMo 与 CUDA-X 合流

InfoQ 中文 · 07-28 19:22 UTC+8

NVIDIA 将其 Agent 框架、物理仿真 PhysicsNeMo 与 CUDA-X 加速库深度整合,重构工程软件栈,旨在为工业数字孪生和物理 AI 提供统一的加速平台,加速仿真与智能体应用开发。

厂商动态英伟达AI Infra数字孪生工业仿真

b10158

llama.cpp · 07-28 16:56 UTC+8

llama.cpp 新增对 gpt-oss 模型的 eagle3-v3 推测解码支持(#25794),可通过投机解码加速本地推理,提升生成吞吐量。

推理优化推测解码llama.cppEagle3本地推理

[AINews] Much ado about Open Weights

Latent Space · 07-28 14:20 UTC+8

月之暗面于当日正式交付开放权重模型 Kimi K3,在众多开放权重讨论中成为唯一实际落地的发布。

厂商动态月之暗面Kimi K3开放权重

b10155

llama.cpp · 07-28 06:01 UTC+8

llama.cpp 引入小米 MiMo-V2.5 的音频输入支持(#26190),基于 RVQ 实现的多模态推理扩展,并提供了 GGUF 转换器。

推理优化llama.cppMiMo-V2.5小米多模态音频输入

b10159

llama.cpp · 07-28 19:45 UTC+8

llama.cpp 的 Metal 后端新增快速沃尔什-哈达玛变换(FWHT)内核(#25924),为 Apple Silicon 推理提供更高效的计算原语。

llama.cppMetalFWHTApple Silicon推理优化

v1.9.2

HF TRL · 07-28 18:39 UTC+8

TRL v1.9.2 修复了 NemotronH 模型 GRPO/RLOO 测试因 transformers 内核问题导致的失败,并兼容 bitsandbytes 0.50.0 量化测试。

后训练TRLGRPORLOONemotronHbitsandbytes

豆包搜索,走出了豆包

量子位 · 07-28 18:12 UTC+8

字节跳动将豆包搜索能力对外开放给 Agent,使得外部智能体可直接调用豆包搜索,丰富信息获取渠道。

豆包字节跳动搜索Agent开放能力

📄 论文 20 篇

今日论文看点包括 Kimi K3 全面技术报告揭示前沿智能体训练细节,以及「DecoupleMix」为视觉语言模型提出解耦比例搜索与凸优化数据配方,在大规模多模态训练中实现高效扩展。

Kimi K3: Open Frontier Intelligence

月之暗面 KimiHF 精选 · 07-28 08:00 UTC+8

Kimi K3 是一个 2.8 万亿参数、1040 亿激活的混合专家模型,拥有原生视觉和 1M 上下文窗口。针对长序列信息流和专家激活效率,它引入 Kimi Delta Attention 与 Attention Residuals 来改善跨深度和序列位置的信息传递,并采用 Stable LatentMoE 从 896 个专家中每 token 灵活激活 16 个,再结合优化的训练与数据配方,最终带来约 2.5 倍的性能增益。

厂商动态大模型基座MoE视觉语言模型新模型发布
📖 阅读⬇ PDF

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

HF 精选 · 07-28 08:00 UTC+8

多轮长程规划是基础模型智能体的关键能力,但其如何形成和提升一直不清晰。该工作构建了一个统一可控的多轮环境,系统研究预训练到后训练三个阶段中规划能力的获取与整合,并采用单教师与多教师在策略智能体蒸馏,为彻底改善长程规划提供了可复现的训练路线。

Agent规划蒸馏训练方法
📖 阅读⬇ PDF

DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

字节 SeedHF 精选 · 07-28 08:00 UTC+8

视觉语言模型预训练数据混合的构建长期依赖直觉和启发式,缺乏可归因的准则。DecoupleMix 将数据构建形式化为一个系统的混合优化问题,并通过解耦比例搜索和凸分配,将数据配方设计转化为可复现的工程化流程,显著提升了数据配方的可扩展性和严谨性。

训练训练方法数据工程VLM多模态
📖 阅读⬇ PDF

A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

HF 精选 · 07-28 08:00 UTC+8

每次通过重训提升语言模型都带来巨大算力开销和输出不确定。该工作反其道而行,冻结 12B 模型并为其配备不断增长的已验证解决方案记忆,一旦某一问题族通过独立验证,后续所有实例即可零生成 token、比特精确且确定性回答,在 180 个新实例上以 100% 准确率超越前沿模型。

推理优化确定性生成大模型应用
📖 阅读⬇ PDF

Characterizing Warp Divergence from Pascal to Blackwell

HF 精选 · 07-28 08:00 UTC+8

自 Volta 引入独立线程调度后,业界的默认假设是 NVIDIA GPU 以固定方式处理 warp divergence,但缺乏跨代验证。该研究通过周期精确微基准、硬件计数器和 SASS 静态分析,系统刻画了从 Pascal 到台式和数据中心 Blackwell 的分叉路径串行化、重收敛等行为,揭示出显著代际变化,为 GPU 内核优化提供精细依据。

InfraAI InfraGPU架构并行计算推理优化
📖 阅读⬇ PDF

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

HF 精选 · 07-28 08:00 UTC+8

创意 AI 正从单步生成走向长程多模态生产,但现有环境缺乏对引用、草稿、编辑和版本关系的支持。JarvisHub 提出画布原生的多智能体开放测试平台,将创意过程建模为完整的创作流,包含工具动作、评估信号和人工反馈,为评估和开发复杂创意智能体提供了标准化实验环境。

Agent多模态创意AI评测
📖 阅读⬇ PDF

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

HF 精选 · 07-28 08:00 UTC+8

在智能体搜索中,结果级强化学习仅提供稀疏监督,而强大的专有模型因无法暴露 logits 而难以直接蒸馏。该工作提出多智能体协议蒸馏,将专有模型的搜索行为协议转化为稠密的中间监督信号,弥合开源与专有模型之间的分布差距,显著提升了开源模型的搜索推理性能。

Agent蒸馏搜索协议
📖 阅读⬇ PDF

StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

HF 精选 · 07-28 08:00 UTC+8

计算机使用智能体通常依赖截图感知,但截图只是底层程序状态的有损渲染,会丢失关键结构信息。StateAct 提出代码优先的多智能体方案,主智能体直接读写程序状态,辅助智能体在必要时查看截图,通过两阶段决策将状态操作与视觉感知解耦,在多个长程基准上任务成功率大幅领先纯视觉方法。

Agent计算机使用多智能体GUI
📖 阅读⬇ PDF

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

NVIDIAHF 精选 · 07-28 08:00 UTC+8

扩散 Transformer 生成视频时注意力成为推理瓶颈,现有训练无关的动态稀疏注意力往往因固定预算和路由开销而效率不佳。Sol-Attn 提出即时的自适应稀疏注意力,能够动态调整计算量并精确选择关键键值块,在保持生成质量的同时大幅加速视频推理。

AI Infra推理优化视频生成稀疏注意力
📖 阅读⬇ PDF

Codifying the Judge: Scalable Evaluation via Program Distillation

HF 精选 · 07-28 08:00 UTC+8

LLM-as-a-Judge 方案成本高、延迟大,且决策不透明,限制其规模化应用。Codifying the Judge 采用程序蒸馏,将 LLM 的评估逻辑提炼为可检查、可编辑的程序委员会,实现快速、透明且可扩展的自动化评估,同时保持与原始裁判高一致。

训练评估蒸馏可扩展性
📖 阅读⬇ PDF

TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs

HF 精选 · 07-28 08:00 UTC+8

参数化工具检索让 LLM 通过虚拟令牌隐式调用 API,但训练时会擦除已有工具知识,且束搜索解码延迟过高。TRACE 设计两阶段课程,先嵌入业务规则的思维链训练,再进行蒸馏,将知识保留和实时检索解耦,在保持高精度的同时达到毫秒级延迟,适合企业部署。

Agent工具调用企业AI蒸馏
📖 阅读⬇ PDF

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

ECCV 2026CCF-B推荐HF 精选 · 07-28 08:00 UTC+8

大视觉语言模型的计算瓶颈集中在视觉编码器,但现有压缩工作多忽略这部分,且未曾直接针对设备端延迟进行优化。UltraViT 以设备端延迟为优化目标,重新设计轻量视觉编码器,在保持特征质量的同时大幅降低推理延迟,使 LVLM 更易部署于资源受限的边缘设备。

AI Infra推理优化视觉编码器边缘计算
📖 阅读⬇ PDF

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

HF 精选 · 07-28 08:00 UTC+8

音视频联合生成时,独立训练的 VAE 导致两模态潜在空间不对齐,下游模型难以学习一致性。OmniVAE 提出统一的音视频 VAE,通过共享编解码路径和显式跨模态对齐,学习到对齐的潜在表示,从根本上简化了联合生成模型的训练。

基座多模态基座视频生成VAE联合生成
📖 阅读⬇ PDF

dRAE: Representation Autoencoder with Hyper-Spherical Codes

蚂蚁HF 精选 · 07-28 08:00 UTC+8

将高维视觉表示离散化以对接语言模型时,传统向量量化因欧氏距离度量与表示空间几何不匹配,经常出现码本崩溃。dRAE 引入超球面编码,通过规范化消除幅度方差并稳定码本,成功实现语义连贯的大规模离散视觉表示。

基座多模态基座视觉表示量化码本
📖 阅读⬇ PDF

ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding

HF 精选 · 07-28 08:00 UTC+8

医学多模态 LLM 面临着 2D/3D 异构影像的知识吸收以及符合放射科实际工作流的精细化评估难题。ClinFusion 以视觉为中心,融合多模态医学知识,并设计注重事实性的细粒度评估协议,在整体医学理解和临床决策支持上获得更可靠的性能。

基座多模态基座医疗AI视觉语言模型评估
📖 阅读⬇ PDF

A Vocabulary for Multi-Agent Automated Research Systems

HF 精选 · 07-28 08:00 UTC+8

多智能体自动化研究系统的设计选择难以比较和复现。该工作提出一套统一词汇,规范了智能体身份、可用操作、调用权限、通信方式、信息可见性、动作决策、运行启动和输出评估八个维度,使系统描述清晰且可比较。

Agent多智能体框架标准化
📖 阅读⬇ PDF

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

HF 精选 · 07-28 08:00 UTC+8

当前机器人策略常依赖大型预训练 VLM 作为动作骨干,计算开销大。WorldDiT 提出统一扩散 Transformer,同时预测连续动作和未来视觉世界模型,无需大型 VLM 便可在多个具身任务上达到强性能,为紧凑的端到端策略提供了新路线。

Agent具身智能扩散模型世界模型机器人
📖 阅读⬇ PDF