Kimi K3、Unlimited OCR包揽全球前二,中国开源模型持续刷屏海外
月之暗面开源的 Kimi K3 和 Unlimited OCR 等多款模型在海外评测中包揽全球前二,这标志着中国开源模型已跻身世界顶尖梯队,为开发者提供了可直接使用与二次开发的一流基座和视觉文本工具。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
跨年累积的 AI 精选:顶会顶刊高被引论文(全领域,按**具体会刊**分组)+ 各厂商实验室论文与官方动态;多源召回 + 大模型相关性精筛,每周自动维护;支持自助检索 arXiv 添加并自动归类。
Kimi K3、Unlimited OCR包揽全球前二,中国开源模型持续刷屏海外
月之暗面开源的 Kimi K3 和 Unlimited OCR 等多款模型在海外评测中包揽全球前二,这标志着中国开源模型已跻身世界顶尖梯队,为开发者提供了可直接使用与二次开发的一流基座和视觉文本工具。
月之暗面在 HuggingFace 上正式发布 Kimi K3 完整权重,总容量 1.56TB,并采用修改后的 MIT 许可证,要求较大商业实体声明归属,这对希望集成该模型的团队明确了许可与使用条件。
月之暗面不仅发布 Kimi K3 权重,还部分开源其基础设施。该模型在流行基准上逼近 GPT-5.6 等西方前沿模型,但独立评测发现其在网络安全和数学方面存在较大差距,提示从业者仍需警惕可能的数据蒸馏和真实能力边界。
Kimi 团队与 kvcache-ai 开源 AgentENV,一套基于 Firecracker 微虚拟机的分布式系统,支持毫秒级快照和 16 路 fork,专为 Kimi K3 的智能体强化学习训练设计,为大规模智能体训练提供了高效且易复现的环境。
llama.cpp 合并 Vulkan 后端对 iq4_nl 量化的 FlashAttention 支持,并修复相关兼容性问题,使得在 Vulkan 驱动的设备上运行低比特量化模型的推理更高效、更稳定。
LFM2.5-Encoders for Fast Long-Context Inference on CPU
LFM2.5 发布编码器模型,针对 CPU 上的长上下文推理进行专门优化,为无 GPU 环境下快速处理长文本提供了实用方案,有助于降低长上下文应用的门槛。
llama.cpp 加入 CUDA 分块 SSD 矩阵乘法,加速 Mamba-2 模型的预填充阶段,对部署状态空间模型和降低长序列推理延迟具有直接提升。
微软发布首个针对网络防御的稀疏 MoE 小模型 MAI-Cyber-1-Flash,5B 激活参数,集成到多智能体扫描框架 MDASH 后,在 CyberGym 上达到 95.95% 准确率,为自动化安全运营提供了新的高效模型。
全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归
全球首个原生支持智能体任务的扩散模型发布,具备 128K 上下文窗口,能够在执行行动时实时纠错,性能比肩自回归模型,为扩散模型在长程 Agent 任务中的落地打开了新的可能。
Beyond RAG: Task-aware knowledge compression for enterprise AI on AWS
AWS 提出任务感知知识压缩方法,可将整个知识库预先压缩为多级保真度表示并缓存,再按需路由查询,突破传统 RAG 在跨数百份文档的分析任务上的瓶颈,且提供了可部署的开源实现,对需要处理海量文档的企业有直接价值。
Codex from 0 to 10M Users: Building ChatGPT Work — Akshay Nathan, OpenAI
OpenAI 核心产品工程负责人分享 ChatGPT Work 从零到千万用户的建设历程,涵盖站点、记忆、子智能体、金融及无代码等关键功能,为构建通用智能体产品提供了宝贵的实战经验。
英伟达重构工程软件栈:Agent、PhysicsNeMo 与 CUDA-X 合流
NVIDIA 将其 Agent 框架、物理仿真 PhysicsNeMo 与 CUDA-X 加速库深度整合,重构工程软件栈,旨在为工业数字孪生和物理 AI 提供统一的加速平台,加速仿真与智能体应用开发。
llama.cpp 新增对 gpt-oss 模型的 eagle3-v3 推测解码支持(#25794),可通过投机解码加速本地推理,提升生成吞吐量。
[AINews] Much ado about Open Weights
月之暗面于当日正式交付开放权重模型 Kimi K3,在众多开放权重讨论中成为唯一实际落地的发布。
llama.cpp 引入小米 MiMo-V2.5 的音频输入支持(#26190),基于 RVQ 实现的多模态推理扩展,并提供了 GGUF 转换器。
微软推出紧凑安全模型 MAI-Cyber-1-Flash,嵌入多智能体系统 MDASH 后在 CyberGym 基准达到 96% 得分,通过仅将困难案例传给 GPT-5.4 实现成本降低 50%。
Microsoft launches its first cybersecurity model, plus a new agentic cybersecurity system
微软发布其首个 AI 安全模型及新的代理安全平台,进一步强化其 AI 网络安全产品矩阵。
从固定编排到自进化蜂群:EvoMap 如何让 Agent 继承经验|AICon深圳
InfoQ 报道 AICon 深圳上提出的 EvoMap 方法,通过自进化蜂群机制让智能体继承经验,从固定编排转向动态群体智能。
从Token到任务:Agentic AI 如何改变基础设施的关注焦点
文章探讨 Agentic AI 如何使基础设施关注焦点从 Token 处理转向任务级编排与执行,对 AI Infra 提出全新需求。
Perplexity 发布命令行工具 pplx,提供搜索和网页内容获取命令并输出 JSON,以单一二进制形式为编码智能体提供搜索 API 接入。
一场圆桌访谈聚焦从成本控制角度必须关注的 Agent 基础设施组件与选型策略,为从业者提供省钱思路。
Nvidia invests in Ilya Sutskever's AI lab, shifting SSI away from Google chips
英伟达向 Ilya Sutskever 的 Safe Superintelligence(SSI) 实验室注入「大量」资金,或推动 SSI 从谷歌芯片转向英伟达硬件生态。
Anthropic CEO Dario Amodei 再次警告开放权重模型可能导致生物或网络攻击风险,坚称从未呼吁禁用,但批评者认为意在维护其商业护城河。
llama.cpp 的 Metal 后端新增快速沃尔什-哈达玛变换(FWHT)内核(#25924),为 Apple Silicon 推理提供更高效的计算原语。
TRL v1.9.2 修复了 NemotronH 模型 GRPO/RLOO 测试因 transformers 内核问题导致的失败,并兼容 bitsandbytes 0.50.0 量化测试。
1v1 对话:来自 Agent Infra 负责人的心声、复盘、规划与思考
InfoQ 与 Agent Infra 负责人进行 1v1 对话,深入复盘实践历程并分享未来规划与行业思考。
字节跳动将豆包搜索能力对外开放给 Agent,使得外部智能体可直接调用豆包搜索,丰富信息获取渠道。
教程演示用 PrismML 移植的 llama.cpp 部署 1-bit 量化的 Bonsai-27B 模型,通过专用 CUDA 内核解码 Q1_0_g128 GGUF 格式实现稀疏本地推理。
黄仁勋向 Ilya Sutskever 的 SSI 实验室投资 50 亿美元,重燃对 Scaling 曲线的信心,强调继续扩展模型规模。
Anthropic’s Dario Amodei responds: doesn’t oppose open-weight models, but fears Chinese AI
Anthropic CEO Dario Amodei 澄清并非反对开放权重模型,但对中国 AI 能力增长公开表达恐惧,引发热议。
本教程基于 Anthropic 的金融服务仓库,用 Claude、Python 和 MCP 连接器构建技能驱动的金融分析智能体,实现自动化交付。
OpenAI’s Hugging Face breach has reignited the debate over alignment and control
OpenAI 在 Hugging Face 上的数据泄露事件重新引发 AI 对齐与控制的争论,暴露出能力增强后应更好对齐还是更严格限制的分歧。
NVIDIA Ising Enables Fully Automated Quantum Computer Calibration with Enhanced In-Context Learning
NVIDIA 开源视觉语言模型 Ising Calibration,可自动解读量子处理器诊断输出并完成校准,通过增强上下文学习提升自动化水平。
Kimi K3: Open Frontier Intelligence
Kimi K3 是一个 2.8 万亿参数、1040 亿激活的混合专家模型,拥有原生视觉和 1M 上下文窗口。针对长序列信息流和专家激活效率,它引入 Kimi Delta Attention 与 Attention Residuals 来改善跨深度和序列位置的信息传递,并采用 Stable LatentMoE 从 896 个专家中每 token 灵活激活 16 个,再结合优化的训练与数据配方,最终带来约 2.5 倍的性能增益。
📖 阅读⬇ PDF多轮长程规划是基础模型智能体的关键能力,但其如何形成和提升一直不清晰。该工作构建了一个统一可控的多轮环境,系统研究预训练到后训练三个阶段中规划能力的获取与整合,并采用单教师与多教师在策略智能体蒸馏,为彻底改善长程规划提供了可复现的训练路线。
📖 阅读⬇ PDFDecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes
视觉语言模型预训练数据混合的构建长期依赖直觉和启发式,缺乏可归因的准则。DecoupleMix 将数据构建形式化为一个系统的混合优化问题,并通过解耦比例搜索和凸分配,将数据配方设计转化为可复现的工程化流程,显著提升了数据配方的可扩展性和严谨性。
📖 阅读⬇ PDFA Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever
每次通过重训提升语言模型都带来巨大算力开销和输出不确定。该工作反其道而行,冻结 12B 模型并为其配备不断增长的已验证解决方案记忆,一旦某一问题族通过独立验证,后续所有实例即可零生成 token、比特精确且确定性回答,在 180 个新实例上以 100% 准确率超越前沿模型。
📖 阅读⬇ PDFCharacterizing Warp Divergence from Pascal to Blackwell
自 Volta 引入独立线程调度后,业界的默认假设是 NVIDIA GPU 以固定方式处理 warp divergence,但缺乏跨代验证。该研究通过周期精确微基准、硬件计数器和 SASS 静态分析,系统刻画了从 Pascal 到台式和数据中心 Blackwell 的分叉路径串行化、重收敛等行为,揭示出显著代际变化,为 GPU 内核优化提供精细依据。
📖 阅读⬇ PDFJarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
创意 AI 正从单步生成走向长程多模态生产,但现有环境缺乏对引用、草稿、编辑和版本关系的支持。JarvisHub 提出画布原生的多智能体开放测试平台,将创意过程建模为完整的创作流,包含工具动作、评估信号和人工反馈,为评估和开发复杂创意智能体提供了标准化实验环境。
📖 阅读⬇ PDF在智能体搜索中,结果级强化学习仅提供稀疏监督,而强大的专有模型因无法暴露 logits 而难以直接蒸馏。该工作提出多智能体协议蒸馏,将专有模型的搜索行为协议转化为稠密的中间监督信号,弥合开源与专有模型之间的分布差距,显著提升了开源模型的搜索推理性能。
📖 阅读⬇ PDFStateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
计算机使用智能体通常依赖截图感知,但截图只是底层程序状态的有损渲染,会丢失关键结构信息。StateAct 提出代码优先的多智能体方案,主智能体直接读写程序状态,辅助智能体在必要时查看截图,通过两阶段决策将状态操作与视觉感知解耦,在多个长程基准上任务成功率大幅领先纯视觉方法。
📖 阅读⬇ PDFSol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
扩散 Transformer 生成视频时注意力成为推理瓶颈,现有训练无关的动态稀疏注意力往往因固定预算和路由开销而效率不佳。Sol-Attn 提出即时的自适应稀疏注意力,能够动态调整计算量并精确选择关键键值块,在保持生成质量的同时大幅加速视频推理。
📖 阅读⬇ PDFReasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models
大推理模型的长推理轨迹中含有大量无关和重复步骤,这些噪声会严重降低幻觉检测的性能。该工作首先识别出两类主要推理噪声,进而提出推理去噪器,在检测前滤除噪声步骤,显著提升了基于推理轨迹的幻觉检测可靠性。
📖 阅读⬇ PDFCodifying the Judge: Scalable Evaluation via Program Distillation
LLM-as-a-Judge 方案成本高、延迟大,且决策不透明,限制其规模化应用。Codifying the Judge 采用程序蒸馏,将 LLM 的评估逻辑提炼为可检查、可编辑的程序委员会,实现快速、透明且可扩展的自动化评估,同时保持与原始裁判高一致。
📖 阅读⬇ PDF参数化工具检索让 LLM 通过虚拟令牌隐式调用 API,但训练时会擦除已有工具知识,且束搜索解码延迟过高。TRACE 设计两阶段课程,先嵌入业务规则的思维链训练,再进行蒸馏,将知识保留和实时检索解耦,在保持高精度的同时达到毫秒级延迟,适合企业部署。
📖 阅读⬇ PDFUltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
大视觉语言模型的计算瓶颈集中在视觉编码器,但现有压缩工作多忽略这部分,且未曾直接针对设备端延迟进行优化。UltraViT 以设备端延迟为优化目标,重新设计轻量视觉编码器,在保持特征质量的同时大幅降低推理延迟,使 LVLM 更易部署于资源受限的边缘设备。
📖 阅读⬇ PDFOmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
音视频联合生成时,独立训练的 VAE 导致两模态潜在空间不对齐,下游模型难以学习一致性。OmniVAE 提出统一的音视频 VAE,通过共享编解码路径和显式跨模态对齐,学习到对齐的潜在表示,从根本上简化了联合生成模型的训练。
📖 阅读⬇ PDFdRAE: Representation Autoencoder with Hyper-Spherical Codes
将高维视觉表示离散化以对接语言模型时,传统向量量化因欧氏距离度量与表示空间几何不匹配,经常出现码本崩溃。dRAE 引入超球面编码,通过规范化消除幅度方差并稳定码本,成功实现语义连贯的大规模离散视觉表示。
📖 阅读⬇ PDFClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding
医学多模态 LLM 面临着 2D/3D 异构影像的知识吸收以及符合放射科实际工作流的精细化评估难题。ClinFusion 以视觉为中心,融合多模态医学知识,并设计注重事实性的细粒度评估协议,在整体医学理解和临床决策支持上获得更可靠的性能。
📖 阅读⬇ PDFIndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages
印度语言对话资源严重匮乏,尤其缺乏多语码混和人格驱动的多轮数据。IndicTalk 构建了涵盖 9 种语言、18 种变体的超 130 万轮事件驱动多轮对话语料,支持母语脚本和罗马化混写,为构建本地化 LLM 提供大规模训练数据。
📖 阅读⬇ PDFA Vocabulary for Multi-Agent Automated Research Systems
多智能体自动化研究系统的设计选择难以比较和复现。该工作提出一套统一词汇,规范了智能体身份、可用操作、调用权限、通信方式、信息可见性、动作决策、运行启动和输出评估八个维度,使系统描述清晰且可比较。
📖 阅读⬇ PDFWorldDiT: A Unified Diffusion Architecture for World and Action Modeling
当前机器人策略常依赖大型预训练 VLM 作为动作骨干,计算开销大。WorldDiT 提出统一扩散 Transformer,同时预测连续动作和未来视觉世界模型,无需大型 VLM 便可在多个具身任务上达到强性能,为紧凑的端到端策略提供了新路线。
📖 阅读⬇ PDFProgress Reward Modeling for Robotic Learning: A Comprehensive Survey
机器人学习常仅依赖终结成功信号,缺少执行过程中的渐进反馈。本文综述进展奖励建模,系统梳理观测形式、奖励定义和泛化条件等维度,为领域提供统一框架,并指出未来方向。
📖 阅读⬇ PDF