vLLM v0.26.0 发布,新增对 Inkling 模型族的全栈支持,包括基础建模、投机解码(MTP=1)、LoRA 及 NVFP4 量化,同时针对 DeepSeek-V4 推出定制路由内核与融合算子,在多个 GPU 厂商硬件上显著改善了端到端延迟。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
跨年累积的 AI 精选:顶会顶刊高被引论文(全领域,按**具体会刊**分组)+ 各厂商实验室论文与官方动态;多源召回 + 大模型相关性精筛,每周自动维护;支持自助检索 arXiv 添加并自动归类。
vLLM v0.26.0 发布,新增对 Inkling 模型族的全栈支持,包括基础建模、投机解码(MTP=1)、LoRA 及 NVFP4 量化,同时针对 DeepSeek-V4 推出定制路由内核与融合算子,在多个 GPU 厂商硬件上显著改善了端到端延迟。
NVIDIA Nemotron 3 Ultra Leads Open Models on Accuracy and Efficiency in Agentic RTL Coding
NVIDIA 推出 Nemotron 3 Ultra,在智能体驱动的 RTL 编码任务中兼顾高准确率与高效率,成为目前该方向上最具竞争力的开源模型之一,为芯片设计公司减少人工编写寄存器传输级代码的工程耗时提供了新选项。
Kimi K3 Is Here: Efficient Day-0 Support on vLLM
vLLM 实现对 Kimi K3 的 Day-0 高效推理支持,整合混合 KDA 前缀缓存、DSpark 投机解码及生产级分解式架构,同时针对 NVIDIA 和 AMD GPU 优化内核,保障千亿参数模型的服务吞吐与延迟。
Black Forest Labs 发布多模态流模型 FLUX 3,首次以单一架构和一组权重统一支持图像、视频、音频生成以及机器人动作预测,标志着该系列从图像生成扩展到全模态理解与生成。
全球首款2nm GPU 炸场!OpenAI、Meta、微软集体站台,AMD 要拆掉英伟达护城河?
全球首款 2nm 工艺 GPU 正式亮相,引发 OpenAI、Meta、微软等 AI 巨头关注。AMD 意图借先进制程与多厂商生态打破英伟达在高端 AI 芯片领域的垄断格局,或将加速下一代训练与推理硬件的迭代。
蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-Flash
蚂蚁百灵发布新一代原生混合推理模型 Ling-3.0-Flash,预计其结合了快速推理与深度思考的双重能力,为移动端与低延迟场景下的智能体应用提供更高效的基座。
Ilya Sutskever’s Safe Superintelligence partners with Nvidia to scale its AI research
由 Ilya Sutskever 领导的 Safe Superintelligence(SSI)结束两年静默期,宣布与 Nvidia 达成长期合作,将大规模部署 Nvidia GPU 集群,全力推进安全超级智能的前沿研究。
llama.cpp 更新,改进多 Token 预测(MTP)时的 GPU 层分配逻辑,确保前置层始终驻留在 GPU,减少 CPU-GPU 数据搬运,进一步提升大模型预测效率。
llama.cpp 修复算子卸载至权重后端的逻辑错误,并纠正 DeepSeek V4 图编译的若干问题,提升模型在多后端环境下的推理稳定性与兼容性。
llama.cpp 在 PowerPC CPU 上开启 BF16 分块矩阵乘优化,使得该指令集架构也能享受低精度计算带来的推理加速,扩大了 llama.cpp 的硬件适配范围。
亚马逊云科技发布 Loom,一个用于在企业级规模上管理 AI 代理的开源参考平台
亚马逊云科技发布开源参考平台 Loom,专为企业级规模管理 AI 代理而设计,提供代理生命周期控制、治理与可观测能力,帮助企业更系统地在生产环境中落地智能体应用。
HF TRL v1.9.1 修复了 vLLM 服务器模式通讯初始化、DeepSpeed CPU 卸载优化器崩溃及 Liger 内核在早于 Ampere 架构 GPU 上的兼容性问题,并新增 Gemma4 响应模板,显著提升强化学习训练器的稳定性与模型覆盖度。
llama.cpp 新增对 Nanbeige4.2 模型的原生支持,进一步丰富其可推理的开源模型库,方便开发者在该轻量级推理框架上快速部署。
trunk/6584e189842429d351835706e1f6cc22d17ee7fa
PyTorch 主干回退了感应器(inductor)中关于布局消费者提前重索引的提交,以避免在特定场景下引入的融合错误或性能退化。
PyTorch 电感器通过对布局消费者进行投机性展平与重索引,扩大了可融合的兼容路径,使得注意力转置和缩放接合等场景在索引反演前获得更多优化机会,提升编译后算子的执行效率。
viable/strict/1785181905: [BE] Upgrade XPU support package to 2026.1 (#189593)
PyTorch 将 Intel GPU 加速栈的 XPU 支持包升级至 2026.1 版本,更新运行时依赖与离线安装器,确保在 Linux 和 Windows 上的 CI/CD 使用最新的 oneAPI 深度学习核心库。
METR introduces a new metric to calculate exactly when AI agents become more expensive than humans
METR 提出「支出地平线」新指标,定量衡量 AI 代理何时在解决任务上比人力更贵。初步在 NanoGPT speedrun 上的评估显示代理性价比仍然偏低,但该指标为代理的经济性评估提供了首个可比较的基准框架。
llama.cpp 修复在同时指定显式草稿模型和 repo 侧车解析时的优先级问题,确保手动指定的 --model-draft 参数不会被动地被侧车解析覆盖,提高了 CLI 配置的确定性。
Cursor 用一群Agent重造SQLite:仅凭 835 页手册,无源码、无测试、不联网
Cursor 通过一群智能体协作,仅依靠 835 页 SQLite 参考手册,在无源码、无测试用例、不联网的条件下重写了完整的 SQLite,展现了多智能体协同编程在复杂软件再实现上的强大潜力。
该提交为 llama.cpp 新增 `-lm mlock` 参数,允许在内存锁定但不使用内存映射的情况下加载模型,便于精细控制物理内存占用,对追求低延迟与稳定推理的部署场景有参考价值。
Six Agent Harness Capabilities for Higher Model Performance
NVIDIA 开发者博客总结了提升 AI Agent 性能的六种支架能力,涵盖上下文渲染、工具执行编排等关键环节,为构建更高效的智能体系统提供了实践指引。
trunk/33812ece06e2b0d597f73fbe41de03a83f9109f9
PyTorch 的 Triton 后端代码更新,改进了自定义算子在 HOP 突变分析中对数据读写的处理,有助于保证编译优化后的执行正确性。
PyTorch 例行更新了分布式通信库 torchcomms 的 pinned 哈希,属于基础设施维护,确保 CI 依赖一致,对训练用户无直接影响。
llama.cpp 服务端修复了模型名包含斜杠时流式路由无法匹配会话的问题,将会话 ID 移至查询字符串,从而保证多模型路由下断点续传等功能的稳定性。
NVIDIA Harnesses Vera CPU to Speed Up Design of Next-Generation CPUs and GPUs
NVIDIA 与 Cadence、Synopsys 合作,利用 Vera CPU 加速关键 EDA 工具,用以设计下一代 CPU 和 GPU,有望缩短复杂芯片的设计周期并提升开发效率。
Ollama 0.32.5-rc0 预发布版主要更新了 MLX 后端,预计将提升 Mac 上模型的推理效率,Apple Silicon 用户可以关注后续正式版本。
llama.cpp 的 SYCL 后端构建过程改为并行调用 ocloc 编译器,能够显著减少 Intel GPU 用户的编译等待时间,改善开发体验。
曝梁文锋不满内部会议泄露,DeepSeek或暂停融资;Karpathy入职Anthropic仅两月疑离职;日媒拆解宇树G1后认输:短期内赶不上中国|AI周报
InfoQ 周报摘要:传 DeepSeek 创始人因内部会议泄露不满,可能暂停第二轮融资;前 OpenAI 成员 Karpathy 入职 Anthropic 仅两月疑已离开;日媒拆解宇树 G1 机器人后承认短期内难以追赶中国技术水平。
昆仑万维押注世界模型的两大产业路径:内容创作实时、可交互,机器人先“预演”再行动
昆仑万维押注世界模型的两大产业路径:内容创作方向追求实时、可交互的生成,机器人方向先通过仿真「预演」再物理执行,以降低真实世界的试错成本。
量子位报道称 DeepSeek 已主动叫停第二轮融资签约,该轮融资原计划募资至少 100 亿元,可能与内部信息泄露事件引发的管理层疑虑有关。
How AI is expanding what people do at work
OpenAI 新研究揭示 ChatGPT 等 AI 工具正在拓宽人类的工作范畴,用户开始承担跨职能任务,重塑职业角色和工作边界。
Advancing Semiconductor Innovation Across Materials Engineering and Manufacturing
NVIDIA 开发者博客探讨了在爆发式 AI 算力需求下,通过材料工程与制造技术的创新来推进半导体创新,以满足前所未有的性能目标。
GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks
Apple 机器学习团队提出 GH-ESD 方法,采用假设驱动的方式在实例级视觉任务中发现模型系统性失败的语义切片,弥补了传统聚类方法无法处理空间与上下文关系缺陷,为检测与分割模型的诊断提供了更精准的工具。
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
针对现有自进化方法难以兼顾任务多样性与验证可靠性的困境——环境约束的方法反馈精确但领域狭窄,开放生成则缺乏可靠奖励信号导致训练污染——论文提出「技能自博弈」(Skill Self-Play),让智能体在共同进化的技能空间中交互博弈,以可验证的中间技能作为双向锚点,既保证奖励可信度又不断扩展能力边界,为突破LLM极限提供了一条训练更稳定的新路径。
📖 阅读⬇ PDFMolt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning
智能体强化学习研究中,算法、估计器、部署流程的频繁改动使研究者每次都要穿透训练器、分布式后端与 rollout 胶水代码。Molt 是一个纯 PyTorch 原生的训练框架,把上述复杂性封装得足够简洁,研究员甚至 AI 编程助手都能轻松阅读和修改,大幅降低了快速迭代的工程成本。
📖 阅读⬇ PDFScaling Native Multimodal Pre-Training From Scratch
纯文本预训练限制了LLM对物理世界的感知,而原生多模态预训练能从输入端开始深度融合图文等模态,但该范式的缩放规律尚不清晰。本文通过大规模实验首次系统研究了原生多模态模型随参数、数据与计算量变化的缩放行为,为后续大规模多模态基座训练提供了关键指导。
📖 阅读⬇ PDFDataPrep-Bench: Benchmarking LLMs as Training Data Preparators
训练数据品质直接决定LLM能力,但此前缺乏统一基准来端到端评估LLM或智能体工作流的数据准备水平。DataPrep-Bench 将数据准备分解为「数据构建」与「数据质量评估」两大互补能力,并构建多维度测试集,为数据工程领域的 LLM 应用提供了可复现的衡量标尺。
📖 阅读⬇ PDFMulti-Head Latent Control: A Unified Interface for LLM Agent Decision Making
LLM 作为智能体时需要在推理过程中动态决策:继续推理、委托更强模型、请求外部信息、调用工具或主动放弃,而现有解决方案多依赖提示路由或外部编排,缺乏统一接口。该论文提出「多头潜在控制」,以紧凑的潜在向量统一表达这些决策,使智能体在保持端到端可训的同时获得更细粒度的行为控制。
📖 阅读⬇ PDFVisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression
视觉语言模型处理过多视觉 token 导致推理延迟和显存开销过大。VisCo 另辟蹊径,不引入外部压缩模块,而是利用 LLM 本身的表示能力作为内在编码器对视觉 token 进行压缩,在保持高压缩比的同时显著降低性能退化,且避免了重新训练主干网络的成本。
📖 阅读⬇ PDFInteractive Training 2: Auditable Control Plane for Live Model Training
以往对正在进行的训练进行干预往往需要模型专属的代码,缺少通用控制手段。Interactive Training 2 构建了一个可审计的控制平面,训练应用通过声明式接口暴露可调参数与动作,经统一协议接收人类或自动化控制器的请求,并在安全检查点动态应用,结合定制化的 Aim 工作区实现训练过程的实时操控与记录。
📖 阅读⬇ PDF生产环境中的 AI 智能体常因上下文无限膨胀而耗尽记忆、推高 token 成本,现有方案多将其视为单纯的存储检索问题。论文提出「智能体上下文管理」,将记忆和成本问题重新定义为生命周期与架构问题,从系统层面设计更可持续的上下文组织方式,有望从根本上缓解智能体遗忘与成本失控。
📖 阅读⬇ PDFIDEAgent: Agentic Quality-Diversity Search for Research Idea Generation
现有科研想法生成系统往往只独立优化「质量」或「多样性」,导致生成的想法趋同或质量参差不齐。IDEAgent 将想法生成本身建模为多目标搜索问题,利用质量-多样性联合搜索算法,让智能体在想法空间中主动探求新颖且科学严谨的方向,在自动科研 ideation 上展现出更均衡的创新潜力。
📖 阅读⬇ PDFSceneActBench: Can Agents Act on the 3D Scenes They See?
现有 3D 基准大多仅评估文本描述或单一物体操作,无法检验 VLM 智能体对完整多物体三维场景的真正行动能力。SceneActBench 构建了一个统一的智能体-环境交互环,覆盖五种 3D 任务,首次系统测试智能体基于视觉在三维世界中执行多步操作的水平,为具身智能评估填补了空白。
📖 阅读⬇ PDFLAMAR: An Open Language-Aware Multilingual Alignment Reranker
多语言 RAG 场景下,现有重排序器在语义等同时并不优先选择与查询语言一致的文档,影响答案生成质量。LAMAR 通过语言感知的对齐训练,使重排序器能显式考虑文档语言,在保持语义相关性的前提下显著提升同语言文档的排位,增强多语言检索的最终可用性。
📖 阅读⬇ PDFClosing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering
自回归生成式渲染在长时间序列中,当相机重访已生成过的区域时会出现画面不一致。该论文在不重新训练的前提下提出「重访一致性循环闭合」方法,通过巧妙地利用历史生成帧的隐式约束来修正新帧,大幅提升了长镜头在相同视点下的时空连贯性。
📖 阅读⬇ PDFSpectral Prior for Reducing Exposure Bias in Diffusion Models
扩散模型在迭代采样时会累积误差(暴露偏差),研究发现这一偏差在频域中呈现随模型和时间步变化的系统性失配。提出的 Spectral Alignment 是一种轻量级引导方法,直接在频域校准噪声预测,无需重训练即可有效减少误差累积,提升生成样本的真实度与稳定性。
📖 阅读⬇ PDF