SGLang v0.5.17 发布,从首日起原生支持 Kimi K3(2.8T 参数多模态 LatentMoE 模型),并集成了 DCP 分布式检查点、DSpark 推测解码、分块预填充与 TP 解码、KDA 感知前缀缓存等大量推理优化特性,为行业展示了对超巨型 MoE 模型的推理支持能力。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
SGLang v0.5.17 发布,从首日起原生支持 Kimi K3(2.8T 参数多模态 LatentMoE 模型),并集成了 DCP 分布式检查点、DSpark 推测解码、分块预填充与 TP 解码、KDA 感知前缀缓存等大量推理优化特性,为行业展示了对超巨型 MoE 模型的推理支持能力。
Nvidia's open-weight Nemotron 3.5 Lightning prioritizes speed over maximum intelligence
NVIDIA 开源 Nemotron 3.5 Lightning,仅 3.6B 活跃参数却达到与 120B 模型相当的智能指数,推理速度近 670 tokens/s,表明公司押注高效小模型来驱动长时间运行的代理工作负载。
Why Scaling AI Compute Performance Requires a New Power Architecture
NVIDIA 指出下一代加速计算需要新的电力架构,传统交流供电已成为瓶颈,更高机架密度和高效直流配电才能满足 GPU 功耗需求。
NVIDIA Nemotron 3.5 Lightning 专为长时间运行的 AI 代理设计,在工具调用、结果验证和子代理委托等高频任务上表现出高精度与高速度,适合作为生产环境中代理执行引擎。
NVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AI
NVIDIA 扩展 Nemotron 3 家族,推出面向代理 AI 的高效模型 Nemotron 3.5 Lightning,并同步发布 NeMo Switchyard 实现跨模型智能路由,提供更灵活、更高吞吐的代理部署方案。
Route AI Agent Workloads Across Models with NVIDIA NeMo Switchyard
NVIDIA 发布 NeMo Switchyard,能够根据成本、延时和能力动态将代理工作负载路由至不同模型,帮助企业复用多种模型以提升整体代理系统的效率。
谷歌创始人布林紧急接管Gemini团队,但“3.5 Pro已被取消”
谷歌联合创始人谢尔盖·布林紧急接管 Gemini 团队,内部消息称算力分配引发严重内耗,且 Gemini 3.5 Pro 已被取消,团队面临方向重整。
[AINews] Muse Glimmer and Spark: Open Weights return Personal Superintelligence promise
Meta 重回开源路线,发布 Muse Glimmer(30B)等模型,其中 Glimmer 在单张 RTX 3090 即可运行,被视为美国开源模型在本地智能设备上再现“个人超级智能”承诺的一步。
未公开的新 Claude 模型在黎曼猜想相关问题上取得突破,将下界大幅推高,展示了前沿推理模型的数学潜力。
As AI-led attacks multiply, OpenAI launches a new cyber model
OpenAI 扩展其网络安全防御项目 Daybreak,并推出新的网络安全训练模型,以应对日益增多的 AI 驱动攻击。
Meta 发布 30B 参数开源模型 Muse Glimmer,采用 Apache 2.0 许可,专精端到端代理任务,在 DeepSearch QA、MCP-Atlas 等代理基准上取得高成功率。
vLLM v0.27.0 发布,全面支持 Kimi K3 模型,新增 Qwen3 等模型,并引入 DeepGEMM 加速、多模态性能提升等多项改进,标志着对超大规模 MoE 推理的成熟支持。
OpenAI launches GPT-5.6-Cyber to help defenders find vulnerabilities before attackers do
OpenAI 推出 GPT-5.6-Cyber,专为安全防御设计,能回答 98.5% 原本会被拦截的安全查询,并已发现两个此前未知的 Chrome 漏洞,帮助防御者在攻击者之前掌握情报。这缩短了防御窗口,但需身份验证才能使用。
Unsloth 推出桌面应用,可在本地运行和训练模型,支持 Windows、macOS 和 Linux,集成自愈式工具调用和沙箱代码执行,将工具调用准确率提升高达 50%,并可运行 Muse Glimmer、Kimi K3 等最新模型以及生成视频和图像。这让开发者一站式完成研究、导出和部署。
vLLM v0.27.1 作为补丁版本,新增对量化 DSpark Markov heads 的支持,进一步完善推理性能。
Nvidia guarantees its own chips' value to unlock $500 billion in AI infrastructure financing
英伟达联合 Apollo、BlackRock 等金融巨头为 AI 基础设施融资超 5000 亿美元,并为其硬件残值提供最高 25% 的保底担保,以吸引投资者。此举标志着 GPU 资产加速金融化,但英格兰银行已警告若 AI 行业受冲击可能引发系统性风险。
Ollama v0.32.8 将 Muse Glimmer 模型带到所有平台,并借助 MLX 引擎在 Apple Silicon 上提供最优性能,支持 DFlash 和图像输入,可直接驱动 Claude Code 等编码代理与长期助手,便于开发者在本地运行高性能代理。
llama.cpp 更新 OpenCL 后端,在局部内存中转置 K 分块来加速 FlashAttention 预填充核,从而提升推理效率。
微软正式发布 Agent Framework Harness 和 Hosted Agents
微软正式发布 Agent Framework Harness 和 Hosted Agents,为构建和托管智能体提供框架与服务。这标志着微软在智能体基础设施上进一步发力,方便从业者快速开发和部署智能体。
Meta’s new Glimmer AI model offers a hint at Zuckerberg’s personal intelligence vision
Meta 发布开源权重模型 Muse Glimmer,透露出扎克伯格对个人超级智能的构想,并凸显了可控私有 AI 与封闭服务之间的路线分化。这对关注开源和个性化 AI 的从业者而言是一个信号。
Deploying Anthropic Claude apps gateway for AWS for enterprise workloads
AWS 发布 Claude apps gateway 的生产参考部署,该自托管治理层连接 Claude Code 和 Claude Desktop 与 Amazon Bedrock,为企业安全使用 Claude 编码和桌面工具提供端到端架构、部署模式及成本方案。这对希望将 Claude 整合进企业工作流的团队有直接参考价值。
Thinking of ACE? We Can Do It with Fewer Tokens
HuggingFace 博客探讨 ACE 方法,声称用更少 Token 即可实现,暗示在推理效率和成本控制上有优化空间,对关注推理经济性的从业者有启发。
Ollama v0.32.9 集成了 NVIDIA Nemotron 3.5 Lightning,这是一个 30B 参数的 MoE 模型,仅 3B 活跃参数,专为常驻智能体设计,并配套 NemoClaw 安全栈。开发者可本地轻松运行高效代理,无需远程依赖。
NVIDIA and Local AI Community Fuel Open Source Models and Intelligent Agents
NVIDIA 联合开源社区推动本地 AI 发展,发布开放模型与软件,赋能开发者构建和定制智能体,强调本地运行的趋势。这对追求隐私和低延迟代理的从业者是一大利好。
这篇分析揭示了一家新能源企业如何支撑全球最大 AI 算力单体,突显电力供应正成为算力竞争的关键瓶颈,对关注数据中心建设的从业者有参考意义。
Anthropic signs $9.1 billion data center deal with Bitcoin miner Riot Platforms
Anthropic 与比特币矿商 Riot Platforms 签订 91 亿美元数据中心租约,获取 191 兆瓦容量,并可扩展至 161 亿美元,反映出 AI 公司大规模抢占电力与算力基础设施的态势,对行业竞争格局有深远影响。
开源LangAlpha正式发布:金融领域的Claude Code,用自然语言驱动投研工作流
开源项目 LangAlpha 正式发布,定位金融领域的 Claude Code,用自然语言驱动投研工作流,简化金融分析自动化。这为金融从业者提供了自行部署智能投研助手的可能。
viable/strict/1786447994: [Profiler] Refactor test_trace_validator.py (#185617)
PyTorch 重构 Profiler 中的 trace_validator 测试,将测试解耦 CUDA,分为加速器无关和加速器相关类,使新硬件后端可以复用测试套件,这对支持多种硬件的团队提高了可维护性。
PyTorch Inductor 在融合搜索中缓存每个节点的分块内存,降低重复计算开销,提升编译效率。
PyTorch Inductor 修复 FXIR 后端在处理复合符号整数图输入时的崩溃问题,增强了鲁棒性。
PyTorch 性能优化,在 SymNode.expr 和张量相关操作中避免重复计算不变量,减少不必要的开销,提升整体推理速度。
PyTorch Inductor 的 addmm 自动调优现在能正确处理带偏置的示例输入,这对 PrismNet 等场景有直接性能改善。
英伟达拉上华尔街开启 5000 亿美元 AI 基础设施融资并担保 GPU 残值,让 GPU 像理财产品一样被金融化,可能改变 AI 算力的投资分配方式。
当AI开始“自作主张”,谁来为智能体戴上“项圈”?全球AI安全实战化大考,中国方案打入前三
全球 AI 安全实战评测中,中国方案 DoGNAVY 位列前三,显示出在智能体自主行为约束和安全控制上的前沿探索,对关注智能体安全落地的从业者有示范意义。
llama.cpp CI 切换至 ROCm 7.14,该版本采用 TheRock 构建系统,支持多架构安装,并更新了 Windows 构建流程,为 AMD GPU 用户带来更稳定的发布。
Ray 2.57.0 发布,Ray Data 默认启用 DataSourceV2 支持行组感知分块和谓词分割,同时 Hash Shuffle V2 用无状态任务替代聚合器池,改善内存管理与容错能力,提升数据处理效率。
llama.cpp 新增后端多输出采样支持,可配合 token 猜测提升效率,并修复了 CPU 与 GPU 采样不一致的问题,对需要推测解码的场景有直接价值。
llama.cpp 修复 CUDA 和 Metal 后端的 ROLL 操作因未检查连续输入而导致的静默错误,确保正确性,避免潜在计算偏差。
HuggingFace 发布教程,指导使用 NVIDIA Magpie TTS 构建低延迟多语言语音代理,该模型开源权重且支持完全部署控制,适合需要定制语音交互的开发者。
Unsloth 发布 v0.1.62-beta 版本,主要修复诸多错误,提升稳定性。
Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
Ouroboros 是一个自我进化的编码代理,其工具、提示、上下文组装和核心逻辑通过受审核的代码提交不断演化,这些提交直接成为后续工作的运行时。它支持递归自由进化和经验驱动进化两种模式,前者将改进本身作为任务、自动调度新一轮循环,后者利用日常任务和交互中暴露的缺陷与粗糙点来驱动核心修正,让代理的自我完善既灵活又有实用根基。
Motif 3 是一个大规模稀疏 MoE 语言模型,引入分组差分潜在注意力机制并结合一系列专门训练技术,在推理、编码和长上下文任务上取得了强劲表现。它的设计试图在极高效率下同时覆盖需要短程与超长程依赖的场景。
Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
Macaron-V1 是一套开放的代理模型家族,基于 Mixture-of-LoRA 架构和递归自我改进机制,使单个模型能够跨多个专业任务持续学习并协作,避免了灾难性遗忘和孤岛化。其核心思路是将不同技能的 LoRA 混合并与自进化流程结合,让持续学习从实验室走向实用。
OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetching
OasisKV 将 LLM 推理期间完整的 KV 缓存存放在容量更大但速度较慢的内存层中,利用推测解码产生的前瞻序列来预测并只预取相关的键值对到 HBM,实现稀疏预取。这种方法有效突破 HBM 容量瓶颈,提升了长上下文推理的吞吐量。
Fusion Training for Mathematical Generalization in Large Language Models
该工作系统研究了思考模式融合(TMF)在大模型数学推理中的训练动态,重点分析了思维模式与非思维模式之间的数据配比和训练调度对模型泛化的影响。通过数学领域的实验,揭示了不同融合策略如何影响模型从简洁回答到长链推理的弹性切换能力。
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
SWE-Bench ProMax 针对现有编码基准测试过饱和以及评估质量缺陷,构建了一个面向大型真实项目的多语言代码重构基准,要求代理执行长期规划、跨文件修改等更复杂的重构任务。它旨在迫使模型展现真正的软件工程能力,而非靠记忆训练数据中的补丁通过测试。
Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory
通过将大型教师代理的分层记忆结构直接蒸馏给小型语言模型,无需任何额外微调即可显著提升小模型的工具使用能力。这种记忆迁移保留了任务执行过程中积累的结构化知识,让小模型也能像大模型一样高效地调用工具。
SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
SPOT 在策略蒸馏中采用稀疏探测,仅对模型预测不确定的位置进行针对性询问,并根据下游任务最终结果来校准蒸馏目标,从而避免无效采样。这一设计有效提升了推理模型蒸馏后的推理质量和生成覆盖度,在保持效率的同时防止模式坍缩。
Scaling Inherently Interpretable Language Models
该研究将可解释性作为训练约束,直接编码到模型结构或训练目标中,得到可扩展的解耦表征。这样训练出的模型不需要二次微调就能支持特征归因、知识检索和表征操控,为构建原生可解释的大模型提供了一条可行路径。
RoMeRL 针对自进化代理中记忆-奖励陷阱和反馈覆盖不平衡,提出将高维的轨迹级记忆效用降维到固定维度的任务级状态,让反馈信号更集中且不易被污染。这种简约状态帮助 LLM 代理在更新长期记忆时更稳定地提升性能。
Evidence-RL: Towards Evidence-intensive Visual Reasoning
Evidence-RL 在视觉推理的强化学习后训练中引入反事实证据解耦,通过审计模型答案是否因果依赖于局部视觉证据,迫使模型真正“看”到关键区域。这种方法提升了视觉问答和解释的可靠性,减少语言偏见的干扰。
SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification
SymDiag 将 LLM 推理验证重新定义为故障诊断:先将思维链转为符号约束,再逐步检查可满足性,并能分离“翻译错误”和“推理错误”,提供可回溯的步骤级诊断证据。这让黑箱推理的调试变得可解释且可验证。
WeClawArena 是一个可审计的沙盒和多代理基准,专门测试多个代理在个人工作空间之间的协作任务效用和安全攻击成功率。它为研究人中心代理网络中的协作与安全提供了标准化环境,使安全漏洞可量化。
Omega-S: A Functional Resilience Index for LLM Fine-Tuning
Omega-S 是一种无数据依赖的轻量正则化项,用于 LoRA 等低秩微调,通过在训练中惩罚权重矩阵节点度的方差,有效抑制对原始能力的遗忘。它能在不掉点的情况下显著提升微调后模型的保留率。
BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
BDH-CQ 是一个仅 150M 参数的推理模型,它结合循环潜在推理和上下文学习,在 ARC-AGI-1 基准上达到了新的成本-准确率前沿,表明小模型通过精巧的推理机制也能挑战复杂推理任务。
Evo-Bench: Can Language Models Improve Agent Harness?
Evo-Bench 评估语言模型自主优化代理框架的能力,采用敏感性感知任务构造方式,揭示了不同领域间进化收益的巨大差异。它帮助研究者理解在哪些场景下让模型自动改进其工具和提示更有效。
A^2E : An End-to-End Agent Auditing Engine
A2E 是一套端到端代理审计引擎,采用标准化任务协议并采集执行轨迹,从效率、工具使用、规划和错误恢复四个维度全面评估代理框架的质量。它为代理系统的迭代提供了系统化的评测手段。
The Loss Does Not See the Basis, but Adam Does
该研究揭示在分解矩阵的模型训练中,损失本身对坐标基底不敏感,但 Adam 等坐标式优化器会破坏低秩偏向,导致 Transformer 等模型中解发散。这一发现解释了为何不同优化器会在看似等价的表示空间中表现出截然不同的收敛行为。
Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains
Sci-VBench 构建了包含 1253 个专家标注示例的科学视频生成基准,覆盖自然科学、医疗健康、社会科学和工程四大学科,要求模型生成符合科学知识与动态推理的视频。它为多模态模型的知识密集型视频合成提供了系统评估平台。
DSLE: A Learning Environment for Dark Souls Boss Encounters
Dark Souls Learning Environment (DSLE) 将《黑暗之魂》全部 22 场首领战封装为 Gymnasium 接口的强化学习环境,提供实时战斗、高维视觉输入和稀疏奖励,用于评测游戏代理的感知与决策能力。同时定义了 DSLE-5 子集以便快速比较。