NVIDIA Vera Rubin Driving Performance Per Watt, Lowest Token Cost for Partners Worldwide
NVIDIA Vera Rubin NVL72 正大规模量产,已部署于 CoreWeave、Google Cloud 等合作伙伴,拥有业界最大机架供应链。这款产品将提供最低 token 成本,为 AI 工厂时代奠定算力基础。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
跨年累积的 AI 精选:顶会顶刊高被引论文(全领域,按**具体会刊**分组)+ 各厂商实验室论文与官方动态;多源召回 + 大模型相关性精筛,每周自动维护;支持自助检索 arXiv 添加并自动归类。
NVIDIA Vera Rubin Driving Performance Per Watt, Lowest Token Cost for Partners Worldwide
NVIDIA Vera Rubin NVL72 正大规模量产,已部署于 CoreWeave、Google Cloud 等合作伙伴,拥有业界最大机架供应链。这款产品将提供最低 token 成本,为 AI 工厂时代奠定算力基础。
Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
Google 发布 Gemini 新版本,包括 3.6 Flash 及 3.5 Flash 的 Lite 和 Cyber 变体,持续拓宽 Gemini Flash 系列的速度、成本与安全选项,为开发者提供更灵活的选择。
Inside NVIDIA Rubin GPU Architecture: Powering the Era of Agentic AI
NVIDIA 透露 Rubin GPU 架构细节,专为 Agentic AI 时代设计,从训练向持续生产智能的 AI 工厂演进,有望在能效与扩展性上实现飞跃。
NVIDIA Vera CPU: Olympus Cores Built for Maximum Single-Thread Performance in Agentic AI
NVIDIA Vera CPU 采用 Olympus 核心,针对智能体工作负载的单线程性能进行极致优化,确保代码执行、工具调用和上下文检索的高吞吐,是 Agentic AI 的关键算力支柱。
据传 Google 正在开发「Frozen v2」芯片,将 Gemini 架构直接固化到硅片中,预估推理效率可达当前 TPU 的 6-10 倍,计划 2028 年推出,可能大幅降低 AI 推理成本并建立价格优势。
Alibaba's Qwen-Image-3.0 renders full infographic grids and readable ten-pixel text in a single pass
阿里 Qwen-Image-3.0 支持最长 4500 token 提示,能原生渲染十二种语言,可一次性生成包含十像素可读文字的信息图、报纸样式等复杂版面,大幅提升了文本到图像在精确排版上的实用性。
该提交为 llama.cpp 的 CUDA 后端 get_rows 操作引入了向量化复制,使用 int4 一次搬运 16 字节,并将行不变计算提取到循环外。对于同类型、连续数据场景,这能有效提升大规模嵌入查表的吞吐。
Setting a World Record for MoE Pre-Training on NVIDIA GB300 NVL72
NVIDIA 宣布在 GB300 NVL72 系统上创造了 MoE 预训练的世界纪录,展示了该平台支撑万卡级混合专家模型训练的极致性能,为前沿模型训练提供了可复现的高效方案。
NVIDIA 开源了 4B 参数的 Cosmos 3 Edge 世界模型,能在设备端实时推理并生成机器人动作。它让视觉智能体在本地理解环境、规划行动,大大降低了云端依赖,有利于机器人普及。
Environment-free Synthetic Data Generation for API-Calling Agents
Apple 研究提出无环境合成数据生成方法,仅凭 API 规格即可用 LLM 模拟世界状态生成训练轨迹,消除环境搭建瓶颈,可加速 API 调用智能体的开发。
Accelerating Text-to-Video Generation with Calibrated Sparse Attention
Apple 的研究发现扩散视频生成器中许多时空注意力连接贡献极低且模式可预测,因此提出校准稀疏注意力,跳过大量无效计算,从而大幅加速文本到视频的生成,同时保持画质。
Built for Vera Rubin, NVIDIA Spectrum-6 Arrives in Gigascale AI Factories
NVIDIA Spectrum-6 网络平台专为 Vera Rubin 架构和超大规模 AI 工厂设计,将网络性能与 token 生成紧密耦合,成为 gigascale 计算的关键乘法器,确保百万卡集群的高效互联。
A Fireside Chat with Cat and Thariq from the Claude Code team
Simon Willison 在 AI Engineer World's Fair 上与 Anthropic Claude Code 团队的 Cat Wu 和 Thariq Shihipar 进行炉边对话,讨论了 Claude Code、Claude Tag、Fable 等工具,以及编码智能体安全、评估与工具设计。对话完整视频已在 YouTube 发布,为开发者理解 Anthropic 如何内部使用这些工具提供了直接视角。
Alibaba's Qwen Audio 3.0 TTS Plus tops the competition in the text-to-speech rankings
阿里通义实验室的 Qwen Audio 3.0 TTS Plus 登顶 Artificial Analysis 的 Speech Arena 排行榜,支持 16 种语言,并允许用户通过自然语言或标签控制说话风格。但其生成速度仅为每秒 16 个字符,远慢于竞争对手 Sonic 3.5 和 Simba 3.2。
NVIDIA Megatron Core 发布 v0.18.2 版本,新增快速 Hadamard 变换支持,将 flash_mla 指向 nv_dev 分支,并修复了 TE 交叉熵损失融合等问题,持续优化大模型训练框架。
Google is working on a new AI chip designed to make Gemini more efficient
据 TechCrunch 报道,谷歌母公司 Alphabet 正在开发一款专为提升 Gemini 模型运行效率而设计的新型 AI 芯片,旨在进一步优化推理性能与成本。
阿里通义实验室推出生产级文本到语音系统 Qwen-Audio-3.0-TTS,分为面向实时交互的 Flash 版和追求高质量生成的 Plus 版,通过阿里云 Model Studio 提供托管服务,重点解决延迟与多语种等生产痛点。
AI’s most important protocol is getting a little bit easier to use
AI 领域最重要的协议迎来易用性改进,服务端采用更宽松的无状态方式处理会话 ID,类似普通网站,降低了开发者集成门槛。此举很可能指向模型上下文协议 MCP。
国产GPU分水岭时刻:当别家还在卷参数,摩尔线程早已训练出了世界模型
国产 GPU 迎来分水岭时刻,摩尔线程不仅停留在参数竞争,更已实际训练出世界模型,展示了其在 AI 训练方面的突破与从芯片到应用的全栈能力。
Nvidia's grip on AI chips weakens as Microsoft turns to AMD and Anthropic may follow
微软正通过 AMD 新 Helios 平台扩充 Azure AI 基础设施,预计 2026 年下半年挑战 NVIDIA GPU 体系;同时 Anthropic 的 GitHub 信息显示其也在测试 AMD 硬件,或将削弱 NVIDIA 的定价控制力。
无问芯穹夏立雪:数字世界与物理世界的所有AI生产力运行,都需要 Agentic Infra
无问芯穹 CEO 夏立雪提出,数字世界与物理世界的所有 AI 生产力运行都需要 Agentic Infra,强调面向智能体的基础设施将成为未来 AI 落地的关键底座。
魔搭社区 ms-swift 微调框架发布 v4.4.2 补丁版本,修复问题并提升稳定性,为大模型高效微调提供更可靠的工具。
trunk/06174e293ac0715a31f0883b9b38a0137904a20d
PyTorch 的 MPS 后端新增对 layer_norm 前向和反向传播中混合精度仿射参数的支持,使 Mac 设备上的模型训练与推理更加灵活高效。
微软跟进谷歌支持 Go 语言开发 AI 智能体,OpenAI 与 Anthropic 落后一步
微软跟随谷歌步伐,官方支持使用 Go 语言开发 AI 智能体,而 OpenAI 与 Anthropic 在此语言支持上暂时落后,有助于拓宽智能体开发生态的语言覆盖面。
Nativ: Run AI models locally on your Mac
开发者 Prince Canuma 发布了基于 MLX 的 Mac 桌面应用 Nativ,支持本地运行视觉大语言模型,提供聊天界面和 localhost API 服务器,并能自动识别已缓存的模型,大幅降低了 Mac 上本地 AI 的使用门槛。
trunk/6677704253c1058a54e4e8b7a104822f7fd0fc63
PyTorch CUPTI 性能分析器更新,支持将图中捕获的内核重新分配到可插拔的逻辑流,增强了 GPU 性能分析的灵活性。
WAIC重磅成果|上海仪电智算牵头成立“智算系统架构联盟”并发布《超节点系统架构规范》
WAIC 上,上海仪电智算牵头成立智算系统架构联盟,并发布《超节点系统架构规范》,致力于推动智算基础设施的标准化与互联互通。
Xiaomi-Robotics-1 shows that more data beats bigger models when training robots to move
小米训练机器人运动模型 Xiaomi-Robotics-1 时发现,使用超过 10 万小时的人类遥操作数据带来的性能提升远超单纯增大模型规模,且增益尚未见顶,但绝对成功率仍较低,凸显数据规模在具身智能中的重要性。
PyTorch 为 torch.cuda.CUDAGraph 新增销毁回调与对象保留机制,使图的生命周期管理更精细,便于释放资源或复用内存。
Anthropic’s landmark $1.5B copyright settlement is approved
Anthropic 15 亿美元版权诉讼和解获最终批准,标志着该公司在版权争议上迈出一步,但并未解决使用版权作品训练 AI 模型这一更广泛的行业难题。
llama.cpp 为 Hexagon 后端新增 CLAMP 算子,扩展了在高通 DSP 等移动芯片上的算子覆盖度,提升移动端推理兼容性。
v0.32.2-rc0: cuda: add CC 10.0 for linux in CUDA v12 (#17025)
Ollama 发布 v0.32.2-rc0 预发布版,在 Linux CUDA v12 预设中添加计算能力 10.0,让 B200 等新一代 GPU 可以在不满足 CUDA v13 驱动最低要求时仍使用 CUDA v12 后端。
Build specialized agent workflows for your business with Amazon Quick and NVIDIA NeMo Agent Toolkit
文章展示了通过 Amazon Quick 作为业务入口,结合 NVIDIA NeMo Agent Toolkit 构建供应链风险缓解等专业代理工作流的方法,实现从看板到指导建议的闭环。
PyTorch 优化了优化器步骤钩子的排序逻辑,确保 pre 钩子始终在 step 之前、post 钩子在 step 之后执行,解决了全局与局部钩子的顺序问题。
Microsoft and Mistral strike multi-billion-dollar deal to build AI infrastructure across Europe
微软与 Mistral 扩大战略合作,达成数十亿美元协议,将在欧洲共同建设 AI 基础设施,加速该地区的 AI 能力发展。
PyTorch 修复了 MPS 后端在 F.linear 带偏置且批次维度超过一定阈值时导致行数据损坏的问题,提升了 Mac 上模型运行的健壮性。
WAIC 上宣布上海市教育算力专区正式开启试运行,为高校教育提供专用 AI 算力资源,支撑 AI 人才培养与科研创新。
WAIC重磅成果|仪电智算云在国家人工智能应用中试基地建设中展现全栈服务能力
仪电智算云在国家人工智能应用中试基地建设中,展示了从基础设施到平台服务的全栈能力,助力 AI 应用从孵化到落地。
trunk/75604cd11166d622cb55f7a177f7e9eaa3e54f99
PyTorch 针对 XPU 设备跳过不兼容的精度模拟测试,确保在 Intel GPU 上的相关功能测试更稳定。
神州数码发布企业AI流程系统与智算产品,尝试打通应用和算力两端
神州数码发布企业 AI 流程系统和智算产品,旨在打通 AI 应用与底层算力,为行业客户提供端到端的 AI 解决方案。
RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
RynnBrain 1.1 系列具身基础模型覆盖 2B 到 122B-A10B 多种规模,在统一时空物理框架下实现了感知、定位、规划等能力。相比前代,该版本新增了接触点预测,并在小型号上引入原生 3D 对齐,使表征能更直接地服务于机器人操作。该工作为通用物理世界大模型提供了更完整的基准。
📖 阅读⬇ PDFDistilled Reinforcement Learning for LLM Post-training
针对大模型后训练中强化学习粗粒度监督与在线蒸馏教师信号贫乏的两难,本文提出蒸馏强化学习,结合过程级奖励与教师知识。方法通过解耦信用分配与知识传递,缓解了单一范式下的学习瓶颈。在推理和对齐任务上,该方法能有效提升模型性能与泛化能力。
📖 阅读⬇ PDFDeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
为突破搜索智能体利用自身经验学习的瓶颈,该工作构建了一个可复现的确定性搜索环境 DeepSearch-World,并设计自蒸馏框架 DeepSearch-Evolve。智能体在 420K 多跳问答任务上迭代探索,从自身轨迹中蒸馏出更优策略,无需外部教师。实验表明该方法显著提升了深度搜索任务的成功率与效率。
📖 阅读⬇ PDFSWE-Pruner Pro: The Coder LLM Already Knows What to Prune
编程智能体在读取工具输出时,其内部表征本身就暗含了代码片段的关联程度。基于这一发现,SWE-Pruner Pro 省去了额外的分类器,直接在智能体内部附加轻量头来预测每个片段的保留价值,实现更轻量、更精准的上下文裁剪。该方法在维持代码修复性能的同时显著缩短上下文长度,对开发者而言意味着更低的推理成本。
📖 阅读⬇ PDFGigaChat Audio: Time-aware Large Audio Language Model
GigaChat Audio 为长音频(最长 120 分钟)设计了时间感知机制,在音频令牌中交错插入周期性的时间标记,并通过级联合成监督训练,让模型能以显式时间戳回答问题。该模型在长短音频基准上都取得了领先的时间定位准确度,并能生成带时间锚点的片段描述,为语音助手等应用提供了精细的时间理解能力。
📖 阅读⬇ PDFGroup Entropy-Controlled Policy Optimization
在异质任务混合训练中,相同策略下的不同任务对探索程度需求不同,全局熵控制难以兼顾。本文提出分组熵控制策略优化,根据任务难度自适应调节各组熵预算,并重构 GRPO 的优势归一化。该方案在多个 LLM 对齐任务上比全局控制带来更稳定的训练与更好的最终性能。
📖 阅读⬇ PDFLLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks
对于难以定义标量奖励的开放任务,本文将评分模型转化为「教练」,从每次生成中提取可迁移的经验教训,并以此调节教师模型,供策略模型内化。这种体验式学习避免了标量奖励的信息丢失,在非可验证任务上明显提升了生成质量与多样性。
📖 阅读⬇ PDFToken-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
TOPL 将后训练重新定义为词元级正确性预测,通过让模型学习区分回应中的好词与坏词来引导生成。这一设计规避了直接拟合离策略数据带来的分布偏移问题,在文档摘要任务上表现出很强的分布外忠实度,为可控生成提供了新思路。
📖 阅读⬇ PDF该框架将互动文学模拟建模为角色与世界协同演化的长程过程,角色交互、场景推进,状态持续更新。EvolvingWorld 提供开放模式基准,可评测角色与环境在长期互动中的一致性与丰富性。相比静态角色扮演,它更接近真实文学世界的动态叙事,对游戏与创意写作具有启发。
📖 阅读⬇ PDFGigaAM Multilingual: Foundation Model for Underrepresented Languages
GigaAM Multilingual 针对哈萨克语、吉尔吉斯语和乌兹别克语等低资源语言,用 200 万小时音频预训练 Conformer 编码器,并引入簇级数据平衡和领域微调策略。它大幅缩小了与高资源语言的 ASR 性能差距,证明了长尾语言也能受益于大规模基础模型。
📖 阅读⬇ PDFReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams
现有视频记忆系统围绕帧而非持久实体组织,导致长时间推理受限。ReflectWorld-MM 提出面向实体的多模态记忆系统,持续累积并更新对象的视觉、位置等属性。智能体可以围绕实体回忆历史、进行问答,极大提升了开放视频流的长程理解与推理能力。
📖 阅读⬇ PDFEnvironment-free Synthetic Data Generation for API-Calling Agents
针对 API 调用智能体数据采集需要完整环境后端的问题,本文仅凭 API 规格即可用 LLM 动态模拟世界状态并生成交互轨迹。这种无环境合成数据方法消除了环境搭建瓶颈,在样本效率与任务成功率上不输给真实环境数据,将极大加速 API 智能体的开发。
📖 阅读⬇ PDFThe Geometry of Semantic Space: A Continuous Geometric Framework for the Transformer Architecture
本文从「词元序列构成离散 1-流形」这一公设出发,将 Transformer 的核心组件统一为语义纤维丛上的积分微分方程,包括 RMSNorm、RoPE、注意力等。该连续几何框架提供了理解与设计 Transformer 的新视角,有助于导出更稳定的架构与训练方法。
📖 阅读⬇ PDFFlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
实时多模态应用需要将多个模型组合成流水线,并做出部署决策,现有服务系统优化选择有限。FlashRT 作为智能体部署的「马具」,能自动搜索最优的放置、流式传输和模型内并行策略,使开发者无需手工调优即可得到高性能实现,显著缩短新应用的部署周期。
📖 阅读⬇ PDFDiagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillation
多教师在策略蒸馏在训练工具使用智能体时,可能出现工具调用边界漂移的隐性行为偏移。本文诊断了这种现象,并提出校准方法,通过对齐教师间的决策边界确保学生模型稳定地掌握何时调用工具、何时直接回答。该工作为多教师蒸馏的实际落地扫清了关键隐患。
📖 阅读⬇ PDFMasked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
为强化学习智能体提供多样化训练环境,世界模型很有前景,但自回归模型易产生模式坍塌。本文提出用掩码扩散语言模型作为文本世界模型,其非自回归生成方式带来更好的状态多样性,且可通过掩码引导进行细粒度操控。在智能体 RL 中,它能替代模拟器,并保持了与真实环境相当的训练效果。
📖 阅读⬇ PDFIt's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief
该研究系统评估了 LLM 对用户不同信念表达形式的敏感性,包括预设、传信标记和语气等。提出类型学分类,发现某些表达会显著干扰模型坚持已知事实。这项工作揭示了对话微妙的语用因素对模型可信度的潜在影响,对安全部署有警示意义。
TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
视频 MLLM 常能描述内容,却难准确定位证据出现的时间。TimeLens2 定义了一种通用视频时间定位任务,要求模型预测变基数证据区间,并设计了贴合该集合预测的训练策略。新方法在多种视频长度、领域和查询下均表现出色,使视频问答进入可验证的证据级理解阶段。
📖 阅读⬇ PDFOpen-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
Open-AoE 提供了从手机采集到模型训练的全流程开源工具链和约 2000 小时的自我中心操作视频数据集,内含结构化操作注释。它填补了低成本高质量具身数据获取与复用工具的缺口,便于社区直接用于机器人操作学习,有望加速具身智能的普及。
📖 阅读⬇ PDFO-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
工业视频异常检测面临复杂物体变换和严格规程,通用 VLM 方法效果下降。O-VAD 采取以物体为中心的跟踪与推理,显式建模帧间物体状态演化和过程约束,从而更可靠地检出违反规则的细微异常,为智能制造场景提供了更可靠的视觉质检方案。