OpenAI signs record Ohio data center lease with Nvidia backing up to $105 billion
OpenAI 在俄亥俄州签下 20 年、8 吉瓦的数据中心租约,Nvidia 提供最高 1050 亿美元的设施残值担保并锁定独家芯片供应。这反映出头部 AI 厂商正把算力基础设施建设推向空前规模,但也让巨额表外承诺成为从业者需要关注的系统性风险。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
OpenAI signs record Ohio data center lease with Nvidia backing up to $105 billion
OpenAI 在俄亥俄州签下 20 年、8 吉瓦的数据中心租约,Nvidia 提供最高 1050 亿美元的设施残值担保并锁定独家芯片供应。这反映出头部 AI 厂商正把算力基础设施建设推向空前规模,但也让巨额表外承诺成为从业者需要关注的系统性风险。
编程能力提高50%!GLM-5.3 满分通过了GPT-5.6给的Coding 测试
智谱发布 GLM-5.3,声称编程能力提升 50%,并在 GPT-5.6 给出的 Coding 测试中获得满分。这一结果如果属实,意味着国产模型在代码生成领域已具备与前沿闭源模型竞争的实力。
Distributed Layerwise Offload: Scaling Toward 200B+ DiT Models Efficiently in vLLM-Omni
vLLM-Omni 引入分布式逐层卸载,将 DiT 权重分片并跨设备流式加载,在 64GB HBM 上成功服务 124GB 的 Cosmos3 模型,并规划扩展到 200B 以上。这对在有限显存环境下运行超大扩散 Transformer 推理具有重要意义,显著降低了硬件门槛。
Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
Qwen 3.8 27B 作为 Apache 2 许可的 27B 视觉模型,在笔记本等设备上尺寸合适,自报基准相比前代和 Qwen 3.7-Plus 有显著提升。不过它默认存在严重过度思考问题,可能影响实际推理体验。从业者需要关注其推理模式的默认配置与可控性。
从模型能力到工程优化,海外开发者正在“榨干” Qwen3.8-27B
海外开发者围绕 Qwen3.8-27B 从模型能力到推理工程展开深度优化,试图充分释放其 27B 规模在本地部署中的潜力。这一现象反映出开源模型生态的活跃度,也说明 Qwen 3.8 已成为开发者探索效率极限的重要载体。
盘古训练与推理通信优化实践:亲和昇腾平台的性能探索|AICon深圳
盘古团队在 AICon 深圳分享面向昇腾平台的训练与推理通信优化实践,针对亲和昇腾硬件做性能调优。对国产算力用户来说,这些工程经验有助于提升大模型在异构平台上的通信效率和整体性能。
Netflix详述其基于Triton与vLLM的内部LLM服务平台
Netflix 详细介绍了内部 LLM 服务平台的架构,该平台基于 Triton 与 vLLM 构建,用于支撑其内部推理需求。这对企业级 LLM 服务平台的选型与落地具有借鉴意义,展示了如何组合成熟开源组件以兼顾性能与易用性。
终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成
世界模型实现 24FPS 画面与 48kHz 立体声的实时生成,并即将完全开源,标志着多媒体世界模型进入有声音频同步的新阶段。这为交互式内容生成、游戏和具身仿真等场景带来更丰富的感官环境,开源将加速社区跟进。
llama.cpp 的 SYCL 后端修复了量化拷贝内核的线程与块数量配置,使其与量化尺寸成比例,减少订阅不足或过度。在 Arc 70 上 q4_0 到 f32 路径吞吐从 20.21 GB/s 跃升至 158.19 GB/s,其余量化格式性能持平。这对在 Intel GPU 上运行量化推理的用户是显著加速。
GLM-5.3 🤖, Stripe OpenRouter deal 💰, AI agent consensus 🤝
本期 TLDR AI 涵盖 GLM-5.3 发布、Stripe 与 OpenRouter 合作以及 AI 智能体共识等动态。这些事件分别反映模型能力、支付与智能体交易基础设施以及行业对齐的进展。可作为快速了解近期 AI 热点的入口。
Nvidia investing $1.5B in SoftBank data center developer behind OpenAI project
Nvidia 向软银旗下数据中心开发商投资 15 亿美元,以确保其芯片为 OpenAI 数据中心项目提供算力。此举进一步绑定 Nvidia 与 OpenAI 的算力供应链,凸显芯片厂商通过资本介入数据中心建设来锁定订单的趋势。
llama.cpp 发布 v0.1.1 版本,这是一个维护性更新。对于依赖 llama.cpp 进行本地推理的开发者,跟随该版本可获得最新修复与稳定性改进。
Securing the Infrastructure of Intelligence
NVIDIA 将 AI 工厂定位为 AI 时代的关键基础设施,强调在 AI 经济中算力直接等同于营收,并指出其依赖先进芯片、封装、内存、网络以及土地、电力等全栈资源。这篇博文把基础设施安全与供应链韧性放到 AI 工厂规模化落地的核心位置,对算力建设方和运营方都有警示意义。
甲骨文企业AI战略曝光:Agent进数据库、GPU跑满、多云砍掉流量费
甲骨文企业 AI 战略的核心方向包括让智能体进入数据库、充分跑满 GPU,并取消多云流量费。这意味着甲骨文正从数据库能力和云成本结构两端切入企业智能体与推理市场,对采用多云架构的团队有直接成本影响。
llama.cpp 发布 v0.1.0 版本,标志项目进入新的版本阶段。对于本地推理和模型部署用户来说,这类版本号变更可能伴随接口或行为调整,升级前应关注发布说明。
快讯|范式PhanRouter上线智谱GLM-5.3,即日开放调用
智谱 GLM-5.3 已在范式 PhanRouter 上线并即日开放调用,开发者可以通过该路由平台接入新模型。这是 GLM 最新版本的首发渠道之一,为希望快速评测和集成 GLM-5.3 的团队提供了新入口。
llama.cpp 的这个提交为 SYCL 后端新增 OPT_STEP_ADAMW 和 OPT_STEP_SGD 算子支持,并同步更新 ops 文档。这意味着在 Intel GPU 等 SYCL 设备上,优化器步骤相关算子的覆盖更完整。
Ollama v0.32.14 为 llama-server 渲染器加入 WebP 图像转码,并修复 Qwen 对非开头系统消息的容忍问题。这次更新改善了多模态输入处理和 Qwen 模型提示模板的兼容性。
We Tracked a Shipment of Rare Books. It Ended at an Amazon AI Training Facility
Simon Willison 转述 404 Media 的调查,用 AirTag 追踪到一批稀有书籍最终流入亚马逊 AI 训练设施,印证了书商对匿名大宗购书用于扫描训练的怀疑。这为 AI 训练数据的版权与伦理争议提供了实证线索。
WorkSwarm:引领办公智能体新范式,让AI从一个助手,进化为一支与你并肩作战的团队
InfoQ 介绍了 WorkSwarm 的办公智能体新范式,目标是把 AI 从单一助手升级为一支能与用户并肩工作的团队。其意义在于推动办公场景从单智能体工具向多智能体协作演进。
AirTag reveals how Amazon destroys rare books for AI training
The Decoder 报道亚马逊大量购买纸质书,将其扫描为 AI 训练数据后销毁,AirTag 追踪揭露了这一过程。该报道再次引发对训练数据来源、版权处置和伦理边界的讨论。
AI 智能体改变代码评审逻辑,Rootly 废止小 PR 规则
Rootly 因 AI 智能体改变代码评审逻辑,废止了要求小 PR 的规则。这说明 AI 评审降低了大批量代码变更的认知负担,团队流程开始围绕智能体能力重新设计。
KDC 提出行动治理主张,强调工具调用成功只是执行层结果,不等于判断正确。这提醒智能体评测需要把动作结果与决策质量分开衡量,否则容易高估系统可靠性。
Instacart 推出 Blueberry AI 助手,帮助值班工程师处理线上故障
Instacart 推出 Blueberry AI 助手,用于帮助值班工程师处理线上故障。这一落地把 AI 助手带进故障响应链路,有望缩短问题发现和恢复时间。
Dropbox 集成 MCP 与 Dash,将安全设计与代码审查连接起来
Dropbox 集成 MCP 与 Dash,将安全设计与代码审查连接起来。通过 MCP 打通这两类工具,安全策略可以更早进入开发流程,减少事后补救成本。
PyTorch 将 mean、var、std 等算子对整数输入的报错从 RuntimeError 改为 NotImplementedError,因为这些操作对整数是良定义的,只是尚未实现,且 NumPy 会提升为浮点。这改善了报错语义,便于开发者区分未实现能力与真实运行错误。
viable/strict/1786953788: [vllm hash update] update the pinned vllm hash (#193748)
PyTorch 的夜间自动提交更新了固定的 vLLM 哈希,保持 PyTorch 与 vLLM 集成版本同步。这对跟踪二者兼容性的开发者有参考价值,通常无需手工干预。
PyTorch trunk 分支自动更新固定的 vLLM 哈希,用于保持与 vLLM 集成的版本同步。该提交属于例行维护,对关注 PyTorch 与 vLLM 兼容性的用户有参考意义。
viable/strict/1786950615: [BE] Share matrix multiplication shape checks (#193583)
PyTorch 将多个矩阵乘法实现中重复的矩阵秩和收缩维度检查,统一到共享的 check_mm_shapes 辅助函数,并输出带操作前缀的一致诊断。这减少了重复代码,也提升了错误信息的可读性。
viable/strict/1786940949: [Dynamo] Trace requires_grad setattr on intermediates (#191129)
PyTorch Dynamo 修复了在 torch.compile 内部给中间张量设置 requires_grad=True 会导致图断裂的问题,改为复用 requires_grad_() 的追踪路径。这样在 fullgraph=True 下进行梯度控制更加顺畅,避免无谓的图回退。
PyTorch trunk 分支合入 Dynamo 修复,针对中间张量设置 requires_grad=True 导致图断裂的问题,改用 requires_grad_() 追踪路径。该改动改善了 fullgraph=True 场景下的编译稳定性。
Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
针对现有基础模型把知识存储与推理过程耦合导致知识压缩效率低、推理开销大的问题,Mobius-v0 将全局记忆存储与迭代式推理模块解耦,让知识检索和推理计算各自独立优化。该设计在更少的训练数据下取得了与同类模型相当的性能,同时显著加快推理速度。对需要高效部署大规模知识库并做多步推理的场景,这一分离架构提供了更灵活、低成本的路线。
Mimir v1 是一个 10 亿参数的层级推理模型,其特色在于只用可许可的后训练数据训练,规避了知识产权风险。尽管规模很小,它在多项英语基准上取得有竞争力的结果,并在丹麦语任务上达到最先进水平。这项工作表明小参数层级推理模型借助纯许可数据也能逼近前沿能力,对开源和合规场景很有价值。
Scaling Domain Data Repetition in LLM Pretraining
该研究探讨在模型规模与训练 token 数同比扩大的条件下,高质量领域数据的最优重复次数如何变化。结果发现最优重复随规模只有轻微上升,并且与领域验证损失相关,而不是与唯一数据量相关。这为预训练数据配比中的重复策略提供了更明确的缩放规律依据,能指导如何在高价值领域数据上分配计算。
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
针对当前智能体评测过度关注最终得分的问题,该工作系统评估了前沿自主智能体在长周期 AI 研究与开发任务中的表现。结果显示这些智能体在工程优化上表现突出,但性能不稳定、创新性有限,且经验复用存在波动。这些发现揭示了现有智能体在真实长期研发中的短板,为评估和迭代更可靠的研究型智能体提供了参考。
Dion3: Full-Stack Orthogonal Updates
Dion3 面向 Muon 优化器,针对其正交化和通信开销大的瓶颈,从算法、内核和更新规则三个层面同时做了优化。通过降低正交化计算量与通信量,显著加速了优化器运行。这对于大模型训练中采用 Muon 等正交更新方法的团队来说,意味着更低的训练成本和更高的吞吐。
Verifier-Induced Support Reshaping in On-Policy Optimization
该研究揭示了在带可验证奖励的在线策略强化学习中,模型在提升即时任务表现的同时,会减少未来训练所需成功响应的多样性,作者将这一现象称为「验证器诱导的支持重塑」。这种支持分布收窄可能损害后续探索和持续学习能力。对从业者而言,需要在在线 RL 优化中警惕验证器信号带来的隐式多样性损失,并考虑相应缓解策略。
该工作聚焦一个基于循环 Transformer 的 30 亿参数智能体模型在 Apple Silicon 上的部署问题。通过修复若干部署缺陷并采用分块预填充策略,降低了循环 Transformer 在长任务中的显存开销,使其能够可靠完成智能体任务。这为在端侧或 Mac 上运行循环架构的智能体模型提供了实用的工程经验。
SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation
SPARGen 将三维重建、稠密对应和空间推理统一到一个指令条件驱动的多模态生成模型中,通过原生生成方式联合学习共享空间表征。相比把多个空间任务拼接或级联的路线,这种统一架构能更好对齐视觉几何与语言推理。该工作为具身智能、空间理解等需要同时处理感知与推理的场景提供了新的模型设计思路。
Self-Supervised Visual On-Policy Distillation
该方法面向小视觉语言模型,通过自监督视觉在线策略蒸馏,从原始图像蒸馏到强增强的学生视图,全程无需特权标注或更大的教师模型。它用在线学习生成的伪视图构造监督,提升了小模型的视觉理解能力。这对于资源受限场景下提升多模态小模型性能很有意义。
Apodex Discovery 提出一个面向可验证、长周期 AI 调查任务的框架,配备重型求解器和结构化评估,覆盖真实世界科学任务。该框架使发现型 AI 的探索过程可被客观验证与量化,而不只是看最终答案。它为研究具备科学发现能力的智能体提供了基准和环境基础。
SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning
SimpleOPD 从长上下文推理教师模型向短上下文学生模型做在线策略蒸馏,通过对齐 token 跨度、限制长度增长和稳定训练,提升了数学证明推理能力并泛化到科学基准。该方法与 tokenizer 无关,实现简单,能有效降低长上下文推理的部署成本。对需要在有限上下文窗口内保持推理深度的场景很有吸引力。
MobileMem: Learning from a Year of Mobile Experiences
MobileMem 构建了一个用于评估设备端长期记忆的基准和框架,包含跨度一年、多模态的移动体验轨迹,要求模型具备时间推理、知识更新和偏好推断能力。这种年尺度轨迹对设备端记忆系统的持续学习和个性化提出了更高要求。该工作为移动端个人助理和记忆增强模型提供了贴近现实的评测标尺。
Latent On-Policy Self-Distillation
该方法从智能体自身经验中端到端学习隐式教学上下文,为在线策略训练提供密集的 token 级监督。相比稀疏奖励或外部教师信号,这种自蒸馏方式能更充分利用环境交互轨迹,提升智能体性能与样本效率。对强化学习场景下的智能体训练具有直接实用价值。
Claim-Level Reliability Assessment for Efficient Test-Time Reasoning
该工作提出在测试时通过验证关键声明而非采样更多解来提升推理准确率,从而在提高性能的同时降低 token 消耗。它把推理长度的扩张转化为对中间主张的可靠性评估,缓解了单纯堆算力的低效模式。这对推理增强系统的成本控制和精度优化都很有意义。
Second Thought: Reasoning in Parallel as LLM Agents Act and Observe
Second Thought 是一个免训练的框架,在智能体执行动作和等待观察的间隙并行运行辅助推理分支,以减少顺序解码轮次和交互回合数。它不牺牲准确率,却能缩短端到端响应时间。这对多轮工具调用或环境交互中的智能体延迟优化非常实用。
Multimodal Model Diffing for Feature Discovery and Control
MMDiff 利用多模态稀疏自编码器来隔离、检测和控制多模态语言模型中的特定特征,从而提升可解释性并实现对视觉与安全行为的定向干预。相比仅靠数值输出或注意力难以定位因果特征,该方法提供了更细粒度的特征操纵工具。这对多模态模型调试、安全对齐和可控生成都有帮助。
LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure
该工作构建了一个精心挑选的小学级预训练语料库和 50 亿参数模型,形成一个可控沙盒,用于研究知识获取、表示形成以及通过后训练和上下文学习实现的有界能力增长。这种受控知识暴露能隔离数据与模型能力之间的关系,避免大模型实验的混杂变量。它为理解语言模型的知识边界与学习动力学提供了干净的研究平台。
Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems
该研究发现多智能体临床委员会容易受到社会性合理捷径的影响,而非单一线索,且只有独立的裁判监督才能可靠检测出这种捷径采纳。这种捷径级联会损害系统在真实临床任务上的可靠性。该工作提醒医疗等高风险多智能体场景必须配置独立监督机制来对抗基准博弈。
UniProbe 是一个轻量可学习的幻觉检测器,利用有向图和交替的 GNN、ViT、GRU 模块识别冻结大视觉语言模型中幻觉 token,并支持生成过程中实时重采样。它不修改底层 VLM,却能在 token 级定位幻觉来源。这为大视觉语言模型的安全部署提供了一种灵活、低侵入的幻觉抑制方案。
Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models
该研究发现推理训练更多放大自我修正等审慎行为,而对置信度校准等高正确性相关行为的放大较弱,说明被放大的推理模式与正确性关联之间存在明显落差。这一差异提示仅观察推理行为频率无法可靠判断模型可靠性。对推理模型的评估和训练目标设计具有警示意义。