IsoExec: Unified Execution to Eliminate Trainer-Inference Mismatch in SkyRL
SkyRL推出IsoExec,统一vLLM与Megatron运行时之间的数值执行,把Qwen3.5-35B-A3B上rollout与训练logprob的平均差异降到1e-6以下,代价仅为25%开销,显著缓解训练推理不一致问题。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
IsoExec: Unified Execution to Eliminate Trainer-Inference Mismatch in SkyRL
SkyRL推出IsoExec,统一vLLM与Megatron运行时之间的数值执行,把Qwen3.5-35B-A3B上rollout与训练logprob的平均差异降到1e-6以下,代价仅为25%开销,显著缓解训练推理不一致问题。
NVIDIA的AVO智能体架构在ARC-AGI-3基准上达到100%成绩,展示了一种面向长程自主智能体的前沿级通用架构;它强调模型外围的harness系统与模型本身同样关键,为智能体系统设计提供了新参照。
GPT-5.6 Sol drives OpenAI's revenue surge as it regains ground on Anthropic
GPT-5.6 Sol发布后OpenAI本季度收入增长35%,企业收入增长超50%,并在商业API支出上首次反超Anthropic;这表明该模型正在帮助OpenAI重获企业市场优势。
Introducing cross-Region inference for OpenAI GPT-5.6 models on Amazon Bedrock
Amazon Bedrock在超过25个AWS区域上线OpenAI GPT-5.6系列模型,并通过跨区域推理配置文件路由请求以提高吞吐量;用户可通过OpenAI和Converse API调用,需要配置IAM、配额和监控。
Up to 3.2x Faster Inference with LFM2.5-DSpark
HuggingFace博客披露LFM2.5-DSpark实现最高3.2倍推理加速,这一提升对降低推理成本和提升服务吞吐有重要意义。
llama.cpp提交b10549为LFM2和LFM2MOE模型启用张量并行分割,允许在多设备上分配张量以支持更大模型或提升吞吐;该提交由deepseek-v4-flash辅助完成。
Nvidia is acquiring Poolside's "Model Factory" and 109 employees for $6 billion
Nvidia斥资60亿美元收购Poolside的Model Factory软件及109名员工,该软件用于构建AI模型;此举显示Nvidia在AI模型开发工具链上的扩张意图。
viable/strict/1787309845: Update torch-xpu-ops commit pin (#194185)
PyTorch更新torch-xpu-ops提交指针,为Intel XPU修复了混合精度元素运算寄存器溢出、group_reduce误中断、TopK NaN未定义行为以及量化dtype不匹配等问题,并转向纯SYCL编译。
v0.28.0rc2: [Spec Decode] DFlash2: local convolution + candidate selector (#52816)
vLLM v0.28.0rc2在投机解码中引入DFlash2,采用局部卷积和候选选择器来提升推测效率;该改动被cherry-pick到发布分支。
Latent Space报道Poolside以约120亿美元整体并入NVIDIA,其中创始人留任价值10亿、员工转移对价60亿,同时Infraco计划扩展至7GW neocloud;此交易结构引发关注。
llama.cpp提交b10545修复了Metal后端tensor API矩阵乘法内核在K维度不是32的倍数时读取越界的问题,通过在最后部分K tile钳制K extent避免未定义行为。
llama.cpp提交b10538针对Metal后端优化,仅在批量较大时对KV缓存执行反量化,以平衡计算与内存开销;该改动有助于提高大批量推理性能。
Ollama 发布「v0.32.15」,首次启动加入新桌面引导流程,并在请求间缓存已解析的模型元数据,将首 token 延迟从约 995 毫秒降至约 524 毫秒,近乎减半。同时修复流式解析错误后可能卡住的问题,规范 Qwen 3.8 系统消息处理,并更新 MLX 与 llama.cpp 依赖。
Maximizing AI Factory Performance per Watt with NVIDIA DSX MaxLPS
NVIDIA 提出「DSX MaxLPS」,针对电力受限的 AI 工厂,强调衡量每瓦特可产出的 AI 结果,而不再只看能塞进多少 GPU。这对数据中心规划者优化能效比有直接指导意义。
PyTorch 测试基础设施改动,将 autograd 的「test_functional.py」测试通用化,并尝试扩展至新硬件后端,以提升跨设备覆盖率。相关 CI 验证显示更多设备特性得到覆盖。
Where Security Fits in an AI Agent Stack
NVIDIA 开发者博客讨论 AI 智能体栈中安全应处的位置,指出随着智能体能力和运行周期增长,必须在应用层构建安全与信任。对开发者设计可审计、可控的智能体系统具有参考价值。
viable/strict/1787324349: [Test] Refactor `nn/test_init.py` and enable on XPU (#192052)
PyTorch 重构「nn/test_init.py」测试以支持 XPU,新增硬件分类、将测试类重命名为「TestNNInitDevice」,并用 @dtypes 装饰器替换参数化。重构后通过测试从 53 个增至 75 个,子测试从 56 个增至 84 个,XPU 覆盖明显扩大。
viable/strict/1787320905: Windows cleanup util rm dependency fix (#189857)
修复 PyTorch cpp_extension 测试清理工具在 Windows 上对 rm 命令的依赖,使其在未安装 git for windows 的 rm 时也能工作,并通过 shutil.rmtree 的错误处理机制绕过 WinError 5 权限错误。这对 Windows 开发者运行扩展测试更友好。
How mobility gives language models a deeper understanding of place
Google Research 分享关于移动性如何帮助语言模型加深对地点的理解,属于算法与理论方向。相关研究可能将位置语义与模型空间认知结合,提升对地理上下文的建模能力。
OpenAI 之后又是 Anthropic,Claude 将攻击延伸至公共互联网
InfoQ 中文报道 Anthropic 继 OpenAI 之后,将 Claude 的能力延伸至公共互联网,可能涉及在线搜索或网页交互。该动作标志着头部模型厂商在智能体联网能力上的竞争加剧。
viable/strict/1787313317: Remove the caffe2/core/macros.h placeholder (#194230)
PyTorch 移除「caffe2/core/macros.h」占位文件,该文件仅两行且真实内容由 cmake 生成,源码中已无引用;清理后消除 include 搜索路径的歧义,属于构建系统代码整理。
viable/strict/1787311590: Fix typos in comments, docstrings, and error messages (#185830)
该 PR 修正 torch 源码中注释、文档字符串和错误消息的拼写错误、缺失词语、标点问题及多余空格,均为字符串和注释变更,无功能影响。由 Claude 辅助完成。
将「test_stateless.py」中与设备相关的测试迁移到设备通用测试框架,以支持多硬件后端并提升测试覆盖。
llama.cpp 新增「--mmproj-device」参数,用于指定多模态投影模型加载的设备,并兼容「MTMD_BACKEND_DEVICE」环境变量及「-mmdev」短选项。该改动让多模态模型部署在不同设备上更灵活。
修复 Vulkan 后端 FA MMQ 量化计算中的精度问题,改用 fp32 进行 Q 量化计算,避免反量化值出现非规格化数导致 1/qd 溢出。提升 Vulkan 推理的数值稳定性。
国产“预制算力”来了:工厂预制率超90% 24小时内投运 交付效率提升70%
国产预制算力方案出现,工厂预制率超 90%,可在 24 小时内投运,交付效率提升 70%。这类预制化模式可大幅缩短算力中心建设周期,对 AI Infra 快速扩容很有价值。
The /wayfinder Skill: Navigating the “Fog of War” of Planning
Matt Pocock 介绍 /wayfinder 技能,面向绿地项目或方向不明时的规划导航,帮助智能体穿越规划中的迷雾。这对构建具备规划能力的 Agent 提供了具体技能设计思路。
Auto compaction (preview) + LAN Remote Access
Unsloth 发布新版本,合并 200 多个 PR,推出实验性自动压缩以支持更长的聊天上下文,新增局域网远程访问预览,同时改善流式性能和长对话流畅度,并支持自定义 llama.cpp 构建及缓存、内存映射等开关。
AI Infra 正在诞生自己的石油期货?GPU 不够买之后,华尔街开始交易算力
文章讨论 AI Infra 领域算力正像石油期货一样被金融化,在 GPU 供不应求背景下,华尔街开始以期货等方式交易算力。这为算力采购和风险管理带来新的市场变量。
CloudFlare 预览 WebMCP 自动支持功能,使网页可以自动暴露 MCP 接口,便于智能体直接接入浏览器操作。该功能有望降低 Agent 接入 Web 工具的开发成本。
Ramp launches its own AI model router, called Router
Ramp 推出自研 AI 模型路由服务 Router,通过 API 让用户和企业能在多种大语言模型之间切换使用,简化模型选择与成本管理。这为模型路由赛道增加了一家金融科技背景的玩家。
Authoring Dogwood policies from natural language in Amazon Bedrock AgentCore
Amazon Bedrock AgentCore 推出 Policy Authoring,支持从自然语言文档生成正确的 Dogwood 策略,并加入基于时间的约束,以便在智能体操作中执行组织管控。文章给出工作示例和最佳实践。
Scaling agentic AI: Enterprise patterns without vendor lock-in
AWS 多智能体系列第二篇探讨企业如何在不被供应商锁定的前提下扩展 Agent AI,覆盖多框架、多模型和多提供商环境下的运行模式与扩展原则。对构建可演进的企业级智能体平台有借鉴意义。
Scaling cloud migrations with agentic AI on Amazon Bedrock AgentCore
AWS 专业服务团队基于 Bedrock AgentCore 构建多智能体框架,自动化企业云迁移的发现、IaC 生成、组合治理和迁移后运维全流程,将 IaC 开发时间从数周缩短至数分钟。
AWS vector solutions: Build agentic AI where your data lives
AWS 介绍六种直接内嵌于现有数据库和存储服务的向量搜索方案,无需独立向量库或数据迁移,并提供选型框架与客户案例,方便团队在数据所在地构建 Agentic AI。
viable/strict/1787329648: Build tensor_lists without copying each inner list (#194169)
PyTorch 新增 make_tensor_lists 工具,避免在构造张量列表时复制每个内部列表,消除 initializer_list 的复制开销,并更新 52 个调用点,优化 CUDA 和 MPS foreach 及融合内核路径。
From Atari to EVE Online: Building on 15 Years of AI Research in Games
Google DeepMind 与游戏工作室合作,基于 15 年游戏 AI 研究积累,在 EVE Online 等游戏中原型验证突破性玩法 AI。这展示了复杂虚拟世界中的通用智能进展。
文章讨论 Anthropic 在 AI 从业者群体中不再被视为信仰级的存在,反映大模型竞争格局和用户心态变化。对观察厂商影响力有一定参考。
撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压 Fable 5”但无人能复现,Token开销反而翻倍
报道一个名为 Anthropic 的外挂项目引发关注,声称让 DeepSeek V4-Pro 碾压 Fable 5,但无人能复现且 token 开销反而翻倍。这提醒从业者警惕缺乏可复现性的评测和基准炒作。
Meta spends hundreds of millions on Microsoft's AI services
据彭博社报道,Meta 已成为微软最大的 AI 客户之一,在 AI 服务上花费数亿美元,反映两家公司在云和 AI 算力上的深度绑定。
FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving
长上下文LLM服务的prefill阶段注意力计算是主要瓶颈,FlashPrefill V2提出均值修正的块稀疏注意力,并配套优化GPU算子和框架集成,在保持精度的同时大幅降低计算量,相比稠密基线实现了显著加速。
Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization
针对将文档知识内化进模型以支持免检索问答时容易损害通用能力的问题,IAR提出注入、对齐、恢复三阶段后训练流程;先注入结构化文档知识,再对齐问答行为,最后通过恢复阶段找回通用能力,在领域准确率和通用性能上都有提升。
ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Language Models
现有LLM遗忘基准通常把遗忘集和保留集设为互不相关的事实,并用直接回忆来评估,忽略了模型需在上下文变化中消除有害行为、保留良性行为的关键要求;ConceptGuard提出上下文敏感的遗忘基准,考察模型能否在复杂上下文中精准移除敏感知识而避免误伤。
EnvHarness: Awakening Static Worlds for Agent Learning
EnvHarness与EnvRigger通过可编程插件把静态环境改造成可动态调整的训练场,能针对智能体弱点重塑任务,从而强化智能体与环境之间的协同进化,提升强化学习效果。
FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
FACET在合成终端任务时保留源意图,并将指令、解决方案和验证器统一锚定在共享的修复环境中,生成可实际执行的任务,为智能体训练提供可扩展的数据来源。
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
SWE-bench Science将编码智能体基准扩展到科学软件修复任务,通过系统评测揭示智能体在科学工程问题上的主要失败机制,并发现引入科学指导对性能的影响并不一致,为科学领域智能体研发提供参照。
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
MemTrapBench系统基准了大模型在使用检索记忆时出现的推理错误和信念扭曲等认知陷阱,并验证一种推理期干预策略能在保持基准性能的同时有效规避这些陷阱。
SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback
SkillEvo利用多轮交互反馈和主动治理机制维持进化梯度,让智能体技能在持续交互中自我更新,避免进化停滞。
Repo0: Design-Driven Zero-to-All Code Generation
Repo0面向从自然语言需求直接生成完整软件仓库的任务,提出双图架构状态表示并利用模块化引导的结构演化来逐步构建代码,在功能覆盖上表现较高。
Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See
该研究在低资源语言上微调大规模混合专家模型,发现SFT能把推理过程迁移到该语言且不降低准确率,而基于可验证奖励的RL进一步修复了格式和泄漏缺陷,说明准确率指标会掩盖部分行为差异。
EXIMO: VLM Guided Exploration of VLA Policies
EXIMO针对大型视觉-语言-动作机器人策略的高效微调,组合了VLM引导的探索、在精心编排数据上的模仿学习以及残差离线策略强化学习,从而降低数据需求并提升策略性能。
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents
客服LLM智能体的合规失败既可能源于执行了禁止动作,也可能源于遗漏身份确认等必要程序;PolicyGuide将合规保障从动作级检查扩展到工作流级引导,使智能体在多步流程中持续遵循组织政策。
Chain-of-Experience for Continual LLM Improvement
Chain-of-Experience提出一种迭代式测试时反馈循环,让大模型在推理过程中利用经验链持续改进输出;该方法相比零样本基线性能更优,同时推理成本和token消耗更低。
τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
τ_0-VLA构建分层视觉-语言-动作模型,利用世界模型引导的测试时搜索为高层子任务决策扩展计算,从而提升长程机器人操作的成功率。
QuoteBench: How Matched Scores Can Hide Command-Path Failures
QuoteBench通过基准测试发现,执行边界处的解析错误会显著拉低LLM编码智能体的实际成功率,而向系统披露边界信息可以有效恢复性能;这说明评测应把部署配置纳入考量,匹配分数不应被视作模型的固有属性。
Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses
该框架针对冻结参数的LLM智能体,通过分层自修改来演化任务特定的执行harness,在中等难度任务上取得显著收益,但其上限受反馈质量和基座模型能力制约。
The Embedder's Dilemma: LLMs Are Better, but at What Cost?
该研究比较LLM与专用嵌入模型在多样任务上的聚合性能,发现两者几乎持平,但嵌入模型在成本和速度上优势明显;研究建议按任务类型进行分工。
InsufficiencyBench: Evaluating LLM legal advice on underspecified user queries
法律AI基准通常假设用户查询信息完备,但现实中用户常省略影响法律结论的关键事实;InsufficiencyBench针对这一查询端信息不足问题,考察模型能否识别缺失的法律重要信息、指出缺什么并避免过早下结论,并给出八类典型缺失元素分类。
ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models
ForgeWM采用渐进式因果训练,将双向视频生成器蒸馏为少数步骤即可运行的动作条件世界模型,并对齐离散与连续控制信号,实现低延迟交互和回放阶段的细化能力。
Transfer Learning in Nonparametric Regression with Deep ReLU Networks
针对多组数据的非参数回归迁移学习,该框架假设各组共享共同结构并叠加组特定加性偏移,采用两阶段偏移学习:先汇集所有组估计总体均值函数,再估计各组偏移量并加性组合得到组级估计,提升估计效率。