LMDeploy v0.15.0发布,新增长上下文与MTP前缀缓存命中、投机解码引导解码、内存分配器与对象缓存调度器整合、AgRs全对全后端,并正式支持DeepSeek V4,推理性能与功能均有显著增强。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
LMDeploy v0.15.0发布,新增长上下文与MTP前缀缓存命中、投机解码引导解码、内存分配器与对象缓存调度器整合、AgRs全对全后端,并正式支持DeepSeek V4,推理性能与功能均有显著增强。
Advancing the price-performance frontier with GPT‑5.6
OpenAI大幅下调GPT-5.6价格,Terra降价20%,Luna降价80%,降幅归因于GPT-5.6 Sol对负载均衡和模型前向计算的优化,使顶级智能以更低成本触达用户。
OpenAI goes full China pricing mode with an 80 percent cut to its most affordable GPT-5.6 model
OpenAI自7月30日起将GPT-5.6 Luna价格大幅下调80%,Terra下调20%,借助顶级模型Sol优化了自身基础设施效率,同时面临中国廉价模型与微软MAI的价格压力。
Introducing explicit prompt caching for OpenAI GPT-5.6 models on Amazon Bedrock
Amazon Bedrock正式上线GPT-5.6系列Sol、Terra、Luna模型,并推出显式提示缓存功能,允许精确控制可缓存的提示部分,有效降低推理成本与延迟。
PyTorch cuDNN可变长度注意力扩展支持分页KV缓存(block_table)和序列已用长度(seqused_k),提升变长序列场景下的显存利用率和推理效率。
让团队记忆在共建中完善: TencentDB Agent Memory 的开源之路 | 腾讯云数据库 DBTalk
腾讯云数据库将TencentDB Agent Memory开源,通过社区共建完善智能体记忆功能,为开发者提供持续的团队记忆解决方案。
即梦发布Seedance 2.5,行业独家支持最长30秒视频的原生直出,大幅提升了AI视频生成的时长上限与创作自由度。
视频后期,危!MiniMax H3手绘即特效,多模态的「Coding时刻」来了
MiniMax H3模型展示手绘即可生成视频特效的多模态能力,标志着多模态内容生成的又一突破,可能重塑视频后期制作流程。
GPT-5.6系列降价20%-80%,借助GPT-5.6递归自我优化,4个月内GPT 5.4级别智能的成本降至1/13,为从业者带来极高的性价比。
OpenAI即日起对GPT-5.6 Luna实施80%的最大幅度降价,Terra同样下调20%,大幅降低先进模型的使用门槛。
Google DeepMind发布Gemini Robotics 2系列,包含全身控制VLA模型、具身推理与任务编排模型,以及可数小时适应新本体的设备端VLA,推动机器人通用智能落地。
NVIDIA Exemplar Cloud: Lessons for Unlocking Full Performance on AI Infrastructure
NVIDIA推出Exemplar Cloud,分享在H100、GB200 NVL72等集群上充分释放训练吞吐的经验,帮助从业者避免因配置不当导致的性能损失。
llama.cpp 为 DeepSeek V4 等 MLA 模型强制 K/V 缓存使用相同数据类型,并在 V 缓存量化时自动启用 FlashAttention,从而在保持显存效率的同时避免混合精度导致的注意力计算错误,对低比特部署场景尤其关键。
ggml 的 ZenDNN 后端新增 group matmul 直接 API,专门为 MoE 模型的 mul_mat_id 操作加速,并根据专家数动态调整回退阈值,提升 CPU 上稀疏混合专家推理的吞吐与自适应能力。
PyTorch 在 FlexGEMM 中引入对 epilogue 结构节点的单次分类,通过查表替换实现 FX 节点的规约化,为后续接入 NVGEMM 和更干净的 lowering 管线打下基础。
DataBuddy:数据语义驱动的企业 Agent Runtime 设计与落地|AICon深圳
DataBuddy 提出一种数据语义驱动的企业 Agent Runtime,将业务数据语义直接注入代理执行循环,让 Agent 在理解上下文时更贴合企业知识,有望减少幻觉并提升任务完成率。
Nous Research 为 Hermes Agent 提供三条集成路径,使其能接入 Block 开源的 Nostr 工作空间 Buzz,保留记忆、技能、审批与定时推送,让人类与智能体在自托管频道中协同工作。
知名研究者姚顺雨在攻克一项五十年未解的数学难题后,宣布为 AI for Science 方向招人,焦点是将 AI 能力深度融入数学与科学发现。
Autoscaling endpoints for LLM inference
Together AI 分享了推理端点自动伸缩的实践要点,指出 GPU 利用率正常时队列仍可能积压,并就伸缩指标选取、扩缩容窗口调优和冷启动预算给出了具体建议。
Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence
Google Research 发布『Science One Framework』,以证据链为核心构建可验证的自主研究框架,让 AI 研究者在生成结论时能回溯每一步的证据,提升科学研究的可信度与可复现性。
前 OpenAI 研究员预测,单纯扩展算力已不够,模型正变得更专业化而非更通用,大厂需在定向训练数据上投入超千亿美元,凸显高质量数据对突破当前瓶颈的重要性。
AWS 官方文章介绍两种部署 Kimi K3 的方式:Amazon SageMaker HyperPod 和 Amazon EKS,为希望在 AWS 上运行该模型的团队提供了生产级指南。
Echoverse: Deep, evolving environments for computer-use agents
微软推出『Echoverse』,为计算机使用智能体提供深度演进的训练环境,让代理在持续变化的任务、测试与环境里应对多步工作流,弥补静态训练集无法覆盖真实动态的短板。
Inference meta-monitoring for Amazon SageMaker AI endpoints with Amazon Quick
该文展示如何为 SageMaker 端点建立推理元监控系统,持续追踪预测与数据质量、检测漂移,并整合延迟的真实标签与自动化性能仪表盘,形成一套 ML 推理的治理层。
EvoLib: Turning experience into evolving knowledge
微软研究院的 EvoLib 将经验转化为可演进的知识,使 LLM 在部署后仍能不断提取可复用技能与洞见,从而跨任务持续学习,而非仅靠记忆更多数据。
llama.cpp 的 SYCL 后端补全了 q2 量化的矩阵乘法支持,覆盖更多 q2_0 场景,使得在 Intel GPU 上运行极低比特量化模型变得可行。
PolyAI 发布 Dialog-RSN-1,一个直接感知呼叫者音频的对话模型,将话轮切换、语音识别、函数调用和回复生成融合在单一模型里,TTS 保持解耦以控制输出音色,线上实测延迟低于 300 毫秒。
Building a Policy-Governed Multi-Agent Financial Research Workflow with Omnigent
本教程展示如何用 Omnigent 构建策略治理的多智能体金融研究工作流,集成实时汇率数据,实施层级代理委托与硬约束策略(成本预算、工具调用上限),在 Google Colab 即可运行。
PyTorch 新增后端无关的 NaN 检查钩子,弥补先前仅 NCCL 支持 NaN 调试的短板,使任何通过 c10d 操作的后端都能自动检测集体通信中的 NaN,极大便利自定义后端调试。
trunk/437657ad1d23900c7e99894188ed8f9be8be0d85
回退了先前尝试让 FlexGEMM 与 NVGEMM 共享 CuTeDSL epilogue 降落的提交,意味着该融合工作还需重新调整以兼容现有管线。
PyTorch 在 cuDNN SDPA 中将注意力掩码的 dtype 显式声明给 cuDNN,而非继承推断,避免因类型匹配错误导致的性能退化或数值问题。
Run High-Performance Core Math at Scale with NVIDIA nvmath-python
NVIDIA 发布 nvmath-python,桥接 Python 科学社区与 CUDA-X 数学库,使 Python 用户能直接调用高性能核心数学运算,大幅简化 GPU 加速的数值计算流程。
Four Ways to Deploy More Secure AI Agents
NVIDIA 开发者博客分享四种部署更安全 AI 代理的方法,针对知识工作者场景,强调身份验证、最小权限、输出护栏等实践,降低“数字同事”代理在企业落地的风险。
PyTorch 对分布式通信初始化进行路由调整,只让 TorchComms 拥有的后端走新 comm 路径,自定义后端如 mooncake 仍走原生 c10d 创建流程,避免强制转换带来的兼容性问题。
Optimizing production agents with Amazon Bedrock AgentCore Observability
利用 Amazon Bedrock AgentCore 可观测性与 CloudWatch,帮助团队在生产环境中定位长会话记忆问题与性能瓶颈,让智能体从原型平稳过渡到高效运行。
llama.cpp 的 SYCL 后端补全了数据拷贝操作中缺失的类型支持,增强在 Intel GPU 上通用张量操作的覆盖度与稳定性。
Building abundant intelligence
OpenAI 阐述其全栈策略,通过模型、基础设施和生态的协同优化,让先进 AI 更强大、更便宜、更易用,对从业者而言意味着推理成本与接入门槛有望进一步降低。
llama.cpp 为 SYCL 后端新增设备到设备内存拷贝支持(DEV2DEV_MEMCPY_FORWARD),避免在 Intel GPU 上不必要的回传主机,提升数据搬运效率。
米哈游创始人蔡浩宇的 AI 创业公司出现策略调整,暂停多个项目,将九成资源集中押注 Agent 方向,反映出业界对智能体赛道的前景判断。
viable/strict/1785494479: Update torch-xpu-ops commit pin (#191489)
PyTorch 更新 torch-xpu-ops 提交,为 Intel GPU 加入 linalg.qr、geqrf 等线性代数操作,并同步多项 XPU 的精度与稳定性修复。
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
面向真实设备、跨平台、结合GUI与CLI操作的长期自主智能体,提出《Qwen-UI-Agent》基座模型,能够在真实设备上可靠执行复杂工作流,并具备主动服务和低人工干预的自主改进能力。它将GUI智能体推向实际可用的下一代形态。
Metis: Memory Foundation Model
针对当前智能体记忆严重依赖外部模块的问题,提出记忆基座模型《Metis》,首次将记忆能力原生内化到基础模型中,使模型具备类似人类的长期记忆与检索机制,不再需要外部记忆库即可维持状态。
为研究AI递归自我改进,构建了全栈系统《OpenMLE》,包含可验证任务环境、操作学习与长程搜索,并基于此对35B模型进行后训练得到《Frontis-MA1》,能在机器学习工程任务中作为元进化智能体持续优化AI构建流程。
PhiZero: A World Model Built Around Physical Language
针对现有世界模型在像素空间预测视频、忽视底层物理规律的问题,提出《PhiZero》物理世界模型,从野外视频中学习一种紧凑的离散物理语言来表示状态转换,实现显式的物理推理与预测。
Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory
为解耦长时记忆与推理、独立扩展记忆容量,将《Memory Decoder》的参数化记忆模块规模扩展到69亿参数、3000亿token预训练;在如此大的数据规模下标准Faiss检索不可行,该工作探索了可扩展的记忆检索方案,使记忆模型能高效处理大规模长序列信息。
Beacon: Knowing When and How to Perform Agentic Visual Reasoning
从工具使用中的模式适应性和工具效果两个维度重新审视智能体视觉推理,提出《Beacon》框架,让多模态大模型学会判断何时真正需要调用工具,在不牺牲成功率的前提下避免多余推理开销。
Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers
针对高分辨率图像、长视频和多模态生成中全注意力平方代价过高的问题,设计混合视觉扩散主干《Chimera》,结合具有O(N)复杂度的Kimi Delta Attention和交错多头潜在注意力,在统一流中处理图文视频token,并给出Chinchilla缩放配方,大幅降低计算开销。
Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes
深入分析投机解码中有损验证的运作机制,揭示加速收益与生成质量之间的权衡:放松分布匹配虽提升效率,却可能悄悄改写解码分布,导致输出不稳定甚至严重退化,该工作系统梳理了失败模式与安全边界。
Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
探索性建模打破了生成模型无法端到端训练的限制,通过引入第三预训练轴来处理多模态分布,首次实现生成模型的端到端联合训练,避免了传统分解式生成带来的误差累积。
VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
针对文生视频模型物理一致性差的问题,提出《VideoCoCo》,用可执行的代码作为思维链来精确描述时空动态,结合智能体双引擎系统实例化完整物理过程,使生成的视频动作更符合物理规律。
BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
在28个层级、语料库规模扩大约450倍的严格控制实验中,系统对比BM25词法检索、稠密检索、图索引和智能体搜索等RAG范式,发现在大规模语料下BM25的准确率和成本综合优势显著,打破了稠密检索一定更好的固有认知。
Flux-OPD: On-Policy Distillation with Evolving Contexts
开放域训练缺乏可验证奖励时,用演化上下文传递任务偏好,提出《Flux-OPD》在策略蒸馏方法,让上下文随学生模型表现动态变化,并通过稳定机制避免蒸馏目标震荡,更可靠地将偏好蒸馏到模型中。
SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them
为了让视觉语言模型既具备细粒度空间理解又能完成高层任务决策,提出《SpatialCLI》框架,先利用专用空间工具进行推理训练,再逐步移除工具依赖,使模型内化精确的空间推理能力。
β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
将标准的在策略自蒸馏(OPSD)揭示为策略优化族中KL惩罚权重β=1的特例,提出《β-OPSD》,通过调节β系数控制参考策略的锚定强度,显著改善了OPSD在实践中的脆弱性和不稳定性,使训练更鲁棒。
Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale
训练计算机使用智能体的瓶颈从环境数量转向环境质量,提出《Echoverse》,构建具有深度行为、针对交互目标并随智能体能力增长复杂度的合成环境,在这种可演化环境中的训练使智能体在真实应用上表现大幅提升。
Multi-Head Attention Residuals
标准Transformer的单一残差流迫使所有特征子空间共享同一跨层读取分布,提出多头注意力残差机制,让每个注意力头学习各自的历史读取softmax分布,增大了信息流动的灵活性和模型表达能力。
OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models
在全模态大模型中,音频与视频的显著性经常在不同时刻达到峰值,单一模态指导的压缩易丢弃关键线索,因此提出无训练的《OmniScope》框架,以文本查询为共享锚点独立压缩各模态token,在极高压缩率下仍保留答案关键信息。
Algorithms for Structured Elections under Thiele Voting Rules
研究Thiele投票规则下委员会选举胜者确定问题的计算复杂性,通过分析投票人批准集引出的候选人间依赖结构,揭示了最优解的结构特性,并给出参数化算法。
Same Graph Cross-Task Transfer in GNNs: Protocols and Predictors
针对同一图上节点分类与链接预测跨任务迁移评估中因数据划分泄露等问题造成的不可靠结论,提出无泄漏的评估协议,并系统分析有效的迁移预测因子,为图神经网络的跨任务复用提供可靠基准。
Graph Neural Multilevel Preconditioners for Iterative Solvers
传统代数多重网格预条件器在不定或非对称线性系统上鲁棒性差,利用图神经网络的数据驱动优势构造多级预条件器,结合多级层次与GNN的表示能力,显著提升了迭代求解器的收敛速度和稳健性。