Jalapeño’s first results show industry-leading speed and efficiency in AI inference
OpenAI 公开了自研推理芯片「Jalapeño」的首批结果,宣称在现代模型上实现更高吞吐、更低延迟和更强能效。对推理成本和部署密度的从业者来说,这是一条值得关注的硬件路线。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
Jalapeño’s first results show industry-leading speed and efficiency in AI inference
OpenAI 公开了自研推理芯片「Jalapeño」的首批结果,宣称在现代模型上实现更高吞吐、更低延迟和更强能效。对推理成本和部署密度的从业者来说,这是一条值得关注的硬件路线。
STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation
Apple ML 提出「STARFlow2」,将语言模型与归一化流桥接起来做统一多模态生成,试图解决现有方案中离散 token 损视觉保真、文本生成与扩散去噪结构不对称、以及生成适配损伤预训练理解的问题。它为文本-图像交织序列生成提供了一条新路径。
Granite 4.2 LLMs: How They're Built
Hugging Face 博客发布「Granite 4.2」大语言模型的构建细节,介绍其架构、训练流程等关键选择。对关注开源企业模型和训练方法的技术人员,这是一份可参考的工程说明。
CUDA Python 1.0: Stable APIs, One Foundation, Full Platform Access
NVIDIA 发布「CUDA Python 1.0」,提供稳定 API 和统一基础,让 Python 开发者无需深入 CUDA C++ 工具链即可获得全平台 GPU 访问能力。这对扩大 GPU 编程生态和降低开发门槛有重要意义。
OpenAI’s Jalapeño chip is built for fast inference at scale, benchmarks show
在 SemiAnalysis 的「InferenceX」基准上,OpenAI 的「Jalapeño」据称在每用户 token 数和每千瓦吞吐两项指标上超过现有最先进芯片。该结果强化了 OpenAI 自研推理硬件在规模推理效率上的竞争力。
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
Hugging Face 博客报道一种量化感知修复方法,其生成的 4 位压缩模型性能超过对应的全精度原版。该结果对低比特模型部署、显存和推理成本优化具有直接吸引力。
「llama.cpp」发布 v0.3.0,加入「dots3-note」多模态模型与新的「DSA-ISWA」KV cache,支持「GLM-4.5-Air」的 MTP,并修复「DeepSeek 4」的 tensor-split 和多序列回滚问题。「ggml」与「mtmd」也迎来多项底层更新,对本地推理用户是重要版本升级。
量子位报道开源的国产 8B 模型「SenseNova U1.5 Lite」宣称性能可媲美闭源「Image 2」。如果属实,这为中小规模开源模型在多模态或视觉任务上提供了高性价比选择。
SGLang 发布 v0.5.18,新增「Muse Glimmer」「Intern-S2-Mobius」「SANA-Video」「LingBot-Video-MoE」「LTX-2.5」「Cosmos3 Edge 与 Distilled」「LongCat-Image」等模型支持,并补充「Qwen3.8」「Ling-3.0」「Nemotron 3.5 Lightning」的示例。对需要快速接入新多模态和扩散模型的推理服务开发者很有帮助。
Meta's paid AI agent Hatch launches soon, with a new model called Watermelon due in October
Meta 将在未来几周推出付费 AI 智能体「Hatch」,并计划在十月份发布新模型「Watermelon」。这显示出 Meta 在 AI 智能体产品化和下一代模型迭代上的并行推进。
Nvidia says its Groq 3 LPX is four times faster than Cerebras, but the math is more complicated
Nvidia 的「Groq 3 LPX」推理芯片进入全面生产,官方称在「Gemma 4 31B」上达到 3400 tokens/s,比 Cerebras 快四倍,但达到该性能需要 64 个加速器,而 Cerebras 只需一到两个。架构在大型 MoE 模型上的可扩展性仍是未决问题。
viable/strict/1787680605: [inductor] Vendor and adapt QuACK symmetric GEMM (#194177)
「PyTorch」的 inductor 后端引入并适配了 QuACK 对称 GEMM 内核,针对 X @ X.T 这类对称矩阵乘法,只计算一个三角并同时写入对称位置,支持 FP16 和 BF16。这能减少冗余计算,提升相关算子的性能。
llama.cpp 发布 0.3.0 版本,更新了 CI 发布默认描述并新增脚本用于生成发布摘要。这是本地推理框架的一个重要版本节点,聚合了近期 Metal、SYCL 等后端改进,对依赖 llama.cpp 做端侧或本地 LLM 推理的开发者值得跟进。
SpaceXAI 推出面向自主 AI 智能代理的 Grok Bot
SpaceXAI 推出面向自主 AI 智能代理的 Grok Bot,将 Grok 模型能力包装为可自主执行任务的代理形态,但原文未展开具体开放细节。这反映模型厂商继续向工具调用与自主代理场景推进,关注 Agent 落地的团队可重点观察其能力边界。
The full stack behind abundant intelligence
OpenAI CFO Sarah Friar 阐释了芯片、算力、模型和产品层面的进步如何复合,以更大规模、更低成本交付更实用的智能。这种全栈飞轮视角帮助从业者理解 OpenAI 的成本下降逻辑与基础设施投资方向。
viable/strict/1787655491: [Inductor] Add gfx950 FlyDSL GEMM and torch.mm autotuning (#190903)
PyTorch Inductor 为 AMD gfx950 集成基于 FlyDSL 模板的 FP16/BF16 GEMM 内核,并接入 torch.mm 的 max-autotune 路径,新增默认与穷举 tile 配置启发式、对齐检查及按配置缓存编译调度器。这将提升 AMD 新硬件在 PyTorch 自动调优下的矩阵运算效率,对 ROCm 训练与推理用户是直接利好。
Ollama 0.33.0 强化与 Claude Desktop 的集成,可在菜单栏开关本地 Ollama 模型、直接在 Claude 内选择本地模型,并新增 Apps 视图管理集成与可复制命令;同时改进缓存并修复 agent 客户端取消长 prefill 时的挂起,prefill 恢复点改为按构造可信。这提升了本地模型与 Claude 混合使用体验,对个人开发者和团队都更稳定。
具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜
量子位报道原力灵机 DM0.5 在 RoboDojo 登顶,被称为机器人大脑新 SOTA,并已全开源。对具身智能领域从业者,这是一个新的开源基线,值得关注其模型架构、训练数据与评测方式。
llama.cpp 为 Metal 后端 flash-attention vec 路径加入按设备调优的 (Q, NE) 分派表,新增 53 个 f16 实例使 vec 数从 80 增至 133,并将调优扩展到量化 KV cache,同时加入 SMEM 上限回退。这有助于提升 Apple Silicon 长上下文注意力性能与稳定性。
Introducing new Ray capabilities on SageMaker HyperPod
AWS SageMaker HyperPod 在 Amazon EKS 上推出托管 Ray 支持,可在 SageMaker Studio 中创建和监控 Ray 集群、连接 JupyterLab 与 Code Editor、获得开箱即用的可观测性,并运行弹性分布式训练与加速推理。这降低了在 AWS 上使用 Ray 的运维门槛,对分布式 AI 工作负载团队是重要补充。
Agentic Resource Discovery (ARD): An open specification for agent discovery
AWS 推出 Agent Registry 集中式可搜索目录,用于管理 agent、工具和技能,并基于开放的 Agentic Resource Discovery 规范支持跨环境发现与治理。这有助于企业多智能体资产标准化和规模化治理,也推动 agent 发现协议走向开放。
Grafana 正式发布 gcx 和 MCP 服务器,助力基于遥测的智能代理开发
Grafana 正式发布 gcx 和 MCP 服务器,以支持基于遥测数据的智能代理开发。这将可观测性数据通过 MCP 协议接入智能体,便于开发者构建运维诊断、根因分析等场景的 agent。
Bug Fixes + Auto compaction + LAN Remote Access
Unsloth 发布包含 170 多个 PR 的修复版本,修复 MLX 与 Mac 运行问题、AMD GPU 相关 bug,并新增实验性自动压缩以支持超出上下文长度的长对话,以及无需 Cloudflare 的 LAN 远程访问预览。这些改动提升了本地微调与推理的稳定性和长对话可用性。
Accel-backed Keenable is indexing the web for AI agents
Keenable 走出隐身模式,获得 Accel 支持的 2600 万美元种子轮,为 AI agent 构建大规模网络搜索索引。这表明 agent 对实时、可访问的网页数据基础设施需求正在升温,对做检索增强或搜索类 agent 的团队有参考意义。
llama.cpp 修复了 Metal 后端缓冲分配未做空指针检查导致的 OOM 硬崩溃问题,使显存分配失败时不再触发 EXC_BAD_ACCESS 而是可恢复。这提升了 Apple Silicon 上加载大模型时的鲁棒性。
Bug Fixes + Auto compaction + LAN Remote Access
Unsloth 发布修复更新,包含 170 多个 PR,修复 MLX、Mac 运行时以及 AMD Strix Halo 和 RDNA GPU 等问题,新增实验性自动压缩与无需 Cloudflare 的局域网远程访问预览,并提升聊天速度。这对使用 Unsloth 微调或推理的用户是一次全面的稳定性与体验改善。
‘The world seems to be ready’: An interview with OpenAI head of product Thibault Sottiaux
TechCrunch 专访 OpenAI 产品负责人 Thibault Sottiaux,讨论 agent、用户体验及向 Greg Brockman 汇报等话题。这为外界了解 OpenAI 在 agent 产品化和 UX 上的思路提供了一手视角。
llama.cpp 执行了 ggml 子模块同步,并发布包含多平台构建产物的更新。对以 llama.cpp 为底层推理引擎的项目,保持 ggml 同步有助于获得最新内核修复与优化。
从开源走向共建:范式联合优必选等十余家具身巨头发布PhanthyMotus新计划
范式联合优必选等十余家具身智能企业发布 PhanthyMotus 生态社区共建计划,其通用具身 Agent 底座从开源走向多方共建。这标志具身智能基础模型开始通过产业联盟共同迭代,对机器人通用大脑生态有风向意义。
viable/strict/1787664910: Add XPU dispatch for linalg.polar (#188253)
PyTorch 为 linalg.polar 算子新增 XPU 后端分派,解决 Intel torch-xpu-ops 的 issue,合并后 XPU 后端上 40 个测试用例可取消跳过。这补全了 Intel GPU/XPU 上 PyTorch 线性代数功能,对 XPU 用户是实用改进。
PyTorch 将 export/test_torchbind.py 测试泛化并在 XPU 后端启用,扩展了 torchbind 相关导出功能在 Intel XPU 上的测试覆盖。这有助于保证 PyTorch 导出路径在 XPU 硬件上的兼容性。
llama.cpp 修复 GBNF 语法解析器对字符类中连字符转义的处理,使生成的工具调用语法不再因连字符被拒绝而解析失败。这对使用约束解码生成结构化工具调用的开发者很重要,避免特殊字符导致 schema 失效。
viable/strict/1787660889: Remove unused typelist constructs from TypeList.h (#194352)
PyTorch 清理了 TypeList.h 中 filter、map、reverse 等零内部用户的模板工具,仅保留 take/drop 等外部依赖构造,并同步更新单元测试与导出表。这属于代码库瘦身,降低维护成本,对编译性能或有轻微帮助。
viable/strict/1787658955: [CI] Add gfx950 FlyDSL Inductor test shard (#193473)
PyTorch CI 增加 gfx950 FlyDSL Inductor 专用测试分片,安装固定版本 FlyDSL wheel,并在 ROCm 环境或 gfx950 设备不可用时提前失败而非静默跳过 GEMM 覆盖。这保障了 AMD gfx950 上 Inductor 与 FlyDSL GEMM 路径的持续验证。
llama.cpp 在 SYCL 后端中将 tq2_0 量化类型标记为不支持,并更新各平台构建产物。这为 Intel SYCL 设备用户提供了明确的能力边界,避免使用不受支持的量化格式导致错误。
PyTorch 对 NCCL CFT 测试增加门控,只在支持 CFT 的 GPU、驱动和 CUDA 栈上运行。这避免在无能力环境上误报失败,提升分布式通信测试的可靠性。
赛博义父Tibo最新访谈:专门实体按钮搞重置,“我想重置就重置”
量子位报道 Tibo 最新访谈,他认为下一代 Agent 天然会走向云端和更大规模计算资源,并提及专门实体重置按钮等设计。这传递了云端 agent 与用户控制权的产品判断,对 agent 架构师有启发。
PyTorch AOTInductor 改进了 aoti_inference 测试中不支持设备路径的处理。这有助于提升 AOTInductor 在多种后端环境下测试的健壮性,减少误报。
PyTorch 删除了 THP_PyFrame_New_NoTrack 中不可达的版本分支。这属于代码清理,降低维护噪音,帮助开发者更清晰地理解 CPython 版本兼容路径。
viable/strict/1787643145: [dynamo] Support types.SimpleNamespace (#193719)
PyTorch Dynamo 新增对 types.SimpleNamespace 的建模支持,解决此前构造 SimpleNamespace 会触发图断裂、17 个相关测试被标记为预期失败的问题。这有助于更多使用 SimpleNamespace 的代码在 torch.compile 下顺利成图,减少图断裂。
SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning
该工作面向长程推理任务的后训练,提出「SRPO」框架,让模型分析自身完整轨迹、把错误凝练成简短的反思补丁,并用反思条件下的教师分数来优化策略。相比只依赖稀疏结果反馈,它把自我反思能力内化到策略优化过程中,目标是更细粒度地分配功劳,从而提升长程任务上的学习效率和表现。
Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
针对语言模型强化学习中稳定性与探索性的两难,提出「ERPO」方法,用输入侧的查询分布控制替代动作侧的策略正则化。这样做在稳定训练的同时保留响应空间的探索,对「RLHF」类流程的收敛和多样性有实用价值。
Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs
本文提出量化感知修复方法,直接从原始未压缩模型中蒸馏,以更快、更稳的方式恢复 4 位压缩 LLM 的能力。与量化感知训练相比,它避免了从头调整的代价,能在压缩模型上找回接近甚至超过全精度的表现,对低比特部署很有意义。
TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration
「TileMix」在融合稠密注意力内部以 tile 为单位,把注意力分数路由到 FP16 或 INT8 混合精度计算。它在不重训练的前提下恢复长上下文精度,同时提升 prefill 吞吐,是推理侧注意力优化的一个轻量方案。
InjecMEM: Memory Injection Attack on LLM Agent Memory Systems
论文提出「InjecMEM」记忆注入攻击,展示只需一次交互、无需读取或编辑记忆库,就能把后续相关查询的回复引向预设输出。它利用了记忆系统的检索-生成机制,对当前 LLM 智能体普遍引入持久记忆的趋势提出了安全警示。
Apodex 1.1: Scaling Agentic Intelligence for Complex Work
「Apodex 1.1」通过扩展可执行环境,并训练智能体协调长程工作流中的状态维护与恢复,来提升复杂真实任务上持续、可验证的进展。它强调智能体不仅要会单步操作,还要能稳定推进长周期目标。
EchoWM: Open and Enterable Omnimodal World Models
「EchoWM」是一个可进入的全模态世界模型,能在连续 6-DoF 导航轨迹下同步生成高分辨率视频、声音、音乐和语音,并支持第一人称和第三人称视角。这为具身智能和交互式世界模拟提供了统一的多模态生成底座。
MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks
「MobilePA-Bench」是一个交互式沙盒基准,专门评估移动端规划智能体在工具调用、子代理协作、记忆使用和复合技能调用上的实际表现,并引入真实运行时约束。它帮助衡量智能体在复杂移动任务中的综合规划能力。
Prime Agent: A Self-Improving RLM Harness
「Prime Agent」是一个开源的自我改进「RLM」harness,借助递归子代理、持久计算和代理间协调来扩展语言模型在编码与推理任务上的长程能力。对想要构建自改进智能体系统的研究者,它提供了一个可复现的框架。
论文指出,能完成一次任务不代表可靠,尤其是在代码之外的业务工作中,智能体必须多轮收集缺失信息、遵循领域策略、协调依赖工具并正确完成持久状态转换。为此提出「Thinkingbox」沙盒与基准,专门评估有状态业务工作流中的这些能力。
Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress
「R2-OPD」改进在策略蒸馏,通过轨迹内的排序比较,过滤掉与推理进度相冲突的教师奖励信号。这让蒸馏过程更关注真正推动推理前进的步骤,从而提升策略学习质量。
「ClawProBench」通过执行轨迹评估智能体配置,设置 live 和 frozen 两个轨道以及运行时覆盖,发现只看最终答案的排名会掩盖原生运行时失败和过程质量差异。这提醒基准设计要更关注执行细节而非只看结果。
The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams
该工作讨论多智能体 LLM 交互的收益与代价,认为已有矛盾部分源于缺少对交互是否保留多样性的区分。它提出交互税概念:通信可能抹平团队内部的多样性,从而抵消多智能体协作带来的增益。
What's the Catch? Evaluating Temporal Consistency in Vision-Language Models
论文从异常检测角度考察视觉语言模型对时间一致性的敏感性,提出「TimeCatch」基准,通过交换连续帧或替换为高斯噪声帧构造异常。这样可以更受控地测试 VLM 是否真正理解时序结构,而不只是单帧内容。
TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming
「TLive-Omni」面向电商直播场景,通过时间戳 token 分组统一图像、视频、音频和文本,配合分阶段监督训练与可验证反馈的强化微调,实现实时全模态理解。这对直播电商中的自动解说、商品识别等应用有直接价值。
GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?
「GameXpert-Bench」评估编码代理在游戏开发三个阶段——生成、修复和优化——上的能力,采用交互式与行为测试。结果显示代理能搭建可玩的基础,但在缺陷发现和回归保持上仍然薄弱,为游戏方向编码智能体指出了短板。
AutoResearch: Insight In, Hallucination Out
「AutoResearch」是一个两阶段自主研究系统,将研究想法与集成生成、基于证据的执行结合起来,以减少幻觉并提高实验可靠性和可测量结果。它试图把科研流程中的想法落地为可验证的实验闭环。
LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks
「LongWoF-Bench」评估 EvoMap 方法,它把验证过的执行经验外化为可复用的结构化「Gene」,以提升长工作流任务完成率并减少 token 消耗。这套机制让模型在长流程任务中复用经验,改善效率。
Robustness of IR Models to Collection Growth
论文形式化了一个理想性质:向检索集合中添加非相关文档不应降低检索器有效性。作者合并两个主题几乎不重叠的集合进行实证评估,并推测检索模型对排名如何依赖其他文档的条件方式会影响这一鲁棒性。
面对资源受限场景下轻量时间序列预测器训练数据不足的问题,提出「MetaCaster」,一个由元 harness 优化的智能体,用于端到端的小样本学习。它旨在让紧凑预测器在数据稀缺、缓慢积累或隐私敏感的领域也能落地。