Ray 2.58.0 的 Ray Serve LLM 完成 KV 缓存与 token 感知请求路由。LLMRouter 入口副本进程内完成分词和路由决策,token 带外传输避免引擎重复分词,并将 KV 生命周期事件广播至所有入口副本。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
Ray 2.58.0 的 Ray Serve LLM 完成 KV 缓存与 token 感知请求路由。LLMRouter 入口副本进程内完成分词和路由决策,token 带外传输避免引擎重复分词,并将 KV 生命周期事件广播至所有入口副本。
Exploring Speculative Decoding in vLLM on AMD GPUs
vLLM 博客发布 AMD GPU 上投机解码实践指南。系统介绍草稿-验证机制、MTP、EAGLE-3、DFlash、DSpark 等方法的配置与调优,并给出基准测试结果。
向量数据库要被取代?DynamoDB 开始原生支持 AI 搜索
亚马逊 DynamoDB 开始原生支持 AI 搜索。它将向量检索等能力直接集成到托管 NoSQL 数据库,可能对独立向量数据库采用产生影响。
AI is becoming AI's biggest customer as agentic token usage jumps 14x on OpenRouter
OpenRouter 数据显示自 2025 年 2 月 6 日起 AI 智能体的 token 消费量已超过人类。智能体使用量增长 14 倍,人类仅增长 2.8 倍。近七成智能体 token 来自廉价缓存提示,实际成本增幅远低于原始数字。
英伟达AI服务器将涨价15%!1GW数据中心成本激增50亿美元
受内存成本飙升影响,英伟达 AI 服务器价格将上涨约 15%。1GW 数据中心成本预计增加 50 亿美元。
Memory shortage reportedly drives Nvidia AI server prices up about 15 percent
由于三星、SK 海力士和美光 DRAM 短缺,搭载 Vera Rubin 与 Grace Blackwell 芯片的英伟达服务器价格将上涨约 15%。微软、谷歌、Meta 等云巨头首当其冲。
DeepMind 校友创立的英国 AI 实验室 Inherent 发布 Faraday 智能体。它在复现科学研究任务上超越 Anthropic 和 OpenAI 的模型,被视为迈向创新的潜在基础。
llama.cpp 提交 b10595 为服务器新增 LLAMA_SERVER_SLOTS_N_DIFF 环境变量。该变量用于调整槽位数量差值。
llama.cpp 提交 b10594 优化设备信息遍历。当不需要打印时跳过循环,避免 CUDA 后端创建 GPU 上下文造成约 550 MB 显存分配。
llama.cpp 提交 b10593 修复 DeepseekV4 多序列回滚问题。改动涉及模型加载、单次回滚、缓存清理和图拓扑静态化等。
匿名牛来大模型被扒出智谱血缘,也有人怀疑Cursor拿开源GLM训的
量子位报道匿名大模型被扒出与智谱 GLM 存在血缘关系。通过 tokenizer、视频编码和 API 报错信息等线索分析,同时有人怀疑 Cursor 使用开源 GLM 训练。
PyTorch 提交 viable/strict/1787486001 为 FSDP2 的 to_accumulated_grad_if_needed 添加 _unsharded_param 访问保护。该改动防止未分片参数访问出错。
viable/strict/1787484326: [inductor] Fix flex flash captured-float test expectation (#194483)
PyTorch Inductor 的 flex_attention FLASH 测试修复:将 test_captured_float_fails_with_dynamic 中的 assertRaisesRegex 放宽,使其接受两种合法的拒绝消息——捕获的 Python float 可能触发「captures a 0-dim CPU tensor」错误,也可能以 SymFloat 形式到达 HOP 并被 flex_attention 操作数检查拒绝。这解决了动态形状下因 tracer 归属不同导致的 CI 偶发失败,属于低风险测试侧改动。
该提交将 PyTorch Inductor 序列化与缓存键相关路径中的类型注解从 Any 替换为 object,收紧类型标注以提升静态检查的准确性和代码可维护性。这属于不改变运行行为的清理性改动,风险很低。
llama.cpp 的 json.h 头文件修复了在 Clang LTO 链接时出现的问题,使项目在启用链接时优化的 Clang 构建下可以正常编译。该提交仅涉及公共 JSON 解析头文件的兼容性调整,对自行编译 llama.cpp 的用户有帮助。
llama.cpp 的 Vulkan 后端新增 GGML_OP_PAD_REFLECT_1D 操作,实现了带反射逻辑的 GLSL compute shader,并补全了 SPIR-V 注册、pipeline 创建、supports_op、dispatch 及调试校验等环节。该算子已在 Intel Iris Xe 上完成测试,为 Vulkan 推理补齐了一维反射填充能力。
llm 0.33 发布,主要升级到 OpenAI Python 库 3.x,并把 HTTP 客户端依赖从 httpx 切换到 httpx2,修复了与新版库的兼容问题。llm embed 与 llm embed-multi 命令新增 --key 参数,Python 侧的 embed、embed_multi 及 Collection 方法也支持 key=,可将每次调用的密钥传给嵌入插件。
viable/strict/1787507580: [Bug] Fix scan Autograd (#193787)
此 PR 为 #153679 报告的 scan Autograd 正确性问题补充了回归测试。根因是 Inductor 在计算 backward 捐赠缓冲区索引时按顶层图 placeholder 顺序,而 SubgraphLowering 错误继承这些索引并用于自身无关的 placeholder 顺序,可能把子图输入标记为可捐赠,导致重用区域覆盖保存值。修复可防止控制流 HOP 场景下出现静默数值错误。
trunk/4287565497d8424c0aab536cafa39ddda763d249: [Bug] Fix scan Autograd (#193787)
主干分支合入了修复 scan Autograd 的提交,同时加入回归测试。该 bug 只在 Inductor 路径出现:子图 lowering 复用了顶层图的捐赠缓冲区索引,错配到自己的 placeholder 顺序上,可能错误捐赠子图输入并造成缓冲区覆盖。此修复对依赖 scan 与高阶算子 autograd 的模型训练有直接影响。
llama.cpp 的 CUDA 后端新增 POOL_1D 支持,为含一维池化操作的 GGML 计算图补充了 CUDA kernel。该提交还修复了末尾换行符以符合 editorconfig 规范,对使用 CUDA 后端运行相关模型的用户有帮助。
How China's gray market sells Claude tokens at a fraction of the price
报道称 Anthropic 针对中国的地域封锁、自拍验证等访问控制正被名为「中转站」的灰产网络系统性绕过,中国开发者能以官方列表价格约十分之一的成本购买 Claude token。分析人士指出,这类规避基础设施削弱了出口管制效力,也破坏了 Anthropic 自身的安全与合规体系。
FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving
FlashPrefill V2 针对长上下文 LLM 服务中预填充阶段注意力计算开销大的问题。它采用均值校正的块稀疏注意力跳过不重要的块,同时优化 GPU 算子并集成进推理框架。相比稠密基线实现显著加速。
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
SWE-bench Science 构建面向科学软件修复的基准。它评估编程智能体在科学工程任务上的表现。结果显示存在多种失败机制,且科学领域引导对性能的影响并不一致。
τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
τ_0-VLA 针对长程机器人操作中高层子任务决策困难的问题。它设计分层视觉-语言-动作模型,利用世界模型引导的测试时搜索来扩展高层决策计算量。该方法有效提升长程操作表现。
Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization
IAR 是一个三阶段后训练框架。它先注入结构化文档知识,再对齐无检索问答能力,最后恢复通用能力。该方法在提升领域准确率的同时保持通用性能。
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
OmniScientist 是一个端到端的全模态 AI 科学家。它通过自主智能体直接从异构原始证据开展多学科研究,并引入全生命周期感知。该方法提升跨科学模态的证据驱动发现能力。
SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE 是一个自博弈强化学习框架。它让语言模型自行设计自适应可执行训练环境并学习求解。通过基于遗憾的环境目标选择,它有效提升推理与工具使用性能。
FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents
FM-Bench 构建足球俱乐部 20 年管理的长周期决策基准。它评估 LLM 智能体的长程管理能力。结果显示管理行为而非模型规模或 token 花费决定表现。
Looped Language Models Improve Compositional Tool Calling
Looped Language Models 通过循环计算增强组合式多步工具调用。它还采用自适应推理在准确率和计算成本之间取得平衡。这为工具调用场景提供了更灵活的计算策略。
EnvHarness: Awakening Static Worlds for Agent Learning
EnvHarness 和 EnvRigger 通过可编程插件动态重塑静态环境。它们针对智能体弱点生成训练场景。该方法改善强化学习中环境与智能体的共同进化。
FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
FACET 解决终端任务合成中源意图丢失和可执行性不足的问题。它保留源意图,并将指令、解法和验证器锚定在共享修复环境中。这实现了可扩展的智能体训练。
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
MemTrapBench 研究检索到的记忆如何导致大模型推理错误和信念扭曲。它提出推理时策略帮助避开认知陷阱。该策略在保持基准性能的同时减少陷阱。
SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback
SkillEvo 通过多轮交互反馈改进智能体技能。它引入主动治理机制维持进化梯度。这使智能体能够持续自我更新。
ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models
ForgeWM 针对视频世界模型推理步数多、延迟高的问题。它渐进式地将双向视频生成器蒸馏为少步交互式世界模型。该方法对齐离散和连续控制,支持低延迟交互与重放时细化。
Repo0: Design-Driven Zero-to-All Code Generation
Repo0 使用双图架构状态和模块化引导的结构演化。它从自然语言需求直接生成完整软件仓库。该方法取得了较高功能覆盖率。
Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See
在低资源语言上微调大型 MoE 模型时,SFT 可将推理迁移到该语言而不损害准确率。RL 则通过可验证奖励修复格式和泄漏缺陷。这揭示了准确率指标无法反映的隐性差异。
EXIMO: VLM Guided Exploration of VLA Policies
EXIMO 针对大型 VLA 机器人策略微调效率问题。它结合 VLM 引导探索、编排数据上的模仿学习和残差离策略强化学习。该方法实现高效微调。
The Embedder's Dilemma: LLMs Are Better, but at What Cost?
比较 LLM 与专用嵌入模型发现,两者在不同任务上的聚合性能几乎持平。但嵌入模型在成本和速度上具明显优势。这支持按任务类型进行分工。
Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses
Hierarchical Self-Improvement 针对冻结 LLM 智能体的任务专属执行套件演化问题。它通过层次式自修改逐步改进。该方法在中等任务上显著提升,但受反馈质量和基座能力限制。
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents
PolicyGuide 指出策略合规 LLM 智能体的现有防护不足。动作局部检查无法引导多步流程,工作流系统又只关注流程完成。它提出从守卫单个动作转向引导整个工作流。
Chain-of-Experience for Continual LLM Improvement
Chain-of-Experience 通过迭代测试时反馈循环持续改进 LLM。它在性能上超过零样本基线。同时成本更低、token 效率更高。