Meta 发布一款开源智能体模型,强调可在本地运行,并支持视觉理解与工具调用。这使开发者能在自有环境中部署多模态 Agent,尤其适合对数据隐私和 API 成本敏感的工作流。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
Meta 发布一款开源智能体模型,强调可在本地运行,并支持视觉理解与工具调用。这使开发者能在自有环境中部署多模态 Agent,尤其适合对数据隐私和 API 成本敏感的工作流。
SGLang 发布 v0.5.18,合并了来自 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge 与 Distilled、LongCat-Image 等多个模型支持。该版本还补充了 Qwen3.8 系列、Ling-3.0、Nemotron 3.5 Lightning 的 cookbook 配方。这显著扩展了多模态和扩散模型在统一推理框架中的覆盖。
DeepSeek 发布了一款多模态模型,为原有文本能力加入视觉理解,被社区称为小鲸鱼长出了眼睛。这意味着 DeepSeek 在多模态基座上继续补齐能力,可能影响后续 Agent 和视觉问答场景的评测竞争。
Deepseek releases experimental Flash vision model that rivals Opus 4.8 on agent benchmarks
DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp,在 V4-Flash 文本能力上增加图像理解,公司多模态智能体基准中接近甚至有时超过 Opus 4.8。这为开发者提供了新的低成本视觉 Agent 测试选项,也反映 DeepSeek 在多模态 Agent 评测上的积极布局。
llama.cpp b10584 修复了在非统一 KV cache 下 draft context 容量计算错误的问题,并让 fit 与 n_streams 参数协同。此前 draft context 以 n_ctx=0 创建并回退到 n_ctx_train/n_streams,一旦 slot 超过该值会导致 draft batch 解码失败并返回 500。该修复提升了草稿模型解码的稳定性。
llama.cpp b10577 修复了 draft-mtp 与 embeddings 结合时的问题,确保草稿多 token 预测在嵌入场景下正常工作。对使用投机解码和嵌入推理的用户有直接帮助。
llama.cpp b10576 为 SYCL 后端重新添加 Q2_K 重排 MMVQ 和 ESIMD 内核,并加入 gate 参数。该改动改善了 Intel GPU 等 SYCL 设备上的量化矩阵向量乘性能和可用性。
viable/strict/1787382165: support min, max in maybe mark dynamic (#194091)
PyTorch 为 torch._dynamo.maybe_mark_dynamic 新增 min 和 max 参数,允许将维度标记为动态并给定初始范围,而不强制该维度必须保持动态。这样 guards 可以在该范围内窄化,维度仍可特化。
Reduce RAG costs on Amazon Bedrock with query-aware compression
AWS 机器学习博客介绍在 Amazon Bedrock 上通过查询感知压缩降低 RAG 成本的方法。检索后先用较小模型根据查询过滤检索块,再由主模型回答,从而减少输入 token 和成本,同时保持答案质量。
视频生成迎来“Claude Code时刻”,MiniMax Design “杀入” Adobe、Canva 腹地
MiniMax Design 的发布被拿来与视频生成的 Claude Code 时刻类比,表明视频生成从模型能力迈向设计工具和产品化。它直接切入 Adobe、Canva 所在的创意设计市场,对视频生成和设计工作流的从业者值得关注。
Simon Willison 提出高效使用编码智能体的关键不是逐行审查代码,而是能自信地指示修改方向并验证修改是否正确落地。文章指出验证代码变更还有多种方式,逐行检查往往不是最有效的。
llama.cpp b10585 新增 json.h 抽象,并迁移 common、server、Jinja 适配和测试相关代码。该改动还修复了 server 崩溃并进行清理,为后续 JSON 处理统一化奠定基础。
viable/strict/1787428363: Revert "support min, max in maybe mark dynamic (#194091)"
「PyTorch」回滚了在「maybe mark dynamic」中支持最小值和最大值的改动,原因是内部差异被回退。该改动若合入会影响动态形状标记逻辑,此次回滚意味着相关能力暂不会进入主线。
Cloudflare 推出 Agent Tracing:支持截断限制,不同框架的 Payload 默认记录策略存在差异
「Cloudflare」推出「Agent Tracing」,为智能体调用链提供追踪能力,并支持截断限制以控制数据量。不同框架在「Payload」的默认记录策略上存在差异,从业者接入时需要按框架调整可观测性与合规配置。
「llama.cpp」恢复「Ubuntu」平台的「ROCm」CI 任务,并把「ccache」的编译器检查改为按内容匹配。由于「ROCm」工具链每次「pip」重装都会改变「clang」二进制时间戳,原默认的按时间戳检查会让热构建缓存命中率只有约七成,改成内容哈希后缓存可跨工具链重装复用。
Study explains why AI agents benefit from "skills" and when they fail
普林斯顿大学和加州大学圣迭戈分校的研究指出,智能体技能库带来的提升主要来自结构化工作流,而不是额外知识。但随着技能库变大,智能体越来越难检索到合适指令,这解释了技能机制在什么条件下会失效。
How Claude Watermarks AI-Generated Text
该视频讲解「Claude」如何给 AI 生成文本加水印,覆盖「token」采样、水印检测与移除三个环节。对关注生成内容溯源、模型合规与检测的从业者是一份直观入门材料。
「llama.cpp」新增对「bailingmoe3」模型的「DSpark」支持,使该「MoE」模型能够在相关后端加载和运行。对本地部署该模型的用户提供了更直接的兼容路径。
「llama.cpp」的多模态模块新增「dots3-note」模型的视觉和音频支持,覆盖转换初始化与「GGUF」张量映射更新。这使本地推理栈可以加载该多模态模型的音视输入。
「ggml」优化了「concat」算子,把逐元素内存拷贝改成按行连续块拷贝,并修复了行级拷贝的偏移,增加行连续性断言。拼接张量是推理和数据处理中的常见操作,该改动可降低拷贝开销。
「PyTorch」修复了图输出包含张量子类时「opaque constant」被损坏的问题,提升张量子类在图编译场景下的稳定性。对使用子类输出的自定义模型和编译器后端有实际意义。
World models that ignore human beliefs predict the wrong actions, new research shows
研究指出「Sora」「Genie」等现有世界模型只模拟物理,而忽略人的信念、意图和感受,会预测出错误动作。新框架「Mental World Modeling」加入心理变量后,即使更弱的语言模型也能超过没有心理建模的更强模型,当前最大瓶颈是物理状态与心理状态的联合演化预测。
The Evolution of the Agent Harness
文章认为智能体框架的能力正不断被模型吸收进权重,未来「harness」会从模型外挂变成争夺人类注意力的层。这对理解「Agent」架构演进和产品设计有启发。
「PyTorch」在「C++ API」一致性测试中加入「privateuse1」后端的支持,方便第三方后端验证与主「API」的行为一致性。对开发「out-of-tree」后端的团队有帮助。
Psychological methods reveal major weaknesses in AI security testing
英国 AI 安全研究所用心理测量方法发现,主流语言模型安全基准并没有测量一致的安全特质;全面拦截请求会人为抬高安全分数,却让模型日常实用性下降。研究还提出识别模型在测试时比日常使用更谨慎的方法。
「llama.cpp」发布 v0.2.0,开始采用一致的语义化版本号,新的「vX.Y.Z」标签表示稳定版本,原有「b」标签继续作为接近每次提交的「nightly」或「dev」版本。这让下游项目能更简单地选择分发和使用的版本。
「PyTorch」将「multihead_attention」测试改为设备无关,以便「out-of-tree」后端复用该测试。这有助于不同设备后端验证多头注意力实现的一致性。
viable/strict/1787378140: Drop the unused BiasType parameter from the grouped FP8 GEMM (#194189)
「PyTorch」从 grouped FP8 GEMM 中删除了未被使用的 BiasType 参数,该参数会让 tile-size 派发树和 CUTLASS 别名被重复实例化两次。公开的 bias 参数及其检查保持不变,因此能减少无谓的编译和实例化开销。
「Ollama」 v0.33.0-rc1 对模型推荐端点进行签名,增强该接口的安全性和防篡改能力。对使用模型推荐功能的部署方来说,能降低接口被伪造的风险。
Simulation: the new Scaling Law — Joon Sung Park, Simile AI
「Simile AI」CEO 从病毒式传播的「Generative Agents」研究讲到打造 80 亿人类数字孪生的计划,认为仿真正成为新的扩展律,并已从有趣探索变成严肃商业。
「Ollama」 v0.33.0-rc0 加入「Claude」模型管理功能,便于在本地工具中配置和使用「Claude」模型。对希望统一管理不同模型源的开发者是实用更新。
Nvidia just showed that the harness, not the AI model, is now the real hero
「Nvidia」的研究表明,通过微调,即使底层模型在任务上并不出色,AI 智能体也能表现良好且不失控。这说明外部「harness」和微调策略可能比模型本身更关键。
神秘“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱 or 小米
一款名为「Ox Alpha」的神秘模型出现在「OpenRouter」,性能被指超过「Fable 5」,社区猜测其可能来自智谱或小米。该事件成为近期模型格局讨论的热点。
Agentic Data Operations Platform (ADOP): Data engineering into hours
「AWS」推出基于「Amazon Bedrock」的「ADOP」参考架构,用专用 AI 智能体自动化「Bronze-to-Silver-to-Gold」数据管道全生命周期,将新数据源接入从数周压缩到数小时,同时保持治理与合规控制。这对数据工程团队向智能体化转型有参考价值。
Govern AI agent tool access with Amazon Bedrock AgentCore Gateway
该文介绍用「Amazon Bedrock AgentCore」构建受治理的智能体工具网关,按「Connect」「Control」「Catalog」「Harden」四个成熟度阶段推进,为智能体提供可审计的企业工具访问,且无需整合底层基础设施。
「llm-openrouter」0.7 发布,兼容「LLM」0.32,可显示「OpenRouter」模型的推理轨迹,并改用「OpenRouter」的「Responses API」。新增「Shell」「WebFetch」「WebSearch」三个服务端工具,可通过 -T 选项启用。
「JetBrains」详细说明其控制 AI 支出快速增长的首批举措,涉及内部 AI 使用和成本管理。对关注企业 AI 成本治理的团队有参考价值。
[AINews] 10% worse, 100x cheaper, 10000x faster: Why Simulation is taking over
文章用「准确率低 10%、成本低 100 倍、速度快 10000 倍」概括仿真为何兴起,认为仿真正接管越来越多场景,且不止于模型训练。这为低成本模拟与数据生成路线提供了论据。
viable/strict/1787380057: [Test] Refactor test/test_shape_ops.py (#187926)
「PyTorch」重构了「test_shape_ops.py」测试文件,改善形状操作测试的可维护性。对参与框架测试和持续集成的开发者是例行但必要的清理。
Anthropic’s Opus 4.6 is a smut-machine
「TechCrunch」测试发现,「Anthropic」虽禁止「Claude」生成露骨内容,但「Opus 4.6」较容易绕过限制。这对内容安全策略和模型越狱防护提出了警示。
FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving
FlashPrefill V2 针对长上下文大模型服务中 prefill 阶段注意力计算成本过高的问题,提出均值校正的块稀疏注意力近似,并配套优化了 GPU 算子和框架集成。它通过稀疏选择与均值修正减少长上下文预填充的计算量,同时尽量保持注意力质量。相比密集基线实现了显著加速,对长上下文 LLM 的 serving 吞吐有直接收益。
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
SWE-bench Science 把代码智能体的评测扩展到科学软件修复场景,用于检验编码 Agent 能否处理科研工程任务。它揭示出这些 Agent 在科学软件问题上的典型失败机制,并发现引入科学领域指导的效果并不一致。该基准为科研软件自动化修复和 Agent 能力边界提供了更细粒度的参照。
Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See
这篇研究探索低资源语言微调对专家混合模型推理行为的影响,发现 SFT 会让模型把推理过程迁移到低资源语言中,但不会损害准确率。进一步用可验证奖励做强化学习时,模型能修复输出格式错误和泄漏缺陷。这揭示了 SFT 与 RL 在语言迁移和推理质量上各自的作用边界。
Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization
IAR 提出三阶段后训练框架,解决把文档知识内化到模型后容易损伤通用能力以及依赖外部检索库的问题。框架先注入结构化文档知识,再将模型对齐到无检索问答形式,最后恢复通用能力。它在领域准确率和通用性能上同时带来提升,适合需要离线知识内部化的场景。
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
Co-RL 面向无监督推理场景,通过多智能体协作强化学习从同侪反馈中构造奖励信号,避免对人工标注真值的依赖。该方法在文本和视觉任务上都取得了性能提升。它为缺乏 ground-truth 标签时训练推理能力提供了一条新路径。
SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE 让语言模型通过自博弈方式设计自适应可执行训练环境,并学习求解这些环境,再用遗憾值驱动环境选择来聚焦自身薄弱点。这样模型可以持续生成对自己有挑战的任务,提升推理与工具使用表现。该方法为可扩展的自我对弈训练提供了一个闭环框架。
FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents
FM-Bench 构建了一个长周期管理基准,让 LLM 智能体在 20 年时间跨度里运营一家足球俱乐部。评测结果显示,影响绩效的主要是经理行为,而不是模型规模或 token 支出。这对长期决策智能体的评估和资源投入方向有重要参考价值。
Looped Language Models Improve Compositional Tool Calling
循环语言模型通过循环计算改进多步组合式工具调用,解决传统模型在多步工具使用中的规划与组合难题。它还引入自适应推理,在准确率和计算成本之间做动态平衡。该工作展示了循环结构对复杂工具调用流程的增益。
EnvHarness: Awakening Static Worlds for Agent Learning
EnvHarness 和 EnvRigger 针对静态学习环境难以针对智能体弱点进行调整的问题,利用可编程插件动态重塑环境。这样环境能针对智能体弱点生成训练场景,并与强化学习共同进化。它提升了 Agent 在动态环境中的学习效率和泛化能力。
FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
FACET 解决终端任务合成中指令、解法和验证器容易脱离真实环境导致不可执行的问题。它保留原始任务意图,并在修复后的共享环境中对齐指令、解法和验证器。这使得终端任务可用于大规模智能体训练,提高可扩展性。
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
MemTrapBench 研究检索到的记忆会诱导大模型产生推理错误和信念扭曲的认知陷阱。它提出一种推理时策略,能在保持基准性能的同时帮助模型避开这些陷阱。这为记忆增强 LLM 的可靠性和安全性提供了新视角。
SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback
SkillEvo 利用多轮交互反馈来改进智能体技能,并通过主动治理机制维持进化梯度。该方法旨在解决多轮学习中反馈稀疏和技能退化的问题。它为持续自我改进的智能体技能库更新提供了机制。
Repo0: Design-Driven Zero-to-All Code Generation
Repo0 提出双图架构状态和模块化导向的结构演化方法,从自然语言需求生成完整软件仓库。它针对传统代码生成只覆盖单文件或局部功能的问题,提升整体功能覆盖率。该工作对自动化软件工程和仓库级代码合成有实际意义。
EXIMO: VLM Guided Exploration of VLA Policies
EXIMO 聚焦大规模视觉语言动作机器人策略的高效微调,将 VLM 引导探索、编排数据上的模仿学习和残差离线策略强化学习结合起来。这种组合可以减少对高质量机器人数据的依赖,同时提升策略学习效率。对机器人基础模型微调有借鉴价值。
Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses
Hierarchical Self-Improvement 针对冻结 LLM Agent 的特定任务执行框架进行自动进化,通过分层自修改来更新任务专用 harness。在中等难度任务上取得显著提升,但也受反馈质量和基座模型能力限制。该方法为在不训练大模型的前提下增强 Agent 能力提供了思路。
τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
τ_0-VLA 提出分层视觉语言动作模型,面向长视程机器人操作任务,用世界模型引导测试时搜索来扩展高层子任务决策的计算量。它解决了固定策略在长程操控中规划不足的问题。结果在长程机器人操作上获得改进。
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents
PolicyGuide 处理客服 LLM 智能体必须遵循组织政策的问题,指出合规失败既来自禁止动作,也来自遗漏身份核验或确认等程序要求。运行时单动作护栏无法引导多步流程,而工作流系统主要关注流程完成而不是政策合规。PolicyGuide 从只保护单个动作转向引导整个工作流,以改善政策合规性。
Chain-of-Experience for Continual LLM Improvement
Chain-of-Experience 提出通过迭代的测试时反馈回路让大模型持续改进,而不是一次性推理。该方法相比零样本基线表现更好,成本更低且 token 效率更高。它为推理时持续优化提供了轻量方案。
The Embedder's Dilemma: LLMs Are Better, but at What Cost?
这篇研究针对嵌入选型中的成本与性能权衡,比较了 LLM 与专用嵌入模型。它们在多样任务上的聚合性能几乎一致,但专用嵌入模型更便宜、更快。作者建议按任务类型进行分工,这为 RAG 和向量检索系统的成本优化提供了依据。
QuoteBench: How Matched Scores Can Hide Command-Path Failures
QuoteBench 揭示执行边界解析错误会显著降低 LLM 编码智能体的成功率,即使匹配分数看起来不错。公开边界信息有助于恢复性能,说明评测必须考虑部署配置而非把匹配分数当作模型固有属性。这对代码生成评测和部署有提醒作用。