「Anthropic」发布新款中端旗舰模型「Claude Sonnet 5」并设为默认,主打 100 万 token 上下文窗口和更强的智能体能力——规划、浏览器与终端工具调用、以及以往要更大模型才能做的自主执行。模型已在 Claude、Claude Code、API 和托管智能体上线,早期促销价为每百万输入 token 2 美元、输出 10 美元,持续到九月初。对开发者意味着以中端价位就能拿到长上下文加强智能体的组合。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
「Anthropic」发布新款中端旗舰模型「Claude Sonnet 5」并设为默认,主打 100 万 token 上下文窗口和更强的智能体能力——规划、浏览器与终端工具调用、以及以往要更大模型才能做的自主执行。模型已在 Claude、Claude Code、API 和托管智能体上线,早期促销价为每百万输入 token 2 美元、输出 10 美元,持续到九月初。对开发者意味着以中端价位就能拿到长上下文加强智能体的组合。
How NVIDIA’s Inference Software Stack Powers the Lowest Token Cost
「NVIDIA」这篇讲随着企业从 AI 试点走向生产级「AI 工厂」,基础设施的决策重心已从峰值算力规格转向每 token 成本——即在既定延迟下每美元、每瓦能产出多少有用 token。文章介绍其推理软件栈如何与 GPU、CPU、网络和系统协同设计,再借开源生态放大效果,把 token 成本压到最低。对做大规模推理部署的团队,这是关于如何算清并优化服务经济性的官方视角。
Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding
「DeepReinforce」发布首个开源权重模型「Ornith-1.0」(MIT 许可),主打面向智能体编程的自搭脚手架能力,含 9B/31B 稠密与 35B/397B MoE 多个规格,构建在预训练的「Gemma 4」和「Qwen 3.5」之上,在同体量开源模型中拿下编程基准的最优表现。值得注意的是它复用了他人预训练模型且许可兼容,这种在强底座上再训练出专长模型的路子,对想低成本做垂直编程模型的团队有参考意义。
「vLLM」发布 v0.24.0,含 256 位贡献者的 571 次提交。重点是新增对「MiniMax-M3」模型的支持,并快速跟进了 BF16/FP8 indexer、MXFP4、FP8 稀疏 GQA 等一系列量化与算子优化,同时对 AMD/ROCm 做了大量调优(MI300X、gfx950 上的 mxfp8 MoE、FP8 KV 缓存修复等)。对用 vLLM 部署新模型或跑在 AMD 卡上的用户,这一版在模型覆盖和硬件适配上都值得升级。
「TensorRT-LLM」发布 v1.3.0rc20,最重要的信号是这将是最后一个支持 TensorRT 后端的版本,下一版就会移除该后端。此外新增了「DeepSeek V4」的准备工作和配置「TeaCache」系数的 API,也做了一处破坏性改动——把请求的 chat_template 改为需显式开启。已知问题包括「DeepSeek V3/V3.2」预热时可能崩溃或挂起。对依赖 TensorRT 后端的用户,这版是明确的迁移预警。
Memora: A Harmonic Memory Representation Balancing Abstraction and Specificity
「微软研究院」提出记忆系统「Memora」,针对 AI 智能体记不住过往对话、只能反复重载或检索上下文、任务越长越低效的痛点。它的核心是把「存什么」和「怎么取」解耦——用一种在抽象与具体之间取得平衡的和谐记忆表示,让记忆既可扩展又便于检索。对做长程、多轮智能体的人,这类可扩展记忆表示是缓解上下文膨胀、维持长期一致性的关键组件。
Claude Meets Blackwell Ultra: Anthropic’s Models Now Run on NVIDIA GB300 in Azure
「Anthropic」的「Claude」模型在微软「Foundry」上正式可用,托管于 Azure 并跑在「NVIDIA GB300 Blackwell Ultra」GPU 上,让 Azure 原生企业多了一条搭建自主与垂直 AI 智能体的路径。这标志着 Claude 进一步深入企业云与最新一代硬件的组合,对已在 Azure 生态里、想用 Claude 做智能体的企业客户直接扩大了可选项。
Why Specialization Is Inevitable
「HuggingFace」这篇博客题为「专业化为何不可避免」,探讨在通用大模型之外,为特定领域或任务做专门化模型的趋势为何势不可挡。核心观点指向随着能力和场景细分,垂直、专精的模型会越来越有价值,对在通用与专用之间做技术选型的从业者是一份趋势判断的参考。
「NVIDIA」这篇属于 Omniverse 系列,讲用合成数据加微调来提升视觉 AI 智能体准确率的三套工作流。视觉 AI 智能体正成为把工厂等物理世界视频数据自动转成运营情报的实用手段,文章基于「OpenUSD」和 NVIDIA Omniverse,展示如何用合成数据补足真实数据的缺口并做针对性微调。对做工业视觉、缺标注数据的团队,是一条用仿真数据提升精度的落地路径。
Devin Fusion 💻, DeepSeek DSpark ⚡, economy of tokens 💰
这期「TLDR AI」聚焦几条动态:编程智能体「Devin」推出「Fusion」、「DeepSeek」发布「DSpark」、以及围绕「token 经济学」的讨论。整体反映出编程智能体持续迭代、国产厂商 DeepSeek 有新动作、以及行业对 token 成本与服务经济性关注度上升这几条主线,适合快速扫一眼近期要闻。
Featuring Every Eval Ever Results on Hugging Face Model Pages
「HuggingFace」在模型页面上线了「Every Eval Ever」评测结果的展示功能,把各类评测跑分直接聚合呈现在模型页上。对要在众多开源模型间做选型的人,能在一个地方看到某模型在各项评测上的成绩,省去到处搜集跑分的麻烦,提升了模型比较和挑选的效率。
DiScoFormer: One transformer for density and score, across distributions
「HuggingFace」介绍「DiScoFormer」,主打用一个 transformer 同时建模密度与分数(score),且能跨不同分布通用。把密度估计和 score 建模统一到单一模型里、并做到跨分布迁移,是生成建模里颇有意思的一步,为需要同时估密度和分数的场景提供了更简洁的统一架构。
Multi-tenant LLM analytics with row-level security: How we built a secure agent on AWS
AWS 分享了 PAR 如何为多租户 LLM 分析系统落地行级安全(row-level security),关键在于一套三层纵深防御架构:用「AWS SigV4」做请求的密码学签名、在「Amazon Bedrock」上做语义校验、再靠「Split-Plane SQL」在程序层强制数据隔离。三层各自独立生效,即便 LLM 本身被攻破或被提示注入操纵,也能压低跨租户数据泄露的风险。对做企业级 Agent 数据分析的团队,这提供了一个别把安全全押在模型自身、而用确定性外层兜底的可复用范式。
Together AI at ICML 2026: frontier research across the full stack
Together AI 宣布有九篇论文入选「ICML 2026」,覆盖从底层到应用的全栈研究,并称这些成果正是其云平台能力的来源,会议期间在首尔设展位。对关注推理与训练基础设施的从业者,这是一个观察该公司技术路线与前沿投入方向的窗口。
Ray 发布 2.56.0,重点是 Ray Data 的稳定性提升:支持在同一集群内跑多个 dataset、为基于 CPU 的「map-batches」加入自动批大小选择、并默认配置逻辑内存以防 OOM。同时收紧了「iter_batches」的稳定性,减少隐藏缓冲、在消费者提前退出时关闭执行器,从而降低常见训练负载下的对象存储溢写。对用 Ray 做数据加载与分布式训练的工程师,这些改动能直接缓解内存爆和 IO 抖动问题。
Ollama 发布 v0.31.0,主要变更是启动时会检查 hermes 桌面端的最低版本要求。属于常规维护性更新。
Ollama 发布 v0.30.12,修复了工具调用解析的一个细节:在检测工具调用结束时会忽略 JSON 字符串内部的花括号,避免误判;同时更新了 mlx 依赖与 llama.cpp。对依赖 Ollama 做本地工具调用(function calling)的开发者,这能减少解析出错导致的调用失败。
RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference
长上下文推理的最大瓶颈是巨量 KV 缓存,而现有稀疏注意力要么用固定预算的 Top-k 静态检索、要么依赖既贵又有偏差的代理分数来挑选关键 token。「RaBitQCache」换了个思路:用随机旋转后的二值量化把 Key 压成比特串,配合二值与 INT4 的高吞吐算术来快速估计注意力权重,从而低成本地判断哪些 token 值得算。旋转能均摊各维度信息、减小量化偏差,比特级运算又极省带宽和算力,等于用近似打分替代昂贵的全精度点积,在保持精度的同时把长文本注意力的检索开销大幅压下来。
Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR
「LoRA」在监督微调下表现稳定,但搬到「RLVR」(带可验证奖励的强化学习)场景就不一样了:本来在 SFT 里优于普通 LoRA 的结构化初始化变体「PiSSA」和「MiLoRA」,在 RLVR 下反而可能跑不过普通 LoRA,甚至训练发散。作者把根因归到初始化破坏了几何结构,提出一种保持几何的正交归一初始化,让低秩适配矩阵在 RL 训练起点就具备良好的正交性与尺度,从而稳住训练、恢复并超过基线表现。这对想用参数高效微调做 RLVR 的人是个实用提醒——SFT 上的最优招数不能照搬到 RL。
On the Convergence of Self-Improving Online LLM Alignment
「SAIL」这类自我改进对齐算法用把双层优化降为单层的技巧来应对在线对齐里的分布漂移,实践效果不错,但一直缺乏收敛性的理论保证。作者指出症结在于标准 SAIL 目标函数的 Hessian 性质不佳、无法保证强凹,于是从这一点切入修正目标并给出收敛性分析,把这套经验上好用的方法补上了理论地基。对做在线 RLHF/对齐的研究者而言,这类分析的价值在于说清楚方法何时可靠、参数该怎么调才不至于失稳。
Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
电脑操作智能体靠自我改进循环攒数据——在可验证环境里反复微调自己成功的轨迹,但失败轨迹通常被直接丢掉,浪费了大量信号。这篇提出在推理时从失败中学习:让智能体把失败经验转化为可用的反思或指导,在测试时就地自我改进,而不必再走一轮昂贵的采集加微调。好处是既榨取了失败样本的价值,又省去重训成本,对轨迹数据稀缺的电脑操作类智能体尤其对症。
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
这篇主张智能体能力该靠拉长任务视野而非堆参数来提升:「Agents-A1」是个仅 35B 的 MoE 智能体模型,通过长视野轨迹扩展加异构能力扩展,做到了对标万亿参数模型的水平。训练分三阶段——先监督微调打底,再训练领域级教师模型,最后做多教师蒸馏把各路专长汇聚到一个小模型里。核心洞见是长程任务表现更依赖轨迹长度和多样能力的覆盖,而不是单纯的参数规模,为用小模型做强智能体提供了一条性价比很高的路径。
ReFreeKV: Towards Threshold-Free KV Cache Compression
KV 缓存剪枝方法大多依赖人工阈值来决定丢哪些 token,阈值一旦设不好,跨数据集、跨模型的表现就很不稳。「ReFreeKV」提出一种免阈值方案,能自适应地给不同位置分配压缩预算,而不是靠一刀切的门限,从而在多种数据集和模型规模上都能逼近全缓存的效果。对部署来说,免去繁琐的阈值调参、又能保住精度,是它最实用的卖点。
MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents
视觉-语言-动作模型能把网络规模的语义知识迁移到机器人控制,但当下单帧架构有三个硬伤:只看当前帧的时间近视丢掉了历史动态、高层指令与底层电机命令之间存在推理鸿沟、自回归标量解码还拖慢推理。「MIRTH」用一套统一框架应对——引入时间枢纽来保留历史动态并做跨时刻的互信息推理,弥合指令到动作的语义落差,同时改进解码效率。思路上把时序记忆、推理桥接和高效解码一并解决,指向更连贯、更实时的具身控制。
ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs
多模态大模型的幻觉顽疾,作者找到了一个内部信号:生成过程中文本到图像的交叉注意力会渐进衰减,表现为注意力失焦或偏置,导致内容与图不符。现有缓解手段多是结果导向、不直接针对这个失效机制。「ADAPT」反其道而行,用偏好调优去对齐注意力动态,直接把交叉注意力拉回到该看的图像区域上,从机制层面抑制幻觉而非事后补救,对追求图文忠实的多模态应用更有针对性。
大规模预训练里异步流水线并行一直被担心梯度延迟会拖垮稳定性和收敛,这篇给出一个反直觉结论:一步梯度延迟并不是障碍。基于「PipeDream-2BW」,通过恰当的优化器选择加误差反馈校正,异步方案能做到接近同步训练的效果,把陈旧梯度带来的偏差补回来。对做万卡级预训练的团队,这意味着可以更放心地用异步流水线换取更高的设备利用率和吞吐,而不必过度担心精度损失。
DA-Studio: An Agentic System for End-to-End Data Analysis
真实数据分析是对异构输入的多步流程,而不只是给个最终答案,但现有基于大模型的分析工具多聚焦孤立子任务,缺乏对完整、可执行工作流的支撑。「DA-Studio」是个端到端的智能体系统:能自主编排多步工作流,在受控沙箱里执行生成的代码,并通过可见的动作轨迹和中间产物保持全程可检查。对数据分析场景,它把自动编排、安全执行和可审计这三点合到一起,让智能体做的分析既能落地又能被人核验。
AsyncOPD: How Stale Can On-Policy Distillation Be?
「On-Policy 蒸馏」在大模型后训练里效果好,但采样生成和学习更新耦合在一起会成为速度瓶颈。「AsyncOPD」把 rollout 生成与 learner 更新解耦成异步流水线来提速,随之而来的问题是策略数据变陈旧——学生学的是旧策略产出的样本。论文系统研究了这种陈旧到底能容忍多少、以及需要哪些针对性手段来抵消其影响,为异步后训练在吞吐和稳定性之间划出可用的边界。
TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
智能体调用工具时,很多操作其实是有用、冗余还是误导的混杂,笼统的结果奖励分不清哪次工具调用真正起了作用。「TACO」用两条优势通道做细粒度信用分配:一是「差分答案探针奖励」,通过对比有无某次工具调用来衡量它对答案的实际贡献;二是「结果门控优势路由」,按最终成败来分配优势。这样就能把功劳精确归到有用的工具操作上、抑制冗余和误导性调用,提升多模态智能体的工具使用效率。
SWE-Together: Evaluating Coding Agents in Interactive User Sessions
现有编程智能体评测多是一问一答式,脱离真实的多轮协作。「SWE-Together」用真实的用户-智能体交互构建多轮编程基准,还配了一个会「反应」的大模型模拟器来扮演用户,评测时不只看最终代码是否正确,还看交互效率——用了几轮、是否绕弯。这更贴近程序员和 AI 结对编程的实际情形,能揭示只看终态正确率会漏掉的交互质量问题。
Mind the Heads: Topological Representation Alignment for Multimodal LLMs
多模态大模型的视觉理解和幻觉问题,「HeRA」从注意力头这一细粒度切入:它逐个对齐各注意力头,让它们在跨模态时保持局部邻域关系的一致性,即用拓扑表示对齐来保住图文之间的近邻结构。这样能强化以视觉为中心任务的表现并减少视觉幻觉,视角上不同于整体对齐,而是抓住单个头的局部几何来做文章。
Agentic Abstention: Do Agents Know When to Stop Instead of Act?
智能体不只要会行动,还得知道什么时候该停手——面对不确定性时选择弃权、不硬做,本身就是一种能力。这篇把「智能体弃权」作为研究对象,考察智能体能否在跨多个环境和任务类型的序贯决策中,判断出继续操作弊大于利、从而恰当地中止。对安全可靠的智能体部署而言,会停比会做同样重要,这项工作把「知道何时停」明确立成了一个待评测的问题。
TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
「TUA-Bench」是面向通用终端使用智能体的基准,覆盖多样的数字活动和专门工作流,专门考察智能体在命令行/终端环境里完成实际任务的能力。评测结果暴露了当前前沿智能体之间存在明显的性能差距,说明终端操作这类需要精确命令和多步执行的场景仍是硬骨头,为后续改进提供了标尺。
Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
这篇想把视频问答和视频引导的智能体任务打通:一个新基准同时考察多模态大模型理解视频内容以及据此执行 GUI 操作的能力,并提出一种通用关键帧提取方法,从长视频里挑出真正信息量大的帧。关键帧选得准,既能提升视频问答的准确率,也能让视频引导的智能体任务表现更好,等于用一套帧筛选同时服务理解和行动两端。
Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning
很多视频基准其实靠单帧物体识别就能刷分,测不出真正的时序推理。「Video-MME-Logical」是个受控的诊断基准,通过可控的时序-逻辑操作来考察多模态大模型能否对动态视觉证据做真正的推理,而不是识别静态物体。受控设计让人能分离出模型在时序逻辑上的短板,为诊断和改进视频推理能力提供了更干净的标尺。
OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks
「OSWorld 2.0」是评测电脑操作智能体的综合基准,用复杂的真实世界工作流来考察智能体,任务更长程、更贴近日常实际操作。测评揭示了当前智能体在推理和任务完成上的明显局限,说明在需要多步规划和长链条执行的真实桌面任务上,前沿智能体离可靠可用还有距离,为该方向指出了改进空间。
GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots
GUI 智能体最缺的是带标注的界面数据,「GUICrafter」用弱监督绕开这个瓶颈:直接利用海量无标注截图,配合两阶段课程学习——先做视觉定位(把元素和位置对上),再用强化学习做校准。这样既省去昂贵的人工标注,又能从廉价截图里学出可用的界面理解和操作能力,为 GUI 智能体的数据难题提供了一条低成本的扩展路线。