行业动态 27 条
Experience and Lessons Learned from Serving Multi-Stage Qwen3-Omni in vLLM-Omni
vLLM 博客 · 07-01 08:00 UTC+8
vLLM 官方博客复盘了在 vLLM-Omni 里服务 Qwen3-Omni 这类多阶段全模态模型的实战经验,模型按 Thinker-Talker-Code2Wav 三段流水线执行。文章详细分享了批处理、CUDA Graphs、异步分块、异步输出、多副本、热路径清理等一系列优化手段及性能验证。对要在生产里部署多模态/全模态模型的推理工程师,这是难得的一手调优参考。
vLLM全模态推理Qwen3-Omni推理优化
NVIDIA Releases Nemotron-Labs-TwoTower: an Open-Weight Diffusion Language Model Built on a Frozen Autoregressive Nemotron-3-Nano-30B-A3B Backbone
MarkTechPost · 07-01 16:10 UTC+8
NVIDIA 开源发布了 Nemotron-Labs-TwoTower,一个建在冻结的自回归主干(Nemotron-3-Nano-30B-A3B)之上的扩散语言模型,以开放权重形式随 Nemotron 开放模型许可放出。它瞄准的是自回归逐 token 串行解码带来的吞吐瓶颈——离散扩散语言模型可以并行出多个 token,从而提升生成吞吐。这是大厂把「扩散式文本生成」推向可用、并复用已有 AR 权重的一个值得关注的方向。
推理优化扩散语言模型NVIDIA开放权重推理吞吐
Claude Sonnet 5 🎭, Fable approved 🚀, Nano Banana 2 Lite 🍌
TLDR AI · 07-01 08:00 UTC+8
TLDR AI 简报本期集中在几则新模型消息:Anthropic 发布 Claude Sonnet 5、Fable 5 通过评估上线,以及 Google 的 Nano Banana 2 Lite 图像模型。对追踪各大厂模型节奏的从业者,这是一条快速掌握当日发布动向的信息汇总。
厂商动态模型发布Claude Sonnet 5行业动态
What's new in Claude Sonnet 5
Simon Willison · 07-01 05:23 UTC+8
Simon Willison 拆读了 Claude Sonnet 5 的开发者文档,指出 Anthropic 称其性能已接近 Opus 4.8 但价格更低。他还引用系统卡说明:Sonnet 5 在网络攻击类任务上明显弱于更强模型,这一「刻意降低危险能力」的设计也是它能顺利发布、不被监管卡住的原因之一。对开发者,这篇提炼出了比官方公告更可操作的模型定位信息。
厂商动态Claude Sonnet 5模型能力Anthropic定价
Introducing Claude Sonnet 5 on AWS: Anthropic’s most capable Sonnet model
AWS 机器学习 · 07-01 02:40 UTC+8
AWS 宣布 Anthropic 最新一代的 Claude Sonnet 5 已上线 Amazon Bedrock 与 AWS 上的 Claude Platform。它是新一代 Sonnet 的首个型号,主打以 Sonnet 的价位提供顶级智能,面向编码、智能体和日常专业场景。对在 AWS 上构建应用的团队,意味着可以更低成本接入这一代高性价比模型。
厂商动态Claude Sonnet 5AWS Bedrock模型上线Anthropic
Start building with Nano Banana 2 Lite and Gemini Omni Flash
Google DeepMind · 07-01 00:02 UTC+8
Google DeepMind 宣布开发者可以开始用 Nano Banana 2 Lite 和 Gemini Omni Flash 构建应用。前者是轻量级图像模型、后者是主打全模态与低延迟的 Gemini 型号,均面向需要高性价比多模态能力的开发场景。对做多模态应用的团队,这是 Google 侧新增的两个可选底座。
厂商动态Google DeepMindNano Banana 2 LiteGemini多模态
b9857
llama.cpp · 07-01 22:42 UTC+8
llama.cpp 发布 b9857 版本,核心是对高通 Hexagon 后端的 flash attention 做了大幅重构,带来一系列优化与精度改进,还把矩阵乘量化任务折进主 matmul 线程、与 ADD 融合等一连串内核层面的打磨。对在移动端/高通平台上跑本地推理的开发者,这版在性能与精度上都有实打实的提升。
推理优化llama.cppFlash AttentionHexagon端侧推理
fa4-v4.0.0.beta20
FlashAttention · 07-01 17:16 UTC+8
FlashAttention 放出 fa4-v4.0.0.beta20,同步了新的 _flash_attn_fwd 四元组返回签名,修复了与 CuTe DSL 4.6.0+ 的兼容问题,并在 SM100(Hopper 之后架构)上改进了 TMEM 分配、新增可关闭 split 对齐的开关等。对跟进 FA4 前沿、在最新 CUDA/CuTe 工具链上做注意力内核开发的工程师,这版主要是兼容性修复与底层细节完善。
推理优化FlashAttentionCUDA 内核注意力优化GPU
v0.31.1
Ollama · 07-01 08:25 UTC+8
Ollama 发布 v0.31.1,重点是让 Gemma 4 在 Apple Silicon 上大幅提速——借助多 token 预测(MTP),在一项编码 Agent 基准上平均出词速度快了近 90%。Ollama 会随运行自动调节草稿 token 数,加速默认开启、无需配置,且不改变模型输出。对在 Mac 上跑本地大模型的用户,这是一次开箱即得的显著性能提升。
推理优化Ollama端侧推理多token预测Apple Silicon
SkillOpt: Agent skills as trainable parameters
Microsoft Research · 07-01 00:50 UTC+8
微软研究院提出 SkillOpt,把 AI 智能体的「技能」(也就是那些手写的指令)当成可训练参数来优化。以往技能靠人工修改、改了也不保证变好;SkillOpt 把技能编辑变成一个训练过程,在不改动模型权重的前提下让 Agent 行为更可靠。这为「如何系统化地打磨 Agent 指令/技能」提供了一条可优化、可度量的新路径。
AgentAgent 技能微软研究院可训练参数智能体优化
NVIDIA BioNeMo Agent Toolkit Brings Accelerated AI to Life Sciences Researchers in Claude Science
NVIDIA 博客 · 07-01 01:00 UTC+8
NVIDIA 宣布其 BioNeMo Agent Toolkit 接入 Anthropic 本周发布的 Claude Science(一个面向科研的 AI 工作台),把 GPU 加速的生命科学工具栈带给研究者。NVIDIA 十多年来搭建的从硬件、框架、库到模型与领域工具的全栈能力,得以在这个科研智能体环境里为更复杂的工作流提速。对生命科学与 AI for Science 方向,这是工具链整合的一则动态。
AgentNVIDIA BioNeMoClaude ScienceAI for Science智能体工具
Gemini Spark, Google’s agentic assistant, is now available on Mac
TechCrunch · AI · 07-01 22:20 UTC+8
Google 的 24 小时全天候智能体助手 Gemini Spark 现已登陆 Mac,同时带来实时追踪、支持更多应用等改进。这标志着 Google 把其 agentic 助手推向桌面端、扩大可操作的应用范围。对关注端侧 Agent 落地与个人助理形态的从业者,这是 Google 侧的一步进展。
厂商动态Gemini Spark智能体助手GoogleMac
Meta, like SpaceX, looks to turn excess AI compute into cash
TechCrunch · AI · 07-01 21:43 UTC+8
继 SpaceX 之后,Meta 也在筹划把自家过剩的 AI 算力对外变现,计划推出云基础设施业务,向外部客户出售算力和模型访问权。此举意味着 Meta 将直接杀入 AWS、Google Cloud、Azure 主导的云市场,与三大巨头正面竞争。对从业者而言,多一个自建超大规模集群的算力供给方,可能改变训练与推理的采购格局和议价空间。
厂商动态MetaAI 算力云服务
not much happened today
smol.ai AI News · 07-01 13:44 UTC+8
「Anthropic」在补齐网络安全防护后重新上线了「Claude Fable 5」,并将部分请求路由到「Opus 4.8」处理,此举带动了「Cursor」「Devin」「Perplexity」等工具的接入调整。值得注意的是开发者应对前沿模型约束的方式正在转变——不再押注单一模型,而是采用多模型编排与模型组合策略;评测上「Fable 5」在「Remote Labor Index」拿到 16.10 分,「Sonnet 5」在「AA-Briefcase」上位列第二。
厂商动态AnthropicFable 5多模型编排
Trump drops restrictions on Anthropic’s Mythos and Fable models
TechCrunch · AI · 07-01 10:16 UTC+8
特朗普政府取消了对「Anthropic」旗下「Mythos」和「Fable」模型的出口限制。这一变动叠加其反复无常的 AI 政策,让整个行业对未来模型发布究竟受何种规则约束仍缺乏清晰预期。对从业者来说,出口管制的松紧直接关系到前沿模型能否对外供应及在哪些市场落地。
厂商动态Anthropic出口管制AI 政策
Announcing our $800M Series C to accelerate the shift to open-source AI
Together AI · 07-01 08:00 UTC+8
「Together AI」完成 8 亿美元 C 轮融资,用于加速向开源 AI 的转移。其核心论点是闭源模型的经济模型难以规模化,开源路线在成本上更具可持续性。对从业者而言,这笔巨额融资进一步夯实了开源基础模型与算力平台的商业底盘,也是开源阵营对闭源的一次高调下注。
厂商动态Together AI融资开源 AI
Hugging Face and Cerebras bring Gemma 4 to real-time voice AI
HuggingFace 博客 · 07-01 08:00 UTC+8
「HuggingFace」与「Cerebras」联手把「Gemma 4」带入实时语音 AI 场景,借助 Cerebras 的高吞吐推理硬件让该模型支撑低延迟的语音交互。对做语音应用的从业者来说,这意味着开源模型加专用推理芯片的组合,正在把实时语音的延迟和成本门槛进一步压低。
厂商动态HuggingFaceCerebrasGemma 4实时语音
Ahmad Osman on why local AI is catching up
Latent Space · 07-01 07:39 UTC+8
在两场爆满的 AIEWF 工作坊之后,Ahmad Osman 论证本地 AI 正在快速追赶云端——从笔记本、手机到企业级基础设施都在受益。对从业者而言,端侧和本地部署能力的成熟,意味着更多对隐私、成本或延迟敏感的场景可以摆脱对云端大模型的依赖。
推理优化本地 AI端侧部署
ScarfBench: Benchmarking AI Agents for Enterprise Java Framework Migration
HuggingFace 博客 · 07-01 02:32 UTC+8
「HuggingFace」推出「ScarfBench」,专门评测 AI 智能体在企业级 Java 框架迁移任务上的能力。这类迁移是企业里真实存在却又繁琐的工程活,用专门基准来衡量智能体表现,为评估 Agent 在实际代码迁移中的可用性提供了更贴近生产的标尺。
AgentScarfBenchAI 智能体代码迁移评测基准
Have your agent record video demos of its work with shot-scraper video
Simon Willison · 07-01 00:54 UTC+8
Simon Willison 在「shot-scraper」1.10 中新增了「shot-scraper video」命令,通过一个 storyboard.yml 文件定义针对 Web 应用的操作流程,再用 Playwright 录制成演示视频。他一直强调让编码智能体为自己的工作产出演示的重要性,这个命令正是为智能体自动录制成果演示提供的实用工具。
Agentshot-scraper编码智能体演示录制
Build generative UI for AI agents on Amazon Bedrock AgentCore with the AG-UI protocol
AWS 机器学习 · 07-01 00:46 UTC+8
AWS 演示了如何借助「AG-UI」协议,在「Amazon Bedrock AgentCore」上为 AI 智能体构建生成式交互前端,并集成进全栈方案模板「FAST」。文中还展示了「CopilotKit」如何在此基础上扩展出生成式 UI、共享状态和人在回路交互。对做 Agent 应用的开发者而言,这提供了一条把智能体后端与可交互前端打通的落地路径。
AWS BedrockAG-UI生成式 UIAgent
Implementing resilience patterns with Amazon Bedrock and LLM gateway
AWS 机器学习 · 07-01 00:40 UTC+8
这篇 AWS 文章给出在其平台上构建高韧性生成式 AI 应用的五种实用模式,从「Amazon Bedrock」原生能力逐步过渡到借助 LLM 网关做多模型编排。这些模式针对流量激增导致的配额耗尽、通过跨地域分布推理来保可用性、以及多租户下的吵闹邻居等真实痛点。对做生产级 LLM 服务的团队来说是可直接借鉴的容错设计参考。
推理优化AWS BedrockLLM 网关多模型编排高可用
Fine-tune Amazon Nova models for accurate email data extraction
AWS 机器学习 · 07-01 00:26 UTC+8
AWS 展示了用「Amazon SageMaker」对「Amazon Nova」模型做微调,以提升邮件数据抽取的准确率——通过让模型学习企业自有的数据模式、区分相似字段来解决抽取难题,最终把抽取准确率做到 94.77,同时把成本降低约一半。对有大量结构化信息抽取需求的团队,这是一个成本与精度双赢的微调实践样本。
后训练Amazon Nova模型微调数据抽取
Safely Releasing Frontier Models to Customers
AWS 机器学习 · 07-01 11:13 UTC+8
AWS 阐述了其如何安全地向客户发布前沿模型,强调「Amazon Bedrock」等 AI 服务建立在其二十多年安全投入的基础之上,目标是让 AWS 成为运行任何工作负载最安全的平台。对企业客户而言,这类安全承诺关系到能否放心地把前沿模型用于合规敏感的生产业务。
厂商动态AWS Bedrock前沿模型AI 安全
[AINews] Sonnet 5 today, and Fable 5 tomorrow
Latent Space · 07-01 11:01 UTC+8
Latent Space 的资讯播报预告「Sonnet 5」当天上线、「Fable 5」次日跟进,主题是「一切又重新开放」,指向此前受限的模型恢复对外供应。对从业者而言,这波前沿模型的重新可用意味着可以重新把它们纳入产品与工作流的选型。
厂商动态Sonnet 5Fable 5模型发布
Quoting Anthropic
Simon Willison · 07-01 07:58 UTC+8
「Anthropic」在推特上宣布,美国商务部已解除对「Claude Fable 5」和「Mythos 5」的出口管制,公司将于次日开始恢复访问。对依赖这两款前沿模型的开发者和企业来说,管制解除意味着供应链和可用区域的不确定性得到缓解,可以重新规划基于它们的部署。
厂商动态Anthropic出口管制Fable 5
Nano Banana 2 Lite
Simon Willison · 07-01 06:15 UTC+8
Simon Willison 试用了「Nano Banana 2 Lite」,也就是「Gemini 3.1 Flash Lite Image」,谷歌称其为最快最便宜、为速度与规模而生的 Gemini 图像模型。他用「找浣熊」式的提示测试,效果比今年 4 月试过的其他 Nano Banana 模型更好,不过图中英文文字仍出现两处拼写错误。对做图像生成的从业者,这代表低成本高吞吐图像模型这一细分方向的持续迭代。
厂商动态Nano BananaGemini图像生成
论文 20 篇
「GSRQ」以增益-形状残差量化把「KV Cache」压至亚1比特,为长上下文推理显存瓶颈提供新解法。
GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache
ICML 2026CCF-A推荐arXiv · 07-01 23:25 UTC+8
长上下文 LLM 部署的头号瓶颈是 KV cache 随序列线性膨胀,这篇工作把矢量量化里的残差量化(RQ)推向亚 1 bit,用小码本逐级编码残差。作者的关键洞察是主流方法仍沿用标准 L2 K-means 学码本,而这在高维残差分布上并不最优,于是提出「增益-形状残差量化」,把向量拆成模长(增益)与方向(形状)分别量化,更契合 KV 激活的统计结构。这样能在把 KV 存储压到 1 bit 以下的同时保住精度,对想在有限显存里跑超长上下文的推理工程很有直接价值。
推理优化KV Cache 压缩矢量量化长上下文推理显存优化
Soosung Kim, Minjae Park, Eui-Young Chung, Jaeyong Chung
Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use
ICML 2026CCF-A推荐arXiv · 07-01 23:40 UTC+8
LLM 智能体在静态基准上表现亮眼,一落到真实场景就因用户意图、工具集、交互动态的持续变化而失灵。作者把这一现象形式化为「开放世界工具使用」问题,明确刻画了查询、动作、观测、领域四个维度上的分布漂移,并搭了一个可控沙盒来逐项拆解每种漂移对成功率的冲击。核心结论是当前靠静态数据训练出来的 Agent 泛化能力很脆弱,这为「怎么训练能扛住线上分布变化的智能体」提供了诊断框架和可复现的评测抓手。
AgentAgent 泛化工具调用分布漂移评测基准
Song-Lin Lv, Weiming Wu, Rui Zhu, Zi-Jian Cheng, Lan-Zhe Guo
CAT: Confidence-Adaptive Thinking for Efficient Reasoning of Large Reasoning Models
ACL 2026CCF-A推荐arXiv · 07-01 20:27 UTC+8
大推理模型靠长思维链解决难题,却常在简单问题上「过度思考」,白白烧掉大量 token。已有压缩方案要么一刀切地砍长度、要么依赖粗粒度的难度估计,结果在真正的难题上掉点。这篇提出「置信度自适应思考」(CAT),让模型依据自身推理过程中的置信度动态决定该想多长——简单题早停、难题保留深度思考,从而在不牺牲难题准确率的前提下显著削减推理开销。对追求成本与效果平衡的推理服务是很实用的调度思路。
推理优化高效推理思维链压缩自适应计算大推理模型
Qizhi Jiang, Shuo Wang, Pei Ke, Yuhang Song, Ke Qin
PAPA: Online Personalized Active Preference Alignment
ECML-PKDD 2026CCF-B推荐arXiv · 07-01 14:14 UTC+8
扩散模型擅长拟合复杂分布,但在个性化推荐这类场景里,真正的目标是逼近「最大化用户偏好」的那一小块分布,而这块偏好一开始未知、只能靠交互反馈逐步揭示。作者把它建模成强化学习问题,提出在线个性化主动偏好对齐(PAPA),边收集用户反馈边微调扩散模型去最大化基于反馈的奖励,并用主动查询机制高效试探未知偏好区域。这为把扩散生成器做成能实时适应个人口味的推荐/生成系统提供了一条对齐路径。
后训练扩散模型偏好对齐强化学习个性化推荐
Anindya Sarkar, Nasik Muhammad Nafi, Isaac Lyngaas, Muralikrishnan Gopalakrishnan Meena, Yevgeniy Vorobeychik
Orca: The World is in Your Mind
HF 精选 · 07-01 08:00 UTC+8
Orca 用多模态数据、以「预测下一状态」为目标训练出一个统一的世界隐空间,把不同模态的信息压进同一套可预测的潜在表示里。这种以世界模型为底座的做法,让单一模型在多个下游任务上超过各自专门设计的基线。对做多模态基座和世界模型的人来说,它展示了「下一状态预测」作为统一预训练目标的潜力。
基座世界模型多模态基座隐空间表示下一状态预测
BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding
HF 精选 · 07-01 08:00 UTC+8
投机解码的加速效果高度依赖草稿块(block)大小,但固定块长在不同样本上并非最优。BlockPilot 把块大小选择做成实例自适应的策略学习,直接从 prefill 阶段的表示预测出每个请求最合适的块长,几乎不增额外开销就拿到可观加速。对做扩散式/投机式推理加速的工程团队,这提供了一个按输入动态调参、榨取更多吞吐的实用手段。
推理优化投机解码推理加速自适应策略扩散解码
Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks
HF 精选 · 07-01 08:00 UTC+8
这篇提出「进化微调」,让 LLM 通过学习搜索轨迹本身来培养跨任务的解题能力,而不是死记单个任务的答案。作者在多达 371 个优化任务上训练,模型从演化式搜索的过程中提炼出通用的探索与改进策略,在数学猜想和优化问题上都取得进步。它的启发在于把「学会搜索」当作一种可迁移的元能力来训练,为提升模型的自主发现与问题求解能力提供了新思路。
后训练微调方法优化任务跨任务泛化搜索轨迹学习
MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
HF 精选 · 07-01 08:00 UTC+8
要把多个领域的能力揉进同一个 LLM,直接混训往往顾此失彼。MOPD 采用「多教师在线策略蒸馏」,为每个领域先训练一个专精的强化学习教师,再用 on-policy 蒸馏把这些教师的能力整合进单一学生模型,训练时学生按自己的采样分布学习以减小分布错配。相比已有方法它在能力整合上取得更优表现,为后训练阶段做「多能力融合」提供了一条高效可行的路线。
在线策略蒸馏多教师蒸馏后训练能力整合
SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions
HF 精选 · 07-01 08:00 UTC+8
现有 SWE 基准多是单轮、一次给全需求,脱离真实开发中反复澄清、逐步推进的样子。SWE-INTERACT 把编码基准重构成用户驱动的多轮、长程软件工程会话,让 Coding Agent 在贴近真实的交互场景里接受考验。结果揭示出单轮表现和多轮交互式任务完成之间存在显著落差,提醒从业者:光看单轮跑分会高估 Agent 的真实可用性。
AgentCoding Agent评测基准多轮交互软件工程
StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning
ECCV 2026CCF-B推荐arXiv · 07-01 13:34 UTC+8
大视觉语言模型靠视觉指令微调激发多模态推理,但训练时常把同一张图的多个任务打包成多轮对话,评测却多在单轮孤立场景下进行,这种错配会让模型出现「视觉注意力衰减」和上下文过拟合,多轮里发挥不出实力。作者提出「随机轮次深度」训练(StochasT),在指令微调时随机化对话轮数与深度,逼模型在不同轮次结构下都保持对图像的关注。这能缓解多轮训练带来的注意力退化,让 LVLM 更充分释放其多模态推理能力。
训练视觉指令微调多模态大模型多轮对话视觉注意力
Yuan Qing, Chengzhi Mao, Boqing Gong
Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments
ECCV 2026CCF-B推荐arXiv · 07-01 13:23 UTC+8
在真实环境里活动的具身智能体需要多尺度推理,且不同尺度的知识过时速度不一样。作者指出把 MoE 直接搬过来有两个毛病:路由没有显式的「尺度」概念,无法针对某个尺度做定向更新;而统一的更新策略又照顾不到各尺度知识的不同更新节奏。MuSix 用「尺度感知的世界模型混合」同时解决这两点,让智能体能按尺度分别更新知识,在演化中的环境里做更稳的适应。这为具身场景下的持续学习与世界模型设计提供了新的结构思路。
Agent具身智能体世界模型混合专家多尺度推理
Jinwoo Jang, Daniel J. Rho, Sihyung Yoon, Hyunsuk Cho, Honguk Woo
Information-Regularized Attention for Visual-Centric Reasoning
ECCV 2026CCF-B推荐MetaarXiv · 07-01 12:45 UTC+8
视觉语言模型常犯物体幻觉、视觉 grounding 弱、全参微调后灾难性遗忘等毛病,作者把根因归结为标准的下一 token 预测目标对视觉表示缺乏显式约束,导致视觉嵌入被动优化、混入冗余甚至虚假信号。为此提出「信息正则化注意力」,在训练中显式地约束视觉注意力的信息流,压制无关信号、强化真正与视觉相关的表征学习。这有助于让 VLM 的视觉推理更稳、更少幻觉,也缓解指令微调后的能力退化。
基座视觉语言模型物体幻觉注意力正则化视觉 grounding
Guohao Sun, Xiaofang Wang, Yash Patel, Mengchen Liu, Zhiqiang Tao, Praveen Krishnan
DOPD: Dual On-policy Distillation
HF 精选 · 07-01 08:00 UTC+8
在线策略蒸馏存在「特权幻觉」问题:教师在学生自采样的轨迹上给的监督未必真的更优。DOPD 提出双向在线策略蒸馏,按优势差(advantage gap)和概率在 token 级动态决定该由教师还是学生来提供监督,避免盲目照搬教师信号。这样能在大模型和视觉语言模型上更可靠地传递能力,为 on-policy 蒸馏里「什么时候该信教师」给出了细粒度的判据。
后训练在线策略蒸馏知识蒸馏token 级监督能力传递
Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs
HF 精选 · 07-01 08:00 UTC+8
LLM 常常「不知道自己不知道」,置信度与实际正确率对不齐。这篇用带元认知反馈的强化学习,配合元认知数据筛选,训练模型对自身表现和不确定性做出更准的自我评估,从而让口头表达的把握程度更忠实地反映真实正确率。改善校准对需要模型如实报告不确定性的高风险应用(如让模型知道何时该拒答或求助)很关键。
后训练不确定性表达模型校准强化学习元认知
TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
HF 精选 · 07-01 08:00 UTC+8
在多角色协作的 Agent 强化学习里,标准 GRPO 把一整条轨迹的回报笼统地分给所有步骤,credit assignment 太粗。TRIAGE 引入「角色分型」的信用分配框架,按每个动作在轨迹中扮演的角色区分其贡献,给出比 GRPO 更细腻的奖励归因。这有助于让智能体在复杂多步任务里学到更精准的策略,是 agentic RL 里改进信用分配的一条思路。
后训练Agent 强化学习信用分配GRPO多角色
LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents
HF 精选 · 07-01 08:00 UTC+8
让 AI 智能体靠截图、视觉识别去操作电脑界面,既慢又易错。LUMOS 提出一个语义化的操作系统层,把系统本身的元数据(控件、可访问性信息等)转成机器可读格式,让 Agent 直接读取界面语义而非靠像素识别来交互,效率明显高于传统视觉方式。这为 Computer-Use 类智能体提供了一条更可靠、更省算力的落地路径。
AgentComputer-Use智能体操作系统层可访问性
ESC: Emotional Self-Correction for Reliable Vision-Language Models
ECCV 2026CCF-B推荐arXiv · 07-01 22:25 UTC+8
视觉语言模型推理不可靠,现有自我纠错方法多要额外后训练或精心设计的反馈,成本不低。这篇换了个角度:能不能靠「情绪线索」在不额外训练的情况下激活 VLM 潜在的自我纠错行为?作者发现给模型注入情绪化提示确实能触发它重新审视并修正错误答案,从而以近乎零成本提升推理可靠性。这个发现挺有意思,揭示了 VLM 内部潜藏着可被简单提示唤醒的自纠能力。
基座视觉语言模型自我纠错提示工程可靠推理
Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan Nguyen, Hoang M. Le
MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment
ECCV 2026CCF-B推荐arXiv · 07-01 20:23 UTC+8
视频-文本对齐模型往往继承了 CLIP 这类图文模型的老毛病,表征纠缠不清,而视频域还额外面临两个难点:文本往往只对应特定时间窗(时间错配),以及图文之间稀疏、双向不对称的语义对应(语义不对称)。MoVA 用非对称的双投影结构分别处理这两个方向的映射,做模块化的长视频-文本对齐,专门应对视频里文本只相关于片段、其余帧无关的情况。这为长视频检索与理解里的对齐质量提供了更贴合视频特性的建模方式。
基座视频文本对齐多模态对比学习长视频理解
Peiyuan Zhu, Shaoan Xie, Zijian Li, Yifan Shen, Namrata Deka, Harsh Shrivastava, Guangyi Chen, Kun Zhang
Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
ECCV 2026CCF-B推荐arXiv · 07-01 17:13 UTC+8
视觉-语言-动作(VLA)模型一旦遇到相机位姿变化、或换到另一台相似机器人(如从 Panda 换成 UR5e)就常常做不好原本学会的任务,而为每个任务在新环境重采多条演示既贵又费。这篇提出「域算术」,借类比的思路做一次性适配:把环境漂移表示成可运算的域向量,通过向量运算把已学任务迁移到目标域,大幅减少数据采集与训练负担。对机器人从业者来说,这是降低 VLA 跨环境迁移成本的实用一招。
AgentVLA 模型机器人域适配具身智能
Taewook Kang, Taeheon Kim, Donghyun Shin, Jonghyun Choi
VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
ECCV 2026CCF-B推荐arXiv · 07-01 12:59 UTC+8
面对海量视频语料,既要从大库里检索出相关视频(跨视频推理),又要在选中视频里做时序定位等细粒度任务(视频内推理)。现有做法把检索当成一次性预处理,一旦初检失败就无从补救。VideoSearch-R1 用强化学习把检索和推理拧成一个可迭代的闭环,通过「软查询精修」不断改写查询、反复检索与推理,让系统在初检不佳时也能自我纠偏。这为大规模视频检索加推理的一体化系统提供了更鲁棒的范式。
基座视频检索强化学习时序定位多模态推理
Seohyun Lee, Seoung Choi, Dohwan Ko, Jongha Kim, Hyunwoo J. Kim