每日 AI 速览

2026-08-24

生成于 2026-08-25 04:13
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线聚焦智能体推理基础设施与多模态基座。NVIDIA 密集发布 Vera Rubin、Spectrum-X Ethernet、BlueField-4 与 Groq 3 LPX,主打智能体场景的每瓦性能与长上下文交互,Cerebras CS-4 与中诚华隆 HL200 也补强推理芯片供给。模型侧,阿里 Wan3.0 视频大模型正式上线,支持文本、图像与文档生成长达 30 秒视频,多模态竞争升温。Agent 工具层,亚马逊云科技开源 Dogwood 规范工具调用,Cloudflare WriteGuard 为 MCP 服务器提供细粒度安全控制,AgentCore 则面向多智能体持久计算。

行业动态 40 条

Giga-Scale AI and the Ethernet Evolution: How Spectrum-X Ethernet Rewrites the Rules

NVIDIA 开发者 · 08-24 23:08 UTC+8

NVIDIA 强调生成式 AI 的规模正在改变数据中心设计,分布式训练可能扩展到数十万 GPU,传统以太网在拥塞和尾延迟上已经不够用。Spectrum-X 以太网通过针对 AI 流量的调度与拥塞控制,试图让大规模 GPU 集群的网络层不再是瓶颈。对 AI Infra 团队,这意味着构建十卡到百万卡级集群时,网络架构需要和算力同样提前规划。

Infra以太网AI基础设施分布式训练NVIDIA

With Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference for Agents

NVIDIA 博客 · 08-24 23:00 UTC+8

NVIDIA 宣布 Groq 3 LPX 全面投产,并围绕 Vera Rubin 平台扩展面向智能体的推理能力,强调下一代推理不是由单一芯片决定,而是 AI 工厂各层协同。对从业者来说,这表明 NVIDIA 正把推理重点转向智能体系统所需的快速 token 生成和系统级整合,而不仅是单卡算力。

推理优化NVIDIAVera Rubin推理加速AI智能体

Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Standard for AI Agents

NVIDIA 博客 · 08-24 23:00 UTC+8

NVIDIA 援引 OpenRouter 数据称,智能体负载消耗的 token 量是普通聊天请求的 15 倍,因为智能体需要反复查询、调用子代理和综合信息。Vera Rubin NVL72 宣称在单位功耗下可完成多达 30 倍的工作量,直接回应了智能体时代推理成本激增的问题。对关注 token 成本与吞吐的团队,这是新一代推理硬件在每瓦产出上的重要指标。

推理优化NVIDIAVera Rubin每瓦性能AI智能体

NVIDIA Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt

NVIDIA 开发者 · 08-24 23:00 UTC+8

NVIDIA 将 Vera Rubin 与 Blackwell 定位为智能体 AI 每瓦性能的新基准,指出 AI 智能体已把推理从单轮交互扩展为多步骤推理、工具调用和子代理协调。从从业者视角看,这意味着评估硬件时不能只看峰值算力,还要看长时间多步骤工作流下的能耗效率与持续可用性。

推理优化NVIDIABlackwellVera Rubin功耗效率

v0.5.18

SGLang · 08-24 15:42 UTC+8

SGLang v0.5.18 合并了来自 212 位贡献者的 710 个 PR,模型覆盖明显向多模态与扩散方向扩展,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge 与 Distilled、LongCat-Image 等,并补充 Qwen3.8、Ling-3.0、Nemotron 3.5 Lightning 的示例。对推理框架用户来说,一次升级就能在多模态生成和扩散模型上获得更完整的支持。

推理优化SGLang推理框架多模态模型支持

阿里视频大模型Wan3.0正式上线,行业评价“稳定、真实、有质感”

量子位 · 08-24 13:09 UTC+8

阿里巴巴视频生成大模型 Wan3.0 于 8 月 24 日正式上线,行业反馈集中在稳定、真实和有质感这几个维度。对视频生成赛道,这意味着国产模型在一致性和画质上开始进入可用性竞争,也给创作者和企业提供了新的多模态生成选择。

基座阿里Wan3.0视频生成模型发布

Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

Apple ML · 08-24 08:00 UTC+8

Apple 提出 Internalized Visual Thinking,核心是让模型在训练阶段学习视觉化思考,但在推理时直接输出结果,避免视觉思维链生成中间图像带来的推理开销。对主动视频推理这类对实时性要求高的场景,这种内化思路能显著降低延迟和计算成本。

训练多模态推理视觉思维链视频理解Apple

亚马逊云科技开源 Dogwood:给 AI 智能体的工具调用立规矩

InfoQ 中文 · 08-24 01:00 UTC+8

亚马逊云科技开源 Dogwood,目标是为 AI 智能体的工具调用建立统一规范,减少不同模型和框架在函数调用格式上的混乱。对智能体开发者来说,这类协议层开源意味着更容易做跨模型编排和工具生态复用。

AgentAWS工具调用智能体协议开源

Alibaba's Wan3.0 generates AI videos up to 30 seconds long from text, images, and documents

The Decoder · 08-24 23:35 UTC+8

Alibaba 的 Wan3.0 支持从文本、PDF 和 PPT 生成最长 30 秒的视频,30 秒 1080p 视频定价约 6 美元。与此同时,阿里季度利润同比下降 75%,反映其在 AI 上的投入正在加大。对开发者来说,文档转视频和明确的按条定价降低了短视频生成的使用门槛。

厂商动态阿里Wan3.0视频生成定价

How XPUs Meet a World-Class AI Factory

NVIDIA 博客 · 08-24 23:00 UTC+8

NVIDIA 认为 AI 工厂的经济性由持续产出决定,核心指标包括每秒 token、每瓦 token、单 token 成本、利用率和在线时间,而不是单张加速卡参数。对自研 XPU 的超大规模企业和 AI 原生公司,这意味着必须把基础设施当作完整工厂来设计,涵盖计算、网络、供电和运维全链路。

InfraAI工厂XPU基础设施吞吐成本

Maximizing AI Factory Performance per Watt with NVIDIA DSX MaxLPS

NVIDIA 开发者 · 08-24 23:00 UTC+8

NVIDIA 推出 DSX MaxLPS,针对 AI 工厂的功率受限现实,把优化目标从机柜里塞多少 GPU 转向每瓦可用电力能产出多少 AI 结果。对数据中心规划者来说,这要求在供电、散热和系统密度之间做全局权衡,而不是单纯追求算力密度。

InfraNVIDIAAI工厂功耗优化数据中心

NVIDIA BlueField-4 Powers New Scale-In Network Infrastructure for Agentic AI Factories

NVIDIA 开发者 · 08-24 23:00 UTC+8

NVIDIA 将 BlueField-4 定位为智能体 AI 工厂的新一代横向扩展网络基础设施的关键组件,以应对传统云网络面向可预测通用负载、而智能体负载连接多样用户与动态服务的特点。对基础设施团队,这意味着网络控制平面和数据处理单元需要更强的可编程性与隔离能力,才能支撑多租户、多步骤的智能体工作流。

InfraNVIDIABlueField智能体AI网络基础设施

How NVIDIA Groq 3 LPX Unlocks Ultrafast Interactivity at Long Context on NVIDIA Vera Rubin

NVIDIA 开发者 · 08-24 23:00 UTC+8

NVIDIA 介绍 Groq 3 LPX 是 Vera Rubin 平台上的交互式 AI 推理加速器,重点解决长上下文下的超快交互问题,核心系统是 Vera Rubin NVL72。对做长文档分析、记忆型智能体或实时对话的团队,这类低延迟长上下文推理能力直接关系到用户体验和可扩展成本。

推理优化NVIDIAGroq LPX长上下文推理延迟

Advancing price-performance for developers with GPT‑5.6 in Kiro

OpenAI · 08-24 20:00 UTC+8

OpenAI 宣布 GPT-5.6 已在 Kiro 中可用,帮助开发者以更好的性价比完成软件规划、构建、审查和测试。这表明 OpenAI 在继续压低开发者使用成本,同时把模型能力嵌入软件开发生命周期,对编码智能体赛道有直接影响。

基座OpenAIGPT-5.6Kiro编程智能体

Cerebras unveils CS-4 with double the performance on the same chip

The Decoder · 08-24 18:16 UTC+8

Cerebras 发布 CS-4 AI 加速器,CEO Andrew Feldman 称其为业界最快系统,宣称在同一芯片上实现翻倍性能。对关注非 GPU 路线的团队,晶圆级芯片在内存带宽和单芯片扩展上的优势值得重新评估。

InfraCerebrasCS-4AI加速器晶圆级芯片

b10605

llama.cpp · 08-24 16:59 UTC+8

llama.cpp b10605 对 mamba2 实现做了算子级优化,把输入输出投影扁平化后改用 GEMM 而非 GEMV 调度,并移除冗余 reshape。这能提升 mamba2 类模型在 CPU 和边缘设备上的推理效率,尤其对小批量或单 token 解码路径更友好。对 llama.cpp 生态用户,这是一次低层但实用的性能改进。

llama.cppmamba2GEMM推理优化

b10604

llama.cpp · 08-24 15:18 UTC+8

llama.cpp 合并了面向 DeepSeek V4 的系列改动,包括为 sm tensor 设置更粗粒度的 head 切分、修复 dspark、为 DSV4 添加模型保存、允许 dflash 在指定设备返回,并加入共享专家延迟 allreduce 和简化 seq_rm。这些改动强化了 DeepSeek V4 在 llama.cpp 中的分布式推理与模型管理能力,对本地部署该系列模型的开发者很有价值。

推理优化llama.cppDeepSeek V4分布式推理模型保存

单芯片到万卡集群体系化突破 中诚华隆HL200推理芯片及超节点集群重磅发布

量子位 · 08-24 15:04 UTC+8

中诚华隆发布 HL200 推理芯片及超节点集群,宣称实现了从单芯片到万卡集群的体系化突破,目标是定义国产推理算力新范式并支撑万卡级 AI 推理算力规模化落地。这对关注国产芯片和推理基础设施建设的从业者是一个值得跟踪的新选项。

Infra国产芯片推理芯片万卡集群中诚华隆

v0.33.0

Ollama · 08-24 03:19 UTC+8

Ollama v0.33.0 增强了与 Claude Desktop 的集成,用户可从菜单栏开关本地模型、在 Claude 内选择可用 Ollama 模型,并通过新的 Apps 视图管理应用集成和复制命令。同时该版本改进了缓存,修复了 agent 客户端取消长 prefill 时挂起的问题,让恢复点机制在重试时更可靠。

推理优化OllamaClaude Desktop本地模型Agent集成

b10603

llama.cpp · 08-24 02:47 UTC+8

llama.cpp 为 GLM-4.5-Air 模型新增 MTP(多 token 预测)支持,这可以在本地推理中利用投机解码类机制提升生成速度。该合并让 GLM-4.5-Air 用户能在 llama.cpp 上获得更高效的推理体验。

推理优化llama.cppGLM-4.5-Air多Token预测推理加速

多个 AI 智能体“同住”一台 EC2:AgentCore 推出持久计算

InfoQ 中文 · 08-24 23:43 UTC+8

AgentCore 推出持久计算能力,让多个 AI 智能体可以常驻同一台 EC2 实例,避免每次任务都冷启动。这有助于降低多智能体工作负载的延迟和成本,并支持长运行、有状态任务。

AgentAgentCore多智能体持久计算EC2

Solving Agentic AI Fleet Challenges with NVIDIA Vera CPU

NVIDIA 开发者 · 08-24 23:00 UTC+8

NVIDIA 介绍了用 Vera CPU 解决智能体 AI 集群挑战的思路,核心观点是 AI factory 的经济性取决于整栈把电力和资本转化为已完成 agent 任务的效率。这对规划大规模 agentic AI 推理集群的企业架构师有参考意义。

InfraNVIDIAVera CPUAgentic AIAI Factory

OpenAI is building AI agents for everything. Will everyone use them?

TechCrunch · AI · 08-24 23:00 UTC+8

TechCrunch 报道 OpenAI 正在为各种场景构建 AI agents,并推动其从软件工程师走向大众用户,同时探讨这类智能体是否会被广泛采用。文章关注前沿实验室在智能体产品化与普及过程中面临的障碍。

AgentOpenAIAI Agent产品化

b10612

llama.cpp · 08-24 21:43 UTC+8

llama.cpp 禁用了 WebGPU 后端的 DOTS3NOTE 架构测试,原因是该测试在当前 WebGPU 条件下不适用或会导致失败。这是针对跨平台测试的兼容性维护,能减少 WebGPU 构建中的测试噪音。

推理优化llama.cppWebGPU测试维护

b10610

llama.cpp · 08-24 21:18 UTC+8

llama.cpp 缩短了 CUDA 和 Metal 后端中虚拟设备的命名,并在 Metal 初始化阶段构建设备描述,使日志和调试信息更简洁。该提交部分由 DeepSeek-V4-Flash 辅助完成。

推理优化llama.cppCUDAMetal设备管理

Thomson Reuters bets $40M on owning its AI instead of renting from OpenAI or Anthropic

The Decoder · 08-24 20:59 UTC+8

汤森路透宣布推出基于阿里 Qwen 构建的自有语言模型「Thomson」,两年成本约 4000 万美元,而不是租用 OpenAI 或 Anthropic 的模型。其基准显示,模型接入 Westlaw 等自有内容时表现最好,CTO 强调关键不是智能本身,而是清楚需要拥有哪类智能。

厂商动态汤森路透Qwen垂直模型AI成本

b10608

llama.cpp · 08-24 20:56 UTC+8

llama.cpp 修复了多模态视频解码中 moov atom 位于文件末尾时无法正确读取的问题,并处理了 Windows 上 broken pipe 引发的 SIGPIPE。该改动提升了对非常规 MP4/MOV 文件的兼容性和跨平台稳定性。

推理优化llama.cpp多模态视频解码跨平台修复

b10606

llama.cpp · 08-24 20:33 UTC+8

llama.cpp 修复了 ggml_clamp 算子并同步更新 ggml-alloc,消除了底层张量钳制操作中的潜在错误和内存分配隐患。这是面向量化或自定义图优化场景的基础稳定性维护。

推理优化llama.cpp算子修复ggml

Netflix 开源了一个用于因果推理的智能代理工作流

InfoQ 中文 · 08-24 18:44 UTC+8

Netflix 开源了一个用于因果推理的智能代理工作流,公开了将 agent 应用于因果推断场景的工程实现。这对希望把智能体引入数据科学、实验分析和决策系统的团队具有参考价值。

AgentNetflix智能体工作流因果推理开源

viable/strict/1787583779

PyTorch · 08-24 17:43 UTC+8

PyTorch 修复了 embedding_bag 在 per_sample_weights 场景下可能触发 CUDA 非法内存访问的问题,提升该算子在批量嵌入训练和推理中的安全性。对使用大规模稀疏特征的用户来说是重要稳定性修复。

InfraPyTorchCUDAembedding_bag内存安全

Cloudflare WriteGuard 为 MCP 服务器提供了精细化的安全控制

InfoQ 中文 · 08-24 17:03 UTC+8

Cloudflare WriteGuard 为 MCP 服务器提供精细化的安全控制,可限制智能体通过 MCP 执行写操作的范围和权限。这对将 MCP 工具部署到生产环境、降低模型误操作风险的团队很重要。

AgentCloudflareMCP安全控制Agent工具调用

viable/strict/1787569149

PyTorch · 08-24 14:39 UTC+8

PyTorch 修复了 XPU 后端在卷积反向算子中内存格式检测的问题,提升 Intel GPU 等 XPU 设备上卷积反向传播的兼容性和正确性。这是针对异构硬件训练路径的针对性修复。

InfraPyTorchXPU卷积反向内存格式

viable/strict/1787565853

PyTorch · 08-24 13:45 UTC+8

PyTorch 测试重构启用了 PrivateUse1 后端相关测试,并补充硬件分类标签,使自定义后端测试覆盖更完善。对开发私有硬件后端并希望集成 PyTorch 的团队有参考价值。

InfraPyTorchPrivateUse1测试重构硬件分类

viable/strict/1787563964

PyTorch · 08-24 13:38 UTC+8

PyTorch 测试重构将 MultiProcContinuo 相关用例改为通过 is_backend_available 判断后端可用性,替代硬编码检查,提升不同后端条件下的测试健壮性。这有助于减少 CI 中因环境差异导致的误报。

InfraPyTorch测试重构后端可用性

viable/strict/1787552956: Fix SymBool equality handling in symbolic shapes (#186461)

PyTorch · 08-24 10:06 UTC+8

PyTorch 修复了符号形状中 SymBool 等式的处理,此前形如 Eq(Eq(u0,1),Eq(u1,1)) 的布尔关系会被误当作算术表达式相减,导致 expect_true 抛 TypeError。新改动对非算术关系做结构化规范化,并调整 Gt/Ge 等方向,增强动态形状推导的稳定性。

InfraPyTorch符号形状SymBool动态Shape

Anthropic’s best AI model struggles to attract users as cheaper tools thrive

Simon Willison · 08-24 04:24 UTC+8

Simon Willison 引述 FT 数据指出,Anthropic 最强模型面临用户增长挑战,更便宜的工具表现更好;其 7 月年化收入升至 650 亿美元,高于 5 月的 470 亿,并预计 Q3 盈利,年付 10 万美元以上客户达 6000 家。这反映模型定价和性价比在采用中的关键作用。

厂商动态Anthropic收入数据模型定价竞争

论文 16 篇

论文看点集中在多模态效率与智能体可靠性:涵盖视觉语言模型 2.7 比特量化、统一视觉表征、MoE 超参数迁移、并行推理与可验证业务环境合成等方向。

UniSpace: Unified Visual Representation and Scalable Multimodal Modeling

美团HF 精选 · 08-24 08:00 UTC+8

UniSpace 通过重参数化预训练视觉 Transformer,把语义理解、高保真重建和图像生成统一到同一个视觉空间里,省掉了通常生成链路中独立的 VAE。这样多模态模型不用在多个视觉表示之间来回转换,结构更简洁,也更容易扩展到更大规模训练。对做统一视觉骨干的团队来说,它提供了一条减少组件、降低工程复杂度的路线。

基座多模态建模视觉表征图像生成免VAE

Llama-Mobile: Efficient 2.7-Bit Quantization of VLMs

HF 精选 · 08-24 08:00 UTC+8

Llama-Mobile 针对视觉语言模型在移动端部署的存储与计算限制,提出用模型自生成训练数据配合 2.7 比特格式做量化。它把 Llama 3.2 11B Vision Instruct 压缩到 3.7 GB,同时尽量保持视觉问答性能,说明低比特量化不一定要以明显掉点为代价。对手机端跑 VLM 的场景,这相当于给出了一套可落地的压缩方案。

推理优化模型量化视觉语言模型移动端部署Llama 3.2

Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

COLM 2026HF 精选 · 08-24 08:00 UTC+8

大规模 MoE 训练里学习率搜索非常昂贵,这篇工作提出两阶段超参迁移框架,通过跨模型宽度和 token 预算的缩放规律来预测最优学习率。这样在真正训练大 MoE 之前,不必反复跑代价高昂的扫描,也能得到较可靠的超参配置。对预训练成本敏感的大模型团队,能显著降低试错开销。

训练混合专家超参迁移预训练学习率

ParaTempo: Efficient Parallel Reasoning via Temporal Confidence

HF 精选 · 08-24 08:00 UTC+8

ParaTempo 针对并行推理中多个分支互相等待、算力浪费的问题,引入时间置信度来动态剪枝、退役和重新分配推理分支,而不需要同步屏障。这样推理过程能更快释放无效分支占用的资源,并把算力集中到更有希望的路径上。结果是在保持推理质量的同时提高并行效率,对大规模思维采样类方法尤其有价值。

并行推理时间置信度分支剪枝推理优化

Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models

HF 精选 · 08-24 08:00 UTC+8

这篇论文研究大模型在线策略蒸馏时到底迁移了什么,发现它迁移的是推理行为而非具体答案,泛化能力与学生模型和教师模型的来源对齐程度高度相关。更有意思的是,多教师组合并不总是带来提升,反而可能引发不同能力之间的权衡。对做蒸馏数据策略和教师选择的团队,这提醒不能只看单点指标,要关注行为分布和教师同源性。

后训练知识蒸馏在线策略推理迁移多教师

Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models

HF 精选 · 08-24 08:00 UTC+8

SparsePR 面向视频 Transformer 和世界模型中的注意力开销,用响应耦合分块和探针拟合残差重建,在很低执行密度下保持注意力近似质量。它不需要额外训练,就能减少注意力误差并取得明显加速,适合视频生成这类 token 数多、时序依赖长的场景。对做视频扩散或世界模型的团队,是一种即插即用的稀疏注意力思路。

推理优化稀疏注意力视频生成世界模型推理加速

AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale

HF 精选 · 08-24 08:00 UTC+8

AgentMercury 把业务场景做成可执行的大规模合成环境,让这些环境直接作为强化学习训练基底,而不是只靠手写少量任务。这样训练出来的智能体在企业任务和跨域推理上都有提升,而且环境构建本身也变成可学习的过程。对想批量生产智能体训练场景、摆脱人工构造效率瓶颈的团队来说,它提供了一条可扩展的合成数据与强化学习一体化路径。

Agent智能体强化学习合成环境业务场景

Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference

HF 精选 · 08-24 08:00 UTC+8

Daedalus-150M 是一个面向 CPU 推理的小型混合语言模型,用稀疏注意力和短卷积替代一部分标准注意力,使前向更快,同时在更少训练数据下拿到比更大常规模型更好的基准成绩。这说明通过结构设计而非单纯堆参数,可以在边缘或纯 CPU 环境里获得可用的语言能力。对 llama.cpp 这类 CPU 推理生态,这类架构有直接参考意义。

推理优化混合架构CPU推理稀疏注意力卷积

CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment

HF 精选 · 08-24 08:00 UTC+8

CLEAR 解决安全对齐里常见的过度拒答和良性输入能力下降问题,用一个隐藏状态门控连续调节安全低秩适配器的介入强度。这样在遇到有害内容时安全模块更强,在正常输入上则尽量不干扰模型原始能力。相比硬切换或多模型方案,它更轻量,也能在安全与有用性之间做更平滑的权衡。

后训练安全对齐低秩适配门控机制大模型安全

Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence

HF 精选 · 08-24 08:00 UTC+8

Graph Engineering 提出用动态图结构来组织多智能体 LLM 系统,把不同专长的智能体作为节点、交互作为边,从而协调复杂且持续变化的任务。相比固定流水线或平面角色分配,图的拓扑可以随任务阶段调整,更适合长流程和高并发协作。对正在搭建多智能体框架的团队,这提供了一种从个体智能走向系统智能的组织范式。

Agent多智能体图工程智能体协作大模型系统

OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

HF 精选 · 08-24 08:00 UTC+8

OmniAssistBench 用逆向构造多轮交互视频的方式,评估全能模型在实时音视频助手场景里的表现。结果显示当前的 omni-modal 模型在视觉提示理解、上下文保持和及时响应上仍有明显短板。该基准把评测从静态问答推进到助手式交互,对做实时语音视频助手的团队是一个更贴近落地的检验工具。

基座多模态评测视频助手全模态模型实时交互

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

腾讯 AI LabHF 精选 · 08-24 08:00 UTC+8

这篇工作关注混合思考多模态模型的一个隐蔽问题:即使答案正确,思考模式和非思考模式在响应格式、详略和风格上的不一致也会影响体验和可靠性。作者构建了诊断基准,并提出按响应模式施加针对性强化学习惩罚,以对齐两种模式的行为。效果是模型在不同推理模式下表现更一致,而不只是单项准确率提升。

后训练多模态模型混合思考强化学习对齐响应一致性

EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking

HF 精选 · 08-24 08:00 UTC+8

EviRank 将多模态图像重排重新定义为语义约束满足问题,先把查询解析成结构化证据包,再通过评分量表式校验和列表级比较筛选候选。整个过程无需训练,却能利用结构化证据提升排序的可解释性和相关性。对检索增强或商品图排序这类场景,它提供了一种低成本、可调试的重排方案。

Infra多模态检索图像重排免训练语义约束

Towards Faithful Simulation of Human Shopping Behavior

HF 精选 · 08-24 08:00 UTC+8

RecVerse 是一个基于 GUI 操作的智能体,用层级记忆和轨迹级强化学习来模拟真实的多轮电商购物行为。它能记住用户偏好和会话上下文,并在连续点击、浏览、决策中体现更自然的购物路径。对需要构建用户仿真器或测试推荐系统的团队,这比规则模板更接近真实行为分布。

Agent用户仿真强化学习GUI智能体电商

Peer-Voted LLM-Agent Stress Tests Find Feed-Induced Lexical Convergence but No Reliable Matched-Exposure Advantage for Distributed Sources

HF 精选 · 08-24 08:00 UTC+8

这项研究用合成 LLM 智能体做同伴投票式信息流压力测试,发现同侪排序的信息流会提高用词趋同,但并没有稳定带来观点俘获或分布式来源的协调优势。换句话说,社交信号可能让表达更像,但不一定让认知或选择更一致。对研究算法推荐生态和 LLM 社会模拟的人,这是关于信息暴露效果的一个重要负结果。

Agent大模型智能体信息流社会模拟观点动力学

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

HF 精选 · 08-24 08:00 UTC+8

PhysCaP 是一个物理感知的代码生成智能体,通过主动探索物体来推断隐藏的物理属性,例如质量、摩擦或质心等,再据此生成操作策略。相比只从视觉或语言里猜物理参数,它把交互探索纳入闭环,能提升机器人操作效率。对具身智能和机器人操作任务,这种物理先验加代码策略的组合很有实用价值。

Agent具身智能代码策略物理推理机器人操作