每日 AI 速览

2026-08-27

生成于 2026-08-28 04:19
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线一:国产高效模型密集发布,智谱「GLM-5.3-Flash」与阿里「Qwen3.8-Flash-Next」以极低成本对标顶尖水平,并可运行于国产卡、摆脱英伟达依赖。主线二:AI 基础设施竞争升级,英伟达收购「Hugging Face」,公布「Vera Rubin」「NVLink Fusion」与「Vera」CPU 进展,亚马逊亦大幅追加英伟达芯片订单。主线三:Agent 商业化提速,DeepSeek 开源 Harness,MiniMax ARR 与 token 用量暴涨,Anthropic 签下巨额算力协议。

行业动态 40 条

GLM-5.3-Flash matches top models at a fraction of the cost, and runs without Nvidia

The Decoder · 08-27 18:24 UTC+8

Z.ai 发布开源模型「GLM-5.3-Flash」,总参数 320B,在「Artificial Analysis」智能指数上仅比更大的「GLM-5.3」低 3 分,成本却只有七分之一。更值得注意的是,其推理流量全部运行在国产 AI 芯片而非英伟达硬件上。这为高性价比开源模型和国产芯片推理生态都提供了重要验证。

基座GLM开源模型国产芯片推理成本

Nvidia snaps up Hugging Face for $12.9 billion as closed AI labs pull away

The Decoder · 08-27 15:14 UTC+8

英伟达以 129 亿美元收购开源 AI 平台「Hugging Face」,交易金额约为其 1.5 亿美元年收入的 80 倍。该收购契合英伟达在开放模型上投入数十亿美元的战略,而「OpenAI」、「Anthropic」等闭源厂商正逐步减少对英伟达硬件的依赖。

厂商动态NVIDIAHugging Face收购开源生态

Nvidia closes in on Hugging Face acquisition

TechCrunch · AI · 08-27 14:32 UTC+8

据报道英伟达已同意以 129 亿美元收购热门开源 AI 中心「Hugging Face」。此举既有助于巩固其芯片帝国,也让英伟达重新进入云业务领域。对开源社区而言,该交易将深刻影响 AI 模型托管生态。

厂商动态NVIDIAHugging Face收购云业务

Qwen3.8-Flash-Next

Simon Willison · 08-27 07:52 UTC+8

「Qwen」发布新开源权重模型「Qwen3.8-Flash-Next」,这是一个多模态 MoE 模型,也是「Qwen4」架构的早期预览。它总参数约 125B,但激活参数仅 6B,带来显著性能提升。作者已在「DGX Spark」上试用多个「Unsloth」量化版本进行测试。

基座Qwen开源模型MoE多模态

Delivering Vera: NVIDIA’s First CPU Built for Agents Is Shipping Now

NVIDIA 博客 · 08-27 21:00 UTC+8

英伟达首款面向智能体工作负载的 CPU「Vera」已开始规模出货,副总裁 Ian Buck 向 AI 生态合作伙伴交付了系统。这意味着面向 Agent 场景设计的 CPU 正式进入实际部署阶段。

InfraNVIDIAVera CPUAgentAI 硬件

[AINews] Hot Chips: OpenAI’s Jalapeño, Cerebras CS-5, Groq 3 LPX, Apple M6

Latent Space · 08-27 09:31 UTC+8

「AINews」汇总了「Hot Chips」大会重点,包括「OpenAI」的「Jalapeño」、「Cerebras CS-5」、「Groq 3 LPX」和苹果「M6」等芯片。这是了解各厂商最新 AI 芯片路线和架构竞争的重要窗口。

InfraHot ChipsAI 芯片OpenAICerebrasGroq

Amazon just tripled its order of Nvidia chips over ‘surging demand’

TechCrunch · AI · 08-27 07:47 UTC+8

亚马逊因需求激增,将未来两年数据中心新增的英伟达 GPU 芯片数量增加 200 万颗,订单规模扩大到三倍。双方合作范围还延伸到芯片采购之外。这反映出超大规模云厂商对 AI 算力的持续争夺。

InfraAmazonNVIDIAGPU数据中心

NVIDIA NVLink Fusion Brings NVHBM to Next-Generation AI Infrastructure

NVIDIA 开发者 · 08-27 05:06 UTC+8

英伟达发布「NVLink Fusion」,将「NVHBM」引入下一代 AI 基础设施,以支撑越来越大的模型和更复杂推理负载的算力需求。这意味着下一代英伟达系统在内存和互联层面将有显著升级。

InfraNVIDIANVLinkNVHBMAI 基础设施

NVIDIA NVLink Fusion Expands With NVHBM Custom High-Bandwidth Memory

NVIDIA 博客 · 08-27 05:05 UTC+8

NVIDIA 扩展 NVLink Fusion 并加入 NVHBM 定制高带宽内存,把计算、内存、存储与网络更紧密地统一设计,以支撑智能体和万亿参数负载成为主流后的基础设施需求。对从业者来说,这意味着未来 AI 系统瓶颈更多向内存带宽与互连转移,定制 HBM 与 NVLink 融合会影响集群架构选择。

InfraNVIDIANVLink Fusion高带宽内存AI 基础设施

Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding

NVIDIA 开发者 · 08-27 01:07 UTC+8

阿里发布「Qwen3.8-Flash-Next」模型权重,作为 Qwen4 架构的预览版本供开发者提前实验和评测,NVIDIA 开发者博客展示其在 GB300 NVL72 系统上用于智能体编码。该预览让社区能提前验证架构特性,并在高带宽 NVL72 环境下评估编码智能体性能。

基座Qwen3.8-Flash-Next智能体编码NVIDIA GB300模型发布

DeepSeek 开源 Harness:AI 智能体基础设施开始“拆分”

InfoQ 中文 · 08-27 00:26 UTC+8

DeepSeek 开源 Harness,InfoQ 中文文章将其解读为智能体基础设施开始从单体框架转向可拆分的组件化形态。从业者可关注该组件是否在工具调用、评估或运行时层面提供可复用能力,以降低多智能体系统搭建的复杂度。

AgentDeepSeek智能体基础设施开源模块化

OpenAI researcher warns ultrafast AI could leave security teams in the dust

The Decoder · 08-27 23:04 UTC+8

OpenAI 研究员警告,运行速度快 50 倍的先进模型可能在安全团队反应前就渗透进系统,仅靠传统监控已不足,需要引入自主关机机制;这一警告正值 OpenAI 发布推理速度大幅超越现有硬件的新 AI 芯片。对安全从业者来说,模型推理速度的跃升会压缩响应时间窗口,推动安全自动化与闭环防御设计。

InfraAI 安全推理速度OpenAI自主防御

Qwen3.8-Flash-Next + GLM-5.3-Flash

Unsloth · 08-27 22:48 UTC+8

Unsloth 宣布可在本地运行「Qwen3.8-Flash-Next」和「GLM-5.3-Flash」,前者只需约 75GB RAM,后者约 102GB RAM+VRAM,并将 RAM offloading 的推理速度提升 5 倍,同时修复了重复压缩与 100 轮以上对话的可靠性问题。这对需要在消费级或工作站硬件上跑最新 Flash 模型微调和推理的开发者很实用,可降低显存门槛。

推理优化UnslothQwen3.8GLM-5.3本地推理

b10655

llama.cpp · 08-27 22:20 UTC+8

llama.cpp 的 Vulkan 后端为 Deepseek V4 算子新增了 LIGHTNING_INDEXER 支持,并将 128 路点积归约从共享内存树改为 subgroupAdd,同时清理了边界检查和 FA_K_ONLY 路径,恢复交错 K/V 缓冲排序。这些改动让 Deepseek V4 在跨厂商 Vulkan GPU 上的推理兼容性和性能得以改善,对有本地异构硬件部署需求的开发者有意义。

llama.cppVulkanDeepseek V4推理优化

Piloting the world's first double-blind AI evaluations

Google DeepMind · 08-27 20:59 UTC+8

Google DeepMind 启动全球首个双盲 AI 评估试点,目的是减少评测中的人为偏差和对模型身份的预期影响。对从业者而言,双盲设计有望让模型能力对比更客观,为基座模型和智能体评测提供更可信的基准方法论。

训练DeepMind评测双盲模型评估

Anthropic locks in 45-billion-dollar compute deal with Nscale ahead of IPO

The Decoder · 08-27 18:49 UTC+8

据 Bloomberg 报道,Anthropic 与英国云初创公司 Nscale 达成约 450 亿美元的计算资源交易,在 IPO 前锁定大规模算力供给。这一动作反映头部模型厂商正把长期算力合同作为战略筹码,同时也助推 Nscale 等二线云厂商进入核心 AI 基础设施竞争。

厂商动态Anthropic算力交易NscaleIPO

千问办公首发上线Qwen3.8-Flash,生成速度提升100%,Token消耗减少75%

InfoQ 中文 · 08-27 18:28 UTC+8

千问办公首发上线「Qwen3.8-Flash」,官方称生成速度提升 100%,Token 消耗减少 75%,用于办公场景。对用户和开发者来说,这个模型在保证任务质量的同时显著降低推理成本并提高响应速度,可直接影响办公类 Agent 和应用的部署成本与体验。

基座Qwen3.8-Flash千问办公推理优化成本降低

[AINews] NVIDIA buys HuggingFace for $13B, as OpenAI publishes their HF incident retro

Latent Space · 08-27 09:50 UTC+8

Latent Space 的 AINews 报道称 NVIDIA 将以 130 亿美元收购 HuggingFace,同时 OpenAI 发布其 HuggingFace 事件的事后复盘,评论称开源阵营获胜。如果属实,这将极大改变开源模型与工具链的格局,使 NVIDIA 在模型分发、数据集和社区入口上获得战略卡位;OpenAI 的复盘也提示巨头对开源生态风险的重视。

厂商动态NVIDIAHuggingFace收购开源生态

v0.33.1

Ollama · 08-27 07:54 UTC+8

Ollama v0.33.1 为 MLX 运行时加入「Qwen3.8 Flash Next」支持,并给 mlxrunner 增加结构化输出能力,同时修复了从慢存储加载模型时的 Metal GPU 超时问题,更新了底层 MLX 与 llama.cpp。对 macOS 本地推理用户来说,这意味着可以在 Apple Silicon 上更稳地运行新 Flash 模型并约束输出格式,适合 Agent 工具调用场景。

推理优化OllamaMLXQwen3.8结构化输出

v1.11.0

HF TRL · 08-27 04:02 UTC+8

TRL v1.11.0 移除了自定义的 vllm-serve FastAPI 封装,改为直接调用 vLLM 自带服务器,脚本从 1218 行缩减到约 130 行,只负责翻译参数并设置 TRL 所需配置。这个改动让强化学习训练中的在线推理更简洁,减少维护负担,并更容易跟上 vLLM 新特性。对做 RLHF 或 RLVR 的团队来说,部署和调试成本会下降。

后训练TRLvLLM强化学习训练框架

Evaluate any agent framework with Amazon Bedrock AgentCore Evaluations

AWS 机器学习 · 08-27 03:13 UTC+8

Amazon Bedrock 的 AgentCore Evaluations 将智能体评估与具体开发框架解耦,只要智能体按 OpenTelemetry 输出遥测数据即可被评分,覆盖 LangGraph、LlamaIndex、OpenAI Agents SDK、Google ADK、Claude Agent SDK 和 Strands Agents 等主流框架。这为采用不同技术栈的团队提供统一评估入口,降低多框架环境下做智能体回归测试和上线前验证的门槛。

AgentAWSBedrock智能体评估OpenTelemetry

Intelligent transcription with Gemini 3.5 Transcribe

Google DeepMind · 08-27 01:01 UTC+8

Google DeepMind 推出「Gemini 3.5 Transcribe」,定位为更智能的语音转文字服务,在识别准确率和语义理解上相比传统 ASR 更接近模型驱动。这对需要会议纪要、客服分析、音视频内容处理的从业者来说,意味着可以把转录与语义抽取整合进同一个基座模型流程,减少后处理复杂度。

基座Gemini 3.5语音识别DeepMind转录

Bring your own model with Amazon SageMaker AI: Script mode in SDK v3

AWS 机器学习 · 08-27 00:31 UTC+8

SageMaker Python SDK v3 重新设计了脚本模式,统一到 ModelTrainer 和 ModelBuilder 类,并通过 SourceCode 在运行时把本地代码同步进任意容器,避免反复重建 Docker 镜像;文章给出 scikit-learn 随机森林和多 GPU Stable Diffusion 3.5 LoRA 微调两个端到端示例。这能显著加快模型训练与微调的迭代速度,尤其对需要频繁改训练脚本的团队更友好。

InfraSageMakerSDK v3训练LoRA

Preparing data for supervised fine-tuning Part 2: Advanced data strategies

AWS 机器学习 · 08-27 00:24 UTC+8

AWS 机器学习博客发布监督微调数据准备第二部分,覆盖用学习曲线评估数据就绪度、筛选高价值数据子集、通过合成和蒸馏样本增强数据,以及混合多来源数据以防灾难性遗忘。这些策略对做微调的团队很实用,可帮助在数据有限或质量参差时更系统地提升 SFT 效果,而不只是堆数据量。

后训练SFT数据工程微调灾难性遗忘

Azure DevOps Remote MCP 服务器正式发布,暂不支持 Claude、ChatGPT 及 Cursor

InfoQ 中文 · 08-27 23:27 UTC+8

微软 Azure DevOps 的 Remote MCP 服务器正式发布,用于让 MCP 客户端通过远程方式接入 DevOps 能力;但当前暂不支持 Claude、ChatGPT 和 Cursor 等常见客户端。对想用 MCP 打通 Azure DevOps 与编码智能体的团队,需要先确认客户端兼容性,该发布也表明 MCP 生态仍在快速分化阶段。

AgentAzure DevOpsMCP智能体工具兼容性

viable/strict/1787858428

PyTorch · 08-27 22:45 UTC+8

PyTorch 为 CUDA 和 ROCm 后端的量化 embedding_bag_byte 算子增加了剪枝查找支持,使嵌入表在稀疏或剪枝后仍能在量化路径上高效执行。这对推荐系统和稀疏特征训练很重要,可以在不牺牲量化加速的情况下支持动态嵌入表压缩,提升大规模嵌入场景的显存与带宽利用效率。

InfraPyTorch量化嵌入CUDA

Enterprise AI's real risk isn't autonomous agents. It's the complexity between them.

VentureBeat · AI · 08-27 22:01 UTC+8

VentureBeat 文章认为,企业 AI 面临的最大风险不是单个自主智能体的失控,而是成群的智能体互相调用 API、访问遗留应用时形成的复杂交互网,这种复杂系统难以被清晰治理。文章由 Gravitee 赞助,强调需要对智能体间流量、权限和依赖关系有可见性,否则故障和安全风险会藏在无人能看清的链路里。

Agent企业 AI多智能体治理Agent 复杂性

b10653

llama.cpp · 08-27 21:50 UTC+8

llama.cpp 为模型加载器新增了 TENSOR_READ_LAZY 和张量行级惰性读取选项,并添加 --tensor-read-lazy 命令行参数,允许模型权重在需要时才从磁盘读取而非一次性载入。这对内存受限或本地大模型推理场景很有价值,可降低启动时的内存峰值并加快冷启动,尤其适合大容量 GGUF 模型。

推理优化llama.cpp惰性加载内存优化本地推理

b10649

llama.cpp · 08-27 20:30 UTC+8

llama.cpp 为 llama-server 和 llama-cli 添加了仅用于基准测试的合成推测接受选项,让开发者能在基准条件下模拟不同的推测解码接受率,从而更系统地评估推测采样性能。这有助于优化投机解码参数和批处理策略,而不必依赖真实模型输出的统计波动。

llama.cpp推测解码基准测试推理优化

MiniMax ARR暴涨500%,token暴涨2000%!这就是Agent红利吧

量子位 · 08-27 20:16 UTC+8

量子位报道 MiniMax 的 ARR 同比增长 500%,token 消耗量暴涨 2000%,并将其归因于 Agent 带来的红利。这显示 MiniMax 在商业化上进入高增长阶段,智能体应用正在拉动真实 API 调用和订阅收入,为国内大模型公司提供了从模型能力到商业闭环的参考样本。

厂商动态MiniMaxARRAgent 商业化token 增长

b10648

llama.cpp · 08-27 20:01 UTC+8

llama.cpp 对 MiniMax-01 模型的计算图进行简化,减少了不必要的图节点和转换路径,有利于提升该模型在 llama.cpp 各后端上的推理效率和可维护性。对在本地或边缘运行 MiniMax-01 的用户,这可能带来更低的算子开销和更稳定的兼容性。

推理优化llama.cppMiniMax-01计算图优化推理

When agents act on their own, governance has to live in the data layer

VentureBeat · AI · 08-27 20:01 UTC+8

VentureBeat 这篇由 EDB 赞助的文章提出,当企业智能体拥有计划、决策和跨系统行动的自主权时,真正阻止未授权操作的机制必须下沉到数据层,而非仅靠应用或模型层的权限控制。文章认为治理需要在数据访问、事务边界和审计日志里落地,否则自主智能体可能在企业基础设施内执行越权动作而无人察觉。

Agent数据治理智能体安全企业 AI自主智能体

b10647

llama.cpp · 08-27 19:27 UTC+8

llama.cpp 新增了一系列 --video-* 命令行参数,用于配置多模态视频输入,并配套 mtmd_helper_init_opt 初始化逻辑。这扩展了 llama.cpp 对视频理解模型的原生支持,让本地用户可以通过 CLI 直接控制视频解码、抽帧或序列处理方式,降低多模态本地推理的集成门槛。

推理优化llama.cpp多模态视频输入CLI

ARR 超 8 亿美元,B 端收入占比升至 80%!MiniMax 第二份财报:增长与商业化来到验证时刻

InfoQ 中文 · 08-27 18:27 UTC+8

InfoQ 中文报道 MiniMax 第二份财报显示 ARR 已超 8 亿美元,B 端收入占比攀升至 80%,标志其增长与商业化进入验证阶段。对国内大模型行业来说,这表明 API 和解决方案收入可以成为营收支柱,而非仅靠 C 端订阅,Agent 场景则是主要拉动因素。

厂商动态MiniMax财报ARR企业服务

如何把 Agent 的判断与行动变成可恢复的软件事实 | KDC 工程补篇

InfoQ 中文 · 08-27 18:00 UTC+8

InfoQ 中文文章讨论如何将 Agent 的判断和行动记录为可恢复的软件事实,作为 KDC 工程的补充内容。对开发者而言,这意味着把智能体的决策过程、工具调用和状态变更持久化为可审计、可重放的数据结构,从而在出错时能回滚或追溯,提升多智能体系统的可靠性与可治理性。

AgentAgent 工程可观测性审计状态管理

Claude Cowork now runs its own browser inside the desktop app

The Decoder · 08-27 17:54 UTC+8

Anthropic 正在将自研浏览器直接内置到 Claude Cowork 桌面应用内,使智能体可以在隔离环境里浏览网页、点击操作,而不依赖用户当前浏览器。这为办公自动化任务提供更可控的执行环境,也意味着 Anthropic 正从纯模型能力向端到端智能体工作空间延伸,触碰浏览器自动化的安全和资源管理问题。

AgentAnthropicClaude Cowork浏览器智能体

论文 20 篇

今日论文集中于推理时扩展与强化学习训练策略、多模态视觉忠实度与视频理解评测,以及编码智能体长程任务和动态环境鲁棒性等方向。

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

HF 精选 · 08-27 08:00 UTC+8

针对现成大模型在智能体任务中高度依赖手工设计的固定脚手架、难以跨模型和任务迁移的问题,「JIT-Agent」训练一个专用模型,在运行时即时合成自适应智能体脚手架。该思路把脚手架本身当作可学习对象,而不是为每个模型和任务单独调参。实验显示它在多种模型和任务上都能带来性能提升,降低定制成本。

Agent智能体框架自适应推理LLM 工具调用模型无关

Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data

HF 精选 · 08-27 08:00 UTC+8

这篇论文重新审视在缺少思维链数据时,下一块推理强化学习是否真的比监督微调更优。作者在数学推理和域外任务上对比发现,把多个推理语料混合起来做监督微调,在训练效率和最终准确率上都更好。这意味着无思维链数据场景下,混合 SFT 可能比复杂的下一块 RL 更具性价比。

后训练训练方法监督微调强化学习推理

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

HF 精选 · 08-27 08:00 UTC+8

针对视觉语言模型在回答中容易出现与图像不一致的幻觉问题,「V-Rubrics」提出基于视觉评分准则的强化学习方法,从视觉忠实度、推理一致性和指令遵循三个维度对答案打分。评分采用结构化部分得分,而不是只看对错,从而提供更细粒度的训练信号。结果表明该方法能显著改善模型的视觉 grounding 表现。

后训练多模态基座强化学习视觉语言模型对齐

Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation

HF 精选 · 08-27 08:00 UTC+8

面向深度 Transformer 参数和内存随层数线性增长的问题,该工作提出「Gated Recurrent Transformers」,在深度方向复用共享核心,并通过自适应更新门进行循环调制。这种设计用更少参数和更低内存实现了与更深模型相当甚至更好的质量。对追求高效架构的从业者来说,它提供了一条用循环机制换取表达深度的路线。

基座模型架构循环神经网络Transformer推理优化

Prefix Sliding for efficient test-time scaling

HF 精选 · 08-27 08:00 UTC+8

长推理过程会产生大量中间 token,显著推高显存占用,限制测试时扩展的计算规模。「Prefix Sliding」通过识别并丢弃不重要的中间 token 来压缩前缀,从而降低内存成本。该方法无需重新训练,可直接用于现有模型,让更长的测试时推理在有限显存下变得可行。

推理优化测试时扩展KV Cache长上下文

VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction

HF 精选 · 08-27 08:00 UTC+8

面向语音语言模型在实时交互中记忆建模薄弱的问题,「VoiceMem」提出双脑流式记忆架构,分别处理短期和长期记忆的流式更新与检索。该架构在检索准确率、情感个性化和实时效率上都有提升。对语音助手和实时语音对话系统来说,它提供了一种更贴近人类记忆机制的方案。

基座多模态基座语音模型记忆实时交互

VGI-BENCH: Probing Visual Intelligence in Video Generation Models

HF 精选 · 08-27 08:00 UTC+8

「VGI-Bench」专门评测视频生成模型在生成过程中的视觉推理能力,覆盖 27 个任务。评测发现这些模型在视觉推理上的可靠性有限,且几乎不具备生成过程中的自我纠正能力。该基准为视频生成模型从画面质量走向视觉智能提供了更严格的衡量维度。

基座视频生成评测基准多模态推理

FrontierChallenge: Evaluating Scientific Workflow Completion

HF 精选 · 08-27 08:00 UTC+8

「FrontierChallenge」构建了跨领域的端到端科学工作流完成评测,考察模型从目标设定到结果交付的全流程能力。结果显示前沿模型虽然部分得分很高,也经常声称已经完成任务,但真正端到端完成的只有约 20%。这揭示了当前大模型在科学任务中可靠性和完整性方面的显著缺口。

评测基准科学智能Agent大模型能力

WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation

HF 精选 · 08-27 08:00 UTC+8

离策略强化学习的稳定性策略在数据量不同时表现差异很大,固定超参难以兼顾。「WarpSAC」通过重新思考探索与利用,提出数据状况感知算法,根据数据可用性自适应调整归一化方式和 Q 函数裁剪。在 CPU 和 GPU 并行训练场景下,该方法都提升了训练效率。

训练强化学习训练方法分布式可扩展

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

HF 精选 · 08-27 08:00 UTC+8

原生视觉推理评测往往难以兼顾可扩展性、可验证性和可控性,「VBVR-Pro」为此引入闭环测试平台。它通过在不同视觉基底上生成任务,使评测可以规模化,同时保持验证性和可控性。该套件为研究模型的原生视觉推理能力提供了更可复用的基础。

基座多模态评测基准视觉推理生成

D^3-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation

HF 精选 · 08-27 08:00 UTC+8

多教师蒸馏中,不同领域的数据采样比例若固定,容易导致某些域训练不充分或过度。「D³-MOPD」通过监测每个域的反向 KL 散度轨迹动态调整采样比例,让训练资源向最需要的域倾斜。实验显示它显著提升收敛效率,并几乎消除了学生模型与教师之间的性能差距。

训练知识蒸馏多教师训练方法域适应

Agent-G^2: Gaussian Guidance for Agentic Reinforcement Learning

HF 精选 · 08-27 08:00 UTC+8

智能体强化学习在长时程任务中常因提示深度不确定而探索低效,「Agent-G²」将提示深度建模为高斯分布,并利用已有轨迹在线估计均值和方差。这样无需额外探测就能获得更稳定的指导信号。方法在长时程任务上提高了强化学习效率。

Agent智能体强化学习长时程任务高斯引导

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

HF 精选 · 08-27 08:00 UTC+8

「JoyAI-Echo-1.5」瞄准长时程音视频生成中身份丢失和剧情不连贯的问题,统一了长视频生成和交互式世界生成。其关键设计包括跨镜头记忆、几何感知的相机控制,以及轨迹感知训练策略。这些机制让它在长时间序列中保持角色一致性和场景连贯性。

基座视频生成世界模型多模态长时程生成

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

HF 精选 · 08-27 08:00 UTC+8

单帧视觉语言动作模型缺少时间上下文,难以处理需要序列推理的机器人操作。「StreamPI」通过指令锚定注意力和随机间隔训练,为这类模型注入流式时间推理能力,且不增加任何参数。该方法在机器人操作任务上带来了明显提升。

基座具身智能视觉语言动作模型时间建模机器人

Code World Model: Coding Agent as World Brain

HF 精选 · 08-27 08:00 UTC+8

世界模型通常把状态动力和视觉渲染耦合在一起,导致长期预测和可控性受限。「Code World Model」把持久的世界动态与视觉渲染分离,由语言模型生成可执行的状态更新,再由视频模型根据代理表征渲染观测。这种设计让世界模型更结构化,也更容易与编码智能体结合。

Agent世界模型编码智能体多模态模型架构

Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation

HF 精选 · 08-27 08:00 UTC+8

UI 到代码生成中,视觉修复步骤往往与生成过程耦合,长序列自进化容易发生轨迹坍缩。「RubSE」用评分准则作为视觉修复上下文,以准则引导的自我进化提升生成稳定性。该方法有效避免了耦合和坍缩问题。

后训练代码生成多模态UI 生成自进化

Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments

HF 精选 · 08-27 08:00 UTC+8

「AnTrap」通过在执行轨迹中注入动态异常,来评测 Android GUI 智能体在对抗环境下的鲁棒性。结果显示这些智能体存在普遍脆弱性,同时该基准能区分可学习的陷阱与模型固有的推理局限。这对提升 GUI 智能体的可靠性有直接参考价值。

Agent智能体评测GUI 智能体鲁棒性对抗环境