每日 AI 速览

2026-08-26

生成于 2026-08-27 04:17
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线有三:一是推理成本与芯片竞赛,阿里发布「Qwen3.8-Flash-Next」主打极致性价比,OpenAI 自研芯片「Jalapeño」被曝推理基准超越英伟达「Blackwell」与「Rubin」。二是开源模型与企业智能体落地加速,「IBM Granite 4.2」开源内置智能体能力,「Claude Cowork」增强对话记忆,「Amazon Bedrock AgentCore」打通跨账号知识库。三是视频与世界模型数据升温,「LAION-BVD」开放千万小时视频数据,「Game2World」利用游戏视频训练世界模型。自改进与强化学习成为论文主线,以「Meta^n」递归自改进和在线策略蒸馏为代表。

行业动态 40 条

Release v5.16.1

HF Transformers · 08-26 22:50 UTC+8

Transformers 发布 v5.16.1,首次加入 GLM-5.3-Flash:这是 GLM-5 系列首个原生多模态模型,总参数 320B、仅激活 18B,以十分之一价格在基准和真实负载上超过 GLM-5.2,并在编码与智能体任务上接近 Claude Opus 4.8。对开发者意味着可以在 Hugging Face 生态中直接使用该高效多模态模型。

基座GLM-5.3-FlashTransformers多模态模型发布

Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"

The Decoder · 08-26 22:40 UTC+8

阿里 Qwen 团队通过 Qwen3.8-Flash-Next 预览下一代 Qwen4 架构,这是一款 MoE 模型,每个 token 只激活 125B 总参数中的 6B 参数。它以九分之一训练成本在编码和办公基准上超过 DeepSeek-V4-Flash 与 Claude Opus 4.6,进一步给 OpenAI 和 Anthropic 带来定价压力。对行业来说,极致性价比方向的竞争再次被推高。

基座Qwen3.8-Flash-Next混合专家成本效率阿里 Qwen

v0.28.0

vLLM · 08-26 18:17 UTC+8

vLLM v0.28.0 发布,包含 584 个提交、270 位贡献者,重点针对 Kimi-K3 做了全栈推理优化。新增 Decode Context Parallel、FlashKDA 核融合 decode/prefill、MegaMoE 的 SiTU 激活、序列并行 GEMM-RS,以及 1.5 到 3 倍速提升的 all-gather 合并和自适应投机 token 预算。对于在 vLLM 上部署 Kimi-K3 或 MoE 大模型的团队,这版能直接降低延迟与成本。

vLLMKimi-K3推理优化MoE

OpenAI's first custom chip "Jalapeño" reportedly beats Nvidia's Blackwell and Rubin in inference benchmarks

The Decoder · 08-26 02:00 UTC+8

OpenAI 在 Hot Chips 上展示了首款自研推理芯片 Jalapeño,SemiAnalysis 测试称其在吞吐量和能效上超过英伟达 Blackwell,甚至胜过 Rubin。SemiAnalysis CEO Dylan Patel 也指出第一代芯片通常不具竞争力,但 OpenAI 这次打破了预期。这对推理芯片格局和自研硅路线是一个重要信号。

InfraOpenAI自研芯片推理芯片Jalapeño

Release: v5.16.0

HF Transformers · 08-26 23:03 UTC+8

Transformers v5.16.0 新增 Qwen4-Exp 模型支持,该模型在 Qwen3.5 的文本与多模态混合架构上加入 GatedResidual、Qwen Sparse Attention 和 Per-Layer Embedding。其中 GatedResidual 在 attention 与 MoE 块前混合多条残差流并做细粒度门控,QSA 与 PLE 则进一步优化稀疏注意力和各层嵌入。这对需要提前试用 Qwen4 实验模型的开发者是及时集成。

基座Qwen4-ExpTransformers稀疏注意力模型发布

Surprise: Z.ai is the AI lab behind the mysterious Ox Alpha model

TechCrunch · AI · 08-26 22:19 UTC+8

Z.ai 确认自己就是此前霸榜的神秘开放模型 Ox Alpha 背后的 AI 实验室,并称权重即将发布。这意味着社区很快可以获得这个在基准和排行榜上表现突出的模型权重。对开放模型生态和希望复现其能力的团队是个重要进展。

基座Z.aiOx Alpha开放权重模型发布

IBM drops open-weight Granite 4.2 family with built-in agentic capabilities under Apache 2.0

The Decoder · 08-26 18:37 UTC+8

IBM 发布 Granite 4.2 系列开放权重模型,覆盖 3B、8B、30B 规模,训练约 15 万亿 token,上下文窗口高达 512K。较大模型采用 agentic RL 自行学习工具调用和代码执行,且全部使用 Apache 2.0 许可证。对需要可自由商用且具备内置智能体能力的企业模型开发者很有吸引力。

基座IBM Granite开放权重智能体 RLApache 2.0

PROOF-Gen: From Optimized Data to Better Distillation

Apple ML · 08-26 08:00 UTC+8

Apple 公开的 PROOF-Gen 研究指出,工具调用蒸馏通常采用 generate-and-filter:保留教师模型通过轨迹、丢弃失败轨迹,但失败样本不提供信号,困难的场景每轮都留下。PROOF-Gen 尝试从优化后的数据出发改进蒸馏流程,以更充分利用教师生成结果。这对按日或按周重训工具调用模型的团队有直接降本意义。

后训练Apple工具调用蒸馏数据优化PROOF-Gen

IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining

Apple ML · 08-26 08:00 UTC+8

Apple 的 IDEA Prune 研究把扩模预训练纳入结构化剪枝流程,而不是只从目标规模的模型开始剪。它将 enlarge-and-prune 作为整体系统研究,关注在有限推理预算下能否比从头训练目标大小模型更高效。对需要兼顾 token 效率与部署成本的大模型预训练团队有实用价值。

训练Apple结构化剪枝预训练推理预算

Restore LLM Inference Capacity in Seconds with Shadow Engine Recovery in NVIDIA Dynamo

NVIDIA 开发者 · 08-26 04:57 UTC+8

英伟达 Dynamo 引入 Shadow Engine Recovery,可在 LLM 引擎进程失败后数秒内恢复推理容量,而不是走冷重启流程。该机制避免了从存储向 HBM 重新加载权重、编译 kernel 等长耗时步骤。对在线推理服务的可用性和故障恢复速度有明显价值。

推理优化NVIDIA Dynamo推理容灾引擎恢复LLM 推理

v0.33.1-rc0: MLX: Qwen3.8 Flash Next support (#18032)

Ollama · 08-26 23:05 UTC+8

Ollama 发布 v0.33.1-rc0,在 MLX 后端加入 Qwen3.8 Flash Next 支持。该版本让 Apple Silicon 用户可以通过 MLX 路径运行该模型,扩大了本地推理的模型选择。

推理优化OllamaMLXQwen3.8 Flash Next本地推理

Chinese Moonshot AI negotiates hosting deals with Microsoft, Amazon, and Google

The Decoder · 08-26 19:54 UTC+8

月之暗面正在与微软、亚马逊和谷歌洽谈模型托管合作,若达成将成为中国 AI 模型首次登陆美国主流云平台,并按收入分成。这对国内大模型厂商出海、绕过地缘限制接入美国云生态有示范意义,也反映美国云厂商对中国模型能力的需求。

厂商动态月之暗面模型托管云平台合作出海

b10632

llama.cpp · 08-26 17:31 UTC+8

llama.cpp 的 Metal 后端加入分块 SSD MMA 内核,针对 Mamba-2 多 token 预填充阶段做优化,并移除了标量实现路径。这能提升 Apple Silicon 上 Mamba 类模型的首 token 延迟和吞吐,对端侧状态空间模型推理有意义。

llama.cppMetalMamba-2推理优化

v0.33.0

Ollama · 08-26 10:09 UTC+8

Ollama v0.33.0 允许 Claude Desktop 将 Ollama 配置为第三方网关,并修复了长预填充取消时的挂起问题,使预填充恢复点可被可靠用于续传。对于本地模型接入 Claude 生态及代理客户端稳定性是重要改进。

推理优化OllamaClaude Desktop推理缓存预填充恢复

Connect Amazon Bedrock AgentCore to cross-account knowledge bases

AWS 机器学习 · 08-26 23:48 UTC+8

AWS 发布指南,展示 Amazon Bedrock AgentCore 代理如何跨账户访问由 Redshift Serverless 支持的 Bedrock 知识库,无需复制源数据即可生成答案。对需要跨组织共享数据、保持安全边界的 Agent 架构有实操价值,涵盖 Strands 代理和声明式 harness 两种编排模型。

AgentAmazon BedrockAgentCore跨账户知识库AWS

b10635

llama.cpp · 08-26 19:34 UTC+8

llama.cpp 在 CUDA 后端为 Pascal 架构(sm_60)解除了 MoE 模型的多量化 mmq 限制,并针对无 dp4a 的旧卡降低部分量化格式的占用。这让老 NVIDIA GPU 也能用量化方式跑 MoE 模型,提升兼容性和推理可行性。

推理优化llama.cppCUDAMoE量化

fa4-v4.0.0.beta28

FlashAttention · 08-26 16:47 UTC+8

FlashAttention 4 beta28 放宽了对 CUTLASS DSL 的版本要求,降低构建时的依赖门槛。对集成 FlashAttention 的框架和开发者来说,这意味着更容易适配不同 CUTLASS 版本,减少编译障碍。

InfraFlashAttentionCUTLASS依赖放宽

刚刚,Top级的视频AI免费了!我反手做了个精致版《牛来》

量子位 · 08-26 13:56 UTC+8

量子位报道,名为「Agnes Video 2.5 Flash」的顶级视频 AI 现已免费开放,作者实测用它制作了精致版《牛来》视频。视频生成模型免费化将进一步降低 AI 视频创作门槛,对内容创作者和视频生成赛道竞争有直接影响。

基座视频生成免费开放AI 视频

Training and Finetuning Multi-Vector Embedding Models with Sentence Transformers

HuggingFace 博客 · 08-26 08:00 UTC+8

Hugging Face 博客发布指南,介绍用「Sentence Transformers」训练和微调多向量嵌入模型的方法。多向量模型在细粒度检索和长尾查询上往往优于单向量,但训练与部署更复杂,该指南为 RAG 与向量检索从业者提供了可复现的实操路径。

后训练Hugging Face多向量嵌入Sentence TransformersRAG

Agentic observability with Amazon OpenSearch Service MCP Apps

AWS 机器学习 · 08-26 03:00 UTC+8

Amazon OpenSearch Service 推出 MCP Apps,让 AI 代理的文本回复可直接附带交互式可视化,并通过单个本地 MCP 服务器串联告警、追踪、日志到根因分析。这对 Agent 可观测性和可验证性有显著提升,允许开发者在 IDE 内逐步核查每一步。

AgentAmazon OpenSearchMCPAgent 可观测性AWS

b10628

llama.cpp · 08-26 02:08 UTC+8

llama.cpp 的 RPC 后端新增 Apple RDMA 传输支持,可在 Apple 硬件间实现低延迟高带宽的分布式推理通信。这对使用多台 Mac 进行模型分片的用户能显著提升跨机通信效率。

Infrallama.cppApple RDMARPC分布式推理

Claude Cowork finally remembers what you told the app in chat

TechCrunch · AI · 08-26 01:50 UTC+8

Anthropic 为 Claude 推出跨 Chat 和 Cowork 的共享记忆,用户不再需要反复向 AI 介绍项目背景和个人偏好。这对依赖 Claude 做持续协作的用户显著降低沟通成本,也标志着 Agent 从单次会话向持久化上下文演进。

AnthropicClaude共享记忆Agent

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space · 08-26 23:15 UTC+8

Anima Anandkumar 在访谈中指出,当前基础模型主要建立在语言上,物理领域尚缺乏同等的基础模型,而她正用 AI 建模天气、聚变反应堆等物理系统。这对科学计算和 AI for Science 方向有启发,提示物理世界基础模型是下一块重要拼图。

基座AI for Science物理建模基础模型Anima Anandkumar

Orchestration is the new challenge for CX in the age of AI agents

VentureBeat · AI · 08-26 22:30 UTC+8

Tata Communications 指出,企业在客户体验领域快速部署 AI 代理和语音 AI,但多数只是将对话式 AI 拼接到老旧系统上,编排成为新挑战。对 CX 架构师而言,这意味着后续需要重构系统以真正释放多智能体与全渠道自动化的价值,而非继续打补丁。

AgentAI 代理客户体验编排Tata Communications

Employee revolt and failing agents forced Meta to scrap its AI layoff plan

The Decoder · 08-26 21:09 UTC+8

路透社报道称,Meta 曾计划用 AI 代理大幅替代员工,但因内部员工反抗以及代理未能交付预期成果而被迫搁置。这给激进 AI 自动化裁员战略泼了冷水,说明企业级 Agent 的可靠性和组织变革阻力仍是现实约束。

厂商动态MetaAI 裁员AI 代理组织变革

Arga Labs is building a better way to train enterprise AI agents

TechCrunch · AI · 08-26 20:55 UTC+8

Arga Labs 获得 1000 万美元种子轮融资,由 General Catalyst 领投,目标是构建更优的企业 AI 代理训练方法。这表明企业级 Agent 训练仍是资本关注的重点,如何让代理在真实企业环境中可靠执行任务是当前瓶颈。

AgentAI 代理企业训练融资Arga Labs

Grab 借助 AI 代理将机械性分析的工作量从 44% 降至 30%

InfoQ 中文 · 08-26 18:10 UTC+8

InfoQ 中文报道,Grab 利用 AI 代理将机械性分析工作占比从 44% 降至 30%。这展示了 AI 代理在业务流程自动化中可量化的降本效果,对东南亚科技公司及同类分析密集型团队有参考意义。

AgentGrabAI 代理流程自动化

硅谷今日最热具身模型!不用后训练,看一遍就学会

量子位 · 08-26 18:07 UTC+8

量子位报道了一个硅谷热门的具身智能模型,该模型无需后训练,仅通过观看一次演示即可学会新任务。这种 one-shot 模仿能力让机器人从预编程走向快速泛化,被视为具身智能向 GPT 时刻迈进的重要信号。

基座具身智能模仿学习零样本/少样本机器人

达卯科技与福建智算方舟达成合作,全栈式算电协同服务在闽落子

量子位 · 08-26 17:17 UTC+8

达卯科技与福建智算方舟达成合作,在长乐机场综保区智算中心落地全栈式算电协同服务。这标志着智算中心从单纯算力供给走向算力与电力协同优化,对降低数据中心能耗和运营成本有实际意义。

Infra智算中心算电协同达卯科技福建智算方舟

b10631

llama.cpp · 08-26 14:06 UTC+8

llama.cpp 的 ggml-meta 模块更新,将缓冲区使用信息传播到新张量并调用初始化。这有助于确保张量生命周期和内存管理的一致性,减少因缓冲区元数据缺失导致的推理错误或性能下降。

Infrallama.cppggml张量管理

深度实测「豆包工作」+飞书:目前最接近企业Agent终局的答案

量子位 · 08-26 10:59 UTC+8

量子位深度实测「豆包工作」与飞书的组合,认为这是目前最接近企业 Agent 终局的解决方案。该组合可能将豆包大模型的智能体能力与飞书协作套件深度整合,为企业级 Agent 落地提供了可用的产品形态参考。

Agent豆包飞书企业 Agent深度实测

viable/strict/1787720427: [inductor] Fix loop-local load CSE lifetime (#194786)

PyTorch · 08-26 08:05 UTC+8

PyTorch Inductor 修复了循环局部加载的 CSE 生命周期问题,此前循环内间接加载可能被错误缓存并在循环后重用,导致临时变量不支配使用点。该修复让生成的 Triton 代码更正确,对复杂算子编译的稳定性有提升。

InfraPyTorch InductorCSE编译器优化

The Hugging Face incident and the road ahead

OpenAI · 08-26 08:00 UTC+8

OpenAI 公开了对 Hugging Face 安全事件的调查发现,并介绍了在模型安全、监控和对齐方面将采取的加固措施。这显示出前沿模型供应商对供应链安全和模型完整性的重视,对依赖第三方模型分发的从业者有警示意义。

厂商动态OpenAIHugging Face安全事件模型安全

How loveholidays is making everyone a builder with Codex

OpenAI · 08-26 08:00 UTC+8

OpenAI 分享案例,旅行公司 loveholidays 利用 Codex 让非技术团队也能参与软件开发,加速从想法到产品的转化。这展示了 AI 编程工具在企业内部推动全民开发者的潜力,对数字化转型团队有参考价值。

AgentOpenAI Codex全民开发企业案例

v0.33.0-rc4

Ollama · 08-26 06:03 UTC+8

Ollama v0.33.0-rc4 修复了代理在图像回退场景下字符串内容丢失的问题,确保请求内容在降级路径中完整保留。这对使用多模态模型且依赖图像回退逻辑的 Ollama 用户是稳定性改进。

推理优化Ollama图像回退代理修复

b10630

llama.cpp · 08-26 05:38 UTC+8

llama.cpp 重构了 KleidiAI 的构建系统和集成方式,增加 fp16 保护并修复 CMake 缓存问题。这提升了 Arm 设备上 AI 加速库的编译可靠性和可维护性,对 Arm 平台的 llama.cpp 用户更友好。

Infrallama.cppKleidiAIArm构建系统

论文 20 篇

今日论文聚焦可验证奖励下的在线策略蒸馏与递归自改进、视频多模态预训练与强化学习、以及智能体执行轨迹驱动的自动化优化,代表工作有「Meta^n」、「CAFE」、「LAION-BVD」与「Game2World」。

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

HF 精选 · 08-26 08:00 UTC+8

面向视频多模态大模型的强化学习后训练通常要么依赖思维链生成导致开销大,要么样本效率与规模化受限。OraRL 引入 oracle rollout 并把优势估计解耦,同时用符号平衡剪枝筛选有效信号,从而在不生成思维链的前提下提升采样效率和可扩展性。该设计让视频 MLLM 的策略优化更轻量,对算力受限或数据规模大的后训练场景有直接价值。

视频多模态大模型强化学习后训练样本效率

On-policy Distillation with Verifiable Reward

HF 精选 · 08-26 08:00 UTC+8

这项研究把在线策略蒸馏与可验证奖励结合,通过 ReLU 门控的隐式奖励重参数化来对齐生成过程中的中间步骤,而不引入额外超参数。相比传统需要精心调参的蒸馏或奖励建模流程,它在推理任务上直接提升表现。对追求稳定、低调试成本的推理模型训练较有参考价值。

后训练在线策略蒸馏可验证奖励推理模型强化学习

WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

HF 精选 · 08-26 08:00 UTC+8

这是微信团队的多模态嵌入模型技术报告,提出 WeMM-Embedding 系列,把文本、图像、视频以及图文交错输入对齐到统一语义空间。该模型在公开检索与推荐基准上取得 SOTA,并在微信大规模业务中经受了真实负载验证。对需要跨模态召回、搜索和推荐的团队提供了一个可参考的通用嵌入方案。

基座多模态嵌入文本图像视频检索增强推荐系统

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild

HF 精选 · 08-26 08:00 UTC+8

CyberFactory 是一个开源框架,从真实漏洞出发构建智能体训练数据,用来训练安全模型 Aegis。它在概念验证生成、补丁修复和问答三类安全任务上提升了开源权重的网络安全能力。对希望用真实世界漏洞数据做安全智能体训练或评估的从业者,降低了数据构造门槛。

训练网络安全智能体开源框架漏洞利用

Best Practice Critic Optimization

HF 精选 · 08-26 08:00 UTC+8

BPCO 针对语言模型 critic 强化学习中价值估计不稳定、组采样成本高的问题,将价值预测限制在有限范围内,并引入蒙特卡洛目标和自适应优势估计。这让单条响应采样就能匹配需要组级采样的方法,显著降低计算开销。对需要做 critic-based RL 但资源有限的团队比较实用。

后训练强化学习critic 优化蒙特卡洛语言模型

Meta^n: Recursive Self-Improvement through Emergent Depth

HF 精选 · 08-26 08:00 UTC+8

Meta^n 研究递归自改进 LLM 代理的稳定性问题,固定同一个元操作并递归作用于不断增长的输入,从而涌现出更深的推理层。其思路是在不破坏系统稳定的前提下增加代理的深度,避免复杂自改进流程中的失控。对持续学习型代理架构和自改进训练有探索意义。

Agent递归自改进LLM 代理深层推理涌现

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

HF 精选 · 08-26 08:00 UTC+8

LAION-BVD 发布了一个一千万小时的开放视频数据集,覆盖视频、音频和图像模态,并配有人工合成标注。它面向多模态预训练,能在多个基准上带来稳健性能提升。对研究视频理解、跨模态对齐且需要大规模开放数据的团队是重要资源。

基座视频数据集多模态预训练开放数据合成标注

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment

HF 精选 · 08-26 08:00 UTC+8

这项研究在开放世界多智能体环境 Station 中让来自不同模型家族的 AI 代理自主选择研究方向、做实验、协作并共同维护科学文献,没有中心协调者或预设流水线。在 AlphaEvolve 的 12 个构造问题与两个案例研究中,Station 得到了相对此前工作具有新颖性的结果。这为探索自主数学发现和群体科研智能体提供了实验平台。

Agent多智能体数学发现开放世界科学智能体

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

HF 精选 · 08-26 08:00 UTC+8

GigaBrain-0.7 是视觉-语言-动作模型,通过三系统架构、大规模异构预训练和联合对齐训练来提升具身泛化能力。相比单一架构,这种分解更利于视觉感知、语言理解和动作控制的协同。其价值在于为具身基础模型如何从异构数据中涌现通用能力提供了一条可扩展路线。

基座具身智能视觉语言动作模型预训练泛化

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces

HF 精选 · 08-26 08:00 UTC+8

AutoSaddler 面向长时程 LLM 代理的脚手架优化,基于离线失败轨迹自动改进 harness,而不是人工调参或在线试错。它通过失败驱动的方式定位瓶颈并更新执行逻辑,在长时程基准上提升代理成功率。对部署复杂 Agent 管线的团队可以降低维护成本。

AgentLLM 代理自动化优化长时程任务失败驱动

On-Policy Self-Distillation in Diffusion Models

HF 精选 · 08-26 08:00 UTC+8

DiffusionOPSD 用在线策略自蒸馏,把图像级奖励转化为扩散模型显式的中间目标,从而提升奖励对齐的效率。这种拆解也使得目标构造和策略拟合可以分开分析,便于定位训练瓶颈。对扩散模型对齐和偏好优化研究有方法论价值。

后训练扩散模型自蒸馏奖励对齐策略优化

SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation

HF 精选 · 08-26 08:00 UTC+8

SecOPD 针对自适应提示注入攻击,在微调阶段引入 token 级反馈进行在线策略蒸馏,使模型学会在生成时逐 token 抵御注入内容。实验显示攻击成功率大幅下降,较单纯内容过滤或 SFT 防御更有效。对部署暴露在用户输入中的语言模型有实用安全价值。

后训练提示注入安全防御在线策略蒸馏token 级反馈

Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

HF 精选 · 08-26 08:00 UTC+8

Recuris 面向长时程智能体提出递归记忆架构,它持续跟踪任务进度并据此选择技能,同时在局部验证通过的门控下更新记忆。这样能减少长任务中的漂移和错误累积,提升成功率。对长时程规划、记忆管理和技能选择是一个可落地的改进思路。

Agent长时程智能体递归记忆技能选择局部验证

AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace

HF 精选 · 08-26 08:00 UTC+8

AgentRoom 通过 CRDT 支持的实时协同编辑和共享文件系统协调,让多个编码代理真正并发工作。相比独立或缺乏协调的并行方式,它降低了任务放弃率,提升了一致性。对多智能体编码协作系统的实现有直接参考价值。

Agent多智能体编码CRDT实时协同共享工作区

Automata from Agent Traces: Failure and Next-Step Prediction

HF 精选 · 08-26 08:00 UTC+8

该工作把 LLM 智能体的运行轨迹压缩成紧凑的有限状态机,用以预测下一步和失败情况。这样无需完整重放即可进行安全审计和运行时监控,降低了可观测性成本。对需要形式化分析智能体行为的团队提供了一种轻量抽象工具。

Agent有限状态机智能体可观测性安全审计运行时监控

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback

HF 精选 · 08-26 08:00 UTC+8

CAFE 让搜索智能体与 critic 共享参数并共同演化,在轨迹内学习修正性反馈,解决静态反馈无法适应动态搜索的问题。它提升了搜索表现,并在多个基准上减少幻觉。对自改进搜索、检索增强和工具调用代理都有启发。

Agent搜索智能体critic 协同轨迹内反馈减少幻觉

DREAM Technical Report

HF 精选 · 08-26 08:00 UTC+8

DREAM 在工业推荐系统中引入智能体元控制层,通过意图推理和双循环优化改进会话级推荐,且无需替换现有模型。它相当于在既有推荐管道上加了一层决策与优化逻辑,使在线推荐能更灵活响应会话目标。对大规模推荐系统架构演进有工程参考意义。

Agent推荐系统智能体元控制双循环优化

MoTE: Mixture of Task Experts for Multi-Task Video Understanding

HF 精选 · 08-26 08:00 UTC+8

MoTE 把视频解码器中的稠密前馈网络替换为按样本任务标签路由的专家模块,实现多任务视频理解的稀疏计算。这样在提升视频语言准确率的同时,保持了一定可解释性并降低计算开销。对视频多任务模型的高效推理和部署比较有价值。

基座多任务视频理解专家混合稀疏计算可解释性

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

HF 精选 · 08-26 08:00 UTC+8

Game2World Engine 提供了一套从游戏视频中移除 UI 的框架,为视频世界模型提供更干净的训练数据。相比基于掩码的去除方法,它在奖励指标上表现更好,说明干净画面能显著帮助世界模型学习。对游戏视频驱动世界模型训练的数据清洗有实用意义。

训练世界模型游戏视频数据清洗UI 移除

When "Must" Becomes "Maybe": Constraint Weakening in LLM Agent Workflows

HF 精选 · 08-26 08:00 UTC+8

该研究指出多阶段 LLM 工作流中,中间产物的存在会把强约束前提弱化为非约束上下文,即使内容看似完整,操作约束也可能丢失并导致安全失败。它揭示了一个常被忽视的流程设计风险,对需要严格约束执行的工作流有警示意义。

AgentLLM 工作流约束弱化安全性多阶段流程