每日 AI 速览

2026-08-03

生成于 2026-08-04 04:11
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线聚焦四大方向:阿里「Qwen3.8-Max」震撼发布,以2.4万亿参数MoE架构、自主编程16天搓出Agent等能力直逼顶尖闭源模型,成为大模型厂商动态绝对焦点;强化学习训练方法迎来密集创新,「RLSVR」通过任务变换实现自主可验证奖励,「SAF-OPD」与自蒸馏推动策略蒸馏与评分优化;多模态具身智能加速,「N_0-VTLA」/「N_0-TWAM」构建视觉-触觉-语言-动作与世界动作模型;Agent与记忆体系进化,华为开源「MindMemOS」让记忆与技能协同进化,Anthropic详解安全隔离架构。MiniMax视频模型登顶开源榜首、Thinking Machines发布多模态MoE亦值得关注。

行业动态 24 条

阿里Qwen3.8正式发布:2.4T规模,自主编程16天搓出一个Hermes Agent

InfoQ 中文 · 08-03 19:52 UTC+8

阿里发布Qwen3.8-Max,拥有2.4万亿参数,展示自主编程16天开发Hermes Agent的能力,整体性能进入全球大模型第一梯队。对从业者而言,该模型在长程任务和自主编程上的突破表明AI向自主智能体迈出了重要一步。

厂商动态Qwen3.8-Max阿里MoE自主编程Agent

阿里Qwen3.8正式发布,编程与办公再进化,推理更快更稳定

量子位 · 08-03 12:58 UTC+8

阿里正式发布Qwen3.8,编程和办公能力显著进化,推理更快更稳定,同时宣布下周开源Qwen3.8-Max和Qwen3.8-27B。这一发布为开发者提供了更高效且即将可本地部署的模型选择。

厂商动态Qwen3.8编程办公开源推理加速

China's MiniMax H3 is the first open model to top an AI video ranking

The Decoder · 08-03 21:52 UTC+8

MiniMax发布H3视频模型权重,成为首个登顶AI视频排行榜的开放模型。这标志着国产视频生成模型达到顶级水平,且开放权重将促进视频生成社区的进一步创新。

厂商动态MiniMaxH3视频生成开放模型

AI不再用完即忘:华为诺亚开源MindMemOS,记忆和Skill一起进化

量子位 · 08-03 10:51 UTC+8

华为诺亚方舟实验室开源面向AI Agent的MindMemOS记忆操作层,支持记忆和技能的可迁移与自演进,让Agent不再用完即忘。这为构建有长期记忆和持续学习能力的智能体提供了关键基础设施。

AgentMindMemOSAgent记忆开源华为

Understanding Alignment in Multimodal LLMs: A Comprehensive Study

Apple ML · 08-03 08:00 UTC+8

苹果机器学习团队发布了关于多模态LLM中对齐的综合研究,系统分析了偏好对齐对减少幻觉、提升图文一致性的作用。这对开发多模态对齐策略的从业者具有重要参考价值。

后训练多模态LLM偏好对齐幻觉苹果

Kimi K3 + DeepSeek-V4 Flash 0731 + Deep Research + Parallel Chat

Unsloth · 08-03 21:55 UTC+8

Unsloth新版本支持本地运行Kimi K3和DeepSeek-V4 Flash,新增并行聊天、基于本地模型的深度研究模式,并改进了AMD和Intel GPU支持及DoRA训练。这为本地大模型应用提供了更丰富的工具链和更高效的多任务运行能力。

AgentUnsloth本地模型Kimi K3DeepSeek-V4并行聊天

这个新生图模型有点夯:4K直出的,国产的,开源的!

量子位 · 08-03 19:59 UTC+8

商汤科技预览国产开源模型SenseNova U1.5 Lite,宣称可直接生成4K分辨率图像。这一进展为高质量图像生成领域提供了新的开源选择,有望丰富开源文生图生态。

厂商动态SenseNova图像生成4K开源商汤

b10238

llama.cpp · 08-03 16:59 UTC+8

llama.cpp新增对Qwen3-Next的多令牌预测(MTP)支持,可直接利用MTP层加速推理。这对希望本地高效运行Qwen系列模型的开发者是重要功能更新。

推理优化llama.cppMTPQwen3-Next推理加速

b10237

llama.cpp · 08-03 15:51 UTC+8

llama.cpp现已支持DeepSeek V3.2的多令牌预测(MTP),进一步提升推理解码效率。这增强了本地部署DeepSeek V3系列模型的实用性。

推理优化llama.cppMTPDeepSeek V3.2推理加速

b10236

llama.cpp · 08-03 13:13 UTC+8

llama.cpp在Metal后端实现了DeepSeek v4的闪电索引器,大幅提升GPU推理效率,尤其在长上下文场景下。这对Apple Silicon用户运行DeepSeek v4模型有显著加速效果。

推理优化llama.cppMetalDeepSeek v4闪电索引器推理加速

b10241

llama.cpp · 08-03 23:00 UTC+8

llama.cpp修复了CUDA后端在block_reduce中复用共享内存时的数据竞争问题,提升了计算稳定性和正确性。这为使用CUDA的用户提供了更可靠的底层运算保障,尤其是在复杂归约操作中。

推理优化llama.cppCUDA数据竞争block_reduce

阿里“千问办公”开启公测

量子位 · 08-03 12:47 UTC+8

阿里旗下办公智能体「千问办公」开启公测,个人与企业用户可直接体验其最新旗舰模型Qwen3.8。该产品将大模型能力直接嵌入办公场景,标志着阿里在端到端办公应用落地上的重要一步,对关注企业智能化改造的从业者提供了可快速上手的参考方案。

厂商动态阿里Qwen3.8办公智能体公测

b10235

llama.cpp · 08-03 05:04 UTC+8

llama.cpp 为 Metal 后端新增了 SILU_BACK 算子,专门针对 F32 类型实现,并清理了冗余断言。这补齐了苹果芯片上反向传播关键激活函数的高效支持,对在 Mac 上做模型微调和训练的开发者很有帮助。

推理优化llama.cppMetal后端SILU反向传播Apple Silicon

b10234

llama.cpp · 08-03 04:19 UTC+8

llama.cpp 的 Metal 后端现在支持二元运算的 F16 半精度,覆盖多种硬件平台。这意味着在 Apple Silicon 设备上进行推理时,能降低显存占用和提升计算吞吐,对重视效率和延迟的本地部署场景很关键。

llama.cppMetal后端半精度F16推理优化

b10233

llama.cpp · 08-03 03:40 UTC+8

针对 OpenCL 后端的 GLU 操作限制了本地工作组大小,以避免因过大工作组导致的不稳定性或性能下降。这对使用 OpenCL 跨平台部署的开发者是一项重要的健壮性改进,可以提升推理的兼容性和稳定性。

推理优化llama.cppOpenCL后端GLU算子稳定性

b10232

llama.cpp · 08-03 02:59 UTC+8

llama.cpp 的 Metal 后端实现了 DeepSeek V4 模型中的超连接算子,包括组合、预处理和后处理步骤,并利用 SIMD 组寄存器和 shuffle 优化内核。这使得在 Apple Silicon 上高效运行最新的 DeepSeek V4 架构成为可能,对在 Mac 上尝试前沿 MoE 模型的用户十分关键。

推理优化llama.cppMetal后端DeepSeek V4超连接算子SIMD优化

v4.4.3: bump transformers and peft (#9837)

ms-swift 魔搭 · 08-03 20:35 UTC+8

魔搭 Swift 微调框架升级至 v4.4.3,主要更新了 transformers 和 peft 库依赖版本。这确保了框架与 HuggingFace 生态的最新特性兼容,对保持微调流程稳定性和获取上游修复非常重要。

Inframs-swift版本升级pefttransformers

论文 14 篇

论文亮点在于强化学习新范式(「RLSVR」的自主验证、「SAF-OPD」的优势融合蒸馏)与多模态具身智能(视觉-触觉-语言-动作模型及世界建模),同时文本条件缩放规律、常识推理显著性偏差等基础研究亦有呈现。

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

HF 精选 · 08-03 08:00 UTC+8

针对RLVR目前仅适用于数学和编程等确定性可验证领域、难以扩展到开放任务的痛点,本文提出RLSVR框架,通过任务转换将开放任务映射为自我验证形式,使得LLM在生成回复时自身即可产出可验证的奖励信号,无需依赖人类偏好或判别模型,从而在开放任务上实现大规模自提升训练。实验表明该方法在多个开放评测上超越了依赖外部评判的基线,为RLVR在更广泛场景的应用提供了新路径。

后训练RLVR自我验证奖励开放任务自提升

SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

美团HF 精选 · 08-03 08:00 UTC+8

针对将RLVR的稀疏响应级奖励与OPD的稠密教师优势相结合时出现的熵崩溃问题,本文分析了两个关键失配——幅度不匹配和校准偏移,并提出SAF-OPD框架,通过自适应优势归一化和动态融合系数稳定训练过程,既保留了OPD的探索能力又超越教师上限。实验在推理任务上表明,SAF-OPD比单纯RLVR或OPD显著提升,并避免熵崩溃,为强化学习与知识蒸馏的结合提供了稳定方案。

后训练RLVR在策略蒸馏优势融合熵崩溃强化学习

Enhancing Rubric-based RL via Self-Distillation

字节 SeedHF 精选 · 08-03 08:00 UTC+8

针对基于评分标准的强化学习中未探索准则得不到优化信号导致探索不足的局限,本文提出一种自蒸馏策略,利用模型自身的特权信息(如完整评分标准)作为教师,为当前策略提供稠密奖励信号,避免了以往外部引导带来的训练-推断分布失配问题。在多个开放文本生成任务上,该方法显著提高了准则覆盖率和最终性能,同时无需额外外部模型,简单高效。

后训练评分标准RL自蒸馏未探索准则开放任务强化学习

Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

HF 精选 · 08-03 08:00 UTC+8

针对长链思维链推理中令牌贡献不均却被等同处理的问题,本文提出反事实敏感性信用重分配(CSCR)方法,通过估计每个令牌对最终答案的边际贡献来重新分配信用,从而更精细地指导强化学习,避免了GRPO的均匀广播和OPSD可能抑制探索的缺点。在数学和代码推理任务上,CSCR相比现有方法显著提升准确率,并提供了更可解释的令牌级信用分配。

后训练长链推理信用分配强化学习GRPO反事实分析

Mental World Modeling

HF 精选 · 08-03 08:00 UTC+8

现有世界模型往往仅预测物理状态演变,而忽略了驱动人类行为的心理状态(如信念、欲望、意图),导致行为预测失准。本文提出心理世界建模(MWM)框架,显式对智能体的心理状态进行建模并预测其演变,从而在社交推理和多智能体交互场景中更准确地推断和预测行为。实验表明MWM在多种心理状态推理任务上显著优于传统世界模型,为构建具有社会智能的AI提供了新思路。

Agent世界模型心理状态建模社会智能多智能体

N_0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

HF 精选 · 08-03 08:00 UTC+8

为增强机器人在接触式操作中的触觉感知和反馈控制能力,本文提出N_0-VTLA模型,通过潜在触觉令牌将触觉模态高效集成到视觉-语言-动作框架中,并采用视觉-触觉预训练、分阶段触觉通路整合和优势条件化离线策略改进等训练方案。在精细操作任务上,N_0-VTLA展现了强大的接触式操作能力,并能利用已部署的数据持续优化策略,为通用触觉智能体奠定基础。

基座视觉-触觉-语言-动作模型潜在触觉令牌接触式操作离线强化学习

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

HF 精选 · 08-03 08:00 UTC+8

针对AI应用中系统提示不透明导致信任和问责缺失的问题,本文提出AISPA框架,从用户视角系统性地审计LLM应用的系统提示,通过分析模型行为倒推潜在的隐藏指令和约束。实验展示了AISPA能够有效揭示商业产品中未公开的系统提示内容,有助于提升AI系统的透明度和可问责性。

后训练系统提示审计透明度AI问责LLM应用

N_0-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

HF 精选 · 08-03 08:00 UTC+8

针对机器人接触式操作中触觉建模不足的问题,本文提出N_0-TWAM,一个原生触觉的世界-动作模型,能够同时预测未来的视觉和接触力。它基于NeoForce统一力表示进行大规模视觉-触觉联合预训练,覆盖6种形态和450个任务。在复杂接触操作上,N_0-TWAM表现出强大的动作预测和触觉状态估计能力,有望推动触觉反馈在机器人中的应用。

基座世界-动作模型触觉原生接触式操作视觉-触觉预训练

Scaling Properties of Text Conditioning in Visual Generation

腾讯混元HF 精选 · 08-03 08:00 UTC+8

稀缺的文本条件缩放规律研究一直受限于自然语言提示长度无法直接与扩散损失建立有效关联,本文另辟蹊径,发现收敛后的扩散损失实际与提示中结构化语言的数量成稳定的缩放关系,并为此设计了白盒指标GPG和黑盒指标ED来度量结构化程度。在受控训练实验和大规模预训练检查点上都验证了这一发现,揭示了文本条件强度的可预测缩放模式,为优化视觉生成模型的文本理解提供了量化指导。

训练扩散模型文本条件化缩放规律视觉生成

Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants

HF 精选 · 08-03 08:00 UTC+8

当前编程助手对用户请求中的歧义通常在该次会话内解决,却忽略了同一用户在不同会话中常表现出类似歧义,需要反复澄清,效率低下。本文构建了跨会话个性化歧义适应基准,要求模型利用历史交互记录来消解当前任务中的歧义,从而减少澄清次数并更快生成准确代码。实验显示,考虑用户个性化历史能大幅降低澄清需求并提升代码正确率,为构建更具记忆和适应性的编程助手提供了评价框架。

Agent编程助手歧义消解个性化跨会话记忆基准测试

EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

HF 精选 · 08-03 08:00 UTC+8

随着AI代理在生命科学领域的广泛使用,需要更适应机器的文献访问方式,但现有资源如Europe PMC仍以人类为中心设计。本文提出EMBL AI Librarian,一个专为AI代理构建的生命科学知识层,将超过4000万条记录转化为Agent友好的结构化表示,支持直接查询而无需复杂语法或多步检索,极大提升了代理获取科学文献的效率与准确性。

AgentAI代理生命科学知识层文献检索EMBL

RL^2-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

HF 精选 · 08-03 08:00 UTC+8

为解决VLA模型在挑战性任务上动作采样趋同且忽略时间步差异的问题,本文提出RL^2-VLA,一种自适应的强化学习潜在组合引导方法,在测试时动态调整干预策略并进行计算缩放,既增强了行为多样性又避免了单一策略的失败模式。实验表明,该方法在复杂操作任务中显著提升成功率,且无需额外训练数据。

AgentVLA模型测试时适应强化学习引导潜在组合

Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

HF 精选 · 08-03 08:00 UTC+8

本文从信息论角度论证了基于可复制上下文的LLM安全防护存在根本性局限:由于攻击者可以完美模仿良性请求和交互历史,模型无法区分合理使用与滥用,因此任何仅依赖请求上下文的防护机制都存在可精确计算的最坏情况攻击成功率下界,同时必须牺牲一定有用性。这揭示了当前安全对齐方法的固有脆弱性,呼吁探索上下文不可复制的新防护方向。

后训练LLM安全可复制上下文安全对齐最坏情况分析

Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning

HF 精选 · 08-03 08:00 UTC+8

现有推理研究多关注逻辑能力,本文聚焦LLM常识推理中一种普遍存在的显著性偏差:模型极易被输入中显式但无关的数字等干扰项劫持,转而忽略物理常识前提,导致荒唐结论。作者通过系统性实验证明这种偏差源于对显式条件的不当侧重,即使强推理模型也难以幸免,并初步探索通过干预注意力模式来缓解该偏差,为常识推理的鲁棒性提供了新视角。

训练常识推理显著性偏差LLM脆弱性显式干扰