阿里Qwen3.8正式发布:2.4T规模,自主编程16天搓出一个Hermes Agent
阿里发布Qwen3.8-Max,拥有2.4万亿参数,展示自主编程16天开发Hermes Agent的能力,整体性能进入全球大模型第一梯队。对从业者而言,该模型在长程任务和自主编程上的突破表明AI向自主智能体迈出了重要一步。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
阿里Qwen3.8正式发布:2.4T规模,自主编程16天搓出一个Hermes Agent
阿里发布Qwen3.8-Max,拥有2.4万亿参数,展示自主编程16天开发Hermes Agent的能力,整体性能进入全球大模型第一梯队。对从业者而言,该模型在长程任务和自主编程上的突破表明AI向自主智能体迈出了重要一步。
Alibaba’s open-weight Qwen3.8-Max takes on long-horizon AI tasks with 2.4 trillion parameters
阿里发布Qwen3.8-Max,2.4T参数MoE模型,能够自主执行持续数天的长程任务,如复现论文和芯片设计,并计划下周开放权重。这为需要长时间自主决策的复杂AI应用提供了开放的基座选择。
阿里将Qwen3.8-Max从预览转为正式发布,公布按token定价并即将开源权重,该2.4T MoE模型支持文本、图像和视频输入及1M上下文。作为Qwen家族最强模型,其发布将深刻影响开源模型竞争格局。
刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude
阿里正式推出Qwen3.8-Max,综合能力冲进全球第一梯队,在编程、专业工作、长程任务和多模态分析上表现直逼Claude。从业者可重点关注其全面提升的基座能力,为复杂应用提供更强支撑。
阿里Qwen3.8正式发布,编程与办公再进化,推理更快更稳定
阿里正式发布Qwen3.8,编程和办公能力显著进化,推理更快更稳定,同时宣布下周开源Qwen3.8-Max和Qwen3.8-27B。这一发布为开发者提供了更高效且即将可本地部署的模型选择。
Thinking Machines Lab发布Inkling-Small,276B总参、12B激活的开源多模态MoE模型,在四分之一规模下即匹配Inkling性能,其NVFP4检查点可单张B300 GPU运行。小规模高效能设计令其适用于消费级部署,对多模态开源社区意义重大。
China's MiniMax H3 is the first open model to top an AI video ranking
MiniMax发布H3视频模型权重,成为首个登顶AI视频排行榜的开放模型。这标志着国产视频生成模型达到顶级水平,且开放权重将促进视频生成社区的进一步创新。
AI不再用完即忘:华为诺亚开源MindMemOS,记忆和Skill一起进化
华为诺亚方舟实验室开源面向AI Agent的MindMemOS记忆操作层,支持记忆和技能的可迁移与自演进,让Agent不再用完即忘。这为构建有长期记忆和持续学习能力的智能体提供了关键基础设施。
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
苹果机器学习团队发布了关于多模态LLM中对齐的综合研究,系统分析了偏好对齐对减少幻觉、提升图文一致性的作用。这对开发多模态对齐策略的从业者具有重要参考价值。
Anthropic 详解 Claude 的安全隔离架构:如何在 Web、开发和桌面环境中约束 Agent 行为
Anthropic详细阐述了Claude的安全隔离架构,展示了如何在Web、开发和桌面环境中约束Agent行为以防止滥用。这对于构建安全的AI Agent系统提供了重要设计参考。
Kimi K3 + DeepSeek-V4 Flash 0731 + Deep Research + Parallel Chat
Unsloth新版本支持本地运行Kimi K3和DeepSeek-V4 Flash,新增并行聊天、基于本地模型的深度研究模式,并改进了AMD和Intel GPU支持及DoRA训练。这为本地大模型应用提供了更丰富的工具链和更高效的多任务运行能力。
商汤科技预览国产开源模型SenseNova U1.5 Lite,宣称可直接生成4K分辨率图像。这一进展为高质量图像生成领域提供了新的开源选择,有望丰富开源文生图生态。
Altman 带着GPT-6进白宫?OpenAI 新模型曝光,或成美国首批过审模型
据报道,OpenAI新模型GPT-6曝光,或将成为美国首批通过安全审查的AI模型。这反映出前沿模型面临的政策监管趋势,从业者需密切关注安全合规要求的变化。
llama.cpp新增对Qwen3-Next的多令牌预测(MTP)支持,可直接利用MTP层加速推理。这对希望本地高效运行Qwen系列模型的开发者是重要功能更新。
llama.cpp现已支持DeepSeek V3.2的多令牌预测(MTP),进一步提升推理解码效率。这增强了本地部署DeepSeek V3系列模型的实用性。
Cogent AI发布VR-1,一款专为网络安全后训练的前沿推理模型,能够组合和验证企业攻击路径,并附带基准IntrusionBench及安全代理运行环境。这为垂直领域推理模型开辟了新方向,推动AI在安全攻防中的深度应用。
llama.cpp在Metal后端实现了DeepSeek v4的闪电索引器,大幅提升GPU推理效率,尤其在长上下文场景下。这对Apple Silicon用户运行DeepSeek v4模型有显著加速效果。
llama.cpp修复了CUDA后端在block_reduce中复用共享内存时的数据竞争问题,提升了计算稳定性和正确性。这为使用CUDA的用户提供了更可靠的底层运算保障,尤其是在复杂归约操作中。
阿里旗下办公智能体「千问办公」开启公测,个人与企业用户可直接体验其最新旗舰模型Qwen3.8。该产品将大模型能力直接嵌入办公场景,标志着阿里在端到端办公应用落地上的重要一步,对关注企业智能化改造的从业者提供了可快速上手的参考方案。
llama.cpp 为 Metal 后端新增了 SILU_BACK 算子,专门针对 F32 类型实现,并清理了冗余断言。这补齐了苹果芯片上反向传播关键激活函数的高效支持,对在 Mac 上做模型微调和训练的开发者很有帮助。
llama.cpp 的 Metal 后端现在支持二元运算的 F16 半精度,覆盖多种硬件平台。这意味着在 Apple Silicon 设备上进行推理时,能降低显存占用和提升计算吞吐,对重视效率和延迟的本地部署场景很关键。
针对 OpenCL 后端的 GLU 操作限制了本地工作组大小,以避免因过大工作组导致的不稳定性或性能下降。这对使用 OpenCL 跨平台部署的开发者是一项重要的健壮性改进,可以提升推理的兼容性和稳定性。
llama.cpp 的 Metal 后端实现了 DeepSeek V4 模型中的超连接算子,包括组合、预处理和后处理步骤,并利用 SIMD 组寄存器和 shuffle 优化内核。这使得在 Apple Silicon 上高效运行最新的 DeepSeek V4 架构成为可能,对在 Mac 上尝试前沿 MoE 模型的用户十分关键。
v4.4.3: bump transformers and peft (#9837)
魔搭 Swift 微调框架升级至 v4.4.3,主要更新了 transformers 和 peft 库依赖版本。这确保了框架与 HuggingFace 生态的最新特性兼容,对保持微调流程稳定性和获取上游修复非常重要。
针对RLVR目前仅适用于数学和编程等确定性可验证领域、难以扩展到开放任务的痛点,本文提出RLSVR框架,通过任务转换将开放任务映射为自我验证形式,使得LLM在生成回复时自身即可产出可验证的奖励信号,无需依赖人类偏好或判别模型,从而在开放任务上实现大规模自提升训练。实验表明该方法在多个开放评测上超越了依赖外部评判的基线,为RLVR在更广泛场景的应用提供了新路径。
SAF-OPD: Stable Advantage Fusion for On-Policy Distillation
针对将RLVR的稀疏响应级奖励与OPD的稠密教师优势相结合时出现的熵崩溃问题,本文分析了两个关键失配——幅度不匹配和校准偏移,并提出SAF-OPD框架,通过自适应优势归一化和动态融合系数稳定训练过程,既保留了OPD的探索能力又超越教师上限。实验在推理任务上表明,SAF-OPD比单纯RLVR或OPD显著提升,并避免熵崩溃,为强化学习与知识蒸馏的结合提供了稳定方案。
Enhancing Rubric-based RL via Self-Distillation
针对基于评分标准的强化学习中未探索准则得不到优化信号导致探索不足的局限,本文提出一种自蒸馏策略,利用模型自身的特权信息(如完整评分标准)作为教师,为当前策略提供稠密奖励信号,避免了以往外部引导带来的训练-推断分布失配问题。在多个开放文本生成任务上,该方法显著提高了准则覆盖率和最终性能,同时无需额外外部模型,简单高效。
针对长链思维链推理中令牌贡献不均却被等同处理的问题,本文提出反事实敏感性信用重分配(CSCR)方法,通过估计每个令牌对最终答案的边际贡献来重新分配信用,从而更精细地指导强化学习,避免了GRPO的均匀广播和OPSD可能抑制探索的缺点。在数学和代码推理任务上,CSCR相比现有方法显著提升准确率,并提供了更可解释的令牌级信用分配。
现有世界模型往往仅预测物理状态演变,而忽略了驱动人类行为的心理状态(如信念、欲望、意图),导致行为预测失准。本文提出心理世界建模(MWM)框架,显式对智能体的心理状态进行建模并预测其演变,从而在社交推理和多智能体交互场景中更准确地推断和预测行为。实验表明MWM在多种心理状态推理任务上显著优于传统世界模型,为构建具有社会智能的AI提供了新思路。
N_0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
为增强机器人在接触式操作中的触觉感知和反馈控制能力,本文提出N_0-VTLA模型,通过潜在触觉令牌将触觉模态高效集成到视觉-语言-动作框架中,并采用视觉-触觉预训练、分阶段触觉通路整合和优势条件化离线策略改进等训练方案。在精细操作任务上,N_0-VTLA展现了强大的接触式操作能力,并能利用已部署的数据持续优化策略,为通用触觉智能体奠定基础。
AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
针对AI应用中系统提示不透明导致信任和问责缺失的问题,本文提出AISPA框架,从用户视角系统性地审计LLM应用的系统提示,通过分析模型行为倒推潜在的隐藏指令和约束。实验展示了AISPA能够有效揭示商业产品中未公开的系统提示内容,有助于提升AI系统的透明度和可问责性。
N_0-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation
针对机器人接触式操作中触觉建模不足的问题,本文提出N_0-TWAM,一个原生触觉的世界-动作模型,能够同时预测未来的视觉和接触力。它基于NeoForce统一力表示进行大规模视觉-触觉联合预训练,覆盖6种形态和450个任务。在复杂接触操作上,N_0-TWAM表现出强大的动作预测和触觉状态估计能力,有望推动触觉反馈在机器人中的应用。
Scaling Properties of Text Conditioning in Visual Generation
稀缺的文本条件缩放规律研究一直受限于自然语言提示长度无法直接与扩散损失建立有效关联,本文另辟蹊径,发现收敛后的扩散损失实际与提示中结构化语言的数量成稳定的缩放关系,并为此设计了白盒指标GPG和黑盒指标ED来度量结构化程度。在受控训练实验和大规模预训练检查点上都验证了这一发现,揭示了文本条件强度的可预测缩放模式,为优化视觉生成模型的文本理解提供了量化指导。
当前编程助手对用户请求中的歧义通常在该次会话内解决,却忽略了同一用户在不同会话中常表现出类似歧义,需要反复澄清,效率低下。本文构建了跨会话个性化歧义适应基准,要求模型利用历史交互记录来消解当前任务中的歧义,从而减少澄清次数并更快生成准确代码。实验显示,考虑用户个性化历史能大幅降低澄清需求并提升代码正确率,为构建更具记忆和适应性的编程助手提供了评价框架。
EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents
随着AI代理在生命科学领域的广泛使用,需要更适应机器的文献访问方式,但现有资源如Europe PMC仍以人类为中心设计。本文提出EMBL AI Librarian,一个专为AI代理构建的生命科学知识层,将超过4000万条记录转化为Agent友好的结构化表示,支持直接查询而无需复杂语法或多步检索,极大提升了代理获取科学文献的效率与准确性。
为解决VLA模型在挑战性任务上动作采样趋同且忽略时间步差异的问题,本文提出RL^2-VLA,一种自适应的强化学习潜在组合引导方法,在测试时动态调整干预策略并进行计算缩放,既增强了行为多样性又避免了单一策略的失败模式。实验表明,该方法在复杂操作任务中显著提升成功率,且无需额外训练数据。
Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs
本文从信息论角度论证了基于可复制上下文的LLM安全防护存在根本性局限:由于攻击者可以完美模仿良性请求和交互历史,模型无法区分合理使用与滥用,因此任何仅依赖请求上下文的防护机制都存在可精确计算的最坏情况攻击成功率下界,同时必须牺牲一定有用性。这揭示了当前安全对齐方法的固有脆弱性,呼吁探索上下文不可复制的新防护方向。
现有推理研究多关注逻辑能力,本文聚焦LLM常识推理中一种普遍存在的显著性偏差:模型极易被输入中显式但无关的数字等干扰项劫持,转而忽略物理常识前提,导致荒唐结论。作者通过系统性实验证明这种偏差源于对显式条件的不当侧重,即使强推理模型也难以幸免,并初步探索通过干预注意力模式来缓解该偏差,为常识推理的鲁棒性提供了新视角。