[AINews] Qwen 3.8 Max(2.4T) and 27B, new open weights models for Coding and Cowork
通义千问发布 Qwen 3.8 Max(2.4T 参数)和 27B 新开源权重模型,强化编程和协同工作能力,为大模型开源生态再添重磅选择,对开发者极具吸引力。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
[AINews] Qwen 3.8 Max(2.4T) and 27B, new open weights models for Coding and Cowork
通义千问发布 Qwen 3.8 Max(2.4T 参数)和 27B 新开源权重模型,强化编程和协同工作能力,为大模型开源生态再添重磅选择,对开发者极具吸引力。
The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten
Baseten 在完成 130 亿美元融资后推出推理工程大师班,深入讲解自回归和扩散模型的高效部署与优化,是推理工程技术的前沿干货分享。
Alibaba's new Qwen model is also taking your job, but this time it's great
阿里巴巴用视频对比方式营销 Qwen 3.8,展示 AI 代劳工作、人类享受生活,一反「AI 抢工作」的常见叙事,折射出大厂在市场沟通策略上的转向。
Orchard: An open framework for scalable agentic AI
微软研究院开源 Orchard 框架,为多类型智能体的训练和评估提供统一且可复用的基础设施,降低复杂度同时支持小模型获得强性能,加速智能体研究从实验到规模化的过渡。
llama.cpp 重构了推测解码配置的公共初始化函数以减少代码重复,保持现有服务器测试全部通过,优化了推理后端的代码结构。
Anthropic 与成立仅数月的云初创 Volta 签署 100 亿美元计算容量协议,锁定未来算力,凸显头部 AI 公司对算力资源的激烈争夺和战略布局。
PyTorch 更新对非阻塞 NCCL 通信器的支持,通过轮询 ncclCommGetAsyncError 正确处理进行中状态,避免误判错误,提升分布式训练的超时鲁棒性和效率。
Y Combinator 内部使用的多人智能体 Harness QM 以 MIT 协议开源,提供隔离工作区、Slack 集成和持久沙箱等,支持多种模型驱动避免厂商锁定,为团队级智能体协作提供开箱即用的框架。
亿级日活App的“算力生死劫”:推理成本倒挂,他们靠跨云架构砍掉75% GPU集群
针对亿级日活出海 AI 应用的推理成本倒挂困境,该案例通过跨云架构优化削减 75% GPU 集群,展示了高流量场景下显著降本增效的可行路径。
How to Secure AI Agents, MCP Servers, and LLM Apps in Production
面向生产环境的 AI 安全实战指南,覆盖智能体、MCP 服务器和 LLM 应用的五层攻击面、12 项配置检查以及运行时护栏,并映射 NIST/Owasp 等标准,为安全建设提供完整落地框架。
200个任务、1700万帧!大晓开源L5级具身数据集ACE-Data-0,把真实家庭变成机器人的物理世界教材
大晓开源涵盖 200 个任务、1700 万帧的 L5 级具身数据集 ACE-Data-0,采集真实家庭环境交互,为机器人从感知到行动的端到端学习提供高质量物理世界教材。
How to Run Isolated Tenant Kubernetes Clusters on Shared GPU Infrastructure
NVIDIA 开发者文章介绍如何在共享 GPU 集群上运行相互隔离的 Kubernetes 租户集群,兼顾资源利用率与多团队安全隔离,对 GPU 集群管理有直接参考价值。
NVIDIA 公布了 Vera 存储基准测试,展示了针对 AI 原生存储的加密、压缩、完整性检查和数据恢复的加速性能。对于构建 agentic AI 工作流的从业者,这可以帮助评估存储层在处理持久记忆和 KV 缓存时的速度与可靠性,从而优化数据管线的整体效率。
Deploy local agents everywhere with LFM2.5-2.6B
HuggingFace 推出了 LFM2.5-2.6B 模型,支持在各类设备上本地部署智能体,无需云端依赖。这为注重隐私、低延迟和离线运行的应用场景大幅降低了 agent 的部署门槛,并拓展了设备端智能体生态。
llama.cpp 为 Vulkan 后端新增了 GATED_LINEAR_ATTN 算子支持,扩展了线性注意力模型在 GPU 上的推理路径。这让在资源受限的 Vulkan 环境中运行更先进的注意力机制成为可能,提升了模型兼容性与推理灵活性。
开源版Claude Science来了!零依赖、MIT协议,内置30+项科研Skills
北京大学与元空AI Agent联合实验室发布了开源版「Claude Science」,采用 MIT 协议且零依赖,内置 30 余项科研技能。该工具让研究人员可以在本地离线环境下使用类 Claude 的科研辅助能力,并方便二次开发,降低了学术领域的智能体应用门槛。
给 Agent 装上方向盘和刹车,Harness 时代的工程新范式
InfoQ 提出为智能体引入类似“方向盘和刹车”的工程化控制机制,探索安全可信的 Agent 治理新范式。这有助于企业解决智能体行为不可控和风险高等落地难题,为 Agent 规模化应用提供更细粒度的管控手段。
llama.cpp 重构了采样器内部结构,将 n_vocab 字段从通用采样数据迁移至 penalty_sampler,以保持与 logit_bias 和 mirostat 采样器一致的设计。这次变更提升了代码的可维护性,且不影响现有推理性能。
腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文
腾讯发布了混元 Hy ASR 3.0 预览版,实现上下文感知的语音识别能力,并已集成到元宝应用中。该技术能够提升噪音环境下的识别准确率和对话理解水平,为语音助手等场景提供更鲁棒的基础支撑。
DeepSeek低价风暴打服硅谷!海外平台争相倒贴V4 Flash
DeepSeek 极具竞争力的定价策略迫使海外云平台纷纷推出 DeepSeek V4 Flash 的免费或补贴方案,在硅谷引发热议。这显示出开源低价模型对商业闭源模式的冲击,加速了推理服务的成本下探与价格竞争。
本文讲解如何利用「NVIDIA SkillSpector」和「LangGraph」构建 AI 技能安全审计流水线,通过自定义 YARA 规则检测提示注入、凭证访问等风险并设置 CI 部署门禁。该方案为 AI agent 技能的安全合规提供了可操作的自动化实践,有助于企业安全地引入智能体能力。
PyTorch 的 nccl-lazy 后端明确拒绝不安全的动态重配置模式,以避免因 pair 通道生命周期不完整导致的通信错误。该修复增强了分布式训练中 nccl-lazy 的稳定性,防止开发者在不适用的场景误用。
PyTorch 修复了 nccl-lazy 未将进程组 UID 转发给主后端的缺陷,使 NCCL 对称内存能够根据正确的名称解析通信器。这一修复对利用对称内存进行高效通信的分布式应用场景至关重要。
PyTorch 完成了 WorkNCCL 的状态管理契约,确保只在真正完成或失败时才发布终端状态与异常,并修正了超时计时的起点。这提升了 NCCL 集合通信操作的错误处理可靠性和可观测性,消除了虚假成功的隐患。
New ways to learn and teach with ChatGPT Work and Codex
OpenAI 为「ChatGPT Work」和「Codex」推出教育类插件,支持 K-12 教师、大学师生进行学习、教学、研究和项目构建。这扩展了 ChatGPT 和 Codex 在教育领域的结构化应用场景,为教学互动提供了新的可能性。
本教程展示了如何为「Moonshot PerceptionBench」搭建端到端评估工作流,该基准覆盖 OCR、计数、定位、上下文推理等细粒度多模态感知任务。通过自动化加载与评判,从业者可以高效衡量视觉模型的感知能力,提升评测效率。
Design Arena creators raise $7.9 million to bring taste to AI models
「Design Arena」的创建者融资 790 万美元,旨在将人类的审美与“品味”判断注入 AI 模型,已有 530 万用户参与提供关键的人类评估数据。这凸显了人类反馈在提升模型主观判断能力中的重要性,也为前沿实验室提供了高质量的对齐信号。
NVIDIA 发布面向 Robotaxi 和自动驾驶的开放前沿模型「Alpamayo 2 Super」,并开放商业使用,它特别擅长处理罕见的复杂长尾场景,需要情境理解与因果推理。这为自动驾驶公司提供了可直接商用的高性能基座模型,加速复杂决策系统的落地。
InfoQ 文章强调智能体记忆不能仅依赖对话记录,需要引入更结构化的记忆管理机制。这对构建能保持长期上下文和个性化能力的智能体至关重要,决定了其在持续交互场景中的可用性。
Silicon Valley’s rift over open source pushes back contemplated White House bans on Chinese AI
硅谷内部就白宫可能对中国开放权重 AI 模型实施制裁和云禁令产生严重分歧,OpenAI 和 Anthropic 主张限制,而 Nvidia、Google 和 Meta 强烈反对,最终白宫暂时搁置相关计划。这一事件凸显了开源模型在国际竞争与政策博弈中的战略地位,开发者需密切关注后续走向。
中国软件行业领军人物、深开鸿CEO王成录博士确认出席AICon深圳,将分享“让 AI 拥有身体:从大模型迈向物理 AI”
深开鸿 CEO 王成录博士将在 AICon 深圳分享“让 AI 拥有身体:从大模型迈向物理 AI”的主题演讲,探讨如何将大模型能力延伸至物理世界。这为关注具身智能和物理 AI 落地的从业者提供了来自行业领军人物的实践视角与战略思考。
From weeks to minutes: How Formula 1® uses agentic AI on AWS to accelerate data operations
F1 与 AWS 合作利用「Amazon Bedrock AgentCore」构建 Data Accelerator,将数据源上线时间从 8 周缩短至约 40 分钟,并实现了 schema 演化自动化与全链路可观测性。这一案例展示了智能体 AI 在数据工程中的巨大加速潜力,为数据密集型团队提供了可复用的参考架构。
Automated Reasoning policy refinement in Amazon Bedrock
Amazon Bedrock 新增自动推理策略精炼功能,能自动诊断失败的权限测试并生成形式逻辑修正建议,用户确认后即可生效。这帮助安全团队更高效地维护 IAM 与合规策略,减少手工梳理的复杂度和出错概率。
DiffusionGemma Technical Report
DiffusionGemma 是一种基于离散扩散的开放权重语言模型,用并行迭代精炼 256 个 token 块的方式生成文本,打破了自回归模型的顺序解码瓶颈。它通过对 MoE 架构的 Gemma 4 进行微调得到,激活参数 3.8B,在极高速度下保持生成质量,为非自回归路线的大模型高效推理提供了新的实践参考。
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
LongHorizon-Harness 将长周期智能体执行重新定义为任务状态管理问题,通过把任务状态评估与上下文解耦,解决传统框架中状态跟踪困难和错误自评扩散的问题,从而提升长程多步任务的完成可靠性与可跟踪性。
DAPD: Dual-Anchored Policy Distillation
DAPD 针对在线策略蒸馏中教师拥有特权信息导致的「特权幻觉」——学生学会依赖推理时无法获得的信息而性能退化——提出双锚定蒸馏,通过矫正学生行为的锚点使策略更忠实于推理上下文,消除信息不对称带来的性能下降。
VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
VAD 针对多模态在线蒸馏中教师纠正信号混合视觉、语言先验等多种成分的问题,引入反事实目标重构来估计哪些纠正有视觉证据支撑,从而让蒸馏聚焦于可验证的视觉知识,提升学生视觉推理的鲁棒性。
SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
SKT 提出一种经过验证的合成数据管线,从大规模技能库中自动构建技能锚定任务和可执行轨迹,为模型提供识别、应用和协调多种技能的训练数据,解决有技能但不会用的问题,大幅提升智能体的技能使用能力。
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
WCM 针对 VLA 模型强化学习中评论家只能基于单帧观测、忽视部分可观测性的痛点,提出世界评论家模型,利用世界模型融入观测历史估计价值,避免指数复杂度,显著提升机器人操作策略的学习效果。
GPTQ-2D: Cubic-Time Two-Sided Adaptive Rounding
GPTQ-2D 将经典的自适应舍入扩展到两侧有非奇异基矩阵作用的一般情形,提出立方时间算法,使 GPTQ 类量化能处理更复杂的舍入问题,拓展了自适应舍入在模型压缩中的应用范围。
DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents
DeepVoyager-VL 针对多模态深度搜索在多轮检索中缺乏视觉引导的问题,激励模型在搜索循环中主动利用视觉信息,超越静态知识限制,在长程多模态智能体的开放世界信息获取中表现更优。
Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Experts
视觉语言 MoE 中图像和文本 token 数量变化大,标准辅助损失只在混合层面平衡,导致图像/文本各自负载不均衡。本文解耦两者的负载分布并固定,通过几何引导实现细粒度平衡,使不同输入分辨率下的负载不均衡变化缩小 5 倍以上。
Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV
该工作直接检验长周期智能体中「保留的 KV 缓存事件在原始观察消失后仍有信息量」这一前提,发现缺失早期观察时答案显著偏移,警示现有记忆剔除策略需重新审视事件与语境的关联性。
CMuon 发现 Muon 优化器在 DiT 训练后期收敛差源于 AdaLN 等结构融合功能不同的权重,破坏正交化约束,于是提出分块动量正交化,加速并稳定 DiT 训练,取得 SOTA 生成效果。
Progressive Agent Skill Generation via Reinforcement Learning
本文用强化学习的执行改善信号替代手工启发式,实现渐进式智能体技能生成,无需针对不同证据源单独设计,为异构来源的技能统一生成提供了学习驱动的新路径。
UEmbed: Unified Sparse and Dense Multimodal Embeddings
UEmbed 提出解码器式多模态统一嵌入模型,同时支持稀疏和稠密检索,摆脱以往稀疏检索对编码器架构和辅助跨模态模块的依赖,为搜索和 RAG 提供更简洁的统一检索方案。
Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
自动驾驶 VLA 的思维链训练中,提前暴露真实未来轨迹会导致教师模型产生轨迹锚定偏差,只做合理化解而非推理。本文推迟未来轨迹暴露时机,使模型从场景证据决策,提升推理可验证性。
SWE-Touch: Benchmarking Coding Agents When Users Touch the Code
SWE-Touch 引入「反编辑」机制,模拟真实共享工作区中用户中途修改代码的场景,测试编码智能体对代码变更的理解和响应,为协作式编程智能体评估提供了更现实的基准。
GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning
GradCuit 在 Transformer 指定层插入可优化隐状态,并通过信用分配的梯度流将隐更新与后续推理直接关联,避免了现有测试时隐推理方法中间接序列级分配带来的模糊性,实现更可解释且鲁棒的推理。
该研究揭示 LLM 在代码编辑中存在系统性的「删除回避」倾向,即使顶尖模型在 SWE-bench Verified 上的删除召回率最高仅 71.7%,并指出这种遗漏会使代码库更难以维护,为提升模型代码修改质量提供了量化依据和缓解方向。
3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering
3DZip 利用空间感知的特征多样性指导 token 压缩,在对 3D 场景的几何理解任务中,既大幅降低了计算和内存开销,又保留了空间推理所必需的结构信息。
Analytic Planning under Uncertainty with Moment Closure
本文提出用矩闭包进行分析式不确定性规划,放松了传统解析传播全状态分布对策略和奖励的限制,在避免采样高方差和点估计忽视不确定性的同时,拓展了深度 MBRL 中分析规划的可能性。
Aggregate-then-Calibrate for Human-centered Assessment with Theoretical Guarantees
AtC 两阶段框架先聚合人类判断和模型分数,再通过理论驱动的校准消除异质专家水平与标度不一致的影响,为缺乏真值基准的主观评估任务提供无偏且理论可保证的优化方案。