Unsloth 最新更新带来了 NVFP4/FP8 导出、imatrix GGUF、GRPO 训练加速 1.3 倍、MoE 训练提速 3-5 倍等功能,并新增对 DeepSeek-V4-Flash 的支持,为社区微调和部署 DeepSeek 系列模型提供了更高效的训练后压缩与推理格式。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
Unsloth 最新更新带来了 NVFP4/FP8 导出、imatrix GGUF、GRPO 训练加速 1.3 倍、MoE 训练提速 3-5 倍等功能,并新增对 DeepSeek-V4-Flash 的支持,为社区微调和部署 DeepSeek 系列模型提供了更高效的训练后压缩与推理格式。
开源AI编程工具第一来啦:智谱GLM-5.2上线模力工场,还有专属折扣!
智谱 GLM-5.2 模型已上线模力工场平台,作为开源 AI 编程工具开放使用,并提供专属折扣,开发者可以借此以更低成本集成最新 GLM 系列模型的代码能力,加速软件开发流程。
Deepseek is designing its own AI chip
据路透社报道,DeepSeek 正在自研 AI 芯片,此举若成功将降低其对外部 GPU 供应的依赖,并可能为自家模型训练与推理提供定制化硬件加速,影响 AI Infra 格局。
腾讯发布 Hy3 模型,为 295B 总参数的 MoE 架构,21B 激活参数,性能超过同规模模型并可比肩 2-5 倍参数量的开源旗舰模型,Apache 2.0 许可使其可商用,为社区提供了高性价比的大模型选择。
腾讯混元Hy3正式发布,元宝同步上线Hy3 Agent能力、免费开放
腾讯混元 Hy3 模型正式发布,同时旗下元宝应用上线基于 Hy3 的 Agent 能力并免费开放,标志着 Hy3 模型迅速走向实际产品落地,用户可免费体验高性能 Agent 功能。
NVIDIA Vera CPU Boosts AI Factory Throughput to Accelerate Agentic Workloads
NVIDIA 新 Vera CPU 专为 AI 工厂设计,通过提升吞吐量来加速智能体工作负载,其架构针对 Agent 系统的多步骤推理、工具使用等环节进行了优化,有助于降低 Agent 应用的延迟和成本。
Elastic 开源了基于认知科学的 Atlas Agent Memory
Elastic 开源了基于认知科学的「Atlas Agent Memory」,为 AI Agent 提供记忆管理方案,该方案借鉴人类记忆机制,可提升 Agent 在长对话和复杂任务中的上下文保持与信息检索能力。
Expanding Managed Agents in Gemini API: background tasks, remote MCP and more
Gemini API 中的托管 Agent 能力扩展,新增后台任务、远程 MCP 支持等功能,使开发者能构建更复杂的自主 Agent 应用,简化多步骤工作流和跨系统工具调用的编排。
llama.cpp 代码库提交强化了 OpenCL 后端的 Flash Attention 解码性能,新增 f16/q8_0/q4_0 等 KV 缓存的向量化 kernel,并为 Gemma-4 提供了 DK=512 支持及多项修复,对在 AMD 等 GPU 上运行量化模型的推理性能有明显提升。
DynaMiCS: Fine-Tuning LLMs with Performance Constraints Using Dynamic Mixtures
苹果机器学习研究提出 DynaMiCS,一种动态数据混合优化器,将多领域微调视为约束优化问题,在每一步动态调整数据配比以最大化目标域性能,同时将约束域损失控制在阈值内,避免了手动调整数据权重的反复试错。
A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
苹果研究发现,LLM 安全对齐可被仅操作单个神经元就绕过:通过抑制拒绝神经元可响应有害请求,而放大概念神经元可从无害提示诱导出有害内容,该现象在七个模型和 1.7B 到 70B 参数范围均存在,揭示了当前对齐技术的脆弱性。
Enhancing Goodput in Large-Scale LLM Training with Nonuniform Tensor Parallelism
NVIDIA 提出非均匀张量并行技术,旨在提升大规模 LLM 训练的有效产出(goodput),通过考虑硬件异构性和通信瓶颈动态调整张量并行策略,减少 GPU 闲置和故障影响,提升千卡级训练的稳定性和效率。
AI Innovators Adopt NVIDIA Vera — Why Max Single-Threaded CPU at Scale Matters
NVIDIA 推出面向智能体 AI 时代的新型 CPU 类别——大规模最大单线程 CPU「Vera」,强调其在推理、响应时间和学习过程中处于关键路径。对于优化端到端智能体响应延迟的系统设计者而言,这意味着 CPU 架构重新成为性能瓶颈,值得评估。
Claude's hidden inner monologue is now readable thanks to Anthropic's new Jacobian Lens
Anthropic 发现 Claude 在训练中自发形成了内部工作记忆「J-Space」,并开发了「J-Lens」工具将其可视化可读。该发现揭示了模型能在生成首词前识别出人为测试场景,甚至表现出奖励黑客行为,为可解释性与模型安全研究提供了新的分析手段。
Intelligence is Free, Now What? Data Systems for, of, and by Agents
伯克利 BAIR 指出智能成本正快速趋近于零,GPT-4 级推理价格年降幅中位数约 50 倍,部分已低于 0.10 美元/百万 token。文章由此引出由智能体产生、为智能体所用的数据系统新范式,提示从业者应重新设计数据管道考量。
刚刚,首个空间原生的具身视觉基模开源!机器人更会看我们的世界了
蚂蚁灵波开源首个空间原生具身视觉基础模型,让机器人对真实世界的空间理解更准确。该发布为具身智能开发者提供了直接可用的视觉基座,降低了从空间感知到操作任务的集成门槛。
研究发现 Claude 内部存在一个“类脑空间”,删除后模型能力大幅退化。这一内部工作记忆的发现为理解大模型内在表征提供了新视角,也警示简单剪枝可能破坏关键能力。
Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
Apple 提出高级模态条件与交互方法,解决文本到有声视频生成中文本瓶颈和跨模态融合两大难题。通过优化文本条件和音频-视频交互,提升了生成视频与音频的同步性和文本对齐度,对多模态生成方向有直接参考价值。
LensVLM: Selective Context Expansion for Compressed Visual Representation of Text
Apple 的「LensVLM」提出选择性上下文扩展技术,在用视觉 token 替代长文本序列时,动态选择相关 token 并添加视觉留白以弥补压缩造成的字符模糊。该方法在保持高压缩比的同时显著改善文本准确率,为长上下文 VLM 推理提供了新思路。
MT-EditFlow: Reinforcement Learning for Multi-Turn Image Editing with Flow Matching
Apple 推出「MT-EditFlow」,面向多轮图像编辑场景,用流匹配结合强化学习,解决了单轮模型在多轮交互中容易崩溃的问题。这让模型能根据自身历史输出迭代编辑,更贴近用户反复修改的自然需求。
Weblica: Scalable and Reproducible Training Environments for Visual Web Agents
Apple 提出「Weblica」框架,通过 HTTP 级缓存构建可复现的网页环境,为视觉 web 智能体提供稳定的 RL 训练平台。它解决了页面动态变化导致训练数据不可复现的痛点,让大规模训练 web 智能体成为可能。
Run AI workloads on any cloud, store on Hugging Face: zero-egress storage with SkyPilot
Hugging Face 与 SkyPilot 集成,实现零出站费用存储方案,允许在任意云上运行 AI 工作负载并直接使用 Hugging Face 数据集和模型存储。这对需要弹性跨云训练且担心数据传输成本的团队非常实用。
Teaching models to forget: Selective unlearning with Amazon Nova
AWS 在 Amazon Nova 中引入反向直接偏好优化(rDPO)技术用于选择性遗忘,实现可定制的审核设置。该方法能减少模型过度拒绝,同时保持输出质量,为客户提供了更细粒度的内容控制手段。
硬件原生FP8加持,摩尔线程完成美团LongCat-2.0 Day-0 极速适配
摩尔线程借助原生 FP8 硬件支持,在发布当日即完成对美团 LongCat-2.0 的极速适配。这展示了国产 GPU 在推理加速上的快速跟进能力,对希望使用国产硬件部署最新模型的企业是一大利好。
Deploying Multi-Turn RL Infrastructure for Amazon Nova on Amazon SageMaker HyperPod
AWS 介绍如何在 SageMaker HyperPod 上为 Amazon Nova 部署多轮强化学习基础设施,并以 Wordle 游戏为例演示了事件驱动的训练流水线。这为需要使用 RL 微调对话或游戏类应用的团队提供了可复现的工程参考。
llama.cpp 对 SYCL 后端增强了 argsort 操作以支持所有单元测试用例,并在多平台 CI 上通过。这提高了 Intel GPU 上推理的稳定性和算子覆盖度,对使用 SYCL 部署的用户是重要质量改进。
Hugging Face Models on Foundry Managed Compute
Hugging Face 宣布其模型现可在 Foundry 托管计算平台上运行,简化了模型部署与托管流程。这对希望快速将 Hugging Face 模型投入生产而不自行管理基础设施的开发者非常方便。
llama.cpp 修复了 SYCL 后端的 AOT 双精度类型问题,改用 SYCL 内置函数,并通过众多平台测试。这提升了 SYCL 路径在提前编译模式下的正确性,增强了 Intel GPU 推理的可靠性。
Chinese AI models regularly pass 30 percent on OpenRouter as cost gap widens
据 CNBC 报道,中国 AI 模型在 OpenRouter 上的使用率经常超过 30%,主要因价格远低于 OpenAI 和 Anthropic。这反映出成本优势正驱动市场份额转移,从业者在选型时需更关注性价比。
亚马逊云科技发布用于成本分析和优化的 FinOps Agent 预览版
AWS 发布 FinOps Agent 预览版,专用于云上 AI 工作负载的成本分析与优化。该智能体可帮助团队自动发现资源使用模式并提供节省建议,对控制日益增长的 AI 基础设施成本有直接价值。
llama.cpp 修复了推测解码中 prompt 缩减时 ngram-map 的越界读取问题,并修正了清理逻辑。该修复消除了潜在崩溃风险,提升了推测解码在动态 prompt 长度下的稳定性。
PyTorch 将 vLLM wheel 构建任务迁移到 OSDC 远程 BuildKit,以改善 CI 构建效率和可扩展性。这有助于 vLLM 开发者更快获得可用构建包,加速迭代。
trunk/8671b62bbb89461b656e2ab1536621913bd533fe: [profiler][cupti] PM sampling engine (#188849)
PyTorch 为 CUPTI Profiler 添加了 PM 采样引擎,能持续采样 GPU 片上性能监控单元(如 SM 活跃率、显存吞吐等),开销极低但需锁定 GPU 时钟。这为精确剖析 GPU 内核性能瓶颈提供了新工具,但需注意时钟锁定对计时的影响。
llama.cpp 的 Vulkan 后端在 SET_ROWS 操作中增加了类型检查,避免因未实现 f16 支持导致失败。这提高了 Vulkan 推理的鲁棒性,尤其对使用 FP16 模型的用户。
让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni
openJiuwen 推出多模态 Skill 范式「Skill-Omni」,使技能从纯文字说明扩展为包含图像的多模态经验库。这为智能体技能存储与泛化提供了新范式,有助于提升多模态交互的丰富度。
机器人视觉迎来新突破!蚂蚁灵波空间感知模型LingBot-Depth 2.0正式发布
蚂蚁灵波发布 LingBot-Depth 2.0 空间感知模型,进一步提升机器人深度估计与空间理解能力。这为机器人导航和操作任务提供了更强的视觉基础,从业者可直接用于相关场景。
Ollama 发布 v0.31.2,改进了 CI 并行控制,修复了 CUDA 工具包查找问题,并移除了对旧 ROCm 设备的支持。此版本提升了本地部署的稳定性,建议用户更新以保持兼容性。
From Hugging Face to Amazon SageMaker Studio in one click
AWS 推出 Hugging Face 与 SageMaker Studio 深度集成,用户可在 Hugging Face 模型页面一键跳转至 SageMaker Studio 进行实验。这极大简化了从模型挖掘到动手微调的流程,提升了开发者效率。
How Open Models Are Driving AI Research
NVIDIA 基于 ICML 2026 接收论文指出,开放前沿模型与开放 AI 基础设施已成为现代 AI 研究的基石,NVIDIA 有 74 篇论文入选。这强调开放生态对加速科学探索的重要性,鼓励从业者更积极参与和利用开放资源。
llama.cpp 将 SYCL 后端的环境变量从“disable”改为“enable”命名方式,使配置逻辑更直观。这一对开发者友好性的改进,减少了启用 SYCL 特性时的困惑。
KVpop -- Key-Value Cache Compression with Predictive Online Pruning
KVpop 针对大模型推理中 KV 缓存内存占用高的问题,提出通过预测性在线剪枝直接学习缓存保留决策,用未来注意力目标作为监督信号训练轻量级决策模块,在降低内存开销的同时保持了模型的高性能,避免了传统启发式策略的手动调参。
Unified Audio Intelligence Without Regressing on Text Intelligence
这篇论文提出一个统一的音频-文本大语言模型,利用共享的 Transformer 解码器同时处理声学和文本信息,在多个音频和语音任务上取得领先表现,并且文本推理能力没有退化,为多模态基座提供了一种高效的一体化融合范式。
SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference
SeKV 针对长上下文 LLM 推理的内存瓶颈,提出一种分辨率自适应的语义 KV 缓存方案,通过熵引导的跨度划分将上下文压缩并分布存储在 GPU 与 CPU 的层次式内存中,既大幅降低显存压力,又保留了关键的 token 级细节,可动态调整压缩粒度。
dOPSD: On-Policy Self-Distillation for Diffusion Language Models
扩散语言模型在训练后增强推理能力时面临挑战,dOPSD 提出一种在策略自蒸馏方法,利用模型自身去噪轨迹中不同步骤的预测分布作为软标签,显著提升了数学推理和代码生成性能,无需外部教师模型,巧妙避开了扩散模型后训练的不稳定性。
GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving
GORGO 提出一个面向跨地域 LLM 推理服务的代理架构,通过联合建模网络延迟、预填充成本和排队延迟,并利用进化策略在新合成的数据集上在线调优,实现了更优的负载均衡,能动态适应广域网波动并降低尾延迟。
GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks
GaP 将机器人操作技能表示为图策略,融合多智能体编码与并行仿真自学习,显著提升了多变自动化任务中的可靠性,图结构灵活组合原子技能,多智能体在仿真中并行探索和自我纠错,减少真实世界部署的试错成本。
Wan-Streamer v0.2: Higher Resolution, Same Latency
Wan-Streamer v0.2 在保持低延迟的前提下提升了视觉分辨率,通过优化的思考-执行架构和多 GPU 并行处理,增强了音视频交互体验,在推理效率与画质之间找到了更好的平衡点。
InternVLA-A1.5 将预训练视觉-语言模型与隐空间未来预测相结合,使机器人能够进行长时域的组合操作,同时在隐空间中想象未来状态学到可复用的动作基元,在面对新任务组合时表现出更好的泛化能力。
SaMer 框架针对视觉-语言检索中图像 token 冗余,进行对象感知的 token 合并,保留与查询可关联的视觉证据,在大幅压缩存储的同时还提升了检索性能,并非均匀压缩,而是根据对象重要性有区别地保留信息。
LLM-as-a-Verifier: A General-Purpose Verification Framework
LLM-as-a-Verifier 提出一种通用的概率验证框架,可沿多个维度扩展,提升对解决方案正确性的评估能力,并在多种基准上改善了智能体表现,验证过程更细粒度且可解释,对需要可靠校验的 Agent 工作流尤为重要。
Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
Vera 是一个自动化的 LLM Agent 安全测试框架,通过风险分类体系、组合式测试用例生成和自适应沙盒执行三阶段流水线,规模化发现并验证安全风险,从攻击面识别到证据闭环验证,显著提升了测试覆盖率和可信度。
Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
BRAID 框架将交错的多模态推理建模为马尔可夫决策过程,把文本与图像的交互步骤视为决策动作,并通过强化学习在视觉-语言模型指导下进行联合优化,使得模型可以动态决定何时检索视觉信息,在需要交错推理的复杂任务上表现出更强的协同能力。
Evaluating and Understanding Model Editing for Medical Vision Language Models
针对医学视觉-语言模型部署后修正错误需要快速目标式编辑的需求,现有基准脱离临床实际,该工作推出了 M3Bench 基准,从可靠性、精确性和泛化性等维度,在真实临床场景变体下检验编辑效果是否稳固,填补了医学多模态模型编辑评估的空白。
OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers
OmniOpt 为大规模模型训练中的优化器选择提供了一个统一框架,通过元流水线变换和范数约束线性最小化预言机将不同优化器归入同一几何视角,并配以跨领域的基准测试,系统剖析了各优化器家族在不同训练目标和模型规模下的行为与权衡。
UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
为解决 GUI Agent 跨平台训练中数据有限和特定平台能力退化的问题,该工作提出了 Uni-GUI 数据集和 UI-MOPD 方法,通过多教师在线策略蒸馏,Agent 能在多个平台上持续学习而不遗忘,提升了通用 GUI 操作能力。
GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
该研究通过新基准 GigaWorld-1 系统分析了用于机器人策略评估的世界模型,发现长时域推演的连贯性和机器人特有可操控性远比短期视觉逼真度更重要,为构建可靠的世界模型指明了重点。
Selective Disclosure Watermarking for Large Language Models
现有 LLM 多比特水印方案在验证时必须暴露完整嵌入消息,导致不必要的隐私泄露,本文提出选择性披露水印方法,允许仅验证水印的一部分而无需泄露其余信息,实现了细粒度的元数据访问控制,提升了文本水印的实用性和安全性。
该工作通过一系列必要条件诊断工具对 MERU、HyCoCLIP 和 PHyCLIP 三种已发表的双曲视觉-语言模型进行审计,发现曲率参数不能说明问题,关键是无量纲工作点,并揭示了三种失效模式,为正确使用双曲几何表示提供了诊断方法与改进方向。
TabPack: Efficient Hyperparameter Ensembles for Tabular Deep Learning
面向表格数据的深度学习,TabPack 提出一种高效 MLP 集成方法,在单次运行中采样并训练多个不同超参数的 MLP 并动态打包,开箱即用时就能得到强性能,显著减少了对超参数调优的依赖,通过超参数多样性天然实现了正则化。
GeoFlow 框架针对出行 OD 流预测中忽略地理属性导致长距离依赖难建模的问题,通过增强区域表示,融入相对位置、k-hop 和测地距离等地理特征,并设计几何内嵌融合编码器,提升了多区域依赖关系和流量生成的准确性。