本文对比了 Unsloth、Axolotl、TRL 和 LLaMA-Factory 四大开源微调框架:Unsloth 重写 CUDA 核以极致提速,Axolotl 擅长组合并行策略,TRL 是底层训练器 API 的标准定义者,LLaMA-Factory 则在模型覆盖面与易用性上着力。从业者可据此根据自身任务在速度、显存和多 GPU 扩展性之间做出选择。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
跨年累积的 AI 精选:顶会顶刊高被引论文(全领域,按**具体会刊**分组)+ 各厂商实验室论文与官方动态;多源召回 + 大模型相关性精筛,每周自动维护;支持自助检索 arXiv 添加并自动归类。
本文对比了 Unsloth、Axolotl、TRL 和 LLaMA-Factory 四大开源微调框架:Unsloth 重写 CUDA 核以极致提速,Axolotl 擅长组合并行策略,TRL 是底层训练器 API 的标准定义者,LLaMA-Factory 则在模型覆盖面与易用性上着力。从业者可据此根据自身任务在速度、显存和多 GPU 扩展性之间做出选择。
FlashAttention 发布 fa4-v4.0.0.beta23,主要为 paged-KV 的 block_table 增加边界检查,并修复了 SM100 上 FP8 e4m3 精度饱和问题,提升数值稳定性。
Samsung deepens its AI empire with a potential billion-euro stake in Europe's hottest AI startup
三星正与法国 AI 初创 Mistral 就高达 10 亿欧元的战略投资进行谈判,若达成将使 Mistral 估值升至约 200 亿欧元,进一步深化三星的 AI 帝国布局。
支付宝 xUI -- “阿宝”背后的 Agentic 终端交互引擎|AICon深圳
支付宝在 AICon 深圳公布其 Agentic 终端交互引擎 xUI,该引擎驱动了「阿宝」等智能体应用,为终端侧智能体提供原生交互层。
OpenAI 推出 Presence,一个面向企业的 AI 智能体平台,支持部署经过验证的语音和聊天智能体,用于客户服务和内部工作流自动化。
Ollama v0.32.2 发布,保持 Claude Code 通道可用,清理了智能体提示包装,新增技能系统,并允许云模型默认无限工具轮次,增强了智能体开发体验。
Poolside 发布开权重 Agentic 编码模型 Laguna S 2.1,118B 总参数、8B 活跃参数的 MoE 架构,支持 1M 长上下文,在 SWE-Bench 多语言基准上以较小规模匹敌甚至超越数倍大的模型,且可在单张 NVIDIA DGX Spark 上运行。
A Preview of Production-Scale Kimi K3 Support on vLLM
vLLM 博客预览了 Kimi K3 的生产级推理支持,包括 KDA 感知前缀缓存、融合算子、优化的 MXFP4 MoE、多模态集成,并提供了初版 NVIDIA 和 AMD 推理路径。
Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,Flash 层级显著降价并提升 token 效率:3.6 Flash 输出 token 减少 17%,输出价格降至每百万 token 7.5 美元;Flash-Lite 达到 350 tokens/秒;门控版 Flash Cyber 用于代码漏洞发现。旗舰 3.5 Pro 仍然延迟。
本教程展示如何用 NVIDIA srt-slurm 框架将声明式 YAML 配置转化为可复现的 SLURM 基准测试工作流,涵盖集群配置、内置与自定义配方以及解耦预填充和解码的分布式 LLM 服务部署,便于工程师系统地验证推理性能并做帕累托分析。
Exploring self-distilled reasoning for supervised fine-tuning with Amazon Nova
AWS 团队探索了一种自蒸馏推理方法 SDR,为缺乏推理痕迹的数据集自动生成思考令牌用于 SFT 定制,缓解了推理抑制问题,并在三个基准上验证了效果,为用 Amazon Nova 定制模型提供了实践建议。
llama.cpp 更新 b10083,为 CUDA topk-moe 添加了 sqrt_softplus 算子支持,针对 dsv4 等架构做优化。
百度文心助手任务Agent登顶国际权威榜单,超越Claude、GPT拿下全球智能体冠军
百度文心助手的任务智能体在国际权威榜单上取得全球智能体冠军,超越了 Claude、GPT 等模型,展示了百度在智能体规划与执行上的实力。
PyTorch Inductor 新增编译时 per-subkernel 自动调优功能,用于组合内核,可进一步提升生成代码的执行效率。
WAIC 上展出了业内首款融合超算与智算能力的大规模计算底座,基于一款设计独特的芯片,为智算和超算统一架构提供了新思路。
Gemini 3.6 Flash ✨, OpenAI security escape 🚨, Devin Outposts 🛰️
本期 TLDR AI 关注 Google Gemini 3.6 Flash 发布、OpenAI 出现安全突破事件(安全逃生)以及 Devin 推出 Outposts 功能等多个热点。
TRL v1.9.0 重点支持 GRPO 和 RLOO 中的可迭代/流式数据集,通过新的 repeat_iterable_dataset 生成器精确复现 RepeatSampler 的排序,解决了过去采样器无法作用于可迭代数据集导致优势计算错误的长期问题。
Building AI infrastructure with the Effingham County community
OpenAI 公布位于佐治亚州艾芬汉姆县的「Project Camellia」AI 基础设施项目,承诺负责任用能、社区投资、创造就业,并向当地社区提供 Codex 访问。
InfoQ 中文报道了智算集群基础设施运维通用技术要求,该标准为智算集群的运维操作提供了规范指导。
Advancing the next era of national science
OpenAI 宣布将与美国能源部及其国家实验室合作,利用前沿 AI 模型加速科学发现,推动国家科学进入新时代。
llama.cpp b10087 新增对 Poolside 的 Laguna XS.2 和 M.1 模型的支持。
llama.cpp 修复了 Qwen3-VL 视觉位置嵌入的插值对齐问题,将双线性采样改为与 transformers 参考实现一致的 align_corners=True,消除了因图像尺寸增大和非方形图像导致的接地坐标缩放偏差。
llama.cpp 的高通 Hexagon 后端在重用描述符时加入张量类型检查,避免类型错配带来的运行时错误,提升了移动端平台的推理稳定性。
Cisco Foundation AI 发布开源权重模型 Antares,包含 350M 和 1B 两个尺寸,专门用于在真实代码库中定位已知漏洞。1B 模型在漏洞定位基准上 File F1 达到 0.209,超过 753B 参数的 GLM-5.2 和 Gemini 3 Pro,其能力几乎全部来自后训练;在单张 H100 上跑完 500 个任务仅需约 13 分钟,成本不足一美元。
llama.cpp 修复了使用 -hf 加载推测解码仓库时草案模型未能正确解析到其配套侧车(sidecar)的问题,现在草案模型可以正常消费已发现的侧车,使 speculative 推理在 Hugging Face 仓库下的工作流更可靠。
The Anthropic-Physical Intelligence rumor roiling AI Twitter
关于 Anthropic 可能收购 Physical Intelligence 的传言在 AI 社区引发热议,该讨论的背景是 Anthropic 与 OpenAI 在 2026 年开展的激进收购竞赛。
llama.cpp 服务器端修复了当 llama_context 为空时未正确处理而可能发生崩溃的问题,增强了服务的健壮性。
OpenAI says Hugging Face was breached by its pre-release models
OpenAI 承认 Hugging Face 数据泄露事件由其内部测试失误导致,泄露内容涉及预发布模型,凸显了模型分发与安全控制的脆弱性。
Google releases three new Gemini models — but no 3.5 Pro
谷歌发布三款新 Gemini 模型——3.6 Flash、3.5 Flash-Lite 和 Flash Cyber,但旗舰级 Gemini 3.5 Pro 依然缺位,令人对其前沿 AI 战略产生新疑问。
Claude Cowork learns new skills through screen recordings and voice-over explanations
Anthropic 的 Claude Cowork 桌面应用新增技能学习能力,用户可录制屏幕操作并配语音解说,Claude 将整个过程转化为可复用的技能,让智能体通过演示快速习得新任务。
Google ships three new Gemini Flash models but its frontier 3.5 Pro remains lost in training
谷歌推出三款新 Gemini Flash 模型,其中 3.6 Flash 的 Token 消耗降低最多 65%,另有一款仅面向政府和特定合作伙伴的网络安全模型;但备受期待的旗舰模型 Gemini 3.5 Pro 仍未出现,而此时 OpenAI、Anthropic 和中国实验室已在前沿模型展开激烈竞争。
AI Teammates: how monday.com runs production AI agents on Amazon Bedrock
monday.com 基于 Amazon Bedrock 大规模运行 AI 代理「AI Teammates」,内部数据显示九成构建者每月使用 AI 编码工具,人均 PR 吞吐量提升超过一半,文章分享了其在一套十年代码库上的架构改造和置信度评分机制。
Jiuwen Symbiosis深度解析:从数字世界走向物理世界,为Physical AI打造Symbiosis (共生)
九问共生平台深入解析如何为 Physical AI 构建从数字世界走向物理世界的共生系统,旨在实现智能体在真实环境的协同作业。
Glow emerges from stealth at $1.2B valuation to challenge endpoint security in the AI era
端点安全公司 Glow 以 12 亿美元估值结束隐身,瞄准企业内快速采用 AI 代理和开发者工具所引发的新端点风险类别,试图重新定义 AI 时代的安全防护。
llama.cpp 的 KleidiAI 后端现在对缺少专用内核的权重类型仅发出一次警告,避免重复日志刷屏,优化开发者的排查体验。
trunk/8506836eb3f1031935ed98113172829edea16798
PyTorch Inductor 修复了一个在标量被除数上进行 floor 除法降级时会触发崩溃的问题,提升了编译器稳定性。
llama.cpp 服务器修复了当请求头包含 X-Conversation-Id 但参数验证失败时错误返回 500 状态码的缺陷,现在正确返回 400,并避免因空回调导致的崩溃,改善了 HTTP API 的错误处理一致性与健壮性。
酷哇科技亮相WAIC 2026,解密行业首个双层智能体世界模型
酷哇科技在 WAIC 2026 展出业界首个双层智能体世界模型,该模型将物理世界模型与人类社会世界模型统一起来,直面机器人理解双重环境的核心挑战。
v0.32.2-rc3: test: revamp integration test entrpoints (#16560)
Ollama v0.32.2-rc3 重构了集成测试入口,将测试分为 fast、release 和 library 三个主要组别,并更新了测试模型清单以淘汰老旧模型、纳入新模型,在保持广泛覆盖的同时提升测试效率。
Jack Dorsey is taking on Slack with Buzz, a group chat platform for teams and their AI agents
Jack Dorsey 推出面向职场的群聊平台 Buzz,让人类与 AI 代理可以在同一对话中协作,直接对标 Slack,开启人机协同办公的新形式。
ISO: An RLVR-Native Optimization Stack
在基于可验证奖励的强化学习(RLVR)中,优化器如何将奖励信号转化为权重更新一直缺乏清晰认识。本工作从模型权重的奇异结构出发,发现「光谱继承」现象——RLVR 可以在复用基座模型权重谱的同时,通过改变关联子空间获取新能力。基于此洞察构建了一个名为 ISO 的 RLVR 原生优化栈,使优化过程更透明、更贴合 RLVR 的特性。
📖 阅读⬇ PDFH^2SD: Hybrid Hindsight Self-Distillation
现有 RLVR 大多为整个轨迹分配标量结果奖励,导致监督稀疏、token 级信用分配困难;在线蒸馏虽然能提供更稠密的监督,却依赖额外更强的教师模型。本文提出「混合后见自我蒸馏」方法 H²SD,无需外部教师即可利用轨迹后见信息为每个 token 生成高质量软标签,从而实现稠密、精准的 token 级信用分配,在数学推理和代码生成任务上取得一致增益。
📖 阅读⬇ PDFMoE 训练中优化器状态通常是显存最大开销项,例如对 6.78B 参数模型,AdamW 需 50.6GB 存储一阶和二阶动量。本文观察到 MoE 的稠密骨干、专家和路由三类参数在数量和梯度统计上差异显著,因此提出 SkewAdam,对三类参数采用分层状态分配,部分层保持完整浮点状态、部分采用有损压缩,大幅削减显存占用同时几乎不牺牲模型质量。
📖 阅读⬇ PDFDataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
用 LLM 代理生成的数据处理脚本难以自动转换为可持久、可编辑的平台制品,形成「NL2Pipeline 鸿沟」。「DataFlow-Harness」平台通过类型化增量变异,引导 LLM 代理构建平台原生的有向无环图,而非自由形式脚本,结合 DataFlow 和 Harness 组件,让流水线可持久化、可编辑,真正打通从自然语言到生产级数据管道的闭环。
📖 阅读⬇ PDFMage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
大规模视觉生成模型训练和部署成本偏高。Mage-Flow 打造了一个紧凑的 4B 规模生成栈,包含轻量高保真潜空间 tokenizer「Mage-VAE」和原生分辨率多模态扩散 Transformer,训练采用流匹配校正。这套协同设计使模型在保证生成与编辑质量的同时,大幅降低训练和推理开销,适合高效微调和部署。
📖 阅读⬇ PDFLLM 智能体调试的难点在于故障表面步骤往往不是根因所在,现有工具仅回放轨迹而缺乏根因定位与修复闭环。AgentDebugX 将调试组织为「Detect-Attribute-Recover-Rerun」闭环,核心模块 DeepDebug 借助全局轨迹分析进行多轮根因诊断,从而实现从故障观察到归因再自动尝试修复的完整流程。
📖 阅读⬇ PDFSubliminal Clocks: Latent Time Modelling in Diffusion Language Models
扩散语言模型在某些实现中未显式依赖时间步,那么它们内部是否仍隐含编码去噪进度?本研究证实 DLM 的残差流中确实存在一种「潜意识时钟」,编码了扩散时间步信息,并且该信号可被提取和操纵,从而影响生成文本的质量与属性,为可控生成提供了新接口。
📖 阅读⬇ PDFHPD-Parsing: Hierarchical Parallel Document Parsing
统一 VLM 文档解析器通常逐 token 自回归生成整页输出,随着文档加长形成严重顺序瓶颈。HPD-Parsing 提出层次化并行解析策略:全局分析布局后,对各元素并行生成,兼顾了全局协调与并行执行效率,在不损害解析质量的前提下显著降低长文档的延迟。
📖 阅读⬇ PDF长文本事实性评估长期偏重精确度,忽略完备性——即模型回答是否包含了所有应有信息。本文提出两层元评分量规,系统化地枚举完整答案应包含的事实集合,并据此构建基准 GAMUT,专门衡量事实完备度,为事实性评估补上了缺失的另一半。
📖 阅读⬇ PDFConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning
多模态大模型在视频空间推理中常因缺乏几何一致性而难以从冗余观测中稳定聚合空间证据。ConsiSpace 引入几何一致性学习,迫使模型跨视角保持空间关系的不变性,从而在导航感知和长视频问答等任务上获得更高效、更稳定的推理表现。
📖 阅读⬇ PDFComputational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges
这篇综述聚焦多模态幽默理解,梳理了在模因、漫画等单一及多面板视觉艺术品中理解幽默的方法、数据集和评估协议,同时将幽默生成视为新兴前沿。文章对比了传统幽默分析、讽刺检测和通用多模态评测,揭示了非字面推理和文化知识仍是核心挑战。
📖 阅读⬇ PDF