🗂 历史归档
每日 AI 速览

2026-07-22

生成于 2026-07-23 04:08
⚠️ 本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性

今日导语

今日主线聚焦模型发布、智能体应用与训练优化。Google 一口气推出 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber,专为 Agent 工作负载打造更低成本、更高吞吐方案;OpenAI 亦发布 Presence 新服务。Infra 方面,vLLM 预览对 Kimi K3 的生产级支持,FlashAttention v4.0 测试版与微调框架性能对比亦值得关注。智能体领域,百度文心助手任务 Agent 登顶国际榜单,AgentDebugX 提供智能体故障诊断开源工具,Claude Cowork 引入屏幕录制学习新技能。训练方法上,ISO 提出 RLVR 原生优化栈,为强化学习与对齐提供新范式。

🗞 行业动态 40 条

Unsloth vs Axolotl vs TRL vs LLaMA-Factory: A Fine-Tuning Framework Comparison on Speed, VRAM, and Multi-GPU

MarkTechPost · 07-22 17:16 UTC+8

本文对比了 Unsloth、Axolotl、TRL 和 LLaMA-Factory 四大开源微调框架:Unsloth 重写 CUDA 核以极致提速,Axolotl 擅长组合并行策略,TRL 是底层训练器 API 的标准定义者,LLaMA-Factory 则在模型覆盖面与易用性上着力。从业者可据此根据自身任务在速度、显存和多 GPU 扩展性之间做出选择。

后训练微调框架对比评测UnslothLLaMA-Factory

fa4-v4.0.0.beta23

FlashAttention · 07-22 16:58 UTC+8

FlashAttention 发布 fa4-v4.0.0.beta23,主要为 paged-KV 的 block_table 增加边界检查,并修复了 SM100 上 FP8 e4m3 精度饱和问题,提升数值稳定性。

FlashAttention推理优化CUDA精度修复

Introducing OpenAI Presence

OpenAI · 07-22 13:30 UTC+8

OpenAI 推出 Presence,一个面向企业的 AI 智能体平台,支持部署经过验证的语音和聊天智能体,用于客户服务和内部工作流自动化。

AgentOpenAI智能体平台企业AI语音代理

v0.32.2

Ollama · 07-22 12:28 UTC+8

Ollama v0.32.2 发布,保持 Claude Code 通道可用,清理了智能体提示包装,新增技能系统,并允许云模型默认无限工具轮次,增强了智能体开发体验。

AgentOllama智能体技能系统更新

A Preview of Production-Scale Kimi K3 Support on vLLM

vLLM 博客 · 07-22 08:00 UTC+8

vLLM 博客预览了 Kimi K3 的生产级推理支持,包括 KDA 感知前缀缓存、融合算子、优化的 MXFP4 MoE、多模态集成,并提供了初版 NVIDIA 和 AMD 推理路径。

推理优化vLLM推理框架Kimi K3MOE优化

Google Releases Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber: A Cheaper, More Token-Efficient Flash Tier Built for Agentic Workloads

MarkTechPost · 07-22 01:45 UTC+8

Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,Flash 层级显著降价并提升 token 效率:3.6 Flash 输出 token 减少 17%,输出价格降至每百万 token 7.5 美元;Flash-Lite 达到 350 tokens/秒;门控版 Flash Cyber 用于代码漏洞发现。旗舰 3.5 Pro 仍然延迟。

厂商动态GoogleGemini Flash模型发布Agentic

Validating Distributed LLM Serving Benchmarks with NVIDIA srt-slurm, SLURM Recipes, Parameter Sweeps, and Pareto Analysis

MarkTechPost · 07-22 00:29 UTC+8

本教程展示如何用 NVIDIA srt-slurm 框架将声明式 YAML 配置转化为可复现的 SLURM 基准测试工作流,涵盖集群配置、内置与自定义配方以及解耦预填充和解码的分布式 LLM 服务部署,便于工程师系统地验证推理性能并做帕累托分析。

推理优化NVIDIA分布式推理基准测试SLURM

Exploring self-distilled reasoning for supervised fine-tuning with Amazon Nova

AWS 机器学习 · 07-22 00:23 UTC+8

AWS 团队探索了一种自蒸馏推理方法 SDR,为缺乏推理痕迹的数据集自动生成思考令牌用于 SFT 定制,缓解了推理抑制问题,并在三个基准上验证了效果,为用 Amazon Nova 定制模型提供了实践建议。

训练自蒸馏推理SFTAmazon Nova思考令牌

b10083

llama.cpp · 07-22 16:35 UTC+8

llama.cpp 更新 b10083,为 CUDA topk-moe 添加了 sqrt_softplus 算子支持,针对 dsv4 等架构做优化。

推理优化llama.cppCUDAMoE优化

viable/strict/1784724490

PyTorch · 07-22 15:31 UTC+8

PyTorch Inductor 新增编译时 per-subkernel 自动调优功能,用于组合内核,可进一步提升生成代码的执行效率。

InfraPyTorchInductor编译器优化内核调优

v1.9.0

HF TRL · 07-22 04:36 UTC+8

TRL v1.9.0 重点支持 GRPO 和 RLOO 中的可迭代/流式数据集,通过新的 repeat_iterable_dataset 生成器精确复现 RepeatSampler 的排序,解决了过去采样器无法作用于可迭代数据集导致优势计算错误的长期问题。

后训练TRLGRPORLOO数据集

Building AI infrastructure with the Effingham County community

OpenAI · 07-22 21:00 UTC+8

OpenAI 公布位于佐治亚州艾芬汉姆县的「Project Camellia」AI 基础设施项目,承诺负责任用能、社区投资、创造就业,并向当地社区提供 Codex 访问。

厂商动态OpenAIAI基础设施数据中心社区投资

智算集群基础设施运维通用技术要求

InfoQ 中文 · 07-22 20:54 UTC+8

InfoQ 中文报道了智算集群基础设施运维通用技术要求,该标准为智算集群的运维操作提供了规范指导。

Infra智算集群运维标准基础设施

Advancing the next era of national science

OpenAI · 07-22 20:00 UTC+8

OpenAI 宣布将与美国能源部及其国家实验室合作,利用前沿 AI 模型加速科学发现,推动国家科学进入新时代。

厂商动态OpenAI美国能源部科学计算AI for Science

b10087

llama.cpp · 07-22 19:05 UTC+8

llama.cpp b10087 新增对 Poolside 的 Laguna XS.2 和 M.1 模型的支持。

推理优化llama.cpp模型支持Laguna

b10085

llama.cpp · 07-22 17:54 UTC+8

llama.cpp 修复了 Qwen3-VL 视觉位置嵌入的插值对齐问题,将双线性采样改为与 transformers 参考实现一致的 align_corners=True,消除了因图像尺寸增大和非方形图像导致的接地坐标缩放偏差。

推理优化Qwen3-VL位置嵌入llama.cpp坐标对齐

b10084

llama.cpp · 07-22 17:14 UTC+8

llama.cpp 的高通 Hexagon 后端在重用描述符时加入张量类型检查,避免类型错配带来的运行时错误,提升了移动端平台的推理稳定性。

推理优化llama.cppHexagon移动端推理

Cisco Foundation AI Releases Antares: 350M and 1B Open-Weight Models That Localize Known Vulnerabilities Inside Real Codebases

MarkTechPost · 07-22 14:27 UTC+8

Cisco Foundation AI 发布开源权重模型 Antares,包含 350M 和 1B 两个尺寸,专门用于在真实代码库中定位已知漏洞。1B 模型在漏洞定位基准上 File F1 达到 0.209,超过 753B 参数的 GLM-5.2 和 Gemini 3 Pro,其能力几乎全部来自后训练;在单张 H100 上跑完 500 个任务仅需约 13 分钟,成本不足一美元。

基座Antares漏洞定位小模型后训练

b10081

llama.cpp · 07-22 13:44 UTC+8

llama.cpp 修复了使用 -hf 加载推测解码仓库时草案模型未能正确解析到其配套侧车(sidecar)的问题,现在草案模型可以正常消费已发现的侧车,使 speculative 推理在 Hugging Face 仓库下的工作流更可靠。

推理优化llama.cpp推测解码模型加载

The Anthropic-Physical Intelligence rumor roiling AI Twitter

TechCrunch · AI · 07-22 11:20 UTC+8

关于 Anthropic 可能收购 Physical Intelligence 的传言在 AI 社区引发热议,该讨论的背景是 Anthropic 与 OpenAI 在 2026 年开展的激进收购竞赛。

厂商动态AnthropicPhysical Intelligence收购传闻

b10079

llama.cpp · 07-22 10:05 UTC+8

llama.cpp 服务器端修复了当 llama_context 为空时未正确处理而可能发生崩溃的问题,增强了服务的健壮性。

Infrallama.cpp服务稳定性空指针修复

OpenAI says Hugging Face was breached by its pre-release models

TechCrunch · AI · 07-22 04:56 UTC+8

OpenAI 承认 Hugging Face 数据泄露事件由其内部测试失误导致,泄露内容涉及预发布模型,凸显了模型分发与安全控制的脆弱性。

厂商动态OpenAIHugging Face数据泄露模型安全

Google releases three new Gemini models — but no 3.5 Pro

TechCrunch · AI · 07-22 01:11 UTC+8

谷歌发布三款新 Gemini 模型——3.6 Flash、3.5 Flash-Lite 和 Flash Cyber,但旗舰级 Gemini 3.5 Pro 依然缺位,令人对其前沿 AI 战略产生新疑问。

厂商动态谷歌GeminiFlash 系列战略缺失

Google ships three new Gemini Flash models but its frontier 3.5 Pro remains lost in training

The Decoder · 07-22 00:52 UTC+8

谷歌推出三款新 Gemini Flash 模型,其中 3.6 Flash 的 Token 消耗降低最多 65%,另有一款仅面向政府和特定合作伙伴的网络安全模型;但备受期待的旗舰模型 Gemini 3.5 Pro 仍未出现,而此时 OpenAI、Anthropic 和中国实验室已在前沿模型展开激烈竞争。

厂商动态Gemini FlashToken 效率网络安全模型战略空缺

AI Teammates: how monday.com runs production AI agents on Amazon Bedrock

AWS 机器学习 · 07-22 23:54 UTC+8

monday.com 基于 Amazon Bedrock 大规模运行 AI 代理「AI Teammates」,内部数据显示九成构建者每月使用 AI 编码工具,人均 PR 吞吐量提升超过一半,文章分享了其在一套十年代码库上的架构改造和置信度评分机制。

AgentAI 代理Amazon Bedrock生产部署编码效率

b10082

llama.cpp · 07-22 14:29 UTC+8

llama.cpp 的 KleidiAI 后端现在对缺少专用内核的权重类型仅发出一次警告,避免重复日志刷屏,优化开发者的排查体验。

推理优化llama.cppKleidiAI日志优化

trunk/8506836eb3f1031935ed98113172829edea16798

PyTorch · 07-22 14:09 UTC+8

PyTorch Inductor 修复了一个在标量被除数上进行 floor 除法降级时会触发崩溃的问题,提升了编译器稳定性。

InfraPyTorchInductor编译器修复

b10080

llama.cpp · 07-22 13:07 UTC+8

llama.cpp 服务器修复了当请求头包含 X-Conversation-Id 但参数验证失败时错误返回 500 状态码的缺陷,现在正确返回 400,并避免因空回调导致的崩溃,改善了 HTTP API 的错误处理一致性与健壮性。

推理优化llama.cppHTTP 状态码错误处理

v0.32.2-rc3: test: revamp integration test entrpoints (#16560)

Ollama · 07-22 07:06 UTC+8

Ollama v0.32.2-rc3 重构了集成测试入口,将测试分为 fast、release 和 library 三个主要组别,并更新了测试模型清单以淘汰老旧模型、纳入新模型,在保持广泛覆盖的同时提升测试效率。

InfraOllama集成测试测试优化

📄 论文 11 篇

今日论文看点:ISO 推进 RLVR 原生优化栈,AgentDebugX 聚焦智能体失败可观测与恢复,Mage-Flow 则展示高效原生分辨率图像生成模型。

ISO: An RLVR-Native Optimization Stack

HF 精选 · 07-22 08:00 UTC+8

在基于可验证奖励的强化学习(RLVR)中,优化器如何将奖励信号转化为权重更新一直缺乏清晰认识。本工作从模型权重的奇异结构出发,发现「光谱继承」现象——RLVR 可以在复用基座模型权重谱的同时,通过改变关联子空间获取新能力。基于此洞察构建了一个名为 ISO 的 RLVR 原生优化栈,使优化过程更透明、更贴合 RLVR 的特性。

后训练RLVR优化器光谱继承模型训练
📖 阅读⬇ PDF

H^2SD: Hybrid Hindsight Self-Distillation

HF 精选 · 07-22 08:00 UTC+8

现有 RLVR 大多为整个轨迹分配标量结果奖励,导致监督稀疏、token 级信用分配困难;在线蒸馏虽然能提供更稠密的监督,却依赖额外更强的教师模型。本文提出「混合后见自我蒸馏」方法 H²SD,无需外部教师即可利用轨迹后见信息为每个 token 生成高质量软标签,从而实现稠密、精准的 token 级信用分配,在数学推理和代码生成任务上取得一致增益。

后训练RLVR信用分配自我蒸馏后见推理
📖 阅读⬇ PDF

Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training

HF 精选 · 07-22 08:00 UTC+8

MoE 训练中优化器状态通常是显存最大开销项,例如对 6.78B 参数模型,AdamW 需 50.6GB 存储一阶和二阶动量。本文观察到 MoE 的稠密骨干、专家和路由三类参数在数量和梯度统计上差异显著,因此提出 SkewAdam,对三类参数采用分层状态分配,部分层保持完整浮点状态、部分采用有损压缩,大幅削减显存占用同时几乎不牺牲模型质量。

InfraMoE训练优化器状态内存优化SkewAdam
📖 阅读⬇ PDF

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

HF 精选 · 07-22 08:00 UTC+8

用 LLM 代理生成的数据处理脚本难以自动转换为可持久、可编辑的平台制品,形成「NL2Pipeline 鸿沟」。「DataFlow-Harness」平台通过类型化增量变异,引导 LLM 代理构建平台原生的有向无环图,而非自由形式脚本,结合 DataFlow 和 Harness 组件,让流水线可持久化、可编辑,真正打通从自然语言到生产级数据管道的闭环。

AgentLLM代理数据管道DAG代码生成
📖 阅读⬇ PDF

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

HF 精选 · 07-22 08:00 UTC+8

大规模视觉生成模型训练和部署成本偏高。Mage-Flow 打造了一个紧凑的 4B 规模生成栈,包含轻量高保真潜空间 tokenizer「Mage-VAE」和原生分辨率多模态扩散 Transformer,训练采用流匹配校正。这套协同设计使模型在保证生成与编辑质量的同时,大幅降低训练和推理开销,适合高效微调和部署。

基座图像生成扩散模型轻量化原生分辨率
📖 阅读⬇ PDF

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

HF 精选 · 07-22 08:00 UTC+8

LLM 智能体调试的难点在于故障表面步骤往往不是根因所在,现有工具仅回放轨迹而缺乏根因定位与修复闭环。AgentDebugX 将调试组织为「Detect-Attribute-Recover-Rerun」闭环,核心模块 DeepDebug 借助全局轨迹分析进行多轮根因诊断,从而实现从故障观察到归因再自动尝试修复的完整流程。

AgentLLM智能体调试框架可观测性故障恢复
📖 阅读⬇ PDF

Subliminal Clocks: Latent Time Modelling in Diffusion Language Models

HF 精选 · 07-22 08:00 UTC+8

扩散语言模型在某些实现中未显式依赖时间步,那么它们内部是否仍隐含编码去噪进度?本研究证实 DLM 的残差流中确实存在一种「潜意识时钟」,编码了扩散时间步信息,并且该信号可被提取和操纵,从而影响生成文本的质量与属性,为可控生成提供了新接口。

基座扩散语言模型时间步编码内部表征可控生成
📖 阅读⬇ PDF

HPD-Parsing: Hierarchical Parallel Document Parsing

HF 精选 · 07-22 08:00 UTC+8

统一 VLM 文档解析器通常逐 token 自回归生成整页输出,随着文档加长形成严重顺序瓶颈。HPD-Parsing 提出层次化并行解析策略:全局分析布局后,对各元素并行生成,兼顾了全局协调与并行执行效率,在不损害解析质量的前提下显著降低长文档的延迟。

推理优化文档解析视觉语言模型并行生成层次化解析
📖 阅读⬇ PDF

Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness

MetaHF 精选 · 07-22 08:00 UTC+8

长文本事实性评估长期偏重精确度,忽略完备性——即模型回答是否包含了所有应有信息。本文提出两层元评分量规,系统化地枚举完整答案应包含的事实集合,并据此构建基准 GAMUT,专门衡量事实完备度,为事实性评估补上了缺失的另一半。

基座事实性评估文本生成完备性基准测试
📖 阅读⬇ PDF

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

ECCV 2026CCF-B推荐HF 精选 · 07-22 08:00 UTC+8

多模态大模型在视频空间推理中常因缺乏几何一致性而难以从冗余观测中稳定聚合空间证据。ConsiSpace 引入几何一致性学习,迫使模型跨视角保持空间关系的不变性,从而在导航感知和长视频问答等任务上获得更高效、更稳定的推理表现。

基座视频理解空间推理几何一致性多模态大模型
📖 阅读⬇ PDF

Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

HF 精选 · 07-22 08:00 UTC+8

这篇综述聚焦多模态幽默理解,梳理了在模因、漫画等单一及多面板视觉艺术品中理解幽默的方法、数据集和评估协议,同时将幽默生成视为新兴前沿。文章对比了传统幽默分析、讽刺检测和通用多模态评测,揭示了非字面推理和文化知识仍是核心挑战。

基座多模态幽默综述LLM评估文化知识
📖 阅读⬇ PDF