🗂 历史归档
每日 AI 速览

2026-07-26

生成于 2026-07-27 04:12
⚠️ 本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性

今日导语

今日 Anthropic 发布 Opus 5,在真实智能基准上超越 Fable 5 和 GPT-5.6 Sol,大模型基座能力再攀新高。智能体方面,快手 KAT-Coder-V2.5 在十万仓库环境中训练编码智能体,Sakana AI 的 Fugu-Cyber 面向安全编排达 86.9%,Cursor 智能体集群则展示低成本模型协同规划思路。AI Infra 中,TileLang 高阶 GPU 内核设计教程涵盖 FlashAttention 与自调优,SANA-Video 2.0 用混合线性注意力加速视频生成。训练方法上,DeepSeek-V4 在昇腾超算完成全参数后训练,多篇论文围绕 LLM 强化学习的探索崩溃与样本效率展开,体现对齐优化与国产算力适配的双重进展。

🗞 行业动态 9 条

Designing High-Performance GPU Kernels with TileLang: Tensor-Core GEMM, Fused Softmax, FlashAttention, and Autotuning

MarkTechPost · 07-26 02:08 UTC+8

TileLang 是一种高阶 Python DSL,让开发者用高层语义设计 GPU kernel,编译器自动处理线程映射、内存布局和 CUDA 指令生成。教程覆盖了张量核心 GEMM、融合 Softmax 和 FlashAttention 等复杂负载,对降低高性能 GPU 编程门槛有显著价值。

InfraGPU编程Domain-Specific LanguageTileLang高性能计算

KwaiKAT Team Releases KAT-Coder-V2.5: An Agentic Coding Model Trained on 100,000+ Verifiable Repository Environments

MarkTechPost · 07-26 18:46 UTC+8

快手 KwaiKAT 团队发布 KAT-Coder-V2.5,一个在超过 10 万个可验证仓库环境上训练而成的智能编码模型。技术核心在于训练基础设施的改进,环境构建成功率从 16.5% 提升至 57.2%,并将 RL 反馈错误从约 16% 压至 2% 以下,表明提升编码智能体能力的关键在于强健的训练管线而非简单扩大模型。

Agent编码智能体训练基础设施KAT-Coder强化学习

Induction Labs Photon-1 Simulates Desktops, Plays Checkers, and Models Billiard Physics From One Pretraining Run

MarkTechPost · 07-26 17:14 UTC+8

Induction Labs 发布 Photon-1,一种 106B-A5B MoE 想象模型,完全从无动作标签的原始视频预训练,可模拟桌面操作、下跳棋和台球物理。他们认为智能体学习的主要瓶颈在于对动作标注的依赖,而该架构打破了这一限制,开辟了从纯视频学习世界和交互规律的路径。

基座世界模型智能体预训练视频学习

v0.32.4

Ollama · 07-26 02:26 UTC+8

Ollama v0.32.4 通过 MLX 引擎支持 Apple GPU 上的 Laguna 模型,并修复了 Qwen3 MoE 在不同量化专家下的解码问题,packed gate/up 投影在 M5 Max 上有约 4-9% 的加速,同时优化了推测解码中草稿模型输出头的量化,提升了本地推理的兼容性和效率。

推理优化OllamaMLX模型推理Apple GPU

viable/strict/1785041792

PyTorch · 07-26 08:37 UTC+8

PyTorch 修复了 CPU BLAS 中 bf16/fp16 gemm staging buffer 的整数溢出问题,保障在大型矩阵运算时低精度计算不会因缓冲区大小计算错误而崩溃,对基于 CPU 的大模型推理和训练具有直接稳定性改善。

InfraPyTorchBug修复BLAS低精度计算

📄 论文 20 篇

📭 今日暂无当天新论文——周末 / 节假日 arxiv 不公告、HuggingFace 每日精选也不更新。以下为近期精选 20 篇

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

HF 精选 · 07-23 08:00 UTC+8

针对万亿参数 MoE 模型全参数后训练在 NPU 集群上面临的巨大内存压力、通信开销和 kernel 效率问题,本报告以 DeepSeek-V4 家族为目标 workload,给出了在 Ascend SuperPOD 上的端到端优化实践。通过定制分布式训练框架、细粒度显存管理与通信隐藏等技术,实现了在国产 NPU 超算上高效完成全参数后训练,为大规模模型在 Ascend 生态下的落地提供了系统级的可行方案。

Infra大模型训练MoEAscend NPU分布式训练优化
📖 阅读⬇ PDF

AREX: Towards a Recursively Self-Improving Agent for Deep Research

HF 精选 · 07-24 08:00 UTC+8

深度研究类任务要求智能体找到满足多重约束的答案,发现成本高而验证易于分解为逐约束检查。基于这种不对称性,AREX 通过验证中间结果、用已验证状态指导后续修正,实现递归式的自我改进。该方法使智能体不再仅仅依赖更长的搜索,而是主动迭代提升答案质量,为复杂研究场景下的智能体设计提供了新范式。

Agent智能体自我改善递归推理深度研究
📖 阅读⬇ PDF

SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

NVIDIAHF 精选 · 07-24 08:00 UTC+8

现有视频扩散 Transformer 依赖全 softmax 注意力,计算成本高,难以在单 GPU 上生成高分辨率视频。SANA-Video 2.0 提出混合线性注意力与注意力残差,将门控线性注意力作为 O(N) 主导的混合方式并周期性插入门控 softmax 锚点,在避免平方复杂度的同时保持长序列建模质量,5B 和 14B 模型即可在单 GPU 上生成 720p 视频,质量媲美全 softmax DiT。

基座视频生成高效注意力线性注意力Diffusion Transformer
📖 阅读⬇ PDF

NVIDIA-labs OO Agents: Native Python Object-Oriented Agents

NVIDIAHF 精选 · 07-24 08:00 UTC+8

传统智能体开发往往分散在提示模板、工具模式、回调代码和工作流图中,维护复杂。NOOA 框架将智能体直接建模为 Python 对象:方法即动作,字段即状态,文档字符串即提示,类型注解构成契约,方法体留空则由 LLM 在运行时补全,从而以模型无关的方式构建可靠智能体,大幅降低了开发心智负担并提升了代码的可组合性。

Agent智能体框架面向对象PythonLLM应用
📖 阅读⬇ PDF

Predictive Divergence Masks for LLM RL

腾讯混元HF 精选 · 07-24 08:00 UTC+8

LLM 强化学习中的 PPO 信任域掩码主要依赖采样 token 的重要性比来控制更新,但方向判断粗糙。后续工作 DPPO 改进了近似准则,本文进一步提出预测性散度掩码,利用对数概率差值的预测来精细调控更新方向与距离,在稳定策略收敛的同时提升样本效率,实验性能超越 PPO 与 DPPO。

后训练LLM强化学习PPO信任域策略优化
📖 阅读⬇ PDF

OpenForgeRL: Train Harness-native Agents in Any Environment

MicrosoftHF 精选 · 07-24 08:00 UTC+8

现代 AI 智能体普遍依赖 Claude Code 这类复杂推理工具链,而开源 SFT/RL 栈难以原生表达有状态、多进程的 harness 推理,导致端到端训练困难。OpenForgeRL 开源框架解决了这一断层,支持在任何环境里端到端训练 harness 原生智能体,让智能体在维持丰富工具交互的同时可直接进行强化学习优化。

Agent智能体训练RLHF工具链开源框架
📖 阅读⬇ PDF

Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

ICML 2026CCF-A推荐HF 精选 · 07-23 08:00 UTC+8

PPO-Clip 在 LLM 强化学习中经常遭遇探索坍缩,根源在于它用欧式距离度量策略差异,与概率单纯形的黎曼几何不兼容。本文揭示这一本质缺陷,并提出黎曼等距策略优化(RIPO),在黎曼流形上以正确的度量来更新策略,有效克服探索坍缩,为提升推理能力扫清了一大障碍。

后训练LLM强化学习策略优化黎曼几何探索坍缩
📖 阅读⬇ PDF

SLPO: Scaling Latent Reasoning via a Surrogate Policy

HF 精选 · 07-23 08:00 UTC+8

通过可验证奖励进行显式思维链推理的 RL 训练计算代价高,而潜在推理以连续向量承载中间计算,虽已在小步数上匹敌显式 CoT,但难以通过 RL 自主扩展。SLPO 方法引入代理策略来引导潜在推理的探索,成功将 RL 扩展至长步潜在推理,提供了比显式 CoT 更高效的推理扩展路径。

潜在推理强化学习Chain-of-Thought推理优化
📖 阅读⬇ PDF

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

HF 精选 · 07-24 08:00 UTC+8

现有编程智能体基准多基于公开 issue 改编,存在数据污染和静态任务局限。腾讯 WorkBuddy Bench 构建了由代码、网页、办公、安全四大领域组成的评估套件,所有任务均从真实提交、PR 或业务场景逆向生成,以抵抗污染,并配以统一评估框架和分布感知的构造方法,为智能体提供了更贴近实际的多领域编码能力测试。

Agent智能体评测代码智能体基准数据污染
📖 阅读⬇ PDF

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

HF 精选 · 07-24 08:00 UTC+8

多智能体交互世界模型既要生成一致观察,还要维护跨智能体持久的世界状态,而现有自回归视频扩散模型仅将观察历史作为条件,难以在多视角多智能体间共享状态。WorldWeaver 引入跨智能体世界状态寄存器,在流式生成中持续更新共享状态,实现了连贯的多智能体交互视频生成。

Agent多智能体世界模型视频扩散状态寄存器
📖 阅读⬇ PDF

Sample-Efficient Learning from Agent Experience

HF 精选 · 07-24 08:00 UTC+8

真实环境交互成本高昂,上下文学习能高效利用交互经验但增益随经验移出上下文而消失,上下文蒸馏虽可内化信息却在复杂多轮交互中难以应用。本文融合两者,将智能体的多轮经验蒸馏至模型权重,实现了持久且样本高效的智能体学习,克服了纯上下文学习的遗忘问题与直接蒸馏的工程困难。

Agent智能体学习上下文蒸馏上下文学习样本效率
📖 阅读⬇ PDF

Multi-Turn On-Policy Distillation with Prefix Replay

HF 精选 · 07-24 08:00 UTC+8

在多轮智能体任务中,完全在线的策略蒸馏(OPD)每次更新都需新的学生 rollout 和教师查询,成本极高。ReOPD 提出离线环境的替代方案,复用预收集的教师轨迹作为回放前缀来重建学生前缀状态,大幅削减训练开销,同时保持了多轮策略蒸馏的效果。

后训练知识蒸馏智能体在线学习多轮交互
📖 阅读⬇ PDF

Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models

HF 精选 · 07-23 08:00 UTC+8

向 LLM 大规模注入事实知识仍极具挑战。不同于常见的测试时适应,本文探索用超网络在训练时为每个事实生成固定 LoRA 适配器插入模型,以实现知识注入。通过研究扩展律,发现注入准确率随事实数量、超网络参数量等可预测地缩放,为高效、规模化的知识注入提供了理论指导。

后训练知识注入超网络LoRA扩展律
📖 阅读⬇ PDF

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

HF 精选 · 07-23 08:00 UTC+8

行为克隆微调 VLM 得到的 VLA 策略会逐步覆盖预训练表征,损害视觉与语义泛化;即使协训图文数据也无法避免语言-动作错位。本文提出表征锚定保留预训练知识,并强制语言与动作在表征上对齐,显著提升了机器人策略在新场景下的泛化能力。

后训练VLA行为克隆表征锚定多模态对齐
📖 阅读⬇ PDF

FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

腾讯 AI LabHF 精选 · 07-23 08:00 UTC+8

视频扩散 Transformer 的自适应稀疏注意力在序列并行下会导致每头负载严重不均,形成落后者瓶颈。FVAttn 是一种训练无感的稀疏注意力系统,通过运行时负载均衡消除该异构性,有效提高了多 GPU 环境中高分辨率视频生成的总体吞吐量。

推理优化视频生成稀疏注意力负载均衡序列并行
📖 阅读⬇ PDF

ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

美团HF 精选 · 07-23 08:00 UTC+8

vibe-coding 流行使编码智能体从代码补全转向根据模糊意图构建完整项目,而现有基准未能跟上。ICAE-Bench 专为交互式项目构建设计,评估智能体在需求澄清、规划、工具使用、调试等维度上的综合能力,填补了对智能体“从意图到软件”全流程评测的缺口。

Agent智能体评测代码智能体项目构建交互式开发
📖 阅读⬇ PDF

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

HF 精选 · 07-23 08:00 UTC+8

RLVR 在语言推理中效果显著,但扩展到视觉语言模型缺乏既广泛又可验证的训练数据。Trace 通过分类法引导的任务构造,用场景语法与可执行任务程序分离视觉实现与答案计算,生成了可验证、可重现的多领域视觉推理数据,为训练 VLM 推理能力提供了基础环境。

后训练视觉推理RLVR训练环境可验证奖励
📖 阅读⬇ PDF

K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

HF 精选 · 07-24 08:00 UTC+8

教育 LLM 不仅需要答题,还需理解课程知识的结构与可视化展示,而现有基准仅测考试表现。K12-KGraph 从人教版教材抽取课程对齐的知识图谱,覆盖先修链、概念分类、实验链接和教学序列等,用于评测和训练具备课程认知能力的教育 LLM。

训练教育LLM知识图谱课程认知基准
📖 阅读⬇ PDF

LLMs Get Lost in Evolving User Intent

MicrosoftHF 精选 · 07-24 08:00 UTC+8

现行评测与训练大多基于单轮完全指定的静态任务,但真实协作中用户意图会随对话演化。该工作揭示 LLM 在多轮动态意图跟踪中容易迷失,指出模型对意图演变的适应能力仍严重不足,并为此提出了新的评测框架和改进方向。

AgentLLM评估意图理解多轮对话协作智能体
📖 阅读⬇ PDF

Robostral Navigate

HF 精选 · 07-24 08:00 UTC+8

大规模部署导航系统通常需依赖深度传感器或多摄像头,成本高且泛化受限。Robostral Navigate 是一个 8B 视觉语言模型,仅以单目 RGB 图像流作为输入,无需额外传感器或预建地图,在保持高效训练的同时,降低了硬件门槛并提升了跨机器人形态的泛化能力。

Agent视觉语言导航单目RGB机器人高效训练
📖 阅读⬇ PDF