每日 AI 速览

2026-07-05

生成于 2026-07-06 04:08
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

字节跳动发布「Seed2.0」模型卡,展示多模态与复杂现实任务的前沿能力。AI Infra层面,MoE服务专家路由优化(ELDR)、视频生成服务框架TurboServe与PyTorch编译器迭代密集推进,pxpipe更可将token成本降低70%。Agent研究向纵深发展:AutoMem让模型自主学习记忆技能,DiscoBench评测搜索Agent在查询歧义时主动澄清的能力,SkillCoach则以自我进化评分表强化技能运用。Meta明确转向出售GPU算力,华为更新「韬定律」论文,巨头竞争向基础设施蔓延。

行业动态 18 条

b9874

llama.cpp · 07-05 23:55 UTC+8

llama.cpp 为 CUDA 后端增加了量化张量拼接操作,直接加速量化模型在 GPU 上的序列处理。

llama.cppCUDA量化推理优化

Better Models: Worse Tools

Simon Willison · 07-05 06:53 UTC+8

新 Claude 模型(如 Opus 4.8)在调用工具时会凭空添加额外字段,导致工具调用被拒,反映出更强的模型能力反而可能带来更差的工具遵循性。

Claude工具调用模型行为Agent

b9873

llama.cpp · 07-05 05:11 UTC+8

llama.cpp 为 K/V 旋转输入添加空缓冲区保护,修复了在投机解码等仅存 K/V 不计算注意力的场景下因未分配缓冲区导致的崩溃。

推理优化llama.cpp投机解码K/V缓存稳定性

华为更新韬定律论文!

量子位 · 07-05 21:38 UTC+8

华为更新「韬定律」论文,明确展示了所放弃的技术路线,对理解其模型缩放规律与研发方向具有重要参考价值。

厂商动态华为缩放定律论文更新技术路线

Alibaba reportedly bans employees from using Claude Code

TechCrunch · AI · 07-05 00:32 UTC+8

据报道阿里巴巴已将 Claude Code 归类为高风险软件并禁止员工使用,可能出于安全与数据合规考虑,反映了国内大厂对外部 AI 编程工具的谨慎态度。

厂商动态阿里巴巴Claude Code安全合规内部禁令

论文 20 篇

今日暂无当天新论文。周末或节假日 arxiv 不公告、HuggingFace 每日精选也不更新。以下为近期精选 20 篇

ELDR: Expert-Locality-Aware Decode Routing for PD-Disaggregated MoE Serving

MicrosoftHF 精选 · 07-02 08:00 UTC+8

ELDR 专为预填充与解码分离的 MoE 推理设计,利用专家局部性感知的路由策略,通过预测专家激活将请求引导到对应节点,大幅减少跨节点通信,从而提升推理吞吐与延迟表现。

MoE推理优化PD分离专家路由

Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity

字节 SeedHF 精选 · 07-02 08:00 UTC+8

Seed2.0 直面真实世界复杂任务,重点攻克长尾知识覆盖与复杂指令跟随难题,同时增强了推理、视觉理解与检索能力,并构建了一套紧贴用户需求的鲁棒评测框架。

厂商动态多模态模型发布长尾知识指令跟随

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

HF 精选 · 07-03 08:00 UTC+8

AgenticSTS 提出有界契约方法,通过类型化检索动态拼装提示,为长时智能体提供可控记忆测试环境,能单独分析记忆组件,在复杂决策任务中展现出更优性能。

Agent智能体记忆管理长时任务评测框架

AutoMem: Automated Learning of Memory as a Cognitive Skill

HF 精选 · 07-03 08:00 UTC+8

AutoMem 将大模型的记忆管理视为可训练技能,自动优化记忆结构与使用熟练度,显著提升长时任务表现,为智能体记忆机制提供了自动化训练方案。

Agent记忆管理智能体长时任务训练方法

WARP: Weight-Space Analysis for Recovering Training Data Portfolios

HF 精选 · 07-03 08:00 UTC+8

WARP 框架通过模型合并与特征提取,分析权重空间中的几何痕迹,能从已公开的模型权重反推出训练数据构成,对理解模型能力来源和数据分析有重要价值。

训练数据工程模型分析权重空间训练数据

Morphing into Hybrid Attention Models

字节 SeedHF 精选 · 07-03 08:00 UTC+8

FlashMorph 将混合注意力层选择形式化为预算约束优化问题,借助可变形模型与线性化正则高效选出适配长上下文的层组合,有效提升 Transformer 长文本效率。

Infra注意力机制长上下文模型优化Transformer

Optimizing Visual Generative Models via Distribution-wise Rewards

ICML 2026CCF-A推荐HF 精选 · 07-03 08:00 UTC+8

该框架为视觉生成引入基于分布级别的奖励强化学习,在提升图像多样性与质量的同时,有效缓解模式坍塌并改善计算效率。

后训练视觉生成强化学习奖励设计模式坍塌

When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search

腾讯 AI LabHF 精选 · 07-03 08:00 UTC+8

DiscoBench 基准评估搜索智能体在模糊查询下的澄清与恢复能力,发现当前智能体在多步信息搜寻中不愿主动提问,反复搜索反致准确率下降,消除歧义后性能可大幅跃升。

Agent搜索智能体澄清提问评测基准多步推理

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

ICML 2026CCF-A推荐HF 精选 · 07-02 08:00 UTC+8

PerceptionRubrics 提出量规化评估框架,通过原子审计与门控评分机制,揭示基准分数与真实人类感知的落差,使多模态评估更贴近人本身的判断。

基座多模态评估评测框架人类感知对齐量规