每日 AI 速览

2026-07-30

生成于 2026-07-31 04:07
本页行业动态来源于互联网公开信息,可能存在不实或失准内容,请仔细辨别消息真实性。AI Infra 状态来自 GitHub 主分支 PR。

今日导语

今日主线聚焦四大方向:一是模型性能前沿,OpenAI公布GPT-5.6在ARC-AGI-3基准上超越Opus 5的成绩,并展现出自我优化潜力,同时Moonshot开源MoE专家并行库「MoonEP」、腾讯推出统一推测解码训练框架「AngelSpec」,推动训练与推理效率提升;二是Agent落地加速,桌面操作智能体「实在Agent」率先突破90%成功率登顶OSWorld,多智能体架构在5G安全运维、软件生命周期等场景深化应用;三是具身智能与机器人,李飞飞世界模型开始训练机器人,结合VLA与轻量化双臂推动家庭服务落地;四是人才异动,前安全负责人翁荔重返OpenAI,AlphaFold团队解散并转向Anthropic。

行业动态 38 条

Kimi K3 + Deep Research + Parallel Chat

Unsloth · 07-30 10:25 UTC+8

Unsloth现已支持本地运行Kimi K3,新增动态GGUF、并行多轮对话和深度研究模式,可用本地模型完成规划、阅读与引用,同时改善了对AMD和Intel GPU的支持。

后训练Kimi K3本地部署深度研究并行推理

b10194

llama.cpp · 07-30 23:02 UTC+8

llama.cpp新增CUDA后端的免转置矩阵向量乘优化,当权重矩阵为1xK形状时可跳过转置操作直接计算,进一步加速推理。

llama.cpp推理优化CUDA性能提升

Advancing the price-performance frontier with GPT-5.6

OpenAI · 07-30 18:00 UTC+8

OpenAI通过GPT-5.6的Luna和Terra方案降价,用更高效的模型帮助企业规模化部署AI工作流,继续推动价格性能边界。

厂商动态GPT-5.6定价性价比企业AI

b10184

llama.cpp · 07-30 12:42 UTC+8

llama.cpp 提交修正了小米 MiMo2 模型 MTP(多令牌预测)实现的审查反馈,提升了新模型在本地推理框架中的适配质量。

推理优化llama.cppMiMo2MTP推理框架

Microsoft is openly competing with OpenAI, Anthropic more than ever

TechCrunch · AI · 07-30 08:21 UTC+8

微软推出自研 AI 模型及类似 Mythos 的产品,高调与 OpenAI 和 Anthropic 展开直接竞争,标志着其从依赖外部模型转向全栈自研,将重塑企业客户的大模型选型格局。

厂商动态微软自研模型OpenAIAnthropic企业AI

How to Self-Host a Validated AI Coding Assistant with NVIDIA NeMo Guardrails

NVIDIA 开发者 · 07-30 00:46 UTC+8

英伟达发布教程指导如何在合规和源代码敏感环境中,利用 NeMo Guardrails 自托管经验证的 AI 编码助手,帮助安全团队在保护代码资产的同时获得智能编程辅助。

AgentNeMo Guardrails自托管AI编码助手安全NVIDIA

Migrate your prompts to new models and optimize them on Amazon Bedrock

AWS 机器学习 · 07-30 23:58 UTC+8

Amazon Bedrock 推出高级提示优化功能,可一次性将提示适配至最多 5 个模型并对比质量、延迟及成本,把传统数周的模型迁移工作缩短至几分钟,极大加速企业大模型选型与迭代。

厂商动态Amazon Bedrock提示优化模型迁移成本优化

深度访谈|第二次权力转移:当Agent拿走数据库的行动权

InfoQ 中文 · 07-30 23:41 UTC+8

深度访谈剖析 AI 智能体从被动应答到直接操作数据库的“第二次权力转移”,探讨当智能体掌握数据写入与执行权限后,对传统数据架构和安全设计带来的根本性冲击。

Agent智能体数据库权力转移安全架构

Language models can't spark scientific revolutions, but world models might

The Decoder · 07-30 22:01 UTC+8

Google DeepMind 研究员提出语言模型因缺少创造性认知飞跃机制而无法引发科学革命,但世界模型可能具备这一能力,对该方向研究路径具有警示与启发意义。

基座语言模型世界模型科学发现DeepMind认知

b10192

llama.cpp · 07-30 21:46 UTC+8

llama.cpp 执行 ggml 底层张量库的同步更新,确保跨平台推理性能与稳定性得到持续保障。

Infrallama.cppggml推理框架同步

b10189

llama.cpp · 07-30 17:35 UTC+8

llama.cpp 重构 Apple M3 芯片计算图,移除自定义 CPU 算子改用标准算子,提升兼容性并简化未来维护。

Infrallama.cppM3算子重构Apple Silicon

GitLab 19.2 借助 AI 代理处理安全待办事项

InfoQ 中文 · 07-30 17:00 UTC+8

GitLab 19.2 利用 AI 代理自动处理安全待办事项,将漏洞从发现到修复的繁琐人工流程交给智能体,加速 DevSecOps 闭环。

AgentGitLabAI代理安全自动化DevSecOps

b10188

llama.cpp · 07-30 16:59 UTC+8

llama.cpp 修复 Metal 后端在模型释放但无 GPU 操作时的内存泄漏与异常解锁问题,增强 macOS 上大模型推理的稳定性。

Infrallama.cppMetal内存泄漏macOS

b10186

llama.cpp · 07-30 15:37 UTC+8

llama.cpp 修复与 Arm KleidiAI 优化相关的持续集成问题与编译器溢出警告,保障 ARM 平台的顺利构建与推理加速。

Infrallama.cppKleidiAIARM持续集成

这这这…翁荔光速回OpenAI上班了

量子位 · 07-30 08:31 UTC+8

OpenAI 安全研究前 VP 翁荔在短暂离开联合创立公司后迅速返回,揭示顶尖 AI 安全人才在巨头间的流动对行业安全能力布局的直接影响。

厂商动态翁荔OpenAIAI安全人才流动

论文 18 篇

今日论文强调Agent能力的广度进化,涵盖「MindForge」教小模型全生命周期软件工程、「SkillRise」跨任务技能演化,以及实时视觉语言动作模型「TurboVLA」在消费级GPU上实现32Hz推理,折射出智能体从记忆、规划到具身执行的系统性突破。

Memory for Large Language Models

HF 精选 · 07-30 08:00 UTC+8

这篇综述系统梳理了大语言模型中记忆机制的演变脉络,从早期作为计算的隐式副产品发展到如今一系列显式可控机制,涵盖瞬时注意力、循环状态动态、参数高效适应和可扩展查找存储等策略,试图为碎片化的研究图景提供一个统一的架构视角。

基座大模型记忆机制综述注意力机制参数高效微调

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

字节 SeedHF 精选 · 07-30 08:00 UTC+8

针对GRPO式评分标准强化学习将结构化评判压缩为标量奖励并均匀广播到所有token的问题,CoRT提出基于反事实重放的token级奖励分配方法,让模型能更细粒度地对齐不同评分维度的要求,从而在多项标准上提升策略优化效果。

后训练RLHFtoken级优化评分标准反事实推理

Can AI agents conduct open-ended AI research? Early evidence from two case studies

HF 精选 · 07-30 08:00 UTC+8

当前对AI智能体从事开放式AI研究的评测要么限于窄任务,要么依赖质量不高的同行评审,这项工作提供了第三种测量方式:让智能体承担核心的开放式研究角色,并通过两个案例研究展示了初步证据,为评估AI研究自动化进展提供了新思路。

AgentAI智能体开放式研究AI研究自动化评测

GPT-Red: Automated Red Teaming via Self-Play at Scale

OpenAIHF 精选 · 07-30 08:00 UTC+8

GPT-Red是一个通过大规模自对弈训练的自动化红队智能体,专门发现前沿大模型的提示注入攻击面,其生成的对抗样本已用于训练GPT-5.6,使生产系统对提示注入的鲁棒性达到目前最高水平。

后训练红队测试提示注入自对弈安全

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

HF 精选 · 07-30 08:00 UTC+8

现有文本空间优化大多固定评估量规,限制了求解器在开放式任务上的持续提升,DecoEvo引入求解器与量规生成器的解耦协同进化,让两者在文本空间中交替优化,确保评分维度随求解器能力成长而更新,在多个任务上获得稳定增益。

后训练文本空间优化协同进化黑盒优化评分量规

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

美团HF 精选 · 07-30 08:00 UTC+8

为解决长程游戏训练中稀疏奖励难以分配回合内决策置信度的问题,CAST利用游戏求解器的状态价值变化作为每步动作的稠密教学信号,充当回合级教师来指导LLM智能体,显著提升最终任务成功率和样本效率。

Agent强化学习游戏智能体回合级奖励教师信号

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

HF 精选 · 07-30 08:00 UTC+8

SkillRise针对LLM智能体跨任务技能复用难题,提出统一强化学习框架,将相关任务组织起来并跨任务学习可复用的技能,在多个任务族中表现出比独立训练或管线式技能学习方法更好的泛化与效率。

Agent智能体强化学习技能学习跨任务泛化基础模型

CADENCE: Closing the Reasoning Gap via Coverage-Adaptive On-Policy Distillation

HF 精选 · 07-30 08:00 UTC+8

CADENCE针对在线蒸馏中冷启动坍塌、散度调度不考虑覆盖状态以及二元奖励稀疏这三项典型失效模式,设计了覆盖度自适应的KL散度调度,并利用部分正确轨迹的细粒度信号关闭蒸馏与真实推理之间的差距,在数学推理等任务上显著提升小模型性能。

后训练知识蒸馏在线策略推理能力覆盖度自适应

SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch

HF 精选 · 07-30 08:00 UTC+8

SpecFirst将行为规范的获取作为从零合成程序的显式第一步,让智能体先通过执行二进制探索行为并形成规格说明,再据此合成代码,从而避免单一通道中文档阅读、行为探索和代码合成相互耦合导致的信息丢失,在困难实例上提升成功率。

Agent程序合成智能体行为规范从零构建

Voice Memory for Agentic Speech Recognition

NVIDIAHF 精选 · 07-30 08:00 UTC+8

Voice Memory提出一种推理时的智能体式语音识别方案,由冻结的修正器按领域记忆文件决定是否修正当前假设,异步评分门控优化器仅在严格提升质量时才更新记忆,形成监听-思考分离的架构,在流式场景中持续改进表现。

Agent语音识别智能体推理时优化记忆机制

Improving Item Discoverability in e-Commerce Search via Related Intent Generation

KDD 2026CCF-A推荐arXiv · 07-30 01:46 UTC+8

针对电商搜索过度强调精准匹配而牺牲召回多样性的问题,提出基于意图条件的召回扩展系统,通过生成替代、互补等关联意图来挖掘更多可发现商品,提升用户体验与商业指标。

电商搜索意图生成召回扩展推荐系统
Ji Xin, Xiao Xiao, Ishan Bhatt, Vinesh Gudla, Trace Levinson, Raochuan Fan, Shishir Kumar Prasad, Prakash Putta