Transformers 发布 v5.16.1,首次加入 GLM-5.3-Flash:这是 GLM-5 系列首个原生多模态模型,总参数 320B、仅激活 18B,以十分之一价格在基准和真实负载上超过 GLM-5.2,并在编码与智能体任务上接近 Claude Opus 4.8。对开发者意味着可以在 Hugging Face 生态中直接使用该高效多模态模型。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
Transformers 发布 v5.16.1,首次加入 GLM-5.3-Flash:这是 GLM-5 系列首个原生多模态模型,总参数 320B、仅激活 18B,以十分之一价格在基准和真实负载上超过 GLM-5.2,并在编码与智能体任务上接近 Claude Opus 4.8。对开发者意味着可以在 Hugging Face 生态中直接使用该高效多模态模型。
Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"
阿里 Qwen 团队通过 Qwen3.8-Flash-Next 预览下一代 Qwen4 架构,这是一款 MoE 模型,每个 token 只激活 125B 总参数中的 6B 参数。它以九分之一训练成本在编码和办公基准上超过 DeepSeek-V4-Flash 与 Claude Opus 4.6,进一步给 OpenAI 和 Anthropic 带来定价压力。对行业来说,极致性价比方向的竞争再次被推高。
vLLM v0.28.0 发布,包含 584 个提交、270 位贡献者,重点针对 Kimi-K3 做了全栈推理优化。新增 Decode Context Parallel、FlashKDA 核融合 decode/prefill、MegaMoE 的 SiTU 激活、序列并行 GEMM-RS,以及 1.5 到 3 倍速提升的 all-gather 合并和自适应投机 token 预算。对于在 vLLM 上部署 Kimi-K3 或 MoE 大模型的团队,这版能直接降低延迟与成本。
OpenAI 在 Hot Chips 上展示了首款自研推理芯片 Jalapeño,SemiAnalysis 测试称其在吞吐量和能效上超过英伟达 Blackwell,甚至胜过 Rubin。SemiAnalysis CEO Dylan Patel 也指出第一代芯片通常不具竞争力,但 OpenAI 这次打破了预期。这对推理芯片格局和自研硅路线是一个重要信号。
Transformers v5.16.0 新增 Qwen4-Exp 模型支持,该模型在 Qwen3.5 的文本与多模态混合架构上加入 GatedResidual、Qwen Sparse Attention 和 Per-Layer Embedding。其中 GatedResidual 在 attention 与 MoE 块前混合多条残差流并做细粒度门控,QSA 与 PLE 则进一步优化稀疏注意力和各层嵌入。这对需要提前试用 Qwen4 实验模型的开发者是及时集成。
Surprise: Z.ai is the AI lab behind the mysterious Ox Alpha model
Z.ai 确认自己就是此前霸榜的神秘开放模型 Ox Alpha 背后的 AI 实验室,并称权重即将发布。这意味着社区很快可以获得这个在基准和排行榜上表现突出的模型权重。对开放模型生态和希望复现其能力的团队是个重要进展。
IBM drops open-weight Granite 4.2 family with built-in agentic capabilities under Apache 2.0
IBM 发布 Granite 4.2 系列开放权重模型,覆盖 3B、8B、30B 规模,训练约 15 万亿 token,上下文窗口高达 512K。较大模型采用 agentic RL 自行学习工具调用和代码执行,且全部使用 Apache 2.0 许可证。对需要可自由商用且具备内置智能体能力的企业模型开发者很有吸引力。
PROOF-Gen: From Optimized Data to Better Distillation
Apple 公开的 PROOF-Gen 研究指出,工具调用蒸馏通常采用 generate-and-filter:保留教师模型通过轨迹、丢弃失败轨迹,但失败样本不提供信号,困难的场景每轮都留下。PROOF-Gen 尝试从优化后的数据出发改进蒸馏流程,以更充分利用教师生成结果。这对按日或按周重训工具调用模型的团队有直接降本意义。
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
Apple 的 IDEA Prune 研究把扩模预训练纳入结构化剪枝流程,而不是只从目标规模的模型开始剪。它将 enlarge-and-prune 作为整体系统研究,关注在有限推理预算下能否比从头训练目标大小模型更高效。对需要兼顾 token 效率与部署成本的大模型预训练团队有实用价值。
Restore LLM Inference Capacity in Seconds with Shadow Engine Recovery in NVIDIA Dynamo
英伟达 Dynamo 引入 Shadow Engine Recovery,可在 LLM 引擎进程失败后数秒内恢复推理容量,而不是走冷重启流程。该机制避免了从存储向 HBM 重新加载权重、编译 kernel 等长耗时步骤。对在线推理服务的可用性和故障恢复速度有明显价值。
v0.33.1-rc0: MLX: Qwen3.8 Flash Next support (#18032)
Ollama 发布 v0.33.1-rc0,在 MLX 后端加入 Qwen3.8 Flash Next 支持。该版本让 Apple Silicon 用户可以通过 MLX 路径运行该模型,扩大了本地推理的模型选择。
535B 大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺
报道称一个 535B 大模型将进行为期三个月的直播训练,代码、数据和 loss 全部公开,并获吴恩达公开力挺。这种透明化训练对 LLM 研究社区了解大模型训练过程、数据与工程细节有较大价值,也可能推动更多开源训练项目跟进。
Chinese Moonshot AI negotiates hosting deals with Microsoft, Amazon, and Google
月之暗面正在与微软、亚马逊和谷歌洽谈模型托管合作,若达成将成为中国 AI 模型首次登陆美国主流云平台,并按收入分成。这对国内大模型厂商出海、绕过地缘限制接入美国云生态有示范意义,也反映美国云厂商对中国模型能力的需求。
llama.cpp 的 Metal 后端加入分块 SSD MMA 内核,针对 Mamba-2 多 token 预填充阶段做优化,并移除了标量实现路径。这能提升 Apple Silicon 上 Mamba 类模型的首 token 延迟和吞吐,对端侧状态空间模型推理有意义。
viable/strict/1787738484: Re-enable expandable segments for CUDA Graph (#194767) (#194767)
PyTorch 在问题修复后重新启用 CUDA Graph 的可扩展段分配,相比基线 QPS 从 28.5k 微升至 28.7k,峰值内存占用从 97.08% 降到 89.28%。对使用 CUDA Graph 做推理和训练的开发者,这直接降低显存压力且性能不降。
Ollama v0.33.0 允许 Claude Desktop 将 Ollama 配置为第三方网关,并修复了长预填充取消时的挂起问题,使预填充恢复点可被可靠用于续传。对于本地模型接入 Claude 生态及代理客户端稳定性是重要改进。
Connect Amazon Bedrock AgentCore to cross-account knowledge bases
AWS 发布指南,展示 Amazon Bedrock AgentCore 代理如何跨账户访问由 Redshift Serverless 支持的 Bedrock 知识库,无需复制源数据即可生成答案。对需要跨组织共享数据、保持安全边界的 Agent 架构有实操价值,涵盖 Strands 代理和声明式 harness 两种编排模型。
llama.cpp 在 CUDA 后端为 Pascal 架构(sm_60)解除了 MoE 模型的多量化 mmq 限制,并针对无 dp4a 的旧卡降低部分量化格式的占用。这让老 NVIDIA GPU 也能用量化方式跑 MoE 模型,提升兼容性和推理可行性。
FlashAttention 4 beta28 放宽了对 CUTLASS DSL 的版本要求,降低构建时的依赖门槛。对集成 FlashAttention 的框架和开发者来说,这意味着更容易适配不同 CUTLASS 版本,减少编译障碍。
量子位报道,名为「Agnes Video 2.5 Flash」的顶级视频 AI 现已免费开放,作者实测用它制作了精致版《牛来》视频。视频生成模型免费化将进一步降低 AI 视频创作门槛,对内容创作者和视频生成赛道竞争有直接影响。
Training and Finetuning Multi-Vector Embedding Models with Sentence Transformers
Hugging Face 博客发布指南,介绍用「Sentence Transformers」训练和微调多向量嵌入模型的方法。多向量模型在细粒度检索和长尾查询上往往优于单向量,但训练与部署更复杂,该指南为 RAG 与向量检索从业者提供了可复现的实操路径。
Agentic observability with Amazon OpenSearch Service MCP Apps
Amazon OpenSearch Service 推出 MCP Apps,让 AI 代理的文本回复可直接附带交互式可视化,并通过单个本地 MCP 服务器串联告警、追踪、日志到根因分析。这对 Agent 可观测性和可验证性有显著提升,允许开发者在 IDE 内逐步核查每一步。
llama.cpp 的 RPC 后端新增 Apple RDMA 传输支持,可在 Apple 硬件间实现低延迟高带宽的分布式推理通信。这对使用多台 Mac 进行模型分片的用户能显著提升跨机通信效率。
Claude Cowork finally remembers what you told the app in chat
Anthropic 为 Claude 推出跨 Chat 和 Cowork 的共享记忆,用户不再需要反复向 AI 介绍项目背景和个人偏好。这对依赖 Claude 做持续协作的用户显著降低沟通成本,也标志着 Agent 从单次会话向持久化上下文演进。
Anima Anandkumar 在访谈中指出,当前基础模型主要建立在语言上,物理领域尚缺乏同等的基础模型,而她正用 AI 建模天气、聚变反应堆等物理系统。这对科学计算和 AI for Science 方向有启发,提示物理世界基础模型是下一块重要拼图。
Orchestration is the new challenge for CX in the age of AI agents
Tata Communications 指出,企业在客户体验领域快速部署 AI 代理和语音 AI,但多数只是将对话式 AI 拼接到老旧系统上,编排成为新挑战。对 CX 架构师而言,这意味着后续需要重构系统以真正释放多智能体与全渠道自动化的价值,而非继续打补丁。
Employee revolt and failing agents forced Meta to scrap its AI layoff plan
路透社报道称,Meta 曾计划用 AI 代理大幅替代员工,但因内部员工反抗以及代理未能交付预期成果而被迫搁置。这给激进 AI 自动化裁员战略泼了冷水,说明企业级 Agent 的可靠性和组织变革阻力仍是现实约束。
Arga Labs is building a better way to train enterprise AI agents
Arga Labs 获得 1000 万美元种子轮融资,由 General Catalyst 领投,目标是构建更优的企业 AI 代理训练方法。这表明企业级 Agent 训练仍是资本关注的重点,如何让代理在真实企业环境中可靠执行任务是当前瓶颈。
Grab 借助 AI 代理将机械性分析的工作量从 44% 降至 30%
InfoQ 中文报道,Grab 利用 AI 代理将机械性分析工作占比从 44% 降至 30%。这展示了 AI 代理在业务流程自动化中可量化的降本效果,对东南亚科技公司及同类分析密集型团队有参考意义。
量子位报道了一个硅谷热门的具身智能模型,该模型无需后训练,仅通过观看一次演示即可学会新任务。这种 one-shot 模仿能力让机器人从预编程走向快速泛化,被视为具身智能向 GPT 时刻迈进的重要信号。
“额度想重置就重置,不问财务”,Codex Tibo首曝幕后:产品没做好,就补偿用户
InfoQ 中文披露了「Codex Tibo」团队幕后的产品理念:额度重置无需层层审批,产品体验不佳时直接补偿用户。这种以用户为中心、快速响应的运营方式对 AI 编程工具的产品策略和客户留存有借鉴意义。
达卯科技与福建智算方舟达成合作,在长乐机场综保区智算中心落地全栈式算电协同服务。这标志着智算中心从单纯算力供给走向算力与电力协同优化,对降低数据中心能耗和运营成本有实际意义。
llama.cpp 的 ggml-meta 模块更新,将缓冲区使用信息传播到新张量并调用初始化。这有助于确保张量生命周期和内存管理的一致性,减少因缓冲区元数据缺失导致的推理错误或性能下降。
Falcon TST 2.0获世界权威测评第一名,推动时间序列基础模型从通用预测走向金融应用
蚂蚁国际发布自研时序预测大模型「鹰序TST」2.0,其在世界权威测评中排名第一,旨在推动时间序列基础模型从通用预测走向金融应用。这对金融风控、交易预测等场景有直接价值,也展示时序基础模型向垂直领域深化的趋势。
深度实测「豆包工作」+飞书:目前最接近企业Agent终局的答案
量子位深度实测「豆包工作」与飞书的组合,认为这是目前最接近企业 Agent 终局的解决方案。该组合可能将豆包大模型的智能体能力与飞书协作套件深度整合,为企业级 Agent 落地提供了可用的产品形态参考。
viable/strict/1787720427: [inductor] Fix loop-local load CSE lifetime (#194786)
PyTorch Inductor 修复了循环局部加载的 CSE 生命周期问题,此前循环内间接加载可能被错误缓存并在循环后重用,导致临时变量不支配使用点。该修复让生成的 Triton 代码更正确,对复杂算子编译的稳定性有提升。
The Hugging Face incident and the road ahead
OpenAI 公开了对 Hugging Face 安全事件的调查发现,并介绍了在模型安全、监控和对齐方面将采取的加固措施。这显示出前沿模型供应商对供应链安全和模型完整性的重视,对依赖第三方模型分发的从业者有警示意义。
How loveholidays is making everyone a builder with Codex
OpenAI 分享案例,旅行公司 loveholidays 利用 Codex 让非技术团队也能参与软件开发,加速从想法到产品的转化。这展示了 AI 编程工具在企业内部推动全民开发者的潜力,对数字化转型团队有参考价值。
Ollama v0.33.0-rc4 修复了代理在图像回退场景下字符串内容丢失的问题,确保请求内容在降级路径中完整保留。这对使用多模态模型且依赖图像回退逻辑的 Ollama 用户是稳定性改进。
llama.cpp 重构了 KleidiAI 的构建系统和集成方式,增加 fp16 保护并修复 CMake 缓存问题。这提升了 Arm 设备上 AI 加速库的编译可靠性和可维护性,对 Arm 平台的 llama.cpp 用户更友好。
Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
面向视频多模态大模型的强化学习后训练通常要么依赖思维链生成导致开销大,要么样本效率与规模化受限。OraRL 引入 oracle rollout 并把优势估计解耦,同时用符号平衡剪枝筛选有效信号,从而在不生成思维链的前提下提升采样效率和可扩展性。该设计让视频 MLLM 的策略优化更轻量,对算力受限或数据规模大的后训练场景有直接价值。
On-policy Distillation with Verifiable Reward
这项研究把在线策略蒸馏与可验证奖励结合,通过 ReLU 门控的隐式奖励重参数化来对齐生成过程中的中间步骤,而不引入额外超参数。相比传统需要精心调参的蒸馏或奖励建模流程,它在推理任务上直接提升表现。对追求稳定、低调试成本的推理模型训练较有参考价值。
WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report
这是微信团队的多模态嵌入模型技术报告,提出 WeMM-Embedding 系列,把文本、图像、视频以及图文交错输入对齐到统一语义空间。该模型在公开检索与推荐基准上取得 SOTA,并在微信大规模业务中经受了真实负载验证。对需要跨模态召回、搜索和推荐的团队提供了一个可参考的通用嵌入方案。
CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild
CyberFactory 是一个开源框架,从真实漏洞出发构建智能体训练数据,用来训练安全模型 Aegis。它在概念验证生成、补丁修复和问答三类安全任务上提升了开源权重的网络安全能力。对希望用真实世界漏洞数据做安全智能体训练或评估的从业者,降低了数据构造门槛。
Best Practice Critic Optimization
BPCO 针对语言模型 critic 强化学习中价值估计不稳定、组采样成本高的问题,将价值预测限制在有限范围内,并引入蒙特卡洛目标和自适应优势估计。这让单条响应采样就能匹配需要组级采样的方法,显著降低计算开销。对需要做 critic-based RL 但资源有限的团队比较实用。
Meta^n: Recursive Self-Improvement through Emergent Depth
Meta^n 研究递归自改进 LLM 代理的稳定性问题,固定同一个元操作并递归作用于不断增长的输入,从而涌现出更深的推理层。其思路是在不破坏系统稳定的前提下增加代理的深度,避免复杂自改进流程中的失控。对持续学习型代理架构和自改进训练有探索意义。
LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
LAION-BVD 发布了一个一千万小时的开放视频数据集,覆盖视频、音频和图像模态,并配有人工合成标注。它面向多模态预训练,能在多个基准上带来稳健性能提升。对研究视频理解、跨模态对齐且需要大规模开放数据的团队是重要资源。
Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment
这项研究在开放世界多智能体环境 Station 中让来自不同模型家族的 AI 代理自主选择研究方向、做实验、协作并共同维护科学文献,没有中心协调者或预设流水线。在 AlphaEvolve 的 12 个构造问题与两个案例研究中,Station 得到了相对此前工作具有新颖性的结果。这为探索自主数学发现和群体科研智能体提供了实验平台。
GigaBrain-0.7 是视觉-语言-动作模型,通过三系统架构、大规模异构预训练和联合对齐训练来提升具身泛化能力。相比单一架构,这种分解更利于视觉感知、语言理解和动作控制的协同。其价值在于为具身基础模型如何从异构数据中涌现通用能力提供了一条可扩展路线。
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
AutoSaddler 面向长时程 LLM 代理的脚手架优化,基于离线失败轨迹自动改进 harness,而不是人工调参或在线试错。它通过失败驱动的方式定位瓶颈并更新执行逻辑,在长时程基准上提升代理成功率。对部署复杂 Agent 管线的团队可以降低维护成本。
On-Policy Self-Distillation in Diffusion Models
DiffusionOPSD 用在线策略自蒸馏,把图像级奖励转化为扩散模型显式的中间目标,从而提升奖励对齐的效率。这种拆解也使得目标构造和策略拟合可以分开分析,便于定位训练瓶颈。对扩散模型对齐和偏好优化研究有方法论价值。
SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation
SecOPD 针对自适应提示注入攻击,在微调阶段引入 token 级反馈进行在线策略蒸馏,使模型学会在生成时逐 token 抵御注入内容。实验显示攻击成功率大幅下降,较单纯内容过滤或 SFT 防御更有效。对部署暴露在用户输入中的语言模型有实用安全价值。
Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
Recuris 面向长时程智能体提出递归记忆架构,它持续跟踪任务进度并据此选择技能,同时在局部验证通过的门控下更新记忆。这样能减少长任务中的漂移和错误累积,提升成功率。对长时程规划、记忆管理和技能选择是一个可落地的改进思路。
AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace
AgentRoom 通过 CRDT 支持的实时协同编辑和共享文件系统协调,让多个编码代理真正并发工作。相比独立或缺乏协调的并行方式,它降低了任务放弃率,提升了一致性。对多智能体编码协作系统的实现有直接参考价值。
Automata from Agent Traces: Failure and Next-Step Prediction
该工作把 LLM 智能体的运行轨迹压缩成紧凑的有限状态机,用以预测下一步和失败情况。这样无需完整重放即可进行安全审计和运行时监控,降低了可观测性成本。对需要形式化分析智能体行为的团队提供了一种轻量抽象工具。
CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
CAFE 让搜索智能体与 critic 共享参数并共同演化,在轨迹内学习修正性反馈,解决静态反馈无法适应动态搜索的问题。它提升了搜索表现,并在多个基准上减少幻觉。对自改进搜索、检索增强和工具调用代理都有启发。
DREAM 在工业推荐系统中引入智能体元控制层,通过意图推理和双循环优化改进会话级推荐,且无需替换现有模型。它相当于在既有推荐管道上加了一层决策与优化逻辑,使在线推荐能更灵活响应会话目标。对大规模推荐系统架构演进有工程参考意义。
MoTE: Mixture of Task Experts for Multi-Task Video Understanding
MoTE 把视频解码器中的稠密前馈网络替换为按样本任务标签路由的专家模块,实现多任务视频理解的稀疏计算。这样在提升视频语言准确率的同时,保持了一定可解释性并降低计算开销。对视频多任务模型的高效推理和部署比较有价值。
Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training
Game2World Engine 提供了一套从游戏视频中移除 UI 的框架,为视频世界模型提供更干净的训练数据。相比基于掩码的去除方法,它在奖励指标上表现更好,说明干净画面能显著帮助世界模型学习。对游戏视频驱动世界模型训练的数据清洗有实用意义。
When "Must" Becomes "Maybe": Constraint Weakening in LLM Agent Workflows
该研究指出多阶段 LLM 工作流中,中间产物的存在会把强约束前提弱化为非约束上下文,即使内容看似完整,操作约束也可能丢失并导致安全失败。它揭示了一个常被忽视的流程设计风险,对需要严格约束执行的工作流有警示意义。