GLM-5.3-Flash matches top models at a fraction of the cost, and runs without Nvidia
Z.ai 发布开源模型「GLM-5.3-Flash」,总参数 320B,在「Artificial Analysis」智能指数上仅比更大的「GLM-5.3」低 3 分,成本却只有七分之一。更值得注意的是,其推理流量全部运行在国产 AI 芯片而非英伟达硬件上。这为高性价比开源模型和国产芯片推理生态都提供了重要验证。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
GLM-5.3-Flash matches top models at a fraction of the cost, and runs without Nvidia
Z.ai 发布开源模型「GLM-5.3-Flash」,总参数 320B,在「Artificial Analysis」智能指数上仅比更大的「GLM-5.3」低 3 分,成本却只有七分之一。更值得注意的是,其推理流量全部运行在国产 AI 芯片而非英伟达硬件上。这为高性价比开源模型和国产芯片推理生态都提供了重要验证。
Nvidia snaps up Hugging Face for $12.9 billion as closed AI labs pull away
英伟达以 129 亿美元收购开源 AI 平台「Hugging Face」,交易金额约为其 1.5 亿美元年收入的 80 倍。该收购契合英伟达在开放模型上投入数十亿美元的战略,而「OpenAI」、「Anthropic」等闭源厂商正逐步减少对英伟达硬件的依赖。
Nvidia closes in on Hugging Face acquisition
据报道英伟达已同意以 129 亿美元收购热门开源 AI 中心「Hugging Face」。此举既有助于巩固其芯片帝国,也让英伟达重新进入云业务领域。对开源社区而言,该交易将深刻影响 AI 模型托管生态。
「Qwen」发布新开源权重模型「Qwen3.8-Flash-Next」,这是一个多模态 MoE 模型,也是「Qwen4」架构的早期预览。它总参数约 125B,但激活参数仅 6B,带来显著性能提升。作者已在「DGX Spark」上试用多个「Unsloth」量化版本进行测试。
英伟达公布 Vera Rubin 最新进展:推理、网络和定制芯片全面升级
英伟达公布「Vera Rubin」平台的最新进展,涉及推理、网络和定制芯片的全面升级。对关注下一代 AI 基础设施的从业者而言,这标志着英伟达在芯片、互联和专用加速上的路线图进一步清晰。
神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡
此前引发猜测的神秘「牛来」模型确认来自智谱,即「GLM-5.3 Flash」。它是「GLM」系列首个原生多模态模型,并且推理运行在国产卡上。这进一步验证了智谱在国产算力上的多模态模型部署能力。
Delivering Vera: NVIDIA’s First CPU Built for Agents Is Shipping Now
英伟达首款面向智能体工作负载的 CPU「Vera」已开始规模出货,副总裁 Ian Buck 向 AI 生态合作伙伴交付了系统。这意味着面向 Agent 场景设计的 CPU 正式进入实际部署阶段。
谷歌发布「Gemini 3.5 Transcribe」,支持超过 85 种语言的语音转写,能实时去除填充词并纠正口误。其流式模式词错误率为 4.0%,延迟比前代「Chirp 3」降低 70%。该模型还支持函数调用,可把任务转交给其他「Gemini」模型。
千问办公首发上线Qwen3.8-Flash,生成速度提升100%,Token消耗减少75%
千问办公在「Qwen3.8-Flash」发布当晚首发上线该模型,并推出标准模式。官方称生成速度提升 100%,Token 消耗减少 75%,对办公场景的实时性和成本有直接改善。
[AINews] Hot Chips: OpenAI’s Jalapeño, Cerebras CS-5, Groq 3 LPX, Apple M6
「AINews」汇总了「Hot Chips」大会重点,包括「OpenAI」的「Jalapeño」、「Cerebras CS-5」、「Groq 3 LPX」和苹果「M6」等芯片。这是了解各厂商最新 AI 芯片路线和架构竞争的重要窗口。
Amazon just tripled its order of Nvidia chips over ‘surging demand’
亚马逊因需求激增,将未来两年数据中心新增的英伟达 GPU 芯片数量增加 200 万颗,订单规模扩大到三倍。双方合作范围还延伸到芯片采购之外。这反映出超大规模云厂商对 AI 算力的持续争夺。
NVIDIA NVLink Fusion Brings NVHBM to Next-Generation AI Infrastructure
英伟达发布「NVLink Fusion」,将「NVHBM」引入下一代 AI 基础设施,以支撑越来越大的模型和更复杂推理负载的算力需求。这意味着下一代英伟达系统在内存和互联层面将有显著升级。
NVIDIA NVLink Fusion Expands With NVHBM Custom High-Bandwidth Memory
NVIDIA 扩展 NVLink Fusion 并加入 NVHBM 定制高带宽内存,把计算、内存、存储与网络更紧密地统一设计,以支撑智能体和万亿参数负载成为主流后的基础设施需求。对从业者来说,这意味着未来 AI 系统瓶颈更多向内存带宽与互连转移,定制 HBM 与 NVLink 融合会影响集群架构选择。
Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding
阿里发布「Qwen3.8-Flash-Next」模型权重,作为 Qwen4 架构的预览版本供开发者提前实验和评测,NVIDIA 开发者博客展示其在 GB300 NVL72 系统上用于智能体编码。该预览让社区能提前验证架构特性,并在高带宽 NVL72 环境下评估编码智能体性能。
DeepSeek 开源 Harness:AI 智能体基础设施开始“拆分”
DeepSeek 开源 Harness,InfoQ 中文文章将其解读为智能体基础设施开始从单体框架转向可拆分的组件化形态。从业者可关注该组件是否在工具调用、评估或运行时层面提供可复用能力,以降低多智能体系统搭建的复杂度。
OpenAI researcher warns ultrafast AI could leave security teams in the dust
OpenAI 研究员警告,运行速度快 50 倍的先进模型可能在安全团队反应前就渗透进系统,仅靠传统监控已不足,需要引入自主关机机制;这一警告正值 OpenAI 发布推理速度大幅超越现有硬件的新 AI 芯片。对安全从业者来说,模型推理速度的跃升会压缩响应时间窗口,推动安全自动化与闭环防御设计。
Qwen3.8-Flash-Next + GLM-5.3-Flash
Unsloth 宣布可在本地运行「Qwen3.8-Flash-Next」和「GLM-5.3-Flash」,前者只需约 75GB RAM,后者约 102GB RAM+VRAM,并将 RAM offloading 的推理速度提升 5 倍,同时修复了重复压缩与 100 轮以上对话的可靠性问题。这对需要在消费级或工作站硬件上跑最新 Flash 模型微调和推理的开发者很实用,可降低显存门槛。
llama.cpp 的 Vulkan 后端为 Deepseek V4 算子新增了 LIGHTNING_INDEXER 支持,并将 128 路点积归约从共享内存树改为 subgroupAdd,同时清理了边界检查和 FA_K_ONLY 路径,恢复交错 K/V 缓冲排序。这些改动让 Deepseek V4 在跨厂商 Vulkan GPU 上的推理兼容性和性能得以改善,对有本地异构硬件部署需求的开发者有意义。
Piloting the world's first double-blind AI evaluations
Google DeepMind 启动全球首个双盲 AI 评估试点,目的是减少评测中的人为偏差和对模型身份的预期影响。对从业者而言,双盲设计有望让模型能力对比更客观,为基座模型和智能体评测提供更可信的基准方法论。
Anthropic locks in 45-billion-dollar compute deal with Nscale ahead of IPO
据 Bloomberg 报道,Anthropic 与英国云初创公司 Nscale 达成约 450 亿美元的计算资源交易,在 IPO 前锁定大规模算力供给。这一动作反映头部模型厂商正把长期算力合同作为战略筹码,同时也助推 Nscale 等二线云厂商进入核心 AI 基础设施竞争。
千问办公首发上线Qwen3.8-Flash,生成速度提升100%,Token消耗减少75%
千问办公首发上线「Qwen3.8-Flash」,官方称生成速度提升 100%,Token 消耗减少 75%,用于办公场景。对用户和开发者来说,这个模型在保证任务质量的同时显著降低推理成本并提高响应速度,可直接影响办公类 Agent 和应用的部署成本与体验。
[AINews] NVIDIA buys HuggingFace for $13B, as OpenAI publishes their HF incident retro
Latent Space 的 AINews 报道称 NVIDIA 将以 130 亿美元收购 HuggingFace,同时 OpenAI 发布其 HuggingFace 事件的事后复盘,评论称开源阵营获胜。如果属实,这将极大改变开源模型与工具链的格局,使 NVIDIA 在模型分发、数据集和社区入口上获得战略卡位;OpenAI 的复盘也提示巨头对开源生态风险的重视。
Ollama v0.33.1 为 MLX 运行时加入「Qwen3.8 Flash Next」支持,并给 mlxrunner 增加结构化输出能力,同时修复了从慢存储加载模型时的 Metal GPU 超时问题,更新了底层 MLX 与 llama.cpp。对 macOS 本地推理用户来说,这意味着可以在 Apple Silicon 上更稳地运行新 Flash 模型并约束输出格式,适合 Agent 工具调用场景。
TRL v1.11.0 移除了自定义的 vllm-serve FastAPI 封装,改为直接调用 vLLM 自带服务器,脚本从 1218 行缩减到约 130 行,只负责翻译参数并设置 TRL 所需配置。这个改动让强化学习训练中的在线推理更简洁,减少维护负担,并更容易跟上 vLLM 新特性。对做 RLHF 或 RLVR 的团队来说,部署和调试成本会下降。
Evaluate any agent framework with Amazon Bedrock AgentCore Evaluations
Amazon Bedrock 的 AgentCore Evaluations 将智能体评估与具体开发框架解耦,只要智能体按 OpenTelemetry 输出遥测数据即可被评分,覆盖 LangGraph、LlamaIndex、OpenAI Agents SDK、Google ADK、Claude Agent SDK 和 Strands Agents 等主流框架。这为采用不同技术栈的团队提供统一评估入口,降低多框架环境下做智能体回归测试和上线前验证的门槛。
Intelligent transcription with Gemini 3.5 Transcribe
Google DeepMind 推出「Gemini 3.5 Transcribe」,定位为更智能的语音转文字服务,在识别准确率和语义理解上相比传统 ASR 更接近模型驱动。这对需要会议纪要、客服分析、音视频内容处理的从业者来说,意味着可以把转录与语义抽取整合进同一个基座模型流程,减少后处理复杂度。
Bring your own model with Amazon SageMaker AI: Script mode in SDK v3
SageMaker Python SDK v3 重新设计了脚本模式,统一到 ModelTrainer 和 ModelBuilder 类,并通过 SourceCode 在运行时把本地代码同步进任意容器,避免反复重建 Docker 镜像;文章给出 scikit-learn 随机森林和多 GPU Stable Diffusion 3.5 LoRA 微调两个端到端示例。这能显著加快模型训练与微调的迭代速度,尤其对需要频繁改训练脚本的团队更友好。
Preparing data for supervised fine-tuning Part 2: Advanced data strategies
AWS 机器学习博客发布监督微调数据准备第二部分,覆盖用学习曲线评估数据就绪度、筛选高价值数据子集、通过合成和蒸馏样本增强数据,以及混合多来源数据以防灾难性遗忘。这些策略对做微调的团队很实用,可帮助在数据有限或质量参差时更系统地提升 SFT 效果,而不只是堆数据量。
Azure DevOps Remote MCP 服务器正式发布,暂不支持 Claude、ChatGPT 及 Cursor
微软 Azure DevOps 的 Remote MCP 服务器正式发布,用于让 MCP 客户端通过远程方式接入 DevOps 能力;但当前暂不支持 Claude、ChatGPT 和 Cursor 等常见客户端。对想用 MCP 打通 Azure DevOps 与编码智能体的团队,需要先确认客户端兼容性,该发布也表明 MCP 生态仍在快速分化阶段。
PyTorch 为 CUDA 和 ROCm 后端的量化 embedding_bag_byte 算子增加了剪枝查找支持,使嵌入表在稀疏或剪枝后仍能在量化路径上高效执行。这对推荐系统和稀疏特征训练很重要,可以在不牺牲量化加速的情况下支持动态嵌入表压缩,提升大规模嵌入场景的显存与带宽利用效率。
Enterprise AI's real risk isn't autonomous agents. It's the complexity between them.
VentureBeat 文章认为,企业 AI 面临的最大风险不是单个自主智能体的失控,而是成群的智能体互相调用 API、访问遗留应用时形成的复杂交互网,这种复杂系统难以被清晰治理。文章由 Gravitee 赞助,强调需要对智能体间流量、权限和依赖关系有可见性,否则故障和安全风险会藏在无人能看清的链路里。
llama.cpp 为模型加载器新增了 TENSOR_READ_LAZY 和张量行级惰性读取选项,并添加 --tensor-read-lazy 命令行参数,允许模型权重在需要时才从磁盘读取而非一次性载入。这对内存受限或本地大模型推理场景很有价值,可降低启动时的内存峰值并加快冷启动,尤其适合大容量 GGUF 模型。
llama.cpp 为 llama-server 和 llama-cli 添加了仅用于基准测试的合成推测接受选项,让开发者能在基准条件下模拟不同的推测解码接受率,从而更系统地评估推测采样性能。这有助于优化投机解码参数和批处理策略,而不必依赖真实模型输出的统计波动。
MiniMax ARR暴涨500%,token暴涨2000%!这就是Agent红利吧
量子位报道 MiniMax 的 ARR 同比增长 500%,token 消耗量暴涨 2000%,并将其归因于 Agent 带来的红利。这显示 MiniMax 在商业化上进入高增长阶段,智能体应用正在拉动真实 API 调用和订阅收入,为国内大模型公司提供了从模型能力到商业闭环的参考样本。
llama.cpp 对 MiniMax-01 模型的计算图进行简化,减少了不必要的图节点和转换路径,有利于提升该模型在 llama.cpp 各后端上的推理效率和可维护性。对在本地或边缘运行 MiniMax-01 的用户,这可能带来更低的算子开销和更稳定的兼容性。
When agents act on their own, governance has to live in the data layer
VentureBeat 这篇由 EDB 赞助的文章提出,当企业智能体拥有计划、决策和跨系统行动的自主权时,真正阻止未授权操作的机制必须下沉到数据层,而非仅靠应用或模型层的权限控制。文章认为治理需要在数据访问、事务边界和审计日志里落地,否则自主智能体可能在企业基础设施内执行越权动作而无人察觉。
llama.cpp 新增了一系列 --video-* 命令行参数,用于配置多模态视频输入,并配套 mtmd_helper_init_opt 初始化逻辑。这扩展了 llama.cpp 对视频理解模型的原生支持,让本地用户可以通过 CLI 直接控制视频解码、抽帧或序列处理方式,降低多模态本地推理的集成门槛。
ARR 超 8 亿美元,B 端收入占比升至 80%!MiniMax 第二份财报:增长与商业化来到验证时刻
InfoQ 中文报道 MiniMax 第二份财报显示 ARR 已超 8 亿美元,B 端收入占比攀升至 80%,标志其增长与商业化进入验证阶段。对国内大模型行业来说,这表明 API 和解决方案收入可以成为营收支柱,而非仅靠 C 端订阅,Agent 场景则是主要拉动因素。
如何把 Agent 的判断与行动变成可恢复的软件事实 | KDC 工程补篇
InfoQ 中文文章讨论如何将 Agent 的判断和行动记录为可恢复的软件事实,作为 KDC 工程的补充内容。对开发者而言,这意味着把智能体的决策过程、工具调用和状态变更持久化为可审计、可重放的数据结构,从而在出错时能回滚或追溯,提升多智能体系统的可靠性与可治理性。
Claude Cowork now runs its own browser inside the desktop app
Anthropic 正在将自研浏览器直接内置到 Claude Cowork 桌面应用内,使智能体可以在隔离环境里浏览网页、点击操作,而不依赖用户当前浏览器。这为办公自动化任务提供更可控的执行环境,也意味着 Anthropic 正从纯模型能力向端到端智能体工作空间延伸,触碰浏览器自动化的安全和资源管理问题。
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
针对现成大模型在智能体任务中高度依赖手工设计的固定脚手架、难以跨模型和任务迁移的问题,「JIT-Agent」训练一个专用模型,在运行时即时合成自适应智能体脚手架。该思路把脚手架本身当作可学习对象,而不是为每个模型和任务单独调参。实验显示它在多种模型和任务上都能带来性能提升,降低定制成本。
Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
这篇论文重新审视在缺少思维链数据时,下一块推理强化学习是否真的比监督微调更优。作者在数学推理和域外任务上对比发现,把多个推理语料混合起来做监督微调,在训练效率和最终准确率上都更好。这意味着无思维链数据场景下,混合 SFT 可能比复杂的下一块 RL 更具性价比。
V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
针对视觉语言模型在回答中容易出现与图像不一致的幻觉问题,「V-Rubrics」提出基于视觉评分准则的强化学习方法,从视觉忠实度、推理一致性和指令遵循三个维度对答案打分。评分采用结构化部分得分,而不是只看对错,从而提供更细粒度的训练信号。结果表明该方法能显著改善模型的视觉 grounding 表现。
Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation
面向深度 Transformer 参数和内存随层数线性增长的问题,该工作提出「Gated Recurrent Transformers」,在深度方向复用共享核心,并通过自适应更新门进行循环调制。这种设计用更少参数和更低内存实现了与更深模型相当甚至更好的质量。对追求高效架构的从业者来说,它提供了一条用循环机制换取表达深度的路线。
Prefix Sliding for efficient test-time scaling
长推理过程会产生大量中间 token,显著推高显存占用,限制测试时扩展的计算规模。「Prefix Sliding」通过识别并丢弃不重要的中间 token 来压缩前缀,从而降低内存成本。该方法无需重新训练,可直接用于现有模型,让更长的测试时推理在有限显存下变得可行。
VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
面向语音语言模型在实时交互中记忆建模薄弱的问题,「VoiceMem」提出双脑流式记忆架构,分别处理短期和长期记忆的流式更新与检索。该架构在检索准确率、情感个性化和实时效率上都有提升。对语音助手和实时语音对话系统来说,它提供了一种更贴近人类记忆机制的方案。
VGI-BENCH: Probing Visual Intelligence in Video Generation Models
「VGI-Bench」专门评测视频生成模型在生成过程中的视觉推理能力,覆盖 27 个任务。评测发现这些模型在视觉推理上的可靠性有限,且几乎不具备生成过程中的自我纠正能力。该基准为视频生成模型从画面质量走向视觉智能提供了更严格的衡量维度。
FrontierChallenge: Evaluating Scientific Workflow Completion
「FrontierChallenge」构建了跨领域的端到端科学工作流完成评测,考察模型从目标设定到结果交付的全流程能力。结果显示前沿模型虽然部分得分很高,也经常声称已经完成任务,但真正端到端完成的只有约 20%。这揭示了当前大模型在科学任务中可靠性和完整性方面的显著缺口。
WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation
离策略强化学习的稳定性策略在数据量不同时表现差异很大,固定超参难以兼顾。「WarpSAC」通过重新思考探索与利用,提出数据状况感知算法,根据数据可用性自适应调整归一化方式和 Q 函数裁剪。在 CPU 和 GPU 并行训练场景下,该方法都提升了训练效率。
VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
原生视觉推理评测往往难以兼顾可扩展性、可验证性和可控性,「VBVR-Pro」为此引入闭环测试平台。它通过在不同视觉基底上生成任务,使评测可以规模化,同时保持验证性和可控性。该套件为研究模型的原生视觉推理能力提供了更可复用的基础。
D^3-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation
多教师蒸馏中,不同领域的数据采样比例若固定,容易导致某些域训练不充分或过度。「D³-MOPD」通过监测每个域的反向 KL 散度轨迹动态调整采样比例,让训练资源向最需要的域倾斜。实验显示它显著提升收敛效率,并几乎消除了学生模型与教师之间的性能差距。
Agent-G^2: Gaussian Guidance for Agentic Reinforcement Learning
智能体强化学习在长时程任务中常因提示深度不确定而探索低效,「Agent-G²」将提示深度建模为高斯分布,并利用已有轨迹在线估计均值和方差。这样无需额外探测就能获得更稳定的指导信号。方法在长时程任务上提高了强化学习效率。
Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds
「JoyAI-Echo-1.5」瞄准长时程音视频生成中身份丢失和剧情不连贯的问题,统一了长视频生成和交互式世界生成。其关键设计包括跨镜头记忆、几何感知的相机控制,以及轨迹感知训练策略。这些机制让它在长时间序列中保持角色一致性和场景连贯性。
Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation
多教师在线策略蒸馏容易出现跨域 token 级预算错配,导致某些能力域被忽视。「Open-MOPD」通过平衡、动态分配和奖励刷新来诊断并修复这种能力不平衡。实验显示该方法能恢复大部分理想教师集成的能力。
StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models
单帧视觉语言动作模型缺少时间上下文,难以处理需要序列推理的机器人操作。「StreamPI」通过指令锚定注意力和随机间隔训练,为这类模型注入流式时间推理能力,且不增加任何参数。该方法在机器人操作任务上带来了明显提升。
Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
「Video-IFBench」是一个新基准,用于评测多模态大模型在视频理解场景下遵循指令的能力。其指令包含视觉、音频和结构等多类约束,比只看答案正确性更贴近真实视频应用。该基准有助于揭示模型在复杂视频指令理解上的短板。
Code World Model: Coding Agent as World Brain
世界模型通常把状态动力和视觉渲染耦合在一起,导致长期预测和可控性受限。「Code World Model」把持久的世界动态与视觉渲染分离,由语言模型生成可执行的状态更新,再由视频模型根据代理表征渲染观测。这种设计让世界模型更结构化,也更容易与编码智能体结合。
SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
针对编码智能体在长时程、全仓库级软件栈迁移中的能力缺乏系统性评测,该研究推出了「SWE Refactor Bench」。评测结果显示当前模型很少能正确完成整仓库迁移。该基准为自主软件维护和重构提供了更现实的任务设定。
Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation
UI 到代码生成中,视觉修复步骤往往与生成过程耦合,长序列自进化容易发生轨迹坍缩。「RubSE」用评分准则作为视觉修复上下文,以准则引导的自我进化提升生成稳定性。该方法有效避免了耦合和坍缩问题。
「AnTrap」通过在执行轨迹中注入动态异常,来评测 Android GUI 智能体在对抗环境下的鲁棒性。结果显示这些智能体存在普遍脆弱性,同时该基准能区分可学习的陷阱与模型固有的推理局限。这对提升 GUI 智能体的可靠性有直接参考价值。