行业动态 36 条
China's CXMT makes its first HBM3E chips, closing the AI memory gap
The Decoder · 08-31 23:17 UTC+8
长鑫存储首次小批量生产 HBM3E,这一高速内存用于当前许多人工智能处理器,意味着中国在 AI 内存供应上缩小差距,对缓解国内算力硬件对外依赖有重要意义。
InfraHBM长鑫存储AI 硬件国产芯片
「GPT-6」灰测demo刷屏!周四发布在即
量子位 · 08-31 12:47 UTC+8
OpenAI 的 GPT-6 灰测演示刷屏,发布时间预计在周四;若属实,新一代模型的能力和发布节奏将对行业产生重大影响。
基座OpenAIGPT-6大模型发布灰测
v1.3.0rc25
TensorRT-LLM · 08-31 11:31 UTC+8
TensorRT-LLM 发布 v1.3.0rc25,为 DeepSeek V3、V4、Kimi K2.5、K3、MiniMax M2、M3、GLM-5、GPT-OSS、Qwen3-Next、Qwen3.5、Qwen3.8、Mistral Large 3、Gemma 3 和 Gemma 4 等模型默认启用 KV Cache Manager V2。新架构提升可扩展性和稳定性,对部署这些大模型做推理的后端团队是重要更新。
推理优化TensorRT-LLMKV Cache推理引擎版本发布
b10720
llama.cpp · 08-31 23:30 UTC+8
llama.cpp 的 ROCm 后端为长行实现了 radix TOP_K 内核,可加速 AMD GPU 上长序列推理中常用的 token 选择操作。这对 llama.cpp 在 ROCm 平台的性能优化是具体改进。
推理优化llama.cppROCmTOP_K推理性能
“你以为买的是 DeepSeek Flash,到手可能是 1.5 bit 缩水版”:Pi 核心贡献者谈 AI Token 黑箱
InfoQ 中文 · 08-31 23:19 UTC+8
InfoQ 报道 Pi 核心贡献者讨论 AI Token 黑箱,指出用户以为用的是 DeepSeek Flash,实际服务方可能采用低比特量化导致质量缩水。这对关注 API 成本与质量一致性的从业者是一记提醒,需要审视第三方服务商的量化策略。
推理优化API 质量模型量化DeepSeekAI 服务
Nvidia’s $3.5B MediaTek bet reveals its plan for tackling Big Tech’s AI chip buildout
TechCrunch · AI · 08-31 23:15 UTC+8
英伟达向联发科投资 35 亿美元,显示出其在大厂自研 AI 芯片趋势下,仍要深度绑定合作伙伴以保持自身在 AI 基础设施中的核心地位。这笔交易可能影响未来 AI 芯片生态。
Infra英伟达联发科AI 芯片战略投资
b10718
llama.cpp · 08-31 22:24 UTC+8
llama.cpp 将 MoE 融合扩展到投机解码,之前 MoE GLU 融合和 topk-router 融合仅支持单 token,现在支持多 token 情况,并加入 SWIGLU_CLAMP 分支。这能提升 MoE 模型在投机解码中的 CUDA 推理效率。
推理优化llama.cppCUDAMoE投机解码
b10715
llama.cpp · 08-31 18:13 UTC+8
llama.cpp 把 DFlash 编码器融进 KV 缓存注入的 decode 阶段,原来是单独的 encode 操作,会造成一次设备到主机往返和额外的图构建。融合后目标特征直接进入 llama_decode,减少开销,对使用 DFlash 的推理流程有性能改进。
llama.cppKV 缓存DFlash推理优化
Triton 3.8.0 Release Notes
Triton · 08-31 08:12 UTC+8
Triton 发布 3.8.0,新增 aggregate 类型为公开 API,包括继承字段、默认值、生成构造函数和不可变实例,并覆盖方言前端、后端编译器等多方面改进。对依赖 Triton 写自定义 kernel 的团队是一个功能更完整的版本。
InfraTriton编译器内核开发版本发布
OpenAI Cursor split 💔, self-improving AI 🧠, GPT-6 Astra 🚀
TLDR AI · 08-31 08:00 UTC+8
本期通讯聚焦 OpenAI 与 Cursor 的合作裂痕、自改进 AI 以及传闻中的 GPT-6 Astra 三个话题。虽然正文未提供细节,但这些线索反映出 AI 工具竞争和模型自改进方向的持续升温。
基座OpenAICursor自改进 AIGPT-6
viable/strict/1788204145
PyTorch · 08-31 23:15 UTC+8
PyTorch 的一个 CI 版本修复了半结构化 bitmask 转换中硬编码 cuda 设备的问题,使设备类型处理更灵活。这属于框架底层修复,对稀疏权重和半结构化稀疏训练推理有稳定性价值。
InfraPyTorch稀疏CUDAbug 修复
b10719
llama.cpp · 08-31 23:06 UTC+8
llama.cpp 为 Apple Silicon M1 添加了 fa-vec 调优,可在 Metal 后端上改善相关 kernel 性能。这对在 Mac 上运行本地模型的用户是一个针对性优化。
llama.cppMetalApple Silicon推理优化
不抢最贵GPU,专捡“没人要”的算力:前英伟达工程师搞出一套“拾荒者”打法
InfoQ 中文 · 08-31 23:03 UTC+8
前英伟达工程师开发了一套「拾荒者」算力方案,专门收集利用市场上被忽视或闲置的低成本算力,而不是争抢最贵的高端GPU。这种做法能显著降低AI训练与推理的算力成本,对预算敏感的团队尤其有参考价值。
Infra算力优化AI Infra成本控制GPU
viable/strict/1788202219: [AOTInductor] Fix user-managed constant handle leak (#194480) (#194480)
PyTorch · 08-31 22:59 UTC+8
PyTorch AOTInductor 修复了用户管理常量句柄泄漏问题,改用 RAIIAtenTensorHandle 管理 ConstantMap 条目,避免张量包装和底层存储引用泄漏。该修复在保持零拷贝和调用方所有权的同时,消除了长期运行中的内存泄漏隐患,对使用 AOTInductor 部署模型的团队很重要。
PyTorchAOTInductor内存泄漏推理优化
自研Runtime、Agent Loop、Infra:一家通用Agent公司的全栈赌注
InfoQ 中文 · 08-31 22:47 UTC+8
报道一家通用 Agent 公司选择自研 Runtime、Agent Loop 和底层 Infra,进行全栈投入,以构建可控性和性能更强的智能体系统。这反映出 Agent 竞争正从模型能力转向系统工程与基础设施层面,对从业者理解技术壁垒有信号意义。
AgentRuntimeInfra全栈
Kubeflow扩展了AI功能,项目临近CNCF毕业
InfoQ 中文 · 08-31 21:31 UTC+8
Kubeflow 新增了 AI 相关功能,并且项目已临近 CNCF 毕业,表明其稳定性和社区采用度达到成熟阶段。对 MLOps 和 AI Infra 从业者来说,这意味着 Kubeflow 将成为更可靠的企业级机器学习平台选择。
InfraKubeflowMLOpsCNCFAI Infra
viable/strict/1788197050: Move partial XPU device property utils to aten (#195146)
PyTorch · 08-31 20:23 UTC+8
PyTorch 将部分 XPU 设备属性工具函数从 torch-xpu-ops 仓库迁移到 aten 核心库,集中设备属性相关代码并修复 Intel 扩展问题。此举有助于改善 Intel GPU 在 PyTorch 中的可维护性和一致性。
InfraPyTorchXPUIntel GPU设备属性
viable/strict/1788193674: Port 3 distributed/_shard tests to Intel GPU. (#189337)
PyTorch · 08-31 19:43 UTC+8
PyTorch 将 3 个分布式/_shard 测试移植到 Intel GPU,推进 Intel GPU 上的分布式测试覆盖。这有助于验证和提升 PyTorch 分布式功能在 Intel 硬件上的兼容性。
InfraPyTorch分布式Intel GPU测试
b10717
llama.cpp · 08-31 19:21 UTC+8
llama.cpp 增强 SYCL 后端,通过 Level Zero 和 SYCL API 获取 Intel GPU 的空闲内存信息,并更新了相关文档。这改善了在 Intel GPU 上运行 llama.cpp 时的显存监控能力,便于资源管理。
推理优化llama.cppSYCLIntel GPU显存管理
viable/strict/1788187801
PyTorch · 08-31 18:50 UTC+8
PyTorch 修复了 MPS 后端中 pad 操作对秩大于 4 且内部元素数超过 2^16 的张量造成数据损坏的问题。该修复提升了 MPS 设备上张量操作的可靠性,对使用 Apple Silicon 进行高阶张量计算的开发者很重要。
InfraPyTorchMPSbug修复张量操作
OpenClaw 2.0 brings simplified setup, a rebuilt browser app, and multiplayer sessions
The Decoder · 08-31 18:46 UTC+8
OpenClaw 基金会发布开源 AI 平台 2.0 版本,累计超过 1.6 万个拉取请求,新增租用机器上的云会话、实时协作和从零重写的浏览器应用,并在安装时自动检测已有的 API 密钥和 AI 订阅。这些改进大幅简化了部署和协作体验,对开源 Agent 平台用户具有吸引力。
AgentOpenClaw开源Agent平台协作
b10714
llama.cpp · 08-31 17:41 UTC+8
llama.cpp 针对 AMD Strix Halo 和 RDNA3 架构调优 Vulkan 后端的矩阵-向量乘法行数,在四列以上场景固定为 4 行,实测比默认值更快。这一优化能提升批量推理性能,对使用 AMD 集成显卡或 APU 运行本地模型的用户有益。
llama.cppVulkanRDNA3推理优化
OpenAI and rival AI labs are buying tens of thousands of Mac minis to train computer-use agents
The Decoder · 08-31 16:55 UTC+8
OpenAI 等 AI 实验室大量采购 Mac mini 和 Mac Studio 用于训练计算机操作智能体,Anthropic 也依赖苹果硬件,导致高端型号数月售罄,苹果 Mac 营收大幅增长。这表明 Apple Silicon 在某些 Agent 训练负载上成为英伟达 GPU 的替代选择,对算力选型有参考意义。
厂商动态OpenAIAnthropicMacAgent训练
范式与华为达成重磅算力战略合作,成为首批拥抱国产最高端算力底座的AI企业
量子位 · 08-31 15:34 UTC+8
范式与华为达成算力战略合作,成为首批采用国产最高端算力底座的 AI 企业。这一合作体现了国产算力生态在 AI 训练与推理中的加速落地,对关注国产替代的从业者具有标志性意义。
Infra华为国产算力战略合作AI Infra
OpenAI买几万台Mac搞强化训练!英伟达的活被苹果抢了
量子位 · 08-31 11:24 UTC+8
报道称 OpenAI 购买数万台 Mac 用于强化学习训练,指出在某些 Agent 训练负载中苹果硬件替代了英伟达 GPU 和谷歌 TPU 的角色。这反映出苹果芯片在特定 AI 工作负载中的竞争力,值得算力规划者关注。
后训练OpenAIMac强化学习算力
gfx950-tutorial-v2.1
Triton · 08-31 11:20 UTC+8
Triton 发布 gfx950 教程 v2.1,将教程基准更新到上游主分支,并添加 AMD gfx950 架构下对 LLIR 调度器和 amdgcnas 插件的支持,引入相关编译标志。这为开发者针对 AMD 新架构优化 kernel 提供了更完整的工具链指导。
InfraTritonAMD gfx950编译器教程
AQuA:让量化研究 Agent 持续进化,也让回测结果经得起检验
量子位 · 08-31 11:01 UTC+8
AQuA 系统旨在让量化研究 Agent 持续进化,同时保证回测结果的可信度,强调区分真实新证据与偶然高分。这一思路对构建自主量化研究系统具有方法学价值,避免过拟合和虚假发现。
量化研究Agent回测可靠性
Understanding ChatGPT Work
Simon Willison · 08-31 07:59 UTC+8
Simon Willison 解析 OpenAI 的 ChatGPT Work 产品,指出其实际包含云端版和桌面版两个产品,云端版可通过网页或移动端访问,产品迭代快但功能强大且令人困惑。这对从业者理解 ChatGPT Work 的产品形态和定位有帮助。
OpenAIChatGPT Work产品分析Agent
b10721
llama.cpp · 08-31 23:56 UTC+8
llama.cpp 修复了 WebGPU 后端在张量获取时 offset 非 4 字节对齐导致的崩溃问题,提高了 WebGPU 推理的稳定性。对使用浏览器端本地推理的开发者来说,这一修复能避免特定情况下程序退出。
Infrallama.cppWebGPUbug修复推理
OpenClaw 从意外爆红到“无人问津”:一个开源 AI Agent 的八个月过山车
InfoQ 中文 · 08-31 23:27 UTC+8
报道开源 AI Agent 项目 OpenClaw 从意外爆红到热度消退的八个月历程,分析其兴衰原因。这一案例揭示了开源 Agent 项目在缺乏持续维护和社区治理时面临的生存挑战。
OpenClaw开源Agent开源项目生命周期
坚决不用行业标准AGENTS.md,Claude Code惹来“封杀令”:Anthropic终于回应了,但开发者更气了
InfoQ 中文 · 08-31 23:03 UTC+8
Anthropic 的 Claude Code 拒绝采用行业标准 AGENTS.md 文件,引发开发者不满甚至封杀呼声;Anthropic 回应后开发者情绪未平。这反映了 Agent 工具配置标准之争,对制定开发规范的企业有警示意义。
AgentClaude CodeAnthropicAGENTS.md开发者生态
Meta用一整年证明Agent无法取代员工:事故增四成,工程师救火多七成
InfoQ 中文 · 08-31 22:56 UTC+8
Meta 一年实践表明 Agent 未能取代员工,反而导致事故增加四成、工程师救火工作量增加七成。这一数据提示当前 Agent 在生产环境中仍有明显局限,企业应理性评估自动化收益。
MetaAgent生产事故人机协作
Cisco 给 9 万员工配上个人 Agent:记住你的一切,还能替你跨系统办事
InfoQ 中文 · 08-31 22:20 UTC+8
思科为 9 万名员工部署个人 Agent,能够记忆员工信息并跨系统代办事务。这展示了企业级 Agent 的规模化落地,对大型组织推行智能助手具有参考价值。
AgentCisco企业Agent规模化自动化
OpenAI 将全面断供 Cursor:SpaceX 收购后触发控制权条款
InfoQ 中文 · 08-31 22:16 UTC+8
OpenAI 因 SpaceX 收购触发控制权条款,将全面停止对 Cursor 的供应。这一变化可能影响 Cursor 用户的服务连续性和 AI 编程工具市场竞争格局。
厂商动态OpenAICursorSpaceX供应中断
viable/strict/1788182929
PyTorch · 08-31 17:30 UTC+8
PyTorch 清理了 autoheuristic fuzzer 中残留的 mixed_mm 代码,移除已废弃的混合矩阵乘法相关逻辑。这有助于简化模糊测试工具,减少维护负担并提升代码清晰度。
InfraPyTorchautoheuristic代码清理模糊测试
viable/strict/1788180922
PyTorch · 08-31 16:56 UTC+8
PyTorch 的 nativert 组件在 JSON 标量类型转换中新增对 UINT64、UINT32 和 FLOAT8E8M0FNU 类型的处理。这增强了原生运行时对多种数据类型的支持,对使用相关序列化功能的开发者有帮助。
InfraPyTorchnativert数据类型JSON转换