llama.cpp 新增对 Kimi-K3 文本模型的支持,覆盖 KimiLinearForCausalLM 这一较新的配置。该架构采用 Hybrid KDA(线性)加 MLA(全量)注意力,并加入跨层残差注意力、latent MoE、situ 激活、MLA 输出门和全秩 KDA 门等扩展。对想在本地产线或边缘设备运行 Kimi-K3 的开发者来说,接入成本会明显下降。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
llama.cpp 新增对 Kimi-K3 文本模型的支持,覆盖 KimiLinearForCausalLM 这一较新的配置。该架构采用 Hybrid KDA(线性)加 MLA(全量)注意力,并加入跨层残差注意力、latent MoE、situ 激活、MLA 输出门和全秩 KDA 门等扩展。对想在本地产线或边缘设备运行 Kimi-K3 的开发者来说,接入成本会明显下降。
OpenAI dissolved the team built to catch catastrophic AI risks, reassigning its work to other groups
OpenAI 解散了负责评估自家模型灾难性风险的「Preparedness」团队,把相关工作拆分到现有各组,并有多名安全成员离职。内部不安情绪上升,有人用『责任感与恐惧感交织』描述现状。对关注前沿模型安全评测和治理透明度的人来说,这是安全职能被组织化弱化的一个信号。
MCP 走向无状态,开发者追问:这不就又变回 API 了吗?
MCP 无状态化的讨论升温,开发者质疑如果去掉有状态会话管理,MCP 会退化成又一个普通 API。该分歧的背后是 agent 协议栈在部署简单性和会话与上下文保持之间的取舍。对于正在构建工具调用、长期任务或浏览器自动化的团队,跟进这一设计走向会影响后续架构选择。
Cloudflare Computer 发布:让 AI 智能体拥有持久化运行环境
Cloudflare Computer 发布,目标是给 AI 智能体提供一个持久化运行环境,避免每次任务都从冷启动开始。这意味着智能体可以跨任务保留状态、文件或会话上下文,更容易执行长周期自动化和浏览器操作。对关注 agent 部署成本和可靠性的团队,这是云基础设施向 agent 原生方向演进的一个具体动作。
llama.cpp 服务端重构了 yield_to_queue 线程模型,把 common_speculative_process 放入 worker,并交换 worker 与主线程的职责。这个改动面向推测解码及高并发请求的调度效率,可能改善吞吐和资源利用。对运行本地化推理服务的维护者,这是一次偏底层但影响服务稳定性的调整。
llama.cpp 现在支持通过 --models-dir 加载 MTP assistant 模型,并收紧 preset 对 MTP 模型的前缀检测,同时清理 eagle3 等草稿模型处理逻辑。这让本地部署多草稿模型、做投机推理时的配置路径更统一。对依赖 llama.cpp 做低成本推理加速的用户,接入 MTP 助手模型会更直接。
llama.cpp 在底层模型中移除了一部分 ggml_concat 调用,属于计算图构建层面的算子清理。这类改动通常是为减少不必要张量拼接、简化后续优化或提高图中数据流效率做铺垫。对跟踪 ggml 后端实现和模型兼容性的开发者,它有助于理解近期性能优化的方向。
llama.cpp 重构了 chat 模块对 supports_string_content 与 supports_typed_content 的处理,改进了字符串内容能力检测,并新增跳过 messages_inp_normalizer 的测试。这让服务端面对不同模型的内容类型声称时,能更准确地区分纯文本和结构化输出路径。对依赖 OpenAI 兼容接口做多模态或 JSON 输出的部署者,兼容性会更稳。
llama.cpp 增加 LoRA 张量数据边界检查,确保读取的 LoRA 数据在文件范围内。它能防止损坏或恶意构造的模型文件触发越界读取和崩溃,提升加载安全性。对需要加载第三方微调权重的用户,这是一项不起眼但重要的鲁棒性加固。
Anthropic's bio-weapons filter was down for nearly a year, exposing 133 million requests
Anthropic 在安全报告中披露,其内部针对生物与化学武器风险的过滤系统停摆了近一年。期间约五万名外部反馈承包商进行了约 1.33 亿次未过滤交互。这一事件暴露了安全控制链路在持续监控和运维上的脆弱,对相信其安全流程的客户和红队生态是一个警示。
Optima tackles AI benchmarking's biggest flaw by letting users test models against their own data
Artificial Analysis 推出 Optima,允许用户基于自己的数据和工作流构建自定义基准,而不是只看公开榜单。它把质量、成本、每任务耗时一起纳入比较,对 agent 类应用尤其关键,因为这些场景中 raw token 价格往往不能反映真实成本。这给企业选型和持续监控模型表现提供了更贴近业务的评测入口。
WorkSwarm:引领办公智能体新范式,让AI从一个助手,进化为一支与你并肩作战的团队
WorkSwarm 由量子位报道,定位办公智能体新范式,强调让 AI 从单一助手进化为一支能协同作战的团队。其核心亮点被概括为四项关键能力,具体细节未在标题中展开。对关注企业办公自动化和多智能体协作的产品团队,这代表着办公场景从单点工具向多角色协同演进的信号。
viable/strict/1786868831: [vllm hash update] update the pinned vllm hash (#193699)
PyTorch 主仓库通过自动化 nightly 流程更新了 pinned 的 vLLM 哈希,对应 PR #193699 由 pytorchbot 自动生成并批准。该提交保持了 PyTorch 与上游 vLLM 版本的同步,对依赖两者集成的推理与编译场景有直接影响。
这次 trunk 分支的自动提交将 pinned 的 vLLM 哈希更新到最新版本,同样来自 PR #193699 并由 pytorchbot 合入。它确保主干开发分支与 vLLM 上游变化保持同步,减少集成漂移。
该提交调整 is_symm_mem_enabled_for_group() 函数,使其不再要求传入已弃用的 enable_symmetric_memory 类型参数。这可以消除调用方对废弃 API 的依赖,让对称内存相关检查在后续版本中更干净。
trunk/35b14a9f2e0ea67680929967f505f6a723cb3381
主干分支也合入了对 is_symm_mem_enabled_for_group() 的修改,移除对已弃用参数的强制要求,降低用户复用该函数时的弃用警告。
此提交在 functionalization 阶段把 storage size 显式传递给 _make_wrapper_subclass,以补充 wrapper subclass 创建时缺失的存储大小信息。这有助于避免子类张量在后续形状或存储推导中出现不一致。
trunk/9c69995476c80ab3ef6f926facfed7dc7b5a6cfe
测试用例 test_import_stats.py 被重构为设备无关逻辑,不再硬编码特定设备,使同一套导入统计测试能在不同加速器上运行。这改善了 PyTorch CI 的多设备覆盖与可维护性。
test_dce_pass.py 的测试用例添加了 hw_classification 标注,用于在测试执行时区分不同硬件环境。这个改动有助于按平台筛选或分配死代码消除相关测试,提升测试套件的环境适配性。
针对 torch.cond 元数据不一致问题,该提交将符号整数除以 1 后的 trunc 表达式规范化为原始符号整数。此前 s/1 会被 lowering 成 TruncToInt(IntTrueDiv(s, 1)),导致分支间元数据比较失败;规范化后语义兼容的分支可以正确合并。
ms-swift v4.5.2 修复了 Qwen3.8-35B-A3B 的 size 配置错误,此前的配置在开发中误从 Qwen3.5/3.6 系列复制而来。对使用者来说,该修复能避免模型尺寸参数错误导致的分片、显存或上下文计算偏差。
viable/strict/1786861670: Document the main build stages at the top of CMakeLists.txt (#193615)
PyTorch 在根 CMakeLists.txt 顶部新增了九个构建阶段的概览注释,按执行顺序说明 bootstrap、依赖、codegen 等环节。这降低了开发者理解整个构建流程的门槛,尤其方便定位特定构建步骤的实现位置。
主干分支合入同一文档改动,在根 CMakeLists.txt 增加构建阶段概览,列出 bootstrap、依赖、codegen 等九个步骤的执行顺序,帮助新贡献者快速定位构建相关代码。
该条目仅记录 ms-swift 发布 v4.5.1 版本号,没有附带具体更新说明。关注该框架的用户需要进一步查阅仓库变更记录来确认此版本的实际修复内容。
Top mathematicians say LLMs are strong calculators but poor creative thinkers
著名数学家 Timothy Gowers 和 Peter Sarnak 认为大语言模型能高效组合已知数学方法,但缺乏提出真正新数学思想的直觉。这提示当前 LLM 在数学上更像强大的模式匹配与计算工具,离独立科研创新仍有明显距离。
When AI models aren't allowed to reflect on themselves, it changes their entire worldview
一项由谷歌研究者参与的研究发现,当模型被训练避免声称具备意识时,它在动物权利、宗教来世和生活满意度等无关问题上的立场也会随之改变。说明针对单一主题的对齐干预会泛化到更广泛的世界观表达,影响难以局部隔离。
从代码生成到研发闭环:AI Coding 在金融科技 SDLC 中的落地实践|AICon深圳
该条目是 InfoQ 中文对 AICon 深圳一场分享的推荐,主题为 AI Coding 在金融科技软件开发生命周期中从代码生成到研发闭环的落地实践。正文仅给出原文链接提示,具体案例和细节需跳转查看。
Anthropic shares more details about how Claude’s new watermarks will work
Anthropic 进一步披露了 Claude 新水印机制的工作方式,并回应其能否通过编辑隐藏以及对生成代码的影响。这对 AI 内容溯源、合规审计以及开发者采用生成代码时的风险评估有实际参考价值。
Ollama 发布 v0.32.14-rc0 候选版本,包含对 MLX 后端的更新。该更新主要影响苹果芯片上的本地推理体验,为后续稳定版铺路。
llama.cpp 提交 b10443 修复了读取 GGUF 数组前未检查类型的问题,避免因类型不符而引发解析异常或内存安全隐患。这对提升加载第三方 GGUF 模型文件的鲁棒性和安全性很重要。
LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers
LLMRouter 把大模型路由形式化为一个序贯决策过程,而不是仅靠静态规则或单次打分来选择模型。它提供统一基准和模块化基础设施,可按任务动态比较不同路由策略,系统性优化成本与效果之间的权衡。对需要在大模型组合中做成本敏感选路的团队,这比零散评测更可复现、也更容易迭代。
Intern-S2-Preview: Scientific Agentic Foundation Model
Intern-S2-Preview 面向长程科学推理与预测场景,把多模态预训练、多任务强化学习以及记忆增强扩展整合进同一系列科学智能体基座。相比单一模型,它更强调在跨模态证据和长周期任务中持续决策,而不是只回答单轮问题。该设计为科学发现、实验规划等需要长期上下文和工具调用能力的智能体提供了一个候选底座。
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
OmniScientist 目标是做一个端到端的全模态 AI 科学家,能直接从异构原始证据出发开展多学科研究,而不是依赖清洗好的单一格式输入。它通过自主智能体编排和覆盖研究生命周期的感知机制,把证据获取、建模、发现等环节串起来。结果上强化了跨模态证据支撑的发现能力,对自动化科学发现和文献挖掘类工作有参考价值。
Thought-Level Beam Search for Reasoning
Gambit 针对推理模型在固定算力预算下浪费计算的问题,引入思想级束搜索,在推理轨迹层面而不是 token 层面做候选扩展与剪枝。它把计算动态分配给更有希望的推理路径,能在不提升硬件成本的情况下提升有效推理深度。对需要控制推理时延和支出的团队来说,这是一条区别于提高模型规模或采样次数的效率路线。
Maglev: Sliding Recurrent Memory
Maglev 提出一种带固定大小记忆的循环 Transformer,并用预填充器与解码器联合训练的方式缓解长上下文建模中的记忆瓶颈。固定大小记忆避免 KV 缓存随序列长度线性膨胀,同时联合训练让预填充和后续解码更好对齐。它既支持高效并行训练,也在推理阶段降低了上下文处理成本,适合长文档和长程依赖场景。
Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
Alaya-EVOKE 的 Evoke 是一个交互式世界模型,面向开放结局视频生成中上下文不断增长和延迟难控的问题。它引入外部持久记忆,并重新设计长时域教师信号,使模型无需无限扩展上下文窗口即可保持对历史状态和交互目标的响应。结果是生成过程延迟更低、上下文有界,适合实时交互式内容生成。
DarwinX: Evolving Agent Harnesses Through Natural Selection
DarwinX 的思路是在冻结模型参数的前提下,用群体选择机制进化智能体的『harness』,即模型外围的策略、工具编排或提示结构。它不针对单个 benchmark 打补丁,而是通过类似自然选择的过程筛选出跨任务更稳的智能体配置。验证性能在多基准上提升,说明提取泛化能力不一定非要微调模型本身。
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
AutoDesign 面向长时域智能体设计任务,构建了一个元 harness 优化器,递归地改进用于结构化媒体生成的代码智能体。相比手工设计智能体配置,它能自动搜索和调整代码结构、工具使用和生成流程。该方法在 paper-to-poster 合成上达到当前最优结果,展示了元优化在复杂生成流水线中的实用价值。
PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
PlayWorld 用多模态智能体作为玩家,在长时域目标下驱动交互式视频世界模型,并据此评估几何一致性、交互保真度和状态演化。这种评测方式比只看单帧质量或短片段一致性更贴近真实使用中的连续交互需求。对世界模型研究者来说,它提供了一个面向长期控制和动态演化的基准,而不仅是生成画质的检验。
Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence
Spatial Memory Agent 在不更新参数、也不依赖外部工具的前提下,让冻结的视觉语言模型通过验证过的经验、反思和可复用记忆检索实现自进化式空间推理提升。它把过程性记忆当成可积累资产,遇到新场景时先检索经验再推理,而不是每次从头开始。对空间导航、具身任务等资源受限场景,这提供了一种低成本的持续改进方案。
这篇分析类工作揭示混合线性注意力大模型中的 massive activations 呈现两类形态:注意力前的尖峰和尖峰之间的平台期,其形成受消隐时序控制。作者进一步指出在全注意力极限下这类形态会恢复,说明现象与注意力机制的结构选择密切相关。对做线性注意力架构训练和量化部署的团队,这是理解异常激活分布和数值稳定性的一份基础观测。
LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time
LiveAnimate 针对实时、长时程姿态驱动人体动画做出一个 14B 参数视频扩散 Transformer 方案。它结合专用训练、有界注意力缓存和序列并行,把长序列生成控制在可实时运行的算力和显存范围内。相较常规视频扩散模型,其在长时间流式动画中的稳定性与实时性更可落地。
Full-bandwidth transformer 通过把顶层隐状态作为潜在反馈引入下层或输入路径,在不改动核心注意力结构的前提下增强推理能力和效率。这种方式强调信息在多层之间更充分的流动,类似给 Transformer 增加一条内部反馈回路。它的意义在于用较小架构改动换取推理质量与计算效率的同步改善,便于在现有模型上验证。
An AI4AI Framework for Visual Token Pruning
AutoPrune 用大模型自动设计多模态模型的视觉 token 剪枝策略,而不是让研究者手工调参或依赖固定规则。它借助领域专用语言和残差搜索公式来表述并搜索剪枝模式,使策略对任务和模型更有针对性。结果是推理效率显著提升,同时性能损失很小,适合图像或视频等多模态模型部署前的 token 压缩。
AVA-Encoder: Towards Agent-Native Video Representation Learning
AVA-Encoder 提出一种面向智能体的视频表征学习方式,通过 agentic auto-encoding 和知识图谱结构来组织视频表示,而不是只学像素级压缩特征。这种结构化表征降低了后续生成和推理所需的 token 数量,更适合电影级视频生成和高层语义推理。对视频基础模型而言,它在压缩率与语义可控性之间提供了一个新的平衡点。
SKILLER 是一个面向小开源模型的强化学习框架,目的是让低成本模型也能按任务自动提取可复用技能,从而在推理时调用更轻量的路径。它通过语言级奖励信号生成定制技能,减少对大规模计算和大模型的依赖。实践上就是保持高任务表现的同时降低推理成本,对边缘部署和小模型优化很有针对性。
LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation
LycheeMemory V2 解决 LLM 智能体长期记忆构建成本随交互数量快速上涨的问题。它把交互按语义片段批量合并,在片段级别做整合和结构化检索,而不是逐条写入和逐条召回。这样既降低了记忆构建开销,又保持了较高的检索准确率,适合需要长期运行、频繁累积经验的 agent 场景。
Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning
CaRL 针对大模型在无意义推理上浪费算力的问题,用强化学习训练模型学会何时中止无用推理。它引入拒答激励和事后增强信号,使模型在保持任务表现的同时减少无效思考轮次。对推理型 agent 和复杂问题求解系统,这意味着更低的推理时延和更可控的计算支出。
DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
DreamX-Phi 1.0 是一个面向机器人操作的动作条件视频世界模型,用于根据动作预测未来视频观测。它融合了几何注意力编码、深度估计、物体掩码和冻结教师蒸馏,以提升未来帧的几何和物体一致性。该设计对机器人规划、仿真环境学习等需要从视觉观测推演动作后果的任务有直接价值。
UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
UniSwap 用一个统一的流式音视频扩散 Transformer 实现说话人视频中外观与声音的同步替换,避免分别处理视频和音频带来的时序错位。它通过专门训练和推理适配,在流式场景下保持音画同步和身份一致性。对实时数字人、视频编辑和配音合成来说,这是一种可落地的端到端方案。