闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5
该新闻指出 Kimi K3 通过包含 18 个智能体的自主科研 Harness,能力逼近闭源 Opus 5,经典 RSI(递归自我改进)剧本开始动摇。对从业者而言,这显示大规模多智能体科研流程正在成为缩小与闭源前沿模型差距的有效路线。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5
该新闻指出 Kimi K3 通过包含 18 个智能体的自主科研 Harness,能力逼近闭源 Opus 5,经典 RSI(递归自我改进)剧本开始动摇。对从业者而言,这显示大规模多智能体科研流程正在成为缩小与闭源前沿模型差距的有效路线。
[AINews] Death of Params: Z.ai CEO Jie Tang on GLM 5.3 and the new Post-training Scaling Law
Z.ai 首席执行官 Jie Tang 讨论 GLM 5.3 和新的后训练缩放定律,提出参数规模作为核心扩展轴正在让位于后训练。这对关注大模型训练策略和算力配置的团队有重要信号意义。
NVIDIA Megatron Core 0.19.0 发布,新增 MoE Quantile Balancing 路由器,利用分位数估计的专家路由偏置实现无辅助损失的负载均衡;同时加入共享专家融合 MLP、打包序列 MoE 分发以及训练和推理路由 trace 分析。这些特性对 MoE 模型的大规模训练和分布式推理优化很有价值。
Frontier Radar #4: China has caught up, so what's left of the Western AI lead?
The Decoder 第四期 Frontier Radar 分析中国模型 Kimi K3 和 GLM-5.3 已接近美国最佳模型水平,西方实验室将部分原因归于蒸馏,且文中认为有实际证据支撑。其核心结论是模型领先无法防御,并对哪些能力仍可构成壁垒进行讨论。
KI-Pioneer Sutton calls synthetic data a "big mistake" in the face of an infinitely complex world
图灵奖得主 Richard Sutton 认为用合成数据扩展大模型是「大错误」,因为世界无限复杂,任何对世界的模拟都过于微小,人类专业知识还会成为真正扩展的瓶颈。他主张智能体应当持续从自身经验中学习,而不是依赖固定的冻结模型。
llama.cpp 更新 b10514,新增对 GraniteSWAForCausalLM 和 GraniteMoeSWAForCausalLM 模型的支持,并加入 rope_pattern 数组的转换基础设施。这对希望在本地或边缘端部署 IBM Granite SWA 系列模型的开发者很有用。
Scaling Laws for Mixture Pretraining Under Data Constraints
Apple 机器学习团队发布数据受限条件下混合预训练的缩放定律研究,分析稀缺目标数据与丰富通用数据混合时的权衡:目标数据比例过低会导致领域欠拟合,过高则重复样本过多、收益递减。这对低资源语言和垂直领域预训练具有直接指导意义。
OpenAI 因安全问题突然停训GPT-6!网友:当你造出一个神,就不可能再给它拴上绳子
该报道称 OpenAI 因安全问题突然停止训练 GPT-6,并引发关于强模型可控性的广泛讨论。不过信息主要来自标题和网友评论,从业者应谨慎看待未经官方证实的说法。
Post-Train NVIDIA Cosmos 3 Edge for On-Device Robot Control
NVIDIA 发布关于对 Cosmos 3 Edge 进行后训练并用于端侧机器人控制的方案,强调机器人策略需要适配传感器、环境和任务,同时运行在车载计算硬件上。这对具身智能边缘部署和世界模型后训练有实用参考价值。
将Pod作为worker而非智能体:在Kubernetes上重新思考AI智能体的部署单元
InfoQ 中文文章讨论在 Kubernetes 上部署 AI 智能体时应将 Pod 视为 worker 而非智能体本身,重新思考部署单元的抽象方式。这会影响多智能体系统的编排、资源调度和故障恢复设计。
viable/strict/1787236083: Fix int64-indexing bugs in Triton grouped_mm for large inputs (#192649)
该 PyTorch PR 修复了 Triton grouped_mm kernel 在大张量下因内部计数器位宽不足导致溢出的 int64 索引 bug,并增加对超大输入跳过不支持硬件模式的保护,同时补充单元测试。这对大规模矩阵分组乘法的训练和推理稳定性有改善。
pre-split-full: Merge main into studio-mmproj-fit
Unsloth 仓库将 main 合并到 studio-mmproj-fit 分支,解决了三个小冲突,包括 llama_cpp.py 中两组独立新增、mmproj 回退测试以及 image-input-support.ts 的导入。其中缺失 .ts 后缀是此前前端测试失败的原因,上游已修复。
viable/strict/1787231279: [MPS] fail loudly on large reductions (#194082)
该 PyTorch PR 修复了 MPS 后端在 2.14 版本中大型张量 reduction 从原先部分报错、部分静默错误变为全部静默失败的问题,改为显式 loud 报错。这对 Mac GPU 上的训练和推理用户有稳定性意义。
Anthropic's most capable model, codenamed "Model 2," is for internal use only
The Decoder 报道 Anthropic 内部使用一个未发布的模型,代号「Model 2」,其能力超过任何公开可用的 Claude 版本。这说明前沿实验室最先进的模型能力可能长期保留在内部,不对外公开,对产业竞争格局有参考意义。
文章讨论长期运行智能体或知识系统中,仅保存历史交互记录并不等于形成有效记忆。KDC 主张需要构建可提取、可索引、可应用的记忆层,才能支撑长程任务中的上下文利用与决策。
vLLM 发布 v0.28.0rc1 候选版本,包含安全修复,对加载 OpenVINO 2 处理器相关逻辑增加远程信任解析保护。升级可降低推理服务中远程代码执行风险。
这篇教程给出用 DPO 在 Anthropic HH-RLHF 数据集上微调语言模型的端到端流程:先审计数据中的结构与长度偏好偏差,再用 TRL 和 LoRA 构建训练管线,最后评估模型是否真正学到偏好而非依赖词法捷径。
PyTorch 移除了阻止部分 vmap 分解注册的条件,使更多算子能够注册 vmap 分解规则。这扩大了 functorch 的函数式变换覆盖范围,减少自定义算子的兼容障碍。
OpenAI builds safety system that catches misuse without storing customer data
OpenAI 计划向企业客户提供最先进模型,同时上线不存储客户数据的安全系统,仍能检测滥用行为。这对金融、医疗等敏感行业采用前沿模型有吸引力,缓解数据隐私与安全合规矛盾。
PyTorch FX 对符号二元算术的结果表达式引入缓存,避免重复构造相同符号表达式。这降低了动态形状或导出场景下的编译开销,提升符号推导效率。
llama.cpp 新增 ggml_rope_set_offset 算子,并在 Metal、CUDA、Vulkan 等后端实现支持,同时补充测试与参数传递。这为动态调整 RoPE 位置偏移提供跨后端能力,便于长上下文或序列拼接场景。
llama.cpp 在 OpenCL 后端对 MoE 专家散播操作做了确定性修复,避免并行执行导致结果不确定。对需要可复现推理或调试 MoE 模型的用户很重要。
llama.cpp 多模态模块新增 mtmd_bitmap_set_mergeable 接口,允许位图对象在合并时标记为可合并。这提升了多模态处理中内存或元数据管理的灵活性。
llama.cpp 在 Metal 后端使用 packed types 优化 q8_0 量化的反量化操作。这可以提升 Apple Silicon 上 q8_0 模型推理性能,减少访存或指令开销。
llama.cpp 的 server 新增 dedup-cache-models 预设选项,用于在缓存中去除重复模型加载,优化多模型服务时的内存占用和启动效率。有利于部署多个模型的运维场景。
墨奇亮相WRC:一台机器人长程任务实战背后的“具身大脑”革命
墨奇智能在 WRC 上首次国内系统亮相,公开展示新发布的具身智能模型架构 MoRA,并在真实机器人上完成长程任务实战。这标志其具身大脑技术从模型走向整机部署。
华尔街对 8 款主流 Agent 进行实测,阿里千问在办公场景综合排名第一,同时指出成本正成为 Agent 商业化的重要考量因素。这表明国产模型在办公智能体赛道具竞争力,也提示关注推理成本与商业闭环。
Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions
Apple 提出一种在目标语言数据受限时通过词汇干预增强多语言知识迁移的方法,帮助低资源语言从高资源语言获取科学推理、常识和世界知识。相比需要大规模数据的方法,该思路能缓解数据约束。
Building Federated Multimodal AI Workflows with NVIDIA FLARE
NVIDIA 开发者博客介绍使用 NVIDIA FLARE 构建联邦多模态 AI 工作流,使视觉语言模型能在数据不出域的情况下完成训练或推理。这解决了医疗、金融等场景的数据隐私与合规问题。
Meet the startup helping Wall Street put a price on AI compute
创业公司 Silicon Data 试图为 AI 算力定价,并让华尔街机构能对冲算力价格波动风险。随着数据中心和 GPU 支出成为 AI 产品最大成本,这为算力金融化提供了新工具。
Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator
NVIDIA 推出 SkillEvaluator,用于评估 AI Agent 的技能执行效果,特别是上下文质量对任务效率的影响。它帮助开发者量化 Agent 在步骤效率、信息检索等方面的表现。
viable/strict/1787248611: fix-193938-align-randn bug (#194118)
PyTorch 修复了 CUDA 上编译后的 torch.randn 和 torch.randn_like 在启用 align_random_eager 时被错误降级为均匀随机的问题,现在只对 rand 模式使用 eager 对齐路径,保证编译模型与 eager 行为一致。
PyTorch 将 CPU 的 ideep 后端回退到 torch 2.13 版本,以解决性能回退问题。这说明新版 ideep 在部分场景引入性能损失,维护者选择保守回退。
llama.cpp 在 Vulkan 后端命令池清理函数中增加空指针检查,防止空队列指针导致崩溃。这是稳定性修复,尤其保护资源释放边界条件。
OpenAI 推出新博客「AI Futures」,专注探讨变革性 AI 对权力、治理、经济和个体自由的影响。这表明 OpenAI 将更公开参与 AI 社会影响与政策讨论。
smolmachines / smolvm as a sandbox for untrusted Python & JavaScript
Simon Willison 使用 Claude 对 smolmachines/smolvm 进行测试,评估其作为不可信 Python 和 JavaScript 代码的安全沙箱能力,重点考察 CPU/内存限制、禁止网络访问和文件系统白名单。
Domain and publish date filters for Web Search on AgentCore
Amazon Bedrock AgentCore 的 Web Search 新增域名和发布日期过滤,开发者可在每次调用时控制允许的网站来源和内容时效,并由服务端强制生效。该功能同时扩展到欧洲(爱尔兰)和亚太(东京)区域。
OpenAI seeks to one-up Anthropic with new customer privacy protections
OpenAI 与 Anthropic 正在竞争谁能为企业客户提供更好的数据隐私保护,OpenAI 试图通过新隐私功能超越对手。这反映大模型厂商将企业数据合规作为差异化卖点,影响企业选型。
Asynchronous patterns for calling Amazon Bedrock AgentCore agents in serverless pipelines
AWS 介绍在 Step Functions 流水线中异步调用 Bedrock AgentCore Agent 的三种无服务器模式:任务令牌回调、直接服务集成和持久函数,可在 Agent 处理请求期间消除空闲计算成本。
How Fanatics Betting and Gaming built a multi-agent customer support system
Fanatics Betting and Gaming 在 AWS 上构建多智能体客服系统,应对体育博彩中州级法规差异、实时负责任博彩检查和重大赛事流量高峰。文章阐述架构与 AWS 服务组合,为多智能体客服提供模式借鉴。
SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE 针对语言模型在推理和工具使用上训练环境固定、难以随模型能力增长而调整的问题,让同一个模型既设计可执行环境又作为求解者进行自我博弈,并通过基于遗憾值的目标选择持续生成更有挑战的环境。这样训练分布不再依赖人工收集的静态数据,而能自适应地匹配模型薄弱环节。论文显示该方法能提升推理与工具调用性能。
Looped Language Models Improve Compositional Tool Calling
该工作针对多步组合工具调用中错误易沿长链路累积、且固定深度推理成本较高的问题,提出用循环语言模型在循环计算中迭代求解。模型可以根据任务难度动态决定循环步数,在准确率与计算成本之间做自适应权衡,而不是像传统一次性生成那样无法纠错。
SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation
SemaPLC 针对 PLC 代码生成缺乏项目上下文、文本生成结果难以保证可编译可运行的问题,提出一个验证门控的智能体框架,通过外部编译和实时运行执行来校验生成的 PLC 逻辑。只有通过验证的候选才能作为最终输出,因此在验证通过率上显著优于基线方法。这对工业控制领域里的可落地代码生成具有直接价值。
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
OmniScientist 针对现有多数 AI 科学家只能处理单一模态或单一学科、难以从异构原始证据中直接发现知识的问题,提出端到端的全模态 AI 科学家框架。它利用自主智能体和生命周期级感知,在多学科环境中直接操作原始证据,减少人工预处理造成的信息损失,改善了跨模态、证据驱动的科学发现能力。
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
Co-RL 解决无标签条件下推理能力难以涌现的问题,用多智能体协作强化学习替代对 ground-truth 标签的依赖。其核心是由多样同伴组成的 cohort 提供同伴派生奖励,形成互相纠错和探索的激励。在文本和视觉任务上均取得了性能提升。
Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis
该工作针对单步逆合成中模型常生成化学上不合理或多样性不足的反应,结合 Top-K 提示与化学合理性感知训练来提升候选反应质量。在一个大型已核实反应数据集上达到当前最优结果,并指出其输出适合作为后续集成系统的基础。
FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents
FM-Bench 提出一个长视野管理基准,让 LLM 智能体在长达 20 年的时间跨度内管理足球俱乐部,并与其他竞争智能体互动。评测发现决定表现的关键因素是管理行为本身,而不是模型规模或 token 消耗,这为评估长周期决策智能体提供了新视角。
The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning
AdaPop 针对 LLM 遗忘学习中不同事实被记忆强度不同、统一梯度压力容易导致遗忘不彻底或已遗忘内容泄露的问题,根据事实流行度自适应调整梯度压力。同时它自动平衡遗忘与保留目标,从而降低被遗忘内容的泄漏概率。
SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents
SkillGate 解决长视野智能体在技能选择中 selector 因信用分配问题而早期被饿死、进而学到误导性技能的问题。它把执行 token 的结果信用与技能命名 token 的局部优势分离开来,稳定技能选择策略的训练。结果提高了成功率并减少了误导性技能的暴露。
LLMs Get Smarter from Targeted Synthetic Multilingual Data
HOTFIXR 是一个数据生成框架,针对多语言推理能力的具体薄弱环节定向合成训练数据,而不是简单混合更多平行语料。它能在不牺牲模型整体能力的前提下提升跨语言性能,尤其适合低资源语言推理增强。
Bounded Agents: Delegation Security for Multi-Agent AI Systems
该工作针对多智能体系统中权限委派可能被滥用、多个单独看似安全的动作组合后产生危害的问题,提出 Agentic Principal Chain。它执行会话感知的授权检查,在委派链上持续校验权限,从而阻止有害动作组合和委派滥用。
Temporal Multi-Signal Fusion for Token-Level Hallucination Detection
该工作针对幻觉常被当作孤立 token 处理、但实际上常表现为时间上延续片段的问题,用序列标注方式在多个外部特征融合基础上检测幻觉片段。它不依赖模型内部访问,跨模型鲁棒性较好,能识别连续时间尺度上的幻觉。
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation
SemComp-Bench 针对现有视频生成评测偏重视觉质量、忽略任务完成语义的问题,提出语义任务完成视角的评测基准。它评估生成视频是否真正达成预期结果,并配有人工整理数据集和基于视觉语言模型的自动评测器。
Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
Zetta 针对具身智能中高层推理与实时物理执行之间脱节、控制频率不足的问题,构建闭环具身 harness,在线进化运行时批评器和恢复技能,在动作频率层面直接治理物理执行。它在机器人基准上取得高成功率,同时推理更快,并能规模化自我探索。
Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification
该工作针对开放权重模型难以判断是否真正源自某一预训练 lineage、还是独立训练或蒸馏的问题,发现兼容的开放权重检查点会在权重空间中留下可检测的祖先信号。通过中心化残差签名,无需数据即可区分真实 lineage 与独立或蒸馏模型。
Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion
该框架针对创意写作数据多围绕故事展开、文体和体裁单一的问题,将主题种子与体裁形式控制分离,生成跨 13 个体裁的多样化高质量写作数据。用这些数据训练后,LLM 的创意写作表现得到改善。
Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention
Lévy Attention 针对不规则采样时间序列模型能在任意连续时间点给出预测、却无法报告预测可信度的问题,提出一种交叉注意力算子,其输出是对非齐次泊松过程的随机积分。在同一前向传播中就能以闭合形式得到预测不确定性,不增加额外计算成本,为连续时间注意力带来了单次推理中的不确定性估计能力。
Discretizing Continuous Time Series for Imputation with Masked Diffusion Training
该工作针对时间序列插补中缺失值与观测值在同一表示空间中混淆、以及连续扩散模型只学习预测噪声而非原始信号的问题,提出离散化表示和掩码扩散训练方法。其目标是显式分离缺失与观测结构,直接重建原始信号,从而在复杂时序和噪声条件下提升插补可靠性。