[Model] add GLM-5.3-Flash support
在 vLLM 中新增对 GLM-5.3-Flash 模型的 day0 支持。使该新模型能够直接在 vLLM 推理栈上运行,便于后续部署与性能优化。
每天 04:00(Asia/Shanghai)自动抓「昨天」一天的新内容。
[Model] add GLM-5.3-Flash support
在 vLLM 中新增对 GLM-5.3-Flash 模型的 day0 支持。使该新模型能够直接在 vLLM 推理栈上运行,便于后续部署与性能优化。
[Bugfix] DSv4 MXFP4 selector: stop narrowing explicit aliases to their BF16 variant
修复 DSv4 MXFP4 selector,不再将显式别名收窄到 BF16 变体,而是回退到 W4A8(MXFP4 权重 + MXFP8 激活)等支持变体。避免 SM100+/SM120 上 FlashInfer CUTLASS BF16 变体因 SM90 限制导致的死路,提升 DeepSeek-V4 类 MoE 模型在新硬件上的后端兼容性。
convert : write explicit recurrent_layers for Qwen3-Next / Qwen3.5
转换器现在为 Qwen3-Next / Qwen3.5 写出显式的 recurrent_layers 数组,而不是仅写全注意力间隔。防止非均匀层配置被错误重建为循环层,避免全注意力层丢失 KV cache,保障模型推理正确性。
[AMD] support qlen>1 for aiter gluon path for Kimi K3
为 AMD 平台的 Kimi K3 在 aiter gluon 路径上扩展 qlen 支持,并在不满足条件时回退到 mla asm ps。提升 AMD GPU 上 Kimi K3 的算子覆盖与执行效率,增强长上下文推理能力。
[None][fix] validate the layer-wise replay request against the calibration before it runs
在 layer-wise benchmark 的 run.py 中增加对 --replay-start-iter/--replay-stop-iter 请求与标定窗口范围的校验。避免因请求不存在的迭代而产生 KeyError,并在 MPI 多 rank 下输出清晰错误信息,改善调试效率。
chore: update CI test est_time values
从 CI stats model.json 刷新测试 est_time 字面量,更新约 203 项。保持 LPT 负载均衡算法对测试分片的准确性,减少并行 CI job 的时间波动。
mtmd: support Qwen3-TTS (note: breaking change to llama-tts binary)
在 mtmd 中新增 Qwen3-TTS 支持,加入 --tts-lang、--tts-speaker-file 等参数,并调整 llama-tts 二进制接口。使 llama.cpp 具备 Qwen3-TTS 语音合成能力,扩展多模态与语音本地推理场景。
[Qwen3.8-Flash-Next] Remove torch.compile for NVIDIA implementation
移除 Qwen3.8-Flash-Next NVIDIA 实现中的 torch.compile 装饰器及自定义 op 注册。避免 torch.compile 对 embedding op 自动调优造成额外约 50GB 激活峰值,使 FP8 checkpoint 可在单块 GB300 上加载,并降低显存压力。
[NPU] Adapt DFlash2 speculative decoding to Ascend NPUs
将 DFlash2 推测解码的 draft 与 verification 路径适配到 Ascend NPU,修复目标验证元数据处理。使 DFlash2 检查点可在昇腾 NPU 上服务,同时保持现有 CUDA 行为不变,扩展硬件支持。
[Bugfix][Spec Decode] Resolve n_predict from text_config for Qwen3.5 multimodal MTP
在 SpeculativeConfig.hf 配置覆盖中新增从 text_config 解析 mtp_num_hidden_layers 的回退逻辑。修复 Qwen3.5/3.6 多模态 MTP 检查点 n_predict 未解析的问题,恢复后续 divisibility checks,保障推测解码正确性。
[Bugfix] OffloadingConnector: stop zeroing offload hits under MTP/EAGLE spec decode
移除 OffloadingConnector 中 all-groups drafter fallback 逻辑,修复 MTP/EAGLE 推测解码下 CPU offload 命中被清零的缺陷。使混合 offload 配置能正确返回可重用 token,提升 KV cache 命中率与推理性能。
[NPU] Fix failed test cases in pr‑test‑npu and improve execution efficiency
精简 pr-test-npu 流水线中的测试用例,补充必要的参数,并将负载均衡测试移至 Nightly。提升 NPU PR CI 的执行效率,同时保持关键场景的覆盖。
[https://nvbugs/6676406][fix] Fix DSV4 disagg MTP accuracy
修复 DSV4 分离式 MTP 中 gen worker 低估已分配 token 数导致 scratch_blocks 为 0 的问题,并纠正 block ids 裁剪逻辑。避免在 beam 搜索等路径中因块列表过长导致的错误,保障 MTP 推理的准确性。
[Docs] Clarify admission control limits apply server-wide, not per DP rank
更新文档,明确 max_num_queued_reqs 和 max_num_queued_tokens 是服务级限制,而非每个 DP rank 的限制。帮助运维正确设置队列上限,避免因复用 max_num_seqs 值而提前拒绝请求。
[NPU] Add NPU arch35 support and enhance DSV4 processing in DeepSeek-V4
为昇腾 Atlas A5/Arch35 添加 DeepSeek-V4 的量化、稀疏注意力、FP8 KV cache 及 MXFP4 MoE 等执行路径。使 DeepSeek-V4 能在昇腾 A5 硬件上高效推理,扩展 NPU 硬件适配范围。
feat(sm120): add NVFP4 sparse MLA support for DeepSeek V4 Flash
在 SM120/SM121 上为 DeepSeek V4 Flash attention 添加原生 NVFP4 稀疏 MLA 支持,并新增 384 字节 token 的 paged NVFP4 cache ABI。降低 KV cache 内存占用,并在 Blackwell 上提供新的量化路径以提升性能。
[Perf] Unified memory: close the DCP decode gap on Blackwell
将统一内存路径上的 write-loc translate 从 eager op chain 改为优化实现,减少 decode 上下文并行下的 CPU 侧 launch 开销。缩小 Blackwell 上统一内存与静态池的 decode 性能差距,提升动态内存管理场景的推理效率。
[AMD] Support aiter fa mha chunked kv for Kimi-K3
为 AMD 平台 Kimi-K3 添加 aiter fa mha chunked kv 支持,以修复 HIP OOM 崩溃。避免长上下文推理时 AMD GPU 显存不足,支撑 1M 上下文基准测试。
[Sampling] Allow sampling-mask replay with DisallowedTokensLogitsProcessor
在 sampling-mask replay 中引入显式 allowlist,允许 DisallowedTokensLogitsProcessor 参与重放。防止 Qwen3.5 等模型在 RL 训练中采样到未映射 token ID,保证训练数据有效性与策略稳定性。
对 SGLang 的 CI 权限配置做出小幅更新。优化 CI 流水线的权限管理,便于授权用户触发与合并流程。
llama.cpp 对 CUDA 后端 Q4_K 和 Q5_K 量化格式做了无分支解包优化,避免 mmvq 中每个列重复解包 scale,提升批处理大于 1 时的性能。同时为 DGX Spark 增加 L2 预取,并对 MUSA 和 HIP 等平台做了保护。这对本地量化推理用户意味着低比特矩阵向量乘更快,批处理场景改善尤为明显。
Qwen-Drive 1.0 tells you why it brakes, just don't expect the explanation to match the maneuver
阿里研究团队发布 Qwen-Drive 1.0,在单一系统里集成环境感知、交通问答和路线规划。研究者强调文本图像模型不会天然具备三维空间理解,必须专门训练空间感知能力,目标是让同一个模型同时驱动座舱与驾驶系统。对自动驾驶与多模态模型从业者来说,这表明空间智能需要显式设计,不能仅靠通用图文预训练迁移。
消息称 OpenAI 研究院人均配置约 3 个 AI 实习生,同时 GPT-6 不仅有 Astra,内部测试中的 Sol 速度据报快 6 倍。该动态反映 OpenAI 正在把 AI 智能体大规模嵌入自身科研流程,并同步推进下一代模型的高效版本。对行业而言,这既展示智能体在组织内部的产出拐点,也提示前沿模型推理效率竞争正在加速。
菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3
菲尔兹奖得主入局大模型研究,其团队用 4B 手机端 Qwen 与云端 GLM 组合在 ARC-AGI 3 上取得突破性成绩。相关观点指出,要在两个模型之间找到数学上的共同基础其实非常困难。这显示了小型端侧模型与云端大模型协同求解抽象推理基准的潜力,也把数学家的理论视角引入到 AGI 评测中。
Serving LLMs on Tenstorrent Hardware: Inside the vLLM TT Plugin
Tenstorrent 加速器以 out-of-tree 平台插件形式加入 vLLM,其实现围绕 mesh 架构做出多项选择:分阶段调度、Galaxy 上的单进程数据并行、设备端采样加主机回退,以及异步解码重叠。这对 vLLM 生态意味着更多非英伟达硬件可以共享同一套高效 serving 栈,也给差异化 AI 芯片接入提供了一种可参考的插件化路径。
阿里前销售总监在美失踪逾半月后确认身亡;5天10万元!外国高管涌入中国“工厂游”;传DeepSeek计划采购16万颗昇腾芯片|AI周报
该周报汇集多条动态,其中与 AI 产业直接相关的是传闻 DeepSeek 计划采购 16 万颗昇腾芯片,显示国产算力在大模型训练中的地位持续上升。同时外国高管涌入中国工厂游也折射出全球对供应链与制造能力的关注。对关注算力自主和芯片替代的人有参考价值。
OpenAI reports AI "research interns" and warns about its own pace at the same time
OpenAI 称其内部的 AI 智能体已能完成相当于每名人类工作日 3.1 个工作日的产出,并宣称达到自动化研究实习生的目标。同时首席科学家 Pachocki 警告,目前没有任何实验室能足够好地掌握对齐与监控,因此不应以最高速度继续扩展。这种一边展示智能体生产效率、一边呼吁放缓节奏的表态,反映了大模型前沿研发中能力与安全治理的紧张关系。
PyTorch 侧提交为 Inductor 的 FlyDSL 新增 gfx950 Grouped GEMM 以及 F.grouped_mm 相关支持。这有助于在特定 AMD 图形或计算架构上加速分组矩阵乘法,并进一步把 FlyDSL 编译路径与高层 API 对齐。对 AI 编译器用户而言,是算子覆盖和硬件适配上的增量改进。
trunk/123739aa495079403f3891233abbba374afee3a7
PyTorch 主干提交为 Inductor 的 FlyDSL 添加 gfx950 Grouped GEMM 与 F.grouped_mm 接口支持,扩展了面向 gfx950 架构的分组矩阵乘编译能力。该改动与另一个 viable/strict 分支提交内容一致,属于同一算子能力在主干上的合并。对使用 AMD gfx950 硬件做编译优化的开发者有实际意义。
llama.cpp 的 ggml-cuda 修复了 f16 flash attention 中的分歧 barrier 问题,并避免重复设置元数据指针。这类低层 CUDA 修复直接关系到自注意力 kernel 在部分硬件上的稳定性,能减少长上下文或特定 batch 下偶发的死锁和错误结果。对依赖本地推理和轻量栈的用户是可靠性改进。
原生全模态技术战略闭环,智象(HiDream.ai)发布具身世界模型HiDream-O1-Embodied
智象(HiDream.ai)发布具身世界模型 HiDream-O1-Embodied,声称形成原生全模态技术战略闭环。虽然原文未给出细节,这一发布显示该公司正在把全模态生成能力延伸到具身智能与世界模型方向。对关注多模态基座和具身智能融合的从业者,这是国内玩家在该方向的一次产品化信号。
Hugging Face太重要,绝不能落入英伟达手中?黄仁勋:我本想让它独立,但有其他竞购者
黄仁勋谈及 Hugging Face 收购相关话题,表示自己本希望它保持独立,但同时存在其他竞购者,并强调其重要性。这凸显了 Hugging Face 作为模型与数据集分发基础设施在 AI 生态中的战略位置。对从业者而言,平台归属可能影响模型发布、权重分发和社区协作的中立性。
PyTorch 合并一个 AI Codemod 改动,跳过未使用的 old_storage_nbytes 查询,避免在相关路径上进行不必要的存储字节数计算。这有助于减少动态图或 AOT 编译过程中的开销。
llama.cpp Vulkan 后端此前在张量 backing-buffer 偏移加 view_offs 未按最小存储缓冲对齐时,GET_ROWS shader 会触发断言并导致硬崩溃,影响 Qwen3-TTS、Qwen3-VL 等模型。现在 supports_op() 在不对齐场景返回 false,让调度器自动回退到 CPU,避免崩溃。
PyTorch 对 test_opaque_obj_v2.py 进行重构,并在 XPU 上启用相关测试。该改动把测试覆盖扩展到非 CUDA 加速器,有助于保证跨设备行为一致性。
llama.cpp 合并 PR #28511,在模板检查字符串时重新检查 caps 的 typed content。该修复解决某些模板渲染场景下 typed content 判断不一致的问题,提升模板处理正确性。
llama.cpp 的 ggml 后端允许输入不额外创建 split,减少多后端混合执行时不必要的图切分和调度开销。这对使用 CPU、Vulkan、ROCm 等多后端组合的推理场景有实际收益。
llama.cpp Vulkan 后端新增 RMS_NORM 融合机会,支持 RMS_NORM 后接 MUL 加 ADD 或 VIEW 加 SET_ROWS 等模式,并把 ROPE 融合扩展到 IMROPE。作者在 gemma4 上观察到约 4% 的性能提升,降低了小算子分派开销。
llama.cpp Vulkan 后端新增 TQ1_0 量化类型支持,覆盖 mm、mat-vec、mat-vec-id、dequant 和 get_rows 等路径。实现上把 TQ1_0 中 3 的幂常数打包进一个 32 位常量,以避免常量数组占用寄存器;在 gfx1151 上相关后端测试全部通过。
viable/strict/1788773762: [MPS] Add naive triangular_solve for complex numbers (#195861)
PyTorch MPS 后端的 MPSMatrixSolveTriangular 仅支持浮点,因此新增自定义 Metal kernel 处理 complex64 三角求解。该实现引入 conjugate 标志,使复数 cholesky_solve 使用伴随转置 A^H,并修复非连续 out 处理问题,同时校验输入与输出都在 MPS 上。
阿里巴巴旗下 Agent 产品「千问办公」推出业内首个「多人工作台」,支持多用户在同一办公 Agent 环境中协同工作。这对办公 Agent 从单人辅助走向团队协作场景具有重要意义。
viable/strict/1788771294: [dynamo] Preserve is_inference in after-AOT repros (#193565)
PyTorch Dynamo 在生成 after-AOT 重现代码时,之前会丢失 is_inference 参数,导致推理编译失败的图在重放时以默认 is_inference=False 重新编译,行为改变且难以复现。该修复将 is_inference 贯穿图转储、序列化、重放、最小化、隔离和分析路径,提升调试保真度。
viable/strict/1788770324: [torchcomms hash update] update the pinned torchcomms hash (#196181)
PyTorch 自动生成的 nightly PR 更新 pinned torchcomms 哈希,属于常规依赖同步。这类更新保持 CI 与最新 torchcomms 版本一致,对分布式通信相关开发有基础维护价值。
viable/strict/1788758887: [dynamo] Fix FP64 softmax repro arguments (#194595)
PyTorch Dynamo 修复 FP64 softmax 重放参数问题,在 softmax 和 log-softmax 输入提升为 FP64 后禁用 half_to_float,避免重放时类型转换行为不一致。新增回归测试覆盖默认与 out 重载及位置与关键字参数。
Claude proves Fermat 🧮, automated AI researcher 🔬, Z1 efficiency chip ⚡
本期 TLDR AI 主题聚焦 Claude 在费马相关命题上的证明能力、自动化 AI 研究员以及 Z1 效率芯片。这三个方向分别对应模型数学推理、自主科研与推理硬件能效,对关注这些前沿领域的从业者有参考价值。
Research acceleration: The view inside OpenAI
Simon Willison 报道 OpenAI 内部将今天称为 RSI 日,即递归自我改进,并提及首席科学家 Jakub Pachocki 的文章「An Alien Mind」。报道还披露 OpenAI 研究团队使用编程 Agent 的细节,显示 2026 年 agentic 工程在 OpenAI 内部显著加速。
llama.cpp 在 HF 到 GGUF 转换脚本中新增 --fuse-qkv 标志,可在转换阶段将 Q、K、V 权重融合为 QKV 张量。这有助于减少后续推理中的张量切分和调度开销,尤其利于注意力计算优化。
PyTorch Dynamo 将若干私有 value-builder 入口点从 Any 类型替换为 object,并保留具体 SourcelessBuilder.create 重载,使分类过程中的类型收窄更清晰。该改动不改变运行时行为,但提升代码可维护性。
InfoQ 中文报道微软将 AI 治理从政策层面转向运行时执行,意味着治理策略被嵌入到模型推理和运行环节。这对关注合规与模型安全落地的从业者具有参考意义。
DHH领衔,英伟达、微软、HuggingFace等150+全球技术大咖集结,GOSIM Shenzhen 2026全议程公布
GOSIM Shenzhen 2026 将于 10 月 16 日至 17 日在深圳举行,由 DHH 领衔,英伟达、微软、HuggingFace 等 150 多位全球技术专家出席并公布完整议程。该大会聚焦开源技术,对 AI 基础设施、开发框架和跨语言生态有较高关注价值。
国内首份办公Agent用户行为报告发布:北京用户量全国居首,海外用户占比超12%
国内首份《中国办公Agent用户行为不完全报告》发布,显示北京用户量全国居首,海外用户占比超过 12%。这为办公 Agent 的产品化与地域运营提供早期数据参考。
Iris: Climbing to the Search Frontier
该工作针对搜索智能体在复杂网络基准上落后于闭源方案的问题,提出多阶段训练管线:先监督微调,再对真实搜索引擎进行强化学习,并用严格轨迹过滤和推理时上下文管理来稳定训练与部署。两个大规模搜索智能体由此在复杂网页基准上取得当前开源最好成绩,表明把真实检索反馈纳入强化学习并治理上下文质量,是提升搜索智能体上限的有效路径。
RISE: Recursive Improvement via Self-Extrapolating Policy Distillation
针对后训练中高质量稠密监督难以获取且依赖外部教师模型的问题,RISE 从模型自身的强化学习轨迹里通过自外推递归生成 token 级稠密监督。这种自蒸馏式闭环摆脱了外部教师,并让语言模型后训练可以持续自我改进。对希望避开昂贵教师标注并提升强化学习数据利用率的从业者,它提供了一种可递归迭代的训练方案。
MaxKernel: Agentic Kernel Generation for TPUs
TPU 算子开发高度依赖专家经验、自动化程度不足,MaxKernel 用多智能体系统把内核生成转成协作式、自主式和基于图的搜索三类范式。该系统在多个基准上达到专家级表现,说明多智能体协作与图式搜索空间建模能有效降低专用加速器算子开发门槛。对 AI Infra 团队而言,这意味着 TPU 内核优化可部分从手工调优转向智能体自动挖掘。
Group Adaptive Clipping Policy Optimization
在可验证奖励的强化学习中,低成功率样本常因重要性采样裁剪过强而丢失梯度信号,拖累策略探索。GAPO 根据 rollout 的优势值自适应调整裁剪阈值,让低成功率群体保留更强的更新信号。该方法不引入额外奖励模型,而是修正策略优化的梯度估计方式,对 RLVR 场景下提升尾部任务成功率有直接意义。
Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems
针对多智能体 LLM 系统中协调机制常缺乏理论保证、评估易失真的问题,该研究用双层博弈与随机记忆反射来形式化建模智能体协调。作者提出带收敛保证的 SRMA 算法和一种有依据的评估门控,并在 SWE-bench 上验证。其价值在于把多智能体协作从经验启发推向有博弈收敛性质的框架,并让评估更贴近真实协调能力。
Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference
该工作反对完全抛弃 dropout,主张用层级稀疏性同时优化大模型训练和推理效率。具体做法是利用层丢弃提升训练效率,并在推理端配合早退和投机解码来加速,而不损害精度。其关键贡献在于把通常只用于正则化的 dropout 重新定位成一种贯穿训练和推理的稀疏优化手段,对低成本部署有实际参考价值。
When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference
低精度量化下的循环网络推理会出现状态写回规则抑制小更新,进而破坏记忆的问题。作者发现用误差反馈和残差记忆机制可以在不重新训练的情况下恢复精度,并在 GRU 与 LSTM 架构上都得到验证。这项研究为量化循环模型的时间序列推理提供了无需重训的修复路径,对边缘端低比特部署很有价值。
针对思维链只在行为层面被评估、内部推理操作缺乏可解释性的问题,该研究发现语言模型中不同推理操作在隐藏表示上具备几何可分性。这些结构会跨层涌现,并且依赖当前推理上下文。它把 CoT 从黑盒输出推进到可定位、可区分的机制解释层面,为后续编辑或诊断推理错误提供了表示级抓手。
Dr. Claw: An AI Scientist Workspace for Vibe Research
现有命令行编码智能体虽能读写文件和维持长会话,但完整研究流程仍被拆散在聊天、IDE、终端和写作工具之间,关键决策难以审计。Dr. Claw 没有再造一个自主智能体,而是把已有编码智能体执行器包进一个开源工作区,提供可控、可审计的人类在环流程,并持久保存状态。这对希望把 AI 科研流程从随意探索变成可复现、可追踪范式的团队尤其重要。
τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction
该基准把评估重点从会写代码转向能否端到端构建真实客服智能体:编码智能体需要基于业务记录、客户需求和生产 API 组装出可工作的系统。结果显示当前智能体与专家表现之间仍存在明显差距。它为智能体构建能力提供了更贴近实际交付的评价环境,能暴露从代码生成到系统集成的全链路短板。
When Models Edit Too Much: On the Fidelity of Minimal Code Edits
大模型在修复代码时往往过度编辑,改动了本不该动的部分,增加维护负担和潜在回归风险。该工作表明,通过保留指令和强化学习可以在不牺牲正确率的前提下提高编辑保真度,让改动更接近最小必要修改。这对自动代码修复工具落地很关键,因为更小、更克制的 diff 才更容易被开发者审查和接受。
ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding
面向流式视频理解中全模型逐帧处理带来的高延迟问题,ShallowStream 提出先利用多模态大模型浅层构建轻量流式索引,再按需调用深层进行回答。这样把索引构建和深度推理解耦,在保持视频检索精度的同时显著降低在线延迟。对实时视频问答和监控场景,该设计提供了一种不牺牲准确率的加速思路。
Knowing What Not to Answer: Selective Non-Compliance in Vision-Language Models
视觉语言模型在混合查询中常常要么过度拒绝、要么该拒的不拒,选择性不遵从能力缺乏系统评估。KoNA 专门评测 VLM 在面对混合请求时的选择性拒绝表现,并通过定向微调提升其对合法请求的遵从度。该工作把安全拒绝问题从纯文本扩展到多模态,并强调模型需要学会区分哪些视觉上下文下应当不回答。
安全微调后的模型常见误拒绝,把询问原因的安全问题也当成攻击。作者把安全响应结构分解为拒绝声明与理由说明两部分,发现仅用理由部分进行训练即可在保持安全性的同时降低误拒绝率。这为安全对齐提供了更细粒度的数据构造视角,让模型学会解释边界而不是机械地拒绝。
Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue
语音对话与全身动作通常被分开建模,导致口型、节奏和姿态难以对齐。Motion-Omni 提出端到端框架,从共享隐藏状态同时生成口语对话和全身协同动作,并借助可扩展伪标签与统一评测协议实现实时对齐响应。它把多模态生成从独立流水线推进到联合建模,对数字人和具身交互系统有直接应用价值。
The Attention Triangle in Audio-Video Models
音视频扩散模型中,音频和视频模态之间存在跨模态注意力带来的双向语义泄漏,导致生成内容互相污染。该研究提出可通过注意力派生信号来诊断这种泄漏,并在推理阶段施加对齐干预来缓解,无需重新训练。这为多模态生成中的模态一致性问题提供了可解释的诊断与轻量修正途径。
Enoki: Efficient Multi-Level Hallucination Detection
幻觉检测通常把整句验证和细粒度定位分成两套模型,重复计算且资源开销大。Enoki 采用开放信息抽取框架,通过共享关系事实把断言级验证和片段级幻觉定位统一起来。这样在降低资源消耗的同时提升了检测准确率,并为大模型输出提供可追溯的证据级判断。
Ask Before You Optimize: Dynamic Pre-Formulation Clarification for Interactive Optimization
在交互式优化建模中,智能体常常在需求尚未明确时就匆忙写模型,导致后续返工。该工作提出 OR-Clarify 基准来评估建模前澄清能力,并设计 InterOPT 指导智能体依据缺失的公式关键信息决定提问或停止。它把优化建模的瓶颈从求解阶段前移到需求澄清,有助于提高自动建模任务的成功率和效率。
Training-Free Speech-Centric Omni Understanding with Frozen VLMs
让现有视觉语言模型获得以语音为中心的视听理解能力通常需要重训或改架构,成本高昂。TFO 通过模块化转录文本路由,在冻结 VLM 的前提下实现语音中心的音视频理解,无需任何再训练。这为快速扩展多模态模型能力提供了一种即插即用方案,尤其适合已有大规模 VLM 的团队。
HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals
HarvestBench 用农场模拟评测 LLM 智能体在无成本伤害动物与支付燃料费用避开动物之间如何选择,考察其道德偏好是否受价格和任务说明影响。结果显示不同模型的杀害率对价格和简报条件高度敏感,说明智能体的价值权衡并不稳定。该基准从具身决策角度为 AI 价值观对齐提供了新的测量工具。