每日精选AI研究论文及翻译
随着基于终端的代码智能体日益普及,智能体轨迹已大规模积累,而真实、可执行的环境仍然稀缺。然而,环境才是智能体后训练真正需要的数据:每个环境都可以被反复查询以生成多种可验证任务,并提供执行反馈;相比之下,一条轨迹只是一份冻结的演示样本。与其从零开始生成环境,我们观察到,现有轨迹中的工具执行历史能够揭示其运行环境的结构与内容,从而使从轨迹自身重建这些环境成为可能。为此,我们提出了Terminal-Universe——一个将每条轨迹转化为可复用环境,并对其进行探索以合成新任务和实现持续交互的框架。具体而言,Terminal-Universe重放轨迹中记录的文件操作,将每个被智能体修改过的文件恢复到修改之前的状态,得到一个部分还原的工作区;随后,补全智能体负责补充缺失的文件和依赖。在这个恢复出的工作区上,我们既重建原始意图对应的任务,也合成全新的任务。此外,我们还沿着两个互补的维度——广度与深度——扩展任务。在广度方面,我们挖掘相关环境之间的有向依赖关系,合成跨越多个代码库的跨工作区查询,正如开发者在真实开发中经常做的那样。在深度方面,我们借助用户智能体,将初始的单轮查询扩展为多轮会话,以捕捉迭代式的用户反馈与需求细化过程。将Terminal-Universe应用于公开的终端智能体轨迹后,我们生成了3.73万个足以支撑任务的环境。在此语料库上对Qwen3.5-27B进行监督微调,使其在Terminal-Bench 2.1上的单轮性能提升了11.9个百分点,在EvoCode-Bench v2上的多轮性能(MT@4)提升了13.8个百分点。
我们提出了LLaDA-Image,一个统一框架,将一个从零训练的6B扩散Transformer(DiT)与一个基于LLaDA2.0-Mini扩散语言模型主干构建的冻结视觉-语言理解模块相结合。我们并非从一开始就严重依赖图文配对数据,而是首先通过仅图像预训练和中期训练建立一个强大的视觉生成先验。该生成流程包含220M个样本,其中98%为真实图像。为实现高效且可扩展的优化,我们在整个DiT中使用无参数RMSNorm,并采用Muon优化器。得到的统一模型能够生成高度逼真的图像,同时准确遵循细粒度编辑指令。我们进一步将LLaDA-Image蒸馏为LLaDA-Image-Turbo,使其只需2-4步采样即可快速推理。在Qwen-Image-Bench上,LLaDA-Image在英文和中文赛道分别取得53.53和53.38的综合得分,在这两个赛道均刷新了开源模型的最佳成绩。为支持对能力强且高效的生成模型的进一步研究,我们发布了模型权重、训练代码及详细训练方案。
大语言模型具有广泛的能力,但将其适配到不断演化的领域、工具和需求通常需要反复的后训练。自主系统通过提出更新、训练候选模型并利用评估反馈来选择后续提案,从而将这一过程中的部分环节自动化。随着证据的不断积累,一个核心问题浮现出来:当后续训练已经改变了父模型之后,哪些过去的更新证据仍然可行?更新的效果取决于其父模型、数据以及训练阶段。将过去的成功视为与上下文无关的许可,可能会浪费算力;若由此产生的子模型被采纳,还可能使后续的训练轨迹退化。我们将这一问题形式化为条件经验迁移,并引入边界校准干预迁移(Boundary-Calibrated Intervention Transfer, BCIT)——一种在改变权重的训练之前对经验复用进行授权的方法。BCIT 将观察到的效果绑定到其来源上下文,检查适用条件,否决存在明确硬冲突的候选,并在需要时通过有界训练试验获取当前状态的证据。完全训练完成的候选仍然要遵循统一的采纳规则,而且只有被观察到的事件才能扩展记忆。在一个经过金融推理、文本到SQL和函数调用适配的4B参数模型上,候选更新在不同评估场景中表现出异质的目标效应与保留效应。在候选、证据和算力均匹配的条件下,与所评估的备选方法相比,BCIT 授权更少的有害更新,并在同等预算下获得更高的最终模型质量。这些结果支持将经验授权视为自主后训练中的一个独立问题。
大语言模型在需要长程推理的任务上表现出色,但长思维链使 KV 缓存成为严重的内存瓶颈。现有 KV 缓存压缩方法都遵循同一范式:根据对每个缓存词元在后续计算中重要性的某种估计进行打分,然后保留得分最高的词元。我们发现,这种选择信号几乎没有贡献。随机注意力(Random Attention)保留提示词,并在每个注意力头内进行均匀随机逐出,完全不计算任何分数;在四个模型和六个推理任务上,它的表现与之前最强的逐出方法相当,而在 vLLM 部署中的吞吐量比后者高出 32–43%。受控实验揭示了其原因:1)提示词是缓存中脆弱的部分,不同选择器之间的差距大多只反映它们的选择信号是否恰好保留了提示词;2)推理轨迹凭借两个层面的冗余来抵御逐出——文本层面(模型在推理过程中会复述它仍需要的内容)和跨注意力头层面(每个头都保留自己的轨迹副本)。因此,只要提示词得到保留,随机抽取就能保留足够多模型仍需要的副本,不需要任何分数来选择它们。我们的代码见 https://github.com/SalesforceAIResearch/Random-Attention。
Compressed context is usually carried as human-readable text or as rendered images that must be decoded, even when its consumer is a language model. We introduce LatentPress, which writes conversational histories and long documents into a third representation: continuous memory tokens that a frozen decoder reads directly through its input-embedding interface, with no text reconstruction at inference. A small reader-matched writer compresses 4-16times while training only an adapter (4.2M-26.2M parameters, sim!0.1% of the decoder). On LongMemEval, LatentPress reaches 0.504 accuracy at 7.70times compression versus 0.490 for uncompressed evidence, outperforming text summaries (0.184) and OCR-based compression (0.426 to 0.312). On LongBench-QA, in-domain writers match or exceed raw-context reading at 4-8times compression, while 16times trails raw. Writing takes 43ms per conversation, roughly an order of magnitude faster than text summarization or OCR reconstruction, and reading is 5-9times faster than raw context or cached OCR. We validate the interface under two transfer settings, zero-shot from UltraChat to LongMemEval memory QA and from LongMemEval-derived QA to unseen LongBench document domains, establishing direct soft tokens as a practical machine-facing context interface beyond text and vision. The implementation of the experiments could be found at: https://github.com/xuyd16ai/context_softtoken_compress .
混合大语言模型(hybrid LLM)将softmax注意力与线性注意力层(如门控DeltaNet,GDN)搭配使用,后者以固定大小的循环状态概括上下文。社区早期针对Qwen3.8-27B(含48个GDN层与16个注意力层)的4比特量化方案将GDN模块——尤其是其衰减(decay)门与写入强度(write-strength)门——保留为8比特或16比特精度,其直觉依据是循环结构中的误差会在长上下文上累积。我们通过构建Minima来检验这一直觉:对所有496个线性层(含GDN)一律采用NVFP4 W4A4量化。在4K/32K困惑度、MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench以及最长至64K的RULER检索任务中,Minima在随机种子波动范围内与BF16相当(5任务平均差值为−0.52),同时是我们所比较方案中体积最小(17.5 GiB)且预填充最快(+14%–19%)的配方;其在32K长度下的困惑度差距还随位置推进而收窄。一项由四部分构成的机制研究揭示了原因:(i)NVFP4的16元素块缩放将残差流中的极端离群值局限在局部,使不同角色层的激活误差趋于均衡;(ii)被认为最脆弱的门投影实际上最不敏感——softplus/指数与sigmoid参数化将约11%的GEMM误差压缩为约2%的输出误差;(iii)因为每次写入都会沿当前键方向覆写状态,delta规则循环能将注入噪声在32K个token上维持在平坦的平台期,并在数百步内遗忘状态脉冲;(iv)逐token量化成本随上下文变长而稀释,而非累积放大。我们还修复了一种全局缩放失配问题——当逐模块校准的NVFP4检查点由将这些模块融合为单个GEMM的内核服务时便会出现该失配——并证明了校准后的FP8 KV缓存缩放不带来性能开销。最终结果是一套实用配方——量化一切,并随附KV缩放——以及对“混合LLM的循环半边为何是更易于量化的半边”的机制性解释。检查点:https://huggingface.co/minima-ai/mnma_qwen3.8_27b_nvfp4
在线策略蒸馏(OPD)结合了学生模型生成的轨迹展开与教师模型提供的密集词元级监督。已有工作主要研究其算法行为,而训练数据的作用尚不明确。我们通过在单条查询上训练,在数据极小极限下考察了这一作用。单次查询的OPD在数百步内持续改进,并在多个任务领域和模型家族中恢复了全数据OPD的大部分收益。我们通过训练过程中访问的状态以及学生与教师对齐的速率来解释这一结果。我们度量了状态覆盖率,即全数据OPD访问的状态中,某一查询集的轨迹展开所能到达的比例。单条查询即可到达\(71.5\%\)的状态,其中大部分在前100步内完成。添加语义不同的查询会同时提升覆盖率与验证准确率,直至16条查询达到\(98.9\%\)的覆盖率并与全数据训练持平。然而,无论OPD在单条查询还是整个数据集上训练,对齐速度都以相似的速率放缓,即使状态集合固定不变,也需要数百步才能完成吸收。因此,OPD面临的问题在于数据过剩而算法饥渴——其轨迹展开能迅速暴露广泛范围的监督信号,而学生吸收这些监督的速度却越来越慢。状态覆盖率的结果可推广至多教师OPD,每个领域16条语义多样的查询即可与全数据MOPD持平。作为进一步的压力测试,内容精简的模板和领域外的WildChat查询也接近真实查询基线的表现。任务内容与由此诱导的状态覆盖率因此可以相互分离。我们希望这些发现能将未来工作引向OPD的步数效率问题,并促使学界重新审视前沿模型后期训练中其近期成功所依赖的数据与机制。
我们提出了Puffin-World,一种统一的多模态架构,它将物理理解、空间模拟以及3D世界生成与重建融为一体,且无需依赖外部离线模块。为了可靠地构建3D世界并与之交互,我们的框架联合建模三种原生世界状态:物理(重力场和纬度)、几何(深度)和外观(图像),并引入支持多样化任务和灵活运动的统一Omni-Camera表示。除了对这些状态进行建模外,我们还提出了一种跨未来帧传播物理动力学的策略。通过将绝对相机属性锚定于真实世界,Puffin-World实现了物理一致且视觉稳定的世界生成。我们进一步在单一生成过程中耦合外观与几何,联合合成每个未来视图并重建其底层几何。这一统一范式使得需要多任务协同的交错闭环应用成为可能,包括模仿(mimic)与自校准世界探索。为了将Puffin-World扩展到复杂场景,我们构建了Puffin-16M数据集,包含1500万个“视觉-语言-相机”三元组和100万条具有多样且富有挑战性运动的轨迹。为促进该领域的进一步研究,我们发布了代码、模型和数据集。
在线三维重建模型在长视频上表现不佳。其原因在于,相对于固定的首帧锚点回归位姿,会迫使模型在远超训练分布的范围外进行外推。微小的漂移不断累积并放大,最终导致严重的几何坍塌。然而,我们观察到,在整个失效过程中,逐帧深度始终保持稳定。主干网络提取的局部几何信息依然完好,只有全局位姿头发生了崩溃。受这一解耦现象的启发,我们提出了Scal3R。该方法将在线重建重新表述为多参考帧相对位姿查询问题。我们使用轻量级可学习令牌(仅占参数总量的约1%),并通过非对称注意力将其注入完全冻结的主干网络中。这一机制使得模型能够相对于多个历史关键帧查询位姿。配合带闭环检测的在线位姿图优化系统,可有效抑制长期漂移。Scal3R在单块GPU上仅需8小时即可收敛。与在线基线方法相比,其在KITTI数据集上的平均ATE降低了超过60%。此外,该方法在Virtual KITTI、Sintel、TUM-Dynamic、ScanNet和7-Scenes等多个基准上均取得了最先进的性能。项目页面:https://linjohnss.github.io/scal3r/
尽管GPT-Image-2、Nano-Banana这类扩散基础模型展现出卓越的视觉表现力,但其端到端生成本质上产出的只是极易出现文本错误的扁平化位图,无法进行图层级后期编辑。相比之下,借助编码智能体实现的基于代码的视觉生成虽能提供精确的布局控制和图层解耦,却仍受限于全局审美直觉的缺失以及复杂视觉素材的编码困难。 针对上述问题,我们提出一种由编码智能体驱动的新范式——可编辑视觉设计(Editable Visual Design)。我们将视觉语言模型(VLM)定位为“创意大脑”,负责需求理解、任务规划与审美判断;同时,将图像生成模型作为按需的“视觉世界模拟器”,用于合成独立的视觉素材。智能体遵循“先想象、再行动”的闭环工作流:先生成相互独立的素材,再编写原生HTML/CSS,并根据视觉渲染反馈对设计进行迭代优化。 此外,智能体设计回放(Agent Design Replay)能够忠实再现与人类专业设计师相似的创意与推理轨迹。最终,系统交付具有解耦图层与真实文本的可编辑产物,使用户能够在图形用户界面上通过直观的鼠标拖拽调整布局。在海报、信息图等场景上的验证表明,该范式成功兼顾了精良的美学效果与生产级的可编辑性。
联合音视频生成模型在视觉质量与音视频同步方面已取得显著进展,然而在面对镜头切换时机和对白开口时刻时,这些模型仍只能提供有限的控制能力。这一局限性制约了其在脚本驱动内容创作中的应用,因为在该场景下,时序错误会破坏叙事连贯性并影响观看体验。当前的联合生成模型将视频与音频表征对齐到共享的时间轴上,但结构化提示所指定的镜头与对白的精确时序,仅编码在提示的文本表征中,并未与任一模态的时序坐标对齐。因此,视频与音频彼此间可能保持同步,但两者却都无法遵循脚本时间线。这一不匹配促使我们将时间对齐的范围从视频与音频之间拓展至结构化脚本。为此,我们提出时间上下文路由(Temporal Context Routing, TCR),它将脚本时序映射到视频与音频生成的共享时间轴上,并将每条提示的引导路由到两种模态中的对应位置。在200条测试脚本上与基线方法相比,TCR将镜头边界平均绝对误差从1.11秒降低至0.042秒,降幅达96%;同时将对白准确率(0.5秒内命中)从28.3%提升至84.1%。TCR在实现上述提升的同时,保持了与基线相当的视觉质量和音视频同步水平。用户研究进一步表明,参与者在全部五项评估维度上均更偏好TCR生成的結果。
流式视频理解要求多模态大语言模型(MLLMs)在严格的因果约束和有限记忆条件下处理连续视觉输入并响应用户查询。现有方法通常将历史观测压缩到外部记忆库中,并检索与查询相关的证据作为额外的视觉上下文。尽管这类方法行之有效,但这种“存储-检索”范式始终将历史证据保留为外部视觉上下文,使其无法被内化为一种紧凑且持续演化的潜在记忆,从而难以持续引导流式推理。为弥合这一差距,我们提出LatentStream——一种渐进式潜在工作记忆框架,将流式记忆从“存储-检索”转变为“检索-内化”。具体而言,LatentStream由三个相互协作的组件构成。首先,查询无关的分层流式记忆(Query-agnostic Hierarchical Streaming Memory)在固定记忆预算内,通过Jenks引导的自适应整合,将视觉历史组织为短期、中期和长期三个层次。当用户查询到达时,分层潜在记忆演化(Hierarchical Latent Memory Evolution)为各组潜在记忆标记赋予逐步扩展的记忆感受野,使其能够从各自对应的范围内迭代检索历史证据,并将其内化为长度固定的紧凑潜在记忆。最后,渐进式置信度引导的潜在记忆优化(Progressive Confidence-guided Latent Memory Optimization)根据分组预测熵构建分层递进奖励,并对潜在记忆标记与检索证据进行联合优化,促使流式推理的置信度不断提升。大量实验表明,LatentStream在现有在线与离线视频基准上均取得了新的最佳性能。
基于MLLM的嵌入模型在组合检索方面仍然能力有限,通常无法区分包含相同概念但属性-物体绑定关系不同的场景。然而,同一骨干网络在被用作交叉注意力重排序器时却能够解决此类区分问题,这促使我们将重排序器的组合判断能力蒸馏到嵌入模型中。我们提出CORE,它综合生成跨越五个组合匹配级别的候选列表,并引入Rank-KL目标,训练嵌入模型复现重排序器的细粒度排序。我们进一步引入分级评估协议,并在相同数据和调参预算下比较对比学习、成对CoSENT与列表式Rank-KL。比较结果显示,CoSENT和Rank-KL对多级监督的利用均比对比学习更有效,其中Rank-KL取得了最强的整体性能。在三个组合推理基准(COLA、SUGARCREPE++、NEGBENCH)上,CORE-RERANKER-8B实现了82.7%的总平均,比Jina-Reranker高出10.7个百分点;而CORE-EMBED-8B在所有被评估的嵌入模型中取得了最佳总平均(0.666)。这些改进可迁移至MCMR基准,同时不牺牲在COCO和Flickr30K上的检索性能。
基于可验证奖励的强化学习在任务具有程序化检查器时效果良好,但大多数长程智能体领域并不具备此类检查器。我们研究的是结果不可观测(outcome-blind)的设置,其中无法获得真实成功信号。多标准评分标准(multi-criteria rubrics)是提供此类奖励的常用方式;它们每条轨迹仅评分一次,但单一标量在跨越数十步的决策过程中是较弱的信号。我们提出DRACO:面向优势分配的评分标准分布式优势(Distributing Rubric-based Advantage for Credit Optimization)。它在训练过程中动态生成评分标准以跟踪策略不断演进的能力,对每条完成的轨迹仅评分一次,并将该评判结果重新分配至与已标注评分标准相关的步骤上,从而在GRPO中产生差异化的逐步骤优势。重新分配过程为闭式求解,且不引入任何经过训练的属性归因模块。在AppWorld上,DRACO相较基础模型提升15.9个点,相较使用稀疏真实奖励训练的GRPO提升5.3个点,且自身未使用任何验证器。在分布外Tau-Bench上,即使没有前沿评判器,它也相较基础模型提升5.3个点,同时优于基于真实奖励的训练以及其他基于评分标准的训练设置。DRACO的代码可在 https://github.com/IBM/draco 获取。
个性化助手不仅应当遵从用户的请求,还应当评估这些请求在用户当前情境下是否恰当。然而,以往的工作主要聚焦于准确执行请求,忽视了助手需要考虑情境并进行基于冲突的拒绝。此外,现有的冲突或安全检测工作依赖于显式提供的因素,而现实场景往往涉及必须从知识库(KB)中检索的隐式因素。为此,我们提出了用于冲突评估的个性化助手数据集(PACE),用于评估模型能否识别使看似合理的用户请求变得不恰当的潜在约束(以自我中心知识或事件的形式表达)。PACE 将基于明确人设的用户请求与自我中心知识库事实配对,要求模型整合情境证据以判断请求是否存在冲突。这种隐式检索设置阻碍了用户请求与冲突诱发知识之间的直接关联,使得现有模型难以识别相关的用户特定事实。为应对这一挑战,我们进一步提出了 PaceMaker,一种多智能体框架,其中专门的智能体在查询重构、多跳图遍历和冲突感知过滤之间协同配合,以检索具有情境决定性的证据。在 PACE 上的实验既评估了证据检索质量,也评估了冲突决策准确性,结果表明 PaceMaker 始终优于现有方法。
编码代理目前通常使用SWE-bench基准系列进行评估,该系列任务基于精选的GitHub问题构建:这些问题篇幅较长、结构清晰且信息丰富。然而,真实用户请求通常要简短得多,且结构化程度较低。为刻画这一差距,我们定义了一个六类信息分类法以及语言风格的四个维度,并将其应用于SWE-chat的真实用户提示以及SWE-bench Verified和Pro中的问题陈述。我们发现,仅包含问题描述(或仅附带有限额外上下文)的请求占真实提示的88%,但在基准问题中仅占7%。此外,87%的真实提示为随意书写风格,而94%的基准问题为正式风格。在这些观察的指导下,我们推出了RealSWE,一个包含381个多变体任务族的数据集,源自SWE-bench Verified和Pro。每个任务族内的变体共享相同的底层任务和参考补丁,仅在信息构成和语言风格上有所不同。使用RealSWE评估七个当代大语言模型,我们发现:i) 真实化输入平均使解决率降低6.4个百分点,且可能改变模型排名。受控分析进一步表明:ii) 包含“期望行为”和“动机”对性能有显著影响,而“环境信息”和“复现步骤”仅增加额外标记却无可测收益;iii) 语言风格的影响较小且因模型而异。这些发现为用户和代理提供了可操作的建议:明确说明期望行为和动机——这是大多数真实提示所省略的——能够显著提升大语言模型的软件工程性能。
基于相机的世界模型生成交互式视频,其中指令动作应引发期望的场景变化,同时外观、几何和时间动态保持连贯。现有奖励方法分别评估这些需求:基于几何的奖励估计轨迹执行质量,但无法判断所执行动作的视觉质量;而基于图像的奖励衡量帧质量,却不捕捉动作执行或时间动态。我们提出,视觉语言模型(VLM)为关联动作与其视觉结果提供了共享推理空间。然而,针对完整动作序列评判整个长视频会形成冗长且嘈杂的上下文,其中短暂存在的局部动作证据可能被遗漏或稀释。我们提出WorldReward,一种基于VLM的成对偏好奖励模型,统一了基于相机的世界模型的动作一致性和视觉质量评估。WorldReward将成对视频分解为动作对齐的分块,将每个分块组织为结构化视觉证据,并通过投票将分块级决策聚合为独立的视频级动作偏好和视觉质量偏好。为训练该模型,我们使用由前沿VLM生成并经基于工具的主体审计和针对性人工审查精化的结构化判断,构建了大规模推理增强偏好数据集。我们进一步引入WorldReward-Bench,一个人工标注基准,用于衡量奖励模型在动作一致性、外观质量和运动质量三个维度上与人类偏好的一致性。WorldReward在所有三个维度上均取得最高一致性,分别超过GPT-5.5达3.42、1.45和3.56个百分点。当用于HY-WorldPlay 1.5的强化学习后训练时,它在短期到长期时间范围内持续改善动作执行和视觉质量。
为了推动科学的进步,我们需要能够测试最先进模型极限的基准测试,以及能够揭示失败案例的评估方法。随着模型不断增强,机器翻译的标准基准测试正逐渐趋于饱和。此外,自动翻译指标不可靠,容易受到奖励欺骗的影响,并且提供的评估结果缺乏可操作性。即使是人工评估也并非没有问题,因为它往往缺乏可重复性、客观性和可扩展性。总体而言,这些问题阻碍了我们追踪该领域的客观进展以及识别改进路径。我们引入了“最后翻译基准”(Last Translation Benchmark),这是一个由人工撰写并经同行评审的示例(文本、图像、音频、视频)集合,能够击破领先的机器翻译模型。我们还提出了一种新的评估方法:每个示例都配有手工设计的验证规则,用于描述该示例上的具体失败模式,从而实现可靠且可操作的未来评估。最后翻译基准是一个持续接受贡献的动态数据集。最新版本为LTBv1,包含2026年9月1日之前被接受的贡献,未来将随着新数据的持续收集而发布更新版本。
我们提出了 FlashRender,一种少步生成式渲染框架,能够在数秒内沿目标相机轨迹对源视频进行重渲染。我们将依赖于采样步数的相机控制识别为现有多步生成式渲染模型中离散化误差的突出表现,并表明解决这一不一致性可大幅降低去噪轨迹的曲率,从而有利于后续的步蒸馏。为此,我们引入了表示转换与对齐(Representation Transformation and Alignment, RETA),该方法将源视频的隐藏表示与来自冻结的视觉几何模型的目标视频特征进行对齐。这直接将几何变换编码到源视频流中,从而实现了跨采样步数一致的相机控制。随后,我们在由 RETA 导致的低曲率去噪轨迹上,使用 MeanFlow 目标函数对模型进行微调,使模型能够更有效地处理离散化误差。最后,我们应用在策略流映射蒸馏,以修正固定少步采样下的自生成轨迹误差。大量实验表明,RETA、MeanFlow 与在策略流映射蒸馏在少步生成式渲染中发挥着互补作用。三者共同使我们的方法在视频质量和几何一致性上与多步基线方法相当,而采样成本仅为原来的 1/25,同时实现更优的相机可控性,即便面对分布外的目标相机轨迹亦是如此。
理解智能体行为需要能够扩展到数千条轨迹的方法,并能在冗长且往往陌生的任务中揭示新的模式,而预构建的分类器在这种情况下往往力不从心。我们提出将扎根理论引入智能体轨迹分析——这一源自社会科学、已有六十年历史的定性方法,具有原则性的饱和判据以及从数据到理论的可审计轨迹。我们提出AutoTraceGT(通过扎根理论实现自动化轨迹分析),这是首个在智能体轨迹上自动化扎根理论的多智能体流水线。它迭代执行开放编码、轴心编码和理论编码,直至达到饱和,从而生成针对每项任务量身定制的行为分类体系。在六个轨迹语料库上,AutoTraceGT生成的编码手册能够恢复人工标注分类体系中73%至91%的失败模式,并揭示出这些分类体系所遗漏的额外模式。其涌现出的理论叙事与既有专家论述相一致。作为演绎性特征空间使用时,该编码手册在下游失败预测任务上优于零样本和少样本LLM基线。这些结果表明,扎根理论为机器学习研究者和智能体开发者研究智能体的实际行为提供了一种可扩展的分析工具。
扩展交互式和可验证环境对于训练终端智能体至关重要。随着前沿模型能力不断增强,从零开始合成的环境变得不再具有挑战性,因而提供的学习信号也有限。近期提出的共同进化方法基于模型在回滚过程中暴露的弱点,在模型可学习前沿附近迭代合成环境。然而,这类方法对在策略回滚的依赖限制了其泛化能力,并且随着模型能力增强,持续提供学习信号的能力也会受限。本文提出环境进化方法,该方法以离策略方式逐步提升环境难度,并在训练过程中逐代调度进化后的环境,以提供持续的学习信号。我们从多轮学习目标出发推导出三条影响环境难度的进化方向,并通过循环工程化的多智能体框架沿这些方向实施进化。基于Hy4 preview、Claude Opus 5和GPT-5.6 Sol的定量回滚实验表明,环境进化能够持续生成更具难度的环境。我们通过简单的长时程强化学习训练在Qwen3.6-27B和Qwen3.6-35B-A3B上验证了该方法的有效性,分别在Terminal-Bench 2.1基准上将性能提升了14.4和18.0个百分点。
评估视频模型中的物理推理能力具有挑战性,因为绝对运动测量依赖于帧率、物体尺度和相机标定,而这些因素在生成视频中往往存在歧义或不可获得。我们提出了一种不同的方法。当同一场景中的两个物体遵循相同的物理定律时,它们的运动必须满足可预测的关系,且这些关系独立于标定而成立。我们引入了Principia基准,通过配对物体之间的关系一致性来评估牛顿物理学。Principia涵盖八种现象——重力、恢复系数、摩擦力、转动惯量、抛体运动、动量、单摆和质量-弹簧振荡——涉及平移、旋转、碰撞和振荡动力学,并采用受控协议记录的真实场景。我们还引入了一种与标定无关的一致性评分,可直接在图像空间中量化物理违背程度。在来自六种最先进视频生成器的数千次生成结果中,尽管所有模型在VBench上的得分均约为0.8,但没有模型在Principia上的得分超过0.42。我们还评估了视觉语言模型检测关系性物理违背的能力,最佳模型仅达到67%的准确率,而大多数模型的性能接近随机水平。
长视频语言模型无法观看每一帧:以每秒一帧采样一小时视频将产生3,600张图像,而系统仅从该图像池中保留一小块固定切片。哪些帧能留存于该切片通常被视为预处理细节;我们检验这一做法是否应当如此。已发表的帧选择器使比较变得困难,因为它们同时改变了帧评分器、提示边界、分辨率策略和回答模型。我们将每一项固定不变,每次仅改变一个决策:选择、空间压缩以及节约资源的再投入,涵盖六种无需训练的选择规则、三个长视频基准测试和两个回答模型。选择是最大的单一杠杆:在LongVideoBench的一小时区间上,八个查询选中的帧比十六个均匀间隔的帧高出6.9分;而正交匹配追踪——一种未经修改的、已有数十年历史的稀疏逼近算法——在所有三个基准测试中,与我们所对比的每个专用选择器表现相当或仅差一分以内。压缩几乎免费:在固定时间戳下将每帧的空间预算减半,最多仅损失0.44分。再投入才是将预算转化为准确率的关键环节:将释放出的词元用于两倍数量的压缩帧,在实测代价不高于原始八帧的情况下,可额外提升两到三分;压缩只有在以这种方式花费其节约的资源时才有回报。在此过程中,我们自身AKS基线中的一个实现错误,以及两个测试框架在相同预算下运行相同已发表规则时出现的0.07至3.74分的差距,说明了为何这些比较必须在单一受控框架内进行,而非跨论文比对。
事后校准可以修正报告置信度,但多类校准器也可能改变相应的前1预测。准确率仅捕捉这些改变对正确性的净效应,而非预测发生变更的频率;前1预测变化率(Top-1 Prediction Change Rate, TPCR)则专门度量该频率。我们提出“用于前1决策保持的校准器输出修复”(Calibrator-Output Repair for Top-1 Decision Preservation, CORD),这是首个通过修复完整校准概率向量来强制实现精确预测保持的拟合后适配器。仅依据原始输出与校准输出,CORD即可确定原前1类别所分配的概率质量。校准后的条件分布将剩余质量分配至其他类别,由此得到的修复向量,其自身的argmax可恢复原始预测。在校准划分上,CORD协调修复后的概率质量,以在可达到的情况下保留校准确输出对原始预测的平均质量。该适配器既不改变已拟合的校准器,也不改变其直接输出,不拟合额外的监督映射,且无需用户或验证集调节的超参数。在CIFAR-10/100与ImageNet-1K上,CORD通过构造实现零TPCR,并在每个数据集中相对对应直接输出降低平均ECE、NLL与布里尔分数;在分布偏移和不同校准集规模下,配对增益依然持续存在。因此,CORD将保持约束从校准器拟合中移除,并把原始决策的精确恢复指派给随后的输出修复。我们的代码可在 https://github.com/labhai/CORD 获取。
我们研究随机梯度下降(SGD)的动力学。已知SGD会将深度神经网络引导至对应于更简单子网络的不变集。然而,这种引导如何随时间展开仍鲜为人知。我们通过将随机梯度流(SGF)建模为一种渗流过程来回答这一问题;在该过程中,架构对称性迫使子网络以离散的同步块而非逐个方式合并。这些结构转变在宏观序参量中表现为方差尖峰,与物理相变相呼应。我们进一步证明,这种俘获机制及其相关的标度级联在显式重尾噪声模型下可推广到Adam和AdamW。
显微镜中重叠细胞的实例分割仍具挑战性,原因在于半透明结构产生弱边界,且重叠区域呈现混合视觉证据。现有方法通过局部感兴趣区域或形状先验来处理该问题,但缺乏跨越重叠对象的全局推理能力。我们提出QCell,一种新颖的基于查询的模型,用于解重叠显微镜场景中的细胞实例。我们的方法结合了:(i) 实例重组模块,在潜在空间中分解并重组查询表示,使模型能够在重叠情况下推理完整的对象结构;以及(ii) 对比查询对齐目标,该目标结合了判别性实例特征学习与重叠细胞查询的分离。我们还引入了一个新的类器官数据集基准,用于重叠细胞分割。实验表明,QCell在多个基准上优于现有最先进方法,在ISBI2014上实现了+2.2 AP和+2.7 AJI的提升。代码可在 https://github.com/SlavkoPrytula/QCell 获取。
生成视频的视觉流畅性并不意味着物理可靠性,且仅凭一个标量质量评分无法指出某个片段违反了哪条约束或在哪一时刻失败。我们提出 VeriPhy——一个可审计的物理验证系统。在该系统中,一个纯文本规划器在观察到任何帧之前,将提示词编译为类型化物理约束和一个经静态验证的执行计划。执行过程中,观测只会对预先声明的、指向冻结低层专家(例如分割与跟踪、计数、对所得轨迹进行十一种类型化物理测量、深度、OCR 和音频事件检测)的调用进行门控与范围限定。每项操作都会返回一条携带溯源信息的证据记录;该记录的有效载荷在可用时,要么是类型化测量结果,要么是显式标记的学习状态。类型化解析器与固定组合将可用记录映射为三值状态(支持、矛盾或未知,对外呈现为“合理”“不合理”或“弃权”),并带有完整溯源,因此每条裁决都可回溯到产生它的证据。 我们的评估以包含 1,500 个片段、带有人工标注缺陷记录的语料库为锚点;这些缺陷记录从提示词指涉、空间和时间上定位了真实的生成失败。在包含 304 条此类记录、由 149 个片段构成的核心子集上,VeriPhy 检出 228 条;而在给定相同片段和相同断言的情况下,一个已发表的问题分解式评估器仅检出 164 条。仅凭召回率无法将 VeriPhy 与对同一主干模型进行整体式提示的方法区分开来——后者达到 222 条;真正的区分在于,每个决策都保留其证据记录和溯源,使得每条裁决背后的追踪过程都可一一审计,并可用作将评论者(critic)的裁决写回生成过程的接口。
基于可验证奖励的强化学习(RLVR)能显著提升单次采样准确率(pass@1),但会导致策略的解空间收缩,从而削弱测试时扩展的收益。在本工作中,我们研究了这种广度在推理轨迹内部何处丢失:是策略无法访问某个有效解族,还是策略在计算启动后无法执行?为了将访问失败与执行失败区分开,我们分析了 Countdown 任务——其解空间可依据第一个操作数和运算符被穷举划分为离散的入口解族——并在 Qwen2.5-3B 上的 PPO 与 Qwen2.5-3B-Instruct 上的 GRPO 两种设置下进行了实验。在两种训练设置下,解覆盖度最多下降 67%,即使是在所有检查点均被解决的问题上,覆盖度也减半。我们发现,这种收缩高度集中在入口处:第一次算术运算之前的逐词元似然偏移量比后续推理过程中的偏移量大 11 至 16 倍。仅提供一个未被选中的入口前缀,就能使低访问率入口解族的完成率恢复一个数量级以上(PPO 下从 0.018 提升到 0.212),这表明替代解仍然可以被执行,只是不再被启动。在该定位结果的指导下,我们发现表层提示无法恢复多样性,而针对入口的干预是有效的:用早期检查点对后层参数进行插值,可在 pass@1 无损失的情况下将解覆盖度提高 37%。最后,我们表明,早期步骤的熵坍缩在使用 7B 和 14B 模型的六个数学基准上反复出现,但这并非推理优化的必然副产品:SFT 基线保留的覆盖度是 RLVR 方案的两倍以上,且分阶段的 SFT-DPO-RLVR 流水线能够保留早期步骤的熵。综上所述,推理广度丢失在入口处,而非房间内部。代码:https://github.com/ershiyidian/early-branch-locking。
言语脑机接口(speech BCIs)将神经活动转化为语言,为瘫痪患者恢复言语能力提供了途径,并在更广泛的层面上实现了新型自然的人机交互。尽管前景广阔,该领域却缺乏统一的进展衡量指标,因为不同系统采用不同的数据集、记录方法、言语类型和词汇表,因此其报告的分数难以相互比较。这一度量问题背后存在两个尚未解决的关键问题:(i) 言语脑机接口应使用户能够交流何种词汇分布;(ii) 系统能够传递该分布中的多少信息。我们通过推导开放词汇互信息(OVMI)来同时解决这两个问题。OVMI是一种信息论量,用于衡量解码器相对于用户可能希望交流词汇的参考分布所传递的信息量。这使得在不同条件(如不同词汇表)下测得的能力能够在统一的交流尺度上进行评估。我们证明,通常报告的准确率、词错误率(WER)以及其他仅针对系统所支持词汇计算的指标,可能会高估系统所能传达的用户意图言语量。随后,我们使用OVMI对现有系统进行比较,揭示系统所支持的用户语言覆盖范围与其解码准确度之间的权衡,表明这些比较结果取决于用户预计要交流的内容,并证实选择使OVMI最大化的词汇表可在三个语音领域使准确率相对提升高达16.3%。因此,OVMI为言语脑机接口研究界提供了一种原理性的方法,用以比较异构系统、改进词汇表设计并衡量该领域的进展。