每日精选AI研究论文及翻译
技能是软件智能体的一种有用抽象,它将人类和智能体的经验转化为可复用的程序化知识。然而,现有的技能库大多是手工编写的、以文本为中心的,或从智能体轨迹中提取的,这使得教程视频和其他多模态人类资源在很大程度上未被充分利用。我们提出了RESOURCE2SKILL框架,该框架将包括教程视频、代码仓库、文章和参考作品在内的多模态资源提炼为软件智能体可执行的技能。RESOURCE2SKILL将这些技能组织成一个层级化的多模态技能维基,其中每个条目结合了结构化文本、代码、视觉示例、元数据和来源信息。这种设计保留了来自不同资源的互补信号:视频捕捉时间顺序操作和视觉效果,代码捕捉可执行的工具模式,而文章或作品则提供概念和风格上的基础。在推理时,智能体从维基中检索并组合相关技能;当覆盖不足时,相同的构建操作符可以在线获取新技能。在七个实际的创作领域中,与无技能智能体相比,RESOURCE2SKILL的平均总得分提高了11.9个百分点,并在28个主聚合模型-领域单元中的26个中优于强大的工具基线。消融实验证实了多模态技能格式、层级化组织、来源多样性、选择策略和在线获取的价值。
图检索增强生成(GraphRAG)通过结构化知识增强大语言模型,但现有系统采用单次提取方式构建知识图谱,导致实体噪声与检索脆弱性问题。RAGU作为开源模块化GraphRAG引擎,通过将提取与整合分离来解决该问题:实体和关系依次经过两阶段类型化提取、基于DBSCAN的去重、大语言模型摘要生成以及Leiden社区检测。一个关键洞见推动了轻量级提取器的设计:流水线内大语言模型所需的技能——理解、提取、基于上下文的推理——属于语言技能,其能力随模型规模增长弱于事实性世界知识。据此,我们训练了Meno-Lite-0.1——一个针对语言技能优化的7B模型,该模型在知识图谱构建任务中超越Qwen2.5-32B(调和平均数相对提升12.5%),并在英文GraphRAG任务中与其持平。在GraphRAG-Bench(医学领域)上,RAGU在每个事实层级均检索到最完整的上下文(证据召回率最高达0.84,对比≤0.76),并在综合任务中超越HippoRAG2;在多跳事实型问答任务中,HippoRAG2的明显优势被证明主要是答案格式造成的假象。RAGU可通过`pip install graph_ragu`安装,单GPU即可运行,遵循MIT协议开源。源代码已发布在https://github.com/RaguTeam/RAGU,Meno-Lite-0.1模型可从https://huggingface.co/bond005/meno-lite-0.1获取。
我们推出了Loopie,这是迄今为止最强大的循环Transformer。Loopie系列包含两个混合专家(MoE)模型:一个200亿参数模型(其中20亿为活跃参数)和一个60亿参数模型(其中6亿为活跃参数)。循环Transformer长期以来面临一项挑战:当预训练计算量增加N倍时,将参数量扩大N倍通常比将模型循环N次效果更佳。Loopie成功攻克了这一难题。大量消融实验(包括与普通30B-A3B模型的对比)表明,在相同计算预算下,Loopie显著优于普通Transformer基线。我们创新的训练后流程赋予了Loopie强大的推理能力。在2025年国际数学奥林匹克竞赛(IMO)和国际物理奥林匹克竞赛(IPhO)中,Loopie在不借助外部工具的情况下取得了金牌级别的表现。
我们提出小米机器人-1,这是一个基础的视觉-语言-动作模型,具备以下能力:(1)在未见环境中开箱即用地遵循多样化的语言指令执行广泛的移动操作任务;(2)以极少的微调数据高效适应新颖的下游任务。我们提出了一种包含预训练和后训练的两阶段训练方案。在预训练阶段,我们通过训练超过10万小时的、由UMI设备收集的真实世界操作轨迹,赋予模型广泛且通用的动作生成能力。关键的是,我们开发了一个可扩展的自动标注流程,用描述场景状态变化的自然语言对轨迹片段进行标注,为动作学习提供了丰富且精确的条件。在后训练阶段,我们旨在将这些能力与机器人本体以及人类自然用于提示机器人的指令性语言对齐。大量实验证明了强大的扩展行为。在预训练中,小米机器人-1的性能随着数据规模和模型大小的增加而持续提升。这种扩展行为直接迁移到后训练中:更强的预训练模型在未见环境中能实现更好的开箱即用真实机器人性能。此外,小米机器人-1作为一个强大的机器人基础策略,能够在复杂、灵巧的任务上以高数据效率进行高效微调。在多个模拟基准测试中,小米机器人-1超越了最先进的方法。值得注意的是,它在RoboCasa365上以57.6%的成功率创下了新的最先进记录,超过了此前的最佳成绩46.6%。同时,它在RoboDojo上的平均得分为20.07,显著优于此前的最先进水平(13.07)。代码和模型检查点将公开发布。项目页面:https://robotics.xiaomi.com/xiaomi-robotics-1.html
超连接(Hyper-Connections, HC)将Transformer的残差流扩展为N个并行流,提供了一种超越模型宽度和深度的记忆扩展形式。流形约束超连接(Manifold-Constrained HC, mHC)在大规模下稳定了该结构。从N=1到N=4的显著增益表明,残差流扩展是一条有前景的扩展维度。然而,现有HC家族方法通常止步于N=4。我们的实验揭示了原因:将mHC扩展到更大规模会导致性能增益递减且训练成本急剧增加。我们将这一限制归因于两个瓶颈:一是扩展的流数导致回写信息不足,二是残差混合生成的复杂度随N呈三次方增长。为解决这两个瓶颈,我们提出xHC(扩展超连接),这是首个能在N>4时实现有意义扩展的HC家族方法。xHC融合了时间特征增强以提供更丰富的回写信息,以及一种稀疏残差流架构——该架构仅更新N=16个流中的k=4个,同时保留对完整残差状态的密集访问权限。在18B和28B MoE模型上,xHC带来了强劲且一致的下游性能提升。在18B MoE模型上,xHC相比mHC将平均下游得分提升了4.0分,同时相对于原始基线仅增加了适度的训练FLOPs。扩展定律实验表明,为达到相同损失,原始模型和mHC所需计算量分别是xHC的1.50倍和1.19倍。大规模N的实际训练还需控制扩展残差状态带来的内存流量。为此我们引入xHC-Flash,该方法将每子层内存流量从73.5C降至40C,与mHC在N=4时所需的34C相当,同时保留了完整xHC的性能增益。xHC与xHC-Flash共同使大规模N残差流扩展在大语言模型预训练中变得高效且实用。
医疗领域涵盖了高风险的沟通、专家推理和工作流程执行,然而,能同时覆盖这些应用场景的专用大语言模型(LLM)仍然有限。一个医疗模型需要处理患者咨询、基于文本和图像的临床推理、交互式诊断以及电子健康记录(EHR)工具的使用。这些能力在不同方面存在不足,对某一任务的窄域更新可能损害其他任务的表现。我们提出了Cura 1T,这是一个通过人类门控自进化循环训练的医疗专用LLM。在每一轮进化中,训练智能体规划目标能力、训练模型、评估基准轨迹,并根据观察到的失败情况优化数据混合。这一以数据为中心的循环通过有针对性的合成示例和精选示例来改进模型,而非采用单一的通用医疗数据更新。在医疗评估套件中,Cura 1T在前沿基线中排名靠前或位居榜首,同时在领域外的推理和智能体基准测试中保持竞争力。
在线策略蒸馏是强化学习中一种替代性的后训练方法,它通过从教师模型提供词元级别的监督信号,缓解了奖励模型带来的约束。尽管在线策略蒸馏已在多种场景下得到研究和应用,但其基本设计仍未被充分探索。本文提出一种新的蒸馏奖励——增量信号(delta signal),以替代直接模仿教师模型的输出分布。增量信号定义为教师模型与其在推理能力指令微调前的基础模型之间的差值。因此,它能够捕捉推理微调所引发的变化,并为迁移推理能力提供更直接的信号。通过大量实证证据,我们证明增量信号显著改进了在线策略蒸馏,并将这种新蒸馏方法命名为在线策略增量蒸馏(On-Policy Delta Distillation, OPD²)。在数学、科学和代码推理基准上的实验表明,OPD²始终优于传统在线策略蒸馏,使推理大语言模型仅需短暂的后训练即可实现强劲性能。代码将在 https://github.com/naver-ai/opd2 上公开。
大型语言模型(LLMs)正将推荐系统从匹配历史行为中的共现模式,转向对驱动行为的意图进行推理。RecGPT-V1 通过聚焦用户理解,在淘宝上开创了这一范式;RecGPT-V2 则通过协调多智能体推理将其规模化;两者均已部署至生产环境,并在用户体验和商业成果上持续取得正向收益。然而,大规模运行 RecGPT 暴露出三个挑战:(1)无状态行为建模——每次请求都重新处理完整的用户历史,浪费计算资源且丢弃了先前的分析结果;(2)标签到物品的信息瓶颈——自然语言标签在用户理解与物品落地之间构成了有损通道;(3)低效的显式推理——冗长的思维链导致不可接受的延迟和计算开销。 我们提出 RecGPT-V3,一种有状态、混合模态的推荐系统,它结合了用于开放世界知识的自然语言推理和用于具体物品落地的语义ID(SIDs)。一个记忆枢纽(Memory Hub)维护着结构化且持续演进的用户记忆,将长期行为提炼为紧凑单元,将用户建模的计算量削减 55.8%。混合模态基础模型(Hybrid-modal Foundation Model)使 LLM 能够联合推理文本标签和语义ID,开辟出一条通往物品空间的高带宽通道。潜在意图推理(Latent Intent Reasoning)将冗长的推理过程内化为紧凑的可学习潜在令牌,同时仍可解码为可读的解释,将输出令牌成本降低 200 倍。在淘宝“猜你喜欢”信息流中部署后,RecGPT-V3 在大规模在线 A/B 测试中取得了持续提升:IPV +1.28%、CTR +1.00%、TC +1.97%、GMV +3.97%,同时将端到端服务资源消耗降低了 52.4%。
代码审查有助于在代码集成前维护软件质量,但也给人类审查者带来了沉重的工作负担。随着生成式人工智能成为软件开发的一部分,代码审查正从主要依赖人类审查的过程转向人工智能支持的审查过程,其中大语言模型(LLM)审查者和AI代理审查者与人类审查者共同参与。然而,我们仍缺乏关于这一转变如何影响审查效率和审查质量的实证证据。本文研究了来自207个GitHub项目的102万个已审查拉取请求,这些项目经历了三个代码审查时代的转变:以人为中心的审查、LLM辅助审查和代理式代码审查。我们识别出三种AI审查者采用实践:渐进式AI采用、快速LLM采用和快速AI代理采用。我们进一步将拉取请求审查讨论建模为审查者交互序列,以描述人类、LLM和AI代理审查者在审查过程中的协作方式。结果表明,涉及代理的协作模式——尤其是由AI代理发起或涉及多个AI代理的审查——在渐进式AI采用和快速AI代理采用模式下与更快的审查决策相关。然而,这些效率提升并未转化为更好的审查质量。我们还发现,审查活动和拉取请求类型在各个时代仍然重要,而一旦LLM和AI代理审查者参与其中,人机协作模式便成为审查效率最强的解释因素。这些发现为设计既能提高效率又不削弱审查质量的人工智能支持代码审查流程提供了实证指导。
强化学习(RL)已成为提升大语言模型(LLMs)在复杂推理任务上表现的核心技术,然而当前对RL后训练的研究大多独立于其前的预训练阶段。由此导致两个基本问题悬而未决:(1)预训练选择(模型规模、数据)如何影响RL计算投入的回报率?(2)RL究竟对模型产生了什么影响?这些问题在标准LLM设置下难以研究:预训练语料库规模庞大且无法受控,导致难以将模型行为归因于预训练还是RL,且对两个阶段进行系统性的计算量扫描成本过高。为解决这些挑战,我们以国际象棋为受控实验平台,研究从预训练到后训练全流程的推理能力。我们遵循标准LLM训练流程:首先在大规模人类棋谱上预训练参数规模从500万到10亿不等的语言模型,随后在合成推理轨迹上进行监督微调,最后对带有可验证奖励的国际象棋谜题实施RL训练。利用这一框架,我们发现:在给定RL计算量下,后RL性能可通过预训练损失进行良好预测,且RL奖励曲线的斜率随预训练数据量近似线性提升。除规模规律外,我们还发现RL并非简单地对监督微调(SFT)策略进行锐化:在简单谜题上,它放大了SFT策略原本就偏好的正确走法;而在困难谜题上,它发掘出了SFT策略几乎从未出现的正确走法。我们进一步验证这些发现是否超越国际象棋领域,通过在数学领域文本上训练10亿参数语言模型,观察到相同的预测模式:预训练更充分的检查点在RL后达到更高性能,且在RL训练中提升更快。总之,我们提供了预训练与RL接口的定量描述,以及一个可受控的测试平台,用于研究从预训练到后训练全流程的推理科学。
本报告介绍Qwen-Music,一款功能强大的音乐生成模型,能够生成具有完整人声演唱、高音乐表现力和高保真度的歌曲。Qwen-Music支持两项核心任务:文本到音乐生成(根据文本描述、歌词和音乐属性创作全新歌曲)以及翻唱生成(以不同风格和人声特征重新演绎现有歌曲)。在架构上,Qwen-Music集成了三个核心组件:Qwen-Music-Tokenizer、Qwen-Music-LLM和Qwen-Music-Render。Qwen-Music-Tokenizer将音频压缩为25 Hz的单码本流音乐语义标记,保留用于大语言模型预测的语义和旋律信息。基于这些标记,Qwen-Music-LLM执行自回归音乐语义建模,其关键创新在于基于旋律标记的思维链机制——在全曲生成前规划旋律,从而提升创意性、音乐性、结构连贯性,并支持基于参考音频的旋律克隆。为解决离散语义标记的保真度限制,Qwen-Music-Render执行生成式立体声渲染,丰富声学细节并生成高保真立体声波形。最后,我们在超过500万小时的多语言音乐数据(涵盖数百种语言)上训练Qwen-Music-LLM。首先应用质量感知的预训练课程,然后采用渐进式后训练,包括监督式初始化、离线DPO和在线GSPO,以进一步提升音乐性和指令遵循能力。在600条中英文提示词上,Qwen-Music在16项客观音乐性和音频质量指标中的13项上达到了最优结果。专业评估者相比主流商用系统也更偏好Qwen-Music。在翻唱生成任务中,Qwen-Music比主流商用系统更准确地保留参考旋律。
在模型-框架共同进化(model-harness co-evolution)的范式下,框架不仅是推理时的支撑结构,更是能够生成数据的关键组件——其执行轨迹可以塑造未来的基础模型。这催生了“框架在环学习”(harness-in-the-loop learning)的理念:对框架进行优化,既要考虑当前智能体的性能,也要兼顾其生成轨迹对未来模型训练的质量。然而,持续更新由提供方构建的框架(scaffolds)成本高昂、劳动密集。因此,我们探究是否可以通过以任务特定方式优化用户自主构建的框架,在仅需少量更新迭代且计算轻量化的前提下,提升执行轨迹的质量。为此,我们提出了递归框架自我改进(Recursive Harness Self-Improvement,RHI),该方法将框架表示为智能体循环的提示层级规范,并利用其自身修订历史中的成对反馈进行迭代优化。在涵盖量化金融、机器人学和制药领域的30个合成机器学习研究任务中,仅需少量RHI迭代,即可显著提升低推理努力(low-reasoning-effort)智能体的性能上限,甚至超越对应最高推理努力(maximum-reasoning-effort)的设置,同时将推理成本降低高达60%。我们证明,这些性能提升主要源于通过更有效的智能体间信息流来改善任务特定的上下文管理,而非依靠更长的推理轨迹。最后,我们将这一行为形式化为RHI隐含优化目标的信息论假设,表明RHI是模型-框架共同进化范式下一种实用的持续学习算法。
Muon在大型预训练中与AdamW不相上下,但其在强化学习(RL)后训练中的价值尚不明确。我们通过匹配单种子的对照实验,使用Qwen2.5-0.5B-Instruct在ALFWorld上比较了朴素Muon与AdamW在稀疏奖励的智能体强化学习中的表现。在组内组策略优化(GiGPO)下,仅对隐藏权重矩阵应用Muon使最终窗口的验证成功率从0.290提升至0.546(提升88%);高学习率的AdamW对照组在更新后未取得成功率提升。该效果取决于优势估计子和学习率。在3e-5学习率下,Muon将GRPO成功率从0.161提升至0.268,而GraphGPO的后期窗口差距在接近饱和时缩小。在1e-5学习率下,GraphGPO Muon达到0.901的成功率,将归一化验证AUC从0.399提升至0.556,并且分别提前30次和60次更新达到0.5和0.75的成功率。这些探索性结果表明,Muon能够有益于智能体强化学习,并激励我们联合研究策略优化器、优势估计子和学习率。多种子及跨任务验证仍有待深入探究。
我们提出了S1-Omni,一个面向科学理解、预测与生成的统一多模态推理模型。AI for Science (AI4S) 已通过领域专用模型、工具增强的大语言模型及科学语言模型取得了显著进展。然而,模型能力仍高度碎片化,限制了异构数据、科学规律与专家知识的联合建模。S1-Omni通过将这些能力整合为一个统一的科学推理模型来弥补这一不足。S1-Omni的架构基于三个核心组件:科学数据的统一表示、自然世界知识对齐以及面向特定领域任务的解码。首先,S1-Omni将自然语言指令与科学对象(包括CIF、SMILES、蛋白质序列、光谱及科学图像)映射至共享表示空间。其次,它将科学规律与专家知识融入数据构建与训练过程,使模型能够基于科学证据进行推理。第三,它执行任务特定的解码,以支持广泛的应用场景,包括性质预测、光谱到分子生成、蛋白质位点与结构预测,以及科学图像生成与编辑。S1-Omni基于包含200个科学任务、数百万条推理样本的S1-Omni-Corpus语料库进行训练,并在超过60项科学基准上进行评估。在大多数基准上,它优于GPT-5.5与Gemini-3.1-Pro,在多项基准上达到或超越领域专用模型水平。总体而言,S1-Omni为统一的科学建模提供了一条可行路径。
基于可验证奖励的强化学习(RLVR)通常采用熵进行优势塑形。然而,熵无法区分有益的不确定性与有害的混乱,这限制了其作为正确性信号的有效性。我们提出对比策略优化(CPO),该方法通过参考引导生成分布与原始生成分布之间的词级对比差异,实现正确性感知的优势塑形。理论和实证结果均表明,这种差异能可靠地指示词级正确性。我们进一步证明在线策略蒸馏是CPO的一种特例,其通过外部教师模型实例化后验分布。CPO还解决了零优势问题。在领域内和领域外基准上的实验表明,CPO显著优于基于熵的RLVR方法,同时保持强大的泛化能力。进一步分析显示,正确与错误响应分别自然支持探索与利用,平衡两者可获得最佳性能。
视频生成模型通常依赖于由3D变分自编码器(3D-VAE)学习的潜在空间。然而,传统3D-VAE主要针对像素级重建进行优化,这限制了其潜在表示所捕获的语义和时空结构。与此同时,视频基础模型(VFM)如V-JEPA 2和VideoMAEv2展现了强大的视频理解能力,但其冻结表示能否转化为紧凑、可重建且利于生成的视频潜在变量,目前仍基本未得到探索。我们通过VideoRAE回答了这一问题,它是一种表示自编码器,利用来自冻结视频基础编码器的多尺度层次特征,并通过轻量级1D自注意力投影器对其进行压缩。VideoRAE通过多码本高维量化,同时支持用于扩散变换器的连续潜在变量和用于自回归模型的离散标记。在解码过程中,与冻结的VFM教师模型进行局部与全局表示对齐的目标,提升了语义保留能力,并使得训练无需KL正则化。实验表明,VideoRAE在连续和离散模式下均实现了强大的重建性能。在UCF-101上,使用自回归生成器和扩散变换器生成器分别获得了40和93的最优类别到视频gFVD分数,同时收敛速度比竞争对手的自编码器基线快约5倍。在一项受控的2B规模文本到视频研究中,用VideoRAE替换LTX-VAE在可比设置下实现了更快的收敛。这些结果验证了冻结的VFM表示是通用且利于生成的视频潜在变量。模型和代码将在https://zhxie0117.github.io/VideoRAE上发布。
尽管自主数据科学智能体在数据理解与决策方面展现出强大能力,但其工作流程仍高度依赖涉及高昂计算成本的试错模式。这一瓶颈促使研究者探索在执行前即可预判数据科学操作影响的模型。本文提出"数据科学世界模型"概念,通过基于当前工作流状态与候选操作预测环境状态转移来建模数据科学执行环境。我们进一步提出DSWorld实用框架,该框架融合结构化状态构建、成本感知路由、轻量级实际执行以及针对高成本操作的基于大语言模型的模拟器。为支持模型训练,我们构建了包含8000个样本的转移轨迹数据集,并提出反思式世界模型优化——一种面向转移预测改进的误差感知强化学习策略。实验表明,DSWorld可将基于强化学习的智能体训练速度提升约14倍,将基于搜索的推理速度提升约3至6倍,同时保持竞争性性能;在转移预测任务上,该方法较最强的大语言模型基线提升35.6%。相关代码已开源至https://anonymous.4open.science/r/DSWorld。
训练无关的上下文分割能够在推理时仅凭一张带标注的参考图像引入新目标类别,从而消除了类增量学习中的重新训练和内存开销。现有方法通过将视觉基础模型(用于语义对应)与可提示分割网络(如SAM)相结合来实现这一目标。然而,其性能从根本上受到跨图像相似度图质量的限制:参考图像与查询图像之间共享的上下文背景会系统性地提升非目标区域的相似度,从而降低提示定位的准确性。本文提出REBASE,一个训练无关的框架,显式抑制这些虚假的上下文对应关系。我们的方法从参考图像中识别出低秩背景特征子空间,并将参考和查询特征投影到该子空间的正交补上(以闭式求解),从而得到更干净的语义匹配。随后,我们利用基于相似度加权的远点采样生成正点提示,并结合细化的稠密相似度先验。无需任何训练或参数更新,我们的方法在PACO-Part、FSS-1000以及跨域数据集(如ISIC2018)上均达到了训练无关方法的最新性能,表明显式去除背景子空间是一种非常有效的单样本定位原则。
我们提出了音频-视觉火烈鸟(AV-Flamingo),这是一个完全开放的最先进的音频-视觉大型语言模型(AV-LLM),用于对音频、图像和长视频进行联合理解与推理。与先前主要聚焦于短视频片段的AV-LLM不同,AV-Flamingo专为理解和推理长且复杂的现实世界(音频-视觉)视频而设计。为此,我们做出了三项关键贡献:(i)Audio-Visual-Skills,一个大规模的现实世界视频数据集,包含约700万条字幕和问答训练实例,旨在强调时序、组合以及跨模态的音频-视觉推理;(ii)一种新颖的三阶段课程训练方法,逐步将模型从短期感知训练至长期多事件推理;(iii)时序音频-视觉交错思维链,这是一种推理框架,能够将中间推理步骤显式地定位到长音频-视觉流中的时间戳上,从而提升时序对齐能力和可解释性。在超过15个音频-视觉、全模态、音频和视觉基准测试上的大量实验表明,AV-Flamingo以明显优势优于同等规模的开源模型,并且在长且复杂的现实世界音频-视觉理解与推理任务上,与更大规模的开源权重模型和闭源模型相比仍具有很强的竞争力,甚至在某些方面超越它们。除了基准性能之外,AV-Flamingo还展现出强大的现实世界实用性,并能很好地迁移至未见过的任务,突显了其稳健性和泛化能力。
基于可验证奖励的强化学习(如GRPO)是当今推理模型的核心驱动力,但它仅对最终答案进行评分。在复杂问题上,这会训练模型写得更长而非想得更深,因为中间推理过程从未被评分,也不存在衡量优秀思维的标准。我们提出Agon方法,让两个相互竞争的模型互为评分者。两个模型尝试解决同一问题:在交替角色中,一个模型起草解答,另一个在阅读该解答的同时独立求解,每个模型因比对方更擅于解题而获得奖励。为了获胜,模型必须比看到其工作过程的对手推理得更优,因此推理能力在训练过程中被隐式评判,无需过程标签或奖励模型。由于两个模型同时优化,每个模型都面临不断变强的对手,这是单模型强化学习无法提供的。两者只需实力相当且行为模式各异即可。推理时,该配对按训练方式部署:形成两级级联,一个模型先起草,另一个阅读草案后再作答。在DeepMath的困难子集上结合Qwen3使用时,该方法使GRPO的pass@1翻倍,相较基于相同基座模型的未经训练的混合智能体方法,增益约达八倍。该结果在竞赛编程代码以及不同模型族(Qwen3.5、Gemma 4)上均得到复现。目前模型以文本形式交互;下一步将让它们在潜在空间中进行协同推理。
自主谈判代理正越来越多地部署在保险、采购等高风险场景中。虽然密码学技术能够保护显式披露的约束值,但未能应对一种更隐蔽的威胁:行为隐私泄露。在此类攻击中,对手可通过观察让步轨迹、时机及收敛模式等可感知的谈判动态,推断出私有约束条件。本文研究了多轮谈判协议中的行为差分隐私问题。我们设计了一种自适应随机谈判策略,该策略能同时保证(ε, δ)-差分隐私、报价序列的几乎必然收敛性(当对手保留价值允许时达成协议)以及高谈判效用。在3000轮合成双边谈判的评估中,我们的机制将对手推理准确率降低了43-50%,同时保持了超过90%的谈判成功率和效用,证明强隐私保障可以在不显著牺牲性能的情况下实现。
安全代理评估通常会在充裕的推理预算下衡量其峰值攻击能力,重点关注漏洞发现、漏洞利用开发、渗透测试和CTF解题。这类评估虽有价值却并不全面:在运维安全中,每一次推理步骤、工具调用、遥测查询和情报补充都会消耗预算。我们通过这种成本-成功视角,对开放型Cybench网络攻击挑战和防御型Splunk BOTS v1调查挑战中的语言模型安全代理进行评估。不同于仅报告最佳情况下的成功率,我们对比了固定成本水平下的模型表现,并按推理开销和工具开销对性能进行分解。研究结果揭示了红蓝队任务中不同的扩展规律:进攻型CTF性能随测试时计算量的增加而提升,且扩展后的开源权重模型在保持成本竞争力的情况下可接近前沿商业系统;而防御型SOC调查则不具备相同的扩展特性——其成功更多依赖于工具使用的规范性、遥测数据的导航能力以及情报的精准筛选,而非单纯的推理预算。我们认为,安全代理基准测试应将经济效率和运维适配度与任务成功率并重考量。融入成本意识的SOC原生评估能更清晰地揭示哪些模型在当前实际可用,以及防御型代理仍需在哪些环节改进。我们已将研究结果发布在交互网站 https://evals.frontier.security。
视觉-语言-动作(VLA)模型通过视觉观测和语言指令预测机器人动作。这些动作在机器人自身的3D坐标系中定义,但大多数VLA模型从相机视角观察场景,导致场景观测与动作定义之间存在帧失配。在固定视角下,该失配问题较轻微——策略可记忆单一观测到动作的映射关系;但当大规模数据集汇集不同相机设置下的示教数据、且策略需要跨视角泛化该映射时,问题会显著加剧。我们提出以机器人为中心的点图(pointmaps)来解决这一失配问题:该类图像的像素存储场景点在机器人坐标系中的3D坐标。点图在保留预训练2D VLA所需的密集H×W网格结构的同时,提供了机器人框架下的3D几何信息,因此能以极小的架构改动集成至现有VLA模型中。在RoboCasa数据集上,点图同时改进了pi0.5和SmolVLA模型,并优于代表性的相机视角方法和3D感知基线。在真实机器人实验中,当相机被移至训练中未出现的放置位置时,基于点图的策略相比纯RGB策略的优势进一步扩大。
我们提出了自验证推理器(Self-Verified Reasoner, SVR-R1),这是一个多轮强化学习框架,能将模型自身的验证转化为多模态推理的学习信号。对于每个查询,模型使用相同的权重生成答案,并输出一个二元自验证结论(是/否)。若结果为“否”,则触发第二轮修正思考;若结果为“是”或达到轮次上限,则最终确定输出并用于计算基于结果的奖励。SVR-R1 基于 GRPO 和异步多轮展开框架实现,无需外部监督或辅助评估器。我们在视觉-语言推理基准上评估了 SVR-R1,结果表明其准确率较强大的标准 GRPO 基线有大幅提升。训练动态显示,对验证的依赖逐渐降低——验证轮次减少,但测试准确率反而提高——这表明随着策略通过我们的框架内化自我修正机制并选择最自信的答案,验证与生成之间的差距逐渐缩小。SVR-R1 连接了视觉语言模型在推理时自我优化与强化学习训练这一较少探索的交叉领域,为引导多模态推理提供了一种简单而有效的方案。我们将开源 SVR-R1,以促进视觉语言模型的未来研究。
托卡马克聚变装置的等离子体诊断模型几乎完全基于干净、完整的传感器数据进行评估。然而在实际运行中,聚变诊断系统经常出现故障:采集系统启动延迟、个别传感器失效、信号丢失现象在等离子体破裂临近时尤为集中。我们基于包含11,573次MAST放电的TokaMark数据集,首次提出了等离子体诊断机器学习的系统化鲁棒性基准测试,评估了XGBoost、LSTM、Transformer及TokaMark CNN基线模型在六种物理失效场景和三种插补策略下的表现。我们引入鲁棒性评分(RS)以实现跨架构的标准化比较。核心发现是:临近破裂的传感器失效(在窗口末段时间步注入干扰)会导致序列模型性能崩溃(LSTM的NRMSE上升+212%),而统计特征模型保持相对稳定(XGBoost仅上升+37%)。前向填充插补可几乎消除序列模型因随机丢失导致的性能退化(LSTM从+57%降至约0%),但当窗口末端受损时收效甚微。基于实际破裂时间戳的放电级报警评估显示,LSTM在临近传感器失效下报警检测率骤降至TPR=0.00,而均值填充插补可将其恢复至TPR=1.00,这一结果与NRMSE观测模式完全相反。在所有架构中,等离子体电流被确认为最关键的单一诊断参数(移除后模型性能下降+73%至+140%)。相关代码、数据集及训练模型检查点已开源:https://github.com/Neerav-Gupta/tokamark-robustness。