每日精選AI研究論文及翻譯
自主代理正開始端到端地執行機器學習(ML)研究。這些代理將模型主幹與規劃、執行、記憶和驗證的調度框架相結合,但這種架構仍將領域特定的專業知識留在代理之外。我們將這一缺失層稱為操作知識——即區分「知道某種方法」與「讓方法真正運作」的訣竅。這種知識並非不存在於該領域之中。它出現在程式庫和論文中,但以面向人類讀者的形式編寫,且規模過大,無法在任務進行中載入。一旦將其蒸餾為精簡且經過驗證的技能,這種知識便能在任務之間重複使用,而非在每次運行中重新發現。 我們提出 DisCo,一個以技能驅動的研究代理,能夠建立技能並在研究過程中使用它們。其蒸餾以兩種互補形式進行:任務無關形式,將該領域廣泛使用的程式庫濃縮為可重用的技能;以及任務導向形式,產出具體任務所需的技能。前者應用於開源生態系統,產出 AREX-Skill 技能庫,其中包含從 1,000 個廣泛使用的 ML 程式庫中蒸餾出的 5,000 多項經驗證技能,並組織為 20 個領域和 178 個能力家族。在 GPT-5.5 主幹、研究調度框架和下游執行預算保持固定的條件下,配備技能的研究代理在 MLE-bench 上得分提高 134.3%,在 PaperBench 上提高 34.4%,在 FrontierCS 上提高 9.2%,在 PassNet 上提高 14.0%,相較於未配備技能的同一代理。這些提升來自於在該固定設置下添加了蒸餾後的操作背景知識。
隨著代理(agent)從研究原型走向實際部署的工具,其能力日益取決於模型外部的執行基礎設施,也就是一般所稱的代理執行框架(agent harness)。在固定模型權重不變的情況下更動此執行框架,即可能大幅改變任務效能。目前的代理評測通常是在所選定的執行框架下報告下游效能;相對而言,模型自身開發執行框架的能力,仍較少被探討。 我們提出 HarnessDev,這是一個將評測單位從任務輸出轉移至可執行基礎設施的基準。HarnessDev 涵蓋兩個階段:在「建立」(Creation)階段,代理從最小的種子與少數案例出發,建構出完整的執行系統;在「演化」(Evolution)階段,代理則從自身建立的執行框架出發,運用下游執行回饋反覆修訂,目標是提升基準效能。接著,我們以能力(在保留(held-out)基準上的任務成功率)與效率(執行 token 成本)兩個面向,評測每個建構出的執行框架。 本文報告的建立階段結果涵蓋六個建立者 LLM、四個領域、五個下游基準,共計 2,207 個不重複的下游實例;其中隱藏的評測任務刻意不納入開發過程。我們發現,所生成的執行框架在程式碼以及搜尋與研究方面仍明顯落後於成熟的人工工程參考框架,但在寫作與機器學習實驗方面則達到或超越所選參考框架,且執行成本差異極大。演化階段能帶來若干效能增益,但這些增益並不穩定,且僅能部分遷移至保留任務。以固定執行模型進行實驗的結果進一步顯示,這些增益高度取決於實際執行該框架的模型,反映出跨模型的遷移能力有限。
人類學習的許多重要形式始於模糊的目標,例如「成為更優秀的物理學家」或「提升研究能力」。學習者必須解讀目標、辨識能力差距、決定如何學習,並判斷自己是否確實有所進步。相較之下,現有的大型語言模型自我進化研究通常以人類指定的任務與評測指標為起點,把自我進化簡化為最佳化一個明確目標,而非決定要學什麼和怎麼學。 我們提出 ASPIRE,一個針對模糊目標驅動之自我進化的基準。ASPIRE 僅提供以自然語言表達的能力目標,下游評測任務則保持隱藏。智能體必須自行選擇資料與更新方法、建構訓練與驗證訊號,並決定何時進行評測,藉此將目標操作化。ASPIRE 在統一的互動式環境中同時支援模型權重進化與智能體框架進化,並以專家撰寫、涵蓋六個目標的 520 個隱藏項目,來評估最終系統。 實驗結果顯示,模糊目標會將搜尋努力轉向目標解讀。目前的智能體往往能完成訓練與框架編輯的循環,但權重層面的增益依然稀少且不穩定;最強的進化後框架仍低於工程化的 Qwen-Agent 參考系統。智能體常在不匹配的資料上訓練,並信任狹隘的自我評估,因而局部增益無法遷移至隱藏的評測;持續的搜尋與訓練甚至可能抹除先前的改進。
我們推出 SolarWM——一個完全開放的基礎架構,用於建構從資料準備到長時程推論的互動式影片世界模型。在異質資料來源與各種影片骨幹網路上訓練極具挑戰性:不同資料集的時間尺度、相機幾何、視覺品質、動態與描述文字風格各不相同,而影片生成器也各自採用不同的表徵與架構。因此,單純混合資料或針對特定模型作個別實作,會產生不一致的監督訊號,使結果難以重現與比較。為解決此耦合問題,SolarWM 結合了可重構的多來源資料引擎,以及以骨幹網路原生特性為本位的適配框架。該引擎將來自 10 個資料集的 143 萬個標準化片段,轉換為統一且逐幀對齊的資料契約,涵蓋視覺觀測、度量相機幾何、描述文字、品質後設資料、選擇決策與來源出處,同時將來源處理與混合資料建構解耦。在共享的相機條件化、訓練與推論介面下,我們基於 Wan2.2、LTX-2.5 與 MiniMax-H3 實例化了四個 5B 至 33B 參數規模的模型,同時保留其原生表徵與訓練目標。一套統一的三階段訓練配方結合了雙向適配、教師強迫自迴歸初始化與分佈匹配蒸餾。所得的因果模型僅以 5 秒序列訓練後,即可在長達數分鐘至數小時的推演中支援即時互動。透過公開釋出上述資料、流程、配方、權重與框架,SolarWM 為互動式世界模型研究提供了可重現且可擴展的基礎。
評估 LLM 代理對於引導其開發至關重要,然而其成本已成長到令人卻步的程度:前沿模型在代理型基準上一次單獨運行就可能耗費數百至數千美元,而這筆代價會在迭代開發週期中被反覆支付。先前以基準蒸餾為核心的方法,雖能減少評估任務的數量,卻未觸及執行每個保留任務本身的成本。在本研究中,我們提出早期結果預測(early outcome prediction),這是一個互補的效率軸向,改從每個任務內部削減成本。我們的關鍵洞察在於:代理的最終結果往往在執行完成之前,就能從其中間行為中清楚浮現。我們將此概念落實於 EarlyEval 框架——這是一個輕量級框架,訓練一對分別針對成功與失敗的 LightGBM 分類器,特徵涵蓋行為、文本及參考解答資訊;當任一分類器跨越校準後的信心門檻時,便立即中止代理運行,而每步僅增添可忽略的額外開銷。在 SWE-bench Verified、TerminalBench 與 Toolathlon 三個基準上,EarlyEval 能以 89%–97% 的預測準確率消除 13%–26% 的代理步驟,並最高節省 44.1% 的輸入 token 與 29.4% 的輸出 token,同時平均僅使每個代理的解決率變動一至兩個百分點。
檢索是現代搜尋與廣告系統的第一階段,負責從龐大的物品空間中選出候選集合,以供下游排序與拍賣使用。近期研究日益利用大語言模型(LLM),透過查詢擴展、資料合成與檢索回饋訓練來改善檢索。然而,生成元件通常僅用於查詢端擴充,最終匹配仍交由下游檢索器處理。我們提出 CoGR,這是一個檢索框架,改而訓練 LLM 在查詢端與物品端直接建構檢索表徵。每個生成器產出一組精簡的關鍵字,並透過反向索引直接進行匹配,從而保留與既有關鍵字檢索基礎設施的相容性。CoGR 採用兩階段訓練流程:先以監督式微調建立對齊的關鍵字空間,接著透過共同演化強化學習,以 GRPO 針對查詢端與物品端生成器進行交替最佳化,並以對側的凍結索引為固定基準。兩端皆最佳化相同的「查詢到物品」檢索 F1 目標:查詢端直接取得檢索 F1;物品端則獲得反事實邊際獎勵,用以衡量其生成關鍵字對查詢端 F1 所造成的變化。在 10 個具代表性的稀疏、稠密與生成式基準方法中,CoGR 在內部 APP Marketplace 資料集與公開的 WANDS 基準上皆達成最佳效能,相較最強基準方法,F1 分別提升了 10.9% 與 36.1%。進一步分析顯示,訓練過程中共同演化保持穩定,且查詢端與物品端的關鍵字空間日益對齊。
語言模型大部分的注意力只集中在上下文中很小的一部分,然而它們仍須讀取整個 KV 快取,才能找出少數重要的詞元。當使用者在 100 萬詞元的對話中詢問先前提及的細節時,全域注意力層在生成回覆的每個詞元時,都必須掃描完整的上下文。一種常見的緩解方法是透過輕量的代理分數預先選取相關詞元,但這種外在評分方式每一步仍須付出 O(N) 的成本。我們從一個簡單的問題出發,採取內在的觀點:模型難道不是本來就知道上下文中哪些部分是相關的嗎?為此,我們提出宣告式注意力(Declarative Attention, DA),這是一種引導模型在思維鏈中宣告其需要關注何處的機制,並將生成過程劃分為三種模式:<global>(全域)、<focus>(特定區域)與 <local>(僅限近期輸出)。推論引擎像解析工具呼叫一樣解析這些宣告,從而跳過大部分的 KV 快取讀取。在涵蓋 15 項長上下文任務的零樣本評估中,DA 應用於現成模型(Gemma-4-31B、Qwen-3.6-27B)在解碼期間分別減少了 52.0% 與 31.1% 的總關注詞元數,同時僅造成 1.27 個百分點與 2.75 個百分點的輕微準確度下降,且此下降幅度隨模型規模擴大而縮小。DA 為稀疏注意力開啟了一個新的軸向,未來在基於訓練的方法下仍有進一步的潛力有待探索。
文字豐富的視覺輸入需要能夠直接在像素空間中閱讀、檢索和壓縮語言的模型,然而現有的像素文本編碼器在固定解析度預訓練、視覺捷徑學習、弱視覺接地以及多語言視覺文本理解方面仍面臨困難。在本研究中,我們探討穩健視覺文本表徵學習所需的基本設計原則。透過系統性的受控消融實驗,我們識別出四個關鍵組成部分:可變影像解析度與渲染字體大小可提供高解析度文件泛化的空間代理;自然影像─文本配對對於接地至關重要,且能防止僅依賴文本的崩潰;感知版面配置的渲染有助於防止像素層級的捷徑;而兩階段多語言課程則能實現有效的跨語言對齊。透過將這些原則整合到可擴展的訓練配方中,我們訓練了 Pixel Linguist II——一個以原生解析度運作的視覺編碼器,採用即時渲染、統一對比接地,以及涵蓋 2.8 億訓練樣本的多語言課程。Pixel Linguist II 在英文、跨語言及多語言的 Visual STS 和 ViDoRe 基準上均創下新最先進成果,同時也促成更佳的多模態大型語言模型(MLLM)下游評估。值得注意的是,Pixel Linguist II 在 80% 視覺 token 壓縮下仍保持穩健表現,展現出光學上下文壓縮的巨大潛力。我們的程式碼與資源已公開於 https://github.com/Pixel-Linguist/Pixel-Linguist-II。
大型語言模型(LLMs)日益與外部環境互動並累積大量行為經驗,然而現有的智能體基準測試大多將其視為固定策略來評估。因此,智能體能否主動測試自身行為、判斷由此產生的經驗,並利用這些經驗來改善未來的決策,仍是個未解的問題。我們提出S³Gym,一個交互式基準測試,通過三種相互耦合的能力來評估大型語言模型的自我改進:自我測試(Self-Testing)、自我判斷(Self-Judging)與自我改進(Self-Improvement)。S³Gym將允許自由探索的環境與嚴格、預先保留的評估環境分開,並在七個帶有可執行環境驗證器的文字遊戲中實例化此協議。我們評估了三種整合互動經驗的途徑:直接的歷史上下文學習(History ICL)、基於分數條件的摘要記憶(Summary Memory),以及參數訓練(Parameter Training)。 我們的實驗揭示,自我改進既非自動也非一致。上下文層級的經驗能提升若干模型—遊戲配對的表現,但最有效的途徑在很大程度上取決於任務結構:當經驗能被壓縮成可重用的戰略規則時,摘要方法有益;然而當成功依賴於精確的、依狀態而定的資訊時,摘要往往不如原始歷史紀錄。參數訓練在某些任務上帶來顯著增益,但在其他任務上則表現出不穩定的改進以及嚴重的負遷移。這些發現表明,僅僅識別成功的行動是不夠的;智能體還必須將回饋轉化為可執行且可遷移的策略。S³Gym提供了一個統一的框架,用以診斷這一過程,並找出阻礙智能體將互動經驗轉化為可靠自我改進的瓶頸。
基於知識的視覺問答(KB-VQA)依賴檢索外部資訊來回答涉及長尾實體的查詢。然而,現有的檢索流程大多採用 CLIP 風格的雙編碼器,這類方法優先考慮表面層級的視覺相似性,而非實體層級的語義對齊。當語義相同的概念呈現出巨大的視覺差異,或不同實體在視覺上相似時,此範式往往會失效。為了解決這個問題,我們提出 KBMR——第一個專為 KB-VQA 設計、基於 MLLM 的嵌入檢索器。KBMR 利用 MLLM 強大的自迴歸能力,將影像映射到更能保留概念身分的語義空間。為了應對維基百科規模檢索中雜訊監督的挑戰,我們引入了基於 MLLM 的語義判別器,用以產生連續的實體一致性權重。這些權重引導一種新穎的連續語義蒸餾目標,使得在僵化的二元標籤之外,也能實現有效的困難負樣本採樣與軟監督。大量實驗表明,KBMR 顯著優於 CLIP 基線方法,在檢索 Recall@1 上最高提升 14.7%,在端到端 VQA 準確率上則有 9.4% 的提升。程式碼可於 https://github.com/realHarryX/KBMR 取得。
多模態模型通常建構於專為生成式視覺語言建模設計的架構之上,一般會將個別預訓練的視覺編碼器與因果語言模型結合。諸如 ColPali 這類視覺文件檢索器,則將這些模型重新用作編碼器,因而把視覺語言模型(VLM)的參數與運算開銷帶入非生成式任務。 我們提出 NeoMME,這是一個擁有 260M 與 800M 參數規模的多模態多語言雙向編碼器系列,可在單一雙向 Transformer 編碼器中同時處理多語言文本與原始影像區塊。兩個模型皆以遮蔽式離散擴散文本目標從零開始預訓練,並在多模態樣本中,以可見的影像區塊作為條件。兩者皆支援 16,384 個標記的上下文,足以編碼最多兩張標準 4K UHD 影像。 為展現其下游能力,我們以聯合訓練的密集與晚期交互輸出頭對 NeoMME 進行微調。在 ViDoRe v3 基準上,所得到的 NeoMME-Retriever 260M 以 0.523 的 nDCG@10 優於所有參數量嚴格低於 800M 的受評模型,而 NeoMME-Retriever 800M 則達到 0.556。在 NVIDIA L40S 上、輸入影像大小匹配為 2048x2048 時,NeoMME-260M 編碼頁面的吞吐量大約是 ColModernVBERT 的 2 倍。分層標記池化與非對稱量化可將晚期交互多模態文件嵌入壓縮 255 倍,同時保留超過 95% 的基線 nDCG@10。我們將 NeoMME 貢獻至 Hugging Face Transformers,並在 Apache 2.0 許可下發布預訓練骨幹與檢索相容的檢查點,網址為 https://hf.co/collections/Hcompany/neomme。
緊湊的token序列對於高效的3D生成至關重要。然而,現有的3D tokenizer通常將潛在表示組織在空間區域上,或組織為固定大小的全域token集合,但這兩者在壓縮到極低的token預算時,重建品質都會急遽下降。在本論文中,我們提出了ZipTok3D,這是一種專門設計用於從極短token序列中進行高保真重建的3D tokenizer。其核心思想是將物體幾何結構組織為資訊量漸增的全域token前綴,並透過迭代解碼展開這些緊湊表示。具體而言,巢狀丟棄(nested dropout)在訓練期間於編碼後隨機截斷潛在序列,並要求每個保留的前綴都能重建完整物體,因而優先將必要的幾何資訊置於前端的token中。接著,解碼器重複套用一個參數共享的Transformer區塊,從每個前綴還原出細粒度的幾何細節,而不需要額外的生成式採樣階段。在相同的token維度下,ZipTok3D在ShapeNet上僅用一個token、在TRELLIS上僅用四個token,便能達到與32-token的COD-VAE基線相當的重建品質,分別產生短32倍與8倍的token序列。
一張影像或許勝過千言萬語,但大多數影像描述生成模型卻只用寥寥數語來描述它。現代的視覺-語言模型能生成流暢的高層次描述,然而經常遺漏那些構成影像視覺具體性的屬性、數量、紋理、材質與空間關係。近期的多階段系統透過生成、分解、驗證與改寫來恢復部分這類細節,但代價是推理延遲大幅提高。 我們提出 SimLoss——一種無需參考的嵌入空間目標函數,專用於單次前向的細粒度影像描述生成。SimLoss 透過 InfoNCE 對比損失,訓練視覺-語言模型將其投影後的隱藏狀態表徵與凍結的影像嵌入對齊;如此一來,在解碼任何文字之前便能提供密集的視覺監督信號,既不需要人工撰寫的細粒度描述,也不需要來自多階段管線的偽描述。我們將其實例化為兩種變體:SimLoss FFT 會對本地可用的嵌入模型進行反向傳播,而 SimLoss GRPO 則將該嵌入模型視為黑箱獎勵。 與單次前向、多階段驗證、獎勵最佳化及感知導向的基線方法相比,完全可微的微調變體 SimLoss FFT 達到了最高的精確率,同時其 F1 分數幾乎與多階段方法相當;此外,它仍維持單次前向推理,運行速度約比多階段管線快 20 倍。基於獎勵的變體 SimLoss GRPO 則取得了最強的召回率。綜合而言,這些結果表明,嵌入空間監督能以單次前向描述生成器的延遲,達到與多階段驗證相當的品質。
可驗證獎勵強化學習(RLVR)已成為大型語言模型(LLM)後訓練的有力典範,但其依賴粗粒度的結果獎勵,導致對中間推理過程的引導有限。現有方法如過程獎勵建模與同策略蒸餾,會引入額外限制,例如依賴專門的獎勵模型,或假設教師與學生的推理模式相同。然而,我們觀察到,一旦推理過程先出現錯誤,評估後續推理所能提供的額外資訊有限,因為評估已以無效前綴為條件。因此,我們提出 Cliff,一種獎勵塑形策略,利用現成的 LLM 作為教師,識別每次軌跡中的第一個錯誤。如此一來,軌跡自然被分解為兩部分:正確的前綴與錯誤的後綴。Cliff 接著將此訊號轉換為 token 級別的優勢,對正確前綴賦予正優勢,並在之後給予負向回饋。在 12 種不同情境下的實驗顯示,Cliff 能一致地提升推理表現,即使使用能力一般的教師,仍比同策略蒸餾高 15%、比標準 GRPO 高 7%。此外,我們分析了「真實答案(ground truth)」在 Cliff 中的作用,並探討其訓練動態。這些結果確立 Cliff 為一種簡單、通用且有效的方法,能透過更豐富、更細粒度的監督來改善 RLVR。
採樣詞元在策略蒸餾(OPD)能利用學生模型生成的詞元,有效地將能力從教師模型轉移至學生模型,且僅需教師模型對採樣詞元的概率。然而,它經常遭遇多樣性蒸餾失敗:學生的 pass@1 提升,但 pass@k 停滯不前,未能繼承教師模型的多樣性。為解釋此現象,我們引入了「一階局部熵影響力」(First-Order Local Entropy Influence),這是一個帶符號的一階代理指標,可將每次更新的熵效應分解為教師—學生對數概率差距與學生局部概率結構兩部分,並在經驗上將熵收縮與負影響位置連結起來。基於此,我們提出了「影響力引導的自適應在策略蒸餾」(IDA-OPD):它不依賴代價高昂的全詞彙前向 KL 散度目標,而是保留熵擴張的更新,並以散度自適應的優勢縮減取代熵收縮的更新,僅需教師模型的採樣詞元對數概率。在以推理為導向的蒸餾實驗中,IDA-OPD 持續提升 pass@k,透過蒸餾繼承教師模型的多樣性;以嚴格更低的成本達到最強教師資訊方法的表現,同時大致維持 vanilla OPD 的 pass@1,全程無需全詞彙教師資訊。
智能體(agent)的效能同時取決於模型參數,以及負責管理上下文與控制流程的執行框架(harness)程式碼。若孤立地最佳化其中任一組件,系統可能因對方保持凍結不動而出現瓶頸:權重更新可能改變何種執行框架最為有效,執行框架更新則可能改變模型所被運用到的能力組合。現有的聯合適應方法會最佳化權重與文本提示(textual prompts),但卻讓更廣泛的執行框架維持不變。我們提出「權重-執行框架交替學習」(Weight-Harness Alternating LEarning,簡稱 WHALE),這是一個簡潔的訓練配方:交替進行兩個階段——先在當前執行框架下更新模型,再於更新後的模型上搜尋更佳的執行框架。我們分別以在線拒絕採樣微調(online rejection-sampling fine-tuning)與 Meta-Harness 實作這兩個階段。何時切換是一項關鍵的設計選擇:為了在不針對持續變動的另一端過度最佳化的前提下,分辨真正的改進與雜訊,WHALE 採用固定階段長度,或依據訓練訊號設定的自適應耐心規則。使用 Qwen3.5-2B/4B 智能體在三個領域(搜尋式問答、數學推理與西洋棋謎題)的實驗中,WHALE 在最佳 Mean@8 準確率上比僅權重最佳化、僅執行框架最佳化與 Fast-Slow Training 高出 4.15 至 24.38 個百分點。實驗亦顯示任一組件皆可能成為瓶頸:在 SearchQA 中,執行框架搜尋僅需遠少於權重最佳化的 rollout 次數,即可達到與僅權重最佳化相同的峰值準確率;但在數學領域,必須先經過權重更新,執行框架搜尋才能提升準確率。此外,小型交錯式更新無論在準確率或 rollout 成本上,皆優於先權重後執行框架的分階段式最佳化。程式碼已公開於 https://github.com/krafton-ai/WHALE。
傳統的說話者歸屬語音辨識(ASR)系統將語音辨識與說話者分段視為兩項獨立的任務。近來,VibeVoice-ASR 等端到端模型已將這兩項任務統一到單一模型之中。然而,現有的統一模型多半仍以離線辨識為主,難以滿足即時語音助理與代理程式對低延遲的需求。為了解決這個問題,我們提出 VibeVoice-ASR-Streaming,這是首批以 LLM 為基礎、針對串流式說話者歸屬 ASR 的端到端方法之一。它將固定大小的音訊區塊、少量的前瞻音訊與先前的文字交錯處理,使模型能在語音到達時即時產生「誰說了什麼」,無需額外的說話者分段階段。在轉錄準確度方面,我們的 7B 模型在五個評估集上達到最低的平均 WER/CER;在說話者歸屬方面,它在 13 個評估設定中的 12 個達到最佳或並列最佳的表現。我們釋出 1.5B 與 7B 模型的權重,以及推論程式碼。
歷史報紙是公共生活的豐富紀錄,但其版面編排密集、不規則,且時有雜訊干擾,使得以計算方式存取這些材料既具挑戰性,也受限甚多。我們提出一套與波士頓公共圖書館(Boston Public Library)共同設計的模組化系統——Institutional Newspapers Pipeline(機構報紙管線),旨在從歷史報紙掃描中萃取高品質的結構化資料集。此管線在架構上確保每個步驟都可解釋且可自訂,同時使整體管線的運算需求保持節約,足以運行於工作站等級的硬體之上。管線會對每份掃描執行多步驟處理:先將掃描分割為與類型無關的個別圖像區塊(crops),並對每個產生的區塊執行光學字元辨識(OCR);隨後再對每個區塊進行文本分析、類型分類、閱讀順序偵測、命名實體辨識、主題分類、語言偵測,並預先計算及生成嵌入向量。我們已將此管線應用於波士頓公共圖書館的部分館藏,並以開放資料集形式發布結果。該 OCR 輸出包含163億個 o200k_base 詞元,涵蓋8,310萬個獨立圖像區塊,內容擷取自1,473,635份於1795年至1930年間出版的公有領域報紙掃描。本報告說明每個處理步驟所使用的方法、我們訓練的小型模型,以及在此過程中所收集的評估結果與資料集規模量測數據。本報告伴隨管線、模型與資料集的發布,並將此項工作定位為朝向從數千萬份報紙掃描中取得高品質資料所邁出的重要一步。
競賽程式設計已成為檢驗大型語言模型推理能力的關鍵測試,而IOI與ICPC等國際競賽則代表其中最具挑戰性的場景。我們提出了一條端到端的專精化流程,結合大規模題目篩選、合成推理軌跡、監督式微調(SFT)與強化學習(RL)。利用22,000道精心篩選的題目,我們以SFT與RL訓練了Nemotron-3-Nano-CC(30B-A3B),並僅以SFT訓練了Nemotron-3-Ultra-CC(550B-A55B)。我們進一步引入了GenCorrect,這是一種反饋驅動的測試時間計算策略,可反覆生成、評估並改良多樣化解法。在IOI 2025上,Nano-CC經後訓練後從130分提升至291分,搭配GenCorrect後更達到468分,超過438.3分的金牌門檻,而Ultra-CC則達到502分。在這些結果的引導下,我們開發了一套專為競賽設計的Ultra-CC系統,並於IOI 2026期間進行前瞻性評估。在與人類參賽者相同的時間、網路存取與提交限制之下,该系统於600分中獲得535.4分,同時超過361.12分的金牌門檻與498.27分的最高人類得分。據我們所知,這是第一個在IOI題目中得分超越最高分人類選手的AI系統。
長上下文 LLM 推論的注意力預填充階段呈二次方擴展,使自注意力成為嚴重的計算瓶頸。傳統的稀疏注意力方法透過固定模式或離線剖析來緩解此問題,但缺乏適應輸入相關注意力結構的靈活性。近期的動態方法透過即時將注意力頭路由至稀疏模式來解決此問題,然而此類方法依賴於具有額外開銷的間接路由代理,且其預算分配機制忽視了 softmax 後的質量層級結構。我們提出 CRISP(懸崖感知輸入自適應稀疏預填充,Cliff-awaRe Input-adaptive Sparse Prefilling),識別並解決了此動態路由範式中的兩個結構性挑戰。首先,我們證明路由決策可以直接從代理注意力圖的結構中讀取。我們以 C_struct 取代詹森-夏農散度(JSD)路由;C_struct 是一種結構性代理,用於量測 Vertical-Slash 相容位置上的質量分布,既能重現 JSD 的路由決策,同時消除池化矩陣乘法及後續 KL 散度的開銷。其次,我們將 softmax 後的質量懸崖形式化,並在理論上證明嚴格的累積覆蓋閾值會在長上下文中累積 O(n) 的背景雜訊。CRISP 透過以雜訊底為基礎的匯點感知閾值來應對此問題。在實驗中,涵蓋 InfiniteBench、RULER 與 LongBench 三個基準、橫跨兩個模型家族,CRISP 整體上是表現最強的稀疏方法,且在檢索密集型基準上達到或超越精確稠密注意力的表現,於檢索任務上相較基線提升高達 +28.0 個百分點,並在 512k tokens 下實現高達 5.30 倍的注意力加速。此成效主要歸因於我們在選擇過程中消除 O(n) 雜訊的同時保持了結構完整性。
資訊檢索(IR)日益聚焦於允許多樣觀點的開放式查詢。然而,現有的 IR 基準主要專注於封閉式查詢,即便是開放式基準,其查詢的支持文件也大多侷限於單一主題領域與模態。我們提出 Multi^3IR,這是一個評估檢索器如何涵蓋開放式查詢在多樣領域與模態下多面向觀點的基準。它包含 104.9K 個 Stack Exchange 查詢,每個查詢皆附有觀點描述之註釋,用以捕捉其隱含觀點。我們進一步提出 SPIN,一種參數與標籤兼具效率的方法,透過學習噪聲向量,將嵌入引導至多樣且具意義的語意方向。實驗顯示,現有的多模態檢索器存在單一觀點偏誤,而 SPIN 在 Multi^3IR 上顯著提升了觀點涵蓋率,並能良好地泛化至未見過的開放式 IR 基準。資料集與實驗程式碼可在 https://github.com/seokwon99/Multi3IR 取得。
將研究論文忠實轉化為程式碼庫層級的實作仍具挑戰性,因為論文通常以高階層次描述方法、將實作假設隱性化,而且要求所生成的程式碼庫必須保留方法邏輯、評測協議以及跨檔案一致性。儘管近年論文轉程式碼代理(paper-to-code agents)有所進展,但其中間輸出往往以自由形式的計畫或摘要呈現,下游的程式碼生成代理可能忽略、重新詮釋或壓縮這些內容,導致演算法簡化與程式碼庫結構不一致。為解決這些挑戰,我們提出 PaperCompiler——一個將以論文為根據的證據編譯成明確之程式碼庫層級實作規格的論文轉程式碼生成框架。PaperCompiler 在保留來源出處的前提下,為與實作相關的證據建立論文依據,並區分四類資訊:論文支持、推斷、外部委派以及尚未解決。產生的規格涵蓋不降級要求、所有權指派、跨檔案依賴與檔案層級約束。程式碼庫生成在此等經編譯的規格下進行,同時對論文未限定的局部工程選擇保留彈性。在 Paper2CodeBench 上,PaperCompiler 效能優於強基準,以參考為基準的忠實度(reference-based fidelity)相對提升 13.8%(自 3.64 至 4.15),並將高嚴重度的評估器批判(evaluator critiques)從 13.2% 降至 6.1%。
基於嵌入的程式碼檢索是程式設計代理與檢索增強程式碼生成的核心組成部分,在這些應用中,檢索到正確的程式碼比檢索到詞彙相似的程式碼更為重要。現有的程式碼檢索基準並未在搜尋池中植入受控的、經執行驗證的單次編輯變體,這些變體對應每個查詢的標準實作,因此,在檢索環境中,嵌入是否能從功能上區分正確程式碼與近乎複製但不正確的程式碼,仍是未解的問題。要解決這個問題,需要一個基準,其搜尋池本身就包含相關的反事實變體——也就是與每個標準實作幾乎相同且經執行驗證的錯誤變體——如此一來,檢索器的排序便可直接檢驗其功能區分能力,而非僅是主題或身分重疊。我們提出 ExecRetrieval,包含 939 個 Python 任務,每個任務配有一個經執行驗證的標準實作,以及最多四個經執行驗證的錯誤干擾項;每個干擾項皆由機械式突變生成,僅做單一目標編輯。我們在提供者原生呼叫下,評估了 23 種稠密嵌入配置及 BM25,並使用配對 McNemar 檢定與查詢層級的 bootstrap 信賴區間進行分析。在搜尋池中加入近乎複製的反事實變體後,表現最佳的主機代管系統達到 exec@10 = 1.00,但 exec@1 僅為 0.331;在四個領先系統中,排名第一時的漏失結果有 91.5% 至 99.4% 是配對的錯誤變體,而且在這些領先系統上,有 67% 至 78% 的查詢中,標準實作的分數低於其四個配對干擾項中至少一個。完整的資料集、執行驗證器、嵌入矩陣、環境快照與成對統計檢定結果均已發布於附錄 D 的網址。
大型語言模型(LLM)日益被部署為協調器,透過自然語言協調專門的子代理來解決複雜任務。然而,在遊戲對弈與機器人學等許多重要領域中,現有最強的代理並非語言模型。若要將非語言代理與LLM整合,就必須進行語言化:在每個互動步驟,將它們豐富的連續表徵壓縮成稀疏的文字摘要。為了探討語言化是否構成瓶頸,我們提出 LLAMIA-Bench:一套涵蓋三個面向、共六項多樣化西洋棋協作任務的基準,三個面向分別是行為模仿、狀態評估與自然語言解釋。每個任務都具體呈現一個成熟的西洋棋問題,而該問題無法由LLM或西洋棋引擎單獨解決。為了解決LLM與非語言代理的協作問題,我們引入潛在狀態內化法,將子代理的連續表徵作為學習到的狀態token直接投影到LLM的token串流中,並在行動推進環境狀態時動態重新編碼。透過將內化與語言化整合進行比較,我們的實驗揭示了持續存在的語言化債:效能差距在訓練過程中不斷擴大,且在LLM從4B擴展至14B參數時依然存在。單一14B模型LLAMIA以潛在狀態內化法訓練,在所有基準任務上均能匹配或超越任務專用模型及具備工具使用能力的前沿模型(包括GPT-5.1),並能泛化至任務特定微調模型會崩潰的分布外情境。
行動AI扮演視覺神諭的角色,讓使用者拍下眼前事物並提出問題以獲取資訊。「拍問」(snap-and-ask)檢索已成為行動AI最常見的入口之一,然而照片往往模糊不清,文字提問也可能簡短或輸入有誤。現有基準測試僅在乾淨輸入上進行評估,或未能在拍問檢索中隔離配對穩健性的影響。為此,我們提出SnapBench——首個針對穩健拍問式多模態檢索的配對基準,涵蓋1,145個查詢、9,085個圖庫項目,並在53種受控損壞條件下提供人工註解。我們評估了16種多模態檢索器,包括雙塔編碼器與基於嵌入的視覺語言模型。結果顯示,影像損壞會大幅降低檢索效能,而文字損壞主要影響純文字檢索,對聯合檢索的影響有限。乾淨的純影像檢索表現往往優於聯合檢索,反映出粗略文字所造成的拖累,以及系統在雜訊輸入下缺乏跨模態回退機制的問題。SnapBench為拍問情境下的穩健檢索評估提供了受控測試環境。我們進一步提出MOOR(模態錨定、異常感知、最優重加權),一種簡單的自適應融合方法,突顯了拍問檢索中可靠性感知模態校正的必要性。
理解動物動作是建立動物行為與生物力學模型的基礎,然而受限於高品質動作資料的匱乏,此領域的進展遠落後於人類動作研究。人類動作可在受控環境中捕捉,但對大多數動物物種而言並不可行,因此現有資料集規模小且僅限於特定應用領域,限制了動畫等下游應用的發展。為了解決這項挑戰,我們提出了 Kirin,這是一個從影片重建動作、大規模學習動作先驗,並生成能直接應用於動畫資產的逼真動作之框架。我們利用大量野外動物影片,重建 3D 動作序列並與文字描述配對,建立了 AiM3D——首個為四足動物提供對齊的影片-文字-動作三元組的大規模資料集。在此資料集的基礎上,我們開發了一個視覺引導的動作生成模型,該模型以文字與圖像為條件,引導生成跨多種動物物種的逼真動作。最後,我們利用現成的影像轉 3D 模型,將生成的動作自動套用至 3D 網格並完成綁定與動畫製作,產出可直接渲染的動物動畫。我們的資料集與框架共同為大規模、以文字與影像為條件的動物動作生成及動畫建立新的基礎。專案頁面:https://kirin-ani.github.io/。
僅以文字與程式碼訓練的大型語言模型(LLM),有時能產生可繪出可辨識圖像的程式。然而,目前仍不清楚這究竟反映模型內部具備二維空間佈局的表徵,抑或僅是將空間描述轉譯為程式碼的能力。我們提出「自迴歸馬賽克」(Autoregressive Mosaics, AM-Bench)基準測試,用以區分上述因素:首先,翻譯任務要求模型根據以文字完整指定圖片幾何結構的提示,生成對應的繪圖程式碼;其次,佈局任務要求模型根據未完整指定的提示自行構圖。在八個僅以文字與程式碼訓練的開放權重模型中,所有模型都能可靠地將指定幾何結構翻譯成程式碼,但它們在開放式佈局任務上的表現差異甚大,顯示這些差異無法僅以程式碼生成能力解釋。輸出媒介的消融實驗進一步顯示,模型所使用的表達介面或媒介確實會造成影響:以原始SVG取代程序式程式碼,一致地提升了所有模型的佈局分數。最後,對模型激活狀態的探測顯示,在生成展開之前,模型中已存在粗略的佈局計畫,但此計畫僅反映提示所隱含的佈局;而在生成期間,模型追蹤的是不斷演變的幾何狀態,而非執行一開始便固定的計畫。整體而言,這些結果表明,純文字LLM的二維空間表現同時取決於模型本身與輸出媒介,並非僅由程式碼生成能力所能解釋。
我們提出 FoldingAgent,一個代理式框架,能直接從摺紙示範影片中推斷出明確的參數化摺疊程式。我們的框架利用預先訓練的視覺語言模型(VLM)的推理能力,該模型配備了一套專門工具,使代理能模擬幾何轉換、驗證物理合理性、檢索並比較視覺內容,以及評估自身預測。為了將視覺內容轉化為摺疊程式,我們定義了一個參數空間,其中包含紙張的幾何結構以及一組參數化摺疊動作。不同於預測靜態摺痕圖案的模型,我們的代理依序運作,並具備重新規劃其動作的能力,從而有效減輕多步驟摺疊中固有的累積誤差。我們的方法朝縮小人類摺紙知識與計算方法之間的差距邁出了一步:人類摺紙知識主要透過非結構化的視覺示範來分享,而計算方法通常依賴結構化的參數化表示,例如摺痕圖或可執行的參數化計畫。我們在 PurelandFold 上評估我們的方法,這是一個新策劃的基準,包含多樣化的 Pureland 摺紙影片,並帶有真實幾何與動作標籤。我們的結果表明,透過結合 VLM 推理、一套專門工具與物理模擬,我們能成功將非結構化的視覺示範轉化為可執行且物理上合理的摺疊程序。
專業型智慧體任務往往依賴於公開語料庫中不存在的慣例,但基準測試很少管控智慧體是否能取得這些慣例。我們提出一套知識門控任務建構協定,將任務指令與一個包含私有慣例、參考表和工具運算子的精簡工件分離。建構階段的來源追蹤、在提供工件與隱藏工件條件下位元組完全相同的任務指令、洩漏稽核,以及可執行見證,使任務對工件的依賴明確且可測試。在十五項校準任務中,某一前沿智慧體配置在提供工件時達到 68.0% 的通過率,未提供工件時為 0%;其中一項任務中,一個看似合理但錯誤的工件同樣在五次試驗中皆得到 0%。確定性求解器與規則語料集為結構化任務提供精確的真值,而具名的標準級評分量表則支援無法由單一可執行預言機檢查的輸出。一個相對於配置的校準篩選保留了七項通過我們五次試驗實證知識門控篩選的任務。這些實驗驗證了建構協定的運作方式,但並未證明這些保留任務能改善後續訓練的成效。我們已於 https://github.com/DatagridsAI/Knowledge-Gated-Task-Construction 公開釋出部分任務套件與支援工具。
剪枝和量化等模型壓縮技術促進了大型語言模型(LLMs)的高效部署與加速。然而,近期研究顯示,諸如SparseGPT這類權重稀疏化方法可能放大模型中既有的偏見,使輸出結果因提示中的身分提示線索而產生顯著差異。在本文中,我們提出Debias-SparseGPT,這是一種訓練後剪枝方法,透過定義於人口統計對比輸入上的二階項來實現表徵去偏。我們在廣泛的生成式大型語言模型上對我們的方法進行了實證驗證。在各種模型與稀疏度設定(25%、50%及結構化2:4稀疏性)下,相較於SparseGPT,Debias-SparseGPT在維持模型困惑度與零樣本準確率的同時,持續降低了剪枝引發的偏見。在最嚴格的2:4結構化稀疏模式下(此模式對模型品質的退化影響最為劇烈),以長上下文、內容豐富的範例擴充校準集,可進一步提升下游任務效能與公平性。整體而言,Debias-SparseGPT在偏見與效能之間取得了更佳的權衡,同時保留了稀疏模型的計算效率。
語言模型對下一個詞元的預測會逐層發展成形,透鏡方法透過將中間隱藏狀態解碼為詞元來追蹤此過程。然而,透鏡的讀取結果同時反映了隱藏狀態以及解碼所用的讀出(反嵌入)矩陣。許多透鏡是在語料庫上擬合的,而我們證明,僅在擬合語料庫上有所不同的兩個透鏡,對相同的隱藏狀態可能報告不同的詞元。我們將此種依賴性稱為語料庫條件性。為了獨立於擬合語料庫檢驗讀出結構,我們提出稀疏讀出稜鏡(Sparse Readout Prism, SRP),該方法僅利用讀出矩陣的權重對其進行分解,並將任何詞元 logit 或 logit 差異表示為稀疏讀出特徵貢獻的總和。這使讀出特徵成為透鏡讀取分析的新分析單元,揭露了詞元身份可能掩蓋的結構,並促成跨詞元、跨上下文、跨層與跨透鏡的比較。以 SRP 的稀疏近似取代原始讀出矩陣,對受測 logit 差異的重建比例,比基於讀出矩陣各行間幾何關係所建構的六種基線中最強者高出 8.9–17.3 個百分點。消融特徵會使 logit 差異依其 SRP 貢獻的比例發生偏移。儘管詞元讀取結果隨擬合語料庫而變化,主導的讀出特徵仍保持穩定。由於 SRP 在建構過程中不使用任何語料庫,它為透鏡分析提供了獨立於擬合語料庫的對照。
對話式推薦系統(CRS)通常需要特定領域的對話資料,但這類資料成本高昂、數量稀缺,且在新領域中往往無法取得。我們針對零資料 CRS 自舉訓練(zero-data CRS bootstrapping)進行了系統性的實證研究:從非對話訊號——商品評論、元資料與使用者-商品互動——生成合成對話監督訊號,且完全不使用任何領域內對話語料庫。我們比較了兩種基於資訊理論的選擇策略——Jensen-Shannon 多樣性與 Fisher 資訊——並跨領域訊號、模型架構、資料集與微調範式進行評估。結果顯示,以領域為根基的合成資料 consistently outperform zero-shot prompting and naive synthetic baselines。具體而言,主動選擇在資料效率上優於隨機抽樣;元資料與協同過濾訊號各自都能提升選擇品質;而在低資源情境下,合成資料不僅能勝過稀缺的真實對話,還能進一步與其產生互補。這些發現確立了非對話領域訊號作為建構無對話訓練資料之 CRS 的可行途徑。程式碼可於 https://anonymous.4open.science/r/zero_data_crs/ 取得。
基於評分量規的強化學習(Rubric-based reinforcement learning)透過針對實例特定標準對回應進行評分,將強化學習的應用擴展至具有精確答案或基於規則驗證器的任務之外。然而,這使得獎勵計算成本高昂:訓練過程需要重複的評分量規評判,通常依賴專有API或參數量達7B以上的本地生成式LLM評判器。我們研究較小的語言模型是否能作為高效且可靠的基於評分量規的評判器。為使此問題可量化衡量,我們建構了PointRubric與RaR-Science-Static兩個逐點式(pointwise)評分量規評估資料集,其中包含實例特定標準與逐項目滿足度標籤。我們比較了三種從小型模型中提取標準層級判斷的方法:生成式判決(Generative verdicts)、是/否Logprob邊際(Yes/No Logprob margins)以及探針式評判器(Probe judges)。在兩個資料集上,Qwen3-1.7B探針式評判器在這些方法中達到最強的標準層級一致性,優於生成式與Logprob評判器。作為GRPO獎勵模型使用時,它將策略在RaR-Science評分量規分數上從0.232訓練至0.643,而8B生成式評判器基線僅達到0.594,且基線所需的獎勵評判時間為前者的10.7倍。任務與領域遷移實驗進一步表明,探針式評判器在不同設定下能保留標準層級的獎勵結構。
投資組合風險評估通常依賴於對跨資產報酬共變異數的可靠估計,而在短期的、高維度的面板資料中,這類估計難以取得。我們證明,公司層級的分配值特徵(distribution-valued characteristics)反而能提供投資組合風險的單側認證(one-sided certificates)。在維持從特徵到系統性曝險、以及從曝險到報酬的關聯性假設下,多家公司的瓦瑟斯坦-2 離散度(Wasserstein-2 dispersion)可產生系統性投資組合變異數的銳利上界,以及對應的標準化報酬界。加權成對鬆弛(weighted pairwise relaxation)方法可產生一個目標函數,其在可檢驗的條件下具凸性,且僅需邊際波動規模,而無需跨資產報酬共變異數。在公司特定寬鬆度(firm-specific slack)為零的情況下,共同映射尺度(common-map scale)會改變被認證的變異數縮減幅度,但不會改變正規化配置——後者僅取決於觀測到的資訊幾何。在 2018 至 2022 年間一個包含 52 家公司的面板中,基於 Qwen3-Embedding-8B 新聞表徵所建構的配置,在四個預先指定的設限投資組合群體中,其樣本內變異數百分位數介於第 0.69 與第 1.33 百分位之間;而等風險權重配置則介於第 21.1 與第 28.6 百分位之間。相對於等風險配置的較低樣本內變異數排名,在所報告的凍結語言模型表徵中亦同樣出現。因此,此一架構將分配值的公司資訊轉化為連貫的風險界,以及一套在無需跨資產報酬共變異數的情況下所建構的可執行配置規則。
空間收益模型將交互矩陣視為已知,且不對回饋進行詮釋。我們利用目標錨定的Wasserstein重心重建,從公司的語言模型文章嵌入分佈中建構一個無頻寬的場域。一個二次曝險調整問題將回饋映射為同儕錯位懲罰比率。針對52家公司,該場域以2018–2022年新聞凍結,得出2023–2026年的懲罰比率為3.46(95%信賴區間[2.89, 4.17]),且條件準似然高於等權重同儕支持或相同距離的RBF加權。重心場域與新聞共現場域的聯合懲罰比率分別為2.33和0.86,邊界校正檢定拒絕剔除兩者。