Rapporto Tecnico Xmodel-2

Xmodel-2 Technical Report

December 27, 2024
Autori: Wang Qun, Liu Yang, Lin Qingquan, Qu Zhijiu, Jiang Ling
cs.AI

Abstract

Xmodel-2 è un modello linguistico di grandi dimensioni con 1,2 miliardi di parametri progettato specificamente per compiti di ragionamento. La sua architettura consente a diverse scale di modelli di condividere un insieme unificato di iperparametri, consentendo un'ampia sperimentazione su modelli più piccoli e un trasferimento senza soluzione di continuità delle configurazioni ottimali a modelli più grandi. Per massimizzare l'efficienza e la stabilità dell'addestramento, Xmodel-2 utilizza il programma di tariffe di apprendimento WSD da MiniCPM. Preallenato su 1,5 trilioni di token da fonti diverse, Xmodel-2 raggiunge prestazioni all'avanguardia in compiti complessi di ragionamento e basati su agenti, mantenendo nel contempo costi di addestramento bassi. Questi risultati mettono in luce il potenziale di un design di modello efficiente e di strategie di addestramento nell'avanzamento delle capacità di ragionamento. I checkpoint del modello e il codice sono disponibili pubblicamente su GitHub all'indirizzo https://github.com/XiaoduoAILab/Xmodel-2
English
Xmodel-2 is a 1.2-billion-parameter large language model designed specifically for reasoning tasks. Its architecture enables different model scales to share a unified set of hyperparameters, allowing for extensive experimentation on smaller models and seamless transfer of optimal configurations to larger models. To maximize training efficiency and stability, Xmodel-2 employs the WSD learning rate scheduler from MiniCPM. Pretrained on 1.5 trillion tokens from diverse sources, Xmodel-2 achieves state-of-the-art performance in complex reasoning and agent-based tasks, while maintaining low training costs. These results highlight the potential of efficient model design and training strategies in advancing reasoning capabilities. Model checkpoints and code are publicly available on GitHub at https://github.com/XiaoduoAILab/Xmodel-2

Summary

AI-Generated Summary

PDF254January 2, 2025