Articoli di Ricerca IA Giornalieri

Articoli di ricerca IA selezionati quotidianamente con traduzioni

Rapporto Tecnico Qwen2.5
Qwen2.5 Technical Report

Qwen, An Yang, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chengyuan Li, Dayiheng Liu, Fei Huang, Haoran Wei, Huan Lin, Jian Yang, Jianhong Tu, Jianwei Zhang, Jianxin Yang, Jiaxi Yang, Jingren Zhou, Junyang Lin, Kai Dang, Keming Lu, Keqin Bao, Kexin Yang, Le Yu, Mei Li, Mingfeng Xue, Pei Zhang, Qin Zhu, Rui Men, Runji Lin, Tianhao Li, Tingyu Xia, Xingzhang Ren, Xuancheng Ren, Yang Fan, Yang Su, Yichang Zhang, Yu Wan, Yuqiong Liu, Zeyu Cui, Zhenru Zhang, Zihan Qiu•Dec 19, 2024•3409

Ragionamento multimodale progressivo tramite recupero attivo
Progressive Multimodal Reasoning via Active Retrieval

Guanting Dong, Chenghao Zhang, Mengjie Deng, Yutao Zhu, Zhicheng Dou, Ji-Rong Wen•Dec 19, 2024•732

MegaPairs: Sintesi Massiccia di Dati per il Recupero Multimodale Universale
MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval

Junjie Zhou, Zheng Liu, Ze Liu, Shitao Xiao, Yueze Wang, Bo Zhao, Chen Jason Zhang, Defu Lian, Yongping Xiong•Dec 19, 2024•532

Come sintetizzare dati testuali senza il collasso del modello?
How to Synthesize Text Data without Model Collapse?

Xuekai Zhu, Daixuan Cheng, Hengli Li, Kaiyan Zhang, Ermo Hua, Xingtai Lv, Ning Ding, Zhouhan Lin, Zilong Zheng, Bowen Zhou•Dec 19, 2024•484

LongBench v2: Verso una comprensione e un ragionamento più approfonditi su compiti multipli con contesti lunghi e realistici.
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks

Yushi Bai, Shangqing Tu, Jiajie Zhang, Hao Peng, Xiaozhi Wang, Xin Lv, Shulin Cao, Jiazheng Xu, Lei Hou, Yuxiao Dong, Jie Tang, Juanzi Li•Dec 19, 2024•335

Dalle parole ai pixel: un framework per l'evoluzione cross-modalità
Flowing from Words to Pixels: A Framework for Cross-Modality Evolution

Qihao Liu, Xi Yin, Alan Yuille, Andrew Brown, Mannat Singh•Dec 19, 2024•264

LeviTor: Sintesi Immagine-Video Orientata alla Tragittoire 3D
LeviTor: 3D Trajectory Oriented Image-to-Video Synthesis

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Ka Leong Cheng, Qifeng Chen, Yujun Shen, Limin Wang•Dec 19, 2024•153

Inserimento di oggetti consapevole delle affordance tramite diffusione duale consapevole delle maschere.
Affordance-Aware Object Insertion via Mask-Aware Dual Diffusion

Jixuan He, Wanhua Li, Ye Liu, Junsik Kim, Donglai Wei, Hanspeter Pfister•Dec 19, 2024•152

AceMath: Avanzamento della Ragionamento Matematico di Frontiera con Post-Training e Modellazione delle Ricompense
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling

Zihan Liu, Yang Chen, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping•Dec 19, 2024•132

DI-PCG: Generazione di Contenuti Procedurali Inversa Efficienti basata sulla Diffusione per la Creazione di Asset 3D di Alta Qualità
DI-PCG: Diffusion-based Efficient Inverse Procedural Content Generation for High-quality 3D Asset Creation

Wang Zhao, Yan-Pei Cao, Jiale Xu, Yuejiang Dong, Ying Shan•Dec 19, 2024•92

Potenziamento della didascalia descrittiva con specialisti visivi per la percezione multimodale
Descriptive Caption Enhancement with Visual Specialists for Multimodal Perception

Yanpeng Sun, Jing Hao, Ke Zhu, Jiang-Jiang Liu, Yuxiang Zhao, Xiaofan Li, Gang Zhang, Zechao Li, Jingdong Wang•Dec 18, 2024•62

AV-Link: Caratteristiche di diffusione allineate temporalmente per la generazione audio-video cross-modale
AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation

Moayed Haji-Ali, Willi Menapace, Aliaksandr Siarohin, Ivan Skorokhodov, Alper Canberk, Kwot Sin Lee, Vicente Ordonez, Sergey Tulyakov•Dec 19, 2024•52

UIP2P: Modifica delle immagini basata su istruzioni non supervisionata tramite ciclo di editing coerente
UIP2P: Unsupervised Instruction-based Image Editing via Cycle Edit Consistency

Enis Simsar, Alessio Tonioni, Yongqin Xian, Thomas Hofmann, Federico Tombari•Dec 19, 2024•53

TOMG-Bench: Valutazione di LLM su Generazione di Molecole Aperte basata su Testo
TOMG-Bench: Evaluating LLMs on Text-based Open Molecule Generation

Jiatong Li, Junxian Li, Yunqing Liu, Dongzhan Zhou, Qing Li•Dec 19, 2024•42

PixelMan: Modifica coerente degli oggetti con modelli di diffusione tramite manipolazione e generazione di pixel
PixelMan: Consistent Object Editing with Diffusion Models via Pixel Manipulation and Generation

Liyao Jiang, Negar Hassanpour, Mohammad Salameh, Mohammadreza Samadi, Jiao He, Fengyu Sun, Di Niu•Dec 18, 2024•34

DateLogicQA: Valutazione delle distorsioni temporali nei grandi modelli linguistici
DateLogicQA: Benchmarking Temporal Biases in Large Language Models

Gagan Bhatia, MingZe Tang, Cristina Mahanta, Madiha Kazi•Dec 17, 2024•22

Spostamento-in-2D: Generazione di Movimento Umano Condizionato in 2D
Move-in-2D: 2D-Conditioned Human Motion Generation

Hsin-Ping Huang, Yang Zhou, Jui-Hsien Wang, Difan Liu, Feng Liu, Ming-Hsuan Yang, Zhan Xu•Dec 17, 2024•22