Articoli di Ricerca IA Giornalieri

Articoli di ricerca IA selezionati quotidianamente con traduzioni

Modellazione Autoregressiva a Lungo Contesto per Video con Predizione del Frame Successivo
Long-Context Autoregressive Video Modeling with Next-Frame Prediction

Yuchao Gu, Weijia Mao, Mike Zheng Shou•Mar 25, 2025•722

Scalabilità del Pre-Addestramento Visivo alla Risoluzione 4K
Scaling Vision Pre-Training to 4K Resolution

Baifeng Shi, Boyi Li, Han Cai, Yao Lu, Sifei Liu, Marco Pavone, Jan Kautz, Song Han, Trevor Darrell, Pavlo Molchanov, Hongxu Yin•Mar 25, 2025•402

Scalatura al Tempo di Inferenza per Modelli di Flusso tramite Generazione Stocastica e Forzatura del Budget di Rollover
Inference-Time Scaling for Flow Models via Stochastic Generation and Rollover Budget Forcing

Jaihoon Kim, Taehoon Yoon, Jisung Hwang, Minhyuk Sung•Mar 25, 2025•334

Esplorazione delle Allucinazioni nei Modelli Multimodali di Grandi Dimensioni nella Comprensione Video: Benchmark, Analisi e Mitigazione
Exploring Hallucination of Large Multimodal Models in Video Understanding: Benchmark, Analysis and Mitigation

Hongcheng Gao, Jiashu Qu, Jingyi Tang, Baolong Bi, Yue Liu, Hongyu Chen, Li Liang, Li Su, Qingming Huang•Mar 25, 2025•314

CoMP: Pre-training Multimodale Continuo per Modelli Fondamentali di Visione
CoMP: Continual Multimodal Pre-training for Vision Foundation Models

Yitong Chen, Lingchen Meng, Wujian Peng, Zuxuan Wu, Yu-Gang Jiang•Mar 24, 2025•301

Pensa Due Volte: Migliorare il Ragionamento dei Modelli Linguistici su Grande Scala attraverso Pensiero Multi-round in Fase di Test
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking

Xiaoyu Tian, Sitong Zhao, Haotian Wang, Shuaiting Chen, Yunjie Ji, Yiping Peng, Han Zhao, Xiangang Li•Mar 25, 2025•265

Individua il Falso: Rilevamento di Immagini Sintetiche Basato su Modelli Multimodali di Grande Scala con Spiegazione degli Artefatti
Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation

Siwei Wen, Junyan Ye, Peilin Feng, Hengrui Kang, Zichen Wen, Yize Chen, Jiang Wu, Wenjun Wu, Conghui He, Weijia Li•Mar 19, 2025•203

MDocAgent: Un Framework Multi-Modale e Multi-Agente per la Comprensione dei Documenti
MDocAgent: A Multi-Modal Multi-Agent Framework for Document Understanding

Siwei Han, Peng Xia, Ruiyi Zhang, Tong Sun, Yun Li, Hongtu Zhu, Huaxiu Yao•Mar 18, 2025•192

ReSearch: Apprendimento del Ragionamento con la Ricerca per LLM tramite Apprendimento per Rinforzo
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning

Mingyang Chen, Tianpeng Li, Haoze Sun, Yijie Zhou, Chenzheng Zhu, Fan Yang, Zenan Zhou, Weipeng Chen, Haofen Wang, Jeff Z. Pan, Wen Zhang, Huajun Chen•Mar 25, 2025•173

CoLLM: Un Modello Linguistico di Grandi Dimensioni per il Recupero di Immagini Composte
CoLLM: A Large Language Model for Composed Image Retrieval

Chuong Huynh, Jinyu Yang, Ashish Tawari, Mubarak Shah, Son Tran, Raffay Hamid, Trishul Chilimbi, Abhinav Shrivastava•Mar 25, 2025•142

WikiAutoGen: Verso la Generazione di Articoli in Stile Wikipedia Multi-Modale
WikiAutoGen: Towards Multi-Modal Wikipedia-Style Article Generation

Zhongyu Yang, Jun Chen, Dannong Xu, Junjie Fei, Xiaoqian Shen, Liangbing Zhao, Chun-Mei Feng, Mohamed Elhoseiny•Mar 24, 2025•112

Super-risoluzione nello Spazio Latente per la Generazione di Immagini ad Alta Risoluzione con Modelli di Diffusione
Latent Space Super-Resolution for Higher-Resolution Image Generation with Diffusion Models

Jinho Jeong, Sangmin Han, Jinwoo Kim, Seon Joo Kim•Mar 24, 2025•101

FullDiT: Modello Fondazionale Generativo per Video Multi-Task con Attenzione Completa
FullDiT: Multi-Task Video Generative Foundation Model with Full Attention

Xuan Ju, Weicai Ye, Quande Liu, Qiulin Wang, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Qiang Xu•Mar 25, 2025•82

DiffPortrait360: Sintesi di Ritratti Coerenti a 360 Gradi con Diffusione
DiffPortrait360: Consistent Portrait Diffusion for 360 View Synthesis

Yuming Gu, Phong Tran, Yujian Zheng, Hongyi Xu, Heyuan Li, Adilbek Karmanov, Hao Li•Mar 19, 2025•82

FirePlace: Affinamenti Geometrici del Ragionamento di Senso Comune nei Modelli Linguistici per il Posizionamento di Oggetti 3D
FirePlace: Geometric Refinements of LLM Common Sense Reasoning for 3D Object Placement

Ian Huang, Yanan Bao, Karen Truong, Howard Zhou, Cordelia Schmid, Leonidas Guibas, Alireza Fathi•Mar 6, 2025•82

PhysTwin: Ricostruzione e Simulazione Basata sulla Fisica di Oggetti Deformabili da Video
PhysTwin: Physics-Informed Reconstruction and Simulation of Deformable Objects from Videos

Hanxiao Jiang, Hao-Yu Hsu, Kaifeng Zhang, Hsin-Ni Yu, Shenlong Wang, Yunzhu Li•Mar 23, 2025•72

LookAhead Tuning: Modelli Linguistici più Sicuri tramite Anteprime Parziali delle Risposte
LookAhead Tuning: Safer Language Models via Partial Answer Previews

Kangwei Liu, Mengru Wang, Yujie Luo, Lin Yuan, Mengshu Sun, Ningyu Zhang, Lei Liang, Zhiqiang Zhang, Jun Zhou, Huajun Chen•Mar 24, 2025•53

Sviluppo Efficiente di Modelli tramite Fine-tuning del Trasferimento
Efficient Model Development through Fine-tuning Transfer

Pin-Jie Lin, Rishab Balasubramanian, Fengyuan Liu, Nikhil Kandpal, Tu Vu•Mar 25, 2025•42

FRESA: Ricostruzione Feedforward di Avatar Personalizzati con Scheletro da Poche Immagini
FRESA:Feedforward Reconstruction of Personalized Skinned Avatars from Few Images

Rong Wang, Fabian Prada, Ziyan Wang, Zhongshi Jiang, Chengxiang Yin, Junxuan Li, Shunsuke Saito, Igor Santesteban, Javier Romero, Rohan Joshi, Hongdong Li, Jason Saragih, Yaser Sheikh•Mar 24, 2025•42

xKV: SVD a Livelli Incrociati per la Compressione della Cache KV
xKV: Cross-Layer SVD for KV-Cache Compression

Chi-Chih Chang, Chien-Yu Lin, Yash Akhauri, Wei-Cheng Lin, Kai-Chiang Wu, Luis Ceze, Mohamed S. Abdelfattah•Mar 24, 2025•41

Flusso di Gumbel-Softmax con Guida Diretta per la Generazione Controllabile di Sequenze Biologiche
Gumbel-Softmax Flow Matching with Straight-Through Guidance for Controllable Biological Sequence Generation

Sophia Tang, Yinuo Zhang, Alexander Tong, Pranam Chatterjee•Mar 21, 2025•42

Baseline Solido: Tracciamento Multi-UAV tramite YOLOv12 con BoT-SORT-ReID
Strong Baseline: Multi-UAV Tracking via YOLOv12 with BoT-SORT-ReID

Yu-Hsi Chen•Mar 21, 2025•45

Quando le Parole Superano la Visione: i Modelli Linguistico-Visuali Possono Migliorarsi Attraverso l'Addestramento su Solo Testo per Decisioni Centrate sull'Uomo
When Words Outperform Vision: VLMs Can Self-Improve Via Text-Only Training For Human-Centered Decision Making

Zhe Hu, Jing Li, Yu Yin•Mar 21, 2025•42

Verso un Modello Fondamentale Unificato Copernicus per la Visione Terrestre
Towards a Unified Copernicus Foundation Model for Earth Vision

Yi Wang, Zhitong Xiong, Chenying Liu, Adam J. Stewart, Thomas Dujardin, Nikolaos Ioannis Bountos, Angelos Zavras, Franziska Gerken, Ioannis Papoutsis, Laura Leal-Taixé, Xiao Xiang Zhu•Mar 14, 2025•43

LLaVAction: valutazione e addestramento di modelli linguistici multimodali di grandi dimensioni per il riconoscimento delle azioni
LLaVAction: evaluating and training multi-modal large language models for action recognition

Shaokai Ye, Haozhe Qi, Alexander Mathis, Mackenzie W. Mathis•Mar 24, 2025•32

Any6D: Stima della posa 6D senza modello per oggetti nuovi
Any6D: Model-free 6D Pose Estimation of Novel Objects

Taeyeop Lee, Bowen Wen, Minjun Kang, Gyuree Kang, In So Kweon, Kuk-Jin Yoon•Mar 24, 2025•32

OpenCity3D: Cosa sanno i modelli visione-linguaggio sugli ambienti urbani?
OpenCity3D: What do Vision-Language Models know about Urban Environments?

Valentin Bieri, Marco Zamboni, Nicolas S. Blumer, Qingxuan Chen, Francis Engelmann•Mar 21, 2025•32

I Modelli Visione-Linguaggio Possono Rispondere a Domande Faccia a Faccia nel Mondo Reale?
Can Vision-Language Models Answer Face to Face Questions in the Real-World?

Reza Pourreza, Rishit Dagli, Apratim Bhattacharyya, Sunny Panchal, Guillaume Berger, Roland Memisevic•Mar 25, 2025•22

Superare il disallineamento del vocabolario: Modellazione del linguaggio guidata dall'insegnante agnostica al vocabolario
Overcoming Vocabulary Mismatch: Vocabulary-agnostic Teacher Guided Language Modeling

Haebin Shin, Lei Ji, Xiao Liu, Yeyun Gong•Mar 24, 2025•22

Convoluzione Dinamica in Frequenza per la Predizione Densa di Immagini
Frequency Dynamic Convolution for Dense Image Prediction

Linwei Chen, Lin Gu, Liang Li, Chenggang Yan, Ying Fu•Mar 24, 2025•22

LPOSS: Propagazione delle Etichette su Patch e Pixel per la Segmentazione Semantica a Vocabolario Aperto
LPOSS: Label Propagation Over Patches and Pixels for Open-vocabulary Semantic Segmentation

Vladan Stojnić, Yannis Kalantidis, Jiří Matas, Giorgos Tolias•Mar 25, 2025•12

ST-VLM: Sintonizzazione delle Istruzioni Cinematiche per il Ragionamento Spazio-Temporale nei Modelli Visione-Linguaggio
ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models

Dohwan Ko, Sihyeon Kim, Yumin Suh, Vijay Kumar B. G, Minseo Yoon, Manmohan Chandraker, Hyunwoo J. Kim•Mar 25, 2025•11

Co-SemDepth: Stima Rapida Congiunta di Segmentazione Semantica e Profondità su Immagini Aeree
Co-SemDepth: Fast Joint Semantic Segmentation and Depth Estimation on Aerial Images

Yara AlaaEldin, Francesca Odone•Mar 23, 2025•02