Articoli di Ricerca IA Giornalieri

Articoli di ricerca IA selezionati quotidianamente con traduzioni

Progressi e Sfide negli Agenti Fondamentali: Dall'Intelligenza Ispirata al Cervello a Sistemi Evolutivi, Collaborativi e Sicuri
Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems

Bang Liu, Xinfeng Li, Jiayi Zhang, Jinlin Wang, Tanjin He, Sirui Hong, Hongzhang Liu, Shaokun Zhang, Kaitao Song, Kunlun Zhu, Yuheng Cheng, Suyuchen Wang, Xiaoqiang Wang, Yuyu Luo, Haibo Jin, Peiyan Zhang, Ollie Liu, Jiaqi Chen, Huan Zhang, Zhaoyang Yu, Haochen Shi, Boyan Li, Dekun Wu, Fengwei Teng, Xiaojun Jia, Jiawei Xu, Jinyu Xiang, Yizhang Lin, Tianming Liu, Tongliang Liu, Yu Su, Huan Sun, Glen Berseth, Jianyun Nie, Ian Foster, Logan Ward, Qingyun Wu, Yu Gu, Mingchen Zhuge, Xiangru Tang, Haohan Wang, Jiaxuan You, Chi Wang, Jian Pei, Qiang Yang, Xiaoliang Qi, Chenglin Wu•Mar 31, 2025•2477

ZClip: Mitigazione Adattiva degli Spike per il Pre-Addestramento di LLM
ZClip: Adaptive Spike Mitigation for LLM Pre-Training

Abhay Kumar, Louis Owen, Nilabhra Roy Chowdhury, Fabian Güra•Apr 3, 2025•762

Oltre i Pixel: Benchmarking dell'Editing Visivo Basato sul Ragionamento
Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing

Xiangyu Zhao, Peiyuan Zhang, Kexian Tang, Hao Li, Zicheng Zhang, Guangtao Zhai, Junchi Yan, Hua Yang, Xue Yang, Haodong Duan•Apr 3, 2025•672

GPT-ImgEval: Un Benchmark Completo per la Diagnosi di GPT4o nella Generazione di Immagini
GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation

Zhiyuan Yan, Junyan Ye, Weijia Li, Zilong Huang, Shenghai Yuan, Xiangyang He, Kaiqing Lin, Jun He, Conghui He, Li Yuan•Apr 3, 2025•553

Scalabilità al Momento dell'Inferenza per la Modellazione di Ricompense Generaliste
Inference-Time Scaling for Generalist Reward Modeling

Zijun Liu, Peiyi Wang, Runxin Xu, Shirong Ma, Chong Ruan, Peng Li, Yang Liu, Yu Wu•Apr 3, 2025•524

JavisDiT: Trasformatore di Diffusione Audio-Video Congiunto con Sincronizzazione Gerarchica di Prior Spazio-Temporali
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

Kai Liu, Wei Li, Lai Chen, Shengqiong Wu, Yanhao Zheng, Jiayi Ji, Fan Zhou, Rongxin Jiang, Jiebo Luo, Hao Fei, Tat-Seng Chua•Mar 30, 2025•514

Diffusione Video Controllata Audio-Visuale con Modellazione a Spazi di Stato Selettivi e Maschera per la Generazione Naturale di Teste Parlanti
Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head Generation

Fa-Ting Hong, Zunnan Xu, Zixiang Zhou, Jun Zhou, Xiu Li, Qin Lin, Qinglin Lu, Dan Xu•Apr 3, 2025•414

WikiVideo: Generazione di Articoli da Più Video
WikiVideo: Article Generation from Multiple Videos

Alexander Martin, Reno Kriz, William Gantt Walden, Kate Sanders, Hannah Recknor, Eugene Yang, Francis Ferraro, Benjamin Van Durme•Apr 1, 2025•363

SkyReels-A2: Comporre qualsiasi cosa nei Transformer di Diffusione Video
SkyReels-A2: Compose Anything in Video Diffusion Transformers

Zhengcong Fei, Debang Li, Di Qiu, Jiahua Wang, Yikun Dou, Rui Wang, Jingtao Xu, Mingyuan Fan, Guibin Chen, Yang Li, Yahui Zhou•Apr 3, 2025•353

Ripensare il ridimensionamento del RL per i modelli visione-linguaggio: un framework trasparente, costruito da zero e uno schema di valutazione completo
Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme

Yan Ma, Steffi Chern, Xuyang Shen, Yiran Zhong, Pengfei Liu•Apr 3, 2025•303

Analisi di Scalabilità dei Modelli Linguistici con Discorso e Testo Intervallati
Scaling Analysis of Interleaved Speech-Text Language Models

Gallil Maimon, Michael Hassid, Amit Roth, Yossi Adi•Apr 3, 2025•272

ShortV: Modelli Linguistici Multimodali di Grande Dimensione Efficienti tramite il Blocco dei Token Visivi negli Strati Inefficaci
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers

Qianhao Yuan, Qingyu Zhang, Yanjiang Liu, Jiawei Chen, Yaojie Lu, Hongyu Lin, Jia Zheng, Xianpei Han, Le Sun•Apr 1, 2025•212

FreSca: Esplorazione dello Spazio di Scalabilità nei Modelli di Diffusione
FreSca: Unveiling the Scaling Space in Diffusion Models

Chao Huang, Susan Liang, Yunlong Tang, Li Ma, Yapeng Tian, Chenliang Xu•Apr 2, 2025•182

Selezione Efficiente dei Modelli per la Previsione di Serie Temporali tramite LLM
Efficient Model Selection for Time Series Forecasting via LLMs

Wang Wei, Tiankai Yang, Hongjie Chen, Ryan A. Rossi, Yue Zhao, Franck Dernoncourt, Hoda Eldardiry•Apr 2, 2025•162

OpenCodeReasoning: Progressi nella Distillazione dei Dati per la Programmazione Competitiva
OpenCodeReasoning: Advancing Data Distillation for Competitive Coding

Wasi Uddin Ahmad, Sean Narenthiran, Somshubra Majumdar, Aleksander Ficek, Siddhartha Jain, Jocelyn Huang, Vahid Noroozi, Boris Ginsburg•Apr 2, 2025•133

GenPRM: Scalabilità del Calcolo in Fase di Test per i Modelli di Ricompensa dei Processi tramite Ragionamento Generativo
GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning

Jian Zhao, Runze Liu, Kaiyan Zhang, Zhimu Zhou, Junqi Gao, Dong Li, Jiafei Lyu, Zhouyi Qian, Biqing Qi, Xiu Li, Bowen Zhou•Apr 1, 2025•123

Leggi di Scalabilità nella Scoperta Scientifica con Intelligenza Artificiale e Scienziati Robotici
Scaling Laws in Scientific Discovery with AI and Robot Scientists

Pengsong Zhang, Heng Zhang, Huazhe Xu, Renjun Xu, Zhenting Wang, Cong Wang, Animesh Garg, Zhibin Li, Arash Ajoudani, Xinyu Liu•Mar 28, 2025•122

Interpretazione della Pianificazione Emergente nell'Apprendimento per Rinforzo Senza Modello
Interpreting Emergent Planning in Model-Free Reinforcement Learning

Thomas Bush, Stephen Chung, Usman Anwar, Adrià Garriga-Alonso, David Krueger•Apr 2, 2025•112

NeuralGS: Colmare il Divario tra Campi Neurali e 3D Gaussian Splatting per Rappresentazioni 3D Compatte
NeuralGS: Bridging Neural Fields and 3D Gaussian Splatting for Compact 3D Representations

Zhenyu Tang, Chaoran Feng, Xinhua Cheng, Wangbo Yu, Junwu Zhang, Yuan Liu, Xiaoxiao Long, Wenping Wang, Li Yuan•Mar 29, 2025•112

Gli Autoencoder Sparse Apprendono Caratteristiche Monosematiche nei Modelli Visione-Linguaggio
Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models

Mateusz Pach, Shyamgopal Karthik, Quentin Bouniot, Serge Belongie, Zeynep Akata•Apr 3, 2025•102

Whisper-LM: Miglioramento dei Modelli ASR con Modelli Linguistici per Lingue a Risorse Limitare
Whisper-LM: Improving ASR Models with Language Models for Low-Resource Languages

Xabier de Zuazo, Eva Navas, Ibon Saratxaga, Inma Hernáez Rioja•Mar 30, 2025•103

Generazione Parametrica di Reti Neurali Autoregressive Guidate da Istruzioni
Instruction-Guided Autoregressive Neural Network Parameter Generation

Soro Bedionita, Bruno Andreis, Song Chong, Sung Ju Hwang•Apr 2, 2025•62

Segmentazione Panottica Non Supervisionata Centrata sulla Scena
Scene-Centric Unsupervised Panoptic Segmentation

Oliver Hahn, Christoph Reich, Nikita Araslanov, Daniel Cremers, Christian Rupprecht, Stefan Roth•Apr 2, 2025•53