ChatPaper.ai
Menü öffnen
Startseite
Tägliche Publikationen
Dashboard
Preise
Konto
🇩🇪
Deutsch
Loading...
•
•
•
•
•
•
•
•
•
•
KI-Forschungspapiere Täglich
Täglich kuratierte KI-Forschungspapiere mit Übersetzungen
October 24th, 2024
MIA-DPO: Multi-Bild-Augmented Direct Preference Optimization für große Vision-Sprach-Modelle
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
Ziyu Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Haodong Duan, Conghui He, Yuanjun Xiong, Dahua Lin, Jiaqi Wang
•
Oct 23, 2024
•
34
3
LongVU: Spatiotemporale adaptive Kompression für das Verständnis von langen Video-Sprache-Beziehungen
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
Xiaoqian Shen, Yunyang Xiong, Changsheng Zhao, Lemeng Wu, Jun Chen, Chenchen Zhu, Zechun Liu, Fanyi Xiao, Balakrishnan Varadarajan, Florian Bordes, Zhuang Liu, Hu Xu, Hyunwoo J. Kim, Bilge Soran, Raghuraman Krishnamoorthi, Mohamed Elhoseiny, Vikas Chandra
•
Oct 22, 2024
•
24
2
WorldSimBench: Auf dem Weg zu Videogenerierungsmodellen als Welt-Simulatoren
WorldSimBench: Towards Video Generation Models as World Simulators
Yiran Qin, Zhelun Shi, Jiwen Yu, Xijun Wang, Enshen Zhou, Lijun Li, Zhenfei Yin, Xihui Liu, Lu Sheng, Jing Shao, Lei Bai, Wanli Ouyang, Ruimao Zhang
•
Oct 23, 2024
•
17
2
Skalierung von Diffusions-Sprachmodellen durch Anpassung von autoregressiven Modellen
Scaling Diffusion Language Models via Adaptation from Autoregressive Models
Shansan Gong, Shivam Agarwal, Yizhe Zhang, Jiacheng Ye, Lin Zheng, Mukai Li, Chenxin An, Peilin Zhao, Wei Bi, Jiawei Han, Hao Peng, Lingpeng Kong
•
Oct 23, 2024
•
15
2
Skalierbare Optimierung von Rangpräferenzen für die Generierung von Text-zu-Bildern
Scalable Ranked Preference Optimization for Text-to-Image Generation
Shyamgopal Karthik, Huseyin Coskun, Zeynep Akata, Sergey Tulyakov, Jian Ren, Anil Kag
•
Oct 23, 2024
•
14
2
DynamicCity: Groß angelegte LiDAR-Erzeugung aus dynamischen Szenen
DynamicCity: Large-Scale LiDAR Generation from Dynamic Scenes
Hengwei Bian, Lingdong Kong, Haozhe Xie, Liang Pan, Yu Qiao, Ziwei Liu
•
Oct 23, 2024
•
12
2
M-RewardBench: Evaluierung von Belohnungsmodellen in mehrsprachigen Umgebungen
M-RewardBench: Evaluating Reward Models in Multilingual Settings
Srishti Gureja, Lester James V. Miranda, Shayekh Bin Islam, Rishabh Maheshwary, Drishti Sharma, Gusti Winata, Nathan Lambert, Sebastian Ruder, Sara Hooker, Marzieh Fadaee
•
Oct 20, 2024
•
10
3
Leichte neuronale App-Steuerung
Lightweight Neural App Control
Filippos Christianos, Georgios Papoudakis, Thomas Coste, Jianye Hao, Jun Wang, Kun Shao
•
Oct 23, 2024
•
9
2
MedINST: Metadatensatz biomedizinischer Anweisungen
MedINST: Meta Dataset of Biomedical Instructions
Wenhan Han, Meng Fang, Zihan Zhang, Yu Yin, Zirui Song, Ling Chen, Mykola Pechenizkiy, Qingyu Chen
•
Oct 17, 2024
•
6
2
ARKit LabelMaker: Eine neue Skala für das Verständnis von 3D-Szenen in Innenräumen
ARKit LabelMaker: A New Scale for Indoor 3D Scene Understanding
Guangda Ji, Silvan Weder, Francis Engelmann, Marc Pollefeys, Hermann Blum
•
Oct 17, 2024
•
6
2
TP-Eval: Erschließen Sie das Potenzial multimodaler LLMs in der Evaluation durch die Anpassung von Aufforderungen.
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
Yuxuan Xie, Tianhua Li, Wenqi Shao, Kaipeng Zhang
•
Oct 23, 2024
•
6
1
LVSM: Ein großes Ansichtssynthesemodell mit minimalem 3D-induktivem Bias.
LVSM: A Large View Synthesis Model with Minimal 3D Inductive Bias
Haian Jin, Hanwen Jiang, Hao Tan, Kai Zhang, Sai Bi, Tianyuan Zhang, Fujun Luan, Noah Snavely, Zexiang Xu
•
Oct 22, 2024
•
3
2
Die Lenkung Ihrer Generalisten: Verbesserung von Roboter-Grundmodellen durch Wertführung
Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance
Mitsuhiko Nakamoto, Oier Mees, Aviral Kumar, Sergey Levine
•
Oct 17, 2024
•
1
1