arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4884 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 4884 篇

2411.12755 2024-11-21 eess.IV cs.CV 57%

SAM-I2I: Unleash the Power of Segment Anything Model for Medical Image Translation

Jiayu Huo, Sebastien Ourselin, Rachel Sparks

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10050 2024-11-18 cs.LG cs.AI 57%

Jal Anveshak: Prediction of fishing zones using fine-tuned LlaMa 2

Arnav Mejari, Maitreya Vaghulade, Paarshva Chitaliya, Arya Telang, Lynette D'mello

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08888 2024-11-15 cs.CY cs.AI 57%

Exploring Capabilities of Time Series Foundation Models in Building Analytics

Xiachong Lin, Arian Prabowo, Imran Razzak, Hao Xue, Matthew Amos, Sam Behrens, Flora D. Salim

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

Comments 7 pages, 1 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08305 2024-11-14 eess.IV cs.CV 57%

Robust Divergence Learning for Missing-Modality Segmentation

Runze Cheng, Zhongao Sun, Ye Zhang, Chun Li

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00583 2024-11-13 cs.DB cs.AI 57%

City Foundation Models for Learning General Purpose Representations from OpenStreetMap

Pasquale Balsebre, Weiming Huang, Gao Cong, Yi Li

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

Comments CIKM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06374 2024-11-12 cs.CL 57%

UstanceBR: a social media language resource for stance prediction

Camila Pereira, Matheus Pavan, Sungwon Yoon, Ricelli Ramos, Pablo Costa, Lais Cavalheiro, Ivandre Paraboni

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13185 2024-11-01 cs.CL 57%

LIVE: Learnable In-Context Vector for Visual Question Answering

Yingzhe Peng, Chenduo Hao, Xu Yang, Jiawei Peng, Xinting Hu, Xin Geng

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10175 2024-11-01 cs.CV 57%

UniAR: A Unified model for predicting human Attention and Responses on visual content

Peizhao Li, Junfeng He, Gang Li, Rachit Bhargava, Shaolei Shen, Nachiappan Valliappan, Youwei Liang, Hongxiang Gu, Venky Ramachandran, Golnaz Farhadi, Yang Li, Kai J Kohlhoff, Vidhya Navalpakkam

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18876 2024-10-25 cs.AI cs.HC 57%

Guiding Empowerment Model: Liberating Neurodiversity in Online Higher Education

Hannah Beaux, Pegah Karimi, Otilia Pop, Rob Clark

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

Comments 9 pages, 1 Figure, 1 Table, Accepted in FIE 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18089 2024-10-25 cs.CY cs.AI cs.LG cs.SY eess.SY 57%

Empowering Cognitive Digital Twins with Generative Foundation Models: Developing a Low-Carbon Integrated Freight Transportation System

Xueping Li, Haowen Xu, Jose Tupayachi, Olufemi Omitaomu, Xudong Wang

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13247 2024-10-24 cs.SE cs.AI cs.HC 57%

Collaborative AI in Sentiment Analysis: System Architecture, Data Prediction and Deployment Strategies

Chaofeng Zhang, Jia Hou, Xueting Tan, Gaolei Li, Caijuan Chen

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16991 2024-10-23 cs.AI cs.GR 57%

An Eye for an AI: Evaluating GPT-4o's Visual Perception Skills and Geometric Reasoning Skills Using Computer Graphics Questions

Tony Haoran Feng, Paul Denny, Burkhard C. Wünsche, Andrew Luxton-Reilly, Jacqueline Whalley

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

Comments 8 pages, 8 figures, 1 table, to be published in SIGGRAPH Asia 2024 Educator's Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14724 2024-10-22 cs.LG cs.AI eess.SP 57%

A Phenomenological AI Foundation Model for Physical Signals

Jaime Lien, Laura I. Galindez Olascoaga, Hasan Dogan, Nicholas Gillian, Brandon Barbello, Leonardo Giusti, Ivan Poupyrev

专题命中 其他多模态 :cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06558 2024-10-22 cs.CV 57%

Deep Correlated Prompting for Visual Recognition with Missing Modalities

Lianyu Hu, Tongkai Shi, Wei Feng, Fanhua Shang, Liang Wan

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

Comments NeurIPS 2024, add some results

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14343 2024-10-21 eess.IV cs.CV 57%

2D-3D Deformable Image Registration of Histology Slide and Micro-CT with ML-based Initialization

Junan Chen, Matteo Ronchetti, Verena Stehl, Van Nguyen, Muhannad Al Kallaa, Mahesh Thalwaththe Gedara, Claudia Lölkes, Stefan Moser, Maximilian Seidl, Matthias Wieczorek

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01483 2024-10-21 cs.LG cs.AI cs.DC 57%

FedSN: A Federated Learning Framework over Heterogeneous LEO Satellite Networks

Zheng Lin, Zhe Chen, Zihan Fang, Xianhao Chen, Xiong Wang, Yue Gao

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

Comments 15 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05328 2024-10-17 cs.AI 57%

Bad Students Make Great Teachers: Active Learning Accelerates Large-Scale Visual Understanding

Talfan Evans, Shreya Pathak, Hamza Merzic, Jonathan Schwarz, Ryutaro Tanno, Olivier J. Henaff

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12744 2024-10-08 cs.CV 57%

PointSmile: Point Self-supervised Learning via Curriculum Mutual Information

Xin Li, Mingqiang Wei, Songcan Chen

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14688 2024-10-02 cs.LG cs.AI cs.CE cs.NA math.DS math.NA 57%

FMint: Bridging Human Designed and Data Pretrained Models for Differential Equation Foundation Model

Zezheng Song, Jiaxin Yuan, Haizhao Yang

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17461 2024-09-30 cs.LG cs.CV 57%

EMR-Merging: Tuning-Free High-Performance Model Merging

Chenyu Huang, Peng Ye, Tao Chen, Tong He, Xiangyu Yue, Wanli Ouyang

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00503 2024-09-30 cs.CV 57%

Black-box Attacks on Image Activity Prediction and its Natural Language Explanations

Alina Elena Baia, Valentina Poggioni, Andrea Cavallaro

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted at ICCV2023 AROW Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17977 2024-09-27 cs.CV 57%

Cross-Modality Attack Boosted by Gradient-Evolutionary Multiform Optimization

Yunpeng Gong, Qingyuan Zeng, Dejun Xu, Zhenzhong Wang, Min Jiang

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17156 2024-09-27 cs.CV cs.SI 57%

An Art-centric perspective on AI-based content moderation of nudity

Piera Riccio, Georgina Curto, Thomas Hofmann, Nuria Oliver

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

Comments To be published at the AI4VA (AI for Visual Arts) Workshop and Challenges at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10389 2024-09-17 cs.CV 57%

Prompt-and-Transfer: Dynamic Class-aware Enhancement for Few-shot Segmentation

Hanbo Bi, Yingchao Feng, Wenhui Diao, Peijin Wang, Yongqiang Mao, Kun Fu, Hongqi Wang, Xian Sun

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09058 2024-09-17 cs.DC cs.AI cs.LG 57%

Redefining Data-Centric Design: A New Approach with a Domain Model and Core Data Ontology for Computational Systems

William Johnson, James Davis, Tara Kelly

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00088 2024-09-17 cs.CL 57%

On-Device Language Models: A Comprehensive Review

Jiajun Xu, Zhiyuan Li, Wei Chen, Qun Wang, Xin Gao, Qi Cai, Ziyuan Ling

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CL

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07964 2024-09-13 cs.NI cs.AI cs.LG 57%

WirelessAgent: Large Language Model Agents for Intelligent Wireless Networks

Jingwen Tong, Jiawei Shao, Qiong Wu, Wei Guo, Zijian Li, Zehong Lin, Jun Zhang

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14133 2024-09-13 cs.CL 57%

I Know About "Up"! Enhancing Spatial Reasoning in Visual Language Models Through 3D Reconstruction

Zaiqiao Meng, Hao Zhou, Yifang Chen

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06729 2024-09-12 cs.CY cs.AI 57%

How will advanced AI systems impact democracy?

Christopher Summerfield, Lisa Argyle, Michiel Bakker, Teddy Collins, Esin Durmus, Tyna Eloundou, Iason Gabriel, Deep Ganguli, Kobi Hackenburg, Gillian Hadfield, Luke Hewitt, Saffron Huang, Helene Landemore, Nahema Marchal, Aviv Ovadya, Ariel Procaccia, Mathias Risse, Bruce Schneier, Elizabeth Seger, Divya Siddarth, Henrik Skaug Sætra, MH Tessler, Matthew Botvinick

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.04569 2024-09-12 cs.CV 57%

Open-World Distributed Robot Self-Localization with Transferable Visual Vocabulary and Both Absolute and Relative Features

Mitsuki Yoshida, Ryogo Yamamoto, Daiki Iwata, Kanji Tanaka

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

Comments 8 pages, 5 figures, Supplementary Material for International Conference Papers

详情

展开后加载摘要…

URL PDF HTML 收藏