arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2406.05113 2025-06-09 cs.CV cs.AI cs.LG 62%

LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models

Lukas Helff, Felix Friedrich, Manuel Brack, Kristian Kersting, Patrick Schramowski

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments In Proceedings of the 42st International Conference on Machine Learning (ICML 2025), Project page at https://ml-research.github.io/human-centered-genai/projects/llavaguard/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01271 2025-06-06 cs.CL cs.AI 62%

MuLan: Adapting Multilingual Diffusion Models for Hundreds of Languages with Negligible Cost

Sen Xing, Muyan Zhong, Zeqiang Lai, Liangchen Li, Jiawen Liu, Yaohui Wang, Jifeng Dai, Wenhai Wang

专题命中 多模态生成 :image-text(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03735 2025-06-05 cs.CL cs.AI cs.HC 62%

Generating Pedagogically Meaningful Visuals for Math Word Problems: A New Benchmark and Analysis of Text-to-Image Models

Junling Wang, Anna Rutkiewicz, April Yi Wang, Mrinmaya Sachan

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03139 2025-06-04 cs.CV cs.AI 62%

SVGenius: Benchmarking LLMs in SVG Understanding, Editing and Generation

Siqi Chen, Xinyu Dong, Haolei Xu, Xingyu Wu, Fei Tang, Hang Zhang, Yuchen Yan, Linjuan Wu, Wenqi Zhang, Guiyang Hou, Yongliang Shen, Weiming Lu, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 19 pages,4 figures, Project page: https://zju-real.github.io/SVGenius, Code: https://github.com/ZJU-REAL/SVGenius-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02661 2025-06-04 cs.SD cs.CV cs.GR eess.AS 62%

MotionRAG-Diff: A Retrieval-Augmented Diffusion Framework for Long-Term Music-to-Dance Generation

Mingyang Huang, Peng Zhang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、eess.AS

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01955 2025-06-03 cs.CV cs.CL cs.LG 62%

Dual-Process Image Generation

Grace Luo, Jonathan Granskog, Aleksander Holynski, Trevor Darrell

机构 * UC Berkeley(伯克利大学) Runway

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01689 2025-06-03 cs.AI cs.CL 62%

Respond Beyond Language: A Benchmark for Video Generation in Response to Realistic User Intents

Shuting Wang, Yunqi Liu, Zixin Yang, Ning Hu, Zhicheng Dou, Chenyan Xiong

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Serendipity One Inc.(Serendipity One公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14318 2025-06-03 cs.CV cs.CL 62%

RADAR: Enhancing Radiology Report Generation with Supplementary Knowledge Injection

Wenjun Hou, Yi Cheng, Kaishuai Xu, Heng Li, Yan Hu, Wenjie Li, Jiang Liu

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Research Institute of Trustworthy Autonomous Systems and Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学可信自主系统研究院和计算机科学与工程系) School of Computer Science, University of Nottingham Ningbo China(宁波大学计算机学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted to ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07089 2025-06-03 cs.CV cs.CL 62%

OmniCaptioner: One Captioner to Rule Them All

Yiting Lu, Jiakang Yuan, Zhen Li, Shitian Zhao, Qi Qin, Xinyue Li, Le Zhuo, Licheng Wen, Dongyang Liu, Yuewen Cao, Xiangchao Yan, Xin Li, Tianshuo Peng, Shufei Zhang, Botian Shi, Tao Chen, Zhibo Chen, Lei Bai, Peng Gao, Bo Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments More visualizations on Homepage: https://alpha-innovator.github.io/OmniCaptioner-project-page and Official code: https://github.com/Alpha-Innovator/OmniCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05902 2025-06-03 cs.CV cs.CL 62%

Autoregressive Models in Vision: A Survey

Jing Xiong, Gongye Liu, Lun Huang, Chengyue Wu, Taiqiang Wu, Yao Mu, Yuan Yao, Hui Shen, Zhongwei Wan, Jinfa Huang, Chaofan Tao, Shen Yan, Huaxiu Yao, Lingpeng Kong, Hongxia Yang, Mi Zhang, Guillermo Sapiro, Jiebo Luo, Ping Luo, Ngai Wong

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Duke University(杜克大学) University of Rochester(罗切斯特大学) The Ohio State University(俄亥俄州立大学) Bytedance(字节跳动) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Apple(苹果公司) The Hong Kong Polytechnic University(香港理工大学) Princeton University(普林斯顿大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments The paper is accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24245 2025-06-02 cs.CV cs.AI 62%

LTM3D: Bridging Token Spaces for Conditional 3D Generation with Auto-Regressive Diffusion Framework

Xin Kang, Zihan Zheng, Lei Chu, Yue Gao, Jiahao Li, Hao Pan, Xuejin Chen, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22705 2025-05-30 cs.CV cs.MM 62%

HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer

Qi Cai, Jingwen Chen, Yang Chen, Yehao Li, Fuchen Long, Yingwei Pan, Zhaofan Qiu, Yiheng Zhang, Fengbin Gao, Peihan Xu, Yimeng Wang, Kai Yu, Wenxuan Chen, Ziwei Feng, Zijian Gong, Jianzhuang Pan, Yi Peng, Rui Tian, Siyu Wang, Bo Zhao, Ting Yao, Tao Mei

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments Source codes and models are available at https://github.com/HiDream-ai/HiDream-I1 and https://github.com/HiDream-ai/HiDream-E1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22126 2025-05-29 cs.CV cs.AI 62%

SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model

Yifan Chang, Yukang Feng, Jianwen Sun, Jiaxin Ai, Chuanhao Li, S. Kevin Zhou, Kaipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) Wuhan University(武汉大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19354 2025-05-27 cs.CL cs.CV 62%

GC-KBVQA: A New Four-Stage Framework for Enhancing Knowledge Based Visual Question Answering Performance

Mohammad Mahdi Moradi, Sudhir Mudur

机构 * Concordia University(康科迪亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13981 2025-05-27 cs.CV cs.AI 62%

On the Fairness, Diversity and Reliability of Text-to-Image Generative Models

Jordan Vice, Naveed Akhtar, Leonid Sigal, Richard Hartley, Ajmal Mian

机构 * University of Western Australia(西澳大学) University of Melbourne(墨尔本大学) University of British Columbia(不列颠哥伦比亚大学) Australian National University(澳大利亚国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments This research is supported by the NISDRG project #20100007, funded by the Australian Government

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14744 2025-05-27 cs.CV cs.AI 62%

RSTeller: Scaling Up Visual Language Modeling in Remote Sensing with Rich Linguistic Semantics from Openly Available Data and Large Language Models

Junyao Ge, Xu Zhang, Yang Zheng, Kaitai Guo, Jimin Liang

机构 * School of Electronic Engineering, Xidian University(电子工程学院,西安电子科技大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Published on ISPRS, minor typos corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17897 2025-05-26 cs.AI cs.CL 62%

T2I-Eval-R1: Reinforcement Learning-Driven Reasoning for Interpretable Text-to-Image Evaluation

Zi-Ao Ma, Tian Lan, Rong-Cheng Tu, Shu-Hang Liu, Heyan Huang, Zhijing Wu, Chen Xu, Xian-Ling Mao

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16976 2025-05-23 cs.CV cs.MM 62%

Creatively Upscaling Images with Global-Regional Priors

Yurui Qian, Qi Cai, Yingwei Pan, Ting Yao, Tao Mei

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM

Comments International Journal of Computer Vision (IJCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16425 2025-05-23 cs.CL cs.AI 62%

$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion

Jing Bi, Pinxin Liu, Ali Vosoughi, Jiarui Wu, Jinxi He, Chenliang Xu

机构 * University of Rochester(罗切斯特大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 13 pages, 5 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16314 2025-05-23 cs.CV cs.AI 62%

NTIRE 2025 challenge on Text to Image Generation Model Quality Assessment

Shuhao Han, Haotian Fan, Fangyuan Kong, Wenjie Liao, Chunle Guo, Chongyi Li, Radu Timofte, Liang Li, Tao Li, Junhui Cui, Yunqiu Wang, Yang Tai, Jingwei Sun, Jianhui Sun, Xinli Yue, Tianyi Wang, Huan Hou, Junda Lu, Xinyang Huang, Zitang Zhou, Zijian Zhang, Xuhui Zheng, Xuecheng Wu, Chong Peng, Xuezhi Cao, Trong-Hieu Nguyen-Mau, Minh-Hoang Le, Minh-Khoa Le-Phan, Duy-Nam Ly, Hai-Dang Nguyen, Minh-Triet Tran, Yukang Lin, Yan Hong, Chuanbiao Song, Siyuan Li, Jun Lan, Zhichao Zhang, Xinyue Li, Wei Sun, Zicheng Zhang, Yunhao Li, Xiaohong Liu, Guangtao Zhai, Zitong Xu, Huiyu Duan, Jiarui Wang, Guangji Ma, Liu Yang, Lu Liu, Qiang Hu, Xiongkuo Min, Zichuan Wang, Zhenchen Tang, Bo Peng, Jing Dong, Fengbin Guan, Zihao Yu, Yiting Lu, Wei Luo, Xin Li, Minhao Lin, Haofeng Chen, Xuanxuan He, Kele Xu, Qisheng Xu, Zijian Gao, Tianjiao Wan, Bo-Cheng Qiu, Chih-Chung Hsu, Chia-ming Lee, Yu-Fan Lin, Bo Yu, Zehao Wang, Da Mu, Mingxiu Chen, Junkang Fang, Huamei Sun, Wending Zhao, Zhiyu Wang, Wang Liu, Weikang Yu, Puhong Duan, Bin Sun, Xudong Kang, Shutao Li, Shuai He, Lingzhi Fu, Heng Cong, Rongyu Zhang, Jiarong He, Zhishan Qiao, Yongqing Huang, Zewen Chen, Zhe Pang, Juan Wang, Jian Guo, Zhizhuo Shao, Ziyu Feng, Bing Li, Weiming Hu, Hesong Li, Dehua Liu, Zeming Liu, Qingsong Xie, Ruichen Wang, Zhihao Li, Yuqi Liang, Jianqi Bi, Jun Luo, Junfeng Yang, Can Li, Jing Fu, Hongwei Xu, Mingrui Long, Lulin Tang

机构 * NTIRE 2025 challenge on Text to Image Generation Model Quality Assessment(NTIRE 2025挑战)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19722 2025-05-20 cs.LG cs.AI cs.CV 62%

JetFormer: An Autoregressive Generative Model of Raw Images and Text

Michael Tschannen, André Susano Pinto, Alexander Kolesnikov

机构 * Google DeepMind(谷歌DeepMind)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments ICLR 2025. Code available at https://github.com/google-research/big_vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08854 2025-05-15 cs.CV cs.AI cs.RO 62%

Generative AI for Autonomous Driving: Frontiers and Opportunities

Yuping Wang, Shuo Xing, Cui Can, Renjie Li, Hongyuan Hua, Kexin Tian, Zhaobin Mo, Xiangbo Gao, Keshu Wu, Sulong Zhou, Hengxu You, Juntong Peng, Junge Zhang, Zehao Wang, Rui Song, Mingxuan Yan, Walter Zimmer, Xingcheng Zhou, Peiran Li, Zhaohan Lu, Chia-Ju Chen, Yue Huang, Ryan A. Rossi, Lichao Sun, Hongkai Yu, Zhiwen Fan, Frank Hao Yang, Yuhao Kang, Ross Greer, Chenxi Liu, Eun Hak Lee, Xuan Di, Xinyue Ye, Liu Ren, Alois Knoll, Xiaopeng Li, Shuiwang Ji, Masayoshi Tomizuka, Marco Pavone, Tianbao Yang, Jing Du, Ming-Hsuan Yang, Hua Wei, Ziran Wang, Yang Zhou, Jiachen Li, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学) University of California, Riverside(加州大学河滨分校) University of Michigan(密歇根大学) Purdue University(普渡大学) Columbia University(哥伦比亚大学) University of Florida(佛罗里达大学) Technische Universität München(慕尼黑技术大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Notre Dame(诺特丹大学) Adobe Research(Adobe研究) Lehigh University(莱斯利大学) Cleveland State University(克利夫兰州立大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Merced(加州大学默塞德分校) University of Utah(犹他大学) Texas A&M Transportation Institute(德克萨斯农工大学交通研究所) Bosch Research North America(博世北美研究) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) NVIDIA(英伟达) Arizona State University(亚利桑那州立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07460 2025-05-13 cs.AI cs.CL 62%

A Survey on Collaborative Mechanisms Between Large and Small Language Models

Yi Chen, JiaHao Zhao, HaoHao Han

机构 * Chengdu Institute of Computer Applications, Chinese Academy of Sciences(中国科学院成都计算机应用研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05501 2025-05-12 cs.CV cs.AI eess.IV 62%

Preliminary Explorations with GPT-4o(mni) Native Image Generation

Pu Cao, Feng Zhou, Junyi Ji, Qingye Kong, Zhixiang Lv, Mingjian Zhang, Xuekun Zhao, Siqi Wu, Yinghui Lin, Qing Song, Lu Yang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03859 2025-05-08 cs.CY cs.AI cs.CV 62%

Deepfakes on Demand: the rise of accessible non-consensual deepfake image generators

Will Hawkins, Chris Russell, Brent Mittelstadt

机构 * Oxford Internet Institute(牛津互联网研究所) University of Oxford(牛津大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 13 pages

Journal ref FAccT '25: Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10316 2025-05-06 cs.CV cs.AI 62%

BrushEdit: All-In-One Image Inpainting and Editing

Yaowei Li, Yuxuan Bian, Xuan Ju, Zhaoyang Zhang, Junhao Zhuang, Ying Shan, Yuexian Zou, Qiang Xu

机构 * Peking University(北京大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments WebPage available at https://liyaowei-stu.github.io/project/BrushEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00019 2025-05-02 cs.CL cs.AI 62%

An Empirical Study on Prompt Compression for Large Language Models

Zheng Zhang, Jinyi Li, Yihuai Lan, Xiang Wang, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) South China University of Technology(华南理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Accepted by Building Trust Workshop at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20998 2025-04-30 cs.CV cs.AI 62%

YoChameleon: Personalized Vision and Language Generation

Thao Nguyen, Krishna Kumar Singh, Jing Shi, Trung Bui, Yong Jae Lee, Yuheng Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments CVPR 2025; Project page: https://thaoshibe.github.io/YoChameleon

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04907 2025-04-30 cs.CV cs.AI 62%

Video-Bench: Human-Aligned Video Generation Benchmark

Hui Han, Siyuan Li, Jiaqi Chen, Yiwen Yuan, Yuling Wu, Chak Tou Leong, Hanwen Du, Junchen Fu, Youhua Li, Jie Zhang, Chi Zhang, Li-jia Li, Yongxin Ni

机构 * Shanghai Jiao Tong University(上海交通大学) Stanford University(斯坦福大学) Fellou AI(Fellou人工智能) Fudan University(复旦大学) Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学) Hong Kong Polytechnic University(香港理工大学) University of Glasgow(格拉斯哥大学) City University of Hong Kong(香港城市大学) Westlake University(西湖大学) LiveX AI(LiveX人工智能) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07199 2025-04-29 cs.CV cs.AI 62%

OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision

Cong Wei, Zheyang Xiong, Weiming Ren, Xinrun Du, Ge Zhang, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Vector Institute(向量研究所) M-A-P

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏