arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4955 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4955 篇

2411.09703 2025-03-25 cs.CV 70%

MagicQuill: An Intelligent Interactive Image Editing System

Zichen Liu, Yue Yu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Wen Wang, Zhiheng Liu, Qifeng Chen, Yujun Shen

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to CVPR 2025. Code and demo available at https://magic-quill.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00895 2025-03-21 cs.CV 70%

Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model

Chenyang Liu, Keyan Chen, Rui Zhao, Zhengxia Zou, Zhenwei Shi

专题命中 多模态生成 :cross-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15264 2025-03-20 cs.CV 70%

LEGION: Learning to Ground and Explain for Synthetic Image Detection

Hengrui Kang, Siwei Wen, Zichen Wen, Junyan Ye, Weijia Li, Peilin Feng, Baichuan Zhou, Bin Wang, Dahua Lin, Linfeng Zhang, Conghui He

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Project Page: https://opendatalab.github.io/LEGION

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15005 2025-03-20 cs.CV 70%

Universal Scene Graph Generation

Shengqiong Wu, Hao Fei, Tat-Seng Chua

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10831 2025-03-20 cs.CV 70%

Low-Biased General Annotated Dataset Generation

Dengyang Jiang, Haoyu Wang, Lei Zhang, Wei Wei, Guang Dai, Mengmeng Wang, Jingdong Wang, Yanning Zhang

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

Comments CVPR2025 Accepted Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09962 2025-03-14 cs.CV 70%

Modeling Thousands of Human Annotators for Generalizable Text-to-Image Person Re-identification

Jiayu Jiang, Changxing Ding, Wentao Tan, Junhong Wang, Jin Tao, Xiangmin Xu

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

Comments CVPR 2025. Project website: https://github.com/sssaury/HAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14282 2025-03-12 cs.CV 70%

Image Super-Resolution with Text Prompt Diffusion

Zheng Chen, Yulun Zhang, Jinjin Gu, Xin Yuan, Linghe Kong, Guihai Chen, Xiaokang Yang

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

Comments Code is available at https://github.com/zhengchen1999/PromptSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09855 2025-02-18 cs.CV 70%

Text4Seg: Reimagining Image Segmentation as Text Generation

Mengcheng Lan, Chaofeng Chen, Yue Zhou, Jiaxing Xu, Yiping Ke, Xinjiang Wang, Litong Feng, Wayne Zhang

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments ICLR 2025. Project page: https://mc-lan.github.io/Text4Seg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19534 2025-01-23 cs.CV 70%

Locate, Assign, Refine: Taming Customized Promptable Image Inpainting

Yulin Pan, Chaojie Mao, Zeyinzi Jiang, Zhen Han, Jingfeng Zhang, Xiangteng He

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments 11 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09279 2025-01-17 cs.AI 70%

Text Semantics to Flexible Design: A Residential Layout Generation Method Based on Stable Diffusion Model

Zijin Qiu, Jiepeng Liu, Yi Xia, Hongtuo Qi, Pengkun Liu

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14505 2025-01-16 cs.CV 70%

T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation

Kaiyue Sun, Kaiyi Huang, Xian Liu, Yue Wu, Zihan Xu, Zhenguo Li, Xihui Liu

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Project page: https://t2v-compbench-2025.github.io/ Code: https://github.com/KaiyueSun98/T2V-CompBench/tree/V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05427 2025-01-10 cs.CV 70%

TextToucher: Fine-Grained Text-to-Touch Generation

Jiahang Tu, Hao Fu, Fengyu Yang, Hanbin Zhao, Chao Zhang, Hui Qian

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments This paper has been accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03567 2025-01-09 cs.CV 70%

Evaluating Image Caption via Cycle-consistent Text-to-Image Generation

Tianyu Cui, Jinbin Bai, Guo-Hua Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Ye Shi

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06322 2024-12-10 cs.CV 70%

LLaVA-SpaceSGG: Visual Instruct Tuning for Open-vocabulary Scene Graph Generation with Enhanced Spatial Relations

Mingjie Xu, Mengyang Wu, Yuzhi Zhao, Jason Chun Lok Li, Weifeng Ou

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by the WACV 2025, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01343 2024-12-03 cs.CV 70%

MoTrans: Customized Motion Transfer with Text-driven Video Diffusion Models

Xiaomin Li, Xu Jia, Qinghe Wang, Haiwen Diao, Mengmeng Ge, Pengxiang Li, You He, Huchuan Lu

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ACM MM 2024, code will be released in https://github.com/XiaominLi1997/MoTrans

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17323 2024-11-27 cs.CV 70%

InsightEdit: Towards Better Instruction Following for Image Editing

Yingjing Xu, Jie Kong, Jiazhi Wang, Xiao Pan, Bo Lin, Qiang Liu

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14715 2024-11-25 cs.CV 70%

Any-to-3D Generation via Hybrid Diffusion Supervision

Yijun Fan, Yiwei Ma, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13025 2024-11-21 cs.CV 70%

ORID: Organ-Regional Information Driven Framework for Radiology Report Generation

Tiancheng Gu, Kaicheng Yang, Xiang An, Ziyong Feng, Dongnan Liu, Weidong Cai

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 13 pages, 11 figures, WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21708 2024-10-30 cs.CV 70%

Unsupervised Modality Adaptation with Text-to-Image Diffusion Models for Semantic Segmentation

Ruihao Xia, Yu Liang, Peng-Tao Jiang, Hao Zhang, Bo Li, Yang Tang, Pan Zhou

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16364 2024-10-24 cs.CV 70%

Harmonizing Visual Text Comprehension and Generation

Zhen Zhao, Jingqun Tang, Binghong Wu, Chunhui Lin, Shu Wei, Hao Liu, Xin Tan, Zhizhong Zhang, Can Huang, Yuan Xie

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11262 2024-10-04 cs.CV 70%

Generative Visual Instruction Tuning

Jefferson Hernandez, Ruben Villegas, Vicente Ordonez

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments Add more results using task tokens, expand the introduction and related work FIX: error in LLM-as-judge evaluation that was over-inflating the results

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08251 2024-09-13 cs.CV 70%

Dynamic Prompting of Frozen Text-to-Image Diffusion Models for Panoptic Narrative Grounding

Hongyu Li, Tianrui Hui, Zihan Ding, Jing Zhang, Bin Ma, Xiaoming Wei, Jizhong Han, Si Liu

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08541 2024-08-15 cs.CV 70%

Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation

Zhengyuan Yang, Jianfeng Wang, Linjie Li, Kevin Lin, Chung-Ching Lin, Zicheng Liu, Lijuan Wang

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments ECCV 2024; Project page at https://idea2img.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12435 2024-07-18 cs.CV 70%

F-HOI: Toward Fine-grained Semantic-Aligned 3D Human-Object Interactions

Jie Yang, Xuesong Niu, Nan Jiang, Ruimao Zhang, Siyuan Huang

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments ECCV24

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07614 2024-07-12 cs.CV 70%

MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis

Wanggui He, Siming Fu, Mushui Liu, Xierui Wang, Wenyi Xiao, Fangxun Shu, Yi Wang, Lei Zhang, Zhelun Yu, Haoyuan Li, Ziwei Huang, LeiLei Gan, Hao Jiang

专题命中 多模态生成 :image-text(abstract);any-to-any(abstract);分类 cs.CV

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06801 2024-07-08 eess.IV cs.CV 70%

CT2Rep: Automated Radiology Report Generation for 3D Medical Imaging

Ibrahim Ethem Hamamci, Sezgin Er, Bjoern Menze

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04940 2024-07-02 cs.CV 70%

Harnessing the Power of MLLMs for Transferable Text-to-Image Person ReID

Wentao Tan, Changxing Ding, Jiayu Jiang, Fei Wang, Yibing Zhan, Dapeng Tao

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01291 2024-06-19 cs.CV cs.AI cs.CL cs.LG cs.MM 70%

Evaluating Text-to-Visual Generation with Image-to-Text Generation

Zhiqiu Lin, Deepak Pathak, Baiqi Li, Jiayao Li, Xide Xia, Graham Neubig, Pengchuan Zhang, Deva Ramanan

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments We open-source our data, model, and code at: https://github.com/linzhiqiu/t2v_metrics ; Project page: https://linzhiqiu.github.io/papers/vqascore

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14688 2024-06-19 cs.CL 70%

Taiyi-Diffusion-XL: Advancing Bilingual Text-to-Image Generation with Large Vision-Language Model Support

Xiaojun Wu, Dixiang Zhang, Ruyi Gan, Junyu Lu, Ziwei Wu, Renliang Sun, Jiaxing Zhang, Pingjian Zhang, Yan Song

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CL

Comments Taiyi-Diffusion-XL Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06525 2024-06-11 cs.CV 70%

Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation

Peize Sun, Yi Jiang, Shoufa Chen, Shilong Zhang, Bingyue Peng, Ping Luo, Zehuan Yuan

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

Comments Codes and models: \url{https://github.com/FoundationVision/LlamaGen}

详情

展开后加载摘要…

URL PDF HTML 收藏