arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2412.17049 2025-03-05 cs.HC cs.CL cs.CY cs.MM 62%

Modular Conversational Agents for Surveys and Interviews

Jiangbo Yu, Jinhua Zhao, Luis Miranda-Moreno, Matthew Korp

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07864 2025-03-04 cs.RO cs.AI cs.CV cs.LG 62%

RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation

Songming Liu, Lingxuan Wu, Bangguo Li, Hengkai Tan, Huayu Chen, Zhengyi Wang, Ke Xu, Hang Su, Jun Zhu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 10 pages, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03550 2025-03-03 cs.CV cs.AI cs.LG 62%

DKDM: Data-Free Knowledge Distillation for Diffusion Models with Any Architecture

Qianlong Xiang, Miao Zhang, Yuzhang Shang, Jianlong Wu, Yan Yan, Liqiang Nie

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10676 2025-02-26 cs.SD cs.CV eess.AS 62%

Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation

Peiwen Sun, Sitong Cheng, Xiangtai Li, Zhen Ye, Huadai Liu, Honggang Zhang, Wei Xue, Yike Guo

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、eess.AS

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14887 2025-02-24 cs.CV cs.AI 62%

Vision-Enhanced Time Series Forecasting via Latent Diffusion Models

Weilin Ruan, Siru Zhong, Haomin Wen, Yuxuan Liang

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11307 2025-02-18 cs.CV cs.AI 62%

Exploiting Point-Language Models with Dual-Prompts for 3D Anomaly Detection

Jiaxiang Wang, Haote Xu, Xiaolu Chen, Haodi Xu, Yue Huang, Xinghao Ding, Xiaotong Tu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05772 2025-02-11 cs.CV cs.AI 62%

Effective Black-Box Multi-Faceted Attacks Breach Vision Large Language Model Guardrails

Yijun Yang, Lichao Wang, Xiao Yang, Lanqing Hong, Jun Zhu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06625 2025-02-11 cs.CV cs.CL cs.LG 62%

ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time

Yi Ding, Bolian Li, Ruqi Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 29pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12784 2025-02-11 cs.CV cs.AI 62%

Evaluating Image Hallucination in Text-to-Image Generation with Question-Answering

Youngsun Lim, Hojun Choi, Hyunjung Shim

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04923 2025-02-10 cs.CV cs.AI 62%

Cached Multi-Lora Composition for Multi-Concept Image Generation

Xiandong Zou, Mingzhu Shen, Christos-Savvas Bouganis, Yiren Zhao

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV、cs.AI

Comments The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03070 2025-02-10 cs.CV cs.AI 62%

A-Bench: Are LMMs Masters at Evaluating AI-generated Images?

Zicheng Zhang, Haoning Wu, Chunyi Li, Yingjie Zhou, Wei Sun, Xiongkuo Min, Zijian Chen, Xiaohong Liu, Weisi Lin, Guangtao Zhai

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00992 2025-02-04 cs.CV cs.MM 62%

FCBoost-Net: A Generative Network for Synthesizing Multiple Collocated Outfits via Fashion Compatibility Boosting

Dongliang Zhou, Haijun Zhang, Jianghong Ma, Jicong Fan, Zhao Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM

Comments This paper has been accepted for presentation at ACM Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00708 2025-02-04 cs.CV cs.AI 62%

PhiP-G: Physics-Guided Text-to-3D Compositional Scene Generation

Qixuan Li, Chao Wang, Zongjin He, Yan Peng

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 13 pages.8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01705 2025-02-03 cs.CV cs.AI 62%

Long Tail Image Generation Through Feature Space Augmentation and Iterated Learning

Rafael Elberg, Denis Parra, Mircea Petrache

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16778 2025-01-29 cs.CV cs.AI cs.GR cs.LG 62%

FlexMotion: Lightweight, Physics-Aware, and Controllable Human Motion Generation

Arvin Tashakori, Arash Tashakori, Gongbo Yang, Z. Jane Wang, Peyman Servati

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14204 2025-01-27 cs.CV cs.AI 62%

Dynamic Token Reduction during Generation for Vision Language Models

Xiaoyu Liang, Chaofeng Guan, Jiaying Lu, Huiyao Chen, Huan Wang, Haoji Hu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03335 2025-01-15 cs.SD cs.CV cs.LG eess.AS 62%

Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition

Zixuan Wang, Chi-Keung Tang, Yu-Wing Tai

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07260 2025-01-14 cs.CV cs.AI 62%

Skip Mamba Diffusion for Monocular 3D Semantic Scene Completion

Li Liang, Naveed Akhtar, Jordan Vice, Xiangrui Kong, Ajmal Saeed Mian

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06394 2025-01-14 cs.SD cs.AI eess.AS 62%

Unispeaker: A Unified Approach for Multimodality-driven Speaker Generation

Zhengyan Sheng, Zhihao Du, Heng Lu, Shiliang Zhang, Zhen-Hua Ling

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01973 2025-01-10 cs.CV cs.AI cs.CY 62%

INFELM: In-depth Fairness Evaluation of Large Text-To-Image Models

Di Jin, Xing Liu, Yu Liu, Jia Qing Yap, Andrea Wong, Adriana Crespo, Qi Lin, Zhiyuan Yin, Qiang Yan, Ryan Ye

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Di Jin and Xing Liu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02552 2025-01-07 cs.CL cs.CV 62%

Multi-LLM Collaborative Caption Generation in Scientific Documents

Jaeyoung Kim, Jongho Lee, Hong-Jun Choi, Ting-Yao Hsu, Chieh-Yang Huang, Sungchul Kim, Ryan Rossi, Tong Yu, Clyde Lee Giles, Ting-Hao 'Kenneth' Huang, Sungchul Choi

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted to AAAI 2025 AI4Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12198 2025-01-07 cs.CV cs.AI 62%

CCIS-Diff: A Generative Model with Stable Diffusion Prior for Controlled Colonoscopy Image Synthesis

Yifan Xie, Jingge Wang, Tao Feng, Fei Ma, Yang Li

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01109 2025-01-03 cs.CV cs.AI 62%

BatStyler: Advancing Multi-category Style Generation for Source-free Domain Generalization

Xiusheng Xu, Lei Qi, Jingyang Zhou, Xin Geng

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18150 2024-12-30 cs.CV cs.AI 62%

EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation

Shuhao Han, Haotian Fan, Jiachen Fu, Liang Li, Tao Li, Junhui Cui, Yunqiu Wang, Yang Tai, Jingwei Sun, Chunle Guo, Chongyi Li

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16839 2024-12-25 cs.CV cs.AI 62%

Human-Guided Image Generation for Expanding Small-Scale Training Image Datasets

Changjian Chen, Fei Lv, Yalong Guan, Pengcheng Wang, Shengjie Yu, Yifan Zhang, Zhuo Tang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by TVCG2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16364 2024-12-24 cs.CV cs.CL 62%

A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation

Shijie Zhou, Ruiyi Zhang, Yufan Zhou, Changyou Chen

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12129 2024-12-18 cs.LG cs.AI cs.CV 62%

SceneDiffuser: Efficient and Controllable Driving Simulation Initialization and Rollout

Chiyu Max Jiang, Yijing Bai, Andre Cornman, Christopher Davis, Xiukun Huang, Hong Jeon, Sakshum Kulshrestha, John Lambert, Shuangyu Li, Xuanyu Zhou, Carlos Fuertes, Chang Yuan, Mingxing Tan, Yin Zhou, Dragomir Anguelov

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11196 2024-12-17 cs.CL cs.CV 62%

Drawing the Line: Enhancing Trustworthiness of MLLMs Through the Power of Refusal

Yuhao Wang, Zhiyuan Zhu, Heyang Liu, Yusheng Liao, Hongcheng Liu, Yanfeng Wang, Yu Wang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10958 2024-12-17 cs.MM cs.CR cs.CV eess.IV 62%

Towards Effective User Attribution for Latent Diffusion Models via Watermark-Informed Blending

Yongyang Pan, Xiaohong Liu, Siqi Luo, Yi Xin, Xiao Guo, Xiaoming Liu, Xiongkuo Min, Guangtao Zhai

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10429 2024-12-17 cs.CV cs.AI 62%

GPTDrawer: Enhancing Visual Synthesis through ChatGPT

Kun Li, Xinwei Chen, Tianyou Song, Hansong Zhang, Wenzhe Zhang, Qing Shan

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏