arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4946 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4946 篇

2011.00192 2020-11-03 cs.CL cs.AI 81%

Personalized Multimodal Feedback Generation in Education

Haochen Liu, Zitao Liu, Zhongqin Wu, Jiliang Tang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Accepted in The 28th International Conference on Computational Linguistics (COLING 2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.03182 2020-10-27 cs.CV cs.AI 81%

VICTR: Visual Information Captured Text Representation for Text-to-Image Multimodal Tasks

Soyeon Caren Han, Siqu Long, Siwen Luo, Kunze Wang, Josiah Poon

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by COLING 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.09888 2020-10-26 cs.CV cs.HC cs.LG cs.SD eess.AS eess.IV stat.ML 81%

Let's Face It: Probabilistic Multi-modal Interlocutor-aware Generation of Facial Gestures in Dyadic Settings

Patrik Jonell, Taras Kucherenko, Gustav Eje Henter, Jonas Beskow

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、eess.AS

Comments Best Paper Award. 8 pages, 4 figures, IVA '20: Proceedings of the 20th ACM International Conference on Intelligent Virtual Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.00246 2020-05-04 cs.CL cs.CV cs.LG 81%

Cross-modal Language Generation using Pivot Stabilization for Web-scale Language Coverage

Ashish V. Thapliyal, Radu Soricut

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV、cs.CL

Comments ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.05664 2019-09-13 cs.CV cs.AI cs.RO 81%

Multimodal Attention Branch Network for Perspective-Free Sentence Generation

Aly Magassouba, Komei Sugiura, Hisashi Kawai

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 10 pages, 4 figures. Accepted for CoRL 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17608 2025-06-24 cs.CV 80%

HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs

Nikitha SR, Aradhya Neeraj Mathur, Tarun Ram Menta, Rishabh Jain, Mausoom Sarkar

机构 * Media and Data Science Research Lab, Adobe(Adobe媒体与数据科学研究实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments Accepted in CVPR 2025 Workshop on What's Next in Multimodal Foundational Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10005 2025-06-13 cs.CV cs.AI cs.CL cs.GR cs.MM 80%

Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models

Sridhar S, Nithin A, Shakeel Rifath, Vasantha Raj

机构 * Computer Science Engineering(计算机科学与工程) Hindustan Institute of Technology and Science(印度恒河理工学院与科学研究院)

专题命中 多模态生成 :multimodal(title,comments);分类 cs.CV、cs.CL、cs.AI

Comments 10 pages, seven figures about Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01369 2025-01-06 cs.LG cs.CR cs.CV 80%

On the Multi-modal Vulnerability of Diffusion Models

Dingcheng Yang, Yang Bai, Xiaojun Jia, Yang Liu, Xiaochun Cao, Wenjian Yu

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted at ICML2024 Workshop on Trustworthy Multi-modal Foundation Models and AI Agents (TiFA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14394 2024-03-28 cs.CV 80%

Unified Sequence-to-Sequence Learning for Single- and Multi-Modal Visual Object Tracking

Xin Chen, Ben Kang, Jiawen Zhu, Dong Wang, Houwen Peng, Huchuan Lu

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Comments This is a new expanded version of our previous CVPR2023 paper "SeqTrack: Sequence to Sequence Learning for Visual Object Tracking." SeqTrackv2 extends SeqTrack to four multi-modal tracking tasks with a unified model and parameter set

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04751 2023-07-11 cs.RO cs.CV cs.LG 80%

Shelving, Stacking, Hanging: Relational Pose Diffusion for Multi-modal Rearrangement

Anthony Simeonov, Ankit Goyal, Lucas Manuelli, Lin Yen-Chen, Alina Sarmiento, Alberto Rodriguez, Pulkit Agrawal, Dieter Fox

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Comments Project page: https://anthonysimeonov.github.io/rpdiff-multi-modal/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15740 2026-08-17 cs.CV cs.AI cs.LG cs.MM 版本更新 80%

Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

通过隐式文化对齐奖励建模消除文本到图像评估中的偏差

Bo-An Chang, Yu-Chih Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究文本到图像评估中文化真实性问题,提出基于轻量级多模态大语言模型构建的隐式文化对齐奖励模型,集成隐式文化探测器与跳跃连接交叉注意力机制,实验证明该模型准确率高、速度快,能为偏好优化管道提供有效信号。

Comments 16 pages, 2 figures, ECCV 2026 Workshop FAILED

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01942 2026-08-04 cs.CV cs.CL cs.MM 新提交 80%

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments Project page:https://hanxjing.github.io/CultureVidBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07061 2026-06-02 cs.SD cs.AI cs.CV cs.MM 80%

Do Joint Audio-Video Generation Models Understand Physics?

联合音视频生成模型是否理解物理?

Zijun Cui, Xiulong Liu, Hao Fang, Mingwei Xu, Jiageng Liu, Zexin Xu, Weiguo Pian, Shijian Deng, Feiyu Du, Chenming Ge, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 针对联合音视频生成模型,提出AV-Phys Bench基准测试其物理常识,发现所有模型在物理一致性上表现不足,尤其是事件驱动和环境驱动转换场景。

Comments Preprint. Project Page: https://zijuncui.com/AV-Phys/. Full abstract appears in the PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22344 2026-05-22 cs.CV cs.AI cs.MM 80%

Bernini: Latent Semantic Planning for Video Diffusion

Bernini: 视频扩散中的潜在语义规划

Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

机构 * Bernini Team(伯尼尼团队)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出Bernini框架,通过将大规模多模态语言模型用于语义规划,扩散模型用于像素生成,实现了视频生成与编辑的统一方法,提升了编辑任务的泛化能力。

Comments Project Page: https://bernini-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23044 2025-07-02 cs.CV cs.AI 80%

Ovis-U1 Technical Report

Guo-Hua Wang, Shanshan Zhao, Xinjie Zhang, Liangfu Cao, Pengxin Zhan, Lunhao Duan, Shiyin Lu, Minghao Fu, Xiaohao Chen, Jianshan Zhao, Yang Li, Qing-Guo Chen

专题命中 多模态生成 :multimodal(abstract,comments);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments An unified model for multimodal understanding, text-to-image generation, and image editing. GitHub: https://github.com/AIDC-AI/Ovis-U1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16234 2026-08-18 cs.CV 新提交 79%

GaussianDWM++: Language-Grounded 3D Gaussian Driving World Model for Unified Scene Understanding, Editing, and Multi-Modal Generation

GaussianDWM++:用于统一场景理解、编辑与多模态生成的语言接地3D高斯驾驶世界模型

Tianchen Deng, Xuefeng Chen, Shuang Wu, Qu Chen, Jiajun Zhu, Bo Dai, Jianfei Yang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Tsinghua University(清华大学) Chongqing Afari Intelligent Drive Co., Ltd.(重庆阿法瑞智能驾驶有限公司) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 该研究提出GaussianDWM++,通过基础特征高斯分词器等模块构建统一框架,在多类驾驶任务中实现场景理解、编辑与多模态生成,性能达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15517 2026-08-18 cs.CV 新提交 79%

GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning

GLaQ:基于视觉证据的潜在查询定位用于多模态推理

Zesheng Yang, Lingling Zhang, Xinyu Zhang, Cheng Zhang, Pengyu Li, Heng Wang, Lin Wu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出GLaQ框架,用定位的上下文条件查询替代顺序潜在展开,经训练后在五个视觉理解基准上优于基础模型及其他视觉潜在方法,可高效恢复局部视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05513 2026-08-18 cs.RO cs.AI 版本更新 79%

DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter

DECO:解耦多模态扩散变压器用于配备插件触觉适配器的双臂灵巧操作

Xukun Li, Yu Sun, Lei Zhang, Bosheng Huang, Yibo Peng, Yuan Meng, Haojun Jiang, Shaoxuan Xie, Guocai Yao, Alois Knoll, Zhenshan Bing, Xinlong Wang, Zhenguo Sun

机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) School of Computation, Information and Technology, Technical University of Munich, Garching, Germany(慕尼黑技术大学计算与信息学院) Department of Shenyang Institute of Computing Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院沈阳计算技术研究所部门) State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 DECO通过解耦多模态输入和触觉适配器,实现了双臂灵巧操作的高效整合与高成功率

Comments 25 pages, 8 figures. Project Page: https://baai-humanoid.github.io/DECO-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18005 2026-08-18 cs.CV 版本更新 79%

UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale

RAISECity: 一种用于城市级现实对齐3D世界生成的多模态代理框架

Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京研究院,清华大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 RAISECity通过多模态代理框架实现城市级3D世界生成,提升现实对齐、精度和性能,适用于沉浸媒体和具身智能应用。

Comments Accepted by ACM MM 2026, the code is available at: https://github.com/tsinghua-fib-lab/UrbanWorld2.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14446 2026-08-17 cs.AI 新提交 79%

Wyvern: An Agentic Framework for Generating Grounded Multimodal Reports

Wyvern:用于生成基于事实的多模态报告的智能体框架

Beatrice Alessandra Motetti, Emilien Guandalino, Daniele Jahier Pagliari, Alessio Burrello, Lorenz K. Müller, Konstantin Berestizshevsky, Lukas Cavigelli

机构 * Politecnico di Torino(都灵理工大学) Huawei Research(华为研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 针对生成式模型内容缺乏事实依据的问题,提出Wyvern多智能体框架生成多模态技术报告,经评估其图像信息量、报告实用性及引用指标均优于基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14032 2026-08-17 cs.IR cs.AI 新提交 79%

HAM-RAG: Hierarchy-Aware Multimodal RAG for Structure-Faithful Interleaved Generation

HAM-RAG:面向结构保真交错生成的层级感知多模态检索增强生成

Yin Li, Ziyang Hu, Zhiyu Guo, Xiangyu Liu, Wenbin Li, Boo-Ho Yang, Rav Lawana, Ziyue Li, Wei Zeng, Fugee Tsung

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文针对现有多模态RAG方法丢失结构化文档层级信息的问题,提出HAM-RAG框架,引入HAM-Bench基准验证,使多模态平均性能提升17.3%,为可靠多模态助手提供了层级感知的基础信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11116 2026-08-17 cs.CV cs.NE 79%

Toward Generalized Detection of Synthetic Media: Limitations, Challenges, and the Path to Multimodal Solutions

Redwan Hussain, Mizanur Rahman, Prithwiraj Bhattacharjee

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments 10 Pages, 4 figures, 1 table, 7th International Conference on Trends in Computational and Cognitive Engineering(TCCE-2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12904 2026-08-14 cs.CV 新提交 79%

HounsWorld: A Multimodal World Model for Hidden Patient-State Readout, Reconstruction, and Simulation

HounsWorld:用于隐藏患者状态读取、重建与模拟的多模态世界模型

Yunhao Bai, Zhongwei Qiu, Guangyu Guo, Yiming Huang, Tony C. W. Mok, Qinji Yu, Ling Zhang, Yan Wang

机构 * East China Normal University(华东师范大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Laboratory(湖畔实验室) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出3B参数多模态世界模型HounsWorld,结合CT扫描与临床语言,通过共享潜在患者状态实现读取、重建、模拟三类任务,在HounsBench基准上表现优异,提升了CT理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12829 2026-08-14 cs.CV 新提交 79%

Semantic Steering for Controllable Generation: Tuning-Free Concept Erasure in Multimodal Diffusion Transformers

语义引导用于可控生成:多模态扩散Transformer中的无调优概念擦除

Qiao Li, Xiaomeng Fu, Yuanshu Zhao, Qipeng Wang, Jiao Dai, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对MM-DiTs的安全风险,提出一种无调优的概念擦除方法,通过在MM-DiT中间模块构建引导向量注入模型,实现高效鲁棒的概念擦除,性能优于现有方法。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02711 2026-08-14 cs.CV 版本更新 79%

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Hunyuan3D-Buffalo 1.0:用于可扩展3D生成、理解与编辑的统一多模态模型

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang, Zibo Zhao, Jiachen Xu, Jiaao Yu, Lifu Wang, Zhihao Liang, Xin Huang, Zhuo Chen, Chunchao Guo

机构 * Tencent Hunyuan(腾讯混元)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Hunyuan3D-Buffalo 1.0是支持3D理解、文本到3D生成等功能的统一多模态模型,构建87M规模语料库训练,在相关基准上达SOTA或领先性能,验证了统一训练的有效性。

Comments Project Page: https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10983 2026-08-12 cs.IR cs.AI 新提交 79%

TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

TimeRoute:面向多模态推荐的时间感知模态路由与扩散模型

Pengyu Zhang, Yangqin Jiang, Klim Zaporojets, Congfeng Cao, Paul Groth

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

AI总结 TimeRoute通过时间感知模态路由器和带FiLM的双流去噪扩散图重构器,解决多模态推荐的模态时间尺度不匹配问题,在三个公开数据集上提升了推荐指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23548 2026-08-12 cs.LG cs.AI 79%

Disentanglement of Variations with Multimodal Generative Modeling

Yijie Zhang, Yiyang Shen, Weiran Wang

机构 * Department of Computer Science University of Iowa(计算机科学系 印第安纳大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

Comments 22 pages, 14 figures, 7 tables

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08469 2026-08-11 cs.AI 新提交 79%

Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation

Aero Realtime:用于低延迟流式多模态生成的完全对齐输入输出流

Kaichen Zhang, Wei Huang, Keming Wu, Bo Li, Xiaojuan Qi

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出4B参数流式多模态模型Aero Realtime,采用双工架构实现输入输出流完全对齐,通过时隙对齐等技术降低延迟,在4块NVIDIA A6000 GPU上验证了其低延迟多模态交互的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05648 2026-08-07 cs.CV 新提交 79%

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation

Vorch-IR:长视频统一多模态身份替换生成模型

Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Vorch-IR是基于LTX2的统一多模态视频身份替换框架,支持单人、双人身份及可选背景替换,通过自动数据构建流水线与时间重叠推理策略,实现长视频生成,在身份保留、动作保真等方面表现出色。

Comments Project page: https://vorch-project.github.io/Vorch-IR-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04623 2026-08-06 cs.CV 新提交 79%

Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition

扩散模型中的视觉锚定:多模态零样本骨骼动作识别

Zehao Bao, Shujun Guo, Bruce X. B. Yu

机构 * The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对零样本骨骼动作识别中模态融合的问题,提出TDSM-MM模型,通过生成式分类范式结合视觉锚定,在NTU数据集上取得优异零样本识别性能,为零样本学习提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏