arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-20 至 2026-04-20 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 13 篇

2604.11804 2026-04-20 cs.CV 83%

OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation

OmniShow:统一多模态条件以生成人-物体交互视频

Donghao Zhou, Guisheng Liu, Hao Yang, Jiatong Li, Jingyu Lin, Xiaohu Huang, Yichen Liu, Xin Gao, Cunjian Chen, Shilei Wen, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出OmniShow框架,统一文本、图像、音频和姿态多模态条件,解决人-物体交互视频生成中的可控性与质量平衡问题,通过统一通道条件和门控局部上下文注意力实现高效生成,建立HOIVG-Bench基准测试平台,取得多模态条件下的最佳性能。

Comments Project page: https://correr-zhou.github.io/OmniShow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07786 2026-04-20 cs.CV cs.LG 79%

Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video

跨模态情绪迁移用于谈话人脸视频中的情绪编辑

Chanhyuk Choi, Taesoo Kim, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * Ulsan National Institute of Science and Technology (UNIST)(乌山国立科学技术研究院)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态情绪迁移(C-MET)方法,通过建模语音与视觉特征空间间的情绪语义向量,提升生成视频的情绪表达与真实感,实验表明其在MEAD和CREMA-D数据集上比现有方法提升14%的情绪准确性。

Comments Accepted to CVPR 2026. Project Page: https://chanhyeok-choi.github.io/C-MET/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11698 2026-04-20 cs.CV cs.AI cs.CL 75%

OSCBench: Benchmarking Object State Change in Text-to-Video Generation

OSCBench:文本到视频生成中对象状态变化的基准测试

Xianjing Han, Bin Zhu, Shiqi Hu, Franklin Mingzhe Li, Patrick Carrington, Roger Zimmermann, Jingjing Chen

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出OSCBench基准,用于评估文本到视频模型在对象状态变化上的性能,揭示当前模型在处理新场景时的不足。

Comments ACL 2026 Main Conference, Project page: https://hanxjing.github.io/OSCBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16170 2026-04-20 cs.CV cs.CE 74%

neuralCAD-Edit: An Expert Benchmark for Multimodal-Instructed 3D CAD Model Editing

neuralCAD-Edit:一个多模态指令引导的3D CAD模型编辑专家基准

Toby Perrett, Matthew Bouchard, William McCarthy

机构 * Autodesk Research(Autodesk研究院)

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 本文提出neuralCAD-Edit,首个基于专家CAD工程师采集的3D CAD模型编辑基准。通过捕捉专业设计师与CAD模型交互的视频,收集真实编辑请求,发现基础模型在自动指标和人工评估中均显著落后于CAD专家。

Comments Project page: https://autodeskailab.github.io/neuralCAD-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15453 2026-04-20 cs.CV cs.AI cs.LG 62%

(1D) Ordered Tokens Enable Efficient Test-Time Search

(1D) 有序标记实现高效的测试时搜索

Zhitong Gao, Parham Rezaei, Ali Cy, Mingqiao Ye, Nataša Jovanović, Jesse Allardice, Afshin Dehghan, Amir Zamir, Roman Bachmann, Oğuzhan Fatih Kar

机构 * Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士联邦理工学院洛桑分校) Apple(苹果公司)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了有序标记对测试时搜索能力的影响,发现粗到细的1D结构比传统2D网格结构更易进行搜索,通过实验验证了有序结构在生成过程中能提升测试时扩展性。

Comments Project page: https://soto.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13590 2026-04-20 eess.IV cs.AI cs.CV 62%

Intelligent Healthcare Imaging Platform: A VLM-Based Framework for Automated Medical Image Analysis and Clinical Report Generation

智能医疗影像平台:基于视觉语言模型的自动化医学图像分析与临床报告生成框架

Samer Al-Hamadani

机构 * Automated Manufacturing Department/Al-Khwarizmi College of Engineering/ University of Baghdad/Gilgamesh University(自动化制造部门/阿尔·卡瓦尔齐米工程学院/巴格达大学/吉尔伽美什大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于视觉语言模型的智能多模态框架,用于自动化医学图像分析和临床报告生成,结合视觉特征提取与自然语言处理,实现上下文图像解释,并通过多层可视化技术提升临床信心。

Comments 32 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15923 2026-04-20 cs.SD cs.CV 57%

Hierarchical Codec Diffusion for Video-to-Speech Generation

层次编码扩散用于视频到语音生成

Jiaxin Ye, Gaoxiang Cong, Chenhui Wang, Xin-Cheng Wen, Zhaoyang Li, Boyuan Cao, Hongming Shan

机构 * Fudan University(复旦大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出HiCoDiT,利用残差向量量化编码的层次结构,通过低层和高层块生成不同层级的语音令牌,以实现强音频视觉对齐,实验表明其在保真度和表达性上优于基线。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14605 2026-04-20 cs.CV 57%

Towards Design Compositing

面向设计合成

Abhinav Mahajan, Abhikhya Tripathy, Sudeeksha Reddy Pala, Vaibhav Methi, K J Joseph, Balaji Vasan Srinivasan

机构 * Carnegie Mellon University(卡内基梅隆大学) IIT Kharagpur(印度理工学院哈里科特) IIT Kanpur(印度理工学院坎普尔) Adobe Research(Adobe研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出GIST,一种无需训练的身份保持图像合成器,用于提升组件到设计流程中的视觉和谐与美学质量。

Comments Accepted to CVEU workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21735 2026-04-20 cs.HC cs.AI 57%

Cognitive Agency Surrender: Defending Epistemic Sovereignty via Scaffolded AI Friction

认知代理退让:通过支架式AI摩擦捍卫认知主权

Kuangzhe Xu, Yu Shen, Longjie Yan, Yinghui Ren

机构 * Cyberspace Security University of China(中国网络安全大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究揭示生成式AI导致认知代理退让的风险,提出支架式认知摩擦理论,通过多模态计算方法解耦决策与认知努力,以强化全球AI治理。

Comments 26 pages, 4 figure (one in appendix). This is a preprint of a perspective article

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17909 2026-04-20 cs.CV 57%

A Single Image and Multimodality Is All You Need for Novel View Synthesis

单张图像与多模态信息足矣实现新视角合成

Amirhosein Javadi, Chi-Shiang Gau, Konstantinos D. Polyzos, Tara Javidi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用稀疏多模态测距数据提升单图像新视角合成的几何一致性和视觉质量,通过多模态深度重建框架替代传统单目深度估计,增强扩散模型的生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12370 2026-04-20 cs.CV 57%

LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens

LLaMo:通过连续自回归令牌扩展预训练语言模型,实现统一的运动理解和生成

Zekun Li, Sizhe An, Chengcheng Tang, Chuan Guo, Ivan Shugurov, Linguang Zhang, Amy Zhao, Srinath Sridhar, Lingling Tao, Abhay Mittal

机构 * Brown University(布朗大学) Meta

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LLaMo通过模态特定的Transformer混合架构扩展预训练语言模型,解决运动-语言生成和理解的统一问题,实现高保真文本到运动生成和运动到文本描述。

Comments Project page: https://kunkun0w0.github.io/project/LLaMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03621 2026-04-20 cs.CV 57%

PILOT: A Promptable Interleaved Layout-aware OCR Transformer

PILOT:一种可提示的交错布局感知OCR变压器

Laziz Hamdi, Amine Tamasna, Pascal Boisson, Thierry Paquet

机构 * univ-rouen(鲁昂大学) LITIS(LITIS研究所) Malakoff Humanis(马拉科夫人类研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PILOT提出一种统一的OCR模型,通过交错布局感知和提示条件生成,实现手写和印刷文档的文本识别与空间定位,优于传统OCR和端到端HTR模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20699 2026-04-20 gr-qc astro-ph.HE 50%

Comparing next-generation detector configurations for high-redshift gravitational wave sources with neural posterior estimation

比较下一代探测器配置用于高红移引力波源的性能:基于神经后验估计

Filippo Santoliquido, Jacopo Tissino, Ulyana Dupletsa, Marica Branchesi, Jan Harms

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文利用神经后验估计方法评估了下一代引力波探测器网络配置,研究高红移双黑洞并合源的探测性能,发现2L MisA配置在天空定位和体积定位上优于三角形ET配置。

Comments 18 pages, 13 figures, 5 tables. Published in A&A

Journal ref A&A 708, A175 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏