arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-13 至 2026-03-13 共收录 68 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2603.11320 2026-03-13 cs.CV 70%

UniCompress: Token Compression for Unified Vision-Language Understanding and Generation

UniCompress: 用于统一视觉-语言理解和生成的标记压缩

Ziyao Wang, Chen Chen, Jingtao Li, Weiming Zhuang, Jiabo Huang, Ang Li, Lingjuan Lyu

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 UniCompress通过引入可学习的全局元标记引导的插件压缩和解压缩机制,显著减少视觉标记数量,同时保持图像理解和生成任务的性能,为资源受限场景下的统一多模态建模提供高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11938 2026-03-13 cs.AI cs.CV cs.LG 62%

Prototype-Based Knowledge Guidance for Fine-Grained Structured Radiology Reporting

基于原型的知识引导的细粒度结构化放射科报告

Chantal Pellegrini, Adrian Delchev, Ege Özsoy, Nassir Navab, Matthias Keicher

机构 * Computer Aided Medical Procedures, Technische Universität München, Germany(计算机辅助医疗程序,慕尼黑技术大学,德国) Munich Center for Machine Learning, Germany(慕尼黑机器学习中心,德国)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ProtoSR通过整合自由文本信息提升细粒度结构化放射科报告的自动化水平,利用多模态知识库和原型条件残差增强模型预测,有效改进了对罕见发现和属性的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12208 2026-03-13 cs.CV 57%

ForensicZip: More Tokens are Better but Not Necessary in Forensic Vision-Language Models

ForensicZip: 更多令牌更好但并非必要在取证视觉-语言模型中

Yingxin Lai, Zitong Yu, Jun Wang, Linlin Shen, Yong Xu, Xiaochun Cao

机构 * Great Bay University(大湾大学) Shenzhen University(深圳大学) Harbin Institute of Technology(哈尔滨工业大学) School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络安全科学与技术学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ForensicZip通过引入无需训练的框架,从伪造驱动的角度重新定义令牌压缩,利用最优传输问题量化物理不连续性,实现高压缩率下的取证证据分离与高效检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11441 2026-03-13 cs.CV 57%

Detect Anything in Real Time: From Single-Prompt Segmentation to Multi-Class Detection

实时检测任意目标:从单提示分割到多类检测

Mehmet Kerem Turkcan

机构 * Columbia University(哥伦比亚大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 DART通过共享视觉主干网络计算,实现实时多类检测,无需训练,提升速度达25倍,达到80类检测的55.8 AP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02421 2026-03-13 cs.CV 57%

Generalizing Vision-Language Models with Dedicated Prompt Guidance

通过专用提示引导泛化视觉语言模型

Xinyao Li, Yinjie Min, Hongbo Chen, Zhekai Du, Fengling Li, Jingjing Li

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GuiDG框架,通过提示微调和跨模态注意力模块提升视觉语言模型的领域泛化能力,并在ImageNet-DG上验证了其有效性。

Comments Accepted to AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2603.11095 2026-03-13 cs.MM cs.SD eess.SP 89%

Multimodal Self-Attention Network with Temporal Alignment for Audio-Visual Emotion Recognition

多模态自注意力网络与时间对齐用于音频-视觉情感识别

Inyong Koo, yeeun Seong, Minseok Son, Jaehyuk Jang, Changick Kim

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出基于Transformer的多模态自注意力网络,通过时间对齐旋转位置嵌入和跨时间匹配损失,解决音频-视觉情感识别中的跨模态帧率不匹配问题,提升时间线索保留和跨模态融合效果。

Comments 5 pages, 3 figures, accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11468 2026-03-13 cs.MM cs.AI cs.SD 79%

Stage-Adaptive Reliability Modeling for Continuous Valence-Arousal Estimation

面向连续情感估值的阶段自适应可靠性建模

Yubeen Lee, Sangeun Lee, Junyeop Cha, Eunil Park

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI、cs.MM

AI总结 本文提出SAGE框架,通过阶段自适应可靠性建模提升多模态环境下连续情感估值的稳定性与准确性。

Comments 8 pages, 3 figures, 2 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12149 2026-03-13 cs.CV cs.CL 62%

Linking Perception, Confidence and Accuracy in MLLMs

将感知、信心与准确性联系起来在多模态大语言模型中

Yuetian Du, Yucheng Wang, Rongyu Zhang, Zhijie Xu, Boyu Yang, Ming Kong, Jie Liu, Qiang Zhu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出信心驱动强化学习和信心感知测试时扩展,通过校准模型信心提升感知灵敏度和测试效果,实现多模态大语言模型的性能提升。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20900 2026-03-13 cs.SD cs.CL cs.LG eess.AS 62%

Text-only adaptation in LLM-based ASR through text denoising

基于文本去噪的LLM语音识别领域适应

Andrés Carofilis, Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Kadri Hacioglu, Srikanth Madikeri, Pradeep Rangappa, Manjunath K E, Petr Motlicek, Shankar Venkatesan, Andreas Stolcke

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出通过文本去噪方法实现LLM语音识别领域适应,有效保持跨模态对齐并提升性能,实测在两个数据集上达到22.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11303 2026-03-13 cs.HC 50%

Bridging the Cognitive Gap: Co-Designing and Evaluating a Voice-Enabled Community Chatbot for Older Adults

弥合认知鸿沟:为老年人设计和评估一个语音启用的社区聊天机器人

Feng Chen, Luna Xingyu Li, Ray-Yuan Chung, Wenyu Zeng, Yein Jeon, Yizhou Hu, Oleg Zaslavsky

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出了一种语音启用的社区聊天机器人,通过共设计和教育工作坊,提升老年人对AI的认知和透明度,同时探索零触控导航对年龄包容性AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2511.12908 2026-03-13 cs.CV cs.AI 84%

DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning

DeepSport: 一种基于代理强化学习的多模态大语言模型,用于通过主动推理实现综合体育视频理解

Junbo Zou, Haotian Xia, Zhen Ye, Shengjie Zhang, Christopher Lai, Vicente Ordonez, Weining Shen, Hanjie Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Rice University(Rice大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Irvine(加州大学 Irvine分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 DeepSport通过代理强化学习实现多运动视频理解,首次端到端训练多任务模型,显著提升性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11896 2026-03-13 cs.CV cs.AI cs.CL 82%

Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models

边看边想:多轮视频推理的在线流式段级内存

Lu Wang, Zhuoran Jin, Yupu Hao, Yubo Chen, Kang Liu, Yulong Ao, Jun Zhao

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Think While Watching框架,通过段级内存保持多轮视频推理连续性,提升流式视频理解的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18990 2026-03-13 cs.CV 74%

IDSelect: A RL-Based Cost-Aware Selection Agent for Video-based Multi-Modal Person Recognition

IDSelect: 一种基于强化学习的成本感知选择代理用于基于视频的多模态人识别

Yuyang Ji, Yixuan Shen, Kien Nguyen, Lifeng Zhou, Feng Liu

专题命中 视频多模态 :multi-modal(title);分类 cs.CV

AI总结 IDSelect 通过强化学习选择最优模型提升多模态人识别的效率与准确度,实验显示其在计算资源上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12254 2026-03-13 cs.CV 70%

Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing

先关注再注意:通过自回归注视实现高效的可扩展视频理解

Baifeng Shi, Stephanie Fu, Long Lian, Hanrong Ye, David Eigen, Aaron Reite, Boyi Li, Jan Kautz, Song Han, David M. Chan, Pavlo Molchanov, Trevor Darrell, Hongxu Yin

机构 * UC Berkeley(伯克利大学) MIT(麻省理工学院) Clarifai(Clarifai公司) NVIDIA(英伟达公司)

专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 AutoGaze通过自回归选择视频中的关键块,减少冗余并提升处理效率,使大语言模型能处理长视频并取得更优表现。

Comments CVPR 2026. Project page: https://autogaze.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03464 2026-03-13 cs.CL 57%

Prompting Underestimates LLM Capability for Time Series Classification

提示低估了LLM在时间序列分类中的能力

Dan Schumacher, Erfan Nourbakhsh, Rocky Slavin, Anthony Rios

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究通过对比提示输出与线性探针,揭示LLM在时间序列分类中的实际能力被提示评估低估,且早期Transformer层能有效捕捉时间序列信息。

Comments 8 pages + Appendix and References, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11439 2026-03-13 cs.CV 57%

Stay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning

Stay in your Lane: 角色特定查询与重叠抑制损失用于密集视频描述

Seung Hyup Baek, Jimin Lee, Hyeongkeun Lee, Jae Won Cho

机构 * Konkuk University(韩国康 kuk 大学) Sejong University(世宗大学) KAIST(韩国科学技术院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出角色特定查询与重叠抑制损失,用于解决密集视频描述中的多任务干扰和时间冗余问题,通过分离定位与描述任务并增强语义一致性,提升描述精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11423 2026-03-13 cs.CV 57%

Beyond Single-Sample: Reliable Multi-Sample Distillation for Video Understanding

超越单样本:面向视频理解的可靠多样本蒸馏

Songlin Li, Xin Zhu, Zechao Guan, Peipeng Chen, Jian Yao

机构 * University of Electronic Science and Technology of China & Robotics Center(电子科技大学 & 机器人中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出R-MSD方法,通过任务自适应教师池和对抗蒸馏目标提升视频理解任务的蒸馏稳定性,实验显示在多个基准上优于单样本蒸馏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22433 2026-03-13 cs.CV 57%

SkeletonAgent: An Agentic Interaction Framework for Skeleton-based Action Recognition

SkeletonAgent: 一种基于骨架的动作识别代理交互框架

Hongda Liu, Yunfan Liu, Changlu Wang, Yunlong Wang, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(神经信息处理研究室,自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 SkeletonAgent通过Questioner和Selector两个代理连接识别模型与LLM,提升基于骨架的动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2603.11520 2026-03-13 cs.CV cs.AI 84%

FBCIR: Balancing Cross-Modal Focuses in Composed Image Retrieval

FBCIR: 在组合图像检索中平衡跨模态聚焦

Chenchen Zhao, Jianhuan Zhuo, Muxi Chen, Zhaohua Zhang, Wenyu Jiang, Tianwen Jiang, Qiuyong Xiao, Jihong Zhang, Qiang Xu

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FBCIR方法,通过分析CIR模型中的聚焦不平衡问题,提出数据增强工作流程以提升模型在挑战性场景下的性能。

Comments 20 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13823 2026-03-13 cs.CV 83%

Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings

Embed-RL: 用于推理驱动的多模态嵌入的强化学习

Haonan Jiang, Yuji Wang, Yongjie Zhu, Xin Lu, Wenyu Qin, Meng Wang, Pengfei Wan, Yansong Tang

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于嵌入引导强化学习的推理驱动多模态嵌入框架,通过生成证据可追溯的推理链提升多模态嵌入质量,实现跨模态语义一致性增强和细粒度匹配能力提升。

Comments Correcting errors and improving organizational logic

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 9 篇

2603.03964 2026-03-13 cs.CV cs.AI 84%

BLOCK: An Open-Source Bi-Stage MLLM Character-to-Skin Pipeline for Minecraft

BLOCK:一个开源的双阶段MLLM字符到皮肤生成Minecraft pipeline

Hengquan Guo

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 BLOCK通过双阶段流程生成Minecraft皮肤,结合MLLM和FLUX.2模型,提出EvolveLoRA提升生成稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11640 2026-03-13 cs.CV cs.AI 81%

Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans

分词使多模态大语言模型能够理解、生成和编辑建筑平面图

Sizhong Qin, Ramon Elias Weber, Xinzheng Lu

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。

Comments 20 pages, 9 figures. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11556 2026-03-13 cs.CV 79%

Enhancing Image Aesthetics with Dual-Conditioned Diffusion Models Guided by Multimodal Perception

通过多模态感知引导的双条件扩散模型增强图像美学

Xinyu Nan, Ning Wang, Yuyao Zhai, Mei Yang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出双监督图像美学增强模型DIAE,通过多模态感知和双分支监督框架提升图像美学质量与内容一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06214 2026-03-13 cs.CL cs.AI math-ph math.MP quant-ph 62%

Can Theoretical Physics Research Benefit from Language Agents?

理论物理研究能否从语言代理中受益?

Sirui Lu, Zhijing Jin, Terry Jingchen Zhang, Pavel Kos, J. Ignacio Cirac, Bernhard Schölkopf

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了语言代理在理论物理研究中的潜力,指出需专门训练和工具支持,以实现多模态数据处理、物理假设提出和理论验证的AI代理。

Comments 8+2 pages + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12264 2026-03-13 cs.CV 57%

GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing

GRADE: 图像编辑中学科引导推理的基准测试

Mingxin Liu, Ziqian Fan, Zhaokai Wang, Leyao Gu, Zirun Zhu, Yiguo He, Yuchen Yang, Changyao Tian, Xiangyu Zhao, Ning Liao, Shaofeng Zhang, Qibing Ren, Zhihang Zhong, Xuanhe Zhou, Junchi Yan, Xue Yang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 GRADE是首个评估图像编辑中学科引导推理能力的基准测试,通过多领域样本和多维评估协议揭示当前模型在知识密集型编辑任务中的局限性。

Comments 49 pages, 23 figures, 10 tables; Project Page: https://grade-bench.github.io/, Code: https://github.com/VisionXLab/GRADE, Dataset: https://huggingface.co/datasets/VisionXLab/GRADE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12126 2026-03-13 cs.CV cs.LG 57%

Hoi3DGen: Generating High-Quality Human-Object-Interactions in 3D

Hoi3DGen:生成高质量的人-物交互的3D模型

Agniv Sharma, Xianghui Xie, Tom Fischer, Eddy Ilg, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院) Technische Universität Nürnberg(纽伦堡技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Hoi3DGen通过多模态大语言模型生成高质量3D人-物交互模型,显著提升交互保真度和3D生成质量,实现文本到3D的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12108 2026-03-13 cs.CV 57%

EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation

EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成

Yan Li, Ning Liao, Xiangyu Zhao, Shaofeng Zhang, Xiaoxing Wang, Yifan Yang, Junchi Yan, Xue Yang

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Corporation(微软公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11984 2026-03-13 cs.CV 57%

Ada3Drift: Adaptive Training-Time Drifting for One-Step 3D Visuomotor Robotic Manipulation

Ada3Drift: 适应性训练时间漂移用于一步式三维视觉-运动机器人操作

Chongyang Xu, Yixian Zou, Ziliang Feng, Fanman Meng, Shuaicheng Liu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Ada3Drift通过将迭代细化从推理时间转移到训练时间,实现高保真的单步三维视觉-运动机器人操作生成,同时在少样本条件下提升性能并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11675 2026-03-13 cs.CV 57%

PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On

PROMO: 可提示的高效高保真虚拟试衣

Haohua Chen, Tianze Zhou, Wei Zhu, Runqi Wang, Yandong Guan, Dejia Song, Yibo Chen, Xu Tang, Yao Hu, Lu Sheng, Zhiyong Wu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 PROMO通过流匹配DiT框架和潜在多模态条件拼接,实现高效高保真虚拟试衣,平衡保真度与效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 16 篇

2603.11987 2026-03-13 cs.AI 83%

LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories

LABSHIELD:一种多模态基准,用于科学实验室中的安全关键推理和规划

Qianpu Sun, Xiaowei Chi, Yuhan Rui, Ying Li, Kuangzhi Ge, Jiajun Li, Sirui Han, Shanghang Zhang

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 LABSHIELD是一个多模态基准,用于评估MLLM在科学实验室中的安全关键推理和规划能力,揭示了现有模型在专业实验室场景中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏