arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-26 至 2026-03-26 共收录 62 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 10 篇

2603.23067 2026-03-26 cs.CV 88%

MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding

MLLM-HWSI: 一种用于分层全滑动图像理解的多模态大语言模型

Basit Alawode, Arif Mahmood, Muaz Khalifa Al-Radi, Shahad Albastaki, Asim Khan, Muhammad Bilal, Moshira Ali Abdalla, Mohammed Bennamoun, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系) Information Technology University(信息技术大学) KAU(卡乌大学) University of the Western Australia(西澳大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CV

AI总结 本文提出MLLM-HWSI,一种分层全滑动图像级多模态大语言模型,通过四级尺度对齐视觉特征与病理语言,提升解释性证据接地推理能力,在六个CPath任务上取得新SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14185 2026-03-26 cs.AI 83%

Relationship-Aware Safety Unlearning for Multimodal LLMs

关系感知的安全反向学习用于多模态大语言模型

Vishnu Narayanan Anilkumar, Abhijith Sreesylesh Babu, Trieu Hai Vo, Mohankrishna Kolla, Alexander Cuneo

机构 * Florida International University(佛罗里达国际大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 本文提出关系感知的安全反向学习框架,通过显式表示不安全的对象-关系-对象元组,并应用参数高效编辑技术抑制不安全元组,同时保留对象边缘和安全邻近关系。

Comments 9 pages,4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22070 2026-03-26 cs.CV 79%

Adapting Point Cloud Analysis via Multimodal Bayesian Distribution Learning

通过多模态贝叶斯分布学习适应点云分析

Xingyu Zhu, Liang Yi, Shuo Wang, Wenbo Zhu, Yonglinag Wu, Beier Zhu, Hanwang Zhang

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(脑信息处理实验室,中国科学技术大学) Opus AI Research(Opus AI研究院) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BayesMM框架,通过多模态贝叶斯分布学习实现测试时点云分析的持续适应,利用文本先验和流式视觉特征的高斯分布融合,提升在分布偏移下的鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10305 2026-03-26 cs.CV cs.AI 79%

DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset

DanQing:一个更新的大型中文视觉-语言预训练数据集

Hengyu Shen, Tiancheng Gu, Bin Qin, Lan Wu, Yuling Wu, Shuo Tan, Zelong Sun, Jun Wang, Nan Wu, Xiang An, Weidong Cai, Ziyong Feng, Kaicheng Yang

机构 * Glint Lab(光粒实验室)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DanQing数据集,包含1亿张高质量图像-文本对,通过系统化流程提升数据质量,实验表明其在多种下游任务中表现优异,且具备更平衡的语义分布和更强的扩展能力。

Comments 19 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24275 2026-03-26 cs.LG 67%

Language-Assisted Image Clustering Guided by Discriminative Relational Signals and Adaptive Semantic Centers

基于判别关系信号和自适应语义中心的语言辅助图像聚类

Jun Ma, Xu Zhang, Zhengxing Jiao, Yaxin Hou, Hui Liu, Junhui Hou, Yuheng Jia

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) School of Computing Information Sciences, Saint Francis University, Hong Kong, China(圣弗朗西斯大学计算信息科学学院) Department of Computer Science, City University of Hong Kong, Hong Kong, China(香港城市大学计算机科学系)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract)

AI总结 本文提出一种新的语言辅助图像聚类框架,通过跨模态关系生成更判别的自监督信号,并利用提示学习学习类别连续语义中心,提升聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12665 2026-03-26 cs.RO 67%

TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation

TacVLA: 基于接触感知的触觉融合用于鲁棒的视觉-语言-动作操控

Kaidi Zhang, Heng Zhang, Zhengtong Xu, Zhiyuan Zhang, Md Rakibul Islam Prince, Xiang Li, Xiaojing Han, Yuhao Zhou, Arash Ajoudani, Yu She

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia(人机交互实验室,意大利理工学院) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova(机器人与智能机器国家级博士项目(DRIM)和热那亚大学) Edwardson School of Industrial Engineering, Purdue University(工业工程学院,普渡大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 TacVLA通过引入触觉模态提升视觉-语言-动作操控的鲁棒性,采用接触感知门控机制实现多模态融合,实验显示在拆解、箱内拾取和视觉遮挡场景中性能提升显著。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24454 2026-03-26 cs.CV 57%

Unleashing Vision-Language Semantics for Deepfake Video Detection

释放视觉-语言语义以进行深度伪造视频检测

Jiawen Zhu, Yunqi Miao, Xueyi Zhang, Jiankang Deng, Guansong Pang

机构 * Singapore Management University(新加坡管理学院) The University of Warwick(沃里克大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国理工学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VLAForge框架,通过ForgePerceiver增强视觉感知并引入身份感知VLA评分,利用跨模态语义提升深度伪造检测的判别能力。

Comments 14 pages, 7 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24224 2026-03-26 cs.CV 57%

RVLM: Recursive Vision-Language Models with Adaptive Depth

具有自适应深度的递归视觉-语言模型

Nicanor Mayumu, Zeenath Khan, Melodena Stephens, Patrick Mukala, Farhad Oroumchian

机构 * Department of Computer Science(计算机科学系) University of Wollongong in Dubai(迪拜沃林戈大学) Dubai Knowledge Park(迪拜知识园区) Mohammed Bin Rashid School of Government(穆罕默德·本·拉希德政府学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出RVLM,通过迭代生成-执行循环和自适应迭代深度控制器,解决医学AI系统在可解释性和推理深度上的限制,实验证明其在脑部MRI和胸部X光中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07659 2026-03-26 cs.CV 57%

Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework

通过自批评推理框架提升视觉-语言模型的测试时鲁棒性

Kaihua Tang, Jiaxin Qi, Jinli Ou, Yuhua Zheng, Jianqiang Huang

机构 * Tongji University(同济大学) Computer Network Information Center, CAS(计算机网络信息中心,中国科学院) HIAS, University of Chinese Academy of Sciences(高等研究所,中国科学院大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出自批评推理框架,通过多轮反事实推理提升视觉-语言模型的鲁棒性,引入动态鲁棒性基准评估框架以应对语言偏差和敏感性问题,实验表明该方法在鲁棒性上优于基线方法。

Comments Accepted to CVPR 2026. Code: https://github.com/KaihuaTang/Self-Critical-Inference-Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23914 2026-03-26 cs.CV cs.LG 57%

Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding

面向大视觉-语言模型的注意力感知推理优化

Fatih Ilhan, Gaowen Liu, Ramana Rao Kompella, Selim Furkan Tekin, Tiansheng Huang, Zachary Yahn, Yichang Xu, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Research(思科研究)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出AttentionPack框架,通过紧凑注意力机制和解压机制提升大视觉-语言模型解码效率,实验表明内存效率提升8倍,支持更大批次和更快推理,同时保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2509.13767 2026-03-26 cs.CV 83%

VocSegMRI: Multimodal Learning for Precise Vocal Tract Segmentation in Real-time MRI

VocSegMRI:多模态学习在实时MRI中的精确声带段分割

Daiqi Liu, Johannes Enk, Maureen Stone, Fangxu Xing, Tomás Arias-Vergara, Jerry L. Prince, Jana Hutter, Jonghye Woo, Andreas Maier, Paula Andrea Pérez-Toro

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃朗根-纽伦堡大学) University of Maryland School of Dentistry(马里兰大学牙科学院) Harvard Medical School/Massachusetts General Hospital(哈佛医学院/麻省总医院) Universidad de Antioquia UdeA(安蒂奥基亚大学 UdeA) Johns Hopkins University(约翰霍普金斯大学) Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出VocSegMRI,通过跨注意力融合和对比学习目标,整合视频、音频和语音学输入,实现实时MRI中声带结构的精确分割,实验表明其优于单模态和多模态基线方法。

Comments Preprint submitted to MIDL short paper 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23960 2026-03-26 cs.CV 79%

Leave No Stone Unturned: Uncovering Holistic Audio-Visual Intrinsic Coherence for Deepfake Detection

不留死角:揭示深度伪造检测中的整体音频视觉内在一致性

Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出HAVIC方法,通过学习模态特定的结构一致性及跨模态微/宏观一致性,提升深度伪造检测的鲁棒性和泛化能力,实验表明其在跨数据集场景中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23673 2026-03-26 eess.AS cs.SD 70%

Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition

Crab:多层对比监督以提升在表演和自然语音条件下的语音情感识别

Lucas H. Ueda, João G. T. Lima, Paula D. P. Costa

机构 * Dept. of Computer Engineering and Automation (DCA), Faculdade de Engenharia Elétrica e de Computação(计算机工程与自动化系(DCA)、电气与计算机工程学院) AI Lab.(人工智能实验室) Institute of Computing, Universidade Estadual de Campinas, UNICAMP(计算学院,坎皮纳斯州立大学,UNICAMP)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本文提出Crab模型,通过多层对比监督策略提升语音情感识别在表演和自然语音条件下的性能,采用跨模态Transformer架构和多任务对比学习,有效解决类别不平衡问题。

Comments IEEE Transactions on Affective Computing submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20072 2026-03-26 cs.CL 57%

From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training

从文本到谈话:音频-语言模型需要非自回归联合训练

Tianqiao Liu, Xueyi Li, Hao Wang, Haoxuan Li, Zhichao Chen, Weiqi Luo, Zitao Liu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) TAL Education Group(TAL教育集团) Peking University(北京大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Text-to-Talk模型,通过整合自回归文本生成与非自回归音频扩散,统一训练目标,提升多模态语音交互系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 6 篇

2603.24484 2026-03-26 cs.CV 83%

Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

视频-only ToM:增强多模态大语言模型的理论思维

Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。

Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27321 2026-03-26 cs.LG 82%

MedM2T: A MultiModal Framework for Time-Aware Modeling with Electronic Health Record and Electrocardiogram Data

MedM2T:一种用于电子健康记录和心电图数据的时间感知多模态框架

Yu-Chen Kuo, Yi-Ju Tseng

机构 * Computational Health Informatics Program, Boston Children’s Hospital(儿童医院计算健康信息学项目,波士顿儿童医院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 MedM2T通过整合稀疏时间序列编码器、层次时间感知融合和双模态注意力机制,有效处理医疗数据的多模态和异构时间结构,实现对慢性及急性疾病动态的预测,展现优于现有方法的性能。

Comments This preprint version of the manuscript has been submitted to the IEEE Journal of Biomedical and Health Informatics (JBHI) for review. The implementation of MedM2T is available at https://github.com/DHLab-TSENG/MedM2T

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24539 2026-03-26 cs.CV cs.AI 62%

CliPPER: Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition

CliPPER:基于长形式术中手术程序的上下文视频-语言预训练用于事件识别

Florian Stilz, Vinkle Srivastav, Nassir Navab, Nicolas Padoy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, France(斯特拉斯堡大学,法国国家科学研究中心,法国国家医学研究院,ICube,UMR7357,法国) IHU Strasbourg, France(斯特拉斯堡IHU,法国) Technical University of Munich, Germany(慕尼黑技术大学,德国)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CliPPER框架,通过手术讲座视频预训练,提升长形式手术视频的细粒度时间视频-文本识别,引入VTC_CTX和COP等预训练策略,改进多模态对齐,实现多个公开手术基准的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04000 2026-03-26 cs.CV cs.AI cs.LG 62%

Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding

分割后再地面:为长视频理解适应帧选择以查询类型

Jialuo Li, Bin Li, Jiahao Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DIG框架,根据查询类型调整帧选择策略,通过高效均匀采样处理全局查询,利用专用流程提取相关帧处理局部查询,提升长视频理解性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03404 2026-03-26 cs.CV cs.LG 57%

Set2Seq Transformer: Temporal and Position-Aware Set Representations for Sequential Multiple-Instance Learning

Set2Seq Transformer: 时序和位置感知的集合表示用于序列多实例学习

Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Set2Seq Transformer,通过端到端多模态学习,联合建模集合结构和时间依赖性,提升在艺术分析和野火预测中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23779 2026-03-26 eess.IV physics.geo-ph 50%

Sentinel-2 for Crop Yield Estimation: A Systematic Review

哨兵-2用于作物产量估计:系统综述

Mohammadreza Narimani, Alireza Pourreza, Ali Moghimi, Parastoo Farajpoor

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文综述了利用哨兵-2卫星进行作物产量估计的最新进展,重点探讨了基于经验模型、作物生长模型融合和多源数据融合的方法,指出机器学习和深度学习在解释田间产量变异方面有显著效果,但受限于地面数据不足和云遮蔽问题。

Comments 29 pages, 5 figures, review paper

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2603.24556 2026-03-26 cs.IR cs.AI 57%

Evaluating Chunking Strategies For Retrieval-Augmented Generation in Oil and Gas Enterprise Documents

评估检索增强生成在石油和天然气企业文档中的分块策略

Samuel Taiwo, Mohd Amaluddin Yusoff

机构 * Digital and Innovation Department, Nigeria LNG Limited(尼日利亚LNG公司数字与创新部门)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了四种分块策略在石油和天然气企业文档中的效果,发现结构感知分块在检索效果和计算成本上表现最佳,但对图表类文档仍有限。

Comments Presented at CCSEIT 2026. This version matches the published proceedings

Journal ref Computer Science and Information Technology (CS and IT), pp. 49-67, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2603.23617 2026-03-26 cs.CV 79%

M3T: Discrete Multi-Modal Motion Tokens for Sign Language Production

M3T:用于手语生成的离散多模态运动令牌

Alexandre Symeonidis-Herzig, Jianhe Low, Ozge Mercanoglu Sincan, Richard Bowden

机构 * CVSSP, University of Surrey, United Kingdom(CVSSP,萨里大学,英国)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出M3T,一种基于多模态运动词汇的自回归Transformer,通过结合FLAME的丰富表情空间与SMPL-X身体模型,实现手语生成中手、脸和口部动作的高质量表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22492 2026-03-26 cs.CV cs.AI cs.MM 75%

Tiny Inference-Time Scaling with Latent Verifiers

微小推理时间缩放与潜在验证器

Davide Bucciarelli, Evelyn Turri, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出VHS验证器,直接在扩散变换器单步生成器的中间隐藏表示上操作,减少验证成本并提升性能,实现更高效的推理时间缩放。

Comments Findings of CVPR 2026 - Code at: https://aimagelab.github.io/VHS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24079 2026-03-26 cs.CV cs.AI cs.CR 73%

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

当理解成为风险:新兴图像生成范式中的真实性与安全性风险

Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Xi’an Jiaotong University(西安交通大学) Flexera(Flexera公司)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。

Comments Accepted by CVPR 2026. 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20012 2026-03-26 cs.CV 57%

Diffusion-Based Makeup Transfer with Facial Region-Aware Makeup Features

基于扩散模型的化妆转移与面部区域感知化妆特征

Zheng Gao, Debin Meng, Yunqi Miao, Zhensong Zhang, Songcen Xu, Ioannis Patras, Jifei Song

机构 * Queen Mary University of London(伦敦女王学院) Huawei London Research Center(华为伦敦研发中心)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 本文提出FRAM方法,通过微调化妆CLIP和区域感知化妆注入,提升扩散模型在面部区域特定化妆转移中的可控性与效果。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10328 2026-03-26 stat.ML cs.LG 50%

Accelerated Parallel Tempering via Neural Transports

加速的神经传输并行退火

Leo Zhang, Peter Potaptchik, Jiajun He, Yuanqi Du, Arnaud Doucet, Francisco Vargas, Hai-Dang Dau, Saifuddin Syed

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学) Cornell University(康奈尔大学) Xaira Therapeutics National University of Singapore(新加坡国立大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出利用神经采样器加速并行退火,通过减少相邻分布间的重叠需求,提升多模态采样效率并降低计算成本。

Comments Camera-ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 18 篇

2603.23521 2026-03-26 cs.CL cs.AI cs.CV 85%

Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages

Chitrakshara:一种用于印度语言的大型多语言多模态数据集

Shaharukh Khan, Ali Faraz, Abhinav Ravi, Mohd Nauman, Mohd Sarfraz, Akshat Patidar, Raja Kolla, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Chitrakshara数据集,涵盖11种印度语言,旨在提升多模态模型对印度语言的表示能力,通过大规模预训练和图像文本对的构建,促进更文化包容的视觉语言模型发展。

Comments Accepted at "CVPR 2025: Workshop Vision Language Models For All"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23938 2026-03-26 cs.CL 83%

OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models

OmniACBench:一种评估多模态模型上下文感知语音控制的基准

Seunghee Kim, Bumkyu Park, Kyudan Jung, Joosung Lee, Soyoon Kim, Jeonghoon Kim, Taeuk Kim, Hwiyeol Jo

机构 * Hanyang University(翰阳大学) Seoul National University(首尔国立大学) KAIST AI(韩国科学技术院人工智能研究所) NAVER Cloud(NAVER云)

专题命中 多模态评测 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 OmniACBench评估多模态模型在上下文感知语音生成中的能力,通过语音速率、音调等六种特征验证,揭示模型在多模态整合中的瓶颈及三种常见失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23510 2026-03-26 cs.CL cs.AI 81%

Visuospatial Perspective Taking in Multimodal Language Models

多模态语言模型中的视觉空间视角转换

Jonathan Prunty, Seraphina Zhang, Patrick Quinn, Jianxun Lian, Xing Xie, Lucy Cheke

机构 * University of Cambridge(剑桥大学) Department of Psychology(心理学系) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究评估多模态语言模型在视觉空间视角转换任务中的表现,发现其在需抑制自身视角以采用他人视角的层面2视角转换中存在显著缺陷,揭示了当前模型在协作场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24294 2026-03-26 cs.CV 79%

VERIA: Verification-Centric Multimodal Instance Augmentation for Long-Tailed 3D Object Detection

VERIA:面向长尾3D目标检测的验证导向多模态实例增强

Jumin Lee, Siyeong Lee, Namil Kim, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院) Naver Labs(Naver实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 VERIA通过多模态实例增强方法提升长尾分布下3D目标检测性能,利用基础模型生成同步RGB-LiDAR实例并进行语义与几何验证,改进稀有类别的检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏