arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-24 至 2026-03-24 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 10 篇

2603.21944 2026-03-24 cs.CV 83%

Group3D: MLLM-Driven Semantic Grouping for Open-Vocabulary 3D Object Detection

Group3D: 基于多模态大语言模型的开放词汇3D目标检测语义分组

Youbin Kim, Jinho Park, Hogun Park, Eunbyung Park

机构 * Department of Artificial Intelligence, Sungkyunkwan University(成均馆大学人工智能系) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 其他多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 Group3D通过将语义约束整合到实例构建过程中,解决多视角开放词汇3D目标检测中的几何过合并问题,实现语义与几何一致性融合的检测框架。

Comments 24 pages, 7 figures, Project page: https://ubin108.github.io/Group3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17487 2026-03-24 cs.CV 79%

Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models

智能下放:探索小型多模态模型中感知与推理的瓶颈

Mark Endo, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究小型多模态模型中感知与推理能力的瓶颈,通过分析LLM容量下降对多模态能力的影响,提出视觉提取调优方法,提升效率与性能。

Comments CVPR 2026, website at https://web.stanford.edu/~markendo/projects/downscaling_intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22182 2026-03-24 cs.RO 78%

Cross-Modal Reinforcement Learning for Navigation with Degraded Depth Measurements

跨模态强化学习用于退化深度测量的导航

Omkar Sawant, Luca Zanatta, Grzegorz Malczyk, Kostas Alexis

机构 * Department of Engineering Cybernetics, Norwegian University of Science and Technology (NTNU)(工程 cybernetics 部,挪威科学技术大学(NTNU))

专题命中 其他多模态 :cross-modal(title,abstract)

AI总结 本文提出利用深度和灰度图像互补信息的跨模态学习框架,通过跨模态一致性学习共享潜在表示,实现深度退化下的鲁棒导航。

Comments Accepted to the 24th European Control Conference (ECC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22031 2026-03-24 cs.RO 78%

MEVIUS2: Practical Open-Source Quadruped Robot with Sheet Metal Welding and Multimodal Perception

MEVIUS2:实用开源四足机器人,具备金属焊接与多模态感知

Kento Kawaharazuka, Keita Yoneda, Shintaro Inoue, Temma Suzuki, Jun Oda, Kei Okada

机构 * Department of Mechano-Informatics, Graduate School of Information Science and Technology, The University of Tokyo(机械信息学系,信息科学与技术研究生院,东京大学)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 MEVIUS2是首个基于电子商务服务可订购的开源四足机器人,采用金属焊接与加工技术实现坚固结构,集成LiDAR和高动态范围相机实现多模态感知,能有效应对复杂地形。

Comments Accepted to IEEE Robotics and Automation Practice, Website - https://haraduka.github.io/mevius2-hardware/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21032 2026-03-24 stat.AP stat.ME 78%

Integrative Predictor-Dependent Learning of Network Data and Spatially Correlated Nodal Attributes for Multimodal Brain Imaging in Aging

整合预测依赖学习网络数据与空间相关节点属性以研究衰老的多模态脑成像

Jose Rodriguez-Acosta, Sharmistha Guha, Jessica Bernard, Thamires Magalhaes, Kaitlin McOwen

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出一个预测依赖的联合建模框架,用于多受试者共享节点的网络数据,结合空间坐标和空间相关节点属性,通过整合结构性和功能性信息,研究脑连接模式与衰老相关预测变量的关系。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21629 2026-03-24 cond-mat.mtrl-sci 71%

Tailoring dispersion and evanescent modes in multimodal nonlocal lattices using positive-only interactions

在多模非本地晶格中利用单向相互作用定制色散和衰减模式

Lucas Rouhi, Christophe Droz

专题命中 其他多模态 :multimodal(title)

AI总结 本文提出一种基于插值的框架,通过设定频率-波数点来定制非本地晶格的色散关系,实现对波行为的局部可控,同时确保正实刚度参数和被动机械行为。

Comments Preprint also available on HAL: https://hal.science/hal-05330430

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21054 2026-03-24 cs.LG cs.AI cs.MM 62%

Harmful Visual Content Manipulation Matters in Misinformation Detection Under Multimedia Scenarios

在多媒体场景中,有害视觉内容操纵对虚假信息检测的重要性

Bing Wang, Ximing Li, Changchun Li, Jinjin Chi, Tianze Li, Renchu Guan, Shengsheng Wang

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学高级技术学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出一种新颖的多模态虚假信息检测方法,通过捕捉视觉内容操纵特征和意图特征,提升虚假信息检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21067 2026-03-24 stat.ME 50%

A Bayesian Framework for Quantifying Association Between Functional and Structural Data in Neuroimaging

一种用于量化神经影像中功能与结构数据关联的贝叶斯框架

Sakul Mahat, Sharmistha Guha, Jessica Bernard

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种贝叶斯框架,用于量化神经影像中功能与结构数据的关联,通过构建功能脑网络并结合层次贝叶斯模型,实现对不同数据结构的适应性和后验不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20992 2026-03-24 cs.RO 50%

Geometrically Plausible Object Pose Refinement using Differentiable Simulation

基于可微模拟的几何合理物体姿态细化

Anil Zeybek, Rhys Newbury, Snehal Dikhale, Nawid Jamali, Soshi Iba, Akansel Cosgun

机构 * Monash University(墨尔本大学) Honda Research Institute(本田研究院) Technical University of Munich(慕尼黑技术大学) Physical AI(物理AI)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出结合可微物理模拟、可微渲染和视觉-触觉传感的多模态姿态优化方法,提升空间准确性和物理一致性,实验表明在初始估计准确和高初始不确定性下,显著优于标准ICP基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01377 2026-03-24 cs.HC cs.CE 50%

From Sustainable Materials to User-Centered Sustainability: Material Experience in Art Healing

从可持续材料到以用户为中心的可持续性:材料体验在艺术疗愈中的作用

Yuxin Zhang, Fan Zhang, Zihao Song, Chao Zhao

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究通过水凝胶基材开发可持续材料,探讨从材料可持续性到用户中心可持续性的转变,重点在于通过材料体验实现艺术疗愈。发现美学属性对艺术疗愈影响最大,其次是内在属性,而物理属性影响较小,并提出材料体验框架以系统理解材料特性。

Journal ref IASDR 2025: Design Next (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏