arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-20 至 2026-03-20 共收录 76 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 12 篇

2510.11173 2026-03-20 cs.CV cs.MM 62%

CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation

CoPRS:从链式思维中学习位置先验以进行推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Yan Feng, Bin Chen, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(北京美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CoPRS模型,通过多模态链式思维生成可解释的位置先验热图,提升推理分割的可解释性和精度,实验表明其在多个数据集上表现优异。

Comments Accepted to ICLR 2026. 20 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18101 2026-03-20 cs.CV cs.AI cs.LG 62%

Training-Only Heterogeneous Image-Patch-Text Graph Supervision for Advancing Few-Shot Learning Adapters

仅训练异构图像-补丁-文本图监督以推进少样本学习适配器

Mohammed Rahman Sherif Khan Mohammad, Ardhendu Behera, Sandip Pradhan, Swagat Kumar, Amr Ahmed

机构 * Edge Hill University(埃德希尔大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种仅训练的异构图监督方法,通过多尺度视觉补丁和文本提示构建统一图,利用模态感知图变压器进行跨模态推理,并通过节点过滤提取高保真类特征,从而提升少样本学习性能。

Comments Accepted at The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18656 2026-03-20 cs.AI 57%

Balanced Thinking: Improving Chain of Thought Training in Vision Language Models

平衡思考:改进视觉语言模型中的推理链训练

Shaked Perek, Ben Wiesel, Avihu Dekel, Nimrod Shabtay, Eli Schwartz

机构 * IBM Research(IBM研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SCALe方法,通过动态权重平衡推理和答案段,提升视觉语言模型的推理效率和准确性,且训练时间仅为传统方法的七分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17944 2026-03-20 cs.CV 57%

TransText: Alpha-as-RGB Representation for Transparent Text Animation

TransText: Alpha-as-RGB表示法用于透明文本动画

Fei Zhang, Zijian Zhou, Bohao Tang, Sen He, Hang Li, Zhe Wang, Soubhik Sanyal, Pengfei Liu, Viktar Atliha, Tao Xiang, Frost Xu, Semih Gunel

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute (SII)(上海创新研究院) Meta AI

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 TransText通过Alpha-as-RGB方法联合建模外观与透明度,避免修改预训练生成流形,生成高质量透明动画。

Comments 19 pages, publication review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18541 2026-03-20 cs.CV 57%

Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detection

矫正目标域色散以提升跨域少样本目标检测

Yongwei Jiang, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对跨域少样本目标检测中目标域色散问题,提出生物启发的注意力细化框架,通过正负模式细化和文本语义对齐模块提升检测精度,实验证明在六个基准上取得新突破。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06679 2026-03-20 cs.CL 57%

CMV-Fuse: Cross Modal-View Fusion of AMR, Syntax, and Knowledge Representations for Aspect Based Sentiment Analysis

CMV-Fuse:跨模态视图融合AMR、语法和知识表示以进行基于方面的情感分析

Smitha Muthya Sudheendra, Mani Deep Cherukuri, Jaideep Srivastava

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 CMV-Fuse通过融合语法、语义和知识表示,提升基于方面的情感分析的鲁棒性,采用层次门控注意力机制和多视图对比学习,实现结构和语义的双重建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08316 2026-03-20 cs.CV 57%

Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge

通过2D语义知识解锁3D affordance分割

Yu Huang, Zelin Peng, Changsong Wen, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, School of Computer Science, Shanghai Jiaotong University(人工智能大模型实验室,计算机科学学院,上海交通大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出CMAT预训练策略,利用2D视觉基础模型的语义知识引导3D表征学习,提升3D affordance分割的准确性和效率。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 9 篇

2603.19067 2026-03-20 cs.LG eess.SP 82%

Communication-Efficient and Robust Multi-Modal Federated Learning via Latent-Space Consensus

通过潜在空间共识实现高效的多模态联邦学习

Mohamed Badi, Chaouki Ben Issaid, Mehdi Bennis

机构 * Center for Wireless Communications, University of Oulu(奥卢大学无线通信中心)

专题命中 其他多模态 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 本文提出CoMFed框架,通过可学习的投影矩阵生成压缩的潜在表示,并利用潜在空间正则化器对齐客户端间的表示,提升跨模态一致性和鲁棒性,实验显示在人体活动识别基准上具有竞争力的准确率与低开销。

Comments Accepted for publication in IEEE Wireless Communications Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15825 2026-03-20 cs.CL 79%

Did somebody say "Gest-IT"? A pilot exploration of multimodal data management

有人提到“Gest-IT”吗?多模态数据管理的初步探索

Ludovica Pannitto, Lorenzo Albanesi, Laura Marion, Federica Maria Martines, Carmelo Caruso, Claudia S. Bianchini, Francesca Masini, Caterina Mauri

机构 * Alma Mater Studiorum - University of Bologna(博洛尼亚大学) University of Poitiers, FoReLLIS Laboratory(波尔多大学FoReLLIS实验室)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文探讨了多模态语料库的构建、管理和分析,通过三层标注方法研究视障人士与正常人对话中的手势变化。

Journal ref Proceedings of the Tenth Italian Conference on Computational Linguistics (CLiC-it 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17314 2026-03-20 cs.CV 79%

A Proposal-Free Query-Guided Network for Grounded Multimodal Named Entity Recognition

无提案查询引导网络用于 grounded 多模态命名实体识别

Hongbing Li, Jiamin Liu, Shuo Zhang, Bo Xiao

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出无提案查询引导网络,通过文本引导和跨模态交互统一多模态推理与解码,提升开放域场景下的命名实体识别精度与鲁棒性。

Comments There is an error in the methods section

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19134 2026-03-20 cs.RO cs.HC 50%

Introducing M: A Modular, Modifiable Social Robot

引入M:一个模块化、可修改的社会机器人

Victor Nikhil Antony, Zhili Gong, Yoonjae Kim, Chien-Ming Huang

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Mechanical Engineering, Rice University(里士满大学机械工程系)

专题命中 其他多模态 :multimodal(abstract)

AI总结 M平台通过模块化设计和开源特性,降低社会机器人研究的摩擦,提供可重复、可修改的机器人解决方案,支持快速仿真到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03297 2026-03-20 physics.soc-ph 50%

How do activity-end trip characteristics affect the choice for shared micromobility? A latent class choice modelling approach for train station egress trips in the Netherlands

活动终点出行特征如何影响共享微出行的选择?一种针对荷兰火车站出站出行的潜在类别选择建模方法

Nejc Geržinič, Mark van Hagen, Hussein Al-Tamimi, Niels van Oort, Dorine Duives

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文通过潜在类别选择模型分析荷兰人口活动终点出行模式,发现三类用户群体,揭示共享微出行在不同情境下的选择差异及政策建议。

Journal ref Transportation Research Part A: Policy and Practice, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18594 2026-03-20 physics.soc-ph 50%

Beyond the Main Mode: The contribution of access and egress trips in door-to-door travel

超越主要出行方式:接入和离散出行在门到门出行中的贡献

Nejc Geržinič, Mark van Hagen, Hussein Al-Tamimi, Niels van Oort, Dorine Duives

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究分析了出行过程中接入和离散出行的重要性,发现列车和公交/地铁等出行方式相比步行、骑行和私家车存在固有不便,但其在车内的时间感知更少负面,适合长途出行。研究建议在密集城区优先发展公共交通以吸引更多乘客。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18370 2026-03-20 cs.RO 50%

Contact Status Recognition and Slip Detection with a Bio-inspired Tactile Hand

具有生物启发触觉手的接触状态识别与滑动检测

Chengxiao He, Wenhui Yang, Hongliang Zhao, Jiacheng Lv, Yuzhe Shao, Longhui Qin

机构 * School of Mechanical Engineering, Southeast University Nanjing 211189, China School of Electronic Science \& Engineering, Southeast University Nanjing 211189, China

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出了一种基于多模态触觉反馈的生物启发触觉手,通过提取17种特征实现96.39%的识别准确率,验证了方法的泛化能力。

Comments 7 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18092 2026-03-20 cs.NI 50%

A Vision-based Framework for Intelligent gNodeB Mobility Control

基于视觉的智能gNodeB移动控制框架

Pedro Duarte, André Coelho, Francisco Ribeiro, Filipe B. Teixeira, Luís Pessoa, Manuel Ricardo

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出基于视觉的智能控制框架,通过融合视觉与无线数据,利用深度Q网络控制移动gNB位置,实验表明可减少75%的视线阻断时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18064 2026-03-20 cs.ET 50%

A vision for a colorectal digital twin that enables proactive and personalized disease management

结直肠数字孪生的愿景:助力前瞻性与个性化疾病管理

Sayed Chhattan Shah, Andrea Townsend-Nicholson, Spiros Denaxas, Pablo Lamata, Manish Chand

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出结直肠数字孪生的概念框架,整合多模态数据与混合模型,支持连续监测和个性化管理,解决传统诊疗方式的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏