arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6897 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6897 篇

2005.01935 2020-11-03 cs.RO cs.AI cs.LG cs.SY eess.SY 74%

Probabilistic End-to-End Vehicle Navigation in Complex Dynamic Environments with Multimodal Sensor Fusion

Peide Cai, Sukai Wang, Yuxiang Sun, Ming Liu

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.AI

Comments 8 pages, 6 figures, 3 tables. IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.10991 2020-10-13 eess.AS cs.HC cs.LG stat.ML 74%

Attention Driven Fusion for Multi-Modal Emotion Recognition

Darshana Priyasad, Tharindu Fernando, Simon Denman, Clinton Fookes, Sridha Sridharan

专题命中 多模态训练与对齐 :multi-modal(title);分类 eess.AS

Comments An updated version of the ICASSP 2020 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.16607 2020-07-01 cs.NE cs.CV cs.LG 74%

A Framework for Learning Invariant Physical Relations in Multimodal Sensory Processing

Du Xiaorui, Yavuzhan Erdem, Immanuel Schweizer, Cristian Axenie

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.10738 2020-06-23 cs.CV 74%

Non-linear and Selective Fusion of Cross-Modal Images

Aiqing Fang, Xinbo Zhao, Jiaqi Yang, Yanning Zhang

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.08577 2020-06-23 cs.CV cs.IT cs.LG math.IT 74%

A Cross-Modal Image Fusion Method Guided by Human Visual Characteristics

Aiqing Fang, Xinbo Zhao, Jiaqi Yang, Yanning Zhang

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.06156 2020-04-10 cs.CV cs.RO 74%

Gimme Signals: Discriminative signal encoding for multimodal activity recognition

Raphael Memmesheimer, Nick Theisen, Dietrich Paulus

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

Comments 8 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.01131 2020-03-31 cs.CL cs.SI 74%

See and Read: Detecting Depression Symptoms in Higher Education Students Using Multimodal Social Media Data

Paulo Mann, Aline Paes, Elton H. Matsushima

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CL

Comments This article was accepted (15 November 2019) and will appear in the proceedings of ICWSM 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.07753 2020-02-21 cs.CV 74%

Multimodal feature fusion for CNN-based gait recognition: an empirical comparison

Francisco Manuel Castro, Manuel Jesús Marín-Jiménez, Nicolás Guil, Nicolás Pérez de la Blanca

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:1603.01006

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.00216 2020-02-04 cs.RO cs.CV 74%

Leveraging Uncertainties for Deep Multi-modal Object Detection in Autonomous Driving

Di Feng, Yifan Cao, Lars Rosenbaum, Fabian Timm, Klaus Dietmayer

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.10718 2019-12-24 cs.CV 74%

Cross-Modal Image Fusion Theory Guided by Subjective Visual Attention

Aiqing Fang, Xinbo Zhao, Yanning Zhang

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.08487 2019-12-20 cs.CV cs.RO 74%

FuseSeg: LiDAR Point Cloud Segmentation Fusing Multi-Modal Data

Georg Krispel, Michael Opitz, Georg Waltner, Horst Possegger, Horst Bischof

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

Comments Accepted for publication in WACV 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.11714 2019-09-02 cs.CV 74%

Multi-Modal Fusion for End-to-End RGB-T Tracking

Lichao Zhang, Martin Danelljan, Abel Gonzalez-Garcia, Joost van de Weijer, Fahad Shahbaz Khan

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

Comments Accepted at ICCVW (VOT) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.07754 2019-05-21 cs.CV cs.LG 74%

Multimodal 3D Object Detection from Simulated Pretraining

Åsmund Brekke, Fredrik Vatsendvik, Frank Lindseth

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

Comments 12 pages, part of proceedings for the NAIS 2019 symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.10796 2019-03-07 cs.CV cs.CY 74%

Dynamic Deep Multi-modal Fusion for Image Privacy Prediction

Ashwini Tonge, Cornelia Caragea

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

Comments Accepted by The Web Conference (WWW) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.11155 2017-12-01 cs.CV 74%

Predicting Depression Severity by Multi-Modal Feature Engineering and Fusion

Aven Samareh, Yan Jin, Zhangyang Wang, Xiangyu Chang, Shuai Huang

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

Comments Thirty-Second AAAI Conference on Artificial Intelligence (AAAI-18)

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.10422 2017-11-02 cs.RO cs.AI cs.LG 74%

Learning End-to-end Multimodal Sensor Policies for Autonomous Navigation

Guan-Horng Liu, Avinash Siravuru, Sai Prabhakar, Manuela Veloso, George Kantor

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.AI

Comments to be published in Conference on Robot Learning (CoRL), 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.01266 2017-04-06 cs.CV cs.CY cs.HC 74%

Supporting Navigation of Outdoor Shopping Complexes for Visually-impaired Users through Multi-modal Data Fusion

Archana Paladugu, Parag S. Chandakkar, Peng Zhang, Baoxin Li

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

Comments ICME 2013

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.04117 2016-03-15 cs.CV 74%

Multi-modal Tracking for Object based SLAM

Prateek Singhal, Ruffin White, Henrik Christensen

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

Comments Submitted to IROS 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06411 2026-08-10 cs.AI cs.CV 新提交 73%

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

学习在多模态大语言模型(MLLMs)中预测中间层注意力以进行视觉token剪枝

Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对MLLMs视觉token剪枝的固定层非最优及计算成本高的问题,提出MAP方法,实现仅保留5.56%视觉token时维持97.5%性能,获3.09倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03247 2026-08-05 cs.CV cs.CL 新提交 73%

CIGTSurv: Clinical Information Guided Tri-modal Survival Prediction with Local Prototype Association and Global Feature Alignment

CIGTSurv:结合局部原型关联与全局特征对齐的临床信息引导三模态生存预测

Jing Dai, Qibin Zhang, Weiwei Zhou, Mingde Xu, Jingsong Liu, Jingdong Zhang, Hongming Xu

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究针对临床信息未充分利用及多模态异质性问题,提出CIGTSurv框架,结合局部原型关联与全局特征对齐机制,在五个TCGA癌症队列上取得生存预测SOTA性能。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22712 2026-07-29 cs.CV cs.AI physics.optics 版本更新 73%

scMIR: a vision-language foundation model for single-cell light microscopy image representation

scMIR:用于单细胞光学显微镜图像表示的视觉语言基础模型

Yifan Shang, Jiahui Tan, Xiangxiang Zeng, Renjie Zhou

专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究针对单细胞光学显微镜图像分析难题,提出scMIR模型,通过自监督图像重建与文本引导跨模态对齐,在多图像文本对上预训练,在多种复杂任务中表现出色,优于现有方法,具备强泛化能力,能推动高通量表型分析工作流程标准化和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09481 2026-07-13 cs.CV cs.AI 新提交 73%

Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation

用于文本引导医学分割的骨干网络与语言引导解耦

Yungeng Liu, Xuanzi Fang, Haijin Zeng, Qi Dai, Yongyong Chen

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) NingBo No.2 Hospital(宁波第二医院)

专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究针对文本引导医学分割中模型组件紧密耦合问题,提出可转移骨干层次适配器框架BTHA,通过稳定特征级接口、分层监督策略和自适应门控语义引导适配器,有效提升分割效果且计算开销适度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06620 2026-07-09 cs.CV cs.AI 新提交 73%

SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

SpaR3D-MoE:来自稀疏视图的自适应3D空间推理与几何归纳专家混合模型

Haida Feng, Hao Wei, Haolin Wang, Shiwei Li, Chade Li, Yihong Wu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) YUKUN Intelligent World(宇琨智能世界)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型在2D与3D表征差距问题,提出SpaR3D-MoE框架,通过自适应时空采样和几何归纳专家混合模型,从稀疏RGB输入实现自适应空间推理,在多个实验中取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02484 2026-07-03 cs.CV cs.AI 新提交 73%

Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning

对抗文本噪声与冗余:熵感知的密集视觉令牌剪枝

Xuehui Wang, Xuankun Yang, Wei Shen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出熵感知密集剪枝(EADP)框架,通过熵过滤文本噪声并利用子模最大化选择令牌,在严格预算下保留细粒度视觉线索,提升VLM精度-效率权衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00296 2026-07-02 cs.CV cs.AI 新提交 73%

Learning When to Listen: Gated Affect Fusion for Human Motion Prediction

学习何时倾听:用于人体运动预测的门控情感融合

Jingni Huang

机构 * University of Oxford(牛津大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出门控情感变换器(GAT)动态调节跨模态信息流,解决无约束视频中情感特征与姿态融合的噪声问题,证明面部情感仅在短中期(如30帧)提供有限预测线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31310 2026-07-01 cs.CL cs.MM 新提交 73%

LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment

LOPA:通过潜在序数原型对齐增强口语评估

Hong-Yun Lin, Fu-An Chao, Bi-Cheng Yan, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL、cs.MM

AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05963 2026-06-23 cs.CV cs.AI 版本更新 73%

Skeleton-to-Image Encoding: Enabling Skeleton Representation Learning via Vision-Pretrained Models

骨架到图像编码:通过视觉预训练模型实现骨架表示学习

Siyuan Yang, Jun Liu, Hao Cheng, Chong Wang, Shijian Lu, Hedvig Kjellstrom, Weisi Lin, Alex C. Kot

机构 * KTH Royal Institute of Technology(皇家理工学院) Lancaster University(兰卡斯特大学) Hebei University of Technology(河北工业大学) Nanyang Technological University(南洋理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) VinUniversity(文大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出S2I编码,将骨架序列转换为图像状数据,首次利用视觉预训练模型进行自监督骨架表示学习,统一异构骨架格式,在多个数据集上验证了有效性。

Comments Submitted to IJCV, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16234 2026-06-16 cs.CV cs.AI 新提交 73%

Propagating Structural Guidance: Synthesizing Fluorescein Angiography from Fundus Images and Sparse OCT Scans

传播结构引导:从眼底图像和稀疏OCT扫描合成荧光素血管造影

Tengfei Ma, Ruiqi Wu, Chenran Zhang, Ye Geng, Na Su, Xiangyuan Duanmu, Tao Zhou, Yi Zhou, Wen Fan

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室) Tianyuan Honors School, Nanjing Medical University(南京医科大学天元荣誉学院) Nanjing University of Science and Technology(南京理工大学) Department of Ophthalmology, The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院眼科)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出从彩色眼底照片(CFP)和稀疏OCT扫描合成荧光素血管造影(FFA)的框架,通过空间对齐跨模态融合和令牌级对比学习,实现非侵入性FFA合成,提升下游诊断性能。

Comments Accepted to MICCAI 2026 (Early Accept)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16158 2026-06-16 cs.CV cs.CL 新提交 73%

Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding

必要时聚焦:用于无训练视觉定位的自适应路由与协作定位

Yifan Wang, Peiming Li, Shiyu Li, Zhiyuan Hu, Xiaochen Yang, Wenming Yang, Yang Tang, Zheng Wei

机构 * East China University of Science and Technology(华东理工大学) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出LazyMCoT动态框架,通过自适应路由评估不确定性,对简单查询跳过处理,对困难样本利用协作定位模块进行两阶段精炼,在提升推理精度的同时降低平均推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04976 2026-06-15 cs.CV cs.AI 版本更新 73%

3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding

3D-RFT:基于视频的3D场景理解的强化微调

Xiongkun Linghu, Jiangyong Huang, Baoxiong Jia, Siyuan Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 提出3D-RFT框架,将可验证奖励的强化学习(RLVR)扩展到视频3D感知与推理,通过直接优化评估指标(如3D IoU和F1分数)提升性能,4B模型超越8B模型。

Comments Accepted at ICML 2026. Project page: https://3d-rft.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏