arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6897 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6897 篇

2511.16216 2026-03-31 cs.AI cs.LG 74%

FlipVQA: Scaling Multi-modal Instruction Tuning via Textbook-to-Knowledge Synthesis

FlipVQA: 通过教科书到知识合成实现多模态指令微调的扩展

Zhen Hao Wong, Jingwen Deng, Yuzhao Wang, Wenkai Yu, Jihao Huang, Runming He, Chengyu Shen, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.AI

AI总结 本文提出FlipVQA-Miner自动化流程,解决OCR文档中的长距离逻辑依赖和跨页断续问题,构建了包含83K问答对的FlipVQA-83K数据集,在保持高结构保真度的同时节省50倍成本,提升了模型推理能力和跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11770 2026-03-27 cs.CL cs.CY cs.SI 74%

The Value of Nothing: Multimodal Extraction of Human Values Expressed by TikTok Influencers

nothing的价值:通过TikTok影响者表达的人类价值观多模态提取

Alina Starovolsky-Shitrit, Alon Neduva, Naama Appel Doron, Itamar Gafni, Ella Daniel, Oren Tsur

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CL

AI总结 本文研究通过TikTok影响者上传的视频提取隐含价值观,采用两阶段方法优于直接提取,使用少量样本的大语言模型在两个阶段表现更优,首次公开TikTok视频价值观标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06186 2026-03-09 cs.CV 74%

SpaCRD: Multimodal Deep Fusion of Histology and Spatial Transcriptomics for Cancer Region Detection

SpaCRD:多模态深度融合组织学与空间转录组学用于癌症区域检测

Shuailin Xue, Jun Wan, Lihua Zhang, Wenwen Min

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 SpaCRD通过多模态深度融合组织学与空间转录组学数据,实现跨样本、平台和批次的癌症区域检测,优于现有八种方法。

Comments Accepted by AAAI-2026-Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02250 2026-03-04 cs.SD eess.AS 74%

SGPA: Spectrogram-Guided Phonetic Alignment for Feasible Shapley Value Explanations in Multimodal Large Language Models

SGPA: 基于频谱的语音对齐用于多模态大语言模型中可行的谢普利值解释

Paweł Pozorski, Jakub Muszyński, Maria Ganzha

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 多模态训练与对齐 :multimodal(title);分类 eess.AS

AI总结 SGPA通过结合连接主义时间分类和频谱边界细化,实现了多模态大语言模型中可行的音频解释,显著减少了模型评估次数并保持了全局轮廓。

Comments Submitted for admission in Interspeech 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01210 2026-03-03 cs.CV cs.RO 74%

OmniVLA: Physically-Grounded Multimodal VLA with Unified Multi-Sensor Perception for Robotic Manipulation

OmniVLA:具有统一多传感器感知的物理基础多模态VLA

Heyu Guo, Shanmu Wang, Ruichun Ma, Shiqi Jiang, Yasaman Ghasempour, Omid Abari, Baining Guo, Lili Qiu

机构 * Princeton University(普林斯顿大学) University of California, Los Angeles(加州大学洛杉矶分校) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 OmniVLA通过整合多种传感器模态,提升机器人操作的感知能力与任务成功率。

Comments Accepted by ICRA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18632 2026-02-25 cs.CV 74%

Decouple, Reorganize, and Fuse: A Multimodal Framework for Cancer Survival Prediction

解耦、重组与融合:一种多模态框架用于癌症生存预测

Huayi Wang, Haochao Ying, Yuyang Xu, Qibo Qiu, Cheng Zhang, Danny Z. Chen, Ying Sun, Jian Wu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Transvascular Implantation Devices of the Second Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第二附属医院血管植入设备国家重点实验室) Transvascular Implantation Devices Research Institute(血管植入设备研究院) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室) China Mobile (Zhejiang) Research & Innovation Institute(中国移动(浙江)研究院)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 本文提出DeReF框架,通过解耦-重组-融合策略提升多模态癌症生存预测的准确性与泛化能力。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09541 2026-02-11 cs.CV 74%

Scalpel: Fine-Grained Alignment of Attention Activation Manifolds via Mixture Gaussian Bridges to Mitigate Multimodal Hallucination

Scalpel: 通过混合高斯桥梁实现细粒度注意力激活流形对齐以缓解多模态幻觉

Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata

机构 * Fujitsu Research & Development Center Co.,LTD.(Fujitsu 研究与开发中心有限公司) Fujitsu Limited(Fujitsu 有限公司)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 Scalpel通过高斯混合模型和熵最优传输减少多模态幻觉,实现注意力激活流形的细粒度对齐,提升视觉-语言模型的输出一致性。

Comments WACV 2026 (It was accepted in the first round, with an acceptance rate of 6%.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09578 2026-01-15 cs.RO cs.CV 74%

Multimodal Signal Processing For Thermo-Visible-Lidar Fusion In Real-time 3D Semantic Mapping

多模态信号处理用于热-可见-激光雷达融合的实时3D语义制图

Jiajun Sun, Yangyi Ou, Haoyuan Zheng, Chao yang, Yue Ma

机构 * College of Mechatronics and Control Engineering, Shenzhen University(深圳大学机械与控制工程学院) School of Robotics, Xi’an-Jiaotong Liverpool University(西安交通大学利物浦大学机器人学院)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 本文提出通过多模态信号处理融合热、可见和激光雷达数据,提升实时3D语义制图的精度与语义理解能力,适用于灾害评估和工业维护等场景。

Comments 5 pages,7 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20892 2025-12-25 cs.CV 74%

Beyond Weight Adaptation: Feature-Space Domain Injection for Cross-Modal Ship Re-Identification

超越权重适应:基于特征空间的域注入用于跨模态船舶重识别

Tingfeng Xian, Wenlve Zhou, Zhiheng Zhou, Zhelin Li

机构 * School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) Key Laboratory of Big Data and Intelligent Robot, Ministry of Education, South China University of Technology(大数据与智能机器人教育部重点实验室)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

AI总结 本文提出基于特征空间的域注入方法,解决跨模态船舶重识别中的模态差异问题,通过轻量级模型提升性能,实现SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20561 2025-12-24 cs.CV 74%

FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models

FlashVLM: 大规模多模态模型中的文本引导视觉令牌选择

Kaitong Cai, Jusheng Zhang, Jing Yang, Yijia Fan, Pengtao Xie, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of California, San Diego(加州大学圣地亚哥分校) Snap Inc.(Snap公司)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 FlashVLM通过文本引导的视觉令牌选择,实现了高效压缩和高准确率,在大规模多模态模型中表现出色。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02972 2025-12-03 cs.CV cs.RO 74%

BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection

BEVDilation:以LiDAR为中心的多模态融合用于3D目标检测

Guowen Zhang, Chenhang He, Liyi Chen, Lei Zhang

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

AI总结 BEVDilation提出以LiDAR为中心的多模态融合方法,通过稀疏体素扩张和语义引导BEV扩张模块提升3D目标检测性能,有效缓解深度误差带来的空间错位问题。

Comments Accept by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11706 2025-11-21 cs.LG cs.CV 74%

Context-Aware Multimodal Representation Learning for Spatio-Temporally Explicit Environmental Modelling

面向情境的多模态表示学习用于时空明确的环境建模

Julia Peters, Karin Mora, Miguel D. Mahecha, Chaonan Ji, David Montero, Clemens Mosig, Guido Kraemer

机构 * Environmental Data Science and Remote Sensing Group(环境数据科学与遥感小组) Institute for Earth System Science and Remote Sensing(地球系统科学与遥感研究所) Leipzig University(莱比锡大学) German Centre for Integrative Biodiversity Research (iDiv)(整合生物多样性研究德国中心(iDiv))

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 本文提出一种面向情境的多模态表示学习框架,整合不同地球观测模态以高时空分辨率建模环境,提升生态分析的精度与效率。

Comments 10 pages (incliding 2 pages of references), 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15139 2025-11-20 q-bio.GN cs.AI cs.LG 74%

CASPER: Cross-modal Alignment of Spatial and single-cell Profiles for Expression Recovery

Amit Kumar, Maninder Kaur, Raghvendra Mall, Sukrit Gupta

机构 * Department of Computer Science \& Engineering, Indian Institute of Technology Ropar, India Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar. Department of Biomedical Engineering, Indian Institute of Technology Ropar, India

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13076 2025-10-16 cs.CV 74%

Hints of Prompt: Enhancing Visual Representation for Multimodal LLMs in Autonomous Driving

Hao Zhou, Zhanning Gao, Zhili Chen, Maosheng Ye, Qifeng Chen, Tongyi Cao, Honggang Qi

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00419 2025-09-03 cs.CV 74%

LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression

Lianyu Hu, Fanhua Shang, Wei Feng, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16224 2025-08-28 cs.CV 74%

LDRFusion: A LiDAR-Dominant multimodal refinement framework for 3D object detection

Jijun Wang, Yan Wu, Yujian Mo, Junqiao Zhao, Jun Yan, Yinghao Hu

机构 * School of Computer Science and Technology, Tongji University, Shanghai 201804, China(计算机科学与技术学院,同济大学,上海) School of Electronics and Information Engineering, Tongji University, Shanghai 201804, China(电子信息工程学院,同济大学,上海)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16873 2025-08-20 cs.CV 74%

ContrastAlign: Toward Robust BEV Feature Alignment via Contrastive Learning for Multi-Modal 3D Object Detection

Ziying Song, Hongyu Pan, Feiyang Jia, Yongchang Zhang, Lin Liu, Lei Yang, Shaoqing Xu, Peiliang Wu, Caiyan Jia, Zheng Zhang, Yadan Luo

机构 * School of Computer Science & Technology, Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, Beijing Jiaotong University(计算机科学与技术学院,北京交通大数据挖掘与具身智能重点实验室,北京交通大学) Horizon Robotics Nanyang Technological University(南洋理工大学) University of Macau(澳门大学) School of Information Science and Engineering, Yanshan University(信息科学与工程学院,燕山大学) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨理工大学) School of Information Technology and Electrical Engineering, The University of Queensland(信息技术与电气工程学院,昆士兰大学)

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21121 2025-06-27 cs.CV cs.RO 74%

GoIRL: Graph-Oriented Inverse Reinforcement Learning for Multimodal Trajectory Prediction

Muleilan Pei, Shaoshuai Shi, Lu Zhang, Peiliang Li, Shaojie Shen

机构 * Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology, Hong Kong, China(香港理工大学电子与计算机工程系) Voyager Research, Didi Chuxing, China(维杰研究,滴滴出行,中国) Zhuoyu Technology Co., Ltd., Shenzhen, China(珠宇科技有限公司,深圳,中国)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03494 2025-05-07 cs.CV 74%

UPMAD-Net: A Brain Tumor Segmentation Network with Uncertainty Guidance and Adaptive Multimodal Feature Fusion

Zhanyuan Jia, Ni Yao, Danyang Sun, Chuang Han, Yanting Li, Jiaofen Nan, Fubao Zhu, Chen Zhao, Weihua Zhou

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03284 2025-05-07 cs.CV cs.RO 74%

OccCylindrical: Multi-Modal Fusion with Cylindrical Representation for 3D Semantic Occupancy Prediction

Zhenxing Ming, Julie Stephany Berrio, Mao Shan, Yaoqi Huang, Hongyu Lyu, Nguyen Hoang Khoi Tran, Tzu-Yun Tseng, Stewart Worrall

机构 * Australian Centre for Robotics (ACFR) at the University of Sydney(澳大利亚机器人中心(ACFR)于悉尼大学)

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19271 2025-04-29 cs.CV 74%

Leveraging Multi-Modal Saliency and Fusion for Gaze Target Detection

Athul M. Mathew, Arshad Ali Khan, Thariq Khalid, Faroq AL-Tam, Riad Souissi

机构 * Elm Company(埃尔姆公司)

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

Comments accepted at NeurIPS 2023 Gaze Meets ML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22285 2025-03-31 cs.CV 74%

RUNA: Object-level Out-of-Distribution Detection via Regional Uncertainty Alignment of Multimodal Representations

Bin Zhang, Jinggang Chen, Xiaoyang Qu, Guokuan Li, Kai Lu, Jiguang Wan, Jing Xiao, Jianzong Wang

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11409 2025-03-17 cs.CV cs.RO 74%

LuSeg: Efficient Negative and Positive Obstacles Segmentation via Contrast-Driven Multi-Modal Feature Fusion on the Lunar

Shuaifeng Jiao, Zhiwen Zeng, Zhuoqun Su, Xieyuanli Chen, Zongtan Zhou, Huimin Lu

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11848 2025-03-14 cs.CV 74%

GraphBEV: Towards Robust BEV Feature Alignment for Multi-Modal 3D Object Detection

Ziying Song, Lei Yang, Shaoqing Xu, Lin Liu, Dongyang Xu, Caiyan Jia, Feiyang Jia, Li Wang

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16284 2025-02-27 cs.LG cs.AI cs.CE physics.chem-ph 74%

MolSpectra: Pre-training 3D Molecular Representation with Multi-modal Energy Spectra

Liang Wang, Shaozhen Liu, Yu Rong, Deli Zhao, Qiang Liu, Shu Wu, Liang Wang

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.AI

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14063 2025-02-25 cs.CV 74%

PedDet: Adaptive Spectral Optimization for Multimodal Pedestrian Detection

Rui Zhao, Zeyu Zhang, Yi Xu, Yi Yao, Yan Huang, Wenxin Zhang, Zirui Song, Xiuying Chen, Yang Zhao

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14262 2025-02-24 cs.CV 74%

ZeroPS: High-quality Cross-modal Knowledge Transfer for Zero-Shot 3D Part Segmentation

Yuheng Xue, Nenglun Chen, Jun Liu, Wenyun Sun

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

Comments 2025 International Conference on 3D Vision (3DV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00665 2025-02-04 cs.CV 74%

Cross-Modal Synergies: Unveiling the Potential of Motion-Aware Fusion Networks in Handling Dynamic and Static ReID Scenarios

Fuxi Ling, Hongye Liu, Guoqiang Huang, Jing Li, Hong Wu, Zhihao Tang

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14164 2024-12-19 cs.CV 74%

MetaMorph: Multimodal Understanding and Generation via Instruction Tuning

Shengbang Tong, David Fan, Jiachen Zhu, Yunyang Xiong, Xinlei Chen, Koustuv Sinha, Michael Rabbat, Yann LeCun, Saining Xie, Zhuang Liu

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

Comments Project page at tsb0601.github.io/metamorph

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15838 2024-12-17 cs.CV 74%

MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity

Yangzhou Liu, Yue Cao, Zhangwei Gao, Weiyun Wang, Zhe Chen, Wenhai Wang, Hao Tian, Lewei Lu, Xizhou Zhu, Tong Lu, Yu Qiao, Jifeng Dai

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

Comments 18 pages, 8 figures, technical report

Journal ref Sci China Inf Sci, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏