arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-24 至 2026-06-24 共收录 75 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 10 篇

2509.14001 2026-06-24 cs.CV cs.AI cs.LG 版本更新 84%

MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment

MOCHA: 多模态对象感知的跨架构对齐

Elena Camuffo, Francesco Barbato, Mete Ozay, Simone Milani, Umberto Michieli

机构 * University of Padova(帕多瓦大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出MOCHA蒸馏框架,将冻结VLM教师的多模态区域知识迁移至轻量视觉检测器,通过双重损失实现局部对齐与全局关系一致性,在少样本个性化检测中平均提升10.1%。

Comments 18 pages main paper, 10 pages supplementary material

Journal ref Proceedings of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23888 2026-06-24 eess.IV cs.AI cs.CV 新提交 81%

E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

E-MRL: 跨视图对齐的证据驱动多模态强化学习用于可靠的3D肿瘤分析

Sijing Li, Zhongwei Qiu, Zhuoya Wang, Boxiang Yun, Zhenyu Yi, Jianwei Xu, Wenqiao Zhang, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(华平实验室) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出跨视图对齐的证据驱动多模态强化学习框架E-MRL,通过将生成过程建模为“诊断-定位-验证”的马尔可夫决策过程,并引入跨视图一致性奖励,减少视觉幻觉并提升3D CT肿瘤诊断准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16696 2026-06-24 cs.LG cs.AI cs.MM cs.SD 版本更新 81%

FISHER: A Foundation Model for Multi-Modal Industrial Signal Comprehensive Representation

FISHER:多模态工业信号综合表示的基础模型

Pingyi Fan, Anbai Jiang, Shuwei Zhang, Xinhu Zheng, Zhiqiang Lv, Bing Han, Wenrui Liang, Junjie Li, Wei-Qiang Zhang, Yanmin Qian, Xie Chen, Jia Liu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学智能感知与机器人研究院) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Huakong AI Plus Company Limited(华冠AIplus有限公司) Didi International Business Group(滴滴国际商务集团)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI、cs.MM

AI总结 针对工业信号分析中的数据异质性(M5问题),提出FISHER基础模型,采用子带建模处理多采样率问题,通过教师-学生自蒸馏预训练,在19个数据集上以较小规模超越24个SOTA编码器。

Comments Accepted by IEEE TII. FISHER open-sourced on https://github.com/jianganbai/FISHER . RMIS open-sourced on https://jianganbai.github.io/RMIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24156 2026-06-24 cs.CV 新提交 79%

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

利用先验校正的令牌缩减加速多模态大语言模型

Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出PriorTR方法,通过分离任务条件注意力与模型先验注意力,在单次前向传播中估计先验并校正令牌重要性,实现无训练令牌缩减,提升多模态大语言模型效率与准确性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24092 2026-06-24 cs.CV 新提交 57%

Progressive Pixel-Neighborhood Deformable Cross-Attention for Multispectral Object Detection

渐进式像素邻域可变形交叉注意力用于多光谱目标检测

Tian Qiu, Jifeng Shen, Xin Zuo

机构 * School of Electrical and Information Engineering, Jiangsu University(江苏大学电气与信息工程学院) School of Computer Science and Engineering, Jiangsu University of Science and Technology(江苏科技大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出PNAFusion,通过像素邻域交叉注意力和自适应可变形对齐模块,渐进式优化多光谱特征融合,在多个数据集上达到高精度并降低计算开销。

Comments Accepted by Sensors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23724 2026-06-24 cs.IR cs.CL cs.HC 新提交 57%

EvidenceLens: A Claim-Evidence Matrix for Auditing Financial Question Answering

EvidenceLens: 用于审计金融问答的声明-证据矩阵

Fengchen Gu, Xiaotian Ren, Zhengyong Jiang, Zhilu Zhang, Ángel F. García-Fernández, Angelos Stefanidis, Mian Zhou, Huakang Li, Jionglong Su

机构 * 1 School of AI Advanced Computing, XJTLU Entrepreneur College (Taicang), Xi’an Jiaotong-Liverpool University, Suzhou, Jiangsu, China 2 ETSI de Telecomunicaci\' o n, Universidad Polit\' e cnica de Madrid, Madrid, Spain IEEE VIS 2026 conditionally accepted version

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 提出EvidenceLens,一种将金融问答视为声明-证据对齐问题的可视化分析工具,通过多模态声明-证据矩阵揭示覆盖、矛盾与模态不平衡,帮助分析师区分有依据的声明与过度自信的综合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21690 2026-06-24 cs.CR cs.CL cs.LG 新提交 57%

A Hybrid, Multi-Layered Pipeline for Phishing and Threat Classification: Independently Validated URL and NLP Engines with a Calibrated Multi-Channel Fusion Stage

用于钓鱼和威胁分类的混合多层管道:独立验证的URL和NLP引擎与校准的多通道融合阶段

Saifelden M. Ismail, Aser O. Ibrahim, Omar A. Mahmoud

机构 * Department of Communications and Information Engineering(通讯与信息工程系) Zewail City of Science and Technology(泽瓦尔科学与技术城)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 提出一种混合管道,分别对URL和文本模态使用独立引擎评分并融合结果,在10,677封邮件基准测试中达到F1=0.914,并将真实垃圾邮件误报率降至3.6%。

Comments Graduation project, Zewail City of Science and Technology. Code and documentation: https://github.com/XHCFS/cybersiren. Whole-system fusion results use proxy URL and header channels; treat integrated metrics as preliminary

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01554 2026-06-24 cs.RO 50%

L2M-Calib: One-key Calibration Method for LiDAR and Multiple Magnetic Sensors

L2M-Calib:一种用于激光雷达和多种磁传感器的单键校准方法

Qiyang Lyu, Wei Wang, Zhenyu Wu, Hongming Shen, Huiqin Zhou, Danwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出L2M-Calib方法,通过联合估计激光雷达与磁传感器间的外参和磁传感器的内畸变参数,实现多模态传感器融合的高效校准。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 7 篇

2606.23717 2026-06-24 eess.IV 新提交 78%

SpaCE: Rethinking Spatial Capacity and Generalization in Multi-Frame Multimodal Large Language Models

SpaCE: 重新思考多帧多模态大语言模型中的空间容量与泛化能力

Mariana Costa, Camila Ferreira, Alberlucia Rafael Soarez, Alejandro Torres

专题命中 其他多模态 :multimodal(title);multi-modal(abstract)

AI总结 提出SpaCE理论框架,证明多帧空间推理的信息论上界、样本复杂度界、PAC-Bayes泛化界,并刻画显式3D表示与隐式推理的偏差-方差权衡,在多个基准上验证了理论紧致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24350 2026-06-24 cs.RO 新提交 78%

SlipSense: Multimodal Sensing for Online Slip Detection in Legged Robots

SlipSense: 用于足式机器人在线滑移检测的多模态传感

Iris Szu-Yao Liu, Chien Chern Cheah, Meng Yee Michael Chuah

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Institute for Infocomm Research, Agency for Science Technology and Research(资讯通信研究院,科技研究局)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出SlipSense框架,通过定制轻量化传感器足和LSTM模型,实现四足机器人基于力的在线滑移检测,早期滑移检测精度达24.1mm,准确率85.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23771 2026-06-24 eess.SP cs.AI 新提交 57%

Integrated Sensing and Communications for Real-time Avatar Control in XR over 5G

面向5G上XR中实时化身控制的集成感知与通信

Nabeel Nisar Bhat, Javad Sameri, Rreze Halili, Rafael Berkvens, Maria Torres Vega, Jeroen Famaey

机构 * IDLab, University of Antwerp - imec(ID实验室,安特卫普大学 - imec) IDLab, Ghent University - imec(ID实验室,根特大学 - imec) Lighting Technology Lab, KU Leuven(照明技术实验室,鲁汶大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出结合5G毫米波ISAC与表面肌电信号的多模态感知架构,实现从身体到手指的多尺度手势识别,支持XR实时化身控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25322 2026-06-24 cs.CV 版本更新 57%

Quantifying mandibular positioning error and simulated temporomandibular joint-space changes in patient-specific occlusal splints

咬合定位夹板对颞下颌关节状况定量影响的评估

Agnieszka Anna Tomaka, Krzysztof Domino, Michał Tarnawski, Dariusz Pojda

机构 * Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(波兰科学院理论与应用信息研究所)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种利用咬合定位夹板分析颞下颌关节配置的计算方法,通过多模态数据建模夹板作为下颌的刚体变换,评估定位精度并模拟关节空间变化。

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24753 2026-06-24 physics.app-ph 新提交 50%

Material identification using laboratory X-ray beam tracking: quantitativeness and signal-to-noise ratio requirements

利用实验室X射线束追踪进行材料识别:定量性与信噪比要求

Sumera Rehman, Ashkan Ajeer, Connor Darling, Marco Endrizzi, Alessandro Olivo, Silvia Cipiccia

专题命中 其他多模态 :multimodal(abstract)

AI总结 提出基于单色X射线束追踪(XBT)的多模态成像方法,通过同时获取吸收和相位信息实现材料区分,并研究信噪比对定量性和元素识别的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15460 2026-06-24 cs.HC cs.CY 新提交 50%

"ChatGPT, help me draft a breakup text": The Covert Triad and Articulation Labor in AI-Assisted Romantic Communication

“ChatGPT,帮我起草分手短信”:AI辅助浪漫沟通中的隐蔽三角与表达劳动

Skyler Wang, Isabella Luppi

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究AI作为人类浪漫沟通中介的现象,提出“隐蔽三角”和“表达劳动”概念,揭示AI介入导致真实性从语言作者转向情感所有权的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22309 2026-06-24 cs.HC cs.CY 50%

GPT-4o reads the mind in the eyes

GPT-4o解读他人眼神

James W. A. Strachan, Oriana Pansardi, Eugenio Scaliti, Marco Celotto, Krati Saxena, Chunzhi Yi, Fabio Manzi, Alessandro Rufo, Guido Manzi, Michael S. A. Graziano, Stefano Panzeri, Cristina Becchio

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究探讨GPT-4o在解读面部情绪与心理状态的能力,发现其在直立面孔上表现优于人类,但在倒置面孔上表现欠佳,且对白人面孔的解读更准确。

详情

展开后加载摘要…

URL PDF HTML 收藏