arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-26 至 2026-03-26 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2603.24296 2026-03-26 cs.CV 89%

AMIF: Authorizable Medical Image Fusion Model with Built-in Authentication

AMIF:具有内置认证的可授权医学图像融合模型

Jie Song, Jun Jia, Wei Sun, Wangqiu Zhou, Tao Tan, Guangtao Zhai

机构 * Macao Polytechnic University(澳门理工学院) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Hefei University of Technology(合肥工业大学)

专题命中 通用Image Fusion :image fusion(title,abstract);medical image fusion(title,abstract);multimodal image fusion(abstract);分类 cs.CV

AI总结 本文提出AMIF,首个具有内置认证的医学图像融合模型,通过授权访问控制保护知识产权,防止推理泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 1 篇

2404.09622 2026-03-26 cs.RO cs.AI 70%

DIDLM: A SLAM Dataset for Difficult Scenarios Featuring Infrared, Depth Cameras, LIDAR, 4D Radar, and Others under Adverse Weather, Low Light Conditions, and Rough Roads

DIDLM:一种针对困难场景的SLAM数据集,包含红外、深度相机、LIDAR、4D雷达等,在恶劣天气、低光条件和粗糙路面下

Weisheng Gong, Chen He, Kaijie Su, Qingyong Li, Tong Wu, Z. Jane Wang

机构 * School of Information Science and Technology, Northwest University(信息科学与技术学院,西北大学) Department of Electrical and Computer Engineering, The University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学)

专题命中 红外-可见光融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.RO

AI总结 本文提出DIDLM数据集,包含红外、深度相机、LIDAR、4D雷达等多传感器数据,用于解决恶劣天气、低光和粗糙路面下的SLAM问题,提供GPS/INS地面真实数据,支持自动驾驶和地面机器人应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 遥感融合与全色锐化 1 篇

2603.24109 2026-03-26 eess.IV cs.AI cs.CV 62%

Comparative analysis of dual-form networks for live land monitoring using multi-modal satellite image time series

多模态卫星图像时间序列用于实时土地监测的双形式网络比较分析

Iris Dumeur, Jérémy Anger, Gabriele Facciolo

机构 * 1 Kayrros SAS 2 Universit\'e Paris-Saclay, ENS Paris-Saclay, CNRS, Centre Borelli, 91190, Gif-sur-Yvette, France 3 Institut Universitaire de France

专题命中 遥感融合与全色锐化 :sensor fusion(abstract);分类 cs.CV、eess.IV

AI总结 本文研究了双形式注意力机制以提升多模态SITS分析效率,通过并行训练支持递归推理,针对时间不规则性和不一致性的挑战,提出基于实际获取日期计算token距离的方法,实验表明双形式机制在性能和效率上优于标准Transformer。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人多传感器融合 1 篇

2603.12665 2026-03-26 cs.RO 57%

TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation

TacVLA: 基于接触感知的触觉融合用于鲁棒的视觉-语言-动作操控

Kaidi Zhang, Heng Zhang, Zhengtong Xu, Zhiyuan Zhang, Md Rakibul Islam Prince, Xiang Li, Xiaojing Han, Yuhao Zhou, Arash Ajoudani, Yu She

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia(人机交互实验室,意大利理工学院) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova(机器人与智能机器国家级博士项目(DRIM)和热那亚大学) Edwardson School of Industrial Engineering, Purdue University(工业工程学院,普渡大学)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO

AI总结 TacVLA通过引入触觉模态提升视觉-语言-动作操控的鲁棒性,采用接触感知门控机制实现多模态融合,实验显示在拆解、箱内拾取和视觉遮挡场景中性能提升显著。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 音视频/视觉语言融合 1 篇

2603.23673 2026-03-26 eess.AS cs.SD 50%

Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition

Crab:多层对比监督以提升在表演和自然语音条件下的语音情感识别

Lucas H. Ueda, João G. T. Lima, Paula D. P. Costa

机构 * Dept. of Computer Engineering and Automation (DCA), Faculdade de Engenharia Elétrica e de Computação(计算机工程与自动化系(DCA)、电气与计算机工程学院) AI Lab.(人工智能实验室) Institute of Computing, Universidade Estadual de Campinas, UNICAMP(计算学院,坎皮纳斯州立大学,UNICAMP)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出Crab模型,通过多层对比监督策略提升语音情感识别在表演和自然语音条件下的性能,采用跨模态Transformer架构和多任务对比学习,有效解决类别不平衡问题。

Comments IEEE Transactions on Affective Computing submission

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 融合架构与评测 2 篇

2603.23650 2026-03-26 cs.CV 74%

Foundation Model Embeddings Meet Blended Emotions: A Multimodal Fusion Approach for the BLEMORE Challenge

基础模型嵌入与混合情感:一种多模态融合方法用于BLEMORE挑战

Masoumeh Chapariniya, Aref Farhadipour, Sarah Ebling, Volker Dellwo, Teodora Vukovic

机构 * Department of Computational Linguistics, University of Zürich(苏黎世大学计算语言学系)

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV

AI总结 本文提出了一种多模态融合方法,结合六个编码器家族进行后期概率融合,通过选择冻结的Wav2Vec2的语调编码层和Gemini Embedding 2.0,提升了混合情感识别的性能,最终在测试集上获得0.279的分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23989 2026-03-26 cs.CL 50%

CoCR-RAG: Enhancing Retrieval-Augmented Generation in Web Q&A via Concept-oriented Context Reconstruction

CoCR-RAG:通过面向概念的上下文重建提升Web问答中的检索增强生成

Kaize Shi, Xueyao Sun, Qika Lin, Firoj Alam, Qing Li, Xiaohui Tao, Guandong Xu

机构 * University of Southern Queensland(昆士兰大学) University of Technology Sydney(新南威尔士大学) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Qatar Computing Research Institute(卡塔尔计算研究所) The Education University of Hong Kong(香港教育大学)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 本文提出CoCR-RAG框架,通过语言学基础的概念级整合解决多源信息融合问题,提升问答系统事实一致性与知识密度。

详情

展开后加载摘要…

URL PDF HTML 收藏