arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-05-26 至 2026-05-26 共收录 10 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 1 篇

2605.25775 2026-05-26 cs.CV 57%

DRFusion: Drift-Resilient Temporally Consistent Infrared-Visible Video Fusion

DRFusion: 抗漂移的时间一致红外-可见光视频融合

Xingyuan Li, Haoyuan Xu, Shulin Li, Xiang Chen, Zhiying Jiang, Jinyuan Liu

机构 * College of Computer Science Technology, Zhejiang University, Hangzhou, China School of Software Technology \& DUT-RU International School of ISE, Dalian University of Technology, Dalian, China College of Information Science Technology, Dalian Maritime University, Dalian, China

专题命中 红外-可见光融合 :infrared and visible(abstract);分类 cs.CV

AI总结 提出一种抗漂移的视频融合方法,将任务重构为历史条件运动生成,通过稳定历史引导和软时间锚定实现时间一致性,并采用解耦结构-运动适应策略,在融合质量和时间稳定性上达到最优。

Comments 11 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 遥感融合与全色锐化 2 篇

2605.24532 2026-05-26 cs.CV 57%

Image-Conditioned Instance Prompt Network for Referring Remote Sensing Image Segmentation

图像条件实例提示网络用于遥感图像指代分割

Biaoyu Ren, Qingsheng Wang, Cun Xu, Dingkang Yang, Wenxuan Wang

机构 * School of Computer Science, Northwestern Polytechnical University, Xi'an, China(西北工业大学计算机科学学院,西安,中国) College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai, China(复旦大学智能机器人与先进制造学院,上海,中国) Shenzhen Research Institute of Northwestern Polytechnical University, Shenzhen, China(西北工业大学深圳研究院,深圳,中国)

专题命中 遥感融合与全色锐化 :information fusion(abstract);分类 cs.CV

AI总结 提出图像条件实例提示网络(ICIPNet),通过自适应视觉语义表示和双边信息融合模块,缓解跨模态特征融合瓶颈,提升遥感图像指代分割性能。

Comments 6 pages, 3 figures. Equal contribution: Biaoyu Ren and Qingsheng Wang. Corresponding authors: Dingkang Yang and Wenxuan Wang

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24014 2026-05-26 cs.CV 57%

SkySeg: Collaborative Onboard Semantic Segmentation with Heterogeneous UAVs in the Wild

SkySeg: 野外异构无人机协同机载语义分割

Anqi Lu, Yun Cheng, Youbing Hu, Zhiqiang Cao, Jie Liu, Zhijun Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) ETH Zurich(苏黎世联邦理工学院) Huawei Cloud Algorithm Innovation Lab(华为云算法创新实验室)

专题命中 遥感融合与全色锐化 :information fusion(abstract);分类 cs.CV

AI总结 针对资源受限无人机在动态环境中实时语义分割的挑战,提出SkySeg异构多无人机空-空协作框架,结合高效信息融合推理与跨设备测试时自适应策略,实现低成本传感器下的机载分割,加速约3.6倍并提升精度5.91%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 2 篇

2605.25495 2026-05-26 cs.RO cs.CV 62%

RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation

RepSAM: 通过表示引导的适应连接基础模型与机器人视觉

Wenhui Chu

机构 * Department of Computer Science and Engineering, Texas A&M University(计算机科学与工程系,德克萨斯大学阿马尔科分校)

专题命中 机器人多传感器融合 :multi-modal fusion(abstract);分类 cs.CV、cs.RO

AI总结 针对基础模型在非结构化机器人视觉场景中性能下降的问题,提出RepSAM框架,通过CKA引导的秩分配策略和多模态融合模块实现参数高效微调,在减少158倍可训练参数的同时达到全微调97.9%的性能。

Comments Accepted to IJCAI-ECAI 2026 (Special Track on AI and Robotics). 8 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25239 2026-05-26 cs.RO eess.SP 62%

FusionCore: A 23-State Unscented Kalman Filter for IMU, Wheel Encoder, GPS, and Visual SLAM Fusion in ROS 2

FusionCore: 用于IMU、轮式编码器、GPS和视觉SLAM融合的23状态无迹卡尔曼滤波器(ROS 2)

Manan Kharwar

机构 * Independent Researcher(独立研究者)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 eess.SP、cs.RO

AI总结 提出FusionCore,一个基于23状态无迹卡尔曼滤波器的开源ROS 2传感器融合包,通过在线估计轮式编码器偏航率偏差、GPS ECEF原生处理、自适应噪声协方差和VSLAM位姿融合,在12个NCLT序列上比robot_localization取得更低的绝对轨迹误差。

Comments 8 pages, 4 figures, 2 tables. Source code: https://github.com/manankharwar/fusioncore (Apache 2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 1 篇

2601.21670 2026-05-26 cs.CV cs.LG 79%

Diverse via bounded Agreement: Geometric Regularization for Multimodal Fusion

通过有界一致性实现多样性:多模态融合的几何正则化

Zixuan Xia, Hao Wang, Pengcheng Weng, Yanyu Qian, Yangxin Xu, William Dan, Fei Wang

机构 * Department of Informatics University of Bern(伯尔尼大学信息学院) College of Computing and Data Science Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Software Engineering Xi’an Jiaotong University(西安交通大学软件工程学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 提出一种轻量级即插即用的几何正则化框架,通过有界一致性原则在保持模态特异多样性的同时约束跨模态漂移,提升多模态融合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 4 篇

2605.25409 2026-05-26 cs.CV 74%

MTLLFM: Multimodal-Temporal Laughter Localization: UR-FUNNY-Temporal and SMILE-Temporal Benchmarks with an Adaptive Multimodal Fusion Model

MTLLFM: 多模态时间笑声定位——UR-FUNNY-Temporal和SMILE-Temporal基准数据集与自适应多模态融合模型

Eyal Hanania, Nadav Kirsch, Daniel Arkushin, Jonathan Benvenisti, Amos Bercovich, Elie Zemmour, Sahar Froim

机构 * WSC-Sports(WSC-体育)

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV

AI总结 针对现有方法无法精确捕捉短暂笑声事件时间边界的问题,本文提出两个完全标注的时间笑声数据集(UR-FUNNY-Temporal和SMILE-Temporal)和一个轻量级弱监督框架,通过固定HuBERT和MAE编码器结合时间softmax池化与自适应模态门控,实现从片段级标签到帧级时间定位,在体育广播数据上达到99% F1和68.1%定位精度,并将下游笑声推理CIDEr提升227%。

Comments Accepted to the Workshop on Affective & Behavior Analysis in-the-wild, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25595 2026-05-26 cs.CV 57%

How Far Has AI Come in Liver Fibrosis Staging? A Large-Scale Real-World Dataset and Benchmark

AI在肝纤维化分期中取得了多大进展?大规模真实世界数据集与基准

Yuanye Liu, Nannan Shi, Zhejia Zhang, Hanxiao Zhang, Boya Wang, Derong Yu, Nao Wang, Yuxin Jin, Yang Zhou, Kunhao Yuan, Siqi Wang, Lida Yang, Xu Qiao, Wentao Liu, Xuelei He, Xin Hong, Guoyan Zheng, Xin Chen, Guang-Zhong Yang, Le Zhang, Lei Li, Yuxin Shi, Xiahai Zhuang

机构 * School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院) Department of Radiology, Shanghai Public Health Clinical Center, Fudan University, Shanghai, China(复旦大学上海公共卫生临床中心放射科) Department of Electrical and Computer Engineering, Northwestern University, Evanston, USA(西北大学电气与计算机工程系) Shanghai Key Laboratory of Flexible Medical Robotics, Tongren Hospital, Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(上海柔性医疗机器人重点实验室) School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学生物医学工程学院) School of Computer Science, University of Nottingham, Nottingham, UK(诺丁汉大学计算机科学学院) Institute of Medical Robotics, School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学生物医学工程学院医疗机器人研究所) College of Computer Science and Technology, Huaqiao University, Xiamen, China(华侨大学计算机科学与技术学院) School of Electronic Information (School of Artificial Intelligence), Northwest University, Xi'an, China(西北大学电子信息学院(人工智能学院)) Department of Mechanical Engineering, University College London, London, UK(伦敦大学学院机械工程系) Institute of Neuroscience and Cardiovascular Research, University of Edinburgh, Edinburgh, UK(爱丁堡大学神经科学与心血管研究学院) CAS Center for Excellence in Nanoscience, National Center for Nanoscience and Technology, Beijing, China(中国科学院纳米科学卓越中心) School of Control Science and Engineering, Shandong University, Jinan, China(山东大学控制科学与工程学院) School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(伯明翰大学工程学院)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 基于多中心、多序列MRI的大规模真实世界数据集LiFS,系统评估了9种AI方法在肝纤维化分期中的表现,发现最佳AI与资深放射科医生相当,但跨中心异质性和标签不平衡仍是主要挑战。

Comments Submitted to Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25288 2026-05-26 cs.IT cs.AI cs.ET cs.LG eess.SP math.IT 57%

CSI-tuples-based 3D Channel Fingerprints Construction Assisted by MultiModal Learning

基于CSI元组的多模态学习辅助3D信道指纹构建

Chenjie Xie, Li You, Ruirong Chen, Gaoning He, Xiqi Gao

机构 * National Mobile Communications Research Laboratory, Southeast University(东南大学国家移动通信研究中心) Purple Mountain Laboratories(紫金山实验室) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 针对低空通信中的3D信道指纹构建问题,提出一种基于CSI元组的多模态回归框架,通过融合位置、通信测量和地理环境地图,实现高效高精度的信道状态信息估计。

Comments 14 pages, 9 figures

Journal ref IEEE Transactions on Wireless Communications, vol. 25, pp. 17369-17383, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25868 2026-05-26 cs.HC cs.LG 50%

The Timing Dependencies of Trust: Speed, Accuracy, and cBCI Neuro-Decoupling in Human-AI Teams

信任的时间依赖性:人机团队中的速度、准确性与cBCI神经解耦

Christopher Baker, Stephen Hinton, Akashdeep Nijjar, Riccardo Poli, Caterina Cinel, Tom Reed, Stephen Fairclough

机构 * School of Electronics, Electrical Engineering and Computer Science(电子工程与计算机科学学院) Queen's University Belfast(贝尔法斯特女王大学) School of Psychology(心理学学院) Liverpool John Moores University(利物浦约翰摩尔斯大学) School of Computer Science and Electronic Engineering(计算机科学与电子工程学院) University of Essex(埃塞克斯大学) Defence Science Technology Laboratory(国防科学技术实验室)

专题命中 融合架构与评测 :hybrid fusion(abstract)

AI总结 本研究通过比较快速低准确率(FLA-AI)与慢速高准确率(SA-AI)两种AI助手,利用协作脑机接口(cBCI)和自适应黎曼Oracle,揭示了AI响应时间决定了团队失败机制:快速AI引发盲目服从,慢速AI导致延迟认知冲突,并通过混合融合方法有效提升了团队性能。

详情

展开后加载摘要…

URL PDF HTML 收藏