arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-07 至 2026-07-07 共收录 13 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 2 篇

2607.02572 2026-07-07 cs.CV cs.AI 新提交 83%

Additive Causal Construction for Transferable and Reconfigurable Cross-System Learning in Multi-Source Image Fusion

多源图像融合中用于可转移和可重构跨系统学习的加性因果构建

Zhizhong Fu, Wei Zhou, Zhaoyang Jiang, Yulong Lin, Yifu Hou, Xiaorong Ding, Qiang Yan, Yifan Chen

机构 * School of Life Science and Technology, University of Electronic Science and Technology of China(电子科技大学生命科学与技术学院) School of Health and Wellbeing, University of Glasgow(格拉斯哥大学健康与幸福学院) Department of Organ Transplantation, Sichuan Provincial People’s Hospital, University of Electronic Science and Technology of China(电子科技大学附属四川省人民医院器官移植科) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Department of Radiology, Huzhou Maternity & Child Health Care Hospital(湖州市妇幼保健院放射科) Hepatological Surgery Department, Huzhou Central Hospital, Fifth School of Clinical Medicine of Zhejiang Chinese Medical University(浙江中医药大学附属湖州中医院第五临床医学院湖州市中心医院肝外科)

专题命中 通用Image Fusion :image fusion(title,abstract);information fusion(abstract);分类 cs.CV

AI总结 针对多源图像融合中跨系统差异和纠缠问题,提出加性因果构建框架,通过干预一致性建立共享因果‘锚’实现因果图可转移,将融合过程形式化为因果构建并量化不确定性确保可重构,改进因果表示学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03643 2026-07-07 eess.IV cs.CV 新提交 81%

Model Confidence-Guided Multi-Image Fusion of Fundus Images for Diabetic Retinopathy Diagnosis

模型置信度引导的多图像融合眼底图像糖尿病视网膜病变诊断方法

Ananya Raghu, Anisha Raghu, Alice S. Tang, Yannis M. Paulus, Tyson N. Kim, Tomiko T. Oskotsky

机构 * Massachusetts Institute of Technology(麻省理工学院) Wilmer Eye Institute, Department of Ophthalmology, Johns Hopkins University(约翰霍普金斯大学威尔默眼科研究所) Department of Biomedical Engineering, Johns Hopkins University(约翰霍普金斯大学生物医学工程系) Bakar Computational Health Sciences Institute, University of California San Francisco(加州大学旧金山分校巴卡计算健康科学研究所) Department of Ophthalmology, University of California San Francisco(加州大学旧金山分校眼科系) Division of Clinical Informatics and Digital Transformation, University of California San Francisco(加州大学旧金山分校临床信息学与数字化转型 division)

专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV、eess.IV

AI总结 针对资源有限地区糖网病早期筛查需求,提出置信度引导的多图像融合框架,整合多眼底视图提升诊断置信度与准确率,性能优于传统图像质量级联流水线,适配低延迟移动筛查场景。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 1 篇

2607.03563 2026-07-07 physics.optics 新提交 50%

Half-wave plasmonic nanolasers near the localization limit

接近局域极限的半波等离子体纳米激光器

Sangyeon Cho, Seok-Hyun Yun

专题命中 红外-可见光融合 :infrared and visible(abstract)

AI总结 研究在超光滑金衬底上用高增益磷化铟纳米颗粒实现接近表面等离子体共振的半波模式激光,通过模拟估计最小激光粒子尺寸,观察不同粒子的激光特性,推动激光小型化至等离子体局域极限。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多聚焦/多曝光融合 1 篇

2607.03110 2026-07-07 cs.CV 新提交 79%

ExpoMotion: A Large-Scale Benchmark and A Householder Projection Network for Multi-Exposure Fusion

ExpoMotion:用于多曝光融合的大规模基准和豪斯霍尔德投影网络

Yao Liu, Lishen Qu, Shihao Zhou, Jie Liang, Hui Zeng, Yabin Peng, Huipeng Lin, Lei Zhang, Jufeng Yang

机构 * Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开大学国际研究院(深圳·福田)) Pengcheng Laboratory(鹏城实验室) College of Computer Science, Nankai University(南开大学计算机科学学院) The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 多聚焦/多曝光融合 :multi-exposure(title,abstract);分类 cs.CV

AI总结 针对多曝光融合中运动重影及高质量动态基准稀缺问题,提出ExpoMotion基准,含多样序列和图像及高保真真值。还提出豪斯霍尔德正交投影网络,通过变换解耦多帧对齐,实验验证了其有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 自动驾驶多传感器融合 1 篇

2607.04098 2026-07-07 cs.CV 新提交 57%

Sparse4D-Radar: An Efficient and Robust Framework for Surround-View 3D Object Detection via 4D Radar-Camera Fusion

Sparse4D-Radar:一种通过4D雷达-相机融合实现高效且稳健的环视3D目标检测框架

Fuyuan Ai, Yuchen Tan, Jiehui Chen, Zhiwei Xu, Chunyi Song

机构 * State Key Laboratory of Ocean Sensing and Ocean College, Zhejiang University(浙江大学海洋传感与海洋学院海洋传感技术国家重点实验室) Engineering Research Center of Oceanic Sensing Technology and Equipment, Ministry of Education, Zhejiang University(浙江大学海洋传感技术与装备教育部工程研究中心) Donghai Laboratory(东海实验室) Ocean College, Institute of Marine Electronics and Intelligent Systems, Zhejiang University(浙江大学海洋学院海洋电子与智能系统研究所)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对4D成像雷达在环视感知缺乏成熟方案的问题,提出Sparse4D-Radar框架。设计可变形融合模块等,经实验验证该框架在环视3D检测性能上达先进水平,兼顾精度、鲁棒性与效率。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人多传感器融合 2 篇

2607.03818 2026-07-07 cs.CV 新提交 70%

TRISTAR: Triple-Signal Stair Recognition and Vision-Only Indoor Navigation for Search-and-Rescue Micro-UAVs

TRISTAR:用于搜索救援微型无人机的三重信号楼梯识别与仅视觉室内导航

Octavian Gîngu, Stelian Spînu

机构 * Military Technical Academy(军事技术学院)

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.CV

AI总结 研究为低成本无人机提出仅基于单目视觉的室内导航框架。结合深度估计、传统计算机视觉和轻量级深度学习模型。核心方法是TRISTAR三重传感器融合,贡献是实现可靠室内探索与楼梯穿越,无需特殊测距硬件。

Comments 10 pages, 7 figures. Project repository available at: https://github.com/tavigingu/HawkOps-Indoor-Drone-Navigation-and-TRISTAR-Stair-Climbing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03338 2026-07-07 cs.RO cs.SY eess.SY 新提交 57%

Closed-loop vs. Open-loop Kalman Filter Architectures in Airborne Aided Inertial Navigation

机载辅助惯性导航中的闭环与开环卡尔曼滤波器架构

Antonia Hager, Torleiv H. Bryne

机构 * Airbus Central Research and Technology(空客中央研究与技术中心) Department of Engineering Cybernetics, Norwegian University of Science and Technology(挪威科技大学工程 cybernetics 系)

专题命中 机器人多传感器融合 :information fusion(abstract);分类 cs.RO

AI总结 研究闭环与开环卡尔曼滤波器架构在机载辅助惯性导航中的性能影响,用标准惯性机制和直接位置辅助评估,通过模拟展示不同传感器误差下两种架构的权衡。

Comments 6 pages, 6 figures, submission to IEEE Navicon

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 音视频/视觉语言融合 1 篇

2607.03825 2026-07-07 cs.CV cs.AI 新提交 57%

Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

Q-TriM:用于视听问答的问题引导三模态注意力

SungHun Kim, SeungJun Baek

机构 * Dept. of Computer Science and Engineering(计算机科学与工程系)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 研究视听问答问题,提出Q-TriM以浅并行方式进行多模态融合,引入基于文本的视频和音频注意力操作框架,避免深度堆叠融合的问题,在三个基准测试中达最优性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 融合架构与评测 5 篇

2607.05311 2026-07-07 cs.CV 新提交 79%

Deep Learning for Semen Analysis in Male Infertility: Computer Vision, Multimodal Fusion, and Clinical Translation

男性不育症精液分析深度学习技术:计算机视觉、多模态融合与临床转化

Runwei Guan, Shaofeng Liang, Jiacheng Weng, Xiaoyi Gu, Jia Weng, Daizong Liu, Duo Pan, Qingxin Zhang, Xiao Liang, Weiping Ding, Suoyu Zhu, Ming Yuan, Yanhua Fei

机构 * Department of Gynaecology and Obstetrics, The Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院妇产科) Department of Oncology, the Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院肿瘤科) Thrust of AI, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能推力实验室) FertiTech AI(生殖科技人工智能公司) Department of Oncology, Suzhou Xiangcheng People’s Hospital(苏州市相城区人民医院肿瘤科) Department of Biological Sciences and Bioinformatics, School of Science, Xi’an Jiaotong-Liverpool University(西交利物浦大学理学院生物科学与生物信息学系) School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 针对传统精液分析的主观性强等缺陷,综述聚焦计算机视觉与深度学习驱动的精子分析技术,梳理方法、数据集与落地障碍,提出分阶段临床转化路线。

Comments 46 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04786 2026-07-07 cs.SE cs.AI cs.MA 新提交 71%

An Exploration of Agentic Information Fusion for Test Maintenance Prediction

用于测试维护预测的智能信息融合探索

Jingxiong Liu, Nasser Mohammadiha, Gregory Gay

机构 * Chalmers University of Technology and University of Gothenburg(楚德斯技术大学和戈特堡大学) Ericsson AB(爱立信有限公司) University of Gothenburg(戈特堡大学)

专题命中 融合架构与评测 :information fusion(title)

AI总结 研究针对测试维护预测问题,提出多智能体框架MAST,通过智能融合多种分析方法及后检查程序,在实际场景中评估,提升了测试维护预测水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03111 2026-07-07 eess.SP 新提交 57%

Edge-Assisted Multimodal UAV Localization with Resource-Efficient Compression and Robust Fusion

基于资源高效压缩和鲁棒融合的边缘辅助多模态无人机定位

Zhong Ye, Yinghui He, Guanding Yu, Pavel Loskot

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 设计多模态无人机定位框架,利用相机、LiDAR和雷达传感模态。通过信息瓶颈压缩等模块应对传感节点资源有限、数据差异大及模态数据退化缺失等挑战,实验表明该框架能准确可靠定位无人机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03934 2026-07-07 cs.CV 新提交 57%

EgoInertia-MI: A Multimodal Egocentric Vision and IMU Benchmark for Motor Impairment Assessment

EgoInertia-MI:用于运动障碍评估的多模态自我中心视觉与惯性测量单元基准测试

Fatemah Alhamdoosh, Pietro Pala, Abduallah Mohamed, DK Arvind

机构 * University of Florence(佛罗伦萨大学) Meta Reality Labs(元现实实验室) University of Edinburgh(爱丁堡大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 研究针对运动障碍评估,结合自我中心视觉与惯性测量单元信号创建EgoInertia-MI数据集,设动作识别等任务并评估基线,发现多模态融合性能最佳,凸显两者结合用于运动评估的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02734 2026-07-07 cs.CL cs.AI 新提交 50%

Echoes of Unrest: A Multimodal NLP Framework for Early Warning of Fake News and Violence-Driven Mob Activity

动荡的回声:用于假新闻和暴力驱动的暴民活动早期预警的多模态NLP框架

Md. Maruf Bangabashi, Tahmid Hasan, Golam Mahmud, Md. Mostafijur Rahman, Md. Toufiqur Rahman, Jahanur Biswas

机构 * Department of Computer Science and Engineering, Dhaka International University(达卡国际大学计算机科学与工程系) Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology(孟加拉国工程技术大学计算机科学与工程系)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 针对社交媒体上错误信息传播引发危害的问题,提出多语言、多模态NLP框架。通过融合多基准数据集创建数据集,集成多种技术进行多模态融合,实验显示该框架在早期错误信息检测中有效。

Comments Accepted for publication as a book chapter (Taylor & Francis, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏