arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-28 至 2026-07-28 共收录 17 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 3 篇

2607.23600 2026-07-28 cs.CV 新提交 88%

ConFusion: Continuous Fusion Space Learning for Fine-Grained Controllable Infrared and Visible Image Fusion

ConFusion:用于细粒度可控红外与可见光图像融合的连续融合空间学习

Guo Yurong, He Yufei, Li Yonghao, Chang Dongliang, Zhang Ke, Ma Zhanyu

机构 * North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 红外-可见光融合 :image fusion(title,abstract);infrared and visible(title,abstract);分类 cs.CV

AI总结 研究可控红外与可见光图像融合,提出ConFusion框架,通过高斯条件空间感知调制学习连续融合空间,采用双分支架构及相关模块实现实例级细粒度可控融合,实验证明其在融合质量和下游任务上达先进水平。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24110 2026-07-28 cs.CV cs.LG physics.optics 新提交 57%

BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion

超越融合:用于无校准红外超分辨率和红外-可见光融合的自对齐潜在扩散

Minchong Chen, Xiaoyun Yuan, Minyu Cao, Jianing Zhang, Jun Zhang, Shuyang Liu, Xiaokang Yang

专题命中 红外-可见光融合 :infrared and visible(abstract);分类 cs.CV

AI总结 针对移动红外-可见光成像中跨传感器未对准问题,提出超越融合框架,通过引入跨模态自对齐模块及未对准增强模块,实现无校准条件下的红外超分辨率和红外-可见光融合,经实验验证了其有效性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19942 2026-07-28 cs.CV cs.AI 版本更新 57%

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

G-MAD:用于多视图RGB-T航空目标检测的基于游戏的数据生成框架

Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

机构 * LIG Defense&Aerospace(LIG国防与航空航天公司) GIST(韩国科学技术院)

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 研究针对航空目标检测中数据集构建的问题,提出基于游戏的G-MAD数据生成框架,可解决视点控制、数据对齐及标注成本等问题,支持多视图相机放置等功能,还构建并发布了AMOD基准。

Comments ACM Multimedia 2026 (Supplementary Material Included)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 遥感融合与全色锐化 1 篇

2607.23136 2026-07-28 eess.IV cs.PF 新提交 74%

Optimized Embedded Implementation of Hyperspectral-Multispectral Image Fusion on Raspberry Pi

树莓派上高光谱-多光谱图像融合的优化嵌入式实现

Salah Eddine Brezini, Okba Bekhelifi, Oussama Mezouar, Chams Eddine Choucha, Sarra Boukhacheba, Fethi Abdelatif Dali

专题命中 遥感融合与全色锐化 :image fusion(title);分类 eess.IV

AI总结 针对高光谱图像数据量大难实时处理的问题,提出将密集运算迁移到特定框架结合XNNPACK后端进行优化的方法,在树莓派5平台部署,显著减少计算时间并保留融合质量,适用于相关遥感应用。

Comments paper is accepted for presentation at EDiS'2026: IEEE 5th International Conference on Embedded and Distributed Systems, Oran, Algeria, November 2-5, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶多传感器融合 1 篇

2607.22698 2026-07-28 cs.CV 新提交 70%

FogDrive: A Multi-Modal Synthetic Driving Dataset for Perception under Graded Fog

FogDrive:用于分级雾天感知的多模态合成驾驶数据集

Vansh Panwar

机构 * Indian Institute of Technology, Guwahati(印度理工学院古瓦哈提分校)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);sensor fusion(abstract);分类 cs.CV

AI总结 FogDrive是用于分级雾天感知的多模态合成驾驶数据集,基于CARLA模拟器构建,含多种传感器数据,模拟不同密度雾。通过跨两种范式建立基线基准,得出训练中混合多密度雾可收紧3D边界框几何形状等见解,将开源加速多模态研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人多传感器融合 1 篇

2607.23220 2026-07-28 eess.SY cs.SY 新提交 50%

Embedded Firmware Development for Flight Control, Telemetry, and Video Streaming for DIY UAV Research

用于DIY无人机研究的飞行控制、遥测和视频流的嵌入式固件开发

Ad-Deen Mahbub, Indroneel Roy, Mohammad Kamruzzaman Khan Prince

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 针对低成本无人机,基于双核ESP32-S3微控制器设计优化固件,利用内核任务分配、零拷贝缓冲区等技术,实现飞行控制、遥测和视频传输,经实验评估能提供精确稳定支持,助力DIY项目和研究。

Comments 6 pages, 12 figures, Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 音视频/视觉语言融合 2 篇

2607.04498 2026-07-28 cs.CV cs.SD 版本更新 57%

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

UniSkip-Mamba:用于视听时间伪造定位的频率感知状态空间模型

Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang

机构 * Soochow University(苏州大学) Tsinghua University(清华大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对视听时间伪造定位,通过频域分析发现伪造特征集中在低中频,提出融合多模态序列与新颖扫描机制的UniSkip-Mamba框架,实现性能提升和推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22794 2026-07-28 cs.LG cs.AI cs.CL cs.SD 新提交 50%

Multimodal Domain Generalization for Depression Detection: An Attention-Based BiLSTM Network with Domain-Adversarial Training

用于抑郁症检测的多模态域泛化:基于注意力的双向长短期记忆网络与域对抗训练

Ali Tabaraei, Federico Simonetta, Stavros Ntalampiras

机构 * University of Milan(米兰大学) Gran Sasso Science Institute (GSSI)(大萨索科学研究所)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 研究针对深度学习抑郁症检测泛化受限问题,提出含域泛化的多模态检测框架,集成BiLSTM与注意力机制,用梯度反转层增强泛化,实验表明该方法提升了准确率和F1分数,超越现有基准,消融研究突出各因素贡献。

Comments 12 pages, 8 figures, 6 tables. Accepted for publication in IEEE Transactions on Neural Networks and Learning Systems (TNNLS)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 融合架构与评测 9 篇

2607.23243 2026-07-28 cs.AI 新提交 82%

Characterisation of Density-based FM generation methods in the context of Information Fusion

信息融合背景下基于密度的模糊测度生成方法的表征

Yanhao Huang, Christian Wagner

专题命中 融合架构与评测 :information fusion(title,abstract);decision-level fusion(abstract)

AI总结 研究信息融合中基于密度的FM生成方法,指出常用方法不足以唯一确定离散FM,展示如何确定区间值FM及相关置信区间,通过实验表明基于此FM的Choquet FI输出可视为‘理想’融合结果置信区间,为表征FI融合结果提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23370 2026-07-28 cs.LG cs.CE econ.EM stat.CO 新提交 71%

Bitcoin Price Direction Prediction via Regime-Aware Multi-Modal Fusion of Social Sentiment and Technical Features

通过社会情绪与技术特征的状态感知多模态融合预测比特币价格走势

Muhammad Abdullah Haroon

机构 * FAST National University of Computer and Emerging Sciences (FAST-NUCES)(快速国立计算机与新兴科学大学)

专题命中 融合架构与评测 :multi-modal fusion(title)

AI总结 研究比特币亚日价格预测难题,提出状态感知多模态学习(RAML)方法,依据市场状态动态融合社会情绪与技术特征,实验表明该方法在预测中表现良好,确立状态条件自适应融合为多模态金融预测的必要原则。

Comments 19 pages, 15 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22773 2026-07-28 eess.IV cs.CV physics.med-ph 新提交 62%

Metric Surface Reconstruction of Neurosurgical Scenes from Monocular Operating Microscope Images and Microscope Pose

从单目手术显微镜图像和显微镜位姿重建神经外科场景的度量曲面

Thomas Bucher, Didier Neuenschwander, Thomas Petutschnigg, Michael Murek, David Bervini, Andreas Raabe, Manuela Eugster

专题命中 融合架构与评测 :image fusion(abstract);分类 cs.CV、eess.IV

AI总结 研究能否从单目手术显微镜图像和位姿数据重建神经外科场景的三维几何度量,利用预训练模型估计深度、泊松曲面重建点云成网格,结果显示该方法在模型设置中有技术可行性,支持相关手术技术进一步发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24683 2026-07-28 cs.CV cs.AI cs.LG 新提交 57%

Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

多模态分类中用于缺失任意模态的协同学习

Francisco Mena, Dino Ienco, Roberto Interdonato, Cassio F. Dantas, Simon Besnard

机构 * GFZ Helmholtz Center for Geosciences(德国波茨坦地学研究中心亥姆霍兹中心) INRAE, UMR TETIS, University of Montpellier(法国蒙彼利埃大学农业环境与生态研究院、蒙彼利埃大学TETIS联合研究单位) INRIA, EVERGREEN, University of Montpellier(法国蒙彼利埃大学信息与自动化研究所、EVERGREEN实验室) CIRAD, UMR TETIS, University of Montpellier(法国蒙彼利埃大学国际农业研究磋商组织、蒙彼利埃大学TETIS联合研究单位)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对多模态分类中因操作约束导致训练和推理时模态可用性不一致、存在缺失任意模态的问题,提出多模态协同学习框架,引入特征和决策层面利用信息的两种方法,实验证明在不同缺失模态条件下有显著鲁棒性提升。

Comments Accepted at Discovery Science 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23576 2026-07-28 cs.CV 新提交 57%

Neuromorphic Object Detection: An In-Depth Study and Future Directions

神经形态目标检测:深入研究与未来方向

Jianing Li, Dianze Li, Arren Glover, Xiaopeng Fan, Guoqi Li, Chiara Bartolozzi, Ryad B. Benosman, Yonghong Tian

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Chinese Academy of Sciences(中国科学院) Italian Institute of Technology(意大利理工学院) Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学) Sorbonne Université(索邦大学) INSERM(法国国家健康与医学研究院) CNRS(法国国家科学研究中心) Institut de la Vision(视觉研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对传统相机在特定条件下目标检测的挑战,本文对神经形态目标检测算法进行全面调查和基准测试,从多视角探索现有方法,评估多种模型并分析结果,讨论未解决问题,为该领域研究提供资源与方向。

Comments Accepted by Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-07-28 cs.IR 新提交 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23822 2026-07-28 cs.LG 新提交 50%

DriveDNA: A Large-Scale Multimodal Naturalistic Driving Dataset and Benchmark for Driving Style Identification

DriveDNA:用于驾驶风格识别的大规模多模态自然驾驶数据集及基准测试

Yuhang Wang, Lingyao Li, Hao Zhou

机构 * University of South Florida(南佛罗里达大学) University of Arizona(亚利桑那大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 该研究引入DriveDNA数据集及基准测试用于驾驶风格识别,定义驾驶风格为车辆在相似条件下的特定行为模式,通过三个核心任务评估,对比多种基线方法得出学习表示更优,视频模型有路线泄漏问题,强调可靠评估需考虑多方面因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22884 2026-07-28 cs.CL 新提交 50%

CHiPS: Character Histograms and Positional Signals for Lightweight Authorship Attribution in Romanian Texts

CHiPS:罗马尼亚语文本中用于轻量级作者归属的字符直方图和位置信号

Sanda-Maria Avram, George C. Ţurcaş

机构 * Faculty of Mathematics and Computer Science, Babeş-Bolyai University(巴比什-波雅依大学数学与计算机科学学院)

专题命中 融合架构与评测 :decision-level fusion(abstract)

AI总结 该研究针对罗马尼亚语文本提出CHiPS轻量级字符级作者归属方法,研究两种互补写作风格指纹,包括字符直方图分类器和位置信号分类器,还介绍了融合变体等,通过实验探讨受限字符证据在严格泄漏控制下的效果。

Comments 17 pages, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22779 2026-07-28 cs.LG cs.AI 新提交 50%

Multimodal Surface EMG Hand Gesture Recognition Using Query-Based Transformers for Prosthetic Control

使用基于查询的变压器进行多模态表面肌电手势识别以用于假肢控制

Federico Del Pup, Elisa Tentori, Manfredo Atzori

机构 * Department of Information Engineering, University of Padua(帕多瓦大学信息工程系) Padova Neuroscience Center, University of Padua(帕多瓦大学帕多瓦神经科学中心) Department of Biomedical Sciences, University of Padua(帕多瓦大学生物医学科学系) Department of Neuroscience, University of Padua(帕多瓦大学神经科学系) Information Systems Institute, University of Applied Sciences Western Switzerland (HES-SO Valais)(瑞士西部应用科学大学(HES-SO瓦莱州)信息系统研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 研究针对表面肌电手势识别用于假肢控制时当前架构的局限,提出EMG-CrossFormer,通过级联交叉注意力融合层组合单模态编码器表示,经实验验证该方法能提升仅sEMG解码及多模态融合下的手势识别性能。

Comments GitHub repository: see https://github.com/deepPNClab/emg-crossformer

详情

展开后加载摘要…

URL PDF HTML 收藏