arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-06-30 至 2026-06-30 共收录 9 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 1 篇

2606.29652 2026-06-30 cs.IR 50%

As We May Search

如我们可能搜索

Saber Zerhoudi, Adam Roegiest, Jelena Mitrovic, Michael Granitzer

专题命中 红外-可见光融合 :hybrid fusion(abstract)

AI总结 针对个人文档等敏感信息搜索中的隐私问题,提出本地优先信息检索(local-first IR)设计理念,通过将索引、模型和推理置于用户设备上,在消费级硬件上实现与云端相当的性能,并指出真正的权衡在于搜索范围而非质量。

Journal ref Proceedings of the 2026 International ACM SIGIR Conference on Innovative Concepts and Theories in Information Retrieval (ICTIR'26), July 25, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 2 篇

2606.28377 2026-06-30 cs.CV cs.AI 83%

Memory-Augmented LSTM Autoencoder for Unsupervised Activity Recognition with IMU Sensor Fusion

记忆增强的LSTM自编码器用于基于IMU传感器融合的无监督活动识别

Saeid Arabzadeh, Farshad Almasganj, Mohammad Mahdi Ahmadi

机构 * Faculty of Biomedical Engineering, Amirkabir University of Technology (Tehran Polytechnic)(生物医学工程学院,阿米尔卡比尔技术大学(德黑兰理工大学))

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);multi-sensor fusion(abstract);分类 cs.CV

AI总结 提出一种完全无监督的时空特征融合框架,使用记忆增强自编码器,通过短时间窗口的多传感器IMU数据增强活动表示,在DaLiAc和PAMAP2上分别达到96.6%和98.4%的准确率,超越监督和无监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13216 2026-06-30 cs.RO 57%

GaRLILEO: Gravity-aligned Radar-Leg-Inertial Enhanced Odometry

GaRLILEO:基于重力对齐的雷达-腿-惯性增强里程计

Chiyun Noh, Sangwoo Jung, Hanjun Kim, Yafei Hu, Laura Herlant, Ayoung Kim

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 本文提出GaRLILEO,一种基于重力对齐的雷达-腿-惯性增强里程计框架,通过连续时间 ego-velocity spline 和软 S2-constrained 重力因子提升垂直姿态估计精度,适用于复杂地形导航。

Comments Accepted for publication at the International Journal of Robotics Research on 30 April, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 4 篇

2606.29384 2026-06-30 cs.CV cs.RO 62%

Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model

Event-VLA: 基于动作条件的事件融合用于鲁棒的视觉-语言-动作模型

Jiaxin Liu, Xun Xu, Zhenhao Zhang, Hanqing Wang, Ruiqi Chen, Shi Chang, Weiyu Guo, Laurent Kneip

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.RO

AI总结 针对现有VLA模型在光照变化下鲁棒性不足的问题,提出Event-VLA框架,通过事件流作为光照鲁棒的运动敏感互补观测,利用动作查询路由和门控交叉注意力融合事件信息,提升低光及近黑暗环境下的操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29136 2026-06-30 cs.CV cs.AI 57%

CMTFormer: Marrying Transformer with Hierarchical Information Interaction for RGB-Event Object Detection

CMTFormer:融合Transformer与层次化信息交互的RGB-事件目标检测

Yu Li, Yuenan Hou, Yingmei Wei, Jiangming Chen, Yanming Guo

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 提出CMTFormer,通过浅层对齐、中层增强和深层可学习融合的层次化交互机制,有效融合RGB帧与事件流,在DSEC-Detection和PKU-DAVIS-SOD基准上超越现有方法。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02948 2026-06-30 cs.CV 57%

CrossWeaver: Cross-modal Weaving for Arbitrary-Modality Semantic Segmentation

CrossWeaver:跨模态编织用于任意模态语义分割

Zelin Zhang, Kedi Li, Huiqi Liang, Chuanzhi Xu, Tao Zhang, Weidong Cai

机构 * The University of Sydney(悉尼大学) University of Technology Sydney(悉尼科技大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出CrossWeaver框架,通过Modality Interaction Block和Seam-Aligned Fusion模块实现高效跨模态融合,在多模态语义分割中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03253 2026-06-30 cs.CV 57%

LaVPR: Benchmarking Language and Vision for Place Recognition

LaVPR:语言与视觉用于位置识别的基准测试

Ofer Idan, Dan Badur, Yosi Keller, Yoli Shavit

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 LaVPR通过引入超过65万条自然语言描述扩展现有VPR数据集,研究多模态融合与跨模态检索,证明语言描述在视觉退化条件下提升性能,尤其对小模型效果显著。

Comments Accepted to ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 2 篇

2606.30189 2026-06-30 cs.CL 50%

DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning

DAIN: 基于动态智能体交互网络的高效协同多模态推理

Xinxin Chen, Yuchen Li, Zihan Wang, Haoyu Zhang, Ruixin Liu, Mingyuan Zhao

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出动态智能体交互网络(DAIN),通过上下文感知元控制器动态调度专业交互智能体并压缩通信,实现高效协同多模态推理,在五个基准上取得最优性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29947 2026-06-30 cs.IR cs.LG 50%

Diagnosing and Mitigating Retrieval Bottlenecks in LLM-Based Cold-Start Recommendation

诊断与缓解基于LLM的冷启动推荐中的检索瓶颈

Zhe Dong, Fang Qin, Manish Shah, Yicheng Wang

专题命中 融合架构与评测 :hybrid fusion(abstract)

AI总结 本文通过五领域基准测试发现,在冷启动场景下,LLM重排序器受限于检索覆盖率低(4.6-22.9%),提出LHF混合融合层作为检索侧基线,恢复17-61%的oracle覆盖空间,但端到端实验显示非LLM排序与LLM重排序之间存在不匹配。

Comments 17 pages, 6 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏