arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-07 至 2026-04-07 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 医学影像融合 1 篇

2604.03747 2026-04-07 cs.RO 70%

CT-VoxelMap: Efficient Continuous-Time LiDAR-Inertial Odometry with Probabilistic Adaptive Voxel Mapping

CT-VoxelMap:高效的连续时间激光雷达-惯性里程计与概率自适应体素映射

Lei Zhao, Xingyi Li, Tianchen Deng, Chuan Cao, Han Zhang, Weidong Chen

专题命中 医学影像融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.RO

AI总结 本文提出CT-VoxelMap,通过概率自适应体素映射提升移动机器人在快速运动或粗糙地形中的定位稳定性与准确性,采用B-样条基方法优化连续时间表示,改进雅可比推导并增强系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 自动驾驶多传感器融合 1 篇

2604.04797 2026-04-07 cs.CV cs.LG 79%

Multi-Modal Sensor Fusion using Hybrid Attention for Autonomous Driving

多模态传感器融合使用混合注意力用于自动驾驶

Mayank Mayank, Bharanidhar Duraisamy, Florian Geiß, Abhinav Valada

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) University of Freiburg(弗莱堡大学)

专题命中 自动驾驶多传感器融合 :sensor fusion(title);hybrid fusion(abstract);分类 cs.CV

AI总结 本文提出MMF-BEV框架,通过变形注意力实现雷达与摄像头BEV融合,通过传感器贡献分析验证传感器互补性,并在VoD数据集上优于单模态基线。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 2 篇

2604.04811 2026-04-07 cs.RO cs.CV cs.HC 62%

AnyUser: Translating Sketched User Intent into Domestic Robots

AnyUser: 将草图用户意图翻译成家用机器人

Songyuan Yang, Huibin Tan, Kailun Yang, Wenjing Yang, Shaowu Yang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(湖南大学国家机器人视觉感知与控制技术工程研究中心)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.CV、cs.RO

AI总结 AnyUser通过相机图像上的自由形式草图(可选语言)实现直观的家庭任务指令,利用多模态输入生成无需先验地图或模型的可执行机器人动作,通过大量评估验证其在不同模拟家庭场景中的高准确性和真实环境中的可靠性。

Comments Accepted to IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03308 2026-04-07 cs.CV 57%

Edge-Based Standing-Water Detection via FSM-Guided Tiering and Multi-Model Consensus

基于状态机引导分层和多模型共识的边缘水体检测

Oliver Aleksander Larsen, Mahyar T. Moghaddam

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV

AI总结 本文提出一种边缘架构,利用Raspberry-Pi类设备和可选Jetson加速器,通过状态机引导控制平面实现水体检测,结合多模型YOLO和日间传感器融合提升检测性能,降低能耗并保持延迟。

Comments Accepted at the In Practice Track of IEEE ICSA 2026. 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 1 篇

2604.03650 2026-04-07 cs.CL 50%

CAGMamba: Context-Aware Gated Cross-Modal Mamba Network for Multimodal Sentiment Analysis

CAGMamba:基于上下文的门控跨模态Mamba网络用于多模态情感分析

Minghai Jiao, Jing Xiao, Peng Xiao, Ende Zhang, Shuang Kan, Wenyan Jiang, Jinyao Li, Yixian Liu, Haidong Xin

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Xingning Power Supply Bureau, Guangdong Power Grid Co., Ltd.(广东电网有限责任公司兴宁供电局)

专题命中 音视频/视觉语言融合 :information fusion(abstract)

AI总结 本文提出CAGMamba网络,通过门控机制实现跨模态信息融合,有效建模上下文依赖和情感演变,实验表明在多模态情感分析任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 2 篇

2601.06338 2026-04-07 cs.AI cs.CV cs.LG 57%

Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers

扩散变换器中空间关系生成的电路机制

Binxu Wang, Jingxuan Fan, Xu Pan

机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Harvard University(哈佛大学)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 研究通过机械可解释性方法探讨扩散变换器如何生成正确空间关系,发现不同文本编码器影响电路机制,随机嵌入通过双阶段电路生成,预训练编码器则通过信息融合生成,两种方法在领域内表现相似但抗扰性不同。

Comments 45 pages, 30 figures, accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03688 2026-04-07 cs.IR cs.AI 50%

Fusion and Alignment Enhancement with Large Language Models for Tail-item Sequential Recommendation

基于大语言模型的尾项序列推荐融合与对齐增强

Zhifu Wei, Yizhou Dang, Guibing Guo, Chuang Zhao, Zhu Sun

机构 * Northeastern University(东北大学) Tianjin University(天津大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 本文提出FAERec框架,通过自适应门控机制和双层对齐方法提升尾项序列推荐中物品表示的质量,解决协同信号与语义知识融合不足及嵌入空间结构不一致的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏