arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-05-29 至 2026-05-29 共收录 6 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 机器人多传感器融合 2 篇

2506.08028 2026-05-29 eess.SY cs.SY stat.AP 71%

Sensor Fusion for Track Geometry Monitoring: Integrating On-Board Condition Monitoring and Degradation Models via Kalman Filtering

轨道几何监测的传感器融合:通过卡尔曼滤波集成车载状态监测与退化模型

Huy Truong-Ba, Jacky Chin, Michael E. Cholette, Pietro Borghesani

专题命中 机器人多传感器融合 :sensor fusion(title)

AI总结 本研究提出一种通过卡尔曼滤波融合低成本车载传感器振动信号与退化模型的方法,以提升轨道几何预测的可靠性,并实验验证了频繁传感器数据能显著降低预测不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29120 2026-05-29 cs.HC 50%

Improving outdoor navigation for people with blindness using an AI-driven smartphone application and personalized audio guidance

利用AI驱动的智能手机应用和个性化音频引导改善盲人户外导航

Raymond Liu, Patrick Slade

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 本文提出Mobilio智能手机应用,结合机器学习、传感器融合和个性化音频反馈,实现逐向导航、路径引导和障碍物检测,实验表明其能显著提升盲人户外导航效率并减少环境接触。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音视频/视觉语言融合 1 篇

2605.30265 2026-05-29 cs.CV cs.CL 57%

LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

LoMo: 局部模态替换以实现更深的视觉-语言融合

Feng Han, Zhixiong Zhang, Zheming Liang, Yibin Wang, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对视觉-语言模型在模态替换时性能下降的“载体敏感性”问题,提出局部模态替换(LoMo)数据策展范式,通过将文本片段动态渲染为图像来训练跨模态表示不变性,显著提升多模态推理与融合效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 3 篇

2605.26255 2026-05-29 eess.IV cs.AI cs.LG 57%

Prospective evaluation of multimodal respiratory failure prediction: Do chest X-rays improve performance beyond EHR signals?

多模式呼吸衰竭预测的前瞻性评估:胸部X光片能否在电子健康记录信号之外提升性能?

Xiaolei Lu, Shamim Nemati

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.IV

AI总结 本研究提出一种门控多模态框架,集成结构化电子健康记录时间序列数据和胸部X光片基础模型表示,用于前瞻性预测ICU患者24小时内是否需要有创机械通气,结果显示相比仅使用电子健康记录的模型和医生预测,多模态融合提高了区分度、敏感性和阳性预测值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30002 2026-05-29 cs.AI 50%

KairosAgent: Agentic Time Series Forecasting with Fused Semantic Reasoning

KairosAgent:融合语义推理的智能体时间序列预测

Kun Feng, Ziwei Shan, Yuchen Fang, Yiyang Tan, Sihan Lu, Shuqi Gu, Lintao Ma, Xingyu Lu, Kan Ren

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) Ant Group(蚂蚁集团)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出KairosAgent框架,通过结合基于LLM的推理器和基于TSFM的预测器,并引入强化学习范式,实现跨模态时间序列的零样本预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29606 2026-05-29 cs.AI cs.IR 50%

HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering

HiKEY: 面向开放域文档问答的分层多模态检索

Joongmin Shin, Gyuho Shim, Jeongbae Park, Jaehyung Seo, Heuiseok Lim

机构 * Human-inspired AI Research, Korea University(韩国大学人机智能研究部) Computer Science and Engineering, Konkuk University(韩国康科大学计算机科学与工程系) Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出基于文档层次结构的分层多模态检索框架HiKEY,通过文档层次解析和粗到细的检索策略解决大规模工业语料中的路由失败和证据碎片化问题,在ODQA基准上检索召回率提升达12.9%,端到端QA性能提升达6.8%。

Comments Accepted to ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏