arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-24 至 2026-07-24 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 机器人多传感器融合 1 篇

2607.21058 2026-07-24 cs.RO 新提交 74%

Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment

用于机器人开颅手术的受人类启发框架:集成多模态融合与自适应轨迹调整

Renzhen Le, Xiao Zhang, Di Wu, Yuanyu Wei, Jiachen Zhu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

机构 * Dalian University of Technology(大连理工大学) The University of Tokyo(东京大学)

专题命中 机器人多传感器融合 :multimodal fusion(title);分类 cs.RO

AI总结 该研究针对机器人开颅手术问题,提出受人类启发的闭环框架,集成术前规划与术中执行。采用自适应双轮廓融合算法生成轨迹,利用多模态网络融合信号实现突破检测,通过原位投影策略调整轨迹,实验验证该框架能实现安全自主且高效闭环控制的开颅手术。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音视频/视觉语言融合 1 篇

2607.20900 2026-07-24 cs.CV 新提交 57%

DINO-VPT: Hierarchical Visual Prompt Tuning for Joint Physical-Digital Face Anti-Spoofing

DINO-VPT:用于联合物理-数字人脸反欺骗的分层视觉提示调整

Pierre Gallin-Martel, Mika Feng, Koichi Ito, Takafumi Aoki

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 研究针对人脸反欺骗需求,提出DINO-VPT轻量级仅视觉框架,利用分层视觉提示调整,通过提示路由网络动态注入提示,无需多模态融合,在基准测试中比现有方法准确率更高,证明合理架构能达最优性能。

Comments accepted to IJCB2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 5 篇

2607.20742 2026-07-24 cs.LG 新提交 78%

Adaptive Confidence-weighted Expansion for Trustworthy Multi-Omics Multimodal Fusion

用于可信多组学多模态融合的自适应置信加权扩展

Mohammad Raahemi, Ali Sekhavati, Alireza Maleki, Hamid Nasiri

机构 * Faculty of Engineering, University of Ottawa(渥太华大学工程学院) RIV Lab, Department of Computer Engineering, Bu-Ali Sina University(布阿里·西纳大学计算机工程系RIV实验室) School of Computing and Communications, Lancaster University(兰卡斯特大学计算与通信学院)

专题命中 融合架构与评测 :multimodal fusion(title,abstract)

AI总结 针对多模态学习模型在噪声或无信息数据流下性能不佳及缺乏数据质量评估机制的问题,提出自适应置信加权扩展(ACE)框架,通过生成互补模态和双层置信机制提升性能,在多组学数据集评估中显著优于现有算法。

Comments Accepted for publication in the proceedings of the International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21347 2026-07-24 cs.CV 新提交 74%

Quality-Aware Multimodal Fusion Reveals Implicit Identity in Valence-Arousal Features

质量感知多模态融合揭示效价-唤醒特征中的隐含身份

Jisu Kim, Benjamin S. Riggan

机构 * University of Nebraska-Lincoln(内布拉斯加大学林肯分校)

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV

AI总结 研究针对传统人脸识别在无约束环境中表现不佳的问题,提出质量感知自适应融合方法 QAAF 用于多模态效价-唤醒估计,在 VA 估计任务中取得良好效果,且经 VA 训练的特征在编码身份上表现出色,确立了多模态 VA 估计为传统人脸识别的互补软生物特征模态。

Comments 10 pages, 3 figures, 6 tables. Accepted for publication at IEEE International Joint Conference on Biometrics (IJCB), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20897 2026-07-24 cs.CV 新提交 57%

MAGE-Vein: Multi-Instance Age and Gender Estimation from Finger Vein Images

MAGE-Vein:从手指静脉图像进行多实例年龄和性别估计

Katsuki Tanaka, Koichi Ito, Takafumi Aoki, Masakazu Fujio, Yosuke Kaga, Kanade Oshima, Kenta Takahashi

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) Hitachi, Ltd.(日立有限公司)

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 cs.CV

AI总结 针对手指静脉图像年龄估计难题,提出MAGE-Vein多实例多任务学习框架,通过混合特征级融合提取衰老特征并抑制噪声,结合性别分类优化消除血管差异,在平衡数据集上取得良好效果,推翻传统认知。

Comments accepted to IJCB2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20790 2026-07-24 cs.CV 新提交 57%

Ocular Verification for Virtual Reality

虚拟现实中的眼部验证

Husanpreet Singh, Robert Tran, Ayushree Kharel, Sudipta Banerjee

机构 * University of Wyoming(怀俄明大学) San Diego State University(圣地亚哥州立大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 研究虚拟现实中眼部验证,评估虹膜质量指标局限性,用生成模型应对数据挑战,进行单模态与多模态识别及融合,发现部分指标在VR数据上失效,图像调整利于眼周识别,多模态融合降低错误接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20517 2026-07-24 cs.LG 新提交 50%

Multimodal CoLRAG-TF: Triple-Filtered Retrieval for Complex PDFs

多模态CoLRAG-TF:复杂PDF的三重过滤检索

Takato Yasuno

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 研究针对异构PDF集合检索增强生成的挑战,提出多模态CoLRAG-TF四轴融合架构,集成多种技术。构建多模态索引,经贝叶斯优化确定融合权重。实验显示其检索召回率高,多跳答案相似性提升显著,还适用于视觉输入,提供通用框架。

Comments 18 pages, 8 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏