arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-14 至 2026-04-14 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 3 篇

2604.11570 2026-04-14 cs.HC cs.MM 57%

From Multimodal Signals to Adaptive XR Experiences for De-escalation Training

从多模态信号到自适应XR体验的降级训练

Birgit Nierula, Karam Tomotaki-Dawoud, Daniel Johannes Meyer, Iryna Ignatieva, Mina Mottahedin, Thomas Koch, Sebastian Bosse

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 本文提出了一种多模态实时通信分析系统,用于自适应VR训练的基础交互层,整合了语音、手势、情感分析、脑电波和生理信号,通过同步技术实现用户意识和无意识沟通线索的连续评估,结合社会符号学和象征互动理论,构建了连接低层信号到冲突缓解的解释层。

Comments 16 pages, 5 figures, ACM Intelligent User Interfaces (IUI) Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14170 2026-04-14 cs.CV cs.AI cs.ET 57%

Progressive Multimodal Interaction Network for Reliable Quantification of Fish Feeding Intensity in Aquaculture

渐进多模态交互网络用于水产养殖中鱼摄食强度的可靠量化

Shulong Zhang, Mingyuan Yao, Jiayin Zhao, Daoliang Li, Yingyi Chen, Haihua Wang

机构 * National Innovation Center for Digital Fishery(国家数字渔业创新中心) Key Laboratory of Smart Farming Technologies for Aquatic Animal and Livestock, Ministry of Agriculture and Rural Affairs(农业农村部水产动物与畜禽智慧养殖技术重点实验室) State Key Laboratory of Efficient Utilization of Agricultural Water Resources(农业水资源高效利用全国重点实验室) Beijing Engineering and Technology Research Center for Internet of Things in Agriculture(北京市农业物联网工程技术研究中心) Key Laboratory of Digital Fisheries of Shandong Province(山东省数字渔业重点实验室) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出渐进多模态交互网络PMIN,通过整合图像、音频和水波数据,有效解决多模态数据不一致性和决策冲突问题,提升鱼摄食强度量化可靠性,实验表明其在精度、参数和计算成本上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10460 2026-04-14 cs.CV cs.AI cs.CR cs.ET 57%

Toward Accountable AI-Generated Content on Social Platforms: Steganographic Attribution and Multimodal Harm Detection

迈向社交平台可问责的AI生成内容:隐写术溯源与多模态危害检测

Xinlei Guan, David Arosemena, Tejaswi Dhandu, Kuan Huang, Meng Xu, Miles Q. Li, Bingyu Shen, Ruiyang Qin, Umamaheswara Rao Tida, Boyang Li

机构 * Kean University(基恩大学) North Dakota State University(北达科他州立大学) McGill University(麦吉尔大学) Villanova University(维拉诺瓦大学) University of Notre Dame(圣母大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出一种隐写术溯源框架,结合多模态危害检测,用于追踪AI生成图像的有害部署,提升合成媒体环境中的问责能力。

Comments 12 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏