arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-01 至 2026-07-01 共收录 5 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 多聚焦/多曝光融合 1 篇

2606.31242 2026-07-01 cs.CV 新提交 88%

UHD-MFF: Shattering Barriers in Multi-Focus Ultra-High-Definition Image Fusion via Learnable Lookup Tables

UHD-MFF:通过可学习查找表打破多焦点超高清图像融合的障碍

Yibing Zhang, Xunpeng Yi, Qinglong Yan, Yeda Wang, Han Xu, Jiayi Ma

机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) School of Robotics, Wuhan University(武汉大学机器人学院) School of Automation, Southeast University(东南大学自动化学院)

专题命中 多聚焦/多曝光融合 :image fusion(title,abstract);multi-focus(title,abstract);分类 cs.CV

AI总结 针对超高清多焦点图像融合中的数据、模型和部署三大障碍,提出首个大规模超高清数据集UHD-MFF和基于可学习查找表的UMF-LUT框架,实现实时4K融合。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音视频/视觉语言融合 2 篇

2606.30675 2026-07-01 eess.AS cs.AI cs.LG q-bio.QM 新提交 50%

Listening Between the Lines: Joint Learning of ASR Embeddings and LLM-Augmented Linguistics for Dementia Detection

弦外之音:ASR嵌入与LLM增强语言学联合学习用于痴呆检测

Olivier Jiyoun Jung, Jonghyeon Park, Myungwoo Oh

机构 * Division of Communication and Media, Ewha Womans University, South Korea(韩国梨花女子大学传播与媒体学院) NAVER Cloud, South Korea(韩国NAVER Cloud)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 提出多模态框架,结合Whisper的声学表示与LLM提取的语言特征,通过门控融合网络实现痴呆检测,在ADReSS和ADReSSo上F1分别达89.47%和90.14%。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30646 2026-07-01 cs.SD cs.AI cs.CL eess.AS 新提交 50%

ASR-Agnostic Multimodal Spectrotemporal Modeling for Early Dementia Detection

ASR无关的多模态谱时建模用于早期痴呆检测

Chukwuemeka Ugwu, Oluwafemi Richard Oyeleke

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 提出一种不依赖语音识别的框架,直接从梅尔频谱图中提取谱时位移场作为数字生物标志物,结合CNN-ConvGRU声学嵌入和交叉注意力融合,在三种语言语料库上验证了多模态融合的语料依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 2 篇

2606.31895 2026-07-01 cs.CV 新提交 57%

RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception

RESOLVE:用于路边协同感知的多分辨率多模态数据集

Shaozu Ding, Linan Song, Marco De Vincenzi, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院) Department of Computer Science and Engineering, New York University(纽约大学计算机科学与工程系)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出RESOLVE数据集,包含多分辨率LiDAR和相机-LiDAR同步数据,用于评估路边3D检测与跟踪中的单模态与融合架构,揭示多模态融合如何补偿LiDAR点稀疏性。

Comments Accepted to ECCV 2026. Including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31332 2026-07-01 cs.AI 新提交 50%

CryoACE: An Atom-centric Framework for Accurate and Automated Model Building in Cryo-EM

CryoACE: 面向冷冻电镜中精确自动模型构建的原子中心框架

Minzhang Li, Mingrui Li, Weichen Qin, Qihe Chen, Sixian Shen, Yuan Pei, Jiakai Zhang, Jingyi Yu

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出CryoACE框架,通过原子中心重建范式和无需训练的引导机制,实现冷冻电镜密度图中均质与异质结构的精确原子模型构建,显著优于现有方法。

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏