arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-12 至 2026-03-12 共收录 6 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2504.08937 2026-03-12 cs.GR cs.CV cs.LG eess.IV stat.ML 81%

Rethinking Few-Shot Image Fusion: Granular Ball Priors Enable General-Purpose Deep Fusion

重新思考少样本图像融合:粒度球先验使通用深度融合成为可能

Minjie Deng, Yan Wei, An Wu, Yuncan Ouyang, Hao Zhai, Qianyao Peng

专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV、eess.IV

AI总结 本文提出粒度球先验方法,通过自适应损失函数实现少样本图像融合,提升融合质量和模型效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音视频/视觉语言融合 2 篇

2603.10978 2026-03-12 cs.CV cs.AI 57%

GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations

GroundCount: 通过目标检测对视觉语言模型进行接地以缓解计数幻觉

Boyuan Chen, Minghao Shao, Siddharth Garg, Ramesh Karri, Muhammad Shafique

专题命中 音视频/视觉语言融合 :feature-level fusion(abstract);分类 cs.CV

AI总结 GroundCount通过目标检测提供空间接地,缓解视觉语言模型计数幻觉,提升准确率并减少推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12583 2026-03-12 eess.AS cs.SD 50%

Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion

鲁棒的音频视觉目标说话人提取与情感感知多注册融合

Zhan Jin, Bang Zeng, Peijun Yang, Jiarong Du, Wei Ju, Yao Tian, Juan Liu, Ming Li

机构 * School of Computer Science, Wuhan University, Wuhan, China(1 武汉大学计算机学院,武汉,中国) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(2 香港中文大学(深圳)人工智能学院,中国) School of Artificial Intelligence, Wuhan University, Wuhan, China(3 武汉大学人工智能学院,武汉,中国) School of Cyber Science and Engineering, Wuhan University, Wuhan, China(4 武汉大学网络科学与工程学院,武汉,中国) Digital Innovation Research Center, Duke Kunshan University, Kunshan, China(5 香港中文大学(深圳)数字创新研究中心,中国) AI Center, OPPO, Beijing, China(6 OPPO人工智能中心,北京,中国)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出一种鲁棒的音频视觉目标说话人提取方法,通过情感感知的多注册融合技术,在模态缺失情况下提升提取性能和鲁棒性。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 3 篇

2603.09689 2026-03-12 cs.CV cs.AI 57%

AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering

AutoViVQA:一个大规模自动构建的数据集用于越南语视觉问答

Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出AutoViVQA数据集,利用变压器架构进行越南语视觉问答,结合文本和视觉预训练,并在多语言环境下系统比较自动评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10623 2026-03-12 eess.AS cs.LG cs.SD 50%

Geo-ATBench: A Benchmark for Geospatial Audio Tagging with Geospatial Semantic Context

Geo-ATBench: 一个具有地理语义上下文的地理音频标签基准

Yuanbo Hou, Yanru Wu, Qiaoqiao Ren, Shengchen Li, Stephen Roberts, Dick Botteldooren

专题命中 融合架构与评测 :decision-level fusion(abstract)

AI总结 Geo-ATBench通过引入地理语义上下文提升音频标签任务的性能,提供了一个可重复的地理音频融合框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12192 2026-03-12 cs.GR 50%

SDGraph: Multi-Level Sketch Representation Learning by Sparse-Dense Graph Architecture

SDGraph:通过稀疏-密集图架构进行多级草图表示学习

Xi Cheng, Pingfa Feng, Mingyu Fan, Zhichao Liao, Hang Cheng, Long Zeng

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 SDGraph通过稀疏-密集图架构实现多级草图表示学习,提升草图分类、检索和生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏