arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 495 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 495 篇

2604.05947 2026-04-08 cs.CV 57%

Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition

多模态专家混合与整体标记学习用于驾驶员行为识别的细粒度多模态视觉分析

Tianyi Liu, Yiming Li, Wenqian Wang, Jiaojiao Wang, Chen Cai, Yi Wang, Kim-Hui Yap

机构 * Nanyang Technological University(南洋理工大学) Singapore University of Technology and Design(新加坡科技设计大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出MoME框架与HTL策略,通过类标记和时空标记提升多模态学习的专家细化与知识传递,验证了在驾驶员行为识别任务中优于单模态和多模态基线的方法。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03198 2026-04-06 cs.CV cs.AI 57%

FLEX: A Largescale Multimodal, Multiview Dataset for Learning Structured Representations for Fitness Action Quality Assessment

FLEX:一个大规模多模态、多视角数据集,用于学习结构化表示以评估健身动作质量

Hao Yin, Lijun Gu, Paritosh Parmar, Lin Xu, Tianxiao Guo, Xiujin Liu, Weiwei Fu, Yang Zhang, Tianyou Zheng

机构 * School of Biomedical Engineering (Suzhou), USTC(中国科学技术大学苏州生物医学工程学院) Suzhou Institute of Biomedical Engineering and Technology, CAS(中国科学院苏州生物医学工程技术研究所) Institute of High-Performance Computing, A*STAR, Singapore(新加坡科技研究局高性能计算研究所) School of Psychology, Beijing Sports University(北京体育大学心理学院) School of Competitive Sports, Beijing Sports University(北京体育大学竞技体育学院) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 FLEX数据集通过多模态融合和结构化知识图谱提升健身动作质量评估的准确性与解释性,支持跨模态预测和生物力学导向的表示学习。

Comments Dataset and code are available at https://github.com/HaoYin116/FLEX . Link to Project page https://haoyin116.github.io/FLEX_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29676 2026-04-01 cs.LG cs.CL cs.CV 57%

A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models

大型视觉-语言模型的全面信息分解分析

Lixin Xiu, Xufang Luo, Hideki Nakayama

机构 * The University of Tokyo(东京大学) Microsoft Research(微软研究院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文通过信息分解方法分析大型视觉-语言模型的信息谱,揭示任务模式和模型策略,为模型设计提供新视角。

Comments Accepted at ICLR 2026. Project page: https://riishin.github.io/pid-lvlm-iclr26/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23276 2026-03-25 cs.CV 57%

CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection

CCF:互补协作融合用于领域泛化的多模态3D目标检测

Yuchen Wu, Kun Wang, Yining Pan, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出CCF方法,通过查询解耦损失、LiDAR引导深度先验和互补跨模态掩码,提升多模态3D目标检测在跨领域场景下的鲁棒性,实验表明优于现有方法且保持源域性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14361 2026-03-17 cs.CV 57%

BROTHER: Behavioral Recognition Optimized Through Heterogeneous Ensemble Regularization for Ambivalence and Hesitancy

BROTHER: 通过异质性集成正则化优化行为识别以应对矛盾与犹豫

Alexandre Pereira, Bruno Fernandes, Pablo Barros

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出BROTHER框架,通过异质集成正则化方法,结合视觉、音频和语言数据,提升对矛盾与犹豫等复杂行为状态的识别能力,采用PSO硬投票集成策略,实现宏F1分数达0.7465。

Comments 5 pages, 2 figures, 3 tables, Ambivalence/Hesitancy (AH) Video Recognition Challenge, ABAW10th, CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13719 2026-03-17 cs.CV 57%

Sparse-Dense Mixture of Experts Adapter for Multi-Modal Tracking

稀疏-密集专家混合适配器用于多模态跟踪

Yabin Zhu, Jianqi Li, Chenglong Li, Jiaxiang Wang, Chengjie Gu, Jin Tang

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出稀疏-密集专家混合适配器框架,通过稀疏MoE和密集共享MoE有效建模多模态特征,结合Gram基于语义对齐超图融合模块,提升多模态跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11468 2026-03-13 cs.MM cs.AI cs.SD 57%

Stage-Adaptive Reliability Modeling for Continuous Valence-Arousal Estimation

面向连续情感估值的阶段自适应可靠性建模

Yubeen Lee, Sangeun Lee, Junyeop Cha, Eunil Park

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 本文提出SAGE框架,通过阶段自适应可靠性建模提升多模态环境下连续情感估值的稳定性与准确性。

Comments 8 pages, 3 figures, 2 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10978 2026-03-12 cs.CV cs.AI 57%

GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations

GroundCount: 通过目标检测对视觉语言模型进行接地以缓解计数幻觉

Boyuan Chen, Minghao Shao, Siddharth Garg, Ramesh Karri, Muhammad Shafique

专题命中 音视频/视觉语言融合 :feature-level fusion(abstract);分类 cs.CV

AI总结 GroundCount通过目标检测提供空间接地,缓解视觉语言模型计数幻觉,提升准确率并减少推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02767 2026-03-10 cs.CV cs.AI 57%

ITO: Images and Texts as One via Synergizing Multiple Alignment and Training-Time Fusion

通过协同多模态对齐和训练时融合实现图像与文本一体化:ITO

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zonglin Zhao, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He

机构 * School of Computer Science(计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Li Auto Inc.(力汽车公司) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究院,中国科学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 ITO通过协同多模态对齐与训练时融合机制,提升图像与文本表示的一致性,有效解决模态间结构化交互问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05465 2026-03-06 cs.CV 57%

HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token

在不生成单个标记的情况下检测视觉-语言模型中的幻觉

Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun, Jiawei Zhou

机构 * Stony Brook University(石英溪大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 通过探测模型内部表示在生成前检测视觉-语言模型的幻觉风险,展示不同架构中信息丰富的层和模态差异,并验证轻量级探测器在提升安全性和效率方面的潜力。

Journal ref The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01536 2026-03-03 cs.IR cs.MM 57%

CLEAR: Null-Space Projection for Cross-Modal De-Redundancy in Multimodal Recommendation

CLEAR: 多模态去冗余中的跨模态空域投影

Hao Zhan, Yihui Wang, Yonghui Yang, Danyang Yue, Yu Wang, Pengyang Shao, Fei Shen, Fei Liu, Le Wu

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 CLEAR通过显式减少跨模态冗余提升多模态推荐性能,采用子空间投影方法增强表示学习动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23994 2026-03-02 cs.LG cs.AI cs.CV 57%

MINT: Multimodal Imaging-to-Speech Knowledge Transfer for Early Alzheimer's Screening

MINT:多模态影像到语音知识迁移用于早期阿尔茨海默病筛查

Vrushank Ahire, Yogesh Kumar, Anouck Girard, M. A. Ganaie

机构 * Department of CSE, Indian Institute of Technology Ropar(印度理工学院罗帕尔计算机科学与工程系) Embry-Riddle Aeronautical University(埃姆布里-瑞尔德航空大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 MINT通过多模态知识迁移,利用MRI生物标志物提升语音识别的阿尔茨海默病早期筛查性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16147 2026-02-19 cs.LG cs.AI cs.HC eess.SP 57%

ASPEN: Spectral-Temporal Fusion for Cross-Subject Brain Decoding

ASPEN:跨受试者脑解码的频谱-时间融合

Megan Lee, Seung Ha Hwang, Inhyeok Choi, Shreyas Darade, Mengchun Zhang, Kateryna Shapovalenko

机构 * Carnegie Mellon University(卡内基梅隆大学) Kyung Hee University(Kyung Hee大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) University of Pittsburgh(匹兹堡大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 eess.SP

AI总结 ASPEN通过频谱-时间融合实现跨受试者脑解码,利用乘法融合提升跨模态一致性,有效提升未见受试者准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21648 2026-02-10 cs.CV cs.CY cs.HC 57%

CAF-Mamba: Mamba-Based Cross-Modal Adaptive Attention Fusion for Multimodal Depression Detection

CAF-Mamba:基于Mamba的跨模态自适应注意力融合用于多模态抑郁症检测

Bowen Zhou, Marc-André Fiedler, Ayoub Al-Hamadi

机构 * Neuro-Information Technology Group (NIT) IIKT, Otto von Guericke University Magdeburg Magdeburg, Germany(奥托·冯·格里克大学马格德堡分校神经信息技术小组(NIT)IIKT)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 CAF-Mamba通过基于Mamba的跨模态自适应注意力融合框架,提升多模态抑郁症检测的性能。

Comments The paper contains a total of 5 pages and 3 figures. This paper has been accepted for publication in the proceedings of 2026 IEEE ICASSP Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00570 2026-02-03 cs.CV 57%

GLAD: Generative Language-Assisted Visual Tracking for Low-Semantic Templates

GLAD: 生成式语言辅助低语义模板视觉跟踪

Xingyu Luo, Yidong Cai, Jie Liu, Jie Tang, Gangshan Wu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 GLAD通过生成式多模态融合提升低语义模板视觉跟踪性能,实现更高效的多模态特征融合与语义增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21675 2026-01-30 cs.MM 57%

Rethinking Fusion: Disentangled Learning of Shared and Modality-Specific Information for Stance Detection

重新思考融合:为立场检测学习解耦的共享信息和模态特定信息

Zhiyu Xie, Fuqiang Niu, Genan Dai, Qianlong Wang, Li Dong, Bowen Zhang, Hu Huang

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.MM

AI总结 DiME通过解耦共享和模态特定信息提升多模态立场检测性能,采用对比学习和余弦对齐的专家模块实现更准确的立场预测。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18396 2026-01-27 eess.AS cs.CL cs.CV cs.SD 57%

Noise-Robust AV-ASR Using Visual Features Both in the Whisper Encoder and Decoder

利用视觉特征在Whisper编码器和解码器中提升抗噪的音频视觉自动语音识别

Zhengyang Li, Thomas Graave, Björn Möller, Zehang Wu, Matthias Franz, Tim Fingscheidt

机构 * Technische Universit\"at Braunschweig Institute for Communications Technology Schleinitzstr. 22, 38106 Braunschweig, Germany

专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV

AI总结 本研究提出在Whisper编码器和解码器中同时使用视觉特征,以提升音频视觉识别在噪声环境下的鲁棒性,实验表明在不同噪声条件下均取得显著改进。

Comments accepted at ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06515 2026-01-27 cs.CV 57%

BigTokDetect: A Clinically-Informed Vision-Language Modeling Framework for Detecting Pro-Bigorexia Videos on TikTok

BigTokDetect: 一种临床指导的视觉-语言建模框架,用于检测TikTok上促进大肌肉畸形行为的视频

Minh Duc Chu, Kshitij Pawar, Zihao He, Roxanna Sharifi, Ross Sonnenblick, Magdalayna Curry, Laura D'Adamo, Lindsay Young, Stuart B Murray, Kristina Lerman

机构 * USC Information Sciences Institute(USC信息科学研究所) Keck School of Medicine, USC(USC凯克医学院) Department of Clinical Psychology, Drexel University(德雷塞尔大学临床心理学系) Department of Psychiatry and Biobehavioral Sciences, UCLA(UCLA精神病学与生物行为科学系)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 BigTokDetect通过临床指导的视觉-语言模型,检测TikTok上促进大肌肉畸形行为的视频,建立了可扩展的有害内容缓解框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15139 2026-01-27 cs.CV 57%

Unified Cross-Modal Attention-Mixer Based Structural-Functional Connectomics Fusion for Neuropsychiatric Disorder Diagnosis

统一的跨模态注意力-混合器基于结构-功能连接组融合的神经精神疾病诊断

Badhan Mazumder, Lei Wu, Vince D. Calhoun, Dong Hye Ye

机构 * Department of Computer Science, Georgia State University(计算机科学系,佐治亚州立大学) Tri-Institutional Center for Translational Research in Neuroimaging and Data Science (TReNDS), Georgia State University, Georgia Institute of Technology, and Emory University(跨机构神经影像与数据科学转化研究中心(TReNDS),佐治亚州立大学、佐治亚理工学院和埃默里大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出ConneX方法,通过统一的跨模态注意力和MLP-Mixer实现结构-功能连接组的多模态融合,提升神经精神疾病诊断性能。

Comments Published in the Proceedings of the 47th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2025). IEEE Xplore. DOI: 10.1109/EMBC58623.2025.11254194

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23243 2026-01-12 cs.CV 57%

Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism

遥感图像的多模态解释:动态分辨率输入策略与多尺度视觉-语言对齐机制

Siyu Zhang, Lianlei Shan, Runhe Qiu

机构 * Tsinghua University(清华大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出动态分辨率输入策略与多尺度视觉-语言对齐机制,提升遥感图像多模态解释的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06282 2026-01-09 cs.CV 57%

From Dataset to Real-world: General 3D Object Detection via Generalized Cross-domain Few-shot Learning

从数据集到现实世界:通过通用跨领域少样本学习实现通用3D目标检测

Shuangzhi Li, Junlong Shen, Lei Ma, Xingyu Li

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出通用跨领域少样本学习方法,通过融合2D语义与3D空间推理,实现对现实世界中常见和新类目标的高效检测。

Comments The latest version refines the few-shot setting on common classes, enforcing a stricter object-level definition

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01339 2026-01-06 cs.CV 57%

Achieving Fine-grained Cross-modal Understanding through Brain-inspired Hierarchical Representation Learning

通过脑启发的分层表征学习实现细粒度跨模态理解

Weihang You, Hanqi Jiang, Yi Pan, Junhao Chen, Tianming Liu, Fei Dou

机构 * School of Computing, University of Georgia, Athens, GA, USA(计算学院,佐治亚大学,亚特兰大,GA,USA)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 NeuroAlign通过脑启发的分层表征学习,在fMRI-视频对齐中实现细粒度跨模态理解,提升跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21135 2025-12-25 cs.CV cs.AI 57%

TGC-Net: A Structure-Aware and Semantically-Aligned Framework for Text-Guided Medical Image Segmentation

TGC-Net:一种结构感知且语义对齐的文本引导医学图像分割框架

Gaoren Lin, Huangxuan Zhao, Yuan Xiong, Lefei Zhang, Bo Du, Wentao Zhu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Orthopedics, Tongji Hospital, Tongji Medical College, Huazhong University of Science(同济大学同济医学学院骨科部,华中科技大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 TGC-Net通过引入语义-结构协同编码器、域增强文本编码器和视觉-语言校准模块,提升文本引导的医学图像分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20898 2025-12-25 cs.CV cs.AI 57%

DGSAN: Dual-Graph Spatiotemporal Attention Network for Pulmonary Nodule Malignancy Prediction

DGSAN:双图时空注意力网络用于肺结节恶性预测

Xiao Yu, Zhaojie Fang, Guanyu Zhou, Yin Shen, Huoling Luo, Ye Li, Ahmed Elazab, Xiang Wan, Ruiquan Ge, Changmiao Wang

专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV

AI总结 DGSAN通过双图时空注意力网络融合多模态数据,提升肺结节恶性预测的准确性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22447 2025-12-16 cs.MM 57%

Angle-Optimized Partial Disentanglement for Multimodal Emotion Recognition in Conversation

对话中多模态情感识别的视角优化部分解耦

Xinyi Che, Wenbo Wang, Yuanbo Hou, Mingjie Xie, Qijun Zhao, Jian Guan

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 本文提出AO-FL框架,通过自适应角度优化实现对话中多模态情感识别的共享与特定特征部分解耦,提升情感识别性能。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11901 2025-12-16 cs.CV cs.LG 57%

CLARGA: Multimodal Graph Representation Learning over Arbitrary Sets of Modalities

CLARGA:任意模态集合上的多模态图表示学习

Santosh Patapati

机构 * Santosh Patapati(独立研究者)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 CLARGA是一种通用的多模态融合架构,通过构建注意力加权图实现多模态表示学习,适用于任意模态集合,具有高效的融合能力和良好的鲁棒性。

Comments WACV; Supplementary material is available on CVF proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23316 2025-12-16 cs.CV 57%

C3-OWD: A Curriculum Cross-modal Contrastive Learning Framework for Open-World Detection

C3-OWD: 一种用于开放世界检测的课程跨模态对比学习框架

Siheng Wang, Zhengdao Li, Yanshu Li, Canran Xiao, Haibo Zhan, Zhengtao Yao, Xuzhi Zhang, Jiale Kang, Linshan Li, Weiming Liu, Zhikang Dong, Jifeng Shen, Junhao Dong, Qiang Sun, Piotr Koniusz

专题命中 音视频/视觉语言融合 :visible-infrared(abstract);分类 cs.CV

AI总结 C3-OWD提出一种课程跨模态对比学习框架,通过预训练和视觉-语言对齐提升目标检测的鲁棒性和泛化能力。

Comments one of the authors doesn't agree any more

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06940 2025-12-16 cs.CV 57%

CineBrain: A Large-Scale Multi-Modal Brain Dataset During Naturalistic Audiovisual Narrative Processing

CineBrain: 一种大规模多模态大脑数据集用于自然视听叙事处理

Jianxiong Gao, Yichang Liu, Baofeng Yang, Jianfeng Feng, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 CineBrain通过多模态融合编码器和神经潜在解码器实现动态视频重建,利用fMRI和EEG互补优势提升视觉保真度,并揭示听觉输入对视觉感知的影响。

Comments Project Page: https://jianxgao.github.io/CineBrain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10376 2025-12-12 cs.CV 57%

RaLiFlow: Scene Flow Estimation with 4D Radar and LiDAR Point Clouds

RaLiFlow: 基于4D雷达和激光雷达点云的场景流估计

Jingyun Fu, Zhiyu Xiang, Na Zhao

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 RaLiFlow是首个联合4D雷达和激光雷达的场景流学习框架,通过动态感知双向跨模态融合模块和精心设计的损失函数实现高效的雷达-激光雷达融合。

Comments Accepted by AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01636 2025-12-02 cs.CV 57%

Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval

联合视觉-语言空间中的生成编辑用于零样本复合图像检索

Xin Wang, Haipeng Zhang, Mang Li, Zhaohui Xia, Yueguo Chen, Yu Zhang, Chunyu Wei

机构 * Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 Fusion-Diff通过联合视觉-语言空间中的生成编辑策略,实现了高效的零样本复合图像检索,提升了多模态对齐的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏