arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-23 至 2026-04-23 共收录 76 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 12 篇

2604.20146 2026-04-23 cs.IR cs.CL 83%

SAKE: Self-aware Knowledge Exploitation-Exploration for Grounded Multimodal Named Entity Recognition

SAKE: 为基于地面的多模态命名实体识别的自我意识知识利用-探索

Jielong Tang, Xujie Yuan, Jiayang Liu, Jianxing Yu, Xiao Dong, Lin Chen, Yunlai Teng, Shimin Di, Jian Yin

机构 * Sun Yat-sen University(中山大学) Shandong Normal University(山东师范大学) University of the Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CL

AI总结 针对开放世界社交媒体平台中长尾、快速演变和未见实体的挑战,SAKE提出一种端到端代理框架,通过自我意识推理和自适应搜索工具调用,结合内部知识利用和外部知识探索,提升多模态命名实体识别的精度与鲁棒性。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07474 2026-04-23 cs.CL cs.AI 81%

Cross-Modal Taxonomic Generalization in (Vision-) Language Models

跨模态分类泛化在(视觉-)语言模型中

Tianyang Xu, Marcelo Sandoval-Castaneda, Karen Livescu, Greg Shakhnarovich, Kanishka Misra

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了语言模型在无显性证据情况下通过跨模态泛化恢复超范畴知识的能力,发现语言模型能基于语言线索实现泛化。

Comments ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23733 2026-04-23 cs.CL cs.CV 81%

AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization

AdaMMS: 为异构多模态大语言模型设计的模型融合方法

Yiyang Du, Xiaochen Wang, Chi Chen, Jiabo Ye, Yiru Wang, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Zhifang Sui, Maosong Sun, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学) School of Software Microelectronics, Peking University(软件微电子学院,北京大学) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国) ModelTC Open Source Organization, Beijing, China(ModelTC开源组织,北京,中国)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出AdaMMS,一种针对异构多模态大语言模型的模型融合方法,通过映射、融合和搜索三个步骤解决异构模型融合难题,无需标注数据即可在视觉语言基准测试中超越现有方法。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19937 2026-04-23 cs.CV cs.AI 79%

Infection-Reasoner: A Compact Vision-Language Model for Wound Infection Classification with Evidence-Grounded Clinical Reasoning

Infection-Reasoner: 一种用于伤口感染分类的紧凑视觉-语言模型,结合证据支撑的临床推理

Palawat Busaranuvong, Reza Saadati Fard, Emmanuel Agu, Deepak Kumar, Shefalika Gautam, Bengisu Tulu, Diane Strong

机构 * Worcester Polytechnic Institute(沃斯特理工学院) UMass Chan Medical School(UMass Chan医学院)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Infection-Reasoner,一种紧凑的视觉-语言模型,通过两阶段训练提升伤口感染分类和推理生成的准确性与解释性,实验结果显示其在分类和推理质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07076 2026-04-23 cs.CV 70%

Retinex Meets Language: A Physics-Semantics-Guided Underwater Image Enhancement Network

Retinex 与语言的结合:一种物理-语义引导的水下图像增强网络

Shixuan Xu, Yabo Liu, Chao Huang, Junyu Dong, Xinghui Dong

机构 * State Key Laboratory of Physical Oceanography and the Faculty of Information Science and Engineering, Ocean University of China(物理海洋学国家重点实验室和中国海洋大学信息科学与工程学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen university(中山大学深圳校区计算机科学与技术学院)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出PSG-UIENet,结合Retinex光照校正与语言引导,通过构建LUIQD-TD数据集和设计ITSS损失函数,提升水下图像增强效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20806 2026-04-23 cs.CV cs.AI cs.CL 67%

OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model

OMIBench:用于大型视觉-语言模型在奥林匹克级多图像推理中的基准测试

Qiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang, Yizhuo Li, Jingqi Tong, Xiachong Feng, Libo Qin, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室) Harbin Institute of Technology(哈尔滨工业大学) Central South University(中南大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center(教育部文本计算与认知智能工程研究中心) Guizhou University(贵州大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OMIBench旨在评估多图像推理能力,包含生物、化学、数学和物理奥林匹克问题,提供精确和语义答案匹配的评估协议,实验显示现有模型性能存在显著差距。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03740 2026-04-23 cs.CV cs.CL 62%

CLIP-SVD: Efficient and Interpretable Vision-Language Adaptation via Singular Values

CLIP-SVD:通过奇异值实现高效且可解释的视觉-语言适应

Taha Koleilat, Hassan Rivaz, Yiming Xiao

机构 * Department of Electrical & Computer Engineering, Concordia University(康科迪亚大学电气与计算机工程系) Department of Computer Science & Software Engineering, Concordia University(康科迪亚大学计算机科学与软件工程系)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 CLIP-SVD通过奇异值微调方法,以0.04%的参数量实现高效视觉-语言模型适应,提升适应性能并保留泛化能力,在11个自然和10个生物医学数据集上取得最佳分类结果。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20544 2026-04-23 cs.CV cs.AI 62%

Evian: Towards Explainable Visual Instruction-tuning Data Auditing

Evian:迈向可解释的视觉指令微调数据审计

Zimu Jia, Mingjie Xu, Andrew Estornell, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ByteDance Seed(字节跳动种子)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Evian框架,通过分解评估模型响应的三大认知组件,解决数据审计中逻辑一致性与事实准确性不足的问题,验证高质量小规模数据优于大规模低质量数据。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20361 2026-04-23 cs.CV 57%

Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models

基于感知增强的视觉-语言模型的物体指称引导的注视路径预测

Rong Quan, Yantao Lai, Dong Liang, Jie Qin

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ScanVLA模型,通过融合视觉和语言特征提升物体指称引导的注视路径预测性能,引入历史增强解码器和冻结分割LoRA辅助定位,提升预测精度且不增加计算成本。

Comments ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25383 2026-04-23 cs.CV 57%

CLIP-RD: Relative Distillation for Efficient CLIP Knowledge Distillation

CLIP-RD:基于相对蒸馏的高效CLIP知识蒸馏

Jeannie Chung, Hanna Jang, Ingyeong Yang, Uiwon Hwang, Jaehyeong Sim

机构 * Ewha Womans University(东亚妇女大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出CLIP-RD框架,通过引入垂直关系蒸馏和交叉关系蒸馏方法,提升学生模型对教师模型多方向关系的保留能力,实现更高效的CLIP知识蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00800 2026-04-23 cs.CV 57%

Semantic-guided Gaussian Splatting for High-Fidelity Underwater Scene Reconstruction

语义引导的高斯点云法用于高保真水下场景重建

Zhuodong Jiang, Haoran Wang, Guoxi Huang, Brett Seymour, Nantheera Anantrasirichai

机构 * School of Computer Science, University of Bristol(布里斯托大学计算机科学学院) Submerged Resources Centre(水下资源中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SWAGSplatting框架,通过整合语义先验信息提升水下场景重建的保真度,采用语义一致性损失和自适应高斯点云重分配策略,有效解决光照不均问题,实验验证其在PSNR、SSIM和LPIPS指标上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20696 2026-04-23 cs.CV 57%

R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs

R-CoV:区域感知的验证链用于减轻LVLMs中的物体幻觉

Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr, Federico Tombari, Bernt Schiele

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) VIA Research Center(VIA研究中心) Google(谷歌)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 R-CoV通过区域感知的验证链方法,减轻LVLMs中的物体幻觉问题,采用六步流程,无需额外训练即可集成至多种LVLMs,实验表明有效缓解幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2604.20267 2026-04-23 cs.SD cs.AI 84%

ATIR: Towards Audio-Text Interleaved Contextual Retrieval

ATIR:面向音频-文本交错上下文检索

Tong Zhao, Chenghao Zhang, Yutao Zhu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 音频语音多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出ATIR任务,通过整合ASR、QA和检索数据集构建基准,解决现有音频检索数据集在语义检索上的局限,引入新的token压缩机制提升MLLM在ATIR中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23089 2026-04-23 cs.CV 79%

A Synchronized Audio-Visual Multi-View Capture System

同步的音频-视觉多视角捕捉系统

Xiangwei Shi, Gara Dorta, Ruud de Jong, Ojas Shirekar, Chirag Raman

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出一种同步音频-视觉多视角捕捉系统,通过统一时间架构整合多摄像机和多通道麦克风,实现高质量的音频视频同步记录,支持对话行为的精细分析与建模。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 6 篇

2604.18570 2026-04-23 cs.LG cs.AI cs.CL 81%

A multimodal and temporal foundation model for virtual patient representations at healthcare system scale

面向医疗系统规模的多模态与时间基础模型:虚拟患者表示

Andrew Zhang, Tong Ding, Sophia J. Wagner, Caiwei Tian, Ming Y. Lu, Rowland Pettit, Joshua E. Lewis, Alexandre Misrahi, Dandan Mo, Long Phi Le, Faisal Mahmood

机构 * Department of Pathology, Mass General Brigham, Harvard Medical School(病理学系,马萨诸塞州总医院与哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(癌症计划,哈佛-麻省理工Broad研究所) Data Science Program, Dana-Farber Cancer Institute(数据科学计划,达纳-法伯癌症研究所) Health Sciences and Technology, Harvard-MIT(健康科学与技术,哈佛-麻省理工) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛约翰·A·保罗森工程与应用科学学院,哈佛大学) Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(电气工程与计算机科学,麻省理工学院(MIT)) School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(计算机与通信科学学院,EPFL,瑞士洛桑)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Apollo模型,整合多模态和时间信息,构建虚拟患者表示,用于预测疾病风险、治疗反应等,展示其在医疗计算中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10417 2026-04-23 cs.CV cs.AI cs.LG 81%

Combo-Gait: Unified Transformer Framework for Multi-Modal Gait Recognition and Attribute Analysis

Combo-Gait:多模态和多任务框架用于多模态步态识别与属性分析

Zhao-Yang Wang, Zhimin Shao, Anirudh Nanduri, Basudha Pal, Laura McDaniel, Jieneng Chen, Rama Chellappa

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Maryland(马里兰大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出结合2D时间轮廓与3D SMPL特征的多模态框架,实现步态识别与年龄、BMI、性别等属性估计,通过统一Transformer融合多模态特征,提升鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07295 2026-04-23 cs.RO cs.AI 79%

Learning Multi-Modal Whole-Body Control for Real-World Humanoid Robots

多模态全身控制学习用于现实世界的人形机器人

Pranay Dugar, Aayam Shrestha, Fangzhou Yu, Bart van Marum, Alan Fern

机构 * Collaborative Robotics and Intelligent Systems Institute (CoRIS)(协同机器人与智能系统研究所)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出了一种多模态全身控制器,通过统一接口实现多样化的人形机器人行为控制,展示了在仿真和真实世界中的有效性。

Comments Website: https://masked-humanoid.github.io/mhc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20119 2026-04-23 cs.HC 78%

Zeitgeist-Aware Multimodal (ZAM) Datasets of Pro-Eating Disorder Short-Form Videos: An Idea Worth Researching

具有时间意识的多模态(ZAM)数据集:关于促进进食障碍短视频的研究想法

Eden Shaveet, Zefan Sramek, Yumi Hamamoto, Jing Du, Scott Griffiths, Thalia Zhang, Thalia Viranda, William Hornby, Flora Salim, Koji Yatani, Tanzeem Choudhury

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出ZAM数据集,旨在解决现有方法在识别促进进食障碍内容时的局限性,通过动态更新的多模态数据支持实时研究和模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15560 2026-04-23 astro-ph.EP astro-ph.IM cs.LG 78%

ExoNet: Calibrated Multimodal Deep Learning for TESS Exoplanet Candidate Vetting using Phase-Folded Light Curves, Stellar Parameters, and Multi-Head Attention

ExoNet:基于相位折叠光变曲线、恒星参数和多头注意力的校准多模态深度学习用于TESS行星候选体验证

Md. Rashadul Islam

机构 * Daffodil International University(达芙果国际大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 ExoNet通过融合相位折叠光变曲线、恒星参数和多头注意力机制,提升TESS行星候选体验证的准确率,实现高置信度信号和适居带候选体的识别。

Comments v2: Complete revision. Corrected systematic TOI/TIC cross-identification errors present in v1. Rebuilt inference pipeline using verified NASA Exoplanet Archive catalog (4,720 PC-disposition candidates, up from 200). Updated all results, figures, and performance metrics. 8 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20136 2026-04-23 cs.CV cs.AI 62%

IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory

IMPACT-CYCLE:一种基于合同的多智能体系统,用于长视频语义记忆的层次级监督修正

Weitong Kong, Di Wen, Kunyu Peng, David Schneider, Zeyun Zhong, Alexander Jaus, Zdravko Marinov, Jiale Wei, Ruiping Liu, Junwei Zheng, Yufan Chen, Lei Qi, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) INSAIT ETH Zurich(苏黎世联邦理工学院) Technical University of Munich(慕尼黑技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IMPACT-CYCLE,通过多智能体系统实现长视频语义记忆的层次级监督修正,提升下游推理性能并降低人工仲裁成本。

Comments 7 pages, 2 figures, code are available at https://github.com/MKong17/IMPACT_CYCLE

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 10 篇

2604.20429 2026-04-23 cs.CV 83%

Fast-then-Fine: A Two-Stage Framework with Multi-Granular Representation for Cross-Modal Retrieval in Remote Sensing

快速-精细:一种用于遥感跨模态检索的两阶段框架,具有多粒度表示

Xi Chen, Xu Chen, Xiangyang Jia, Xu Zhang, Shuquan Wei, Wei Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出一种两阶段框架,通过多粒度表示提升遥感跨模态检索效率与精度,采用文本无关召回和文本引导重排序阶段,减少计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08923 2026-04-23 cs.AI 83%

Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

相同内容,不同答案:多模态大语言模型中的跨模态不一致

Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

机构 * University of Amsterdam(阿姆斯特丹大学) City of Amsterdam(阿姆斯特丹市) University of Technology Nuremberg(努尔堡技术大学)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出REST和REST+基准测试,评估多模态大语言模型的跨模态不一致性。研究发现,即使在相同语义信息下,不同模态的推理结果也不一致,且OCR错误和视觉特征影响模型性能。

Comments Accepted at CVPR 2026. Angela van Sprang and Laurens Samson contributed equally as first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00798 2026-04-23 cs.CV cs.AI 81%

Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering

逐步多模态搜索与推理用于知识密集型视觉问答

Changin Choi, Wonseok Lee, Jungmin Ko, Wonjong Rhee

机构 * Interdisciplinary Program in Artificial Intelligence(人工智能交叉学科项目) Department of Intelligence and Information(智能与信息系) Samsung Advanced Institute of Technology(三星先进技术研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出PMSR框架,通过逐步构建结构化推理轨迹提升知识获取与综合能力,实验显示在六个基准测试中提升了检索召回率和端到端回答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20444 2026-04-23 cs.RO cs.AI cs.DB cs.LG 79%

VTouch++: A Multimodal Dataset with Vision-Based Tactile Enhancement for Bimanual Manipulation

VTouch++:一个用于双臂操作的多模态数据集,具有基于视觉的触觉增强

Qianxi Hua, Xinyue Li, Zheng Yan, Yang Li, Chi Zhang, Yongyao Li, Yufei Liu

机构 * Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) School of Astronautics, Harbin Institute of Technology(航天学院,哈尔滨工程大学)

专题命中 跨模态检索 :multimodal(title);cross-modal(abstract);分类 cs.AI

AI总结 本文提出VTouch++数据集,通过视觉触觉传感提供高保真的物理交互信号,采用矩阵式任务设计实现系统学习,并利用自动化数据采集管道确保可扩展性,通过跨模态检索和真实机器人评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20283 2026-04-23 cs.CL 79%

Multi-Perspective Evidence Synthesis and Reasoning for Unsupervised Multimodal Entity Linking

多视角证据综合与推理用于无监督多模态实体链接

Mo Zhou, Jianwei Wang, Kai Wang, Helen Paik, Ying Zhang, Wenjie Zhang

机构 * The University of New South Wales(新南威尔士大学) Shanghai Jiao Tong University(上海交通大学) University of Technology Sydney(技术大学悉尼)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MSR-MEL框架,通过多视角证据综合与推理提升无监督多模态实体链接性能,采用图神经网络和大语言模型进行证据整合与推理,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19176 2026-04-23 cs.LG cs.IR 78%

From Raw Features to Effective Embeddings: A Three-Stage Approach for Multimodal Recipe Recommendation

从原始特征到有效嵌入:一种多模态食谱推荐的三阶段方法

Jeeho Shin, Kyungho Kim, Kijung Shin

机构 * KAIST(韩国科学技术院)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出TESMR三阶段框架,通过内容、关系和学习增强多模态特征,提升食谱推荐性能,实验表明其在Recall@10上比现有方法高7-15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20460 2026-04-23 cs.CV 74%

CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs

CCTVBench:用于多模态大语言模型的对比一致性交通视频问答基准

Xingcheng Zhou, Hao Guo, Rui Song, Walter Zimmer, Mingyu Liu, André Schamschurko, Hu Cao, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 跨模态检索 :multimodal(title);分类 cs.CV

AI总结 CCTVBench通过真实事故视频与世界模型生成的反事实场景配对,提出对比一致性评估方法,揭示视频问答中对比一致性与标准指标间的显著差距,并引入C-TCD方法提升问答与一致性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08508 2026-04-23 cs.CV cs.CL 73%

Re:Verse -- Can Your VLM Read a Manga?

Re:Verse -- 能读懂漫画吗?

Aaditya Baranwal, Madhav Kataria, Naitik Agrawal, Yogesh S Rawat, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学) Indian Institute of Technology, Jodhpur(印度理工学院,朱达浦尔) Indian Institute of Technology, Varanasi(印度理工学院,瓦拉纳西)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文通过分析漫画叙事理解,揭示现有VLM在时间因果和跨面板连贯性上的不足,提出新的评估框架,系统研究长篇叙事理解能力。

Comments Accepted (oral) at ICCV (AISTORY Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 3820-3830

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14222 2026-04-23 cs.CR cs.AI 70%

Membership Inference for Contrastive Pre-training Models with Text-only PII Queries

对比预训练模型的成员推断与仅文本隐私信息查询

Ruoxi Cheng, Yizhong Ding, Jian Zhao, Hongyi Zhang, Haoxuan Ma, Tianle Zhang, Yiyan Huang, Xuelong Li

机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) School of Computing and Information Technology, Great Bay University(广东大湾区大学计算机与信息科技学院)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出UMID框架,通过仅文本模态推断多模态模型的记忆,有效检测隐私信息泄露,无需生物特征输入,提升隐私审计效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19386 2026-04-23 cs.CV 57%

Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval

Air-Know: 基于仲裁校准的知识内化鲁棒网络用于组合图像检索

Zhiheng Fu, Yupeng Hu, Qianyun Yang, Shiqi Zhang, Zhiwei Chen, Zixu Li

机构 * Shandong University(山东大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对组合图像检索中噪声三元组对应问题,Air-Know提出专家-代理-分流解耦范式,通过外部先验仲裁、专家知识内化和双流协调模块,提升鲁棒性和检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏