arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-03 至 2026-06-03 共收录 108 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2606.03693 2026-06-03 cs.CL cs.CV 73%

Does Language Shift Break Medical Vision-Language Models? Indonesian Radiology Visual Question Answering Case Study

语言转换会破坏医学视觉语言模型吗?印度尼西亚放射学视觉问答案例研究

Pieter Christy Yan Yudhistira, Dzaki Rafif Malik, Novanto Yudistira

机构 * Intelligent System Laboratory, Faculty of Computer Science Brawijaya University(智能系统实验室,计算机科学学院布拉维亚大学)

专题命中 图文多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL

AI总结 本研究通过构建印尼语放射学VQA数据集IndoRad-VQA,评估医学视觉语言模型在非英语临床语言下的鲁棒性,发现英语与印尼语设置间存在8-25%的性能差距,表明需要更包容的多语言评估。

Comments accepted to MMFM-BIOMED Workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03610 2026-06-03 cs.CV 57%

SkelHCC: A Hyperbolic CLIP-Driven Cache Adaptation Framework for Skeleton-based One-Shot Action Recognition

SkelHCC:一种基于双曲CLIP驱动的缓存自适应框架用于骨架基础的一次动作识别

Yanan Liu, Anqi Zhu, Jingmin Zhu, Jun Liu, Hossein Rahmani, Mohammed Bennamoun, Farid Boussaid, Dan Xu, Qiuhong Ke

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出SkelHCC框架,利用双曲几何编码骨架层次结构,结合CLIP和免训练缓存实现一次动作识别,在三个数据集上达到最优。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02947 2026-06-03 cs.LG cs.CV 57%

BYORn: Bootstrap Your Own Responses to Defend Large Vision-Language Models Against Backdoor Attacks

BYORn:自举你的响应以防御大型视觉-语言模型的后门攻击

Ivan Sabolić, Marin Oršić, Josip Šarić, Sven Lončarić

机构 * University of Rijeka(里耶卡大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 提出BYORn框架,通过识别并替换语义不合理的后门目标响应,打破触发器与目标输出的关联,从而在保持干净任务性能的同时提升对后门攻击的鲁棒性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15748 2026-06-03 cs.CV 57%

Concept-wise Attention for Fine-grained Concept Bottleneck Models

面向细粒度概念瓶颈模型的概念级注意力机制

Minghong Zhong, Guoshuai Zou, Kanghao Chen, Dexia Chen, Ruixuan Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 提出概念级注意力机制(CoAt-CBM),通过可学习概念视觉查询和概念对比优化,实现自适应细粒度图像-概念对齐,解决预训练偏差和概念互斥问题,显著提升性能。

Comments Withdrawn by authors for revision and improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03087 2026-06-03 cs.LG 50%

Learning to Solve, Forgetting to Retain: Correct-Set Turnover in RLVR

学会解决,忘记保留:RLVR中的正确集更替

Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Peng Fu, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) JD.COM(京东)

专题命中 图文多模态 :image-text(abstract)

AI总结 针对强化学习可验证奖励(RLVR)中模型遗忘已解决问题的问题,提出正确集更替现象和修复窗口原则,并设计保留感知的回顾机制\method{},通过零额外开销的预部署批量替换提升多模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 12 篇

2601.14569 2026-06-03 cs.CL cs.LG 85%

Social Caption: Evaluating Social Understanding in Multimodal Models

Social Caption: 评估多模态模型的社会理解能力

Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe, Louis-Philippe Morency

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02724 2026-06-03 cs.CV cs.AI 84%

AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes

AVTrack: 以人为中心的复杂场景中的视听跟踪

Yaoting Wang, Yun Zhou, Zipei Zhang, Henghui Ding

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有视听跟踪数据集局限于简单场景的问题,提出AVTrack数据集,通过包含相机运动、视觉遮挡和位置变化等复杂动态条件,评估并提升鲁棒的人为中心视听场景理解。

Comments 19 pages, 10 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03747 2026-06-03 eess.AS eess.SP 83%

Stable Hybrid Cross-Attention Fusion for Audio-Visual Event Recognition

用于音视频事件识别的稳定混合交叉注意力融合

Parinaz Binandeh Dehaghani, Danilo Pena, A. Pedro Aguiar

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 eess.AS

AI总结 提出一种结合VideoMAE和AST的混合交叉注意力融合框架,通过FiLM音频条件、双向交叉注意力融合和多模态Transformer编码,在AVE数据集上达到91.74%的验证准确率和83.85%的测试准确率。

Comments 6 pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02642 2026-06-03 eess.AS cs.AI cs.CV cs.LG cs.MM cs.SD 83%

SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

SVHalluc: 音频-视觉大语言模型中的语音-视觉幻觉基准测试

Chenshuang Zhang, Kyeong Seon Kim, Chengxin Liu, Tae-Hyun Oh

机构 * KAIST(韩国国立信息通信研究院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 针对音频-视觉大语言模型中的语音-视觉幻觉问题,提出SVHalluc基准,从语义和时间两个维度评估模型将语音内容与视觉信号对齐的能力,发现现有模型存在跨模态理解局限。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09685 2026-06-03 cs.IR cs.AI cs.MM cs.SD eess.AS 82%

TalkPlayData 2: An Agentic Synthetic Data Pipeline for Multimodal Conversational Music Recommendation

TalkPlayData 2:用于多模态对话式音乐推荐的智能体合成数据流水线

Keunwoo Choi, Seungheon Doh, Juhan Nam

机构 * KAIST(韩国科学技术院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 提出TalkPlayData 2,一个由智能体数据流水线生成的多模态对话式音乐推荐合成数据集,通过多角色大语言模型模拟对话并覆盖多种场景,以支持生成式推荐模型训练。

Comments 2025-10-08: updating the stat table with the latest numbers. updated the abstract per the latest license terms

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03672 2026-06-03 cs.SD cs.MM 79%

Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

Foley-Omni:从任务级音频合成到完整视频配乐生成的统一多模态生成模型

Ye Tao, Lupeng Liu, Xuenan Xu, Jiasun Feng, Jiarui Wang, Ying Qin, Shuiyang Mao, Wei Liu, Shuai Wang

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Video Rebirth Shanghai Jiao Tong University(上海交通大学) Beijing Jiaotong University(北京交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 提出Foley-Omni统一多模态音频生成模型,通过共享潜变量生成过程联合建模语音、音效和音乐,实现从孤立任务级合成到完整视频配乐生成,并构建V2ST-Bench基准进行综合评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03168 2026-06-03 cs.CV 79%

JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation

JAVEDIT: 联合音频-视觉指令引导视频编辑与智能体数据策展

Yinan Chen, Chuming Lin, Zhennan Chen, Yuxiang Zeng, Junwei Zhu, Yali Bi, Xijie Huang, Chengming Xu, Donghao Luo, Zhucun Xue, Xiaobin Hu, Chengjie Wang, Yong Liu, Jiangning Zhang, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Nanjing University(南京大学) University of Auckland(奥克兰大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 针对联合音频-视觉编辑缺乏数据集和基准的问题,提出首个大规模高质量数据集JAVEdit-100k、基准JAVEditBench以及基线模型JAVEdit,在六项指标中五项超越所有基线。

Comments Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/JAVEdit Code: https://github.com/RyanChenYN/JAVEdit Dataset: https://huggingface.co/datasets/Coraxor/JAVEdit-100k

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13713 2026-06-03 cs.IR cs.SD eess.AS 79%

TALKPLAY: Multimodal Music Recommendation with Large Language Models

TALKPLAY: 基于大语言模型的多模态音乐推荐

Seungheon Doh, Keunwoo Choi, Juhan Nam

机构 * KAIST(韩国科学技术院) talkpl.ai

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 提出TALKPLAY系统,通过将推荐转化为token生成问题,利用大语言模型处理多模态音乐特征,实现端到端对话式推荐,显著优于单模态方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03540 2026-06-03 cs.CV 70%

Attend to Anything: Foundation Model for Unified Human Attention Modeling

关注一切:统一人类注意力建模的基础模型

Wenzhuo Zhao, Ronghao Xian, Keren Fu, Qijun Zhao

机构 * College of Computer Science, Sichuan University, Chengdu, 610065, China(四川大学计算机学院) National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University, Chengdu, 610065, China(合成视觉基础科学国家重点实验室)

专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出 Attend to Anything Model (AAM),一种多模态基础模型,通过层次化语言提示和双曲空间嵌入统一图像、视频和视听任务中的注意力建模,并在16个基准上平均提升6%,视频推理加速约4倍。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03874 2026-06-03 cs.CV cs.RO 57%

DyaPlex: Full-Duplex Speech-Motion Model for Dyadic Interaction

DyaPlex: 用于二元交互的全双工语音-运动模型

Koki Nagano, Hongyu Liu, Seonwook Park, Tianye Li, Amrita Mazumdar, Christian Jacobsen, Shengze Wang, Michael Stengel, Rajarshi Roy, Ka Chun Cheung, Simon See, Shalini De Mello

机构 * NVIDIA HKUST(香港科技大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出DyaPlex,一种流式全双工语音-运动模型,通过双塔Transformer架构和统一二元令牌交织机制,实现同步多模态交互,在单体和二元交互基准上达到最优性能。

Comments Project page: https://research.nvidia.com/labs/amri/projects/DyaPlex

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03614 2026-06-03 cs.MM 57%

OmniHalluc-L: Counterfactual Benchmarking and Modality-Perturbation Reliability Calibration for Long-Form Omni Hallucination

OmniHalluc-L:长形式全模态幻觉的反事实基准测试与模态扰动可靠性校准

Zixuan Dong, Jiafu Tang, Zhide Lei, Zhe Cao, Zijie Zhang, Yanghai Wang, Shihao Li, Xiaodong Wang, Baoyun Peng, Jiaheng Liu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM

AI总结 针对长视频全模态助手将真实证据错误绑定到错误说话者、时刻或模态的“几乎正确”错误,提出反事实事件绑定协议构建配对支持/反事实声明,并基于此构建基准OmniHalluc-L,同时提出模态扰动可靠性校准方法(Modality-Perturbation Reliability Calibration)在不更新主干网络的情况下提升模型性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16808 2026-06-03 cs.CV 57%

BioLip: Language-Generalizable Lip-Sync Deepfake Detection via Biomechanical Constraint Violation Modeling

BioLip: 通过生物力学约束违反建模实现语言泛化的唇同步深度伪造检测

Hao Chen, Junnan Xu

机构 * Independent Researcher(独立研究者)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 针对现有检测方法在生成器或语言迁移下失效的问题,提出基于唇部运动生物力学约束的轻量级三分支网络,仅利用地标坐标检测唇同步伪造,在零样本设置下对未见生成器和多种语言表现鲁棒。

Comments 13 pages, 5 figures. Keywords: Deepfake detection, lip-sync forgery, biomechanical constraints, landmark kinematics, cross-lingual generalization, video forensics, privacy-preserving inference, compression robustness

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2606.03920 2026-06-03 cs.CV 85%

Benchmarking Visual State Tracking in Multimodal Video Understanding

多模态视频理解中的视觉状态追踪基准测试

Sihyun Yu, Nanye Ma, Pinzhi Huang, Hyunseok Lee, Shusheng Yang, June Suk Choi, Ellis Brown, Oscar Michel, Boyang Zheng, Jinwoo Shin, Saining Xie

机构 * New York University(纽约大学) KAIST(韩国科学技术院)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出VSTAT基准,通过需要连续感知和整合整个视频流的问题评估多模态大语言模型的视觉状态追踪能力,发现当前模型远低于人类表现,失败主要源于视觉感知而非文本推理。

Comments Website: https://vision-x-nyu.github.io/vstat-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03173 2026-06-03 cs.CY cs.LG cs.SI 78%

Auditing Engagement Incentives in the Kidfluencer Ecosystem: A Multimodal Weak Supervision Approach

审计儿童网红生态系统中的参与激励:一种多模态弱监督方法

Zijing Wei, Chao Peter Yang, Xuanjie Chen

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本研究采用多模态弱监督方法审计YouTube儿童网红频道,发现剥削信号与观看量显著正相关,且表演性劳动、情感诱饵和隐私侵犯能带来参与度溢价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02994 2026-06-03 cs.CV 74%

Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation

Video-OPD:通过在线策略蒸馏实现多模态大语言模型在时序视频定位中的高效后训练

Jiaze Li, Hao Yin, Haoran Xu, Boshen Xu, Wenhui Tan, Zewen He, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 提出Video-OPD框架,利用在线策略蒸馏和教师验证分歧聚焦课程,以高效后训练多模态大语言模型进行时序视频定位,克服稀疏奖励和高计算开销问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03099 2026-06-03 cs.CL cs.AI 73%

PhotoCraft: Agentic Reasoning with Hierarchical Self-Evolving Memory for Deep Image Search

PhotoCraft: 具有层次自进化记忆的深度图像搜索代理推理

Kailin Lyu, Zhiqiang Yuan, Jianwei He, Qiwei Yan, Xuanbo Su, Nanxing Hu, Yang Liu, Ce Hao, Shengqian Qin, Lianyu Hu, Jinchao Zhang, Jie Zhou

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc.(微信AI模式识别中心,腾讯公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 提出PhotoCraft,一种无需训练的分层记忆系统,通过工作、情景和语义记忆增强多模态大语言模型,实现深度图像搜索中的多步推理和知识迁移,在DISBench上提升检索性能达18.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03112 2026-06-03 stat.AP cs.LG 50%

Trans GAN-WT: A Feature Extraction and Interactive Learning-Based Anomaly Detection Model for Wind Turbine Time Series Data

Trans GAN-WT: 一种基于特征提取和交互学习的风电机组时间序列数据异常检测模型

Jingzhe Kang

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出融合Transformer和生成对抗网络的异常检测模型TransGAN-WT,通过放大重构误差、自回归多模态特征提取和时序特征交互学习,在真实风电机组数据集上F1达96.10%,误报率仅0.06%。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 9 篇

2606.02629 2026-06-03 q-bio.QM cs.AI cs.LG 83%

Enhancing Protein-Protein Interaction Prediction with Hierarchical Motif-based Multimodal Protein Embedding

基于层次化基序的多模态蛋白质嵌入增强蛋白质-蛋白质相互作用预测

Zaifei Yang, Samuel Ping-Man Choi, James Kwok

机构 * National University of Singapore(新加坡国立大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 提出MMM-PPI模型,通过层次化基序的多模态编码(微观、中观、宏观三尺度)整合序列、结构和功能信息,提升蛋白质-蛋白质相互作用预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03418 2026-06-03 cs.CV 83%

IDO: Incongruity-aware Distribution Optimization for Multimodal Fake News Detection

IDO: 面向多模态假新闻检测的不一致性感知分布优化

Hengyang Zhou, Rongman Hong, Yuxuan Zhou, Jing Wang, Zhaoyan Pan

机构 * Nanjing University(南京大学) University of Birmingham(伯明翰大学) East China Normal University(华东师范大学) Zhejiang University(浙江大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出不一致性感知分布优化(IDO)方法,通过事实不一致性和模态不一致性建模,提升多模态假新闻检测性能。

Comments Accept by GlobalSouthML@ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02659 2026-06-03 cs.LG cs.AI 79%

CL-DMDF:Dynamic Multimodal Data Fusion Model Based on Contrastive Learning

CL-DMDF:基于对比学习的动态多模态数据融合模型

Dong Li, Lingling Zhang, Binghao Han, Linlin Ding, Yue Kou

机构 * Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态数据融合中模态缺失和局部交互忽视全局互补线索的问题,提出基于对比学习的动态多模态数据融合模型(CL-DMDF),通过跨特征和模态维度的注意力机制、实体质心对比学习模块和自适应融合模块,提升动态融合的效率和准确性。

Comments 9 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03627 2026-06-03 cs.AI 79%

MemVerse: Multimodal Memory for Lifelong Learning Agents

MemVerse:面向终身学习智能体的多模态记忆

Junming Liu, Yifei Sun, Weihua Cheng, Haodong Lei, Yirong Chen, Licheng Wen, Xuemeng Yang, Daocheng Fu, Pinlong Cai, Nianchen Deng, Yi Yu, Shuyue Hu, Botian Shi, Ding Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出MemVerse,一种模型无关的即插即用记忆框架,通过分层检索记忆与参数化快速回忆结合,解决智能体在多模态交互中的灾难性遗忘和长程推理问题。

Comments 25 pages, 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00360 2026-06-03 cs.CL 79%

CourseTimeQA: A Lecture-Video Benchmark and a Latency-Constrained Cross-Modal Fusion Method for Timestamped QA

CourseTimeQA: 一个讲座视频基准和一种用于时间戳问答的延迟约束跨模态融合方法

Vsevolod Kovalev, Parteek Kumar

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CL

AI总结 针对教育讲座视频中的时间戳问答任务,在单GPU延迟/内存预算下,提出了CourseTimeQA基准和一种轻量级延迟约束跨模态检索器CrossFusion-RAG,通过冻结编码器、浅层查询无关交叉注意力和时间一致性正则化,在nDCG@10和MRR上分别提升0.10和0.08,中位端到端延迟约1.55秒。

Comments This paper is being withdrawn because an error in our measurement procedure produced incorrect values in our reported retrieval results (Tables I, II, V, and VI, and the corresponding headline figures in the Abstract). Several of our empirical claims depend on these measurements and therefore do not hold as stated

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03470 2026-06-03 cs.CV 77%

Mixed-Modality Dual Face-Hair Retrieval

混合模态双人脸-发型检索

Quoc-Anh Bui-Huynh, Mai-Tuyen Lam, Dai-Anh-Tuan Nguyen, Thanh Duc Ngo

机构 * Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南) University of Information Technology, VNU-HCM, Ho Chi Minh City, Vietnam(信息技术大学,VNU-HCM,胡志明市,越南)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出混合模态双参考检索任务DFHR,通过解耦身份与发型特征并融合多模态嵌入,实现跨模态的身份感知与属性可控检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02605 2026-06-03 cs.LG cs.AI eess.IV 74%

Cross-Modal Contrastive Learning of ECG and Angiography Representations for Severe Stenosis Classification

用于严重狭窄分类的心电图与血管造影表示的跨模态对比学习

Nikola Cenikj, Özgün Turgut, Alexander Müller, Alexander Steger, Jan Kehrer, Marcus Brugger, Daniel Rueckert, Philip Müller

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich and TUM University Hospital(人工智能在医疗与医学中的研究所,慕尼黑技术大学及慕尼黑大学医院) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML)) Department of Internal Medicine, TUM University Hospital(慕尼黑大学医院内科学系)

专题命中 跨模态检索 :cross-modal(title);分类 cs.AI

AI总结 提出StenCE预训练框架,通过跨模态对比学习从心电图特征中实现冠状动脉狭窄风险分层,在严重狭窄分类中首次达到高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03354 2026-06-03 cs.CR 50%

ImageAuditor: Membership Inference Attack against Image-based Retrieval-Augmented Generation

ImageAuditor: 针对基于图像的检索增强生成系统的成员推理攻击

Jinghuai Zhang, Pengyue Yu, Zhexiao Lin, Kunlin Cai, Fnu Suya, Yuan Tian

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 提出首个针对基于图像的检索增强生成(IRAG)的成员推理攻击方法ImageAuditor,通过奖励引导策略优化解决跨模态检索和判别信号提取两大挑战,在仅需四次查询时AUROC超过80%。

详情

展开后加载摘要…

URL PDF HTML 收藏