arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-01 至 2026-05-01 共收录 68 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2512.14044 2026-05-01 cs.CV cs.AI 84%

OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving

OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶

Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) MEGVII Technology(美科维七科技) AFARI

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27712 2026-05-01 cs.CV cs.CL 84%

Linguistically Informed Multimodal Fusion for Vietnamese Scene-Text Image Captioning: Dataset, Graph Framework, and Phonological Attention

具有语言信息的多模态融合用于越南语场景文本图像描述:数据集、图框架和语音注意力

Nhi Ngoc-Yen Nguyen, Anh-Duc Nguyen, Nghia Hieu Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

机构 * Faculty of Information Science and Engineering(信息科学与工程学院) University of Information Technology(信息技术大学) Vietnam National University(越南国家大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出HSTFG和PhonoSTFG框架,通过图拓扑分析发现跨模态边对场景文本融合有害,并构建首个大规模越南语场景文本描述数据集ViTextCaps,揭示52.8%词汇存在声调符号冲突风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27393 2026-05-01 cs.CL 83%

MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction

MiniCPM-o 4.5:迈向实时全双工多模态交互

Junbo Cui, Bokai Xu, Chongyi Wang, Tianyu Yu, Weiyue Sun, Yingjing Xu, Tianran Wang, Zhihui He, Wenshuo Ma, Tianchi Cai, Jiancheng Gui, Luoyuan Zhang, Xian Sun, Fuwei Huang, Moye Chen, Zhuo Lin, Hanyu Liu, Qingxin Gui, Qingzhe Han, Yuyang Wen, Huiping Liu, Rongkang Wang, Yaqi Zhang, Hongliang Wei, Chi Chen, You Li, Kechen Fang, Jie Zhou, Yuxuan Li, Guoyang Zeng, Chaojun Xiao, Yankai Lin, Xu Han, Maosong Sun, Zhiyuan Liu, Yuan Yao

机构 * OpenBMB(开放大脑)

专题命中 图文多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 MiniCPM-o 4.5通过实时全双工多模态交互技术,解决多模态交互中感知与响应分离及被动响应的问题,实现更接近人类水平的多模态交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27674 2026-05-01 cs.CL cs.AI cs.CR cs.IR 81%

One Single Hub Text Breaks CLIP: Identifying Vulnerabilities in Cross-Modal Encoders via Hubness

一个单一的枢纽文本破坏CLIP:通过枢纽性揭示跨模态编码器的漏洞

Hiroyuki Deguchi, Katsuki Chousa, Yusuke Sakai

机构 * NTT, Inc.(NTT公司) Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出方法识别枢纽嵌入及其对应文本,揭示跨模态编码器的漏洞,实验显示单一枢纽文本在图像描述评估中表现优异,暴露了编码器的缺陷。

Comments Accepted at ACL2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10941 2026-05-01 cs.CV cs.AI 74%

Mull-Tokens: Modality-Agnostic Latent Thinking

Mull-Tokens: 通用模态的潜在思考

Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

机构 * Google(谷歌) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Boston University(波士顿大学)

专题命中 图文多模态 :multimodal(abstract,comments);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Mull-Tokens,一种无需模态切换的潜在令牌,用于空间、时间等多模态推理,通过预训练和微调在四个挑战性基准上实现3%-16%的提升。

Comments Project webpage: https://arijitray.com/multimodal_thinking/, Accepted to CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17175 2026-05-01 cs.LG cs.AI q-bio.BM 57%

RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design

RosettaSearch:蛋白质序列设计的多目标推理时间搜索

Meghana Kshirsagar, Allen Nie, Ching-An Cheng, Fanglei Xue, Rahul Dodhia, Juan Lavista Ferres, Kevin K. Yang, Frank DiMaio

机构 * AI for Good, Microsoft Redmond(微软红mond AI for Good) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Institute for Protein Design University of Washington(蛋白质设计研究所华盛顿大学) Microsoft Research New England(微软新英格兰研究) Department of Biochemistry Institute for Protein Design University of Washington(生物化学系蛋白质设计研究所华盛顿大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

AI总结 RosettaSearch通过大语言模型作为生成优化器,在受控探索与利用中改进蛋白质序列设计,实现结构保真度提升2.5倍,适用于多种LLM家族和独立结构预测 oracle。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2509.23744 2026-05-01 cs.CL cs.AI 84%

Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning

组合与融合:重新审视多模态推理中的基础瓶颈

Yucheng Wang, Yifan Hou, Aydin Javadov, Mubashara Akhtar, Mrinmaya Sachan

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过逻辑基础评估框架,发现多模态推理中模态交互的六个模式影响推理效果,指出任务组合和融合是主要瓶颈,提出通过分步提示和早融控制提升推理性能。

Comments Our code (https://github.com/DELTA-DoubleWise/OmniReason) and data (https://huggingface.co/datasets/ycwang11/OmniReason) are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27866 2026-05-01 eess.AS cs.MM cs.SD 81%

LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition

LRS-VoxMM:面向真实场景的音频视觉语音识别基准

Doyeop Kwak, Jeongsoo Choi, Suyeon Lee, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

AI总结 本文提出LRS-VoxMM基准,基于VoxMM数据集,通过预处理生成适合AVSR管道的样本,覆盖更广泛场景和声学条件,并提供噪声、回声和带宽限制的评估集,实验表明其比LRS3更难,视觉信息在音频退化时作用更显著。

Comments Technical report for the LRS-VoxMM dataset release. Project page: https://mm.kaist.ac.kr/projects/voxmm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27517 2026-05-01 cs.HC 78%

I'm Fine, But My Voice Isn't: Cross-Modal Affective Dissonance Detection for Reflective Journaling

我很好,但我的声音不是:面向反思日记的跨模态情感不一致检测

Sumin Lee

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 本文提出跨模态情感不一致检测(CADD),通过区分掩蔽、应对和一致三种状态,解决数字日记中情感与语音不匹配的问题,并提出CADD-Journal数据集、DACM模型及领域差距量化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20522 2026-05-01 cs.SD cs.CV 57%

From Image to Music Language: A Two-Stage Structure Decoding Approach for Complex Polyphonic OMR

从图像到音乐语言:一种针对复杂多声部乐谱的两阶段结构解码方法

Nan Xu, Shiheng Li, Shengchao Hou

机构 * FindLab

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种实用的两阶段光学音乐识别管道新方法,聚焦第二阶段解码,通过结构解码问题解决复杂多声部乐谱中的声部分离和小节内时间同步问题。

Comments 52 pages, 18 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27436 2026-05-01 eess.AS eess.IV 57%

BUT System Description for CHiME-9 MCoRec Challenge

BUT系统描述用于CHiME-9 MCoRec挑战

Dominik Klement, Alexander Polok, Nguyen Hai Phong, Prachi Singh, Lukáš Burget

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出BUT系统,通过长上下文目标说话人音频视频ASR模型和LLM聚类方法,在CHiME-9 MCoRec任务中实现高精度语音识别与对话组划分。

Comments Accepted to HSCMA 2026 Workshop at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24587 2026-05-01 stat.AP 50%

Bayesian inference for hidden Markov models under genuine multimodality with application to ecological time series

隐马尔可夫模型下的贝叶斯推断在真实多模态情况下的应用及生态时间序列分析

Marco A. Gallegos-Herrada, Vianey Leos-Barajas, Jeffrey S. Rosenthal

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文探讨了在隐马尔可夫模型中处理多模态似然函数的挑战,提出改进的平行温度算法以有效探索高维多模态后验分布,并通过蓝鲸潜水数据验证了该方法在生态时间序列分析中的应用。

Comments 37 pages, 11 figures, to be submitted to Bayesian Analysis, corrected author affiliations

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 12 篇

2604.28001 2026-05-01 cs.AI cs.SE 70%

A Pattern Language for Resilient Visual Agents

面向鲁棒视觉代理的模式语言

Habtom Kahsay Gidey, Alexander Lenz, Alois Knoll

专题命中 视频多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 本文提出一种模式语言,用于在企业生态系统中整合多模态基础模型,平衡视觉语言动作模型的延迟与非确定性与企业控制循环的严格确定性和实时性要求。

Comments Accepted to the 23rd International Conference on Software Architecture (ICSA 2026), New and Emerging Ideas Track. 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28007 2026-05-01 q-bio.NC 67%

Multisensory learning recruits visual neurons into an olfactory memory engram

多感官学习招募视觉神经元进入嗅觉记忆表征

Zeynep Okray, Nils Otto, Anna A. Cook, Clifford Talbot, Ashwin Miriyala, Martín Klappenbach, Ciara Stern, Kieran Desmond, Paola Vargas-Gutierrez, Scott Waddell

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 研究揭示多感官学习通过扩大记忆表征提升记忆表现,核心方法涉及视觉神经元与嗅觉记忆的连接,主要贡献是发现多感官训练增强记忆表达的机制。

Comments 24 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07180 2026-05-01 cs.CL cs.AI cs.CV 67%

Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs

视频中的奉承:视频大语言模型中奉承行为的基准测试与分析

Wenrui Zhou, Mohamed Hendy, Shu Yang, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证负责任人工智能与数据 analytics 实验室) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学与技术大学) HKUST(香港科技大学) MBZUAI(穆罕默德·本·拉希德人工智能研究所) University of Science and Technology of China(中国科学技术大学) Kyungpook National University(庆尚国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VISE基准,用于评估视频大语言模型在面对误导性输入时的奉承行为,通过多类型分析和两种无训练缓解策略提升模型可靠性。

Comments 27 Pages, Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27591 2026-05-01 cs.CV cs.AI 62%

ClipTBP: Clip-Pair based Temporal Boundary Prediction with Boundary-Aware Learning for Moment Retrieval

ClipTBP:基于剪辑对的时序边界预测:面向时刻检索的边界感知学习

Ji-Hyeon Kim, Ho-Joong Kim, Seong-Whan Lee

机构 * Dept. of Artificial Intelligence, Korea University, Seoul(人工智能系,韩国大学,首尔)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ClipTBP框架,通过边界感知学习解决视频时刻检索中多段答案与查询的语义关系建模问题,提升时序边界预测的鲁棒性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25186 2026-05-01 cs.CV cs.CE cs.MM 62%

FCMBench-Video: Benchmarking Document Video Intelligence

FCMBench-Video:文档视频智能基准测试

Runze Cui, Fangxin Shang, Yehui Yang, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(启赋科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV、cs.MM

AI总结 本文提出FCMBench-Video基准测试,用于评估文档视频理解中的文档感知、时间定位和证据推理能力,通过真实场景数据验证系统性能,揭示不同任务的敏感性和能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27445 2026-05-01 cs.CV 57%

Context as Prior: Bayesian-Inspired Intent Inference for Non-Speaking Agents with a Household Cat Testbed

上下文作为先验:一种基于贝叶斯的意图推断方法用于非说话智能体的家用猫测试平台

Wenqian Zhang, Zehao Wang

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CatSignal框架,通过将空间上下文作为先验约束和行为观测作为证据,实现多模态意图推断,提升非说话智能体的意图识别精度。

Comments Accepted to the CVPR 2026 Animal Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21479 2026-05-01 cs.CV 57%

Frozen LLMs as Map-Aware Spatio-Temporal Reasoners for Vehicle Trajectory Prediction

冻结的大语言模型作为具有地图意识的时空推理器用于车辆轨迹预测

Yanjiao Liu, Jiawei Liu, Xun Gong, Zifei Nie

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出利用冻结的大语言模型作为时空推理器,通过交通编码器提取轨迹特征并结合轻量CNN处理地图信息,评估LLM在动态交通代理行为和道路拓扑理解中的能力,提升轨迹预测的准确性与泛化性。

Comments Accepted for publication at IEEE Intelligent Vehicles Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08418 2026-05-01 cs.LG cs.AI 57%

Taxon: Hierarchical Tax Code Prediction with Semantically Aligned LLM Expert Guidance

Taxon: 基于语义对齐的LLM专家指导的层级税码预测

Jihang Li, Qing Liu, Zulong Chen, Jing Wang, Wei Wang, Chuanfei Xu, Zeyi Wen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出Taxon框架,通过语义对齐和专家指导实现层级税码预测,结合多专家架构和语义一致性模型,在实际业务中提升准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07645 2026-05-01 cs.RO 50%

From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback

从动作标签到集合:重新思考基于纠正反馈的模仿学习中的动作监督

Zhaoting Li, Rodrigo Pérez-Dattari, Robert Babuska, Cosimo Della Santina, Jens Kober

机构 * Delft University of Technology, The Netherlands(代尔夫特理工大学,荷兰) KTH, Sweden(瑞典皇家理工学院) University of Stuttgart, Germany(斯图加特大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出CLIC方法,通过将点状监督替换为集合值动作目标,提升在不准确反馈下的模仿学习效果,实验表明其在不同场景下具有更高的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27508 2026-05-01 cs.RO 50%

SASI: Leveraging Sub-Action Semantics for Robust Early Action Recognition in Human-Robot Interaction

SASI:利用子动作语义实现人机交互中鲁棒的早期动作识别

Yongpeng Cao, Masahiro Hirano, Hyuno Kim, Yuji Yamakawa

机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) Interfaculty Initiative in Information Studies, Graduate School of Interdisciplinary Information Studies, The University of Tokyo(东京大学跨学际信息研究学院信息研究联合计划)

专题命中 视频多模态 :cross-modal(abstract)

AI总结 本文提出SASI框架,通过融合时空特征与子动作语义提升人机交互中早期动作识别的鲁棒性,实验表明其在识别精度和部分动作序列理解方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27497 2026-05-01 cs.CR cs.CY 50%

SST-Guard: Detecting and Characterizing Server-Side Google Analytics in the Wild

SST-Guard:检测和表征野外的服务器端Google Analytics

Muhammad Jazlan, Alexander Gamero-Garrido, Zubair Shafiq, Yash Vekaria

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出SST-Guard系统,通过多模态方法检测和阻止服务器端Google Analytics,通过匹配语义值模式提高检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27131 2026-05-01 cs.IR 50%

LLM-Enhanced Topical Trend Detection at Snapchat

基于大语言模型的Snapchat话题趋势检测

Hangqi Zhao, Jay Li, Abhiruchi Bhattacharya, Cong Ni, Jason Yeung, Jinchao Ye, Kai Yang, Akshat Malu, Manish Malik

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一个大规模系统,利用多模态主题提取、时间序列爆发检测和大语言模型进行整合与丰富,实现Snapchat上新兴话题趋势的准确及时发现,首次在短视频平台实现生产级话题趋势检测系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 7 篇

2604.27934 2026-05-01 cs.AI cs.CL 86%

MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection

MM-StanceDet:基于检索的多模态多智能体立场检测

Weihai Lu, Zhejun Zhao, Yanshu Li, Huan He

机构 * Peking University(北京大学) Baidu Inc(百度公司) Brown University(布朗大学) Amazon(亚马逊)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MM-StanceDet框架,通过整合检索增强、多模态分析代理、辩论阶段和自我反思,解决多模态立场检测中的上下文 grounding、跨模态解释模糊和单次推理脆弱问题,实验表明其在五个数据集上优于现有方法。

Comments Accepted on ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27600 2026-05-01 cs.IR 85%

Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG

净化多模态检索:用于RAG的片段级证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Cao Liu, Ke Zeng, Quan Z. Sheng, Lina Yao

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本文提出FES-RAG框架,通过片段级证据选择提升多模态检索效果,减少噪声干扰,实验显示在M2RAG基准上性能提升27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17765 2026-05-01 q-bio.QM cs.AI cs.CV 84%

Grounded Multimodal Retrieval-Augmented Drafting of Radiology Impressions Using Case-Based Similarity Search

基于案例相似性搜索的医学影像印象 grounded 多模态检索增强草稿生成

Himadri S Samanta

机构 * Independent AI Researcher(独立AI研究员)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态检索增强生成系统,结合对比图像-文本嵌入、基于案例的相似性检索和引用约束草稿生成,以生成具有临床依据的医学影像印象。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27724 2026-05-01 cs.AI 79%

Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering

迭代多模态检索增强生成用于医疗问答

Xupeng Chen, Binbin Shi, Chenqian Le, Jiaqi Zhang, Kewen Wang, Ran Gong, Jinhan Zhang, Chihang Wang

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Independent Researcher(独立研究者) Chinese Academy of Sciences, Beijing, China(中国科学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 MED-VRAG通过多模态检索增强生成框架,利用文档页面图像而非OCR文本进行医疗问答,提升准确率至78.6%,并验证检索和迭代对问答性能的积极影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25711 2026-05-01 cs.SE cs.AI 79%

Learning Generalizable Multimodal Representations for Software Vulnerability Detection

学习通用的多模态表示以进行软件漏洞检测

Zeming Dong, Yuejun Guo, Qiang Hu, Yao Zhang, Maxime Cordy, Hao Liu, Mike Papadakis, Yongqiang Lyu

机构 * University of Luxembourg(卢森堡大学) Luxembourg Institute of Science and Technology(卢森堡科学与技术研究院) Tianjin University(天津大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MultiVul框架,通过双相似性学习和一致性正则化对代码和注释进行多模态对齐,提升漏洞检测的泛化能力,实验表明在多个数据集上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19143 2026-05-01 cs.AI cs.CR cs.CV 62%

Imitation Game for Adversarial Disillusion with Chain-of-Thought Reasoning in Generative AI

对抗性欺骗的模仿游戏:生成AI中的链式推理

Ching-Chun Chang, Fan-Yun Chen, Shih-Hong Gu, Kai Gao, Hanrui Wang, Isao Echizen

机构 * Information and Society Research Division, National Institute of Informatics(信息与社会研究部,国立信息研究所) Department of Information Engineering and Computer Science, Feng Chia University(信息工程与计算机科学系,逢甲大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于模仿游戏的对抗性欺骗防御框架,利用链式推理生成多模态代理,有效对抗生成AI中的演绎和归纳欺骗攻击。

Journal ref in IEEE Access, vol. 13, pp. 95085-95093, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏