arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-27 至 2026-04-27 共收录 51 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2604.22498 2026-04-27 cs.CV cs.AI 62%

CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding

CGC:基于组成性 grounded 对比的细粒度多图像理解

Lihao Zheng, Zhenwei Shao, Yu Zhou, Yan Yang, Xintian Shen, Jiawei Chen, Hao Ma, Tao Wei

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Technology, Hangzhou Dianzi University(技术,杭州电子科技大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CGC框架,通过跨图像对比和内图像对比提升多图像细粒度理解,结合规则空间奖励增强属性和对齐,实验显示在多个基准上取得最佳结果,并在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22190 2026-04-27 cs.CV cs.AI 62%

From Global to Local: Rethinking CLIP Feature Aggregation for Person Re-Identification

从全局到局部:重新思考CLIP特征聚合用于人重识别

Aotian Zheng, Winston Sun, Bahaa Alattar, Vitaly Ablavsky, Jenq-Neng Hwang

机构 * Department of Electrical and Computer Engineering, University of Washington(华盛顿大学电气与计算机工程系) Applied Physics Laboratory, University of Washington(华盛顿大学应用物理实验室)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SAGA-ReID,通过在CLIP文本嵌入空间中对齐中间补丁标记与锚向量,改进CLIP基于的人重识别方法,提升在遮挡和跨摄像头变化下的鲁棒性,实验表明其在遮挡增加时表现更优,达到+10.6 Rank-1的提升。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21435 2026-04-27 cs.AI 57%

Graph-to-Vision: Multi-graph Understanding and Reasoning using Vision-Language Models

图到视觉:利用视觉-语言模型进行多图理解与推理

Qihang Ai, Ruizhou Li, Menghui Wang, Haiyun Jiang

机构 * Nanyang Technological University(南洋理工大学) Shandong University(山东大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出首个评估和提升视觉语言模型多图推理能力的基准,涵盖四种常见图类型并支持复杂任务,评估了多种先进模型并验证了数据集的有效性。

Comments 26 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2604.22739 2026-04-27 cs.CV 79%

Inter-Stance: A Dyadic Multimodal Corpus for Conversational Stance Analysis

跨实例:一种双人多模态语料库用于对话立场分析

Xiang Zhang, Xiaotian Li, Taoyue Wang, Nan Bi, Xin Zhou, Cody Zhou, Zoie Wang, Andrew Yang, Yuming Su, Jeff Cohn, Qiang Ji, Lijun Yin

机构 * State University of New York at Binghamton(纽约州立大学布法罗分校) Choate Rosemary Hall(乔斯-罗丝玛丽高中) Rensselaer Polytechnic Institute(拉特格斯理工学院) Ward Melville High School(沃德梅尔维尔高中) University of Pittsburgh(匹兹堡大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一个包含多模态双人交互数据的语料库,用于研究对话中的立场分析,包含2D面部视频、3D面部几何、热谱动态、语音行为、生理数据及自我报告情感,通过实验评估双人互动的多模态建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22209 2026-04-27 eess.AS cs.AI cs.CL cs.SD 75%

UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions

UniSonate:一种统一的语音、音乐和音效生成模型,通过文本指令控制

Chunyu Qiang, Xiaopeng Wang, Kang Yin, Yuzhe Liang, Yuxin Guo, Teng Ma, Ziyu Zhang, Tianrui Wang, Cheng Gong, Yushen Chen, Ruibo Fu, Chen Zhang, Longbiao Wang, Jianwu Dang

机构 * Tianjin University(天津大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 UniSonate通过统一的文本指令接口生成语音、音乐和音效,采用动态令牌注入机制和多阶段课程学习策略,提升跨模态生成性能,实现指令驱动的TTS和TTM的SOTA表现。

Comments Accepted to ACL 2026 main conference (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11594 2026-04-27 eess.AS cs.SD 70%

HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models

HumDial-EIBench: 一个用于音频语言模型的情感智能基准测试

Shuiyuan Wang, Zhixian Zhao, Hongfei Xue, Chengyou Wang, Shuai Wang, Hui Bu, Xin Xu, Lei Xie

机构 * Nanjing University, China(南京大学,中国) AISHELL, China(AISHELL,中国)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本文提出HumDial-EIBench,通过真实人类对话评估音频语言模型的情感智能,采用多选题和对抗性干扰项减少主观评分偏差,发现大多数模型在多轮情感跟踪和隐含因果推理上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2604.22492 2026-04-27 eess.IV cs.CV 85%

MTT-Bench: Predicting Social Dominance in Mice via Multimodal Large Language Models

MTT-Bench:通过多模态大语言模型预测小鼠的社会支配

Yunquan Chen, Haoyu Chen

机构 * Department of Communication Systems, KTH Royal Institute of Technology(通信系统系,皇家理工学院) CMVS, University of Oulu(奥卢大学CMVS)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MTT-Bench基准,利用多模态大语言模型分析小鼠行为视频,预测社会支配等级,无需显式标签进行零样本推理,展示了在乙学和社会行为分析中的应用潜力。

Comments 8 pages, 2 figures. Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19592 2026-04-27 cs.CV 57%

Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation

MLLMs中分解注意力融合用于无训练视频推理分割

Su Ho Han, Jeongseok Hyun, Pilhyeon Lee, Minho Shim, Dongyoon Wee, Seon Joo Kim

机构 * Yonsei University(延世大学) Inha University(inha大学) NAVER Cloud(NAVER云)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DecAF方法,通过对比物体背景融合和互补视频帧融合精炼注意力图,实现无训练视频推理分割,取得优于无训练方法和与有训练方法相当的性能。

Comments Accepted to ICLR 2026. Code is available at https://github.com/HYUNJS/DecAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22575 2026-04-27 cs.LG 50%

SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference

SpikingBrain2.0:面向高效长上下文和跨平台推理的脑启发基础模型

Yuqi Pan, Jinghao Zhuang, Yupeng Feng, Fangzhi Zhong, Siyu Ding, Xuerui Qiu, Shaowei Gu, Bohan Sun, Zhiyong Qin, Yibo Zhong, Lingtao Ouyang, Kun Yang, Zehao Liu, Yuhong Chou, Shurong Wang, Anjie Hu, Han Xu, Bo Xu, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑启发通用智能大模型重点实验室) Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术重点实验室) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 SpikingBrain2.0通过双空间稀疏注意力机制和优化训练策略,在保持性能的同时提升长上下文处理效率,实现跨平台高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22043 2026-04-27 physics.soc-ph cs.LG 50%

Audio Video Verbal Analysis (AVVA) for Capturing Classroom Dialogues

音频视频言语分析(AVVA)用于捕捉课堂对话

Vivek Upadhyay, Amaresh Chakrabarti

机构 * Department of Design and Manufacturing, Indian Institute of Science(设计与制造系,印度科学研究院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出AVVA框架,通过整合定性解释与定量建模,提升课堂对话分析的可扩展性与严谨性,验证了其在23小时课堂录音中的实用性。

Comments 42 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07818 2026-04-27 cs.MA 50%

Open-Ended Video Game Glitch Detection with Agentic Reasoning and Temporal Grounding

基于代理推理和时间定位的开放式视频游戏漏洞检测

Muyang Zheng, Tong Zhou, Geyang Wu, Zihao Lin, Haibo Wang, Lifu Huang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出VideoGlitchBench基准和GliDe框架,通过代理推理和时间定位检测视频游戏中的漏洞,提升语义理解和时间定位能力。

Comments 16 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 9 篇

2210.05513 2026-04-27 cs.CV 70%

ViFiCon: Vision and Wireless Association Via Self-Supervised Contrastive Learning

ViFiCon:通过自监督对比学习实现视觉与无线关联

Nicholas Meegan, Hansi Liu, Bryan Bo Cao, Abrar Alali, Kristin Dana, Marco Gruteser, Shubham Jain, Ashwin Ashok

机构 * Rutgers University(罗切斯特大学) Stony Brook University(石溪大学) Saudi Electronic University(沙特电子大学) Georgia State University(佐治亚州立大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 ViFiCon通过自监督对比学习实现视觉与无线模态的关联,利用RGB-D相机和WiFi测距数据,减少隐私和能耗,无需标注数据即可实现高精度关联。

Comments 8 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22292 2026-04-27 cs.CL cs.AI 62%

ReLeVAnT: Relevance Lexical Vectors for Accurate Legal Text Classification

ReLeVAnT:用于准确法律文本分类的相关词向量

Ishaan Gakhar, Harsh Nandwani

机构 * Perssonify

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReLeVAnT框架,通过n-gram处理、对比分数匹配和浅层神经网络实现法律文档二分类,准确率达99.3%。

Comments 9 Pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22061 2026-04-27 cs.CL cs.AI cs.LG 62%

Lightweight Retrieval-Augmented Generation and Large Language Model-Based Modeling for Scalable Patient-Trial Matching

轻量级检索增强生成与基于大语言模型的建模用于可扩展的患者试验匹配

Xiaodi Li, Yang Xiao, Munhwan Lee, Konstantinos Leventakos, Young J. Juhn, David Jones, Terence T. Sio, Wei Liu, Maria Vassilaki, Nansu Zong

机构 * Department of Artificial Intelligence and Informatics, Mayo Clinic(人工智能与信息学系,梅奥诊所) Computer Science Department, University of Tulsa(图兰大学计算机科学系) Mayo Clinic Comprehensive Cancer Center, Mayo Clinic(梅奥诊所综合癌症中心,梅奥诊所) Division of Community Pediatric and Adolescent Medicine, Department of Pediatrics, Mayo Clinic(社区儿科与青少年医学分会,儿科部,梅奥诊所) Department of Neurology, Mayo Clinic(神经病学部,梅奥诊所) Department of Radiation Oncology, Mayo Clinic(放射肿瘤学部,梅奥诊所) Department of Quantitative Health Sciences, Mayo Clinic(定量健康科学部,梅奥诊所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出轻量级框架,结合检索增强生成和大语言模型建模,解决患者试验匹配中长异构电子健康记录和复杂资格标准的可扩展性、泛化性和计算效率问题。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22678 2026-04-27 cs.CL 57%

BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering

BERAG:基于贝叶斯集成的检索增强生成用于基于知识的视觉问答

Jinghong Chen, Jingbiao Mei, Guangyu Yang, Bill Byrne

机构 * Department of Engineering(工程系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 BERAG通过将语言模型条件于单个检索文档而非单一上下文,解决检索增强生成中文档贡献不明和长上下文中的信息丢失问题,提升视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22374 2026-04-27 cs.CL 57%

Selective Contrastive Learning For Gloss Free Sign Language Translation

选择性对比学习用于无 gloss 手语翻译

Changhao Lai, Rui Zhao, Xuewen Zhong, Jinsong Su, Yidong Chen

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Key Lab of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian-Taiwan (XMU), Ministry of Culture and Tourism, China(福建省 Fujian-Taiwan 非物质文化遗产数字保护与智能处理重点实验室,文化部,中国) National Language Resources Monitoring and Research Center for Education and Teaching Media, Xiamen University, China(教育与教学媒体语言资源监测与研究中心,厦门大学,中国)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出选择性对比学习方法,通过动态选择负样本提升手语翻译的跨模态对齐效果,减少噪声干扰。

Comments Accepted by ACL 2026 as the main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22180 2026-04-27 cs.IR cs.AI 57%

ResRank: Unifying Retrieval and Listwise Reranking via End-to-End Joint Training with Residual Passage Compression

ResRank:通过端到端联合训练与残差段落压缩统一检索与列表级重排序

Xiaojie Ke, Shuai Zhang, Liansheng Sun, Yongjin Wang, Hengjun Jiang, Xiangkun Liu, Cunxin Gu, Jian Xu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴Qwen应用业务组)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 ResRank通过端到端联合训练与残差段落压缩技术,解决传统重排序方法中输入长度增加导致的排名质量下降和推理延迟问题,实现高效且有效的检索与重排序统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22174 2026-04-27 cs.CV 57%

Unlocking Optical Prior: Spectrum-Guided Knowledge Transfer for SAR Generalized Category Discovery

解锁光学先验:基于频谱引导的知识迁移用于SAR广义类别发现

Jingyuan Xia, Ruikang Hu, Ye Li, Zhixiong Yang, Xu Lan, Zhejun Lu

机构 * College of Electronic Science and Technology, National University of Defense Technology(电子科学与技术学院,国防科技大学) State Key Laboratory of Complex System Simulation and Modeling Technology(复杂系统仿真与建模技术国家重点实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于频谱引导的知识迁移框架,通过频谱差异建模提升SAR图像中光学先验的适应性,实现广义类别发现任务的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21806 2026-04-27 cs.CV 57%

TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval

TEMA: 图像锚定,文本引导的多修改复合图像检索

Zixu Li, Yupeng Hu, Zhiheng Fu, Zhiwei Chen, Yongqi Li, Liqiang Nie

机构 * School of Software, Shandong University(山东大学软件学院) Department of Computing, Hong Kong Polytechnic University(香港理工大学计算机系) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 TEMA通过构建多修改数据集和提出文本导向实体映射架构,解决复合图像检索中的实体覆盖不足和句法-实体对齐问题,提升检索准确性和效率。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13211 2026-04-27 cs.CV 57%

3DAlign-DAER: Dynamic Attention Policy and Efficient Retrieval Strategy for Fine-grained 3D-Text Alignment at Scale

3DAlign-DAER:动态注意力策略与高效检索策略用于大规模细粒度3D文本对齐

Yijia Fan, Jusheng Zhang, Kaitong Cai, Jing Yang, Jian Wang, Keze Wang

机构 * Uni3D-g

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出3DAlign-DAER框架,通过动态注意力策略和高效检索策略实现文本与3D几何的细粒度对齐,解决大规模3D数据库下的对齐性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2507.09028 2026-04-27 q-bio.QM cs.AI 83%

From Classical Machine Learning to Emerging Foundation Models: Review on Multimodal Data Integration for Cancer Research

从经典机器学习到新兴基础模型:癌症研究中多模态数据整合的综述

Amgad Muneer, Muhammad Waqas, Maliazurina B Saad, Eman Showkatian, Rukhmini Bandyopadhyay, Hui Xu, Wentao Li, Joe Y Chang, Zhongxing Liao, Cara Haymaker, Luisa Solis Soto, Carol C Wu, Natalie I Vokes, Xiuning Le, Lauren A Byers, Don L Gibbons, John V Heymach, Jianjun Zhang, Jia Wu

机构 * Department of Imaging Physics, The University of Texas MD Anderson Cancer Center(影像物理系,德克萨斯大学MD安德森癌症中心) Department of Thoracic/Head and Neck Medical Oncology, The University of Texas MD Anderson Cancer Center(胸腔/头颈医学肿瘤科,德克萨斯大学MD安德森癌症中心) Department of Thoracic Radiation Oncology, The University of Texas MD Anderson Cancer Center(胸腔放射肿瘤科,德克萨斯大学MD安德森癌症中心) Department of Translational Molecular Pathology, The University of Texas MD Anderson Cancer Center(转化分子病理学系,德克萨斯大学MD安德森癌症中心) Department of Thoracic Imaging, The University of Texas MD Anderson Cancer Center(胸腔影像科,德克萨斯大学MD安德森癌症中心)

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文综述了多模态数据整合在癌症研究中的应用,探讨了传统机器学习向基础模型转变的趋势,以及多组学与先进影像数据整合的最新方法和挑战。

Comments 10 figures, 5 tables

Journal ref Artificial Intelligence Review 59, 119 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22212 2026-04-27 eess.IV cs.CV cs.LG 79%

Multimodal Diffusion to Mutually Enhance Polarized Light and Low Resolution EBSD Data

多模态扩散用于互为增强的偏振光与低分辨率EBSD数据

Harry Dong, Timofey Efimov, Megna Shah, Jeff Simmons, Sean Donegan, Marc De Graef, Yuejie Chi

机构 * Carnegie Mellon University(卡内基梅隆大学) Air Force Research Laboratory(空军研究实验室) Yale University(耶鲁大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态扩散模型,通过结合偏振光和低分辨率EBSD数据,提升数据收集效率,实现颗粒边界预测、超分辨率和去噪等任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01650 2026-04-27 cs.HC cs.AI 79%

AromaGen: Interactive Generation of Rich Olfactory Experiences with Multimodal Language Models

AromaGen:基于多模态语言模型的交互式丰富嗅觉体验生成

Yunge Wen, Awu Chen, Jianing Yu, Jas Brooks, Hiroshi Ishii, Paul Pu Liang

机构 * MIT Media Lab(MIT媒体实验室) Harvard Graduate School of Design(哈佛设计研究生院) MIT CSAIL(MIT计算机科学与人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 AromaGen利用多模态语言模型实现基于文本和视觉输入的实时嗅觉生成,通过迭代优化提升嗅觉混合物的自然度,达到与真实食物香气相似的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19858 2026-04-27 cs.CV 57%

Wan-Image: Pushing the Boundaries of Generative Visual Intelligence

Wan-Image:推动生成视觉智能的边界

Chaojie Mao, Chen-Wei Xie, Chongyang Zhong, Haoyou Deng, Jiaxing Zhao, Jie Xiao, Jinbo Xing, Jingfeng Zhang, Jingren Zhou, Jingyi Zhang, Jun Dan, Kai Zhu, Kang Zhao, Keyu Yan, Minghui Chen, Pandeng Li, Shuangle Chen, Tong Shen, Yu Liu, Yue Jiang, Yulin Pan, Yuxiang Tuo, Zeyinzi Jiang, Zhen Han, Ang Wang, Bang Zhang, Baole Ai, Bin Wen, Boang Feng, Feiwu Yu, Gang Wang, Haiming Zhao, He Kang, Jianjing Xiang, Jianyuan Zeng, Jinkai Wang, Junjie Zhou, Ke Sun, Linqian Wu, Pei Gong, Pingyu Wu, Ruiwen Wu, Tongtong Su, Wenmeng Zhou, Wenting Shen, Wenyuan Yu, Xianjun Xu, Xiaoming Huang, Xiejie Shen, Xin Xu, Yan Kou, Yangyu Lv, Yifan Zhai, Yitong Huang, Yun Zheng, Yuntao Hong, Zhe Zhang, Zhicheng Zhang

机构 * Wan Team(万团队) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Wan-Image通过统一多模态架构和大规模数据训练,实现从随意生成到专业级视觉工具的转变,具备超长文本渲染、多主体身份保持等专业能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21977 2026-04-27 cs.CV 57%

When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters

当LoRA背叛时:通过伪装成无害适配器对文本到图像模型进行后门攻击

Liangwei Lyu, Jiaqi Xu, Jianwei Ding, Qiyao Deng

机构 * People’s Public Security University of China(中国人民公安大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 研究提出MasqLoRA攻击框架,通过独立LoRA模块在文本到图像扩散模型中隐蔽注入恶意行为,实验显示其攻击成功率高达99.8%。

Comments Accepted to CVPR 2026 main track(poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21898 2026-04-27 cs.RO cs.AI 57%

Flexible Multitask Learning with Factorized Diffusion Policy

灵活的多任务学习与因子化扩散策略

Chaoqi Liu, Haonan Chen, Sigmund H. Høeg, Shaoxiong Yao, Yunzhu Li, Kris Hauser, Yilun Du

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Norwegian University of Science and Technology(挪威科学与技术大学) Columbia University(哥伦比亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种因子化扩散策略框架,通过将复杂动作分布分解为多个专用扩散模型,提升多任务学习的灵活性和适应性,实验证明其在仿真和现实机器人任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 9 篇

2504.06148 2026-04-27 cs.CV 83%

V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models

V-MAGE:一种用于评估多模态大语言模型视觉能力的游戏评估框架

Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang

机构 * Nanjing University(南京大学) Microsoft Research(微软研究院) Central South University(中南大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 V-MAGE通过游戏化评估框架系统评估多模态大语言模型在动态交互环境中的视觉推理能力,揭示其在复杂场景中的性能局限,为提升模型视觉与推理能力提供改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07632 2026-04-27 cs.AI cs.CL cs.CV cs.LG 83%

Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models

测试时匹配:在多模态模型中解锁组合推理

Yinglun Zhu, Jiancheng Zhang, Fuzhi Tang

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出测试时匹配算法,通过改进评估指标提升多模态模型的组合推理能力,使SigLIP-B16和GPT-4.1在Winoground等基准上取得新突破。

Comments To appear at ICLR 2026; extended results to generative multimodal models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14306 2026-04-27 cs.CL cs.AI 81%

EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation

欧洲医学问答研究协议:一个多语言、多模态的医学考试数据集用于语言模型评估

Francesco Andrea Causio, Vittorio De Vita, Olivia Riccomi, Michele Ferramola, Federico Felizzi, Alessandro Tosi, Antonio Cristiano, Lorenzo De Mori, Chiara Battipaglia, Melissa Sawaya, Luigi De Angelis, Marcello Di Pumpo, Alessandra Piscitelli, Pietro Eric Risuleo, Alessia Longo, Giulia Vojvodic, Mariapia Vassalli, Bianca Destro Castaniti, Nicolò Scarsi, Manuel Del Medico

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出欧洲医学问答数据集,旨在通过多语言多模态数据评估语言模型性能,评估跨语言迁移和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07038 2026-04-27 cs.CV cs.CL 81%

UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents

UNIKIE-BENCH:用于视觉文档中关键信息提取的大型多模态模型基准测试

Yifan Ji, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Qian Zhang, Zhibo Yang, Junyang Lin, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Alibaba Group, Hangzhou, China(阿里巴巴集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出UNIKIE-BENCH基准,用于评估大型多模态模型在视觉文档关键信息提取中的性能,揭示了不同场景下模型的性能差异及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏