PCRI: Measuring Context Robustness in Multimodal Models for Enterprise Applications
机构 * Oracle AI
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted in EMNLP 2025
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Oracle AI
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted in EMNLP 2025
机构 * Lehigh University(莱维大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to EMNLP 2025 Findings
专题命中 多模态评测 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted to the 26th International Society for Music Information Retrieval (ISMIR) Conference, 2025
机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) ; School of Information Technology in Education, South China Normal University(华南师范大学教育信息技术学院)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.AI
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(电信人工智能研究院) ; Institute of Artificial Intelligence and Robotics(IAIR), Xi’an Jiaotong University(人工智能与机器人研究院) ; Advanced Technique of Artificial Intelligence(ATAI), Chongqing University of Technology(人工智能先进技术研究院)
专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI
Comments 9 pages,3 figures ICCV format
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments 11 pages, 7 figures. This paper is accepted by ICCV 2025
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Tongji University(同济大学)
专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted by TPAMI 2025
机构 * School of Computer Science Wuhan University(武汉大学计算机学院)
专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
机构 * Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(前沿人工智能研究中心,科技研究局,新加坡) ; Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,科技研究局,新加坡) ; National University of Singapore, Singapore(新加坡国立大学) ; Zhejiang University, China(浙江大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by CVPR 2025
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
Comments 18 pages, 10 figures
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.MM
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
Comments Project released at: https://github.com/AILab-CVC/SEED-Bench. arXiv admin note: text overlap with arXiv:2307.16125
专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments arXiv admin note: text overlap with arXiv:2305.04329
专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI
专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2022 Track Datasets and Benchmarks
专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Produced by MME+MMBench+LLaVA Teams. Project Page: https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models/tree/Benchmarks
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted for publication in National Science Review. Project page:https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models
专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Code and models are available at https://github.com/opendatalab/MLLM-DataEngine
专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Accepted in AAAI'22: First Workshop on Multimodal Fact-Checking and Hate Speech Detection, Februrary 22 - March 1, 2022,Vancouver, BC, Canada
VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解
机构 * Zhejiang University(浙江大学) ; Peking University(北京大学) ; Sun Yat-sen University(中山大学) ; CUHK(香港中文大学)
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。
MIEScore:面向多源图像编辑的人类对齐评估方法
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.MM
AI总结 针对多源图像编辑(MIE)缺乏人类对齐评估基准的问题,研究构建了首个MIE基准MIE-Bench,并提出基于MLLM的评估模型MIEScore,其对齐人类偏好性能最优且泛化性良好。
OmniTraffic:面向时空交通推理的可控生成流水线与基准
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shanghai AI Lab(上海人工智能实验室) ; Beihang University(北京航空航天大学) ; Nanyang Technological University(南洋理工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出OmniTraffic,一个基于12个真实路口3D重建的可控生成流水线与基准,通过8M VQA样本和3K人工验证测试集评估11个前沿MLLM,揭示拓扑与时空推理中的显著人机差距,并证明仿真数据微调可提升真实场景性能。
Comments 34 pages, 28 figures
你能相信你所见的吗?人类与AI对合成法律证据的检测
机构 * Faculty of Law, McGill University(麦吉尔大学法学院)
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究人类和前沿多模态大模型在民事纠纷场景中区分真实照片与AI生成图像的能力,发现两者均不可靠,提出结合人工审查、MLLM筛查和来源认证的解决方案。
StemBind: 当多模态大语言模型在抽象视觉推理中迷失于规则与实例之间
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出 StemBind 诊断基准,通过共享主干的三对齐问题(感知、规则、完整)定位 MLLM 在抽象视觉推理中的失败环节,发现规则到实例的绑定是主要瓶颈。
Comments Project page: https://hexixiang.github.io/StemBind
机构 * School of Computing and Communications(计算与通讯学院) ; Lancaster Medical School(兰卡斯特医学学院)
专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract,comments);分类 cs.CV、cs.AI
Comments ICCV 2025 (PHAROS-AFE-AIMI: Adaptation, Fairness, and Explainability in Medical Imaging). 8 pages, 5 figures, 4 tables. Keywords: multi-modal, multimodal, prototype learning, explainable AI, interpretable models, case-based reasoning, medical imaging, DEXA, bone health, osteoporosis, osteopenia, diagnosis, classification, clustering
专题命中 多模态评测 :multimodal(title);multimodal foundation model(title);分类 cs.CL、cs.AI
Comments 1st Conference on Language Modeling (COLM), 2024