arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-21 至 2026-04-21 共收录 192 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 17 篇

2604.17385 2026-04-21 cs.CV 57%

SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning

SpatialImaginer: 向空间推理的自适应视觉想象迈进

Yian Li, Yang Jiao, Bin Zhu, Tianwen Qian, Shaoxiang Chen, Jingjing Chen, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学 computing 与信息学院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) MiniMax Institute of Trustworthy Embodied Al, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SpatialImaginer框架,通过结合文本推理与视觉想象,解决多模态大语言模型在空间推理中的鲁棒性问题,实验显示其在复杂空间任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17090 2026-04-21 cs.CV 57%

Marrying Text-to-Motion Generation with Skeleton-Based Action Recognition

将文本到动作生成与基于骨架的动作识别相结合

Jidong Kuang, Hongsong Wang, Jie Gui

机构 * School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出CoAMD模型,结合骨架坐标进行动作理解和生成,实现统一的动作识别与生成,通过多模态动作识别器提供语义指导,实验表明其在多个任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20360 2026-04-21 cs.CV 57%

EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning

EditVerse:通过上下文学习统一图像和视频编辑与生成

Xuan Ju, Tianyu Wang, Yuqian Zhou, He Zhang, Qing Liu, Nanxuan Zhao, Zhifei Zhang, Yijun Li, Yuanhao Cai, Shaoteng Liu, Daniil Pakhomov, Zhe Lin, Soo Ye Kim, Qiang Xu

机构 * Adobe Research(Adobe研究院) CUHK(中国香港大学) Johns Hopkins University(约翰霍普金斯大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出EditVerse框架,通过统一token序列实现图像和视频生成编辑,利用自注意力机制实现跨模态知识迁移,实验表明其在视频编辑任务中达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 43 篇

2604.17233 2026-04-21 cs.CV cs.AI 89%

Enhancing Zero-shot Personalized Image Aesthetics Assessment with Profile-aware Multimodal LLM

通过基于资料的多模态大语言模型增强零样本个性化图像审美评估

Chun Wang, Chenfeng Wei, Chenyang Liu, Weihong Deng

机构 * Mashang Consumer Finance Co., Ltd.(马莎消费金融有限公司) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出P-MLLM,通过用户资料引导的多模态大语言模型实现零样本个性化图像审美评估,实验表明其在无历史数据情况下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04043 2026-04-21 cs.CL 85%

When Helpers Become Hazards: A Benchmark for Analyzing Multimodal LLM-Powered Safety in Daily Life

当助手变成危险:一个多模态大语言模型在日常生活中的安全分析基准

Xinyue Lou, Jinan Xu, Jingyi Yin, Xiaolong Wang, Zhaolu Kang, Youwei Liao, Yixuan Wang, Xiangyu Shi, Fengran Mo, Su Yao, Kaiyu Huang

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能在交通运输中的关键实验室(北京交通大学),教育部) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) Tsinghua University(清华大学) Peking University(北京大学) University of Montreal(蒙特利尔大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CL

AI总结 本文提出SaLAD基准,通过2013个真实世界图像-文本样本评估多模态大语言模型在日常生活中的安全影响,揭示模型在识别危险行为方面的局限性。

Comments Accepted by ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23885 2026-04-21 cs.CV 84%

Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training

通过现实场景合成和文档感知训练实现真实世界文档解析

Gengluo Li, Pengyuan Lyu, Chengquan Zhang, Huawen Shen, Liang Wu, Xingyu Wan, Gangyan Zeng, Han Hu, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Tencent(腾讯) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出数据训练协同框架,通过现实场景合成和文档感知训练提升文档解析的准确性和鲁棒性,构建了Wild-OmniDocBench基准,并在1B参数MLLM中实现了跨扫描/数字和真实世界场景的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10154 2026-04-21 cs.CR cs.AI cs.MM 84%

PRISM-XR: Empowering Privacy-Aware XR Collaboration with Multimodal Large Language Models

PRISM-XR: 通过多模态大语言模型赋能隐私感知的扩展现实协作

Jiangong Chen, Mingyu Zhu, Bin Li

机构 * Department of Electrical Engineering, The Pennsylvania State University, University Park, PA 16802, USA(电气工程系,宾夕法尼亚州立大学,University Park,PA 16802,USA)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI、cs.MM

AI总结 本文提出PRISM-XR框架,通过边缘服务器智能预处理过滤敏感数据,实现隐私保护的多用户XR协作,实验表明其在准确性和隐私保护方面表现优异。

Comments Accepted to the 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR)

Journal ref 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (VR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16372 2026-04-21 cs.CL cs.AI 84%

CFMS: Towards Explainable and Fine-Grained Chinese Multimodal Sarcasm Detection Benchmark

CFMS:迈向可解释且细粒度的中文多模态讽刺检测基准

Junzhao Zhang, Hsiu-Yuan Huang, Chenming Tang, Yutong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing(多媒体信息处理国家重点实验室) Peking University School of Computer Science(北京大学计算机科学学院) Peking University School of Software and Microelectronics(北京大学软件与微电子学院)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CFMS,首个针对中文社交媒体的细粒度多模态讽刺检测数据集,包含2796对高质量图像-文本对,提供三层次标注框架,并提出PGDS方法在关键任务中优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17030 2026-04-21 cs.CV 83%

Conditional Evidence Reconstruction and Decomposition for Interpretable Multimodal Diagnosis

基于条件证据重建与分解的可解释多模态诊断

Shaowen Wan, Yanjun Lv, Lu Zhang, Dajiang Zhu, Bharat Biswal, Tianming Liu, Xiaobo Li, Lin Zhao

机构 * Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) Department of Computer Science and Engineering, The University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) Department of Computer Science, Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校计算机科学系) School of Computing, University of Georgia(佐治亚大学计算科学学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出CERD框架,通过条件证据重建与分解,解决多模态诊断中模态缺失的问题,提升诊断的可解释性和临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13759 2026-04-21 cs.CV 83%

Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark

Uni-MMMU:一个大规模多学科多模态统一基准

Kai Zou, Ziqi Huang, Yuhao Dong, Shulin Tian, Dian Zheng, Hongbo Liu, Jingwen He, Bin Liu, Yu Qiao, Ziwei Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 Uni-MMMU通过八个以推理为中心的领域系统展开生成与理解的双向协同,评估模型在视觉理解和生成方面的性能差异及跨模态依赖,为统一模型发展提供可靠基础。

Comments Equal contributions from frst three authors. Project page: https://vchitect.github.io/Uni-MMMU-Project/ Code: https://github.com/vchitect/Uni-MMMU

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16655 2026-04-21 eess.IV cs.AI cs.CV 81%

A Two-Stage Multi-Modal MRI Framework for Lifespan Brain Age Prediction

一种用于全生命周期脑年龄预测的双阶段多模态MRI框架

Dingyi Zhang, Ruiying Liu, Yun Wang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Biomedical Informatics, Emory University(埃默里大学生物医学信息学系)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出双阶段多模态MRI框架,通过独立处理模态并融合评估,实现对全生命周期脑成熟度的统一评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20409 2026-04-21 cs.CL cs.AI cs.CY 81%

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments Under review; 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18224 2026-04-21 cs.SE cs.AI 79%

WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

WebCompass:迈向多模态网络编码评估的代码语言模型

Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 WebCompass提出一个多模态基准测试,用于评估代码语言模型在网络工程中的能力,涵盖生成、编辑和修复三种任务类型,通过多阶段人机协作流程,发现闭源模型在编辑和修复方面表现更优,但美学仍是开放源模型的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04509 2026-04-21 cs.CL 79%

ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection

ErrorRadar:通过错误检测基准测试多模态大语言模型的复杂数学推理能力

Yibo Yan, Shen Wang, Jiahao Huo, Hang Li, Boyan Li, Jiamin Su, Xiong Gao, Yi-Fan Zhang, Tianlong Xu, Zhendong Chu, Aoxiao Zhong, Kun Wang, Hui Xiong, Philip S. Yu, Xuming Hu, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) MSU(密歇根州立大学) UCAS(中国科学技术大学) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 ErrorRadar通过错误检测任务评估多模态大语言模型在复杂数学推理中的能力,包含2500个高质量K-12数学问题,实验显示GPT-4o仍比人类评价差10%。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03191 2026-04-21 cs.CV 79%

CORP: A Multi-Modal Dataset for Campus-Oriented Roadside Perception Tasks

CORP:面向校园道路感知任务的多模态数据集

Beibei Wang, Zijian Yu, Lu Zhang, Jingjing Huang, Yao Li, Haojie Ren, Yuxuan Xiao, Yuru Peng, Jianmin Ji, Yu Zhang, Yanyong Zhang

机构 * Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出CORP数据集,首个针对校园场景的多模态道路感知任务基准数据集,包含205k张图像和102k点云,用于提升校园区域的3D跟踪和实例分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17065 2026-04-21 cs.CV 79%

BasketHAR: A Multimodal Dataset for Human Activity Recognition and Sport Analysis in Basketball Training Scenarios

BasketHAR:一种用于篮球训练场景中的人体活动识别和运动分析的多模态数据集

Xian Gao, Haoyue Zhang, Zongyun Zhang, Jiacheng Ruan, Ting Liu, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BasketHAR数据集,用于解决现有HAR数据集在体育分析应用中的不足,通过多模态数据包括运动传感器和视频记录,提供先进的HAR任务研究资源。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17037 2026-04-21 cs.CL 79%

Dynamic Emotion and Personality Profiling for Multimodal Deception Detection

动态情绪与人格画像用于多模态欺骗检测

Li Zheng, Yanyi Luo, Hao Fei, Yuzhe Ding, Yujie Huang, Fei Li, Chong Teng, Donghong Ji

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门与可信计算教育部重点实验室,网络安全科学与工程学院,武汉大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模型多提示标注方案和严格标签质量评估标准,建立多模态联合检测数据集DDEP,提出Rel-DDEP框架,通过高维高斯分布空间量化不确定性,实现欺骗、情绪和人格的联合检测。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16980 2026-04-21 cs.LG cs.AI 79%

Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models

评估多模态大语言模型在住院诊断中的表现:在十个前沿模型上的真实世界性能、安全性和成本

Bruce A. Bassett, Amy Rouillard, Sitwala Mundia, Michael Cameron Gramanie, Linda Camara, Ziyaad Dangor, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Ismail Kalla, Haroon Saloojee

机构 * School of Computer Science and Applied Mathematics, University of the Witwatersrand(沃斯兰大学计算机科学与应用数学学院) Wits MIND Institute, University of the Witwatersrand(沃斯兰大学Wits MIND研究所) Grai Labs, Cape Town, South Africa(南非开普敦Grai实验室) Faculty of Health Sciences, University of the Witwatersrand(沃斯兰大学健康科学学院) South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand(南非医学研究委员会疫苗与传染病分析研究单位,沃斯兰大学健康科学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文评估了十个前沿多模态大语言模型在住院诊断中的真实世界性能,发现尽管成本差异大,模型表现紧密聚集,且在安全性和诊断准确性上均优于常规护理。

Comments 17 pages, 11 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01306 2026-04-21 cs.CL 79%

M2-Verify: A Large-Scale Multidomain Benchmark for Checking Multimodal Claim Consistency

M2-Verify:一个大规模多领域基准用于检查多模态声明一致性

Abolfazl Ansari, Delvin Ce Zhang, Zhuoyang Zou, Wenpeng Yin, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出M2-Verify基准,用于评估多模态科学声明与证据之间的一致性。该数据集包含16个领域46.9万实例,通过专家审核验证,揭示了现有模型在复杂挑战中的表现不足。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17932 2026-04-21 cs.SE cs.AI 79%

From Charts to Code: A Hierarchical Benchmark for Multimodal Models

从图表到代码:一个多模态模型的分层基准

Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu, Zijian Zhang, Yifei Tao, Dongxing Mao, Yang Wan, Jingru Tan, Min Zeng, Min Li, Alex Jinpeng Wang

机构 * CSU-JPG, Central South University(中南大学CSU-JPG) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Chart2Code基准,用于评估大多模态模型的图表理解和代码生成能力,包含三个层级任务,涵盖图表复现、编辑和长表转图表生成,测试了25种最先进的LMMs,结果显示GPT-5在编辑任务中表现不佳,凸显了该基准的挑战性。

Comments This work has been accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19685 2026-04-21 cs.CV cs.AI 79%

Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline

生成篡改面部图像的归因报告:一个数据集和基线

Jingchun Lian, Lingyu Liu, Yaxiong Wang, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng

机构 * Xi’an Jiaotong University(西安交通大学) Hefei University of Technology(合肥工业大学) CSIRO(澳大利亚联邦科学与工业研究组织) Northwestern Polytechnical University(西北工业大学) University of Macau(澳门大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态篡改追踪数据集和 ForgeryTalker 框架,通过联合定位篡改区域和生成自然语言解释,提升面部伪造检测的语义理解能力。

Comments Accepted to ACL 2026 (Main Conference). This version includes camera-ready revisions and updated experimental results

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17871 2026-04-21 cs.HC 78%

Design and Evaluation of a Culturally Adapted Multimodal Virtual Agent for PTSD Screening

面向PTSD筛查的跨文化多模态虚拟代理设计与评估

Cengiz Ozel, Waleed Nadeem, Samuel Potter, Yahya Bokhari, Bdour Alwuqaysi, Wejdan Alotaibi, Rahaf Fahad Alnufaie, Sabri Boughorbel, Abdulrhman Aljouie, Rakan Altasan, Ehsan Hoque

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文设计并评估了适用于军事医疗场景的跨文化多模态虚拟代理Molhim,通过可配置的对话流程实现特定目的的交互,支持结构化多轮对话和自动会后分析,集成PCL-5量表进行PTSD筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19897 2026-04-21 cs.AI cs.CL cs.CV cs.HC 78%

ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows

ScienceBoard: 评估多模态自主代理在真实科学工作流中的表现

Qiushi Sun, Zhoumianze Liu, Chang Ma, Zichen Ding, Fangzhi Xu, Zhangyue Yin, Haiteng Zhao, Zhenyu Wu, Kanzhi Cheng, Zhaoyang Liu, Jianing Wang, Qintong Li, Xiangru Tang, Tianbao Xie, Xiachong Feng, Xiang Li, Ben Kao, Wenhai Wang, Biqing Qi, Lingpeng Kong, Zhiyong Wu

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Peking University(北京大学) Nanjing University(南京大学) East China Normal University(华东师范大学) Yale University(耶鲁大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 ScienceBoard通过真实多领域环境和169个高质量任务评估多模态自主代理在科学工作流中的能力,发现现有代理在复杂任务中仅达到15%的成功率,揭示了改进设计原则的必要性。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07143 2026-04-21 cs.CV 77%

Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods

我们是否在使用正确的基准:视觉令牌压缩方法的评估框架

Chenfei Liao, Wensong Wang, Zichen Wen, Xu Zheng, Yiyu Wang, Haocong He, Yuanhuiyi Lyu, Lutao Jiang, Xin Zou, Yuqian Fu, Bin Ren, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) MBZUAI

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文通过实验证明现有基准含大量无关样本, downsampling能有效过滤样本,提出VTC-Bench框架以更公平评估视觉令牌压缩方法。

Comments Accepted by ACL2026 Main. Code: https://github.com/Chenfei-Liao/VTC-Bench; Project Page: https://chenfei-liao.github.io/VTC-Bench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21282 2026-04-21 cs.RO 71%

EgoWalk: A Multimodal Dataset for Robot Navigation in the Wild

EgoWalk:一种用于野外机器人导航的多模态数据集

Timur Akhtyamov, Mohamad Al Mdfaa, Javier Antonio Ramirez Benavides, Arthur Nigmatzyanov, Sergey Bakulin, German Devchich, Denis Fatykhov, Diego Ruiz Salinas, Alexander Mazurov, Kristina Zipa, Malik Mohrat, Pavel Kolesnik, Ivan Sosin, Gonzalo Ferrer

机构 * Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所) Sber Robotics Center(Sber机器人中心)

专题命中 多模态评测 :multimodal(title)

AI总结 本文提出EgoWalk数据集,包含50小时人类在多样化环境中的导航数据,提供多模态数据及自动化子集生成流程,展示其在机器人导航中的应用价值。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16708 2026-04-21 eess.SP 71%

Knowledge Distillation for Lightweight Multimodal Sensing-Aided mmWave Beam Tracking

知识蒸馏用于轻量级多模态感知辅助毫米波波束跟踪

Mengyuan Ma, Isuri Welgamage, Ahmed Alkhateeb, A. Lee Swindlehurst, Markku Juntti, Nhan Thanh Nguyen

专题命中 多模态评测 :multimodal(title)

AI总结 本文提出基于知识蒸馏的轻量模型框架,利用摄像头和雷达数据实现高效波束预测与跟踪,实验显示多模态融合优于单一模态方法,模型在精度提升的同时显著降低计算复杂度和参数量。

Comments 5 pages, 4 figures, submitted to IEEE SPAWC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17028 2026-04-21 cs.CV 70%

IMA-MoE: An Interpretable Modality-Aware Mixture-of-Experts Framework for Characterizing the Neurobiological Signatures of Binge Eating Disorder

IMA-MoE:一种可解释的模态感知专家混合框架,用于表征暴食障碍的神经生物学特征

Lin Zhao, Qiaohui Gao, Elizabeth Martin, Kurt P. Schulz, Tom Hildebrandt, Robyn Sysko, Tianming Liu, Xiaobo Li

机构 * Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) College of Engineering, Northeastern University(东北大学工程学院) Department of Psychiatry, Icahn School of Medicine at Mount Sinai(辛克尔医学中心精神科部门) School of Computing, University of Georgia(佐治亚大学计算机科学学院)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出IMA-MoE框架,通过整合多模态数据揭示暴食障碍的可泛化神经生物学特征,展示其在区分暴食障碍与健康对照组中的优越性能及性别差异预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16858 2026-04-21 cs.CV 70%

Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement

Q-DeepSight:利用图像激励思考用于图像质量评估与细化

Xudong Li, Jiaxi Tan, Ziyin Zhou, Yan Zhong, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Q-DeepSight框架,通过多模态链式思考与工具增强证据获取,提升图像质量评估与细化的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16504 2026-04-21 cs.CV cs.LG 70%

From Handwriting to Structured Data: Benchmarking AI Digitisation of Handwritten Forms

从手写到结构化数据:基准测试AI手写文档数字化

Nicholas Pather, Joshua Fouché, Sitwala Mundia, Karl-Günter Technau, Thokozile Malaba, Alex Welte, Ushma Mehta, Bruce A. Bassett

机构 * CSAM, University of the Witwatersrand(沃特沙尔德大学计算机科学与数学系) Grai Labs(Grai实验室) Faculty of Health Sciences, University of the Witwatersrand(沃特沙尔德大学健康科学学院) Empilweni Services and Research Unit, Department of Paediatrics and Child Health, University of the Witwatersrand(沃特沙尔德大学儿科与儿童健康部门Empilweni服务与研究单位) Division of Epidemiology and Biostatistics, School of Public Health, Faculty of Health Sciences, University of Cape Town(开普敦大学公共卫生学院流行病学与生物统计学系) Discipline of Public Health, School of Medicine, University of KwaZulu-Natal(夸祖鲁-纳塔尔大学医学院公共卫生系) WITS MIND Institute and CSAM, University of the Witwatersrand, University of Cape Town & Grai Labs(沃特沙尔德大学WITS MIND研究所和CSAM、开普敦大学及Grai实验室)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文评估了17种前沿多模态大语言模型在处理复杂手写表格任务中的表现,发现最新版Google和OpenAI模型在准确率和F1分数上达到85%和90%,并展示了提示优化对性能的显著提升。

Comments 19 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03331 2026-04-21 cs.CV cs.AI cs.LG 62%

MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models

MMErroR:面向视觉-语言模型错误推理的基准测试

Yang Shi, Yifeng Xie, Minzhe Guo, Liangsi Lu, Mingxuan Huang, Jingchao Wang, Zhihong Zhu, Boyan Xu, Zhiqi Huang

机构 * Guangdong University of Technology(广东工业大学) Hong Kong Baptist University(香港 Baptist大学) Sun Yat-sen University(中山大学) Peking University(北京大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMErroR基准,通过1997个包含单一推理错误的样本,评估视觉-语言模型检测错误推理的能力,发现即使最佳模型也仅能正确分类66.65%的错误。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏