arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 40 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 40 篇

2603.14951 2026-03-17 cs.CV 85%

GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM

GT-PCQA: 一种基于多模态大语言模型的几何-纹理解耦点云质量评估方法

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin, Yao Zhao

机构 * Beijing Jiaotong University(北京交通大学) Nanyang Technological University(南洋理工大学) University of Science and Technology Beijing(北京科技大学)

专题命中 多模态评测 :MLLM(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出GT-PCQA框架,通过2D-3D联合训练和几何-纹理解耦策略,解决点云质量评估中数据量少和模型对几何退化不敏感的问题,实现高效且泛化能力强的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15020 2026-03-17 cs.CV cs.CL 84%

MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal

MER-Bench:多模态表情包再解释的综合基准

Yiqi Nie, Fei Wang, Junjie Chen, Kun Li, Yudi Cai, Dan Guo, Chenglong Li, Meng Wang

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文提出MER-Bench,一个用于多模态表情包再解释的综合基准,通过多模态大语言模型评估结构保持、语义一致性和情感转换,揭示现有系统在约束满足上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13238 2026-03-17 cs.CV cs.CL 84%

KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR

KazakhOCR: 一种用于评估多模态模型在低资源库尔德语手写体OCR中的合成基准

Henry Gagnier, Sophie Gagnier, Ashwin Kirubakaran

机构 * Pittsford Sutherland High School(皮茨福德萨瑟兰高中) Edison Academy Magnet School(埃德ison学院磁性学校)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文构建了包含7219张图像的合成OCR数据集,用于评估多模态大语言模型在低资源库尔德语手写体OCR和语言识别中的性能,发现传统OCR在字符错误率上优于MLLMs。

Comments Accepted to AbjadNLP @ EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15467 2026-03-17 cs.CV 83%

Evaluating Time Awareness and Cross-modal Active Perception of Large Models via 4D Escape Room Task

通过4D逃脱房间任务评估大模型的时间意识和跨模态主动感知

Yurui Dong, Ziyue Wang, Shuyun Lu, Dairu Liu, Xuechen Liu, Fuwen Luo, Peng Li, Yang Liu

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出4D逃脱房间任务,用于评估大模型在时间变化和不可逆条件下跨模态感知和时间意识的能力,发现模型在多模态整合中存在模态偏差和能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15117 2026-03-17 cs.CL 83%

MMKU-Bench: A Multimodal Update Benchmark for Diverse Visual Knowledge

MMKU-Bench:一种多模态更新基准,用于多样化视觉知识

Baochen Fu, Yuntao Du, Cheng Chang, Baihao Jin, Wenzhi Deng, Muhao Xu, Hongmei Yan, Weiye Song, Yi Wan

机构 * Shandong University, Jinan, China(山东大学,济南,中国)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出MMKU-Bench,用于评估多模态知识更新,包含25k以上知识实例和49k张图像,涵盖更新知识和未知知识两种场景,评估SFT、RLHF和KE等方法,发现SFT和RLHF易遗忘,KE保留能力但更新有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13099 2026-03-17 cs.AI cs.CV cs.IR cs.MM 82%

Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation

超越最终答案:CRYSTAL基准用于透明多模态推理评估

Wayner Barrios, SouYoung Jin

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 CRYSTAL基准通过可验证的中间步骤评估多模态推理,提出Match F1和Ordered Match F1两个指标,揭示模型在推理顺序、精度与召回率上的系统性缺陷,并引入CPR和CPR-Curriculum提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05264 2026-03-17 cs.CV cs.AI 81%

Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation

迈向3D人体姿态估计中多模态学习的平衡

Mengshi Qi, Jiaxuan Peng, Xianlin Zhang, Huadong Ma

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种平衡多模态学习方法,利用RGB、LiDAR、毫米波和WiFi数据,通过Shapley值算法评估模态贡献并解决模态不平衡问题,提升复杂环境下3D姿态估计性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14559 2026-03-17 cs.CV cs.AI cs.IR 81%

A comprehensive multimodal dataset and benchmark for ulcerative colitis scoring in endoscopy

一种全面的多模态数据集和基准用于内镜溃疡性结肠炎评分

Noha Ghatwary, Jiangbei Yue, Ahmed Elgendy, Hanna Nagdy, Ahmed Galal, Hayam Fathy, Hussein El-Amin, Venkataraman Subramanian, Noor Mohammed, Gilberto Ochoa-Ruiz, Sharib Ali

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个包含专家标注的MES和UCEIS评分及临床描述的多中心多分辨率数据集,结合双评分指标和专家生成的图像描述,为开发具有临床意义的多模态算法提供新机遇。

Comments 11

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13886 2026-03-17 cs.CV cs.AI 81%

Multi-Modal Character Localization and Extraction for Chinese Text Recognition

多模态字符定位与提取用于中文文本识别

Qilong Li, Chongsheng Zhang

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LER方法,通过解耦字符并考虑中文复杂结构,提升中英文文本识别性能,实验表明在大规模中文和英文基准上均取得显著成果。

Comments On January 08th, 2026, this paper has been accepted by the IEEE Transactions on Multimedia journal. To appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13590 2026-03-17 cs.CV cs.AI 81%

Opportunistic Cardiac Health Assessment: Estimating Phenotypes from Localizer MRI through Multi-Modal Representations

机会性心脏健康评估:通过多模态表示从局部定位MRI估计表型

Busra Nur Zeybek, Özgün Turgut, Yundi Zhang, Jiazhen Pan, Robert Graf, Sophie Starck, Daniel Rueckert, Sevgi Gokce Kafali

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital(人工智能在医疗与健康中的研究所,慕尼黑技术大学(TUM)和TUM大学医院) Department of Diagnostic and Interventional Neuroradiology, School of Medicine, TUM University Hospital(诊断与介入神经放射科,医学院,TUM大学医院) Department of Computing, Imperial College London(计算学院,伦敦帝国学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML),德国)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出C-TRIP框架,通过融合局部定位MRI、ECG和表格数据,利用低成本信息预测心脏表型,提升心脏健康评估的可及性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13427 2026-03-17 cs.CV cs.AI 81%

MIBench: Evaluating LMMs on Multimodal Interaction

MIBench: 评估大多模态模型在多模态交互中的能力

Yu Miao, Zequn Yang, Yake Wei, Ziheng Chen, Haotian Ni, Haodong Duan, Kai Chen, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学人工智能学院,北京,中国) Beijing Key Laboratory of Research on Large Models(大型模型研究关键实验室) Beihang University, Beijing, China(北京航空航天大学,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MIBench通过多模态交互三元组评估大模型在多模态任务中的能力,发现模型在多模态交互上存在局限性,易受文本干扰,且在基础协同能力上表现不足。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10722 2026-03-17 cs.CV cs.AI 81%

UAV traffic scene understanding: A regulation embedded multi-modal network and a unified benchmark

无人机交通场景理解:一种嵌入监管的多模态网络和一个统一的基准

Yu Zhang, Zhicheng Zhao, Ze Luo, Chenglong Li, Jin Tang

机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing 100190, China(中国科学院计算机网络信息中心,北京100190,中国) University of Chinese Academy of Sciences, Beijing 100190, China(中国科学院大学,北京100190,中国) Anhui Provincial Key Laboratory of Multi-modal Cognitive Computation, Anhui University, Hefei 230601, China(安徽省多模态认知计算重点实验室,安徽大学,合肥230601,中国) Information Materials and Intelligent Sensing Laboratory of Anhui Province, Anhui University, Hefei 230601, China(安徽省信息材料与智能感知实验室,安徽大学,合肥230601,中国)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MTCNet多模态交通认知网络,通过原型引导知识嵌入模块和质量感知光谱补偿模块,提升无人机交通场景理解的鲁棒性,并构建首个大规模光学-热红外基准Traffic-VQA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24741 2026-03-17 cs.CV 79%

Collaborating Vision, Depth, and Thermal Signals for Multi-Modal Tracking: Dataset and Algorithm

融合视觉、深度和热信号的多模态跟踪:数据集与算法

Xue-Feng Zhu, Tianyang Xu, Yifan Pan, Jinjie Gu, Xi Li, Jiwen Lu, Xiao-Jun Wu, Josef Kittler

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态跟踪任务,结合RGB、深度和热红外信号,构建RGBDT500数据集,并提出RDTTrack算法,通过融合三模态信息提升复杂场景下的跟踪鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14229 2026-03-17 cs.AI cs.SE 79%

Agentic DAG-Orchestrated Planner Framework for Multi-Modal, Multi-Hop Question Answering in Hybrid Data Lakes

基于代理的DAG编排规划框架:用于混合数据湖中多模态、多跳问答系统

Kirushikesh D B, Manish Kesarwani, Nishtha Madaan, Sameep Mehta, Aldrin Dennis, Siddarth Ajay, Rakesh B R, Renu Rajagopal, Sudheesh Kairali

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出A.DOT规划框架,通过编译自然语言查询为DAG执行计划,实现多模态多跳问答,提升准确性和效率,并生成可追溯的证据链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00744 2026-03-17 cs.CV 79%

Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs

先定位后回答:一种用于基于地面的医学多模态大语言模型的幻觉评估基准

Dung Nguyen, Minh Khoi Ho, Huy Ta, Thanh Tam Nguyen, Qi Chen, Kumar Rav, Quy Duong Dang, Satwik Ramchandre, Son Lam Phung, Zhibin Liao, Minh-Son To, Johan Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出HEAL-MedVQA基准,通过创新评估协议和67K VQA数据集,评估医学多模态模型的定位能力与幻觉鲁棒性,提出LobA框架提升视觉推理能力,实验结果表明其在挑战性基准中优于现有生物医学LMMs。

Comments Accepted at Joint Conference on Artificial Intelligence (IJCAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13362 2026-03-17 cs.SD cs.AI eess.AS 76%

Patient-Level Multimodal Question Answering from Multi-Site Auscultation Recordings

多站点听诊录音的患者级多模态问答

Fan Wu, Tsai-Ning Wang, Nicolas Zumarraga, Ning Wang, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Oliver Aalami, Paul Schmiedmayer, Robert Jakob, Patrick Langer

机构 * Agentic Systems Lab, ETH Zurich(伦理学院系统实验室,苏黎世联邦理工学院) Eindhoven University of Technology(埃因霍温理工大学) Centre for Digital Health Interventions, ETH Zurich(数字健康干预中心,苏黎世联邦理工学院) Centre for Digital Health Interventions, University of St. Gallen(数字健康干预中心,圣加尔登大学) Stanford Mussallem Center for Biodesign, Stanford University(斯坦福穆萨勒姆生物设计中心,斯坦福大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI、eess.AS

AI总结 本文提出通过门控交叉注意力将多站点听诊录音与冻结的大语言模型嵌入空间对齐,实现患者级评估,在CaReSound基准上取得SOTA结果,展示轻量领域特定编码器与多站点聚合的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12720 2026-03-17 cs.CL cs.CV cs.MM cs.SD 75%

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

Omni-Captioner:多模态信息细粒度感知的数据管道、模型与基准

Ziyang Ma, Ruiyang Xu, Zhenghao Xing, Yunfei Chu, Yuxuan Wang, Jinzheng He, Jin Xu, Pheng-Ann Heng, Kai Yu, Junyang Lin, Eng Siong Chng, Xie Chen

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出Omni-Captioner,通过数据管道、模型和基准系统,系统研究多模态细粒度感知,提出Omni-Detective生成高质量数据,实现音频和视频细粒度描述的最优性能。

Comments Accepted by ICLR2026. Open Source at https://github.com/ddlBoJack/Omni-Captioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13391 2026-03-17 cs.CV 74%

WebVR: Benchmarking Multimodal LLMs for WebPage Recreation from Videos via Human-Aligned Visual Rubrics

WebVR:通过人类对齐的视觉标准基准测试多模态大语言模型从视频中重建网页

Yuhong Dai, Yanlin Lai, Mitt Huang, Hangyu Guo, Dingming Li, Hongbo Peng, Haodong Li, Yingxiu Zhao, Haoran Lyu, Zheng Ge, Xiangyu Zhang, Daxin Jiang

机构 * StepFun Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 WebVR通过人类对齐的视觉标准评估多模态大语言模型从视频中重建网页的能力,包含175个多样化网页,展示了模型在细节风格和运动质量上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15540 2026-03-17 cs.CV cs.CL 73%

Beyond Words: Enhancing Desire, Emotion, and Sentiment Recognition with Non-Verbal Cues

超越词语:利用非语言线索增强欲望、情感和情感识别

Wei Chen, Tongguan Wang, Feiyue Xue, Junkai Li, Hui Liu, Ying Sha

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SyDES框架,通过双向细粒度模态对齐和非语言线索利用,提升多模态欲望、情感和情感识别性能,实验显示在MSED基准上取得新的SOTA成果。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15409 2026-03-17 cs.CL 70%

SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia

SEA-Vision:面向东南亚的多语言综合文档和场景文本理解基准

Pengfei Yue, Xingran Zhao, Juntao Chen, Peng Hou, Wang Longchao, Jianghang Lin, Shengchuan Zhang, Anxiang Zeng, Liujuan Cao

机构 * Xiamen University, China(厦门大学,中国) Shopee, China(Shopee,中国) Tongji University, China(同济大学,中国)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CL

AI总结 SEA-Vision提出一个多语言基准,用于评估文档解析和文本中心视觉问答,涵盖11种东南亚语言,包含15234页文档和7496对问答对,揭示多语言文档理解的差距。

Comments Accepted By CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07610 2026-03-17 cs.CV cs.CL cs.HC 62%

SpatialViz-Bench: A Cognitively-Grounded Benchmark for Diagnosing Spatial Visualization in MLLMs

SpatialViz-Bench:一种基于认知的多模态基准,用于诊断大语言模型中的空间可视化能力

Siting Wang, Minnan Pei, Luoyang Sun, Cheng Deng, Yuchen Li, Kun Shao, Zheng Tian, Haifeng Zhang, Jun Wang

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SpatialViz-Bench,一个包含12个任务和4种子能力的多模态基准,通过1180个程序生成问题评估大语言模型的空间可视化能力,揭示了模型在空间任务中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04779 2026-03-17 cs.CL cs.SD eess.AS 62%

MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark

MMSU:一个大规模多任务语音语言理解与推理基准

Dingdong Wang, Junan Li, Jincenzi Wu, Dongchao Yang, Xueyuan Chen, Tianhua Zhang, Helen Meng

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 MMSU基准通过整合语音的语义、语调和语音学特征,评估语音语言理解与推理能力,发现现有模型存在改进空间,为开发更高级的人机语音交互系统提供新标准。

Comments ICLR 2026. MMSU benchmark is available at https://huggingface.co/datasets/ddwang2000/MMSU. Project page https://github.com/dingdongwang/MMSU

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16643 2026-03-17 cs.CV cs.AI 62%

From Evaluation to Defense: Advancing Safety in Video Large Language Models

从评估到防御:推进视频大语言模型的安全性

Yiwei Sun, Peiqi Jiang, Chuanbin Liu, Luohao Lin, Zhiying Lu, Hongtao Xie

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VideoSafety-R1框架,通过创新方法提升视频大语言模型的安全性,实验显示其在多个安全数据集上取得显著提升。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14426 2026-03-17 cs.CV cs.IR cs.MM 62%

GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos

GenState-AI:面向AI生成视频的基于状态的文本到视频检索数据集

Minghan Li, Tongna Chen, Tianrui Lv, Yishuai Zhang, Suchao An, Guodong Zhou

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV、cs.MM

AI总结 本文提出GenState-AI数据集,通过可控状态转换和显式端状态标注,解决文本到视频检索中时间推理和端状态定位不足的问题,评估两种基线模型并分析时间与语义混淆源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14326 2026-03-17 cs.LG cs.AI cs.CL 62%

ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation

ECG-Reasoning-Benchmark: 一个用于评估心电图解读中临床推理能力的基准

Jungwoo Oh, Hyunseung Chung, Junhee Lee, Min-Gyu Kim, Hangyul Yoon, Ki Seong Lee, Youngchae Lee, Muhan Yeo, Edward Choi

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ECG-Reasoning-Benchmark,通过6400个样本系统评估17种核心心电图诊断的逐步推理能力,发现现有多模态大语言模型在多步逻辑推理中存在严重缺陷,无法有效将心电图发现与实际信号证据关联。

Comments Preprint. 9 pages for main text, 2 pages for references, 19 pages for supplementary materials (appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14323 2026-03-17 cs.CV cs.AI 62%

How Do Medical MLLMs Fail? A Study on Visual Grounding in Medical Images

医学 MLLMs 如何失效?对医学图像中视觉语义关联的探讨

Guimeng Liu, Tianze Yu, Somayeh Ebrahimkhani, Lin Zhi Zheng Shawn, Kok Pin Ng, Ngai-Man Cheung

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了医学 MLLMs 在视觉关联上的不足,通过设计 VGMED 数据集和 VGRefine 方法,验证了其在医学图像任务中的性能瓶颈。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16457 2026-03-17 cs.HC cs.AI cs.CL 62%

Integrating Personality into Digital Humans: A Review of LLM-Driven Approaches for Virtual Reality

将人格融入数字人类:一种基于大语言模型的虚拟现实方法综述

Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Färber, Pedro Schindler Freire Brasil Ribeiro, Rafael Teixeira Sousa, Arlindo Rodrigues Galvão Filho

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了利用大语言模型驱动虚拟现实中的数字人类人格塑造方法,探讨了零样本、少样本和微调等技术,并指出计算需求、延迟及多模态交互评估框架缺乏等挑战。

Comments Revised and expanded version of the survey published in Findings of EMNLP 2025. Includes 14 pages and 2 figures

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, 9519--9532

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14952 2026-03-17 cs.CV 57%

Pansharpening for Thin-Cloud Contaminated Remote Sensing Images: A Unified Framework and Benchmark Dataset

针对薄云污染的遥感图像全色增强:一个统一框架和基准数据集

Songcheng Du, Yang Zou, Jiaxin Li, Mingxuan Liu, Ying Li, Changjing Shang, Qiang Shen

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出统一全色增强模型与薄云去除框架,通过频率解耦恢复模块和交互频域一致性模块提升图像恢复性能,并构建首个真实世界薄云污染数据集,验证了方法在实际大气退化下的优越性。

Comments 11 pages,5 figures,published in AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14880 2026-03-17 cs.CV 57%

RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulation

RealVLG-R1: 一个大规模真实世界视觉-语言接地基准,用于机器人感知与操作

Linfei Li, Lin Zhang, Ying Shen

机构 * School of Computer Science and Technology, Tongji University, China(同济大学计算机科学与技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RealVLG框架,结合RealVLG-11B数据集和RealVLG-R1模型,统一了真实世界视觉-语言接地与抓取任务,支持零样本感知与操作,提供全面的数据与评估平台。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21071 2026-03-17 cs.HC cs.AI 57%

FingerTip 20K: A Benchmark for Proactive and Personalized Mobile LLM Agents

FingerTip 20K: 一个用于主动和个性化移动大语言模型代理的基准测试

Qinglong Yang, Haoming Li, Haotian Zhao, Xiaokai Yan, Jingtao Ding, Fengli Xu, Yong Li

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出FingerTip 20K基准测试,通过收集20000个真实用户多步骤Android交互演示,评估主动任务建议和个性化任务执行的挑战,展示基于用户信息的移动LLM代理的潜力。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏