arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-31 至 2026-03-31 共收录 27 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 27 篇

2603.01305 2026-03-31 cs.CV cs.AI 84%

AG-VAS: Anchor-Guided Zero-Shot Visual Anomaly Segmentation with Large Multimodal Models

AG-VAS:基于大多模态模型的锚引导零样本视觉异常分割

Zhen Qu, Xian Tao, Xiaoyi Bao, Dingrong Wang, ShiChen Qu, Zhengtao Zhang, Xingang Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Casivision(中科视语) Weiqiao-UCAS Science and Technology Park(魏桥国科科技园)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 AG-VAS通过引入三个可学习的语义锚点,建立统一的锚引导分割范式,提升零样本视觉异常分割的精度与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26859 2026-03-31 cs.CV cs.AI eess.IV 84%

Beyond Textual Knowledge-Leveraging Multimodal Knowledge Bases for Enhancing Vision-and-Language Navigation

超越文本知识的多模态知识库用于增强视觉-语言导航

Dongsheng Yang, Yinfeng Yu, Liejun Wang

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing(丝绸之路多语言认知计算联合国际研究实验室)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出BTK框架,通过整合环境特定文本知识与生成图像知识库,提升视觉-语言导航中的语义 grounding 和跨模态对齐,实验表明在R2R和REVERIE数据集上性能显著提升。

Comments Main paper (37 pages). Accepted for publication by the Information Processing and Management,Volume 63,Issue 6,September 2026,104766

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27737 2026-03-31 cs.CV 83%

Synergizing Discriminative Exemplars and Self-Refined Experience for MLLM-based In-Context Learning in Medical Diagnosis

融合判别示例与自我优化经验的医学诊断基于MLLM的上下文学习

Wenkai Zhao, Zipei Wang, Mengjie Fang, Di Dong, Jie Tian, Lingwei Zhang

机构 * CAS Key Laboratory of Molecular Imaging, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所分子影像重点实验室) School of Software, North University of China(中北大学软件学院)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出Clinician Mimetic Workflow框架,结合判别示例核心集选择与自我优化经验总结,提升医学诊断中基于MLLM的上下文学习性能,超越零样本通用和医疗MLLM,并接近全监督视觉模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16417 2026-03-31 cs.AI 83%

Pharos-ESG: A Framework for Multimodal Parsing, Contextual Narration, and Hierarchical Labeling of ESG Report

Pharos-ESG:一种用于多模态解析、上下文叙述和分层标注ESG报告的框架

Yan Chen, Yu Zou, Jialei Zeng, Haoran You, Xiaorui Zhou, Aixi Zhong

机构 * Southwestern University of Finance and Economics(西南财经大学)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出Pharos-ESG框架,通过多模态解析、上下文叙述和分层标注解决ESG报告中布局混乱和隐含层级的问题,实现结构化表示,并发布Aurora-ESG数据集以支持金融治理决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27187 2026-03-31 cs.LG 82%

Omni-Modal Dissonance Benchmark: Systematically Breaking Modality Consensus to Probe Robustness and Calibrated Abstention

多模态不和谐基准:系统性打破模态共识以探测鲁棒性及校准的回避

Zabir Al Nazi, Shubhashis Roy Dipta, Md Rizwan Parvez

机构 * University of California, Riverside(加州大学河滨分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 多模态评测 :omni-modal(title,abstract);cross-modal(abstract)

AI总结 本文提出OMD-Bench,通过系统性破坏多模态一致性来评估模型的鲁棒性和校准能力,发现模型在模态冲突时存在过度回避或严重回避的问题,且链式推理提示虽提升回避一致性,但加剧了过度自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28407 2026-03-31 cs.AI cs.CL 81%

MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome

MiroEval: 多模态深度研究代理的流程与成果评估基准

Fangda Ye, Yuxin Hu, Pengxiang Zhu, Yibo Li, Ziqi Jin, Yao Xiao, Yibo Wang, Lei Wang, Zhen Zhang, Lu Wang, Yue Deng, Bin Wang, Yifan Zhang, Liangcai Su, Xinyu Wang, He Zhao, Chen Wei, Qiang Ren, Bryan Hooi, An Bo, Shuicheng Yan, Lidong Bing

机构 * MiroMind Team(MiroMind团队)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MiroEval通过100个真实需求任务评估多模态深度研究代理的流程与成果,揭示系统在适应性合成、事实验证和过程审计方面的差异,证明流程质量对整体表现的预测作用。

Comments GitHub: https://github.com/MiroMindAI/MiroEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27331 2026-03-31 cs.CL cs.MM 81%

SACRED: A Faithful Annotated Multimedia Multimodal Multilingual Dataset for Classifying Connectedness Types in Online Spirituality

SACRED:一个忠实标注的多媒体多模态多语言数据集,用于在线灵性中连接类型的分类

Qinghao Guan, Yuchen Pan, Donghao Li, Zishi Zhang, Yiyang Chen, Lu Li, Flaminia Canu, Emilia Volkart, Gerold Schneider

机构 * University of Zurich(苏黎世大学) Ping An Technology(平安科技)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CL、cs.MM

AI总结 本文提出SACRED数据集,用于分类在线灵性中的连接类型,评估13种LLM及传统方法,发现DeepSeek-V3在抽象概念分类中表现优异,GPT-4o-mini在视觉任务中表现最佳,同时发现新的连接类型。

Comments Accepted by LLMs4SSH 2026 at LREC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08503 2026-03-31 cs.CV cs.AI 81%

Disrupting Hierarchical Reasoning: Adversarial Protection for Geographic Privacy in Multimodal Reasoning Models

破坏层次推理:多模态推理模型中地理隐私的对抗保护

Jiaming Zhang, Che Wang, Yang Cao, Longtao Huang, Wei Yang Bryan Lim

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) Institute of Science Tokyo(东京科学大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ReasonBreak框架,通过概念感知扰动破坏多模态推理模型中的层次推理,利用GeoPrivacy-6K数据集验证其在提升地理隐私保护效果上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28550 2026-03-31 cs.CV 79%

MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures

MarkushGrapher-2:端到端多模态识别化学结构

Tim Strohmeyer, Lucas Morin, Gerhard Ingmar Meijer, Valéry Weber, Ahmed Nassar, Peter Staar

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MarkushGrapher-2,通过OCR提取化学图像文本,结合视觉-文本-布局编码器和光学化学结构识别编码器,实现多模态化学结构识别,并通过两阶段训练策略提升性能,同时构建大规模真实世界Markush结构数据集。

Comments 15 pages, to be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09326 2026-03-31 cs.CV 79%

OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models

OddGridBench: 暴露多模态大语言模型在细粒度视觉差异敏感性方面的不足

Tengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li, Lin Ma, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen Technology University(深圳技术大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Meituan(美团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出OddGridBench基准,评估多模态大语言模型的视觉差异敏感性,发现其检测能力远低于人类,提出OddGrid-GRPO框架提升模型细粒度视觉辨别能力。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26952 2026-03-31 cs.CV cs.LG 79%

Multimodal Deep Learning for Diabetic Foot Ulcer Staging Using Integrated RGB and Thermal Imaging

多模态深度学习在结合RGB和热成像的糖尿病足溃疡分期中的应用

Gulengul Mermer, Mustafa Furkan Aksu, Gozde Ozsezer, Sevki Cetinkalp, Orhan Er, Mehmet Kemal Gullu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究了多模态图像对深度学习模型在糖尿病足溃疡分期中的影响,通过RGB和热成像数据结合提升模型性能,VGG16模型在RGB+热成像数据集上达到93.25%的准确率。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12378 2026-03-31 cs.CV 79%

M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstruction

M4Human: 一种大规模多模态毫米波雷达基准用于人体网格重建

Junqiao Fan, Yunjiao Zhou, Yizhuo Yang, Xinyuan Cui, Jiarui Zhang, Lihua Xie, Jianfei Yang, Chris Xiaoxuan Lu, Fangqiang Ding

机构 * NTU(南洋理工大学) University of Edinburgh(爱丁堡大学) UPenn(宾夕法尼亚大学) UCL(伦敦大学学院) MIT(麻省理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出M4Human,首个大规模多模态毫米波雷达基准,提供高分辨率雷达、RGB和深度数据,用于解决传统视觉传感的遮挡、光照和隐私问题,推动人体建模研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28115 2026-03-31 cs.LG 78%

Graph Vector Field: A Unified Framework for Multimodal Health Risk Assessment from Heterogeneous Wearable and Environmental Data Streams

图向量场:一种统一的多模态健康风险评估框架,用于异构可穿戴和环境数据流

Silvano Coletti, Francesca Fallucchi

机构 * Università degli Studi Guglielmo Marconi, Roma, Italy(意大利罗马古列尔莫·马可尼大学) Chelonia SA, Lugano, Switzerland(瑞士卢加诺Chelonia SA)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出图向量场框架,通过结合离散微分几何算子与模态结构混合专家,统一多模态健康风险评估,实现可解释的模态解析风险建模。

Comments 25 pages, 6 appendices. Theoretical framework; no empirical experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08752 2026-03-31 cond-mat.mtrl-sci 78%

NMRPeak: a ready-to-use intelligent system for molecular structure elucidation enabled by synergistic cross-modal learning

NMRPeak:一种基于协同跨模态学习的分子结构解析智能系统

Fanjie Xu, Jinyuan Hu, Jingxiang Zou, Junjie Wang, Boying Huang, Zhifeng Gao, Xiaohong Ji, Weinan E, Zhong-Qun Tian, Fujie Tang, Jun Cheng

专题命中 多模态评测 :cross-modal(title,abstract)

AI总结 NMRPeak通过实验驱动设计整合谱预测、检索和生成任务,实现分子结构解析的突破性性能,提升实验场景下的应用效用。

Comments 35 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28651 2026-03-31 cs.AI 70%

Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning

不是搜索,而是扫描:在面向学术论文推理的扫描任务上基准测试大语言模型

Rongjin Li, Zichen Tang, Xianghe Wang, Xinyi Hu, Zhengyu Wang, Zhengyu Lu, Yiling Huang, Jiayuan Chen, Weisheng Tan, Jiacheng Liu, Zhongjun Yang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出ScholScan基准,通过扫描式任务评估大语言模型在学术论文推理中的能力,发现检索增强生成方法在扫描任务上无显著提升,揭示了当前模型在该任务上的系统性缺陷。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24903 2026-03-31 cs.CV 70%

Self-Supervised Learning for Knee Osteoarthritis: Diagnostic Limitations and Prognostic Value of Hospital Data

自监督学习在膝骨关节炎中的应用:医院数据的诊断局限性与预后价值

Haresh Rengaraj Rajamohan, Yuxuan Chen, Kyunghyun Cho, Cem M. Deniz

机构 * Department of Physics, J.K. Institute of Science(物理系,J.K. 科学研究所) World Scientific University(世界科学大学) University of Intelligent Studies(智能研究大学) Center for Data Science, New York University(数据科学中心,纽约大学) Bernard and Irene Schwartz Center for Biomedical Imaging, New York University Langone Health(伯纳德和艾琳·施瓦茨生物医学成像中心,纽约大学朗格尼健康中心) Department of Radiology, New York University Langone Health(放射学系,纽约大学朗格尼健康中心) Perlmutter Cancer Center, New York University Langone Health(珀尔马特癌症中心,纽约大学朗格尼健康中心)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本研究评估自监督学习是否能提升膝骨关节炎的诊断与预后建模,发现医院数据在诊断分级中表现有限,但对预后预测有显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24569 2026-03-31 cs.CV 70%

POLY-SIM: Polyglot Speaker Identification with Missing Modality Grand Challenge 2026 Evaluation Plan

POLY-SIM:基于缺失模态的多模态说话人识别挑战2026评估计划

Marta Moscati, Muhammad Saad Saeed, Marina Zanoni, Mubashir Noman, Rohan Kumar Das, Monorama Swain, Yufang Hou, Elisabeth Andre, Khalid Mahmood Malik, Markus Schedl, Shah Nawaz

机构 * Institute of Computational Perception, Johannes Kepler University Linz, Austria(林茨约翰·开普勒大学计算感知研究所) University of Michigan-Flint, USA(密歇根大学弗林特分校) Sapienza University of Rome, Italy(罗马大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Fortemedia Singapore, Singapore(新加坡Fortemedia公司) IT:U Interdisciplinary Transformation University Austria(奥地利跨学科转型大学) University of Augsburg, Germany(奥格斯堡大学) Human-centered AI Group, AI Lab, Linz Institute of Technology, Austria(奥地利林茨理工学院人工智能实验室人本人工智能组)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文针对多模态说话人识别中缺失模态和跨语言条件下的鲁棒性问题,提出POLY-SIM 2026挑战,设计标准化基准和评估框架以推动更实用的系统发展。

Comments Grand challenge at ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15090 2026-03-31 cs.DB cs.AI cs.CV 62%

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

SciEGQA:一个用于科学证据基础问题回答与推理的数据集

Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The University of Hong Kong(香港大学) Baidu Inc.(百度公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SciEGQA数据集通过精细标注和大规模自动构建,提升视觉语言模型在科学文档中的证据定位与推理能力。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16952 2026-03-31 cs.CL cs.AI 62%

AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation

AirQA:一个用于人工智能研究的综合性问答数据集,具有实例级评估

Tiancheng Huang, Ruisheng Cao, Yuxin Zhang, Zhangyi Kang, Zijian Wang, Chenrun Wang, Yijie Luo, Hang Zheng, Lirong Qian, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Shanghai Innovation Institution(上海创新研究院) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AirQA数据集,包含13956篇AI论文和1246个问题,支持多任务、多模态和实例级评估,并提出ExTrActor框架提升小模型多轮工具使用能力。

Comments 29 page, 6 figures, 17 tables, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26837 2026-03-31 cs.RO cs.AI cs.CV 62%

SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation

SpatialAnt:通过主动场景重建与视觉预判实现自主零样本机器人导航

Jiwen Zhang, Xiangyu Shi, Siyuan Wang, Zerui Li, Zhongyu Wei, Qi Wu

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) Adelaide University(阿德莱德大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SpatialAnt通过主动场景重建和视觉预判机制,解决零样本机器人导航中自建场景的不完整和噪声问题,提升导航性能。

Comments 10 pages, 4 figures, 5 tables. Homepage: https://imnearth.github.io/Spatial-X/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26831 2026-03-31 cs.CV cs.AI 62%

Envisioning global urban development with satellite imagery and generative AI

用卫星影像和生成式AI展望全球城市发展

Kailai Sun, Yuebing Liang, Mingyi He, Yunhan Zheng, Alok Prakash, Shenhao Wang, Jinhua Zhao, Alex "Sandy'' Pentland

机构 * Singapore–MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工学院研究与技术联盟中心) Department of Urban Planning, Tsinghua University(清华大学城市规划系) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系) College of Urban and Environmental Sciences, Peking University(北京大学城市与环境学院) Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系) Stanford Institute for Human-Centered Artificial Intelligence, Stanford University(斯坦福大学以人为本人工智能研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态生成式AI框架,通过整合提示和地理空间控制,生成全球500个最大都会区的高保真城市卫星影像,支持可持续城市发展和场景规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24037 2026-03-31 cs.CV 57%

A$^3$: Towards Advertising Aesthetic Assessment

A$^3$:迈向广告审美评估

Kaiyuan Ji, Yixuan Gao, Lu Sun, Yushuo Zheng, Zijian Chen, Jianbo Zhang, Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) School of Information and Electronic Engineering, East China Normal University(华东师范大学信息与电子工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出A$^3$框架,通过理论驱动的A$^3$-Law、大规模标注数据集A$^3$-Dataset、多模态大语言模型A$^3$-Align及基准A$^3$-Bench,解决广告审美评估中主观性、缺乏标准等问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27112 2026-03-31 cs.CV 57%

RailVQA: A Benchmark and Framework for Efficient Interpretable Visual Cognition in Automatic Train Operation

RailVQA: 一个用于自动列车操作中高效可解释视觉认知的基准和框架

Sen Zhang, Runmei Li, Zhichao Zheng, Yuhe Zhang, Jiani Li, Kailun Zhang, Tao Zhang, Wenjun Wu, Qunbo Wang

机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出RailVQA-bench和RailVQA-CoM,旨在解决ATO中视觉感知与决策推理的高效可解释性问题,通过基准测试和框架提升认知泛化能力与跨领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27033 2026-03-31 cs.CV 57%

RealBirdID: Benchmarking Bird Species Identification in the Era of MLLMs

RealBirdID:在MLLM时代鸟类物种识别的基准测试

Logan Lawrence, Mustafa Chasmai, Rangel Daroya, Wuao Liu, Seoyun Jeong, Aaron Sun, Max Hamilton, Fabien Delattre, Oindrila Saha, Subhransu Maji, Grant Van Horn

机构 * Computer Vision Lab, UMass Amherst(马萨诸塞大学阿默斯特分校计算机视觉实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究针对野外细粒度鸟类识别难题,提出RealBirdID基准测试,要求系统在无法识别时提供明确依据。发现开源和专有模型在可回答案例上准确率低,且大模型在无法回答时难以给出正确理由。

Comments Accepted to CVPR26. 23 pages, 23 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11410 2026-03-31 cs.CV 57%

Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs Supplementary

看见并不意味着定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yang, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DORI基准,通过分解定向为四个维度,揭示多模态模型在物体定向任务中的系统性不足,指出其依赖分类启发式而非几何推理。

Comments This is a replacement and updated version for submission arXiv:2505.21649 : Right Side Up? Disentangling Orientation Understanding in MLLMs with Fine-grained Multi-axis Perception Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26784 2026-03-31 cs.CV 57%

HighlightBench: Benchmarking Markup-Driven Table Reasoning in Scientific Documents

HighlightBench:科学文档中基于标记的表格推理基准测试

Lexin Wang, Shenghua Liu, Yiwei Wang, Yujun Cai, Yuyao Ge, Jiayu Yao, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校) University of Queensland(昆士兰大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HighlightBench,用于评估文档中基于标记的表格推理能力,通过五个任务家族分解评估,并提供可复现的基准流程,揭示模型在视觉提示与符号推理一致性下的稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27534 2026-03-31 cs.RO 50%

S3KF: Spherical State-Space Kalman Filtering for Panoramic 3D Multi-Object Tracking

S3KF:基于旋转激光雷达和四鱼眼相机的全景三维多目标跟踪框架

Zhongyuan Liu, Shaonan Yu, Jianping Li, Pengfei Wan, Xinhang Xu, Pengfei Wang, Maggie Y. Gao, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ST Engineering(新科工程) School of Civil and Environmental Engineering, Nanyang Technological University(南洋理工大学土木与环境工程学院)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出S3KF框架,利用旋转激光雷达和四鱼眼相机实现全景三维多目标跟踪,通过球面状态表示和扩展球面卡尔曼滤波提升跟踪精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏