arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-21 至 2026-05-21 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 17 篇

2605.20892 2026-05-21 cs.CV 91%

FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition

FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition

Enhui Yu, Junhui Li, Ruitong Lu, Jialu Li, Youshan Zhang

机构 * University of Science and Technology Liaoning(辽宁科技大学) Chuzhou University(楚州大学) Yeshiva University(犹他大学)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出FruitEnsemble框架,通过多阶段动态推理解决细粒度水果分类中的泛化限制问题,利用MLLM进行专家仲裁以提升分类准确率,最终达到70.49%的分类精度。

Comments 10 pages,6 figures,submitted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15876 2026-05-21 cs.CV 81%

Unlocking Dense Metric Depth Estimation in VLMs

解锁VLMs中的密集度量深度估计

Hanxun Yu, Xuan Qu, Yuxin Wang, Jianke Zhu, Lei Ke

机构 * Zhejiang University(浙江大学) Tencent Hunyuan LLM(腾讯混元大模型) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态评测 :multimodal(abstract,abstract_cn);multimodal foundation model(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出DepthVLM,一种将单个VLM转换为原生密集几何预测器的简单有效框架,同时保持其多模态能力。通过在LLM主干上附加轻量级深度头,并在统一的视觉-文本监督范式下进行训练,DepthVLM能够在单次前向传递中生成高分辨率深度图和语言输出。此外,还引入了一个统一的室内-室外度量深度基准,实验表明DepthVLM在推理效率、复杂3D空间推理等方面均优于现有VLMs和纯视觉模型。

Comments Project Page: https://depthvlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17946 2026-05-21 cs.AI cs.CV cs.LG 81%

SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain

SVFSearch: 一种面向游戏垂直领域的多模态知识密集型短视频帧搜索基准

Lingtao Mao, Huangyu Dai, Xinyu Sun, Zihan Liang, Ben Chen, Chenyi Lei, Wenwu Ou

机构 * Kuaishou Technology(快手科技)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SVFSearch,首个针对中文游戏领域短视频帧搜索的多模态知识密集型基准,通过5000个四选一测试示例和4198个辅助训练示例,评估了从直接问答到计划-行动-重新计划代理等多种方法在短视频帧搜索中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21251 2026-05-21 eess.IV cs.CV 79%

Local-sensitive connectivity filter (ls-cf): A post-processing unsupervised improvement of the frangi, hessian and vesselness filters for multimodal vessel segmentation

局部敏感连通性滤波器(ls-cf):一种后处理的无监督改进方法,用于多模态血管分割的Frangi、Hessian和血管性滤波器

Erick O Rodrigues, Lucas O Rodrigues, João HP Machado, Dalcimar Casanova, Marcelo Teixeira, Jeferson T Oliva, Giovani Bernardes, Panos Liatsis

机构 * Department of Academic Informatics (DAINF), Universidade Tecnologica Federal do Parana (UTFPR)(学术信息系(DAINF),技术联邦大学帕托布拉诺分校(UTFPR)) Graduate Program of Sciences Applied to Health Products, Universidade Federal Fluminense (UFF)(健康产品应用科学研究生项目,联邦大学弗洛里塞分校(UFF)) Institute of Technological Sciences (ICT), Universidade Federal de Itajuba (UNIFEI)(技术科学研究所,联邦大学伊塔比亚分校(UNIFEI)) Department of Electrical Engineering and Computer Science, Khalifa University of Science and Technology(电气工程与计算机科学系,卡利法科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种无监督的多模态方法,改进Frangi滤波器的响应,实现自动血管分割。通过计算像素级血管连续性并引入局部容忍启发式方法来填补Frangi响应产生的血管不连续性,提出局部敏感连通性滤波器(LS-CF),在多种多模态数据集上取得了有竞争力的结果,尤其在OSIRIX视网膜血管造影数据集中,其准确率优于现有最先进方法。

Journal ref Journal of Imaging 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20967 2026-05-21 cs.CL 79%

ArPoMeme: An Annotated Arabic Multimodal Dataset for Political Ideology and Polarization

ArPoMeme:一个标注的阿拉伯多模态数据集用于政治意识形态和极化

Wajdi Zaghouani, Kais Attia, Md. Rafiul Biswas, Fadhl Eryani

机构 * Northwestern University in Qatar(卡塔尔西北大学) Independent Researcher(独立研究员) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学) University of Tübingen(图宾根大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出ArPoMeme数据集,用于分析阿拉伯政治漫画的多模态和意识形态维度,通过自定义工具实现大规模标注,揭示意识形态极化特征。

Comments Accepted at LREC 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20458 2026-05-21 cs.CV 79%

ELEMENT: Multi-Modal Retinal Vessel Segmentation Based on a Coupled Region Growing and Machine Learning Approach

ELEMENT:基于耦合区域生长和机器学习方法的多模态视网膜血管分割

Erick O. Rodrigues, Aura Conci, Panos Liatsis

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于耦合区域生长和机器学习方法的多模态视网膜血管分割框架ELEMENT,通过区域生长和机器学习提取特征并进行像素分类,提高了分割的准确性和效率,实验表明其在多个数据集上均优于现有方法。

Journal ref IEEE Journal of Biomedical and Health Informatics 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10784 2026-05-21 cs.AI 79%

TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training

TorchUMM: 一个用于评估、分析和训练后处理的统一多模态模型代码库

Yinyi Luo, Wenwen Wang, Hayes Bai, Hongyu Zhu, Hao Chen, Pan He, Marios Savvides, Sharon Li, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院) Auburn University(阿肯色大学欧文分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出TorchUMM,一个统一的多模态模型代码库,用于评估、分析和训练后处理,涵盖多种多模态模型架构、任务和数据集,通过统一接口和标准化评估协议,促进异构模型的公平比较和深入理解,推动更强大的统一多模态系统的发展。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17776 2026-05-21 cs.RO 78%

CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization

CosFly-Track: 一个大规模多模态数据集,用于通过多约束轨迹优化的无人机视觉跟踪

Xiangyue Wang, Hanxuan Chen, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本文提出CosFly-Track数据集,用于无人机视觉跟踪任务,通过多约束轨迹优化生成大规模多模态数据,提升了动态目标跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20676 2026-05-21 cs.CV 77%

VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

VISTAQA: 评估联合视觉问答与像素级证据

Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出VISTAQA基准,用于评估视觉问答中自由回答的正确性和像素级证据的定位,通过引入GROVE指标,强调回答正确性与视觉证据对齐的重要性,实验显示现有系统在该指标下表现有限,揭示了回答准确性和视觉证据对齐之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06206 2026-05-21 cs.RO cs.CV 74%

Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model

Affordance-R1: 为多模态大语言模型中的通用化 affordance 推理设计的强化学习

Hanqing Wang, Shaoyang Wang, Yiming Zhong, Zemin Yang, Jiamin Wang, Zhiqing Cui, Jiahao Yuan, Yifan Han, Mingyu Liu, Yuexin Ma

机构 * The Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) ShanghaiTech University(上海科技大学) East China Normal University(华东师范大学) Nanjing University of Information Science & Technology(南京信息工程大学) Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出 Affordance-R1,一种结合认知 CoT 引导的 Group Relative Policy Optimization (GRPO) 的统一 affordance 地标框架,通过强化学习实现零样本泛化和测试时推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20993 2026-05-21 physics.plasm-ph 71%

Photodiode based multi-modal diagnostic for low-energy neutral beam injection in the LTX-$β$ spherical tokamak

基于光电二极管的多模诊断用于LTX-β球形托卡马克中的低能中性束注入

A. Maan, Tosh Le, D. P. Boyle, R. Majeski, S. Banerjee, G. J. Wilkie, M. Lampert, C. Lopez Perez, R. Shousha, W. Capecchi, H. Gajani

专题命中 多模态评测 :multi-modal(title)

AI总结 本文提出了一种紧凑型基于光电二极管的诊断阵列,用于研究LTX-β球形托卡马克中的低能中性束注入。该诊断系统结合了滤波软X射线(SXR)、窄带Lyman-α和未滤波AXUV光电二极管行,通过部分重叠且几乎重合的切向视图来观察等离子体,包括中性束路径。这种几何结构能够同时敏感地检测到束诱导的SXR发射、与回流、快速中性粒子和燃料相关的中性氢线辐射,以及宽带发射,包括直接中性粒子从快速离子电荷交换损失。初始测量显示在12-20 keV氢束操作中,所有三种模式的探测器响应都具有束同步响应。未滤波AXUV信号表现出毫秒级的上升和下降时间,远慢于探测器响应,且在不同视线上变化,并依赖于锂条件化历史。与经典减速时间估计的比较表明,与背景中性粒子的电荷交换对测量衰减有显著贡献。该诊断可用于约束前向模型以估算小型托卡马克中束加热和燃料补充的时间分辨平衡。

Comments High temperature plasma diagnostics review of scientific instruments

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18034 2026-05-21 cs.CV cs.AI cs.RO 62%

Can VLMs Unlock Semantic Anomaly Detection? A Framework for Structured Reasoning

VLMs能否解锁语义异常检测?一个结构化推理的框架

Roberto Brusnicki, David Pop, Yuan Gao, Mattia Piccinini, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems TUM School of Engineering Design, Technical University of Munich Munich, Germany

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SAVANT框架,通过结构化推理方法提升VLM在语义异常检测中的性能,实现对自动驾驶场景中罕见异常情况的更准确识别。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20510 2026-05-21 cs.CV cs.AI cs.CY 62%

ShadeBench: A Benchmark Dataset for Building Shade Simulation in Sustainable Society

ShadeBench: 一个用于可持续社会建筑阴影模拟的基准数据集

Longchao Da, Mithun Shivakoti, Xiangrui Liu, T Pranav Kutralingam, Yezhou Yang, Hua Wei

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学) Global Futures Laboratory, Arizona State University(全球未来实验室,亚利桑那州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ShadeBench,一个用于城市阴影理解的综合数据集和基准,通过多模态数据支持阴影生成、分割和3D建筑重建,并提供标准化评估协议和基线方法,为数据驱动的城市气候研究和热适应城市规划提供基础。

Comments 12 pages, 13 figures, 2 tables. Accepted by KDD 2026 AI for Sciences Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27195 2026-05-21 cs.AI 57%

Evaluating TabPFN for Mild Cognitive Impairment to Alzheimer's Disease Conversion in Data Limited Settings

评估TabPFN在数据有限环境下对轻度认知障碍向阿尔茨海默病转化的预测能力

Brad Ye, Bulent Soykan, Gulsah Hancerliogullari Koksalmis, Hsin-Hsiung Huang, Laura J. Brattain

机构 * 1 Department of Medicine, University of Central Florida College of Medicine, Orlando, FL, USA 2 Department of Mechanical, Industrial \& Manufacturing Eng., The University of Toledo, Toledo, OH, USA 3 Department of Industrial Eng. Mngt. Systems, University of Central Florida, Orlando, FL, USA 4 Department of Industrial Engineering, Istanbul Technical University, Istanbul, Turkey 5 School of Data, Mathematical Statistical Sciences, University of Central Florida, Orlando, FL, USA

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文评估了TabPFN在数据有限环境下对轻度认知障碍向阿尔茨海默病转化的预测能力,通过比较传统机器学习方法,发现TabPFN在低数据量情况下表现更优,特别是在训练样本仅为50时仍能保持较高的AUC值。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21131 2026-05-21 cs.CV 57%

UniT: Unified Geometry Learning with Group Autoregressive Transformer

UniT: 基于群自回归变换器的统一几何学习

Haotian Wang, Yusong Huang, Zhaonian Kuang, Hongliang Lu, Xinhu Zheng, Meng Yang, Gang Hua

机构 * Intelligent Transportation Thrust of the Systems Hub, The Hong Kong University of Science and Technology (GZ), Guangzhou, P.R.China(香港理工大学(广州)系统中心智能交通研究组,中国广东省广州市) The National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University, Xi’an, P.R.China(人机混合增强智能国家级重点实验室,西安交通大学,中国陕西省西安市) Applied Science, Amazon.com, Inc., USA(亚马逊公司应用科学部,美国)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出UniT模型,通过群自回归变换器统一了几何感知中的多种能力,包括在线感知、离线重建、多模态融合、长视界扩展和度量尺度估计,并引入了适应性几何损失以提升跨场景的度量尺度泛化能力。

Comments Submitted to IEEE T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21130 2026-05-21 cs.CV 57%

VersusQ: Pairwise Margin Reasoning for Generalizable Video Quality Assessment

VersusQ:用于通用视频质量评估的成对边距推理

Shibei Meng, Binxin Yang, Yuan Liu, Jiexuan Zhang, Zhengyao Lv, Hubery Yin, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) WeChat Vision, Tencent Inc.(腾讯公司视觉部门) Beijing Normal University(北京师范大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VersusQ,一种基于成对边距推理的框架,通过直接比较视频来缓解绝对尺度校准偏差,实现跨域的视频质量评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21179 2026-05-21 cs.CE 50%

KSOS-BO: Improving Sampling in Bayesian Optimization via Kernel Sum of Squares

KSOS-BO: 通过核平方和改进贝叶斯优化中的采样

Buqing Ou, Frederike Dümbgen

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出KSOS-BO,一种基于核的无导数框架,用于优化贝叶斯优化的获取函数,通过将获取函数优化建模为半正定规划问题,实现了结构化的全局搜索,并在多个基准函数上表现出色,平均改进了81.16%的 regrets,尽管计算成本较高,但收敛速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏