arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-07 至 2026-04-07 共收录 26 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 26 篇

2604.03650 2026-04-07 cs.CL 88%

CAGMamba: Context-Aware Gated Cross-Modal Mamba Network for Multimodal Sentiment Analysis

CAGMamba:基于上下文的门控跨模态Mamba网络用于多模态情感分析

Minghai Jiao, Jing Xiao, Peng Xiao, Ende Zhang, Shuang Kan, Wenyan Jiang, Jinyao Li, Yixian Liu, Haidong Xin

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Xingning Power Supply Bureau, Guangdong Power Grid Co., Ltd.(广东电网有限责任公司兴宁供电局)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL

AI总结 本文提出CAGMamba网络,通过门控机制实现跨模态信息融合,有效建模上下文依赖和情感演变,实验表明在多模态情感分析任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26064 2026-04-07 cs.CV cs.AI 84%

MuDD: A Multimodal Deception Detection Dataset and GSR-Guided Progressive Distillation for Non-Contact Deception Detection

MuDD:一种多模态欺骗检测数据集和GSR引导的渐进性知识蒸馏用于非接触欺骗检测

Peiyuan Jiang, Yao Liu, Yanglei Gan, Jiaye Yang, Lu Liu, Daibing Yao, Qiao Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MuDD多模态欺骗检测数据集及GSR引导的渐进蒸馏方法,通过跨模态知识蒸馏提升非接触欺骗检测性能,实验表明其在欺骗检测和隐藏数字识别上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15148 2026-04-07 cs.CV cs.AI 84%

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

XModBench:多模态能力与一致性在多语言模型中的基准测试

Xingrui Wang, Jiang Liu, Chao Huang, Xiaodong Yu, Ze Wang, Ximeng Sun, Jialian Wu, Alan Yuille, Emad Barsoum, Zicheng Liu

机构 * Advanced Micro Devices(超威半导体) Johns Hopkins University(约翰霍普金斯大学) University of Rochester(罗彻斯特大学)

专题命中 多模态评测 :cross-modal(title,abstract);omni-modal(abstract);分类 cs.CV、cs.AI

AI总结 XModBench通过大规模三模态基准测试,评估多语言模型在跨模态一致性中的能力,揭示模型在不同模态下的推理偏差和不平衡问题。

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04207 2026-04-07 cs.AI 79%

Don't Blink: Evidence Collapse during Multimodal Reasoning

不要眨眼:多模态推理中的证据崩溃

Suresh Raghu, Satwik Pandey

机构 * Independent Researcher, New Delhi, India(独立研究者,印度新德里)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究发现多模态推理过程中证据逐渐消失的现象,提出通过视觉-熵交互模型降低风险,提升模型在分布偏移下的安全性。

Comments 8 pages, 6 figures, 1 table, plus appendix. Submitted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03505 2026-04-07 cs.CV 79%

Multimodal Urban Tree Detection from Satellite and Street-Level Imagery via Annotation-Efficient Deep Learning Strategies

通过高效深度学习策略实现多模态城市树木检测:结合卫星和街景图像

In Seon Kim, Ali Moghimi

机构 * Department of Computer Science, University of California, Davis(加州大学戴维斯分校计算机科学系) Department of Biological and Agricultural Engineering, University of California, Davis(加州大学戴维斯分校生物与农业工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态框架,结合高分辨率卫星图像与地面Google街景图像,实现低标注条件下城市树木的高效检测。通过领域自适应和三种学习策略(半监督、主动学习、混合策略),提升检测精度,混合策略F1-score达0.90,显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01586 2026-04-07 cs.CV 79%

HandMCM: Multi-modal Point Cloud-based Correspondence State Space Model for 3D Hand Pose Estimation

HandMCM:基于多模态点云的对应状态空间模型用于3D手姿态估计

Wencan Cheng, Gim Hee Lee

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出HandMCM,通过结合局部信息注入/过滤模块和对应建模,利用状态空间模型提升3D手姿态估计的鲁棒性和精度,实验表明其在严重遮挡场景中优于现有方法。

Comments AAAI accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03774 2026-04-07 cs.CV cs.AI 76%

When Does Multimodal AI Help? Diagnostic Complementarity of Vision-Language Models and CNNs for Spectrum Management in Satellite-Terrestrial Networks

何时多模态AI有所帮助?视觉-语言模型与CNN在卫星-地面网络中的频谱管理中的诊断互补性

Yuanhang Li

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本文研究了视觉-语言模型与CNN在频谱管理中的互补性,提出SpectrumQA基准测试,并发现CNN在空间定位任务中表现优异,而VLM在语义推理任务中具有独特优势,通过任务类型路由器可提升整体性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20814 2026-04-07 cs.CV cs.AI cs.LG 62%

SPHINX: A Synthetic Environment for Visual Perception and Reasoning

SPHINX:一个用于视觉感知与推理的合成环境

Md Tanvirul Alam, Saksham Aggarwal, Justin Yang Chae, Nidhi Rastogi

机构 * Rochester Institute of Technology(罗彻斯特理工学院) University of Washington(华盛顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SPHINX通过生成具有可验证解的谜题,评估视觉感知与推理能力,发现大模型表现不足,RLVR方法显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14565 2026-04-07 cs.SE cs.AI cs.CV 62%

Detecting and Characterising Mobile App Metamorphosis in Google Play Store

在Google Play Store中检测和表征移动应用蜕变

D. Denipitiyage, B. Silva, K. Gunathilaka, S. Seneviratne, A. Mahanti, A. Seneviratne, S. Chawla

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) Department of Computer Science and Engineering, University of Moratuwa(莫拉图瓦大学计算机科学与工程系) University of New South Wales (UNSW)(新南威尔士大学) Qatar Computing Research Institute, Hamad Bin Khalifa University (HBKU)(哈马德·本·哈利法大学卡塔尔计算研究所)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态搜索方法,用于识别经历蜕变的应用程序,并分析Google Play Store的两个五年跨度快照,揭示蜕变场景及潜在安全隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03400 2026-04-07 cs.CV cs.AI cs.LG 62%

Banana100: Breaking NR-IQA Metrics by 100 Iterative Image Replications with Nano Banana Pro

Banana100: 通过100次迭代图像复制打破NR-IQA度量标准

Kenan Tang, Praveen Arunshankar, Andong Hua, Anthony Yang, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 Banana100通过100次迭代编辑生成28000张退化图像,揭示多轮编辑中图像质量退化问题,发现现有NR-IQA度量标准无法检测严重退化图像,威胁未来模型训练稳定性。

Comments Accepted to CVPR 2026 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03322 2026-04-07 cs.CV cs.AI cs.RO 62%

VitaTouch: Property-Aware Vision-Tactile-Language Model for Robotic Quality Inspection in Manufacturing

VitaTouch:面向制造领域机器人质量检测的属性感知视觉-触觉-语言模型

Junyi Zong, Qingxuan Jia, Meixian Shi, Tong Li, Jiayuan Li, Zihang Lv, Gang Chen, Fang Deng

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院) Zhongguancun Academy(中关村学院) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of AI, Beijing Institute of Technology(北京理工大学人工智能学院) Beijing Key Laboratory of Lightweight Intelligent System, Beijing Institute of Technology(北京理工大学北京市轻量化智能系统重点实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VitaTouch通过融合视觉、触觉与语言信息,提升机器人在制造中对材料属性的识别能力,实现了高精度的质量检测与自然语言描述。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16197 2026-04-07 cs.LG cs.CL cs.MM 62%

ModalImmune: Immunity Driven Unlearning via Self Destructive Training

ModalImmune: 通过自毁式训练实现的免疫驱动反学习

Rong Fu, WeiZhi Tang, Ziming Wang, Jia Yee Tan, Zijian Zhang, Zhaolu Kang, Muge Qi, Shuning Zhang, Simon Fong

机构 * University of Macau(澳门大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) University of Pennsylvania(宾夕法尼亚大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.MM

AI总结 本文提出ModalImmune框架,通过可控地在训练中坍缩选定模态信息,使模型学习到对破坏性模态影响具有鲁棒性的联合表示,提升多模态系统在模态丢失或损坏时的可靠性。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17087 2026-04-07 cs.CL cs.AI cs.CY cs.DB cs.LG 62%

Informatics for Food Processing

食品加工的信息化

Gordana Ispirova, Michael Sebek, Giulia Menichetti

机构 * Channing Division of Network Medicine, Department of Medicine, Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里格姆妇女医院医学系钱宁网络医学部) Network Science Institute and Department of Physics, Northeastern University(东北大学网络科学研究所与物理系) Harvard Data Science Initiative, Harvard University(哈佛大学哈佛数据科学计划)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了食品加工的演变、分类及健康影响,提出利用机器学习和数据科学改进食品信息化,通过FoodProX模型和BERT等模型实现食品分类与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23607 2026-04-07 cs.CV cs.RO 57%

LongTail Driving Scenarios with Reasoning Traces: The KITScenes LongTail Dataset

长尾驾驶场景与推理轨迹:KITScenes长尾数据集

Royden Wagner, Omer Sahin Tas, Jaime Villa, Felix Hauser, Yinzhe Shen, Marlon Steiner, Dominik Strutz, Carlos Fernandez, Christian Kinzig, Guillermo S. Guitierrez-Cabello, Hendrik Königshof, Fabian Immel, Richard Schwarzkopf, Nils Alexander Rack, Kevin Rösch, Kaiwen Wang, Jan-Hendrik Pauls, Martin Lauer, Igor Gilitschenski, Holger Caesar, Christoph Stiller

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(FZI信息技术研究中心) University Charles III of Madrid(马德里卡洛斯三世大学) Technical University of Madrid(马德里理工大学) University of Toronto(多伦多大学) Delft University of Technology(代尔夫特理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出KITScenes长尾数据集,通过多视角视频、轨迹、指令和推理轨迹提升模型在长尾驾驶场景下的泛化能力,评估指令遵循与语义连贯性。

Comments 21 pages; v2: update MMS values (bugfix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08887 2026-04-07 cs.LG cs.AI 57%

FAST-CAD: A Fairness-Aware Framework for Non-Contact Stroke Diagnosis

FAST-CAD:一种面向非接触中风诊断的公平性感知框架

Tommy Sha, Zhan Cheng, Haotian Zhai, Xuwei Ding, Junnan Li, Haixiang Tang, Zaoting Sun, Yanchuan Tang, Yongzhe, Yi, Yuan Gao, Anhao Li

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出FAST-CAD框架,结合域对抗训练与群体分布鲁棒优化,实现公平且准确的非接触中风诊断,通过理论分析和实验验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04017 2026-04-07 cs.CL 57%

GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces

GeoBrowse:一种用于代理工具使用的地理定位基准测试

Xinyu Geng, Yanjing Xiao, Yuyang Zhang, Hanwen Wang, Xinyan Liu, Rui Min, Tianqing Fang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 GeoBrowse基准测试结合了视觉推理与知识密集型多跳查询,通过专家标注的逐步轨迹分析验证多步工具使用策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03660 2026-04-07 cs.AI 57%

TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables

TableVision:一种大规模基准,用于复杂分层表格上的空间感知推理

Xiaoyu Chen, Lu Dai, Hanqing Wang, Zhuoyu Li, Wenbin Dai, Yanzong Zheng, Zhenggang Xia, Junyong Lin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出TableVision基准,通过量化分析发现复杂表格推理中的感知瓶颈,引入轨迹感知的分层任务分类,结合确定性接地流程生成6799条高保真推理轨迹,提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03572 2026-04-07 cs.CV physics.optics 57%

Physics-Informed Untrained Learning for RGB-Guided Superresolution Single-Pixel Hyperspectral Imaging

基于物理的无训练学习用于RGB引导的超分辨率单像素超光谱成像

Hao Zhang, Bilige Xu, Lichen Wei, Xu Ma, Wenyi Ren

机构 * College of Science, Northwest Agriculture & Forestry University(西北农林科技大学理学院) Key Laboratory of Photoelectronic Imaging Technology and System, School of Optics and Photonics, Beijing Institute of Technology(北京理工大学光电学院光电成像技术与系统教育部重点实验室) State Key Laboratory of Digital Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学数字制造装备与技术国家重点实验室)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于物理的无训练框架,利用未训练的神经网络和RGB引导,实现超分辨率和超光谱重建,无需外部训练数据,实验表明其在重建精度和光谱保真度上优于现有方法。

Comments 9 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26792 2026-04-07 cs.NE cs.AI cs.LG 57%

A Firefly Algorithm for Mixed-Variable Optimization Based on Hybrid Distance Modeling

一种基于混合距离建模的混合变量优化萤火虫算法

Ousmane Tom Bechir, Adán José-García, Zaineb Chelly Garcia, Vincent Sobanski, Clarisse Dhaenens

机构 * Univ. Lille, CNRS, Inria, Centrale Lille, UMR 9189 CRIStAL(里尔大学,法国国家科学研究中心,法国国家信息与自动化研究所,中央里尔高等电力工程学院,UMR 9189 CRIStAL) Univ. Lille, Inserm, CHU Lille, U1286 – INFINITE(里尔大学,法国国家健康与医学研究院,里尔大学医院,U1286 – INFINITE) Institut Universitaire de France (IUF)(法国大学研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种混合变量优化萤火虫算法,通过改进的距离吸引机制整合连续和离散变量,有效处理异构搜索空间,实验显示其在混合变量优化中表现优异。

Comments 25 pages, 15 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01895 2026-04-07 cs.CV 57%

Automated Wildfire Damage Assessment from Multi view Ground level Imagery Via Vision Language Models

基于多视角地面影像的自动化火灾损害评估:通过视觉语言模型

Miguel Esparza, Archit Gupta, Kai Yin, Yiming Xiao, Ali Mostafavi

机构 * Department of Computer Science and Engineering, Texas A&M University(德州农工大学计算机科学与工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用预训练多模态大语言模型进行火灾损害评估,通过对比实验验证多视角分析的有效性,展示了零样本方法在快速准确评估中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01256 2026-04-07 cs.NE 56%

Runtime Analyses of NSGA-III on Many-Objective Problems: Provable Exponential Speedup via Stochastic Population Update

NSGA-III在多目标问题上的运行时间分析:通过随机种群更新实现可证明的指数加速

Andre Opris

专题命中 多模态评测 :multimodal(abstract,comments)

AI总结 本文通过严格运行时间分析,揭示NSGA-III在多目标问题上的性能,证明随机种群更新机制在多目标多模态问题中可实现指数加速。

Comments This is the long version of the paper with the title "A First Runtime Analysis of NSGA-III on a Many-Objective Multimodal Problem: Provable Exponential Speedup via Stochastic Population Update" already appeared at IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12165 2026-04-07 cs.LG 50%

Multi-Component VAE with Gaussian Markov Random Field

多组件变分自编码器与高斯马尔可夫随机场

Fouad Oubari, Mohamed El-Baha, Raphael Meunier, Rodrigue Décatoire, Mathilde Mougeot

机构 * Université Paris-Saclay, CNRS, ENS Paris-Saclay, Centre Borelli(巴黎萨克雷大学,法国国家科学研究中心,巴黎高等师范学校萨克雷分校,博雷利中心) Michelin(米其林) ENSIIE(法国国立信息统计与高等技术学校)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出一种基于高斯马尔可夫随机场的多组件变分自编码器,通过建模组件间关系提升复杂交互的表示能力,在合成数据集和现实数据集上均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03981 2026-04-07 cs.LG stat.CO 50%

Multirate Stein Variational Gradient Descent for Efficient Bayesian Sampling

多速率Stein变分梯度下降用于高效的贝叶斯采样

Arash Sarshar

机构 * Department of Computer Engineering and Computer Science, California State University, Long Beach(加州州立大学长滩分校计算机工程与计算机科学系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出多速率SVGD方法,通过不同时间尺度更新不同组件,提升高维、各向异性或分层后验中的鲁棒性和效率,尤其在刚性分层、强各向异性及多模态目标中表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03391 2026-04-07 cs.SE cs.LG 50%

SDVDiag: Using Context-Aware Causality Mining for the Diagnosis of Connected Vehicle Functions

SDVDiag:利用基于上下文的因果挖掘进行联网车辆功能诊断

Matthias Weiß, Falk Dettinger, Elias Detrois, Nasser Jazdi, Michael Weyrich

机构 * Institute of Industrial Automation and Software Engineering (IAS)(工业自动化与软件工程研究所(IAS)) University of Stuttgart(斯图加特大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种多模态方法,结合人类反馈和系统信息,提升联网车辆功能诊断的精度与可解释性。

Comments 7 pages, 4 figures, to be submitted to the VTC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04755 2026-04-07 cs.LG 50%

KindSleep: Knowledge-Informed Diagnosis of Obstructive Sleep Apnea from Oximetry

KindSleep:基于血氧数据的阻塞性睡眠呼吸暂停诊断

Micky C Nnamdi, Wenqi Shi, Cheng Wan, J. Ben Tamo, Benjamin M Smith, Chad A Purnell, May D Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) UT Southwestern Medical Center(德克萨斯大学西南医学中心)

专题命中 多模态评测 :multimodal(abstract)

AI总结 KindSleep利用深度学习整合临床知识与单通道血氧数据,实现精准的阻塞性睡眠呼吸暂停诊断,其在不同人群中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24428 2026-04-07 cs.SE 50%

CodeWiki: Evaluating AI's Ability to Generate Holistic Documentation for Large-Scale Codebases

CodeWiki: 评估AI生成大规模代码库整体文档的能力

Anh Nguyen Hoang, Minh Le-Anh, Bach Le, Nghi D. Q. Bui

专题命中 多模态评测 :multi-modal(abstract)

AI总结 CodeWiki提出一个统一框架,用于生成多语言代码库的自动化文档,通过层级分解、递归多代理处理和多模态合成,提升文档质量,实验显示其在高脚本语言上的改进显著。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏