arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-26 至 2026-06-26 共收录 21 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 21 篇

2606.27128 2026-06-26 cs.CV cs.RO 新提交 84%

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

FlameVQA: 一个基于辐射热监督的物理基础无人机野火VQA基准

Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi, Fatemeh Afghah

机构 * National Science Foundation(国家科学基金会) NASA(美国国家航空航天局)

专题命中 多模态评测 :MLLM(summary_cn,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出FlameVQA,一个基于FLAME 3数据集的无人机野火多选视觉问答基准,利用配对的RGB和辐射热TIFF图像实现温度基础的推理,评估了多种MLLM在检测、定位、覆盖估计等任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26654 2026-06-26 cs.CL cs.HC cs.IR 新提交 83%

SocialPersona: Benchmarking Personalized Profiling and Response with Multimodal Social-Media Context

SocialPersona: 基于多模态社交媒体上下文的个性化画像与回复基准测试

Qinkai Zhang, Yanyan Zhao, Xin Lu, Yulin Hu, Pengtao Han, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 提出SocialPersona基准,评估多模态大语言模型从社交媒体时间线推断用户偏好并用于对话的能力,实验表明模型在细粒度与近期偏好上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12716 2026-06-26 cs.CL 新提交 83%

Does AI Reviewer See the Full Picture? Attacking and Defending Multimodal Peer Review

AI审稿人是否看到全貌?攻击与防御多模态同行评审

Xinyu Zhao, Rana Muhammad Shahroz Khan, Zhen Xu, Zhen Tan, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 针对AI同行评审易受多模态对抗攻击的问题,提出PaperGuard基准,包含多领域数据集、统一攻击套件和基于分块嵌入搜索的实用防御方法。

Comments Accepted to ICML 2026, Project Page: https://paper-guard.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19274 2026-06-26 cs.RO 版本更新 82%

GO: The Great Outdoors Multimodal Dataset

GO: 大户外多模态数据集

Peng Jiang, Kasi Viswanath, Akhil Nagariya, George Chustz, Maggie Wigness, Philip Osteen, Timothy Overbye, Christian Ellis, Long Quang, Jia Huang, Srikanth Saripalli

机构 * Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX, USA(迈克·沃克66机械工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国) DEVCOM Army Research Laboratory, Adelphi, MD, USA(陆军研究实验室,阿德菲,马里兰州,美国) University of Texas at Austin Center for Autonomy, Austin, TX, USA(德克萨斯大学奥斯汀分校自主性中心,奥斯汀,德克萨斯州,美国)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract)

AI总结 针对非结构化环境中地面机器人研究,提出包含六种互补传感器模态的大规模多模态越野数据集,支持语义分割、目标检测和SLAM等任务,以提升退化条件下的鲁棒性。

Comments 7 pages, 7 figures, accepted at IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22437 2026-06-26 cs.CV cs.AI 新提交 81%

MMGist: A Comprehensive Multimodal Benchmark for 2027

MMGist:面向2027年的综合多模态基准

Wenzhen Yuan, Jiacheng Ruan, Wutao Xiong, Chengping Zhao, Ting Liu, Yuzhuo Fu

机构 * SJTU(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对现有视觉语言基准的视觉依赖不足、性能饱和及异常项问题,提出MMGist基准,通过三阶段过滤构建7,262项,覆盖7个能力维度,在保持模型排名高保真度(Spearman ρ=0.98)的同时减少69%评估项并提升78%跨模型区分度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26984 2026-06-26 cs.CV 新提交 79%

Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation

Unison: 通过协同理解与生成对统一多模态模型进行基准测试

Jinyu Liu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出Unison基准,包含2169个统一任务样本,通过内部一致性、理解引导生成、生成引导理解和相互增强四个维度评估统一多模态模型的协同能力,并引入Unison-Judge评估模型确保可靠性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26473 2026-06-26 cs.LG eess.AS 新提交 79%

When Does Quality-Aware Multimodal Fusion Matter? A Leakage-Safe Diagnostic for Decision-Level Dependence

质量感知多模态融合何时重要?一种针对决策级依赖的泄漏安全诊断方法

Jaden Moon, Arvind Pillai, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 eess.AS

AI总结 提出一种诊断方法,通过置换测试检验多模态融合中可靠性分数是否真正影响决策,实验表明仅当可靠性信号能预测单模态正确性时才有效。

Comments Accepted to INTERSPEECH 2026. 5 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26348 2026-06-26 cs.AI 新提交 79%

What We are Missing in Multimodal LLM Evaluation?

我们在多模态大语言模型评估中缺失了什么?

Po-han Li, Shenghui Chen, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文分析现有多模态大语言模型评估基准的不足,识别出时空连贯性、物理世界理解、多模态一致性和选择性注意等关键缺失,强调填补这些空白对衡量多模态智能真实进展的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26164 2026-06-26 cs.LG cs.NA math.NA physics.data-an stat.CO 新提交 78%

\chisao{}: A GPU-Native Parallel Optimizer for Multimodal Black-Box Functions via Convergence-Anticonvergence Oscillation

Chisao: 一种基于收敛-反收敛振荡的多模态黑盒函数的GPU原生并行优化器

Ira Wolfson

机构 * Braude College of Engineering(布劳德工程学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出GPU原生群体优化器Chisao,通过收敛-反收敛振荡循环逃离局部陷阱并冻结确认模态,在42个基准函数上实现100%模态恢复,速度提升达39倍。

Comments 22 pages, 4 Appendixes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18640 2026-06-26 cs.LG q-bio.QM 新提交 78%

MetaboNet-Bench: A Multi-modal Benchmark for Glucose Forecasting in Type 1 Diabetes

MetaboNet-Bench:1型糖尿病血糖预测的多模态基准

Nathaniel Jeffries, Miriam Wolff, Sam Royston, Elizabeth Healey, Caleb Mayer, David Klonoff, Michael Snyder, Tao Wang

机构 * Department of Genetics, Stanford University School of Medicine(斯坦福大学医学院遗传学系) Replica Health Boston Children’s Hospital, Harvard Medical School(哈佛医学院波士顿儿童医院) Diabetes Research Institute, Mills-Peninsula Medical Center(米尔斯半岛医学中心糖尿病研究所)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract)

AI总结 针对1型糖尿病血糖预测算法缺乏标准化评估基准的问题,提出MetaboNet-Bench多模态基准,集成血糖、胰岛素和碳水化合物数据,通过多个模型对比验证多模态数据对模型性能的影响。

Comments main content in 10 pages with 5 figures; supplementary section with 11 more pages and 5 more figures. v2: fix figure 4 and 5's misordering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10637 2026-06-26 hep-ex 新提交 78%

A Multimodal Domain-Adversarial Network for Fragmentation Background Suppression in AMS Heavy Nuclei Measurements

用于AMS重核测量中碎裂本底抑制的多模态域对抗网络

Zhen Liu, Valerio Formato, Muhammad Waqas

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对AMS重核测量中碎裂本底问题,提出多模态域对抗网络,融合硅径迹仪和飞行时间探测器数据,通过域对抗训练实现模拟到飞行数据的迁移,有效抑制本底。

Comments 16 pages, 13 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11225 2026-06-26 cs.CV cs.CL 66%

Sign Language Recognition in the Age of LLMs

在大语言模型时代的手语识别

Vaclav Javorek, Jakub Honzik, Ivan Gruber, Tomas Zelezny, Marek Hruz

机构 * University of West Bohemia(西波西米亚大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态评测 :multimodal(abstract,comments);分类 cs.CV、cs.CL

AI总结 研究探讨现代VLMs在零样本条件下进行孤立手语识别的能力,发现开源模型表现欠佳,而大模型在精度上表现突出,强调模型规模和训练数据多样性的重要性。

Comments Accepted at the CVPR 2026 Workshop on Multimodal Sign Language Research (MSLR), 8 pages, 3 figures

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 10511-10519

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26535 2026-06-26 cs.CV cs.AI 新提交 62%

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

从幻觉到扎根:通过CRISP诊断视觉空间智能

Zhixing Li, Yinan Yu

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出CRISP诊断范式,通过一致性评估解耦感知与推理,揭示闭源模型存在度量估计不准确和未利用隐式结构表示的问题,开源模型则受限于多跳组合推理能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26942 2026-06-26 cs.CV 新提交 57%

TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment

TraMP-LLaMA: 基于解耦指令微调的生成式可解释性用于面部表情质量评估

Shuchao Duan, Alan Whone, Hossein Rahmani, Jun Liu, Majid Mirmehdi

机构 * School of Computer Science University of Bristol(布里斯托大学计算机科学学院) Translational Health Sciences University of Bristol(布里斯托大学转化健康科学学院) School of Computing and Communications Lancaster University(兰卡斯特大学计算与通信学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出TraMP-LLaMA多模态框架,融合外观和轨迹特征,采用解耦指令微调策略,联合预测严重度并生成结构化文本报告,在PFED5-plus数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26923 2026-06-26 cs.CL 新提交 57%

GAVEL: Grounded Caption Error Verification and Localization

GAVEL:基于视觉定位的标题错误验证与定位

Zixian Gao, Atsushi Hashimoto, Kuniaki Saito

机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司)

专题命中 多模态评测 :image-text(abstract);分类 cs.CL

AI总结 提出GAVEL任务,联合解决图像-文本对的验证、解释和定位问题,构建数据集和基准,监督基线在定位和解释指标上持续改进。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26741 2026-06-26 cs.RO cs.CV 新提交 57%

PressMimic: Pressure-Guided Motion Capture and Control for Humanoid Robot Imitation

PressMimic: 压力引导的动作捕捉与控制用于人形机器人模仿

Yi Lu, Shenghao Ren, Tianyu Xiong, Zhaoxiang Li, Jiaqi Li, He Zhang, Tao Yu, Qiu Shen, Xun Cao

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) Key Laboratory of Optoelectronic Devices and Systems with Extreme Performances of MOE, Nanjing University(南京大学极端性能光电技术与系统教育部重点实验室) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出PressMimic框架,通过压力模态融合RGB估计3D姿态和全局运动,并利用压力监督策略实现物理一致的接触模式,提升人形机器人模仿的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26694 2026-06-26 cs.CV 新提交 57%

PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models

PhysEditWorld: 一个面向物理可编辑世界模型的大规模数据集

Bin Hu, Yanwen Ma, Jiehui Huang, Ziliang Zhang, Haoning Wu, Ruicheng Zhang, Yaokun Li, Zijun Wang, Yuechen Zhang, Chun-Mei Tseng, Hanhui Li, Shengju Qian, Jun Zhou, Kaipeng Zhang, Xiaodan Liang, Jiaya Jia, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beihang University(北京航空航天大学) The Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Tencent(腾讯)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出PhysEditWorld数据集,通过UE5重放渲染管线生成多重力配置下的动作条件视频,支持可控物理编辑,用于改进世界模型的动力学建模和一致性。

Comments Project page: https://yizhiqianbi.github.io/physeditworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26661 2026-06-26 cs.RO cs.AI 新提交 57%

LAMP: Lane-Aligned Motion Primitives for Feasible Trajectory Prediction

LAMP: 面向可行轨迹预测的车道对齐运动基元

Sangjin Han, Hoseong Jung, Jeongtae Her, Changhyun Choi, H. Jin Kim

机构 * Seoul National University(首尔大学) Hyundai Motor Company(现代汽车公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出LAMP框架,利用VQ-VAE学习形状感知运动基元作为离散意图查询,并结合车道拓扑先验的可行性意图选择器,在保持行为多样性的同时提升预测轨迹的拓扑一致性和可行性。

Comments IEEE ITSC 2026, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26602 2026-06-26 cs.CV 新提交 57%

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

DiCoBench: 通过差异性和共性视觉线索进行多图像细粒度感知的基准测试

Geng Li, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出DiCoBench,一个包含765个样本的高分辨率多图像基准,通过差异性和共性视觉线索评估多模态大模型的细粒度感知能力,发现顶尖模型与人类准确率(98.3%)差距显著。

Comments Accepted by ECCV 2026. Project page with code: https://github.com/PKU-ICST-MIPL/DICO_Bench_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26633 2026-06-26 cs.DC 新提交 50%

Simulating Unified Tensor Resharding in heterogeneous AI systems

模拟异构AI系统中的统一张量重分片

Sumit Kumar, Sayantan Dasgupta, Kushal Mitra, Meet Dadhania, Rohan Sudhir Basugade, Praveen Tammana, Satananda Burla, Abed Mohammad Kamaluddin, Rinku Shah

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出异构感知模拟器Xsim,通过非均匀负载划分、定制环构建和分块分区等方法,准确模拟异构分布式LLM训练,误差小于5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26451 2026-06-26 cs.SD cs.LG 新提交 50%

Listening Like a Judge: A Music-Aware Framework for Automatic Singing Performance Evaluation

像法官一样聆听:一种用于自动歌唱表现评估的音乐感知框架

Neelam Saini, Sourav Ghosh

机构 * Samsung R&D Institute Bangalore, India(三星研发中心班加罗尔,印度)

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出MusicJudge框架,通过模态引导的块对齐多模态分析,结合歌词正确性与音高节奏保真度,实现自动歌唱质量评估,实验验证与人类专家判断高度一致。

Comments Accepted at Interspeech 2026. Supplementary material: https://neelam472.github.io/MusicJudge/Supp.pdf (backup mirror: https://sourav-ghosh.github.io/MusicJudge/Supp.pdf )

详情

展开后加载摘要…

URL PDF HTML 收藏