arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-10 至 2026-08-10 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 18 篇

2502.20295 2026-08-10 cs.LG cs.AI cs.CV 版本更新 86%

Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription

通过封面判断书籍:调查多模态大语言模型用于多页手写文档转录

Benjamin Gutteridge, Matthew Thomas Jackson, Toni Kukurin, Xiaowen Dong

机构 * University of Oxford(牛津大学) QuantCo

专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文研究多模态大语言模型在多页手写文档转录中的应用,提出OCR+PAGE-1和OCR+PAGE-N策略,通过共享页面内容提升转录效果。

Comments 10 pages (36 including references and appendices), 11 figures, accepted at COLM 2026, earlier version accepted at AAAI 2025 Workshop on Document Understanding and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05249 2026-08-10 cs.LG cs.AI 版本更新 83%

PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis

PRISM:基于结构化多模态数据合成的感知优先级的评分标准内化

Xiaomin He, Dongling Xiao, Jiahao Xie, Ruiqi Lu, Qianle Wang, Zhongbin Guo, Wanxuan Sun

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 该研究针对多模态指令多要求重要性不等的问题,提出PRISM四阶段数据合成框架,结合PRISM-Eval评估,提升多模态大模型的多规则优先级感知指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27723 2026-08-10 cs.LG 版本更新 82%

TMTE: Effective Multimodal Graph Learning with Task-aware Modality and Topology Co-evolution

TMTE: 有效多模态图学习中的任务感知模态与拓扑共进化

Yinlin Zhu, Xunkai Li, Di Wu, Wang Luo, Miao Hu, Guocong Quan

机构 * Sun Yat-sen University(中山大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出TMTE框架,通过任务感知的模态与拓扑共进化方法,解决多模态图学习中图拓扑质量不足的问题,实现多视角度量学习与跨模态对齐,提升下游任务性能。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07188 2026-08-10 cs.AI 新提交 79%

SetEasy: A Multi-Modal Classroom Engagement Assessment and Seating Optimization Framework

SetEasy:多模态课堂参与度评估与座位优化框架

Zhihao Xie, Hongye Yang, Shien Liu

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 SetEasy融合多模态感知与v-Gage模型,通过CP-SAT优化固定座位布局,在23名学生331个班级的四周部署中,将平均参与度从0.30提升至0.70,为课堂空间设计提供了可迁移路径。

Comments 18 pages, 4 figures, 2 tables. Published in the Proceedings of ASCAAD 2025

Journal ref Proceedings of the 13th International Conference of the Arab Society for Computation in Architecture, Art and Design (ASCAAD 2025), Riyadh, Saudi Arabia, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06934 2026-08-10 cs.LG cs.CV 新提交 79%

Walkable to Whom? Capturing Subjective Variability in Walkability Perception Using Multimodal Deep Learning

对谁而言是可步行的?使用多模态深度学习捕捉步行感知中的主观变异性

Moloud Damandeh, Meead Saberi

机构 * School of Civil and Environmental Engineering, University of New South Wales (UNSW)(新南威尔士大学土木与环境工程学院) Research Centre for Integrated Transport Innovation (rCITI)(综合交通创新研究中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究构建含29870条评分的步行性数据集,提出用户条件多模态深度学习框架,发现人行道图像评分更高,模型一致性提升65%,助力构建更包容的行人环境评估模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06769 2026-08-10 cs.CV 新提交 79%

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

GraphVerse:面向多模态大语言模型的综合性视觉图推理基准

Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

机构 * New York University(纽约大学) Sensetime Research(商汤科技研究院) Tsinghua University(清华大学) New York University Shanghai(上海纽约大学) University of Georgia(佐治亚大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06406 2026-08-10 cs.CV cs.LG 新提交 79%

Deep Evidential Regression for Sparse Forest Height Estimation from Multimodal Satellite Imagery

基于多模态卫星图像的稀疏林高估计的深度证据回归

Laura Bader, Muhammad Ammar Ahmed, Xiao Xiang Zhu, Göran Kauermann

机构 * LMU Munich(慕尼黑大学) TU Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究针对TreeUQ基准数据集,采用融合多模态卫星输入的U-Net架构,提出掩码证据损失函数,应用深度证据回归实现了树高与不确定性的联合预测,性能优于确定性模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06378 2026-08-10 cs.HC cs.AI 新提交 79%

Multimodal Drivers' Emotion Recognition and Safety-Oriented Intervention for Intelligent Transportation Systems

面向智能交通系统的多模态驾驶员情绪识别与安全导向干预

Chang Liu, Dalai Mengke, Hanbo Zhou, Jia Hu, Peter Mihajlik, Tamas Sziranyi

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对智能交通系统,提出安全优先的多模态驾驶员辅助框架,构建多模态数据集并引入CARE分数,实现环境风险报告与情绪感知调节的平衡,提供安全驱动的可行方向。

Comments 6 pages, 2 figures, IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05844 2026-08-10 cs.CV 版本更新 79%

Curia-MAE: Multi-Modal Multi-Anatomy MAE Pre-Training for 3D Medical Image Segmentation

Curia-MAE:面向3D医学图像分割的多模态多解剖区域掩码自编码器预训练方法

Théo Danielou, Antoine Saporta, Léo Alberge, Corentin Dancette

机构 * Raidium(雷迪厄姆)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Curia-MAE,通过改进MAE预训练目标,在30万张CT和MRI图像上预训练的多模态多解剖区域模型,可提升冻结编码器下的3D医学图像分割性能,尤其适用于标注数据稀缺的病灶任务。

Comments Accepted at ECCV 2026 Workshop AI4M3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13108 2026-08-10 cs.RO cs.CV eess.IV 版本更新 79%

Panoramic Multimodal Semantic Occupancy Prediction for Quadruped Robots

四足机器人全景多模态语义占用预测

Guoqiang Zhao, Zhe Yang, Sheng Wu, Fei Teng, Mengfei Duan, Yuanfan Zheng, Kai Luo, Kailun Yang

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PanoMMOcc数据集和VoxelHound框架,通过垂直抖动补偿和多模态信息融合提升四足机器人全景多模态3D感知性能。

Comments The dataset and code will be publicly released at https://github.com/SXDR/PanoMMOcc

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25232 2026-08-10 cs.LG 版本更新 78%

Neurai-VN Benchmark: Standardized Machine Learning Models for Multimodal Digital Phenotyping in Mental Health Classification

神经-VN基准:用于心理健康分类中多模态数字表型分析的标准化机器学习模型

Quoc-Cuong Pham, Hoang-Thuy-Duong Vu, Thi-Thanh-Huong Ha, Huy-Hieu Pham

机构 * College of Engineering and Computer Science, VinUni-Illinois Smart Health Center, VinUniversity(工程与计算机科学学院,VinUni - 伊利诺伊智能健康中心,Vin大学) School of Biomedical Engineering, International University, Vietnam National University HCMC(生物医学工程学院,胡志明市越南国立大学国际大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究基于Neurai-VN数据集构建可重复基准,定义四个临床相关二元分类任务,用标准化受试者交叉验证评估,在预定义特征配置下评估多种基线模型,给出各任务F1分数,为心理健康分类任务的多模态DP研究提供可重复基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01295 2026-08-10 cs.CV 版本更新 70%

UniREditBench: A Unified Reasoning-based Image Editing Benchmark

UniREditBench: 一个基于推理的图像编辑统一基准

Feng Han, Yibin Wang, Chenglin Li, Zheming Liang, Dianyi Wang, Yang Jiao, Zhipeng Wei, Chao Gong, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) UC Berkeley(伯克利大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 UniREditBench通过多模态双参考评估和大规模合成数据集,提升图像编辑模型在复杂推理场景中的评估可靠性与性能表现。

Comments Project page: https://maplebb.github.io/UniREditBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07036 2026-08-10 cs.SE cs.CV 新提交 57%

CAS2UML: A Handwritten Sketch-to-PlantUML Dataset for Class and Activity Diagrams

CAS2UML:用于类图和活动图的手绘草图到PlantUML数据集

Simon Scholz, Mersedeh Sadeghi

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 CAS2UML是含557幅手绘类图与活动图及对应PlantUML代码的公开数据集,配套验证工具与脚本,可实现草图转UML方法的可复现基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07015 2026-08-10 cs.CV 新提交 57%

Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection

先理解再检测:用于全域红外小目标检测的视觉-语言学习

Haoyang Yuan, Boyang Li, Yingqian Wang, Yimian Dai, Nuo Chen, Xinfei Huang, Shuqi Yi, Zaiping Lin, Weidong Sheng, Wei An

机构 * National University of Defense Technology(国防科技大学) College of Computer Science, Nankai University(南开大学计算机学院) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对全域红外小目标检测的域偏移问题,提出“先理解再检测”范式及JinSight方法,构建视觉-语言数据集OmniIRST-VL,实现跨异构红外域的泛化检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06931 2026-08-10 cs.AI 新提交 57%

Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

科学边缘评估:SEE——迈向真实科学发现的缺失环节

Taolin Han, Yuchen Zhang, Jinghang Wang, Yun Wu, Wai Yuet Chiu, Zhaohai Li, Yifei Zhang, Jinxin Wang, Yuhao Zhou, Chen Zhao, Jiajia Li, Jiaxin Li, Qile Jin, Kewei Sun, Shuang Wu, Weiqi Zhai, Renquan Lv, Junchao Li, Ruodan Chen, Qingteng Chen, Zhibo Yang, Hu Wei, Lin Qu, Shuai Bai, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) University of Alberta(阿尔伯塔大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 该研究构建多模态基准SEE评估19个MLLMs,发现其仅达48.7%准确率,通用模型优于专用模型,工具使用可提至52.7%但仍难实现科学发现所需的证据约束推断,需从解释转向推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05825 2026-08-10 cs.CL 版本更新 57%

MoCA: Implicit Social Context Analysis

MoCA:隐式社会语境分析

Wenhao Xu, Kaiwen Zhang, Hao Li, Maowei You, Yongzheng Ji, Siyuan Zuo, Jingxuan Yu, Sina A, Xinyao Tan, Bobo Li, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Wuhan University(武汉大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出隐式社会语境分析(MoCA)新任务,构建含3108个实例的基准数据集,提出CoDAR框架提升模型性能,但模型与人类推理仍存差距,凸显隐式社会理解难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17679 2026-08-10 cs.HC cs.AI 版本更新 57%

PULSE: Agentic Investigation with Passive Sensing for Proactive Affective Intervention in Cancer Survivorship

PULSE:基于被动感知的代理探究用于癌症幸存者的主动干预

Zhiyuan Wang, Subigya Nepal, Ariful Islam, Indrajeet Ghosh, Xinyu Chen, Katharine E. Daniel, Laura E. Barnes, Philip Chow

机构 * Department of Systems and Information Engineering, University of Virginia(系统与信息工程系,弗吉尼亚大学) Center for Behavioral Health and Technology, University of Virginia(行为健康与技术中心,弗吉尼亚大学) Department of Computer Science, University of Virginia(计算机科学系,弗吉尼亚大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出PULSE系统,通过代理感知探究方法,利用智能手机被动感知数据和日记数据,提升对癌症幸存者情绪调节需求的预测准确率,验证了代理推理在主动干预中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07064 2026-08-10 cs.HC 新提交 50%

XGait: A Multi-Modality Wireless Sensing Dataset for Indoor Human Tracking and Identification

XGait:用于室内人体跟踪与识别的多模态无线传感数据集

Wei Xu, Zhu Wang, Yifan Guo, Changlong Cheng, Yin Zhang, Zhihui Ren, Bin Guo, Zhiwen yu

专题命中 多模态评测 :cross-modal(abstract)

AI总结 针对现有无线传感数据集模态与轨迹局限,本文提出XGait多模态数据集,采用Wi-Fi与声学同步采集,构建统一多普勒频谱图表示,验证了两种传感模态的互补优势,为相关研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏