arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-16 至 2026-07-16 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 15 篇

2603.00546 2026-07-16 cs.AI cs.CV 版本更新 86%

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation

通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型

Zeyu Chen, Huanjin Yao, Ziwang Zhao, Min Yang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13860 2026-07-16 cs.CV 新提交 83%

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

迈向增强医学多模态大语言模型中的 3D 空间推理

Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang, Hangui Lin, Yan Shu, Yan Li, Binyang Li, Yaru Zhao

机构 * University of International Relations(国际关系学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究旨在增强医学多模态大语言模型的 3D 空间推理。通过新型逐片数据合成范式构建结构化推理数据集,用其对二维预训练模型进行指令微调,提升了模型在 3D 医学基准测试中的性能,缩小了与原生 3D 架构的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13712 2026-07-16 cs.CV cs.AI cs.CL cs.MM 新提交 83%

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

Groc-PO:用于真实多模态大语言模型的基于上下文的偏好优化

Zhixiao Zheng, Zheren Fu, Zhiyuan Yao, Chunxiao Liu, Dongming Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaomi Corporation(小米公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对多模态大语言模型的不真实问题,提出基于上下文的偏好优化框架Groc-PO,构建相关数据集,通过多阶段偏好样本捕捉基础上下文,加强上下文相关推理,减轻跨阶段错误传播,提升模型性能。

Comments Accepted by ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13881 2026-07-16 cs.CV cs.AI 新提交 81%

Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild

释放多模态大语言模型用于野外无训练的人机交互检测

Ting Lei, Jialin Liu, Zhu Xu, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对传统人机交互检测方法在开放世界和组合场景中泛化能力受限的问题,提出无训练的AgentHOI框架,利用基础模型多模态推理能力,通过上下文感知多轮推理和多方面交互定位机制,在实际场景中取得优于现有监督和弱监督方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13826 2026-07-16 cs.CV cs.AI cs.IR cs.LG 新提交 81%

Multimodal Assessment of Pancreatic Cancer Resectability Using Deep Learning

使用深度学习对胰腺癌可切除性进行多模态评估

Vincent Ochs, Christoph Kuemmerli, Florentin Bieder, Julia Wolleb, Joel L. Lavanchy, Julia Ruppel, Jan Liechti, Stephanie Taha-Mehlitz, Christian Andreas Nebiker, Beat Mueller, Giuseppe Kito Fusai, Joerg-Matthias Pollok, Anas Taha, Philippe C. Cattin, Sebastian Staubli

机构 * University of Basel(巴塞尔大学) Clarunis, University Digestive Health Centre(克拉鲁尼斯大学消化健康中心) Kantonsspital Aarau(阿劳州立医院) Royal Free Hospital(皇家自由医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究利用深度学习框架联合分析CT与临床信息,对胰腺癌可切除性分类。通过Swin-UNETR主干获取图像特征,融合临床嵌入,经动态多任务目标训练,能将患者分入NCCN的三种可切除性类别,提高评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11192 2026-07-16 cs.CV 版本更新 80%

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

GDP.pdf:针对专业PDF文档的基础多模态推理基准测试

Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

机构 * Surge AI

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对专业PDF文档构建多模态推理基准测试GDP.pdf,由专业人员编写问题-文档对,通过严格筛选保留问题,有详细评分标准和能力分类。评估七个前沿模型,发现多数错误源于特定模式,公开了完整基准测试。

Comments 9 pages. v2: results updated to July 2026 leaderboard (17 models). Accepted at the 2nd Workshop on Knowledge-Intensive Multimodal Reasoning (KnowledgeMR) at CVPR 2026 (non-archival), under the former title "PDFParse: A Benchmark for Grounded Multimodal Reasoning over Professional PDF Documents". Dataset: https://huggingface.co/datasets/surgeai/GDP.pdf ; Code: https://github.com/surge-ai/gdp-pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04876 2026-07-16 cs.CV cs.LG 版本更新 70%

BenthiCat: An opti-acoustic dataset for advancing benthic classification and habitat mapping

BenthiCat:用于推进底栖生物分类和栖息地测绘的光声数据集

Hayat Rajani, Valerio Franchi, Borja Martinez-Clavel Valles, Raimon Ramos, Rafael Garcia, Nuno Gracias

机构 * Computer Vision and Robotics Research Institute, University of Girona, Spain(计算机视觉与机器人研究研究所,加泰罗尼亚大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 为解决底栖生物分类和栖息地测绘领域大型标注数据集稀缺问题,本文介绍含约百万侧扫声纳图块等的多模态数据集,通过空间关联促进跨模态学习,提供工具,旨在建立标准化基准推动相关领域进步。

Comments Article under review by Earth System Science Data (ESSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10057 2026-07-16 quant-ph cs.AI cs.CV cs.LG 交叉投稿 62%

Quantum Circuit Vision: Cost-Aware Evaluation of Visual AI Agents for Quantum Code Generation

量子电路视觉:用于量子代码生成的视觉人工智能代理的成本感知评估

Dongping Liu, Aoyu Zhang, Luyao Zhang

机构 * Amazon Web Services(亚马逊网络服务) Duke Kunshan University(杜克昆山大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究人工智能代理对量子电路图的理解及代码生成成本,提出量子电路视觉评估框架,构建基准并评估模型,发现中级模型在成本-准确性上平衡最佳,电路深度是失败主因,提出级联路由策略并开源数据集及代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13548 2026-07-16 cs.AI 新提交 57%

How Far Can Root Cause Analysis Go on Real-World Telemetry Data?

根因分析在实际遥测数据上能走多远?

Athira Gopal, Ashwanth Krishnan

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究生产微服务故障根因分析难题,提出结构化多智能体RCA管道,性能超现有方法。引入反向推理智能体和自动规则挖掘管道,发现故障证据多,瓶颈在智能体推理能力,模型推理和领域知识是主要限制,进步需模型改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16307 2026-07-16 cs.AI 版本更新 57%

NeSy-Route: A Neuro-Symbolic Benchmark for Constrained Route Planning in Remote Sensing

NeSy-Route:一种用于遥感约束路径规划的神经符号基准

Ming Yang, Zhi Zhou, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) School of Artifical Intelligence, Nanjing University, China(人工智能学院,南京大学) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 NeSy-Route是一个大规模神经符号基准,用于评估遥感中的约束路径规划能力,通过自动化数据生成框架和三级评估协议,全面测试多模态大语言模型的感知、推理和规划能力。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18548 2026-07-16 cs.SE cs.AI 版本更新 57%

1D-Bench: A Benchmark for Iterative UI Code Generation with Visual Feedback in Real-World

1D-Bench: 一个用于具有实时反馈的现实世界迭代UI代码生成的基准

Qiao Xu, Yipeng Yu, Chengxiao Feng, Xu Liu

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 1D-Bench通过现实电商工作流提供迭代UI代码生成基准,测试模型在中间表示缺陷下的鲁棒性,实验表明迭代编辑能提升渲染成功率和视觉相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13724 2026-07-16 cs.HC 新提交 50%

Interaction Density as a Behavioural Signature of Exhibit Type: A Minimal-Log Study from a Two-Venue Science Experience Centre

交互密度作为展品类型的行为特征:来自双场馆科学体验中心的最小日志研究

R A Udaya Rakshith, Inavamsi Enaganti, Umang J Gala

专题命中 多模态评测 :multimodal(abstract)

AI总结 研究如何从触摸式展品默认记录的少量字段获取参观者与展品互动信息,通过分析得出交互密度这一行为特征区分游戏和测验,发现其能预测展品类型,但数据有复杂性,还表明最小化交互日志可支持行为研究。

Comments 7 pages, 4 figures. Raw session-level dataset (CSV) included as an ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13060 2026-07-16 cs.RO 新提交 50%

A Bayesian framework for the uncanny valley in humanoid robot design

类人机器人设计中恐怖谷效应的贝叶斯框架

Shimon Honda, Rin Shibano, Hideyoshi Yanagisawa

机构 * The University of Tokyo(东京大学)

专题命中 多模态评测 :cross-modal(abstract)

AI总结 研究类人机器人设计中恐怖谷效应,提出分层贝叶斯生成模型,将相关准则转化为数学变量,通过模拟和实验验证,该模型能将经验启发式方法转变为计算基础,用于评估和优化机器人外观与行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12451 2026-07-16 cs.LG 版本更新 50%

Overcoming the Modality Gap in Context-Aided Forecasting

克服情境差距以实现上下文辅助预测

Vincent Zhihao Zheng, Étienne Marcotte, Arjun Ashok, Andrew Robert Williams, Lijun Sun, Alexandre Drouin, Valentina Zantedeschi

机构 * ServiceNow Research(ServiceNow研究) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出半合成数据增强方法,生成高质量上下文以提升上下文辅助预测性能,构建了700万规模的数据集,并验证了其在真实场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19063 2026-07-16 cs.RO cs.GR 版本更新 50%

Fire as a Service: Augmenting Robot Simulators with Thermally and Visually Accurate Fire Dynamics

火灾作为服务:通过热力学和视觉准确的火灾动力学增强机器人仿真器

Anton R. Wagner, Madhan Balaji Rao, Helge Wrede, Sören Pirk, Xuesu Xiao

机构 * Department of Computer Science, Kiel University(基尔大学计算机科学系) Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出Fire as a Service框架,通过高保真火灾模拟提升机器人仿真器的热力学和视觉准确性,支持生成真实火灾环境下的训练数据和热危害评估。

详情

展开后加载摘要…

URL PDF HTML 收藏