arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-17 至 2026-04-17 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 18 篇

2604.14799 2026-04-17 cs.CL cs.CV 81%

Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

在何时不回答:评估多模态推理系统中的退避

Nishanth Madhusudhan, Vikas Yadav, Alexandre Lacoste

机构 * ServiceNow Research(ServiceNow研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出MM-AQA基准,通过视觉模态依赖性和证据充分性变换生成不可回答实例,评估三种前沿VLM和两种MAS架构,发现VLM在标准提示下 rarely 退避,MAS提升退避但引入准确率-退避权衡,序列设计表现优异,表明退避意识训练比提示或更多代理更重要。

Comments 10 pages and 4 figures (excluding appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09643 2026-04-17 cs.ET cs.AI 80%

MM-tau-p$^2$: Persona-Adaptive Prompting for Robust Multi-Modal Agent Evaluation in Dual-Control Settings

MM-tau-p$^2$: 人格自适应提示用于双控制设置中多模态代理的鲁棒性评估

Anupam Purwar, Aditya Choudhary

机构 * Sprinklr AI

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI;multimodal(comments)

AI总结 本文提出MM-tau-p$^2$基准,通过12个新指标评估多模态代理在双控制环境中的鲁棒性,结合用户输入解决查询,并展示即使使用前沿LLM,多模态鲁棒性等指标仍需考虑。

Comments A benchmark for evaluating multimodal both voice and text LLM agents in dualcontrol settings. We introduce persona adaptive prompting and 12 new metrics to assess robustness safety efficiency and recovery in customer support scenarios

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20214 2026-04-17 cs.AI 79%

When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning

当慢并非真:多模态推理中真理性的反比例定律

Sitong Fang, Wenjing Cao, Jiahao Li, Xuyao Wang, Juntao Dai, Chi-Min Chan, Sirui Han, Yike Guo, Yaodong Yang, Jiaming Ji

机构 * Institute for AI(人工智能研究院) Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究探讨了多模态推理中慢思考模式的反比例定律,发现慢思考模型在面对不完整或误导性视觉输入时更易生成虚假细节,揭示了推理模型在处理模糊输入时的脆弱性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15052 2026-04-17 cs.RO 78%

CAVERS: Multimodal SLAM Data from a Natural Karstic Cave with Ground Truth Motion Capture

CAVERS:从自然喀斯特洞穴获取多模态SLAM数据并采用地面真实运动捕捉

Giacomo Franchini, David Rodríguez-Martínez, Alfonso Martínez-Petersen, C. J. Pérez-del-Pulgar, Marcello Chiaberge

机构 * Polytechnic of Turin Interdepartmental Centre for Service Robotics (PIC4SeR)(都灵理工大学服务机器人跨部门研究中心(PIC4SeR)) Systems Engineering and Automation Department, Universidad de Málaga(马德里大学系统工程与自动化系)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出CAVERS数据集,通过地面真实运动捕捉系统提供高精度姿态和速度数据,验证了多模态传感器在复杂洞穴环境中的SLAM算法性能。

Comments 8 pages, 5 figures, preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16870 2026-04-17 cs.RO 78%

A Multimodal Data Collection Framework for Dialogue-Driven Assistive Robotics to Clarify Ambiguities: A Wizard-of-Oz Pilot Study

一种多模态数据收集框架用于对话驱动的辅助机器人以澄清歧义:一项巫师-of-奥兹试点研究

Guangping Liu, Nicholas Hawkins, Billy Madden, Tipu Sultan, Flavio Esposito, Madi Babaiasl

机构 * Aerospace and Mechanical Engineering Department(航空航天与机械工程系) Computer Science Department(计算机科学系) Saint Louis University(圣路易斯大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出一种多模态数据收集框架,通过对话交互协议和双房间巫师-of-奥兹设置,模拟机器人自主性并捕捉自然用户行为,用于澄清对话驱动控制中的歧义问题。

Comments Accepted to IEEE RAS/EMBS 11th International Conference on Biomedical Robotics and Biomechatronics (BioRob) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04884 2026-04-17 cs.RO 71%

Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation

嗨!- 一个用于力导向、跨视角人工 manipulation 的多模态数据集

Tim Engelbracht, René Zurbrügg, Matteo Wohlrapp, Martin Büchner, Abhinav Valada, Marc Pollefeys, Hermann Blum, Zuria Bauer

机构 * ETH Zurich(苏黎世联邦理工学院) Technical University of Munich(慕尼黑技术大学) University of Freiburg(弗赖堡大学) Microsoft(微软) University of Bonn(波恩大学)

专题命中 多模态评测 :multimodal(title)

AI总结 本文提出一个结合视觉、动作和触觉的多模态数据集,包含381个人工物体在38种环境中的3048个序列,用于评估方法在人机视角间的迁移能力及探索交互力等未被研究的模态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15066 2026-04-17 cs.LG cs.AI cs.MM 62%

Time-RA: Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback

Time-RA:面向时间序列推理的异常诊断方法:基于LLM反馈

Yiyuan Yang, Zichuan Liu, Lei Song, Kai Ying, Zhiguang Wang, Tom Bamford, Svitlana Vyetrenko, Jiang Bian, Qingsong Wen

机构 * University of Oxford(牛津大学) Nanjing University(南京大学) MSRA(微软研究院) SJTU(上海交通大学) Abel AI Outsampler University of Strasbourg(斯特拉斯堡大学) Squirrel Ai Learning(Squirrel AI学习)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出Time-RA,通过引入RATs40K多模态数据集,改进时间序列异常检测的生成式推理方法,提升诊断准确性和解释性,实现可解释的多模态时间序列分析。

Comments ACL 2026 Findings. 27 pages, 11 figures, 15 tables. Code and dataset are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10966 2026-04-17 cs.CV cs.AI 62%

You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass

你只评判一次:单次前向传递中的多响应奖励建模

Yinuo Yang, Zixian Ma, Manasi Ganti, Jieyu Zhang, Ranjay Krishna

机构 * Paul G. Allen School of Computer Science & Engineering(保罗·G·艾伦计算机科学与工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种判别性多模态奖励模型,通过单次前向传递对所有候选响应进行评分。该方法通过拼接多个响应并应用交叉熵实现直接比较推理和高效N-way偏好学习,同时提升速度和计算效率。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14683 2026-04-17 cs.AI 57%

DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation

DR$^{3}$-Eval: 向真实和可重复的深度研究评估迈进

Qianqian Xie, Qingheng Xiong, He Zhu, Tiantian Xia, Xueming Han, Fanyu Meng, Jiakai Wang, Zhiqi Bai, Chengkang Jiang, Zhaohui Wang, Yubin Guo, Yuqing Wen, Jiayang Mao, Zijie Zhang, Shihao Li, Yanghai Wang, Yuxiang Ren, Junlan Feng, Jiaheng Liu

机构 * Nanjing University(南京大学) M-A-P Jiutian Research(九天研究) National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出DR$^{3}$-Eval基准,用于评估多模态多文件报告生成的深度研究代理,通过真实用户材料和静态研究沙盒语料结合,引入多维评估框架,验证其与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14199 2026-04-17 q-fin.CP cs.AI cs.LG 57%

PolyBench: Benchmarking LLM Forecasting and Trading Capabilities on Live Prediction Market Data

PolyBench:基于实时预测市场数据的LLM预测与交易能力基准测试

Pu Cheng, Juncheng Liu, Yunshen Long

机构 * College of Electrical Engineering, Sichuan University(四川大学电气工程学院) School of Economics, Sichuan University(四川大学经济学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出PolyBench基准测试,通过实时预测市场数据评估七种先进LLM的预测与交易能力,发现仅两种模型在严格市场状态下实现正收益,揭示了语言流畅性与真实概率推理之间的差距。

Comments 16 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14154 2026-04-17 eess.SP cs.AI cs.CY 57%

An Edge-Cloud Collaborative Architecture for Proactive Elderly Care: Real-Time Risk Assessment and Three-Level Emergency Response

面向主动老年护理的边缘-云协作架构:实时风险评估与三级应急响应

Lijie Zhou, Luran Wang

机构 * School of Computer Science University of Nottingham Ningbo China Ningbo, China(计算机科学学院 南阳大学宁波分校 中国 宁波) School of Mathematical Sciences University of Nottingham Ningbo China Ningbo, China(数学科学学院 南阳大学宁波分校 中国 宁波)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出边缘-云协作架构,通过实时多模态传感器融合、四维风险评估模型和三级应急响应系统,解决现有云平台在延迟、隐私和可扩展性方面的不足,实验表明其在活动识别和异常检测上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14041 2026-04-17 cs.CV 57%

Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios

寻找并解决:用于日常场景中视觉线索驱动推理的MLLMs基准测试

Xiaomin Li, Tala Wang, Zichen Zhong, Ying Zhang, Zirui Zheng, Takashi Isobe, Dezhuang Li, Huchuan Lu, You He, Xu Jia

机构 * Dalian University of Technology(大连理工大学) WeChat, Tencent Inc.(微信,腾讯公司) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DailyClue基准测试,旨在评估MLLMs在日常场景中通过视觉线索进行推理的能力,强调真实日常活动和挑战性查询设计,推动模型深入理解与推理。

Comments Accepted by ACL Findings 2026. Project page: https://xiaominli1020.github.io/DailyClue/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11600 2026-04-17 cs.CV 57%

Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language

几何解析:一种统一形式语言用于平面和立体几何的图表解析

Peijie Wang, Ming-Liang Zhang, Jun Cao, Chao Deng, Dekang Ran, Hongda Sun, Pi Bu, Xuan Zhang, Yingyao Wang, Jun Song, Bo Zheng, Fei Yin, Cheng-Lin Liu

机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种统一形式语言,结合平面和立体几何,构建了GDP-29K数据集,通过监督微调与可验证奖励的强化学习提升几何解析性能,提升MLLMs的几何推理能力。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03611 2026-04-17 cs.CV 57%

PortraitCraft: A Benchmark for Portrait Composition Understanding and Generation

PortraitCraft:面向肖像构图理解与生成的基准测试

Yuyang Sha, Zijie Lou, Youyun Tang, Xiaochao Qu, Zheng Qu, Ben Xia, Haoxiang Li, Ting Liu, Luoqi Liu

机构 * MT Lab, Meitu Inc(美图实验室,美图公司) Airbrush Studio, Meitu Inc(喷雾工作室,美图公司) Meitu Design, Meitu Inc(美图设计,美图公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PortraitCraft基准测试,通过结构化多级监督数据集,实现对肖像构图的理解与生成评估,包含评分预测、细粒度属性推理和生成任务,推动细粒度肖像理解与可控生成研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10159 2026-04-17 cs.CY cs.AI cs.HC 57%

Enhancing Large Language Model-Based Systems for End-to-End Circuit Analysis Problem Solving

增强基于大语言模型的系统以实现端到端电路分析问题求解

Liangliang Chen, Weiyu Sun, Huiru Xie, Yongnuo Cai, Ying Zhang

机构 * School of Electrical Computer Engineering, Georgia Institute of Technology, Atlanta, GA 30332 USA

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种改进的端到端电路问题求解框架,通过整合YOLO检测器和OpenCV处理提升电路识别精度,并引入ngspice验证循环以减少推理错误,实验结果表明准确率显著提升。

Comments Liangliang Chen and Weiyu Sun contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21025 2026-04-17 cs.CV 57%

CaptionQA: Is Your Caption as Useful as the Image Itself?

CaptionQA: 你的描述是否和它所代表的图像一样有用?

Shijia Yang, Yunong Liu, Bohan Zhai, Ximeng Sun, Zicheng Liu, Emad Barsoum, Manling Li, Chenfeng Xu

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Stanford University(斯坦福大学) Independent Researcher(独立研究者) Northwestern University(西北大学) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 CaptionQA通过评估生成描述在下游任务中的实用性,揭示了图像与描述之间的效用差距,涵盖四个领域,包含25个顶级和69个子类别,提供33,027个密集标注的多选问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16780 2026-04-17 cs.LG cs.CV 57%

An Optimal Transport-driven Approach for Cultivating Latent Space in Online Incremental Learning

一种基于最优传输的在线增量学习中潜在空间培育方法

Quyen Tran, Hai Nguyen, Hoang Phan, Quan Dao, Linh Ngo, Khoat Than, Dinh Phung, Dimitris Metaxas, Trung Le

机构 * Rutgers University(罗格斯大学) Tuft University(塔夫茨大学) New York University(纽约大学) HUST(哈尔滨理工大学) Monash University(墨尔本大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于最优传输理论的混合模型学习框架(MMOT),通过增量更新聚类中心来应对多模态数据流,提升复杂数据流的表征精度和未见样本的类相似性估计。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09299 2026-04-17 cs.CY 50%

Synthetic Reflections on Resource Extraction

合成反思与资源开采

Sai Krishna Tammali, Vinaya Kumar, Marc Böhlen

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文探讨如何利用AI模型分析景观,提出结合统计方法、人类判断和生成式AI的卫星图像解读框架,引入新的景观描述指标以提升多模态模型对采矿分布的评估能力。

Comments 20 pages, 5 figures, HCII 2026, prepublication

详情

展开后加载摘要…

URL PDF HTML 收藏