arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-14 至 2026-07-14 共收录 28 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 28 篇

2607.11341 2026-07-14 cs.CL cs.CV 新提交 84%

The In-Car Sign Language Corpus (ICSL): A Multi-Modal Resource for Constrained-Space Sign Language Recognition

车内手语语料库(ICSL):用于受限空间手语识别的多模态资源

Raviteja Boddu, Guilherme Vieira Leite, Joed Lopes da Silva, Ângelo Benetti, Isabela Barbieri, Natália de Melo Afonso, Thyago Santos, Helio Pedrini, Felipe Venâncio Barbosa, José Mario De Martino, Munir Georges, Alessandro Zimmer

机构 * Technische Hochschule Ingolstadt (THI)(因戈尔施塔特技术大学) Universidade Estadual de Campinas (UNICAMP)(坎皮纳斯州立大学) Universidade de São Paulo (USP)(圣保罗大学)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究共享出行服务中受限空间的手语识别挑战,提出ICSL数据集,含高精度实验室数据和现实多模态车内记录,为相关比较分析提供基础,描述了语料库多方面细节,助力提升聋人社区公共交通可达性及乘客生活质量。

Comments Published in the Proceedings of the LREC2026 12th Workshop on the Representation and Processing of Sign Languages: Language in Motion Original publication: https://www.sign-lang.uni-hamburg.de/lrec/pub/26.html The paper is distributed under the CC BY-NC 4.0 license. Link to paper: https://www.sign-lang.uni-hamburg.de/lrec/pub/26033.html

Journal ref Proceedings of the LREC2026 12th Workshop on the Representation and Processing of Sign Languages: Language in Motion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03430 2026-07-14 cs.RO 版本更新 82%

ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response

ProAct:用于结构感知主动响应的基准和多模态框架

Xiaomeng Zhu, Fengming Zhu, Weijie Zhou, Ye Tian, Zhenlin Hu, Yufei Huang, Yuchun Guo, Xinyu Wu, Zhengyou Zhang, Fangzhen Lin, Xuantang Xiong

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST), Hong Kong SAR, China(香港科技大学计算机科学与工程系) Tencent, Shenzhen, China(腾讯(中国深圳)) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究所(SIAT),中国科学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract)

AI总结 针对主动智能体开发受资源缺乏阻碍的问题,引入ProAct-75基准,提出由多模态大语言模型驱动的ProAct-Helper,其利用任务图进行行动选择,实验证明该方法在触发检测等方面优于闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08884 2026-07-14 cs.CV cs.CL cs.LG 版本更新 81%

SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs

SpurLens:多模态大语言模型中虚假线索的自动检测

Parsa Hosseini, Sumit Nawathe, Mazda Moayeri, Sriram Balasubramanian, Soheil Feizi

机构 * Department of Computer Science University of Maryland(计算机科学系大学马里兰大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究多模态大语言模型中虚假偏差,介绍SpurLens管道,利用GPT-4和开放集目标检测器自动识别虚假视觉线索,揭示虚假关联导致的两种失败模式,验证发现并探索缓解策略,呼吁提高评估方法和策略以增强MLLMs可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11459 2026-07-14 eess.SY cs.AI cs.SY 新提交 79%

A Multimodal Dataset for Large Language Model Applications in the Energy Domain

用于能源领域大语言模型应用的多模态数据集

Costas Mylonas, Magda Foti

机构 * UBITECH

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 介绍mAIEnergy多模态数据集,整合文本、图像、时间序列及地理空间等数据,统一为结构化格式并伴有元数据与工作流程,可作能源知识库,遵循FAIR原则,助力能源领域大语言模型应用的研究、建模和决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09730 2026-07-14 eess.SP 新提交 78%

Multimodal EEG-IMU Fusion for Motor Assessment: Leveraging Task-Dependent Complementarity for Robustness

用于运动评估的多模态脑电-惯性测量单元融合:利用任务相关互补性提高鲁棒性

Zhenan Yin, Lalitha Pranathi Pulavarthy, Saptarshi Purkayastha

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究针对运动障碍评估中多传感模式整合不足问题,通过同步记录脑电-惯性测量单元数据,评估特定任务模态性能和多模态融合。结果表明脑电和惯性测量单元各有优势,后期融合可利用互补性提高评估可靠性,为大规模临床验证提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10530 2026-07-14 cs.CE 新提交 78%

Integrating Physics-Informed Neural Networks and 3D Vascular Geometry Learning for Cerebral Aneurysm Detection and Multimodal Rupture-Risk Prediction

将物理信息神经网络与3D血管几何学习相结合用于脑动脉瘤检测和多模态破裂风险预测

Eshan Vipuil, Xianqi Li

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究旨在结合物理信息神经网络与3D血管几何学习用于脑动脉瘤检测及多模态破裂风险预测。通过基于PointNeXt的检测器识别动脉瘤,利用物理信息神经网络生成血流动力学描述符,多模态模型整合多种变量预测风险,取得良好检测及预测效果,提供了定量多模态评估策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09948 2026-07-14 physics.med-ph cs.LG 新提交 78%

Artificial Intelligence Across the Cardiac Amyloidosis Diagnostic Pathway: From Single-Modality Detection to Multimodal Clinical Integration

人工智能在心脏淀粉样变性诊断途径中的应用:从单模态检测到多模态临床整合

Diana Shadibaeva, Rochak Dhakal, Kui Zhang, Xiaofeng Yang, Saurabh Malhotra, Weihua Zhou

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究心脏淀粉样变性诊断中人工智能的应用,按筛查、检测等临床任务综合相关研究,揭示其成熟度梯度,骨闪烁显像和SPECT/CT的二元检测及量化接近临床转化,亚型识别等任务尚处早期。

Comments Diana Shadibaeva and Rochak Dhakal contributed equally to this work. Total Pages = 35, No. of Figures = 4, No. of Tables on Manuscript = 1, Supplementary Tables = 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07965 2026-07-14 physics.app-ph 版本更新 78%

NSF Future Manufacturing Data Challenge: A Multimodal DED Dataset for Probabilistic Representation and Prediction of Laser-Track Geometry

NSF未来制造数据挑战:用于激光轨迹中概率局部几何预测的多模态DED数据集

Abhishek Hanchate, Himanshu Balhara, Satish T. S. Bukkapatnam

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究针对NSF未来制造数据挑战,引入多模态DED数据集预测激光轨迹局部几何变化,包含热图像序列、SEM图像和高度图三种模态,在不同激光功率下进行实验,发布相关代码及坐标约定。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11007 2026-07-14 cs.LG cs.DC 版本更新 78%

Device-Cloud Collaborative LLM Inference with Multi-Modal, Multi-Task, Multi-Turn Conversations

具有多模态、多任务、多轮对话的设备-云协作大语言模型推理

Liangqi Yuan, Dong-Jun Han, Shiqiang Wang, Christopher G. Brinton

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 研究大语言模型部署挑战,设计TMO设备-云推理系统,结合轻量级设备LLM和大规模云LLM,开发资源受限强化学习策略优化推理,贡献M4A1数据集,实验证明TMO在延迟、成本和响应质量方面效果显著。

Comments ACM MobiHoc 2025 (Best Paper Runner-Up) -> IEEE/ACM Transactions on Networking (extended journal version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03988 2026-07-14 cs.HC 版本更新 78%

HEART-Watch: A multimodal physiological dataset from a Google Pixel Watch across different physical states

HEART-Watch:来自谷歌Pixel手表的不同身体状态下的多模态生理数据集

Jathushan Kaetheeswaran, Boyi Ma, Ali Abedi, Shehroz Khan, Milad Lankarany

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对消费级智能手表心血管监测算法开发缺现实多样数据的问题,提出HEART-Watch多模态生理数据集,涵盖40名健康成年人三种身体状态下的多种信号及血压测量值,以支持相关算法开发与基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10240 2026-07-14 cs.CV cs.MM 新提交 76%

What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks

你的简答题VQA分数实际衡量的是什么?多模态简答题基准中依赖评估者的不稳定性

Guanhua Ye, Niu Jingbin, Yan Li, Meiyu Liang, Zhe Xue, Yingxia Shao, Yawen Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.MM

AI总结 研究简答题VQA基准中模型答案语义正确性与和评估者期望表面形式匹配度被混淆的问题,通过人工验证语义判断等方法研究六个视觉语言模型和六个基准,发现答案类型影响不稳定性,提出官方分数应伴有语义审计和答案类型诊断以保持可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09880 2026-07-14 cs.CL cs.AI 新提交 76%

CLIR-Bench: Benchmarking Multimodal Question Answering over Irregular Clinical Time Series

CLIR-Bench:针对不规则临床时间序列的多模态问答基准测试

Frank Nie, Ethan B. Liu, Yuan Zhu, Loe Yan, Wei Fan, Jindong Han

机构 * Shandong University(山东大学) University of Auckland(奥克兰大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

AI总结 研究针对临床时间序列稀疏、不规则等问题,引入CLIR-Bench基准,通过四阶段流程构建,含6600个问答实例。实验发现现有通用模型处理稀疏临床证据困难,强调需更强不规则时间序列推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06537 2026-07-14 cs.RO 版本更新 67%

UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation

UniLM-Nav:零样本最后一英里导航的统一框架

Zhuofan Zhang, Tianxu Wang, Guoxi Zhang, Yixiong Lin, Xilin Wang, Hongming Xu, Qing Li, Song-Chun Zhu, Lifeng Fan

机构 * Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

AI总结 研究移动操作中最后一英里导航问题,提出UniLM-Nav统一框架,通过多模态大语言模型后端分解任务为视图选择、功能接地和姿态推理,在OVMM基准上优于现有方法,还验证了在实际机器人上的适用性。

Comments Project page: https://unilm-nav.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-07-14 cs.RO cs.AI cs.CL cs.CV 版本更新 67%

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交 62%

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10301 2026-07-14 cs.CV cs.CL 新提交 62%

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

ChartSync:视觉逻辑级联图表编辑的基准测试

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu

机构 * Jianghan University(江汉大学) HiThink Research(海思睿研) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究针对生成式图像编辑模型处理结构化统计图的困难,提出视觉逻辑级联编辑任务。引入ChartSync基准测试,含多种图表类别和任务类型。通过两层框架评估模型,发现开源与专有模型能力差距,分析误差以指导多模态架构发展,数据集和代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09629 2026-07-14 cs.CV cs.AI 版本更新 62%

4DR360: State Reasoning for Joint 3D Detection and Occupancy Prediction in 4D Radar-Camera Full-Scene Perception

4DR360:用于4D雷达-相机全场景感知中联合3D检测和占用预测的状态推理

Xiaokai Bai, Lianqing Zheng, Runwei Guan, Songkai Wang, Siyuan Cao, Hui-liang Shen

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对4D雷达-相机全场景感知,提出\method框架,遵循跨模态状态推理范式,通过状态引导的BEV增强和多普勒引导的时间融合进行联合3D检测和占用预测,扩展数据集并实验,提升多任务学习效果。

Comments 5 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01042 2026-07-14 cs.IR cs.AI cs.CL 版本更新 62%

Can Argus Judge Them All? Comparing VLMs Across Domains

阿格斯能评判一切吗?跨领域比较视觉语言模型

Harsh Joshi, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Niharika Jain, Sarthak Jain, Jiechao Gao, Usman Naseem

机构 * Bharati Vidyapeeth(巴哈提大学) Macquarie University(麦考瑞大学) DSEU-Okhla Vivekananda Institute of Professional Studies(维维kananda专业研究学院) IIIT-Delhi(德里印度理工学院) Center for SDGC(SDGC中心) Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究跨领域视觉语言模型,提出ARGUS-EVAL评估框架,通过多种指标刻画模型行为,评估多个模型在下游任务表现,发现能力与可靠性导向排名有显著差异,如Qwen-2.5VL-3B-Instruct能力强,CLIP延迟和内存占用低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09812 2026-07-14 eess.IV cs.CV cs.LG 新提交 57%

CHM-Net: Center Heatmap-driven Macro-Micro Modeling Network for MRI-based Microbial Density Stratification

CHM-Net:基于中心热图驱动的宏观-微观建模网络用于基于MRI的微生物密度分层

Jiaming Liang, Haolin Chen, Tingting Li, Bowen Yu, Qianyan Long, Tinghe Zhang, Xi Zhong, Xiaowei Hu, Xiaoqi Sheng, Hongmin Cai

机构 * School of Computer Science and Engineering(计算机科学与工程学院) School of Future Technology(未来技术学院) Department of Medical Imaging(医学影像科) Affiliated Cancer Hospital, Guangzhou Medical University(广州医学院附属癌症医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究基于MRI的微生物密度分层,提出CHM-Net,通过中心热图引导小病变反应定位,构建宏观-微观证据预测微生物密度,在GBNPC 2026数据集上验证有效性,在两个3D医学图像数据集上证实鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10849 2026-07-14 cs.CL 新提交 57%

Capabilities of Claude Fable 5 on Biomedical Challenge Problems

Claude Fable 5在生物医学挑战问题上的能力

Dominic Okonkwo, Magnus Hodgson, Temitope I. David, Susan Adanna Ihejirika

机构 * School of Computing, University of Georgia(佐治亚大学计算学院) Department of Chemistry, University of Illinois(伊利诺伊大学化学系) Institute of Bioinformatics, University of Georgia(佐治亚大学生物信息学研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究评估Claude Fable 5在八个生物医学基准上的能力,以确定性评分针对固定答案键评估,含两个Claude前身和GPT-5作基线。发现Fable 5拒绝率因基准而异,排除拒绝项后准确率超其他模型,还识别出两种拒绝模式,其生物医学应用主要受限在参与意愿。

Comments 15 pages, 6 tables, 4 figures, appendix with qualitative examples

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10308 2026-07-14 cs.CV 新提交 57%

Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis

通过虚拟模态合成将大型多模态模型推广到通用视觉模态

Shihao Yuan, Yuanze Li, Ruyi Zhang, Ming Liu, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究大型多模态模型推广到未见视觉模态的挑战,提出VVM-Tuning训练框架,通过模态合成和上下文让模型具备相关能力,引入VVM-Bench基准,实验证明经合成模态训练的模型在多模态上有改进且无需模态内训练。

Comments Accepted by the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09780 2026-07-14 cs.CV cs.LG 新提交 57%

Towards Real-World Wearable Motion Reconstruction

迈向现实世界的可穿戴运动重建

Andrea Boscolo Camiletto, Rishabh Dabral, Eduardo Alvarado, Thabo Beeler, Marc Habermann, Christian Theobalt

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarbrücken Research Center for Visual Computing, Interaction and AI(萨尔布吕肯视觉计算、交互与人工智能研究中心) Google(谷歌)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 研究可穿戴设备运动捕捉问题,提出优先考虑轻便设备。贡献包括提供多模态数据集,提出WHIP模型,研究传感器互补性,以实现从任意传感器子集重建运动,处理缺失模态并生成合理运动。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08964 2026-07-14 cs.AI 版本更新 57%

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

长视野终端基准测试:使用基于密集奖励的评分方式测试智能体在长视野终端任务中的极限

Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, Leowei Liang

机构 * Tencent(腾讯) University of Maryland, College Park(马里兰大学帕克分校) University of Georgia(佐治亚大学) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Indiana University(印第安纳大学) Lehigh University(里海大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究针对现有终端基准测试局限,引入长视野终端基准测试(Long-Horizon-Terminal-Bench),含46个长视野任务。通过分解为分级子任务提供密集中间奖励,评估15个前沿模型,揭示改进空间,分析失败模式,发布该基准测试助力长视野终端智能体发展。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02585 2026-07-14 cs.CV 版本更新 57%

Reliability-Aware CT-MRI Registration: A Quality Engineering Framework with Stability Analysis and Risk Classification

可靠性感知的CT-MRI配准:一个具有稳定性分析和风险分类的质量工程框架

Nisreen Albzour

机构 * School of Systems Science and Industrial Engineering, Binghamton University(宾夕法尼亚大学系统科学与工业工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出可靠性感知框架,通过数据学习阈值将配准质量转化为风险类别,用多种指标评估可靠性,经训练阈值用于测试患者,表明仿射配准更优,可靠性过滤配准可改善对齐,还做了多方面分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21649 2026-07-14 cs.CV 57%

Seeing Isn't Orienting: A Cognitively Informed Hierarchical Benchmark for Object Orientation in MLLMs

看到并不等于定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yan, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

机构 * Boston University(波士顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DORI基准,揭示多模态大语言模型在定向理解上的不足,发现其在角度估计和方向跟踪方面存在系统性缺陷,对机器人控制和3D场景重建有重要启示。

Comments Paper accepted to ECCV 2026 (Main Track). Previously, this version appeared as arXiv:2603.11410 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18465 2026-07-14 cs.CV 版本更新 57%

BiomechGPT: Extending Motion-Language Models to Clinical Motion Understanding

BiomechGPT:将运动-语言模型扩展到临床运动理解

Ruize Yang, Ann Kennedy, R. James Cotton

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究探索多模态运动-语言模型BiomechGPT能否回答临床运动相关问题。通过收集数据、设计跨格式令牌化器构建多模态数据集来训练模型,其在临床相关任务中性能良好,为临床和研究人员交互生物力学数据提供新途径。

Comments Project page: https://intelligentsensingandrehabilitation.github.io/BiomechGPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10462 2026-07-14 math.NA cs.NA 新提交 50%

Computing critical velocities in waveguides via multiparameter eigenvalue problems

通过多参数特征值问题计算波导中的临界速度

Hauke Gravenkamp, Xiang Liu

专题命中 多模态评测 :multimodal(abstract)

AI总结 研究波导动力学等场景中临界速度的计算方法,从多项式参数依赖特征值问题出发,结合等相速和群速条件得到奇异多项式多参数特征值问题,用既定算法求解,能同时计算所有临界点,经基准问题验证性能良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09094 2026-07-14 physics.geo-ph 版本更新 50%

Artificial Intelligence for Subsurface Imaging Understanding: A Decade Review of Challenges, Methods, Benchmarks, and Outlook

CIG-Bench:AI驱动的地下成像理解的综合调查与基准

Yimin Dou, Xinming Wu, Hui Gao, Mingliang Liu, Tao Zhao, Zhi Zhong, Haibin Di, Min Jun Park, Robert G. Clapp, Zhixiang Guo, Long Han, Sergey Fomel

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文系统回顾2015-2025年间652篇文献,将地下成像理解归纳为四大任务,总结三大挑战,并提出包含统一评估协议、预训练模型和混合数据集的社区基准CIG-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏