arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 1521 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 318 篇

2508.02929 2026-07-28 cs.IR cs.AI cs.LG 版本更新 57%

Realizing Scaling Laws in Recommender Systems: A Foundation-Expert Paradigm for Hyperscale Model Deployment

在推荐系统中实现扩展定律:超大规模模型部署的基础-专家范式

Dai Li, Kevin Course, Wei Li, Hongwei Li, Jie Hua, Yiqi Chen, Zhao Zhu, Rui Jian, Xuan Cao, Bi Xue, Yu Shi, Jing Qian, Kai Ren, Matt Ma, Qunshu Zhang, Rui Li

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 针对推荐系统中跨多界面部署基础模型的挑战,提出基础-专家范式,中央FM生成目标感知嵌入供特定界面专家模型使用,迁移率超现有方法,自2025年在Meta部署后实现线上指标提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12447 2026-07-27 cs.LG cs.AI 版本更新 57%

The Computational Basis of Confidence in Large Language Models

大语言模型中置信度的计算基础

Dharshan Kumaran, Viorica Patraucean, Maks Ovsjanikov, Petar Veličković, Nathaniel Daw

机构 * Google DeepMind(谷歌DeepMind) École Polytechnique(巴黎综合理工学院) Princeton University(普林斯顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究大语言模型中置信度的计算基础,利用统计决策置信度框架,通过答案 - 对数差异测试其预测特征,结果表明在多种任务中答案对数可作潜在决策变量读出,为多模态语言模型置信度提供解释并统一研究框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07643 2026-07-23 cs.CV 版本更新 57%

Universality Reconsidered: Rethinking the Validation of Foundation Models for General-Purpose 3D Medical Segmentation

揭示通用3D医学分割中的模态差异与泛化幻觉

Yichi Zhang, Le Xue, Feiyang Xiao, Wenbo Zhang, Gang Feng, Chenguang Zheng, Yuan Qi, Yuan Cheng, Zixin Hu

机构 * Fudan University, Shanghai, China.(复旦大学) Shanghai Academy of Artificial Intelligence for Science, Shanghai, China.(上海人工智能科学研究院) Shanghai Universal Medical Imaging Diagnostic Center, Shanghai, China.(上海通用医学影像诊断中心)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文通过UMD数据集揭示3D医学分割中模态差异与泛化幻觉问题,指出现有基础模型在实际应用中存在显著性能差异,需转向多模态训练以提升通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13024 2026-07-22 cs.CL 版本更新 57%

Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses

眼泪还是欢呼?通过文化诱发的差异情感反应基准测试LLMs

Chongyuan Dai, Yaling Shen, Zihan Gao, Jia Li, Yishun Jiang, Yaxiong Wang, Liu Liu, Zongyuan Ge, Jinpeng Hu

机构 * Hefei University of Technology(合肥工业大学) Monash University(墨尔本大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出CEDAR基准,通过文化诱发的差异情感反应评估LLMs,揭示语言一致性和文化契合度之间的脱节,展示文化根植的情感理解仍是模型的重大挑战。

Comments ACL 2026 SAC Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16727 2026-07-22 cs.CV cs.LG 版本更新 57%

Pain in 3D: Generating Controllable Synthetic Faces for Automated Pain Assessment

3D 中的疼痛:生成用于自动疼痛评估的可控合成面部

Xin Lei Lin, Soroush Mehraban, Abhishek Moturu, Babak Taati

机构 * Vector Institute(向量研究所) KITE Research Institute(KITE研究机构) University Health Network(大学健康网络) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Medical Imaging, University of Toronto(多伦多大学医学成像系) Institute of Biomedical Engineering, University of Toronto(多伦多大学生物医学工程研究所)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对面部表情自动疼痛评估面临的数据稀缺等问题,提出3DPain数据集及三阶段框架合成多视图面部,还引入ViTPain框架,为可推广的自动疼痛评估建立了可控、多样且基于临床的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11899 2026-07-22 cs.CV 版本更新 57%

Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models

阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准

Futa Waseda, Shojiro Yamabe, Daiki Shiono, Kento Sasaki, Tsubasa Takahashi

机构 * Turing Inc.(Turing公司) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) Tohoku University(东北大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。

Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20575 2026-07-21 cs.CV 版本更新 57%

An interactive enhanced driving dataset for autonomous driving

一种交互增强的自动驾驶数据集

Haojie Feng, Xinrui Zhang, Mengjie Tian, Peizhi Zhang, Zhuoren Li, Junpeng Huang, Xiurong Wang, Junfan Zhu, Jianzhou Wang, Dongxiao Yin, Lu Xiong

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出交互增强驾驶数据集,通过生成合成视频实现多模态对齐,用于评估和优化自动驾驶模型的推理能力。

Comments Accepted for publication in Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15190 2026-07-20 cs.AI 版本更新 57%

Can We Trust Item Response Theory for AI Evaluation?

我们能信任项目反应理论进行人工智能评估吗?

Han Jiang, Sunbeom Kwon, Jinwen Luo, Ziang Xiao, Susu Zhang

机构 * Johns Hopkins University(约翰·霍普金斯大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究探讨项目反应理论(IRT)用于人工智能评估的可靠性,利用六个大语言模型基准模拟响应矩阵,比较四种估计工具,评估IRT在多方面的表现,发现经典估计器在大型基准中可能不可行,可扩展估计器在特定模型集下可能产生不可靠推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18929 2026-07-20 cs.CV 版本更新 57%

On the Role of Depth in Surgical Vision Foundation Models: An Empirical Study of RGB-D Pre-training

在手术视觉基础模型中深度的作用:一项关于RGB-D预训练的实证研究

John J. Han, Adam Schmidt, Muhammad Abdullah Jamal, Chinedu Nwoye, Anita Rau, Jie Ying Wu, Omid Mohareri

机构 * Vanderbilt University(范德比尔大学) Intuitive Surgical Inc.(Intuitive Surgical公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究通过比较不同预训练方法,发现几何感知的多模态预训练能显著提升手术视觉模型的性能,且无需改变推理架构。

Comments Inaccurate findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13020 2026-07-20 cs.LG cs.AI 版本更新 57%

PASs-MoE: Mitigating Misaligned Co-drift among Router and Experts via Pathway Activation Subspaces for Continual Learning

PASs-MoE:通过路径激活子空间减轻路由器与专家之间的错位协同漂移以进行持续学习

Zhiyan Hou, Haiyun Guo, Haokai Ma, Yandu Sun, Yonghui Yang, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Southeast University, Nanjing, China(南京东南大学) Wuhan AI Research, Wuhan, China(武汉人工智能研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究持续指令调整中多模态大语言模型的问题,提出基于路径激活子空间的固定容量PASs - MoE - LoRA方法,含PAS引导的重新加权和PAS感知的秩稳定,实验表明该方法在准确性和抗遗忘性上优于基线和变体且不增参数。

Comments Published in the Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Volume 1: Long Papers. 14 pages. Code is available at https://github.com/yueluoshuangtian/PASs-MoE

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 31959--31972, San Diego, California, United States, July 2026. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.04599 2026-07-20 cs.LG cs.AI 版本更新 57%

Perception-Aligned AI Outputs: End-to-End Visual Prediction for Uncertainty Communication in Clinical Decision-Making

感知对齐的人工智能输出:临床决策中用于不确定性通信的端到端视觉预测

Mohammad Eslami, Solale Tabarestani, Saber Kazeminasab, Ehsan Adeli, Glyn Elwyn, Tobias Elze, Mengyu Wang, Nazlee Zebardast, Lucia Sobrin, Nassir Navab, Daniel Shu Wei Ting, Malek Adjouadi

机构 * Harvard Ophthalmology AI Lab(哈佛眼科人工智能实验室) Schepens Eye Research Institute of Massachusetts Eye and Ear(马萨诸塞眼耳医院施佩恩眼科研究所) Harvard Medical School(哈佛医学院) Center for Advanced Technology and Education(先进教育技术中心) Florida International University(佛罗里达国际大学) Dartmouth Institute for Health Policy and Clinical Practice(达特茅斯健康政策与临床实践研究所) Dartmouth College(达特茅斯学院) Computer Aided Medical Procedures(医学辅助程序) Technical University of Munich(慕尼黑技术大学) Singapore Eye Research Institute(新加坡眼科研究所) Singapore National Eye Centre(新加坡国家眼科中心) Department of Ophthalmology, Byers Eye Institute, Stanford University(眼科部门,比尔斯眼科研究所,斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究针对医疗保健中可解释人工智能的问题,提出以人为本的机器学习可视化学习框架VL4ML,通过直观视觉表示传达模型预测与不确定性,经多临床任务验证及评估,结果显示其能有效支持临床决策,具有广泛可及性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16307 2026-07-16 cs.AI 版本更新 57%

NeSy-Route: A Neuro-Symbolic Benchmark for Constrained Route Planning in Remote Sensing

NeSy-Route:一种用于遥感约束路径规划的神经符号基准

Ming Yang, Zhi Zhou, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) School of Artifical Intelligence, Nanjing University, China(人工智能学院,南京大学) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 NeSy-Route是一个大规模神经符号基准,用于评估遥感中的约束路径规划能力,通过自动化数据生成框架和三级评估协议,全面测试多模态大语言模型的感知、推理和规划能力。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18548 2026-07-16 cs.SE cs.AI 版本更新 57%

1D-Bench: A Benchmark for Iterative UI Code Generation with Visual Feedback in Real-World

1D-Bench: 一个用于具有实时反馈的现实世界迭代UI代码生成的基准

Qiao Xu, Yipeng Yu, Chengxiao Feng, Xu Liu

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 1D-Bench通过现实电商工作流提供迭代UI代码生成基准,测试模型在中间表示缺陷下的鲁棒性,实验表明迭代编辑能提升渲染成功率和视觉相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17183 2026-07-15 cs.CV cs.CY 版本更新 57%

Benchmarking Nighttime Traffic Sign Recognition with Illumination-Adaptive Detection and Semantic Attribute Reasoning

在低光照条件下学习:用于交通标志识别的数据集和算法

Aditya Mishra, Akshay Agarwal, Haroon Lone

机构 * IISER Bhopal(印度比哈尔州国际研究学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出INTSD数据集和LENS-Net算法,解决夜间交通标志识别中的低光照和干扰问题,通过大规模数据和先进模型验证了夜间识别的挑战与方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08964 2026-07-14 cs.AI 版本更新 57%

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

长视野终端基准测试:使用基于密集奖励的评分方式测试智能体在长视野终端任务中的极限

Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, Leowei Liang

机构 * Tencent(腾讯) University of Maryland, College Park(马里兰大学帕克分校) University of Georgia(佐治亚大学) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Indiana University(印第安纳大学) Lehigh University(里海大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究针对现有终端基准测试局限,引入长视野终端基准测试(Long-Horizon-Terminal-Bench),含46个长视野任务。通过分解为分级子任务提供密集中间奖励,评估15个前沿模型,揭示改进空间,分析失败模式,发布该基准测试助力长视野终端智能体发展。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02585 2026-07-14 cs.CV 版本更新 57%

Reliability-Aware CT-MRI Registration: A Quality Engineering Framework with Stability Analysis and Risk Classification

可靠性感知的CT-MRI配准:一个具有稳定性分析和风险分类的质量工程框架

Nisreen Albzour

机构 * School of Systems Science and Industrial Engineering, Binghamton University(宾夕法尼亚大学系统科学与工业工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出可靠性感知框架,通过数据学习阈值将配准质量转化为风险类别,用多种指标评估可靠性,经训练阈值用于测试患者,表明仿射配准更优,可靠性过滤配准可改善对齐,还做了多方面分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18465 2026-07-14 cs.CV 版本更新 57%

BiomechGPT: Extending Motion-Language Models to Clinical Motion Understanding

BiomechGPT:将运动-语言模型扩展到临床运动理解

Ruize Yang, Ann Kennedy, R. James Cotton

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究探索多模态运动-语言模型BiomechGPT能否回答临床运动相关问题。通过收集数据、设计跨格式令牌化器构建多模态数据集来训练模型,其在临床相关任务中性能良好,为临床和研究人员交互生物力学数据提供新途径。

Comments Project page: https://intelligentsensingandrehabilitation.github.io/BiomechGPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17717 2026-07-13 cs.CR cs.AI stat.AP stat.ML 版本更新 57%

Machine Learning for Network Attacks Classification and Statistical Evaluation of Adversarial Learning Methodologies for Synthetic Data Generation

基于机器学习的网络攻击分类及对抗学习方法在合成数据生成中的统计评估

Iakovos-Christos Zarkadis, Christos Douligeris

机构 * University of Piraeus(希腊比雷埃乌斯大学) Dept. of Informatics(信息学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文通过统一多模态NIDS数据集,利用机器学习算法和对抗学习生成合成数据,评估其真实性、效用和隐私性,为入侵检测提供稳定模型。

Comments Accepted at IEEE ISCC 2026, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00846 2026-07-08 cs.CL 版本更新 57%

Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

Omni-RRM:通过基于自动评分标准的偏好合成推进全模态奖励建模

Zicheng Kong, Dehua Ma, Zhenbo Xu, Alven Yang, Yiwei Ru, Haoran Wang, Zixuan Zhou, Fuqing Bie, Liuyu Xiang, Huijia Wu, Jian Zhao, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) ShiFang Technology Inc.(ShiFang科技公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究针对多模态大语言模型对齐难题,提出全模态基于评分标准的奖励模型Omni-RRM。通过自动评分标准偏好合成构建数据集,用特定训练方案提升奖励辨别力,在多模态基准测试中达最优精度,还能指导选择与迁移,提升模型对齐能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26946 2026-07-07 cs.CV cs.RO 版本更新 57%

Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation

三步导航:一种用于零样本视觉-语言导航的分层全局-局部规划器

Wanrong Zheng, Yunhao Ge, Laurent Itti

机构 * University of Southern California(南加州大学) NVIDIA Research(NVIDIA研究)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出三步导航方法,通过全局-局部分层规划解决零样本视觉-语言导航中的漂移和低成功率问题,无需梯度更新或微调,实现最先进的性能。

Comments Accepted to AISTATS 2026. Code: https://github.com/ZoeyZheng0/3-step-Nav

Journal ref Proceedings of the 29th International Conference on Artificial Intelligence and Statistics (AISTATS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24847 2026-07-07 cs.CV 版本更新 57%

CORA: Generalizable coronary artery disease assessment and risk stratification from coronary CT angiography using pathology-centric representation learning

CORA:一种由病理合成驱动的冠状动脉CT血管造影分析和MACE风险评估基础模型

Jinkui Hao, Gorkem Durak, Halil Ertugrul Aktas, Ulas Bagci, Bradley D. Allen, Nilay S. Shah, Bo Zhou

机构 * Department of Radiology, Northwestern University(西北大学放射学系) Department of Biomedical Engineering, Northwestern University(西北大学生物医学工程系) Department of Cardiology, Northwestern University(西北大学心脏病学系) Department of Preventive Medicine, Northwestern University(西北大学预防医学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 CORA通过病理合成驱动的自监督框架,直接从体积CT血管造影数据中学习,提升冠状动脉疾病分析和MACE风险评估性能,实现29%的性能提升。

Comments Code is available at: https://github.com/Advanced-AI-in-Medicine-and-Physics-Lab/CORA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11098 2026-07-07 cs.SD cs.CL 版本更新 57%

VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents

VCB Bench:用于音频基础大语言模型对话代理的评估基准

Jiliang Hu, Wenfu Wang, Zuchao Li, Chenxing Li, Yiyang Zhao, Hanzhao Li, Liqiang Zhang, Meng Yu, Dong Yu

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Tencent AI Lab(腾讯AI实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 针对现有音频语言模型基准局限,提出VCB Bench,基于真实人类语音构建,从指令跟随、知识理解、鲁棒性三个角度评估,揭示性能差距并指明改进方向,提供评估框架。

Comments 25 pages, 9 figures, accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11691 2026-07-07 cs.CV 版本更新 57%

VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models

VLMEvalKit:用于评估大型多模态模型的开源工具包

Haodong Duan, Xinyu Fang, Junming Yang, Xiangyu Zhao, Zerun Ma, Yuxuan Qiao, Mo Li, Tianhao Liang, Lin Zhu, Amit Agarwal, Xiaozhe Li, Shengyuan Ding, Jiazi Bu, Ziyu Liu, Zhangyang Qi, Yifei Li, Yuhang Zang, Zhe Chen, Lin Chen, Yuan Liu, Yubo Ma, Hailong Sun, Yifan Zhang, Shiyin Lu, Tack Hwa Wong, Weiyun Wang, Peiheng Zhou, Chaoyou Fu, Junbo Cui, Jixuan Chen, Enxin Song, Song Mao, Junming Lin, Xilin Wei, Jinsong Li, Zeyi Sun, Zhaowei Wang, Zicheng Zhang, Xiaoyi Dong, Junjun He, Pan Zhang, Jiaqi Wang, Dahua Lin, Kai Chen

机构 * VLMEvalKit Team(VLMEvalKit团队) Community Contributors(社区贡献者)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 VLMEvalKit是基于PyTorch的开源工具包,为评估多模态模型提供框架。实现450+模型配置,支持330+基准测试,有单一接口,自动处理多项任务,还扩展到多领域,基于其结果有OpenVLM Leaderboard。

Comments Updated on 2026.07.05

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30313 2026-07-03 cs.CV cs.LG 版本更新 57%

TRACE: A Concept Bottleneck Model for Longitudinal 3D Glioblastoma Response Assessment

TRACE:用于纵向3D胶质母细胞瘤反应评估的概念瓶颈模型

Alia Tarek, Hamsa Saberr, Hamza Elghonemy, Youssef Afify, Tamer Basha, Omair Shahzad Bhatti, Abdulrahman M. Selim, Hasan Md Tusfiqur Alam, Daniel Sonntag

机构 * Department of Biomedical and Healthcare Data Engineering, Faculty of Engineering, Cairo University(生物医学与健康数据工程系,工程学院,开罗大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) University of Oldenburg(奥尔登堡大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出TRACE模型,通过概念瓶颈架构将RANO 2.0标准融入深度学习,实现可解释的4类胶质母细胞瘤纵向反应分类,在LUMIERE数据集上达到4类宏F1为0.4769,并支持概念校正。

Comments Accept in the EXPLIMED: Explainable Artificial Intelligence for the Medical Domain workshop in IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16130 2026-07-03 cs.CV 版本更新 57%

EPOFusion: Exposure aware Progressive Optimization Method for Infrared and Visible Image Fusion

EPOFusion:一种针对红外和可见图像融合的曝光感知渐进优化方法

Zhiwei Wang, Defeng He, Li Zhao, Xiaoqin Zhang, Yuxing Li, Edmund Y. Lam

机构 * College of Information Engineering, Zhejiang University of Technology(浙江工业大学信息工程学院) College of Information Science and Technology, Zhejiang Shuren University(浙江树人大学信息科技学院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电机电子工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EPOFusion方法,通过引入指导模块和迭代解码器提升曝光区域的融合效果,同时构建首个高质红外引导标注的曝光数据集,实验表明其在视觉保真度和下游任务表现上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23365 2026-07-02 cs.CV 版本更新 57%

SpatialMosaic: A Multiview VLM Dataset for Partial Visibility

SpatialMosaic:一个多视角VLM数据集用于部分可见性

Kanghee Lee, Jungi Hong, Sion Lee, Injae Lee, Minseok Kwak, Kwonyoung Ryu, Jaesik Park

机构 * Seoul National University(首尔大学) University College London(伦敦大学学院) Kyung Hee University(庆熙大学) POSTECH(浦项科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SpatialMosaic数据集,通过多视角图像生成2M问答对,引入SpatialMosaic-Bench基准测试,结合3D重建模型的混合框架提升空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19889 2026-07-02 cs.CV 版本更新 57%

OmniFall: From Staged Through Synthetic to Wild, A Unified Multi-Domain Dataset for Robust Fall Detection

OmniFall: 从舞台到合成再到真实场景,一个用于鲁棒跌倒检测的统一多域数据集

David Schneider, Zdravko Marinov, Moritz Mistol, Zeyun Zhong, Alexander Jaus, Rodi Düger, Rafael Baur, M. Saquib Sarfraz, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Mercedes-Benz Tech Innovation(梅赛德斯-奔驰技术创新)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出OmniFall统一基准,包含15k视频(80小时)的帧级标注,覆盖舞台、合成和真实三个域,评估微调模型和零样本多模态大模型,发现合成数据微调模型在跌倒状态检测上显著优于零样本模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18011 2026-07-02 cs.CV 版本更新 57%

RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

RoadBench: 在城市道路场景下对多模态大语言模型进行细粒度空间理解与推理的基准测试

Jun Zhang, Xin Zhang, Jie Feng, Long Chen, Junhui Wang, Zhicheng Liu, Depeng Jin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心) Zhongguancun Academy(中关村学院) Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对城市复杂场景中多模态大语言模型在细粒度空间理解与推理能力上的不足,提出RoadBench基准,包含8个任务、3040个测试用例,通过鸟瞰图和第一人称视角图像评估模型性能,揭示现有模型在此类任务上的显著缺陷。

Comments Accepted by ECCV 2026, the code and data are publicly available at: https://github.com/tsinghua-fib-lab/RoadBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17731 2026-07-02 cs.CV cs.LG 版本更新 57%

VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

VisReason: 面向视觉思维链推理的大规模数据集

Lingxiao Li, Yifan Wang, Xinyan Gao, Chen Tang, Xiangyu Yue, Chenyu You

机构 * Stony Brook University(石溪大学) Boston University(波士顿大学) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 为解决多模态大模型缺乏大规模视觉思维链数据的问题,构建包含48.9万样本的VisReason数据集及专家级子集VisReason-Pro,通过微调Qwen2.5-VL模型显著提升逐步视觉推理准确性与泛化能力。

Comments ECCV Camera Ready, project page: https://y-research-sbu.github.io/VisReason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29672 2026-07-01 cs.CL 版本更新 57%

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分

William Orwig, Roger E. Beaty

机构 * Harvard University(哈佛大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏