Explainable Multimodal AI for Adaptive Calibration of Archaeological Sensing Workflows
面向考古传感工作流自适应校准的可解释多模态人工智能
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出一种可解释多模态AI框架,用于考古传感工作流的自适应校准、质量评估与采集支持,经多模态考古数据集验证可实现跨模态稳健质量评估。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
面向考古传感工作流自适应校准的可解释多模态人工智能
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出一种可解释多模态AI框架,用于考古传感工作流的自适应校准、质量评估与采集支持,经多模态考古数据集验证可实现跨模态稳健质量评估。
ICU-Bench: 多模态大语言模型持续反学习基准测试
机构 * School of Computer Science and Technology(计算机科学与技术学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出ICU-Bench,用于评估多模态大语言模型在持续隐私删除中的性能,包含1000个敏感资料和9500张图像,引入新指标分析遗忘效果与稳定性,揭示现有方法在持续场景下的局限。
Comments 21 pages, 11 figures, and 9 tables
缺失-by-设计:可撤销多模态情感分析的可验证模态删除
机构 * University of Macau(澳门大学) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Juntendo University(立命馆大学) ; Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 本文提出MBD框架,通过结构化表示学习和可验证参数修改流程,实现可撤销多模态情感分析中的模态删除,实验表明其在不完整输入下具有强预测性能,并实现隐私与效用的平衡。
Comments 21 pages, 6 figures. In the previous version, Juntendo University was erroneously listed as the affiliation; we must clarify that this paper has absolutely no relation to Juntendo University. Therefore, we have replaced this affiliation in the new version
苏格拉底测试的理论基础:动态、多模态、对话式考试
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出苏格拉底测试的理论基础,整合多类教育评估原则与分类学,量化最近发展区并设计非补偿性加法评分架构,以解决传统评估的缺陷并提升测量可靠性。
Comments 21 pages, 1 figure, submitted to Computers and Education: Artificial Intelligence
ReMoE:报告引导型混合专家模型用于多模态OCT/OCTA异常检测
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 针对多模态OCT/OCTA异常检测,提出ReMoE模型,融合正常报告语义构建模态感知先验,在两个数据集上取得最优性能。
MMShopBench:面向多模态多轮购物智能体的真实日志基准
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 该研究推出首个多模态多轮购物智能体真实日志基准MMShopBench,构建离线购物沙箱,经微调后开源模型性能大幅接近领先专有模型,验证了基准及配套训练数据的有效性。
Comments 16 pages, 6 figures, including appendix
CAER:面向多模态大语言模型的冲突感知证据路由,采用双前缀专家机制
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本研究提出与主干无关的CAER框架,通过双前缀专家路由机制实现视觉-语言冲突检测与冲突感知生成,在MMMC及AgriConflict数据集上验证可提升开源多模态大语言模型的可靠性。
用于非配对跨模态医学分类的共享语义码本蒸馏
机构 * Sungkyunkwan University(成均馆大学) ; Convergence Research Institute, Sungkyunkwan University(成均馆大学融合研究院)
专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV
AI总结 针对非配对跨模态医学分类的挑战,提出SSCD方法,通过共享语义码本转移知识,在两个医学分类任务中提升学生模型性能,优于各基线方法
Comments 16 pages, 2 figures, 4 tables
SKY-Piano:多模态钢琴演奏数据集
机构 * Seoul National University(首尔大学) ; KAIST(韩国科学技术院) ; Yamaha(雅马哈)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM
AI总结 该研究发布SKY-Piano多模态钢琴演奏数据集,含多类数据及标注工具,通过微调实验验证其用于MIDI到动作生成的可用性。
Comments Accepted to the 27th International Society for Music Information Retrieval Conference (ISMIR 2026), Abu Dhabi, UAE. Project page: https://joonhyungbae.github.io/skypiano/
MultivationBench:多模态序列动机推理基准
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出MultivationBench基准,基于心理学框架评估多模态序列动机推理,发现现有模型难以在序列语境中保持一致的动机推理,暴露了静态识别与动态推理的差距。
Comments 31 pages, including appendices; 6 figures and 22 tables. Code: https://github.com/HKUST-KnowComp/MultivationBench
面向心血管传感器贴片的端到端多模态微型CNN原型设计
机构 * CTO System Innovation, NXP Semiconductors Germany GmbH(NXP半导体德国系统创新部) ; Advanced Chip Engineering, NXP Semiconductors(NXP半导体先进芯片工程部) ; Business Line Secure Connected Edge, NXP Semiconductors(NXP半导体安全连接边缘业务线) ; Institute of Medical Technology and Intelligent Systems, Hamburg University of Technology(汉堡技术大学医学技术与智能系统研究所) ; Department of Informatics, Hamburg University of Applied Sciences(汉堡应用科学大学信息学院)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV
AI总结 针对资源受限的医疗边缘设备,提出一种早期融合心电图和心音图数据的卷积神经网络,实现二分类,相比现有技术将内存和计算成本降低约三个数量级,并验证了在微控制器上的能效优势。
Comments 16 pages, 2 figures. Extended version of our 2024 IEEE PerCom paper, with direct on-device energy measurements, a BLE communication benchmark, architecture comparisons, and an extended evaluation. Submitted to Pervasive and Mobile Computing; Measurement-method clarifications and minor editorial corrections; results and conclusions unchanged
缩小眼科人工智能的差距:MM-Retinal-Reason数据集与OphthaReason模型用于动态多模态推理
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Department of Ophthalmology, The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院眼科学系) ; School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) ; School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 该研究针对现有眼科AI仅聚焦基础推理的问题,构建首个眼科多模态数据集MM-Retinal-Reason,并提出带UADT方法的OphthaReason模型,实现眼科多模态推理性能的显著提升。
迈向可靠的染色转移:基于多模态专家指导评估的迭代数据-模型协同优化框架
机构 * East China Normal University(华东师范大学) ; Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) ; Hangzhou Hyperspectral Imaging Technology Co., Ltd.(杭州高光谱成像技术有限公司) ; Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 研究针对染色转移建模难题,提出DMCoStain框架,通过迭代优化数据与模型能力提升准确性和可解释性。基于IPE视觉语言模型构建MEGFS策略并创建ImmunoInstruction数据集,实验证明该框架达最优精度,其范式有实用价值,MEGFS可作评估工具。
Comments 10 pages, accepted by ACMMM2026 Main Track
用于多模态短期太阳辐照度预测的可控视觉主干基准测试
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究针对多模态短期太阳辐照度预测,固定多模态预测管道,仅改变视觉主干进行基准测试。比较多种主干在不同数据集上的预测表现,给出了各主干的RMSE等结果,提供了可重复的编码器比较,未确立架构优势等。
Comments 6 pages, 3 figures, Moratuwa Engineering Research Conference 2026 (MERCon 2026)
思想令牌混合:统一感知与推理以实现自由形式多模态基础定位
机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) ; Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) ; University of Science and Technology Beijing(北京科技大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 研究旨在统一多模态基础定位中的感知与推理。提出思想令牌混合(Motto)方法,通过空间接地思想令牌化及上下文自适应令牌链实现,构建PR-Bench基准,实验证明该方法在自由形式接地任务中达领先性能。
Comments Accepted by ACM MM 2026
彩色眼底摄影分析:数据、预处理和建模向多模态人工智能的共同进化
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 研究彩色眼底摄影分析中数据、预处理和建模的共同进化,通过数据集进化、预处理范式和建模框架的相互作用进行综合概述,指出未来进展取决于三者协同优化,为临床部署等提供路线图。
Comments Survey paper, 77 pages, 18 figures, 2 tables
MulRobBench:用于安全且符合安全策略的多模态无人机智能体的决策级基准测试
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 智慧城市中无人机需在复杂条件下决策,MulRobBench作为决策级基准测试,将多模态观测、安全策略等集成,含多任务样本和评分维度,评估结合多种方式,给出模型得分,通过研究找出决策不稳定原因,为无人机多模态决策提供可重复基准。
Comments 22 pages, 18 figures, 17 tables
ObsDriveBench:具有可观测性意识的恶劣天气下多模态理解基准测试
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所)
专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.AI
AI总结 研究恶劣天气下视觉语言模型在多模态输入时的表现,引入ObsDriveBench基准测试,通过可观测性元标注等构建含多类问题的测试集,实验发现现有模型性能降,还引入ObsDrive模型提升其在多方面的鲁棒性。
FogDrive:用于分级雾天感知的多模态合成驾驶数据集
机构 * Indian Institute of Technology, Guwahati(印度理工学院古瓦哈提分校)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV
AI总结 FogDrive是用于分级雾天感知的多模态合成驾驶数据集,基于CARLA模拟器构建,含多种传感器数据,模拟不同密度雾。通过跨两种范式建立基线基准,得出训练中混合多密度雾可收紧3D边界框几何形状等见解,将开源加速多模态研究。
DOSE-I:用于内镜操作镇静的多模态生理信号数据集——技术报告
机构 * Universitätsmedizin Halle (Saale)(哈勒(萨勒)大学医学院) ; Universitätsklinikum Halle (Saale)(哈勒(萨勒)大学医院) ; Universitätsklinik und Poliklinik für Innere Medizin I(内科学I大学医院和多科医院) ; Martin‑Luther‑Universität Halle‑Wittenberg(哈勒-维滕贝格马尔伯特大学) ; Medizinische Fakultät(医学系) ; Ernst‑Grube‑Straße 40(埃尔斯特-格鲁布街40号)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本文介绍内镜镇静多模态生理信号数据集DOSE-I的构建细节,提供标注数据、预处理方案与开源代码,支撑相关医疗AI研究。
Comments Dataset can be accessed via zenodo DOI https://doi.org/10.5281/zenodo.18483292 For citation use the primary academic reference: Garbe J et al. Towards predicting sedation depth in endoscopy with large clinically annotated EEG data of continuous Propofol sedation. In: P. Andreevetal (Eds.): AIME2026, LNAI 16749, p.1-6, Springer, 2026. https://doi.org/10.1007/978-3-032-30813-9_58
医学检查表:评估多模态模型对医学图像的理解
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 介绍医学检查表这一基准测试,通过给模型一张图像及一正一误两个标题进行二元测试,可统一评估不同多模态模型,验证其对医学概念的理解,评估其处理分布外输入的能力,用其评估四个先进模型发现它们理解图像能力待提升。
Comments Accepted for publication in IEEE Journal of Biomedical and Health Informatics
PixDLM:一种用于无人机推理分割的双路径多模态语言模型
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出PixDLM,一种用于无人机推理分割的多模态语言模型,通过构建DRSeg基准数据集,验证了该模型在处理高分辨率无人机图像中的有效性。
Comments Accepted to CVPR 2026 (highlight)
一种用于机器人的智能云边缘多模态交互系统
机构 * Hainan University(海南大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 针对复杂环境下资源受限机器人的交互问题,提出云边缘多模态交互框架,集成增强YOLO手势检测器与LLM、VLM智能体,改进手势检测方法,经实验验证该系统在手势检测精度、任务成功率及用户满意度方面表现良好,证明了方法的可行性。
使用多模态时间序列数据预测甜椒的可收获果实数量
机构 * University of Bonn(波恩大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) ; CSIRO(联邦科学与工业研究组织)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 针对单株甜椒产量预测,提出融合图像特征与计数测量的多模态深度学习框架,利用LSTM网络处理时间依赖性和不规则采样,实验证明该方法能降低RMSE,提供校准不确定性估计,还发布数据集和代码助力相关研究。
跨模态无人机目标跟踪:状态感知表示学习与统一基准
机构 * Anhui University(安徽大学) ; Edinburgh Napier University(爱丁堡龙比亚大学)
专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV
AI总结 针对无人机跨模态目标跟踪中模态切换致外观和位置突变的问题,提出状态感知表示学习方法SARLA,含相关模块及损失函数,建立CM-UOT基准,实验证明其性能优于多种方法,推动了该领域发展。
用人工智能查询多模态科学论文:盲人、低视力和视力正常科学家的实践与偏好
机构 * Paul G. Allen School of Computer Science \& Engineering University of Washington Seattle WA USA ; The Information School University of Washington Allen Institute for AI Seattle WA USA ; Allen Institute for AI Seattle WA USA ; University of Washington ; Allen Institute for AI
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 研究不同视力科学家如何用ChatGPT和Gemini查询多模态科学文档,通过采访了解其审查多模态内容的实践、对AI响应的反馈等,发现相关问题,贡献数据集,讨论对AI科学QA系统的影响。
SpEmoC:一个平衡的说话者片段多模态情感基准
机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔分校) ; Østfold University College(东福尔郡大学学院) ; Trinity College Dublin(都柏林圣三一大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 研究口语对话中人类情感理解,提出SpEmoC基准,整合预训练模型与人工验证标注七种情感模态,采用严格分割保持情感平衡分布,实验证明其能提升模型跨数据集评估时情感性能的稳定性。
基于数据优先本体的显式世界模型:DaoQL多模态存储验证与反事实推理评估
机构 * School of Mathematics and Statistics, Chongqing University(重庆大学数学与统计学院) ; Guangzhou Polytechnic Normal University(广州技术师范大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 研究大型语言模型隐式编码世界模型的风险,提出数据优先本体并构建DaoQL多模态数据库。通过形式化显式世界模型,对比隐式模型优势。实验展示系统性能,如在反事实实验中DaoQL+GPT-4o可组合反事实可分解性大幅提升。
Comments 20 pages, 2 figures. Code: https://github.com/zhanbolee/DaoQL-Edu
BanClickThumb:用于孟加拉语YouTube视频中标题党检测的多模态数据集和Transformer融合基准测试
机构 * Department of Computer Science and Engineering, Bangladesh Army University of Science and Technology(孟加拉国陆军科技大学计算机科学与工程系)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 针对孟加拉语YouTube视频标题党检测,公开多模态数据集BanClickThumb,用其对单模态和多模态方法进行基准测试,提出多模态模型BanClickFusionFormer,结合ViT和XLM - RoBERTa,证明多模态融合有效性,提供基准支持低资源多模态内容分析研究。
学习用于多模态神经影像的稀疏潜在预测基础模型
机构 * New York University, Center for Data Science(纽约大学数据科学中心) ; NYU Grossman School of Medicine, Department of Radiology(纽约大学格罗斯曼医学院放射学系) ; State University of New York at Binghamton, School of Computing(纽约州立大学宾汉姆顿分校计算机学院) ; NYU Grossman School of Medicine, Department of Neurology(纽约大学格罗斯曼医学院神经病学系) ; NYU Grossman School of Medicine, Department of Neurosurgery(纽约大学格罗斯曼医学院神经外科学系) ; NYU Grossman School of Medicine, Department of Pathology(纽约大学格罗斯曼医学院病理学系) ; School of Medicine, Department of Radiology, Stanford(斯坦福大学医学院放射学系) ; NYU Grossman School of Medicine, Department of Neuroscience(纽约大学格罗斯曼医学院神经科学系) ; NYU Grossman School of Medicine, Neuroscience Institute(纽约大学格罗斯曼医学院神经科学研究所)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 提出Neuro-JEPA模型,结合潜在预测目标和专家混合架构,学习T1w、T2w和FLAIR三种MRI序列的统一表示,在25项临床任务和22项公开数据集任务上优于现有基础模型和CNN基线。
Comments Under Review Preprint