MAD: A Multimodal and Multi-perspective Affective Dataset with Hierarchical Annotations
MAD:一个多模态和多视角情感数据集及其层次标注
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)
AI总结 MAD数据集通过多模态和多视角的层次标注,为情绪识别和跨模态情感分析提供了可靠基准,支持单模态和多模态设置下的性能一致性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
MAD:一个多模态和多视角情感数据集及其层次标注
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)
AI总结 MAD数据集通过多模态和多视角的层次标注,为情绪识别和跨模态情感分析提供了可靠基准,支持单模态和多模态设置下的性能一致性。
EarthScape:一种用于地表地质制图和地表分析的多模态数据集
机构 * Kentucky Geological Survey(肯塔基地质调查局) ; University of Kentucky(肯塔基大学) ; Department of Computer Science(计算机科学系)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 EarthScape是一种用于地表地质制图和地表分析的多模态数据集,通过整合多种数据源提供统一的基准测试平台,提升多模态融合和领域适应能力。
MLLMRec-R1: 通过大型语言模型增强多模态序列推荐的推理能力
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 MLLMRec-R1通过离线文本化视觉信号和混合粒度数据增强策略,提升多模态序列推荐中基于GRPO的推理效率与稳定性。
Comments 14 pages, 10figures
VisioMath: 评估LMMs中基于图的数学推理能力的基准测试
机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) ; Beijing Key Laboratory of Artificial Intelligence for Education(北京人工智能教育重点实验室) ; Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(教育部智能技术与教育应用工程研究中心)
专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 VisioMath是一个针对LMMs中基于图表的数学推理能力的基准测试,通过1,800个高质量K-12数学问题评估模型在视觉相似图像间的推理能力,并提出三种提升对齐效果的策略。
Comments Accepted to ICLR 2026
用大语言模型变革科学:一项关于人工智能辅助科学发现、实验、内容生成和评估的综述
机构 * University of Technology Nuremberg (UTN)(图恩大学(UTN)) ; University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) ; TIB Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心) ; Austrian Research Institute for Artificial Intelligence(奥地利人工智能研究所) ; IT:U Interdisciplinary Transformation University Austria(奥地利 interdisciplinary transformation 大学) ; University of Hamburg(汉堡大学) ; University of Manchester(曼彻斯特大学) ; University of Sheffield(谢菲尔德大学) ; University of Aberdeen(阿伯丁大学) ; University of Manitoba(曼尼托巴大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文综述了大语言模型在科学发现、实验、内容生成和评估中的应用,探讨了相关技术、数据集和伦理问题,旨在为AI辅助科学研究提供指导。
Comments 46 pages, 7 figures, 7 tables
EpisTwin:一种基于知识图谱的神经符号架构用于个人AI
机构 * Politecnico di Bari(巴里理工大学) ; Università degli Studi della Tuscia(图斯卡大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 EpisTwin通过构建个人知识图谱,结合多模态语言模型和代理协调器,实现对用户数据的语义理解和复杂推理,提升个人AI的可信度和整体认知能力。
CORE-Seg: 通过强化学习实现复杂病灶的推理驱动分割
机构 * Yuxin Xie 1 ; Yuming Chen 1 ; Yishan Yang 1 ; Yi Zhou 1 ; Tao Zhou 2 ; Zhen Zhao 3 ; Jiacheng Liu 3 ; Huazhu Fu 4
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 CORE-Seg通过强化学习实现复杂病灶分割,提出语义引导的提示适配器和渐进训练策略,取得更高Dice系数和更低失败率
Comments Under Review with Computational Visual Media
Spatial4D-Bench: 一种多功能的4D空间智能基准
机构 * Pan Wang Fundation Model Dept, Huawei(王潘 基础模型部门,华为) ; Yang Liu Noah’s Ark Lab, Huawei(刘阳 神秘 Ark 实验室,华为) ; Guile Wu Noah’s Ark Lab, Huawei(吴古力 神秘 Ark 实验室,华为) ; Eduardo R. Corral-Soto Noah’s Ark Lab, Huawei(埃杜阿多·R·科拉尔-索托 神秘 Ark 实验室,华为) ; Chengjie Huang Noah’s Ark Lab, Huawei(黄成杰 神秘 Ark 实验室,华为) ; Binbin Xu Noah’s Ark Lab, Huawei(徐彬彬 神秘 Ark 实验室,华为) ; Dongfeng Bai Noah’s Ark Lab, Huawei(白东风 神秘 Ark 实验室,华为) ; Xu Yan Fundation Model Dept, Huawei(颜绪 基础模型部门,华为) ; Yuan Ren Noah’s Ark Lab, Huawei(袁仁 神秘 Ark 实验室,华为) ; Xingxin Chen Noah’s Ark Lab, Huawei(陈星心 神秘 Ark 实验室,华为) ; Yizhe Wu Fundation Model Dept, Huawei(吴义哲 基础模型部门,华为) ; Tao Huang Fundation Model Dept, Huawei(黄涛 基础模型部门,华为) ; Wenjun Wan Central Media Technology Institute, Huawei(万文军 中央媒体技术研究院,华为) ; Xin Wu Central Media Technology Institute, Huawei(吴新 中央媒体技术研究院,华为) ; Pei Zhou Central Media Technology Institute, Huawei(周佩 中央媒体技术研究院,华为) ; Xuyang Dai Central Media Technology Institute, Huawei(戴绪阳 中央媒体技术研究院,华为) ; Kangbo Lv Fundation Model Dept, Huawei(吕康博 基础模型部门,华为) ; Hongbo Zhang Fundation Model Dept, Huawei(张宏波 基础模型部门,华为) ; Yosef Fried Fundation Model Dept, Huawei(弗里德·约瑟夫 基础模型部门,华为) ; Aixue Ye Fundation Model Dept, Huawei(叶爱雪 基础模型部门,华为) ; Bailan Feng Fundation Model Dept, Huawei(冯 Bailan 基础模型部门,华为) ; Zhenyu Chen Fundation Model Dept, Huawei(陈振宇 基础模型部门,华为) ; Zhen Li CUHK-Shenzhen(李振 中山大学深圳校区) ; Yingcong Chen HKUST-GZ(陈应聪 香港科技大学-广东) ; Yiyi Liao Zhejiang University(廖亿毅 浙江大学) ; Bingbing Liu Fundation Model Dept, Huawei(刘冰冰 基础模型部门,华为)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 Spatial4D-Bench提出了一种多功能的4D空间智能基准,用于评估多模态大语言模型的4D空间推理能力,并揭示其在路线规划、动作识别等任务中的局限性。
Comments Technical Report
迈向运动图灵测试:评估人形机器人的人性化
机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(福建城市智能感知与计算重点实验室,厦门大学) ; Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Xiamen University(多媒体可信感知与高效计算重点实验室,中华人民共和国教育部,信息学院,厦门大学) ; National Institute for Data Science in Health and Medicine, Xiamen University(医学数据科学国家研究院,厦门大学) ; OPPO Research Institute(OPPO研究院) ; ShanghaiTech University(上海科技大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出运动图灵测试框架,通过HHMotion数据集评估人形机器人动作的人性化程度,并展示基线模型在预测人性化的有效性。
Comments 13 pages, 10 figures, conference
UniVBench:迈向统一评估视频基础模型
机构 * Zhejiang University(浙江大学) ; ByteDance(字节跳动) ; Zhejiang Lab(浙江实验室)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 UniVBench通过统一评估系统和多任务视频任务,首次提供衡量视频基础模型综合能力的框架。
关于可视化同步与远程协作中的挑战
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文探讨了可视化同步与远程协作中的16个挑战,结合XR和AI的发展,提出四类研究方向以指导未来研究。
Comments Proceedings of the 2026 ACM Conference on Human Factors in Computing Systems (CHI)