arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-09 至 2026-03-09 共收录 79 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2603.05697 2026-03-09 cs.CV 83%

MultiHaystack: Benchmarking Multimodal Retrieval and Reasoning over 40K Images, Videos, and Documents

MultiHaystack:用于40,000张图像、视频和文档的多模态检索和推理的基准测试

Dannong Xu, Zhongyu Yang, Jun Chen, Yingfang Yuan, Ming Hu, Lei Sun, Luc Van Gool, Danda Pani Paudel, Chun-Mei Feng

机构 * INSAIT Lanzhou University(兰州大学) King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹科学与技术大学) Heriot-Watt University(赫瑞-沃德大学) Monash University(莫纳什大学) University College Dublin(都柏林大学学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MultiHaystack是首个评估大规模异构多模态检索与推理的基准测试,揭示了MLLMs在异构语料库中检索证据时的性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10828 2026-03-09 cs.RO cs.AI 83%

RAG-Driver: Generalisable Driving Explanations with Retrieval-Augmented In-Context Learning in Multi-Modal Large Language Model

RAG-Driver: 多模态大语言模型中基于检索的可泛化驾驶解释

Jianhao Yuan, Shuyang Sun, Daniel Omeiza, Bo Zhao, Paul Newman, Lars Kunze, Matthew Gadd

机构 * University of Oxford(牛津大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 跨模态检索 :multi-modal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 RAG-Driver通过检索增强的上下文学习,实现高性能、可解释和可泛化的自动驾驶系统。

Comments 14 pages, 6 figures

Journal ref Robotics: Science and Systems (RSS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06503 2026-03-09 cs.CL 79%

Beyond Rows to Reasoning: Agentic Retrieval for Multimodal Spreadsheet Understanding and Editing

超越行到推理:面向多模态电子表格理解与编辑的智能检索

Anmol Gulati, Sahil Sen, Waqar Sarguroh, Kevin Paul

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 BRTR通过迭代工具调用框架实现多模态电子表格的端到端理解与编辑,取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01511 2026-03-09 cs.AI 79%

Multimodal Mixture-of-Experts with Retrieval Augmentation for Protein Active Site Identification

多模态专家混合模型与检索增强用于蛋白质活性位点识别

Jiayang Wu, Jiale Zhou, Rubo Wang, Xingyi Zhang, Xun Lin, Tianxu Lv, Leong Hou U, Yefeng Zheng

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 MERA通过检索增强和可靠性引导的多专家模型,实现了蛋白质活性位点识别的高精度预测和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05641 2026-03-09 cs.RO cs.HC 78%

RFM-HRI : A Multimodal Dataset of Medical Robot Failure, User Reaction and Recovery Preferences for Item Retrieval Tasks

RFM-HRI : 一项医疗机器人故障、用户反应和恢复偏好的多模态数据集用于物品检索任务

Yashika Batra, Giuliano Pioldi, Promise Ekpo, Arman Sayatqyzy, Purnjay Maruur, Shalom Otieno, Kevin Ching, Angelique Taylor

机构 * Cornell University, Cornell Tech(康奈尔大学,康奈尔科技)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 RFM-HRI数据集通过多模态数据研究医疗机器人故障下的用户反应与恢复偏好,揭示故障对情感和控制的影响,并为安全关键场景的故障恢复提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02123 2026-03-09 cs.CL 72%

CMRAG: Co-modality-based visual document retrieval and question answering

CMRAG:基于共模的视觉文档检索与问答

Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司) The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学)

专题命中 跨模态检索 :multimodal(abstract,comments);cross-modal(abstract);分类 cs.CL

AI总结 CMRAG通过统一编码模型和共模信息检索方法,提升多模态视觉文档问答系统的性能。

Comments Published at ICLR 2026 Workshop on Multimodal Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 13 篇

2603.06508 2026-03-09 cs.LG 82%

When One Modality Rules Them All: Backdoor Modality Collapse in Multimodal Diffusion Models

当一种模态统治一切:多模态扩散模型中的后门模态崩溃

Qitong Wang, Haoran Dai, Haotian Zhang, Christopher Rasmussen, Binghui Wang

机构 * University of Delaware(德克萨斯大学) Illinois Institute of Technology(伊利诺伊理工学院) Columbia University(哥伦比亚大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文研究了多模态扩散模型中后门攻击的模态崩溃现象,发现攻击常依赖单一模态,跨模态交互反而降低攻击效果,揭示了现有评估的盲点。

Comments Accepted to the ICLR 2026 Workshop on Principled Design for Trustworthy AI. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06544 2026-03-09 cs.CV 79%

Modeling and Measuring Redundancy in Multisource Multimodal Data for Autonomous Driving

多源多模态数据中冗余建模与测量用于自动驾驶

Yuhan Zhou, Mehri Sattari, Haihua Chen, Kewei Sha

机构 * Dept. of Information Science University of North Texas Denton, Texas, USA(信息科学系 诺克斯维尔大学 德顿, 德克萨斯州, 美国) Dept. of Data Science University of North Texas Denton, Texas, USA(数据科学系 诺克斯维尔大学 德顿, 德克萨斯州, 美国)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究了自动驾驶中多源多模态数据的冗余问题,通过实验展示了删除冗余标签对目标检测性能的提升作用,并揭示了数据质量与性能之间的直接联系。

Comments This paper has been accepted by the Fourth IEEE International Conference on Mobility: Operations, Services, and Technologies (MOST) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06507 2026-03-09 cs.CV 79%

Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis

自监督流匹配用于可扩展的多模态合成

Hila Chefer, Patrick Esser, Dominik Lorenz, Dustin Podell, Vikash Raja, Vinh Tong, Antonio Torralba, Robin Rombach

机构 * Black Forest Labs(黑森林实验室) MIT(麻省理工学院)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 Self-Flow通过自监督流匹配方法,在无需外部监督的情况下提升多模态生成的性能和扩展性。

Comments project webpage: https://bfl.ai/research/self-flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06147 2026-03-09 cs.CV 79%

Longitudinal NSCLC Treatment Progression via Multimodal Generative Models

多模态生成模型用于非小细胞肺癌治疗进展的纵向预测

Massimiliano Mantegna, Elena Mulero Ayllón, Alice Natalina Caragliano, Francesco Di Feola, Claudia Tacconi, Michele Fiore, Edy Ippolito, Carlo Greco, Sara Ramella, Philippe C. Cattin, Paolo Soda, Matteo Tortora, Valerio Guarrasi

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma, Italy(人工智能与计算机系统单位,工程系,罗马大学生物医学学院) Multi-Specialist Clinical Institute for Orthopaedic Trauma Care (COT), Messina, Italy(骨科创伤护理多学科临床研究所(COT),意大利Messina) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University, Sweden(诊断与介入系,放射物理,生物医学工程,乌梅大学,瑞典) Operative Research Unit of Radiation Oncology, Fondazione Policlinico Universitario Campus Bio-Medico, Rome, Italy(放射肿瘤手术研究单位,大学生物医学学院基金会,罗马,意大利) Research Unit of Radiation Oncology, Department of Medicine and Surgery, Università Campus Bio-Medico di Roma, Italy(放射肿瘤研究单位,医学与外科系,罗马大学生物医学学院,意大利) Department of Biomedical Engineering, University of Basel, Allschwil, Switzerland(生物医学工程系,巴塞尔大学,瑞士Allschwil) Department of Naval, Electrical, Electronics and Telecommunications Engineering, University of Genoa, Italy(海军、电气、电子与电信工程系,热那亚大学,意大利)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出虚拟治疗框架,利用多模态生成模型预测NSCLC治疗进展,验证扩散模型在生成稳定肿瘤演变轨迹方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06043 2026-03-09 cs.CV 79%

Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models

通过理解学习生成:基于理解的内在奖励用于统一多模态模型

Jiadong Pan, Liang Li, Yuxin Peng, Yu-Ming Tang, Shuohuan Wang, Yu Sun, Hua Wu, Qingming Huang, Haifeng Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GvU机制,通过内在奖励提升统一多模态模型的生成能力,同时增强其视觉理解能力,缩小理解与生成之间的能力差距。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05800 2026-03-09 cs.DC cs.AI 79%

StreamWise: Serving Multi-Modal Generation in Real-Time at Scale

StreamWise: 实时大规模多模态生成服务

Haoran Qiu, Gohar Irfan Chaudhry, Chaojie Zhang, Íñigo Goiri, Esha Choukse, Rodrigo Fonseca, Ricardo Bianchini

机构 * Microsoft Azure Research(微软Azure研究院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

AI总结 StreamWise通过实时播客视频生成,整合LLM、文本转语音和视频音频生成,实现高效多模态实时服务,兼顾延迟、成本和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06057 2026-03-09 cs.CV cs.AI cs.LG cs.SD 62%

TempoSyncDiff: Distilled Temporally-Consistent Diffusion for Low-Latency Audio-Driven Talking Head Generation

TempoSyncDiff: 压缩时间一致扩散用于低延迟音频驱动说话头生成

Soumya Mazumdar, Vineet Kumar Rakesh

机构 * Computer and Informatics Group, Variable Energy Cyclotron Centre(计算机与信息组,变能循环中心)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 TempoSyncDiff通过压缩扩散模型实现低延迟音频驱动说话头生成,结合教师-学生压缩和时间正则化以提高生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13687 2026-03-09 cs.CV 57%

Towards Scalable Pre-training of Visual Tokenizers for Generation

面向生成任务的视觉分词器可扩展预训练

Jingfeng Yao, Yuda Song, Yucong Zhou, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) MiniMax

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 VTP通过联合优化图像-文本对比、自监督和重建损失,提升视觉分词器的生成性能和扩展性。

Comments Our pre-trained models are available at https://github.com/MiniMax-AI/VTP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06038 2026-03-09 cs.CV cs.GR 57%

FontUse: A Data-Centric Approach to Style- and Use-Case-Conditioned In-Image Typography

FontUse: 一种以数据为中心的方法用于风格和使用场景条件下的图像内字体设计

Xia Xin, Yuki Endo, Yoshihiro Kanamori

机构 * University of Tsukuba(茨口大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 FontUse提出了一种以数据为中心的方法,通过构建大规模字体数据集并结合多模态模型,提升文本生成中字体风格和使用场景的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06032 2026-03-09 cs.CV 57%

StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision

StruVis: 通过结构化视觉进行推理的文本到图像生成增强

Yuanhuiyi Lyu, Kaiyu Lei, Ziqiao Weng, Xu Zheng, Lutao Jiang, Teng Li, Yangfu Li, Ziyuan Huang, Linfeng Zhang, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) East China Normal University(华东师范大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 StruVis通过结构化视觉引导推理,提升基于推理的文本到图像生成性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06014 2026-03-09 cs.CV 57%

EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation

EffectMaker:统一推理与生成以实现定制化视觉效果创建

Shiyuan Yang, Ruihuang Li, Jiale Tao, Shuai Shao, Qinglin Lu, Jing Liao

机构 * Tencent Hunyuan(腾讯文言) City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 EffectMaker通过统一推理生成框架实现定制化视觉效果创建,利用多模态模型和扩散变换器提升效果质量和一致性,构建大规模数据集增强泛化能力。

Comments Project page: https://effectmaker.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05769 2026-03-09 cs.CV 57%

Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers

逐层实例绑定用于文本到图像扩散变换器中的区域和遮挡控制

Ruidong Chen, Yancheng Bai, Xuanpu Zhang, Jianhao Zeng, Lanjun Wang, Dan Song, Lei Sun, Xiangxiang Chu, Anan Liu

机构 * Tianjin University(天津大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LayerBind通过逐层实例绑定实现文本到图像扩散变换器中的区域和遮挡控制,无需训练即可提升生成质量和遮挡管理能力。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05518 2026-03-09 cs.HC cs.CV 57%

CoEditor++: Instruction-based Visual Editing via Cognitive Reasoning

CoEditor++:基于指令的视觉编辑 via 认知推理

Minheng Ni, Yutao Fan, Zhengyuan Yang, Yeli Shen, Yuxiang Wei, Yaowen Zhang, Lijuan Wang, Lei Zhang, Wangmeng Zuo

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft(微软公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 CoEditor++通过认知推理实现基于指令的视觉编辑,无需训练即可在通用和负责任的编辑任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 11 篇

2603.06206 2026-03-09 eess.SP 82%

MAD: A Multimodal and Multi-perspective Affective Dataset with Hierarchical Annotations

MAD:一个多模态和多视角情感数据集及其层次标注

Shengwei Guo, Yunqing Qiao, Wenzhan Zhang, Bo Liu, Yong Wang, Guobing Sun

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 MAD数据集通过多模态和多视角的层次标注,为情绪识别和跨模态情感分析提供了可靠基准,支持单模态和多模态设置下的性能一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15625 2026-03-09 cs.CV 79%

EarthScape: A Multimodal Dataset for Surficial Geologic Mapping and Earth Surface Analysis

EarthScape:一种用于地表地质制图和地表分析的多模态数据集

Matthew Massey, Nusrat Munia, Abdullah-Al-Zubaer Imran

机构 * Kentucky Geological Survey(肯塔基地质调查局) University of Kentucky(肯塔基大学) Department of Computer Science(计算机科学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 EarthScape是一种用于地表地质制图和地表分析的多模态数据集,通过整合多种数据源提供统一的基准测试平台,提升多模态融合和领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06243 2026-03-09 cs.IR 78%

MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation

MLLMRec-R1: 通过大型语言模型增强多模态序列推荐的推理能力

Yu Wang, Yonghui Yang, Le Wu, Jiancan Wu, Hefei Xu, Hui Lin

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 MLLMRec-R1通过离线文本化视觉信号和混合粒度数据增强策略,提升多模态序列推荐中基于GRPO的推理效率与稳定性。

Comments 14 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06727 2026-03-09 cs.AI cs.CV 73%

VisioMath: Benchmarking Figure-based Mathematical Reasoning in LMMs

VisioMath: 评估LMMs中基于图的数学推理能力的基准测试

Can Li, Ying Liu, Ting Zhang, Mei Wang, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education(北京人工智能教育重点实验室) Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(教育部智能技术与教育应用工程研究中心)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 VisioMath是一个针对LMMs中基于图表的数学推理能力的基准测试,通过1,800个高质量K-12数学问题评估模型在视觉相似图像间的推理能力,并提出三种提升对齐效果的策略。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05151 2026-03-09 cs.CL cs.AI cs.CV cs.LG 67%

Transforming Science with Large Language Models: A Survey on AI-assisted Scientific Discovery, Experimentation, Content Generation, and Evaluation

用大语言模型变革科学:一项关于人工智能辅助科学发现、实验、内容生成和评估的综述

Steffen Eger, Yong Cao, Jennifer D'Souza, Andreas Geiger, Christian Greisinger, Stephanie Gross, Yufang Hou, Brigitte Krenn, Anne Lauscher, Yizhi Li, Chenghua Lin, Nafise Sadat Moosavi, Wei Zhao, Tristan Miller

机构 * University of Technology Nuremberg (UTN)(图恩大学(UTN)) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) TIB Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心) Austrian Research Institute for Artificial Intelligence(奥地利人工智能研究所) IT:U Interdisciplinary Transformation University Austria(奥地利 interdisciplinary transformation 大学) University of Hamburg(汉堡大学) University of Manchester(曼彻斯特大学) University of Sheffield(谢菲尔德大学) University of Aberdeen(阿伯丁大学) University of Manitoba(曼尼托巴大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文综述了大语言模型在科学发现、实验、内容生成和评估中的应用,探讨了相关技术、数据集和伦理问题,旨在为AI辅助科学研究提供指导。

Comments 46 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06290 2026-03-09 cs.AI cs.CL 62%

The EpisTwin: A Knowledge Graph-Grounded Neuro-Symbolic Architecture for Personal AI

EpisTwin:一种基于知识图谱的神经符号架构用于个人AI

Giovanni Servedio, Potito Aghilar, Alessio Mattiace, Gianni Carmosino, Francesco Musicco, Gabriele Conte, Vito Walter Anelli, Tommaso Di Noia, Francesco Maria Donini

机构 * Politecnico di Bari(巴里理工大学) Università degli Studi della Tuscia(图斯卡大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 EpisTwin通过构建个人知识图谱,结合多模态语言模型和代理协调器,实现对用户数据的语义理解和复杂推理,提升个人AI的可信度和整体认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05911 2026-03-09 cs.CV cs.AI 62%

CORE-Seg: Reasoning-Driven Segmentation for Complex Lesions via Reinforcement Learning

CORE-Seg: 通过强化学习实现复杂病灶的推理驱动分割

Yuxin Xie, Yuming Chen, Yishan Yang, Yi Zhou, Tao Zhou, Zhen Zhao, Jiacheng Liu, Huazhu Fu

机构 * Yuxin Xie 1 Yuming Chen 1 Yishan Yang 1 Yi Zhou 1 Tao Zhou 2 Zhen Zhao 3 Jiacheng Liu 3 Huazhu Fu 4

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CORE-Seg通过强化学习实现复杂病灶分割,提出语义引导的提示适配器和渐进训练策略,取得更高Dice系数和更低失败率

Comments Under Review with Computational Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00092 2026-03-09 cs.CV 57%

Spatial4D-Bench: A Versatile 4D Spatial Intelligence Benchmark

Spatial4D-Bench: 一种多功能的4D空间智能基准

Pan Wang, Yang Liu, Guile Wu, Eduardo R. Corral-Soto, Chengjie Huang, Binbin Xu, Dongfeng Bai, Xu Yan, Yuan Ren, Xingxin Chen, Yizhe Wu, Tao Huang, Wenjun Wan, Xin Wu, Pei Zhou, Xuyang Dai, Kangbo Lv, Hongbo Zhang, Yosef Fried, Aixue Ye, Bailan Feng, Zhenyu Chen, Zhen Li, Yingcong Chen, Yiyi Liao, Bingbing Liu

机构 * Pan Wang Fundation Model Dept, Huawei(王潘 基础模型部门,华为) Yang Liu Noah’s Ark Lab, Huawei(刘阳 神秘 Ark 实验室,华为) Guile Wu Noah’s Ark Lab, Huawei(吴古力 神秘 Ark 实验室,华为) Eduardo R. Corral-Soto Noah’s Ark Lab, Huawei(埃杜阿多·R·科拉尔-索托 神秘 Ark 实验室,华为) Chengjie Huang Noah’s Ark Lab, Huawei(黄成杰 神秘 Ark 实验室,华为) Binbin Xu Noah’s Ark Lab, Huawei(徐彬彬 神秘 Ark 实验室,华为) Dongfeng Bai Noah’s Ark Lab, Huawei(白东风 神秘 Ark 实验室,华为) Xu Yan Fundation Model Dept, Huawei(颜绪 基础模型部门,华为) Yuan Ren Noah’s Ark Lab, Huawei(袁仁 神秘 Ark 实验室,华为) Xingxin Chen Noah’s Ark Lab, Huawei(陈星心 神秘 Ark 实验室,华为) Yizhe Wu Fundation Model Dept, Huawei(吴义哲 基础模型部门,华为) Tao Huang Fundation Model Dept, Huawei(黄涛 基础模型部门,华为) Wenjun Wan Central Media Technology Institute, Huawei(万文军 中央媒体技术研究院,华为) Xin Wu Central Media Technology Institute, Huawei(吴新 中央媒体技术研究院,华为) Pei Zhou Central Media Technology Institute, Huawei(周佩 中央媒体技术研究院,华为) Xuyang Dai Central Media Technology Institute, Huawei(戴绪阳 中央媒体技术研究院,华为) Kangbo Lv Fundation Model Dept, Huawei(吕康博 基础模型部门,华为) Hongbo Zhang Fundation Model Dept, Huawei(张宏波 基础模型部门,华为) Yosef Fried Fundation Model Dept, Huawei(弗里德·约瑟夫 基础模型部门,华为) Aixue Ye Fundation Model Dept, Huawei(叶爱雪 基础模型部门,华为) Bailan Feng Fundation Model Dept, Huawei(冯 Bailan 基础模型部门,华为) Zhenyu Chen Fundation Model Dept, Huawei(陈振宇 基础模型部门,华为) Zhen Li CUHK-Shenzhen(李振 中山大学深圳校区) Yingcong Chen HKUST-GZ(陈应聪 香港科技大学-广东) Yiyi Liao Zhejiang University(廖亿毅 浙江大学) Bingbing Liu Fundation Model Dept, Huawei(刘冰冰 基础模型部门,华为)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 Spatial4D-Bench提出了一种多功能的4D空间智能基准,用于评估多模态大语言模型的4D空间推理能力,并揭示其在路线规划、动作识别等任务中的局限性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06181 2026-03-09 cs.CV 57%

Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots

迈向运动图灵测试:评估人形机器人的人性化

Mingzhe Li, Mengyin Liu, Zekai Wu, Xincheng Lin, Junsheng Zhang, Ming Yan, Zengye Xie, Changwang Zhang, Chenglu Wen, Lan Xu, Siqi Shen, Cheng Wang

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(福建城市智能感知与计算重点实验室,厦门大学) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Xiamen University(多媒体可信感知与高效计算重点实验室,中华人民共和国教育部,信息学院,厦门大学) National Institute for Data Science in Health and Medicine, Xiamen University(医学数据科学国家研究院,厦门大学) OPPO Research Institute(OPPO研究院) ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出运动图灵测试框架,通过HHMotion数据集评估人形机器人动作的人性化程度,并展示基线模型在预测人性化的有效性。

Comments 13 pages, 10 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21835 2026-03-09 cs.CV 57%

UniVBench: Towards Unified Evaluation for Video Foundation Models

UniVBench:迈向统一评估视频基础模型

Jianhui Wei, Xiaotian Zhang, Yichen Li, Yuan Wang, Yan Zhang, Ziyi Chen, Zhihang Tang, Wei Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动) Zhejiang Lab(浙江实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 UniVBench通过统一评估系统和多任务视频任务,首次提供衡量视频基础模型综合能力的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05871 2026-03-09 cs.HC 50%

Challenges in Synchronous & Remote Collaboration Around Visualization

关于可视化同步与远程协作中的挑战

Matthew Brehmer, Maxime Cordeil, Christophe Hurter, Takayuki Itoh, Wolfgang Büschel, Mahmood Jasim, Arnaud Prouzeau, David Saffo, Lyn Bartram, Sheelagh Carpendale, Chen Zhu-Tian, Andrew Cunningham, Tim Dwyer, Samuel Huron, Masahiko Itoh, Alark Joshi, Kiyoshi Kiyokawa, Hideaki Kuzuoka, Bongshin Lee, Gabriela Molina León, Harald Reiterer, Bektur Ryskeldiev, Jonathan Schwabish, Brian A. Smith, Yasuyuki Sumi, Ryo Suzuki, Anthony Tang, Yalong Yang, Jian Zhao

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文探讨了可视化同步与远程协作中的16个挑战,结合XR和AI的发展,提出四类研究方向以指导未来研究。

Comments Proceedings of the 2026 ACM Conference on Human Factors in Computing Systems (CHI)

详情

展开后加载摘要…

URL PDF HTML 收藏