arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-05 至 2026-05-05 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 7 篇

2605.00963 2026-05-05 cs.RO cs.AI 79%

Ablation Study of Multimodal Perception, Language Grounding, and Control for Human-Robot Interaction in an Object Detection and Grasping Task

多模态感知、语言接地与控制在物体检测与抓取任务中的人机交互消融研究

Zi Tian, Guanting Shen

机构 * Dalian University of Technology(大连理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文通过消融研究探讨多模态感知、语言接地和控制模块对端到端性能的影响,评估最佳组合以优化执行时间和成功率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00891 2026-05-05 cs.CV cs.AI 79%

X2SAM: Any Segmentation in Images and Videos

X2SAM:图像和视频中的任意分割

Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

机构 * Sun Yat-Sen University(中山大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 X2SAM是一种统一的分割多模态大语言模型,能够将图像分割能力扩展到视频,结合LLM和Mask Memory模块,支持通用、开放词汇、指称、推理、基于视觉的对话生成及交互式分割。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01506 2026-05-05 cs.CV 77%

OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder

OmniEncoder: 通过一个编码器实现如同人类般连续的视觉、听觉与触觉感知

Detao Bai, Shimin Yao, Weixuan Chen, Chengen Lai, Yuanming Li, Zhiheng Ma, Xihan Wei

机构 * Tongyi Lab Alibaba Group(阿里巴巴集团通义实验室) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 视频多模态 :cross-modal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV

AI总结 OmniEncoder通过统一的Transformer架构,在共享潜在空间中对视觉和音频信号以25fps对称嵌入,解决多模态解耦与计算效率问题,提升连续视觉理解任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00871 2026-05-05 eess.SP cs.AI cs.CV cs.LG 62%

NAKUL-Med: Spectral-Graph State Space Models with Dynamics Kernels for Medical Signals

NAKUL-Med: 带动态核的谱-图状态空间模型用于医学信号

Badri N. Patro, Vijay S. Agneeswaran

机构 * Microsoft(微软)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 NAKUL-Med通过动态核生成、谱上下文建模和图引导的空间注意力,提升多通道生理信号分析的性能,实现高准确率和高效推理。

Comments Accepted CVPR Finding Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00826 2026-05-05 cs.IR cs.CV cs.LG cs.MM 62%

Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis

理解文本到视频检索中的性能平台:全面的实证和语言分析

Maria-Eirini Pegia, Dimitrios Stefanopoulos, Björn Þór Jónsson, Anastasia Moumtzidou, Ilias Gialampoukidis, Stefanos Vrochidis, Ioannis Kompatsiaris

机构 * Information Technologies Institute(信息科技研究所) CERTH-ITI School of Computer Science(计算机科学学院) Reykjavík University(雷克雅未克大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文通过实证和语言分析,探讨文本到视频检索中模型性能瓶颈,揭示caption特性与模型表现的关系,指出简单清晰的caption提升召回率,而复杂事件仍具挑战性。

Comments Survey, 50 pages, 15 figures, 13 tables, 154 citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01498 2026-05-05 cs.CV 57%

Towards Visual Query Localization in the 3D World

面向3D世界的视觉查询定位

Liang Peng, Bohan Tan, Zhipeng Zhang, Haobo Li, Yifan Jiao, Xingping Dong, Libo Zhang

机构 * Wuhan University(武汉大学) AutoLab, SAI, Shanghai Jiao Tong University(AutoLab、SAI、上海交通大学) Anyverse Dynamics University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文首次提出3D多模态视觉查询定位基准3DVQL,包含2002个序列和17万帧数据,通过点云、RGB图像和深度图像多模态数据提升研究灵活性,并提出LaF算法提升性能。

Comments Accepted to CVPR 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01427 2026-05-05 cs.RO 50%

SixthSense: Task-Agnostic Proprioception-Only Whole-Body Wrench Estimation for Humanoids

SixthSense:面向人类oid的无任务依赖的本体感知-only全身 wrench 估计

Xingzhou Chen, Xiayan Xu, Yan Ning, Jiyu Yu, Yizheng Zhang, Siyi Qian, Lingzhu Xiang, Jiahao Chen, Yuquan Wang, Haodong Zhang, Ling Shi

机构 * The Hong Kong University of Science and Technology(香港理工大学) Zhejiang University(浙江大学) Tencent Robotics X(腾讯机器人实验室)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出SixthSense,一种基于本体感知和IMU数据的无任务依赖方法,用于估计人类oid的全身接触时间和位置及外部wrench,解决浮动物理动力学和不确定接触位置的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏