arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4721 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4721 篇

2601.21915 2026-02-03 cs.CV 79%

VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models

VideoAesBench: 大规模多模态模型视频审美感知能力评估基准

Yunhao Li, Sijing Wu, Zhilin Gao, Zicheng Zhang, Qi Jia, Huiyu Duan, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 VideoAesBench通过多样化视频内容和多类型问题评估大规模多模态模型的视频审美感知能力,揭示当前模型在该领域的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22039 2026-01-30 cs.CV 79%

Understanding Multimodal Complementarity for Single-Frame Action Anticipation

理解单帧动作预测中的多模态互补性

Manuel Benavent-Lledo, Konstantinos Bacharidis, Konstantinos Papoutsakis, Antonis Argyros, Jose Garcia-Rodriguez

机构 * Department of Computer Technology, University of Alicante(阿尔瓦雷斯大学计算机技术系) Institute of Computer Science, FORTH(福蒂研究所) Computer Science Department, University of Crete(克里特大学计算机科学系) Department of Management, Science and Technology, Hellenic Mediterranean University(希腊地中海大学管理、科学与技术系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究通过单帧动作预测框架AAG+,探索多模态互补性对动作预测的影响,验证单帧信息在动作预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17123 2026-01-27 cs.HC cs.CV cs.RO 79%

Acoustic Field Video for Multimodal Scene Understanding

用于多模态场景理解的声学场视频

Daehwa Kim, Chris Harrison

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出声学场视频作为多模态场景理解的新输入方式,通过整合空间声学数据显著提升视觉-语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19529 2026-01-21 cs.CV 79%

Vidi2.5: Large Multimodal Models for Video Understanding and Creation

Vidi2.5:大型多模态模型用于视频理解和创作

Vidi Team, Chia-Wen Kuo, Chuang Huang, Dawei Du, Fan Chen, Fanding Lei, Feng Gao, Guang Chen, Haoji Zhang, Haojun Zhao, Jin Liu, Jingjing Zhuge, Lili Fang, Lingxi Zhang, Longyin Wen, Lu Guo, Lu Xu, Lusha Li, Qihang Fan, Rachel Deng, Shaobo Fang, Shu Zhang, Sijie Zhu, Stuart Siew, Weiyan Tao, Wen Zhong, Xiaohui Shen, Xin Gu, Ye Yuan, Yicheng He, Yiming Cui, Zhenfang Chen, Zhihua Wu, Zuhua Lin

机构 * ByteDance Inc.(字节跳动公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12330 2026-01-21 cs.LG cs.AI 79%

IceWatch: Forecasting Glacial Lake Outburst Floods (GLOFs) using Multimodal Deep Learning

IceWatch: 使用多模态深度学习预测冰湖溃决洪水(GLOFs)

Zuha Fatima, Muhammad Anser Sohaib, Muhammad Talha, Ayesha Kanwal, Sidra Sultana, Nazia Perwaiz

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 IceWatch通过多模态深度学习结合空间和时间视角,实现对冰湖溃决洪水的高效预测,提升预警系统的可靠性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11990 2026-01-21 cs.CV 79%

DAOS: A Multimodal In-cabin Behavior Monitoring with Driver Action-Object Synergy Dataset

DAOS: 一种基于驾驶员行为与物体协同的多模态舱内行为监测数据集

Yiming Li, Chen Cai, Tianyi Liu, Dan Lin, Wenqian Wang, Wenfei Liang, Bingbing Li, Kim-Hui Yap

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) College of Computer Science and Technology, Harbin Engineering University(哈尔滨工程大学计算机科学与技术学院) Singapore University of Technology and Design (SUTD), Singapore(新加坡科技设计大学) Continental Automotive Singapore Pte. Ltd.

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 DAOS数据集通过多模态数据和动作-物体关系网络提升驾驶员行为识别的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02064 2026-01-16 cs.CV 79%

RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video

RTV-Bench: 通过实时视频对多模态大语言模型的连续感知、理解和推理进行基准测试

Shuhang Xun, Sicheng Tao, Jungang Li, Yibo Shi, Zhixin Lin, Zhanhui Zhu, Yibo Yan, Hanqian Li, Linghao Zhang, Shikang Wang, Yixin Liu, Hanbo Zhang, Ying Ma, Xuming Hu

机构 * HIT(哈尔滨工业大学) HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) XJTU(西安交通大学) SDU(山东大学) CityU(城市大学) HUST(华中科技大学)

专题命中 视频多模态 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 RTV-Bench通过实时视频对多模态大语言模型的连续感知、理解和推理能力进行细粒度基准测试,揭示了实时模型在长时段视频处理中的性能优势与局限。

Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track;

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08408 2026-01-14 cs.CV cs.RO 79%

Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2

边缘优化的多模态学习用于无人机视频理解 via BLIP-2

Yizhan Feng, Hichem Snoussi, Jing Teng, Jian Liu, Yuyang Wang, Abel Cherouat, Tian Wang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于BLIP-2的轻量级多模态学习平台,通过集成YOLO模型实现无人机视频理解的高效处理与多任务适应。

Comments The Tenth International Conference on Data Mining and Big Data (DMBD'2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08240 2026-01-14 eess.IV cs.CV 79%

Temporal-Enhanced Interpretable Multi-Modal Prognosis and Risk Stratification Framework for Diabetic Retinopathy (TIMM-ProRS)

时间增强的可解释多模态预后和风险分层框架用于糖尿病视网膜病变(TIMM-ProRS)

Susmita Kar, A S M Ahsanul Sarkar Akib, Abdul Hasib, Samin Yaser, Anas Bin Azim

机构 * Department of Robotics, Robo Tech Valley, Dhaka, Bangladesh(机器人系,罗布科技谷,达卡,孟加拉国)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 TIMM-ProRS通过融合视网膜图像和时间生物标志物,实现糖尿病视网膜病变的多模态和时间动态分析,达到97.8%的准确率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22393 2026-01-13 cs.CV cs.LG 79%

Gems: Group Emotion Profiling Through Multimodal Situational Understanding

GEMS: 通过多模态情境理解进行群体情绪分析

Anubhav Kataria, Surbhi Madan, Shreya Ghosh, Tom Gedeon, Abhinav Dhall

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 GEMS通过多模态情境理解实现群体情绪分析,预测个体、群体和事件层面的情绪,提供更细粒度和整体的分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04709 2026-01-09 cs.AI 79%

Bridging Temporal and Textual Modalities: A Multimodal Framework for Automated Cloud Failure Root Cause Analysis

弥合时序与文本模态:一种多模态框架用于自动化云故障根本原因分析

Gijun Park

机构 * Okestro

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态框架,通过融合时间序列与文本数据,提升云故障根本原因分析的自动化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00123 2026-01-09 cs.CV 79%

A Spatially Masked Adaptive Gated Network for multimodal post-flood water extent mapping using SAR and incomplete multispectral data

一种空间掩码自适应门控网络用于利用SAR和不完整多光谱数据的多模态洪水后水 extent 映射

Hyunho Lee, Wenwen Li

机构 * School of Geographical Sciences and Urban Planning, Arizona State University(地理科学与城市规划学院,亚利桑那州立大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SMAGNet,一种多模态深度学习模型,通过融合SAR和不完整多光谱数据,提升洪水后水 extent 映射的准确性和鲁棒性。

Comments 50 pages, 12 figures, 6 tables

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing, 232, 492-508, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02968 2026-01-07 cs.AI 79%

Rationale-Grounded In-Context Learning for Time Series Reasoning with Multimodal Large Language Models

基于理由的上下文学习用于多模态大语言模型的时间序列推理

Qingxiang Liu, Zhiqing Cui, Xiaoliang Luo, Yuqian Wu, Zhuoyang Jiang, Huaiyu Wan, Sheng Sun, Lvchun Wang, Wei Yu, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) China Mobile (Jiangxi) Virtual Reality Technology Co., Ltd.(中国移动(江西)虚拟现实技术有限公司) School of Computer and Information Technology, Beijing Jiaotong University(北京交通大学计算机与信息学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出RationaleTS方法,通过基于理由的上下文学习提升多模态大语言模型在时间序列推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19542 2026-01-07 cs.CV 79%

CVBench: Benchmarking Cross-Video Synergies for Complex Multimodal Reasoning

CVBench: 多视频协同推理的基准测试

Nannan Zhu, Yonghao Dong, Teng Wang, Xueqian Li, Shengjun Deng, Yijia Wang, Zheng Hong, Tiantian Geng, Guo Niu, Hanyan Huang, Xiongfei Yao, Shuaiwei Jiao

机构 * Sun Yat-sen University(中山大学) University of Hong Kong(香港大学) Foshan University(佛山大学) University of Birmingham(伯明翰大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 CVBench通过跨视频关系推理基准测试,揭示多模态大语言模型在跨视频时空推理中的性能差距及架构瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12595 2026-01-06 cs.CV 79%

Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation

增强视觉能力的大型语言模型用于高分辨率图像合成和多模态数据解释

Karthikeya KV

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出了一种增强视觉能力的大型语言模型,通过整合修正流机制和混合序列建模方法,实现高分辨率图像合成和多模态数据解释的高效生成与高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22979 2026-01-05 cs.CV 79%

PoseStreamer: A Multi-modal Framework for 3D Tracking of Unseen Moving Objects

PoseStreamer: 一种多模态框架用于未见移动物体的3D跟踪

Huiming Yang, Linglin Liao, Fei Ding, Sibo Wang, Zijian Zeng

机构 * School of Mathematics, Renmin University of China(中国人民大学数学学院)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 PoseStreamer是一种多模态框架,通过结合自适应姿态内存队列、以对象为中心的2D跟踪器和射线姿态滤波器,实现高速移动物体的高精度3D跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20501 2025-12-24 cs.CV 79%

Bridging Modalities and Transferring Knowledge: Enhanced Multimodal Understanding and Recognition

弥合模态与知识转移:增强多模态理解和识别

Gorjan Radevski

机构 * University of Bristol(布里斯托大学) University of Würzburg(乌尔姆大学) Processing Speech and Images (PSI)(语音与图像处理组)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态对齐、翻译、融合和转移方法,提升复杂输入的理解与识别能力,涵盖空间语言、医学文本、知识图谱和动作识别等多个领域。

Comments Ph.D. manuscript; Supervisors/Mentors: Marie-Francine Moens and Tinne Tuytelaars

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13385 2025-12-23 cs.CV 79%

SNN-Driven Multimodal Human Action Recognition via Sparse Spatial-Temporal Data Fusion

基于稀疏时空数据融合的SNN驱动多模态人体动作识别

Naichuan Zheng, Hailun Xia, Zeyu Liang, Yuchen Du

机构 * School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(信息与通信工程学院,北京邮电大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于SNN的多模态人体动作识别框架,通过稀疏时空数据融合提升识别准确率和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10200 2025-12-23 cs.CV 79%

LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents

LVAgent: 通过多轮动态协作的MLLM代理实现长视频理解

Boyu Chen, Zhengrong Yue, Siran Chen, Zikang Wang, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :MLLM(title,abstract);分类 cs.CV

AI总结 LVAgent通过多轮动态协作的MLLM代理提升长视频理解性能,实现80%的准确率并在LongVideoBench上提升13.3%

Comments accepted in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16023 2025-12-19 cs.CV 79%

CoVAR: Co-generation of Video and Action for Robotic Manipulation via Multi-Modal Diffusion

CoVAR: 通过多模态扩散生成视频与动作用于机器人操作

Liudi Yang, Yang Bai, George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Ziyuan Liu, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心)

专题命中 视频多模态 :multi-modal(title);cross-modal(abstract);分类 cs.CV

AI总结 CoVAR通过多模态扩散模型生成视频与动作,解决机器人操作中动作标注不足的问题,提升视频生成质量与动作精度。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18951 2025-12-19 cs.CV 79%

Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition

感知、对话,然后适应:面向开放世界视频识别的多模态基础模型知识迁移

Boyu Chen, Siran Chen, Kunchang Li, Qinglin Xu, Yu Qiao, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PCA框架,通过感知、对话和适应三个阶段,利用多模态知识提升开放世界视频识别的性能。

Comments 35 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10021 2025-12-17 cs.LG cs.AI 79%

Online Multi-modal Root Cause Identification in Microservice Systems

微服务系统中的在线多模态根本原因识别

Lecheng Zheng, Zhengzhang Chen, Haifeng Chen

机构 * University of Illinois Urbana-Champagin(伊利诺伊大学厄巴纳-香槟分校) NEC Labs America(NEC美洲实验室)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出OCEAN方法,通过多模态因果结构学习实现微服务系统中的在线根本原因识别,结合扩张卷积神经网络和图神经网络,提升因果图学习的准确性与效率。

Comments Accepted by BigData 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13604 2025-12-16 cs.CV 79%

LongVie 2: Multimodal Controllable Ultra-Long Video World Model

LongVie 2: 多模态可控超长视频世界模型

Jianxiong Gao, Zhaoxi Chen, Xian Liu, Junhao Zhuang, Chengming Xu, Jianfeng Feng, Yu Qiao, Yanwei Fu, Chenyang Si, Ziwei Liu

机构 * FDU(福建大学) NJU(南京大学) NTU(National University of Taiwan) NVIDIA(英伟达) THU(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 LongVie 2通过多模态引导、退化感知训练和历史-上下文引导,实现了超长视频的可控生成,支持连续视频生成长达五分钟,推动视频世界建模的统一发展。

Comments Project Page: https://vchitect.github.io/LongVie2-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00752 2025-12-12 cs.CV cs.RO 79%

Multi-Modal Graph Convolutional Network with Sinusoidal Encoding for Robust Human Action Segmentation

多模态图卷积网络与正弦编码用于鲁棒的人体动作分割

Hao Xing, Kai Zhe Boey, Yuankai Wu, Darius Burschka, Gordon Cheng

机构 * Institute for Cognitive Systems(认知系统研究所) Chair of Media Technology(媒体技术教授职位) Machine Vision and Perception Group(机器视觉与感知小组) School of Computation, Information and Technology(计算、信息与技术学院)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态图卷积网络与正弦编码方法,通过融合低帧率和高帧率数据提升人体动作分割的鲁棒性,实验表明在双手动作数据集上显著提高分割准确率。

Comments 8 pages, 5 figures, accepted in IROS25, Hangzhou, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23478 2025-12-09 cs.CV 79%

Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models

Video-R2: 通过强化一致性和基于现实的推理提升多模态语言模型

Muhammad Maaz, Hanoona Rasheed, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Linköping University(林肯皮大学) Australian National University(澳大利亚国立大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Video-R2通过强化学习提升多模态模型在视频推理中的时间对齐和逻辑一致性,提高准确性和可信度。

Comments Video-R2 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06708 2025-12-09 cs.LG cs.AI 79%

A Novel Multimodal RUL Framework for Remaining Useful Life Estimation with Layer-wise Explanations

一种新型多模态剩余寿命估计框架,结合层间解释

Waleed Razzaq, Yun-Bo Zhao

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种结合图像和时频表示的多模态RUL估计框架,通过多头注意力和多模态LRP提升模型透明度,实验证明其在不同操作条件下均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19907 2025-12-08 cs.CV 79%

MHB: Multimodal Handshape-aware Boundary Detection for Continuous Sign Language Recognition

MHB: 多模态手形感知边界检测用于连续手语识别

Mingyu Zhao, Zhanfu Yang, Yang Zhou, Zhaoyang Xia, Can Jin, Xiaoxiao He, Dimitris N. Metaxas

机构 * Rutgers University(罗杰斯大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MHB方法,通过多模态融合结合3D骨骼特征和手形信息,提升连续手语识别的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02846 2025-12-03 cs.CV 79%

Action Anticipation at a Glimpse: To What Extent Can Multimodal Cues Replace Video?

瞬间动作预见:多模态线索能替代视频到何种程度?

Manuel Benavent-Lledo, Konstantinos Bacharidis, Victoria Manousaki, Konstantinos Papoutsakis, Antonis Argyros, Jose Garcia-Rodriguez

机构 * Universidad de Alicante(阿利坎特大学) Foundation for Research and Technology-Hellas(希腊基础研究与技术基金会) University of Crete(克里特大学) Hellenic Mediterranean University(希腊地中海大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 AAG通过结合单帧RGB特征与深度线索及先前动作信息,实现了多模态单帧动作预见,能与视频聚合基线和先进方法在教学活动数据集上竞争。

Comments Accepted in WACV 2026 - Applications Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02651 2025-12-03 cs.HC cs.CV cs.SE 79%

Real-Time Multimodal Data Collection Using Smartwatches and Its Visualization in Education

利用智能手表进行实时多模态数据采集及其在教育中的可视化

Alvaro Becerra, Pablo Villegas, Ruth Cobos

机构 * Universidad Autónoma de Madrid(马德里自治大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出利用智能手表进行实时多模态数据采集及可视化,用于教育场景中的学习分析。

Comments Accepted in Technological Ecosystems for Enhancing Multiculturality (TEEM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02609 2025-12-03 cs.RO cs.CV 79%

SAM2Grasp: Resolve Multi-modal Grasping via Prompt-conditioned Temporal Action Prediction

SAM2Grasp:通过提示条件化的时序动作预测解决多模态抓取

Shengkai Wu, Jinrong Yang, Wenqiu Luo, Linfeng Gao, Chaohui Shang, Meiyu Zhi, Mingshan Sun, Fangping Yang, Liangliang Ren, Yong Zhao

机构 * CVTE(中国中车)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 SAM2Grasp通过提示条件化的时序动作预测,解决多模态抓取中的冲突问题,实现高精度抓取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏