arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-25 至 2026-05-25 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 8 篇

2605.17468 2026-05-25 cs.HC cs.AI 79%

An Interpretable Closed-Loop Intelligent Tutoring System for Multimodal Affective Feedback in Asynchronous Presentation Training

一种可解释的闭环智能辅导系统,用于异步演讲训练中的多模态情感反馈

Hung-Yue Suen, Kuo-En Hung

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于XGBoost的可解释闭环智能辅导系统,通过三层可解释反馈架构将多模态输入映射为可追溯的反馈,在MOOC视频上训练并验证了其提升演讲技能的有效性。

Comments 12 pages, 8 figures, IEEE Transactions on Learning Technologies, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19995 2026-05-25 cs.CV 79%

A Computational Model of Message Sensation Value in Short Video Multimodal Features that Predicts Sensory and Behavioral Engagement

短视频多模态特征中信息感知价值的计算模型预测感官与行为参与

Haoning Xue, Jingwen Zhang, Xiaohui Wang, Diane Dagyong Kim, Yunya Song

机构 * Department of Communication, University of Utah(犹他大学通讯系) Department of Communication, University of California, Davis(加州大学戴维斯分校通讯系) Department of Media and Communication, City University of Hong Kong(香港城市大学媒体与传播系) Division of Emerging Interdisciplinary Areas, Hong Kong University of Science and Technology(香港科学与技术大学新兴跨学科领域 division)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 基于信息感知价值理论,通过多模态特征分析和人工评估构建计算模型,预测短视频的感官与行为参与,发现MSV与感官参与正相关,与行为参与呈倒U型关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23428 2026-05-25 cs.CV cs.MM 62%

FAST-ME: Foundation-aware Adaptive Stopping for Motion Estimation for Efficient IoT Video Analysis

FAST-ME:面向高效物联网视频分析的基于基础模型的自适应运动估计停止方法

Kakia Panagidi, Stathes Hadjieftymiadis

机构 * Department of Informatics \& Telecommunications National Kapodistrian University of Athens Athens, Greece

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出一种基于最优停止理论和基础模型(如ViT和SAM)的语义感知运动估计框架,通过融合语义注意力分数与失真度量实现自适应停止,在降低计算量的同时保持精度和语义覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07399 2026-05-25 cs.AI cs.CV 62%

VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation

VGAS: 价值引导的动作块选择用于少样本视觉-语言-动作适应

Changhua Xu, En Yu, Junyu Xuan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出VGAS框架,通过生成-选择范式和价值引导的动作块选择,解决少样本VLA适应中的几何歧义问题,提升成功率和鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23274 2026-05-25 cs.CV 57%

U-CESE: Unified Clip-based Event Search Engine for AI Challenge HCMC 2025

U-CESE:面向AI挑战赛胡志明市2025的统一基于片段的事件搜索引擎

Duc-Nhuan Le, Hoang-Phuc Nguyen, Thanh-Duy Lam, Minh-Nhut Dang, Minh-Hoang Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出U-CESE框架,通过统一剪辑算法、轻量级关键帧提取方法DAKE和时序一致字幕生成ReCap,实现大规模视频多模态事件检索。

Comments Accepted for publication in the Proceedings of the 14th International Symposium on Information and Communication Technology (SOICT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22962 2026-05-25 cs.CV cs.CE cs.HC cs.SE q-bio.NC 57%

GazeBehavior Annotation Toolkit (GBAT): AI-powered toolkit for automatic annotation of egocentric eye-tracking and video data of child-caregiver interaction

凝视行为注释工具包 (GBAT): 基于AI的自动注释工具,用于自我中心眼动追踪和儿童-照顾者互动视频数据

Iba Baig, Kevin Li, Yanbin Xu, Seiji Cattelain, Marie Hallo, Hayato Ono, Sho Tsuji, Ming Bo Cai

机构 * Department of Psychology, University of Miami(迈阿密大学心理学系) Northeastern University(东北大学) Ecole Normale Supérieure, PSL University, EHESS, CNRS(巴黎高等师范学院(PSL大学)、EHESS、CNRS) International Research Center for Neurointelligence (WPI-IRCN), The University of Tokyo Institutes for Advanced Study(神经智能国际研究中心(WPI-IRCN)、东京大学高级研究机构)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出GBAT工具包,利用深度学习实现多视频同步、注视目标半自动注释和参与者姿态手部动作分类,提高从自我中心眼动和视频数据中提取特征的效率和可扩展性。

Comments submitted to IEEE International Conference on Development and Learning (ICDL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06885 2026-05-25 cs.CV 57%

Time-driven Survival Analysis from FDG-PET/CT in Non-Small Cell Lung Cancer

基于FDG-PET/CT的非小细胞肺癌时间驱动生存分析

Sambit Tarai, Ashish Chauhan, Elin Lundström, Johan Öfverstedt, Therese Sjöholm, Veronica Sanchez Rodriguez, Håkan Ahlström, Joel Kullberg

机构 * Radiology, Department of Surgical Sciences(外科科学系放射学部) Antaros Medical(Antaros医疗) Molecular Imaging and Medical Physics, Department of Surgical Sciences(外科科学系分子成像与医学物理部)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种结合组织FDG-PET/CT投影和时间输入的深度学习回归框架,用于预测非小细胞肺癌患者的总生存期,在AUC上比基线方法提升4.3%,并实现了风险分层。

Comments Under review

Journal ref Ann Biomed Eng (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23598 2026-05-25 cs.CR cs.HC 50%

When Youth Enter the Algorithmic Wild: Discovering and Understanding Potentially Harmful Teen Videos on Douyin and Kwai

当青少年进入算法荒野:发现和理解抖音和快手上的潜在有害青少年视频

Shaoxuan Zhou, Yafei Sun, Jing Zhang, Xianghang Mi

专题命中 视频多模态 :multimodal(abstract)

AI总结 通过行为测量框架PHTV-Scout,结合离线调查与在线管道,发现抖音和快手上6.11%的视频为潜在有害青少年视频,其中儿童性剥削图像占53.2%,且有害内容通过隐蔽交互和主动规避策略传播,而青少年模式虽能完全屏蔽但采用率低。

详情

展开后加载摘要…

URL PDF HTML 收藏