arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-28 至 2026-04-28 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 13 篇

2601.20597 2026-04-28 cs.CV 83%

StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval

StructAlign:结构化跨模态对齐用于连续文本到视频检索

Shaokun Wang, Weili Guan, Jizhou Han, Jianlong Wu, Yupeng Hu, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学) Shandong University(山东大学)

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出StructAlign,通过结构化跨模态对齐方法解决连续文本到视频检索中的模态错位和特征漂移问题,提升模型持续学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23173 2026-04-28 cs.CV 79%

One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition

一个身份,多种角色:多模态实体指代用于增强视频情境识别

Balaji Darur, Amanmeet Garg, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad, India(IIIT海得拉尔学院计算机视觉研究所,印度) Amazon Prime Video, Seattle(亚马逊Prime视频,西雅图)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态实体指代(MEC)方法,通过结合文本和视频信息提升视频情境识别的准确性和一致性,实验结果显示在描述和视觉定位方面均取得显著提升。

Comments Accepted to CVPR 2026 Findings. Project Page: https://katha-ai.github.io/projects/cinemec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21094 2026-04-28 cs.CV 79%

EMCompress: Video-LLMs with Endomorphic Multimodal Compression

EMCompress: 具有端态多模态压缩的视频大语言模型

Zheyu Fan, Jiateng Liu, Yuji Zhang, Zihan Wang, Yi R. Fung, Manling Li, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出端态多模态压缩(EMC)作为视频问答的结构约束充分统计问题,通过端态变换保持答案不变性,提升视频语言理解的训练和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24002 2026-04-28 cs.HC cs.AI cs.MM 62%

IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models

IntentVLM: 通过视频语言模型的前-后向建模实现开放词汇意图识别

Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani

机构 * Institute of Intelligent Systems and Robotics (ISIR)(智能系统与机器人研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出IntentVLM框架,通过前-后向建模提升多模态环境下的人意图识别效果,实验表明其在IntentQA和Inst-IT Bench数据集上达到80%准确率,超越基线30%,接近人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23532 2026-04-28 cs.CV cs.AI 62%

Emotion-Conditioned Short-Horizon Human Pose Forecasting with a Lightweight Predictive World Model

基于轻量预测世界模型的情感条件短周期人体姿态预测

Jingni Huang, Peter Bloodsworth

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了情感嵌入对短周期姿态预测的辅助作用,提出轻量级自回归预测世界模型,结合姿态关键点与情感嵌入,提升情感驱动动作序列的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23325 2026-04-28 cs.CV cs.AI eess.IV 62%

EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence

EAD-Net:具有空间细化和时间一致性的情感感知说话头生成

Yahui Li, Yinfeng Yu, Liejun Wang, Shengjie Shen

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 EAD-Net通过引入同步网络监督和时空方向注意力机制,提升情感感知说话头生成的唇同步精度和时间一致性,同时利用大语言模型增强情感语义控制。

Comments Main paper (10 pages). Accepted for publication by ICMR(International Conference on Multimedia Retrieval) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23145 2026-04-28 cs.CV cs.AI 62%

UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks

UpstreamQA:一个用于视频问答任务显式推理的模块化框架

Jason Nguyen, Ameet Rao, Alexander Chang, Ishaan Kumar, Erin Tan

机构 * Lincoln North Star High School(林肯北星高中) The Charter School of Wilmington(威尔明顿 charter 学校) Greenwich High School(格林威治高中) Santa Susana High School(圣塔苏娜高中) UC Berkeley(伯克利大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UpstreamQA框架,通过显式推理模块分离和评估视频推理核心组件,提升视频问答任务的性能和可解释性,但可能在基线性能高时导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22839 2026-04-28 cs.CV cs.AI 62%

From Skeletons to Pixels: Few-Shot Precise Event Spotting via Representation and Prediction Distillation

从骨骼到像素:通过表示和预测蒸馏实现少样本精确事件定位

Zhong Han Ervin Yeoh, Jiang Kan

机构 * Department of Business Analytics(商业分析系) School of Computing(计算学院) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出两种互补的蒸馏策略,通过多模态蒸馏提升少样本精确事件定位的泛化能力,实验表明在网球和花样滑冰数据集中均优于单一模态基线。

Comments 39 pages, 4 figures, ISACE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23255 2026-04-28 cs.HC cs.AI cs.CY 57%

Scalable LLM-based Coding of Dialogue in Healthcare Simulation: Balancing Coding Performance, Processing Time, and Environmental Impact

可扩展的基于LLM的医疗模拟对话编码:在编码性能、处理时间和环境影响之间取得平衡

Kiyoshige Garces, Gloria Milena Fernandez-Nieto, Linxuan Zhao, Sachini Samaraweera, Dragan Gasevic, Roberto Martinez-Maldonado, Vanessa Echeverria

机构 * RMIT University(皇家墨尔本理工大学) Monash University(墨尔本大学) Adelaide University(阿德莱德大学) The University of Hong Kong(香港大学) ESPOL University(ESPOL大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了如何通过优化提示设计和批量策略,在医疗模拟复盘中平衡编码准确性、处理时间和环境影响,展示了LLM在对话分析中的可行性及实际应用价值。

Comments 12 pages, 6 figures. Accepted at the Learning at Scale Conference (L@S) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23198 2026-04-28 cs.AI 57%

StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning

StoryTR: 基于心智理论的叙事视频时序检索

Xuanyue Zhong, Yuqiang Xie, Guanqun Bi, Jiangping Yang, Guibin Chen

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong(香港中文大学计算机科学与工程系) SkyReels, Skywork AI(SkyReels与Skywork AI) Independent Researcher(独立研究者)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 StoryTR首次引入需要心智理论推理的视频时刻检索基准,通过生成包含8100个样本的叙事短视频数据集,验证了心智理论推理在视频理解中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23001 2026-04-28 cs.RO cs.AI 57%

Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines

机器人中的视觉-语言-动作:数据集、基准和数据引擎的综述

Ziyao Wang, Bingying Wang, Hanrong Zhang, Tingting Du, Tianyang Chen, Guoheng Sun, Yexiao He, Zheyu Shen, Wanghao Ye, Ang Li

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Utah(犹他大学) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了视觉-语言-动作研究中数据基础设施的关键挑战,指出未来进展依赖于数据引擎与评估协议的协同设计,揭示了数据集、基准和数据引擎的四大开放挑战。

Comments This is a survey paper. The survey is already accepted by TMLR after peer-review. The OpenReview link is here: https://openreview.net/forum?id=tAaWFpvnmm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07990 2026-04-28 cs.CV 57%

SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations

SceneScribe-1M:一个具有全面几何和语义标注的大规模视频数据集

Yunnan Wang, Kecheng Zheng, Jianyuan Wang, Minghao Chen, David Novotny, Christian Rupprecht, Yinghao Xu, Xing Zhu, Wenjun Zeng, Xin Jin, Yujun Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团) Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东部技术研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江工业智能与数字孪生重点实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 SceneScribe-1M通过提供一个包含一百万真实视频的数据集,支持3D几何感知与视频合成的统一资源,推动了单目深度估计、场景重建等下游任务及文本到视频合成等生成任务的发展。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19554 2026-04-28 cs.LG 50%

MobText-SISA: Efficient Machine Unlearning for Mobility Logs with Spatio-Temporal and Natural-Language Data

MobText-SISA:基于时空和自然语言数据的高效机器反学习

Haruki Yonekura, Ren Ozeki, Tatsuya Amano, Hamada Rizk, Hirozumi Yamaguchi

机构 * The University of Osaka(大阪大学) RIKEN Center for Computational Science(理化学研究所计算科学中心) Tanta University(塔塔大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 MobText-SISA通过扩展SISA训练方法,实现对异构时空数据的高效机器反学习,保持预测精度并优于随机分片方法,为城市规模的多模态移动数据隐私合规分析提供基础。

Comments Accepted to The 33rd ACM International Conference on Advances in Geographic Information Systems(SIGSPATIAL '25) as a short paper in the Short Paper Track

Journal ref In Proceedings of the 33rd ACM International Conference on Advances in Geographic Information Systems (SIGSPATIAL '25), 2025, pp. 1186-1189

详情

展开后加载摘要…

URL PDF HTML 收藏