arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2602.08706 2026-02-10 cs.HC cs.AI cs.ET 57%

Technosocial risks of ideal emotion recognition technologies: A defense of the (social) value of emotional expressions

理想情感识别技术的科技社会风险:对情感表达(社会)价值的辩护

Alexandra Pregent

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨理想情感识别技术可能带来的科技社会风险,指出其对情感表达的社会功能的误解可能导致社会凝聚力和个体自主性的削弱,主张以功能为导向的监管方法保护社会利益。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08202 2026-02-10 cs.CV 57%

Generative Regression for Left Ventricular Ejection Fraction Estimation from Echocardiography Video

基于生成回归的超声心动图视频左室射血分数估计

Jinrong Lv, Xun Gong, Zhaohuan Li, Weili Jiang

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) Manufacturing Industry Chain Collaboration Industrial Software Key Laboratory of Sichuan Province(四川省制造业产业链协同工业软件重点实验室) School of Medicine, University of Electronic Science and Technology(医学院,电子科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MCSDR模型,通过生成回归方法提升超声心动图视频中左室射血分数估计的准确性与解释性。

Comments 11 pages, 5 tables, 10 figures. Under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07915 2026-02-10 cs.CV 57%

MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding

MARC: 用于高效视频理解的记忆增强强化学习令牌压缩

Peiran Wu, Zhuorui Yu, Yunze Liu, Chi-Hao Wu, Enmin Zhou, Junxiao Shen

机构 * University of Bristol(布里斯托大学) Memories.ai Research(Memories.ai研究)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MARC通过结合结构化检索和强化学习知识蒸馏,实现高效视频理解,显著减少视觉令牌、GPU内存和延迟。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07034 2026-02-10 cs.AI 57%

ST-Raptor: An Agentic System for Semi-Structured Table QA

ST-Raptor:一个用于半结构化表格问答的智能系统

Jinxiu Qu, Zirui Tang, Hongzhang Huang, Boyu Niu, Wei Zhou, Jiannan Wang, Yitong Song, Guoliang Li, Xuanhe Zhou, Fan Wu

机构 * Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 ST-Raptor通过结合视觉编辑、树形结构建模和代理驱动查询解决,提升半结构化表格问答的准确性和易用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06997 2026-02-10 eess.SP cs.AI cs.LG cs.NE 57%

Adaptive Temporal Dynamics for Personalized Emotion Recognition: A Liquid Neural Network Approach

自适应时间动态用于个性化情绪识别:一种液态神经网络方法

Anindya Bhattacharjee, Nittya Ananda Biswas, K. A. Shahriar, Adib Rahman

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于液态神经网络的多模态框架,用于提升基于EEG的情绪识别准确率,通过结合卷积特征提取、可学习时间常数和注意力引导融合,实现高准确率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06129 2026-02-09 cs.LG cs.AI 57%

Urban Spatio-Temporal Foundation Models for Climate-Resilient Housing: Scaling Diffusion Transformers for Disaster Risk Prediction

城市时空基础模型用于气候韧性住房:扩散变换器的扩展用于灾害风险预测

Olaf Yunus Laitinen Imanov, Derya Umut Kulali, Taner Yilmaz

机构 * Technical University of Denmark(技术大学) Eskisehir Technical University(埃斯基谢普大学) Afyon Kocatepe University(阿夫yon卡奥塔佩大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出Skjold-DiT模型,通过整合时空城市数据预测建筑气候风险,并结合交通网络结构提升灾害响应能力。

Comments 10 pages, 5 figures. Submitted to IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05853 2026-02-06 cs.CL 57%

RRAttention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context Inference

RRAttention: 通过每头轮换位移实现动态块稀疏注意力以支持长上下文推理

Siran Liu, Guoxia Wang, Sa Wang, Jinle Zeng, HaoYang Xie, Siyu Lou, JiaBin Yang, DianHai Yu, Haifeng Wang, Chao Yang

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 RRAttention通过轮换位移策略实现动态块稀疏注意力,提升长上下文推理效率,实现99%的完整注意力性能和2.4倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05829 2026-02-06 cs.CV 57%

Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning

Weaver:用于视频交织推理的端到端代理系统训练

Yudi Shi, Shangzhe Di, Qirui Chen, Qinian Wang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Weaver通过端到端训练多模态推理代理系统,提升视频推理任务在长视频处理上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04257 2026-02-05 cs.CV 57%

Depth-Guided Metric-Aware Temporal Consistency for Monocular Video Human Mesh Recovery

基于深度的度量感知时序一致性用于单目视频人体网格恢复

Jiaxin Cen, Xudong Mao, Guanghui Yue, Wei Zhou, Ruomei Wang, Fan Zhou, Baoquan Zhao

机构 * Sun Yat-sen University, China(中山大学) Shenzhen University, China(深圳大学) Cardiff University, UK(卡迪夫大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出深度引导的度量感知时序一致性框架,通过多尺度融合、D-MAPS估计器和MoDAR模块提升单目视频人体网格恢复的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23729 2026-02-04 cs.CV 57%

Proteus-ID: ID-Consistent and Motion-Coherent Video Customization

Proteus-ID:身份一致且运动协调的视频定制

Guiyu Zhang, Chen Shi, Zijian Jiang, Xunzhi Xiang, Jingjing Qian, Shaoshuai Shi, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Voyager Research, Didi Chuxing(Voyager Research与滴滴出行)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Proteus-ID通过多模态身份融合、时间感知身份注入和自适应运动学习,实现了身份一致且运动协调的视频定制,提升了视频生成的真实性和流畅度。

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04282 2026-02-03 cs.CV cs.LG 57%

Inference-time Stochastic Refinement of GRU-Normalizing Flow for Real-time Video Motion Transfer

推理时GRU归一化流的随机细化用于实时视频运动转移

Tasmiah Haque, Srinjoy Das

机构 * Department of Industrial and Management Systems Engineering(工业与管理系统工程系) School of Mathematical and Data Sciences(数学与数据科学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种在推理时结合随机采样和GRU-NF的改进方法,以提升实时视频运动转移中未来预测的多样性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06051 2026-02-03 cs.CV 57%

VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning

VQAThinker: 通过强化学习探索通用且可解释的视频质量评估

Linhan Cao, Wei Sun, Weixia Zhang, Xiangyang Zhu, Jun Jia, Kaiwei Zhang, Dandan Zhu, Guangtao Zhai, Xiongkuo Min

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VQAThinker通过强化学习方法,结合大模型和规则引导算法,提升视频质量评估的泛化能力和可解释性。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00536 2026-02-03 cs.CV 57%

SADER: Structure-Aware Diffusion Framework with DEterministic Resampling for Multi-Temporal Remote Sensing Cloud Removal

SADER:一种结构感知扩散框架,用于多时相遥感云去除

Yifan Zhang, Qian Chen, Yi Liu, Wengen Li, Jihong Guan

机构 * College of Literature, Science, and the Arts, University of Michigan(文学、科学与艺术学院,密歇根大学) School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SADER通过结构感知扩散框架,结合时间融合和混合注意力机制,有效解决多时相遥感云去除问题,提升云去除效果和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00440 2026-02-03 cs.CV cs.LG cs.RO 57%

DISK: Dynamic Inference SKipping for World Models

DISK:用于世界模型的动态推理跳过

Anugunj Naman, Gaibo Zhang, Ayushman Singh, Yaguang Zhang

机构 * Purdue University, West Lafayette, United States(普渡大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 DISK通过动态推理跳过技术,在无需训练的情况下提升自回归世界模型的视频和轨迹预测效率,同时保持预测精度和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22938 2026-02-02 cs.CR cs.AI eess.IV eess.SP 57%

A Real-Time Privacy-Preserving Behavior Recognition System via Edge-Cloud Collaboration

通过边缘-云协作实现实时隐私保护行为识别系统

Huan Song, Shuyu Tian, Junyi Hao, Cheng Yuan, Zhenyu Jia, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于AI流理论和边缘-云协作架构的隐私保护行为识别系统,通过边缘设备的特征抽象与云平台的联合推断,实现高隐私环境下的行为检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02767 2026-02-02 cs.CV 57%

Dynamic Reflections: Probing Video Representations with Text Alignment

动态反射:通过文本对齐探测视频表示

Tyler Zhu, Tengda Han, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本研究通过视频-文本表示对齐探索现代视频和语言编码器的能力,揭示了跨模态对齐与数据丰富性、语义对齐与性能相关性以及时间推理与对齐的关系。

Comments To appear at ICLR 2026. 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22153 2026-01-30 cs.RO cs.CV 57%

DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation

DynamicVLA: 一种用于动态物体操控的视觉-语言-动作模型

Haozhe Xie, Beichen Wen, Jiarui Zheng, Zhaoxi Chen, Fangzhou Hong, Haiwen Diao, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 DynamicVLA通过整合时间推理和闭环适应,提出了一种用于动态物体操控的视觉-语言-动作模型,提升了响应速度和泛化能力。

Comments Project Page: https://www.infinitescript.com/project/dynamic-vla/ GitHub: https://github.com/hzxie/DynamicVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21193 2026-01-30 cs.CV 57%

Generative Recall, Dense Reranking: Learning Multi-View Semantic IDs for Efficient Text-to-Video Retrieval

生成回忆,密集重排序:学习多视图语义ID以实现高效的文本到视频检索

Zecheng Zhao, Zhi Chen, Zi Huang, Shazia Sadiq, Tong Chen

机构 * The University of Queensland(昆士兰大学) The University of Southern Queensland(南部昆士兰大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 GRDR通过生成回忆和密集重排序方法,提升文本到视频检索的效率和准确性,减少存储并加速检索过程。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19022 2026-01-29 cs.LG cs.AI 57%

EVEREST: An Evidential, Tail-Aware Transformer for Rare-Event Time-Series Forecasting

EVEREST:一种证据感知、尾部意识的Transformer用于稀有事件时间序列预测

Antanas Zilinskas, Robert N. Shorten, Jakub Marecek

机构 * Imperial College London(伦敦帝国学院) Czech Technical University in Prague(布拉格捷克技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 EVEREST通过结合证据头和极值头,实现稀有事件时间序列预测的高精度与可解释性,适用于高风险领域。

Comments Updated author affiliation. No changes to technical content

Journal ref 14th International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19686 2026-01-28 cs.CV 57%

Video-KTR: Reinforcing Video Reasoning via Key Token Attribution

Video-KTR: 通过关键令牌 attribution 增强视频推理

Ziyue Wang, Sheng Jin, Zhongrong Zuo, Jiawei Wu, Han Qiu, Qi She, Hao Zhang, Xudong Jiang

机构 * ByteDance(字节跳动) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) National University of Singapore(国立新加坡大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-KTR通过结合三种attribution信号,提升视频推理的准确性和可解释性,实现状态-of-the-art性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06835 2026-01-27 cs.CV 57%

X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding

X-LeBench:一个用于极长第一人称视频理解的基准数据集

Wenqi Zhou, Kai Cao, Hao Zheng, Yunze Liu, Xinyi Zheng, Miao Liu, Per Ola Kristensson, Walterio Mayol-Cuevas, Fan Zhang, Weizhe Lin, Junxiao Shen

机构 * University of Bristol(布里斯托大学) University of Manchester(曼彻斯特大学) University of Cambridge(剑桥大学) College of AI, Tsinghua University(清华大学人工智能学院) Meta Memories.ai Research(Memories.ai研究)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 X-LeBench通过模拟真实日常生活场景,构建了首个极长第一人称视频理解基准数据集,揭示了长视频理解中的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16652 2026-01-26 cs.CV cs.NE 57%

Reliable Brain Tumor Segmentation Based on Spiking Neural Networks with Efficient Training

基于高效训练的脉冲神经网络的可靠脑肿瘤分割

Aurora Pia Ghiardelli, Guangzhi Tang, Tao Sun

机构 * Department of Advanced Computing Sciences, Maastricht University, Maastricht, The Netherlands(先进计算科学系,马斯特里赫特大学,马斯特里赫特,荷兰)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于高效训练的脉冲神经网络框架,用于可靠且节能的3D脑肿瘤分割,实验显示在准确性、不确定性校准和计算成本降低方面均表现优异。

Comments Accepted at ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16079 2026-01-26 cs.CV 57%

Masked Modeling for Human Motion Recovery Under Occlusions

遮蔽建模用于遮挡下的人体运动恢复

Zhiyin Qian, Siwei Zhang, Bharat Lal Bhatnagar, Federica Bogo, Siyu Tang

机构 * ETH Zürich(苏黎世联邦理工学院) Meta Reality Labs(Meta现实实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 MoRo通过遮蔽建模方法,在遮挡条件下实现高效且鲁棒的人体运动恢复,结合多模态先验提升推理性能。

Comments Project page: https://mikeqzy.github.io/MoRo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08957 2026-01-26 cs.LG cs.AI 57%

LUMOS: Large User MOdels for User Behavior Prediction

LUMOS:大规模用户模型用于用户行为预测

Dhruv Nigam, Naman Agarwal, Krishna Murthy, Susmit Saha

机构 * Dream11 Dream Sports

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 LUMOS通过基于Transformer的架构,利用原始用户活动数据联合学习多个任务,实现用户行为预测的高效与准确,提升业务指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11551 2026-01-23 cs.CV cs.IR cs.LG 57%

Multi-event Video-Text Retrieval

多事件视频-文本检索

Gengyuan Zhang, Jisen Ren, Jindong Gu, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Oxford(牛津大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出多事件视频-文本检索任务,设计Me-Retriever模型,通过关键事件表示和新损失函数提升视频-文本检索性能。

Comments [fixed typos in equations] accepted to ICCV2023 Poster; some figures are not supported when viewed online, please download the file and view locally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15115 2026-01-22 cs.CV 57%

Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial Reasoning

无需训练的多阶段对抗推理 hateful 视频检测

Shuonan Yang, Yuchen Zhang, Zeyu Fu

机构 * Multimodal Intelligence Lab, Department of Computer Science, University of Exeter, United Kingdom(埃克塞特大学计算机科学系多模态智能实验室) Institute for Analytics and Data Science, University of Essex, United Kingdom(埃塞克斯大学分析与数据科学研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MARS通过多阶段对抗推理框架实现无需训练的可解释仇恨视频检测,提升检测可靠性与透明度。

Comments Accepted at ICASSP 2026. \c{opyright} 2026 IEEE. This is the author accepted manuscript. The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14917 2026-01-22 cs.LG cs.AI 57%

Tailoring Adverse Event Prediction in Type 1 Diabetes with Patient-Specific Deep Learning Models

为1型糖尿病定制不良事件预测的患者特异性深度学习模型

Giorgia Rigamonti, Mirko Paolo Barbato, Davide Marelli, Paolo Napoletano

机构 * Department of Informatics, Systems and Communication(信息学、系统与通信系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于深度学习的个性化血糖预测方法,利用患者特定数据提高预测准确性,以改善1型糖尿病的管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14250 2026-01-21 cs.CV 57%

OmniTransfer: All-in-one Framework for Spatio-temporal Video Transfer

OmniTransfer: 一种用于时空视频转换的综合框架

Pengze Zhang, Yanze Wu, Mengtian Li, Xu Bai, Songtao Zhao, Fulong Ye, Chong Mou, Xinghui Li, Zhuowei Chen, Qian He, Mingyuan Gao

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 OmniTransfer通过统一框架实现灵活的高保真视频生成,结合多视角和时间线索提升转换性能。

Comments Github Page: https://pangzecheung.github.io/OmniTransfer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19546 2026-01-21 cs.CV 57%

ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars

ActAvatar: 时空感知的精确动作控制用于对话虚拟角色

Ziqiao Peng, Yi Chen, Yifeng Ma, Guozhen Zhang, Zhiyao Sun, Zixiang Zhou, Youliang Zhang, Zhengguang Zhou, Zhaoxin Fan, Hongyan Liu, Yuan Zhou, Qinglin Lu, Jun He

机构 * Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯文yne) Tsinghua University(清华大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV

AI总结 ActAvatar通过文本引导实现对话虚拟角色的相位级动作控制,引入相位感知交叉注意力、渐进式音频-视觉对齐和双阶段训练策略,提升动作控制精度和视觉质量。

Comments Project Page: https://ziqiaopeng.github.io/ActAvatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11634 2026-01-21 cs.CV 57%

When Rules Fall Short: Agent-Driven Discovery of Emerging Content Issues in Short Video Platforms

当规则不足时:基于智能体的短视频平台新兴内容问题发现

Chenghui Yu, Hongwei Wang, Junwen Chen, Zixuan Wang, Bingfeng Deng, Zhuolin Hao, Hongyu Xiong, Yang Song

机构 * TikTok Inc.(TikTok公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于多模态大语言模型智能体的自动问题发现方法,有效提升短视频平台新兴内容问题的发现与治理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏