arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1375 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1375 篇

2603.16397 2026-03-18 cs.CL cs.AI 50%

Fanar 2.0: Arabic Generative AI Stack

Fanar 2.0:阿拉伯生成AI堆栈

FANAR TEAM, Ummar Abbas, Mohammad Shahmeer Ahmad, Minhaj Ahmad, Abdulaziz Al-Homaid, Anas Al-Nuaimi, Enes Altinisik, Ehsaneddin Asgari, Sanjay Chawla, Shammur Chowdhury, Fahim Dalvi, Kareem Darwish, Nadir Durrani, Mohamed Elfeky, Ahmed Elmagarmid, Mohamed Eltabakh, Asim Ersoy, Masoomali Fatehkia, Mohammed Qusay Hashim, Majd Hawasly, Mohamed Hefeeda, Mus'ab Husaini, Keivin Isufaj, Soon-Gyo Jung, Houssam Lachemat, Ji Kim Lucas, Abubakr Mohamed, Tasnim Mohiuddin, Basel Mousi, Hamdy Mubarak, Ahmad Musleh, Mourad Ouzzani, Amin Sadeghi, Husrev Taha Sencar, Mohammed Shinoy, Omar Sinan, Yifan Zhang

机构 * Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 视频理解 :video understanding(abstract)

AI总结 Fanar 2.0在资源受限条件下实现卓越性能,通过数据质量优先、持续预训练和模型融合,提升阿拉伯语知识、语言、方言及英语能力,同时引入多项新功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19184 2026-02-24 cs.RO 50%

Human-to-Robot Interaction: Learning from Video Demonstration for Robot Imitation

人机交互:从视频演示中学习机器人模仿

Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang, Ziyan Gao, Nak Young Chong, Xiem HoangVan

专题命中 视频理解 :video understanding(abstract)

AI总结 本研究提出了一种基于视频演示的机器人模仿学习方法,通过模块化框架结合时间位移模块和深度强化学习,实现机器人从无结构视频中学习基本操作技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10986 2026-02-12 cs.LG 50%

TVCACHE: A Stateful Tool-Value Cache for Post-Training LLM Agents

TVCACHE: 一种具有状态的工具-价值缓存用于训练后LLM代理

Abhishek Vijaya Kumar, Bhaskar Kataria, Byungsoo Oh, Emaad Manzoor, Rachee Singh

机构 * cornell(康奈尔大学)

专题命中 视频理解 :video understanding(abstract)

AI总结 TVCACHE通过维护工具调用序列树和最长前缀匹配,实现LLM代理训练后的高效缓存,提高缓存命中率并减少工具调用时间。

Comments Abhishek Vijaya Kumar and Bhaskar Kataria have equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10015 2026-02-12 cs.RO cs.AI 50%

RoboSubtaskNet: Temporal Sub-task Segmentation for Human-to-Robot Skill Transfer in Real-World Environments

RoboSubtaskNet: 人类-机器人技能转移中的时间子任务分割用于现实环境

Dharmendra Sharma, Archit Sharma, John Rebeiro, Vaibhav Kesharwani, Peeyush Thakur, Narendra Kumar Dhar, Laxmidhar Behera

专题命中 视频理解 :video understanding(abstract)

AI总结 RoboSubtaskNet通过结合增强注意力的I3D特征和改进的MS-TCN,实现了人类-机器人技能转移中的时间子任务分割,提升了现实环境中的机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16231 2026-01-26 cs.SD cs.AI cs.CL cs.LG eess.AS 50%

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

SoundBreak: 对三模态模型上仅音频对抗攻击的系统研究

Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)

专题命中 视频理解 :video-language(abstract)

AI总结 SoundBreak研究了对三模态模型的仅音频对抗攻击,发现音频扰动可导致严重多模态失败,攻击成功率高达96%,并揭示了多模态系统中被忽视的单模态攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08871 2026-01-15 cs.SD cs.AI eess.AS 50%

Semantic visually-guided acoustic highlighting with large vision-language models

语义视觉引导的音频突出与大型视觉-语言模型

Junhua Huang, Chao Huang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学)

专题命中 视频理解 :video understanding(abstract)

AI总结 本文提出利用大型视觉-语言模型提取视觉-语义特征,以提升音频混音质量,发现摄像机焦点、语气和场景背景对感知混音质量提升最显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20876 2026-01-13 cs.RO 50%

Proprioception Enhances Vision Language Model in Generating Captions and Subtask Segmentations for Robot Task

本体感知增强视觉语言模型在为机器人任务生成描述和子任务分割中的应用

Kanata Suzuki, Shota Shimizu, Tetsuya Ogata

机构 * Faculty of Science and Engineering, Waseda University(工学部,早稻田大学) Artificial Intelligence Laboratory, Fujitsu Limited(Fujitsu 人工智能实验室) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)

专题命中 视频理解 :video understanding(abstract)

AI总结 本研究通过引入本体感知数据,提升视觉语言模型在机器人任务描述和子任务分割中的性能,以增强机器人模仿学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05472 2025-12-08 cs.NE 50%

Unleashing Temporal Capacity of Spiking Neural Networks through Spatiotemporal Separation

通过时空分离释放脉冲神经网络的时间能力

Yiting Dong, Zhaofei Yu, Jianhao Ding, Zijie Xu, Tiejun Huang

专题命中 视频理解 :video understanding(abstract)

AI总结 本文提出STSep网络,通过解耦空间与时间分支,提升脉冲神经网络在视频理解中的时空建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11664 2025-11-03 cs.AI 50%

VRoPE: Rotary Position Embedding for Video Large Language Models

Zikang Liu, Longteng Guo, Yepeng Tang, Tongtian Yue, Junxian Cai, Kai Ma, Qingbin Liu, Xi Chen, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Basic Algorithm Center, Tencent(腾讯基础算法中心)

专题命中 视频理解 :video understanding(abstract)

Comments EMNLP 2025 Main Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21026 2025-10-27 cs.RO 50%

HRT1: One-Shot Human-to-Robot Trajectory Transfer for Mobile Manipulation

Sai Haneesh Allu, Jishnu Jaykumar P, Ninad Khargonkar, Tyler Summers, Jian Yao, Yu Xiang

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) XPeng(小鹏)

专题命中 视频理解 :video understanding(abstract)

Comments 14 pages, 11 figures and 3 tables. Project page is available at \url{https://irvlutd.github.io/HRT1/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23870 2025-08-12 cs.LG cs.AI 50%

MaCP: Minimal yet Mighty Adaptation via Hierarchical Cosine Projection

Yixian Shen, Qi Bi, Jia-Hong Huang, Hongyi Zhu, Andy D. Pimentel, Anuj Pathania

专题命中 视频理解 :video understanding(abstract)

Comments This work was intended as a replacement of arXiv:2410.09103 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09103 2025-08-12 cs.LG cs.AI 50%

MaCP: Minimal yet Mighty Adaptation via Hierarchical Cosine Projection

Yixian Shen, Qi Bi, Jia-Hong Huang, Hongyi Zhu, Andy D. Pimentel, Anuj Pathania

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视频理解 :video understanding(abstract)

Comments 17 pages; Previously this version appeared as arXiv:2505.23870 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18805 2025-04-29 cs.CL cs.AI cs.LG 50%

Stealing Creator's Workflow: A Creator-Inspired Agentic Framework with Iterative Feedback Loop for Improved Scientific Short-form Generation

Jong Inn Park, Maanas Taneja, Qianwen Wang, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 视频理解 :video generation(abstract)

Comments Project page: https://minnesotanlp.github.io/scitalk-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10742 2025-04-25 cs.LG cs.CL 50%

Keyframe-oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-Form Video Processing

Yudong Liu, Jingwei Sun, Yueqian Lin, Jingyang Zhang, Ming Yin, Qinsi Wang, Jianyi Zhang, Hai Li, Yiran Chen

机构 * Duke University(杜克大学) Duke Kunshan University(杜克昆山大学)

专题命中 视频理解 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14692 2025-04-22 cs.CL 50%

OmniV-Med: Scaling Medical Vision-Language Model for Universal Visual Understanding

Songtao Jiang, Yuan Wang, Sibo Song, Yan Zhang, Zijie Meng, Bohan Lei, Jian Wu, Jimeng Sun, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) UIUC(伊利诺伊大学香槟分校)

专题命中 视频理解 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06214 2025-04-09 cs.CL cs.AI cs.LG 50%

From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models

Chejian Xu, Wei Ping, Peng Xu, Zihan Liu, Boxin Wang, Mohammad Shoeybi, Bo Li, Bryan Catanzaro

专题命中 视频理解 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04707 2025-04-08 cs.IR 50%

TC-MGC: Text-Conditioned Multi-Grained Contrastive Learning for Text-Video Retrieval

Xiaolun Jing, Genke Yang, Jian Chu

专题命中 视频理解 :text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12272 2024-12-03 cs.AI 50%

Slot State Space Models

Jindong Jiang, Fei Deng, Gautam Singh, Minseung Lee, Sungjin Ahn

专题命中 视频理解 :video understanding(abstract)

Comments Accepted to NeurIPS 2024; Project page is available at https://slotssms.github.io/ ; Code is available at https://github.com/JindongJiang/SlotSSMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01264 2024-10-08 cs.CL 50%

SignCLIP: Connecting Text and Sign Language by Contrastive Learning

Zifan Jiang, Gerard Sant, Amit Moryossef, Mathias Müller, Rico Sennrich, Sarah Ebling

专题命中 视频理解 :text-to-video(abstract)

Comments Accepted at EMNLP 2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11406 2024-08-22 cs.HC 50%

Audio Description Customization

Rosiana Natalie, Ruei-Che Chang, Smitha Sheshadri, Anhong Guo, Kotaro Hara

专题命中 视频理解 :video understanding(abstract)

Comments ASSETS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.09141 2022-08-16 cs.DB 50%

ExSample: Efficient Searches on Video Repositories through Adaptive Sampling

Oscar Moll, Favyen Bastani, Sam Madden, Mike Stonebraker, Vijay Gadepally, Tim Kraska

专题命中 视频理解 :video understanding(abstract)

Journal ref 2022 IEEE 38th International Conference on Data Engineering (ICDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.03630 2021-08-05 quant-ph 50%

A Quantum Convolutional Neural Network for Image Classification

Yanxuan Lü, Qing Gao, Jinhu Lü, Maciej Ogorzałek, Jin Zheng

专题命中 视频理解 :video understanding(abstract)

Comments Techniques need to be double checked

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.13448 2020-10-26 cs.SD cs.CL eess.AS 50%

Audio Caption in a Car Setting with a Sentence-Level Loss

Xuenan Xu, Heinrich Dinkel, Mengyue Wu, Kai Yu

专题命中 视频理解 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.11780 2019-03-29 cs.LG stat.ML 50%

Wasserstein Dependency Measure for Representation Learning

Sherjil Ozair, Corey Lynch, Yoshua Bengio, Aaron van den Oord, Sergey Levine, Pierre Sermanet

专题命中 视频理解 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.02653 2018-07-10 cs.LG stat.ML 50%

When Work Matters: Transforming Classical Network Structures to Graph CNN

Wenting Zhao, Chunyan Xu, Zhen Cui, Tong Zhang, Jiatao Jiang, Zhenyu Zhang, Jian Yang

专题命中 视频理解 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏