arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2603.23489 2026-03-25 cs.CV 57%

AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation

AgentRVOS: 基于对象跟踪的零样本视频对象分割

Woojeong Jin, Jaeho Lee, Heeseong Shin, Seungho Jang, Junhwan Heo, Seungryong Kim

机构 * KAIST AI Project(韩国科学技术院人工智能项目)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 AgentRVOS通过结合SAM3和MLLM的优势,提出无需训练的管道,利用生成的掩码跟踪提供可靠的时空信息,通过查询引导的推理实现零样本视频对象分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23478 2026-03-25 cs.CV 57%

UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation

UniFunc3D: 统一的主动空间-时间接地用于3D功能分割

Jiaying Lin, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 UniFunc3D通过统一框架实现3D场景功能分割,利用多模态大语言模型作为主动观察者,结合语义、时间和空间推理,提升任务分解的准确性与效率,实现优于其他方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23186 2026-03-25 cs.CV 57%

ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting

ViKey:通过视觉提示增强视频中的时间理解

Yeonkyung Lee, Dayun Ju, Youngmin Kim, Seil Kang, Seong Jae Hwang

机构 * Yonsei University(延世大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ViKey通过视觉提示和轻量级关键词-帧映射模块提升视频模型的时间推理能力,在减少帧数的情况下保持性能。

Comments accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22953 2026-03-25 cs.CV 57%

Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining

基于簇的时空掩码用于高效的视频-语言预训练

Weijun Zhuang, Yuqing Huang, Weikang Meng, Xin Li, Ming Liu, Xiaopeng Hong, Yaowei Wang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ClusterSTM策略,通过簇内掩码保留关键时空信息,提升视频-语言预训练效率,并在多任务上取得新状态。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11336 2026-03-25 cs.CV 57%

UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models

UFVideo:迈向统一的细粒度视频协作理解的大型语言模型

Hewen Pan, Cong Wei, Dashuang Liang, Zepeng Huang, Pengfei Gao, Ziqi Zhou, Lulu Xue, Pengfei Yan, Xiaoming Wei, Minghui Li, Shengshan Hu

机构 * Huazhong University of Science and Technology(华中科技大学) Meituan(美团)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 UFVideo通过统一多粒度协作理解能力,实现视频理解的全面覆盖,展示了其在多粒度视频任务中的灵活性和优势。

Comments CVPR 2026 Camera Ready, Github Code: https://github.com/Heven-Pan/UFVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03405 2026-03-25 cs.CV 57%

ViDiC: Video Difference Captioning

ViDiC:视频差异描述

Jiangtao Wu, Shihao Li, Zhaozhou Bian, Jialu Chen, Runzhe Wen, An Ping, Yiwen He, Jiakai Wang, Yuanxing Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ViDiC任务及ViDiC-1K数据集,旨在评估多模态大语言模型对视频对相似性与差异性的细粒度描述能力,揭示现有模型在比较描述和差异感知上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20066 2026-03-24 cs.CV 57%

PAUL: Uncertainty-Guided Partition and Augmentation for Robust Cross-View Geo-Localization under Noisy Correspondence

PAUL:基于不确定性的分区与增强以实现在噪声对应下的鲁棒跨视图地理定位

Zheng Li, Xueyi Zhang, Yanming Guo, Yuxiang Xie, Ding Zhaoyun, Siqi Cai, Haizhou Li, Mingrui Lao

机构 * National University of Defense Technology(国防科技大学) Shenzhen Loop Area Institute(深圳河套学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出PAUL框架,通过不确定性感知的共增强和证据共训练,解决跨视图地理定位中的噪声对应问题,提升鲁棒性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20887 2026-03-24 cs.CV 57%

Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning

基于场景图的细粒度SegCaptioning Transformer用于可控视频分割与标注

Xu Zhang, Jin Yuan, BinHong Yang, Xuan Liu, Qianjun Zhang, Yuyi Wang, Zhiyong Li, Hanwang Zhang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) School of Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人学院和机器人视觉感知与控制技术国家工程研究中心,湖南大学) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) CRRC Zhuzhou Institute Company Ltd.(中车株洲院有限公司) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出可控视频分割与标注任务,通过Scene Graph-guided Fine-grained SegCaptioning Transformer框架,结合提示引导时间图模块和细粒度掩码-语言解码器,实现用户意图的精准捕捉与多模态输出生成。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05175 2026-03-24 cs.CV 57%

VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice

VideoAuto-R1:通过一次推理、两次回答实现视频自动推理

Shuming Liu, Mingchen Zhuge, Changsheng Zhao, Jun Chen, Lemeng Wu, Zechun Liu, Chenchen Zhu, Zhipeng Cai, Chong Zhou, Haozhe Liu, Ernie Chang, Saksham Suri, Hongyu Xu, Qi Qian, Wei Wen, Balakrishnan Varadarajan, Zhuang Liu, Hu Xu, Florian Bordes, Raghuraman Krishnamoorthi, Bernard Ghanem, Vikas Chandra, Yunyang Xiong

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Princeton University(普林斯顿大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VideoAuto-R1框架,通过一次推理两次回答策略提升视频理解效率,实现准确率和效率的双重提升。

Comments Accepted to CVPR 2026. Project page: https://ivul-kaust.github.io/projects/videoauto-r1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05105 2026-03-24 cs.CV 57%

UniLiPs: Unified LiDAR Pseudo-Labeling with Geometry-Grounded Dynamic Scene Decomposition

UniLiPs: 基于几何引导的动态场景分解的统一激光雷达伪标签方法

Filippo Ghilotti, Samuel Brucker, Nahku Saidy, Matteo Matteucci, Mario Bijelic, Felix Heide

机构 * TORC Robotics(TORC机器人公司) Politecnico of Milan(米兰理工学院) Princeton University(普林斯顿大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出UniLiPs方法,通过利用激光雷达扫描的时空几何一致性,将文本和2D视觉模型的线索直接融合到3D中,生成3D语义标签、包围盒和密集点云,验证了其在三个数据集上的鲁棒性。

Journal ref Proceedings of the International Conference on 3D Vision (3DV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12656 2026-03-24 cs.CV 57%

SPKLIP: Aligning Spike Video Streams with Natural Language

SPKLIP:通过自然语言对齐尖峰视频流

Yongchang Gao, Meiling Jin, Zhaofei Yu, Tiejun Huang, Guozhang Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SPKLIP提出了一种专门用于尖峰视频-语言对齐的架构,通过分层尖峰特征提取器和尖峰-文本对比学习实现多尺度时间动态建模,并在稀疏异步输出上实现高效的少样本学习。

Comments A dataset partitioning error occurred and is being corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20186 2026-03-23 cs.CV 57%

Improving Image-to-Image Translation via a Rectified Flow Reformulation

通过修正流重新公式化改进图像到图像转换

Satoshi Iizuka, Shun Okamoto, Kazuhiro Fukui

机构 * University of Tsukuba(茨口大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出I2I-RFR方法,通过将标准图像到图像回归网络重新解释为连续时间传输模型,提升图像转换性能,保留传统监督训练流程,增强感知质量和细节保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06344 2026-03-23 cs.CV cs.LG 57%

Hyper-STTN: Hypergraph Augmented Spatial-Temporal Transformer Network for Trajectory Prediction

Hyper-STTN:基于超图的时空变换网络用于轨迹预测

Weizheng Wang, Baijian Yang, Sungeun Hong, Wenhai Sun, Byung-Cheol Min

机构 * School of Applied and Creative Computing, Purdue University(普渡大学应用与创意计算学院) Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(印第安纳大学布卢明顿分校计算机科学系和智能系统工程系) Department of Applied Artificial Intelligence, Sungkyunkwan University(成均馆大学应用人工智能系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Hyper-STTN,通过构建多尺度超图和时空变换器,有效建模人群轨迹预测中的群体和个体交互,实验表明其优于现有方法。

Comments To appear in ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19571 2026-03-23 cs.CV 57%

CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management

CurveStream: 通过曲率感知的层次视觉记忆管理提升MLLMs在流媒体视频理解中的性能

Chao Wang, Xudong Tan, Jianjian Cao, Kangcong Li, Tao Chen

机构 * College of Future Information Technology, Fudan University(未来信息科技学院,复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 CurveStream通过曲率感知的层次视觉记忆管理框架,在流媒体视频理解中实现显著性能提升,实验表明其在多个基准测试中均优于现有方法,达到新状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19481 2026-03-23 cs.CV 57%

Narrative Aligned Long Form Video Question Answering

叙事对齐的长视频问答

Rahul Jain, Keval Doshi, Burak Uzkent, Garin Kessler

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出NA-VQA基准,评估长视频中的深度时间与叙事推理能力,通过88部完整电影和4.4K开放性问题测试模型整合分散叙事信息的能力,提出Video-NaRA框架提升远距离推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10518 2026-03-23 cs.CV 57%

VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning

VR-Thinker: 通过图像推理提升视频奖励模型

Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

机构 * CUHK MMLab(香港中文大学多模态实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Nanjing University(南京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VR-Thinker框架,通过图像推理操作和可配置视觉记忆窗口提升视频奖励模型的推理精度与可靠性,实现在视频偏好基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18758 2026-03-20 cs.HC cs.CV cs.SD 57%

Dual-Model Prediction of Affective Engagement and Vocal Attractiveness from Speaker Expressiveness in Video Learning

双模型预测视频学习中说话者表达性对情感参与和语音吸引力的影响

Hung-Yue Suen, Kuo-En Hung, Fan-Hsun Tseng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于说话者情感表达的双回归模型,利用大规模在线课程数据预测观众情感参与和语音吸引力,验证说话者多模态特征可预测观众反馈。

Comments Preprint. Accepted for publication in IEEE Transactions on Computational Social Systems

Journal ref IEEE Transactions on Computational Social Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18649 2026-03-20 cs.CV 57%

Click-to-Ask: An AI Live Streaming Assistant with Offline Copywriting and Online Interactive QA

点击提问:一种带有离线文案生成和在线交互问答的AI直播助手

Ruizhi Yu, Keyang Zhong, Peng Liu, Qi Wu, Haoran Zhang, Yanhao Zhang, Chen Chen, Haonan Lu

机构 * East China normal University(东中国正常大学) Sun Yat-sen University(孙中山大学) OPPO AI Center(OPPO AI中心) Shenzhen Institutes of Advanced Technology(深圳先进技术研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Click-to-Ask系统,通过离线处理多模态产品信息生成结构化数据和合规文案,结合在线实时问答模块提升直播电商效率和观众互动性。

Comments 4 pages, 2 figures, Accepted at WWW2026 Demos

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21782 2026-03-20 cs.CV 57%

Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding

Mobile-VideoGPT:用于移动视频理解的高效模型

Abdelrahman Shaker, Muhammad Maaz, Chenhui Gou, Hamid Rezatofighi, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) Monash University(莫纳什大学) Linköping University(利尔贝里大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Mobile-VideoGPT,一种轻量级多模态框架,通过高效编码器、投影器和小语言模型实现快速推理,提升移动视频理解效率。

Comments Technical Report. Project: https://amshaker.github.io/Mobile-VideoGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00960 2026-03-20 cs.CV 57%

Efficient and Scalable Monocular Human-Object Interaction Motion Reconstruction

高效且可扩展的单目人类-物体交互运动重建

Boran Wen, Ye Lu, Sirui Wang, Keyan Wan, Jiahong Zhou, Junxuan Liang, Xinpeng Liu, Bang Xiao, Ruiyang Liu, Yong-Lu Li

机构 * SJTU(上海交通大学) SII(上海信息院) FDU(福建大学) BJTU(北京理工大学) ZJU(浙江大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种高效的稀疏接触标注方法和InterPoint多模态预测器,结合4DHOISolver框架,构建了大规模4D HOI数据集,并通过强化学习验证了运动重建的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02535 2026-03-20 cs.CV 57%

Video Anomaly Detection with Semantics-Aware Information Bottleneck

基于语义感知信息瓶颈的视频异常检测

Juntong Li, Lingwei Dang, Qingxin Xiao, Shishuo Shang, Jiajia Cheng, Haomin Wu, Yun Hao, Qingyao Wu

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SIB-VAD框架,通过自适应信息瓶颈过滤和语义增强方法,解决视频异常检测中正常与异常边界模糊和低级特征难以捕捉高级语义异常的问题。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17930 2026-03-19 cs.CV 57%

Interpretable Traffic Responsibility from Dashcam Video via Legal Multi Agent Reasoning

基于法律多智能体推理的可解释交通责任分析

Jingchun Yang, Jinchang Zhang

机构 * Northeast University(东北大学) SUNY Binghamton University(纽约州立大学布法罗分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出C-TRAIL多模态数据集,结合视频与文本描述,通过两阶段框架实现交通责任判定,优于现有方法并提供透明法律推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14827 2026-03-19 cs.CV 57%

SemanticFace: Semantic Facial Action Estimation via Semantic Distillation in Interpretable Space

SemanticFace: 通过可解释空间中的语义蒸馏进行语义面部动作估计

Zejian Kang, Kai Zheng, Yuanchen Fei, Wentao Yang, Hongyuan Zou, Xiangru Huang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Hunan University(湖南大学) The University of Hong Kong(香港大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SemanticFace通过语义蒸馏在可解释空间中估计面部动作,提升系数精度和可解释性,实现跨身份泛化和抗域移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18886 2026-03-19 cs.CV 57%

MagicWorld: Towards Long-Horizon Stability for Interactive Video World Exploration

MagicWorld: 向交互视频世界探索的长时稳定迈进

Guangyuan Li, Bo Li, Jinwei Chen, Xiaobin Hu, Lei Zhao, Peng-Tao Jiang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo蓝影实验室,vivo移动通信有限公司) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MagicWorld模型,通过引入流引导运动保留约束和增强交互训练策略,解决复杂环境中运动漂移和长时交互误差累积问题,并构建RealWM120K数据集验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13397 2026-03-18 cs.CV 57%

TennisExpert: Towards Expert-Level Analytical Sports Video Understanding

TennisExpert: 向专家级分析体育视频理解迈进

Zhaoyu Liu, Xi Weng, Lianyu Hu, Zhe Hou, Kan Jiang, Jin Song Dong, Yang Liu

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Griffith University(格里菲斯大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TennisExpert框架,通过整合视频语义解析器和基于Qwen3-VL-8B的记忆增强模型,实现高效多模态网球理解,提升战术分析和比赛动态捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23359 2026-03-18 cs.CV 57%

VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?

VideoReasonBench: 大规模语言模型能否进行以视觉为中心的复杂视频推理?

Yuanxin Liu, Kun Ouyang, Haoning Wu, Yi Liu, Lin Sui, Xinhao Li, Yan Zhong, Y. Charles, Xinyu Zhou, Xu Sun

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Moonshot AI Nanjing University(南京大学) School of Mathematical Sciences, Peking University(数学科学学院,北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VideoReasonBench评估了基于视觉的复杂视频推理能力,发现大多数先进多模态语言模型在复杂视频推理任务上表现不佳,而增强推理能力的Gemini-2.5-Pro表现突出。

Comments Project Page: https://llyx97.github.io/video_reason_bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15167 2026-03-17 cs.CV 57%

Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding

基于记忆反馈的问题引导视觉压缩用于长期视频理解

Sosuke Yamao, Natsuki Miyahara, Yuankai Qi, Shun Takeuchi

机构 * Fujitsu Research(富士通研究实验室) Macquarie University(麦考瑞大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出QViC-MF框架,通过问题引导的多模态选择性注意力和记忆反馈提升长期视频理解性能,在多个基准测试中取得显著提升。

Comments Accepted to CVPR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15153 2026-03-17 cs.CV 57%

TextOVSR: Text-Guided Real-World Opera Video Super-Resolution

TextOVSR: 基于文本引导的现实世界歌剧视频超分辨率

Hua Chang, Xin Xu, Wei Liu, Jiayi Wu, Kui Jiang, Fei Ma, Qi Tian

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System(湖北省智能信息处理与实时工业系统重点实验室) Harbin Institute of Technology Zhengzhou Research Institute(哈尔滨工业大学郑州研究所) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Huawei Technologies Ltd(华为技术有限公司)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对歌剧视频因早期拍摄设备限制和长期存储退化导致的视觉质量差问题,本文提出TextOVSR网络,通过引入两种文本提示引导超分辨率过程,结合文本增强判别器和降质鲁棒特征融合模块,提升纹理重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 57%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14935 2026-03-17 cs.CV 57%

Video-CoE: Reinforcing Video Event Prediction via Chain of Events

Video-CoE:通过事件链强化视频事件预测

Qile Su, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里妈妈,阿里巴巴集团)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 本文提出Video-CoE方法,通过构建时间事件链提升视频事件预测的准确性,实验表明其优于现有主流大语言模型。

Comments 21 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏