arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-01 至 2026-07-01 共收录 24 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 6 篇

2606.27922 2026-07-01 cs.CV cs.AI 新提交 88%

Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding

Reflect-R1:长视频理解中基于证据驱动的自纠正反思

Shuimu Chen, Yuteng Chen, Yuanshen Guan, Zebang Cheng, Zeyu Zhang, Shengqian Qin, Bin Xia, Jiaran Li, Wenming Yang, Fei Ma

机构 * Tsinghua University(清华大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) University of California(加利福尼亚大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出Reflect-R1框架,通过直觉、验证、仲裁三阶段管道动态检索客观视觉证据,并设计阶段解耦强化学习算法SD-GRPO解决策略耦合,在长视频理解基准上达到最优性能。

Comments 2026 ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31326 2026-07-01 cs.CV 新提交 83%

Bridging Video Understanding and Generation in a Unified Framework

桥接视频理解与生成的统一框架

Yuqi Wang, Runyi Li, Ruoyu Feng, Renjie Chen, Wenfeng Lin, Mingyu Guo

专题命中 视频理解 :video understanding(title,abstract);video generation(abstract);分类 cs.CV

AI总结 提出Vega统一框架,通过共享词汇表联合建模文本与视觉表示,结合自回归预测关键帧语义令牌与扩散模型渲染密集视频帧,在视频生成和理解基准上均取得强性能。

Comments technical blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18242 2026-07-01 cs.CV 版本更新 83%

EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning

EgoVITA:学习规划与验证以实现自我中心视频推理

Yogesh Kulkarni, Pooyan Fazli

专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 提出EgoVITA框架,通过先规划自我中心动作序列再以第三方视角验证时空一致性的方法,提升自我中心视频推理的准确性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31245 2026-07-01 cs.CV 新提交 79%

HyperVLP: Enhancing Hierarchical Surgical Video-Language Pre-training in Hyperbolic Space

HyperVLP: 在双曲空间中增强层次化手术视频-语言预训练

Yaojun Hu, Kun Yuan, Nassir Navab, Haochao Ying, Jian Wu, Nicolas Padoy

机构 * Zhejiang University(浙江大学) University of Strasbourg, CNRS, INSERM, ICube, UMR7357(斯特拉斯堡大学,CNRS,INSERM,ICube,UMR7357) IHU Strasbourg(斯特拉斯堡IHU) Technical University of Munich(慕尼黑工业大学)

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

AI总结 提出双曲空间手术视频-语言预训练框架HyperVLP,通过保留层次结构、缓解结构假负例并强制父子语义一致性,提升零样本和少样本手术阶段识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31933 2026-07-01 cs.CV 新提交 70%

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

无处可藏:基于背景控制对的视频幻觉基准测试

Haojian Huang, Harold Haodong Chen, Meng Luo, Junjia Du, Shanqing Xu, Ziheng Chen, Yanxiang Huang, Yinchuan Li, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Knowin AI(考恩人工智能) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 提出VidPair-Halluc基准,通过背景相似但前景语义不同的视频对,精确评估大型视频模型中的视频幻觉,包含1K对抗视频对和11K时空问答对。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31249 2026-07-01 cs.CV 新提交 57%

Rethinking the Role of Feature Engineering and Learning Strategies in Few-Shot Hidden Emotion Recognition

重新思考特征工程与学习策略在少样本隐藏情感识别中的作用

Xiaochuan Guo, Jihao Gu, Haixu Liu, Yuxin Liu, Qi Wang, Yufei Wang, Fei Wang, Kun Li, Dan Guo

机构 * Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) The University of Sydney(悉尼大学) Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯光科技有限公司) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Beihang University(北京航空航天大学) The University of New South Wales(新南威尔士大学) United Arab Emirates University(阿拉伯联合酋长国大学)

专题命中 视频理解 :long video(abstract);分类 cs.CV

AI总结 提出跨注意力机制与多实例学习框架,利用多源特征(2D/3D骨架、面部Blendshapes、DINOv2/v3、X-CLIP、Gemini)解决长视频中弱稀疏隐式情感识别,在IJCAI挑战赛Track 3中获第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 7 篇

2603.13402 2026-07-01 cs.CV cs.LG 版本更新 83%

Event-Driven Video Generation

事件驱动视频生成

Chika Maduabuchi, Jindong Wang

机构 * William & Mary(威廉与玛丽学院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出事件驱动视频生成(EVD),通过轻量级头部预测令牌级事件活动,并利用事件门控采样在交互区域集中更新,以修正对象交互错误,提升状态持久性、空间准确性和接触稳定性。

Comments Accepted to ECCV 2026. Project webpage: https://evd-project-website.pages.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30811 2026-07-01 cs.CV cs.MM cs.SD eess.AS 新提交 81%

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

AVTok: 用于整体音视频生成的1D统一分词化

Kien T. Pham, I Chieh Chen, Qifeng Chen, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 提出AVTok统一分词器,采用双流Transformer架构和分层训练策略,将音视频对编码为紧凑的一维潜在表示,在音视频重建及下游生成任务中表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22905 2026-07-01 cs.CV 新提交 79%

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

InteractiveAvatar: 用于一致且意图感知的虚拟形象的实时流式视频生成

Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能科技(北京)有限公司) Wuhan University(武汉大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出InteractiveAvatar框架,通过自回归蒸馏实现实时无限流式生成,利用长短视觉记忆机制保持视觉一致性,并设计推理反应模块实现意图感知交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21466 2026-07-01 cs.CV 版本更新 74%

StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation

StreamGVE: 无需训练的视频编辑通过少步流式视频生成

Guanlong Jiao, Chenyangguang Zhang, Jia Jun Cheng Xian, Zewei Zhang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) ETH Zürich(苏黎世联邦理工学院) McMaster University(麦马斯特大学) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出StreamGVE,一种基于噪声到数据视角的视频编辑方法,通过引入双分支快速采样和自注意力桥接以及交叉注意力接地/增强,实现了高效的视频编辑,能够在少步设置中优于现有方法。

Comments ECCV 2026. Project Page: https://dsl-lab.github.io/StreamEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17461 2026-07-01 cs.CV 版本更新 74%

AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

AR-CoPO: 利用对比策略优化对齐自回归视频生成

Dailan He, Guanlin Feng, Xingtong Ge, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Vivix Group Limited(Vivix集团有限公司) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(InnoHK下的CPII)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出AR-CoPO框架,通过分叉机制构建邻域候选、分块级对齐和半在线训练策略,解决流式自回归视频生成中RLHF对齐难题,提升跨域泛化与人类偏好对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24336 2026-07-01 cs.CV 新提交 57%

TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration

TIGER:驯服身份、几何和生成先验以实现高质量人脸视频恢复

Yang Zhou, Wenxue Li, Peng Zhang, Yifei Chen, Fei Wang, Daiguo Zhou

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出TIGER框架,融合身份、几何和生成先验,通过解耦3D参数空间和一步整流流,解决人脸视频恢复中的身份偏移、视角纠缠和感知真实性问题,实现高保真、时间一致且高效的恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02376 2026-07-01 cs.HC 版本更新 50%

Talking Surveys: How Photorealistic Embodied Conversational Agents Shape Response Quality, Engagement, and Satisfaction

对话式调查:逼真的具身对话代理如何影响回答质量、参与度和满意度

Matus Krajcovic, Peter Demcak, Eduard Kuric

专题命中 视频生成 :video generation(abstract)

AI总结 研究提出一种集成AI驱动视频生成、语音识别和大语言模型的虚拟化身对话调查工具,实验表明具身代理能显著提升回答信息量和详细度,提高参与效率,但对满意度无显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 7 篇

2603.14965 2026-07-01 cs.CV 版本更新 79%

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS: 基于几何的视频扩散模型用于新视角合成

Minjun Kang, Inkyu Shin, Taeyeop Lee, Myungchul Kim, In So Kweon, Kuk-Jin Yoon

机构 * KAIST, South Korea(韩国科学技术院) Luma AI, USA(Luma AI(美国))

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。

Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16271 2026-07-01 cs.CV 版本更新 57%

VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment

VIGOR: 面向视频几何的时序生成对齐奖励

Tengjiao Yin, Jinglei Shi, Heng Guo, Xi Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出基于几何的奖励模型,利用预训练几何基础模型通过跨帧重投影误差评估多视图一致性,以点方式计算误差,并引入几何感知采样策略,通过后训练和推理时优化对齐视频扩散模型,提升生成视频的几何一致性。

Comments Project Page: https://vigor-geometry-reward.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06136 2026-07-01 cs.CV 版本更新 57%

Cross-Resolution Distribution Matching for Diffusion Distillation

跨分辨率分布匹配的扩散蒸馏

Feiyang Chen, Hongpeng Pan, Haonan Xu, Xinyu Duan, Zhefeng Wang, Yang Yang

机构 * Huawei(华为) Nanjing University of Science and Technology(南京理工大学) HiThink Research(海康研究院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 提出跨分辨率分布匹配蒸馏(RMD)框架,通过logSNR映射和分布匹配弥合分辨率间隙,实现高保真、少步数多分辨率级联推理,在SDXL和Wan2.1-14B上分别加速33.4倍和25.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05851 2026-07-01 cs.CV 版本更新 57%

VS3R: Robust Full-frame Video Stabilization via Deep 3D Reconstruction

VS3R:基于深度三维重建的鲁棒全帧视频稳定

Muhua Zhu, Xinhao Jin, Xinping Wang, Yu Zhang, Yifei Xue, Tie Ji, Yizhen Lao

机构 * Hunan University(湖南大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出VS3R框架,结合前馈三维重建与生成式视频扩散,通过联合估计相机参数、深度和掩码,并引入混合稳定渲染模块和稳定驱动扩散模型,实现高保真全帧视频稳定,在鲁棒性和视觉质量上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新 57%

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19778 2026-07-01 cs.CV 版本更新 57%

Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer

相位对齐的混合分辨率扩散Transformer旋转位置编码

Haoyu Wu, Jingyi Xu, Qiaomu Miao, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 针对混合分辨率token在RoPE中注意力分数异常的问题,提出无训练机制PMA,通过统一位置尺度稳定注意力,并引入边界细化模块提升局部连贯性,在图像和视频扩散模型中提升视觉质量与计算效率。

Comments Accepted to ECCV 2026. Project page: https://hao-yu-wu.github.io/mixed_res/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21210 2026-07-01 cs.LG cs.CE 版本更新 50%

Pretrained Video Models as Differentiable Physics Simulators for Urban Wind Flows

预训练视频模型作为可微物理模拟器用于城市风流

Janne Perini, Rafael Bischof, Moab Arar, Ayça Duran, Michael A. Kraus, Siddhartha Mishra, Bernd Bickel

机构 * ETH Zurich(苏黎世联邦理工学院) Tel Aviv University(特拉维夫大学) TU Darmstadt(达姆施塔特工业大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出WinDiNet,一种预训练视频扩散模型,用于快速模拟城市风流,通过反向传播优化建筑布局以提升风安全性和行人舒适度。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 2 篇

2606.31187 2026-07-01 cs.CV 新提交 57%

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31101 2026-07-01 cs.RO 新提交 50%

Efficient Sim-to-Real Transfer of World-Action Models from Synthetic Priors

基于合成先验的世界-动作模型的高效仿真到现实迁移

Zixing Wang, Kausik Sivakumar, Jinghuan Shang, Yafei Hu, Zhaoming Xie, Ran Gong, Xiaohan Zhang, Karl Schmeckpeper

机构 * Purdue University(普渡大学) Robotics and AI Institute(机器人与人工智能研究所)

专题命中 动作与事件理解 :video diffusion(abstract)

AI总结 本文研究从合成先验训练世界-动作模型并零样本部署到真实机器人操作,通过域随机化和AnyTask运动规划生成演示,首次成功实现仿真到现实的迁移。

Comments This work is accepted by CVPR'26, Embodied AI Workshop. This paper represent a part of early result of our official world-action model zero-shot sim-to-real transfer work, which will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2606.31734 2026-07-01 cs.CV 新提交 70%

MemLearner: Learning to Query Context memory for Video World Models

MemLearner: 学习查询上下文记忆用于视频世界模型

Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

专题命中 长视频与时序推理 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 提出基于学习的自适应上下文查询方法MemLearner,利用视频生成模型自身进行上下文记忆查询,解决视频世界模型在遮挡和动态场景下的场景一致性问题。

Comments ECCV 2026, Project Page: https://yujiwen.github.io/memlearner/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2603.10652 2026-07-01 cs.CV cs.AI 版本更新 74%

Are Video Reasoning Models Ready to Go Outside?

视频推理模型是否已准备好走向户外?

Yangfan He, Changgyu Boo, Jaehong Yoon

机构 * NTU Singapore(新加坡国立大学) Korea University(韩国大学)

专题命中 视频数据与评测 :video reasoning(title);分类 cs.CV

AI总结 本文提出ROVA框架,通过时空腐蚀建模提升模型鲁棒性,并引入PVRBench基准测试真实环境扰动下的性能,验证了ROVA在准确性和推理质量上的显著提升。

Comments Project Page: https://robust-video-reason.github.io/, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏