arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-29 至 2026-06-29 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2606.27999 2026-06-29 cs.CV 新提交 57%

HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

HumanMoveVQA:视频多模态大语言模型能否推理视频中的人类运动?

Pulkit Gera, Faegheh Sardari, Asmar Nadeem, Valentina Bono, Padraig Boulton, Adrian Hilton, Armin Mustafa

机构 * CVSSP, University of Surrey, Guildford, UK(萨里大学视觉、语音与信号处理中心,英国吉尔福德) Tesco, UK(乐购,英国)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出HumanMoveVQA基准,通过世界坐标系下的3D运动轨迹生成问答对,评估视频MLLM在全局轨迹和方向推理上的能力,发现现有模型存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27777 2026-06-29 cs.CV 新提交 57%

TRUST: Efficient Abdominal Trauma Recognition via Image-to-Ultrasound-Video Transfer Learning

TRUST:通过图像到超声视频迁移学习实现高效腹部创伤识别

Enguang Wang, Hao Zhou, Shuo Gao, Tuo Liu, Guangquan Zhou

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) Nanjing Medical University First Affiliated Hospital(南京医科大学第一附属医院) Jiangsu Key Laboratory of Biomaterials and Devices, Southeast University(江苏省生物材料与器件重点实验室,东南大学) State Key Laboratory of Digital Medical Engineering, Southeast University(数字医学工程国家重点实验室,东南大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出TRUST框架,通过跨频协作适配器、多粒度运动感知模块和视觉查询语义聚合,解决超声视频中时空变化和语义差异问题,在腹部创伤数据集上性能提升9.63%。

Comments Accepted to MICCAI 2026, 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2606.27964 2026-06-29 cs.CV 新提交 79%

Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control

Directing the World: 具有组合式人体-相机控制的快速自回归视频生成

Haoyuan Wang, Yabo Chen, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出一种快速自回归框架,通过解耦控制学习并保持统一视频先验,实现人体运动和相机轨迹的组合控制,支持稳定长程生成与高视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18610 2026-06-29 cs.RO cs.CV 新提交 79%

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28128 2026-06-29 cs.CV cs.AI cs.RO 新提交 70%

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

PhysisForcing:面向机器人操作的物理增强世界模拟器

Peiwen Zhang, Yufan Deng, Shangkun Sun, Juncheng Ma, Duomin Wang, Jonas Du, Zilin Pan, Ye Huang, Hao Liang, Songyan Huang, Ruihua Zhang, Enze Xie, Ming-Yu Liu, Daquan Zhou

机构 * Peking University(北京大学) NVIDIA(英伟达)

专题命中 视频生成 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 针对视频生成模型在机器人操作模拟中物理不稳定的问题,提出PhysisForcing框架,通过像素级轨迹对齐和语义级关系对齐损失联合优化,显著提升物理一致性,在多个基准上改进基础模型,并提高下游策略成功率。

Comments Github: https://github.com/DAGroup-PKU/PhysisForcing Project website: https://dagroup-pku.github.io/PhysisForcing.github.io/#

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28026 2026-06-29 cs.CV 新提交 57%

EMOSH: Expressive Motion and Shape Disentanglement for Human Animation

EMOSH:用于人体动画的表现性运动与形状解耦

Dongbin Zhang, Hao Liu, Binquan Dai, Kangjie Chen, Chuming Wang, Chen Li, Jing Lyu, Haoqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出EMOSH框架,通过可表现人体模型解耦形状与姿态,结合粗细混合运动注入和空间对齐条件机制,实现高保真、可控的人体视频生成,解决运动-形状纠缠问题。

Comments Accepted to ECCV 2026, Project Page: https://eastbeanzhang.github.io/EMOSH/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2606.28237 2026-06-29 cs.RO 新提交 50%

Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors

释放无限运动:通过生成式视频先验扩展富有表现力的四足运动

Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 提出Uni-Mo全自动流水线,利用LLM和视频扩散模型生成四足机器人运动数据,通过身份一致性损失提取3D轨迹,训练真实机器人跟踪策略,并发布包含7488个语言标注运动的数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2606.27504 2026-06-29 cs.CV 新提交 57%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2606.28163 2026-06-29 eess.IV cs.CV 新提交 62%

Enhanced Neural Video Representation Compression across Extreme Complexity and Quality Scales

跨极端复杂度和质量尺度的增强型神经视频表示压缩

Ho Man Kwan, Tianhao Peng, Fan Zhang, Mike Nilsson, Andrew Gower, David Bull

机构 * Visual Information Lab, University of Bristol, UK(布里斯托大学视觉信息实验室,英国) Network Connectivity Services Research, BT, UK(BT公司网络连接服务研究,英国)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV

AI总结 提出NVRC++,一种基于隐式神经表示的轻量级视频编解码器,通过多分辨率特征网格和高效优化框架,在多种复杂度级别下实现宽比特率范围的高质量压缩,支持实时解码。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2606.26551 2026-06-29 cs.CV 新提交 57%

PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing

PhyEditBench: 一个用于物理感知图像编辑的真实世界多阶段基准

Shengbin Guo, Shaokang He, Chaoyue Meng, Shengpeng Xiao, Xunzhi Xiang, Shaofeng Zhang, Qi Fan

机构 * Nanjing University(南京大学) SDU(山东大学) HRBEU(哈尔滨工程大学) SDUTCM(山东中医药大学) USTC(中国科学技术大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 提出PhyEditBench基准,通过分层分类和真实/反物理实例评估编辑模型的物理理解能力,并引入训练无关基线PhyWorld利用视频生成推理。

Comments 19 pages, 6 figures, 2 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏