arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-08 至 2026-06-08 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2601.22574 2026-06-08 cs.CV cs.AI 版本更新 57%

Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models

增强视频表示中的时空语义残差以缓解视频大型多模态模型中的幻觉

Yuansheng Gao, Jinman Zhao, Tong Zhang, Xingguo Xu, Wenbin Xing, Han Bao, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) University of Toronto(多伦多大学) Dalian University of Technology(大连理工大学) Sun Yat-sen University(中山大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出ViSSRes方法,通过轻量级MLP网络学习视频表示的残差,从时空和语义一致性优化,在推理时仅需单次前向传播,有效降低幻觉率并提升视频理解性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2602.15287 2026-06-08 cs.CV 版本更新 83%

Consistency-Preserving Diverse Video Generation

保持一致性的多样化视频生成

Xinshuang Liu, Runfa Blark Li, Truong Nguyen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出一种联合采样框架,在保持时间一致性的同时提高文本到视频生成中批次内视频的多样性,通过轻量级潜在空间模型避免视频解码和反向传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06042 2026-06-08 cs.CV 版本更新 79%

LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing

LoomVideo: 统一多模态输入到视频生成与编辑

Jianzong Wu, Hao Lian, Jiongfan Yang, Dachao Hao, Ye Tian, Yunhai Tong, Jingyuan Zhu, Biaolong Chen, Qiaosong Qi, Aixi Zhang, Wanggui He, Mushui Liu, Jinlong Liu, Pipei Huang, Hao Jiang

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出LoomVideo,一种5B参数的高效统一架构,通过多模态大语言模型和零开销Scale-and-Add条件机制,实现视频生成与编辑,显著降低计算复杂度并加速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2604.10578 2026-06-08 cs.CV 版本更新 79%

Rein3D: Reinforced 3D Indoor Scene Generation with Panoramic Video Diffusion Models

Rein3D: 基于全景视频扩散模型的强化3D室内场景生成

Dehui Wang, Rong Wei, Yue Shi, Congsheng Xu, Shoufa Chen, Dingxiang Luo, Tianshuo Yang, Xiaokang Yang, Wei Sui, Yusen Qin, Rui Tang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Manycore Tech Inc.(Manycore科技公司) D-Robotics The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出Rein3D框架,结合3D高斯泼溅与视频扩散模型,通过“恢复-细化”范式从稀疏输入生成全局一致的360度室内场景,并构建PanoV2V-15K数据集,显著提升长距离相机探索效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02919 2026-06-08 cs.CV 版本更新 57%

Pixel Cube: Diffusion-based Portrait Video Relighting Through Realistic Lighting Reproduction

Pixel Cube: 基于扩散的肖像视频重光照通过真实感光照再现

Yufan Zhang, Yu Ji, Ayo Ajiboye, Rundi Wu, Yu Guo, Changxi Zheng, Jinwei Ye

机构 * George Mason University(乔治·马歇尔大学) LightThought LLC Columbia University(哥伦比亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出一种基于扩散的方法,利用混合训练数据集和HDR环境图控制,实现动态肖像视频的真实感重光照,保持时间一致性和身份特征。

Comments ACM SIGGRAPH 2026 Journal Track / ACM Transactions on Graphics, 17 pages. Project page: https://yufanzhang82.github.io/PixelCube/

Journal ref ACM Trans. Graph. 45, 4, Article 119 (July 2026), 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他视频模型 1 篇

2602.01740 2026-06-08 cs.AI cs.CV cs.LG 版本更新 57%

MACD: Model-Aware Contrastive Decoding via Counterfactual Data

MACD:基于反事实数据的模型感知对比解码

Qixin Xiao, Kun Zhou

机构 * University of Michigan, Ann Arbor, MI, USA(密歇根大学,安娜堡分校) University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校)

专题命中 其他视频模型 :video language model(abstract);分类 cs.CV

AI总结 提出MACD方法,利用视频语言模型自身反馈识别导致幻觉的目标区域,生成目标级反事实输入,结合对比解码减少幻觉,提升多模型在复杂场景下的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏