arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-08 至 2026-07-08 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 1 篇

2604.13030 2026-07-08 cs.CV 版本更新 70%

Generative Refinement Networks for Visual Synthesis

生成细化网络用于视觉合成

Jian Han, Jinlai Liu, Jiahuan Wang, Bingyue Peng, Zehuan Yuan

机构 * ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出生成细化网络(GRN),通过近无损分层二进制量化解决离散化瓶颈,结合全局细化机制和熵引导采样策略,提升图像生成质量与效率。

Comments code: https://github.com/bytedance/GRN

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长视频与时序推理 1 篇

2511.17649 2026-07-08 cs.CV cs.AI cs.RO 版本更新 57%

SWITCH: Benchmarking Modeling and Handling of Tangible Interfaces in Long-horizon Embodied Scenarios

SWITCH:在长时程具身场景中评估和处理具象接口的基准测试

Juntao Cheng, Wanyue Zhang, Zhiwei Yu, Shuo Ren, Zheqi He, Shaoxuan Xie, Guocai Yao, Jieru Lin, Börje F. Karlsson, Jiajun Zhang

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 SWITCH基准测试通过1170个时间交互视频,评估具象接口在真实第一人称环境中的闭环交互推理,揭示多模态模型在细粒度视觉-时间感知、结果验证和错误恢复方面的不足。

Comments The dataset is available at https://huggingface.co/datasets/BAAI-Agents/SWITCH

详情

展开后加载摘要…

URL PDF HTML 收藏