VIVECaption: A Split Approach to Caption Quality Improvement
VIVECaption:一种改进标题质量的分步方法
机构 * Adobe Inc.(Adobe公司)
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
VIVECaption:一种改进标题质量的分步方法
机构 * Adobe Inc.(Adobe公司)
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。
HERO: 分层嵌入-细化用于视频中开放词汇时间句接地
机构 * Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(电子科技大学复杂系统建模与仿真实验室,计算机科学与技术学院) ; Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,电子科技大学) ; Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)
专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV
AI总结 HERO提出一种分层嵌入-细化框架,用于视频中开放词汇时间句接地,通过多级语义建模和跨模态细化提升视频与语言的对齐能力。
语义噪声初始化能否从图像迁移到视频?一项配对诊断研究
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 该研究探讨了语义噪声初始化在文本到视频生成中的有效性,发现其在时间相关维度有小幅度提升,但整体效果与基线相当,建议采用提示级评估和噪声空间分析作为标准方法。
Comments 8 pages, 1 figure. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence: Next Token Prediction & Beyond
DrivingGen:自主驾驶中生成视频世界模型的综合性基准
机构 * University of Toronto(多伦多大学) ; CUHK MMLab(香港中文大学MMLab)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 DrivingGen提出首个综合性基准,用于评估生成驾驶世界模型的视觉真实性、轨迹合理性、时间一致性和可控性,揭示通用与专用模型间的权衡。
Comments ICLR 2026 Poster; Project Website: https://drivinggen-bench.github.io/