A Closer Look at Dynamic Scene Graph Generation In the Era of Multimodal Large Language Models
多模态大语言模型时代的动态场景图生成研究
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本研究针对多模态大语言模型时代动态场景图生成的局限,从任务设置优化评估指标、基于MLLM改进模型设计,在多个数据集上实现了最优性能。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
多模态大语言模型时代的动态场景图生成研究
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本研究针对多模态大语言模型时代动态场景图生成的局限,从任务设置优化评估指标、基于MLLM改进模型设计,在多个数据集上实现了最优性能。
CineWeaver:用于电影叙事的无训练参考可控多镜头长视频生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; China Telecom(中国电信) ; Institute of Artificial Intelligence (TeleAI)(人工智能研究院(电信AI))
专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);text-to-video(abstract)
AI总结 CineWeaver是首个无训练的统一框架,通过操控位置编码、注意力模式等,实现参考可控的多镜头长视频生成,产出的电影视频时长较长且质量高。
Visko Orbis 1.0:用于实时交互式长视频生成的实时模型
专题命中 视频生成 :video generation(title,abstract);long video(title);text-to-video(abstract);分类 cs.CV
AI总结 Visko Orbis 1.0是一款实时交互式长视频生成模型,支持多类型生成任务与实时提示词切换,靠有界多尺度记忆实现长视频生成无明显漂移,在对比测试中获最优偏好与稳定性评分。
FilmBench:用于电影视频生成的电影级基准测试
机构 * Alibaba Group(阿里巴巴集团) ; Moku Lab, Hujing Digital Media & Entertainment Group(魔氪实验室,虎鲸数字媒体与娱乐集团) ; Beijing Film Academy(北京电影学院)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
AI总结 FilmBench是基于电影学院传统专业电影语言开发的文本到视频和参考到视频基准测试。它从获奖影片反向设计提示,依电影分类法评估,开发自动评估代理并开源核心套件,能再现人类模型排名,指出当前模型在动态美学等方面不足。
Ripple:基于跨模态循环记忆的实时流音频-视频生成
机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出Ripple系统,通过跨模态循环记忆机制及三阶段训练方案,实现480P下约28 FPS的实时流音频-视频生成,性能优于现有方法。
AptAvatar:用于生产就绪头像的快速且生动的长格式音频驱动视频生成
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 研究生产就绪的音频驱动头像生成,提出AptAvatar框架,通过端点锚定分布蒸馏和自生成历史重放方法,实现快速且生动的长格式视频生成,仅用2次归一化流评估,加速60倍且保持视觉保真度和长跨度身份。
Comments 9 pages, 5 figures
G2VD:通过反事实干预和因果解缠实现可泛化的人工智能生成视频检测
机构 * Information Engineering University(信息工程大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 针对AI生成视频检测中因捷径学习导致跨域性能差的问题,提出G2VD框架,用反事实干预管道生成样本并对齐,设计因果解缠分类器,提升了跨域性能。
从被动视频到可编辑体验:具身智能的物理基础体验合成
专题命中 视频生成 :video generation(abstract)
AI总结 针对具身AI的数据瓶颈,提出Pegasus低资源框架,通过结构化知识传递将人类操作视频转化为机器人可学习数据,经多基准与机器人评估验证其跨具身翻译及数据生成的有效性。
TPD:用于文本到视频扩散模型的时间先验解耦
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 该研究针对文本到视频扩散模型的时间先验抑制问题,提出无需训练的TPD框架,通过帧选择性下界约束恢复被抑制的后期片段信号,提升后期概念实现效果且与骨干无关。
WildShadowRemover:基于细节保留视频扩散模型的野外视频阴影去除方法
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 针对野外视频阴影去除难题,提出WildShadowRemover框架,通过LoRA微调适配视频扩散模型,结合细节注入、频率分解调制及Depth Anything 3深度先验,构建对应数据集,在阴影去除质量与时间一致性上优于现有方法。
通过视频表示正则化缓解复合误差
机构 * Peking University(北京大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 针对视频扩散世界模型自回归生成的复合误差问题,研究发现其与表示维度崩溃相关,提出视频表示正则化方法,在VBench指标上显著优于Diffusion Forcing,提升了长视频生成的鲁棒性。
Genie Sim PanoWorld:基于全景场景建模与仿真的无限室内3D世界生成流水线
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 Genie Sim PanoWorld是两阶段前馈流水线,从单张360°全景生成可自由导航的高保真3D高斯场景,优于几何条件基线,且能零样本泛化至未见室内场景
穿越绘画:来自互联网先验的自我中心世界模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Toyota Research Institute(丰田研究机构)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。
I2VShield:一种针对基于DiT的图像到视频模型的高效主动防御框架
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 针对I2V模型被滥用问题,提出I2VShield主动防御框架。其包含文本自适应扰动生成框架和非目标多模态注意力干扰攻击两部分。该方法在多数据集和模型上保护性能优,能破坏时空连贯性且降低计算成本。
VideoNorms:视频语言模型文化意识基准测试
机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)
专题命中 视频数据与评测 :video language model(title);分类 cs.CV
AI总结 本研究推出VideoNorms数据集评估VideoLLMs的文化规范意识,发现模型中文表现逊于英文、提供非语言证据更困难,视频模态必要且规模扩大无分类分数提升,成果助力文化导向的视频模型训练与评估。
Comments 29 pages, 6 figures, 19 tables. IC2S2 2026, C3NLP@ACL 2026
CG-World:面向世界模型的大规模世界状态数据集与协议
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 CG-World是源自工业计算机图形流水线的大规模世界状态数据集,含约85万时间对齐片段,支持干预学习与反事实推理,经评估可为世界模型相关任务提供结构化监督,拟打造共享数据基础设施。
VendorBench-100:用于深度伪造图像检测的统一跨范式基准测试
机构 * Universidade da Beira Interior(贝拉内斯大学) ; Shri Guru Buddhi Swami College(什里·古鲁·布迪·斯瓦米学院) ; Swami Ramanand Tirtha Marathwada University(斯瓦米拉曼南德·蒂尔塔马哈拉施特拉大学)
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 研究针对深度伪造图像检测的三种范式缺乏通用评估的问题,提出VendorBench-100基准测试,用统一框架评估36个模型,强调现实场景,通过MCC排名,发现ROC-AUC与MCC有差异,还发布评估框架和结果助力后续研究。
Comments Fixed scoring-normalization error in Neural Defend/TruthScan results, revising the central finding: MCC and ROC-AUC are strongly correlated (r ~ 0.86) overall, with only a specific subset showing one-directional threshold miscalibration. Abstract, tables, Discussion, Conclusion updated