MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
MarkIt: 免训练视觉标记用于精确视频时间定位
专题命中 视频理解 :video understanding(abstract);分类 cs.MM
AI总结 提出免训练框架MarkIt,通过无标注查询到掩码桥接生成标记视频,增强视频语言大模型的时间定位能力,在多个基准上取得最优结果。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
MarkIt: 免训练视觉标记用于精确视频时间定位
专题命中 视频理解 :video understanding(abstract);分类 cs.MM
AI总结 提出免训练框架MarkIt,通过无标注查询到掩码桥接生成标记视频,增强视频语言大模型的时间定位能力,在多个基准上取得最优结果。
OmniDrive: 一种由LLM编排的多智能体世界模型,用于多视角驾驶视频生成的统一潜在协同压缩
机构 * Peking University(北京大学) ; Xiamen University(厦门大学) ; Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; National Taiwan University(国立台湾大学) ; Wuhan University(武汉大学) ; Wuhan University of Technology(武汉理工大学) ; Tsinghua University(清华大学) ; Jimei University(集美大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 提出DRIVE-CHOREO,一种由LLM编排的多智能体世界模型,通过三个Qwen2.5-VL智能体协同生成位置感知的潜在序列,并利用视图-时间置换与3D VAE协同压缩,实现可控多视角视频生成,在nuScenes上达到SOTA多视角一致性和BEV mAP 21.6。
Comments 24 pages, 10 figures
PermaVid: 通过解耦上下文记忆实现编辑下的一致视频生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; Stanford University(斯坦福大学) ; S-Lab, Nanyang Technological University(南洋理工大学S-Lab) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 提出PermaVid框架,利用解耦为语义外观和几何结构的上下文记忆,结合编辑感知更新策略,实现编辑操作后视频的长期一致生成。
Comments Project page: https://ys-imtech.github.io/projects/PermaVid/
代理世界建模:基础、能力、定律及更远
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学) ; Nanyang Technological University(南洋理工大学) ; Chinese University of Hong Kong(香港中文大学) ; University of Hong Kong(香港大学) ; University of Washington(华盛顿大学) ; University of Tokyo(东京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Singapore Management University(新加坡管理学院) ; XGEN Labs(XGEN实验室)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。
Pulling The REINS: 通过表示引导实现视频扩散模型的无训练安全对齐
机构 * University of California, Riverside(加州大学河滨分校) ; YouTube (Google)(YouTube(谷歌))
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出REINS方法,在推理时通过线性方向引导视频扩散模型的内部表示,实现无训练的安全对齐,避免有害内容生成,且不降低通用能力。
Flash-GRPO:通过单步策略优化实现视频扩散的高效对齐
机构 * Zhejiang University(浙江大学) ; Joy Future Academy(京东探索研究院) ; Independent Researcher(独立研究员) ; Tsinghua University(清华大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 提出Flash-GRPO单步训练框架,通过等时分组和时间梯度校正解决计算瓶颈,在低计算预算下实现优于全轨迹训练的对齐质量和训练效率。
Phys4D: 从视频扩散模型实现细粒度物理一致的4D建模
机构 * Northwestern University(西北大学) ; Dolby Laboratories(杜比实验室)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 提出Phys4D流水线,通过三阶段训练(伪监督预训练、物理监督微调、强化学习校正)从视频扩散模型学习物理一致的4D世界表示,显著提升细粒度时空与物理一致性。
SierpinskiCam: 基于谢尔宾斯基三角形图案线索的相机控制视频重拍
机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; VISTEC, Thailand(泰国威斯泰克科学技术研究院)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出SierpinskiCam方法,通过谢尔宾斯基圆顶纹理线索增强几何引导,并引入参考视频条件机制,解决单目视频重拍中相机大角度偏离时的稀疏区域问题,提升相机可控性、几何一致性和视频质量。
Comments 20 pages, 13 figures
AoiZora: 面向扩散变换器推理的拓扑感知自动并行优化
机构 * Rice University(里士大学) ; Independent Researcher(独立研究者) ; Google(谷歌)
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 针对扩散变换器推理中的低延迟需求,提出AoiZora编译器,通过拓扑感知的物理布局优化自动并行策略,在TPU子片上实现高达1.42倍的加速。
面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 动作与事件理解 :text-to-video(title,abstract);分类 cs.CV
AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。
LiveStarPro: 具有分层记忆的主动式流视频理解用于长时域流
机构 * IEEE
专题命中 长视频与时序推理 :video understanding(title,abstract);video-language(abstract);分类 cs.CV
AI总结 提出LiveStarPro,通过流验证解码、流因果注意力掩码和树结构分层记忆三个组件,实现长时域流媒体视频的主动理解,在语义正确性和时序误差上分别提升28.9%和降低18.2%。
MaineCoon: 追求实时音视频社交世界模型
机构 * Catnip AI Team(Catnip AI团队)
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 提出MaineCoon,首个22B参数的实时音视频自回归模型,支持单GPU上高达47.5 FPS的流式生成和亚秒级交互,专为社交互动应用优化,引入自重采样、跨模态对齐、领域偏好优化和强化在线策略蒸馏等技术。
Comments 32 pages, 13 figures, 3 tables
TivTok:广播时间不变令牌以实现可扩展视频分词
机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; Department of Automation, Tsinghua University(清华大学自动化系) ; Kuaishou Technology(快手科技)
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 提出TivTok,一种可重用感知的视频分词器,通过时间不变(TIV)和时间变化(TV)令牌分解视频,实现高效压缩和长视频建模,在标准基准上rFVD达12.65,压缩效率提升2.91倍。
长视频全模态推理基准
机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; American University of Beirut(贝鲁特美国大学) ; Linköping University(利尔贝里大学)
专题命中 视频数据与评测 :long video(title,abstract);video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 提出LongShOTBench基准,用于评估长视频中视觉、语音和环境音频的全模态推理,并引入无训练的全模态证据搜索代理LongShOTAgent,在105个模型上取得最优性能。
EgoCS-400K:面向世界模型的自我中心游戏数据集
机构 * City University of Hong Kong(香港城市大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 为支持世界模型研究,构建大规模自我中心游戏数据集EgoCS-400K,包含40万第一人称视频和1万小时游戏轨迹,支持动作条件未来预测、状态事件场景展开等交互式视觉建模任务。