Listener-Rewarded Thinking in VLMs for Image Preferences
图像偏好中的VLMs思考奖励
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 本文提出一种增强GRPO框架,通过引入独立的监听器模型来校准推理过程,提升图像偏好任务中的准确性和泛化能力。
Comments part of a different work
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
图像偏好中的VLMs思考奖励
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 本文提出一种增强GRPO框架,通过引入独立的监听器模型来校准推理过程,提升图像偏好任务中的准确性和泛化能力。
Comments part of a different work
保留伪造痕迹:在原生尺度上进行AI生成视频检测
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室) ; Peking University(北京大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出在原生尺度上进行AI生成视频检测的新方法,通过构建大规模数据集和新型框架,有效保留高频率伪影和时空不一致特征,提升检测性能。
Comments ICLR 2026 Camera Ready
BoxComm:基于 boxing 的类别感知评论生成与叙述节奏基准测试
机构 * Tsinghua University(清华大学) ; Beijing Sport University(北京体育大学)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出 BoxComm 数据集,包含 445 场世界拳击锦标赛视频及 52000 多条专业评论,通过分类注解和两项新评估方法,解决拳击评论生成中的节奏与类别准确性问题。
UENR-600K:一个大规模的物理基础数据集用于夜间视频去雨
机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab) ; National University of Singapore(新加坡国立大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出UENR-600K数据集,通过Unreal Engine模拟真实夜间雨景,解决传统小规模数据无法捕捉物理特性的问题,提升模型在真实夜间雨场景下的泛化能力。
活动取证:一种全面的基准,用于定位视频中的篡改活动
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ; School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院) ; Jiangxi Provincial Key Laboratory of Multimedia Intelligent Processing(江西省多媒体智能处理重点实验室) ; Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程系) ; VinUniversity
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出ActivityForensics基准,用于定位视频中被篡改的活动。该基准包含6000多个无缝融合的篡改视频片段,并引入了Temporal Artifact Diffuser方法,评估了多种最先进的伪造定位器。
Comments [CVPR 2026] The first benchmark for action-level deepfake localization
生成世界渲染器
机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,盛大人工智能研究院东京) ; National Taiwan University(国立台湾大学) ; The University of Tokyo(东京大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出一个大规模动态数据集,用于解决生成逆向和正向渲染在现实场景中的限制,通过双屏拼接方法提取400万帧数据,提升渲染真实性和时间一致性,并提出新的评估协议。
Comments Project page: https://alaya-studio.github.io/renderer/
CL-VISTA:视频大语言模型持续学习基准测试
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; FKLPRIU, School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院福建省模式识别与图像理解重点实验室)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 CL-VISTA通过8个多样化任务诱导分布偏移,评估持续学习方法在性能、效率和内存方面的权衡,揭示无单一最优解的特性。
Comments Preprint
EgoReasoner:通过任务自适应结构化思维学习视角4D推理
机构 * Northeastern University(东北大学) ; Google Research(谷歌研究院) ; Google DeepMind(谷歌DeepMind)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出EgoReasoner框架,通过任务自适应结构化思维解决视角4D推理任务,提升空间锚定、时间跟踪和持续推理能力,模型在HD-EPIC基准上取得37.5%准确率。
Comments preprint
可泛化动作生成的探索:数据、模型与评估
机构 * Nanyang Technological University(南洋理工大学) ; SenseTime Research(商汤科技研究院) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; NVIDIA Research(英伟达研究院)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出一个综合框架,通过数据、建模和评估三大支柱将视频生成知识迁移至动作生成,引入大规模数据集和改进模型,提升动作生成的泛化能力。
Comments Homepage: https://motrixlab.github.io/2026_iclr_vimogen
ShotBench:视觉语言模型中的专家级电影叙事理解
机构 * Tongji University(同济大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; S-Lab, Nanyang Technological University(南洋理工大学S-Lab)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出ShotBench基准测试,用于评估视觉语言模型对电影叙事语言的理解能力,通过专家标注的3500多对问答数据揭示现有模型在细粒度视觉线索和复杂空间推理上的不足,并开发ShotVL模型在该基准上取得新突破。
Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)
PerceptionComp:一个复杂感知导向推理的视频基准测试
机构 * Tsinghua University(清华大学) ; University of Washington(华盛顿大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV
AI总结 PerceptionComp是一个手动标注的复杂长时景视频推理基准测试,要求多时间片段的视觉证据和逻辑约束,涉及多个感知子任务,测试人类和模型在感知推理中的性能瓶颈。
Comments Project Page: https://perceptioncomp.github.io
ABot-PhysWorld:用于机器人操作的交互世界基础模型,具有物理对齐
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 ABot-PhysWorld通过物理对齐的交互世界模型,生成物理合理且可控的视频,解决了传统方法在物理仿真中的不足,通过新框架和基准测试提升了性能。
Comments Code: https://github.com/amap-cvlab/ABot-PhysWorld.git
基于框架的思考:通过帧奖励模型生成视频失真评估
机构 * University of Science and Technology of China(中国科学技术大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 本文提出REACT框架,通过帧级奖励模型评估生成视频的结构性失真,结合人类偏好数据集和高效合成流程,提升视频生成质量评估的准确性和可解释性。
WildWorld: 一个大规模动态世界建模数据集,包含动作和显式状态,面向生成式ARPG
机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,Shanda AI东京研究院) ; Beijing Institute of Technology(北京理工大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shenzhen MSU-BIT University(深圳MSU-BIT大学) ; Tsinghua University(清华大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出WildWorld数据集,通过AAA动作角色扮演游戏Monster Hunter: Wilds自动收集,包含1.08亿帧视频和450多种动作,包含骨骼、世界状态、相机姿态和深度图标注,用于评估动作跟随和状态对齐。
Omni-WorldBench:迈向全面的交互导向的世界模型评估
机构 * School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) ; The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, CASIA(复杂系统认知与决策智能重点实验室) ; School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) ; State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室) ; AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出Omni-WorldBench,一个针对4D世界模型交互响应能力的综合评估基准,通过Omni-WorldSuite和Omni-Metrics评估交互动作对状态转移的影响,分析现有模型的局限性。
白内障手术分割与可扩展地面真实标注的领域适应模型CataractSAM-2
机构 * Thomas Jefferson High School for Science and Technology(托马斯·杰弗逊高中科学与技术学校) ; Mass Eye and Ear, Harvard Medical School(麻省眼耳研究所,哈佛医学院) ; Harvard Ophthalmology AI Lab, Schepens Eye Research Institute of Mass Eye and Ear, Harvard Medical School(哈佛眼科学人工智能实验室,麻省眼耳研究所的谢普恩斯眼研究学院,哈佛医学院)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出CataractSAM-2,一种针对白内障眼科手术视频的实时语义分割模型,结合稀疏提示与视频掩码传播框架,提升标注效率并推动高质量地面真实标注的可扩展生成。
SPKLIP:通过自然语言对齐尖峰视频流
专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV
AI总结 SPKLIP提出了一种专门用于尖峰视频-语言对齐的架构,通过分层尖峰特征提取器和尖峰-文本对比学习实现多尺度时间动态建模,并在稀疏异步输出上实现高效的少样本学习。
Comments A dataset partitioning error occurred and is being corrected
MME-CoF-Pro:基于文本和视觉提示评估视频生成模型中的推理一致性
机构 * Northeastern University(东北大学) ; The Chinese University of Hong Kong(香港中文大学) ; Westlake University(西湖大学) ; ByteDance Seed(字节跳动种子) ; Peking University(北京大学) ; NVIDIA(英伟达)
专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV
AI总结 本文提出MME-CoF-Pro视频推理基准,评估视频模型的推理一致性,发现生成模型推理一致性弱,文本提示提升正确性但导致不一致,视觉提示在结构化任务中表现较好但难以处理细粒度感知。
Physion-Eval:通过人类推理评估生成视频的物理真实性
机构 * Physion Labs(Physion实验室) ; Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; Harvard University(哈佛大学) ; Character AI
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出Physion-Eval基准,通过专家人类推理评估生成视频的物理真实性,揭示当前视频生成模型在物理关键场景中存在显著缺陷,83.3%的外向视角和93.5%的内向视角视频存在可识别的物理错误。
TAU-R1:用于交通异常理解的视觉语言模型
机构 * University of Bath(巴斯大学) ; University of Washington(华盛顿大学) ; City of Carmel, Indiana(印第安纳州卡迈尔市) ; Starwit GmbH
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出TAU-R1模型,通过两层框架提升交通异常识别与推理能力,结合定制化训练策略与数据集,实现高效部署。
HyperMotionX:基于DiT的Pose引导人体图像动画的Dataset和Benchmark
机构 * Bournemouth University(伯恩茅斯大学) ; vivo BlueImage Lab, vivo Mobile Communication Co., Ltd(vivo 蓝影实验室,vivo 通信有限公司) ; Peking University(北京大学) ; National Cheng-Kung University(国立成功大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出基于DiT的高效人体动画生成基线和改进的RoPE模块,构建了HyperMotionX数据集和基准,提升了复杂人体运动动画的结构稳定性和外观一致性。
Comments 17 pages, 7 figures
MatAnyone 2:通过学习的质量评估器扩展视频磨边
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV
AI总结 本文提出学习质量评估器MQE,用于无地面真实情况下评估alpha磨边的语义和边界质量,通过在线反馈和离线数据筛选构建大规模真实世界视频磨边数据集VMReal,实现高质量视频磨边。
Comments Accepted to CVPR 2026. Project page: https://pq-yang.github.io/projects/MatAnyone2/
INST-IT:通过显式视觉提示指令微调提升实例理解
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出INST-IT方法,通过显式视觉提示指令微调提升大模型的实例理解能力,构建了评估基准和数据集,并在多个基准上验证了方法的有效性。
Comments Accepted by NeurIPS 2025
ShotVerse: 提升文本驱动多镜头视频创作的电影级摄像机控制
机构 * Tencent Video AI Center, PCG, Tencent(腾讯视频AI中心)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 ShotVerse通过'计划然后控制'框架,结合视觉语言模型和摄像机适配器,实现多镜头视频创作中精准的摄像机控制与高保真电影效果。
VIVECaption:一种改进标题质量的分步方法
机构 * Adobe Inc.(Adobe公司)
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。
HERO: 分层嵌入-细化用于视频中开放词汇时间句接地
机构 * Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(电子科技大学复杂系统建模与仿真实验室,计算机科学与技术学院) ; Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,电子科技大学) ; Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)
专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV
AI总结 HERO提出一种分层嵌入-细化框架,用于视频中开放词汇时间句接地,通过多级语义建模和跨模态细化提升视频与语言的对齐能力。
语义噪声初始化能否从图像迁移到视频?一项配对诊断研究
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV
AI总结 该研究探讨了语义噪声初始化在文本到视频生成中的有效性,发现其在时间相关维度有小幅度提升,但整体效果与基线相当,建议采用提示级评估和噪声空间分析作为标准方法。
Comments 8 pages, 1 figure. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence: Next Token Prediction & Beyond
DrivingGen:自主驾驶中生成视频世界模型的综合性基准
机构 * University of Toronto(多伦多大学) ; CUHK MMLab(香港中文大学MMLab)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 DrivingGen提出首个综合性基准,用于评估生成驾驶世界模型的视觉真实性、轨迹合理性、时间一致性和可控性,揭示通用与专用模型间的权衡。
Comments ICLR 2026 Poster; Project Website: https://drivinggen-bench.github.io/
迈向多模态终身理解:一个数据集和代理基准
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出MM-Lifelong数据集和ReMA代理,解决多模态终身理解中的工作记忆瓶颈和全局定位崩溃问题,通过动态内存管理提升模型性能。
MicroVerse: 微观世界模拟的初步探索
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Peking Union Medical College Hospital(北京协和医学院附属医院) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 MicroVerse通过构建MicroWorldBench和MicroSim-10K数据集,首次提出微观世界模拟概念,展示其在生物机制教育中的潜力。