arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2143 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2143 篇

2605.15196 2026-05-15 cs.CV cs.LG 57%

RefDecoder: Enhancing Visual Generation with Conditional Video Decoding

RefDecoder:通过条件视频解码增强视觉生成

Xiang Fan, Yuheng Wang, Bohan Fang, Zhongzheng Ren, Ranjay Krishna

机构 * University of Washington(华盛顿大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出RefDecoder,通过引入高保真参考图像信号提升视频生成质量,改进解码器结构以保持结构完整性,在多个基准测试中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14984 2026-05-15 cs.CV cs.AI 57%

Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image

Sat3DGen:从单张卫星图像生成全面的街景3D场景

Ming Qian, Zimin Xia, Changkun Liu, Shuailei Ma, Wen Wang, Zeran Ke, Bin Tan, Hang Zhang, Gui-Song Xia

机构 * LIESMARS & School of Artificial Intelligence, Wuhan University(珞珈实验室与武汉大学人工智能学院) EPFL(苏黎世联邦理工学院) HKUST(香港科技大学) Northeastern University(东北大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Amap, Alibaba Group(高德地图,阿里巴巴集团)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Sat3DGen,通过几何优先方法提升从单张卫星图像生成高精度3D场景的性能,改进几何精度和真实感,并在新基准上验证其效果。

Comments ICLR 2026; code: https://github.com/qianmingduowan/Sat3DGen demo: https://huggingface.co/spaces/qian43/Sat3DGen project page: https://qianmingduowan.github.io/Sat3DGen_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13775 2026-05-14 cs.RO cs.CV 57%

RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data

RoboEvolve:用于有限数据的机器人操作共进化规划-模拟器

Harold Haodong Chen, Sirui Chen, Yingjie Xu, Wenhang Ge, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 RoboEvolve通过共进化循环提升机器人操作性能,利用无标签种子图像实现高效数据生成,显著提升规划和模拟效果,同时表现出极高的数据效率和持续学习能力。

Comments On-going work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12198 2026-05-13 cs.CV 57%

Enhancing Domain Generalization in 3D Human Pose Estimation through Controllable Generative Augmentation

通过可控生成增强在3D人体姿态估计中的领域泛化

Xinhao Hu, Yiyi Zhang, Liqing Zhang, Jianfu Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出可控人体姿态生成框架,通过系统变化姿态、背景和摄像机视角合成多样化视频数据,增强训练集多样性,提升模型泛化能力,验证了在处理领域差异方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12167 2026-05-13 cs.RO cs.CV 57%

From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation

从想象的未来到可执行的动作:用于机器人操作的潜在动作混合

Yajie Li, Bozhou Zhang, Chun Gu, Zipei Ma, Jiahui Zhang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出MoLA,一种面向控制的接口,将想象的未来视频转化为可执行的表示,通过混合预训练的逆动力学模型,提升机器人操作的稳定性和通用性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11363 2026-05-13 cs.CV cs.CL 57%

PresentAgent-2: Towards Generalist Multimodal Presentation Agents

PresentAgent-2: 向通用多模态展示代理迈进

Wei Wu, Ziyang Xu, Zeyu Zhang, Yang Zhao, Hao Tang

机构 * Peking University(北京大学) La Trobe University(拉特罗布大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PresentAgent-2通过多模态资源收集与生成,实现基于用户查询的交互式展示视频生成,支持单人叙述、多人讨论及观众互动三种模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10806 2026-05-12 cs.CV cs.AI cs.LG 57%

PhyGround: Benchmarking Physical Reasoning in Generative World Models

PhyGround:用于生成世界模型中物理推理的基准测试

Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, Edmund Yeh, Sarah Ostadabbas, Yun Fu, Jennifer Dy, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PhyGround通过250个精心设计的提示和13种物理定律的分类,评估视频生成中的物理推理能力,采用大规模人工研究验证并发布专用VLM评估工具PhyJudge-9B,显著降低偏见。

Comments Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10434 2026-05-12 cs.CV 57%

WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors

WorldReasonBench: 视频生成器作为未来世界状态预测器的人类对齐压力测试

Keming Wu, Yijing Cui, Wenhan Xue, Qijie Wang, Xuan Luo, Zhiyuan Feng, Zuhao Yang, Sudong Wang, Sicong Jiang, Haowei Zhu, Zihan Wang, Ping Nie, Wenhu Chen, Bin Wang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 WorldReasonBench通过结构化地面真实QA注释,测试视频生成器能否在物理、社会、逻辑和信息层面保持一致性。该基准包含436个测试案例和22个子类别,结合人类对齐的两阶段方法评估生成视频的质量。

Comments Project Page: https://unix-ai-lab.github.io/WorldReasonBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10409 2026-05-12 cs.CV 57%

Progressive Photorealistic Simplification

渐进式逼真简化

Adi Rosenthal, Dana Berman, Yedid Hoshen, Ariel Shamir

机构 * Reichman University and Google(里奇曼大学和谷歌) Google Israel(谷歌以色列) Hebrew University and Google(希伯来大学和谷歌) Google(谷歌)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出渐进式语义图像简化框架,通过迭代去除并修补元素保持逼真外观,结合视觉-语言模型和学习验证器实现高效高质量的简化过程,应用于内容感知清理和交互编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21581 2026-05-12 cs.CV 57%

MultiAnimate: Pose-Guided Image Animation Made Extensible

MultiAnimate:基于姿态的图像动画使其可扩展

Yingcheng Hu, Haowen Gong, Chuanguang Yang, Zhulin An, Yongjun Xu, Songhua Liu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种可扩展的多人物图像动画框架,通过引入标识符分配器和标识符适配器,解决多人物场景中的身份混淆和不合理的遮挡问题,实现高质量多人物动画生成。

Comments CVPR2026 Accepted. Project page at https://hyc001.github.io/MultiAnimate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07695 2026-05-11 cs.CV 57%

OphEdit: Training-Free Text-Guided Editing of Ophthalmic Surgical Videos

OphEdit: 无需训练的文本引导眼科手术视频编辑

Ritul Jangir, Arkya Jyoti Bagchi, Aiman Farooq, Mangalton Okram, Saurabh Seetaram Korgaonkar, Deepak Mishra

机构 * Indian Institute of Technology Jodhpur(印度理工学院贾布尔分校) All India Institute of Medical Sciences Delhi(全国医学科学研究所德里)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出OphEdit框架,通过确定性二阶ODE反向管道和条件分类器自由引导分支,实现无需训练的文本引导眼科手术视频编辑,保持眼部解剖结构并实现语义修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10571 2026-05-05 cs.CV 57%

AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner

AVI-Edit: 基于粒度感知掩码细化的音频同步视频实例编辑

Haojie Zheng, Shuchen Weng, Jingqi Liu, Siqi Yang, Boxin Shi, Xinlong Wang

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Lab of Multimedia Info. Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Nat’l Eng. Research Ctr. of Visual Tech., School of Computer Science, Peking University(北京大学计算机学院视觉技术工程研究中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出AVI-Edit框架,通过粒度感知掩码细化和自反馈音频代理,实现音频同步的高质量视频实例编辑,提升了空间和时间控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28980 2026-05-04 cs.CV 57%

Stepper: Stepwise Immersive Scene Generation with Multiview Panoramas

Stepper:基于多视角全景图的分步沉浸式场景生成

Felix Wimbauer, Fabian Manhardt, Michael Oechsle, Nikolai Kalischek, Christian Rupprecht, Daniel Cremers, Federico Tombari

机构 * Google(谷歌) University of Oxford(牛津大学) MCML Technical University of Munich(慕尼黑技术大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Stepper通过分步扩展多视角全景图,解决传统方法在视觉保真度与可探索性之间的权衡问题,实现高质量沉浸式3D场景生成。

Comments Accepted at CVPR 2026 Findings; Find our project page under https://fwmb.github.io/stepper/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00244 2026-05-04 cs.RO cs.CV 57%

Lucid-XR: An Extended-Reality Data Engine for Robotic Manipulation

Lucid-XR:一种用于机器人操控的扩展现实数据引擎

Yajvan Ravan, Adam Rashid, Alan Yu, Kai McClennen, Gio Huh, Kevin Yang, Zhutian Yang, Qinxi Yu, Xiaolong Wang, Phillip Isola, Ge Yang

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) FortyFive Labs(FortyFive实验室) Caltech(加州理工学院) Harvard University(哈佛大学) UC San Diego(南加州大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Lucid-XR通过XR头显直接运行的物理模拟环境生成多模态数据,实现零样本迁移至复杂环境,支持软材料、松散颗粒和刚体接触的精细操控任务。

Comments Project website: https://lucidxr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00080 2026-05-04 cs.RO cs.CV 57%

World Model for Robot Learning: A Comprehensive Survey

机器人学习的世界模型:全面综述

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr, Oier Mees, Marc Pollefeys, Zhuang Liu, Jiajun Wu, Pieter Abbeel, Jitendra Malik, Yilun Du, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) The University of Tokyo(东京大学) University of Oxford(牛津大学) Microsoft(微软公司) ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 综述从机器人学习角度系统回顾世界模型的快速发展,探讨其与机器人策略的耦合、作为强化学习模拟器的作用以及机器人视频世界模型的发展,总结关键范式与挑战。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27621 2026-05-01 cs.RO cs.CV 57%

Robot Learning from Human Videos: A Survey

从人类视频学习机器人:综述

Junyi Ma, Erhang Zhang, Haoran Yang, Ditao Li, Chenyang Xu, Guangming Wang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文综述了通过人类视频学习机器人技能的方法,探讨了政策学习基础、人类视频接口、技能转移层次分类及数据基础,分析了挑战与未来研究方向。

Comments Paper list: https://github.com/IRMVLab/awesome-robot-learning-from-human-videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26571 2026-05-01 cs.CV cs.AI 57%

GVCC: Zero-Shot Video Compression via Codebook-Driven Stochastic Rectified Flow

GVCC:基于代码本驱动的随机修正流零样本视频压缩

Ziyue Zeng, Xun Su, Haoyuan Liu, Bingyu Lu, Yui Tatsumi, Hiroshi Watanabe

机构 * Graduate School of Fundamental Science and Engineering, Waseda University(早稻田大学基础科学与工程研究生院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 GVCC通过预训练视频生成模型直接作为解码器,在极低比特率下实现高质量视频重建,通过编码生成轨迹的随机创新信息,提升压缩效率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25819 2026-04-29 cs.CV cs.SD 57%

Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation

相互推动:双模式自我进化用于快速自回归音频视频生成

Yupeng Zhou, Lianghua Huang, Zhifan Wu, Jiabao Wang, Yupeng Shi, Biao Jiang, Daquan Zhou, Yu Liu, Ming-Ming Cheng, Qibin Hou

机构 * VCIP, School of Computer Science, Nankai University(南开大学计算机科学学院VCIP实验室) Tongyi Lab(通义实验室) Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Mutual Forcing框架,通过双阶段训练策略解决音频视频联合建模与快速自回归生成问题,通过共享参数实现自蒸馏,提升训练推理一致性,相比传统方法更高效且质量更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03075 2026-04-28 cs.CV cs.AI cs.LG 57%

What Drives Compositional Generalization? The Importance of Continuous Training Objectives in Visual Generative Models

是什么驱动了组合泛化?在视觉生成模型中连续训练目标的重要性

Karim Farid, Rajat Sahay, Yumna Ali Alnaggar, Simon Schrodi, Volker Fischer, Cordelia Schmid, Thomas Brox

机构 * University of Freiburg Bosch Center for Artificial Intelligence Inria, \'E cole Normale Sup \'e rieure, CNRS, PSL Research University

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究探讨了视觉生成模型中连续训练目标对组合泛化能力的影响,发现训练目标分布的离散或连续性及条件信息对泛化性能有关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23579 2026-04-28 cs.MM 57%

CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration

CineAGI:通过LLM协同多模态生成与跨场景整合实现角色一致的电影创作

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 CineAGI通过多代理叙事合成模块、角色中心流水线和分层音视频同步机制,提升电影创作的一致性和质量,实现40%的整体一致性提升。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23574 2026-04-28 cs.CV 57%

PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics

PhysLayer:基于语言的分层动画与深度感知物理

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi

机构 * Nanjing University(南京大学) University of Guelph(圭尔夫大学) Zhejiang Sci-Tech University(浙江科技大学) Dalian Maritime University(大连海事大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PhysLayer通过深度感知物理模拟和语言引导,实现静态图像的分层动画生成,提升了物理真实性和可控性,实验结果显示在多个指标上均有显著提升。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19234 2026-04-28 cs.CV 57%

Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation

学习正确的步骤:面向视觉生成的客观感知过程优化

Rui Li, Ke Hao, Yuanzhi Liang, Haibin Huang, Chi Zhang, Yun Gu, XueLong Li

机构 * University of Science and Technology of China(科学技术大学) Shanghai Jiao Tong University(交通大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出OTCA框架,通过细粒度奖励分配提升视觉生成质量,解决传统GRPO在奖励分配上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22554 2026-04-27 cs.CV 57%

Video Analysis and Generation via a Semantic Progress Function

通过语义进度函数进行视频分析与生成

Gal Metzer, Sagi Polaczek, Ali Mahdavi-Amiri, Raja Giryes, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出语义进度函数,用于分析和修正视频生成模型中非线性变化的问题,通过线性化语义变化提升视频过渡的平滑性和一致性。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07940 2026-04-24 cs.CV 57%

Beyond the Frame: Generating 360 Panoramic Videos from Perspective Videos

超越帧限:从视角视频生成360度全景视频

Rundong Luo, Matthew Wallingford, Ali Farhadi, Noah Snavely, Wei-Chiu Ma

机构 * Cornell University(康奈尔大学) University of Washington(华盛顿大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出从视角视频生成完整全景视频的方法,通过设计几何与运动感知操作提升生成质量,实现空间与时间一致性,应用于视频稳定、视角控制和交互式视觉问答。

Comments Project page: https://red-fairy.github.io/argus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20357 2026-04-23 cs.CV cs.CL 57%

SignDATA: Data Pipeline for Sign Language Translation

SignDATA:手语翻译的数据管道

Kuanwei Chen, Tingyi Lin

机构 * Computer Science and Information Engineering National Central University(计算机科学与信息工程国家级中央大学) Electrical Engineering National Changhua University Of Education(电气工程国家彰化教育大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出SignDATA,一种标准化手语数据集的预处理工具包,支持端到端的姿势和视频处理流程,通过可配置的接口实现统一输出,提升手语研究的可重复性和比较性。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20157 2026-04-23 cs.CV 57%

HumanScore: Benchmarking Human Motions in Generated Videos

HumanScore:在生成视频中评估人类动作的基准测试

Yusu Fang, Tiange Xiang, Tian Tan, Narayan Schuetz, Scott Delp, Li Fei-Fei, Ehsan Adeli

机构 * Stanford University(斯坦福大学) Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出HumanScore框架,通过六个可解释指标评估AI生成视频中人类动作的质量,揭示感知合理性与生物力学真实性的差距,并产生可靠的模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18564 2026-04-22 cs.CV 57%

MultiWorld: Scalable Multi-Agent Multi-View Video World Models

多世界:可扩展的多智能体多视角视频世界模型

Haoyu Wu, Jiwen Yu, Yingtian Zou, Xihui Liu

机构 * The University of Hong Kong(香港大学) Sreal AI

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 多世界框架通过多智能体控制模块和全局状态编码器,实现多智能体多视角视频世界建模,提升视频保真度和多视角一致性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17021 2026-04-21 cs.CV 57%

LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing

LIVE: 利用图像篡改先验知识进行基于指令的视频编辑

Weicheng Wang, Zhicheng Zhang, Zhongqi Zhang, Juncheng Zhou, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Jufeng Yang

机构 * Nankai University(南开大学) Pengcheng Laboratory(鹏城实验室) Kuaishou Technology(快手科技) Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出LIVE框架,结合大规模高质量图像编辑数据和视频数据提升编辑能力,通过帧级噪声策略和两阶段训练策略,构建包含60多项挑战性任务的评估基准,实验表明方法达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16391 2026-04-21 cs.RO cs.CV 57%

Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

通过分离前向和逆向动力学预训练实现解耦的机器人学习

Wenyao Zhang, Bozhou Zhang, Zekun Qi, Wenjun Zeng, Xin Jin, Li Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出DeFI框架,通过分离前向和逆向动力学预训练,利用不同数据源解决视觉-动作耦合问题,实现端到端微调,实验表明在CALVIN ABC-D和SimplerEnv上取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20360 2026-04-21 cs.CV 57%

EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning

EditVerse:通过上下文学习统一图像和视频编辑与生成

Xuan Ju, Tianyu Wang, Yuqian Zhou, He Zhang, Qing Liu, Nanxuan Zhao, Zhifei Zhang, Yijun Li, Yuanhao Cai, Shaoteng Liu, Daniil Pakhomov, Zhe Lin, Soo Ye Kim, Qiang Xu

机构 * Adobe Research(Adobe研究院) CUHK(中国香港大学) Johns Hopkins University(约翰霍普金斯大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出EditVerse框架,通过统一token序列实现图像和视频生成编辑,利用自注意力机制实现跨模态知识迁移,实验表明其在视频编辑任务中达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏