arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2962 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2264 篇

2606.18658 2026-06-23 cs.CV eess.IV 新提交 57%

Deep Image Prototype Learning with Geometric Heat-Kernel Priors

基于热核先验的流形变分学习

Jiarui Xing, Tal Zeevi, Nian Wu, Jian Wang

机构 * Yale School of Medicine(耶鲁大学医学院) University of Virginia(弗吉尼亚大学) Harvard Medical School(哈佛医学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种流形锚定变分框架,利用几何感知EM算法选择热核加权潜图上的图中心点作为原型,确保原型在流形上,并通过Dirichlet能量正则化保持潜空间几何平滑,在心脏瘢痕和脑MRI基准上取得最高精度和清晰原型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20563 2026-06-19 cs.CV 新提交 57%

JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising

JanusMesh: 通过跨空间去噪实现快速零样本3D视觉错觉生成

Siang-Ling Zhang, Huai-Hsun Cheng, Tsung-Ju Yang, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种无需训练的快速框架,通过跨空间双分支去噪和视图条件纹理合成,在3-5分钟内生成高真实感双语义3D视觉错觉,优于现有方法。

Comments ECCV 2026. Project page: https://siang1105.github.io/JanusMesh.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19736 2026-06-19 cs.CV 新提交 57%

VFACamou: View-Fused Adversarial Camouflage for Environment-Adaptive Physical Evasion

VFACamou: 视图融合的对抗性伪装用于环境自适应物理规避

Shihui Yan, Hu Liu, Junyu Shi, Zihui Zhu, Ziqi Zhou, Yufei Song, Youming Geng, Minghui Li, Shengshan Hu

机构 * State Key Laboratory of Intelligent Vehicle Safety Technology(智能汽车安全技术国家重点实验室) School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间安全学院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Hebei Energy College of Vocation And Technology(河北能源职业技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种端到端框架,结合UV体积渲染与扩散纹理生成器,并引入照明颜色一致性估计器和多尺度动态训练策略,生成可穿戴对抗图案,在无人机侦察等动态视角和光照变化下实现稳定物理攻击。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18869 2026-06-18 cs.CV 新提交 57%

Learning to Distort: Weakly-Supervised Image Quality Transfer for Prostate DWI Correction

学习扭曲:用于前列腺DWI校正的弱监督图像质量迁移

YuCheng Tang, Wen Yan, Alexander Ng, Natasha Thorley, Pawel Rajwa, Yipei Wang, Aqua Asif, Clare Allen, Louise Dickinson, Francesco Giganti, David Atkinson, Shonit Punwani, Daniel Alexander, Shaheer Ullah Saeed, Veeru Kasivisvanathan, Yipeng Hu

机构 * UCL Hawkes Institute(UCL哈维斯研究所) Department of Medical Physics and Biomedical Engineering(医学物理与生物医学工程系) University College London(伦敦大学学院) Division of Surgery and Interventional Science(外科与介入科学分会) Centre for Medical Imaging(医学成像中心) British Urology Researchers in Surgical Training (BURST)(英国泌尿外科手术培训研究人员(BURST)) Department of Radiology(放射科) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院国家健康服务信托基金) Centre for Medical Image Computing(医学图像计算中心) Department of Computer Science(计算机科学系) Department of Urology(泌尿科)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出弱监督图像质量迁移框架,利用图像质量评估信号从无失真图像学习生成真实失真,并训练校正模型,在PI-RADS和Gleason评分分类任务中优于现有无配对方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13768 2026-06-18 cs.CV cs.AI 新提交 57%

CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation

CineOrchestra:面向电影视频生成的统一实体中心条件控制

Sharath Girish, Tsai-Shien Chen, Zhikang Dong, Mukesh Singhal, Hao Chen, Sergey Tulyakov, Aliaksandr Siarohin

机构 * Snap Inc.(Snap公司) UC Merced(加州大学默塞德分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出CineOrchestra,一种统一控制主体、事件、相机和镜头切换的视频扩散模型,通过实体中心条件原语和参数无关的旋转位置编码实现多轴联合控制,在密集描述跟随和镜头切换时序上超越六种专用方法。

Comments Project page: https://snap-research.github.io/CineOrchestra

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13376 2026-06-18 cs.CV 新提交 57%

MoVerse: Real-Time Video World Modeling with Panoramic Gaussian Scaffold

MoVerse: 基于全景高斯支架的实时视频世界建模

Yang Zhou, Ziheng Wang, Yuqin Lu, Haofeng Liu, Jun Liang, Shengfeng He, Jing Li

机构 * South China University of Technology Columbia University Orange Team, Youku Moku-Lab, HUJING Digital Media \& Entertainment Group Singapore Management University

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出MoVerse,从单张窄视场图像实时构建可交互漫游的360度全景世界,通过拓扑感知扩散补全视场、全景几何残差预测生成3D高斯支架,并结合双向扩散教师蒸馏为因果自回归学生实现低延迟视频渲染。

Comments Project Page: https://orange-3dv-team.github.io/MoVerse/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17601 2026-06-17 cs.CV 新提交 57%

Test-Time Training for Robust Text-Guided Open-Vocabulary Object Counting

测试时训练用于鲁棒文本引导的开放词汇目标计数

Hao-Yuan Ma, Yuda Zou, Li Zhang, Yongchao Xu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Wuhan University(武汉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Dual-TTT框架,通过测试时训练轻量去噪模块,提升文本引导开放词汇目标计数在恶劣条件下的鲁棒性,无需修改原模型架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17584 2026-06-17 cs.CV cs.LG 新提交 57%

Root-Selecting Fixed-Point Inversion for Rectified Flows via Trajectory Straightness

基于轨迹直线度的整流流根选择不动点反演

Semin Kim, Jihwan Yoon, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :image editing(abstract);分类 cs.CV

AI总结 提出SelFix方法,通过选择使逆轨迹更直的不动点解,在整流流中实现精确反演,提升图像重建和编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17408 2026-06-17 cs.RO cs.CV cs.LG 新提交 57%

Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies

动作生成应从何处开始?面向生成式机器人策略的可学习源先验

Meipo Dai, Qiyuan Zhuang, He-Yang Xu, Ying-Jie Shuai, Yijun Wang, Qi Dou, Xiu-Shen Wei

机构 * Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出LeaP,用轻量MLP预测基于本体感知的对角高斯分布作为动作生成源先验,替代标准高斯分布,在15个RoboTwin任务中平均成功率81.6%,优于基线方法6.5-25.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17379 2026-06-17 cs.CV cs.AI eess.IV 新提交 57%

MeiBRD: Meta-Learning Intraoperative Biomechanical Residual Deformation

MeiBRD:元学习术中生物力学残余变形

Casey Meisenzahl, Jon Heiselman, Michael Holtz, Yubo Ye, Michael Miga, Linwei Wang

机构 * Rochester Institute of Technology(罗切斯特理工学院) Vanderbilt University(范德堡大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出混合配准框架,利用稀疏术中对应点自适应生物力学先验,通过图神经扩散函数学习残余变形,结合元学习从术中样本中快速适应,在肝脏体模上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17310 2026-06-17 cs.CV 新提交 57%

SierpinskiCam: Camera-Controlled Video Retaking with Sierpinski Triangle Pattern Cues

SierpinskiCam: 基于谢尔宾斯基三角形图案线索的相机控制视频重拍

Suttisak Wizadwongsa, Hyelin Nam, Supasorn Suwajanakorn, Jeong Joon Park

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) VISTEC, Thailand(泰国威斯泰克科学技术研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出SierpinskiCam方法,通过谢尔宾斯基圆顶纹理线索增强几何引导,并引入参考视频条件机制,解决单目视频重拍中相机大角度偏离时的稀疏区域问题,提升相机可控性、几何一致性和视频质量。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17048 2026-06-16 cs.LG cs.CV stat.ML 新提交 57%

Exact Posterior Score Estimation for Solving Linear Inverse Problems

精确后验分数估计用于求解线性逆问题

Abbas Mammadov, Ozgur Kara, Kaan Oktay, Iskander Azangulov, Adil Kaan Akan, Hyungjin Chung, James Matthew Rehg, Yee Whye Teh

机构 * University of Oxford(牛津大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) EverEx

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出精确后验分数(EPS)方法,通过闭式后验分数将线性逆问题转化为去噪问题,无需梯度或投影,在FFHQ和ImageNet上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16354 2026-06-16 cs.CV 新提交 57%

GraphBEV++: Multi-Modal Feature Alignment for Autonomous Driving

GraphBEV++: 自动驾驶中的多模态特征对齐

Ziying Song, Caiyan Jia, Lin Liu, Shaoqing Xu, Lei Yang, Yadan Luo

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院,交通数据挖掘与具身智能北京市重点实验室) School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) University of Macau(澳门大学) Nanyang Technological University(南洋理工大学) The University of Queensland(昆士兰大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对自动驾驶中BEV感知的特征未对齐问题,提出GraphBEV++框架,通过局部对齐(LocalAlign-v2)和全局对齐(GlobalAlign-v2)模块,利用图匹配、可变形偏移和扩散去噪方法,在多种基准上实现最优性能。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16317 2026-06-16 cs.CV 新提交 57%

Training-free sparse attention based on cumulative energy filtering

基于累积能量过滤的无训练稀疏注意力

Chunlu Li, Yixuan Pan, Bai Du, Zhenyuan Chen, Yanzhao Li, Hui Dong, Hui Wang, Zhiqiang Zou

机构 * Huawei Technologies(华为技术有限公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出动态阈值策略,在保持固定召回率的同时提高稀疏性,并与Flash Attention深度集成,无需额外掩码计算,在Wan 2.2上稀疏度从61.42%提升至82%,VBench指标下降小于5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16124 2026-06-16 cs.CV 新提交 57%

Training-Free Open-Vocabulary Visual Grounding for Remote Sensing Images and Videos

面向遥感图像与视频的无训练开放词汇视觉定位

Ke Li, Di Wang, Yongshan Zhu, Ting Wang, Weiping Ni, Tao Lei, Quan Wang, Xinbo Gao

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Interdisciplinary Institute of Artificial Intelligence, Xidian University(西安电子科技大学跨学科人工智能研究院) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Northwest Institute of Nuclear Technology(西北核技术研究所) School of Physics and Information Engineering, Fuzhou University(福州大学物理与信息工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出无训练框架RSVG-ZeroOV,利用冻结的通用基础模型通过概览-聚焦-演化范式实现零样本开放词汇遥感视觉定位,并扩展至视频时空定位,在多个基准上超越现有零样本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15574 2026-06-16 cs.CV 新提交 57%

Toward the Whole Picture: Accumulative Fingerprint Mapping and Reconstruction for Small-Area Mobile Sensors

迈向全貌:小面积移动传感器的累积指纹映射与重建

Xiongjun Guan, Jianjiang Feng, Jie Zhou

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对小面积移动指纹传感中采集与识别不匹配的问题,提出累积映射与重建框架,将局部观测序列转化为统一指纹状态,实现单次匹配,提升效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15534 2026-06-16 cs.CV 新提交 57%

Track2View: 4D-Consistent Camera-Controlled Video Generation via Paired 3D Point Tracks

Track2View: 通过配对3D点轨迹实现4D一致的相机控制视频生成

Feng Qiao, Zhaochong An, Zhexiao Xiong, Serge Belongie, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) University of Copenhagen(哥本哈根大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Track2View,利用配对3D点轨迹为视频扩散变压器提供显式时空对应,实现新视角视频渲染,在视觉质量、视角同步和相机精度上达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14988 2026-06-16 cs.GR 新提交 57%

Toward Richer Material Generation via Procedural Data Enhancement

通过程序化数据增强实现更丰富的材质生成

Yunchen Yu, Jacob Munkberg, Jon Hasselgren, Chris Cummings, Steve Marschner, Andrea Weidlich

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 提出一种程序化数据增强方法,将简单PBR材质的单瓣GGX镜面反射扩展为多层模型,以捕获更丰富的非漫反射效果,并通过神经材质编码和扩散模型生成实现更丰富的材质生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14972 2026-06-16 cs.CV 新提交 57%

ReGenHuman: Re-Generating Human Appearances for Realistic Full-Body Video Anonymization

ReGenHuman: 重新生成人体外观以实现逼真的全身视频匿名化

Adam Sun, Eshaan Barkataki, Arnold Milstein, Gordon Wetzstein, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出ReGenHuman,首个同时实现逼真、时间一致且天生匿名的全身视频匿名化流水线,采用“重新生成而非编辑”范式,利用结构条件微调视频扩散模型合成人体区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14759 2026-06-16 cs.CV cs.AI 新提交 57%

Temporally Consistent and Controllable Video Generation of 2D Cine CMR via Latent Space Motion Modeling

基于潜在空间运动建模的二维电影心脏磁共振时序一致且可控视频生成

Yiheng Cao, Gustavo Andrade-Miranda, Jiatian Zhang, Guillaume Sallé, Xin Gao

机构 * Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Sciences(苏州生物医学工程与技术研究所,中国科学院) SyCoIA, IMT Mines Ales(SyCoIA,IMT Mines Ales)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种文本到视频生成方法,通过解耦心脏空间结构与时间运动,利用微调扩散模型合成初始帧,再以心脏相位嵌入条件化潜在流模型生成完整运动,实现高时序一致性和解剖可控性。

Journal ref ISBI 2026 - IEEE International Symposium on Biomedical Imaging, Apr 2026, London, United Kingdom. pp.1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09150 2026-06-16 cs.CV 新提交 57%

Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions

Ultra Flash: 将实时流式视频生成扩展到高分辨率

Luxury, Jie Huang, Zihao Fan, Xiaoxiao Ma, Jun-hao Zhuang, Yuming Li, Zeyue Xue, Siming Fu, Haoran Li, Mingchen Zhong, Guohui Zhang, Shichen Ma, Yijun Liu, Jiaqi Shi, Yanwen Ma, Yaofeng Su, Haoyu Wang, Yaowei Li, Songchun Zhang, Weiyang Jin, Yuxuan Bian, Shiyi Zhang, Haojun Xu, Shuai Lu, Xin Han, Wei Tang, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索研究院) USTC(中国科学技术大学) PKU(北京大学) THU(清华大学) BUAA(北京航空航天大学) FDU(复旦大学) HKUST(香港科技大学) HKU(香港大学) CUHK(香港中文大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Ultra Flash级联框架,通过架构保持的超分辨率训练、因果流式潜在上采样器和高分辨率解码器、以及级联优化方案,在单GPU上实现1K分辨率约30 FPS和2K分辨率约18 FPS的实时高分辨率流式视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14317 2026-06-15 cs.CV 新提交 57%

CausalMotion: Structured Physical Reasoning as Keyframe and Trajectory Guidance for Training-Free Video Generation

CausalMotion: 基于关键帧与轨迹引导的结构化物理推理实现免训练视频生成

Sihan Zhuang, Xinyuan Chen, Tianfan Xue, Yaohui Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出CausalMotion框架,利用视觉语言模型将文本提示分解为因果一致的关键帧和物体运动轨迹,作为软约束引导预训练视频扩散模型,无需额外训练即可提升物理合理性和时间连贯性。

Comments Project Page: https://zhuangsh0713.github.io/CausalMotion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14230 2026-06-15 cs.CV cs.CL 新提交 57%

A Multi-Domain Feature Fusion Framework for Generalizable Deepfake Detection Across Different Generators

面向不同生成器的可泛化深度伪造检测的多域特征融合框架

Amna Amjid, Sana Qadir, Mehwish Fatima, Raja Khurram Shahzad

机构 * School of Electrical Engineering and Computer Science (SEECS), National University of Sciences and Technology (NUST), Islamabad, Pakistan(巴基斯坦国立科技大学电气工程与计算机科学学院) Department of Communication, Quality Management and Information Systems, Mid Sweden University, Ostersund Campus, Sweden(瑞典中部大学通信、质量管理和信息系统系,厄斯特松德校区) Department of Computer Science, Electrical and Space Engineering, Lulea University of Technology, Luleå, Sweden(瑞典吕勒奥理工大学计算机科学、电气与空间工程系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出SGFF-Net,融合空间、梯度和DWT频率表示,在双残差学习架构中实现跨生成器和跨范式的深度伪造检测,准确率提升至79.80%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13861 2026-06-15 cs.CV 新提交 57%

Temporal Backtracking Search for Test-time Generative Video Reasoning

时间回溯搜索:测试时生成式视频推理

Sejoon Jun, Zheng Ding, Huangyuan Su, Weirui Ye, Yilun Du

机构 * Northeastern University(东北大学) Independent Researcher(独立研究者) Harvard & Kempner(哈佛大学与肯普纳研究所) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出时间回溯搜索(TBS),通过将搜索空间转移到时间轴,在扩散过程中定位失败点并回溯重启,显著提升视频模型在测试时的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14638 2026-06-15 cs.CV astro-ph.EP 新提交 57%

Improving Lunar Topography with Deep Learning Schrödinger Bridges

利用深度学习薛定谔桥改进月球地形

Matthew Repasky, Erwan Mazarico, Michael K. Barker, Stefano Bertone, Terence J. Sabaka, Yao Xie

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H. Milton Stewart工业与系统工程系) NASA Goddard Space Flight Center(美国国家航空航天局戈达德太空飞行中心) Center for Research and Exploration in Space Science and Technology (CRESST II), University of Maryland, College Park(马里兰大学帕克分校空间科学与技术研究与探索中心(CRESST II)) National Institute for Astrophysics (INAF), Astrophysical Observatory of Turin(意大利国家天体物理研究所(INAF)都灵天体物理天文台)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于扩散薛定谔桥的生成模型,结合光学影像约束,实现月球地形超分辨率重建,并提供像素级不确定性估计。

Journal ref The Planetary Science Journal 7.6 (2026): 139

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13494 2026-06-12 cs.RO cs.CV 新提交 57%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13432 2026-06-12 cs.CV cs.AI 新提交 57%

OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data

OmniDirector: 无需配对数据的通用多镜头相机克隆

Jiwen Liu, Shujuan Li, Zhixue Fang, Xiaohan Li, Yan Zhou, Zijie Meng, Zhimin Zhang, Yawen Luo, Guoxin Zhang, Yu-Shen Liu, Pengfei Wan

机构 * Kuaishou Technology(快手科技) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出OmniDirector框架,通过将相机参数编码为网格运动视频,并利用百万级配对数据训练,实现无需交叉配对数据的多镜头相机运动克隆,具备卓越的控制性能。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13364 2026-06-12 cs.LG cs.CV 新提交 57%

VideoMDM: Towards 3D Human Motion Generation From 2D Supervision

VideoMDM: 从2D监督走向3D人体运动生成

Amir Mann, Gal Michael Harari, Merav Keidar, Or Litany

机构 * Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出VideoMDM框架,利用单目视频的2D姿态通过扩散模型学习3D运动先验,使用深度加权的2D重投影损失近似3D监督,在HumanML3D上接近全3D监督性能。

Comments https://videomdm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13035 2026-06-12 cs.CV cs.AI 新提交 57%

TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted Alignment

TetherCache: 基于门控召回与可信对齐的自回归长视频生成稳定性方法

Yu Meng, Xiangyang Luo, Letian Li, Wenyuan Jiang, Chen Gao, Xinlei Chen, Yong Li, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) D-INFK, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出TetherCache,一种无需训练、即插即用的缓存管理策略,通过门控召回(GRAB)和可信对齐编辑(TAME)缓解自回归视频扩散模型中的上下文漂移,实现稳定长视频生成。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10450 2026-06-10 cs.CV cs.LG 新提交 57%

Few-step Generative Models as Lossy Compression

少步生成模型作为有损压缩

Fuma Kimishima, Jinjia Zhou

机构 * University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究将少步生成模型(Rectified Flow、CTM、MeanFlow)用于反向信道编码框架进行有损压缩,通过参数化等效和局部高斯近似实现无需重训练的编解码,在低分辨率基准上减少编解码时间并提升低比特率下的真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏