arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-20 至 2026-03-20 共收录 83 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 56 篇

2603.18320 2026-03-20 math.PR 50%

Global Tensor Field Formulation of the Fokker-Planck Equation on Riemannian Manifolds

黎曼流形上的福克-普朗克方程全局张量场公式

Taeyoung Lee, Gregory S. Chirikjian

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种基于张量场的全局坐标无关福克-普朗克方程形式,通过利叶导数和散度定理推导出其伴随算子,建立几何化的方程表达,同时引入扩散张量场以推广欧几里得扩散矩阵,提供一种直观且简洁的几何解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18061 2026-03-20 physics.flu-dyn math.AP 50%

SIREN Residual Error as a Regularity Diagnostic for Navier-Stokes Equations

SIREN残差误差作为纳维-斯托克斯方程的正则性诊断

Jason Burton

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文利用SIREN残差误差检测纳维-斯托克斯方程解的正则性损失,通过分析误差集中现象验证了在粘度降低时的奇异点定位,并确定了临界粘度。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 10 篇

2603.19227 2026-03-20 cs.CV 79%

Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer

通过扩散基离散运动分词器弥合语义与运动条件

Chenyang Gu, Mingyuan Zhang, Haozhe Xie, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出三阶段框架,结合连续扩散模型与离散分词生成器,通过MoTok分词器实现语义与运动控制的结合,提升运动生成的可控性与保真度。

Comments Project Page: https://rheallyc.github.io/projects/motok GitHub: https://github.com/rheallyc/MoTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18356 2026-03-20 cs.AI 67%

LGESynthNet: Controlled Scar Synthesis for Improved Scar Segmentation in Cardiac LGE-MRI Imaging

LGESynthNet:用于改进心脏LGE-MRI成像瘢痕分割的受控瘢痕合成

Athira J. Jacob, Puneet Sharma, Daniel Rueckert

机构 * Digital Technology and Innovation, Siemens Healthineers(西门子医疗数字化技术与创新部) Al in Healthcare and Medicine, Klinikum rechts der Isar, Technical University of Munich(医疗与医学AI,慕尼黑工业大学右侧医院) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract)

AI总结 本文提出LGESynthNet,一种基于潜在扩散模型的可控合成框架,通过奖励模型、提示模块和生物医学文本编码器,利用少量标注数据生成高质量瘢痕图像,提升后续分割和检测性能。

Comments Accepted at MICCAI STACOM workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19228 2026-03-20 cs.CV 57%

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐

Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan Chen, Hui Zhang, Haocheng Feng, Yu Lu, Hang Zhou, Chun Yuan, Jingdong Wang

机构 * Baidu(百度) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18427 2026-03-20 cs.CV cs.AI 57%

R&D: Balancing Reliability and Diversity in Synthetic Data Augmentation for Semantic Segmentation

R&D: 在语义分割中平衡可靠性与多样性以合成数据增强

Huy Che, Dinh-Duy Phan, Duc-Khai Lam

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(越南胡志明市信息科技学院) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种整合可控扩散模型的合成数据增强方法,通过类感知提示和视觉先验融合提升图像质量,有效提升语义分割性能,尤其在数据稀缺场景中表现优异。

Journal ref Computational Collective Intelligence, ICCCI 2025, Lecture Notes in Computer Science 16139 (2026) 433-448

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16098 2026-03-20 cs.CV cs.AI 57%

LICA: Layered Image Composition Annotations for Graphic Design Research

LICA:图形设计研究的分层图像组成标注

Elad Hirsch, Shubham Yadav, Mohit Garg, Purvanshi Mehta

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 LICA提出了一个包含155万个多层图形设计作品的数据集,通过分层结构和丰富的元数据,推动图形布局的结构理解和生成,同时引入动画布局挑战,支持时序感知生成模型等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20649 2026-03-20 cs.CV 57%

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

Infinity-RoPE: 自动回归自回滚中涌现的无限视频生成

Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Infinity-RoPE,通过Block-Relativistic RoPE、KV Flush和RoPE Cut三个组件解决自回归视频扩散模型的三个瓶颈,实现无限时域、可控和电影级视频生成。

Comments CVPR 2026 | Project Page: https://infinity-rope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18900 2026-03-20 math.AP math.OC 50%

Optimal Bilinear control restricted to the three-dimensional chemo-repulsion model with potential production

最优双线性控制受限于三维化学排斥模型及其潜在生产

Francisco Guillen-Gonzalez, Exequiel Mallea-Zepeda, Maria A. Rodriguez-Bellido, Elder J. Villamizar-Roa

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了带有潜在生产、逻辑反应和双线性控制的三维抛物型化学排斥模型,证明了在特定控制函数下全局弱解的存在性,并探讨了正则性条件对最优双线性控制问题的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18658 2026-03-20 eess.SY cs.SY 50%

Mean-field control barrier functions for stochastic multi-agent systems

均场控制屏障函数用于随机多智能体系统

Cinzia Tomaselli, Gian Carlo Maffettone, Samy Wu Fung, Levon Nurbekyan, Mario di Bernardo

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出均场控制屏障函数,用于保障随机多智能体系统安全,通过稳定性分析和数值模拟验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18367 2026-03-20 math.OC 50%

Stabilization of highly nonlinear hybrid stochastic differential delay equations by periodically intermittent feedback controls based on discrete-time observations with asynchronous switching

基于离散时间观测与异步切换的周期性间断反馈控制对高非线性混合随机微分延迟方程的稳定性研究

Guangqiang Lan, Fansai Meng

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究高非线性混合随机微分延迟方程的矩指数稳定性,设计基于离散时间观测与异步切换的周期性间断控制器,确定观测周期上界和控制宽度下界,证明控制系统的指数稳定性及收敛速度。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16952 2026-03-20 cs.RO cs.AI 50%

Embodied Foundation Models at the Edge: A Survey of Deployment Constraints and Mitigation Strategies

边缘端具身基础模型:部署约束及缓解策略综述

Utkarsh Grover, Ravi Ranjan, Mingyang Mao, Trung Tien Dong, Satvik Praveen, Zhenqi Wu, J. Morris Chang, Tinoosh Mohsenin, Yi Sheng, Agoritsa Polyzou, Eiman Kanjo, Xiaomin Lin

机构 * University of South Florida(佛罗里达州立大学) Florida International University(佛罗里达国际大学) Johns Hopkins University(约翰霍普金斯大学) Nottingham Trent University(诺丁汉特伦特大学) Imperial College London(伦敦帝国理工学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文综述了在边缘端部署具身基础模型时面临的系统性约束及缓解策略,重点探讨了内存带宽、计算延迟和执行成本等关键因素对自动回归视觉-语言-动作策略和扩散控制器的影响,强调了内存、调度、通信和模型架构的协同设计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2603.18645 2026-03-20 cs.CV 57%

MeInTime: Bridging Age Gap in Identity-Preserving Face Restoration

MeInTime:弥合年龄差距的恒定身份面部修复

Teer Song, Yue Zhang, Yu Tian, Ziyang Wang, Xianlin Zhang, Guixuan Zhang, Xuan Liu, Xueming Li, Yasen Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院) Minzu University of China(民族大学) Xiaomi Corporation(小米公司)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 MeInTime提出一种基于扩散的面部修复方法,通过引入年龄提示和新的注意力机制,实现跨年龄的恒定身份修复,提升了身份保真度和年龄一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23251 2026-03-20 eess.IV 50%

Deep Learning for Restoring MPI System Matrices Using Simulated Training Data

利用模拟训练数据通过深度学习恢复MPI系统矩阵

Artyom Tsanda, Sarah Reiss, Konrad Scheffler, Marija Boberg, Tobias Knopp

专题命中 图像修复 :inpainting(abstract)

AI总结 本文研究了基于物理的模拟系统矩阵是否能训练深度学习模型用于系统矩阵恢复任务,如去噪、加速校准、上采样和修补,证明了模型在真实数据中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2508.11431 2026-03-20 cs.CV 57%

Remove360: Benchmarking Residuals After Object Removal in 3D Gaussian Splatting

Remove360: 3D高斯散射中物体移除后残差的基准测试

Simona Kocour, Assia Benbihi, Torsten Sattler

机构 * CTU in Prague, Czech Republic(布拉格CTU,捷克共和国)

专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV

AI总结 本文提出Remove360数据集和评估框架,用于量化3D高斯散射中物体移除后的语义残差,揭示几何移除与语义擦除之间的差距,强调隐私保护移除方法的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19173 2026-03-20 cs.LG cs.AI 50%

SOL-ExecBench: Speed-of-Light Benchmarking for Real-World GPU Kernels Against Hardware Limits

SOL-ExecBench:面向真实世界GPU内核的光速基准测试,针对硬件极限

Edward Lin, Sahil Modi, Siva Kumar Sastry Hari, Qijing Huang, Zhifan Ye, Nestor Qin, Fengzhe Zhou, Yuan Zhang, Jingquan Wang, Sana Damani, Dheeraj Peri, Ouye Xie, Aditya Kane, Moshe Maor, Michael Behar, Triston Cao, Rishabh Mehta, Vartika Singh, Vikram Sharma Mailthody, Terry Chen, Zihao Ye, Hanfeng Chen, Tianqi Chen, Vinod Grover, Wei Chen, Wei Liu, Eric Chung, Luis Ceze, Roger Bringmann, Cyril Zeller, Michael Lightstone, Christos Kozyrakis, Humphrey Shi

机构 * NVIDIA

专题命中 图像生成评测 :diffusion(abstract)

AI总结 SOL-ExecBench通过235个CUDA内核优化问题,针对NVIDIA Blackwell GPU的硬件极限,提出基于Speed-of-Light(SOL)的基准测试方法,评估内核优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 7 篇

2509.22925 2026-03-20 cs.CV cs.AI cs.LG 85%

Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings

Soft-Di[M]O: 通过软嵌入提升一步离散图像生成

Yuanzhi Zhu, Xi Wang, Stéphane Lathuilière, Vicky Kalogeiton

机构 * LIX, École Polytechnique, CNRS, IPP(IX实验室,巴黎高等理工学院,法国国家科学研究中心,IPP) Inria at Univ. Grenoble Alpes, CNRS, LJK(里尔大学,法国国家科学研究中心,LJK)

专题命中 效率与蒸馏 :image generation(title);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 本文提出Soft-Di[M]O框架,通过引入软嵌入解决一步生成器中离散token阻断梯度的问题,实现端到端训练并支持GAN精炼、可微奖励微调和TTEO。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18095 2026-03-20 cs.CV cs.LG 83%

Q-Drift: Quantization-Aware Drift Correction for Diffusion Model Sampling

Q-Drift:扩散模型采样中的量化感知漂移校正

Sooyoung Ryu, Mathieu Salzmann, Saqib Javed

机构 * Department of Computer Science and Engineering, Seoul National University, Seoul, South Korea(计算机科学与工程系,首尔国立大学,韩国首尔) School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(计算机与通信科学学院,瑞士洛桑联邦理工学院) Meta Reality Labs, Redmond, USA(Meta现实实验室,美国西雅图)

专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Q-Drift,一种在采样端校正量化噪声的方法,通过将量化误差视为隐含的随机扰动,提升扩散模型生成质量,实验显示在多种模型和方法上均有效。

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18742 2026-03-20 cs.CV 79%

6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models

6Bit-Diffusion:视频扩散模型推理时的混合精度量化

Rundong Su, Jintao Zhang, Zhihang Yuan, Haojie Duanmu, Jianfei Chen, Jun Zhu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种推理时的混合精度量化框架,通过动态分配NVFP4和INT8精度,提升视频扩散模型的效率与质量,实验显示在推理速度和内存占用上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18501 2026-03-20 cs.CV cs.AI 79%

Efficient Video Diffusion with Sparse Information Transmission for Video Compression

高效视频扩散与稀疏信息传输用于视频压缩

Mingde Zhou, Zheng Chen, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Diff-SIT方法,通过稀疏时序编码模块和单步视频扩散模型提升视频压缩的感知质量和时间一致性,尤其在超低比特率下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09465 2026-03-20 cs.CV 57%

OFTSR: One-Step Flow for Image Super-Resolution with Tunable Fidelity-Realism Trade-offs

OFTSR: 一种用于图像超分辨率的一步流方法,具有可调保真度-现实感权衡

Yuanzhi Zhu, Ruiqing Wang, Shilin Lu, Junnan Li, Hanshu Yan, Kai Zhang

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出OFTSR,一种基于流的图像超分辨率框架,通过可调保真度与现实感权衡实现一步生成。通过训练条件流模型并应用特殊约束,使学生模型预测与教师模型采样轨迹对齐,从而提升性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18572 2026-03-20 eess.IV cs.CV 57%

UEPS: Robust and Efficient MRI Reconstruction

UEPS:鲁棒且高效的MRI重建

Xiang Zhou, Hong Shang, Zijian Zhan, Tianyu He, Jintao Meng, Dong Liang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, China(深圳先进技术研究院,中国科学院,中国) School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University, China(生物医学工程学院,深圳大学医学院,深圳大学,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology, China(计算机科学与人工智能学院,深圳先进技术大学,中国) State Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences, China(生物医学成像科学与系统国家重点实验室,中国科学院,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出UEPS框架,通过消除CSM依赖、渐进分辨率和稀疏注意力机制,提升MRI重建的鲁棒性和效率,在多种临床转移测试中表现优异。

Comments The document contains the main paper and additional experimental details in the supplementary material. Open-source code can be found at: https://github.com/HongShangGroup/UEPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22592 2026-03-20 cs.LG 50%

OT-MeanFlow3D: Bridging Optimal Transport and Meanflow for Efficient 3D Point Cloud Generation

OT-MeanFlow3D: 通过最优传输与Meanflow弥合,实现高效的3D点云生成

Elaheh Akbari, Shansita Sharma, Ping He, Ahmadreza Moradipari, Kyungtae Han, Hamed Pirsiavash, Yikun Bai, Soheil Kolouri

机构 * Department of Computer Science, Vanderbilt University(范德比尔特大学计算机科学系) Toyota InfoTech Labs(丰田信息技术实验室) Department of Computer Science, University of California, Davis(加州大学戴维斯分校计算机科学系) Department of Mathematics, Purdue University(普渡大学数学系)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出OT-MeanFlow3D框架,通过整合最优传输采样,提升3D点云生成与修复的效率与准确性,实验表明其在ShapeNet上优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏