arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-01 至 2026-04-01 共收录 85 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 57 篇

2402.15123 2026-04-01 physics.flu-dyn 50%

Turbulent Accelerating Combusting Flows with a Methane-Vitiated Air Flamelet Model

带甲烷掺混空气的湍流加速燃烧流

Sylvain L. Walsh, Lei Zhan, Carsten Mehring, Feng Liu, William A. Sirignano

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了掺混空气条件下甲烷燃烧的湍流燃烧层,采用火焰图变量方法结合k-ω和SST湍流模型,分析了反应机制细节对燃烧过程的影响。

Comments 35 pages, 17 figures. Presented as Paper 2024-2427 at the AIAA SciTech 2024 Forum, Orlando, Florida, January 8-12, 2024

Journal ref AIAA Jorunal, Volume 63, No. 4, April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.12074 2026-04-01 cond-mat.stat-mech nlin.PS physics.bio-ph physics.chem-ph 50%

Thermodynamic Bounds on Symmetry Breaking in Linear and Catalytic Biochemical Systems

热力学对线性和催化生化系统对称性破缺的限制

Shiling Liang, Paolo De Los Rios, Daniel Maria Busiello

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文基于矩阵树定理,推导了线性和催化生化系统对称性破缺的热力学上下界,揭示了非平衡条件在塑造稳态性质中的作用。

Journal ref Phys. Rev. Lett. 132, 228402 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15491 2026-04-01 math.OC 50%

A unified approach to shape and topological sensitivity analysis of discretized optimal design problems

形状和拓扑灵敏度分析的统一方法:离散最优设计问题

Peter Gangl, Michael H. Gfrerer

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种统一的灵敏度概念,用于分析离散PDE约束优化问题中的形状和拓扑扰动,并将其与连续形状和拓扑导数联系起来。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 5 篇

2603.29634 2026-04-01 cs.CV cs.AI 74%

MacTok: Robust Continuous Tokenization for Image Generation

MacTok: 图像生成中的鲁棒连续分词

Hengyu Zeng, Xin Gao, Guanghao Li, Yuxiang Yan, Jiaoyang Ruan, Junpeng Ma, Haoyu Albert Wang, Jian Pu

机构 * Fudan University(复旦大学)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 MacTok通过引入图像掩码和表征对齐,防止后验崩溃,实现高效且高保真的连续分词,仅需64或128个token,在ImageNet上取得优异成绩。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29570 2026-04-01 cs.CV cs.AI 57%

Generating Key Postures of Bharatanatyam Adavus with Pose Estimation

通过姿态估计生成巴赫提亚姆阿达夫的关键姿态

Jagadish Kashinath Kamble, Jayanta Mukhopadhyay, Debaditya Roy, Partha Pratim Das

机构 * Indian Institute of Technology(印度理工学院) Ashoka University(阿育王大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种结合姿态估计模块的生成框架,通过关键点损失和姿态一致性约束,提升巴赫提亚姆阿达夫关键姿态的生成精度与文化真实性。

Comments Published in ICVGIP, 2025

Journal ref In Proceedings of the Indian Conference on Computer Vision, Graphics and Image Processing (ICVGIP), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29446 2026-04-01 math.PR 50%

Law of large numbers for stochastic multiscale spatial gene networks

随机多尺度空间基因网络的大数定律

Arnaud Debussche, Baptiste Huguet

专题命中 可控生成 :diffusion(abstract)

AI总结 研究随机多尺度空间基因网络的收敛性,通过离散Sobolev空间中的矩控制和乘积规则,证明系统收敛到由PDE和ODE组成的确定性系统,与混合 stirred 情况下的跳跃现象不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29409 2026-04-01 cs.RO 50%

CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics

CLaD:通过跨模态潜在动力学实现具有基础前瞻性的规划

Andrew Jeong, Jaemin Kim, Sebin Lee, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院)

专题命中 可控生成 :diffusion(abstract)

AI总结 CLaD通过不对称跨注意力机制联合建模本体和语义状态演化,利用自监督目标和EMA编码器防止表征崩溃,实现高成功率的长序列动作生成。

Comments Project page: https://andrewwwj.github.io/clad

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27756 2026-04-01 cs.RO cs.AI 50%

Heracles: Bridging Precise Tracking and Generative Synthesis for General Humanoid Control

Heracles:连接精确跟踪与生成合成以实现通用人形控制

Zelin Tao, Zeran Su, Peiran Liu, Jingkai Sun, Wenqiang Que, Jiahao Ma, Jialin Yu, Jiahang Cao, Pihai Sun, Hao Liang, Gang Han, Wen Zhao, Zhiyuan Xu, Jian Tang, Qiang Zhang, Yijie Guo

专题命中 可控生成 :diffusion(abstract)

AI总结 Heracles通过结合精确跟踪与生成合成,提升人形机器人在极端扰动下的鲁棒性,实现从刚性跟踪到开放生成的控制架构升级。

Comments 26 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2111.09027 2026-04-01 cs.CV 57%

Discriminative Dictionary Learning based on Statistical Methods

基于统计方法的判别字典学习

G. Madhuri, Atul Negi

机构 * School of Computer and Information Sciences, University of Hyderabad(海得拉巴大学计算机与信息科学学院)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文探讨了利用统计方法改进字典学习以提升分类性能,提出混合方法结合稀疏系数与多层感知机,实现判别字典学习。

Journal ref Statistical Modeling in Machine Learning Concepts and Applications 2023, Pages 55-77, Academic Press

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29423 2026-04-01 cs.CV 57%

A2BFR: Attribute-Aware Blind Face Restoration

A2BFR:属性感知的盲脸修复

Chenxin Zhu, Yushun Fang, Lu Liu, Shibo Yin, Xiaohong Liu, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出A2BFR框架,结合高保真重建与提示可控生成,通过属性感知学习和语义双训练提升修复精度与可控性,实验显示在恢复保真度和指令遵循上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 4 篇

2603.29356 2026-04-01 cs.CV cs.AI 70%

CIPHER: Counterfeit Image Pattern High-level Examination via Representation

CIPHER: 通过表征进行伪造图像模式高层检查

Kyeonghun Kim, Youngung Han, Seoyoung Ju, Yeonju Jean, YooHyun Kim, Minseo Choi, SuYeon Lim, Kyungtae Park, Seungwoo Baek, Sieun Hyeon, Nam-Joon Kim, Hyuk-Jae Lee

机构 * OUTTA Seoul National University(首尔国立大学)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出CIPHER框架,通过重用和微调生成模型判别器,提取多尺度特征和时间一致性特征,实现跨模型的深度伪造检测,实验表明其在F1-score上优于现有方法。

Comments 6 pages, 2 figures. Accepted at IEEE-Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29587 2026-04-01 cs.GR 57%

Style-Instructed Mask-Free Virtual Try On

风格指导的无掩膜虚拟试穿

Mengqi Zhang, Qi Li, Mehmet Saygin Seyfioglu, Karim Bouyarmane

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.GR

AI总结 本文提出一种无需掩膜的虚拟试穿框架,通过注意力引导机制和指令提示提升试穿准确性与交互灵活性,实验表明其在多个数据集上均优于现有方法。

Comments Project page: https://smf-vto.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28068 2026-04-01 cs.CV 57%

AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation

AIBench:评估学术示意图生成中的视觉-逻辑一致性

Zhaohe Liao, Kaixun Jiang, Zhihang Liu, Yujie Wei, Junqiu Yu, Quanhao Li, Hong-Tao Yu, Pandeng Li, Yuzheng Wang, Zhen Xing, Shiwei Zhang, Chen-Wei Xie, Yun Zheng, Xihui Liu

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SJTU(上海交通大学) FDU(复旦大学) USTC(中国科学技术大学) SEU(东南大学) HKU(香港大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出AIBench,首个通过VQA评估学术示意图逻辑正确性及VLM评估美观性的基准,通过四层问题验证生成示意图与论文的一致性,发现模型在该任务上的性能差异显著,且逻辑与美观难以同时优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12766 2026-04-01 cs.CV 57%

Catalyst4D: High-Fidelity 3D-to-4D Scene Editing via Dynamic Propagation

Catalyst4D: 通过动态传播实现高保真的3D到4D场景编辑

Shifeng Chen, Yihui Li, Jun Liao, Hongyu Yang, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhejiang Industrial Big Data and Robot Intelligent System Key Laboratory, Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院浙江省工业大数据与机器人智能系统重点实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Catalyst4D框架,通过动态传播实现高保真的4D场景编辑,保持时空一致性,优于现有方法。

Comments https://junliao2025.github.io/Catalyst4D-ProjectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 3 篇

2603.29855 2026-04-01 cs.GR 70%

PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generation

PosterReward: 解锁高质量图形设计生成的准确评估

Jianyu Lai, Sixiang Chen, Jialin Gao, Hengyu Shi, Zhongying Liu, Fuxiang Zhai, Junfeng Luo, Xiaoming Wei, Lujia Wang, Lei Zhu

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.GR

AI总结 本文提出PosterReward,通过多阶段训练策略构建高质量海报偏好数据集,设计专用奖励模型以提升海报评估精度,并引入评估基准测试现有模型性能。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29697 2026-04-01 cs.CV 57%

FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing

FED-Bench:一种跨粒度的面部表情编辑评估基准

Fengjian Xue, Xuecheng Wu, Heli Sun, Yunyun Shi, Shi Chen, Liangyu Fu, Jinheng Xie, Dingkang Yang, Hao Wang, Junxiao Xue, Liang He

机构 * Xi’an Jiaotong University(西安交通大学) Northwestern Polytechnical University(西北工业大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Zhejiang Lab(之江实验室)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 本文提出FED-Bench,通过构建747个三元组基准,引入FED-Score评估协议,评估面部表情编辑的对齐、保真度和相对表达增益,揭示当前方法在高保真与准确表达操控间的困境,并提供20k+真实世界面部训练集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17320 2026-04-01 cs.CV 57%

EMMA: Concept Erasure Benchmark with Comprehensive Semantic Metrics and Diverse Categories

EMMA:具有综合语义度量和多样类别的概念擦除基准

Lu Wei, Yuta Nakashima, Noa Garcia

机构 * The University of Osaka(大阪大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 EMMA通过13项指标评估五种概念擦除方法,揭示其在隐含提示和视觉相似非目标概念下的鲁棒性问题,发现部分方法加剧性别和种族偏见。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 7 篇

2603.28460 2026-04-01 cs.CV cs.LG 79%

$R_\text{dm}$: Re-conceptualizing Distribution Matching as a Reward for Diffusion Distillation

$R_\ ext{dm}$:重新概念化分布匹配作为扩散蒸馏的奖励

Linqian Fan, Peiqin Sun, Tiancheng Wen, Shun Lu, Chengru Song

机构 * KlingAI Research(KlingAI 研究院) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出将分布匹配重新概念化为奖励以提升扩散蒸馏性能,通过引入GNDM提升优化稳定性,实现无缝奖励整合和改进采样效率,实验表明其在生成质量与保真度上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29535 2026-04-01 cs.CV cs.AI 79%

Quantization with Unified Adaptive Distillation to enable multi-LoRA based one-for-all Generative Vision Models on edge

量化与统一自适应蒸馏用于在边缘设备上实现多LoRA基于的通用生成视觉模型

Sowmya Vajrala, Aakash Parmar, Prasanna R, Sravanth Kodavanti, Manjunath Arveti, Srinivas Soumitri Miriyala, Ashok Senapati

机构 * Samsung Research Institute Bangalore, India(三星研究所班加罗尔,印度)

专题命中 效率与蒸馏 :generative vision(title);image editing(abstract);分类 cs.CV

AI总结 本文提出统一框架,通过单共享模型在边缘设备上实现多任务生成式AI推理,采用动态任务切换和QUAD量化策略,减少内存占用和延迟,保持高质量生成效果。

Comments Accepted at the Mobile AI Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13280 2026-04-01 cs.LG 78%

Value Gradient Sampler: Learning Invariant Value Functions for Equivariant Diffusion Sampling

价值梯度采样器:用于等变扩散采样的不变价值函数

Himchan Hwang, Hyeokju Jeong, Dong Kyu Shin, Che-Sang Park, Sehee Kweon, Sangwoong Yoon, Frank Chongwoo Park

机构 * Seoul National University(首尔大学) Ulsan National Institute of Science and Technology (UNIST)(蔚山科学技术院)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出价值梯度采样器(VGS),通过价值函数参数化扩散采样器,利用等变梯度流在无规范目标密度下生成样本,结合先进强化学习方法与高效不变网络,实现高质量与高速采样。

Comments AISTATS 2026. Code: https://github.com/swyoon/value-gradient-sampler/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29572 2026-04-01 cs.GR cs.AI cs.CV 62%

Turbo4DGen: Ultra-Fast Acceleration for 4D Generation

Turbo4DGen: 4D生成的超快加速

Yuanbin Man, Ying Huang, Zhile Ren, Miao Yin

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Turbo4DGen框架,通过时空缓存机制和动态语义感知注意力剪枝,显著减少4D生成中的冗余计算,实现9.7倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29555 2026-04-01 cs.LG math.PR 50%

Total Variation Guarantees for Sampling with Stochastic Localization

总变分保证的随机定位采样

Jakob Kellermann

机构 * Weierstrass Institute Berlin(柏林魏尔斯特拉斯研究所)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出通过总变分距离保证SLIPS算法的收敛性,证明其在最小假设下所需步骤数与维度线性相关,揭示了离散化点选择的理论依据。

Comments 12 pages main body, 13 pages Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24394 2026-04-01 astro-ph.HE 50%

Derivation of the injection spectrum of positrons and electrons from Geminga and Monogem

从Geminga和Monogem推导出正电子和电子的注入光谱

Qian Zhong

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文通过分析Geminga和Monogem脉冲星的晕区域,结合GeV-TeVγ射线观测,推导出正电子和电子的注入光谱,发现硬谱和截止能量在10^5-10^6 GeV范围内,对AMS-02测量的宇宙射线正电子通量有抑制作用。

Comments 16 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23062 2026-04-01 math.PR cs.DS cs.NA math.AP math.NA math.ST stat.TH 50%

Shifted Composition IV: Toward Ballistic Acceleration for Log-Concave Sampling

移位组合 IV:迈向log-凹采样中的弹道加速

Jason M. Altschuler, Sinho Chewi, Matthew S. Zhang

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出基于耦合的局部误差框架,分析Underdamped Langevin动力学及其数值离散化在KL散度中的表现,实现了log-凹采样中的弹道加速,首次获得与条件数子线性相关的采样复杂度。

Comments v3: amending minor typos

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他图像生成 1 篇

2512.10805 2026-04-01 cs.LG cs.CV 57%

Interpretable and Steerable Concept Bottleneck Sparse Autoencoders

可解释且可操控的概念瓶颈稀疏自编码器

Akshay Kulkarni, Tsui-Wei Weng, Vivek Narayanaswamy, Shusen Liu, Wesam A. Sakla, Kowshik Thopalli

机构 * University of California, San Diego(加州大学圣迭戈分校) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出CB-SAE框架,通过剪枝低效神经元和增加概念瓶颈提升LVLMs和图像生成任务的可解释性和可操控性,效果提升分别为32.1%和14.5%。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏