arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-13 至 2026-04-13 共收录 82 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 58 篇

2603.17486 2026-04-13 cond-mat.soft physics.chem-ph 50%

Free-Energy Analysis of Bubble Nucleation on Electrocatalytic Surfaces

气泡成核的自由能分析:电催化表面

Qingguang Xie, Paolo Malgaretti, Othmane Aouane, Simon Thiele, Jens Harting

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出自由能模型预测气泡成核的活化能和临界核尺寸,发现活化能随过饱和度降低而减小,临界核半径随过饱和度减小而增大,理论预测与实验结果一致,为电解器催化剂层设计提供指导。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21602 2026-04-13 cs.CR cs.IT math.IT 50%

Condense to Conduct and Conduct to Condense

压缩以传导,传导以压缩

Tomasz Kazana

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文首次提出低导电性排列的例子,并证明低导电性排列等价于具有信息论性质的多源某处压缩器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07031 2026-04-13 cs.LG 50%

Reducing Class Bias In Data-Balanced Datasets Through Hardness-Based Resampling

通过难度基于的重采样减少数据平衡数据集中的类别偏差

Pawel Pukowski, Venet Osmani

机构 * Department of Computer Science, The University of Sheffield(谢菲尔德大学计算机科学系) Digital Environment Research Institute, Queen Mary University of London(伦敦玛丽女王大学数字环境研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出HBR方法,通过难度估计指导数据选择,减少类别偏差,实验显示在CIFAR-10和CIFAR-100上召回率差距降低32%和16%。

Comments Submitted to Springer ML

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04629 2026-04-13 cond-mat.soft physics.flu-dyn 50%

Solute dispersion in pre-turbulent confined active nematics

预湍流受限活性凝胶中溶质的分散

Tomás Alvim, Margarida M. Telo da Gama, Rodrigo C. V. Coelho

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了活性凝胶在狭窄通道中溶质的分散机制,发现两种预湍流流态中溶质纵向分散由速度场的二阶矩决定,与活动性成正比,为不同流态提供了共同的分散机制。

Journal ref Soft Matter, 2025, 21, 2569-2577

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15263 2026-04-13 cond-mat.stat-mech math-ph math.MP quant-ph 50%

Macroscopic Irreversibility in Quantum Systems: Free Expansion in a Fermion Chain

量子系统中的宏观不可逆性:费米链中的自由膨胀

Hal Tasaki

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究证明在量子系统中,自由膨胀过程导致宏观密度分布趋于均匀,揭示了量子力学中不可逆行为的出现,无需引入随机性。

Comments 5 pages, no figures. This is the final version to be published in PRE as a Letter. There are also some new references. There is a 20-minute video that explains the main results of the present work: https://youtu.be/HQzzCxok18A

Journal ref Phys. Rev. E 111, L062103 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 8 篇

2604.09405 2026-04-13 cs.CV 77%

EGLOCE: Training-Free Energy-Guided Latent Optimization for Concept Erasure

EGLOCE:无需训练的能量引导潜在优化用于概念擦除

Junyeong Ahn, Seojin Yoon, Sungyong Baik

机构 * KAIST AI(韩国科学技术院人工智能) Hanyang University(汉阳大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 EGLOCE通过在推理过程中重新定向噪声潜在变量,实现无需训练的概念擦除,结合排斥能量和保留能量,提升图像质量和提示对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22437 2026-04-13 cs.CV 57%

EmoCtrl: Controllable Emotional Image Content Generation

EmoCtrl:可控的情感图像内容生成

Jingyuan Yang, Weibin Luo, Hui Huang

机构 * CSSE, Shenzhen University(深圳大学计算机科学与软件工程学院)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 EmoCtrl通过结合内容描述与目标情绪生成图像,实现内容忠实与情绪表达的平衡,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09201 2026-04-13 cs.CV 57%

CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation

CT-1:视觉-语言-相机模型将空间推理知识转移到相机可控的视频生成

Haoyu Zhao, Zihao Zhang, Jiaxi Gu, Haoran Chen, Qingping Zheng, Pin Tang, Yeyin Jin, Yuang Zhang, Junqi Cheng, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯) Xiamen University(厦门大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CT-1模型,通过准确估计相机轨迹将空间推理知识转移到视频生成中,利用小波正则化损失和视频扩散模型提升相机控制精度,实验显示其生成的视频质量高且控制准确率提升25.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06982 2026-04-13 cs.CV cs.AI 57%

IntrinsicWeather: Controllable Weather Editing in Intrinsic Space

IntrinsicWeather: 内在空间中可控的天气编辑

Yixin Zhu, Zuo-Liang Zhu, Jian Yang, Miloš Hašan, Jin Xie, Beibei Wang

机构 * Nanjing University(南京大学) Nankai University(南开大学) NVIDIA(英伟达)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出IntrinsicWeather框架,通过内在空间编辑实现可控天气生成,利用内在映射提升大场景控制能力,并在合成与真实数据集上验证其优越性。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05091 2026-04-13 cs.CV 57%

PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation

PoseGen: 一种基于上下文LoRA微调的长人类视频生成框架

Jingxuan He, Busheng Su, Finn Wong

机构 * Xiaoice, China(小冰公司,中国) The University of Sydney, Australia(悉尼大学,澳大利亚)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PoseGen通过上下文LoRA微调实现对人物姿态的精细控制,生成长时长视频,解决了身份漂移和视频长度限制问题。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08887 2026-04-13 math.PR math.OC 50%

Heavy-traffic limit of stationary distributions of a state-dependent queue

具有状态依赖性的队列的重负荷极限

Masahiro Kobayashi, Masakiyo Miyazawa, Yutaka Sakuma

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了具有状态依赖性的单服务器队列的重负荷极限,探讨了其稳定性及平稳分布的极限性质,提出了密度条件并证明了多级队列的解具有闭形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17329 2026-04-13 physics.chem-ph 50%

How back reaction, hydrogen transport, and capillarity control the performance of hydrogen release from liquid organic carriers

如何背反应、氢气传输和毛细管力控制从液态有机载体释放氢气的性能

Tatiana Nizkaia, Thomas Solymosi, Paolo Malgaretti, Peter Wasserscheid, Jens Harting

专题命中 可控生成 :diffusion(abstract)

AI总结 研究揭示了氢气传输是多孔催化剂性能的主要限制因素,通过分析氢气以气泡或扩散形式逸出的不同动力学 regime,提出氢气过饱和度与毛细管力的条件。

Comments 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16772 2026-04-13 cs.SI cs.LG 50%

Balancing User Preferences by Social Networks: A Condition-Guided Social Recommendation Model for Mitigating Popularity Bias

通过社交网络平衡用户偏好:一种条件引导的社交推荐模型以缓解流行偏见

Xin He, Wenqi Fan, Ruobing Wang, Yili Wang, Ying Wang, Shirui Pan, Xin Wang

机构 * Jilin University(吉林大学) The Hong Kong Polytechnic University(香港理工大学) Griffith University(格里菲斯大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出CGSoRec模型,通过去噪社交网络和调整用户偏好权重,缓解推荐中的流行偏见。模型包含条件引导的社交去噪和扩散推荐模块,在三个真实数据集上验证了有效性。

Comments Accepted by Neural Networks

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 3 篇

2604.08836 2026-04-13 cs.CV 79%

CatalogStitch: Dimension-Aware and Occlusion-Preserving Object Compositing for Catalog Image Generation

CatalogStitch: 一种面向目录图像生成的维度感知和遮挡保留物体合成方法

Sanyam Jain, Pragya Kandari, Manit Singhal, He Zhang, Soo Ye Kim

机构 * Adobe

专题命中 图像修复 :image generation(title,abstract);分类 cs.CV

AI总结 CatalogStitch通过自动化修正遮挡元素和适应不同尺寸的产品,简化了目录图像生成流程,提升生成效率和质量。

Comments CVPR 2026 HiGen Workshop. Project page, https://catalogstitch.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03342 2026-04-13 cs.CV cs.AI cs.LG 57%

Tiled Prompts: Overcoming Prompt Misguidance in Image and Video Super-Resolution

分块提示:克服图像和视频超分辨率中的提示误导

Bryan Sangwoo Kim, Jonghyun Park, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能学院)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Tiled Prompts框架,通过为每个潜在块生成特定提示,解决传统全局提示在超分辨率中的误导问题,提升图像和视频的感知质量和真实性。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18600 2026-04-13 cs.CV cs.AI cs.LG 57%

Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment

链式放大:通过尺度自回归和偏好对齐实现极端超分辨率

Bryan Sangwoo Kim, Jeongsol Kim, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能系)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Chain-of-Zoom框架,通过自回归链和多尺度提示实现极端超分辨率,利用GRPO优化文本提示对齐人类偏好,实验显示标准4x扩散模型在CoZ下可实现256倍以上高质量放大。

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 2 篇

2604.08828 2026-04-13 cs.LG cs.CV 57%

Post-Hoc Guidance for Consistency Models by Joint Flow Distribution Learning

通过联合流分布学习提升一致性模型的后验指导

Chia-Hong Hsu, Randall Balestriero

机构 * Brown University(布朗大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出JFDL方法,通过预训练一致性模型实现后验指导,无需扩散模型教师,有效降低FID并提升生成图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08760 2026-04-13 cs.CV 57%

SIC3D: Style Image Conditioned Text-to-3D Gaussian Splatting Generation

SIC3D:基于风格图像的文本到3D高斯点云生成

Ming He, Zhixiang Chen, Steve Maddock

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 SIC3D通过引入变分风格化分数蒸馏损失,提升文本到3D生成的可控性和纹理精度,实验表明其在几何真实性和风格一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 1 篇

2506.22832 2026-04-13 cs.CV cs.AI 57%

Listener-Rewarded Thinking in VLMs for Image Preferences

图像偏好中的VLMs思考奖励

Alexander Gambashidze, Li Pengyi, Matvey Skripkin, Andrey Galichin, Anton Gusarov, Konstantin Sobolev, Andrey Kuznetsov, Ivan Oseledets

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种增强GRPO框架,通过引入独立的监听器模型来校准推理过程,提升图像偏好任务中的准确性和泛化能力。

Comments part of a different work

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 3 篇

2604.06832 2026-04-13 cs.CL 78%

Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM

Fast-dVLM: 通过直接转换自回归VLM实现高效的块扩散VLM

Chengyue Wu, Shiyi Lan, Yonggan Fu, Sensen Gao, Jin Wang, Jincheng Yu, Jose M. Alvarez, Pavlo Molchanov, Ping Luo, Song Han, Ligeng Zhu, Enze Xie

机构 * The University of Hong Kong(香港大学) NVIDIA(英伟达) MIT(麻省理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出Fast-dVLM,通过直接转换自回归VLM实现高效的块扩散VLM,采用KV-cache兼容并行解码和推测块解码,提升推理效率。实验表明其生成质量与自回归模型相当,且通过SGLang和FP8量化实现6倍以上的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09227 2026-04-13 eess.IV cs.CV 74%

Training-free, Perceptually Consistent Low-Resolution Previews with High-Resolution Image for Efficient Workflows of Diffusion Models

无需训练的感知一致低分辨率预览与高分辨率图像的高效扩散模型工作流程

Wongi Jeong, Hoigi Seo, Se Young Chun

机构 * Seoul National University(首尔国立大学)

专题命中 效率与蒸馏 :diffusion(title);分类 cs.CV

AI总结 本文提出无需训练的低分辨率预览生成方法,通过选择下采样矩阵和交换子零条件,实现与高分辨率图像的感知一致性,减少计算量并提升工作流程效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09159 2026-04-13 cs.LG 50%

Truncated Rectified Flow Policy for Reinforcement Learning with One-Step Sampling

截断修正流策略用于具有一步采样的强化学习

Xubin Zhou, Yipeng Yang, Zhan Li

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出TRFP框架,通过混合确定性-随机性架构解决MaxEnt RL中连续时间生成策略的可微性问题,实现稳定训练和有效一步采样,实验表明其在多目标环境和MuJoCo基准中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏