arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-10 至 2026-04-10 共收录 105 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 7 篇

2604.07900 2026-04-10 cs.CV cs.AI 57%

AnomalyAgent: Agentic Industrial Anomaly Synthesis via Tool-Augmented Reinforcement Learning

AnomalyAgent:通过工具增强强化学习进行代理工业异常合成

Jiaming Su, Tengchao Yang, Ruikang Zhang, Zhengan Yan, Haoyu Sun, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出AnomalyAgent,通过工具增强强化学习生成高语义真实性的工业异常样本,采用闭环优化和两阶段训练框架,实现自我反思与迭代改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11633 2026-04-10 cs.CV 57%

MV-SAM3D: Adaptive Multi-View Fusion for Layout-Aware 3D Generation

MV-SAM3D:面向布局感知的多视图融合3D生成

Baicheng Li, Dong Wu, Jun Li, Shunkai Zhou, Zecui Zeng, Lusong Li, Hongbin Zha

机构 * Peking University(北京大学) JD Explore Academy(京东探索研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MV-SAM3D通过多视图一致性与物理合理性提升3D生成质量,无需额外训练,实现更可信的布局生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-04-10 cs.CV 57%

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Project Page: https://yunhe24.github.io/langdrivectrl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07409 2026-04-10 cs.LG eess.IV 50%

GAN-based Domain Adaptation for Image-aware Layout Generation in Advertising Poster Design

基于GAN的领域适应用于广告海报设计中的图像感知布局生成

Chenchen Xu, Min Zhou, Tiezheng Ge, Weiwei Xu

机构 * Anhui Normal University(安徽师范大学) Zhejiang University(浙江大学) Shenzhen Bay Laboratory(深圳湾实验室) Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :inpainting(abstract)

AI总结 本文提出基于GAN的模型,利用图像生成广告海报布局,引入CGL数据集并设计PDA-GAN模型以提升图像感知布局生成效果。

Comments arXiv admin note: text overlap with arXiv:2303.14377

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 2 篇

2504.17069 2026-04-10 cs.CV cs.AI 57%

Distilling Specialized Orders for Visual Generation

蒸馏专用顺序用于视觉生成

Rishav Pramanik, Amin Sghaier, Masih Aminbeidokhti, Juan A. Rodriguez, Antoine Poupon, David Vazquez, Christopher Pal, Zhaozheng Yin, Marco Pedersoli

机构 * Stony Brook University(石溪大学) International Laboratory on Learning Systems (ILLS)(国际学习系统实验室(ILLS)) LIVIA, ÉTS Montréal(LIVIA,蒙特利尔高等技术学院) Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ServiceNow Research(ServiceNow研究院) Université Paris-Saclay, CentraleSupélec(巴黎-萨克雷大学,中央理工-高等电力学院) Polytechnique Montréal(蒙特利尔综合理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文提出OAR生成方法,通过蒸馏任意顺序AR模型,提取专用生成顺序并微调,提升生成质量并保持灵活性,实验显示在ImageNet等数据集上FID得分降低,支持零样本修复和扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07855 2026-04-10 cs.AI 50%

Hidden Biases in Conditioning Autoregressive Models

自回归模型中隐藏的偏见

Francois Pachet, Pierre Roy

机构 * LIP6, Sorbonne Université(索邦大学计算机科学实验室LIP6) Soundtrap

专题命中 图像修复 :inpainting(abstract)

AI总结 研究揭示了自回归模型在条件生成中存在隐藏的推理偏见,证明了精确解码在全局形式约束下计算上是不可行的。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 3 篇

2512.01236 2026-04-10 cs.CV 83%

PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards

PSR: 通过成对主体一致性奖励实现多主体个性化图像生成的扩展

Shulei Wang, Longhui Wei, Xin He, Jianbo Ouyang, Hui Lu, Zhou Zhao, Qi Tian

机构 * Zhejiang University(浙江大学) Huawei Inc.(华为技术有限公司)

专题命中 个性化与一致性 :image generation(title,abstract);personalized generation(abstract);分类 cs.CV

AI总结 本文提出PSR框架,通过多主体数据生成管道和强化学习策略,提升多主体个性化图像生成的性能和一致性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08037 2026-04-10 cs.CR cs.AI cs.CV cs.LG 79%

PrivFedTalk: Privacy-Aware Federated Diffusion with Identity-Stable Adapters for Personalized Talking-Head Generation

PrivFedTalk: 隐私感知的联邦扩散模型与身份稳定的适配器用于个性化说话头生成

Soumya Mazumdar, Vineet Kumar Rakesh, Tapas Samanta

机构 * Engineering Sciences, Homi Bhabha National Institute(霍米·巴巴国立研究所工程科学系)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出PrivFedTalk框架,结合条件潜在扩散模型与参数高效的身份适应,解决个性化说话头生成中的隐私问题,通过身份稳定联邦聚合和时间去噪一致性正则化提升性能。

Comments GitHub: https://github.com/mazumdarsoumya/PrivFedTalk

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07402 2026-04-10 cs.LG eess.IV 50%

Accelerating Training of Autoregressive Video Generation Models via Local Optimization with Representation Continuity

通过局部优化与表征连续性加速自回归视频生成模型训练

Yucheng Zhou, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学智慧城市物联网国家重点实验室及计算机与信息科学系)

专题命中 个性化与一致性 :image generation(abstract)

AI总结 本文提出局部优化与表征连续性方法,通过减少误差传播和提升生成视频一致性,使自回归视频生成模型训练效率提升一倍而不牺牲质量。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2604.07378 2026-04-10 cs.RO 71%

Evaluation as Evolution: Transforming Adversarial Diffusion into Closed-Loop Curricula for Autonomous Vehicles

评估作为进化:将对抗扩散转化为自动驾驶的闭环课程

Yicheng Guo, Jiaqi Liu, Chengkai Xu, Peng Hang, Jian Sun

机构 * College of Transportation, Tongji University(同济大学交通运输学院) Department of Computer Science, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系)

专题命中 图像生成评测 :diffusion(title)

AI总结 本文提出E²框架,通过闭环方法将对抗生成转化为自动驾驶的闭环课程,提升系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26241 2026-04-10 cs.CV cs.CL 57%

Which Way Does Time Flow? A Psychophysics-Grounded Evaluation for Vision-Language Models

时间如何流逝?基于心理物理学的评估用于视觉-语言模型

Shiho Matta, Lis Kanashiro Pereira, Peitao Han, Fei Cheng, Shigeru Kitazawa

机构 * Kyoto University(京都大学) Center for Information and Neural Networks(信息与神经网络中心) National Institute of Information and Communications Technology(国立信息通信技术研究所) The University of Osaka(大阪大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文通过心理物理学验证的基准测试评估了视觉-语言模型对时间方向的理解能力,发现大多数模型表现接近随机,且在物理不可逆过程和因果手动动作上远低于人类水平。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.00638 2026-04-10 cs.LG cs.CV 57%

Tabular GANs for uneven distribution

用于不均衡分布的表格GANs

Insaf Ashrapov

机构 * Moscow Institute of Physics and Technology(莫斯科物理技术学院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文综述了三种主要范式下的表格数据生成方法,提出统一框架支持GAN、扩散模型和大语言模型,并通过实验验证框架在分布偏移下的有效性。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 3 篇

2503.02537 2026-04-10 cs.CV cs.AI 72%

RectifiedHR: Enable Efficient High-Resolution Synthesis via Energy Rectification

RectifiedHR: 通过能量 rectification 实现高效高分辨率合成

Zhen Yang, Guibao Shen, Minyang Li, Liang Hou, Mushui Liu, Luozhou Wang, Xin Tao, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) Kuaishou Technology(快手科技) HKUST(香港科技大学) Zhejiang University(浙江大学)

专题命中 效率与蒸馏 :diffusion(abstract,comments);image editing(abstract);分类 cs.CV

AI总结 本文提出RectifiedHR,一种无需训练的高效高分辨率合成方法,通过噪声刷新策略提升效率,并首次发现能量衰减现象,通过调整引导超参数改善生成质量,兼容多种扩散模型技术。

Comments Project Page: https://zhenyangcs.github.io/RectifiedHR-Diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08189 2026-04-10 cs.LG 50%

Equivariant Efficient Joint Discrete and Continuous MeanFlow for Molecular Graph Generation

等变高效联合离散和连续均值流用于分子图生成

Rongjian Xu, Teng Pang, Zhiqiang Dong, Guoqiang Wu

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出EQUIMF框架,通过同步MeanFlow动态联合建模离散和连续成分,实现高效生成并保持物理一致性,优于现有扩散和流匹配方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08174 2026-04-10 cs.LG 50%

Value-Guidance MeanFlow for Offline Multi-Agent Reinforcement Learning

基于价值引导的MeanFlow多智能体强化学习

Teng Pang, Zhiqiang Dong, Yan Zhang, Rongjian Xu, Guoqiang Wu, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出VGM$^2$P框架,通过全局优势值引导智能体协作,利用分类器自由引导MeanFlow提升策略表达与推理效率,实验证明其在离线多智能体强化学习中性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏