arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-02 至 2026-04-02 共收录 99 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 4 篇

2511.22690 2026-04-02 cs.CV 70%

Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation

Ar2Can:利用画布进行多人体生成的架构与艺术家

Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research, an initiative of Qualcomm Technologies, Inc.(高通人工智能研究院,高通技术公司旗下)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 Ar2Can提出一种两阶段框架,通过分离空间规划与身份渲染,解决多人体生成中人脸身份丢失问题,采用空间引导的面部匹配奖励提升生成质量,使用合成数据实现高精度和保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12090 2026-04-02 cs.CV cs.CR cs.LG 57%

SPDMark: Selective Parameter Displacement for Robust Video Watermarking

SPDMark:基于选择性参数位移的鲁棒视频水印技术

Samar Fares, Nurbek Tastan, Karthik Nandakumar

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Michigan State University (MSU)(密歇根州立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 SPDMark通过在视频扩散模型中选择性位移参数,在生成视频时嵌入不可见水印,实现高鲁棒性和计算效率的平衡。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00293 2026-04-02 cs.CV cs.CR cs.LG 57%

MOLM: Mixture of LoRA Markers

MOLM:LoRA标记的混合

Samar Fares, Nurbek Tastan, Noor Hussein, Karthik Nandakumar

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Michigan State University (MSU)(密歇根州立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MOLM,一种基于路由的LoRA标记方法,通过轻量级LoRA适配器在残差和注意力块中实现参数扰动,提升水印的鲁棒性和隐蔽性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04485 2026-04-02 cs.CV 57%

Not All Birds Look The Same: Identity-Preserving Generation For Birds

并非所有鸟都看起来一样:用于鸟类的身份保持生成

Aaron Sun, Oindrila Saha, Subhransu Maji

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出NABirds Look-Alikes数据集,用于评估鸟类身份保持生成,显示基于物种、年龄和性别的训练提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像生成评测 2 篇

2511.16908 2026-04-02 cs.CV 57%

Q-REAL: Towards Realism and Plausibility Evaluation for AI-Generated Content

Q-REAL:迈向AI生成内容真实性和可信度评估

Shushi Wang, Zicheng Zhang, Chunyi Li, Wei Wang, Liya Ma, Fengjiao Chen, Xiaoyu Li, Xuezhi Cao, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出Q-REAL数据集,用于细粒度评估AI生成图像的真实性和可信度,通过标注实体位置和设计判断问题,提升生成模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00293 2026-04-02 cs.LG stat.ML 50%

SYNTHONY: A Stress-Aware, Intent-Conditioned Agent for Deep Tabular Generative Models Selection

SYNTHONY:一种考虑压力的、基于意图的深度表格生成模型选择代理

Hochan Son, Xiaofeng Lin, Jason Ni, Guang Cheng

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出SYNTHONY,一种基于意图的表格生成模型选择框架,通过压力分析选择最佳合成器,提升模型在不同数据分布下的性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 效率与蒸馏 2 篇

2603.24587 2026-04-02 cs.LG cs.RO 50%

DreamerAD: Efficient Reinforcement Learning via Latent World Model for Autonomous Driving

DreamerAD:通过潜在世界模型实现高效的强化学习用于自动驾驶

Pengxuan Yang, Yupeng Zheng, Deheng Qian, Zebin Xing, Qichao Zhang, Linbo Wang, Yichen Zhang, Shaoyu Guo, Zhongpu Xia, Qiang Chen, Junyu Han, Lingyun Xu, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学先进交叉科学学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 DreamerAD通过压缩扩散采样将步骤从100步减少到1步,实现80倍加速并保持视觉可解释性,解决了自动驾驶中真实世界数据训练成本高和安全风险大的问题。

Comments authors update

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04738 2026-04-02 cs.LG 50%

SetONet: A Set-Based Operator Network for Solving PDEs with Variable-Input Sampling

SetONet:一种基于集合的运算网络,用于通过变量输入采样求解偏微分方程

Stepan Tretiakov, Xingjian Li, Krishna Kumar

机构 * organization= Maseeh Department of Civil, Architectural Environmental Engineering , addressline= University of Texas at Austin , city= Austin , postcode= 78712 , state= TX , country= USA organization= Oden Institute for Computational Engineering Sciences , addressline= University of Texas at Austin , city= Austin , postcode= 78712 , state= TX , country= USA

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 SetONet通过将运算输入重构为无序坐标-值观测集,解决了传统神经运算代理对固定传感器布局的依赖问题,提出SetONet-Key通过可学习查询令牌和位置-only键路径解耦采样几何与传感器值,适用于固定和变量布局及传感器丢失场景。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他图像生成 1 篇

2604.00955 2026-04-02 cs.CV 57%

Enhancing Gradient Inversion Attacks in Federated Learning via Hierarchical Feature Optimization

通过分层特征优化增强联邦学习中的梯度反向攻击

Hao Fang, Wenbo Yu, Bin Chen, Xuan Wang, Shu-Tao Xia, Qing Liao, Ke Xu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出GIFD方法,通过分解GAN模型并搜索中间层的分层特征,提升梯度反向攻击的表达能力和泛化能力,同时引入正则化约束和OOD场景下的标签映射技术,实现像素级重建。

详情

展开后加载摘要…

URL PDF HTML 收藏