arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 9 信号源:cs.CV, cs.GR, cs.MM

1. 其他图像生成 9 篇

2607.16824 2026-07-22 cs.CV 版本更新 79%

Test-Time Registers as Global Priors for Tokenized Image Generation

作为令牌化图像生成全局先验的测试时寄存器

Cheng-Yao Hong, Yifan Wang, Yuewei Lin, Chenyu You

机构 * Stony Brook University(纽约州立大学石溪分校) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 其他图像生成 :image generation(title,abstract);分类 cs.CV

AI总结 研究在令牌化图像生成中,基于测试时寄存器特征低频集中度高及与DCT低频能量相关的发现,引入RegToken,通过三步将寄存器结构转换为全局先验令牌,插入生成管道可提升指标、加速优化,证明相关结构可作轻量级全局先验。

Comments 39 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00233 2026-07-09 quant-ph cs.CV cs.LG 版本更新 79%

Scaling Quantum Machine Learning without Tricks: Full-Resolution and Diverse Image Generation

无技巧扩展量子机器学习:全分辨率与多样图像生成

Jonas Jäger, Florian J. Kiwit, Carlos A. Riofrío

机构 * BMW Group, Munich, Germany(宝马集团,慕尼黑,德国) Department of Computer Science and Institute of Applied Mathematics, University of British Columbia (UBC), Vancouver, Canada(计算机科学系和应用数学研究所,不列颠哥伦比亚大学(UBC),温哥华,加拿大) Stewart Blusson Quantum Matter Institute (QMI), Vancouver, Canada(斯图尔特·布卢森量子物质研究所(QMI),温哥华,加拿大) Ludwig Maximilian University, Munich, Germany(路德维希-马克西米利安大学,慕尼黑,德国)

专题命中 其他图像生成 :image generation(title,abstract);分类 cs.CV

AI总结 研究如何在量子机器学习中无技巧地扩展,通过在经典MNIST和Fashion - MNIST数据集上训练量子瓦瑟斯坦GAN,实现全分辨率图像生成,还能扩展到彩色图像,分析了变分电路架构等因素对性能的影响,在多种条件下取得有前景成果。

Comments 29 pages, 17 figures, 3 tables. Main text: 17 pages, 10 figures. Appendix: 11 pages, 7 figures, 3 tables

Journal ref Quantum Sci. Technol. 11(3), 035042, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10898 2026-06-19 cs.HC 版本更新 71%

How Creatives Approach GenAI Image Generation: Tensions Between Structured Guidance, Self-Experimentation, and Creative Autonomy

创意人士如何接近生成式AI图像生成:结构化指导、自我实验与创意自主之间的张力

Haidan Liu, Isabelle Kwan, Taiga Okuma, Jeffrey Loverock, Nicholas Vincent, Parmit K Chilana

专题命中 其他图像生成 :image generation(title)

AI总结 研究探讨创意人士在使用生成式AI图像工具时如何平衡结构化指导与自我实验,发现尽管指导有助于理解AI,但许多人仍倾向于自我探索以保持创意自由。

Comments Accepted at ACM Creativity & Cognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17390 2026-07-09 cs.CV 版本更新 57%

FMMC: Harnessing the Power of Foundation Models for Accurate Material Classification

利用基础模型提升材料分类的准确性

Qingran Lin, Fengwei Yang, Chaolun Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学) Waseda University(早稻田大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出一种利用基础模型克服数据限制并提升分类准确性的新框架,通过生成高质量数据集和融合视觉语言模型先验知识,有效提高材料分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25682 2026-07-01 cs.CV 版本更新 57%

Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples

少样本合成图像溯源:有限样本下识别未见生成器

Shiyu Wu, Shuyan Li, Jing Li, Jing Liu, Yequan Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peking University(北京大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 提出少样本合成图像溯源新范式,构建含45个生成器、117万图像的OmniFake数据集,并设计OmniDFA基线,实现少样本下识别未见生成器,在AIGI检测中达到最优泛化性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14877 2026-06-18 cs.CV 版本更新 57%

HeatKV: Head-tuned KV-cache Compression for Visual Autoregressive Modeling

HeatKV:针对视觉自回归建模的头部调制KV缓存压缩

Jonathan Cederlund, Axel Berg, William Isaksson, Durmus Alp Emre Acar, Chuteng Zhou, Pontus Giselsson

机构 * Dept. of Automatic Control, Lund University(自动控制系,吕勒欧大学) Arm(Arm公司)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出HeatKV方法,通过根据每个头部对先前生成尺度的注意力进行调整,实现更高效的KV缓存压缩,提升内存利用率并保持图像生成质量。

Comments 18 pages total including appendix; 6 main-paper figures, 2 appendix figures; 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14999 2026-07-16 cs.LG 版本更新 50%

Unlocking Latent Dimensions: Exploring Representations of Large-Scale X-ray Scattering Data using Variational Autoencoders

解锁潜在维度:使用变分自编码器探索大规模X射线散射数据的表示

Monika Choudhary, Xiaoya Chong, Runbo Jiang, Wiebke Koepp, Petrus H. Zwart, Damon English, Gregory M. Su, Eric Schaible, Chenhui Zhu, Mostafa Nassr, Noah P. Wamble, Kelvin Kam-Yun Li, Jonathan M. Chan, Jose Carlos Diaz, Cameron McKay, Lynn Katz, Benny Freeman, Guillaume Freychet, Yevgen Matviychuk, Eliot Gann, Daniel B. Allan, Benedikt Sochor, Frank Schluenzen, Stephan V. Roth, Ethan J. Crumlin, Dylan McReynolds, Tanny Chavez, Alexander Hexemer

机构 * Advanced Light Source, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室先进光源) Center for Advanced Mathematics for Energy Research Applications, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室能源研究应用高级数学中心) Molecular Biophysics & Integrated Bioimaging Division, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室分子生物物理学与综合生物成像部) Berkeley Synchrotron Infrared Structural Biology program, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室伯克利同步辐射红外结构生物学项目) Materials Sciences Division, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室材料科学部) McKetta Department of Chemical Engineering, University of Texas(德克萨斯大学麦凯塔化学工程系)

专题命中 其他图像生成 :image generation(abstract)

AI总结 针对X射线散射数据离线探索和实时分析两大挑战,训练领域特定注意力卷积变分自编码器(C-VAE),学习低维表示以捕捉结构变化,并集成到MLExchange平台的Latent Space Explorer中,支持交互式结构探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10751 2026-07-09 cs.LG 版本更新 50%

Predicting integers from continuous parameters

从连续参数预测整数

Bas Maat, Peter Bloem

机构 * Learning & Reasoning Group Vrije Universiteit Amsterdam(阿姆斯特丹自由大学学习与推理组)

专题命中 其他图像生成 :image generation(abstract)

AI总结 本文研究了从连续参数预测整数标签的问题,探讨了离散分布在整数预测中的应用,并测试了多种分布模型在不同任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13212 2026-07-08 cs.LG 版本更新 50%

MAME: Multidimensional Adaptive Metamer Exploration with Human Perceptual Feedback

MAME:基于人类感知反馈的多维自适应同态体探索

Mina Kamao, Hayato Ono, Ayumu Yamashita, Kaoru Amano, Masataka Sawayama

机构 * Graduate School of Information Science and Technology(信息科学与技术研究生学校) The University of Tokyo(东京大学) Graduate School of System Informatics(系统信息科学研究生学校) Kobe University(大阪大学) Hokkaido University(北海道大学) Prometech CG Research(Prometech CG研究所)

专题命中 其他图像生成 :image generation(abstract)

AI总结 该研究针对人脑网络与人工模型对齐问题,提出MAME框架,通过人类感知反馈引导在线图像生成,在单个心理物理实验中成功测量多维人类同态体空间,发现人类与CNN模型在低级处理同态体空间对齐较差,强调早期视觉计算重要性,为研究人类视觉功能提供工具。

Comments 26 pages, 12 figures. Accepted at Journal of Vision

Journal ref Journal of Vision, 26(8):1, 1-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏