arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-05 至 2026-05-05 共收录 39 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 31 篇

2605.00843 2026-05-05 cs.CY cs.AI 50%

Generative-AI and the transformation of workforce. A job postings-driven analysis

生成式AI与劳动力的变革:基于工作职位发布的分析

Diana Maria Popa, Simona-Vasilica Oprea, Adela Bâra

机构 * Department of Economic Informatics and Cybernetics, Bucharest University of Economic Studies(经济信息与自动化系,布加勒斯特经济学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过分析全球劳动力市场中工作职位发布中AI相关技能的变化,探讨生成式AI在职场中的增益或替代作用,提出可复现的数据驱动方法,揭示AI技能在行业和时间维度上的扩散趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.05270 2026-05-05 physics.flu-dyn 50%

Chaotic Mixing in Three Dimensional Porous Media

三维多孔介质中的混沌混合

Daniel R. Lester, Marco Dentz, Tanguy Le Borgne

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究三维多孔介质中混沌对流与分子扩散的相互作用,揭示其对混合动力学的影响,并提出新的连续时间随机游走模型来量化微观混合过程。

Comments 36 pages

Journal ref Journal of Fluid Mechanics , Volume 803 , 25 September 2016 , pp. 144 - 174

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 3 篇

2605.00893 2026-05-05 cs.CV cs.AI cs.IR 57%

Retrieval-Guided Generation for Safer Histopathology Image Captioning

基于检索的生成用于更安全的病理科图像描述生成

Md. Enamul Hoq, Wataru Uegami, Saghir Alfasly, Ghazal Alabtah, Sahar Rahimi Malakshan, Armita Kazemi, Alex T. Schmitgen, Fred Prior, H. R. Tizhoosh

机构 * Kimia Lab, Department of Artificial Intelligence \& Informatics, Mayo Clinic, Rochester, MN, USA Department of Biomedical Informatics, University of Arkansas for Medical Sciences, Little Rock, AR, USA Lane Department of Computer Science Electrical Engineering, West Virginia University, Morgantown, WV, USA Department of Computer Science Engineering, Princeton University, Princeton, NJ, USA Department of Computer Sciences, University of Wisconsin--Madison, Madison, WI, USA

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 本文提出检索引导生成方法,通过总结相似病例的专家文本生成描述,提升病理图像描述的准确性与可靠性,实验表明其在语义对齐和诊断一致性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01470 2026-05-05 cond-mat.soft cond-mat.stat-mech physics.comp-ph 50%

Colloidal layer deposition with a controllable number of layers and compositional order

具有可控层数和组分有序性的胶体层沉积

Akshaya Kumar Jena, Aashima Aashima, Pritam Kumar Jana, Bortolo Matteo Mognetti

专题命中 可控生成 :diffusion(abstract)

AI总结 本文设计了一种二元悬浮液与表面结合的系统,通过DNA寡聚物调控胶体自组装,实现可控层数和组分有序的胶体聚集。

Comments These last two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09646 2026-05-05 math.OC math.PR 50%

Long-Term Average Impulse and Singular Control of a Growth Model with Two Revenue Sources

长期平均冲击与双收入源增长模型的奇异控制

K. L. Helmes, R. H. Stockbridge, C. Zhu

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了长期平均冲击控制及相关奇异控制问题,针对一维扩散过程,探讨了可再生能源管理与金融投资优化中的长期平均收益最大化方法,分析了冲击与奇异控制间的联系。

Comments arXiv admin note: substantial text overlap with arXiv:2505.11345

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2605.01467 2026-05-05 math.OC cs.CV cs.NA math.NA 57%

Quaternion Nonlinear Transform-Induced Nuclear Norm for Low-Rank Tensor Completion

四元数非线性变换诱导的核范数用于低秩张量补全

Biswarup Karmakar, Ratikanta Behera

机构 * Department of Computational and Data Sciences, Indian Institute of Science(计算与数据科学系,印度科学研究院)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文提出四元数非线性变换诱导的核范数,用于低秩张量补全,解决了实值张量方法无法处理四元数数据的问题,通过实嵌入四元数实现可计算的核范数定义和高效优化。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2602.08245 2026-05-05 cs.RO cs.AI 50%

STEP: Warm-Started Visuomotor Policies with Spatiotemporal Consistency Prediction

STEP: 带时空一致性的预热视觉运动策略

Jinhao Li, Yuxuan Cong, Yingqiao Wang, Hao Xia, Shan Huang, Yijia Zhang, Ningyi Xu, Guohao Dai

机构 * Shanghai Jiao Tong University, Shanghai, China.(上海交通大学,上海,中国。) Shanghai Innovation Institute, Shanghai, China.(上海创新研究院,上海,中国。)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 本文提出STEP策略,通过轻量级时空一致性预测机制生成高质量预热动作,同时保持生成能力。引入速度感知扰动注入机制,防止执行停滞,提升实时任务性能。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 1 篇

2605.00883 2026-05-05 cs.CV cs.AI 57%

Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark

迈向高保真人脸交换:全面综述与新基准

Qi Li, Weining Wang, Shuangjun Du, Bo Peng, Jing Dong, Kun Wang, Zhenan Sun, Ming-Hsuan Yang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Nanyang Technological University(南洋理工大学) Yonsei University(延世大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文综述了人脸交换方法,提出新基准CASIA FaceSwapping,通过系统分析设计原理和局限性,提供统一视角和评估框架以推动更稳健的人脸交换技术。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 1 篇

2602.02958 2026-05-05 cs.LG 50%

Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization

Quant VideoGen:通过2位KV缓存量化实现自回归长视频生成

Haocheng Xi, Shuo Yang, Yilong Zhao, Muyang Li, Han Cai, Xingyang Li, Yujun Lin, Zhuoyang Zhang, Jintao Zhang, Xiuyu Li, Zhiying Xu, Jun Wu, Chenfeng Xu, Ion Stoica, Song Han, Kurt Keutzer

机构 * University of California, Berkeley(加州大学伯克利分校) NVIDIA Massachusetts Institute of Technology(麻省理工学院) Amazon(亚马逊) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出Quant VideoGen,通过语义感知平滑和渐进残差量化技术,有效降低KV缓存内存消耗,提升长视频生成质量与效率。

Comments Accepted by ICML 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏