arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-18 至 2026-06-18 共收录 82 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 60 篇

2602.02476 2026-06-18 cond-mat.mes-hall 50%

Frequency Stability of Graphene Nonlinear Parametric Oscillator

石墨烯非线性参数振荡器的频率稳定性

Enise Kartal, Oriel Shoshani, Elena Botnaru, Alberto Martín-Pérez, Tomás Manzaneque, Farbod Alijani

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过相位锁定环操作证明石墨烯参数振荡器在强非线性条件下能提升频率稳定性,其非线性阻尼机制有效抑制了幅度到频率噪声的转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23728 2026-06-18 physics.flu-dyn 50%

Effect of freestream turbulence on the coherent dynamics of a wind turbine wake

自由流湍流对风力涡轮机尾流相干动力学的影响

Neelakash Biswas, Oliver R. H. Buxton

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究自由流湍流对风力涡轮机尾流相干动力学的影响,发现湍流强度和积分长度尺度增加会提前导致涡流破裂,进而影响尾流恢复。尾流摆动与涡轮机固有不稳定性相关,湍流增强会加剧远场尾流摆动幅度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09753 2026-06-18 cond-mat.quant-gas 版本更新 50%

Confinement and finite-range effects in a quasi-two-dimensional gas of fermionic dimers

准二维费米子分子气体中的约束和有限程效应

Giovanni Midei, Jordi Boronat, Grigory E. Astrakharchik

专题命中 扩散模型 :diffusion(abstract)

AI总结 利用固定节点扩散蒙特卡洛方法研究强相互作用费米气体中紧密束缚分子的基态性质,揭示有限程修正和约束诱导的维度效应,并评估平均场及超越平均场描述的适用范围。

Comments final version, 8 pages, 4 figures

Journal ref Phys. Rev. Research 8, L022051 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18588 2026-06-18 cs.CL 版本更新 50%

UniECG: Understanding and Generating ECG in One Unified Model

UniECG: 在一个统一模型中理解与生成心电图

Jiarui Jin, Haoyu Wang, Xiang Lan, Jun Li, Hongyan Li, Shenda Hong

机构 * Peking University(北京大学) Shanghai Ocean University(上海海洋大学) the Second Hospital of Tianjin Medical University(天津医科大学第二医院) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出UniECG模型,通过两阶段设计实现心电图信号/图像生成解释性文本及根据文本目标生成对应心电图信号,支持交互式心电图教育。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17116 2026-06-18 math.PR 版本更新 50%

A scaling limit theorem for controlled branching processes with a size-divisible term

具有规模可分解项的控制分支过程的标度极限定理

Miguel González, Pedro Martín-Chávez, Inés del Puerto

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文为具有移民和规模可分解项的控制分支过程建立了Skorokhod空间上的弱收敛充分条件,极限过程为具有相依移民的连续状态分支过程。

Comments 21 pages

Journal ref Rev. R. Acad. Cienc. Exactas Fís. Nat. Ser. A Mat. 120, 89 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00089 2026-06-18 quant-ph cond-mat.stat-mech math-ph math.MP 50%

Approximation theory for Green's functions via the Lanczos algorithm

通过兰契兹算法的格林函数近似理论

Gabriele Pinna, Oliver Lunt, Curt von Keyserlingk

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了利用连分数近似格林函数时的误差问题,探讨了截断连分数与精确系数的结合方法,并分析了兰契兹系数衰减对收敛速度的影响。

Journal ref Phys. Rev. B 112, 054435 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 5 篇

2606.18780 2026-06-18 cs.CV cs.CL cs.MM 新提交 73%

SAMA: Semantic Anchor-aligned Augmentation for Unified Low-Resource Multimodal Information Extraction

SAMA:面向统一低资源多模态信息抽取的语义锚定对齐增强

Quanjiang Guo, Chong Mu, Jiazhou Pan, Ming Jia, Ling Tian, Hui Gao, Zhao Kang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.MM

AI总结 提出语义锚定对齐增强框架SAMA,通过构建结构化语义锚引导多专家多模态大模型生成高保真文本,并利用锚保留扩散机制合成图像,结合双约束过滤模块,在低资源多模态信息抽取任务中显著提升性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21431 2026-06-18 cs.CV 版本更新 57%

iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance

iTryOn: 通过空间-语义引导掌握交互式视频虚拟试穿

Jun Zheng, Zhengze Xu, Mengting Chen, Jing Wang, Jinsong Lan, Xiaoyong Zhu, Kaifu Zhang, Bo Zheng, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University Taobao \& Tmall Group of Alibaba

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出iTryOn框架,通过空间-语义引导解决交互式视频虚拟试穿中的语义模糊和复杂服装变形问题,实现了更动态可控的虚拟试穿体验。

Comments Project Page: https://zhengjun-ai.github.io/itryon-page. Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19016 2026-06-18 quant-ph 新提交 50%

Coherent Microwave Control of Optically Addressable Donor Qubits in ZnO

ZnO中光学可寻址施主量子比特的相干微波控制

Ethan R. Hansen, Dong-Rong Wu, Yixuan Li, Yaser Silani, Joseph Falson, Yusuke Kozuka, Masashi Kawasaki, Yuan Ping, Kai-Mei C Fu

专题命中 可控生成 :diffusion(abstract)

AI总结 通过微波脉冲实现ZnO中注入的$^{115}$In施主电子自旋的相干控制,利用光泵浦初始化与读出,观测到拉比振荡和超精细跃迁,但低场下相干时间显著短于预期。

Comments 14 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17893 2026-06-18 eess.SP cs.IT math.IT 新提交 50%

Condition-Wise Sinkhorn Drifting for One-Shot Learned Channel Simulation

条件式Sinkhorn漂移用于一次性学习信道仿真

Rick Fritschek, Rafael F. Schaefer

专题命中 可控生成 :diffusion(abstract)

AI总结 针对学习通信系统中扩散式反向采样成本高的问题,提出条件式Sinkhorn漂移,一种一次性信道替代方法,通过条件Sinkhorn目标训练生成器,在AWGN、瑞利衰落等信道下评估,条件式变体在条件诊断和符号编码检查中表现最强。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05107 2026-06-18 cs.AI 版本更新 50%

Structured Cognitive Loop for Behavioral Intelligence in Large Language Model Agents (Extended Revision: From Behavioral Architecture to Epistemic Accountability)

大型语言模型代理中行为智能的结构化认知循环(扩展修订:从行为架构到认知问责)

Myung Ho Kim

机构 * JEI University(JEI大学)

专题命中 可控生成 :image generation(abstract)

AI总结 提出结构化认知循环(SCL)架构,通过分离认知、记忆、控制和行动模块,实现LLM代理的可问责行为,在360个任务中成功率86.3%,优于基线方法。

Comments This revised version extends the original SCL framework from a behavioral architecture for reliable LLM agents into a broader architecture of epistemic accountability, integrating context-aware Human-in-the-Loop control, Pool-Gated Retrieval, and the Horizon-Warrant-Commitment structure

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 4 篇

2606.19195 2026-06-18 cs.CV 新提交 83%

Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance

Moebius: 0.2B轻量级图像修复框架,性能达10B级别

Kangsheng Duan, Ziyang Xu, Wenyu Liu, Xiaohu Ruan, Xiaoxin Chen, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) VIVO AI Lab(VIVO人工智能实验室)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出Moebius轻量级图像修复框架,通过局部-λ混合交互模块和自适应多粒度蒸馏策略,以0.22B参数实现与10B级模型FLUX.1-Fill-Dev相当甚至更优的生成质量,推理速度提升15倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00176 2026-06-18 cs.CV cs.AI 版本更新 83%

Posterior Continuation with Noise-Conditioned Frequency Exposure for Diffusion Inverse Problems

基于噪声条件频率暴露的扩散逆问题后验延续

Feng Tian, Yixuan Li, Weili Zeng, Weitian Zhang, Yichao Yan, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 图像修复 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出后验延续框架,根据扩散噪声水平逐步暴露测量频率,结合稳定采样器实现超分辨率、修复和去模糊的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.14224 2026-06-18 cs.CV cs.LG eess.IV 版本更新 57%

Investigation of Neural Network Methods for Reconstruction and Classification of Texture Images Under Conditions of Incomplete Information

不完全信息条件下纹理图像重建与分类的神经网络方法研究

Galymzhan Abdimanap, Kairat Bostanbekov, Abdelrahman Abdallah, Anel Alimova, Darkhan Kurmangaliyev, Daniyar Nurseitov, Tatyana Dedova, Larissa Balakay, Serik Nurakynov

机构 * Satbayev University(萨特巴耶夫大学) Institute of Ionosphere LLP(电离层研究所) Information Technology Department(信息技术部门) Assiut University(阿西乌特大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 提出结合目标检测、GAN(CRA)修复和Transformer/CNN分类的端到端框架,发现重建质量高(PSNR 28.7dB)但分类准确率仅53%,通过置信度混合集成将MCA从48%提升至58%,揭示生成模型产生语义模糊特征的问题。

Comments IEEE ACCESS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19161 2026-06-18 cs.RO 新提交 50%

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

HT-Bench:基于自我中心视觉的灵巧全手触觉表示基准与学习

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Ziyuan Jiao, Yuanxin Zhong

机构 * Beihang University(北航) Rimbot BUPT(北邮) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) CAS(中国科学院)

专题命中 图像修复 :inpainting(abstract)

AI总结 提出HT-Bench多任务基准和HandTouch编码器,通过大规模自我中心视觉与全手触觉数据,在触觉相似性检索、掩码修复、视觉到触觉合成等任务上验证了触觉表示的有效性。

Comments 9pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2606.18753 2026-06-18 cs.CV 新提交 57%

SMART: A Flexible, Interpretable, and Scalable Spatio-temporal Brain Atlas from High-Resolution Imaging Data

SMART:一种灵活、可解释且可扩展的高分辨率成像数据时空脑图谱

John Kalkhof, Boris Gutman, Emile d'Angremont, Daniel C. Alexander, Marco Lorenzi

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Amsterdam University Medical Center(阿姆斯特丹大学医学中心) University College London(伦敦大学学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出SMART框架,通过解耦全局疾病动态与患者特定解剖表现,学习连续疾病时间图谱,实现高分辨率3D医学图像中时空变化的灵活、可解释和可扩展建模。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 3 篇

2606.19184 2026-06-18 cs.CV cs.LG 新提交 57%

When AUC Misleads: Polarization-Aware Evaluation of Deepfake Detectors under Domain Shift

当AUC误导:域偏移下深度伪造检测器的极化感知评估

Dat Nguyen, Cosmin Radoi, Romain Hermary, Marcella Astrid, Nesryne Mejri, Enjie Ghorbel, Djamila Aouada

机构 * CVI$^2$(CVI²实验室) SnT, University of Luxembourg(SnT,卢森堡大学) Cristal Laboratory, National School of Computer Sciences, University of Manouba(Cristal实验室,马努巴国家计算机科学学院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 针对现有AUC评估无法反映真实场景中混合数据源和不同伪影类型的问题,提出Cross-dataset AUC(Cross-AUC)指标,通过平均每域AUC并引入预测极化度量(Wasserstein距离)来评估域偏移鲁棒性,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17030 2026-06-18 cs.CV 新提交 57%

Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation

Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界模型

Jie Zhang, Xiaoyue Chen, Anzhe Chen, Dayiheng Liu, Deqing Li, Gengze Zhou, Hale Yin, Haoqi Yuan, Haoyang Li, Jiahao Li, Jiazhao Zhang, Jingren Zhou, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Pei Lin, Qihang Peng, Shengming Yin, Tianhe Wu, Tianyi Yan, Xiao Xu, Yan Shu, Yanran Zhang, Ye Wang, Yi Wang, Yilei Chen, Yixian Xu, Yiyang Huang, Yuxiang Chen, Zekai Zhang, Zhendong Wang, Zixing Lei, Zhixuan Liang, Zihao Liu, Zikai Zhou, Chenxu Lv, Xiong-Hui Chen, Chenfei Wu

机构 * Qwen Team(Qwen团队)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 提出Qwen-RobotWorld,一种以自然语言为统一动作接口的语言条件视频世界模型,通过双流MMDiT、大规模具身世界知识语料和渐进式课程训练,在机器人操作、自动驾驶等任务中实现物理一致的未来视觉轨迹预测,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05010 2026-06-18 cs.CV 版本更新 57%

How far have we gone in Generative Image Restoration? A study on its capability, limitations and evaluation practices

生成式图像恢复进展:能力、局限性与评估实践研究

Xiang Yin, Jinfan Hu, Zhiyuan You, Kainan Yan, Yu Tang, Chao Dong, Jinjin Gu

机构 * Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of the Chinese Academy of Sciences(中国科学院大学) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 通过多维度评估管道系统比较扩散、GAN等生成式模型与PSNR导向模型,揭示从细节不足到细节质量与语义控制的范式转变,并训练了更符合人类感知的IQA模型。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 2 篇

2508.11211 2026-06-18 eess.IV cs.CV 版本更新 70%

Efficient Image-to-Image Schrödinger Bridge for CT Field of View Extension

面向CT视野扩展的高效图像到图像薛定谔桥

Zhenhao Li, Song Ni, Long Yang, Xiaojie Yin, Haijun Yu, Jiazhou Wang, Hongbin Han, Weigang Hu, Yixing Huang

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学人民医院医学技术研究所) Shanghai Cancer Center, Fudan University(复旦大学上海癌症中心) Department of Electrical and Computer Engineering, University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校电气与计算机工程系) Beijing Key Laboratory of Intelligent Neuromodulation and Brain Disorder Treatment(北京智能神经调控与脑疾病治疗重点实验室)

专题命中 效率与蒸馏 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出基于图像到图像薛定谔桥(I²SB)扩散模型的CT视野扩展框架,通过直接学习有限视野与扩展视野图像间的随机映射,实现单步快速推理,在精度和速度上均超越现有扩散模型。

Comments 12 pages

Journal ref IEEE Transactions on Radiation and Plasma Medical Sciences 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18702 2026-06-18 cs.CV 新提交 57%

UniTemp: Unlocking Video Generation in Any Temporal Order via Bidirectional Distillation

UniTemp: 通过双向蒸馏实现任意时间顺序的视频生成

Lin Zhang, Sicheng Mo, Zefan Cai, Jinhong Lin, Zihao Lin, Jiuxiang Gu, Krishna Kumar Singh, Yuheng Li, Yin Li

机构 * University of Wisconsin Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe 研究院) University of California Los Angeles(加利福尼亚大学洛杉矶分校) University of California Davis(加利福尼亚大学戴维斯分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出UniTemp框架,通过双向蒸馏训练单个自回归模型,支持任意时间方向(前向、后向、中间插值)的视频生成,解决因果3D VAE在后向生成中的不连续性,提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他图像生成 1 篇

2605.14877 2026-06-18 cs.CV 版本更新 57%

HeatKV: Head-tuned KV-cache Compression for Visual Autoregressive Modeling

HeatKV:针对视觉自回归建模的头部调制KV缓存压缩

Jonathan Cederlund, Axel Berg, William Isaksson, Durmus Alp Emre Acar, Chuteng Zhou, Pontus Giselsson

机构 * Dept. of Automatic Control, Lund University(自动控制系,吕勒欧大学) Arm(Arm公司)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出HeatKV方法,通过根据每个头部对先前生成尺度的注意力进行调整,实现更高效的KV缓存压缩,提升内存利用率并保持图像生成质量。

Comments 18 pages total including appendix; 6 main-paper figures, 2 appendix figures; 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏