arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-12 至 2026-03-12 共收录 66 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 40 篇

2512.18163 2026-03-12 physics.plasm-ph 50%

Electron Density Depletion in Reentry Plasma Flows Using Pulsed Electric Fields

利用脉冲电场减少再入等离子体流中的电子密度

Felipe Martin Rodriguez Fuentes, Bernard Parent

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究利用脉冲电场减少再入等离子体流中的电子密度,通过模拟展示电场对等离子体鞘的影响,从而降低信号衰减,提升通信性能。

Comments 15 pages, 18 figures

Journal ref Physics of Fluids 38, 036114 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10553 2026-03-12 cond-mat.soft physics.flu-dyn 50%

Friction modifies the quasistatic mechanical response of a confined, poroelastic medium

摩擦修改了受限孔隙弹性介质的准静态机械响应

Térence Desclaux, Callum Cuttle, Chris W. MacMinn, Olivier Liot

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究摩擦对受限孔隙弹性介质在活塞和流体驱动加载下的准静态机械响应的影响,揭示摩擦与介质力学的耦合及能量耗散机制。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.07757 2026-03-12 physics.bio-ph q-bio.SC 50%

Herding of proteins by the ends of shrinking polymers

通过收缩聚合物末端聚集蛋白质

Amer Al-Hiyasat, Yazgan Tuna, Yin-Wei Kuo, Jonathon Howard

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究提出一种蛋白质通过收缩聚合物末端的'聚集'效应自发富集的机制,并通过实验验证微管调节因子spastin的应用。

Comments Main text: 7 pages, 5 figures; Supplementary Information: 8 pages, 4 figures

Journal ref Phys. Rev. E 107, L042601 (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10669 2026-03-12 q-bio.MN 50%

ATP Level and Phosphorylation Free Energy Regulate Trigger-Wave Speed and Critical Nucleus Size in Cellular Biochemical Systems

ATP水平和磷酸化自由能调节细胞生化系统中的触发波速度和临界核大小

Jianwei Li, Kai Meng, Xuewen Shen, Fangting Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过热力学一致的反应-扩散框架,探讨ATP水平和磷酸化自由能如何调节细胞中触发波的速度和临界核大小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10532 2026-03-12 math.NA cs.NA 50%

Perturbed saddle-point problems in $\mathbf{L}^p$ with non-regular loads

$\mathbf{L}^p$空间中扰动鞍点问题的离散可解性分析

Abeer F. Alsohaim, Tomas Führer, Ricardo Ruiz-Baier, Segundo Villa-Fuentes

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了$\mathbf{L}^p$空间中扰动鞍点问题的离散可解性,通过正则化投影和Stenberg后处理分析了混合对流方程的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10531 2026-03-12 math.AP math.CA 50%

Analysis of a Biofilm Model in a Continuously Stirred Tank Reactor with Wall Attachment

连续搅拌釜反应器中带有壁附作用的生物膜模型分析

Katerina Nik, Christoph Walker

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了连续搅拌釜反应器中带有壁附作用的生物膜模型,分析了其全局良好性状和长期动力学,证明了非平凡平衡点的存在及其稳定性条件。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10344 2026-03-12 quant-ph 50%

Machine learning the arrow of time in solid-state spins

在固态自旋中机器学习时间之箭

Xiang-Qian Meng, Zhide Lu, Ya-Nan Lu, Xiu-Ying Chang, Yan-Qing Liu, Dong Yuan, Weikang Li, Zheng-Zhi Sun, Pei-Xin Shen, Lu-Ming Duan, Dong-Ling Deng, Pan-Yu Hou

专题命中 扩散模型 :diffusion(abstract)

AI总结 利用机器学习从固态自旋中识别时间之箭,通过量子电路和神经网络实现时间方向的识别与熵产分析

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10147 2026-03-12 cond-mat.stat-mech physics.optics 50%

Bridge Scaling in Conditioned Henyey-Greenstein Random Walks

条件化Henyey-Greenstein随机游走中的桥缩放

Claude Zeller

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究发现Henyey-Greenstein随机游走中的桥缩放现象,揭示了二维状态空间结构导致的异常扩散行为和中点深度分布特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22429 2026-03-12 math.OC 50%

Leader-Follower Linear-Quadratic Stochastic Graphon Games

领导者-追随者线性二次随机图ons游戏

Weijia Chen, Jingtao Shi

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了领导者-追随者线性二次随机图ons游戏,构建了斯塔克尔伯格-纳什均衡模型,并证明了解的存在性与唯一性。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09566 2026-03-12 cs.AI cs.LG 50%

Toward Closed-loop Molecular Discovery via Language Model, Property Alignment and Strategic Search

通过语言模型、性质对齐和战略搜索实现闭环分子发现

Junkai Ji, Zhangfan Yang, Dong Xu, Ruibin Bai, Jianqiang Li, Tingjun Hou, Zexuan Zhu

专题命中 扩散模型 :diffusion(abstract)

AI总结 Trio结合语言模型、性质对齐和战略搜索,实现高效且可解释的闭环分子设计,提升药物配体的结合亲和力、药物性和合成可及性。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22953 2026-03-12 cs.LG stat.ML 50%

GDR-learners: Orthogonal Learning of Generative Models for Potential Outcomes

GDR-learners: 生成模型的正交学习用于潜在结果

Valentyn Melnychuk, Stefan Feuerriegel

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出GDR-learners,通过正交学习生成模型以高效估计潜在结果分布,具备准Oracle效率和双稳健性,实验显示其在估计性能上优于现有方法。

Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06801 2026-03-12 cond-mat.soft cond-mat.stat-mech 50%

Scale-free cluster-cluster aggregation during polymer collapse

无标度的聚集体-聚集体聚集过程在聚合物坍缩期间

Suman Majumder, Saikat Chakraborty

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过分子动力学模拟验证了聚合物坍缩过程中动态标度行为,发现无标度聚集体生长与弯曲刚度相关。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13104 2026-03-12 physics.app-ph 50%

Scattering symmetry of diffusive systems

扩散系统的散射对称性

Dong Wang, Pei-Chao Cao, Yanxiang Wang, Minghong Qi, Ran Ju, Hongsheng Chen, Chengwei Qiu, Ying Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过实验实现扩散反宇称时间系统中的热散射,揭示了不同手性温度信号相互作用时的散射对称性机制,为非厄米特系统对称性和相变提供了新分析方法。

Journal ref Phys. Rev. B 113, L100301 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
1202.4131 2026-03-12 math.PR 50%

Zero-Noise Limit for High-Dimensional ODE with Measurable Drift

高维ODE的零噪声极限

Liangquan Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究高维ODE在零噪声极限下的行为,结合概率极限理论、几何测度理论等方法,揭示了支撑集的结构及奇异分布特性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 8 篇

2603.03281 2026-03-12 cs.CV cs.LG 85%

CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance

CFG-Ctrl: 基于控制的分类器自由扩散引导

Hanyang Wang, Yiyang Liu, Jiawei Chi, Fangfu Liu, Ran Xue, Yueqi Duan

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 CFG-Ctrl通过引入滑模控制方法改进分类器自由扩散引导,提升语义对齐和鲁棒性。

Comments Accepted by CVPR 2026; Project Page: https://hanyang-21.github.io/CFG-Ctrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10519 2026-03-12 cs.CV 85%

Visually-Guided Controllable Medical Image Generation via Fine-Grained Semantic Disentanglement

通过细粒度语义解耦实现视觉引导的可控医学图像生成

Xin Huang, Junjie Liang, Qingshan Hou, Peng Cao, Jinzhu Yang, Xiaoli Liu, Osmar R. Zaiane

机构 * Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程系,中国沈阳) Key Laboratory of Intelligent Computing in Medical Image of Ministry of Education, Northeastern University, Shenyang, China(教育部医学图像智能计算重点实验室,东北大学,中国沈阳) National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Shenyang, China(工业智能与系统优化国家级前沿科学中心,中国沈阳) AiShiWeiLai AI Research, China(艾世维来人工智能研究,中国) Amii, University of Alberta, Edmonton, Alberta, Canada(阿尔伯塔大学艾米人工智能研究所,加拿大埃德蒙顿,阿尔伯塔)

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 本文提出视觉引导的文本解耦框架,通过细粒度语义解耦提升医学图像生成的可控性和生成质量。

Comments 10 pages, 7 figures. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13702 2026-03-12 cs.CV cs.AI 79%

MVCustom: Multi-View Customized Diffusion via Geometric Latent Rendering and Completion

MVCustom: 通过几何潜在渲染和完成实现多视图定制化扩散

Minjung Shin, Hyunin Cho, Sooyeon Go, Jin-Hwa Kim, Youngjung Uh

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 MVCustom通过几何潜在渲染和完成技术,实现多视图定制化扩散,解决多视图一致性和定制化保真度的统一问题。

Comments ICLR 2026, Project page: https://minjung-s.github.io/mvcustom

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02182 2026-03-12 q-bio.NC cs.CV cs.LG 79%

Uncovering Semantic Selectivity of Latent Groups in Higher Visual Cortex with Mutual Information-Guided Diffusion

通过互信息引导的扩散模型揭示高级视觉皮层潜在群体的语义选择性

Yule Wang, Joseph Yu, Chengrui Li, Weihan Li, Anqi Wu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 MIG-Vis通过互信息引导的扩散模型揭示高级视觉皮层中神经潜在群体的语义选择性,提供结构化语义表示的直接证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00638 2026-03-12 cs.CV cs.GR 62%

Sketch-Guided Stylized Landscape Cinemagraph Synthesis

草图引导的风格化景观cinemagraph合成

Hao Jin, Hengyuan Chang, Xiaoxuan Xie, Zhengyang Wang, Xusheng Du, Shaojun Hu, Haoran Xie

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Sketch2Cinemagraph通过草图引导生成风格化景观cinemagraph,结合文本提示和运动草图控制,实现连续时间流动的高质量合成。

Comments 16 pages, 18 figures, accepted in Computer and Graphics

Journal ref Computers & Graphics,Volume 135,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10702 2026-03-12 cs.CV 57%

UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations

UniCom: 通过压缩的连续语义表示实现统一多模态建模

Yaqi Zhao, Wang Lin, Zijian Zhang, Miles Yang, Jingyuan Chen, Wentao Zhang, Zhao Zhong, Liefeng Bo

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 UniCom通过压缩连续语义表示实现统一多模态建模,有效解决离散化与连续建模的矛盾,提升生成性能和图像可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14552 2026-03-12 cs.CV 57%

OmniVTON++: Training-Free Universal Virtual Try-On with Principal Pose Guidance

OmniVTON++: 无需训练的通用虚拟试衣系统 with 主要姿态引导

Zhaotong Yang, Yong Du, Shengfeng He, Yuhui Li, Xinzhe Li, Yangyang Xu, Junyu Dong, Jian Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 OmniVTON++是一种无需训练的通用虚拟试衣系统,通过协调结构化服装变形、主要姿态引导和连续边界缝合,实现跨数据集和服装类型的高性能虚拟试衣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14178 2026-03-12 cs.CV cs.AI 57%

UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model

UniWeTok: 一种具有 $2^{128}$ 大小代码本的统一二进制分词器用于统一多模态大语言模型

Shaobin Zhuang, Yuang Ai, Jiaming Han, Weijia Mao, Xiaohui Li, Fangyikang Wang, Xiao Wang, Yan Li, Shanchuan Lin, Kun Xu, Zhenheng Yang, Huaibo Huang, Xiangyu Yue, Hao Chen, Yali Wang

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 UniWeTok通过大规模二进制代码本和改进的训练框架,实现统一多模态大语言模型的高效视觉表示。

Comments 29 pages, 9 figures, 33 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2603.10256 2026-03-12 cs.SD cs.CV cs.GR 62%

ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA

ID-LoRA:基于身份的音频视频个性化与上下文LoRA

Aviad Dahan, Moran Yanuka, Noa Kraicer, Lior Wolf, Raja Giryes

机构 * Tel Aviv University(特拉维夫大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 ID-LoRA通过联合生成音频和视频实现身份驱动的个性化,利用上下文LoRA技术在单次生成过程中提升语音与视觉的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2603.10990 2026-03-12 cs.CV 57%

Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity

过于生动以至于不真实?生成式颜色真实性的基准测试与校准

Zhengyao Fang, Zexi Jia, Yijia Zhong, Pengcheng Luo, Jinchao Zhang, Guangming Lu, Jun Yu, Wenjie Pei

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出颜色真实性数据集和度量标准,通过多模态编码器和自适应指导尺度提升生成图像的颜色真实性,构建了评估与改进的渐进框架。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10814 2026-03-12 cs.CV 57%

HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation

HanMoVLM:用于专业艺术绘画评估的大型视觉-语言模型

Hongji Yang, Yucheng Zhou, Wencheng Han, Songlian Li, Xiaotong Zhao, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(SKL-IOTSC、CIS、澳门大学) CSE, Shandong University(山东大学计算机科学与工程学院) Online-Video BU, Tencent(腾讯在线视频事业部)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 HanMoVLM通过引入HanMo-Bench数据集和链式推理机制,实现专业艺术绘画评估,提升中国绘画生成质量。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.04796 2026-03-12 cs.CV 57%

In Pursuit of Many: A Review of Modern Multiple Object Tracking Systems

追寻众多:现代多目标跟踪系统的综述

Mk Bashar, Samia Islam, Kashifa Kawaakib Hussain, Md. Bakhtiar Hasan, A. B. M. Ashikur Rahman, Md. Hasanul Kabir

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文综述了现代多目标跟踪系统的发展,涵盖从基于检测到端到端设计的演变,以及基于变压器、生成模型等架构的最新进展,并探讨了基准趋势和实际部署中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 9 篇

2507.01957 2026-03-12 cs.CV cs.AI 79%

Locality-aware Parallel Decoding for Efficient Autoregressive Image Generation

具有局部性的并行解码以提高自回归图像生成的效率

Zhuoyang Zhang, Luke J. Huang, Chengyue Wu, Shang Yang, Kelly Peng, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) First Intelligence(第一智能)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出LPD方法,通过灵活的并行自回归建模和局部意识生成顺序,显著提升自回归图像生成的效率和质量。

Comments ICLR 2026 Oral. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09488 2026-03-12 cs.CV 70%

Streaming Autoregressive Video Generation via Diagonal Distillation

通过对角蒸馏实现流式自回归视频生成

Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Ming-Hsuan Yang, Weiyang Liu

机构 * South China University of Technology(南方科技大学) Westlake University(西湖大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Merced(加州大学默塞德分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出对角蒸馏方法,通过不对称生成策略和隐式光学流建模,在减少计算步骤的同时提升视频生成的运动质量和效率。

Comments ICLR 2026 (31 pages, 10 figures, project page: https://spherelab.ai/diagdistill/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10893 2026-03-12 cs.CV 57%

S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputs

S2D:基于稀疏到密集的3D重建方法,使用最少输入

Yuzhou Ji, Qijian Tian, He Zhu, Xiaoqi Jiang, Guangzhi Cao, Lizhuang Ma, Yuan Xie, Xin Tan

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chery Automobile(奇瑞汽车)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 S2D通过稀疏到密集的提升方法,在最少输入下实现高质量的3DGS重建,提升稀疏点云和3DGS的一致性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10583 2026-03-12 cs.CV 57%

Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution

属性作为检索:模型无关的AI生成图像属性

Hongsong Wang, Renxi Cheng, Chaolei Han, Jie Gui

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种模型无关的AI生成图像归因方法LIDA,通过实例检索问题解决深度伪造检测和图像归因的挑战。

Comments To appear in CVPR 2026, Code is at https://github.com/hongsong-wang/LIDA

详情

展开后加载摘要…

URL PDF HTML 收藏