arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-30 至 2026-04-30 共收录 62 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 50 篇

2505.19903 2026-04-30 cond-mat.stat-mech physics.data-an 71%

Diffusion with stochastic resetting on a lattice

在晶格上进行随机重置的扩散

Alexander K. Hartmann, Satya N. Majumdar

专题命中 扩散模型 :diffusion(title)

AI总结 本文研究了在晶格上扩散粒子的首次通过时间,推导出精确公式,并探讨了重置率和初始位置对结果的影响,揭示了在不同极限下首次通过时间的行为。

Comments 17 pages, 7 figures, data gnuplot files for plots available at https://doi.org/10.57782/VGCHTI

Journal ref Phys. Rev. E 112, 034102 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26820 2026-04-30 cs.CV 70%

Bridge: Basis-Driven Causal Inference Marries VFMs for Domain Generalization

桥接:基于基础的因果推断融合视觉基础模型以实现领域泛化

Mingbo Hong, Feng Liu, Caroline Gevaert, George Vosselman, Hao Cheng

机构 * University of Twente(代尔夫特理工大学) Drexel University(德雷塞尔大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Bridge框架,通过因果推断与视觉基础模型结合,解决领域泛化中因分布差异导致的性能下降问题,通过学习低秩基并过滤冗余信息提升检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02731 2026-04-30 cs.SD cs.CV cs.MM 62%

Omni2Sound: Towards Unified Video-Text-to-Audio Generation

Omni2Sound:迈向统一的视频-文本到音频生成

Yusheng Dai, Zehua Chen, Yuxuan Jiang, Baolong Gao, Qiuhong Ke, Jianfei Cai, Jun Zhu

机构 * Tsinghua University(清华大学) Monash University(莫纳什大学) Shengshu AI(盛数人工智能)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Omni2Sound模型,解决视频-音频、文本-音频及联合视频-文本-音频生成中的数据稀缺与任务竞争问题,通过SoundAtlas数据集和三阶段训练策略实现统一生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26232 2026-04-30 cs.CV cs.AI 57%

DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation

DepthPilot:从可控性到可解释性在结肠镜视频生成中

Junhu Fu, Ke Chen, Weidong Guo, Shuyu Liang, Jie Xu, Chen Ma, Kehao Wang, Shengli Lin, Zeju Li, Yuanyuan Wang, Yi Guo, Shuo Li

机构 * College of Biomedical Engineering, Fudan University, Shanghai 200433, China(复旦大学生物医学工程学院) Key Laboratory of Medical Imaging Computing and Computer Assisted Intervention of Shanghai, Shanghai 200032, China(上海医学影像计算与计算机辅助干预重点实验室) Endoscopy Research Institute, Zhongshan Hospital, Fudan University, Shanghai 200032, China(复旦大学中山医院内窥镜研究所) Shanghai Collaborative Innovation Center of Endoscopy, Shanghai 200032, China(上海内窥镜协同创新中心) Department of Biomedical Engineering, Case Western Reserve University, Cleveland, OH 44106, USA(凯斯西储大学生物医学工程系) Department of Computer and Data Science, Case Western Reserve University, Cleveland, OH 44106, USA(凯斯西储大学计算机与数据科学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DepthPilot框架,通过几何对齐策略和自适应样条去噪模块,实现结肠镜视频生成的可控性与可解释性,取得高FID分数和临床评估领先成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20340 2026-04-30 cs.CV 57%

The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection

细节决定成败:通过关键帧驱动的细节注入增强视频虚拟试衣

Qingdong He, Xueqin Chen, Yanjie Pan, Peng Tang, Pengcheng Xu, Zhenye Gan, Chengjie Wang, Xiaobin Hu, Jiangning Zhang, Yabiao Wang

机构 * Tencent Youtu Lab(腾讯优图实验室) TU Delft(代尔夫特理工大学) Fudan University(复旦大学) Western University(西部大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出KeyTailor框架和ViT-HD数据集,通过关键帧驱动的细节注入策略提升视频虚拟试衣的服装真实性和背景完整性,实验表明其在动态和静态场景中表现更优。

Comments Accepted by CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25236 2026-04-30 cs.AI cs.LG eess.SP 56%

Networks of Causal Abstractions: A Sheaf-theoretic Framework

因果抽象网络:一种她夫理论框架

Gabriele D'Acunto, Paolo Di Lorenzo, Sergio Barbarossa

机构 * DIET Sapienza University of Rome(Sapienza罗马大学DIET)

专题命中 扩散模型 :diffusion(abstract,comments)

AI总结 本文提出因果抽象网络(CAN)框架,通过她夫理论统一多个上下文依赖因果机制模型,解决分布式智能体间因果视角协调问题,实现因果学习与推理。

Comments Major changes: added convergence proof for CK diffusion dynamics; clarified relation with our prior work arXiv:2602.02623, removing substantial overlap; shortened background

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26939 2026-04-30 math.PR cs.SI q-bio.PE 50%

Degree-dependent and distance-dependent contact rates interpolate between explosive, exponential and polynomial epidemic growth

基于度数和距离的接触率:在爆炸性、指数性和多项式流行病增长之间进行插值

Zylan Benjert, Júlia Komjáthy, Johannes Lengler, John Lapinskas, Ulysse Schaller

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一个基于代理的网络模型,通过研究接触率与空间距离和接触人数的关系,揭示流行病增长速率受几何结构、弱联系普及度和超级传播者影响的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26928 2026-04-30 q-bio.TO math.AP physics.bio-ph 50%

Theory of adhesion-driven self-organisation in growing tissues

生长组织中由粘附驱动的自组织理论

Carles Falcó, Samuel W. S. Johnson, Mohit P. Dalwadi, Philip K. Maini

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过多尺度分析揭示了细胞粘附、自扩散和增殖之间的平衡如何控制集体动态,发现粘附强度调节影响组织侵袭的凝聚力与模式形成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26692 2026-04-30 quant-ph 50%

Towards Quantum Optimised Malware Containment

迈向量子优化的恶意软件隔离

Matthew Sutcliffe, Ravindra Mutyamsetty

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出结合量子幅估计和Grover最小查找算法,实现恶意软件隔离问题的二次加速,通过减少采样复杂度和候选评估次数提升优化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09409 2026-04-30 physics.flu-dyn 50%

A theoretical one-dimensional model for variable-density Rayleigh-Taylor turbulence

一种变量密度雷利-泰勒湍流的理论一维模型

Chian Yeh Goh, Guillaume Blanquart

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文回顾了Belen'kii与Fradkin 1965年的理论工作,推导了雷利-泰勒混合的湍流扩散模型,并探讨了简化方程与完整相似方程的解,揭示了非 Boussinesq 流中对称性、速度统计偏移等特征。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12288 2026-04-30 cs.AI 50%

Quantum-Aware Generative AI for Materials Discovery: A Framework for Robust Exploration Beyond DFT Biases

面向材料发现的量子感知生成AI:一种超越DFT偏见的稳健探索框架

Mahule Roy

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种量子感知生成AI框架,通过多保真度学习与主动验证的结合,克服DFT在强相关系统中的系统性失效,提升材料发现的鲁棒性与探索能力。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02509 2026-04-30 physics.chem-ph 50%

Quantitative and Predictive Folding Models from Limited Single-Molecule Data Using Simulation-Based Inference

基于模拟推理的有限单分子数据中定量与预测折叠模型构建

Lars Dingeldein, Aaron Lyons, Pilar Cossio, Michael Woodside, Roberto Covino

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于模拟推理的框架,利用单分子数据重建DNA发夹和核糖开关的折叠自由能景观,通过深度学习与物理建模结合,实现对折叠动力学的预测,且无需大量数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12007 2026-04-30 math.ST stat.TH 50%

The entropic optimal (self-)transport problem: Limit distributions for decreasing regularization with application to score function estimation

熵最优(自)运输问题:正则化参数减小的极限分布及其在分数函数估计中的应用

Gilles Mordant

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究熵最优自运输问题的统计性质,分析正则化参数缩小时的极限分布,揭示经验熵最优自运输计划的分数函数收敛性及波动特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26599 2026-04-30 cond-mat.dis-nn 50%

Effective length scales, dispersion relations, and discrete densities of states for Laplacian eigenvectors on complex networks

拉普拉斯特征向量在复杂网络上的有效长度尺度、色散关系和离散态密度

Per Arne Rikvold

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种方法,通过计算图拉普拉斯矩阵特征向量的有效长度尺度,研究复杂网络中扩散和振荡过程的色散关系和态密度。

Comments 38 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26436 2026-04-30 math.AP math.FA math.SP 50%

Analytic semigroup generated by the dispersal process of a sylvatic transmission model of Chagas disease

由切口传播过程生成的解析半群

Narimene Benarbia, Rabah Labbas, Tewfik Mahdjoub, Alexandre Thorel

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一个新的切口传播模型,通过两个反应扩散方程和偏布朗运动条件,研究切口传播过程的解析半群生成。

Journal ref IMA Journal of Applied Mathematics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26393 2026-04-30 astro-ph.CO astro-ph.GA gr-qc hep-ph 50%

Tidal Heating of Stellar Clusters in Fuzzy Dark Matter Halos

恒星团在模糊暗物质晕中的潮汐加热

Yiheng Liu, Xinyu Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过模拟恒星团在模糊暗物质晕中的动态演化,发现低质量情况下潮汐加热是主要机制,且溶iton质量减少和潮汐剥离晕会抑制加热,强调需考虑晕结构与环境以约束模糊暗物质质量。

Comments Submitted to PRD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26362 2026-04-30 cond-mat.mtrl-sci cond-mat.soft 50%

Molecular Dynamics simulations of Al-Ti metallic alloy melts using a transferable machine-learning potential

使用可转移机器学习势对Al-Ti金属合金熔体进行分子动力学模拟

Yuna Kato, Jürgen Brillo, Dirk Holland-Moritz, Fan Yang, Thomas C. Hansen, Thomas Voigtmann, Linnea Heitmeier

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究Al-Ti二元液态金属合金在温度和成分下的结构与动力学性质,采用可转移机器学习势进行分子动力学模拟,并与实验数据对比,发现该势函数能良好描述液态结构特征及动力学性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26346 2026-04-30 cond-mat.soft cond-mat.stat-mech physics.bio-ph 50%

Coexistence of patterned phases in chemically active multicomponent mixtures

化学活性多组分混合物中图案化相的共存

Chengjie Luo, Yicheng Qiang, Guido L. A. Kusters, David Zwicker

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究化学活性混合物中物理相互作用与反应的协同作用,揭示复杂图案的形成机制及相共存规律。

Comments 5 pages and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26065 2026-04-30 cs.RO 50%

FlowS: One-Step Motion Prediction via Local Transport Conditioning

FlowS: 通过局部传输条件实现一步运动预测

Leandro Di Bella, Adrian Munteanu, Bruno Cornelis

机构 * Department of Electronics and Informatics, Vrije Universiteit Brussel(弗拉芒布鲁塞尔自由大学电子与信息系) IMEC

专题命中 扩散模型 :diffusion(abstract)

AI总结 FlowS通过局部传输条件实现一步运动预测,结合在线场景条件学习先验和步一致位移场,提升预测精度与效率,达到SOTA性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25941 2026-04-30 physics.chem-ph physics.comp-ph 50%

Molecular Dynamics Force Field Genetic Optimization for Tri-n-butyl Phosphate Liquid

三丁基磷酸酯液体分子动力学力场遗传优化

Faranak Hatami, Valmor F. de Almeida

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种结合分子动力学模拟的迭代优化算法,用于优化三丁基磷酸酯液体的Lennard-Jones参数,通过多目标优化改进力场预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02415 2026-04-30 hep-ph cs.AI 50%

Generative models on phase space

相空间上的生成模型

Zachary Bogorad, Ibrahim Elsharkawy, Yonatan Kahn, Andrew J. Larkoski, Noam Levi

机构 * Theory Division, Fermi National Accelerator Laboratory, Batavia, IL, USA Department of Physics, University of Toronto Vector Institute, Toronto, ON, Canada NERSC, Lawrence Berkeley National Laboratory, Berkeley, California, USA Tel Aviv University, Tel Aviv, Israel

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出在相空间曼哈顿上构建生成模型,以精确满足物理约束,提升高能物理数据生成模型的可解释性和可靠性。

Comments v2: references added. 19+9 pages, 22 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07220 2026-04-30 cs.LG cs.AI 50%

Neural Bridge Processes

神经桥过程

Jian Xu, Yican Liu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN AIP(理化学研究所AIP) South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 神经桥过程通过引入输入锚定轨迹提升生成路径的条件性,解决传统扩散过程在输入条件编码上的不足,实验显示在回归、EEG、CylinderFlow和图像回归任务中均取得提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12549 2026-04-30 cs.LG cs.CC stat.ML 50%

The Serial Scaling Hypothesis

序列扩展假说

Yuxi Liu, Konpat Preechakul, Kananart Kuwaranancharoen, Yutong Bai

机构 * UC Berkeley(加州大学伯克利分校) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究指出某些问题本质上是顺序的,无法高效并行化,提出扩散模型无法解决此类问题,对机器学习和硬件发展有深远影响。

Comments ICLR 2026. Equal contribution by the first two authors. Project page: https://serial-scaling-hypothesis.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 3 篇

2604.26883 2026-04-30 cs.CV 77%

SEAL: Semantic-aware Single-image Sticker Personalization with a Large-scale Sticker-tag Dataset

SEAL: 基于大规模贴纸-标签数据集的语义感知单图贴纸个性化

Changhyun Roh, Yonghyun Jeong, Jonghyun Lee, Chanho Eom, Jihyong Oh

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 SEAL通过引入语义感知的单图贴纸个性化方法,解决扩散模型在贴纸个性化中的视觉纠缠和结构刚性问题,利用StickerBench数据集实现属性级控制,提升身份保持与上下文可控性。

Comments The last two authors are co-corresponding authors. Please visit our project page at https://cmlab-korea.github.io/SEAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13285 2026-04-30 cs.CV 57%

SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design

SkyReels-Text: 精细可控字体文本编辑用于海报设计

Yunjie Yu, Jingchen Wu, Junchen Zhu, Chunze Lin, Guibin Chen

机构 * Skywork AI

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 本文提出SkyReels-Text,一种可精细控制字体的文本编辑框架,支持多区域文本同时编辑,保留非编辑区域的视觉效果,无需字体标签或测试时微调,实现高质量字体控制。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26802 2026-04-30 eess.SY cs.SY 50%

A Control Framework for Induced Seismicity Mitigation in Groningen Gas Reservoir

格罗宁根气田诱发地震缓解控制框架

Diego Gutiérrez-Oribio, Ioannis Stefanou

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种控制方法,用于在格罗宁根气田中缓解诱发地震,通过耦合孔压扩散与地震率动态的 cascade 模型,结合随机事件生成过程,设计鲁棒反馈控制器以调节地震率并满足生产要求。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2507.02314 2026-04-30 cs.CV cs.AI 83%

MAGIC: Few-Shot Mask-Guided Anomaly Inpainting with Prompt Perturbation, Spatially Adaptive Guidance, and Context Awareness

MAGIC: 少样本掩码引导的异常修复与提示扰动、空间自适应引导和上下文意识

JaeHyuck Choi, MinJun Kim, Je Hyeong Hong

机构 * Department of AI Semiconductor Engineering, Hanyang University, Seoul, Korea(汉阳大学人工智能半导体工程系) Department of Electronic Engineering, Hanyang University, Seoul, Korea(汉阳大学电子工程系)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 MAGIC通过引入提示扰动、空间自适应引导和上下文意识,解决少样本异常生成中的样本多样性问题,提升下游任务的鲁棒性。

Comments Accepted at CVPR 2026 Findings. Supplementary material included after references. 47 pages, 47 figures, 28 tables. Code : https://github.com/SpatialAILab/MAGIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26244 2026-04-30 cs.CV cs.AI 57%

MetaSR: Content-Adaptive Metadata Orchestration for Generative Super-Resolution

MetaSR:面向生成超分辨率的内容自适应元数据编排

Jiaqi Guo, Mingzhen Li, Haohong Wang, Aggelos K. Katsaggelos

机构 * Department of Electrical and Computer Engineering, Northwestern University(电气与计算机工程系,西北大学) TCL

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 MetaSR通过自适应元数据编排提升生成超分辨率性能,在资源受限下实现更高PSNR和更低传输速率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2604.24953 2026-04-30 cs.CV cs.AI 70%

ViPO: Visual Preference Optimization at Scale

ViPO:大规模视觉偏好优化

Ming Li, Jie Wu, Justin Cui, Xiaojie Li, Rui Wang, Chen Chen

机构 * University of Central Florida(中央佛罗里达大学) ByteDance Seed(字节跳动种子) UCLA(加州大学洛杉矶分校)

专题命中 图像生成评测 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出ViPO大规模偏好数据集和Poly-DPO方法,通过提升数据质量和算法鲁棒性,实现视觉生成模型的高效偏好优化。

Comments ICLR 2026 Paper. Project Page: https://liming-ai.github.io/ViPO ; Code: https://github.com/liming-ai/ViPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02494 2026-04-30 cs.CL cs.AI cs.CV 57%

MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text

MINOS:一种用于图像与文本双向生成的多模态评估模型

Junzhe Zhang, Huixuan Zhang, Xinyu Hu, Li Lin, Mingqi Gao, Shi Qiu, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所) School of Physics, Peking University(北京大学物理学院)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出MINOS模型,通过严格质量控制策略构建Minos-57K多模态评估数据集,结合SFT和偏好对齐训练策略,在16个跨领域数据集中取得最佳性能。

Comments Accepted to the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏