arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-15 至 2026-06-15 共收录 22 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2512.04981 2026-06-15 cs.CV cs.LG 版本更新 83%

Aligned but Stereotypical? How System Prompts Shape Demographic Bias in LLM-Based Text-to-Image Models

对齐但刻板?系统提示如何塑造基于LLM的文本到图像模型中的人口统计偏见

NaHyeon Park, Na Min An, Kunhee Kim, Soyeon Yoon, Jiahao Huo, Hyunjung Shim

机构 * KAIST(韩国科学技术院) HKUST (GZ)(香港科技大学(广州))

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究LLM增强的文本到图像系统在提示扩展中引入隐性人口统计偏见的问题,提出无训练的去偏框架FairPro,通过自适应生成公平性指令减少人口统计差异。

Comments Project page: https://fairpro-t2i.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09250 2026-06-15 cs.CV cs.AI cs.LG 版本更新 57%

MirrorCheck: Efficient Adversarial Defense for Vision-Language Models

MirrorCheck: 视觉-语言模型的高效对抗防御

Samar Fares, Klea Ziu, Toluwani Aremu, Nikita Durasov, Martin Takáč, Pascal Fua, Ivan Laptev, Karthik Nandakumar

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能大学) NVIDIA École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Michigan State University(密歇根州立大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出MirrorCheck框架,利用文本到图像模型和随机化策略检测并防御针对视觉-语言模型的自适应对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15947 2026-06-15 eess.IV cs.CV 版本更新 57%

MCR-VQGAN: A Scalable and Cost-Effective Tau PET Synthesis Approach for Alzheimer's Disease Imaging

MCR-VQGAN:一种用于阿尔茨海默病成像的可扩展且经济高效的Tau PET合成方法

Jin Young Kim, Jeremy Hudson, Jeongchul Kim, Qing Lyu, Christopher T. Whitlow

机构 * Department of Biomedical Engineering, Wake Forest University School of Medicine(生物医学工程系,威克森林大学医学院) Department of Radiology, Wake Forest School of Medicine(放射学系,威克森林医学院) Department of Radiology and Biomedical Imaging, Yale School of Medicine(放射学与生物医学成像系,耶鲁医学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出MCR-VQGAN模型,通过多尺度卷积、ResNet块和CBAM模块改进VQGAN,从T1加权MRI合成高保真tau PET图像,在ADNI数据集上优于cGAN等方法,且合成图像保留诊断特征,区域SUVR等效分析显示与真实图像高度一致。

Comments Accepted for publication in IEEE Access. 14 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 19 篇

2601.19115 2026-06-15 cs.CV 版本更新 83%

FBSDiff++: Improved Frequency Band Substitution of Diffusion Features for Efficient and Highly Controllable Text-Driven Image-to-Image Translation

FBSDiff++: 改进的扩散特征频带替换用于高效且高度可控的文本驱动图像到图像翻译

Xiang Gao, Yunpeng Jia

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出FBSDiff++框架,通过动态频带替换扩散特征,实现无需训练的文本驱动图像到图像翻译,支持外观、布局和轮廓引导,并大幅提升推理速度(8.9倍),支持任意分辨率输入和局部编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01801 2026-06-15 cs.CV cs.AI 版本更新 79%

Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention

快速自回归视频扩散与世界模型:基于时间缓存压缩与稀疏注意力

Dvir Samuel, Issar Tzachor, Matan Levy, Michael Green, Gal Chechik, Rami Ben-Ari

机构 * Hebrew University of Jerusalem(特拉维夫大学) Google Research(谷歌研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FAST-AR框架,通过TempCache压缩KV缓存、AnnCA加速交叉注意力、AnnSA稀疏化自注意力,实现自回归视频扩散模型5-10倍加速,同时保持视觉质量并稳定GPU内存使用。

Comments Accepted to ICML 2026. Project Page: https://dvirsamuel.github.io/fast-auto-regressive-video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21179 2026-06-15 cs.CV 版本更新 79%

Enhancing Underwater Light Field Images via Global Geometry-aware Diffusion Process

通过全局几何感知扩散过程增强水下光场图像

Yuji Lin, Qian Zhao, Zongsheng Yue, Junhui Hou, Deyu Meng

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学学院) School of Mathematics and Statistics and the Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学学院和教育部智能网络与网络安全重点实验室) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Macao Institute of Systems Engineering, Macau University of Science and Technology(澳门系统工程研究院,澳门科学大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于扩散的GeoDiff-LF框架,利用空间-角度结构增强水下4D光场成像,通过改进U-Net、几何引导损失和优化采样策略,有效缓解颜色失真,在视觉保真度和定量性能上超越现有方法。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07824 2026-06-15 cond-mat.stat-mech math-ph math.MP math.PR nlin.SI quant-ph 版本更新 78%

Tamed Feynman-Kac diffusion processes: Killing-branching intertwine

驯化的Feynman-Kac扩散过程:杀死-分支交织

Piotr Garbaczewski, Mariusz Żaba

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究漂移布朗运动平衡松弛的Feynman-Kac核,通过引入杀死和分支速率解释负势区域的驯化效应,并用数值模拟验证一维非线性模型。

Comments 34 pp. 26 figures, invited paper submitted to (De Gruyter Brill, Berlin) "Open Transport"

Journal ref (De Gruyter) Open Transport 2026; 1(1): 20260019

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26927 2026-06-15 math.AP 版本更新 78%

Homogenization of Three Species Reaction Diffusion Equation in Perforated Domains

穿孔区域中三物种反应扩散方程的同质化

Saumyajit Das, Kshitij Sinha

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 利用双尺度收敛方法,研究穿孔区域中具有非齐次Neumann边界条件的三物种反应扩散模型在微尺度质量流入影响下的宏观渐近行为,得到具有修正扩散系数的同质化方程。

Comments 32 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02230 2026-06-15 cs.LG cs.AI 版本更新 78%

Generalized Discrete Diffusion with Self-Correction

广义离散扩散与自校正

Linxuan Wang, Ziyi Wang, Yikun Bai, Wei Deng, Guang Lin, Qifan Song

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出自校正离散扩散模型(SCDD),通过显式状态转移和离散时间学习,简化训练噪声调度,消除冗余重掩码步骤,在GPT-2规模上实现高效并行解码并保持生成质量。

Comments 40 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14202 2026-06-15 cs.LG cs.AI stat.ML 版本更新 78%

DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation

DiffusionBlocks: 通过扩散解释进行分块神经网络训练

Makoto Shing, Masanori Koyama, Takuya Akiba

机构 * Sakana AI The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出DiffusionBlocks框架,利用残差连接与动力系统的对应关系,将网络转换为去噪过程,通过分数匹配目标实现独立分块训练,在多种Transformer架构上达到与端到端训练相当的性能,同时降低内存需求。

Comments To appear at the 14th International Conference on Learning Representations (ICLR 2026). v4: Fixed typos in experimental details (Appendix E.4)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22954 2026-06-15 cs.CL cs.AI 版本更新 78%

Residual Context Diffusion Language Models

残差上下文扩散语言模型

Yuezhou Hu, Harman Singh, Monishwaran Maheswaran, Haocheng Xi, Coleman Hooper, Jintao Zhang, Aditya Tomar, Michael W. Mahoney, Sewon Min, Mehrdad Farajtabar, Kurt Keutzer, Amir Gholami, Chenfeng Xu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出残差上下文扩散(RCD)模块,通过回收丢弃令牌的上下文残差提高扩散语言模型的解码效率,在长/短CoT任务上以极少额外计算提升准确率4-11个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05881 2026-06-15 math.PR math.AP 版本更新 78%

On a stochastic phase-field model of cell motility with singular diffusion

关于具有奇异扩散的细胞运动随机相场模型

Amjad Saef, Wilhelm Stannat

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究一类描述移动边界问题的随机相场模型,通过加权L^2空间中的概率弱解处理相场零水平集处的奇异性,建立全局存在性。

Comments 39 pages

Journal ref Nonlinear Analysis, Vol. 274, January 2027, 114238

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00336 2026-06-15 cs.LG stat.ML 版本更新 78%

Denoising Score Matching with Random Features: Insights on Diffusion Models from Precise Learning Curves

随机特征去噪分数匹配:从精确学习曲线看扩散模型

Anand Jerry George, Rodrigo Veiga, Nicolas Macris

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(联邦理工学院洛桑校区)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过随机特征神经网络参数化分数函数,推导去噪分数匹配的渐近精确误差,揭示模型复杂度、数据量和噪声样本数对扩散模型泛化与记忆的影响。

Comments Published at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24710 2026-06-15 stat.ML cs.LG cs.NA math.NA 版本更新 78%

MAD: Manifold Attracted Diffusion

MAD: 流形吸引扩散

Dennis Elbrächter, Giovanni S. Alberti, Matteo Santacesaria

机构 * Department of Mathematics, University of Vienna(维也纳大学数学系) MaLGa Center, Department of Mathematics, University of Genoa(热那亚大学数学系MaLGa中心)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出流形吸引扩散方法,利用流形假设通过扩展得分函数在推理阶段去除噪声,生成无噪声样本,在玩具问题、合成数据和真实数据上验证有效性。

Comments 21 pages, 13 figures

Journal ref Forty-third International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12400 2026-06-15 math.CO cs.CV 版本更新 70%

Generation of Maximal Snake Polyominoes Using a Deep Neural Network

使用深度神经网络生成最大蛇形多联骨牌

Benjamin Gauthier, Alain Goupil, Fadel Toure

机构 * Université du Québec à Trois-Rivières(魁北克大学三河分校)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出结构化像素空间扩散模型,从数据驱动学习生成最大蛇形多联骨牌,无需显式编码约束,能泛化到更大矩形并接近当前计算极限。

Comments In Proceedings GASCom 2026, arXiv:2606.09910

Journal ref EPTCS 445, 2026, pp. 104-113

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00649 2026-06-15 physics.flu-dyn astro-ph.HE hep-ph 版本更新 50%

Linear causality and stability constraints on relativistic second-order magnetohydrodynamics

相对论二阶磁流体力学中的线性因果性与稳定性约束

Yiwei Qiu, Duan She, Defu Hou

专题命中 扩散模型 :diffusion(abstract)

AI总结 基于熵流分析构建相对论二阶磁流体力学框架,通过线性模式分析研究因果性和稳定性对各向异性系统的约束,揭示了磁声、阿尔文和电荷扩散模式的渐近色散关系及因果性边界。

Comments 56 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18784 2026-06-15 q-fin.RM cs.AI cs.CR cs.CY econ.GN q-fin.EC 版本更新 50%

The Insurability Frontier of AI Risk: Mapping Threats to Affirmative Coverage, Silent Exposures, and Exclusions

AI风险的可保险边界:将威胁映射到积极保险、沉默暴露和排除

Alex Leung, Rex Zhang, Ervin Ling, Kentaroh Toyoda, SiewMei Loh

机构 * Munich Re(慕尼黑再保险) Armilla Tokio Marine Kiln(东京海上日赤保险) CFC Apollo ibott Coalition

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了AI风险在商业保险中的可保险性边界,通过分析55类AI威胁与26种保险产品和排除制度,揭示了四个层次的可保险性前沿:积极保险的风险、沉默AI暴露、主动排除的风险以及传统私人保险结构之外的风险。

Comments Version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16499 2026-06-15 cond-mat.stat-mech cond-mat.dis-nn physics.bio-ph physics.med-ph 版本更新 50%

Fractal and Spectral Dimensions as Determinants of Thermal Ablation Outcomes in Cancer Tissues

分形维数和谱维数作为癌组织热消融结果的决定因素

Mario Olmo-Fajardo, Alexander López, Malte Henkel, Sébastien Fumeron

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过分形-分数阶生物热模型,发现组织分形几何和拓扑连通性共同控制凝固区扩展,谱维数是临床变异的关键驱动因素,为恶性肿瘤热消融提供拓扑信息指导策略。

Comments 18 pages, 7 figures

Journal ref Chaos, Solitons & Fractals, 210, 118668 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20925 2026-06-15 quant-ph cond-mat.stat-mech 版本更新 50%

Double-Bracket Master Equations: Phase-Space Representation and Classical Limit

双括号主方程:相空间表示与经典极限

Ankit W. Shrestha, Budhaditya Bhattacharjee, Adolfo del Campo

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过Wigner-Weyl变换和Moyal括号形式,系统推导了双括号耗散主方程的经典极限,并建立了量子与半经典框架下的梯度流表示,研究了谐振子与驱动非谐振子的半经典演化。

Comments 18 pages, 7 figures, Published version

Journal ref Phys. Rev. A 113, 062610 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02695 2026-06-15 cs.LG cs.AI 版本更新 50%

RAMAC: Multimodal Risk-Aware Offline Reinforcement Learning and the Role of Behavior Regularization

RAMAC: 多模态风险感知离线强化学习及行为正则化的作用

Kai Fukazawa, Kunal Mundada, Iman Soltani

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出RAMAC框架,结合分布性评论家与生成式演员(如扩散模型),通过条件风险价值与行为克隆的复合目标实现离线强化学习中的风险敏感学习,抑制分布外动作并提升CVaR。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15366 2026-06-15 cond-mat.stat-mech 版本更新 50%

Analytical Theory of Chiral Active Particle Transport in a Fluctuating Density Field

手性活性粒子在涨落密度场中输运的解析理论

Jayam Joshi, Abhra Puitandy, Shradha Mishra

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对三维手性活性布朗粒子在涨落密度场中的输运,建立了闭式解析理论,推导了均方位移和时变扩散率的精确表达式,揭示了手性与密度耦合对定向持久性和动力学交叉的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18275 2026-06-15 cond-mat.soft 版本更新 50%

Optimal Translocation of Living \& Active Filaments in Confinement

受限空间中活性和活性细丝的最优转运

Marin Vatin, Rosa Sinaasappel, Renske Kamping, Chantal Valeriani, Emanuele Locatelli, Antoine Deblais

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过蠕虫模型和活性细丝模拟,发现活性与重定向共同控制受限空间中的逃逸,且中间温度下转运效率最高。

Comments 10 pages, 6 figures plus 8 pages, 8 figures supplemental

详情

展开后加载摘要…

URL PDF HTML 收藏