arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-29 至 2026-07-29 共收录 82 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 58 篇

2605.10708 2026-07-29 quant-ph 版本更新 50%

Gate-Level Quantum Simulation of Nonunitary Linear Dynamics with Hybrid Oscillator-Qubit Architecture

通过混合振子-量子比特线性组合哈密顿量模拟求解量子微分方程

Elin Ranjan Das, Muqing Zheng, Rishab Dutta, Ang Li, Timothy Stavenger, Yuan Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种混合振子-量子比特方法,用于求解线性常微分方程,通过连续变量辅助模式替代离散变量辅助寄存器,减少量子比特开销,并展示其在热方程中的高保真度表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19099 2026-07-29 math.AP 版本更新 50%

Weighted well-posedness and kernel stability for coercive evolution equations with measure-valued delays

扩散方程中混合测度记忆的适定性与核稳定性

Hiroki Ishizaka

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了包含历史效应的线性扩散方程,通过有限非负Borel测度统一弱形式,探讨了分布记忆和离散延迟的适定性与稳定性。

Comments Corrected and substantially revised version with a new weighted well-posedness argument and an expanded kernel-stability analysis. Title and bibliography updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01109 2026-07-29 q-fin.RM 版本更新 50%

A stochastic correlation extension of the Vasicek credit risk model

Vasicek信用风险模型的随机相关性扩展

Dhruv Bansal, Mayank Goud, Sourav Majumdar

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种Vasicek信用风险模型的随机相关性扩展,通过圆周扩散过程引入相关性风险,改进了传统模型对尾部风险的刻画能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00433 2026-07-29 cond-mat.mtrl-sci 版本更新 50%

In situ Gas-Cell Electron Microscopy Reveals Pressure-Selected Restructuring Pathways in AuRu Ammonia Catalysts

反应条件下的氨催化剂演变揭示于环境和多模式电子显微镜

Amy S. McKeown-Green, Parivash Moradifar, Zisheng Zhang, Cedric Lim, Andrew Barnum, Lin Yuan, Robert Sinclair, Frank Abild-Pedersen, Colin Ophus, Jennifer A. Dionne

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过环境和多模式电子显微镜研究,揭示了AuRu催化剂在反应条件下的结构演变机制,揭示了氢驱动的纳米空洞形成及压力对重构的影响。

Comments First two authors contributed equally to this work. First two and final author are corresponding authors. This work was conducted at Stanford University

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18473 2026-07-29 cond-mat.mtrl-sci physics.comp-ph 50%

Interface phonon modes governing the ideal limit of thermal transport across diamond/cubic boron nitride interfaces

Xiaonan Wang, Xin Wu, Penghua Ying, Zheyong Fan, Huarui Sun

专题命中 扩散模型 :diffusion(abstract)

Comments 11 pages, 7 figures

Journal ref Int. J. Heat Mass Transfer 271, 129245 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 2 篇

2605.27351 2026-07-29 cs.CV 版本更新 57%

Feedforward 3D Editing Learns from Semantic-Part Transformation

前馈3D编辑从语义部分变换中学习

Jiawei Weng, Saining Zhang, Zhenxin Diao, Peishuo Li, Henghaofan Zhang, Junhao Chen, Hao Zhao

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 提出Pxform数据集和PartFlow网络,通过语义部分变换实现高质量前馈3D编辑,在几何和外观编辑基准上达到最优性能。

Comments 31 pages, 22 figures. Project Page: https://dennis-jwweng.github.io/pxform/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12109 2026-07-29 cs.RO cs.AI 版本更新 50%

InDex: Empowering VLA Models with Intent-Conditioned Arm-Hand Coordination for Dexterous Manipulation

弥合形态差距:通过意图条件微调使VLA模型适应灵巧操作

Chuanke Pang, Junyi Huang, Zhijun Zhao, Yaobing Wang, Kun Xu, Xilun Ding

机构 * Beihang University(北京航空航天大学) China Academy of Space Technology(中国空间技术研究院)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出InDex框架,通过将预训练的1-DoF平行抓取输出重用作宏观虚拟抓取意图代理,结合两阶段解耦学习架构,实现VLA模型从低自由度夹爪到高自由度灵巧手的适应,有效缓解灾难性遗忘和动作流形坍缩。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 3 篇

2607.25147 2026-07-29 cs.AI 新提交 50%

Inferring Missing Trajectory Data with Temporal Convolutional Networks

使用时间卷积网络推断缺失的轨迹数据

Ilinca Tiriblecea, Gabriel Turinici

机构 * CEREMADE, Université Paris Dauphine - PSL, CNRS(巴黎第九大学 - 巴黎文理研究大学、法国国家科学研究中心决策数学与经济实验室)

专题命中 图像修复 :inpainting(abstract)

AI总结 针对现实中轨迹数据常缺失的问题,提出用带对称扩张的时间卷积网络进行轨迹修复,放宽因果关系约束,利用组合损失训练,在含随机掩码片段的合成数据集上训练,取得良好的R²、MSE和MAE指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16813 2026-07-29 eess.AS 版本更新 50%

Audio dequantization using instantaneous frequency

利用瞬时频率的音频去量化

Vojtěch Kovanda, Pavel Rajmic

专题命中 图像修复 :inpainting(abstract)

AI总结 本文提出了一种基于相位感知正则化器的音频去量化方法,旨在提升音频信号在时频表示中的正弦分量连续性并减少能量损失伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00941 2026-07-29 eess.SY cs.SY 50%

Stop-and-go wave super-resolution reconstruction via iterative refinement

Junyi Ji, Alex Richardson, Derek Gloudemans, Gergely Zachár, Matthew Nice, William Barbour, Jonathan Sprinkle, Benedetto Piccoli, Daniel B. Work

专题命中 图像修复 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 7 篇

2607.25622 2026-07-29 cs.CV 新提交 79%

Beyond Facial Consistency: Personalized Person Image Generation with Holistic Identity Preservation

超越面部一致性:具有整体身份保留的个性化人物图像生成

Yuxuan Xiao, Shanshan Zhang, Jian Yang, Shengcai Liao

机构 * Black Forest Labs(黑森林实验室)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 研究个性化人物图像生成中面部保真度与外观一致性权衡问题,提出双分支基线及动态平衡缩放策略DBS,由自适应时间门控和区域感知优化组成,实验表明DBS比现有基线更好,为整体身份建模提供可控框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25390 2026-07-29 cs.CV 新提交 79%

Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors

基于扩散先验的无噪声单步LoRA用于任务驱动的图像恢复

Jaeha Kim, Kyoung Mu Lee

机构 * Seoul National University(首尔国立大学) IPAI, Seoul National University(首尔国立大学IPAI)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对退化图像影响下游任务的问题,提出基于扩散先验的无噪声单步LoRA方法用于任务驱动的图像恢复,通过特定适配模块及新训练策略,经实验验证该方法在多任务上优于先前方法且具泛化能力。

Comments Code: https://github.com/JaehaKim97/NOLA-IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25750 2026-07-29 cs.LG cs.CY 新提交 78%

Detecting CSAM Text-to-Image LoRAs From Weights

从权重中检测用于生成儿童性虐待材料的文本到图像的LoRA

David Demitri Africa, Cate Heine, Nadine Staes-Polet, Kimberly Mai

专题命中 个性化与一致性 :text-to-image(title);image generation(abstract)

AI总结 研究如何从权重中检测用于生成CSAM的文本到图像的LoRA,利用LoRA更新的左上角奇异向量形成的指纹$u_1$,以人类主体年龄为代理,发现其能识别训练内容、跨模型泛化且对良性内容不判断,可直接从权重筛选有害LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25962 2026-07-29 cs.CV 新提交 70%

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection

LaP-Forensics:用于深度伪造检测的潜在像素一致性引导的多模态推理

Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) University College London(伦敦大学学院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学)

专题命中 个性化与一致性 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对深度伪造检测问题,提出LaP-Forensics多模态框架,利用基于重建的取证证据及结构化模型预测,经组相对策略优化,实现跨生成器检测和伪影定位,实验验证了残差流效用,但后处理下文本忠实性和可靠性有局限。

Comments Accepted at ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25842 2026-07-29 cs.CV cs.CR 新提交 57%

Adversarial Deepfake Generation and an Investigation of Purification-Based Adversarial Detection

对抗性深度伪造生成与基于净化的对抗性检测研究

Junghyun Kim, Seunghyun Kim, Jiyoung Woo

机构 * Soonchunhyang University(顺天乡大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 该研究参与ImageCLEF 2026深度伪造检测与生成任务,图像生成采用FLUX.1-dev等方法,检测用SigLIP+DINOv2等组合。还自主研究基于净化的对抗性检测,发现特定信号可有效区分对抗与干净输入,反驳相关假设并揭示质量悬崖。

Comments Accepted at CLEF 2026, ImageCLEF-Deepfake task. Published in CEUR-WS CLEF 2026 Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23023 2026-07-29 cs.CV 版本更新 57%

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

OmniMate:用于交互式虚拟化身的开放式实时流视听生成

Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究针对实时交互式流中生成范围未知和跨模态身份一致性退化的挑战,提出OmniMate框架,通过生成进度控制器和多参考条件模块,实现高质量、低延迟的开放式实时交互式视听虚拟化身生成及长期跨模态身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20233 2026-07-29 cs.CV 版本更新 57%

Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models

使用角色-环境协调视频生成模型的电影级合成

Tianyi Xiang, Mingming He, Li Ma, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Independent Researcher(独立研究员)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出端到端视频扩散框架,通过三掩码引导和RGB-D联合去噪建模角色与环境的双向物理与光照交互,实现高质量动态视频合成。

Comments Project Page: https://cehcomposition.github.io/demo/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 3 篇

2607.24763 2026-07-29 cs.AI 新提交 78%

CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models

用于掩码扩散语言模型的计算感知重掩码评估协议

Yash Shah, Abhijit Chakraborty, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) MongoDB(MongoDB公司)

专题命中 图像生成评测 :diffusion(title,abstract)

AI总结 研究针对掩码扩散语言模型评估标准不完善的问题,提出计算感知评估框架CaRE,通过标准化函数评估实际数量等方法审核重掩码策略,应用于多种模型和数据集,揭示了温度、计算匹配等因素对评估的影响,发布相关内容确保评估可重复可比。

Comments updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24016 2026-07-29 cs.CV 版本更新 57%

DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models

DailyBench:用于评估现代生成模型生成和处理的人工智能图像的统一基准

Xin Jiang, Hao Tang, Junyao Gao, Meiqi Cao, Fei Shen, Dongming Zhang, Yongdong Zhang

机构 * People’s Daily Online(人民网) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

AI总结 研究针对现有生成模型图像检测基准与现实差距问题,提出统一基准DailyBench,含FakeBench和ManipulationBench两个子集,通过实验揭示当前检测器鲁棒性差,凸显其可用于开发更强大的人工智能生成图像检测方法。

Comments Some errors must be corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24871 2026-07-29 cond-mat.mtrl-sci 新提交 50%

A flexible kinetic Monte Carlo framework for GaN molecular beam epitaxy with adaptive on-the-fly barrier evaluation

用于 GaN 分子束外延的具有自适应实时势垒评估的灵活动力学蒙特卡罗框架

Sajid Ali, Norbert Krause, Carla Verdi

专题命中 图像生成评测 :diffusion(abstract)

AI总结 该研究提出基于晶格的 KMC 框架模拟 GaN(0001)分子束外延生长,捕捉关键微观过程,支持自适应实时势垒评估,能再现岛形成等现象,为 GaN 外延及化合物半导体非平衡生长提供了灵活的原子尺度预测模拟平台。

Journal ref Applied Surface Science, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 2 篇

2602.15355 2026-07-29 cs.CV 版本更新 79%

DAV-GSWT: Diffusion-Active-View Sampling for Data-Efficient Gaussian Splatting Wang Tiles

DAV-GSWT:基于扩散优先的主动视角采样用于数据高效的高斯溅射瓦片

Rong Fu, Jiekai Wu, Yee Tan Jia, Yang Li, Xiaowen Ma, Wangyu Wu, Simon Fong

机构 * University of Macau(澳门大学) Juntendo University(立命馆大学) Tongji University(同济大学) Renmin University of China(中国人民大学) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) University of Liverpool(利物浦大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DAV-GSWT框架,利用扩散先验和主动视角采样,从少量输入观测合成高保真高斯溅射瓦片,减少数据需求并保持视觉质量和交互性能。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26004 2026-07-29 cs.CV cs.LG 新提交 70%

Parallel Decoding Distillation for Fast Image and Video Generation

用于快速图像和视频生成的并行解码蒸馏

Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

机构 * NVIDIA(英伟达) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散或流模型生成计算昂贵问题,提出并行解码蒸馏方法PDD,兼容预训练模型,通过预测多去噪步骤加速生成,在多个数据集上达SOTA性能,提升视频多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏