arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-26 至 2026-05-26 共收录 173 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2605.25266 2026-05-26 cs.CV 57%

DeltaCam: Differential Intrinsic Camera Modeling for Video Generation

DeltaCam: 用于视频生成的差分内参相机建模

Debabrata Mandal, Zhihan Peng, Yujie Wang, Praneeth Chakravarthula

机构 * UNC, Chapel Hill USA(北卡罗来纳大学教堂山分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出DeltaCam视频扩散框架,通过差分参数化神经相机适配器学习相对变化,实现焦距、光圈、ISO等内参的平滑可控视频生成,并扩展到真实场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13597 2026-05-26 cs.CV 57%

Lighting in Motion: Spatiotemporal HDR Lighting Estimation

运动中的光照:时空高动态范围光照估计

Christophe Bolduc, Julien Philip, Li Ma, Mingming He, Paul Debevec, Jean-François Lalonde

机构 * Université Laval(拉瓦尔大学) Eyeline Labs(Eyeline实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出基于扩散的时空光照估计方法LiMo,通过生成不同曝光下的镜面与漫反射球体,结合深度与几何条件,实现高精度高频细节预测与照度估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12425 2026-05-26 cs.CV 57%

Boosting Monocular Metric Depth Estimation via Bokeh Rendering

通过散景渲染提升单目度量深度估计

Hangwei Zhang, Armando Fortes, Tianyi Wei, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Beihang University(北航大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出BokehDepth两阶段框架,利用物理生成模型产生校准散景堆栈作为无监督几何信号,通过散景感知聚合模块提升单目深度估计的度量精度。

Comments Project Page: https://fogradio.github.io/BokehDepth_Project/

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25012 2026-05-26 cs.CV 57%

Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation

从语义字典中学习:面向统一视觉表示与生成的判别式码本对比学习

Imanol G. Estepa, Jesús M Rodríguez-de-Vera, Bhalaji Nagarajan, Petia Radeva

机构 * Universitat de Barcelona(巴塞罗那大学) Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 提出LEASE框架,通过配对生成-判别码本设计,在离散标记空间中联合优化掩码重建损失和码本对比损失,实现统一视觉表示与生成,在ImageNet-1K上达到最先进性能。

Comments Accepted at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24074 2026-05-26 cs.CV cs.RO 57%

WideDepth: Millimeter-Accurate Benchmark for Fisheye Depth Estimation

WideDepth: 用于鱼眼深度估计的毫米级精度基准

Ilia Indyk, Ignat Penshin, Ivan Sosin, Maxim Monastyrny, Aleksei Valenkov, Ilya Makarov

机构 * Robotics Center(机器人中心) AXXX Trusted AI Research Center, RAS(可信人工智能研究中心,俄罗斯科学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出首个室内鱼眼深度估计数据集WideDepth,包含101个场景的5K高分辨率立体对和毫米级真值,并引入基于LiDAR的立体鱼眼图像生成方法,评估多种模型,微调后性能提升高达62%。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20583 2026-05-26 math.NA cs.NA 50%

Multilevel Isogeometric Projection Stabilization via Quasi-Interpolation for Advection-Dominated Problems

基于拟插值的多水平等几何投影稳定化方法用于对流主导问题

Zakaria El Hasnaoui, Ahmed Ratnani

专题命中 可控生成 :diffusion(abstract)

AI总结 针对对流主导的对流扩散问题,提出一种基于连续B样条拟插值的多水平投影稳定化方法,通过提取和惩罚细尺度波动,避免残差型方法的参数敏感性和局部投影稳定化的不连续辅助空间,理论推导先验误差估计并数值验证稳定性,显著减少非物理振荡。

Comments 28 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22414 2026-05-26 math.OC cs.NA math.NA 50%

Computational Control of Nonlinear Partial Differential Equations Using Machine Learning

使用机器学习对非线性偏微分方程进行计算控制

Maximilian Kurbanov, Minh-Nhat Phung, Minh-Binh Tran

专题命中 可控生成 :diffusion(abstract)

AI总结 提出WeightedPINN框架,通过算子分解和独立自适应时空权重,解决非线性偏微分方程中内部和双线性控制问题的数值重构,并给出收敛分析和数值实验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11534 2026-05-26 cs.LG cs.AI 50%

Krause Synchronization Transformers

Krause同步变换器

Jingkun Liu, Yisong Yue, Max Welling, Yue Song

机构 * Shanghai Qi Zhi Institute(上海启智研究院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Jiao Tong University(上海交通大学) California Institute of Technology(加州理工学院) University of Amsterdam(阿姆斯特丹大学)

专题命中 可控生成 :image generation(abstract)

AI总结 提出基于有界置信共识动力学的Krause注意力机制,通过局部化稀疏交互替代全局softmax归一化,缓解表示坍缩和注意力汇聚现象,实现线性复杂度并提升性能。

Comments ICML 2026, Project page: https://jingkun-liu.github.io/krause-sync-transformers/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 5 篇

2605.24762 2026-05-26 cs.CV 77%

4KLSDB: A Large-Scale Dataset for 4K Image Restoration and Generation

4KLSDB:用于4K图像恢复与生成的大规模数据集

Zihao Zhu, Kuan-Ru Huang, Zhaoming Xu, Renjie Li, Bo Wu, Ruizheng Bai, Mingyang Wu, Sayak Paul, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学) Hugging Face

专题命中 图像修复 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 为解决现有数据集缺乏原生4K分辨率和规模的问题,提出包含129,484张4K图像的大规模数据集4KLSDB,并通过多阶段自动过滤和标注确保质量,实验证明其在超分辨率和扩散模型训练中能显著提升4K基准性能。

Comments Accepted to the DataCV Workshop at CVPR 2026; 10 pages, 4 figures, 7 tables; Our project page is available at: https://4klsdb.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08125 2026-05-26 eess.IV cs.CV 70%

FlowSteer: Conditioning Flow Field for Consistent Image Restoration

FlowSteer: 条件化流场以实现一致图像恢复

Tharindu Wickremasinghe, Chenyang Qi, Harshana Weligampola, Zhengzhong Tu, Stanley H. Chan

机构 * Purdue University(普渡大学) HKUST(香港科技大学) Texas A&M University(德克萨斯农工大学)

专题命中 图像修复 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出FlowSteer,一种算子感知的条件化方案,通过在采样路径中注入测量先验,将冻结流的隐式引导与显式测量约束耦合,在零样本设置下实现超分辨率、去模糊、去噪和着色等任务的一致图像恢复。

Comments Accepted by CVPRF 2026. Camera Ready version. Project page is \href{https://tharindu-nirmal.github.io/FlowSteer/}{in this link}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24593 2026-05-26 cs.CV 57%

Self-supervised Dynamic Heterogeneous Degradation Modeling for Unified Zero-Shot Image Restoration

自监督动态异质退化建模用于统一零样本图像恢复

XiaoWan Hu, Jing Yang, HeNan Liu, HuaQiu Li, Mai Xu

机构 * Beihang University(北航) Tsinghua University(清华大学)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出统一物理零样本图像恢复框架,通过将异质退化重参数化为同质分布并引入动态质量细化策略,实现单/混合退化下的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14552 2026-05-26 cs.CV 57%

LiWi: Layering in the Wild

LiWi: 野外分层

Yu He, Fang Li, Haoyang Tong, Lichen Ma, Xinyuan Shan, Jingling Fu, Dong Chen, Luohang Liu, Junshi Huang, Yan Li

机构 * MAIS & NLPR, CASIA(模式识别与人工智能实验室及中国科学院自动化研究所)

专题命中 图像修复 :image generation(abstract);分类 cs.CV

AI总结 提出基于代理驱动数据分解和联合优化光度保真度与alpha边界的方法,实现野外自然图像的高保真分层分解,构建了LiWi-100k数据集并达到SOTA性能。

Comments Project Page https://rassetmusty.github.io/LiWi

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24763 2026-05-26 cs.LG physics.flu-dyn 50%

High-fidelity Modeling of Full-scale Pressurized Water Reactor Flow Fields for Machine Learning Applications

面向机器学习应用的全尺寸压水堆流场高保真建模

Logan A. Burnett, Hyungjun Kim, Hsien-Cheng Chou, Arsha Witoelar, Robert A. Brewster, Benoit Forget, Emilio Baglietto, Majdi I. Radaideh

机构 * Department of Nuclear Engineering and Radiological Sciences, University of Michigan(密歇根大学核工程与辐射科学系) Department of Nuclear Science and Engineering, Massachusetts Institute of Technology(麻省理工学院核科学与工程系) Korea Atomic Energy Research Institute(韩国原子能研究所) Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系) Department of Computer Science and Engineering, University of Michigan(密歇根大学计算机科学与工程系)

专题命中 图像修复 :inpainting(abstract)

AI总结 本研究利用高保真CFD模拟和机器学习模型,对四环路压水堆组件级流场进行表征,揭示了冷腿旋流和下腔室输运导致的入口流量分布不均匀性,并验证了ConvLSTM等空间感知架构在流场重建与预测中的优越性。

Comments 30 pages, 10 figures, and 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 3 篇

2605.26111 2026-05-26 cs.CV cs.AI cs.GR cs.LG cs.MM 75%

Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation

从多模态大语言模型中榨取能力用于主题驱动生成

Shuhong Zheng, Aashish Kumar Misraa, Yu-Teng Li, Yu-Jhe Li, Igor Gilitschenski

机构 * University of Toronto & Vector Institute(多伦多大学及向量研究所) Adobe(Adobe公司) Google(谷歌公司)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 提出一种结合多模态大语言模型和VAE身份条件的方法,通过双层级聚合模块和多阶段去噪策略,在主题驱动图像生成中实现多模态理解与身份保持的平衡,优于现有方法。

Comments 33 pages, 18 figures, Project Page: https://zsh2000.github.io/squeeze-mllm-subject-gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25778 2026-05-26 cs.CV 57%

OMGTex: One-stage Multi-style Facial Texture Reconstruction without Geometry Guidance

OMGTex: 无需几何引导的一阶段多风格面部纹理重建

Zitong Xiao, Yuda Qiu, Zisheng Ye, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能化重点实验室) FNii-Shenzhen(FNii-深圳)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出OMGTex,一种端到端的扩散框架,无需3D几何先验,直接从多风格面部图像重建高质量、可编辑的UV纹理,通过梯度引导推理和语义感知训练实现鲁棒重建与编辑。

Comments CVPR 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00443 2026-05-26 cs.SD cs.MM eess.AS 57%

RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models

RVCBench:现代音频生成模型中语音克隆鲁棒性的基准测试

Ruinan Jin, Xinting Liao, Hanlin Yu, Deval Pandya, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 提出RVCBench数据集和基准,通过18项鲁棒性评估、225个说话人和14370个话语,系统评估语音克隆模型在噪声、多语言、长文本、后处理和对抗扰动等现实场景下的鲁棒性。

Comments 65 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2605.25759 2026-05-26 cs.CV 79%

Towards Anatomically Plausible Human Image Generation via Synthetic Localized Preferences

通过合成局部偏好实现解剖学合理的人体图像生成

Bao Li, Yuliang Xiu, Zhen Liu

机构 * Westlake University(西湖大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 图像生成评测 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 提出 ASAP 框架,利用局部退化机制构建受控偏好对,并结合局部有界 DPO 变体,在保持整体图像质量的同时减少解剖学错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08063 2026-05-26 cs.CV cs.AI 77%

Flow-OPD: On-Policy Distillation for Flow Matching Models

Flow-OPD:面向流匹配模型的在线策略蒸馏

Zhen Fang, Wenxuan Huang, Yu Zeng, Yiming Zhao, Shuang Chen, Kaituo Feng, Yunlong Lin, Lin Chen, Zehui Chen, Shaosheng Cao, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of California, Los Angeles(加州大学洛杉矶分校) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司)

专题命中 图像生成评测 :diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 提出Flow-OPD框架,通过两阶段对齐策略(单奖励GRPO微调专家+流式冷启动与在线策略蒸馏)解决流匹配模型在多任务对齐中的奖励稀疏和梯度干扰问题,并引入流形锚点正则化抑制美学退化,在GenEval和OCR指标上显著提升。

Comments Project Page: https://costaliya.github.io/Flow-OPD/ , Code: https://github.com/CostaliyA/Flow-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24658 2026-05-26 cs.LG 50%

WLNO: Wavelet-Laplace Neural Operator for Solving Partial Differential Equations

WLNO: 用于求解偏微分方程的小波-拉普拉斯神经算子

Muhammad Abid, Arth Sojitra, Omer San

机构 * Department of Mechanical and Aerospace Engineering, University of Tennessee, Knoxville(田纳西大学机械与航空航天工程系)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出WLNO,通过融合Haar小波多尺度空间分解与拉普拉斯神经算子的极点-留数公式,在五个基准PDE问题上优于LNO,尤其擅长处理具有强空间多尺度结构的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 4 篇

2605.24016 2026-05-26 cs.AR cs.AI 78%

SA-Kura: An Energy-Efficient Systolic Array Accelerator for Locally-Coupled Kuramoto Drift in Diffusion Sampling

SA-Kura: 用于扩散采样中局部耦合Kuramoto漂移的节能脉动阵列加速器

Jeongmin Jin, Kyeongwon Lee, Mundo Jeong, Jongin Choi, Woojoo Lee

机构 * National Research Foundation of Korea(韩国国家研究基金会) Institute of Information & communications Technology Planning & Evaluation(信息通信技术规划与评估院)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 针对扩散采样中局部耦合Kuramoto漂移的计算瓶颈,提出首个专用数字脉动阵列加速器SA-Kura,通过重新公式化耦合计算实现高效脉动执行,相比软件和GPU分别实现193倍和6.57倍加速。

Comments 8 pages, 6 figures, 1 table; ACM/IEEE ISLPED 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25547 2026-05-26 cs.RO cs.CV 57%

TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation

TapSampling:基于任务进度理解验证器的推理时采样方法用于机器人操作

Sizhe Zhao, Shengping Zhang, Shuo Yang, Weiyu Zhao, Shuigen Wang, Xiangyang Ji

机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) Harbin Institute of Technology (Weihai) Qingdao Research Institute, China(哈尔滨工业大学(威海)青岛研究院,中国) Iray Technology co., Ltd., Shandong, China(Iray科技有限公司,山东,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出TapSampling框架,通过Action-VAE在低维潜空间采样候选动作,并利用任务进度预测验证器选择最优动作,无需微调即可提升多种通用策略的性能。

Comments ICML 2026. Project Page: https://aipixel.github.io/TapSampling/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24843 2026-05-26 cs.CV cs.AI 57%

Adversarial Error Correction for Visual Autoregressive Generation

视觉自回归生成的对抗性纠错

Ligong Bi, Tao Huang, Jianyuan Guo, Chang Xu

机构 * Shanghai Jiao Tong University(上海交通大学) City University of Hong Kong(香港城市大学) The University of Sydney(悉尼大学)

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV

AI总结 提出AID-VAR框架,通过对抗性注入诊断机制纠正视觉自回归模型中的级联误差,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27636 2026-05-26 cs.AI 50%

Generative structure search for efficient and diverse discovery of molecular and crystal structures

生成式结构搜索:高效且多样地发现分子和晶体结构

Yifang Qin, Yu Shi, Junfu Tan, Chang Liu, Ming Zhang, Ziheng Lu

机构 * Zhongguancun Academy(中关村学院) Kairos Materials(Kairos材料)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出生成式结构搜索(GSS)框架,结合扩散模型和随机结构搜索,利用数据先验加速采样并保持能量引导的局部极小探索,以低于随机结构搜索十分之一的成本恢复多样亚稳态结构。

详情

展开后加载摘要…

URL PDF HTML 收藏