arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-12 至 2026-05-12 共收录 206 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 151 篇

2605.08953 2026-05-12 q-bio.BM physics.bio-ph physics.comp-ph q-bio.QM 50%

A putative, computationally stable structure of homotrimeric BP180/collagen XVII

一种计算上稳定的同源三聚体BP180/胶原 XVII结构

Congzhou M Sha

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过机器学习和分子动力学预测了BP180的三维结构,揭示了其同源三聚体结构及关键抗原区域的特性,为药物靶向和疾病机制研究提供基础。

Comments 21 pages, 5 figures, Supplemental Materials at https://doi.org/10.5281/zenodo.20091509

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08869 2026-05-12 cs.DL 50%

Horizontal and Longitudinal Comparisons Among AI Subfields: A Bibliometric Perspective

人工智能子领域间的横向与纵向比较:一种文献计量学视角

Zeyu Li, Yalan Jin, Shuyu Chen, Tingxin Jiang, Xinyi Chang, Lu Yuan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过文献计量学方法,对比分析人工智能五个子领域在2000-2024年的横向与纵向发展,揭示其结构分化和演化机制。

Comments 66 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08734 2026-05-12 cs.LG cs.AI cs.CL 50%

AdaPreLoRA: Adafactor Preconditioned Low-Rank Adaptation

AdaPreLoRA: 带Adafactor预条件的低秩适应

Ziyun Liu, Fengmiao Bian, Jian-Feng Cai

机构 * Department of Mathematics(数学系) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 AdaPreLoRA通过Adafactor预条件器和因子空间求解方法,在低秩适应中实现更高效的优化,提升模型性能与内存效率。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08733 2026-05-12 cs.LG cs.IT math.IT 50%

Generative Actor-Critic with Soft Bridge Policies

生成性动作-批评者与软桥策略

Ke He, Le He, Shunpu Tang, Yafei Wang, Lisheng Fan

机构 * Guangzhou University(广州大学) Zhejiang University(浙江大学) Southeast University(东南大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出SoftGAC,通过构建可解析的MaxEnt目标,实现高效的生成性策略,仅需单次演员前向传递即可生成动作,提升了连续控制任务的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08634 2026-05-12 math.NA cs.NA 50%

Decoupling scales via localized subspace iteration and temporal splitting for multiscale parabolic equations

通过局部子空间迭代和时间分裂解耦尺度用于多尺度抛物方程

Eric T. Chung, Lijian Jiang, Mengnan Li, Yajun Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种多尺度抛物方程求解方法,通过局部子空间迭代构建低维试空间并结合时间分裂方案,有效抑制误差累积,建立能量和L2范数的先验误差估计,验证了方法的准确性和效率。

Comments 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08456 2026-05-12 cs.CR cs.LG 50%

HEART: A High-Efficiency Adaptive Real-Time Telemonitoring Framework for Secure Electrocardiogram Signal Transmission Using Chaotic Encryption

HEART:一种高效率自适应实时远程监控框架,用于使用混沌加密的安全心电图信号传输

Beyazıt Bestami Yuksel

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于患者自身心电图特征生成可学习密钥的实时心电图监控系统,利用混沌加密技术实现安全传输,通过动态生成加密密钥和结合置换与异或扩散,提高安全性与实时性能。

Comments 15 pages, 4 figure, 3 table

Journal ref ELECTRICA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10616 2026-05-12 math.AP cs.NA math.NA 50%

Local Well-Posedness of a Modified NSCH-Oldroyd System: PINN-Based Numerical Computation

修正NSCH-Oldroyd系统的局部适定性:基于PINN的数值计算

Woojeong Kim

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究修正的NSCH-Oldroyd系统,通过引入扩散增强变量保持耗散能量结构,证明局部适定性,并基于PINN进行数值示例,报告残差损失和能量衰减基准误差。

Comments 58pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02834 2026-05-12 quant-ph 50%

Identification of quantum generative circuits with parallel quantum neural network

量子生成电路的识别与并行量子神经网络

Zheping Wu, Xiaopeng Huang, Hengyue Jia, Haobin Shi, Wei-Wei Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出并行量子嵌入神经网络ParaQuanNet,通过分类生成量子数据实现量子生成电路的高效识别,准确率达99.5%,并展示了其在经典数据集上的良好性能。

Comments 11pages, 9 figures, 3 tables

Journal ref https://journal.hep.com.cn/fop/EN/10.15302/frontphys.2026.113201

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24359 2026-05-12 cond-mat.stat-mech 50%

Tethering effects on first-passage variables of lattice random walks in linear and quadratic focal point potentials

在线性与二次焦点势中随机游走首次通过变量的 tethering 效应

Debraj Das, Luca Giuggioli

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究在线性与二次焦点势中随机游走的首次通过变量,分析离散空间和时间下的动力学行为,探讨重置过程对稳态概率和首次通过动力学的影响。

Comments v1: 23 pages, 11 figures. v2: 23 pages, 12 figures. Accepted for publication in Phys. Rev. E

Journal ref Phys. Rev. E 113, 044102 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01196 2026-05-12 stat.ML cs.AI cs.LG 50%

An Interdisciplinary and Cross-Task Review on Missing Data Imputation

关于缺失数据填补的跨学科和跨任务综述

Jicong Fan

机构 * School of Data Science(数据科学学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文综述了缺失数据填补的核心概念和方法,涵盖不同领域和数据类型,分析了填补方法的分类和应用,并探讨了填补与下游任务的整合及未来研究方向。

Journal ref Foundations and Trends in Signal Processing, Vol. 20, No. 3, pp. 185-317, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27157 2026-05-12 cs.IR 50%

A Survey on Generative Recommendation: Data, Model, and Tasks

生成推荐的综述:数据、模型与任务

Min Hou, Le Wu, Yuxin Liao, Yonghui Yang, Zhen Zhang, Yu Wang, Changlong Zheng, Han Wu, Richang Hong

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文综述生成推荐领域,探讨数据、模型与任务维度,分析生成模型在推荐中的应用与挑战,提出智能推荐助手的发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18443 2026-05-12 cond-mat.mtrl-sci 50%

Using Thermal Crowding to Direct Pattern Formation on the Nanoscale

利用热拥挤指导纳米尺度上的图案形成

Ryan H. Allaire, Linda J. Cummings, Lou Kondic

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过控制金属沉积量和几何结构,利用热拥挤效应影响纳米尺度金属薄膜的演化,从而控制流体不稳定性及图案形成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08336 2026-05-12 hep-ph astro-ph.CO 50%

Primordial Black Hole Hotspots Beyond Flat Spacetime

原始黑洞热点在非平坦时空中的表现

Doojin Kim, TaeHun Kim, Jong-Chul Park, Jong-Hyun Yoon

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了原始黑洞通过霍金辐射加热周围等离子体形成热点的过程,指出在膨胀宇宙中热点的冷却阶段有显著变化,温度分布和衰减规律不同于平坦时空情况。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08312 2026-05-12 cond-mat.mtrl-sci 50%

Photovoltaic Possibility of Cu2SiSe3 and Cu2SnS3 Ternary Chalcogenides- Single Junction to Tandem Architecture

铜基二元硫化物的光伏可能性——单结到叠层架构

Saptarshi Mandal, Surbhi Ramawat, Sumit Kukreti, Ambesh Dixit

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过漂移扩散模型评估了Cu₂SiSe₃和Cu₂SnS₃二元硫化物作为光伏吸收层的可行性,发现叠层结构效率达24.1%,优于单结器件。

Comments 28 Pages, 15 Figures, Submitted to Solar Energy Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08291 2026-05-12 cs.LG cs.AI cs.AR 50%

Graph Computation Meets Circuit Algebra: A Task-Aligned Analysis of Graph Neural Networks for Electronic Design Automation

图计算与电路代数的交汇:图神经网络在电子设计自动化中的任务对齐分析

Hyunmog Kim

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文探讨了图神经网络在电子设计自动化中的应用,通过任务对齐分析,揭示了不同任务与图神经网络架构的匹配问题,指出当前方法的局限性和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08264 2026-05-12 physics.bio-ph cond-mat.mtrl-sci physics.med-ph 50%

Indirect Detection of Lactate Through Voltammetry Using Glassy Carbon Microelectrodes

通过玻璃碳微电极的伏安法间接检测乳酸

Amish Rohtagia, Elisa Barts, Neharika Ravichandran, Sandra Lara Galindoa, Surabhi Nimbalkara, Mantra Mittal, Samantha Omer, Sam Kassegnea

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文利用玻璃碳微电极结合乳酸氧化酶,通过酶促生成过氧化氢实现乳酸的间接检测,展示了在10nM浓度下的检测能力,并通过SEM和FTIR验证了电极的功能化效果。

Comments 14 pages; 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08262 2026-05-12 cond-mat.mtrl-sci cs.AI 50%

SLayerGen: a Crystal Generative Model for all Space and Layer Groups

SLayerGen:一种适用于所有空间群和层群的晶格生成模型

Rees Chang, Andrew Novick, Ryan P Adams, Elif Ertekin

机构 * Department of Materials Science & Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校材料科学与工程系) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Materials Research Laboratory, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校材料研究实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出SLayerGen,一种能生成符合空间群或层群对称性的晶格生成模型,解决了现有模型未考虑层群影响的问题,通过改进扩散组件和构建新数据集,提升了对非周期材料的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15840 2026-05-12 math.NA cs.NA 50%

A Non-Recursive, Dimension-Independent Schur-Decomposition Algorithm for $N$-Dimensional Sylvester Tensor Equations

一种非递归、与维度无关的Schur分解算法用于N维Sylvester张量方程

Carlota M. Cuesta, Francisco de la Hoz

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种非递归直接求解器,用于求解N维Sylvester张量方程,该方法基于Bartels-Stewart算法,通过Schur分解系数矩阵,实现与维度无关的计算,适用于高维问题,且在内存效率和实现复杂度上优于递归方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 13 篇

2605.09425 2026-05-12 cs.CV cs.AI 79%

AtteConDA: Attention-Based Conflict Suppression in Multi-Condition Diffusion Models and Synthetic Data Augmentation

AtteConDA:基于注意力的多条件扩散模型与合成数据增强中的冲突抑制

Shogo Noguchi

机构 * Gunma University(群马大学)

专题命中 可控生成 :diffusion(title);image generation(abstract);分类 cs.CV

AI总结 本文提出AtteConDA方法,通过多条件生成模型处理图像生成中的条件冲突,提升结构保持能力,并建立驾驶任务的生成框架和评估协议,缓解高阶自动驾驶任务的数据稀缺问题。

Comments 44 pages, 20 figures. Code and project page available at: https://github.com/ShogoNoguchi/AtteConDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09024 2026-05-12 cs.CV cs.GR cs.MM eess.IV 67%

Relightable Gaussian Splatting for Virtual Production Using Image-Based Illumination

可重照明高斯点散布用于虚拟制作的基于图像的照明

Adrian Azzarelli, Nantheera Anantrasirichai, James Pollock, David R. Bull

机构 * University of Bristol, UK(英国布里斯托大学) Lux Aeterna, Bristol, UK(卢克斯艾特纳,布里斯托,英国)

专题命中 可控生成 :image editing(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 本文提出一种针对虚拟制作的3D重建与重照明框架,利用高斯点散布技术,通过已知背景图像条件重照明过程,避免使用环境映射,提高3D重建质量和可控性,方法高效且支持多种输出变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08824 2026-05-12 cs.GR cs.CV 62%

HairGPT: Strand-as-Language Autoregressive Modeling for Realistic 3D Hairstyle Synthesis

HairGPT: 基于发丝的语言自回归建模用于逼真3D发型合成

Haimin Luo, Min Ouyang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) ShanghaiTech University and Deemos Technology Co., Ltd.(上海科技大学和Deemos技术有限公司) Deemos Technology Co., Ltd.(Deemos技术有限公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 HairGPT通过发丝为中心的框架,将发型合成转化为双解耦的自回归序列建模问题,实现结构和语义的解耦,支持复杂发型合成与风格化领域适应。

Comments Accepted to SIGGRAPH 2026 (Journal Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10523 2026-05-12 cs.CV 57%

Improving Human Image Animation via Semantic Representation Alignment

通过语义表示对齐提升人类图像动画

Chang Liu, Mengting Chen, Yixuan Huang, Haoning Wu, Chen Ju, Shuai Xiao, Jinsong Lan, Yanfeng Wang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SemanticREPA方法,通过结构和ID对齐提升人类动画质量,增强动作连续性和一致性。

Comments Accepted by CVPR 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10409 2026-05-12 cs.CV 57%

Progressive Photorealistic Simplification

渐进式逼真简化

Adi Rosenthal, Dana Berman, Yedid Hoshen, Ariel Shamir

机构 * Reichman University and Google(里奇曼大学和谷歌) Google Israel(谷歌以色列) Hebrew University and Google(希伯来大学和谷歌) Google(谷歌)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出渐进式语义图像简化框架,通过迭代去除并修补元素保持逼真外观,结合视觉-语言模型和学习验证器实现高效高质量的简化过程,应用于内容感知清理和交互编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08321 2026-05-12 cs.CV 57%

UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing

UM-Text: 一种统一的多模态模型用于图像理解和视觉文本编辑

Lichen Ma, Xiaolong Fu, Gaojing Zhou, Zipeng Guo, Ting Zhu, Yichun Liu, Yu Shi, Jason Li, Junshi Huang

机构 * Sun Yat-sen University(中山大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出UM-Text模型,通过自然语言指令实现图像理解和视觉文本编辑,引入VLM处理指令和参考图像,结合UM-Encoder生成风格一致的文本图像,并提出区域一致性损失和三阶段训练策略,最终在多个基准上取得最佳性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09429 2026-05-12 cs.CV cs.AI 57%

Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models

逃避视觉失语:面向视觉-语言模型的对比自适应语义令牌修剪

Jie Ma, Yihang Liu, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun

机构 * Xiamen University(厦门大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出COAST方法,通过对比自适应语义路由实现视觉-语言模型的高效令牌修剪,减少77.8%的视觉令牌并提升2.15倍的推理速度,同时保持98.64%的原始性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21581 2026-05-12 cs.CV 57%

MultiAnimate: Pose-Guided Image Animation Made Extensible

MultiAnimate:基于姿态的图像动画使其可扩展

Yingcheng Hu, Haowen Gong, Chuanguang Yang, Zhulin An, Yongjun Xu, Songhua Liu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种可扩展的多人物图像动画框架,通过引入标识符分配器和标识符适配器,解决多人物场景中的身份混淆和不合理的遮挡问题,实现高质量多人物动画生成。

Comments CVPR2026 Accepted. Project page at https://hyc001.github.io/MultiAnimate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09534 2026-05-12 cs.CV 57%

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

AUHead: 通过动作单元控制实现逼真的情感谈话头生成

Jiayi Lyu, Leigang Qu, Wenjing Zhang, Hanyu Jiang, Kai Liu, Zhenglin Zhou, Xiaobo Xia, Jian Xue, Tat-Seng Chua

机构 * University of the Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日報網通信內容認知重點實驗室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AUHead方法,通过动作单元控制实现逼真的谈话头生成,解决现有方法在情感表达细腻度上的不足。

Comments https://openreview.net/forum?id=dmzlAUkulz&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3DICLR.cc%2F2026%2FConference%2FAuthors%23your-submissions) Accepted at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02169 2026-05-12 cs.CV cs.DC cs.LG 57%

Heterogeneous Model Fusion for Privacy-Aware Multi-Camera Surveillance via Synthetic Domain Adaptation

异构模型融合用于隐私保护多摄像头监控的合成领域适应

Peggy Joy Lu, Wei-Yu Chen, Yao-Tsung Huang, Vincent Shin-Mu Tseng

机构 * Department of Computer Science and Information Engineering, National Chung Cheng University(资讯工程系,国立 Chung Cheng 大学) Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,国立阳明交通大学) National Center for High-Performance Computing(国家高速计算中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出HeroCrystal框架,通过合成领域适应解决多摄像头目标检测中的隐私、类别不平衡和异构架构问题,提升定位精度并实现模型融合,实验表明其在多类别隐私保护设置下优于现有方法,mAP提升2.1%达33.4%。

Comments 42 pages, 13 figures. Published in Information Fusion (Elsevier). DOI: 10.1016/j.inffus.2026.104413

Journal ref Information Fusion, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14479 2026-05-12 physics.flu-dyn math.CV 50%

Metric Geometry Governs Optimal Control in Driven Stokes Flows: Magnetic Driving and Beyond

度量几何支配驱动斯托克斯流中的最优控制:磁驱动及其他

Kyle McKee

专题命中 可控生成 :diffusion(abstract)

AI总结 研究揭示在斯托克斯流中,洛伦兹力诱导的可调环流可通过度量几何确定最优控制路径,展现各向异性扩散特性,方法适用于通用驱动斯托克斯流。

Journal ref Phys. Rev. Lett. 136, 184001 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08928 2026-05-12 math.OC stat.ML 50%

Learning Generative Dynamics with Soft Law Constraints: A McKean-Vlasov FBSDE Approach

通过软法律约束学习生成动力学:一种 McKean-Vlasov FBSDE 方法

Samer El Boustany, Samy Mekkaoui, Yadh Hafsi, Alexandre Alouadi, Huyên Pham

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出通过 McKean-Vlasov 控制问题学习随机动力学,利用软能量约束强制终端和时间边际分布,通过 FBSDE 生成耦合的随机路径,验证了在低维和高维数据中生成符合观测分布的轨迹效果。

详情

展开后加载摘要…

URL PDF HTML 收藏