arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-26 至 2026-03-26 共收录 91 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 65 篇

2603.24053 2026-03-26 cond-mat.soft cond-mat.stat-mech physics.bio-ph 50%

Multi-filament coordination rescues active transport from inertia-induced spinning arrest

多丝协调缓解由惯性诱导的旋转停滞

Anuradha Rajput, Arnab Bhattacharjee, Annwesha Dutta

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过多丝协调机制克服惯性诱导的运动停滞,发现通过立体约束消除螺旋构象,恢复定向运输,揭示了机械驱动的运动增强机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24000 2026-03-26 nlin.PS physics.bio-ph q-bio.PE 50%

Self-organized pattern synchronization modulated by stochasticity in coupled plankton ecosystems

自组织模式同步受随机性调制的耦合浮游生物生态系统

Ju Kang, Yiyuan Niu, Yuanzhi Li, Quan-Xing Liu, Chengjin Chu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过构建两层浮游生物生态模型,揭示被动扩散耦合在维持空间同步与鲁棒性中的作用,发现耦合强度超过阈值后可使独立的Turing模式转变为完全同步模式,并增强模式对环境噪声的稳定性。

Comments main: 13 pages, 7 figures; SM: 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23983 2026-03-26 cs.RO cs.AI cs.SY eess.SY 50%

SafeFlow: Real-Time Text-Driven Humanoid Whole-Body Control via Physics-Guided Rectified Flow and Selective Safety Gating

SafeFlow: 通过物理引导的修正流和选择性安全门实现实时文本驱动的人形全身体控制

Hanbyel Cho, Sang-Hun Kim, Jeonguk Kang, Donghan Koo

机构 * Future Robot AI Group, Samsung Electronics(三星电子未来机器人人工智能小组)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出SafeFlow框架,结合物理引导的运动生成与三级安全门,通过显式风险指标实现安全可控的文本驱动人形全身体控制,实验表明其在成功率、物理合规性和推理速度上优于现有扩散方法。

Comments Project Page: https://hanbyelcho.info/safeflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23621 2026-03-26 math.AP math.FA math.PR 50%

Intrinsic Hardy inequality for fractional Kolmogorov operator

分数柯莫戈罗夫算子的内在Hardy不等式

Damir Kinzebulatov

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了当漂移项对原点的吸引力强度取临界值时,非局部扩散算子的Hardy不等式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21491 2026-03-26 math.NA cs.NA 50%

Nodal Hybrid Neural Solvers for Parametric PDE Systems

节点混合神经求解器用于参数PDE系统

Yun Liu, Chen Cui, Shi Shu, Zhen Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于图傅里叶神经求解器(G-FNS)和自适应图傅里叶神经求解器(AG-FNS)的求解器,解决参数PDE系统在非结构化网格上的高效求解问题,实现网格无关收敛率和多尺度误差模式捕捉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09146 2026-03-26 cs.LG 50%

Score-Based Density Estimation from Pairwise Comparisons

基于成对比较的密度估计

Petrus Mikkola, Luigi Acerbi, Arto Klami

机构 * Department of Computer Science University of Helsinki(计算机科学系赫尔辛基大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究通过成对比较进行密度估计,提出利用温度化胜利密度进行学习,通过得分匹配估计目标密度,证明信念与胜利密度的得分向量共线性。

Comments Accepted at ICLR 2026. Camera-ready version. 36 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05543 2026-03-26 cond-mat.mes-hall cond-mat.mtrl-sci 50%

Probing orbital currents through inverse orbital Hall and Rashba effects

通过逆轨道Hall效应和Rashba效应探测轨道电流

E. Santos, J. L. Costa, R. L. Rodriguez-Suarez, J. B. S. Mendes, A. Azevedo

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究金属和半导体材料中轨道到电荷转换,揭示逆轨道Hall效应和逆轨道Rashba效应的核心作用,通过SP-FMR和SSE检测轨道电流,发现氧化铜增强信号,提取轨道扩散长度,证实轨道传输存在。

Comments 25 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04501 2026-03-26 math.AP math.DS q-bio.PE 50%

Non-Monotone Traveling Waves of the Weak Competition Lotka-Volterra System

弱竞争Lotka-Volterra系统中的非单调行波

Chiun-Chuan Chen, Ting-Yang Hsiao, Shun-Chieh Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究弱竞争Lotka-Volterra反应扩散系统中行波的存在性,通过构造改进的上下解和Schauder不动点定理,证明了所有波速s≥s*≥max{2,2√(ad)}下的行波存在,并给出了非单调行波出现的可验证条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23845 2026-03-26 gr-qc hep-th nucl-th 50%

Thermoelectric Conduction in General Relativity: A Causal, Stable, and Well Posed Theory

广义相对论中的热电传导:一种因果、稳定且良好设定的理论

Lorenzo Gavassino

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种协变稳定的一阶框架,用于描述嵌入曲空间中的各向同性刚性介质中的电荷和热传导,探讨了金属在相对论加速下的重力热电效应,并推导了考虑冷却驱动Seebeck电荷位移的相对论Thomas-Fermi方程。

Comments 6 pages and 5 figures (main text) + 6 pages and 1 figure (supplementary material), published in PRL (see https://journals.aps.org/prl/abstract/10.1103/b2k6-thdy)

Journal ref Phys. Rev. Lett. 136, 121402 (24 March, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20072 2026-03-26 cs.CL 50%

From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training

从文本到谈话:音频-语言模型需要非自回归联合训练

Tianqiao Liu, Xueyi Li, Hao Wang, Haoxuan Li, Zhichao Chen, Weiqi Luo, Zitao Liu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) TAL Education Group(TAL教育集团) Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出Text-to-Talk模型,通过整合自回归文本生成与非自回归音频扩散,统一训练目标,提升多模态语音交互系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04998 2026-03-26 cond-mat.mes-hall physics.app-ph 50%

Probing carrier and phonon transport in semiconductors all at once through frequency-domain photo-reflectance

通过频域光反射探测半导体中的载流子和声子传输

Qichen Song, Sorren Warkander, Samuel C. Huberman

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种非接触频域泵浦-探测方法,同时探测半导体中的载流子和声子传输,无需样品预处理,通过建模光诱导载流子的双极扩散、电子与声子的能量转移以及声子扩散,提取Si、Ge、SiGe和GaAs的温度依赖电热输运系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16768 2026-03-26 physics.ao-ph physics.flu-dyn 50%

Discrete variance decay analysis of spurious mixing

离散方差衰减分析中的虚假混合

Tridib Banerjee, Sergey Danilov, Knut Klingbeil

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于离散方差衰减率的框架,用于估计数值实现中虚假混合的来源,并揭示了其非唯一性及高阶方案的不确定性。

Comments Submitted to Ocean Modelling Manuscript number: OCEMOD-D-23-00145. Name of funder: Deutsche Forschungsgemeinschaft. Grant agreement or award number: 274762653

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08765 2026-03-26 math.AP math.DS nlin.AO nlin.PS 50%

Stability of coherent pattern formation through invasion in the FitzHugh-Nagumo system

通过入侵实现相干图案形成的稳定性

Montie Avery, Paul Carter, Björn de Rijk, Arnd Scheel

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了FitzHugh-Nagumo系统中通过入侵形成周期性图案的前沿稳定性,提出了一种非线性稳定性分析方法,解决了边缘扩散与尾部模式相互作用的问题,为生长过程中的波数选择定律提供了理论基础。

Comments 83 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10550 2026-03-26 math.NA cs.NA 50%

Unconditional stability and error estimates of FEMs for the electro-osmotic flow in micro-channels

微通道中电渗流的有限元方法的无条件稳定性及误差估计

Yunxia Wang, Zhiyong Si

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种用于微通道中电渗流的有限元方法,通过建立电荷密度ρ^e的对流扩散型方程,并基于后向欧拉方法设计时间离散方法,理论分析证明该算法无条件稳定且具有最优收敛性,数值结果验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 3 篇

2603.24078 2026-03-26 cs.CV 70%

PosterIQ: A Design Perspective Benchmark for Poster Understanding and Generation

PosterIQ: 一份面向海报理解和生成的设计视角基准

Yuheng Feng, Wen Zhang, Haodong Duan, Xingxing Zou

机构 * The Hong Kong Polytechnic University(香港理工大学) Snapchat Inc.(Snapchat公司) ByteDance Seed(字节跳动种子)

专题命中 可控生成 :diffusion(abstract);generative vision(abstract);分类 cs.CV

AI总结 PosterIQ 是一个设计驱动的海报理解与生成基准,包含7765个图像注释实例和822个生成提示,评估了最先进的MLLMs和扩散生成器,揭示了视觉层次、字体语义等领域的差距。

Comments CVPR 2026, Project Page: https://github.com/ArtmeScienceLab/PosterIQ-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24460 2026-03-26 math.NA cs.NA math.AP 50%

Analysis and numerical simulation of a spatio-temporal Ricker-type model for the control of Aedes aegypti mosquitoes with Sterile Insect Techniques

Aedes aegypti蚊虫SIT控制的时空Ricker型模型分析与数值模拟

Oscar Eduardo Escobar-Lasso, Stefan Frei, Reinhard Racke, Olga Vasilieva

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了基于SIT的Aedes aegypti蚊虫生物控制的时空反应扩散模型,分析了性别结构模型的数学性质,并通过数值模拟验证了关键释放阈值对灭绝与持续的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11269 2026-03-26 cs.NI cs.AI 50%

From Prompts to Packets: A View from the Network on ChatGPT, Copilot, and Gemini

从提示到数据包:从网络角度审视ChatGPT、Copilot和Gemini

Antonio Montieri, Alfredo Nascita, Antonio Pescapè

机构 * University of Napoli Federico II(那不勒斯费德里科二世大学)

专题命中 可控生成 :image generation(abstract)

AI总结 本文通过分析ChatGPT、Copilot和Gemini的流量特性,揭示了生成式AI聊天机器人在网络中的独特行为,包括TLS和QUIC的使用及SNI对流量可见性的影响,为网络管理提供了新的视角。

Comments 15 pages, 8 figures, 2 tables, 4 research questions, accepted on Elsevier Computer Networks

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2505.18047 2026-03-26 cs.CV cs.AI 70%

RestoreVAR: Visual Autoregressive Generation for All-in-One Image Restoration

RestoreVAR:用于全图像修复的视觉自回归生成

Sudarshan Rajagopalan, Kartik Narayan, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 图像修复 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 RestoreVAR通过视觉自回归模型提升全图像修复性能,实现比扩散模型快10倍的推理速度,并在修复效果和泛化能力上达到新高。

Comments Project page: https://sudraj2002.github.io/restorevarpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24240 2026-03-26 cs.CV 57%

InstanceRSR: Real-World Super-Resolution via Instance-Aware Representation Alignment

InstanceRSR: 通过实例感知的表示对齐实现现实世界超分辨率

Zixin Guo, Kai Zhao, Luyan Zhang

机构 * Tongji University(同济大学) Western Sydney University(西澳大学) Independent Researcher(独立研究员)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 InstanceRSR通过联合建模语义信息和引入实例级特征对齐,解决现实世界超分辨率中细粒度细节恢复问题,提升实例级语义一致性。

Comments 4 pages, 4 figures, 2 tables. Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 3 篇

2603.24043 2026-03-26 cs.CV 83%

HAM: A Training-Free Style Transfer Approach via Heterogeneous Attention Modulation for Diffusion Models

HAM: 一种通过异构注意力调节的无训练风格迁移方法用于扩散模型

Yeqi He, Liang Li, Zhiwen Yang, Xichun Sheng, Zhidong Zhao, Chenggang Yan

机构 * Hangzhou Dianzi University(杭州电子科技大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Macao Polytechnic University(澳门 polytechnic 大学)

专题命中 个性化与一致性 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出一种无训练的风格迁移方法HAM,通过异构注意力调节保护内容图像的身份信息,解决风格与内容的平衡问题。

Comments Accepted in CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19900 2026-03-26 cs.CV cs.GR 62%

ExpPortrait: Expressive Portrait Generation via Personalized Representation

ExpPortrait:通过个性化表示生成表现力强的肖像

Junyi Wang, Yudong Guo, Boyang Guo, Shengming Yang, Juyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种高保真个性化头部表示,用于生成具有高表现力的肖像视频,通过引入表达转移模块实现不同身份间的头部姿态和表情细节转移,实验表明在身份保持、表情准确性和时间稳定性方面优于现有方法。

Comments CVPR 2026, Project Page: https://ustc3dv.github.io/ExpPortrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22172 2026-03-26 cs.CV 57%

CA-LoRA: Concept-Aware LoRA for Domain-Aligned Segmentation Dataset Generation

CA-LoRA:面向领域对齐的分割数据集生成的概念感知LoRA

Minho Park, Sunghyun Park, Jungsoo Lee, Hyojin Park, Kyuwoong Hwang, Fatih Porikli, Jaegul Choo, Sungha Choi

机构 * KAIST(韩国科学技术院) Qualcomm AI Research(高通AI研究) Kyung Hee University(庆熙大学)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CA-LoRA方法,通过文本到图像生成模型生成分割数据集,解决数据稀缺问题。该方法通过选择性更新与领域对齐相关的概念权重,提升生成样本的多样性和信息量,在城市场景分割中表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 3 篇

2603.19775 2026-03-26 cs.CV 79%

Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach

基于大语言模型的图像编辑评估:一个全面的基准和中间层探针方法

Shiqi Gao, Zitong Xu, Kang Fu, Huiyu Duan, Xiongkuo Min, Jia wang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出TIEdit基准和EditProbe方法,通过5120张编辑图像和专家评分,评估文本引导图像编辑方法的感知质量、对齐性和内容保真度,同时利用大语言模型中间层探针提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23883 2026-03-26 cs.CV 57%

BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment

BioVITA: 生物数据集、模型和基准用于视觉-文本-音频对齐

Risa Shinoda, Kaede Shiohara, Nakamasa Inoue, Kuniaki Saito, Hiroaki Santo, Fumio Okura

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究所) OMRON SINIC X

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出BioVITA框架,通过大规模数据集、模型和跨模态检索基准,实现生物物种的多模态对齐,提升生物多样性理解。

Comments CVPR 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24335 2026-03-26 cs.CY 50%

Generative Artificial Intelligence and the Knowledge Gap: Toward a New Form of Informational Inequality

生成式人工智能与知识差距:迈向一种新的信息不平等形式

Raphael Morisco

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出将生成式AI的使用重点从访问和使用转向信息批判性评估,探讨教育水平对AI生成内容处理的影响,为未来研究教育、AI使用与知识不平等的关系提供框架。

Comments 8 pages, conceptual paper. Proposes a theoretical extension of the knowledge gap perspective, arguing that generative AI shifts informational inequality from access and usage toward the evaluation of AI-generated content

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 6 篇

2511.18281 2026-03-26 cs.CV cs.AI 88%

Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation

Uni-DAD: 集成扩散模型的蒸馏与适应以实现少步少样本图像生成

Yara Bahram, Mélodie Desbos, Mohammadhadi Shateri, Eric Granger

机构 * LIVIA, ILLS, ETS(LIVIA、ILLs、ETS)

专题命中 效率与蒸馏 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 Uni-DAD通过统一蒸馏与适应流程,提升少样本图像生成质量与多样性,采用双域分布匹配和多头GAN损失,实现单阶段高效生成。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07058 2026-03-26 cs.CV cs.AI cs.LG 77%

SPARE: Self-distillation for PARameter-Efficient Removal

SPARE:用于参数高效去除的自蒸馏

Natnael Mola, Leonardo S. B. Pereira, Carolina R. Kelsch, Luis H. Arribas, Juan C. S. M. Avedillo

机构 * Universidad Autonoma de Madrid(马德里自治大学) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 SPARE提出一种两阶段方法,结合参数定位与自蒸馏,实现文本到图像扩散模型中特定概念的高效去除,通过梯度重要性分析和稀疏低秩适配器实现轻量级修改,并通过时间步采样提升效率,验证了其在UnlearnCanvas基准上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27684 2026-03-26 cs.CV 70%

Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals

相位DMD:通过在子区间内进行分数匹配实现少步分布匹配蒸馏

Xiangyu Fan, Zesong Qiu, Zhuguanyu Wu, Fanzhou Wang, Zhiqian Lin, Tianxiang Ren, Dahua Lin, Ruihao Gong, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Beihang University(北航大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Phased DMD,一种多步蒸馏框架,结合分步蒸馏与专家混合(MoE),提升模型容量并减少学习难度,通过分步分布匹配和子区间内分数匹配改进生成多样性与视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22533 2026-03-26 cs.CV 57%

Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration

Fast3Dcache: 无训练3D几何合成加速

Mengyu Yang, Yanming Yang, Chenyi Xu, Chenxi Song, Yufan Zuo, Tong Zhao, Ruibo Li, Chi Zhang

机构 * AGI Lab, Westlake University(西溪大学AGI实验室) University of Electronic Science and Technology of China(电子科学与技术大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Fast3Dcache,一种无训练的几何感知缓存框架,通过动态缓存调度和时空稳定性准则,显著加速3D扩散模型推理,同时保持几何精度。

Comments Accepted by CVPR 2026; Project page: https://fast3dcache-agi.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23383 2026-03-26 cs.CV 57%

From Feature Learning to Spectral Basis Learning: A Unifying and Flexible Framework for Efficient and Robust Shape Matching

从特征学习到谱基学习:一种统一且灵活的框架,用于高效且鲁棒的形状匹配

Feifan Luo, Hongyang Chen

机构 * College of Computer Science and Technology, Zhejiang University, China(浙江大学计算机科学与技术学院,中国) Research Center for Computational Earth and Space Science, Zhejiang Lab, China(浙江实验室计算地球与空间科学研究中心,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种统一的框架,通过学习谱基来提升形状匹配的效率和鲁棒性,引入了新的热扩散模块和无监督损失函数,实现了特征提取与基函数的联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏