arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-16 至 2026-03-16 共收录 72 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 48 篇

2603.00947 2026-03-16 cs.CV 57%

Mobile-VTON: High-Fidelity On-Device Virtual Try-On

Mobile-VTON: 高保真设备端虚拟试衣

Zhenchen Wan, Ce Chen, Runqi Lin, Jiaxin Huang, Tianxi Chen, Yanwu Xu, Tongliang Liu, Mingming Gong

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Mobile-VTON,一种基于设备端的高保真虚拟试衣框架,通过模块化架构和隐私保护技术,在无需云端支持的情况下实现高质量试衣效果。

Comments The project page is available at: https://zhenchenwan.github.io/Mobile-VTON/

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20673 2026-03-16 cs.CV 57%

GA-Drive: Geometry-Appearance Decoupled Modeling for Free-viewpoint Driving Scene Generation

GA-Drive:用于自由视角驾驶场景生成的几何-外观解耦建模

Hao Zhang, Lue Fan, Qitai Wang, Wenbo Li, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(CUHK的MMLab) CASIA Shanghai Jiaotong University(上海交通大学) SenseTime Research(商汤科技研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GA-Drive通过几何-外观解耦和扩散生成技术,生成可编辑的高保真驾驶场景,提升自动驾驶训练和评估的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06684 2026-03-16 cs.CV 57%

EMGauss: Continuous Slice-to-3D Reconstruction via Dynamic Gaussian Modeling in Volume Electron Microscopy

EMGauss:通过动态高斯建模在体积电子显微镜中实现连续切片到三维重建

Yumeng He, Zanwei Zhou, Yekun Zheng, Chen Liang, Yunbo Wang, Xiaokang Yang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 EMGauss通过动态高斯建模方法,解决体积电子显微镜中切片到三维重建的异质性限制,提升插值质量并实现连续切片合成。

Comments Accepted by CVPR 2026. Project page: https://raynehe.github.io/EMGauss/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06119 2026-03-16 cs.CV 57%

Omni-Video: Democratizing Unified Video Understanding and Generation

Omni-Video:统一视频理解与生成的普及

Zhiyu Tan, Hao Yang, Luozheng Qin, Jia Gong, Mengping Yang, Hao Li

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Omni-Video框架,通过改进多模态大语言模型生成连续视觉线索,结合轻量架构和高效训练方案,实现视频理解、生成与编辑的统一模型。

Comments Technical report, project page: https://howellyoung-s.github.io/OmniVideo_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03222 2026-03-16 cs.CV 57%

Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretraining

Mocap-2-to-3:多视角提升用于单目运动恢复的2D预训练

Zhumei Wang, Zechen Hu, Ruoxi Guo, Huaijin Pi, Ziyong Feng, Liang Zhang, Mingtao Pei, Siyuan Huang

机构 * Beijing Institute of Technology(北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI(国家一般人工智能重点实验室,BIGAI) Deep Glint Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Shandong Agricultural University(山东农业大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Mocap-2-to-3框架,通过多视角合成过程和分阶段训练提升单目运动恢复的精度与泛化能力,实现更精确的物理空间定位。

Comments Project page: https://wangzhumei.github.io/mocap-2-to-3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13167 2026-03-16 astro-ph.EP astro-ph.IM 50%

Connecting JWST Silicate Cloud Observations to Exoplanet Cloud Microphysics with Nimbus

通过NIMBUS将JWST硅酸盐云观测连接到系外行星云微物理

Sven Kiefer, Caroline V. Morley, Melanie Rowland

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究利用NIMBUS和Virga模型分析四个系外行星的云结构,发现高海拔存在纳米级硅酸盐颗粒,其形成过程受高效沉降和生长效率限制,通过多波段观测约束粘附系数,为未来云研究提供方向。

Comments 23 pages, 16 figures, accepted for publication in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12969 2026-03-16 math.NA cs.NA 50%

Rapid Identification of Moving Contaminant Sources Through Physics-Based Modelling

通过物理建模快速识别移动污染源

Marco Mattuschka, Jacopo Bonari, Max von Danwitz, Alexander Popp

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种结合advection-diffusion模型和稀疏性先验信息的算法,用于快速定位和量化时间变化的污染源,并通过风洞实验校准三维流动模型,以提升数字孪生环境中的实时决策支持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05946 2026-03-16 math.NA cs.NA math-ph math.MP 50%

PriorIDENT: Prior-Informed PDE Identification from Noisy Data

PriorIDENT: 从噪声数据中利用先验信息的偏微分方程识别

Cheng Tang, Hao Liu, Dong Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种结合先验信息的弱形式稀疏回归框架,通过优化字典和移除导数到平滑测试函数,解决噪声放大和过完备库的模糊性问题,实现更准确的PDE识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15233 2026-03-16 physics.chem-ph 50%

Unifying reciprocal and real space atomic dynamics in dilute gases

统一稀气体中反演空间与实空间原子动力学

Jaeyun Moon

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过正常模式理论统一稀气体中的热导率、扩散系数和剪切粘度等传输过程,弥合固体与气体相描述间的理论鸿沟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14996 2026-03-16 cond-mat.mtrl-sci 50%

Dependence of Radiation Induced Segregation of Cr on Sink Dimensionality and Morphology in Fe-Cr Alloys

Cr在Fe-Cr合金中辐射诱导偏聚对sink维度和形态的依赖性

Mohammadhossein Nahavandian, Anter El-Azab, Enrique Martinez

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过KMC模型分析Fe-3Cr合金中Cr偏聚行为,探讨sink维度对偏聚和浓度分布的影响,发现平面sink的偏聚依赖性线性,而球形sink则更复杂。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17058 2026-03-16 q-bio.PE cond-mat.stat-mech 50%

How animal movement influences wildlife-vehicle collision risk: a mathematical framework for range-resident species

动物运动如何影响野生动物-车辆碰撞风险:一种适用于栖息地物种的数学框架

Benjamin Garcia de Figueiredo, Inês Silva, Michael J. Noonan, Christen H. Fleming, William F. Fagan, Justin M. Calabrese, Ricardo Martinez-Garcia

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种数学框架,结合交通、景观和个体运动特征,分析野生动物-车辆碰撞风险,为制定基于数据的缓解策略提供理论基础。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17564 2026-03-16 cs.LG cs.AI cs.RO 50%

Accelerating Residual Reinforcement Learning with Uncertainty Estimation

通过不确定性估计加速残差强化学习

Lakshita Dodeja, Karl Schmeckpeper, Shivam Vats, Thomas Weng, Mingxi Jia, George Konidaris, Stefanie Tellex

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出改进残差强化学习方法,通过不确定性估计提升样本效率,并使其适用于随机基策略。在Robosuite和D4RL任务中,该方法在多种模拟环境和现实部署中均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16326 2026-03-16 cs.CR 50%

Architectural Selection Framework for Synthetic Network Traffic: Quantifying the Fidelity-Utility Trade-off

合成网络流量架构选择框架:量化保真度与效用的权衡

Dure Adan Ammara, Jianguo Ding, Kurt Tutschku

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出架构选择框架,通过评估不同生成模型在两类数据结构上的保真度与效用,揭示GAN模型在保真度与效用平衡上的优势,以及统计方法和扩散模型的局限性。

Journal ref IEEE Access, vol 14, pp 468-484, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12889 2026-03-16 physics.optics 50%

Dynamic analysis of refractive index evolution and diffraction properties during single-photon polymerization of photopolymers for micro-optical applications

光聚合过程中折射率演变与衍射特性动态分析用于微光学应用

Andreas Heinrich, Manuel Rank

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究光聚合过程中折射率变化与衍射特性,利用DLP投影系统分析光固化动力学及光学性能,揭示聚合相变阶段及光散射对折射率对比度的影响。

Comments 28 pages, 9 figures, submitted to Journal of Optical Microsystems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12849 2026-03-16 eess.SP cs.RO 50%

AoI-FusionNet: Age-Aware Tightly Coupled Fusion of UWB-IMU under Sparse Ranging Conditions

AoI-FusionNet:在稀疏测距条件下基于UWB-IMU的年龄感知紧密耦合融合

Tehmina Bibi, Anselm Köhler, Jan-Thomas Fischer, Falko Dressler

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出AoI-FusionNet,通过直接融合UWB测距与IMU数据实现三维轨迹估计,采用年龄信息衰减模块和自适应注意力机制提升定位精度,通过数据增强策略提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12806 2026-03-16 cs.RO 50%

FLUX: Accelerating Cross-Embodiment Generative Navigation Policies via Rectified Flow and Static-to-Dynamic Learning

FLUX:通过校正流和静态到动态学习加速跨身体生成导航策略

Zeying Gong, Yangyi Zhong, Yiyi Ding, Tianshuai Hu, Guoyang Zhao, Lingdong Kong, Rong Li, Jiadi You, Junwei Liang

专题命中 扩散模型 :diffusion(abstract)

AI总结 FLUX是首个基于流的统一导航策略,通过线性化概率流提升推理效率,结合静态到动态课程学习,在六个导航任务中取得最佳性能,并实现无调优的仿真到现实迁移。

Comments Project Page at this [Website](https://zeying-gong.github.io/projects/flux/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12802 2026-03-16 math.AP math.PR 50%

Uniform-in-time propagation of chaos and bifurcation in two-type adhesion systems

时间一致的混沌传播与双型黏附系统中的分支现象

Myeongju Chae, Young-Pil Choi

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究双型肿瘤细胞相互作用的非局部黏附模型,结合扩散、配对相互作用和随机表型切换,建立微观扩散-跳跃粒子描述及其均场极限非线性麦肯纳-瓦尔茨方程,证明弱相互作用下时间一致混沌传播及长时指数收缩,揭示平稳分布唯一性,并探讨强相互作用下均匀平衡态稳定性丧失的分支机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12782 2026-03-16 math.NA cs.NA 50%

Computing the Nonnegative Low-Rank Leading Eigenmatrix and its Applications to Markov Grids and Metzler Operators

计算非负低秩主导特征矩阵及其在马尔可夫网格和梅茨勒算子中的应用

Nicolas Gillis, Carmela Scalone

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于微分方程时间积分的算法,用于计算线性实算子右端特征对的非负低秩近似,应用于马尔可夫网格和梅茨勒算子。

Comments 22 pages, code available from https://gitlab.com/ngillis/nonnegative-low-rank-leading-eigenmatrix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12734 2026-03-16 stat.ML cs.LG 50%

VecMol: Vector-Field Representations for 3D Molecule Generation

VecMol:基于向量场的3D分子生成

Yuchen Hua, Xingang Peng, Jianzhu Ma, Muhan Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 VecMol通过将分子建模为欧几里得空间中的连续向量场,避免显式图生成,实现了3D分子生成的新方法,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12730 2026-03-16 cs.RO 50%

AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation

AnchorVLA4D: 一种基于锚点的时空视觉-语言-动作模型用于机器人操作

Juan Zhu, Zhanying Shao, Xiaoqi Li, Ethan Morgan, Jiadong Xu, Hongwei Fan, Hao Dong

机构 * PrimeBot School of Computer Science, Peking University(北京大学计算机学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出AnchorVLA4D,通过引入锚点图像和轻量级空间编码器,提升机器人操作中的时空推理能力,实现在Simpler WidowX基准测试中提升13.6%,并在真实任务中达到80%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12637 2026-03-16 cs.CR cs.AR cs.DS 50%

ExpanderGraph-128: A Novel Graph-Theoretic Block Cipher with Formal Security Analysis and Hardware Implementation

ExpanderGraph-128:一种新型图论块密码及其形式安全分析与硬件实现

W. A. Susantha Wijesinghe

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于扩张图交互网络的轻量级块密码ExpanderGraph-128,采用20轮平衡Feistel网络,通过稀疏结构连接实现扩散与安全,结合MILP分析证明其高安全性和高效实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11234 2026-03-16 physics.bio-ph cond-mat.soft q-bio.TO 50%

Biology and Physics

生物学与物理学

Stuart A. Newman, Sahotra Sarkar

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出生物物理学作为研究活物质的科学,区分经典生物物理学,并探讨活物质在不同尺度上的独特物理特性及哲学基础。

Comments Prepared for Comprehensive Philosophy of Science (Ed. Sven Ove Hansson; Elsevier), Section on Philosophy of Biology (ed. Francesca Merlin)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11143 2026-03-16 astro-ph.EP 50%

Martian concretion sizes predicted from two independently constrained inputs: atmospheric dust grain size and obliquity-forced wetting duration

火星中混凝土尺寸的预测:来自两个独立约束输入的预测:大气尘粒大小和倾角驱动的湿润持续时间

Samuel Cody

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过大气尘粒大小和倾角驱动湿润持续时间两个独立约束输入,揭示火星混凝土尺寸一致性源于全球统一的细尘颗粒限制生长,形成机制与液态水接触尘土有关,且每个混凝土记录单一湿润事件。

Comments 19 pages, 3 figures, 2 tables. Preprint; not yet peer-reviewed. V1.4

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22338 2026-03-16 hep-ph hep-lat nucl-th 50%

Fluctuation-Dissipation Relation for Hard Partons in a Gluonic Plasma

强子在胶子等离子体中的涨落-耗散关系

Amit Kumar, Abhijit Majumder, Ismail Soudi, Johannes Heinrich Weber

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究推导了高能轻夸克在胶子等离子体中阻力与扩散系数及热胶子凝聚态的涨落-耗散关系,通过局部算符和轮廓积分技术实现物理输运系数的联系。

Comments 6 pages + 1 figure including references: derivation includes resummation of higher-order terms, inclusion of more references

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15614 2026-03-16 astro-ph.HE 50%

Implementation of CR Energy SPectrum (CRESP) algorithm in PIERNIK MHD code. II. Propagation of Primary and Secondary nuclei in a magneto-hydrodynamical environment

在PIERNIK MHD代码中实现CR能谱(CRESP)算法。II. 在磁流体动力学环境中初级和次级核的传播

Antoine Baldacchino-Jordan, Michał Hanasz, Mateusz Ogrodnik, Dominik Wóltański, Artur Gawryszczak, Andrew W. Strong, Philipp Girichidis

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文在PIERNIK MHD代码中实现了CR能谱算法,研究了磁流体动力学环境中初级和次级核的传播,探讨了扩散系数和SN率对次级到初级通量比的影响。

Comments 27 pages, 11 figures,Accepted for The Astrophysical Journal Supplement Series, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 10 篇

2603.12829 2026-03-16 cs.CV 83%

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24980 2026-03-16 cs.CV 79%

SDPose: Exploiting Diffusion Priors for Out-of-Domain and Robust Pose Estimation

SDPose:利用扩散先验进行跨域和鲁棒姿态估计

Shuang Liang, Jing He, Chuanmeizhi Wang, Lejun Liao, Guo Zhang, Yingcong Chen, Yuan Yuan

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 SDPose通过分析不同上采样层次的潜在特征,提取鲁棒的U-Net特征并融合轻量级模块,结合关键点热图监督和辅助潜变量重建损失,实现跨域姿态估计的鲁棒性和泛化能力。

Comments 22 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12793 2026-03-16 cs.CV cs.AI 70%

Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation

Cheers:解耦补丁细节与语义表示以实现统一的多模态理解和生成

Yichen Zhang, Da Peng, Zonghao Guo, Zijian Zhang, Xuesong Yang, Tong Sun, Shichu Sun, Yidan Zhang, Yanghao Li, Haiyan Zhao, Wang Xu, Qi Shi, Yangang Sun, Chi Chen, Shuo Wang, Yukun Yan, Xu Han, Qiang Ma, Wei Ke, Liang Wang, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 Cheers通过解耦补丁细节与语义表示,实现统一的多模态理解和生成,提升图像生成的保真度,并在多个基准测试中表现优异,同时实现4倍的token压缩效率。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13024 2026-03-16 cs.CV cs.AI cs.LG eess.IV 57%

SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation

SAW:通过可控且可扩展的视频生成实现手术动作世界模型

Sampath Rapuri, Lalithkumar Seenivasan, Dominik Schneider, Roger Soberanis-Mukul, Yufan He, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Pengfei Guo, Daguang Xu, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) NVIDIA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。

Comments The manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23120 2026-03-16 cs.CV 57%

MMGT: Motion Mask Guided Two-Stage Network for Co-Speech Gesture Video Generation

MMGT:基于运动遮罩的两阶段网络用于语音手势视频生成

Siyuan Wang, Jiawei Liu, Wei Wang, Yeying Jin, Jinsong Du, Zhi Han

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MMGT网络,通过结合音频、运动遮罩和姿态视频生成同步语音手势视频,解决单一音频控制导致的大动作缺失问题,提升视频质量与细节控制。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏