arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-10 至 2026-07-10 共收录 16 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 12 篇

2606.30308 2026-07-10 cs.CV 版本更新 79%

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14584 2026-07-10 cs.CV 版本更新 79%

Anatomically Guided Latent Diffusion for Brain MRI Progression Modeling

用于脑 MRI 进展建模的解剖学引导潜在扩散

Cheng Wan, Bahram Jafrasteh, Ehsan Adeli, Miaomiao Zhang, Qingyu Zhao

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔医学院) Stanford University(斯坦福大学) University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究旨在准确建模脑 MRI 进展,提出解剖学引导潜在扩散模型 AG-LDM,通过融合多因素简化训练流程,经实验验证其在图像质量、误差降低及特征捕捉等方面表现优异,是可靠的脑 MRI 进展建模框架。

Comments 24 pages, 7 figures, 7 tables. Code available at https://github.com/JornyWan/AG-LDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08055 2026-07-10 cond-mat.mtrl-sci 版本更新 78%

Anisotropic Defect Diffusion in Layered CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$ Perovskites

层状CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$钙钛矿中各向异性缺陷扩散

Konrad Wilke, Mike Pols, Titus S. van Erp, Geert Brocks, Shuxia Tao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过分子动力学模拟探讨层状CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$钙钛矿中缺陷扩散的各向异性,揭示层状卤素排列对材料稳定性及缺陷迁移的调控作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11440 2026-07-10 cs.LG cs.AI cs.CE 版本更新 78%

GenDA: Generative Data Assimilation on Complex Urban Areas via Classifier-Free Diffusion Guidance

GenDA:基于无分类器扩散引导的复杂城市区域生成式数据同化

Francisco Giral, Álvaro Manzano, Ignacio Gómez, Ricardo Vinuesa, Soledad Le Clainche

机构 * Applied Mathematics Department, ETSIAE-School of Aeronautics, Universidad Politécnica de Madrid, Spain(马德里理工大学应用数学系) Department of Aerospace Engineering, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学航空航天工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对仅靠稀疏传感器数据进行城市风流重建的难题,提出GenDA框架,利用多尺度图扩散架构及无分类器引导机制,在RANS模拟实验中表现出色,相比其他方法降低误差、提高相似性指数,为复杂领域环境监测提供可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16920 2026-07-10 cs.CV 版本更新 70%

DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution

DeltaDeno:通过Delta去噪归因实现零样本异常生成

Chaoran Xu, Chengkan Lv, Qiyu Chen, Yunkang Cao, Feng Zhang, Zhengtao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) CASI Vision Technology CO., LTD., Luoyang, China(CASI视觉科技有限公司) School of Artificial Intelligence and Robotics, Hunan University, Changsha, China(湖南大学人工智能与机器人学院)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 研究在无真实异常样本和训练情况下的零样本异常生成问题,提出DeltaDeno方法,通过对比两个扩散分支定位编辑缺陷,累积去噪增量生成掩码,经令牌级提示细化等操作提升性能,在公共数据集实验中效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19480 2026-07-10 cs.CV 版本更新 57%

Deep Sprite-based Image Models: An Analysis

基于深度精灵的图像模型:一种分析

Zeynep Sonat Baltacı, Romain Loiseau, Mathieu Aubry

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM研究所、国家科学研究中心、巴黎理工大学、ENPC、巴黎理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文分析了基于精灵的图像分解模型,提出了一种深度方法,在CLEVR基准上与最新无监督类感知分割方法相当,线性扩展对象数量并明确识别对象类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新 57%

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26169 2026-07-10 physics.flu-dyn 版本更新 50%

A Nonhomogeneous Porous-Medium Equation for Field Scale CO$_2$ Plume Spreading

二氧化碳羽流扩展的多孔介质尺度

Fernando Alonso-Marroquin, Christian Tantardini

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过比较分析解与数字图像分析结果,量化了多孔介质中二氧化碳羽流扩展的尺度特征,推导了羽流厚度、边缘和核心半径的闭合表达式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08311 2026-07-10 math.ST cs.LG stat.TH 版本更新 50%

Sign Identifiability of Causal Effects in Stationary Stochastic Dynamical Systems

在平稳随机动力学系统中因果效应的符号可识别性

Gijs van Seeventer, Saber Salehkaleybar

机构 * Leiden University(莱顿大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了平稳随机动力学系统中因果效应的符号可识别性,提出边符号可识别性概念,并通过具体因果结构分析确定了边符号的显式表达式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14883 2026-07-10 hep-th gr-qc 版本更新 50%

Pole-skipping without master variable and holographic superfluids

无主变量的极点跳跃与全息超流体

Makoto Natsuume, Takashi Okamura

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究强耦合下格林函数极点跳跃性质,提出不依赖主变量的形式,以全息超流体为例指出流体动力学极点不全是极点跳跃点。

Comments 24 pages, v2: accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21286 2026-07-10 cond-mat.mtrl-sci 版本更新 50%

NEP89: Universal neuroevolution potential for inorganic and organic materials across 89 elements

NEP89:89种元素的无机和有机材料通用神经进化潜力

Ting Liang, Ke Xu, Eric Lindgren, Zherui Chen, Rui Zhao, Jiahui Liu, Esmée Berger, Benrui Tang, Bohan Zhang, Yanzhou Wang, Keke Song, Penghua Ying, Nan Xu, Haikuan Dong, Shunda Chen, Paul Erhart, Zheyong Fan, Tapio Ala-Nissila, Jianbin Xu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究针对机器学习原子间势的局限,提出神经进化势架构的NEP89模型,通过特定方法构建训练数据集。该模型精度高且计算高效,能实现大规模原子模拟,适用于多种场景并支持微调,为材料研究提供有力工具。

Comments 5 figures in the main text; Supplementary Information is available on the Nature Computational Science website

Journal ref Nature Computational Science (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06718 2026-07-10 physics.plasm-ph 版本更新 50%

TORAX: A Fast and Differentiable Tokamak Transport Simulator in JAX

TORAX:JAX 中一个快速且可微的托卡马克输运模拟器

Jonathan Citrin, Ian Goodfellow, Akhil Raju, Jeremy Chen, Jonas Degrave, Craig Donner, Federico Felici, Philippe Hamel, Andrea Huber, Dmitry Nikulin, David Pfau, Brendan Tracey, Martin Riedmiller, Pushmeet Kohli

专题命中 扩散模型 :diffusion(abstract)

AI总结 介绍基于 JAX 框架的开源可微托卡马克输运模拟器 TORAX,它求解多种输运耦合方程,融合物理与机器学习模型,利用 JAX 特性实现快速运行及微分,经与 RAPTOR 代码验证,为托卡马克相关研究提供有力工具。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 1 篇

2512.14236 2026-07-10 cs.CV 版本更新 57%

Elastic3D: Controllable Stereo Video Conversion with Guided Latent Decoding

Elastic3D:基于引导潜解码的可控立体视频转换

Nando Metzger, Prune Truong, Goutam Bhat, Konrad Schindler, Federico Tombari

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对沉浸式3D内容需求,提出Elastic3D方法,基于(条件)潜扩散,用引导VAE解码器确保高质量立体视频输出,能让用户在推理时控制立体效果强度,实验表明其优于传统及现有基线。

Comments Project page: elastic3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2602.11117 2026-07-10 cs.CV 版本更新 79%

HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion

HairWeaver:基于仿真到现实引导视频扩散的少样本逼真头发运动合成

Di Chang, Ji Hou, Aljaz Bozic, Assaf Neuberger, Felix Juefei-Xu, Olivier Maury, Gene Wei-Chin Lin, Tuur Stuyck, Doug Roble, Mohammad Soleymani, Stephane Grabli

机构 * Meta University of Southern California(Meta 美国南加州大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 HairWeaver旨在解决现有方法在头发运动控制上的不足,通过运动上下文LoRA和风格对齐LoRA两个模块,结合CG模拟器生成的数据集训练视频扩散主干,实现对头发运动的精细控制,生成高度逼真且具动态细节的头发动画,达到新的技术水平。

Comments Accepted by ECCV 2026. Website: https://boese0601.github.io/hairweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 2 篇

2603.15136 2026-07-10 cs.LG cs.AI 版本更新 50%

Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies

安全流Q学习:基于可达性的安全离线强化学习流策略

Mumuksh Tayal, Manan Tayal, Ravi Prakash

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出Safe Flow Q-Learning,结合达性启发的安全价值函数和高效的一步流策略,通过自一致性Bellman递归学习安全价值,行为克隆训练流策略并转化为奖励最大化安全动作选择器,减少部署时的拒绝采样,提升实时安全应用性能。

Comments 21 pages, 6 figures, 3 tables; First 2 authors have contributed equally; Paper accepted at Reinforcement Learning Conference (RLC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08583 2026-07-10 cs.RO cs.LG 版本更新 50%

SeFA-Policy: Fast and Accurate Visuomotor Policy Learning with Selective Flow Alignment

SeFA策略:基于选择性流对齐的快速准确视觉运动策略学习

Rong Xue, Jiageng Mao, Mingtong Zhang, Yue Wang

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 针对机器人模仿学习中视觉运动策略学习难题,提出SeFA框架,用选择性流对齐策略,借助专家示范纠正动作,统一整流流效率与观测一致动作生成,实验显示其超越现有策略,准确性、鲁棒性高且推理延迟大幅降低。

详情

展开后加载摘要…

URL PDF HTML 收藏