arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-28 至 2026-04-28 共收录 120 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 96 篇

2510.21552 2026-04-28 cond-mat.soft physics.bio-ph 50%

Kinetic theory of emulsions with matter supply

乳液的运动理论与物质供应

Jacqueline Janssen, Frank Jülicher, Christoph A. Weber

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种乳液动力学理论,考虑了持续物质供应对液滴生长的影响,扩展了LSW理论,探讨了不同限制条件下的液滴尺寸分布特性,适用于生物系统。

Journal ref Phys. Rev. E 113, 045420 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06927 2026-04-28 physics.pop-ph physics.hist-ph physics.soc-ph 50%

An elementary method to determine the critical mass of a sphere of fissile material based on a separation of neutron transport and nuclear reaction processes

确定 fissile 材料球体临界质量的简易方法:基于中子输运与核反应过程的分离

Steven K. Lamoreaux

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种基于中子输运与核反应过程分离的简易方法,通过设定中子数量不随时间变化的阈值条件,推导出临界半径表达式,无需求解扩散方程,并验证了其与已知临界质量的吻合度。

Comments Principle manuscript 8 pages, two figures; supplemental material 6 pages, two figures; added a rate equation solution in Appendix F, corrected typos. New version addresses 234U

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23533 2026-04-28 eess.SP cs.NI 50%

PILOT: One Physics-Integrated Generation Framework to Unify 2D and 3D Radio Map Construction

PILOT:一个整合物理的生成框架,统一2D和3D无线电地图构建

Weiming Huang, Hao Sun, Junting Chen

专题命中 扩散模型 :diffusion(abstract)

AI总结 PILOT通过整合物理模型,采用波前序列替代传统栅格扫描,提升2D和3D无线电地图构建的精度与效率,实现更低的NMSE和更快的推理速度。

Comments 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23382 2026-04-28 quant-ph math-ph math.MP 50%

Non-unitary extension of Grover's search algorithm

非幺正扩展的Grover搜索算法

V. N. A. Lula-Rocha, M. A. S. Trindade

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出非幺正扩展的Grover算法,通过改变扩散算子所承载的希尔伯特空间隐几何,以更大旋转代替小旋转,在多项式时间内解决搜索问题,复杂度为O(√N),并利用量子奇异值变换和块编码技术达到Grover界限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23324 2026-04-28 cs.LG cs.AI 50%

Layer Embedding Deep Fusion Graph Neural Network

层嵌入深度融合图神经网络

Taihua Xu, Genhao Tian, Jicong Fan, Xibei Yang, Qinghua Zhang, Yun Cui

机构 * Jiangsu University of Science and Technology(江苏科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Chongqing University of Post and Telecommunications(重庆邮电大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出LEDF-GNN,通过层嵌入深度融合操作和双拓扑并行策略,解决图神经网络在低同质性场景下的过平滑问题,实验表明其在多种图类型中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23191 2026-04-28 physics.chem-ph 50%

Effects of Porous Media Properties and Flow Environment on Drug Release from Porous Implants

多孔介质性质和流体环境对多孔植入物药物释放的影响

Pawan Kumar Pandey, KVS Chaithanya, Prateek K. Jha

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过数值模拟探讨了多孔植入物药物释放过程受流体流动和多孔介质特性的影响,揭示了流体条件和多孔介质参数对药物释放曲线及通道内药物可用性的作用,提出了一种基于时间依赖速率常数的近似一级过程模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23112 2026-04-28 cs.LG 50%

Conditional Imputation for Within-Modality Missingness in Multi-Modal Federated Learning

多模态联邦学习中模态内缺失的条件补全

Wugeng Zheng, Ziwen Kan, Katie Wang, Chen Chen, Song Wang

机构 * University of Central Florida(佛罗里达大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出CondI框架,通过条件扩散模型解决多模态联邦学习中的模态内缺失问题,采用两阶段训练流程提升模态特定提取器和联合嵌入空间的性能,实验表明在三个临床数据集上效果与现有方法相当。

Comments Wugeng Zheng and Ziwen Kan contributed equally to this work. Song Wang is the corresponding author. Accepted to FedVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22912 2026-04-28 astro-ph.EP 50%

Substructures Induced by Dust Drag in Protoplanetary Disks

原行星盘中尘埃拖曳诱导的亚结构

Jiaqing Bi, Mario Flock, Dominik Ostertag, Neele Lüttkemöller, Sebastian Wolf

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过二维模拟探讨了尘埃流体不稳定性(SI)和垂直剪切不稳定性(VSI)对尘埃分布的影响,发现高金属licity和中等粘性条件下尘埃呈现独特的穿梭状亚结构,表明内在气体-尘埃相互作用可生成显著尘埃亚结构。

Comments 12+5 pages, 9+5 figures, accepted to A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18288 2026-04-28 math.NA cs.NA 50%

Dual formulations of geometric curvature flows and their discretizations

几何曲率流的双重形式及其离散化

Guangwei Gao, Buyang Li, Rong Tang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出新的几何曲率流形式,通过引入双重乘子实现线性隐式和能量稳定的方案设计,适用于均曲率流、表面扩散和固态脱湿问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11264 2026-04-28 physics.app-ph physics.comp-ph physics.optics 50%

Nature-Inspired Hyperuniform Nanohole Patterning for Robust Broadband Absorption Enhancement in Perovskite Solar Cells

基于自然的超均匀纳米孔图案化用于在钙钛矿太阳能电池中实现鲁棒宽频带吸收增强

Arpan Sur, Kawshik Nath, Ahmed Zubair

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出一种基于自然的超均匀纳米孔结构,用于增强钙钛矿太阳能电池的宽频带吸收,通过优化光路长度提升光电性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25582 2026-04-28 quant-ph 50%

A unified quantum computing quantum Monte Carlo framework through structured state preparation

通过结构化态制备实现统一的量子计算量子蒙特卡洛框架

Giuseppe Buonaiuto, Antonio Marquez Romero, Brian Coyle, Annie E. Paine, Vicente P. Soloviev, Stefano Scali, Michal Krompiec

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出通过结构化态制备扩展QCQMC,用于求解激发态谱、组合优化和有限温观测,验证了QCQMC在不同领域中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17477 2026-04-28 cs.LG 50%

Variational Grey-Box Dynamics Matching

变分灰盒动力学匹配

Gurjeet Sangra Singh, Frantzeska Lavda, Giangiacomo Mercatali, Alexandros Kalousis

机构 * University of Geneva(日内瓦大学) HES-SO Geneva(日内瓦HES-SO)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种灰盒方法,将不完整物理模型直接整合到生成模型中,通过变分分布学习动态,无需真实物理参数,在无模拟环境下实现可解释性与性能的平衡。

Comments AISTATS 2026. Code is available at https://github.com/DMML-Geneva/VGB-DM

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09752 2026-04-28 math.AP 50%

Existence of steady Navier-Stokes flows exterior to an infinite cylinder

无限圆柱体外稳态纳维-斯托克斯流的存在性

Mitsuo Higaki, Ryoma Horiuchi

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究无限圆柱体外稳态纳维-斯托克斯系统在外部力作用下的解的存在性,通过构造垂直均匀流类解,证明在特定边界条件和小外力下,弱解渐近于对应的Hamel型流。

Comments 18 pages. Abstract rewritten, introduction expanded, and references added. No changes to the main mathematical results

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.02604 2026-04-28 math.NA cs.NA 50%

Automated solving of constant-coefficients second-order linear PDEs using Fourier analysis

利用傅里叶分析自动求解常系数二阶线性偏微分方程

Emmanuel Roque, José A Vallejo

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文基于傅里叶方法,利用计算机代数系统自动求解常系数二阶线性偏微分方程,涵盖热方程、波动方程和拉普拉斯方程在常见有界域上的斯特鲁姆-刘维尔问题,以及常系数二阶线性抛物型方程,包括对流扩散方程。

Comments Second version. 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2604.22847 2026-04-28 cs.CV 77%

Dream-Cubed: Controllable Generative Modeling in Minecraft by Training on Billions of Cubes

Dream-Cubed:通过训练数十亿个立方体实现Minecraft中的可控生成建模

Tim Merino, Sam Earle, Ryunosuke Iwai, Julian Togelius, Edoardo Cetin

机构 * New York University(纽约大学) Sakana AI

专题命中 可控生成 :inpainting(abstract,abstract_cn);diffusion(abstract);分类 cs.CV

AI总结 本文提出Dream-Cubed数据集及基于立方体的生成模型,用于高效生成交互式3D环境,通过分析扩散模型的不同形式和架构,评估生成质量并释放预训练模型以推动未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24459 2026-04-28 cs.CV 70%

TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering

TextGround4M:一种对齐提示的布局感知文本渲染数据集

Dongxing Mao, Yilin Wang, Linjie Li, Zhengyuan Yang, Alex Jinpeng Wang

机构 * Central South University(中南大学) Zhejiang University(浙江大学) Microsoft Research(微软研究院)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出TextGround4M数据集,通过细粒度布局监督提升文本生成的准确性,引入轻量训练策略和布局评估指标,验证了布局感知在文本到图像生成中的重要性。

Comments aaai poster; Project page: https://dongxingmao.github.io/TextGround4M.github.io/

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, vol. 40, no. 10, pp. 7918-7926, Mar. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23540 2026-04-28 cs.CV 70%

Oracle Noise: Faster Semantic Spherical Alignment for Interpretable Latent Optimization

Oracle Noise: 更快的语义球面对齐用于可解释的潜在优化

Haosen Li, Wenshuo Chen, Lei Wang, Shaofeng Liang, Haozhe Jia, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Griffith University & Data61/CSIRO(格里菲斯大学及Data61/CSIRO)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Oracle Noise框架,通过将噪声初始化重新定义为语义驱动的优化,严格限制在黎曼流形上,以提升文本到图像扩散模型的语义对齐效率和图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19019 2026-04-28 cs.CV 57%

TokenTrace: Multi-Concept Attribution through Watermarked Token Recovery

TokenTrace: 通过水印标记令牌恢复实现多概念归因

Li Zhang, Shruti Agarwal, John Collomosse, Pengtao Xie, Vishal Asnani

机构 * Adobe Research(Adobe研究院) University of California, San Diego(加州大学圣地亚哥分校) DECaDE, University of Surrey(Surrey大学DECaDE实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TokenTrace框架,通过在语义域中嵌入秘密签名,实现对生成图像中多个概念的鲁棒归因,实验表明其在单概念和多概念归因任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24108 2026-04-28 math.OC math.AP 50%

Optimal control for a fourth-order nonisothermal tumor growth model of Caginalp type

四阶非等温Caginalp型肿瘤生长模型的最优控制

Cavalleri Giulia, Pierluigi Colli, Elisabetta Rocca

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了一种非等温Caginalp型相场模型的分布式最优控制问题,考虑了热疗下肿瘤生长的数学建模,结合Cahn-Hilliard方程、热平衡方程和营养浓度反应扩散方程,分析了最优控制的存在性及变分不等式条件。

Comments 35 pages. The keywords are: tumor growth model, Cahn--Hilliard system, nonisothermal model, optimal control, adjoint system, necessary optimality conditions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23370 2026-04-28 math.OC cs.AI cs.LG cs.SY eess.SY stat.ML 50%

Nonlinear Non-Gaussian Density Steering with Input and Noise Channel Mismatch: Sinkhorn with Memory for Solving the Control-affine Schrödinger Bridge Problem

非线性非高斯密度操控与输入和噪声通道不匹配:具有记忆的Sinkhorn方法用于求解控制-仿射Schrödinger桥问题

Georgiy A. Bondar, Asmaa Eldesoukey, Yongxin Chen, Abhishek Halder

机构 * Department of Applied Mathematics, University of California Santa Cruz(加州大学圣克鲁兹分校应用数学系) Department of Aerospace Engineering, Iowa State University(爱荷华州立大学航空航天工程系) School of Aerospace Engineering, Georgia Institute of Technology(佐治亚理工学院航空航天工程学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种具有记忆的Sinkhorn递归方法,用于解决控制-仿射Schrödinger桥问题中的输入和噪声通道不匹配问题,通过非线性PDEs结构证明了算法的局部稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 3 篇

2509.16702 2026-04-28 cs.CV 70%

Animalbooth: multimodal feature enhancement for animal subject personalization

Animalbooth:多模态特征增强用于动物主体个性化

Chen Liu, Haitao Wu, Kafeng Wang, Weiran Huang

机构 * College of Intelligence and Computing(智能与计算学院) Department of Computer Science and Technology(计算机科学与技术系) School of Computer Science(计算机科学学院)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对动物图像生成中丰富的外观线索和形态多样性带来的挑战,AnimalBooth通过Animal Net和自适应注意力模块增强身份保持,结合频域控制特征整合模块提升扩散过程的全局结构到细节纹理的逐步生成,同时构建AnimalBench数据集验证了其在多个基准上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23584 2026-04-28 cs.CV cs.IR 57%

Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented Generation

多模态检索增强生成中视觉证据的身份解耦匿名化

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * Department of Computer Science University of Oxford, UK

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出身份解耦MRAG框架,通过在检索与生成之间插入生成匿名化模块,解耦人脸身份与属性,利用生成对抗网络和拒绝采样器实现隐私保护。

Comments ACM International Conference on Multimedia Retrieval 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02316 2026-04-28 cs.CV cs.AI 57%

ConsDreamer: Advancing Multi-View Consistency for Zero-Shot Text-to-3D Generation

ConsDreamer:推进多视图一致性以实现零样本文本到3D生成

Yuan Zhou, Shilong Jin, Litao Hua, Wanjun Lv, Haoran Duan, Jungong Han

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系) Lenovo(联想)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 ConsDreamer通过消除视图偏差和几何一致性约束,解决多面Janus问题,提升零样本文本到3D生成的多视图一致性。

Comments Accepted by IEEE Transactions on Image Processing, Code is available at: https://github.com/GAInuist/ConsDreamer

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 1 篇

2509.26158 2026-04-28 cs.CV cs.AI 57%

Towards Continual Expansion of Data Coverage: Automatic Text-guided Edge-case Synthesis

迈向数据覆盖的持续扩展:自动文本引导的边缘案例合成

Kyeongryeol Go

机构 * Superb AI Seoul, South Korea(首尔超凡AI研究所,韩国)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出自动文本引导的边缘案例合成方法,通过预训练语言模型生成多样化提示,提升模型鲁棒性,优于传统增强方法。

Comments Accepted in CVPR 2026 Workshop on How Do Vision Models Work

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 6 篇

2603.06165 2026-04-28 cs.CV cs.AI 77%

Reflective Flow Sampling Enhancement

反射流采样增强

Zikai Zhou, Muyao Wang, Shitong Shao, Lichen Bai, Haoyi Xiong, Bo Han, Zeke Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Tokyo(东京大学) Microsoft(微软) Hong Kong Baptist University(香港 Baptist大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Reflective Flow Sampling,一种针对流模型的无训练增强框架,提升文本图像生成质量与提示对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22177 2026-04-28 cs.LG cs.CV 77%

Designing Instance-Level Sampling Schedules via REINFORCE with James-Stein Shrinkage

通过REINFORCE与James-Stein收缩设计实例级采样计划

Peiyu Yu, Suraj Kothawade, Sirui Xie, Ying Nian Wu, Hongliang Fei

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) UCLA(加州大学洛杉矶分校)

专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过REINFORCE学习实例级采样计划,结合James-Stein收缩估计器提升高维策略学习的梯度估计精度,实现文本图像对齐和生成质量提升。

Comments CVPR 2026; 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08425 2026-04-28 cs.LG cs.SY eess.SY 67%

HardFlow: Hard-Constrained Sampling for Flow-Matching Models via Trajectory Optimization

HardFlow: 通过轨迹优化实现流匹配模型的硬约束采样

Zeyang Li, Kaveh Alim, Navid Azizan

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与蒸馏 :diffusion(abstract);image editing(abstract)

AI总结 本文提出HardFlow框架,通过轨迹优化解决流匹配模型中硬约束采样问题,利用数值最优控制确保终端时间满足约束,并在统一框架下提升样本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23632 2026-04-28 cs.CV cs.MM cs.SD 62%

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

Hallo-Live: 实时流式联合音频-视频虚拟形象生成与异步双流及以人类为中心的偏好蒸馏

Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Baidu(百度)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Hallo-Live框架,通过异步双流扩散与人类中心偏好蒸馏实现高保真实时音频视频虚拟形象生成,达到高吞吐量与低延迟,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24586 2026-04-28 cs.CV 57%

Point-MF: One-step Point Cloud Generation from a Single Image via Mean Flows

点-流:通过均流实现单图像点云生成

Yuta Baba, Keiji Yanai

机构 * The University of Electro-Communications(电子通信大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Point-MF框架,通过均流与辅助损失实现单图像点云重建,以单次网络调用完成高精度重建,提升效率与质量。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24447 2026-04-28 cs.RO cs.AI 50%

Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

跨XPUs的视觉-语言-动作模型特性分析:约束与加速以实现机器人部署

Kaijun Zhou, Qiwei Chen, Da Peng, Zhiyang Li, Xijun Li, Jinyu Gu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文研究了视觉-语言-动作模型在机器人上的部署问题,通过模型与硬件的协同分析,揭示了边缘加速器在成本、能耗和时间上的优化潜力,并提出DP-Cache和V-AEFusion方法提升性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏