arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-25 至 2026-05-25 共收录 79 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 65 篇

2603.29294 2026-05-25 physics.ins-det nucl-ex 50%

Assessment of the Imaging Performance of the CITIUS High-Resolution Detector for Heavy Charged Particles and Neutrons

CITIUS高分辨率探测器对重带电粒子和中子的成像性能评估

Yoshio Kamiya, Haruki Nishino, Takaki Hatsui

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过实验和模拟,评估了CITIUS高速X射线探测器对α粒子和冷中子的成像性能,发现其增益选择架构和长载流子漂移距离带来的电荷共享显著提高了空间分辨率。

Comments 7 pages, 7 figures

Journal ref Nucl. Instrum. Methods A1090, 171677 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20902 2026-05-25 physics.app-ph 50%

LED-based multibeam photoacoustics combined with electrical circuit-based modeling for the analysis of multispecies mass transport through thin membranes

基于LED的多光束光声结合电路建模分析薄膜中的多物种质量传输

Pawel Rochowski

专题命中 扩散模型 :diffusion(abstract)

AI总结 开发了基于光声的实验方法,结合电路模型,用于表征薄膜系统中多物种质量传输的动力学和界面平衡。

Comments 28 pages, 6 figures, 1 table. Original research article

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13601 2026-05-25 physics.flu-dyn 50%

Resolving Cryogenic and Hypersonic Rarefied Flows via Deep Learning-Accelerated Lennard-Jones DSMC

通过深度学习加速的Lennard-Jones DSMC解决低温与高超声速稀薄流动问题

Ahmad Shoja Sani, Ehsan Roohi, Stefan Stefanov

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过发展基于Lennard-Jones势的DSMC框架,结合广义碰撞选择模型和深度算子网络加速散射角计算,解决了低温与高超声速稀薄流动中的物理精度与计算效率问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17792 2026-05-25 cond-mat.mtrl-sci 50%

Bayesian Methods for the Investigation of Temperature-Dependence in Conductivity

电导率温度依赖性的贝叶斯研究方法

Andrew R. McCluskey, Samuel W. Coles, Benjamin J. Morgan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文介绍贝叶斯方法在分析温度依赖输运数据(如扩散系数和离子电导率)中的应用,涵盖参数估计、模型选择和外推不确定性传播,并通过超离子材料的分子动力学模拟示例进行说明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06235 2026-05-25 physics.optics cond-mat.dis-nn nlin.CD 50%

Wave-packet spreading in the disordered and nonlinear Su-Schrieffer-Heeger chain

无序和非线性Su-Schrieffer-Heeger链中的波包扩散

Bertin Many Manda, Vassos Achilleos, Olivier Richoux, Charalampos Skokos, Georgios Theocharis

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过数值研究无序和非线性Su-Schrieffer-Heeger模型中单点波包激发的长时间动力学,发现线性区拓扑相变前存在反常扩散,而非线性下模间相互作用导致该特征消失,且渐近扩散特性在整个参数空间一致。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22951 2026-05-25 cond-mat.soft 50%

Amorphous Radial Frustration and Water-Like Anomalies in a Ramp-Shoulder Fluid

斜坡肩部流体中的非晶径向挫败与水样反常

Murilo S. Marques, Lucas Axel R. Santana, Gabriel San R. R. Câmara, José Rafael Bordin

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过分子动力学模拟研究聚合物接枝纳米颗粒有效相互作用导出的三维粗粒化斜坡肩部流体,发现其热力学、结构和动力学反常,并揭示非晶径向挫败机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22943 2026-05-25 cond-mat.mtrl-sci 50%

A new method to probe conducting filaments in MoS$_2$-based memristors

一种探测MoS$_2$基忆阻器中导电细丝的新方法

Pierre Trousset, Lucie Le Van-Jodin, Bruno Reig, Clotilde Ligaud, Thomas Jalabert, Hanako Okuno, Le Van-Hoan, Paul Brunet, Stéphane Cadot, Matthieu Jamet

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一种利用机械剥离技术去除顶电极的方法,结合KPFM、拉曼光谱和截面TEM表征,揭示了MoS$_2$基忆阻器中导电细丝由金属原子迁移形成,并发现电极材料(金与镍)因吸附和扩散能差异显著影响开关行为。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22927 2026-05-25 astro-ph.SR 50%

The first 3D MHD core-collapse progenitors I: General properties, convection and nuclear burning

首个3D MHD核塌缩前身星 I:一般性质、对流与核燃烧

Adam Griffiths, Miguel-Ángel Aloy, Martin Obergaulinger

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过3D磁流体动力学模拟,研究了快速旋转磁化前身星中湍流和核燃烧的行为,发现扩展氧燃烧壳层中湍流速度约为混合长理论预测的两倍,而薄硅燃烧壳层混合显著偏离一维模型,并提出了考虑多维效应的修正方案。

Comments 12 pages, 4 pages of appendices,14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 2 篇

2503.06684 2026-05-25 cs.CV 89%

PixelPonder: Dynamic Patch Adaptation for Enhanced Multi-Conditional Text-to-Image Generation

PixelPonder: 动态补丁自适应增强多条件文本到图像生成

Yanjie Pan, Qingdong He, Zhengkai Jiang, Pengcheng Xu, Chaoyi Wang, Jinlong Peng, Haoxuan Wang, Yun Cao, Zhenye Gan, Mingmin Chi, Bo Peng, Yabiao Wang

机构 * Fudan University(复旦大学) Tencent Youtu Lab(腾讯优图实验室) Western University(西澳大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出PixelPonder统一控制框架,通过补丁级自适应条件选择和时间感知控制注入机制,解决多条件文本到图像生成中结构失真和伪影问题,在保持文本语义一致性的同时提升空间对齐精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23178 2026-05-25 cs.CV 85%

Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes

将人物组合在一起:面向多人交互场景的迭代姿态-图像生成

Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一种双姿态-图像表示方法,将人物结构先验引入预训练扩散Transformer,通过跨模态对齐和迭代场景构建,提升多人交互图像生成的提示对齐度和场景多样性。

Comments Accepted to SIGGRAPH Conference Papers 2026. 22 pages, 12 figures. Project page: https://cornell-vailab.github.io/PeopleComposer/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2604.10077 2026-05-25 cs.CV 70%

DocRevive: A Unified Pipeline for Document Text Restoration

DocRevive:文档文本恢复的统一流水线

Kunal Purkayastha, Ayan Banerjee, Josep Llados, Umapada Pal

机构 * Computer Vision Center(计算机视觉中心) Indian Statistical Institute(印度统计研究所)

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出DocRevive统一流水线,结合OCR、图像分析、掩码语言建模和扩散模型,用于恢复受损文档文本并保持视觉完整性,同时提出UCSM评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2605.22996 2026-05-25 cs.CV 57%

CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration

CoMoGen: 基于掩码引导的视频生成的可控运动动力学与交互

Adil Meric, Lin Geng Foo, Mert Kiray, Benjamin Busam, Rishabh Dabral, Christian Theobalt

机构 * Technical University of Munich(慕尼黑技术大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Obsphera

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出CoMoGen框架,通过轻量级MaskAdapter将二进制掩码序列编码为潜在残差信号注入MMDiT模型,并利用LoRA微调运动层,实现从单张图像和掩码序列生成逼真的交互运动,在运动保真度和感知真实性上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 1 篇

2603.28767 2026-05-25 cs.CV 79%

Gen-Searcher: Reinforcing Agentic Search for Image Generation

Gen-Searcher: 强化搜索代理用于图像生成

Kaituo Feng, Manyuan Zhang, Shuang Chen, Yunlong Lin, Kaixuan Fan, Yilei Jiang, Hongyu Li, Dian Zheng, Chenyang Wang, Xiangyu Yue

机构 * MMLab, CUHK(CUHK的MMLab) UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) Meituan Home(美团家庭)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 提出Gen-Searcher,首个通过多跳推理和搜索收集文本知识与参考图像的搜索增强图像生成代理,结合SFT和强化学习训练,显著提升生成质量。

Comments Project page: https://gen-searcher.vercel.app Code: https://github.com/tulerfeng/Gen-Searcher

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 5 篇

2605.23451 2026-05-25 cs.CV 79%

Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention

高效的一步扩散修复模型:紧凑令牌压缩与线性注意力

Bingtian Qiao, Yue Shi, Yingjie Zhou, Yong Guo, Guangtao Zhai, Jiezhang Cao

机构 * Shanghai Jiao Tong University(上海交通大学) Fuzhou University(福州市大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 效率与蒸馏 :diffusion(title);image synthesis(abstract);分类 cs.CV

AI总结 针对真实图像超分辨率中计算和内存成本随分辨率增长的问题,提出SANA-SR框架,通过32倍压缩自编码器和线性注意力DiT实现高效一步修复,在保持高质量的同时显著降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21605 2026-05-25 cs.CV 79%

GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation

GenEvolve: 通过工具编排的视觉经验蒸馏实现自我进化的图像生成智能体

Sixiang Chen, Zhaohu Xing, Tian Ye, Xinyu Geng, Yunlong Lin, Jianyu Lai, Xuanhua He, Fuxiang Zhai, Jialin Gao, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Meituan(美团) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 提出GenEvolve框架,通过工具编排的视觉经验蒸馏,使图像生成智能体在多样化任务中自我进化,提升工具使用和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23522 2026-05-25 cs.LG cs.AI cs.CV 57%

Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models

Precise: 用于流匹配模型强化学习后训练的SDE一致随机采样

Jade Zou, Tao Huang, Weijie Kong, Junzhe Li, Yue Wu, Qi Tian, Jiangfeng Xiong, Jianwei Zhang, Liefeng Bo, Zhao Zhong

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯文言)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对流匹配模型强化学习后训练中的随机采样问题,提出Precise采样器,通过平衡探索与稳定性的SDE调度和冻结干净潜变量后验均值的近似方法,实现SDE一致性,显著提升奖励优化速度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23445 2026-05-25 cs.CV 57%

DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation

DFSAttn:面向高效视频生成的动态细粒度稀疏注意力

Jie Hu, Zixiang Gao, Yutong He, Kun Yuan

机构 * Peking University(北京大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散变换器中注意力二次复杂度导致计算成本高的问题,提出一种无需训练的稀疏注意力框架DFSAttn,通过希尔伯特曲线重排序、分层块评分和稀疏掩码缓存实现动态细粒度稀疏化,在保持生成质量的同时实现高达2.1倍端到端加速。

Comments ICML 2026; 17 pages, 8 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22990 2026-05-25 physics.chem-ph 50%

Drift-React: One-step Generation of Reaction Pathways via SE(3) Drifting Fields

Drift-React: 通过 SE(3) 漂移场一步生成反应路径

Rémi Schlama, Philippe Schwaller

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出 SE(3) 等变生成框架 Drift-React,通过 Sinkhorn 加权漂移场从反应物和产物几何结构一步预测完整反应路径,无需迭代力评估或 ODE/SDE 积分,在 Transition1x 和 Halo8 数据集上生成物理一致的 MEP,并实现亚埃级 TS 预测精度与数量级加速。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他图像生成 1 篇

2605.22902 2026-05-25 cs.LG cs.AI cs.CL 50%

Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models

Transcoders 追踪视觉语言模型中的视觉基础与幻觉

Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos, Vassilis Katsouros, Georgios Paraskevopoulos

机构 * Institute of Language and Speech Processing(语言与语音处理研究所) Athena Research Center(雅典研究中心)

专题命中 其他图像生成 :generative vision(abstract)

AI总结 采用基于Transcoders的功能中心框架分解视觉语言模型的计算路径,揭示视觉输入如何影响文本生成,并通过反事实分析和图结构特征预测幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏