arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-30 至 2026-03-30 共收录 65 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 43 篇

2505.09364 2026-03-30 cs.IR cs.LG cs.NE 78%

Diffusion Recommender Models and the Illusion of Progress: A Concerning Study of Reproducibility and a Conceptual Mismatch

扩散推荐模型与进步的幻觉:关于可重复性和概念不匹配的令人担忧的研究

Michael Benigni, Maurizio Ferrari Dacrema, Dietmar Jannach

机构 * Politecnico di Milano(米兰理工大学) University of Klagenfurt(克拉根福大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究评估了九篇SIGIR 2023和2024推荐算法的可重复性,发现仅25%的结果可复现,且扩散模型在传统推荐任务中存在概念不匹配,质疑其适用性。

Journal ref ACM Transactions on Recommender Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10242 2026-03-30 math.OC 78%

Reinforcement Learning for optimal dividend problem under diffusion model

基于扩散模型的最优分红问题的强化学习

Lihua Bai, Thejani Gamage, Jin Ma, Gaozhan Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文从强化学习视角研究连续时间扩散模型下的最优分红问题,提出基于熵正则化的探索性控制算法,通过神经网络近似价值函数及其导数,实现非显式确定最优控制的数值方法。

Comments In this version the numerical scheme and the experiments are reconstructed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08130 2026-03-30 math.PR 71%

On the parabolic Adams theorem and its applications to diffusion processes

关于抛物Adams定理及其在扩散过程中的应用

N. V. Krylov

专题命中 扩散模型 :diffusion(title)

AI总结 本文探讨了抛物Adams定理及其在估计抛物型算子相关演算族及Itô方程解的初始数据导数矩中的应用。

Comments 24 pages, cosmetic changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09435 2026-03-30 cs.CV 57%

UniPart: Part-Level 3D Generation with Unified 3D Geom-Seg Latents

UniPart: 部级3D生成与统一3D几何-分割潜在表示

Xufan He, Yushuang Wu, Xiaoyang Guo, Chongjie Ye, Jiaqing Zhou, Tianlei Hu, Xiaoguang Han, Dong Du

机构 * Nanjing University of Science and Technology(南京理工大学) ByteDance Games(字节跳动游戏) Zhejiang University(浙江大学) FNii-Shenzhen(深圳福田国家创新研究院) SSE, CUHKSZ(香港中文大学(深圳)理工学院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来智能网络重点实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出UniPart,一种基于统一3D几何-分割潜在表示的两阶段扩散框架,实现图像引导的部级3D生成,提升分割可控性和几何质量。

Comments Project page: https://xfanhe.github.io/projects/unipart/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01752 2026-03-30 cs.CV physics.med-ph 57%

Clinical Metadata Guided Limited-Angle CT Image Reconstruction

临床元数据引导的限角CT图像重建

Yu Shi, Shuyi Fan, Changsheng Fang, Shuo Han, Haodong Li, Li Zhou, Bahareh Morovati, Dayang Wang, Hengyong Yu

机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于结构化临床元数据的两阶段扩散框架,用于改进限角CT重建,通过整合元数据提升图像质量与效率。

Comments IEEE Transactions on Medical Imaging, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03745 2026-03-30 cs.CV cs.AI cs.LG eess.IV 57%

StreamDiT: Real-Time Streaming Text-to-Video Generation

StreamDiT:实时流式文本到视频生成

Akio Kodaira, Tingbo Hou, Ji Hou, Markos Georgopoulos, Felix Juefei-Xu, Masayoshi Tomizuka, Yue Zhao

机构 * UC Berkeley(加州大学伯克利分校) Meta

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出StreamDiT模型,通过流匹配和混合训练提升内容一致性和视觉质量,实现16FPS实时视频生成,支持流式生成等实时应用。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25765 2026-03-30 cs.CV cond-mat.mtrl-sci 57%

Evaluating Synthetic Images as Effective Substitutes for Experimental Data in Surface Roughness Classification

评估合成图像作为实验数据的有效替代品在表面粗糙度分类中的应用

Binwei Chen, Huachao Leng, Chi Yeung Mang, Tsz Wai Cheung, Yanhua Chen, Wai Keung Anthony Loh, Chi Ho Wong, Chak Yin Tang

机构 * State Key Laboratory of Ultra-precision Machining Technology, Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业及系统工程学系超精密加工技术国家重点实验室) Division of Science, Engineering and Health Studies, The School of Professional Education and Executive Development, The Hong Kong Polytechnic University(香港理工大学专业进修学院科学、工程及健康研究学部) Department of Science and Environmental Studies, The Education University of Hong Kong(香港教育大学科学与环境研究学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文研究了使用合成图像替代实验数据在陶瓷表面粗糙度分类中的有效性,通过生成图像增强真实数据,实现了与实验数据相当的分类准确率,并验证了生成模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26650 2026-03-30 math.AP 50%

The fundamental solution of a nonlinear kinetic Fokker-Planck equation

非线性动能福克-普朗克方程的基本解

Giovanni Brigati, Guillaume Carlier, Jean Dolbeault

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究非线性动能方程的基本解,涉及孔隙介质或快速扩散算子,通过自相似变换将问题转化为非线性动能福克-普朗克方程,揭示了自相似行为和稳定性性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26466 2026-03-30 cs.RO 50%

Adapt as You Say: Online Interactive Bimanual Skill Adaptation via Human Language Feedback

根据指令适应:通过人类语言反馈实现在线交互双臂技能适应

Zhuo Li, Dianxi Li, Tao Teng, Quentin Rouxel, Zhipeng Dong, Dennis Hong, Darwin Caldwell, Fei Chen

机构 * Collaborative and Versatile Robots (CLOVER) Laboratory, T-Stone Robotics Institute, The Chinese University of Hong Kong(香港中文大学T-Stone机器人研究所协作与多功能机器人(CLOVER)实验室) Department of Mechanical and Aerospace Engineering, University of California, Los Angeles(加州大学洛杉矶分校机械与航空航天工程系) Department of Advanced Robotics, Istituto Italiano di Tecnologia(意大利技术研究院先进机器人系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出BiSAIL框架,通过交互语言反馈实现零样本在线适应,提升双臂技能在任务变化中的适应性、泛化能力和跨身体可扩展性。

Comments 11 pages, 15 figures, submitted to IEEE TMECH

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26344 2026-03-30 stat.ML cs.LG cs.SD eess.AS eess.SP 50%

A Power-Weighted Noncentral Complex Gaussian Distribution

具有幂权重的非中心复高斯分布

Toru Nakashika

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种新的复值随机变量概率模型,即幂权重非中心复高斯分布,该模型在复平面直接建模,保留复值观测的几何结构,并通过单个形状参数实现相位扩散的非线性控制,实验表明其在语音功率谱上优于传统分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26291 2026-03-30 math.OC q-fin.CP 50%

Monotone 2D Integration Scheme for Mean-CVaR Optimization via Fourier-Trained Transition Kernels

单调的二维积分方案用于通过傅里叶训练的转移核进行均值-条件价值风险优化

Duy-Minh Dang, Hao Zhou

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种严格单调且收敛的二维积分方法,用于多期均值-条件价值风险优化,通过闭式特征函数指定一步增量法则。当转移密度无法用闭式表达时,利用简单形约束高斯混合参数化在傅里叶空间学习非负归一化二维转移核,并用非负权重的复合求积规则离散化卷积积分以保证单调性。

Comments 28 pages, 3 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26276 2026-03-30 astro-ph.SR physics.plasm-ph physics.space-ph 50%

Energy Transport and Heating by Non-Thermal Electrons in a Turbulent Solar Flare Environment

太阳日冕暴发环境中非热电子的能量传输与加热

A. Gordon Emslie, Eduard P. Kontar

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究非热电子在湍流太阳日冕暴发环境中的能量传输与加热机制,通过分析弹性与非弹性碰撞主导的两种情形,揭示湍流散射对等离子体加热和色球层加热的影响,以及非热电子各向同性降低对欧姆加热的抑制作用。

Comments 12 pages, 4 figures, accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26159 2026-03-30 math.AP 50%

Large time asymptotic behavior for the weakly damped Jordan-Moore-Gibson-Thompson equation

弱阻尼约尔-摩尔-吉布森-托马斯方程的大时间渐进行为

Wenhui Chen, Yan Liu, Manqing Luo

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了带有弱阻尼项的约尔-摩尔-吉布森-托马斯方程的全局解的存在性及大时间行为,探讨了最优衰减估计和渐进行为,区分了亚临界和临界情况下的不同特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26038 2026-03-30 math.AP math.DS 50%

Existence and uniqueness of traveling fronts for a free interface model of autoignition in reactive jets

自激励火焰在反应喷流中的自由界面模型的传播:行进前沿的存在性和唯一性

Mingxin Ma, Peter V. Gordon, Robert Roussarie, Peipei Shang, Claude-Michel Brauner

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了自激励火焰在反应喷流中的传播问题,通过动力系统方法证明了行进前沿的唯一性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06279 2026-03-30 physics.geo-ph physics.flu-dyn 50%

Structural barriers to complete homogenization and wormholing in dissolving porous and fractured rocks

完全均质化和虫洞形成的结构障碍

Tomasz Szawełło, Jeffrey D. Hyman, Peter K. Kang, Piotr Szymczak

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过三种网络模型量化了多孔和裂隙介质中溶解过程的异质性影响,揭示了流体流动路径演变的统一度量标准,强调结构异质性对流体均质化的根本限制。

Comments 40 pages, 9 figures

Journal ref International Journal of Rock Mechanics and Mining Sciences 200 (2026) 106431

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20313 2026-03-30 astro-ph.HE 50%

Mathematical Anatomy of Neutrino Decoherence in Red Turbulence: A Fractional Calculus Approach

中微子去相干的数学解剖:红湍流中的分数微积分方法

Yiwei Bao, Andrea Addazi, Shuai Zha

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过分数微积分方法,建立了中微子去相干在幂律相关湍流中的精确框架,利用Nakajima-Zwanzig投影技术推导出非马尔可夫主方程,并通过 Mittag-Leffler 函数揭示中微子味演化的数学联系。

Comments accepted by ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14549 2026-03-30 cs.CL cs.AI 50%

Dual-objective Language Models: Training Efficiency Without Overfitting

双目标语言模型:无需过拟合的训练效率

David Samuel, Lucas Georges Gabriel Charpentier

机构 * University of Oslo(奥斯陆大学) National Library of Norway(挪威国家图书馆)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文结合自回归和掩码扩散训练目标,提出灵活的语言模型,优于单一目标模型。通过训练50个模型,证明双目标训练在效率与抗过拟合间取得最佳平衡。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15088 2026-03-30 physics.chem-ph 50%

Chromatographic Peak Shape from Stochastic Model: Analytic Time-Domain Expression in Terms of Physical Parameters and Conditions under which Heterogeneity Reduces Tailing

色谱峰形的随机模型:物理参数和条件下的时间域解析表达式,其中异质性减少尾随

Hernán R. Sánchez

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种用于高计算效率的时间域色谱峰形解析表达式,结合了轴向扩散、两种保留机制及异质性对尾随的影响,实验拟合结果优于现有方法。

Journal ref Journal of Chromatography A, 1775 (2026) 466896

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20386 2026-03-30 cond-mat.soft 50%

Re-orientational dynamics of ring polymers in dilute solutions

环状聚合物在稀溶液中的重新定向动力学

Prabeen Kumar Pattnayak, Aloke Kumar, Gaurav Tomar

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了七种拓扑结构不同的聚合物链在无限稀释极限下的扩散动力学,发现拓扑结构显著影响旋转扩散系数,机械键的存在减缓了旋转扩散,揭示了分子拓扑对聚合物反应动力学的作用。

Comments 9 pages, 7 figures

Journal ref Phys. Rev. E 113, 035416 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25888 2026-03-30 math.AP cs.NA math.NA 50%

Some Unexplored Topics in The Reconstruction of Scalar Parameters of Subdiffusion

关于子扩散方程标量参数重构中的一些未探索主题

Sergii V. Siryk, Lidiia Tereshchenko, Nataliya Vasylyeva

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文探讨了带有分数时间微分算子和非局部项的线性扩散方程中标量参数的重构问题,针对小时间区间内非局部观测的数值重构提出新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2506.01949 2026-03-30 cs.CV 83%

IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout

IMAGHarmony:具有一致物体数量和布局的可控图像编辑

Fei Shen, Yutong Gao, Jian Yu, Xiaoyu Du, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 可控生成 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出IMAGHarmony,通过和谐感知模块和偏好引导噪声选择策略,在保持物体数量和布局一致性的前提下实现多物体场景的可控图像编辑,实验表明其在结构一致性和语义准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08277 2026-03-30 cs.CV cs.AI 70%

PISCO: Precise Video Instance Insertion with Sparse Control

PISCO:具有稀疏控制的精确视频实例插入

Xiangbo Gao, Renjie Li, Xinghao Chen, Yuheng Wu, Suofei Feng, Qing Yin, Zhengzhong Tu

机构 * Stanford University(斯坦福大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出PISCO模型,通过稀疏关键帧控制实现精确视频实例插入,解决传统视频编辑中对空间时间定位、物理一致性及动态保持的挑战,采用变量信息引导和分布保持时间遮罩技术提升生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23376 2026-03-30 cs.CV cs.RO 57%

ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment

ABot-PhysWorld:用于机器人操作的交互世界基础模型,具有物理对齐

Yuzhi Chen, Ronghan Chen, Dongjie Huo, Yandan Yang, Dekang Qi, Haoyun Liu, Tong Lin, Shuang Zeng, Junjin Xiao, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ABot-PhysWorld通过物理对齐的交互世界模型,生成物理合理且可控的视频,解决了传统方法在物理仿真中的不足,通过新框架和基准测试提升了性能。

Comments Code: https://github.com/amap-cvlab/ABot-PhysWorld.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25985 2026-03-30 cs.CV 57%

JRM: Joint Reconstruction Model for Multiple Objects without Alignment

JRM:无对齐的多物体联合重建模型

Qirui Wu, Yawar Siddiqui, Duncan Frost, Samir Aroudj, Armen Avetisyan, Richard Newcombe, Angel X. Chang, Jakob Engel, Henry Howard-Jenkins

机构 * Meta Reality Labs Research(Meta现实实验室) Simon Fraser University(西蒙菲莎大学)

专题命中 可控生成 :personalized generation(abstract);分类 cs.CV

AI总结 本文提出JRM模型,通过将物体重建视为个性化生成任务,利用重复信号提升重建质量,无需显式对齐,增强鲁棒性并自然处理非刚性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25892 2026-03-30 cs.CV 57%

THFM: A Unified Video Foundation Model for 4D Human Perception and Beyond

THFM:一种用于4D人体感知及更广泛领域的统一视频基础模型

Letian Wang, Andrei Zanfir, Eduard Gabriel Bazavan, Misha Andriluka, Cristian Sminchisescu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 THFM是一种统一的视频基础模型,能够同时处理密集任务和稀疏任务,其基于预训练的文本到视频扩散模型,并通过可学习的标记增强稀疏预测能力,且在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26003 2026-03-30 math.PR 50%

Pathwise Convergence of a Modular Simulation Scheme for Hybrid SDEs with Memory

具有记忆的混合随机微分方程模拟能量方案的路径收敛性

Oscar Peralta

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种具有记忆的混合随机微分方程(mH-SDEs),扩展了传统混合随机微分方程模型,允许更丰富的依赖关系。开发了模块化-泊松算法,通过路径依赖均匀化生成离散跳跃,并利用现有SDE求解器进行欧几里得演化。理论贡献建立了路径收敛性并给出了显式速率,控制误差累积和过程解耦概率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2511.18090 2026-03-30 cs.CV 77%

Versatile Recompression-Aware Perceptual Image Super-Resolution

多功能的感知图像超分辨率:考虑再压缩

Mingwei He, Tongda Xu, Xingtong Ge, Ming Sun, Chao Zhou, Yan Wang

机构 * AIR, Tsinghua University(清华大学智能产业研究院) AGUS Tech HKUST(香港科技大学) Kuaishou Technology(快手科技)

专题命中 图像修复 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出VRPSR,通过将压缩建模为条件文本到图像生成,利用预训练扩散模型构建通用编码器模拟器,并提出针对感知超分辨率的训练技术,实现SR与再压缩的联合优化,取得10%-40%的比特率节省。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 3 篇

2603.26128 2026-03-30 cs.CV 85%

TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life

TaxaAdapter:视觉分类模型是生命树上细粒度图像生成的关键

Mridul Khurana, Amin Karimi Monsefi, Justin Lee, Medha Sawhney, David Carlyn, Julia Chae, Jianyang Gu, Rajiv Ramnath, Sara Beery, Wei-Lun Chao, Anuj Karpatne, Cheng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) The Ohio State University(俄亥俄州立大学) MIT(麻省理工学院) Boston University(波士顿大学)

专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 本文提出TaxaAdapter,通过整合视觉分类模型提升细粒度物种生成的精度与一致性,实验表明其在形态学和物种识别准确性上优于现有方法,且具备良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03220 2026-03-30 cs.CV 83%

PokeFusion Attention: A Lightweight Cross-Attention Mechanism for Style-Conditioned Image Generation

PokeFusion Attention:一种轻量级的跨注意力机制用于风格条件图像生成

Jingbang Tang

机构 * Independent Researcher, Vancouver, Canada(独立研究员,加拿大温哥华) School of Computing, Universiti Kebangsaan Malaysia (UKM), Malaysia(马来西亚国立大学计算机学院)

专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出PokeFusion Attention,一种轻量级跨注意力机制,用于风格条件图像生成,通过学习风格分布先验而非实例级条件,提升生成效果与一致性。

Comments 12 pages, 5 figures. Revised version with improved method description and corrected references

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09472 2026-03-30 cs.CV 57%

Zero-Shot Personalized Camera Motion Control for Image-to-Video Synthesis

零样本个性化摄像机运动控制用于图像到视频合成

Pooja Guhan, Divya Kothandaraman, Geonsun Lee, Tsung-Wei Huang, Guan-Ming Su, Dinesh Manocha

机构 * University of Maryland College Park(马里兰大学帕克分校) Dolby Laboratories(杜比实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出零样本扩散框架,实现从单参考视频向静态图像转移电影级运动,提升非专家创作者的创意表达与视频制作可及性。

详情

展开后加载摘要…

URL PDF HTML 收藏