arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-27 至 2026-03-27 共收录 92 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 62 篇

2602.24242 2026-03-27 cond-mat.stat-mech cond-mat.quant-gas cond-mat.str-el nlin.SI 50%

Anomalous hydrodynamic fluctuations in the quantum XXZ spin chain

量子XXZ自旋链中的异常水动力波动

Takato Yoshimura, Žiga Krajnik, Alvise Bastianello, Enej Ilievski

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究量子XXZ自旋链在易轴各向异性区域中非高斯自旋电流波动的机制,通过球形宏观波动理论推导出热平衡下的自旋电流波动精确概率分布,并与数值模拟对比,揭示其水动力起源。

Comments v1:9+2 pages, 3 figures. v2: typos corrected and references added

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04026 2026-03-27 cond-mat.soft cond-mat.stat-mech 50%

Transport properties in a model of confined granular mixtures at moderate densities

受限颗粒混合物在中等密度下的输运性质

David González Méndez, Vicente Garzó

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文推导了受限、准二维、s组分非弹性光滑硬球混合物的纳维-斯托克斯流体动力学方程,通过非弹性修正恩斯柯格理论获得质量、动量和能量的宏观平衡方程,并通过一级查普曼-恩斯柯格展开确定通量的本构方程,分析了温度梯度和重力驱动的分异现象。

Comments 32 pages; 13 figures; the first version has been updated with two new figures. To be published in Phys. Fluids

Journal ref Phys. Fluids 38, 033343 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11428 2026-03-27 quant-ph cond-mat.other 50%

Photon correlation Fourier spectroscopy of a B center in hBN

hBN中B中心的光子相关傅里叶光谱

Aymeric Delteil, Stéphanie Buil, Jean-Pierre Hermier

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究hBN中B中心在非共振激发下的光谱特性,发现其发光线型受均一贡献和谱扩散影响,揭示了其退相干机制。

Journal ref Phys. Rev. B 113, 125308 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08522 2026-03-27 cs.RO 50%

RoboMatch: A Unified Mobile-Manipulation Teleoperation Platform with Auto-Matching Network Architecture for Long-Horizon Tasks

RoboMatch:一种用于长周期任务的统一移动操作远程操作平台,配备自动匹配网络架构

Hanyu Liu, Yunsheng Ma, Jiaxin Huang, Keqiang Ren, Jiayi Wen, Yilin Zheng, Haoru Luan, Baishu Wan, Pan Li, Jiejun Hou, Zhihua Wang, Zhigong Song

机构 * Jiangsu Key Laboratory of Advanced Food Manufacturing Equipment and Technology, School of Mechanical Engineering, Jiangnan University(江苏省食品先进制造装备与技术重点实验室,江南大学机械工程学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出RoboMatch,一种用于移动操作的统一远程操作平台,采用自动匹配网络架构以应对动态环境中的长周期任务。核心是 cockpit 风格的控制界面,提升控制精度和数据采集效率。同时引入PVE-DP和AMN,显著提高精细操作性能和长周期推理性能。

Comments Accepted to the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12786 2026-03-27 math.AP 50%

Right and Wrong Ansätze for Nonlinear Waves in Stochastic PDEs

非线性波在随机PDE中的正确与错误假设

C. H. S. Hamster

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过乘以随机指数寻找随机反应扩散方程显式解的可行性,指出该方法仅在Stratonovich解释下的NLS型方程中有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25060 2026-03-27 astro-ph.HE astro-ph.CO astro-ph.GA 50%

The 'Forgotten' Neutrons: Implications for the Propagation of High-Energy Cosmic Rays in Magnetized Astrophysical and Cosmological Structures

被遗忘的中子:高能宇宙射线在磁化天体物理和宇宙结构中传播的含义

Ellis R. Owen, Kinwah Wu, Yoshiyuki Inoue, Tatsuki Fujiwara, Qin Han, Hayden P. H. Ng

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究探讨高能宇宙射线在磁化结构中传播时,中子介导的传播机制如何影响宇宙射线的限制与逃逸,揭示了中子在宇宙大尺度结构中的重要作用。

Comments 39 pages, 8 figures, accepted for publication in Universe special issue: Studying Astrophysics with High-Energy Cosmic Particles

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24962 2026-03-27 math.NA cs.NA 50%

Nonlinear Model Order Reduction on Quadratic Manifolds via Greedy Algorithms with Dimension-Dependent Regularization

基于二次流形的非线性模型降阶:通过具有维度依赖正则化的贪心算法

Lijie Ji, Sabrina Rashid, Yanlai Chen, Zhu Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种改进的二次流形方法,结合双贪心算法和物理参数贪心算法,平衡降阶模型的精度与稳定性,提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24760 2026-03-27 math.AP 50%

Some remarks on patterns for semilinear Neumann problems

关于半线性Neumann问题中模式的一些注记

Marta Calanchi, Giulio Ciraolo, Francesca Messina

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究半线性椭圆方程的解的结构,证明在非线性满足单调性条件时,所有解均为常数,不依赖于领域凸性,且通过构造例子验证假设的尖锐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24741 2026-03-27 astro-ph.HE astro-ph.GA 50%

The Diffuse Gamma-ray Sky of a Milky Way Analogue: Local Diversity and Global Constraints

类银河系的弥散伽马射线天空:局部多样性与全球约束

Karin Kjellgren, Philipp Girichidis, Maria Werhahn, Ralf S. Klessen, Christoph Pfrommer, Juan Soler, Brian Reville, Jim Hinton, Patrick Hennebelle, Noé Brucy, Simon C. O. Glover

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过Rhea模拟探讨类银河系中伽马射线发射的局部环境与整体约束,揭示气体密度波动对形态的影响及CR传输对光谱和结构的控制。

Comments 17 pages, 19 figures. Submitted to A&A with a positive referee report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05877 2026-03-27 physics.med-ph 50%

Functional dual-slope frequency-domain near-infrared spectroscopy data interpreted with two- and three-layer models

功能双斜率频域近红外光谱数据的双层和三层模型解释

Jodee Frias, Giles Blaney, Angelo Sassaroli, Sergio Fantini

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过双层和三层模型模拟数据,验证其能否准确复现活体双斜率频域近红外光谱数据,以提高近红外光谱分析的准确性。

Comments 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13708 2026-03-27 math.AP 50%

On uniqueness of coefficient identification in the Bloch-Torrey equation for magnetic resonance imaging

关于Bloch-Torrey方程中系数识别唯一性的研究

Barbara Kaltenbacher

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了在磁共振成像中通过Bloch-Torrey方程重建空间变化的自旋密度及自旋-晶格、自旋-自旋弛豫时间及局部磁场不均匀性的唯一性问题,采用k空间采样和扩散特性两种方法进行分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10270 2026-03-27 cs.LG cs.NA cs.SI eess.SP math.NA stat.ML 50%

Multiscale Hodge Scattering Networks for Data Analysis

多尺度霍奇散射网络用于数据分析

Naoki Saito, Stefan C. Schonsheck, Eugene Shvarts

机构 * Department of Mathematics, University of California, Davis(加州大学戴维斯分校数学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出多尺度霍奇散射网络,利用多尺度基字典进行信号分析,具备抗重排性和多尺度池化能力,适用于信号分类、领域分类和分子动力学预测。

Comments 20 Pages, Comments Welcome

Journal ref ACHA.84.2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12351 2026-03-27 hep-ph cs.LG hep-ex 50%

Improving Generative Model-based Unfolding with Schrödinger Bridges

通过施罗德inger桥改进生成模型展开

Sascha Diefenbacher, Guan-Horng Liu, Vinicius Mikuni, Benjamin Nachman, Weili Nie

机构 * Physics Division, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室物理部) Autonomous Control and Decision Systems Laboratory, Georgia Institute of Technology(佐治亚理工学院自主控制与决策系统实验室) National Energy Research Scientific Computing Center, Berkeley Lab(伯克利实验室国家能源研究科学计算中心) Berkeley Institute for Data Science, University of California, Berkeley(伯克利数据科学研究所) Machine Learning Research Group, NVIDIA Research(NVIDIA研究机器学习研究组)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出SBUnfold方法,结合判别与生成模型优势,通过施罗德inger桥和扩散模型实现高维展开,验证其在合成数据集上的优越性能。

Comments 9 pages, 5 figures

Journal ref Phys.Rev.D 109 (2024) 7, 076011

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.10021 2026-03-27 cond-mat.soft 50%

Energetics of Cytoskeletal Gel Contraction

细胞骨架凝胶收缩的能量学

Matteo Ferraresso, Albert Kong, Mehadi Hasan, Gwynn J. Elfring, Daniele Agostinelli, Mattia Bacca

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究细胞骨架凝胶收缩的机械能需求,通过热力学分析确定聚合物链密度和分子马达密度对收缩能量的影响,区分快速和慢速马达激活两种极限情况。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2603.25249 2026-03-27 cs.CV 83%

Semantic-Aware Prefix Learning for Token-Efficient Image Generation

语义感知的前缀学习用于令牌高效图像生成

Qingfeng Li, Haoxian Zhang, Xu He, Songlin Tang, Zhixue Fang, Xiaoqiang Liu, Pengfei Wan Guoqi Li

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SMAP,一种将语义条件注入查询式1D令牌化框架的令牌高效图像生成方法,通过尾令牌丢弃策略增强语义重要性,并引入CARD生成器验证其生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25441 2026-03-27 eess.IV 67%

Language-Free Generative Editing from One Visual Example

无需语言的生成编辑:一个视觉示例

Omar Elezabi, Eduard Zamfir, Zongwei Wu, Radu Timofte

专题命中 可控生成 :diffusion(abstract);image editing(abstract)

AI总结 本文提出无需语言指导的视觉编辑方法VDC,通过直接从视觉示例学习条件信号,实现高精度图像编辑,优于现有无训练和全微调方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25728 2026-03-27 cs.CV cs.AI 57%

PixelSmile: Toward Fine-Grained Facial Expression Editing

PixelSmile:迈向细粒度面部表情编辑

Jiabin Hua, Hengyuan Xu, Aojie Li, Wei Cheng, Gang Yu, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) StepFun(阶跃星辰)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PixelSmile框架,通过全对称联合训练解耦表情语义,结合强度监督与对比学习实现更清晰可辨的表情生成,提升线性表达控制精度与稳定性,验证了其在连续可控细粒度表情编辑中的有效性。

Comments 21 Pages; Project Page: https://ammmob.github.io/PixelSmile/ Code: https://github.com/Ammmob/PixelSmile

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25357 2026-03-27 cs.CV 57%

InstanceAnimator: Multi-Instance Sketch Video Colorization

Yinhan Zhang, Yue Ma, Bingyuan Wang, Kunyu Feng, Yeying Jin, Qifeng Chen, Anyi Rao, Zeyu Wang

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) NUS(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07237 2026-03-27 cs.CV 57%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.02807 2026-03-27 physics.app-ph cond-mat.mtrl-sci 50%

Controllable growth of centimeter-size 2D perovskite heterostructural single crystals for highly narrow dual-band photodetectors

可控制生长厘米级二维钙钛矿异质结构单晶用于高性能窄双波段光电探测器

Jun Wang, Junze Li, Shangui Lan, Chen Fang, Hongzhi Shen, Dehui Li

专题命中 可控生成 :diffusion(abstract)

AI总结 本研究通过新方法合成出厘米级高纯度二维钙钛矿单晶,用于制备高性能窄双波段光电探测器,实现了可控的异质结构厚度和结深,展现出低暗电流和高开关电流比。

Journal ref ACS Nano 2019, 13, 5, 5473-5484

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2512.22854 2026-03-27 cs.CV cs.GR cs.LG 62%

ByteLoom: Weaving Geometry-Consistent Human-Object Interactions through Progressive Curriculum Learning

ByteLoom: 通过渐进课程学习编织几何一致的人-物体交互

Bangya Liu, Xinyu Gong, Zelin Zhao, Ziyang Song, Yulei Lu, Suhui Wu, Jun Zhang, Suman Banerjee, Hao Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ByteDance(字节跳动) Georgia Institute of Technology(佐治亚理工学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出ByteLoom框架,通过简化的人类条件和3D物体输入生成几何一致的人-物体交互视频,解决多视角信息注入和手部网格标注依赖的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 5 篇

2603.25319 2026-03-27 cs.CV 74%

MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data

MACRO:通过结构化长上下文数据推进多参考图像生成

Zhekai Chen, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文提出MACRO数据集和基准,解决多参考图像生成中参考数量增加导致性能下降的问题,通过结构化长上下文数据提升生成质量。

Comments Project Page: https://macro400k.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25732 2026-03-27 cs.CV 70%

BizGenEval: A Systematic Benchmark for Commercial Visual Content Generation

BizGenEval:一个系统化的商业视觉内容生成基准测试

Yan Li, Zezi Zeng, Ziwei Zhou, Xin Gao, Muzhao Tian, Yifan Yang, Mingxi Cheng, Qi Dai, Yuqing Yang, Lili Qiu, Zhendong Wang, Zhengyuan Yang, Xue Yang, Lijuan Wang, Ji Li, Chong Luo

机构 * Microsoft Corporation(微软公司) Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学) Fudan University(复旦大学)

专题命中 图像生成评测 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出BizGenEval基准测试,系统评估商业视觉内容生成模型在文档类型和多约束下的能力,包含20个任务和8000个检查问题,揭示现有模型与专业需求间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13303 2026-03-27 cs.CV 70%

ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement

ShowTable:通过协作反思与精炼解锁创意表格可视化

Zhihang Liu, Xiaoyi Bao, Pandeng Li, Junjie Zhou, Zhaohe Liao, Yefei He, Kaixun Jiang, Chen-Wei Xie, Yun Zheng, Hongtao Xie

机构 * USTC(中国科学技术大学) CASIA(中国科学院自动化研究所) NJU(南京大学) SJTU(上海交通大学) ZJU(浙江大学) FDU(福建师范大学) Tongyi Lab(通义实验室)

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出ShowTable框架,结合大语言模型与扩散模型,通过逐步自我纠正过程实现创意表格可视化,引入TableVisBench基准测试,展示其在多模态推理、生成和纠错方面的优势。

Comments Accepted to CVPR 2026, project page: https://lntzm.github.io/showtable-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25178 2026-03-27 cs.CV cs.CL 57%

Bilingual Text-to-Motion Generation: A New Benchmark and Baselines

双语文本到动作生成:一个新的基准和基线

Wanjiang Weng, Xiaofeng Tan, Xiangbo Shu, Guo-Sen Xie, Pan Zhou, Hongsong Wang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) Nanjing University of Science and Technology(南京理工大学) Singapore Management University(新加坡管理大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出BiHumanML3D双语文本到动作基准及BiMD基线,通过跨语言对齐策略提升多语言动作生成质量,实验显示其在FID和R@3指标上显著优于单语模型和翻译基线。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23265 2026-03-27 cs.CV 57%

SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models

SPR-128K:一种多模态大语言模型空间合理性推理的新基准

Zhiyuan Hu, Zheng Sun, Yi Wei, Long Yu

机构 * Tsinghua University(清华大学) Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出SPR-128K数据集及DPA-GRPO方法,解决图像筛选中多模态大语言模型空间推理能力不足的问题,实验表明小型模型在该任务上优于主流模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 6 篇

2603.25463 2026-03-27 cs.CV 83%

CIAR: Interval-based Collaborative Decoding for Image Generation Acceleration

基于区间的方法:用于图像生成加速的协作解码

Keming Ye, Zhou Zhao, Fan Wu, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出CIAR框架,通过设备端自验证处理图像生成中的大词汇量和空间冗余问题,采用连续概率区间加速处理并保持图像质量,实验显示在速度和云请求减少方面优于现有方法。

Comments 23 pages, 10 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08985 2026-03-27 cs.CV 83%

Verifier Threshold: An Efficient Test-Time Scaling Approach for Image Generation

验证阈值:一种高效的测试时间扩展方法用于图像生成

Vignesh Sundaresha, Akash Haridas, Vikram Appia, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD(超威半导体公司) Stony Brook University(石溪大学)

专题命中 效率与蒸馏 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Verifier-Threshold方法,通过自动重新分配测试时间计算,提升图像生成模型的效率,在GenEval基准上实现2-4倍的计算时间减少。

Comments ICLR 2026 ReALM-Gen and DeLTa

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24806 2026-03-27 cs.RO cs.AI 78%

FODMP: Fast One-Step Diffusion of Movement Primitives Generation for Time-Dependent Robot Actions

FODMP:快速一步扩散运动原形生成用于时间依赖机器人动作

Xirui Shi, Arya Ebrahimi, Yi Hu, Jun Jin

机构 * University of Alberta(阿尔伯塔大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 FODMP通过单步解码器生成时间结构化运动,提升机器人实时控制性能,速度比MPD快10倍,能拦截快速飞来的球。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24793 2026-03-27 cs.CV cs.MM cs.SD 62%

AVControl: Efficient Framework for Training Audio-Visual Controls

AVControl: 用于音频-视觉控制训练的高效框架

Matan Ben-Yosef, Tavi Halperin, Naomi Ken Korem, Mohammad Salama, Harel Cain, Asaf Joseph, Anthony Chen, Urska Jelercic, Ofir Bibi

机构 * Lightricks

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV、cs.MM

AI总结 AVControl通过轻量级框架实现多模态控制,无需架构改动,支持多种独立训练的模态,如深度、姿态、边缘、相机轨迹等,并在多个基准测试中表现优异。

Comments Project page: https://matanby.github.io/AVControl/

详情

展开后加载摘要…

URL PDF HTML 收藏