arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-04 至 2026-03-04 共收录 73 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 59 篇

2601.09143 2026-03-04 cs.LG cs.NA math.NA physics.comp-ph 50%

Discrete Solution Operator Learning for Geometry-Dependent PDEs

几何依赖偏微分方程的离散解算子学习

Jinshuai Bai, Haolin Li, Zahra Sharif Khodaei, M. H. Aliabadi, YuanTong Gu, Xi-Qiao Feng

机构 * Institute of Biomechanics and Medical Engineering Applied Mechanics Laboratory (AML) Tsinghua University(生物力学与医学工程研究所应用力学实验室(AML)清华大学) Department of Aeronautics Imperial College London(航空航天系帝国理工学院伦敦) School of Mechanical, Medical, and Process Engineering Queensland University of Technology(机械、医学与工艺工程学院昆士兰理工大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 DiSOL通过学习离散求解过程来处理几何依赖的偏微分方程,实现稳定且准确的预测。

Comments 15 pages main text, 42 pages SI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15165 2026-03-04 cs.LG math.OC 50%

Policy Transfer for Continuous-Time Reinforcement Learning: A (Rough) Differential Equation Approach

连续时间强化学习中的策略迁移:一种(粗糙)微分方程方法

Xin Guo, Zijiu Lyu

机构 * UC Berkeley, IEOR(伯克利大学,工业工程与运筹学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于粗糙路径理论的连续时间强化学习策略迁移方法,通过利用高斯结构和黎卡提方程的稳定性,实现了策略迁移的理论证明,并提出了新的策略学习算法,实现了全局和局部收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 3 篇

2506.07177 2026-03-04 cs.CV cs.AI 79%

Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models

帧引导:基于帧级信号的无训练引导用于视频扩散模型的可控生成

Sangwon Jang, Taekyung Ki, Jaehyeong Jo, Jaehong Yoon, Soo Ye Kim, Zhe Lin, Sung Ju Hwang

机构 * KAIST(韩国国立科学技术院) NTU Singapore(南洋理工大学) Adobe Research(Adobe研究)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 帧引导通过帧级信号实现无训练的视频生成控制,支持多种任务如关键帧引导、风格化和循环,无需训练即可生成高质量视频。

Comments ICLR 2026. Project page: https://frame-guidance-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02802 2026-03-04 cs.CV 57%

NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing

NOVA:无配对视频编辑的稀疏控制与密集合成

Tianlin Pan, Jiayi Dai, Chenpu Yuan, Zhengyao Lv, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu, Caifeng Shan, Chenyang Si

机构 * Nanjing University(南京大学) University of Chinese Academy of Sciences(中国科学院大学) WeChat, Tencent(微信、腾讯) The University of Hong Kong(香港大学)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 NOVA提出了一种无配对视频编辑框架,通过稀疏控制与密集合成提升编辑保真度和时间一致性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02911 2026-03-04 cond-mat.mtrl-sci 50%

Dual-wavelength control of charge accumulation in rubrene microcrystals with anisotropic conductivity

双波长控制 rubrene 微晶中电荷积累的各向异性导电性

Moha Naeimi, Ingo Barke, Sylvia Speller

专题命中 可控生成 :diffusion(abstract)

AI总结 通过双波长控制 rubrene 微晶中电荷积累的各向异性导电性,揭示了不同区域的电荷积累特性及可控的电荷景观形成。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 3 篇

2602.18936 2026-03-04 cs.CV 70%

CRAFT-LoRA: Content-Style Personalization via Rank-Constrained Adaptation and Training-Free Fusion

CRAFT-LoRA: 通过秩约束适应与无训练融合实现内容-风格个性化

Yu Li, Yujun Cai, Chi Zhang

机构 * AGI Lab, Westlake University(西莱大学AGI实验室) George Washington University(乔治华盛顿大学) The University of Queensland(昆士兰大学)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 CRAFT-LoRA通过秩约束适应与无训练融合实现内容-风格个性化,提升生成稳定性与语义控制灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02893 2026-03-04 cs.CV 57%

Intrinsic Geometry-Appearance Consistency Optimization for Sparse-View Gaussian Splatting

内在几何-外观一致性优化用于稀疏视角高斯点绘制

Kaiqiang Xiong, Rui Peng, Jiahao Wu, Zhanke Wang, Jie Liang, Xiaoyun Zheng, Feng Gao, Ronggang Wang

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东超高清沉浸媒体技术省重点实验室,深圳大学,北京大学) Peng Cheng Laboratory(鹏城实验室) Migu Culture Technology Co., Ltd(咪咕文化技术有限公司) Alibaba Group(阿里巴巴集团) School of Arts, Peking University(北京大学艺术学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MVD-HuGaS通过多视角扩散模型实现从单张图像生成自由视角3D人体,结合几何-外观一致性优化提升重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26127 2026-03-04 cs.CV 57%

EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model

EchoGen: 通过前馈主体驱动自回归模型在任意场景中生成视觉回声

Ruixiao Dong, Zhendong Wang, Keli Liu, Li Li, Ying Chen, Kai Li, Daowen Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 EchoGen通过前馈主体驱动自回归模型在任意场景中生成高质量视觉回声,实现高效生成与高保真度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2603.02712 2026-03-04 cs.CV cs.MM eess.IV 81%

From "What" to "How": Constrained Reasoning for Autoregressive Image Generation

从‘是什么’到‘如何做’:用于自回归图像生成的约束推理

Ruxue Yan, Xubo Liu, Wenya Guo, Zhengkun Zhang, Ying Zhang, Xiaojie Yuan

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Baidu Inc.(百度公司)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出CoR-Painter框架,通过约束推理引导自回归图像生成,解决空间结构模糊问题,提升生成图像的准确性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23348 2026-03-04 cs.LG 78%

Entering the Era of Discrete Diffusion Models: A Benchmark for Schrödinger Bridges and Entropic Optimal Transport

进入离散扩散模型的时代:Schrödinger桥和熵最优传输的基准

Xavier Aramayo Carrasco, Grigoriy Ksenofontov, Aleksei Leonov, Iaroslav Sergeevich Koshelev, Alexander Korotin

机构 * Applied AI Institute(应用人工智能研究所) AI Foundation and Algorithm Lab(人工智能基金会与算法实验室)

专题命中 图像生成评测 :diffusion(title,abstract)

AI总结 本文提出了一种针对离散空间的Schrödinger桥基准,通过构造具有已知解的概率分布对,实现了对SB方法在高维离散设置中性能的严格评估,并引入了新的SB算法DLightSB和DLightSB-M以及α-CSBM算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02619 2026-03-04 cs.CV 57%

Direct Reward Fine-Tuning on Poses for Single Image to 3D Human in the Wild

基于姿态的直接奖励微调用于单图像到野外3D人体

Seunguk Do, Minwoo Huh, Joonghyuk Shin, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 DrPose通过直接奖励微调提升单图像到3D人体重建的姿态一致性,利用姿态与图像配对数据训练,改进多视图扩散模型,提升动态和复杂姿态的重建质量。

Comments ICLR 2026, Project webpage: https://seunguk-do.github.io/drpose

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 2 篇

2503.16397 2026-03-04 cs.CV 83%

Scale-wise Distillation of Diffusion Models

扩散模型的分层蒸馏

Nikita Starodubcev, Ilya Drobyshevskiy, Denis Kuznedelev, Artem Babenko, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院) HSE University(俄罗斯高等经济大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 SwD通过分层蒸馏框架提升扩散模型效率,引入MMD补丁级目标改进收敛性,实现更快采样和更高性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01515 2026-03-04 cs.CV 57%

FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation

FACE:一种基于面部的自回归表示,用于高保真和高效的网格生成

Hanxiao Wang, Yuan-Chen Guo, Ying-Tian Liu, Zi-Xin Zou, Biao Zhang, Weize Quan, Ding Liang, Yan-Pei Cao, Dong-Ming Yan

机构 * CASIA UCAS VAST KAUST

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FACE提出了一种基于面的自回归表示方法,通过在面级别生成网格,显著提高3D网格生成的效率和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏