arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-15 至 2026-05-15 共收录 91 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 66 篇

2510.16196 2026-05-15 cs.CV cs.AI 57%

Seeing Through the Brain: New Insights from Decoding Visual Stimuli with fMRI

穿透大脑:通过fMRI解码视觉刺激的新见解

Zheng Huang, Enpei Zhang, Weikang Qiu, Yinghao Cai, Carl Yang, Elynn Chen, Xiang Zhang, Rex Ying, Dawei Zhou, Yujun Yan

机构 * Dartmouth College(达特茅斯学院) Yale University(耶鲁大学) Emory University(埃默里大学) New York University(纽约大学) UNC Charlotte(北卡罗来纳大学柴郡分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究通过fMRI信号重建视觉刺激,发现文本空间比视觉或联合文本图像空间更接近神经活动结构,并提出PRISM模型利用结构化文本空间提升重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15033 2026-05-15 cs.SI cs.CC 50%

On the Limits of PAC Learning of Networks from Opinion Dynamics

关于从意见动态中学习网络的极限

Dmitry Chistikov, Luisa Estrada, Mike Paterson, Paolo Turrini

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究探讨了在意见动态下学习网络结构的限制,提出在阈值规则下存在高效的PAC学习算法,而在多数规则下证明不存在高效算法,并提出有效的启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14614 2026-05-15 physics.optics 50%

Collective-Coordinate Fluctuations of Driven-Dissipative Solitons

受驱动耗散孤子的集体坐标波动

Yifan Sun, Thomas Bunel, Sofya Glazyrina, Georges Semaan, Fabien Bretenaker, Stephane Coen, Simon-Pierre Gorza, François Leo

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示了受驱动耗散孤子中非平衡局部化波的波动机制,通过集体坐标理论解析了确定性转换与随机注入对谱特性的影响,提出了一种新的理论框架以连接内部波动转移机制与可测量噪声观测。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14546 2026-05-15 cs.LG 50%

Discovering Physical Directions in Weight Space: Composing Neural PDE Experts

在权重空间中发现物理方向:组合神经PDE专家

Pengkai Wang, Pengwei Liu, Yuanyi Wang, Guanyu Chen, Xingyu Ren, Xiaolong Li, Zhongkai Hao, Yuting Kong, Qixin Zhang, Dong Ni

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了神经PDE专家在连续物理家族中多模式微调后的权重空间更新性质,提出CCM方法通过物理方向整合专家模型,提升跨物理域的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14465 2026-05-15 cs.AI 50%

From Table to Cell: Attention for Better Reasoning with TABALIGN

从表格到单元格:用于基于TABALIGN的更好推理的注意力

Tung Sum Thomas Kwok, Zeyong Zhang, Xinyu Wang, Chunhe Wang, Xiaofeng Lin, Hanwei Wu, Lei Ding, Guang Cheng, Zhijiang Guo

机构 * University of California, Los Angeles(加州大学洛杉矶分校) New Jersey Institute of Technology(新泽西理工学院) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) University of Manitoba(曼尼托巴大学) SimpleWay The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出TABALIGN框架,通过引入DLM Planner和TABATTN验证器,提升表格推理的准确性和效率,实验显示在多个基准测试中准确率提升15.76个百分点,推理速度加快44.64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14397 2026-05-15 physics.geo-ph cs.NA math.NA physics.comp-ph physics.flu-dyn 50%

Three dimensional simulation of fluid-driven frictional and tensile ruptures on existing discontinuities

三维模拟流体驱动的摩擦性和张性破裂在现有断层上

Brice Lecampion, Sylvain Brisson, Antareep Sarma, Ankit Gupta, Alexis Sáez, Regina Fakhretdinova

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一个隐式、全耦合的流体-机械求解器,用于模拟流体驱动的破裂传播,同时处理摩擦滑动和张性开裂,结合边界元法和有限元法,通过弹性预测-塑性校正方案实现非线性孔隙流体扩散,并验证了求解器在多种复杂情况下的准确性和收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14214 2026-05-15 cond-mat.mes-hall 50%

Spin Hall effect in electronic Lévy glasses: Enhanced spin current generation in the superdiffusive regime

电子莱维玻璃中的自旋霍尔效应:在超扩散区域中增强自旋电流生成

Diego B. Fonseca, Luiz Felipe C. Pereira, Anderson L. R. Barbosa

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究电子莱维玻璃中自旋霍尔效应,发现超扩散区域可将低电荷电流转化为大自旋霍尔电流,而扩散区域则生成较小的自旋霍尔电流,且超扩散区域自旋霍尔角可达30%。

Comments 9 pages, 5 figures, 68 references. This work is a follow-up to arXiv:2302.02197 and arXiv:2405.10066

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06875 2026-05-15 cs.LG q-fin.CP 50%

Stochastic Attention via Langevin Dynamics on the Modern Hopfield Energy

通过现代Hopfield能量的兰格vin动力学实现随机注意力

Abdulrahman Alswaidan, Jeffrey D. Varner

机构 * R.F. Smith School of Chemical and Biomolecular Engineering(R.F. Smith 化学与生物分子工程学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于现代Hopfield能量的随机注意力机制,通过兰格vin动力学实现无训练的注意力采样,能够在不同温度下实现精确检索与开放生成,适用于低数据场景。

Comments Main body (including references excluding the appendix): 11 pages, 2 figures and 1 table. Total paper: 26 pages, 13 figures and 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00772 2026-05-15 stat.ML cs.LG 50%

Generalizing Score-based generative models for Heavy-tailed Distributions

将基于得分的生成模型推广到厚尾分布

Tiziano Fassina, Gabriel Cardoso, Sylvan Le Corff, Thomas Romary

机构 * STIM, Mines Paris(STIM, Mines巴黎) LPSM, Sorbonne Université(LPSM,索邦大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种统一的生成框架,通过正常化流捕捉厚尾行为并作为SGM的初始化先验,从而在理论上克服了现有方法的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21151 2026-05-15 cs.LG physics.ao-ph 50%

Learning to Advect: A Neural Semi-Lagrangian Architecture for Weather Forecasting

学习输运:一种用于天气预测的神经半拉格朗日架构

Carlos A. Pereira, Stéphane Gaudreault, Valentin Dallerit, Christopher Subich, Shoyon Panday, Siqi Wei, Sasa Zhang, Siddharth Rout, Eldad Haber, Raymond J. Spiteri, David Millard, Emilia Diaconescu

机构 * Recherche en prévision numérique atmosphérique, Environnement et Changement climatique Canada(环境与气候变化加拿大大气数值预报研究) Department of Earth, Ocean and Atmospheric Sciences, University of British Columbia(不列颠哥伦比亚大学地球、海洋和大气科学系) Department of Computer Science, University of Saskatchewan(萨斯喀彻温大学计算机科学系) Department of Mechanical Engineering, Rochester Institute of Technology(罗切斯特理工学院机械工程系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出PARADIS模型,通过将输运、扩散和反应块分解为 latent 变量,实现天气预测的物理结构化操作,提升预测精度与谱保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13959 2026-05-15 cs.LG cs.AI cs.RO 50%

WarmPrior: Straightening Flow-Matching Policies with Temporal Priors

WarmPrior: 通过时间先验使流匹配策略更加平直

Sinjae Kang, Chanyoung Kim, Kaixin Wang, Li Zhao, Kimin Lee

机构 * KAIST(韩国科学技术院) Microsoft Research(微软研究院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出WarmPrior,通过利用近期动作历史构建的时间先验,提升机器人操作任务的成功率,改进概率路径并提高样本效率和最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05319 2026-05-15 cs.LG 50%

Accelerated Sequential Flow Matching: A Bayesian Filtering Perspective

加速的序列流匹配:从贝叶斯过滤视角

Yinan Huang, Hans Hao-Hsun Hsu, Junran Wang, Bo Dai, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于贝叶斯过滤的序列贝叶斯流匹配框架,通过学习概率流在时间步间传输后验分布,实现高效采样,提升实时流处理中的推断效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10661 2026-05-15 physics.flu-dyn 50%

Boundary treatment algorithms for meshfree RANS turbulence modeling

无网格RANS湍流建模的边界处理算法

Mohan Padmanabha, Jörg Kuhnert, Nicolas R. Gauger, Pratik Suchde

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出改进的无网格方法用于湍流流动的壁处理策略,通过评估最近邻方法和新型最近带邻近方法与移位边界方法,验证了其在高雷诺数湍流模拟中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 8 篇

2504.01571 2026-05-15 cs.GR cs.AI cs.CV cs.LG 84%

Pro-DG: Procedural Diffusion Guidance for Architectural Facade Generation

Pro-DG:基于过程扩散引导的建筑立面生成

Aleksander Plocharski, Jan Swidzinski, Przemyslaw Musialski

机构 * Warsaw University of Technology(华沙技术大学) Akces NCBR Imperial College London(伦敦帝国理工学院) New Jersey Institute of Technology(新泽西理工学院)

专题命中 可控生成 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Pro-DG方法,通过层次化过程规则生成控制图,实现建筑立面的真实感生成,支持结构编辑如楼层复制和窗户重排,经评估验证其在保持建筑身份和精确编辑方面的优越性。

Comments 17 pages, 15 figures, Computer Graphics Forum 2026 Journal Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15167 2026-05-15 cs.CV 57%

Does Synthetic Layered Design Data Benefit Layered Design Decomposition?

合成分层设计数据是否有助于分层设计分解?

Kam Man Wu, Haolin Yang, Qingyu Chen, Yihu Tang, Jingye Chen, Qifeng Chen

机构 * HKUST(香港理工大学) Webank(网商银行)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文研究合成分层数据对图形设计分解的影响,发现纯合成数据能有效替代传统方法,且训练数据规模增加时性能提升,但5万样本后趋于饱和。

Comments 22 pages, 10 figures. Code is available at https://github.com/YangHaolin0526/SynLayers

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12624 2026-05-15 cs.RO cs.CV 57%

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1:统一流架构使VLA超越VA用于自动驾驶

Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Li Auto Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MindVLA-U1通过统一流架构实现自动驾驶中VLA超越VA,采用统一视觉语言模型骨干和流匹配连续动作轨迹,在保持各模态自然输出形式的同时,实现高效规划和低延迟。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14935 2026-05-15 cs.CV 57%

Multi-scale Coarse-to-fine Modeling for Test-time Human Motion Control

多尺度粗到细建模用于测试时的人体运动控制

Nhat Le, Daochang Liu, Anh Nguyen, Ajmal Mian

机构 * The University of Western Australia(西澳大学) The University of Liverpool(利物浦大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MSCoT模型,通过多尺度粗到细方法实现测试时的人体运动合成与控制,采用高效多尺度令牌引导策略提升控制精度与效率,实验显示其在运动质量和控制准确性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14815 2026-05-15 cs.CV 57%

Probing into Camera Control of Video Models

探究视频模型的摄像机控制

Chen Hou, Christian Rupprecht

机构 * Visual Geometry Group University of Oxford(视觉几何组牛津大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过几何引导而非隐式映射实现摄像机控制,有效提升视频生成模型的几何表现力,并揭示了基础模型的摄像机控制偏见与差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14626 2026-05-15 cs.CV 57%

UniTriGen: Unified Triplet Generation of Aligned Visible-Infrared-Label for Few-Shot RGB-T Semantic Segmentation

UniTriGen: 一致的可见-红外-标签三元组生成用于少样本RGB-T语义分割

Ping Zhou, Haoyu Wang, Mengmeng Zheng, Lei Zhang, Wei Wei, Chen Ding, Fei Zhou

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) School of Computer Science & Technology, Xi’an University of Posts & Telecommunications(西安邮电大学计算机科学与技术学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 UniTriGen提出统一三元组生成框架,通过共享潜在空间和扩散过程生成一致的可见-红外-标签三元组,解决少样本RGB-T语义分割中的对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09304 2026-05-15 cs.CV 57%

GeRM: A Generative Rendering Model From Physically Realistic to Photorealistic

GeRM:从物理真实到照片级的生成渲染模型

Jiayuan Lu, Rengan Xie, Xuancheng Jin, Zhizhen Wu, Qi Ye, Tian Xie, Hujun Bao, Rui Wang. Yuchi Huo

机构 * State Key Lab of CAD\&CG, Zhejiang University Zhejiang Lab China State Key Laboratory of Industrial Control Technology, Zhejiang University China Zhejiang University China Zhejiang Lab State Key Laboratory of Industrial Control Technology, Zhejiang University Zhejiang University

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 GeRM是首个多模态生成渲染模型,通过学习分布转移向量场实现从物理真实到照片级的过渡,结合控制网络和多代理框架提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14135 2026-05-15 cs.CV 57%

PanoPlane: Plane-Aware Panoramic Completion for Sparse-View Indoor 3D Gaussian Splatting

PanoPlane:基于平面感知的稀疏视角室内3D高斯散点完成

Adil Qureshi, Dongki Jung, Jaehoon Choi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PanoPlane通过全景场景完成重建封闭房间几何,利用360度全景完成条件生成过程,通过Layout Anchored Attention Steering机制引导扩散模型注意力至检测到的平面表面,实现基于几何一致性的表面外推,提升稀疏视角下的新型视图合成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2605.14267 2026-05-15 cs.CV cs.AI 79%

Image Restoration via Diffusion Models with Dynamic Resolution

通过动态分辨率模型进行图像修复

Yang Zheng, Wen Li, Zhaoqiang Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过动态分辨率模型将数据投影到低维子空间,以加速推理过程,改进了传统扩散模型在图像修复中的效率与质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14821 2026-05-15 cs.CV 57%

HDRFace: Rethinking Face Restoration with High-Dimensional Representation

HDRFace: 重新思考高维表示下的面部修复

Zirui Wang, Xianhui Lin, Yi Dong, Bo Wei, Gangjian Zhang, Siteng Ma, Zebiao Zheng, Xing Liu, Hong Gu, Minjing Dong

机构 * City University of Hong Kong(香港城市大学) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd(vivo蓝影实验室,vivo移动通信有限公司)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出HDRFace框架,通过注入语义丰富的先验知识提升面部修复效果,采用高维特征编码器提取细粒度面部表示,并引入SDFM机制平衡结构一致性和细节保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2605.14486 2026-05-15 cs.CV 57%

Reduce the Artifacts Bias for More Generalizable AI-Generated Image Detection

降低艺术偏差以提高通用性的人工智能生成图像检测

Yiheng Li, Yang Yang, Zichang Tan, Gao Li, Zhen Lei, Wenhao Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) Sangfor Technologies Inc.(Sangfor技术公司) China Mobile Financial Technology Co., Ltd.(中国移动金融科技有限公司) CAIR, HKSIS, Chinese Academy of Sciences(中国科学院CAIR、HKSIS部门) SCSE, FIE, M.U.S.T, Macau, China(澳门SCSE、FIE、M.U.S.T部门) Vast Intelligence Lab, Sydney, Australia(悉尼澳大利亚Vast Intelligence Lab)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SEF框架,通过分离专家融合减少领域干扰,提升AI生成图像检测的通用性与鲁棒性,实验表明在13个基准上表现优异。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 1 篇

2507.07776 2026-05-15 cs.CV 57%

SCOOTER: A Human Evaluation Framework for Unrestricted Adversarial Examples

SCOOTER:一种用于无限制对抗示例的人工评估框架

Dren Fazlija, Monty-Maximilian Zühlke, Johanna Schrader, Arkadij Orlov, Clara Stein, Iyiola E. Olatunji, Daniel Kudenko

机构 * University of Luxembourg(卢森堡大学) CAIMed – Lower Saxony Center for AI & Causal Methods in Medicine(下萨克森人工智能与因果方法医学中心)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SCOOTER框架,通过大规模人类与模型对比验证无限制对抗示例的不可察觉性,发现部分攻击方法无法生成不可察觉图像,并展示了基于ImageNet的基准数据集。

Comments 42 pages, 16 figures, 11 tables, Under Review, Code: https://github.com/DrenFazlija/Scooter, Data: https://doi.org/10.5281/zenodo.15771501

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 6 篇

2605.14333 2026-05-15 cs.CV 79%

InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation

InsightTok: 提高离散分词中文本和面部保真度以用于自回归图像生成

Yang Yue, Fangyun Wei, Tianyu He, Jinjing Zhao, Zanlin Ni, Zeyu Liu, Jiayi Guo, Lei Shi, Yue Dong, Li Chen, Ji Li, Gao Huang, Dong Chen

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 InsightTok通过局部内容感知损失提升文本和面部保真度,在不牺牲通用重建质量的情况下优于现有分词器,从而推动离散图像生成的发展。

Comments Code and checkpoints are available at https://github.com/LeapLabTHU/InsightTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15178 2026-05-15 cs.CV 74%

SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer

SANA-WM:高效分钟级世界建模的混合线性扩散变换器

Haoyi Zhu, Haozhe Liu, Yuyang Zhao, Tian Ye, Junsong Chen, Jincheng Yu, Tong He, Song Han, Enze Xie

机构 * NVIDIA(英伟达)

专题命中 效率与蒸馏 :diffusion(title);分类 cs.CV

AI总结 SANA-WM通过混合线性注意力、双分支相机控制等设计,实现高效分钟级视频生成,提升效率与视觉质量。

Comments https://nvlabs.github.io/Sana/WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14276 2026-05-15 stat.ML cs.LG 67%

Training-Free Generative Sampling via Moment-Matched Score Smoothing

无需训练的生成采样 via 动量匹配的分数平滑

Zhenyu Yao, Daniel Paulin

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract)

AI总结 本文提出无需训练的动量匹配分数平滑过阻尼兰格-恩斯坦动力学(MM-SOLD),通过在采样轨迹中强制目标动量,实现高效的训练自由采样,实验显示其在CPU上能快速稳健地生成高质量样本。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17588 2026-05-15 cs.CV 57%

HERO: Hierarchical Extrapolation and Refresh for Efficient World Models

HERO:高效世界模型的分层外推与刷新

Quanjian Song, Xinyu Wang, Donghao Zhou, Jingyu Lin, Cunjian Chen, Yue Ma

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 HERO通过分层策略提升世界模型推理效率,采用补丁刷新和线性外推技术,在保持质量的同时实现1.73倍加速。

Comments 12 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22394 2026-05-15 cs.CV 57%

PacTure: Efficient PBR Texture Generation on Packed Views with Visual Autoregressive Models

PacTure:基于打包视角的高效PBR纹理生成方法

Fan Fei, Jiajun Tang, Fei-Peng Tian, Boxin Shi, Ping Tan

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(视觉技术国家工程研究中心,计算机学院,北京大学) The Hong Kong University of Science and Technology(香港科技大学) Light Illusions PKU-AI 2 Robotics Joint Lab of Embodied AI(北京大学人工智能2机器人联合实验室)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 PacTure通过引入视角打包技术,提升多视角生成的效率与一致性,结合自回归模型实现高效PBR纹理生成。

Comments Accepted by Computational Visual Media Journal (CVMJ) in Feb. 2026. 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏