arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-04 至 2026-05-04 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2605.00345 2026-05-04 cs.CV 87%

Pose-Aware Diffusion for 3D Generation

姿态感知扩散用于3D生成

Zihan Zhou, Luxi Chen, Jingzhi Zhou, Yuhao Wan, Min Zhao, Baoyu Fan, Chongxuan Li

机构 * Gaoling School of AI, Renmin University of China(中国人民大学 Gallagher人工智能学院) VCIP, School of Computer Science, Nankai University(南开大学计算机学院 VCIP) THU-Bosch MLCenter, Tsinghua University(清华大学 THU-Bosch 机器学习中心) Inspur Group(Inspur集团)

专题命中 可控生成 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出Pose-Aware Diffusion,通过直接在观测空间生成3D几何,解决姿态对齐难题,实现高保真姿态一致的3D资产生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08965 2026-05-04 cs.LG cs.AI 78%

Semantic Level of Detail for Knowledge Graphs: Discovering Abstraction Boundaries via Spectral Heat Diffusion

知识图谱的语义层次细节:通过谱热扩散发现抽象边界

Edward Izgorodin

机构 * Mnemoverse.AI, Funchal, Madeira, Portugal(Mnemoverse.AI,法赫尔,马德拉,葡萄牙)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出SLoD框架,通过谱热扩散在图拉普拉斯上定义连续缩放操作,解决知识图谱中抽象层次边界检测问题,实验证明其在合成数据和WordNet中的有效性。

Comments v2: extended companion of GRAAI 2026 workshop paper; full proofs of Lemmas A.1-A.2 (Frechet-mean and heat-kernel Lipschitz constants, corrected) in Appendix A; Proposition 1(i) empirical anchor (new Figure 1); 50-seed ablation with BCa CIs and Wilcoxon tests (Tables 3-4, p<10^-15); WordNet retained (tau=0.79). 21 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00503 2026-05-04 cs.CV cs.LG 74%

End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

端到端自回归图像生成与1D语义分词器

Wenda Chu, Bingliang Zhang, Jiaqi Han, Yizhuo Li, Linjie Yang, Yisong Yue, Qiushan Guo

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 本文提出端到端训练 pipeline,结合重建与生成优化,改进1D分词器,实现自回归图像生成的高FID分数结果。

Comments In ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00605 2026-05-04 cs.CV 57%

Faithful Extreme Image Rescaling with Learnable Reversible Transformation and Semantic Priors

基于可学习可逆变换和语义先验的忠实极端图像放大

Hao Wei, Yanhui Zhou, Chenyang Ge, Saeed Anwar, Ajmal Mian

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) School of Information and Communications Engineering, Xi’an Jiaotong University(信息与通信工程学院,西安交通大学) Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FaithEIR框架,通过可学习可逆变换和语义先验提升极端图像放大的真实性与细节,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18064 2026-05-04 cs.CV 57%

Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement

适配大型视觉语言模型以生成低光照增强

Xiaoran Sun, Liyan Wang, Yeying Jin, Kin-man Lam, Zhixun Su, Yang Yang, Jinshan Pan, Cong Wang

机构 * Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加州大学旧金山分校) Nanjing University of Science and Technology(南京理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VLM-IMI框架,通过迭代和手动指令适配大型视觉语言模型,用于生成低光照增强。该框架包含正常光照指令先验生成和指令感知光照增强扩散两个分支,通过融合模块整合跨模态先验,提升生成效果。

Comments 11 papers,8 figures, CVPR2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01955 2026-05-04 cs.CV cs.AI cs.LG 57%

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

GPT-4o对视觉的理解有多好?在标准计算机视觉任务上评估多模态基础模型

Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

机构 * Swiss Federal Institute of Technology(瑞士联邦理工学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文评估了GPT-4o等多模态基础模型在标准计算机视觉任务上的表现,发现其在语义任务上优于几何任务,GPT-4o在非推理模型中表现最佳,推理模型在几何任务中有所提升。

Comments ICLR 2026. Project page at https://fm-vision-evals.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏