arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2512.19943 2025-12-24 cs.CV 70%

SE360: Semantic Edit in 360$^\circ$ Panoramas via Hierarchical Data Construction

SE360:通过分层数据构建实现360度全景图的语义编辑

Haoyi Zhong, Fang-Lue Zhang, Andrew Chalmers, Taehyun Rhee

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 SE360通过分层数据构建实现360度全景图的语义编辑,提出自主数据生成管道和两阶段数据精修策略,提升编辑质量和语义准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19020 2025-12-23 cs.CV cs.LG 70%

CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization

CETCAM: 通过一致且可扩展的分词实现相机可控的视频生成

Zelin Zhao, Xinyu Gong, Bangya Liu, Ziyang Song, Jun Zhang, Suhui Wu, Yongxin Chen, Hao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) ByteDance(字节跳动) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 CETCAM通过一致且可扩展的分词方案实现相机可控的视频生成,提高了几何一致性和视觉真实性,同时支持额外的控制模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17350 2025-12-22 cs.CV 70%

Beyond Semantic Features: Pixel-level Mapping for Generalized AI-Generated Image Detection

超越语义特征:用于通用AI生成图像检测的像素级映射

Chenming Zhou, Jiaan Wang, Yu Li, Lei Li, Juan Cao, Sheng Tang

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出通过像素级映射预处理破坏图像语义特征,提升AI生成图像检测器的跨模型泛化能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16270 2025-12-19 cs.CV cs.AI 70%

TextEditBench: Evaluating Reasoning-aware Text Editing Beyond Rendering

TextEditBench: 评估超出渲染的推理-aware文本编辑

Rui Gui, Yang Wan, Haochen Han, Dongxing Mao, Fangming Liu, Min Li, Alex Jinpeng Wang

机构 * Central South University(中南大学) Pengcheng Laboratory(鹏城实验室)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 TextEditBench 旨在评估文本编辑中超出渲染的推理能力,通过引入语义期望维度,推动多模态生成中的文本引导编辑技术发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13014 2025-12-16 cs.CV 70%

JoDiffusion: Jointly Diffusing Image with Pixel-Level Annotations for Semantic Segmentation Promotion

JoDiffusion: 通过像素级标注联合扩散图像以促进语义分割

Haoyu Wang, Lei Zhang, Wenrui Liu, Dengyang Jiang, Wei Wei, Chen Ding

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 JoDiffusion通过联合扩散图像与像素级标注,提升语义分割的性能和可扩展性。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06215 2025-12-15 cs.CV 70%

Fine-grained Defocus Blur Control for Generative Image Models

细粒度模糊模糊控制用于生成图像模型

Ayush Shrivastava, Connelly Barnes, Xuaner Zhang, Lingzhi Zhang, Andrew Owens, Sohrab Amirghodsi, Eli Shechtman

机构 * University of Michigan(密歇根大学) Adobe Research(Adobe研究)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于EXIF数据的文本到图像扩散模型,通过生成可控的镜头模糊效果,实现细粒度的模糊控制,提升图像生成的可控性与真实性。

Comments Project link: https://www.ayshrv.com/defocus-blur-gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09406 2025-12-11 cs.RO cs.AI cs.CV 70%

H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos

H2R-Grounder:一种无需配对数据的视频到物理 grounded 机器人视频翻译范式

Hai Ci, Xiaokang Liu, Pei Yang, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学显示实验室)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 H2R-Grounder通过无需配对数据的方法,将人类交互视频转换为物理 grounded 的机器人视频,提升机器人学习的现实感和扩展性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22194 2025-12-01 cs.CV 70%

Controllable 3D Object Generation with Single Image Prompt

单图像提示下的可控3D物体生成

Jaeseok Lee, Jaekoo Lee

机构 * College of Computer Science, Kookmin University, Seoul, Korea(计算机科学学院,韩国高丽大学,首尔)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出两种方法,通过单图像提示生成可控的3D物体,提升3D一致性并优于现有文本倒置方法。

Journal ref Pattern Recognition. ICPR 2024. Lecture Notes in Computer Science, vol 15306. Springer, Cham. p222-238

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21024 2025-11-27 cs.CV 70%

CameraMaster: Unified Camera Semantic-Parameter Control for Photography Retouching

CameraMaster: 用于摄影修饰的统一相机语义-参数控制

Qirui Yang, Yang Yang, Ying Zeng, Xiaobin Hu, Bo Li, Huanjing Yue, Jingyu Yang, Peng-Tao Jiang

机构 * Tianjin University(天津大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) NUS(国立大学)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 CameraMaster通过统一相机感知框架实现精确摄影修饰,通过解耦相机指令和参数嵌入,提升多参数控制与语义-参数对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19811 2025-11-26 cs.CV cs.CL cs.LG 70%

Training-Free Generation of Diverse and High-Fidelity Images via Prompt Semantic Space Optimization

无需训练生成多样化且高保真的图像 via 提示语义空间优化

Debin Meng, Chen Jin, Zheng Gao, Yanran Li, Ioannis Patras, Georgios Tzimiropoulos

机构 * Queen Mary University of London(伦敦女王学院) Centre for AI, AstraZeneca(AstraZeneca人工智能中心) University of Bedfordshire(贝德福德大学) Samsung AI Center(三星人工智能中心)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出TPSO方法,通过优化提示语义空间提升图像生成的多样性和保真度,无需训练且适用于多种模型。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18204 2025-11-25 cs.CV 70%

Generating Synthetic Human Blastocyst Images for In-Vitro Fertilization Blastocyst Grading

生成合成人类囊胚图像用于体外受精囊胚分级

Pavan Narahari, Suraj Rajendran, Lorena Bori, Jonas E. Malmsten, Qiansheng Zhan, Zev Rosenwaks, Nikica Zaninovic, Iman Hajirasouliha

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 DIA框架通过生成高保真的合成囊胚图像,解决体外受精中囊胚分级的数据稀缺和类别不平衡问题,提升AI评估工具的性能和标准化。

Comments The manuscript is 23 pages, with five main figures and one table. The supplemental material includes 23 pages with fourteen figures and four tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15222 2025-11-18 cs.AI cs.CV cs.MA 70%

See it. Say it. Sorted: Agentic System for Compositional Diagram Generation

Hantao Zhang, Jingyang Liu, Ed Li

机构 * Yale University(耶鲁大学) University of Edinburgh(爱丁堡大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00298 2025-11-18 cs.CV 70%

AniMer+: Unified Pose and Shape Estimation Across Mammalia and Aves via Family-Aware Transformer

Liang An, Jin Lyu, Li Lin, Pujin Cheng, Yebin Liu, Xiaoying Tang

机构 * Department of Electronic and Electrical Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学电子与电气工程系) Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Jiaxing Research Institute, Southern University of Science and Technology, Jiaxing, China(南方科技大学嘉兴研究所) Department of Electrical and Electronic Engineering, the University of Hong Kong, Hong Kong, China(香港大学电子与电气工程系)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to TPAMI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06002 2025-11-11 cs.CV 70%

MALeR: Improving Compositional Fidelity in Layout-Guided Generation

Shivank Saxena, Dhruv Srivastava, Makarand Tapaswi

机构 * Adobe Research(Adobe研究)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ACM TOG Dec 2025, Siggraph Asia, Project page: https://katha-ai.github.io/projects/maler/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27324 2025-11-03 cs.CV cs.AI 70%

Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis

Weiming Chen, Yijia Wang, Zhihan Zhu, Zhihai He

机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25163 2025-10-30 cs.CV 70%

Target-Guided Bayesian Flow Networks for Quantitatively Constrained CAD Generation

Wenhao Zheng, Chenwei Sun, Wenbo Zhang, Jiancheng Lv, Xianggen Liu

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, Chengdu, China(教育部机器学习与工业智能工程研究中心)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (2025) 3330-3339

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24093 2025-10-29 cs.CV 70%

OmniText: A Training-Free Generalist for Controllable Text-Image Manipulation

Agus Gunawan, Samuel Teodoro, Yun Chen, Soo Ye Kim, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) Adobe Research(Adobe研究院) Chung-Ang University(Chung-Ang 大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments The first two authors contributed equally to this work. The last two authors are co-corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22010 2025-10-28 cs.CV cs.LG eess.IV 70%

FlowOpt: Fast Optimization Through Whole Flow Processes for Training-Free Editing

Or Ronai, Vladimir Kulikov, Tomer Michaeli

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

Comments Project's webpage at https://orronai.github.io/FlowOpt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20385 2025-10-24 cs.CV 70%

Positional Encoding Field

Yunpeng Bai, Haoxiang Li, Qixing Huang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Pixocial Technology(Pixocial技术)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11650 2025-10-14 cs.CV 70%

InfiniHuman: Infinite 3D Human Creation with Precise Control

Yuxuan Xue, Xianghui Xie, Margaret Kostyrko, Gerard Pons-Moll

机构 * University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) University of Tübingen, Tübingen AI Center, MPI for Informatics, SIC(图宾根大学,图宾根人工智能中心,马克斯·普朗克信息研究所,SIC) University of Tübingen(图宾根大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ACM SIGGRAPH Asia 2025. Project website: https://yuxuan-xue.com/infini-human

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19066 2025-10-14 cs.CV 70%

Concept Steerers: Leveraging K-Sparse Autoencoders for Test-Time Controllable Generations

Dahye Kim, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Runway

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 23 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05722 2025-10-08 cs.CV 70%

Data Factory with Minimal Human Effort Using VLMs

Jiaojiao Ye, Jiaxing Zhong, Qian Xie, Yuzhou Zhou, Niki Trigoni, Andrew Markham

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24652 2025-09-30 cs.CV 70%

Learning Object-Centric Representations Based on Slots in Real World Scenarios

Adil Kaan Akan

机构 * Computer Science and Engineering(计算机科学与工程)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments PhD Thesis, overlap with arXiv:2507.20855 and arXiv:2501.15878

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24288 2025-09-30 cs.CV 70%

ASIA: Adaptive 3D Segmentation using Few Image Annotations

Sai Raj Kishore Perla, Aditya Vora, Sauradip Nag, Ali Mahdavi-Amiri, Hao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments SIGGRAPH Asia, 2025. Project Page: https://sairajk.github.io/asia/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21938 2025-09-29 cs.CV cs.AI 70%

SemanticControl: A Training-Free Approach for Handling Loosely Aligned Visual Conditions in ControlNet

Woosung Joung, Daewon Chae, Jinkyu Kim

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Korea University(韩国大学) Electrical and Computer Engineering(电气与计算机工程系) University of Michigan(密歇根大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14108 2025-09-29 cs.CV 70%

DanceText: A Training-Free Layered Framework for Controllable Multilingual Text Transformation in Images

Zhenyu Yu, Mohd Yamani Idna Idris, Hua Wang, Pei Wang, Rizwan Qureshi, Shaina Raza, Aman Chadha, Yong Xiang, Zhixiang Chen

机构 * Universiti Malaya(马来大学) Zhejiang University of Finance and Economics Dongfang College(浙江财经大学东阳学院) Kunming University of Science and Technology(昆明理工大学) University of Central Florida(佛罗里达中央大学) Toronto metropolitan university(多伦多 Metropolitan 大学) Amazon Web Services(亚马逊网络服务) Deakin University(德肯大学) University of Sheffield(谢菲尔德大学)

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15772 2025-09-22 cs.CV 70%

Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation

Weimin Bai, Yubo Li, Weijian Luo, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) Xiaohongshu Inc(小红书公司)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16783 2025-08-26 cs.CV cs.AI 70%

Improving Performance, Robustness, and Fairness of Radiographic AI Models with Finely-Controllable Synthetic Data

Stefania L. Moroianu, Christian Bluethgen, Pierre Chambon, Mehdi Cherti, Jean-Benoit Delbrouck, Magdalini Paschali, Brandon Price, Judy Gichoya, Jenia Jitsev, Curtis P. Langlotz, Akshay S. Chaudhari

机构 * Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学人工智能医学与成像中心) Department of Radiology, Stanford University(斯坦福大学放射科) Department of Applied Physics, Stanford University(斯坦福大学应用物理系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Institute for Diagnostic and Interventional Radiology, University Hospital Zurich, University of Zurich(苏黎世大学医院诊断与介入放射学研究所) LAION Juelich Supercomputing Center (JSC), Research Center Juelich (FZJ)(耶鲁超级计算中心(JSC)、耶鲁研究中心(FZJ)) Department of Radiology & Imaging Sciences, Emory University(埃默里大学放射科与成像科学系) Department of Radiology, University of Florida College of Medicine(佛罗里达大学医学院放射科)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06551 2025-08-12 cs.CV 70%

Slice or the Whole Pie? Utility Control for AI Models

Ye Tao

机构 * Ye Tao

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14054 2025-08-08 cs.CV 70%

PointRegGPT: Boosting 3D Point Cloud Registration using Generative Point-Cloud Pairs for Training

Suyi Chen, Hao Xu, Haipeng Li, Kunming Luo, Guanghui Liu, Chi-Wing Fu, Ping Tan, Shuaicheng Liu

机构 * University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科技大学) Megvii Technology(商汤科技)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments To appear at the European Conference on Computer Vision (ECCV) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏