arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2507.21529 2025-11-07 cs.CV 57%

Chain-of-Cooking:Cooking Process Visualization via Bidirectional Chain-of-Thought Guidance

Mengling Xu, Ming Tao, Bing-Kun Bao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03425 2025-11-06 cs.SD cs.LG cs.MM 57%

SyMuPe: Affective and Controllable Symbolic Music Performance

Ilya Borovik, Dmitrii Gavrilev, Vladimir Viro

机构 * Skolkovo Institute of Science and Technology(斯克洛夫诺科学与技术研究所) Peachnote GmbH(Peachnote公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.MM

Comments ACM Multimedia 2025. Extended version with supplementary material

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (MM '25), October 27-31, 2025, Dublin, Ireland, pp. 10699-10708

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01678 2025-11-04 cs.CV 57%

UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback

Ropeway Liu, Hangjie Yuan, Bo Dong, Jiazheng Xing, Jinwang Wang, Rui Zhao, Yan Xing, Weihua Chen, Fan Wang

机构 * Zhejiang University(浙江大学) DAMO Academy Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25173 2025-11-04 cs.CV 57%

D$^2$GS: Dense Depth Regularization for LiDAR-free Urban Scene Reconstruction

Kejing Xia, Jidong Jia, Ke Jin, Yucai Bai, Li Sun, Dacheng Tao, Youjian Zhang

机构 * Wuhan University(武汉大学) Shanghai Jiaotong University(上海交通大学) TongJi University(同济大学) Bosch(博世) Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27452 2025-11-03 cs.CV 57%

From Pixels to Paths: A Multi-Agent Framework for Editable Scientific Illustration

Jianwen Sun, Fanrui Zhang, Yukang Feng, Chuanhao Li, Zizhen Li, Jiaxin Ai, Yifan Chang, Yu Dai, Kaipeng Zhang

机构 * Nankai University(南开大学) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18637 2025-11-03 cs.CV cs.AI cs.LG 57%

ε-Seg: Sparsely Supervised Semantic Segmentation of Microscopy Data

Sheida Rahnamai Kordasiabi, Damian Dalle Nogare, Florian Jug

机构 * Human Technopole, Milan, Italy(米兰人类技术极地) Technical University of Dresden, Germany(德累斯顿技术大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 10 pages main text, 17 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08325 2025-10-31 cs.CV 57%

GameFactory: Creating New Games with Generative Interactive Videos

Jiwen Yu, Yiran Qin, Xintao Wang, Pengfei Wan, Di Zhang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Kuaishou Technology(快手科技)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV 2025 Highlight, Project Page: https://yujiwen.github.io/gamefactory

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03318 2025-10-30 cs.CV 57%

Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning

Yibin Wang, Zhimin Li, Yuhang Zang, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Hunyuan, Tencent(腾讯 Hunyuan)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments [NeurIPS2025] Project Page: https://codegoat24.github.io/UnifiedReward/think

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22981 2025-10-28 cs.AI cs.CV 57%

Exploring Semantic-constrained Adversarial Example with Instruction Uncertainty Reduction

Jin Hu, Jiakai Wang, Linna Jing, Haolin Li, Haodong Liu, Haotong Qin, Aishan Liu, Ke Xu, Xianglong Liu

机构 * State Key Laboratory of Complex & Critical Software Environment (CCSE), Beihang University(复杂与关键软件环境国家重点实验室,北京航空航天大学) Zhongguancun Laboratory(中关村实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Department of Information Technology and Electrical Engineering, ETH Zurich(苏黎世联邦理工学院信息科技与电气工程系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22534 2025-10-28 cs.CV 57%

SRSR: Enhancing Semantic Accuracy in Real-World Image Super-Resolution with Spatially Re-Focused Text-Conditioning

Chen Chen, Majid Abdolshah, Violetta Shevchenko, Hongdong Li, Chang Xu, Pulak Purkait

机构 * Amazon(亚马逊公司) The University of Sydney(悉尼大学) Australian National University(澳大利亚国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21887 2025-10-28 cs.CV cs.AI cs.LG 57%

Generative AI in Depth: A Survey of Recent Advances, Model Variants, and Real-World Applications

Shamim Yazdani, Akansha Singh, Nripsuta Saxena, Zichong Wang, Avash Palikhe, Deng Pan, Umapada Pal, Jie Yang, Wenbin Zhang

机构 * Florida International University(佛罗里达国际大学) Manipal Institute of Technology(曼海姆技术学院) University of Southern California(南加州大学) Indian Statistical Institute(印度统计研究所) University of Wollongong(沃林根大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by the Journal of Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21391 2025-10-27 cs.CV 57%

TerraGen: A Unified Multi-Task Layout Generation Framework for Remote Sensing Data Augmentation

Datao Tang, Hao Wang, Yudeng Xin, Hui Qiao, Dongsheng Jiang, Yin Li, Zhiheng Yu, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) University of Melbourne(墨尔本大学) China Telecom Shaanxi Branch(中国电信陕西分公司) Huawei Technologies Ltd(华为技术有限公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20888 2025-10-27 cs.CV cs.AI 57%

Video-As-Prompt: Unified Semantic Control for Video Generation

Yuxuan Bian, Xin Chen, Zenan Li, Tiancheng Zhi, Shen Sang, Linjie Luo, Qiang Xu

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Website: https://bytedance.github.io/Video-As-Prompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21491 2025-10-27 cs.CV 57%

Frame In-N-Out: Unbounded Controllable Image-to-Video Generation

Boyang Wang, Xuweiyi Chen, Matheus Gadelha, Zezhou Cheng

机构 * University of Virginia(弗吉尼亚大学) Adobe Research(Adobe研究)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17452 2025-10-23 cs.CV cs.AI 57%

Training-Free Label Space Alignment for Universal Domain Adaptation

Dujin Lee, Sojung An, Jungmyung Wi, Kuniaki Saito, Donghyun Kim

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18345 2025-10-22 cs.CV 57%

GPTFace: Generative Pre-training of Facial-Linguistic Transformer by Span Masking and Weakly Correlated Text-image Data

Yudong Li, Hao Li, Xianxu Hou, Linlin Shen

机构 * Shenzhen University(深圳大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments This work was initially drafted in November 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15873 2025-10-21 cs.GR 57%

Two-Stage Sketch-Based Smoke Illustration Generation using Stream Function

Hengyuan Chang, Xiaoxuan Xie, Syuhei Sato, Haoran Xie

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

Comments 3 pages, 4 figures. SIGGRAPH 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10780 2025-10-21 cs.CV 57%

MaskControl: Spatio-Temporal Control for Masked Motion Synthesis

Ekkasit Pinyoanuntapong, Muhammad Usama Saleem, Korrawe Karunratanakul, Pu Wang, Hongfei Xue, Chen Chen, Chuan Guo, Junli Cao, Jian Ren, Sergey Tulyakov

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) ETH Zürich(苏黎世联邦理工学院) University of Central Florida(中央佛罗里达大学) Snap Inc.(Snap公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Camera Ready Version. ICCV2025 (Oral). Change name from ControlMM to MaskControl. project page https://exitudio.github.io/ControlMM-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15783 2025-10-20 cs.CV 57%

ReCon: Region-Controllable Data Augmentation with Rectification and Alignment for Object Detection

Haowei Zhu, Tianxiang Pan, Rui Qin, Jun-Hai Yong, Bin Wang

机构 * Tsinghua University(清华大学) Li Auto Inc.(力汽车公司) BNRist(BNR机构)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15564 2025-10-20 cs.CV 57%

Imaginarium: Vision-guided High-Quality 3D Scene Layout Generation

Xiaoming Zhu, Xu Huang, Qinghongbing Xie, Zhi Deng, Junsheng Yu, Yirui Guan, Zhongyuan Liu, Lin Zhu, Qijun Zhao, Ligang Liu, Long Zeng

机构 * Tsinghua University(清华大学) Tencent(腾讯) Southeast University(东南大学) University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14952 2025-10-20 cs.RO cs.CV 57%

From Language to Locomotion: Retargeting-free Humanoid Control via Motion Latent Guidance

Zhe Li, Cheng Chi, Yangyang Wei, Boan Zhu, Yibo Peng, Tao Huang, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang, Chang Xu

机构 * University of Sydney(悉尼大学) BAAI(北京人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14874 2025-10-17 cs.CV 57%

TOUCH: Text-guided Controllable Generation of Free-Form Hand-Object Interactions

Guangyi Han, Wei Zhai, Yuhang Yang, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14536 2025-10-17 cs.CV 57%

Exploring Image Representation with Decoupled Classical Visual Descriptors

Chenyuan Qu, Hao Chen, Jianbo Jiao

机构 * The MIx Group University of Birmingham, UK(米克斯小组英国伯明翰大学) University of Cambridge Cambridge, UK(剑桥大学) Allsee Technologies Ltd Birmingham, UK(Allsee技术有限公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accepted by The 36th British Machine Vision Conference (BMVC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01912 2025-10-16 cs.CV 57%

Unconditional CNN denoisers contain sparse semantic representation of images

Zahra Kadkhodaie, Stéphane Mallat, Eero Simoncelli

机构 * New York University(纽约大学) Flatiron Institute(Flatiron研究所) Collège de France(法兰西学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12069 2025-10-15 cs.CV 57%

VIDMP3: Video Editing by Representing Motion with Pose and Position Priors

Sandeep Mishra, Oindrila Saha, Alan C. Bovik

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11649 2025-10-14 cs.CV 57%

PhySIC: Physically Plausible 3D Human-Scene Interaction and Contact from a Single Image

Pradyumna Yalandur Muralidhar, Yuxuan Xue, Xianghui Xie, Margaret Kostyrko, Gerard Pons-Moll

机构 * University of Tübingen, Zuse School ELIZA(图宾根大学Zuse学校ELIZA) University of Tübingen, Tübingen AI Center(图宾根大学图宾根人工智能中心) University of Tübingen, Tübingen AI Center, MPI for Informatics, SIC(图宾根大学图宾根人工智能中心、马克斯·普朗克信息研究所、SIC)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Accepted to ACM SIGGraphAsia 2025. Project website: https://yuxuan-xue.com/physic

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10650 2025-10-14 cs.CV cs.AI 57%

DEMO: Disentangled Motion Latent Flow Matching for Fine-Grained Controllable Talking Portrait Synthesis

Peiyin Chen, Zhuowei Yang, Hui Feng, Sheng Jiang, Rui Yan

机构 * College of Artificial Intelligence and Automation, Hohai University(人工智能与自动化学院,河海大学) College of DaYu, Hohai University(大禹学院,河海大学) College of Water Conserwancy and Hydropower Engineering, Hohai University(水利水电工程学院,河海大学) College of Computer Science and Technology, Zhejiang University of Technology(计算机科学与技术学院,浙江工业大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09817 2025-10-14 cs.RO cs.CV 57%

Cross-Sensor Touch Generation

Samanta Rodriguez, Yiming Dou, Miquel Oller, Andrew Owens, Nima Fazeli

机构 * University of Michigan(密歇根大学) Cornell University(康奈尔大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08561 2025-10-14 cs.CV 57%

MultiCOIN: Multi-Modal COntrollable Video INbetweening

Maham Tanveer, Yang Zhou, Simon Niklaus, Ali Mahdavi Amiri, Hao Zhang, Krishna Kumar Singh, Nanxuan Zhao

机构 * Simon Fraser University(西蒙弗雷泽大学) Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project website: https://multicoinx.github.io/multicoin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01298 2025-10-13 q-bio.QM cs.CV cs.LG 57%

MorphGen: Controllable and Morphologically Plausible Generative Cell-Imaging

Berker Demirel, Marco Fumero, Theofanis Karaletsos, Francesco Locatello

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏