arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2511.21530 2025-11-27 cs.CV 70%

The Age-specific Alzheimer 's Disease Prediction with Characteristic Constraints in Nonuniform Time Span

具有非均匀时间跨度的特征约束的年龄特异性阿尔茨海默病预测

Xin Hong, Kaifeng Huang

机构 * Department of Software, School of Computer Science and Technology, Huaqiao University, China(软件系,计算机科学与技术学院,华侨大学)

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本研究提出了一种基于定量指标和年龄缩放因子的序列图像生成方法,用于提高非均匀时间跨度下阿尔茨海默病预测的准确性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04678 2025-11-27 cs.CV 70%

Unsupervised Segmentation by Diffusing, Walking and Cutting

无监督分割的扩散、行走与切割

Daniela Ivanova, Marco Aversa, Paul Henderson, John Williamson

机构 * University of Glasgow, UK(格拉斯哥大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 基于预训练扩散模型的自注意力特征,提出无监督图像分割方法,通过递归归一化切割和随机行走实现语义层次分割,无需额外训练。

Comments Accepted to The IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14993 2025-11-26 cs.AI cs.CV 70%

Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification

多模态生成式AI:多模态大语言模型、扩散模型与统一

Xin Wang, Yuwei Zhou, Bin Huang, Hong Chen, Wenwu Zhu

机构 * Department of Computer Science, Beijing Information Science and Technology National Research Center, Tsinghua University(计算机系,北京信息科学与技术国家研究中心,清华大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文综述了多模态生成式AI,涵盖多模态LLMs、扩散模型及统一模型的设计与应用,探讨了统一理解和生成的方法及未来研究方向。

Comments 21 pages, 10 figures, 3 tables

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13970 2025-11-19 cs.AI cs.CV 70%

Scene Graph-Guided Generative AI Framework for Synthesizing and Evaluating Industrial Hazard Scenarios

Sanjay Acharjee, Abir Khan Ratul, Diego Patino, Md Nazmus Sakib

机构 * Ph.D. Student, Dept. of Civil Eng., University of Texas at Arlington. E-mail Assistant Professor, Dept. of Computer Sci. \& Eng., University of Texas at Arlington. E-mail Assistant Professor, Dept. of Civil Eng., University of Texas at Arlington. E-mail

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12956 2025-11-18 cs.CV cs.CR 70%

T2I-Based Physical-World Appearance Attack against Traffic Sign Recognition Systems in Autonomous Driving

Chen Ma, Ningfei Wang, Junhao Zheng, Qing Guo, Qian Wang, Qi Alfred Chen, Chao Shen

机构 * Xi’an Jiaotong University(西安交通大学) University of California, Irvine(加州大学 Irvine 分校) Nankai University(南开大学) Wuhan University(武汉大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12002 2025-11-18 cs.LG cs.CV 70%

Selecting Fine-Tuning Examples by Quizzing VLMs

Tenghao Ji, Eytan Adar

机构 * University of Michigan(密歇根大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05573 2025-11-11 cs.CV cs.AI 70%

Video Text Preservation with Synthetic Text-Rich Videos

Ziyang Liu, Kevin Valencia, Justin Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01894 2025-11-11 cs.CV cs.AI cs.HC 70%

LIVS: A Pluralistic Alignment Dataset for Inclusive Public Spaces

Rashid Mushkani, Shravan Nayak, Hugo Berard, Allison Cohen, Shin Koseki, Hadrien Bertrand

机构 * Mila–Quebec AI Institute(魁北克AI研究所)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14799 2025-11-06 cs.CV cs.AI 70%

A Survey on Text-Driven 360-Degree Panorama Generation

Hai Wang, Xiaoyu Xiang, Weihao Xia, Jing-Hao Xue

机构 * Department of Statistical Science, University College London(统计科学系,伦敦大学学院) Core AI team at Meta Reality Labs(Meta Reality Labs人工智能核心团队)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by IEEE TCSVT, Code: https://github.com/littlewhitesea/Text-Driven-Pano-Gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00749 2025-11-06 cs.CV cs.CL 70%

Erasing 'Ugly' from the Internet: Propagation of the Beauty Myth in Text-Image Models

Tanvi Dinkar, Aiqi Jiang, Gavin Abercrombie, Ioannis Konstas

机构 * Interaction Lab, Heriot Watt University(赫瑞瓦德大学交互实验室)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments This is a preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18065 2025-11-05 cs.CV cs.AI cs.CL cs.RO 70%

Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation

Ziming Wei, Bingqian Lin, Yunshuang Nie, Jiaqi Chen, Shikui Ma, Hang Xu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Hunan Artificial Intelligence and Robotics Institute Company Ltd.(湖南人工智能与机器人研究院有限公司) Huawei Noah’s Ark Lab(华为诺亚实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Neural Networks and Learning Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24820 2025-10-30 cs.CV cs.AI 70%

SafeEditor: Unified MLLM for Efficient Post-hoc T2I Safety Editing

Ruiyang Zhang, Jiahao Luo, Xiaoru Feng, Qiufan Pang, Yaodong Yang, Juntao Dai

机构 * PKU Alignment Team, Peking University(北京大学对齐团队) LLM Safety Centre, Beijing Academy of Artificial Intelligence(北京人工智能研究院大语言模型安全中心)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22970 2025-10-28 cs.CV 70%

VALA: Learning Latent Anchors for Training-Free and Temporally Consistent

Zhangkai Wu, Xuhui Fan, Zhongyuan Xie, Kaize Shi, Longbing Cao

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22004 2025-10-28 cs.CV 70%

LiteDiff

Ruchir Namjoshi, Nagasai Thadishetty, Vignesh Kumar, Hemanth Venkateshwara

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21512 2025-10-27 cs.CV 70%

Towards a Golden Classifier-Free Guidance Path via Foresight Fixed Point Iterations

Kaibo Wang, Jianda Mao, Tong Wu, Yang Xiang

机构 * Department of Mathematics, The Hong Kong University of Science and Technology(香港科技大学数学系) Shenzhen-Hong Kong Collaborative Innovation Research Institute, HKUST(深圳-香港协同创新研究院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09538 2025-10-27 cs.CV 70%

AngleRoCL: Angle-Robust Concept Learning for Physically View-Invariant T2I Adversarial Patches

Wenjun Ji, Yuxiang Fu, Luyang Ying, Deng-Ping Fan, Yuyi Wang, Ming-Ming Cheng, Ivor Tsang, Qing Guo

机构 * NKIARI, Shenzhen Futian(深圳福田NKIARI) VCIP, CS, Nankai University(南开大学VCIP研究所) CRRC Zhuzhou Institute(株洲CRRC研究所) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局CFAR和IHPC)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20977 2025-10-21 cs.CV cs.AI 70%

From Cradle to Cane: A Two-Pass Framework for High-Fidelity Lifespan Face Aging

Tao Liu, Dafeng Zhang, Gengchen Li, Shizhuo Liu, Yongqi Song, Senmao Li, Shiqi Yang, Boqian Li, Kai Wang, Yaxing Wang

机构 * VCIP, College of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Samsung Research China - Beijing (SRC-B)(三星中国北京研究院) School of Electrical and Information Engineering, Zhengzhou University(电气信息学院,郑州大学) School of Computer , Zhengzhou University of Aeronautics(计算机学院,郑州航空大学) Program of Computer Science, City University of Hong Kong (Dongguan)(计算机科学项目,香港城市大学(东莞)) City University of Hong Kong(香港城市大学) Computer Vision Center, Barcelona(巴塞罗那计算机视觉中心)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 32 pages, 12 figures, NeurIPS 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16342 2025-10-21 cs.AI cs.CV 70%

Beyond Fixed Anchors: Precisely Erasing Concepts with Sibling Exclusive Counterparts

Tong Zhang, Ru Zhang, Jianyi Liu, Zhen Yang, Gongshen Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10623 2025-10-17 cs.LG cs.CV 70%

Flows and Diffusions on the Neural Manifold

Daniel Saragih, Deyu Cao, Tejas Balaji

机构 * Queen’s University and Vector Institute(女王大学和向量研究所) University of Tokyo(东京大学) University of Toronto(多伦多大学)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments 43 pages, 11 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04324 2025-10-16 cs.CV 70%

TempFlow-GRPO: When Timing Matters for GRPO in Flow Models

Xiaoxuan He, Siming Fu, Yuke Zhao, Wanli Li, Jian Yang, Dacheng Yin, Fengyun Rao, Bo Zhang

机构 * ZheJiang University(浙江大学) WeChat Vision, Tencent Inc(微信视觉,腾讯公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03355 2025-10-13 cs.LG cs.AI cs.CV 70%

Robustness in Both Domains: CLIP Needs a Robust Text Encoder

Elias Abad Rocamora, Christian Schlarmann, Naman Deep Singh, Yongtao Wu, Matthias Hein, Volkan Cevher

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05660 2025-10-08 cs.CV 70%

Teleportraits: Training-Free People Insertion into Any Scene

Jialu Gao, K J Joseph, Fernando De La Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04576 2025-10-07 cs.LG cs.AI cs.CV stat.ML 70%

SONA: Learning Conditional, Unconditional, and Mismatching-Aware Discriminator

Yuhta Takida, Satoshi Hayakawa, Takashi Shibuya, Masaaki Imaizumi, Naoki Murata, Bac Nguyen, Toshimitsu Uesaka, Chieh-Hsin Lai, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团) The University of Tokyo(东京大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 24 pages with 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22635 2025-09-29 cs.CV cs.LG 70%

Training-Free Synthetic Data Generation with Dual IP-Adapter Guidance

Luc Boudier, Loris Manganelli, Eleftherios Tsonis, Nicolas Dufour, Vicky Kalogeiton

机构 * LIX, École Polytechnique, IP Paris, CNRS(LIX,巴黎高等师范学院,IP巴黎,法国国家科学研究中心) LIGM École des Ponts, IP Paris, CNRS, UGE DIPSY(LIGM 巴黎综合理工学院,IP巴黎,法国国家科学研究中心,UGE DIPSY)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments BMVC 2025. Project page: https://www.lix.polytechnique.fr/vista/projects/2025_bmvc_dipsy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21995 2025-09-29 cs.CV 70%

FailureAtlas:Mapping the Failure Landscape of T2I Models via Active Exploration

Muxi Chen, Zhaohua Zhang, Chenchen Zhao, Mingyang Chen, Wenyu Jiang, Tianwen Jiang, Jianhuan Zhuo, Yu Tang, Qiuyong Xiao, Jihong Zhang, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent(腾讯) Nanjing University(南京大学) Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15270 2025-09-22 cs.CV cs.AI 70%

PRISM: Phase-enhanced Radial-based Image Signature Mapping framework for fingerprinting AI-generated images

Emanuele Ricco, Elia Onofri, Lorenzo Cima, Stefano Cresci, Roberto Di Pietro

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16174 2025-09-19 cs.CV 70%

Erased or Dormant? Rethinking Concept Erasure Through Reversibility

Ping Liu, Chi Zhang

机构 * Department of Computer Science University of Nevada Reno(计算机科学系内华达大学拉斯维加斯分校) Department of Mathematics National University of Singapore(数学系新加坡国立大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Dr. Chi Zhang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06130 2025-09-11 cs.CV cs.CL 70%

Self-Correcting Decoding with Generative Feedback for Mitigating Hallucinations in Large Vision-Language Models

Ce Zhang, Zifu Wan, Zhehan Kan, Martin Q. Ma, Simon Stepputtis, Deva Ramanan, Russ Salakhutdinov, Louis-Philippe Morency, Katia Sycara, Yaqi Xie

机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by ICLR 2025. Project page: https://zhangce01.github.io/DeGF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21254 2025-09-01 cs.CV 70%

Reverse Imaging for Wide-spectrum Generalization of Cardiac MRI Segmentation

Yidong Zhao, Peter Kellman, Hui Xue, Tongyun Yang, Yi Zhang, Yuchi Han, Orlando Simonetti, Qian Tao

机构 * Department of Imaging Physics, Delft University of Technology, Delft, The Netherlands(影像物理系,代尔夫特理工大学,代尔夫特,荷兰) National Heart Lung and Blood Institute, National Institutes of Health, Bethesda, Maryland, USA(国家心肺血液研究所,美国国立卫生研究院,贝塞斯达,马里兰州,美国) Microsoft Research(微软研究院) Cardiovascular Division, The Ohio State University Wexner Medical Center, Columbus, Ohio, USA(心血管科,俄亥俄州立大学韦克斯纳医学中心,哥伦布,俄亥俄州,美国)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20881 2025-08-29 cs.CV 70%

Understanding and evaluating computer vision models through the lens of counterfactuals

Pushkar Shukla

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏