arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3480 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2605.07230 2026-05-11 cs.CV cs.AI 77%

CASCADE: Context-Aware Relaxation for Speculative Image Decoding

CASCADE:基于上下文的放松方法用于推测图像解码

Selin Yildirim, Subhajit Dutta Chowdhury, Mohammad Mahdi Kamani, Vikram Appia, Deming Chen

机构 * AMD(AMD公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CASCADE方法,通过捕捉目标模型隐藏状态中的冗余性,在不额外训练的情况下实现接受放松,提升推测解码效率,实验表明在多模态模型中达到3.6倍加速,保持图像质量和提示一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10949 2026-04-14 cs.CV cs.AI 77%

Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models

伪统一:熵探测揭示统一多模态模型中分歧的信息模式

Songlin Yang, Xianghao Kong, Anyi Rao

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 研究揭示统一多模态模型中伪统一现象的根源,通过信息论方法分析输入编码和输出生成,发现模态不对称编码和响应模式分裂是导致分歧的主要原因,强调信息流一致性对真实多模态协同的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20068 2026-04-13 cs.CV 77%

PRADA: Probability-Ratio-Based Attribution and Detection of Autoregressive-Generated Images

PRADA:基于概率比的自回归生成图像归因与检测

Simon Damm, Jonas Ricker, Henning Petzka, Asja Fischer

机构 * Ruhr University Bochum(波鸿鲁尔大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出PRADA方法,通过分析自回归生成图像的概率比特征,实现对生成图像的可靠检测和归因,适用于多种图像生成模型。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition - Findings Track (CVPRF 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24383 2026-03-26 cs.CV 77%

ViHOI: Human-Object Interaction Synthesis with Visual Priors

ViHOI:基于视觉先验的人-物交互合成

Songjin Cai, Linjie Zhong, Ling Guo, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 ViHOI通过从2D图像中提取丰富的交互先验,利用扩散模型提升生成质量,实现人-物交互的高质量合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19157 2026-03-20 cs.CV 77%

ADAPT: Attention Driven Adaptive Prompt Scheduling and InTerpolating Orthogonal Complements for Rare Concepts Generation

ADAPT:基于注意力的自适应提示调度与稀有概念生成的插值正交补集

Kwanyoung Lee, Hyunwoo Oh, SeungJu Cha, Sungho Koh, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 ADAPT框架通过确定性提示调度和语义对齐,提升稀有概念生成效果,无需额外训练,在RareBench基准上表现优异。

Comments Accepted in CVPR 2026 (findings). 10 pages, 4 figures; supplementary material included (8 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14041 2026-03-16 cs.CV cs.AI 77%

BitDance: Scaling Autoregressive Generative Models with Binary Tokens

BitDance: 通过二进制令牌扩展自回归生成模型

Yuang Ai, Jiaming Han, Shaobin Zhuang, Weijia Mao, Xuefeng Hu, Ziyan Yang, Zhenheng Yang, Yali Wang, Huaibo Huang, Xiangyu Yue, Hao Chen

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 BitDance通过二进制令牌生成高熵表示,结合二进制扩散头和next-patch扩散方法,实现高效图像生成,达到最佳FID分数并显著提升推理速度。

Comments Code and models: https://github.com/shallowdream204/BitDance

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10210 2026-03-12 cs.CV cs.AI 77%

Delta-K: Boosting Multi-Instance Generation via Cross-Attention Augmentation

Delta-K: 通过交叉注意力增强提升多实例生成

Zitong Wang, Zijun Shen, Haohao Xu, Zhengjie Luo, Weibin Wu

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Nanjing University(南京大学) College of Management and Economics, Tianjin University(天津大学管理学院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 Delta-K通过在交叉注意力键空间中直接操作,解决扩散模型在多实例生成中的概念遗漏问题,提升生成质量且无需额外训练或架构修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02686 2026-02-27 cs.CV 77%

ClimaOoD: Improving Anomaly Segmentation via Physically Realistic Synthetic Data

ClimaOoD: 通过物理真实合成数据提升异常分割

Yuxing Liu, Zheng Li, Huanhuan Liang, Ji Zhang, Zeyu Sun, Yong Liu

机构 * Beijing University of Chemical Technology(北京化工大学) Southwest Minzu University(西南民族大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 ClimaOoD通过生成物理真实且语义连贯的合成数据,提升异常分割的鲁棒性和泛化能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10546 2026-02-12 cs.CV cs.AI 77%

RealHD: A High-Quality Dataset for Robust Detection of State-of-the-Art AI-Generated Images

RealHD:一个高质量数据集,用于鲁棒检测最新AI生成图像

Hanzhe Yu, Yun Ye, Jintao Rong, Qi Xuan, Chen Ma

机构 * Institute of Cyberspace Security, Zhejiang University of Technology(网络安全研究院,浙江工业大学) Intel Corporation(英特尔公司) College of Information Engineering, Zhejiang University of Technology(信息工程学院,浙江工业大学) Binjiang Institute of Artificial Intelligence, ZJUT(滨江人工智能研究所,浙江工业大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);inpainting(abstract);分类 cs.CV

AI总结 RealHD数据集通过高质量图像和先进生成方法,提升AI生成图像检测的鲁棒性和泛化能力,并提出基于噪声熵的轻量级检测方法。

Comments Published in the Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025)

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025), 2025, pp. 11394--11403

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01193 2026-02-03 cs.CL cs.CV 77%

Bridging Lexical Ambiguity and Vision: A Mini Review on Visual Word Sense Disambiguation

弥合词汇歧义与视觉:关于视觉词义消歧的简要综述

Shashini Nilukshi, Deshan Sumanathilaka

机构 * School of Computing Informatics(计算与信息学学院) Institute of Technology(技术研究所)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文综述了视觉词义消歧的发展,探讨了对比模型和LLM在解决词汇歧义中的作用,并指出未来发展方向。

Comments 2 figures, 2 Tables, Accepted at IEEE TIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22400 2026-02-03 cs.CV 77%

Closing the Safety Gap: Surgical Concept Erasure in Visual Autoregressive Models

弥合安全鸿沟:视觉自回归模型中的手术概念擦除

Xinhao Zhong, Yimin Zhou, Zhiqi Zhang, Junhao Li, Yi Sun, Bin Chen, Shu-Tao Xia, Xuan Wang, Ke Xu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Jilin University(吉林大学) Peng Cheng Laboratory(鹏城实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出S-VARE方法,通过过滤交叉熵损失和保留损失实现VAR模型中的精确概念擦除,有效解决安全性和生成质量之间的平衡问题。

Comments Accepted toICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02567 2026-01-27 cs.CV 77%

Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities

统一的多模态理解和生成模型:进展、挑战与机遇

Shanshan Zhao, Xinjie Zhang, Jintao Guo, Jiakui Hu, Lunhao Duan, Minghao Fu, Yong Xien Chng, Guo-Hua Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团) Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文探讨了多模态理解和生成模型的统一进展、挑战与机遇,分析了不同架构范式及未来研究方向。

Comments In this version, we incorporate new papers (after Aug. 2025), datasets, and benchmarks. This work is still in progress; Github project: https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06574 2026-01-13 cs.CV 77%

APEX: Learning Adaptive Priorities for Multi-Objective Alignment in Vision-Language Generation

APEX: 为视觉-语言生成中的多目标对齐学习自适应优先级

Dongliang Chen, Xinlin Zhuang, Junjie Xu, Luojian Xie, Zehui Wang, Jiaxi Zhuang, Haolin Yang, Liang Dou, Xiao He, Xingjiao Wu, Ying Qian

机构 * East China Normal University(东华师范大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 APEX通过双阶段自适应归一化和P^3自适应优先级,提升视觉-语言生成中多目标对齐的稳定性与性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21015 2026-01-09 cs.CV 77%

FluencyVE: Marrying Temporal-Aware Mamba with Bypass Attention for Video Editing

FluencyVE:将时间感知Mamba与旁路注意力相结合用于视频编辑

Mingshu Cai, Yixuan Li, Osamu Yoshie, Yuya Ieiri

机构 * Waseda University, Japan(早稻田大学,日本) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 FluencyVE通过结合时间感知Mamba与旁路注意力,实现高效的视频编辑,减少计算成本并提升生成能力。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12800 2025-12-16 cs.CV 77%

Learning Common and Salient Generative Factors Between Two Image Datasets

学习两个图像数据集之间的共同和显著生成因素

Yunlong He, Gwilherm Lesné, Ziqian Liu, Michaël Soumm, Pietro Gori

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)

专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种新的对比分析框架,用于学习两个图像数据集之间的共同和显著生成因素,适用于GAN和扩散模型,提升了生成质量与分离能力。

Comments This is the author's version of a work submitted to IEEE for possible publication. The final version may differ from this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21209 2025-12-04 cs.CV cs.AI 77%

BitMark: Watermarking Bitwise Autoregressive Image Generative Models

BitMark: 图像生成模型中位级水印技术

Louis Kerner, Michel Meintz, Bihe Zhao, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA 河岸信息安全中心)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 BitMark通过位级水印技术防止图像生成模型中的模型崩溃,确保生成内容可检测。

Comments Accepted as a Conference Paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03726 2025-11-25 cs.CV 77%

DICE: Distilling Classifier-Free Guidance into Text Embeddings

DICE: 将分类器无关引导 distilling 进文本嵌入

Zhenyu Zhou, Defang Chen, Can Wang, Chun Chen, Siwei Lyu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 DICE通过减少计算开销,在保持生成质量的同时,将基于CFG的文本到图像扩散模型转换为无CFG版本,提升图像生成效率。

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17547 2025-11-25 eess.SP cs.AI cs.CV cs.HC cs.LG 77%

SYNAPSE: Synergizing an Adapter and Finetuning for High-Fidelity EEG Synthesis from a CLIP-Aligned Encoder

SYNAPSE: 适配器与微调协同实现高保真EEG信号到图像的合成

Jeyoung Lee, Hochul Kang

机构 * The Catholic University of Korea(韩国天主大学)

专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 SYNAPSE通过结合适配器与微调技术,实现了高保真EEG信号到图像的合成,提升了EEG数据的图像生成质量和跨受体泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22946 2025-11-21 cs.CV 77%

LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation

LightFusion: 一种轻量级、双融合框架用于统一多模态理解和生成

Zeyu Wang, Zilong Chen, Chenhui Gou, Feng Li, Chaorui Deng, Deyao Zhu, Kunchang Li, Weihao Yu, Haoqin Tu, Haoqi Fan, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) Tsinghua University(清华大学) Monash University(墨尔本大学) ByteDance Seed Project(字节跳动种子项目)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 LightFusion通过双融合机制实现轻量级多模态理解和生成,仅用350亿个标记训练即在多个基准测试中取得优异成绩。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13713 2025-11-18 cs.CV 77%

Free-Form Scene Editor: Enabling Multi-Round Object Manipulation like in a 3D Engine

Xincheng Shuai, Zhenyuan Qin, Henghui Ding, Dacheng Tao

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

Comments AAAI 2026, Project Page: https://henghuiding.com/FFSE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26105 2025-10-31 cs.CV cs.AI cs.CR 77%

Security Risk of Misalignment between Text and Image in Multi-modal Model

Xiaosen Wang, Zhijin Ge, Shaokang Wang

机构 * Xidian University(西安电子科技大学) Shanghai Jiaotong University(上海交通大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06220 2025-10-31 cs.CV cs.AI 77%

GenIR: Generative Visual Feedback for Mental Image Retrieval

Diji Yang, Minghao Liu, Chung-Hsiang Lo, Yi Zhang, James Davis

机构 * University of California Santa Cruz(加州大学圣克ruz分校) Northeastern University(东北大学) Accenture(Accenture公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24640 2025-10-29 cs.CV 77%

A Dual-Branch CNN for Robust Detection of AI-Generated Facial Forgeries

Xin Zhang, Yuqi Song, Fei Zuo

机构 * Computer Science Department University of Southern Maine Portland, United States(计算机科学系 俄亥俄州立大学 帕斯托市 美国) The Department of Computer Science University of Central Oklahoma Edmond, United States(计算机科学系 中央俄克拉荷马大学 埃德蒙德 美国)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12323 2025-10-23 cs.CV 77%

Doctor Approved: Generating Medically Accurate Skin Disease Images through AI-Expert Feedback

Janet Wang, Yunbei Zhang, Zhengming Ding, Jihun Hamm

机构 * Tulane University(路易斯安那州立大学)

专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01480 2025-10-22 cs.CV 77%

Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning

Kaihang Pan, Yang Wu, Wendong Bu, Kai Shen, Juncheng Li, Yingting Wang, Yunfei Li, Siliang Tang, Jun Xiao, Fei Wu, Hang Zhao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15257 2025-10-09 cs.CV cs.LG 77%

RespoDiff: Dual-Module Bottleneck Transformation for Responsible & Faithful T2I Generation

Silpa Vadakkeeveetil Sreelatha, Sauradip Nag, Muhammad Awais, Serge Belongie, Anjan Dutta

机构 * University of Surrey(塞雷尔大学) Simon Fraser University(西蒙弗雷泽大学) University of Copenhagen(哥本哈根大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06827 2025-10-09 cs.CV 77%

StyleKeeper: Prevent Content Leakage using Negative Visual Query Guidance

Jaeseok Jeong, Junho Kim, Gayoung Lee, Yunjey Choi, Youngjung Uh

机构 * Yonsei University(延世大学) NAVER AI Lab(NAVER AI实验室)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICCV 2025; CVPRW AI4CC 2024 (Best Paper + Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18639 2025-09-26 cs.CV 77%

Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation

Yuanhuiyi Lyu, Chi Kit Wong, Chenfei Liao, Lutao Jiang, Xu Zheng, Zexin Lu, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学) Huawei Hong Kong Research Center(华为香港研究中心)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16197 2025-09-22 cs.CV cs.CL cs.LG 77%

MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer

Yanghao Li, Rui Qian, Bowen Pan, Haotian Zhang, Haoshuo Huang, Bowen Zhang, Jialing Tong, Haoxuan You, Xianzhi Du, Zhe Gan, Hyunjik Kim, Chao Jia, Zhenbang Wang, Yinfei Yang, Mingfei Gao, Zi-Yi Dou, Wenze Hu, Chang Gao, Dongxu Li, Philipp Dufter, Zirui Wang, Guoli Yin, Zhengdong Zhang, Chen Chen, Yang Zhao, Ruoming Pang, Zhifeng Chen

机构 * Apple(苹果公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15537 2025-09-05 cs.CV 77%

MUNBa: Machine Unlearning via Nash Bargaining

Jing Wu, Mehrtash Harandi

机构 * Department of Data Science & AI(数据科学与人工智能系) Department of Electrical and Computer Systems Engineering(电气与计算机系统工程系)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏