arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2509.21278 2026-03-03 cs.CV cs.AI cs.LG 70%

Does FLUX Already Know How to Perform Physically Plausible Image Composition?

FLUX 是否已经能够进行物理上合理的图像合成?

Shilin Lu, Zhuming Lian, Zihan Zhou, Shaocong Zhang, Chen Zhao, Adams Wai-Kin Kong

机构 * Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 FLUX能否通过SHINE框架实现物理合理的图像合成,通过引入无训练框架和降质抑制指导,提升高保真度和背景完整性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20903 2026-02-27 cs.CV 70%

TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering

TextPecker: 通过奖励结构异常量化提升视觉文本渲染

Hanshen Zhu, Yuliang Liu, Xuecheng Wu, An-Lan Wang, Hao Feng, Dingkang Yang, Chao Feng, Can Huang, Jingqun Tang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) ByteDance(字节跳动)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 TextPecker通过结构异常感知强化学习策略提升视觉文本渲染的结构忠实度和语义对齐度。

Comments Accepted by CVPR 2026; Code: https://github.com/CIawevy/TextPecker

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19557 2026-02-24 cs.CV 70%

The Intricate Dance of Prompt Complexity, Quality, Diversity, and Consistency in T2I Models

提示复杂性、质量、多样性与一致性在T2I模型中的微妙舞蹈

Zhang Xiaofeng, Aaron Courville, Michal Drozdzal, Adriana Romero-Soriano

机构 * FAIR at Meta - Montréal(Meta - Montréal 的 FAIR) Mila - Québec AI Institute(魁北克 AI 院) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能 chair)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文研究了提示复杂性对T2I模型生成数据质量、多样性和一致性的影响,提出新的评估框架并发现提示扩展在生成多样性与美观性上优于真实数据。

Comments accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20836 2026-02-16 cs.CV cs.CR 70%

Vulnerabilities in AI-generated Image Detection: The Challenge of Adversarial Attacks

AI生成图像检测中的漏洞:对抗攻击的挑战

Yunfeng Diao, Naixin Zhai, Changtao Miao, Zitong Yu, Xingxing Wei, Xun Yang, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) School of Computing and Information Technology(计算与信息学院) Institute of Artificial Intelligence(人工智能研究院) Great Bay University(大亚湾大学)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出FPBA方法,通过频域扰动和贝叶斯策略攻击AIGI检测器,揭示对抗攻击对检测器的真实威胁。

Comments Accepted in TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09775 2026-02-11 cs.CV 70%

Where Do Images Come From? Analyzing Captions to Geographically Profile Datasets

图像来自哪里?通过分析描述词地理上剖析数据集

Abhipsa Basu, Yugam Bahl, Kirti Bhagat, Preethi Seshadri, R. Venkatesh Babu, Danish Pruthi

机构 * Indian Institute of Science, Bangalore(印度科学研究院,班加罗尔) TNSQ AI(TNSQ人工智能) University of California, Irvine(加州大学尔湾分校)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究通过分析图像描述词地理分布,发现训练数据严重偏向欧美国家,且代表性与GDP正相关,但生成图像的多样性不足。

Comments 41 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09439 2026-02-11 cs.CV 70%

Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning

Fine-T2I: 一个大规模、高质量且多样化的开放数据集用于高质量T2I微调

Xu Ma, Yitian Zhang, Qihua Dong, Yun Fu

机构 * Department of Electrical \& Computer Engineering, Northeastern University, Boston

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 Fine-T2I是一个大规模高质量开放数据集,通过结合合成和真实图像,提升T2I微调的生成质量和指令遵循性。

Comments Dataset: https://huggingface.co/datasets/ma-xu/fine-t2i

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08127 2026-02-10 cs.CV 70%

TIPO: Text to Image with Text Presampling for Prompt Optimization

TIPO: 文本到图像的文本预采样用于提示优化

Shih-Ying Yeh, Yi Li, Sang-Hyun Park, Giyeong Oh, Xuehai Wang, Min Song, Youngjae Yu, Shang-Hong Lai

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 TIPO通过文本预采样优化提示,提升文本到图像生成的视觉质量和人类偏好度。

Comments 50 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00092 2026-02-03 cs.LG cs.AI cs.CL cs.CV 70%

Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits

通过宪法进行原子概念编辑来解释和控制模型行为

Neha Kalibhat, Zi Wang, Prasoon Bajpai, Drew Proud, Wenjun Zeng, Been Kim, Mani Malek

机构 * Google DeepMind(谷歌DeepMind)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究提出通过原子概念编辑学习模型宪法,以解释和控制模型行为,实验证明其在提升模型成功率方面效果显著。

Journal ref Twenty-Ninth Annual Conference on Artificial Intelligence and Statistics (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22630 2026-02-02 cs.CV 70%

LINA: Linear Autoregressive Image Generative Models with Continuous Tokens

LINA: 基于连续令牌的线性自回归图像生成模型

Jiahao Wang, Ting Pan, Haoge Deng, Dongchen Han, Taiqiang Wu, Xinlong Wang, Ping Luo

机构 * The University of Hong Kong(香港大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 LINA是一种基于线性注意力的高效文本到图像生成模型,通过改进归一化和门控机制,在计算效率和生成质量上取得平衡。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18624 2026-01-27 cs.CV 70%

GeneMAN: Generalizable Single-Image 3D Human Reconstruction from Multi-Source Human Data

GeneMAN: 从多源人类数据中通用的单图像3D人体重建

Wentao Wang, Hang Ye, Fangzhou Hong, Xue Yang, Jianfu Zhang, Yizhou Wang, Ziwei Liu, Liang Pan

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Nanyang Technological University(南洋理工大学) SAIS & SCS, Shanghai Jiao Tong University(上海交通大学SAIS与SCS)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 GeneMAN通过多源高质量数据集和深度学习方法,实现从单张图像到高保真3D人体的通用重建。

Comments Accepted by NeurIPS 2025; Project page: https://roooooz.github.io/GeneMAN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04548 2026-01-23 cs.CV 70%

Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model

Skywork UniPic 2.0: 通过在线强化学习构建 Kontext 模型以实现统一多模态模型

Hongyang Wei, Baixin Xu, Hongbo Liu, Size Wu, Jie Liu, Yi Peng, Peiyu Wang, Zexiang Liu, Jingwen He, Yidan Xietian, Chuanxin Tang, Zidong Wang, Yichen Wei, Liang Hu, Boyi Jiang, Wei Li, Ying He, Yang Liu, Xuchen Song, Yangguang Li, Yahui Zhou

机构 * Skywork Multimodality Team(Skywork多模态团队)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Skywork UniPic 2.0 通过在线强化学习构建 Kontext 模型,实现统一多模态模型,提升图像生成与编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15071 2026-01-22 cs.CV 70%

The Pictorial Cortex: Zero-Shot Cross-Subject fMRI-to-Image Reconstruction via Compositional Latent Modeling

皮层:通过组合潜在建模实现零样本跨主体fMRI到图像重建

Jingyang Huo, Yikai Wang, Yanwei Fu, Jianfeng Feng

机构 * Institute of Science and Technology for Brain-inspired Intelligence (ISTBI), Fudan University(脑启发智能科学与技术研究院,复旦大学) School of Data Science, Fudan University(复旦大学数据科学学院) Fudan ISTBI–ZJNU Algorithm Centre for Brain-Inspired Intelligence, Zhejiang Normal University(复旦ISTBI-浙师大脑启发智能算法中心,浙江师范大学) Shanghai Innovation Institute(上海创新研究院) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出PictorialCortex模型,通过组合潜在建模和多数据集训练,实现零样本跨主体fMRI到图像重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10803 2026-01-19 cs.CR cs.AI cs.CV 70%

Beyond Known Fakes: Generalized Detection of AI-Generated Images via Post-hoc Distribution Alignment

超越已知伪造:通过事后分布对齐实现AI生成图像的通用检测

Li Wang, Wenyu Chen, Xiangtao Meng, Zheng Li, Shanqing Guo

机构 * School of Cyber Science and Technology, Shandong University(网络安全科学与技术学院,山东大学) State Key Laboratory of Cryptography and Digital Economy Security, Shandong University(密码与数字经济安全国家重点实验室,山东大学) Shandong Key Laboratory of Artificial Intelligence Security, Shandong University(人工智能安全山东省重点实验室,山东大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出PDA框架,通过事后分布对齐实现对未知生成器AI图像的通用检测,实验显示其在16种生成模型上的检测准确率达96.69%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10035 2026-01-14 cs.GR cs.AI 70%

FastFLUX: Pruning FLUX with Block-wise Replacement and Sandwich Training

FastFLUX: 通过块级替换和 sandwich 训练进行 FLUX 剪枝

Fuhan Cai, Yong Guo, Jie Li, Wenbo Li, Jian Chen, Xiangzhong Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) South China University of Technology(华南理工大学) Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.GR

AI总结 FastFLUX 通过块级替换和 sandwich 训练方法,提高 FLUX 模型的推理效率和图像质量。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07293 2026-01-13 cs.CV 70%

Inference-Time Scaling for Visual AutoRegressive modeling by Searching Representative Samples

推理时的缩放用于视觉自回归建模通过搜索代表性样本

Weidong Tang, Xinyan Wan, Siyu Li, Xiumei Wang

机构 * School of Electronic Engineering, Xidian University, Xi'an, China(西安电子科技大学电子工程学院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出VAR-Scaling框架,通过搜索代表性样本解决VQ视觉自回归建模中的离散潜在空间问题,提升推理过程的生成质量。

Comments Accepted to PRCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06169 2026-01-13 cs.CV 70%

Think Bright, Diffuse Nice: Enhancing T2I-ICL via Inductive-Bias Hint Instruction and Query Contrastive Decoding

Think Bright, Diffuse Nice: 通过归纳偏置提示指令和查询对比解码增强T2I-ICL

Zhiyong Ma, Zhenpeng Li, Yuanjie Shi, Zhengping Li, Jiahao Chen, Qingyuan Chuai

机构 * Cao Tu Li (Guangzhou) Technology Co., Ltd(曹图利(广州)科技有限公司) South China University of Technology(华南理工大学) Washington State University(华盛顿州立大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 TBDN通过引入归纳偏置提示指令和查询对比解码,有效解决T2I-ICL中的合规性失败和先验主导幻觉问题,实现高效可靠的图像生成。

Comments Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07198 2026-01-08 cs.CV cs.CL 70%

Generating Storytelling Images with Rich Chains-of-Reasoning

通过丰富的推理链生成叙事图像

Xiujie Song, Qi Jia, Shota Watanabe, Xiaoyi Pang, Ruijie Chen, Mengyue Wu, Kenny Q. Zhu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) East China University of Technology, China(东华大学,中国) University of Texas at Arlington, USA(德克萨斯大学阿灵顿分校,美国)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出StorytellingPainter,通过结合大语言模型推理与文本到图像合成,生成具有丰富推理链的叙事图像,并引入评估框架和轻量级模型以提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02771 2026-01-07 cs.CV 70%

AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs

AbductiveMLLM: 提升多模态大语言模型中的视觉归纳推理

Boyu Chang, Qi Wang, Xi Guo, Zhixiong Nan, Yazhou Yao, Tianfei Zhou

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 AbductiveMLLM通过结合REASONER和IMAGINER组件,提升多模态大语言模型在视觉归纳推理中的性能。

Comments Accepted by AAAI 2026 as Oral. Code:https://github.com/ChangPtR/AbdMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV 70%

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20479 2025-12-24 cs.CV 70%

UTDesign: A Unified Framework for Stylized Text Editing and Generation in Graphic Design Images

UTDesign: 一种统一框架,用于图形设计图像中的风格化文本编辑与生成

Yiming Zhao, Yuanpeng Gao, Yuxuan Luo, Jiwei Duan, Shisong Lin, Longfei Xiong, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 UTDesign提出了一种统一框架,实现高精度风格化文本编辑与生成,支持中英文文本,通过多模态编码器和DiT模型提升设计图像中的文本生成与编辑能力。

Comments 22 pages, 25 figures, SIGGRAPH Asia 2025, Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11705 2025-12-24 cs.CV 70%

FiGO: Fine-Grained Object Counting without Annotations

FiGO:无需标注的细粒度物体计数

Adriano D'Alessandro, Ali Mahdavi-Amiri, Ghassan Hamarneh

机构 * Simon Fraser University(西蒙 Fraser 大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 FiGO是一种无需标注的细粒度物体计数方法,通过生成合成示例和学习紧凑概念嵌入,实现对细粒度类别的准确计数。

Comments data - https://dalessandro.dev/datasets/lookalikes/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06032 2025-12-18 cs.CV 70%

Learning 3D Texture-Aware Representations for Parsing Diverse Human Clothing and Body Parts

学习3D纹理感知表示以解析多样化的人类服装和身体部位

Kiran Chhatre, Christopher Peters, Srikrishna Karanam

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 Spectrum通过改进的3D纹理生成模型,实现了对多样化人类服装和身体部位的精细解析与分割。

Comments Association for the Advancement of Artificial Intelligence (AAAI) 2026, 14 pages, 11 figures. Webpage: https://s-pectrum.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07504 2025-12-09 cs.CV 70%

ControlVP: Interactive Geometric Refinement of AI-Generated Images with Consistent Vanishing Points

ControlVP: 交互式几何校正AI生成图像以保持一致的消失点

Ryota Okumura, Kaede Shiohara, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 ControlVP通过结合建筑轮廓的结构指导和几何约束,校正AI生成图像中的消失点不一致,提升空间结构真实性。

Comments Accepted to WACV 2026, 8 pages, supplementary included. Dataset and code: https://github.com/RyotaOkumura/ControlVP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03905 2025-12-04 cs.CV 70%

Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence

无监督视频翻译与编辑中的帧空间-时间对应

Shuai Yang, Junxin Lin, Yifan Zhou, Ziwei Liu, Chen Change Loy

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 FRESCO通过整合帧内与帧间对应关系,提升视频翻译与编辑的空间-时间一致性,实现高质量、一致的视频生成。

Comments Code: https://github.com/Sunnycookies/FRESCO-v2, Project: https://williamyang1991.github.io/projects/FRESCOv2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03463 2025-12-04 cs.CV cs.AI cs.CL 70%

Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models

文本打印图像:为以文本为中心的大型视觉-语言模型训练弥合图像-文本模态差距

Shojiro Yamabe, Futa Waseda, Daiki Shiono, Tsubasa Takahashi

机构 * Turing Inc.(图灵公司) Institute of Science Tokyo(东京科学研究院) The University of Tokyo(东京大学) Tohoku University(东北大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出文本打印图像(TPI)技术,通过生成合成图像弥合图像-文本模态差距,提升以文本为中心的大型视觉-语言模型训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05127 2025-12-04 eess.IV cs.CV q-bio.QM 70%

PixCell: A generative foundation model for digital histopathology images

PixCell:数字病理图像的生成基础模型

Srikar Yellapragada, Alexandros Graikos, Zilinghan Li, Kostas Triaridis, Varun Belagali, Tarak Nath Nandi, Karen Bai, Beatrice S. Knudsen, Tahsin Kurc, Rajarsi R. Gupta, Prateek Prasanna, Ravi K Madduri, Joel Saltz, Dimitris Samaras

机构 * Stony Brook University(石溪大学) Argonne National Laboratory(阿贡国家实验室) The University of Chicago(芝加哥大学) University of Utah(犹他大学)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 PixCell是首个针对数字病理图像的生成基础模型,通过扩散模型在大规模数据集上训练,实现隐私保护的数据生成和虚拟染色任务,提升病理学研究效率。

Comments Project page - https://histodiffusion.github.io/docs/projects/pixcell

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00557 2025-12-02 cs.CV 70%

NeuroVolve: Evolving Visual Stimuli toward Programmable Neural Objectives

NeuroVolve:通过可编程神经目标演化视觉刺激

Haomiao Chen, Keith W Jamison, Mert R. Sabuncu, Amy Kuceyeski

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) Weill Cornell Medicine(韦尔医学院)

专题命中 文生图 :image editing(abstract);image synthesis(abstract);分类 cs.CV

AI总结 NeuroVolve通过可编程神经目标生成视觉刺激,揭示大脑区域间的协同与对抗性调节关系,实现脑引导的图像编辑与首选刺激生成的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05068 2025-12-02 cs.CV cs.AI cs.CR 70%

ICAS: Detecting Training Data from Autoregressive Image Generative Models

ICAS: 从自回归图像生成模型中检测训练数据

Hongyao Yu, Yixiang Qiu, Yiheng Yang, Hao Fang, Tianqu Zhuang, Jiaxin Hong, Bin Chen, Hao Wu, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院) Shenzhen ShenNong Information Technology Co., Ltd.(深圳深农信息技术有限公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 ICAS通过隐含分类和自适应得分聚合策略,从自回归图像生成模型中检测训练数据,揭示了大型模型的脆弱性,并展示了在不同场景下的有效性。

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22982 2025-12-01 cs.CV cs.AI 70%

Ovis-Image Technical Report

Ovis-Image 技术报告

Guo-Hua Wang, Liangfu Cao, Tianyu Cui, Minghao Fu, Xiaohao Chen, Pengxin Zhan, Jianshan Zhao, Lan Li, Bowen Fu, Jiaqi Liu, Qing-Guo Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 Ovis-Image 是一个70亿参数的文本到图像模型,通过优化的多模态主干和文本聚焦训练方法,在紧凑架构下实现与大型开源模型相当的文本渲染性能。

Comments Code is released at https://github.com/AIDC-AI/Ovis-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04675 2025-12-01 cs.CV 70%

InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation

InfinityStar: 一种统一的时空自回归模型用于视觉生成

Jinlai Liu, Jian Han, Bin Yan, Hui Wu, Fengda Zhu, Xing Wang, Yi Jiang, Bingyue Peng, Zehuan Yuan

机构 * ByteDance(字节跳动)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 InfinityStar是一种统一的时空自回归模型,能够高效生成高分辨率图像和动态视频,其在VBench上的表现优于现有自回归模型,且生成速度显著快于扩散方法。

Comments NeurIPS 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏