arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-04 至 2026-08-04 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 3 篇

2608.00674 2026-08-04 cs.CV 新提交 70%

CopyCat: Improving Fine-Grained Subject Consistency in Subject-to-Image Models within Seconds

CopyCat:在数秒内提升主体到图像模型中的细粒度主体一致性

Peng Zheng, Ruiqi Liu, Rui Ma, Zuxuan Wu

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出轻量级模型精调框架CopyCat,通过附加FCLoRA在数秒内提升主体到图像模型的细粒度主体一致性,经DreamBench等实验验证,可适配多样未见过的主体与提示并取得持续效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01988 2026-08-04 cs.CV 新提交 57%

Grounding and Explaining Visual Evidence for AI-Generated Image Detection in Human-Centric Scenes

面向以人为中心场景中AI生成图像检测的视觉证据定位与解释

Kun Guo, Yuzhou Yang, Haoyue Wang, Qichao Ying, Sheng Li, Zhenxing Qian

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 针对以人为中心场景AI生成图像检测的证据定位与解释局限,提出HAVE数据集及PAVE框架,实现真伪预测、证据定位与解释生成,实验表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17020 2026-08-04 cs.CV cs.AI 版本更新 57%

FusionRS: A Large-Scale RGB-Infrared-Style Remote Sensing Dataset for Cross-Modal Vision-Language Learning

FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集

Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Dingyi Lu, Chengyin Hu, Luwei Yang, Fengyu Zhang, Yiwei Wei, Jiujiang Guo

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) University of Electronic Science and Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 个性化与一致性 :generative vision(abstract);分类 cs.CV

AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏