arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-27 至 2026-03-27 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2511.22989 2026-03-27 cs.CV 88%

MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation

MultiBanana:多参考文本到图像生成的挑战性基准

Yuta Oshima, Daiki Miyake, Kohsei Matsutani, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出MultiBanana基准,用于评估多参考文本到图像生成模型的能力,涵盖参考数量变化、领域不匹配、尺度不匹配、罕见概念和多语言参考等挑战,分析不同模型的性能与不足。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12760 2026-03-27 cs.MM cs.AI cs.CV 87%

A User-Friendly Framework for Generating Model-Preferred Prompts in Text-to-Image Synthesis

一种用户友好的生成模型偏好提示框架

Nailei Hei, Qianyu Guo, Zihao Wang, Yan Wang, Haofen Wang, Wenqiang Zhang

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);分类 cs.CV、cs.MM

AI总结 本文提出UF-FGTG框架,通过粗细粒度提示数据集和自适应特征提取模块,自动优化用户输入提示以生成更高质量的图像。

Comments Accepted by The 38th Annual AAAI Conference on Artificial Intelligence (AAAI 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24965 2026-03-27 cs.CV cs.AI 83%

Self-Corrected Image Generation with Explainable Latent Rewards

可解释性潜在奖励的自校正图像生成

Yinyi Luo, Hrishikesh Gokhale, Marios Savvides, Jindong Wang, Shengfeng He

机构 * Carnegie Mellon University(卡内基梅隆大学) Singapore Management University(新加坡管理大学) William & Mary(威廉与玛丽学院)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出xLARD框架,利用多模态大语言模型通过可解释性潜在奖励指导生成,改进语义对齐和视觉保真度,同时保持生成先验。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21208 2026-03-27 cs.CV cs.LG 83%

JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimization

JANUS:通过分布优化轻量级框架实现文本到图像模型的 jailbreak 攻击

Haolun Zheng, Yu He, Tailun Chen, Shuo Shao, Zhixuan Chu, Hongbin Zhou, Lan Tao, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Alibaba Group(阿里巴巴集团) Hangzhou HighTech Zone (Binjiang) Blockchain and Data Security Research Institute(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 JANUS 通过分布优化实现文本到图像模型的 jailbreak 攻击,提升 ASR-8 评分并保持语义,适用于开源和商业模型。

Comments This paper is accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25738 2026-03-27 cs.CV 57%

PSDesigner: Automated Graphic Design with a Human-Like Creative Workflow

PSDesigner: 基于人类创意流程的自动化图形设计

Xincheng Shuai, Song Tang, Yutong Huang, Henghui Ding, Dacheng Tao

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院大数据研究所) Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院生成式人工智能实验室)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 PSDesigner通过模拟人类设计师的创意流程,实现了自动化图形设计,通过设计数据集CreativePSD提升工具使用能力,在多种设计任务中优于现有方法,使非专业人士能轻松创建高质量设计。

Comments CVPR 2026, Project Page: https://henghuiding.com/PSDesigner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05042 2026-03-27 cs.CV cs.RO 57%

CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection

CoIn3D:重新审视配置不变的多摄像头3D目标检测

Zhaonian Kuang, Rui Ding, Haotian Wang, Xinhu Zheng, Meng Yang, Gang Hua

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室) Intelligent Transportation Thrust of the Systems Hub, HKUST(GZ)(香港科技大学(广州)系统枢纽智能交通学域) Amazon Alexa AI(亚马逊Alexa人工智能)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出CoIn3D框架,通过空间先验整合和摄像头感知数据增强,提升多摄像头3D目标检测在不同配置下的泛化能力。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24730 2026-03-27 cs.CV 57%

A Framework for Generating Semantically Ambiguous Images to Probe Human and Machine Perception

一种生成语义模糊图像的框架以探测人类和机器感知

Yuqi Hu, Vasha DuTell, Ahna R. Girshick, Jennifer E. Corbett

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 该研究通过生成语义模糊图像探讨人类和机器感知的边界,揭示模型在概念区分上的偏差,展示控制模糊性作为诊断工具的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏