arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-04 至 2026-08-04 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2608.01780 2026-08-04 cs.CV cs.AI 新提交 83%

Investigating Social Bias in Narrative Image Generation

探究叙事图像生成中的社会偏见

Junyeong Park, Sowon Min, Euna Jang, Soobin Kim, Jiho Jin, Hyunseung Lim, Gahyeon Bae, Hwajung Hong

机构 * KAIST(韩国科学技术院)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究将偏见评估框架BBG适配图像生成,对比6种T2I模型在照片、分镜、漫画生成中的偏见表现,发现叙事视觉形式中偏见更易显现,强调需用多样视觉形式评估T2I系统。

Comments Accepted to GenAI4World Workshop at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00598 2026-08-04 cs.MM cs.CY 新提交 79%

EmergencyBias: Bias in Text-to-Image Models under Emergency Scenarios

EmergencyBias:文本到图像模型在应急场景下的偏差

Haibo Tang, Linqi Zhang, Hongxin Huan, Chenwei Lin, Xian Xu

专题命中 文生图 :text-to-image(title,abstract);分类 cs.MM

AI总结 本文定义了T2I模型在应急场景下的EmergencyBias,构建评估框架发现其存在人口统计学与行为偏差,提出ActionAlign方法可减少行为差异并保留图像质量。

Comments 15 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00973 2026-08-04 cs.CL 新提交 78%

Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems

关注差距:基于文本到图像系统中过滤器-生成器差异的零查询越狱攻击

Wanguang Li, Zhaoxin Wang, Handing Wang

专题命中 文生图 :text-to-image(title,abstract)

AI总结 该研究针对文本到图像系统的零查询越狱问题,提出基于过滤器-生成器差异的框架,通过筛选与集成进化搜索提升攻击成功率,在六个黑盒管线及商业服务上效果优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08831 2026-08-04 cs.GR cs.CV cs.RO 版本更新 62%

DiffPhysCam: Differentiable Physics-Based Camera Simulation for Inverse Rendering and Embodied AI

DiffPhysCam:面向逆渲染与具身智能的可微分基于物理的相机仿真

Bo-Hsun Chen, Nevindu M. Batagoda, Dan Negrut

机构 * Simulation-Based Engineering Lab, University of Wisconsin-Madison(模拟基于工程实验室,威斯康星大学麦迪逊分校)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 本文提出DiffPhysCam,一款可微分基于物理的相机模拟器,解决现有虚拟相机局限,支持正向与逆渲染,经实验验证可提升机器人感知性能,还用于自主地面车辆导航的虚拟实验。

Comments 37 pages, 24 figures, and 5 tables. Code of DiffPhysCam-CamCaliExp: https://github.com/DanielYamChen/DiffPhysCam-CamCaliExp Code of DiffPhysCam-NovelViewSynthesis: https://github.com/DanielYamChen/DiffPhysCam-NovelViewSynthesis Data of DiffPhysCam_Data: https://huggingface.co/datasets/DanielYamChen/DiffPhysCam_Data Simulation video: https://youtu.be/gQwSMrdmHJI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00994 2026-08-04 cs.CV cs.CL 新提交 57%

Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image Captioning

零样本图像描述中合成监督的实体忠实修复

Zhiyue Liu, Wenkai Zhou, Jian Qin, Qipeng Jiang

机构 * Guangxi University(广西大学) School of Computer, Electronics and Information(计算机与电子信息学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 针对零样本图像描述中合成监督的实体级错位问题,提出即插即用框架ReCap,通过实体级重对齐与自适应加权策略优化合成数据,在两类基准上实现最优性能。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00559 2026-08-04 cs.CV 新提交 57%

Test-Time Curriculum for Open-Set AIGC Detection

开放集AIGC检测的测试时课程

Yiqian Zhang, Zheyuan Gu, Xiangzhao Hao, Zefeng Zhang, Jingjia Mao, Jiahao Hu, Jiaxu Miao, Jun Yu, Zhenyu Zhang, Shuohuan Wang, Yu Sun

机构 * Baidu Inc.(百度公司)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本研究针对开放集AIGC检测的分布偏移问题,提出Test-Time Curriculum框架,结合跨尺度伪标签细化技术,构建AIGCGuard基准,经实验验证可显著提升未见生成器偏移下的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00410 2026-08-04 cs.AI cs.CL cs.CV 新提交 57%

Where did the ambiguity go? Examining how multimodal models interpret polysemous words

歧义去了哪里?探究多模态模型如何解释多义词

Jasin Cekinmez, Addison J. Wu, Raja Marjieh, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 该研究对比17个文本到图像模型和15个文本生成模型,发现多模态模型生成图像的词义多样性低于文本,揭示了基础模型在不同模态间意义表达的迁移 gap。

Comments Oral Presentation, Sci-FM Workshop @ COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏