arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-20 至 2026-05-20 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 7 篇

2605.02223 2026-05-20 cs.SD cs.CV 79%

Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization

迈向细粒度语音修补取证:一个多区域篡改定位的数据集、方法和度量标准

Tung Vu, Yen Nguyen, Hai Nguyen, Cuong Pham, Cong Tran

机构 * Posts and Telecommunications Institute of Technology

专题命中 图像生成评测 :inpainting(title,abstract);分类 cs.CV

AI总结 本文提出MIST数据集、ISA方法和SF1@tau度量标准,用于多区域语音修补检测,揭示现有深度伪造检测器在细粒度语音修补检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19712 2026-05-20 cs.CV 74%

Physics-informed simulation framework for realistic sonar image generation and statistical validation

具有物理信息的模拟框架用于真实声纳图像生成和统计验证

Kamal Basha S, Athira Nambiar

机构 * Department of Computational Intelligence, SRM Institute of Science

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文提出了一种基于物理的模拟框架ACOUSIM,用于生成真实声纳图像并进行统计验证,通过比较合成与真实声纳图像的统计特性,建立了可重复的分布级基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19957 2026-05-20 cs.CV cs.AI cs.RO 57%

World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks

为混合具身体验中的长时域演化构建世界-自我模型

Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种新的世界-自我建模范式,通过分解未来演化为世界和自我组件,解决混合任务中长时域具身体验中的退化问题,并通过HTEWorld基准测试验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25897 2026-05-20 cs.CV cs.LG 57%

MIRO: MultI-Reward cOnditioned pretraining improves T2I quality and efficiency

MIRO:多奖励条件预训练提升T2I质量和效率

Nicolas Dufour, Lucas Degeorge, Arijit Ghosh, Vicky Kalogeiton, David Picard

机构 * LIGM, ENPC, IP Paris, CNRS, UGE, France LIX, CNRS, \'Ecole Polytechnique, IP Paris, France

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 MIRO通过在训练过程中对模型施加多个奖励,直接学习用户偏好,从而提升文本到图像生成的质量和效率,同时在GenEval组合基准和用户偏好评分上取得最佳成绩。

Comments Accepted at ICML 2026. Project page: https://nicolas-dufour.github.io/miro

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19639 2026-05-20 cs.CV 57%

Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation

基于反思生成的基准测试与进化

Junjie Wang, Xinghua Lou, Jason Li, Ye Tian, Keyu Chen, Yulin Li, Bin Kang, Jacky Mai, Yanwei Li, Zhuotao Tian, Liqiang Nie

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出R^3-Bench基准和R^3-Refiner框架,用于评估和提升反思视觉生成能力,通过改进迭代推理和修正能力,提升文本到图像模型的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19382 2026-05-20 cs.AI 50%

PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning

PRISM:一个程序化空间-时间推理的基准测试

Qiran Zhang, Yuheng Wang, Runde Yang, Lin Wu, Jingru Fan, Shu Yao, Jie Zhang, Tianle Zhou, Huatao Li, Ruijie Shi, Yihan Li, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出PRISM基准测试,通过大规模人类校准的指令-代码对(共10,372个,比之前基准大20倍),评估语言模型生成空间正确动画输出的能力,并揭示执行成功率与空间正确率之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17804 2026-05-20 cs.LG eess.SP 50%

GenTS: A Comprehensive Benchmark Library for Generative Time Series Models

GenTS:生成时间序列模型的综合基准库

Chenxi Wang, Xiaorong Wang, Peiyang Li, Yi Wang

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出GenTS,一个用于系统评估生成时间序列模型的综合且可扩展的基准库,通过统一的数据预处理流程、多样化的模型集合和全景评估指标,为生成模型提供了更灵活的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏