arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2508.08189 2025-12-24 cs.CV 57%

Reinforcement Learning for Large Model: A Survey

为大模型设计强化学习:综述

Weijia Wu, Chen Gao, Joya Chen, Kevin Qinghong Lin, Qingwei Meng, Yiming Zhang, Yuke Qiu, Hong Zhou, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文综述了视觉强化学习领域,探讨了多模态大语言模型、视觉生成等四个主题,分析了算法设计、奖励工程及评估协议,并指出了样本效率、泛化能力等开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19539 2025-12-23 cs.CV 57%

StoryMem: Multi-shot Long Video Storytelling with Memory

StoryMem: 基于记忆的多镜头长视频叙事

Kaiwen Zhang, Liming Jiang, Angtian Wang, Jacob Zhiyuan Fang, Tiancheng Zhi, Qing Yan, Hao Kang, Xin Lu, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 StoryMem通过基于记忆的迭代镜头合成,实现了高质量多镜头视频叙事,提升了跨镜头一致性与审美质量。

Comments Project page: https://kevin-thu.github.io/StoryMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18477 2025-12-23 cs.RO cs.CV 57%

STORM: Search-Guided Generative World Models for Robotic Manipulation

STORM:基于搜索的生成世界模型用于机器人操作

Wenjun Lin, Jensen Zhang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 STORM通过结合生成模型与搜索算法,实现了机器人操作中的时空推理,显著提升了任务成功率和环境适应能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14620 2025-12-17 cs.CL cs.AI cs.CV 57%

JMMMU-Pro: Image-based Japanese Multi-discipline Multimodal Understanding Benchmark via Vibe Benchmark Construction

JMMMU-Pro:通过Vibe基准构建的基于图像的日本多学科多模态理解基准

Atsuyuki Miyai, Shota Onohara, Jeonghun Baek, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 JMMMU-Pro通过构建基于图像的多模态理解基准,评估LMMs在日文处理能力,提出Vibe基准构建方法以提高基准质量。

Comments Project page: https://mmmu-japanese-benchmark.github.io/JMMMU_Pro/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20865 2025-12-17 cs.CV 57%

AI-GenBench: A New Ongoing Benchmark for AI-Generated Image Detection

AI-GenBench: 一个面向AI生成图像检测的新持续性基准

Lorenzo Pellegrini, Davide Cozzolino, Serafino Pandolfini, Davide Maltoni, Matteo Ferrara, Luisa Verdoliva, Marco Prati, Marco Ramilli

机构 * Dipartimento di Informatica - Scienza e Ingegneria (DISI) Università di Bologna(博洛尼亚大学信息学院-科学与工程系) Dipartimento di Ingegneria Elettrica e delle Tecnologie dell’Informazione (DIETI) Università degli Studi di Napoli Federico II(那不勒斯费德里科二世大学电子工程与信息科技系) IdentifAI

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 Ai-GenBench提出一个持续性基准,用于评估AI生成图像检测方法在面对新生成模型时的泛化能力,提供全面数据集和标准化评估流程,促进可重复性和实际应用。

Comments Accepted at Verimedia workshop, IJCNN 2025. 9 pages, 6 figures, 4 tables, code available: https://github.com/MI-BioLab/AI-GenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12287 2025-12-16 cs.CV 57%

RealDrag: The First Dragging Benchmark with Real Target Image

RealDrag: 首个包含真实目标图像的拖动基准

Ahmad Zafarani, Zahra Dehghanian, Mohammadreza Davoodi, Mohsen Shadroo, MohammadAmin Fazli, Hamid R. Rabiee

机构 * Sharif University of Technology(谢里夫技术大学) Iran University of Science and Technology(伊朗科学技术大学) Comprehensive University of Islamic Revolution(伊斯兰革命综合大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 RealDrag是首个包含真实目标图像的拖动基准,通过提出四个任务特定指标,系统评估了17种最先进模型,揭示了当前方法间的权衡并建立了可重复的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10949 2025-12-12 cs.CV cs.AI cs.CL 57%

Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation

我们是否准备好在文本到3D生成中使用强化学习?一项渐进性的调查

Yiwen Tang, Zoey Guo, Kaixin Zhu, Ray Zhang, Qizhi Chen, Dongzhi Jiang, Junli Liu, Bohan Zeng, Haoming Song, Delin Qu, Tianyi Bai, Dan Xu, Wentao Zhang, Bin Zhao

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文首次系统研究了强化学习在文本到3D生成中的应用,提出Hi-GRPO范式和AR3D-R1模型,探讨奖励设计、算法优化及3D生成基准。

Comments Code is released at https://github.com/Ivan-Tang-3D/3DGen-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10237 2025-12-12 cs.CV 57%

Multi-dimensional Preference Alignment by Conditioning Reward Itself

通过条件化奖励进行多维偏好对齐

Jiho Jang, Jinyoung Kim, Kyungjune Baek, Nojun Kwak

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 MCDPO通过条件化奖励解决多维偏好对齐问题,实现独立优化方向学习和动态控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18271 2025-12-12 cs.CV cs.AI 57%

Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models

超越文字和像素:生成模型中隐式世界知识推理的基准测试

Tianyang Han, Junhao Su, Junjie Hu, Peizhen Yang, Hengyu Shi, Junfeng Luo, Jialin Gao

机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) Fudan University(复旦大学) D^{4} Lab(D⁴实验室) HHMI Janelia Research Campus(HHMI贾能实验室)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09663 2025-12-11 cs.CV 57%

IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting

IF-Bench:基于生成视觉提示的多模态大语言模型在红外图像上的基准测试与增强

Tao Zhang, Yuyang Hong, Yang Xia, Kun Ding, Zeyu Zhang, Ying Wang, Shiming Xiang, Chunhong Pan

机构 * MAIS, Institute of Automation(自动化研究所信息处理中心) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Research Center of Aerospace Information, Institute of Automation(自动化研究所航空信息研究中心)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 IF-Bench通过生成视觉提示方法提升多模态大语言模型对红外图像的理解能力,提供首个高质量基准测试及实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15644 2025-12-04 cs.CV cs.AI cs.CR 57%

Can VLMs Detect and Localize Fine-Grained AI-Edited Images?

视觉语言模型能否检测并定位细粒度的人工智能编辑图像?

Zhen Sun, Ziyi Zhang, Zeren Luo, Zhiyuan Zhong, Zeyang Sha, Tianshuo Cong, Zheng Li, Shiwen Cui, Weiqiang Wang, Jiaheng Wei, Xinlei He, Qi Li, Qian Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Shandong University(山东大学) Wuhan University(武汉大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FragFake基准,首次系统研究VLMs在编辑图像分类和定位中的应用,发现微调模型在准确性上表现优异,同时探索了基于GRPO的RLVR训练方法。

Comments 14pages,19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02790 2025-12-03 cs.CV 57%

UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits

UnicEdit-10M: 一个通过统一验证打破规模-质量壁垒的数据集和基准

Keming Ye, Zhipeng Huang, Canmiao Fu, Qingyang Liu, Jiani Cai, Zheqi Lv, Chen Li, Jing Lyu, Zhou Zhao, Shengyu Zhang

机构 * Zhejiang University(浙江大学) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 UnicEdit-10M通过统一验证方法构建大规模高质量数据集和基准,解决图像编辑中规模与质量的矛盾,评估模型在空间和知识推理中的表现。

Comments 31 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03692 2025-12-03 cs.CV cs.RO 57%

LiDARCrafter: Dynamic 4D World Modeling from LiDAR Sequences

LiDARCrafter:从LiDAR序列动态构建4D世界模型

Ao Liang, Youquan Liu, Yu Yang, Dongyue Lu, Linfeng Li, Lingdong Kong, Huaici Zhao, Wei Tsang Ooi

机构 * WorldBench Team(WorldBench团队)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 LiDARCrafter通过自然语言输入生成和编辑4D LiDAR数据,实现高保真度、可控性和时间一致性,为自动驾驶数据增强和模拟提供新方法。

Comments AAAI 2026 Oral Presentation; 38 pages, 18 figures, 12 tables; Project Page at https://lidarcrafter.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00752 2025-12-02 cs.CV 57%

Charts Are Not Images: On the Challenges of Scientific Chart Editing

图表不是图像:关于科学图表编辑挑战的探讨

Shawn Li, Ryan Rossi, Sungchul Kim, Sunav Choudhary, Franck Dernoncourt, Puneet Mathur, Zhengzhong Tu, Yue Zhao

机构 * University of Southern California(南加州大学) Adobe Research(Adobe研究院) Texas A&M University(德克萨斯A&M大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FigEdit基准测试,揭示科学图表编辑中结构转换的重要性,并指出传统像素操作方法的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23525 2025-12-02 cs.CV 57%

Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization

Hallo4: 通过直接偏好优化实现高保真的动态肖像动画

Jiahao Cui, Yan Chen, Mingwang Xu, Hanlin Shang, Yuxuan Chen, Yun Zhan, Zilong Dong, Yao Yao, Jingdong Wang, Siyu Zhu

机构 * Fudan University(复旦大学) Baidu Inc.(百度公司) Shanghai Innovative Institute(上海创新研究院) Nanjing University(南京大学) Alibaba Group(阿里巴巴集团)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 Hallo4通过直接偏好优化和时空运动调制,实现高保真的动态肖像动画生成,提升唇部同步、表情自然性和身体运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23241 2025-12-01 cs.CV 57%

Synthetic Industrial Object Detection: GenAI vs. Feature-Based Methods

合成工业目标检测:GenAI与基于特征的方法

Jose Moises Araya-Martinez, Adrián Sanchis Reig, Gautham Mohan, Sarvenaz Sardari, Jens Lambrecht, Jörg Krüger

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本研究比较了GenAI与基于特征的方法在合成工业目标检测中的效果,发现简单方法在准确性和效率上优于复杂GenAI方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22576 2025-12-01 cs.MM 57%

A Progressive Evaluation Framework for Multicultural Analysis of Story Visualization

一种用于故事可视化多元文化分析的渐进评估框架

Janak Kapuriya, Ali Hatami, Paul Buitelaar

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.MM

AI总结 本文提出一种渐进多元文化评估框架,通过五个新指标评估故事可视化模型在不同文化下的表现,揭示模型在文化适当性和视觉美学上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20330 2025-12-01 cs.RO cs.CV 57%

ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation

ArtiBench 和 ArtiBrain:可泛化的视觉-语言操纵基准测试

Yuhan Wu, Tiantian Wei, Shuo Wang, ZhiChao Wang, Yanyong Zhang, Daniel Cremers, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Technical University of Munich(慕尼黑技术大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 ArtiBench和ArtiBrain通过统一高层推理与自适应低层控制,提升可操纵物体操作的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20937 2025-11-27 cs.AI cs.CL cs.CV cs.RO 57%

ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction

ENACT:通过视角交互的世界建模评估具身认知

Qineng Wang, Wenlong Huang, Yu Zhou, Hang Yin, Tianwei Bao, Jianwen Lyu, Weiyu Liu, Ruohan Zhang, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校)

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

AI总结 ENACT通过视角交互的世界建模评估具身认知,揭示VLMs在长周期交互中与人类表现差距扩大,且模型在逆向任务中表现更优。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20647 2025-11-26 cs.CV 57%

Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization

多样视频生成与确定性点过程引导的策略优化

Tahira Kazimi, Connor Dunlop, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DPP-GRPO框架,结合DPP和GRPO理论,通过显式奖励提升视频生成的多样性,同时保持高质量和提示一致性。

Comments Project webpage: https://diverse-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01982 2025-11-25 cs.LG cs.CV 57%

Fine-Grained GRPO for Precise Preference Alignment in Flow Models

细粒度GRPO用于流模型中的精确偏好对齐

Yujie Zhou, Pengyang Ling, Jiazi Bu, Yibin Wang, Yuhang Zang, Jiaqi Wang, Li Niu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出细粒度GRPO框架,通过细粒度评估和多粒度整合模块提升流模型中偏好对齐的精度与鲁棒性。

Comments Project Page: https://bujiazi.github.io/g2rpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09109 2025-11-21 cs.CV cs.CL 57%

CAIRe: Cultural Attribution of Images by Retrieval-Augmented Evaluation

CAIRe:通过检索增强评估进行图像文化归因

Arnav Yayavaram, Siddharth Yayavaram, Simran Khanuja, Michael Saxon, Graham Neubig

机构 * BITS Pilani(比斯·皮兰大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 CAIRe通过检索增强评估方法,评估图像在不同文化标签下的相关性,有效衡量文化偏见,提升跨文化公平性。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12675 2025-11-18 cs.CV 57%

Appreciate the View: A Task-Aware Evaluation Framework for Novel View Synthesis

Saar Stern, Ido Sobol, Or Litany

机构 * Technion(技术学院) NVIDIA(英伟达)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments 3DV 2026. Project page: https://saarst.github.io/appreciate-the-view-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12363 2025-11-18 cs.CV 57%

Explainable AI-Generated Image Detection RewardBench

Michael Yang, Shijian Deng, William T. Doan, Kai Wang, Tianyu Yang, Harsh Singh, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Toronto(多伦多大学) University of Notre Dame(诺特大学) Stony Brook University(石溪大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19112 2025-11-17 cs.CV 57%

DENTEX: Dental Enumeration and Tooth Pathosis Detection Benchmark for Panoramic X-ray

Ibrahim Ethem Hamamci, Sezgin Er, Omer Faruk Durugol, Gulsade Rabia Cakmak, Ezequiel de la Rosa, Enis Simsar, Atif Emre Yuksel, Sadullah Gultekin, Serife Damla Ozdemir, Kaiyuan Yang, Mehmet Berke Isler, Mustafa Salih Gucez, Shenxiao Mei, Chenglong Ma, Feihong Shen, Kaidi Shen, Huikai Wu, Han Wu, Lanzhuju Mei, Zhiming Cui, Niels van Nistelrooij, Khalid El Ghoul, Steven Kempers, Tong Xi, Shankeeth Vinayahalingam, Kyoungyeon Choi, Jaewon Shin, Eunyi Lyou, Lanshan He, Yusheng Liu, Lisheng Wang, Tudor Dascalu, Shaqayeq Ramezanzade, Azam Bakhshandeh, Lars Bjørndal, Bulat Ibragimov, Hongwei Bran Li, Sarthak Pati, Bernd Stadlinger, Albert Mehl, Mehmet Kemal Ozdemir, Mustafa Gundogar, Bjoern Menze

机构 * Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) Harvard Medical School(哈佛医学院) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) ETH AI Center, ETH Zurich(苏黎世联邦理工学院人工智能中心) Center for Dental Medicine, University of Zurich(苏黎世大学牙科医学中心) Department of Computer Engineering, Bogazici University(博雅大学计算机工程系) Department of Endodontics, Istanbul Medipol University(伊斯坦布尔Medipol大学牙体医学系) University of Oklahoma, College of Dentistry, Graduate Periodontics Department(俄克拉荷马大学牙科学院研究生牙周病学系)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03997 2025-11-07 cs.CV 57%

PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection

Peiyao Wang, Weining Wang, Qi Li

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02791 2025-11-05 cs.CV cs.GT 57%

AI-Generated Image Detection: An Empirical Study and Future Research Directions

Nusrat Tasnim, Kutub Uddin, Khalid Mahmood Malik

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05635 2025-11-05 cs.RO cs.CV 57%

Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation

Yue Liao, Pengfei Zhou, Siyuan Huang, Donglin Yang, Shengcong Chen, Yuxin Jiang, Yue Hu, Jingbin Cai, Si Liu, Jianlan Luo, Liliang Chen, Shuicheng Yan, Maoqing Yao, Guanghui Ren

机构 * AgiBot Genie Team(AgiBot Genie团队) LV-NUS Lab(LV-NUS实验室) BUAA(北京航空航天大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Comments https://genie-envisioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16556 2025-10-31 cs.CV 57%

Fit for Purpose? Deepfake Detection in the Real World

Guangyu Lin, Li Lin, Christina P. Walker, Daniel S. Schiff, Shu Hu

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17626 2025-10-22 cs.CV cs.AI 57%

CaMiT: A Time-Aware Car Model Dataset for Classification and Generation

Frédéric LIN, Biruk Abere Ambaw, Adrian Popescu, Hejer Ammar, Romaric Audigier, Hervé Le Borgne

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

Comments To be published in NeurIPS 2025 Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏