arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2606.02800 2026-06-24 cs.CV cs.AI cs.LG cs.MM cs.RO 版本更新 62%

Cosmos 3: Omnimodal World Models for Physical AI

Cosmos 3:面向物理AI的全模态世界模型

NVIDIA, :, Aditi, Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline Aubame, Alisson Azzolini, Junjie Bai, Maciej Bala, Yogesh Balaji, Josh Bapst, Aarti Basant, Mukesh Beladiya, Mohammad Qazim Bhat, Zaid Pervaiz Bhat, Dan Blick, Vanni Brighella, Han Cai, Tiffany Cai, Eric Cameracci, Jiaxin Cao, Yulong Cao, Mark Carlson, Carlos Casanova, Ting-Yun Chang, Yan Chang, Yu-Wei Chao, Prithvijit Chattopadhyay, Roshan Chaudhari, Chieh-Yun Chen, Junyu Chen, Ke Chen, Qizhi Chen, Wenkai Chen, Xiaotong Chen, Yu Chen, An-Chieh Cheng, Click Cheng, Xiu Chia, Jeana Choi, Chaeyeon Chung, Wenyan Cong, Yin Cui, Magdalena Dadela, Nalin Dadhich, Wenliang Dai, Joyjit Daw, Alperen Degirmenci, Rodrigo Vieira Del Monte, Robert Denomme, Sameer Dharur, Marco Di Lucca, Ke Ding, Wenhao Ding, Yifan Ding, Yuzhu Dong, Nicole Drumheller, Yilun Du, Aigul Dzhumamuratova, Aleksandr Efitorov, Hamid Eghbalzadeh, Naomi Eigbe, Imad El Hanafi, Hassan Eslami, Benedikt Falk, Jiaojiao Fan, Jim Fan, Amol Fasale, Sergiy Fefilatyev, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Vikram Fugro, Prashant Gaikwad, TJ Galda, Katelyn Gao, Yihuai Gao, Wenhang Ge, Sreyan Ghosh, Arushi Goel, Vivek Goel, Akash Gokul, Rama Govindaraju, Jinwei Gu, Miguel Guerrero, Elfie Guo, Aryaman Gupta, Siddharth Gururani, Hugo Hadfield, Song Han, Ankur Handa, Zekun Hao, Mohammad Harrim, Ali Hassani, Nathan Hayes-Roth, Yufan He, Chris Helvig, Cyrus Hogg, Madison Huang, Michael Huang, Sophia Huang, Yufan Huang, Jacob Huffman, DeLesley Hutchins, Suneel Indupuru, Boris Ivanovic, Arihant Jain, Joel Jang, Ryan Ji, Yanan Jian, Dongfu Jiang, Jingyi Jin, Atharva Joshi, Nikhilesh Joshi, Pranjali Joshi, Andy Ju, Jaehun Jung, Weiwei Kang, Scott Kassekert, Jan Kautz, Ashna Khetan, Julia Kiczka, Slawek Kierat, Gwanghyun Kim, Kuno Kim, Sunny Kim, Kezhi Kong, Xin Kong, Zhifeng Kong, Tomasz Kornuta, Egor Krivov, Hui Kuang, Saurav Kumar, Chia-Wen Kuo, George Kurian, Wojciech Kutak, JF Lafleche, Himangshu Lahkar, Omar Laymoun, Jayjun Lee, Sanggil Lee, Gabriele Leone, Boyi Li, Freya Li, Jiajun Li, Jinfeng Li, Ling Li, Pengcheng Li, Shangru Li, Tingle Li, Xiaolong Li, Xuan Li, Zhaoshuo Li, Zhiqi Li, Hao Liang, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Ming-Yu Liu, Sifei Liu, Zihan Liu, Hai Loc Lu, Xiangyu Lu, Alice Luo, Ruipu Luo, Wenjie Luo, Jiangran Lyu, Martin Ding Ma, Nic Ma, Qianli Ma, Dawid Majchrowski, Louis Marcoux, Miguel Martin, Qing Miao, Ashkan Mirzaei, Shreyas Misra, Kaichun Mo, Durra Mohsin, Hyejin Moon, Pawel Morkisz, Saeid Motiian, Kirill Motkov, Seungjun Nah, Yashraj Narang, Deepak Narayanan, Thabang Ngazimbi, Julian Ouyang, Shubham Pachori, David Page, Yatian Pang, Sehwi Park, Mahesh Patekar, Mostofa Patwary, Marco Pavone, Trung Pham, Wei Ping, Soha Pouya, Shrimai Prabhumoye, Varun Praveen, Delin Qu, Hesam Rabeti, Morteza Ramezanali, Marilyn Reeb, Xuanchi Ren, Kristen Rumley, Wojciech Rymer, Jun Saito, Yeongho Seol, John Shao, Piyush Shekdar, Tianwei Shen, Humphrey Shi, Min Shi, Stella Shi, Kevin Shih, Mohammad Shoeybi, Mateusz Sieniawski, Shuran Song, Alexander Sotelo, Amir Sotoodeh, Sunil Srinivasa, Vignesh Srinivasakumar, Bartosz Stefaniak, Rahul Heinrich Steiger, Shangkun Sun, Jiaxiang Tang, Shitao Tang, Yangyang Tang, Yue Tang, Tolou Tavakkoli, Kayley Ting, Krzysztof Tomala, Wei-Cheng Tseng, Jibin Varghese, Sergei Vasilev, Thomas Volk, Raju Wagwani, Roger Waleffe, Andrew Z. Wang, Boxiang Wang, Haoxiang Wang, Qiao Wang, Shihao Wang, Shijie Wang, Ting-Chun Wang, Yan Wang, Yu Wang, Rohit Watve, David Wehr, Fangyin Wei, Xinshuo Weng, Jay Zhangjie Wu, Kedi Wu, Hongchi Xia, Summer Xiao, Tianjun Xiao, Kevin Xie, Daguang Xu, Jiashu Xu, Mengyao Xu, Ruqing Xu, Xingqian Xu, Yao Xu, Dinghao Yang, Dong Yang, Hans Yang, Xiaodong Yang, Xuning Yang, Yichu Yang, Yurong You, Zhiding Yu, Hao Yuan, Simon Yuen, Xiaohui Zeng, Pengcuo Zeren, Cindy Zha, Haotian Zhang, Jenny Zhang, Jing Zhang, Liangkai Zhang, Paris Zhang, Shun Zhang, Xuanmeng Zhang, Zhizheng Zhang, Ann Zhao, Yilin Zhao, Yuliya Zhautouskaya, Charles Zhou, Fengzhe Zhou, Shilin Zhu, Yuke Zhu, Dima Zhylko, Artur Zolkowski

机构 * NVIDIA

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 提出基于统一混合Transformer架构的全模态世界模型Cosmos 3,联合处理语言、图像、视频、音频和动作序列,在理解和生成任务上达到新最优,为具身智能体提供可扩展的通用骨干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00188 2026-06-03 cs.GR cs.CV cs.LG 62%

PaintBench: Deterministic Evaluation of Precise Visual Editing

PaintBench: 精确视觉编辑的确定性评估

Kai Xu, Ellis Brown, Shrikar Madhu, Rob Fergus, He He, Saining Xie

机构 * New York University(纽约大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV、cs.GR

AI总结 提出PaintBench基准,通过程序化生成20种基本视觉编辑操作,实现确定性像素级评估,发现当前模型性能低(最高mIoU 17.1%),并揭示任务分解和场景变化的影响。

Comments Project Page: https://paintbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11696 2026-05-13 cs.CV cs.AI cs.GR 62%

WildRelight: A Real-World Benchmark and Physics-Guided Adaptation for Single-Image Relighting

WildRelight:一个现实世界基准和基于物理的适应方法用于单图像照明

Lezhong Wang, Mehmet Onurcan Kaya, Siavash Bigdeli, Jeppe Revall Frisvad

机构 * Technical University of Denmark(丹麦技术大学) Inria(法国国家信息与自动化研究所)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出WildRelight,首个现实世界单图像照明评估数据集,通过严格对齐的自然光照和高动态范围环境图,揭示了合成数据训练模型在现实世界中的域移问题,并引入基于物理的推理框架实现自监督适应。

Comments Companion paper to the CVPR26 findings paper 'WildRelight', introducing the physics-guided adaptation method evaluated on the dataset. Project Page: https://lez-s.github.io/wildrelight_proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08282 2026-03-31 cs.CV cs.MM cs.SD 62%

PAVAS: Physics-Aware Video-to-Audio Synthesis

PAVAS:物理感知的视频到音频合成

Oh Hyun-Bin, Yuhta Takida, Toshimitsu Uesaka, Tae-Hyun Oh, Yuki Mitsufuji

机构 * POSTECH(浦项科技大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司) KAIST(韩国科学技术院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 PAVAS通过引入物理推理,结合物理参数估计器和物理驱动音频适配器,生成符合物理规律的音频,优于现有视频到音频生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22805 2025-12-01 cs.CV cs.LG cs.MM 62%

From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images

从像素到感受:将MLLMs对齐于人类对图像的认知感知

Yiming Chen, Junlin Han, Tianyi Bai, Shengbang Tong, Filippos Kokkinos, Philip Torr

机构 * Oxford University(牛津大学) HKUST(香港科技大学) University College London(伦敦大学学院) New York University(纽约大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CogIP-Bench基准,通过后训练提升MLLMs对图像认知属性的对齐能力,并展示其在图像生成中的应用。

Comments Project page with codes/datasets/models: https://follen-cry.github.io/MLLM-Cognition-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02474 2025-09-03 cs.GR cs.CV cs.LG 62%

Unifi3D: A Study on 3D Representations for Generation and Reconstruction in a Common Framework

Nina Wiedemann, Sainan Liu, Quentin Leboutet, Katelyn Gao, Benjamin Ummenhofer, Michael Paulitsch, Kai Yuan

机构 * Intel Corporation(英特尔公司)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00777 2025-09-03 cs.GR cs.CV 62%

IntrinsicReal: Adapting IntrinsicAnything from Synthetic to Real Objects

Xiaokang Wei, Zizheng Yan, Zhangyang Xiong, Yiming Hao, Yipeng Qin, Xiaoguang Han

机构 * The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Cardiff University(卡迪夫大学) NanJing XiaoZhuang University(南京小庄大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17632 2025-08-12 cs.AI cs.CV cs.MM 62%

D-Judge: How Far Are We? Assessing the Discrepancies Between AI-synthesized and Natural Images through Multimodal Guidance

Renyang Liu, Ziyu Lyu, Wei Zhou, See-Kiong Ng

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学信息科学与技术学院(深圳校区)) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) College of Modern Engineering and the Engineering Research Center of Cyberspace, Yunnan University(云南大学现代工程学院及空天信息工程研究中心)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17489 2025-07-30 cs.CV cs.AI cs.GR cs.LG 62%

Puzzle Similarity: A Perceptually-guided Cross-Reference Metric for Artifact Detection in 3D Scene Reconstructions

Nicolai Hermann, Jorge Condor, Piotr Didyk

机构 * USI(USI大学) IDSIA(IDSIA研究所)

专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16064 2025-03-21 cs.CV cs.AI cs.IR cs.MM 62%

PromptHash: Affinity-Prompted Collaborative Cross-Modal Learning for Adaptive Hashing Retrieval

Qiang Zou, Shuli Cheng, Jiayi Chen

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV、cs.MM

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00712 2024-11-26 cs.CV cs.GR 62%

MotionFix: Text-Driven 3D Human Motion Editing

Nikos Athanasiou, Alpár Cseke, Markos Diomataris, Michael J. Black, Gül Varol

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH Asia 2024 Camera Ready, Project page: https://motionfix.is.tue.mpg.de

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13743 2024-11-05 cs.CV cs.AI cs.CL cs.LG cs.MM 62%

GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation

Baiqi Li, Zhiqiu Lin, Deepak Pathak, Jiayao Li, Yixin Fei, Kewen Wu, Tiffany Ling, Xide Xia, Pengchuan Zhang, Graham Neubig, Deva Ramanan

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.MM

Comments We open-source our dataset, model, and code at: https://linzhiqiu.github.io/papers/genai_bench ; Project page: https://linzhiqiu.github.io/papers/genai_bench ; GenAI-Bench was first introduced in arxiv:2404.01291. This article extends it with an additional GenAI-Rank benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18085 2024-10-25 cs.CV cs.AI cs.GR cs.HC 62%

TextureMeDefect: LLM-based Defect Texture Generation for Railway Components on Mobile Devices

Rahatara Ferdousi, M. Anwar Hossain, Abdulmotaleb El Saddik

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV、cs.GR

Comments 6 Pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01291 2024-06-19 cs.CV cs.AI cs.CL cs.LG cs.MM 62%

Evaluating Text-to-Visual Generation with Image-to-Text Generation

Zhiqiu Lin, Deepak Pathak, Baiqi Li, Jiayao Li, Xide Xia, Graham Neubig, Pengchuan Zhang, Deva Ramanan

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.MM

Comments We open-source our data, model, and code at: https://github.com/linzhiqiu/t2v_metrics ; Project page: https://linzhiqiu.github.io/papers/vqascore

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12451 2024-06-07 cs.CV cs.AI cs.CL cs.MM 62%

The Revolution of Multimodal Large Language Models: A Survey

Davide Caffagni, Federico Cocchi, Luca Barsellotti, Nicholas Moratelli, Sara Sarto, Lorenzo Baraldi, Lorenzo Baraldi, Marcella Cornia, Rita Cucchiara

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV、cs.MM

Comments ACL 2024 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12961 2024-03-20 cs.CV cs.AI cs.GR cs.LG 62%

TexTile: A Differentiable Metric for Texture Tileability

Carlos Rodriguez-Pardo, Dan Casas, Elena Garces, Jorge Lopez-Moreno

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.GR

Comments CVPR 2024. Project page: https://mslab.es/projects/TexTile/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11943 2024-01-23 cs.LG cs.CL cs.CR cs.CV cs.MM 62%

Benchmarking Large Multimodal Models against Common Corruptions

Jiawei Zhang, Tianyu Pang, Chao Du, Yi Ren, Bo Li, Min Lin

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV、cs.MM

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10407 2023-12-27 cs.CV cs.AI cs.LG cs.MM 62%

DeepArt: A Benchmark to Advance Fidelity Research in AI-Generated Content

Wentao Wang, Xuanyao Huang, Tianyang Wang, Swalpa Kumar Roy

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV、cs.MM

Comments This is the second version of this work, and new contributors join and the modification content is greatly increased

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05523 2023-11-01 cs.CL cs.AI cs.CV cs.MM 62%

FACTIFY3M: A Benchmark for Multimodal Fact Verification with Explainability through 5W Question-Answering

Megha Chakraborty, Khushbu Pahwa, Anku Rani, Shreyas Chatterjee, Dwip Dalal, Harshit Dave, Ritvik G, Preethi Gurumurthy, Adarsh Mahor, Samahriti Mukherjee, Aditya Pakala, Ishan Paul, Janvita Reddy, Arghya Sarkar, Kinjal Sensharma, Aman Chadha, Amit P. Sheth, Amitava Das

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.MM

Comments arXiv admin note: text overlap with arXiv:2305.04329

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02898 2023-08-15 cs.CV cs.MM 62%

Towards Unified Text-based Person Retrieval: A Large-scale Multi-Attribute and Language Search Benchmark

Shuyu Yang, Yinan Zhou, Yaxiong Wang, Yujiao Wu, Li Zhu, Zhedong Zheng

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01319 2023-05-31 cs.SD cs.CV cs.MM eess.AS 62%

Long-Term Rhythmic Video Soundtracker

Jiashuo Yu, Yaohui Wang, Xinyuan Chen, Xiao Sun, Yu Qiao

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.MM

Comments ICML2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01577 2022-12-06 eess.IV cs.CV cs.MM 62%

A Domain-specific Perceptual Metric via Contrastive Self-supervised Representation: Applications on Natural and Medical Images

Hongwei Bran Li, Chinmay Prabhakar, Suprosanna Shit, Johannes Paetzold, Tamaz Amiranashvili, Jianguo Zhang, Daniel Rueckert, Juan Eugenio Iglesias, Benedikt Wiestler, Bjoern Menze

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV、cs.MM

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.16748 2022-03-21 cs.CV cs.GR 62%

Dual Contrastive Loss and Attention for GANs

Ning Yu, Guilin Liu, Aysegul Dundar, Andrew Tao, Bryan Catanzaro, Larry Davis, Mario Fritz

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV、cs.GR

Comments Accepted to ICCV'21

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.12088 2019-03-29 cs.MM cs.CV 62%

GANs-NQM: A Generative Adversarial Networks based No Reference Quality Assessment Metric for RGB-D Synthesized Views

Suiyi Ling, Jing Li, Junle Wang, Patrick Le Callet

专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.03924 2018-04-12 cs.CV cs.GR 62%

The Unreasonable Effectiveness of Deep Features as a Perceptual Metric

Richard Zhang, Phillip Isola, Alexei A. Efros, Eli Shechtman, Oliver Wang

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV、cs.GR

Comments Accepted to CVPR 2018; Code and data available at https://www.github.com/richzhang/PerceptualSimilarity

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.02898 2017-08-10 cs.CV cs.MM 62%

An evaluation of large-scale methods for image instance and class discovery

Matthijs Douze, Hervé Jégou, Jeff Johnson

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.MM

Comments Published at ACM Multimedia workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08705 2026-08-17 cs.CV 版本更新 57%

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales

HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准

Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Ziqi Sheng, Wei Lu

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01896 2026-08-14 cs.CV cs.AI 版本更新 57%

Train, Test, Re-evaluate: Schedule-Sensitive Evaluation of Generative Data for Hand Detection

训练、测试、重新评估:用于手部检测的生成数据的调度敏感评估

Atmika Bhardwaj, Silvia Vock, Nico Steckhan

机构 * Federal Institute for Occupational Safety and Health(联邦职业安全与卫生研究所)

专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV

AI总结 本研究通过多阶段训练调度实验,评估生成性图像修补数据对安全关键场景下手部检测性能的影响,发现适当的训练流程能显著提升真实部署效果。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07550 2026-08-11 cs.CV cs.LG 新提交 57%

Auditing Medical Vision-Language Models on Chest Radiographs: Estimating Reference Agreement Across Institutions

胸部X光医学视觉语言模型审计:估算跨机构参考一致性

Pengyang Yu, Yiou Wang, Zhongping Dong, Sahraoui Dhelim, Chun-Mei Feng, M. Tahar Kechadi

机构 * University College Dublin(都柏林大学学院) School of Computer Science, University College Dublin(都柏林大学学院计算机科学学院) The Third Affiliated Hospital of Southern Medical University(南方医科大学第三附属医院) Dublin City University(都柏林城市大学)

专题命中 图像生成评测 :generative vision(abstract);分类 cs.CV

AI总结 该研究通过评估三个生成式视觉语言模型在胸部X光数据上的表现,估算跨机构参考一致性,发现无法推荐默认估算器,且参考一致性需按站点和接口重新评估。

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06769 2026-08-10 cs.CV 新提交 57%

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

GraphVerse:面向多模态大语言模型的综合性视觉图推理基准

Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

机构 * New York University(纽约大学) Sensetime Research(商汤科技研究院) Tsinghua University(清华大学) New York University Shanghai(上海纽约大学) University of Georgia(佐治亚大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏