arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-19 至 2026-03-19 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 5 篇

2512.12220 2026-03-19 cs.CV 83%

TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation

TechImage-Bench: 基于评分标准的技术图像生成评估

Minheng Ni, Zhengyuan Yang, Yaowen Zhang, Linjie Li, Chung-Ching Lin, Kevin Lin, Zhendong Wang, Xiaofei Wang, Shujie Liu, Lei Zhang, Wangmeng Zuo, Lijuan Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft Project Website(微软项目网站)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出TechImage-Bench,通过评分标准评估技术图像生成,发现现有模型在科学准确性上存在显著差距,并展示评分标准对改进图像生成的监督作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13399 2026-03-19 cs.CV cs.AI cs.LG 70%

EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing

EdiVal-Agent:一个面向多轮编辑自动细粒度评估的对象中心框架

Tianyu Chen, Yasi Zhang, Zhi Zhang, Peiyu Yu, Shu Wang, Zhendong Wang, Kevin Lin, Xiaofei Wang, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Jianwen Xie, Oscar Leong, Lijuan Wang, Ying Nian Wu, Mingyuan Zhou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Microsoft AI Superintelligence(微软人工智能超智实验室) Lambda, Inc(Lambda公司)

专题命中 图像生成评测 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出EdiVal框架,通过对象中心视角实现多轮编辑的细粒度评估,引入EdiVal-IF、EdiVal-CC和EdiVal-VQ三个指标,构建多轮编辑基准测试平台,用于识别现有编辑模型的失败模式。

Comments Tianyu Chen and Yasi Zhang contributed equally; Oscar Leong, Lijuan Wang, Ying Nian Wu, and Mingyuan Zhou advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17476 2026-03-19 cs.CV cs.AI cs.CL 57%

UniSAFE: A Comprehensive Benchmark for Safety Evaluation of Unified Multimodal Models

UniSAFE:统一多模态模型安全评估的综合基准

Segyu Lee, Boryeong Cho, Hojung Jung, Seokhyun An, Juhyeong Kim, Jaehyun Kwak, Yongjin Yang, Sangwon Jang, Youngrok Park, Wonjun Chang, Se-Young Yun

机构 * KAIST AI(KAIST人工智能研究院) Department of Computer Science and Engineering, UNIST(UNIST计算机科学与工程系) Department of Mathematical Sciences, KAIST(KAIST数学科学系) University of Toronto(多伦多大学) KAIST CS(KAIST计算机科学系)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出UniSAFE基准,用于评估统一多模态模型的系统级安全性,发现多图像生成任务比文本生成任务更易出现安全漏洞。

Comments Equal contribution by first three authors, 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16958 2026-03-19 cs.CV cs.AI 57%

PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models

PhysQuantAgent: 一种用于视觉-语言模型的物体质量估计推断流水线

Hisayuki Yokomizo, Taiki Miyanishi, Yan Gang, Shuhei Kurita, Nakamasa Inoue, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) National Institute of Informatics(信息处理技术研究所)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出PhysQuantAgent框架和VisPhysQuant基准数据集,通过引入三种视觉提示方法提升视觉-语言模型对真实物体质量的估计精度。

Comments Code and dataset will be available at https://github.com/hisasnow/PhysQuantAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16897 2026-03-19 eess.SP cs.CL cs.HC cs.LG q-bio.NC 50%

EEG-Based Brain-LLM Interface for Human Preference Aligned Generation

基于EEG的脑-大语言模型接口用于人类偏好对齐生成

Junzi Zhang, Jianing Shen, Weijie Tu, Yi Zhang, Hailin Zhang, Tom Gedeon, Bin Jiang, Yue Yao

机构 * Shandong University, China(山东大学) Australian National University, Australia(澳大利亚国立大学) Curtin University, Australia(Curtin大学)

专题命中 图像生成评测 :image generation(abstract)

AI总结 本文提出基于EEG的脑-大语言模型接口,通过EEG信号引导图像生成模型,利用神经信号反馈实现模型动态适应,为适应性语言模型推理提供新思路。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏