arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 63 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 63 篇

2606.09156 2026-06-09 cs.CV 新提交 87%

OmniGen-AR: AutoRegressive Any-to-Image Generation

OmniGen-AR: 自回归任意到图像生成

Junke Wang, Xun Wang, Qiushan Guo, Peize Sun, Weilin Huang, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Bytedance Seed(字节跳动Seed) The University of Hong Kong(香港大学)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);image synthesis(abstract)

AI总结 提出统一自回归框架OmniGen-AR,通过共享视觉分词器和解耦因果注意力,支持文本、空间信号和视觉上下文等多种条件输入,在多项基准上达到最优或竞争性能。

Comments Accepted by NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06440 2026-07-08 cs.CV 新提交 85%

PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation

PIPBench:用于个性化图像生成评估的包含个人资料的框架

Yuhang Wu, Shuxiang Zhang, Wee Hian Ching, Chi Zhang, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 研究个性化图像生成问题,引入PIPBench基准及新数据构建管道,利用心理和人口统计学资料维度收集数据,全面评估代表性方法,揭示现有方法局限,为个性化文本到图像合成带来新挑战与机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15867 2026-06-16 cs.CV 新提交 85%

CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation

CogCanvas: 用于评估多主体参考图像生成的基准

Long-Bao Nguyen, Quang-Khai Tran, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市理科大学) University of Dayton, Ohio, United States(代顿大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出CogCanvas基准,包含1952张参考图像和1361个组合提示,评估多身份、对象绑定和背景场景的生成,引入BG-Sim和Attr-VQA指标,发现现有模型在超过3个主体时性能严重下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20100 2026-06-19 cs.CV 新提交 83%

WeGenBench: A Multidimensional Diagnostic Benchmark towards Text-to-Image Model Optimization

WeGenBench:面向文本到图像模型优化的多维诊断基准

Qian Liang, Xiaomin Li, Ying Zhang, Jia Xu, Lihao Ni, Hongrui Li, Jingjing Li, Jing Lyu, Chen Li

机构 * University of Electronic Science and Technology of China(电子科技大学) Dalian University of Technology(大连理工大学) Weixin, Tencent(腾讯微信)

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出WeGenBench基准,包含4000个中英双语提示,通过场景分类和多维标签实现跨维度评估,并设计基于视觉语言模型的新颖指标,精准定位模型在特定生成类别中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01383 2026-07-03 cs.CV 新提交 79%

MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation

MIBE:面向个性化图像生成的多主体交互基准与评估器

Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao, Mengcong Ren, Suwen Wang, Qiuyang Yin, Yuchen Sun, Qin Wang, Lu Xin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) DeerLab LLC(DeerLab有限责任公司) Carnegie Mellon University(卡内基梅隆大学) Clemson University(克莱姆森大学) Google(谷歌) San Jose State University(圣何塞州立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 提出MIBE框架,包含多主体交互基准(MIB)和评估器(MIE),通过解耦数据体制和双头排序诊断目标,解决多主体个性化图像生成中主体遗漏、外观失配和交互错误问题,在黄金集上达到0.922成对准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21113 2026-06-23 cs.CV cs.LG 新提交 79%

Object-Centric Dataset Resources for Constrained-Data Image Generation and Augmentation

面向受限数据图像生成与增强的以对象为中心的数据集资源

Vasile Marian, Yong-Bin Kang, Alexander Buddery

机构 * The University of Queensland(昆士兰大学) Swinburne University of Technology(斯威本科技大学)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 针对少样本场景下的对象中心图像生成,提出三个标准化数据集资源(Cityscapes-Pedestrian、TrafficSigns、COCO PottedPlant),提供256×256裁剪、边界框标注及重建脚本,支持受控比较与评估。

Comments 5 pages including references, 2 figures, 2 tables. Dataset and related files at https://github.com/Latzi/object-centric-low-data-datasets and https://doi.org/10.5281/zenodo.20573001

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20543 2026-06-19 cs.CV 新提交 79%

SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation

SSD: 空间推测解码加速自回归图像生成

Shilong Xiang, Zirui Zhang, Lijun Yu, Chengzhi Mao

机构 * Rutgers University(罗格斯大学)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 提出空间推测解码(SSD),利用二维空间相关性同时预测相邻水平与下方令牌,突破视觉推理中的内存瓶颈,实现高达13.3倍的自回归图像生成加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24763 2026-07-29 cs.AI 新提交 78%

CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models

用于掩码扩散语言模型的计算感知重掩码评估协议

Yash Shah, Abhijit Chakraborty, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) MongoDB(MongoDB公司)

专题命中 图像生成评测 :diffusion(title,abstract)

AI总结 研究针对掩码扩散语言模型评估标准不完善的问题,提出计算感知评估框架CaRE,通过标准化函数评估实际数量等方法审核重掩码策略,应用于多种模型和数据集,揭示了温度、计算匹配等因素对评估的影响,发布相关内容确保评估可重复可比。

Comments updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13120 2026-07-16 cs.LG cs.AI 新提交 78%

CoDiffGRN: Rethinking Gene Regulatory Network Inference via the BEELINE-KGC Benchmark and Co-evolutionary Discrete Diffusion

CoDiffGRN:通过BEELINE-KGC基准和协同进化离散扩散重新思考基因调控网络推理

Jiaze Song, Runhao Zhao, Minghao Xu, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学) National University of Defense Technology(国防科技大学)

专题命中 图像生成评测 :diffusion(title,abstract)

AI总结 该研究针对单细胞转录组数据推断基因调控网络问题,提出CoDiffGRN方法,将GRN推理转化为归纳图完成问题,引入新基准和协同进化离散扩散框架,实验表明其在新调控发现上性能优越,优于现有方法。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06609 2026-07-09 cs.LG cs.AI 新提交 78%

D2PO: Optimizing Diffusion Samplers via Dynamic Preference

D2PO:通过动态偏好优化扩散采样器

Jinkyu Kim, Jinyoung Choi, Bohyung Han

机构 * Seoul National University(首尔国立大学) Ulsan National Institute of Science and Technology(蔚山国立科学技术院)

专题命中 图像生成评测 :diffusion(title,abstract)

AI总结 研究针对现有框架局限,提出D2PO框架优化扩散采样策略。核心方法是将其转化为基于偏好的对齐问题,利用DPO框架并建模为能量模型,引入新能量公式和动态偏好。主要贡献是使采样器与感知质量更忠实对齐,性能优于传统调度器。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01709 2026-07-03 cs.AI cs.LG 新提交 78%

COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows

COMFYCLAW:面向图像生成工作流的自进化技能工具包

Zongxia Li, Dawei Liu, Fuxiao Liu, Yuhang Zhou, Xiyang Wu, Jingxi Chen, Jing Xie, Xiaomin Wu, Lichao Sun

机构 * University of Maryland(马里兰大学) University of Pennsylvania(宾夕法尼亚大学) Nvidia(英伟达) Lehigh University(里海大学)

专题命中 图像生成评测 :image generation(title,abstract)

AI总结 提出COMFYCLAW框架,通过类型化图编辑、区域级VLM验证器和渐进式技能库进化,提升ComfyUI工作流构建的代理可靠性和性能,在多个基准上取得最佳平均评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08841 2026-06-09 cs.AI cs.CV 新提交 77%

ZIPP:Zero-shot Image Personalization from Personas

ZIPP:基于人物画像的零样本图像个性化生成

Harini SI, Somesh Singh, Yaman Kumar Singla, David Doermann, Rajiv Ratn Shah

机构 * Adobe Media and Data Science Research (MDSR)(Adobe媒体与数据科学研究(MDSR)) IIIT-Delhi(德里印度理工学院) SUNY at Buffalo(纽约州立大学布法罗分校)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出ZIPP方法,利用自然语言人物画像通过LLM改写提示词实现零样本图像个性化生成,无需用户数据或微调;引入ZIPBench基准,在多个评测中取得13-20%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26860 2026-07-30 cs.LG 新提交 75%

Amortized Moment Matching for Visual Generation

用于视觉生成的摊销矩匹配

Wenze Liu, Xintao Wang, Pengfei Wan, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技影幻团队)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 该研究提出摊销矩匹配方法,构建AMFD损失,用于视觉生成,在ImageNet、GenEval等基准上性能优于FD基线及FLUX.2 4B模型,实现高效高维数据生成。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08525 2026-06-16 cs.CV 新提交 74%

DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving

DriveReward:面向自动驾驶的综合数据集与生成式视觉语言奖励模型

Qimao Chen, Fang Li, Yuechen Luo, Zehan Zhang, Haiyang Sun, Fangzhen Li, Bing Wang, Guang Chen, Yang Ji, Jiong Deng, Hongwei Xie, Hangjun Ye, Long Chen, Yi Zhang

机构 * Tsinghua University(清华大学) Xiaomi EV(小米汽车)

专题命中 图像生成评测 :generative vision(title);分类 cs.CV

AI总结 提出DriveReward数据集和专用视觉语言奖励模型,通过反事实标注和时序视觉引导,解决自动驾驶中奖励获取的泛化问题,在强化学习和轨迹选择中取得与基于规则方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26899 2026-06-26 cs.AI 新提交 71%

Generative Retrieval via Diffusion Transformer with Metric-Ordered Sequence Training and Hybrid-Policy Preference Optimization

基于扩散Transformer的生成式检索:度量有序序列训练与混合策略偏好优化

Chenghao Liu, Yu Zhang, Zhongtao Jiang, Kun Xu, Zhenwei An, Renzhi Wang, Zhao Wang, Jiachen Zhang, Yuxiao Zhang, Kun Xu, Songfang Huang

机构 * Peking University(北京大学)

专题命中 图像生成评测 :diffusion(title)

AI总结 针对模式保持的属性检索任务,提出MO-DiT+HPPO框架,通过度量有序训练和混合策略偏好优化,在八个领域分割中七个取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02589 2026-08-04 cs.CV 新提交 70%

CAPEval: A Decoupled Caption Evaluation across Understanding and Generation

CAPEval:跨理解与生成的解耦式标题评估

Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究提出解耦式标题评估基准CAPEval,将标题质量分为覆盖度与精确度,发现二者分别对应理解与生成任务性能,为标题生成器的选择优化提供指导。

Comments 21 pages, 8 figures. Code and dataset will be available at https://liuzhipenggg.github.io/CAPEval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02582 2026-07-07 cs.CV 新提交 70%

Evaluating Intellectual Property Guardrails of Generative Image Models: A Technical Report

评估生成式图像模型的知识产权保护措施:技术报告

Austin T. Hoag, Apostolos Modas, Yunhao Ba, Julienne M. LaChance, Jinru Xue, Wiebke Hutiri, Jan Simson, Tiffany Georgievski, Alex Towli, Joseph Smith, Yuki Mitsufuji, Alice Xiang

机构 * Sony AI New York(索尼人工智能纽约分部) Sony AI Zurich(索尼人工智能苏黎世分部) Sony Group Corporation London(索尼集团公司伦敦分部) Sony Group Corporation New York(索尼集团公司纽约分部)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出基准和自动化评估流程,测试生成式图像模型的知识产权保护证据及生成含可识别知识产权图像的倾向,评估了14个文本到图像模型,发现私有模型有不同程度拒绝生成情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27376 2026-06-26 cs.CV 新提交 70%

Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

Ask, Solve, Generate: 通过自一致性奖励实现自我进化的统一多模态理解与生成

Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar, Abdelrahman Shaker, Fahad Khan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一个自我进化的训练框架,通过内部角色(提议者、求解者、生成者)和自一致性信号,无需人工标注或外部奖励模型,同时提升统一多模态模型的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10894 2026-06-10 cs.CV 新提交 70%

The 1st PortraitCraft Challenge: A CVPR 2026 Workshop Competition on Portrait Composition Understanding and Generation

首届PortraitCraft挑战赛:CVPR 2026研讨会肖像构图理解与生成竞赛

Zijie Lou, Youyun Tang, Xiaochao Qu, Haoxiang Li, Ting Liu, Luoqi Liu, Xun Zhu, Zheng Zhang, Xi Chen, Miao Li, Ji Wu, Dizhe Zhang, Xian Ge, Sujia Wang, Ruiyang Zhang, Jiaming Wang, Xianshun Wang, Lu Qi, Boao Kang, Wei Zhou, Jinghui Sun, Zhenyu Yan, Jiliang Zhao, Rui Yang, Yipo Huang, Boyuan Liu, Shanglin Li, Zifan Xie, Yichen Zhang, Anlan Wang, Wenfeng Lin, Mingyu Guo, Dong Li, Xinghao Wang, Yanting Li, Shanzhao Tong, Shuai He, Qiu Zhou, Yongqi Yang, Taoyang Mu, Dianqiao Lei, Anlong Ming, Huadong Ma

机构 * CVPR 2026

专题命中 图像生成评测 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出PortraitCraft挑战赛,包含构图理解与生成两个赛道,并发布约5万张肖像数据集,推动肖像美学与可控图像生成研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08964 2026-08-11 cs.LG 新提交 67%

Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities

数学视觉图表:评估大型语言模型数学图表生成能力的综合基准

Harish Kashyap, Kiran Byadarhaly, Sriram Chakaravarthy, Sanyukta Tuti, Aryan Mistry

机构 * Pandita AI Inc.(潘迪塔人工智能公司)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)

AI总结 本研究推出首个专门评估LLMs数学图表生成能力的基准Math-Vision Diagrams,涵盖文本到代码与图像范式,测试发现LLMs在该任务上存在困难,相关资源将开源。

Comments Accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交 62%

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07550 2026-08-11 cs.CV cs.LG 新提交 57%

Auditing Medical Vision-Language Models on Chest Radiographs: Estimating Reference Agreement Across Institutions

胸部X光医学视觉语言模型审计:估算跨机构参考一致性

Pengyang Yu, Yiou Wang, Zhongping Dong, Sahraoui Dhelim, Chun-Mei Feng, M. Tahar Kechadi

机构 * University College Dublin(都柏林大学学院) School of Computer Science, University College Dublin(都柏林大学学院计算机科学学院) The Third Affiliated Hospital of Southern Medical University(南方医科大学第三附属医院) Dublin City University(都柏林城市大学)

专题命中 图像生成评测 :generative vision(abstract);分类 cs.CV

AI总结 该研究通过评估三个生成式视觉语言模型在胸部X光数据上的表现,估算跨机构参考一致性,发现无法推荐默认估算器,且参考一致性需按站点和接口重新评估。

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06769 2026-08-10 cs.CV 新提交 57%

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

GraphVerse:面向多模态大语言模型的综合性视觉图推理基准

Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

机构 * New York University(纽约大学) Sensetime Research(商汤科技研究院) Tsinghua University(清华大学) New York University Shanghai(上海纽约大学) University of Georgia(佐治亚大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05049 2026-08-06 cs.CV 新提交 57%

OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing

OmniEdit-Bench:基于指令的视频编辑综合基准

Chenxuan Miao, Yutong Feng, Yi Lu, Yunfeng Yan, Donglian Qi, Shiwei Zhang, Yu Liu, Xi Chen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 针对现有基于指令的视频编辑基准的任务覆盖有限、指标不足的问题,OmniEdit-Bench将编辑任务分解为多维度并提出含惩罚机制的评估框架,实验显示当前IVE模型仍待提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04504 2026-08-06 cs.CV cs.AI 新提交 57%

GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction

GeoReward:缓解跨市场偏好预测的视觉语言模型中的上下文变量高估问题

Shuo Liu, Huixiang Cai, Weiru Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本研究针对视觉语言模型的上下文变量高估问题,提出GeoReward奖励模型,通过三种机制缓解该偏差,在跨市场广告偏好预测任务中性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04349 2026-08-06 cs.CV 新提交 57%

Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models

Poly-OPD:用于能力可选流模型的异构多教师在线策略蒸馏

Siming Fu, Haojun Xu, Ruizhe He, Zheming Fu, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Linjiang Huang, Si Liu

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 Poly-OPD框架通过异构多教师在线策略蒸馏,将FLUX.1-dev和Z-Image的互补优势整合到25亿参数的SD3.5-Medium模型,提升了文本到图像生成的GenEval与DrawBench指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01848 2026-08-04 cs.CV 新提交 57%

Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

将语义与视觉解耦:一种用于可靠视觉-文本压缩评估的框架

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen Technology University(深圳技术大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本研究针对现有视觉-文本压缩评估依赖下游任务性能的缺陷,提出解耦语义与视觉的评估框架,引入ZeroSense基准消除文本依赖,实验证实VTC质量与下游任务准确率存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29679 2026-08-03 cs.CV 新提交 57%

Scaling Properties of Text Conditioning in Visual Generation

视觉生成中文本条件的缩放特性

Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 该研究探究视觉生成中文本条件的缩放特性,采用GPG、ED量化结构化语言,据此构建结构化提示并训练提示生成器,所得系统在多基准上超越多数开放权重模型、匹配或超越最强封闭权重模型。

Comments Code: https://github.com/heheyas/context-scaling Models: https://huggingface.co/collections/heheyas/context-scaling Demo: https://heheyas-context-scaling.hf.space/ Project page: https://heheyas.github.io/context-scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24560 2026-07-28 cs.CV cs.AI 新提交 57%

EgoPlay: Event-Triggered Video Editing for Egocentric Streams

EgoPlay:用于第一人称视角视频流的事件触发式视频编辑

Jinjie Mai, Gordon Guocheng Qian, Willi Menapace, Arpit Sahni, Chaoyang Wang, Ashkan Mirzaei, Runjia Li, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Rameen Abdal

机构 * Snap Inc.(Snap公司) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 研究第一人称视角视频流编辑问题,提出EgoPlay,通过微调预训练模型,在单个端到端模型中联合学习事件识别等,构建数据集训练双向视频扩散编辑器,在Ego4D基准测试中表现出色,优于现有基线。

Comments Accepted to SIGGRAPH Asia 2026 as a Conference Paper. Project page: https://egoplay2026.github.io/egoplay

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22745 2026-07-28 cs.CV cs.AI 新提交 57%

AI-generated Images Challenge Visual Trust in High-risk Scenarios

人工智能生成的图像在高风险场景中挑战视觉信任

Yi-Zhi Wang, Yichen Xiao, Linan Yue, Weibo Gao, Yichao Du, Pengfei Fang, Shimin Di, Min-Ling Zhang

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 研究聚焦人工智能生成图像在高风险场景下对视觉信任的挑战,提出SafeIMG基准,涵盖12个安全场景。评估专门探测器和视觉语言模型,发现它们检测可靠性不足,模型解释覆盖低,表明当前探测器在多方面欠缺,难以可靠评估此类图像。

详情

展开后加载摘要…

URL PDF HTML 收藏