arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2602.21141 2026-08-10 cs.CV 版本更新 57%

SynthRender and I-AsSET: Open-Source Framework and Dataset for Bidirectional Sim-Real Transfer in Industrial Object Perception

SynthRender 和 IRIS:用于工业物体感知双向仿真-现实迁移的开源框架和数据集

Jose Moises Araya-Martinez, Thushar Tom, Adrián Sanchis Reig, Pablo Rey Valiente, Jens Lambrecht, Jörg Krüger

机构 * Technical University Berlin, Industrial Automation Technology(柏林技术大学,工业自动化技术) Mercedes-Benz AG, Future Manufacturing Technologies(梅赛德斯-奔驰公司,未来制造技术) Technical University Braunschweig, Institute for Cognitive Robotics(不伦瑞克技术大学,认知机器人研究所)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出SynthRender和IRIS,通过合成数据生成与结构化评估,系统研究双向仿真-现实迁移,提供32类数据集和CAD模型,实现高效合成训练与工业应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05049 2026-08-06 cs.CV 新提交 57%

OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing

OmniEdit-Bench:基于指令的视频编辑综合基准

Chenxuan Miao, Yutong Feng, Yi Lu, Yunfeng Yan, Donglian Qi, Shiwei Zhang, Yu Liu, Xi Chen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 针对现有基于指令的视频编辑基准的任务覆盖有限、指标不足的问题,OmniEdit-Bench将编辑任务分解为多维度并提出含惩罚机制的评估框架,实验显示当前IVE模型仍待提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04504 2026-08-06 cs.CV cs.AI 新提交 57%

GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction

GeoReward:缓解跨市场偏好预测的视觉语言模型中的上下文变量高估问题

Shuo Liu, Huixiang Cai, Weiru Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本研究针对视觉语言模型的上下文变量高估问题,提出GeoReward奖励模型,通过三种机制缓解该偏差,在跨市场广告偏好预测任务中性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04349 2026-08-06 cs.CV 新提交 57%

Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models

Poly-OPD:用于能力可选流模型的异构多教师在线策略蒸馏

Siming Fu, Haojun Xu, Ruizhe He, Zheming Fu, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Linjiang Huang, Si Liu

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 Poly-OPD框架通过异构多教师在线策略蒸馏,将FLUX.1-dev和Z-Image的互补优势整合到25亿参数的SD3.5-Medium模型,提升了文本到图像生成的GenEval与DrawBench指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01848 2026-08-04 cs.CV 新提交 57%

Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

将语义与视觉解耦:一种用于可靠视觉-文本压缩评估的框架

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen Technology University(深圳技术大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本研究针对现有视觉-文本压缩评估依赖下游任务性能的缺陷,提出解耦语义与视觉的评估框架,引入ZeroSense基准消除文本依赖,实验证实VTC质量与下游任务准确率存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29679 2026-08-03 cs.CV 新提交 57%

Scaling Properties of Text Conditioning in Visual Generation

视觉生成中文本条件的缩放特性

Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 该研究探究视觉生成中文本条件的缩放特性,采用GPG、ED量化结构化语言,据此构建结构化提示并训练提示生成器,所得系统在多基准上超越多数开放权重模型、匹配或超越最强封闭权重模型。

Comments Code: https://github.com/heheyas/context-scaling Models: https://huggingface.co/collections/heheyas/context-scaling Demo: https://heheyas-context-scaling.hf.space/ Project page: https://heheyas.github.io/context-scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24101 2026-07-31 cs.CV cs.AI 版本更新 57%

LU-500: A Logo Benchmark for Concept Unlearning

LU-500:用于概念遗忘的标志基准

Keyu Li, Jin Gao, Jialing Zhang, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像模型中概念遗忘里公司标志未被充分研究的问题,引入LU-500基准及多粒度协议,通过实验评估多种方法,分析ProLU基线,指出未来标志遗忘或需空间感知控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25991 2026-07-31 cs.AI cs.CV 版本更新 57%

Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline

面向社交媒体中统一的多模态虚假信息检测:基准数据集与基线模型

Haiyang Li, Yaxiong Wang, Shengeng Tang, Yuchen Zhang, Lianwei Wu, Lechao Cheng, Liu Liu, Chaofeng Dong, Zhun Zhong

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) School of Computer Science and Technology, Northwestern Polytechnical University(计算机科学与技术学院,西北工业大学)

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

AI总结 该研究构建了含9.8万样本的OmniFake基准数据集,提出UMFDet框架,实现对人工与AI生成两类多模态虚假内容的统一检测,性能优于专用基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24016 2026-07-29 cs.CV 版本更新 57%

DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models

DailyBench:用于评估现代生成模型生成和处理的人工智能图像的统一基准

Xin Jiang, Hao Tang, Junyao Gao, Meiqi Cao, Fei Shen, Dongming Zhang, Yongdong Zhang

机构 * People’s Daily Online(人民网) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

AI总结 研究针对现有生成模型图像检测基准与现实差距问题,提出统一基准DailyBench,含FakeBench和ManipulationBench两个子集,通过实验揭示当前检测器鲁棒性差,凸显其可用于开发更强大的人工智能生成图像检测方法。

Comments Some errors must be corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24560 2026-07-28 cs.CV cs.AI 新提交 57%

EgoPlay: Event-Triggered Video Editing for Egocentric Streams

EgoPlay:用于第一人称视角视频流的事件触发式视频编辑

Jinjie Mai, Gordon Guocheng Qian, Willi Menapace, Arpit Sahni, Chaoyang Wang, Ashkan Mirzaei, Runjia Li, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Rameen Abdal

机构 * Snap Inc.(Snap公司) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 研究第一人称视角视频流编辑问题,提出EgoPlay,通过微调预训练模型,在单个端到端模型中联合学习事件识别等,构建数据集训练双向视频扩散编辑器,在Ego4D基准测试中表现出色,优于现有基线。

Comments Accepted to SIGGRAPH Asia 2026 as a Conference Paper. Project page: https://egoplay2026.github.io/egoplay

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22745 2026-07-28 cs.CV cs.AI 新提交 57%

AI-generated Images Challenge Visual Trust in High-risk Scenarios

人工智能生成的图像在高风险场景中挑战视觉信任

Yi-Zhi Wang, Yichen Xiao, Linan Yue, Weibo Gao, Yichao Du, Pengfei Fang, Shimin Di, Min-Ling Zhang

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 研究聚焦人工智能生成图像在高风险场景下对视觉信任的挑战,提出SafeIMG基准,涵盖12个安全场景。评估专门探测器和视觉语言模型,发现它们检测可靠性不足,模型解释覆盖低,表明当前探测器在多方面欠缺,难以可靠评估此类图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19259 2026-07-28 cs.CV cs.AI 版本更新 57%

TextRich: A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

一个用于检测 GPT-Image-2 生成的含丰富文本图像的多领域基准

Yijin Wang, Shuyi Wang, Wenhan Zhang, Yuqi Ouyang

机构 * College of Computer Science(计算机科学学院)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 针对现有基准缺乏文本丰富图像检测的问题,构建了包含8602张图像、覆盖6个类别的多领域基准,评估5种检测器,发现性能高度依赖领域且易受JPEG压缩影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05680 2026-07-28 cs.LG cs.AI cs.CV 版本更新 57%

Infinite-Precision Autoregressive Modeling for Vector Graphics and Layouts

AGDC: 变长序列的自回归生成与联合离散连续空间

Yeonsang Shin, Insoo Kim, Bongkeun Kim, Keonwoo Bae, Bohyung Han

机构 * Seoul National University(首尔国立大学) Samsung Electronics(三星电子)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 AGDC通过联合建模离散和连续值,实现变长序列的高精度生成,适用于半导体设计等高精度领域。

Comments Code: https://github.com/yxxshin/IPAM

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22352 2026-07-27 cs.CV cs.AI eess.IV 新提交 57%

Time-Reversed Imaging: A Multimodal Benchmark and Framework for Reconstructing Past Human-Environment Interactions

时间反转成像:用于重建过去人类与环境交互的多模态基准和框架

Jorge Bacca, Kebin Contreras, Luis Toscano-Palomino, Mauro Dalla Mura

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 研究提出时间反转成像范式,通过TRACE-HEI数据集及多模态推理方法,从热、紫外和可见光谱中残余物理印记推断过去人类与环境交互,为时间反转成像奠定基础,开辟场景理解新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19923 2026-07-23 cs.CV 新提交 57%

WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment

WearWow:通过自适应令牌打包和偏好对齐实现原生2K多服装虚拟试穿

Xujie Zhang, Runyan Du, Song Chang, Jiang Li, Dongliang Shao, Liping Wu, Wei Luo, Xiaochao Qu, Luoqi Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Meitu Lab(美图实验室)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 研究针对原生2K多服装虚拟试穿难题,提出WearWow框架。用自适应2D令牌打包减轻内存爆炸,多维试穿奖励系统纠正纹理退化,还构建高质量数据集。实验证明该框架在原生2K多服装合成上达新水平,超越现有商业基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21618 2026-07-23 cs.CV 版本更新 57%

4DGS360: 360° Gaussian Reconstruction of Dynamic Objects from a Single Video

4DGS360:从单个视频中进行动态物体的360度高斯重建

Jae Won Jang, Yeonjin Chang, Wonsik Shin, Juhwan Cho, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出4DGS360框架,通过3D原生初始化解决动态物体360度重建中的几何模糊问题,结合优化实现一致的4D重建,并引入iPhone360基准测试集验证方法有效性。

Comments Accepted to ECCV 2026. Project page: https://jaewon040.github.io/4dgs360/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02473 2026-07-23 cs.CV cs.LG 版本更新 57%

WorldPack: Dynamic Frame Compression for Long-context Video World Modeling

WorldPack:用于长上下文视频世界建模的动态帧压缩

Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 研究针对长上下文视频世界建模中时空一致生成的挑战,提出WorldPack视频世界模型,通过轨迹打包和几何选择机制,基于3D空间相关性动态分配压缩率,扩展有效上下文,在相关数据集上优于基线,提升空间推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05784 2026-07-20 cs.CV cs.CR 57%

Comprehensive Dataset of Synthetic and Manipulated Overhead Imagery for Development and Evaluation of Forensic Tools

综合性合成与 manipulated 天顶影像数据集用于开发和评估取证工具

Brandon B. May, Kirill Trapeznikov, Shengbang Fang, Matthew C. Stamm

机构 * Drexel University(德雷塞尔大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种综合性合成与 manipulated 天顶影像数据集,用于开发和评估取证工具,支持可控生成多种操纵类别及任务基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14194 2026-07-17 cs.CV cs.LG 新提交 57%

Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models

文本到视频模型的推理时概念抑制和以视频为中心的评估

Wenxuan Chen, Wenjie Feng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 研究文本到视频模型中可控去除目标概念的问题,提出无训练推理时框架SIRUS,通过定位目标相关提示证据抑制目标表达,引入视频导向评估框架,在多个概念上实验表现出色,能在不同骨干上泛化。

Comments 29 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22809 2026-07-17 cs.CV 版本更新 57%

PhotoAgent: Exploratory Visual Aesthetic Planning with Large Vision Models

PhotoAgent: 带探索性视觉审美规划的代理照片编辑

Mingde Yao, Zhiyuan You, King-Man Tam, Menglu Wang, Tianfan Xue

机构 * MMLab, CUHK(CUHK媒体实验室) Shanghai AI Lab(上海AI实验室) USTC(中国科学技术大学) Institute of Science Tokyo(东京科学研究所) CPII under InnoHK(创新香港下的CPII)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 PhotoAgent通过探索性视觉审美规划实现自主照片编辑,无需用户逐步提示,提升图像质量和指令遵循度。

Comments ICML 2026 Oral. A fully automated, intelligent photo-editing agent that autonomously plans multi-step aesthetic enhancements, smartly chooses diverse editing tools, and enables everyday users to achieve professional-looking results without crafting complex prompts. Project page: https://mdyao.github.io/PhotoAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09076 2026-07-15 cs.CV 版本更新 57%

Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

超越标量奖励:将推理内化到分数分布中

Xin Jin, Huanqia Cai, Zhen Li, Zechao Zhan, Dengyang Jiang, Aiming Hao, Yuming Jiang, Xiangpeng Yang, Chunle Guo, Peng Gao, Ming-Ming Cheng, Steven C. H. Hoi

机构 * Alibaba Group(阿里巴巴集团) Nankai University(南开大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 提出Z-Reward框架,通过教师-学生模型将推理型奖励内化为紧凑VLM的分数分布,实现高效且准确的文本到图像优化。

Comments Z-Image Team Technical Report. Project page: https://srameo.github.io/projects/z-reward/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08497 2026-07-10 cs.CV cs.AI cs.CL cs.LG 新提交 57%

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

用于多模态理解、生成和编辑的认知结构多模态智能体

Feng Wang, Canmiao Fu, Zhipeng Huang, Chen Li, Jing Lyu, Ge Li

机构 * Peking University(北京大学) Tencent Inc(腾讯公司)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 研究针对统一多模态模型在长时多模态对话中的局限,提出认知结构多模态智能体,通过外化视觉信息等方式改进。开发统一场景引擎,构建评估基准。实验显示该智能体检索准确率高、推理时间减半,还介绍了工具包,为长时多模态智能体提供新范式。

Comments 16 pages, 7 figures, 8 tables. Project page: https://caseclose.github.io/cma-harness/ Code: https://github.com/caseclose/cma-harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16446 2026-07-09 cs.CV 版本更新 57%

Unified Removal of Raindrops and Reflections: A New Benchmark and A Novel Pipeline

统一去除雨滴和反射:一个新的基准和一个新流程

Xingyu Liu, Zewei He, Yu Chen, Chunyu Zhu, Zixuan Chen, Xing Luo, Zhe-Ming Lu

机构 * School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空航天学院) Huanjiang Laboratory(浣江实验室) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出统一去除雨滴和反射的任务,并构建了新的基准数据集,同时提出基于扩散的新型框架DiffUR³,有效去除两种退化,实验表明在基准和真实场景中表现优异。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04796 2026-07-07 cs.GR 新提交 57%

Glare Mitigation using a Differentiable Unified Glare Rating

使用可微统一眩光评级减轻眩光

Linas Beresna, Eugene Fiume

专题命中 图像生成评测 :image generation(abstract);分类 cs.GR

AI总结 研究利用可微光传输,引入连续可微的UGR代理,解决低样本密度下蒙特卡洛方差导致的优化不稳定,通过可调Sigmoid边界替换离散UGR阶梯函数,在多领域减轻眩光,提供优化视觉舒适度的管道。

Comments 15 pages, 16 figures. Published in Proceedings of the Eurographics Symposium on Rendering (EGSR) 2026, Symposium Track. This is the authors' version; the definitive version is available at the Eurographics Digital Library

Journal ref Eurographics Symposium on Rendering 2026 (Symposium Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13416 2026-07-07 cs.CV cs.AI 版本更新 57%

DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis

DF3DV-1K:用于无干扰新视角合成的大规模数据集与基准

Cheng-You Lu, Yi-Shan Hung, Wei-Ling Chi, Hao-Ping Wang, Charlie Li-Ting Tsai, Yu-Cheng Chang, Yu-Lun Liu, Thomas Do, Chin-Teng Lin

机构 * University of Technology Sydney(悉尼科技大学) University of Sydney(悉尼大学) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 为弥补无干扰辐射场领域缺乏大规模真实世界数据集的空白,构建了包含1048个场景、每场景提供干净和杂乱图像集的DF3DV-1K数据集,并基于此基准测试了九种最新方法,识别出最鲁棒的方法和最具挑战的场景。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13438 2026-07-07 cs.CV cs.LG 57%

Explainable Concept Generation through Vision-Language Preference Learning for Understanding Neural Networks' Internal Representations

通过视觉-语言偏好学习实现可解释的概念生成以理解神经网络的内部表示

Aditya Taparia, Som Sagar, Ransalu Senanayake

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出通过视觉-语言偏好学习生成概念图像集,解决传统方法需手动收集概念图像集的不足,提高神经网络内部表示理解的效率和可靠性。

Comments 28 pages, 31 figures

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML 2025), PMLR 267:59154-59181, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00378 2026-07-02 cs.CV q-bio.PE 新提交 57%

Radial Interaction Tomography: Recognizing Non-Transitive Evolutionary Games from One Range-Expansion Image

径向相互作用断层扫描:从一次范围扩张图像识别非传递演化博弈

Faruk Alpay, Baris Basaran

机构 * Department of Computer Engineering, Bahçeşehir University(巴赫切希尔大学计算机工程系)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 提出计算机视觉逆问题,从单张端点图像恢复径向边界流场,并检验视觉模式是否与传递标量适应度层级兼容,通过几何信号提取和统计检验实现非传递循环检测。

Comments 17 pages, 10 figures. Ancillary files include computational diagnostics, benchmark code, and supplementary proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02459 2026-06-30 cs.CV 57%

ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing

ReSpace:基于文本的自回归3D室内场景合成与编辑

Martin JJ. Bucher, Iro Armeni

机构 * Stanford University(斯坦福大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。

Comments 23 pages, 17 figures, 11 tables (incl. appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23951 2026-06-29 cs.CV 版本更新 57%

HunyuanImage 3.0 Technical Report

HunyuanImage 3.0 技术报告

Tencent Hunyuan Foundation Model Team

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 HunyuanImage 3.0是一种统一多模态理解与生成的自回归模型,通过精心数据整理、先进架构、原生思维链、渐进预训练和激进后训练,训练出超800亿参数MoE模型(推理时激活130亿),在文本-图像对齐和视觉质量上媲美最先进模型,并开源代码和权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25445 2026-06-25 cs.CV cs.AI 新提交 57%

C3-Bench: A Context-Aware Change Captioning Benchmark

C3-Bench:一种上下文感知的变化描述基准

Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 提出C3-Bench基准,包含51种真实变化场景的4996对图像,并首次引入LLM-as-Judge评估框架,揭示现有模型在非训练分布场景下的系统性盲点。

Comments ECCV 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏