arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-31 至 2026-03-31 共收录 166 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 7 篇

2603.27862 2026-03-31 cs.GR cs.AI cs.CV cs.LG 88%

ImagenWorld: Stress-Testing Image Generation Models with Explainable Human Evaluation on Open-ended Real-World Tasks

ImagenWorld: 通过可解释的人类评估对图像生成模型进行压力测试,针对开放性现实任务

Samin Mahdizadeh Sani, Max Ku, Nima Jamali, Matina Mahdizadeh Sani, Paria Khoshtab, Wei-Chieh Sun, Parnian Fazel, Zhi Rui Tam, Thomas Chong, Edisy Kin Wai Chan, Donald Wai Tong Tsang, Chiao-Wei Hsu, Ting Wai Lam, Ho Yin Sam Ng, Chiafeng Chu, Chak-Wing Mak, Keming Wu, Hiu Tung Wong, Yik Chun Ho, Chi Ruan, Zhuofeng Li, I-Sheng Fang, Shih-Ying Yeh, Ho Kei Cheng, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) G-G-G Comfy Org University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent(独立研究者)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 ImagenWorld通过3600个条件集评估14个模型,揭示编辑任务比生成任务更难,艺术和照片实感领域表现优异,但符号和文本密集领域表现较差,现代VLM指标在Kendall准确性上达0.79,但无法实现细粒度可解释性误差归因。

Comments Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28547 2026-03-31 cs.CV 79%

GEditBench v2: A Human-Aligned Benchmark for General Image Editing

GEditBench v2:一个对齐人类的通用图像编辑基准

Zhangqi Jiang, Zheng Sun, Xianfang Zeng, Yufeng Yang, Xuanyang Zhang, Yongliang Wu, Wei Cheng, Gang Yu, Xu Yang, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) StepFun Southeast University(东南大学)

专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出GEditBench v2,包含1200个真实用户查询,涵盖23项任务,引入PVC-Judge模型评估视觉一致性,实验表明其在开放源模型中表现优异,揭示当前模型局限性。

Comments 30 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08282 2026-03-31 cs.CV cs.MM cs.SD 62%

PAVAS: Physics-Aware Video-to-Audio Synthesis

PAVAS:物理感知的视频到音频合成

Oh Hyun-Bin, Yuhta Takida, Toshimitsu Uesaka, Tae-Hyun Oh, Yuki Mitsufuji

机构 * POSTECH(浦项科技大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司) KAIST(韩国科学技术院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 PAVAS通过引入物理推理,结合物理参数估计器和物理驱动音频适配器,生成符合物理规律的音频,优于现有视频到音频生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28766 2026-03-31 cs.CV 57%

HandX: Scaling Bimanual Motion and Interaction Generation

HandX:扩展双臂运动和交互生成

Zimu Zhang, Yucheng Zhang, Xiyan Xu, Ziyin Wang, Sirui Xu, Kai Zhou, Bing Zhou, Chuan Guo, Jian Wang, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Specs Inc.(Specs公司) Snap Inc.(Snap公司)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出HandX,通过整合数据、标注和评估,解决双臂运动生成中精细指节动态和协作的不足,验证了大模型在生成高质量双臂运动中的有效性。

Comments CVPR 2026. Project Page: https://handx-project.github.io. Code: https://github.com/handx-project/HandX

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28082 2026-03-31 cs.CV cs.MA 57%

LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization

LogiStory: 一个多图像故事可视化逻辑感知框架

Chutian Meng, Fan Ma, Chi Zhang, Jiaxu Miao, Yi Yang, Yueting Zhuang

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出LogiStory框架,通过显式建模视觉逻辑提升多图像故事可视化中的叙事逻辑与视觉质量,引入多智能体系统和LogicTale基准测试集进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26794 2026-03-31 cs.CV 57%

The Quest for Generalizable Motion Generation: Data, Model, and Evaluation

可泛化动作生成的探索:数据、模型与评估

Jing Lin, Ruisi Wang, Junzhe Lu, Ziqi Huang, Guorui Song, Ailing Zeng, Xian Liu, Chen Wei, Wanqi Yin, Qingping Sun, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA Research(英伟达研究院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一个综合框架,通过数据、建模和评估三大支柱将视频生成知识迁移至动作生成,引入大规模数据集和改进模型,提升动作生成的泛化能力。

Comments Homepage: https://motrixlab.github.io/2026_iclr_vimogen

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与蒸馏 9 篇

2412.16906 2026-03-31 cs.CV 86%

Self-Corrected Flow Distillation for Consistent One-Step and Few-Step Text-to-Image Generation

自修正流蒸馏用于一致的一步和少步文本到图像生成

Quan Dao, Hao Phung, Trung Dao, Dimitris Metaxas, Anh Tran

专题命中 效率与蒸馏 :image generation(title);text-to-image(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出自修正流蒸馏方法,结合一致性模型和对抗训练,提升文本到图像生成的一致性与效率,实验验证其在CelebA-HQ和COCO数据集上的优越性能。

Comments Accepted to AAAI 2025. Code: https://github.com/hao-pt/SCFlow.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27987 2026-03-31 cs.CV cs.AI 79%

Beyond Dataset Distillation: Lossless Dataset Concentration via Diffusion-Assisted Distribution Alignment

超越数据集蒸馏:通过扩散辅助分布对齐实现无损数据集浓缩

Tongfei Liu, Yufan Liu, Bing Li, Weiming Hu

机构 * PeopleAI, Inc.(人民人工智能公司)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DsCo框架,通过扩散模型合成代表性样本并结合掺杂技术提升效率,实现低数据量下的SOTA性能,并在高数据量下有效减小数据集规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18792 2026-03-31 cs.CV 79%

MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanations

MaskDiME: 适应性遮蔽扩散用于精确且高效的视觉反事实解释

Changlu Guo, Anders Nymark Christensen, Anders Bjorholm Dahl, Morten Rieger Hannemose

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MaskDiME,一种高效的扩散框架,通过局部采样实现语义一致性和空间精度,提升视觉反事实解释的效率和准确性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12057 2026-03-31 cs.CV cs.AI 57%

Coarse-Guided Visual Generation via Weighted h-Transform Sampling

通过加权h变换采样实现粗引导的视觉生成

Yanghao Wang, Ziqi Jiang, Zhen Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种基于h变换的粗引导视觉生成方法,通过调整采样步骤的概率过渡,结合噪声水平感知调度,提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05207 2026-03-31 cs.CV 57%

Follow-Your-Motion: Video Motion Transfer via Efficient Spatial-Temporal Decoupled Finetuning

跟随你的动作:通过高效的时空解耦微调实现视频动作迁移

Yue Ma, Yulong Liu, Qiyuan Zhu, Ayden Yang, Kunyu Feng, Xinhua Zhang, Zexuan Yan, Zhifeng Li, Sirui Han, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) XIntelligence Technology Co., Limited(星云科技股份有限公司) SJTU(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Follow-Your-Motion框架,通过高效的时空解耦微调方法,解决视频扩散变换器在动作迁移中的不一致性和效率问题,并引入MotionBench基准进行验证。

Comments Accepted by ICLR 2026, project page: https://follow-your-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27599 2026-03-31 cs.CV 57%

You Only Erase Once: Erasing Anything without Bringing Unexpected Content

你只擦除一次:无需引入意外内容的任意擦除

Yixing Zhu, Qing Zhang, Wenju Xu, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Amazon(亚马逊) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出YOEO方法,通过训练无配对数据的扩散模型,实现高质量物体擦除,保留上下文一致性,优于现有方法。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27464 2026-03-31 cs.DB cs.MM 57%

NeedleDB: A Generative-AI Based System for Accurate and Efficient Image Retrieval using Complex Natural Language Queries

NeedleDB: 一种基于生成式AI的图像检索系统,用于通过复杂自然语言查询实现精确高效的检索

Mahdi Erfanian, Abolfazl Asudeh

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.MM

AI总结 NeedleDB通过生成式AI合成引导图像,将文本到图像检索转化为图像到图像搜索,提升复杂查询的精度和效率,实现93%的精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27086 2026-03-31 cs.CV 57%

EFlow: Fast Few-Step Video Generator Training from Scratch via Efficient Solution Flow

EFlow:通过高效解流实现从零开始的快速少步视频生成训练

Dogyun Park, Yanyu Li, Sergey Tulyakov, Anil Kag

机构 * Snap Inc.(Snap公司) Korea University(高丽大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出EFlow框架,通过高效解流目标和改进的训练方法,减少采样步骤和计算成本,实现更高的训练吞吐量和更低的推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27058 2026-03-31 cs.LG cs.RO 50%

Liquid Networks with Mixture Density Heads for Efficient Imitation Learning

具有混合密度头的液体网络用于高效模仿学习

Nikolaus Correll

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文比较了具有混合密度头的液体网络与扩散策略在多个任务中的性能,发现液体网络参数更少、预测误差更低且推理更快,且在样本效率实验中表现更稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他图像生成 1 篇

2603.28333 2026-03-31 cs.CV cs.AI 57%

Integrating Multimodal Large Language Model Knowledge into Amodal Completion

将多模态大语言模型知识整合到无模态补全中

Heecheol Yun, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏