arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-19 至 2026-06-19 共收录 76 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 55 篇

2406.06380 2026-06-19 math.PR 50%

The number of connected components in sub-critical random graph processes

亚临界随机图过程中连通分量数量的研究

Josué Corujo

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究亚临界乘积随机图过程中连通分量数量的演变,推导了归一化后的流极限和波动极限,并应用于多个例子,包括Erdős-Rényi图过程的亚临界情形。

Comments 15 pages, accepted for publication at Journal of/Advances in Applied Probability

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13962 2026-06-19 math.AP 50%

Reconstruction of degeneracy region and power for parabolic equations and systems

抛物方程和系统的退化区域和幂的重建

Piermarco Cannarsa, Veronica Danesi, Anna Doubova

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了一维复抛物方程扩散系数退化点的逆问题,通过边界一点的法向导数观测,推导了初始数据的充分条件以保证解的稳定性和唯一性,并提出了更一般的唯一性定理,涵盖初始数据、零阶项系数和退化幂的识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00271 2026-06-19 cs.RO 版本更新 50%

Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online

从我们所拥有的学习:在线推理过去交互的历史感知验证器

Yishu Li, Xinyi Mao, Ying Yuan, Kyutae Sim, Ben Eisner, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出历史感知验证器HAVE,通过解耦动作生成与验证,利用历史交互在线消除歧义,理论证明其提升期望动作质量,在多个模拟和真实环境中验证有效性。

Comments CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 5 篇

2606.20404 2026-06-19 cs.CV 新提交 57%

FlowBender: Feedback-Aware Training for Self-Correcting Conditional Flows

FlowBender: 面向自校正条件流的反馈感知训练

Daniel Gilo, Sven Elflein, Ido Sobol, Or Litany

机构 * Technion(以色列理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对条件扩散/流模型常违反任务约束的问题,提出FlowBender闭环框架,将对齐误差作为输入训练网络学习校正策略,在图像翻译、复原和3D纹理贴图中同时提升保真度与合理性。

Comments Project page: https://flow-bender.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20108 2026-06-19 cs.CV cs.LG 新提交 57%

EFIQA: Explainable Fundus Image Quality Assessment via Anatomical Priors

EFIQA: 基于解剖先验的可解释眼底图像质量评估

Pengwei Wang, José Morano, Qian Wan, Hrvoje Bogunović

机构 * Institute of Artificial Intelligence, Center for Medical Data Science, Medical University of Vienna, Austria(维也纳医科大学医学数据科学中心人工智能研究所) Christian Doppler Lab for Artificial Intelligence in Retina, Medical University of Vienna, Austria(维也纳医科大学视网膜人工智能克里斯蒂安·多普勒实验室)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 提出无需质量标签的EFIQA框架,利用解剖先验通过掩膜解剖修复学习正常结构,生成空间质量图,在多个基准上超越监督方法,兼具可解释性。

Comments Accepted in MIDL 2026. Code: https://github.com/penway/EFIQA

Journal ref Proceedings of Machine Learning Research 315:2248-2264, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19958 2026-06-19 cs.CV 新提交 57%

SketchKeyAnime: Reference-anchored Sparse Key-Sketch Animation Synthesis

SketchKeyAnime:基于参考锚点的稀疏关键草图动画合成

Meixi Li, Xianlin Zhang, Yue Zhang, Xueming Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出SketchKeyAnime视频扩散框架,通过双分支条件机制和可学习门控的草图交叉注意力,从单张参考RGB图像和稀疏关键草图生成结构可控、外观一致且时间连贯的动画,在Sakuga-42M数据集上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15819 2026-06-19 cs.CV 版本更新 57%

VideoSketcher: Sequential Sketch Generation Using Video Model Priors

VideoSketcher:利用视频模型先验的序列草图生成

Hui Ren, Yuval Alaluf, Omer Bar Tal, Alexander Schwing, Antonio Torralba, Yael Vinker

机构 * MIT(麻省理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出VideoSketcher方法,结合LLM的语义规划与视频扩散模型的时序渲染,通过两阶段微调从少量样本学习笔画顺序与风格,生成高质量序列草图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19957 2026-06-19 cs.CY 新提交 50%

Modest, artistic, and radical solutions to the environmental impact of image-generating machine learning

图像生成机器学习的环境影响:温和、艺术与激进的解决方案

Laura U. Marks, Jess MacCormack, Kehui Li

专题命中 可控生成 :image generation(abstract)

AI总结 针对图像生成ML的高能耗问题,从计算机工程、媒体研究和艺术角度探索非精确计算、小模型、低精度硬件等解决方案,并提出真实成本核算。

Comments Paper in Proceedings of LIMITS 2026: 12th Workshop on Computing within Limits, 2026-06-23-25, Online

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2606.20532 2026-06-19 cs.AI 新提交 50%

How Do Instructions Shape Speech? Cross-Attention Attribution for Style-Captioned Text-to-Speech

指令如何塑造语音?面向风格描述文本到语音的交叉注意力归因

Nityanand Mathur, Hamees Sayed, Wasim Madha, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 提出交叉注意力归因方法,分析风格描述文本到语音系统中单词对声学输出的影响,发现风格标记在早期步骤和深层注意力峰值,且与基频和能量相关。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2606.20100 2026-06-19 cs.CV 新提交 83%

WeGenBench: A Multidimensional Diagnostic Benchmark towards Text-to-Image Model Optimization

WeGenBench:面向文本到图像模型优化的多维诊断基准

Qian Liang, Xiaomin Li, Ying Zhang, Jia Xu, Lihao Ni, Hongrui Li, Jingjing Li, Jing Lyu, Chen Li

机构 * University of Electronic Science and Technology of China(电子科技大学) Dalian University of Technology(大连理工大学) Weixin, Tencent(腾讯微信)

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出WeGenBench基准,包含4000个中英双语提示,通过场景分类和多维标签实现跨维度评估,并设计基于视觉语言模型的新颖指标,精准定位模型在特定生成类别中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20543 2026-06-19 cs.CV 新提交 79%

SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation

SSD: 空间推测解码加速自回归图像生成

Shilong Xiang, Zirui Zhang, Lijun Yu, Chengzhi Mao

机构 * Rutgers University(罗格斯大学)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 提出空间推测解码(SSD),利用二维空间相关性同时预测相邻水平与下方令牌,突破视觉推理中的内存瓶颈,实现高达13.3倍的自回归图像生成加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20536 2026-06-19 cs.CV 新提交 57%

The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation

FID 彩票:量化生成模型评估中的隐藏随机性

Nicolas Dufour, Alexei A. Efros, Patrick Pérez

机构 * Kyutai UC Berkeley(加州大学伯克利分校)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 研究FID作为随机变量在训练和生成种子上的方差,发现重训练比重采样导致更大FID波动,提出新评估协议:使用每类最优引导、报告多个训练种子的误差条。

Comments Website: https://kyutai.org/fid-lottery

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 3 篇

2606.19970 2026-06-19 cs.CV 新提交 57%

CrossFlow: One-Step Generation Across Latent and Pixel Spaces

CrossFlow: 跨潜在空间与像素空间的单步生成

Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Tencent(腾讯) Fudan University(复旦大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出CrossFlow,一种跨空间流模型,将噪声潜在输入直接映射到像素图像,通过无速度单步目标实现潜在到像素的生成,并替代潜在扩散中的解码器,在ImageNet-1k上达到1.62 FID。

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06952 2026-06-19 cs.CV 版本更新 57%

LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer

LaTtE-Flow: 基于层间时间步专家流的Transformer

Ying Shen, Zhiyang Xu, Jiuhai Chen, Shizhe Diao, Jiaxin Zhang, Yuguang Yao, Joy Rimchala, Ismini Lourentzou, Lifu Huang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland(马里兰大学) Nvidia(英伟达) Salesforce AI Research(Salesforce AI研究) Intuit AI Research(Intuit AI研究)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出LaTtE-Flow,一种基于预训练视觉语言模型的高效统一架构,通过层间时间步专家流和条件残差注意力机制,实现图像理解与生成,生成速度提升约6倍。

Comments Unified multimodal model, Flow-matching

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19377 2026-06-19 cs.LG cs.AI 新提交 50%

Emyx: Fast and efficient all-atom protein generation

Emyx: 快速高效的全原子蛋白质生成

Nicholas J. Williams, Ward Haddadin, Matteo P. Ferla, Constantin Schneider, Nicholas B. Woodall, Ruby Sedgwick, Christian D. Madsen, Andrew L. Hopkins, Edward O. Pyzer-Knapp

机构 * Xyme

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出Emyx,一种140M参数的流匹配模型,通过轻量条件表示和稀疏连接降低复杂度,在酶设计基准上超越现有方法,训练仅需682 GPU小时。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2605.10898 2026-06-19 cs.HC 版本更新 71%

How Creatives Approach GenAI Image Generation: Tensions Between Structured Guidance, Self-Experimentation, and Creative Autonomy

创意人士如何接近生成式AI图像生成:结构化指导、自我实验与创意自主之间的张力

Haidan Liu, Isabelle Kwan, Taiga Okuma, Jeffrey Loverock, Nicholas Vincent, Parmit K Chilana

专题命中 其他图像生成 :image generation(title)

AI总结 研究探讨创意人士在使用生成式AI图像工具时如何平衡结构化指导与自我实验,发现尽管指导有助于理解AI,但许多人仍倾向于自我探索以保持创意自由。

Comments Accepted at ACM Creativity & Cognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏