arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-11 至 2026-05-11 共收录 98 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 2 篇

2601.15884 2026-05-11 cs.CV 74%

Contrast-X: A Multi-Modal Contrast Image Synthesis Benchmark and Universal Modality Flow Matching

Contrast-X:一个多模态对比图像合成基准及通用模态流匹配

Yifan Chen, Fei Yin, Hao Chen, Jia Wu, Chao Li

机构 * University of Cambridge(剑桥大学) MD Anderson Cancer Center(MD安德森癌症中心) University of Dundee(邓迪大学)

专题命中 图像生成评测 :image synthesis(title);分类 cs.CV

AI总结 Contrast-X通过多器官CT和乳腺DCE-MRI数据,提出FlowMI模型解决多模态缺失问题,评估合成图像质量及跨器官泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07943 2026-05-11 cs.RO cs.AI cs.CV cs.LG 70%

TAVIS: A Benchmark for Egocentric Active Vision and Anticipatory Gaze in Imitation Learning

TAVIS:一种用于第一人称主动视觉和预见性注视的模仿学习基准

Giacomo Spigler

机构 * Department of Intelligent Systems(智能系统系)

专题命中 图像生成评测 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 TAVIS提出了一种评估主动视觉模仿学习的基础设施,包含两个任务集和两个仿人躯干机器人,通过实验发现主动视觉对任务类型和条件具有任务依赖性,且多任务策略在分布偏移下表现下降,模仿学习能产生与人类参考相当的预见性注视。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与蒸馏 5 篇

2605.07253 2026-05-11 cs.CV 83%

LENS: Low-Frequency Eigen Noise Shaping for Efficient Diffusion Sampling

LENS:低频特征噪声塑造用于高效扩散采样

Haewon Jeon, Si-Hyeon Lee

机构 * School of Electrical Engineering(电气工程学院) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出LENS方法,通过在低维子空间中高效调节噪声,提升扩散采样效率,减少计算量和参数,同时保持图像质量。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02883 2026-05-11 cs.CV 79%

SemanticDialect: Semantic-Aware Mixed-Format Quantization for Video Diffusion Transformers

语义感知混合格式量化:用于视频扩散变换器的混合格式量化

Wonsuk Jang, Thierry Tambe

机构 * Stanford University(斯坦福大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SemanticDialect,通过块级混合格式量化和语义感知方言分配,提升视频扩散变换器的量化效果,实验表明其在Open-Sora 2.0上接近FP16质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07661 2026-05-11 cs.LG cs.CV 70%

Stochastic Transition-Map Distillation for Fast Probabilistic Inference

随机转移图蒸馏用于快速概率推断

George Rapakoulias, Peter Garud, Lingjiong Zhu, Panagiotis Tsiotras

机构 * Department of Aerospace Engineering, Georgia Institute of Technology(佐治亚理工学院航空航天工程系) Department of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学系) Department of Mathematics, Florida State University(佛罗里达州立大学数学系)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出STMD框架,通过蒸馏完整的转移图加速扩散模型推断并保持概率采样生成,无需预训练教师模型或轨迹模拟,理论上有收敛界支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07020 2026-05-11 cs.LG cs.AI 50%

FlashMol: High-Quality Molecule Generation in as Few as Four Steps

FlashMol:在四步内生成高质量分子构象

Xinyuan Wei, Zian Li, Shaoheng Yan, Cai Zhou, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Yuanpei College, Peking University(北京大学元培学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电气工程与计算机科学系) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 FlashMol通过改进分布匹配蒸馏方法,在四步内生成高质量分子构象,实验表明其在速度和质量上优于传统模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06916 2026-05-11 cs.LG 50%

Tyche: One Step Flow for Efficient Probabilistic Weather Forecasting

Tyche:一步流用于高效的概率天气预报

Fan Xu, Yuan Gao, Kun Wang, Rui Su, Fenghua Ling, Hao Wu, Wanli Ouyang

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 Tyche提出一种一步条件流模型,通过JVP正则化目标和Swin式变换器,在高维地理场中实现高效概率天气预报,实验显示其性能优于多步生成基线和ECMWF IFS集合预报。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他图像生成 1 篇

2604.25809 2026-05-11 cs.CV 57%

Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning

基于指令和证据的对比双流解码用于 grounded 视觉语言推理

Yashwant Pravinrao Bangde, Debaditya Roy

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Kharagpur(印度理工学院Kharagpur分校)

专题命中 其他图像生成 :generative vision(abstract);分类 cs.CV

AI总结 本文提出 IECD$^2$ 方法,通过双流解码平衡语言信息和视觉真实性,提升视觉语言推理任务的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏