arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-13 至 2026-05-13 共收录 127 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 5 篇

2605.09003 2026-05-13 cs.CV 57%

FlashClear: Ultra-Fast Image Content Removal via Efficient Step Distillation and Feature Caching

FlashClear: 通过高效的步骤蒸馏和特征缓存实现超快图像内容移除

Yixin Tang, Jiawei Guo, Junxian Li, Zhiteng Li, Jixin Zhao, Bingya Zhang, Chenbo Wang, Yulun Zhang, Shangchen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Honor Device Co., Ltd(荣耀设备有限公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FlashClear,通过区域感知对抗蒸馏和前景优先的注意力与缓存策略,实现高效内容移除,实验表明其在保持性能的同时显著提升速度,达到8.26倍和122倍的加速。

Comments Code: https://github.com/GuoCalix/FlashClear

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08434 2026-05-13 cs.RO 50%

Failing Forward: Adaptive Failure-Informed Learning for Vision-Language-Action Models

失败前进:面向视觉-语言-动作模型的自适应失败信息学习

Meng Zheng, Samhita Marri, Anwesa Choudhuri, Benjamin Planche, Zhongpai Gao, Van Nguyen Nguyen, Terrence Chen, Girish Chowdhary, Ziyan Wu

机构 * United Imaging Intelligence(联合影像智能) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出AFIL框架,通过利用失败轨迹作为负向指导,提升视觉-语言-动作模型在机器人操作中的鲁棒性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11468 2026-05-13 cs.AI 50%

CAMPA: Efficient and Aligned Multimodal Graph Learning via Decoupled Propagation and Aggregation

CAMPA: 通过解耦传播和聚合实现高效且对齐的多模态图学习

Daohan Su, Hao Liu, Xunkai Li, Yinlin Zhu, Xiong Yongfu, Yi Liu, Hongchao Qin, Rong-Hua Li, Guoren Wang

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 CAMPA通过解耦传播和聚合机制,解决多模态图学习中的模态冲突问题,提升效率和可扩展性,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11214 2026-05-13 cs.LG 50%

Enforcing Constraints in Generative Sampling via Adaptive Correction Scheduling

通过自适应修正调度强制生成采样中的约束

Noah Trupin, Yexiang Xue

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出自适应修正调度方法,通过动态分配修正预算提升生成采样效率,实验显示在相同修正预算下,该方法恢复了71.2%的全步修正收益,且修正次数减少75%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他图像生成 3 篇

2602.06339 2026-05-13 cs.RO cs.AI 71%

Action Hallucination in Generative Vision-Language-Action Models

生成视觉-语言-动作模型中的动作幻觉

Harold Soh, Eugene Lim

机构 * Department of Computer Science, School of Computing(计算机科学系,计算系) Smart Systems Institute(智能系统研究所)

专题命中 其他图像生成 :generative vision(title)

AI总结 研究分析生成视觉-语言-动作模型中动作幻觉的根源,揭示拓扑、精度和地平线三类障碍对动作生成的影响,提出改进模型可靠性和可信度的方法。

Comments 24 pages; updated setup with minor changes to proofs. changed template

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22663 2026-05-13 cs.CV 57%

AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model

AIA: 重新思考统一多模态模型中的架构解耦策略

Dian Zheng, Manyuan Zhang, Hongyu Li, Kai Zou, Hongbo Liu, Ziyu Guo, Kaituo Feng, Yexin Liu, Ying Luo, Hongsheng Li

机构 * MMLab, CUHK(CUHK多媒体实验室) Meituan(美团) USTC(中国科学技术大学) TJU(天津大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出AIA损失函数,通过学习任务特定的多模态交互模式,缓解任务冲突而不依赖模型解耦,提升生成与理解性能。

Comments Project page: https://zhengdian1.github.io/AIA-project/ Code: https://github.com/zhengdian1/AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07473 2026-05-13 quant-ph cond-mat.stat-mech cs.AI cs.ET cs.LG 50%

Breaking QAOA's Fixed Target Hamiltonian Barrier: A Fully Connected Quantum Boltzmann Machine via Bilevel Optimization

突破QAOA固定目标哈密顿量障碍:通过双层优化的全连接量子玻尔兹曼机

Jun Liu

机构 * School of Economics, Hunan University of Finance and Economics(湖南财经大学经济学院)

专题命中 其他图像生成 :image generation(abstract)

AI总结 本文提出全连接量子玻尔兹曼机,通过双层优化架构改进传统QAOA电路,展示模型在单一层数下具有高测量精度,并在噪声环境下表现出强鲁棒性,同时在图像生成中也表现出稳定性。

Comments 34 pages, 8 figures, 3 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏