arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-13 至 2026-05-13 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 其他图像生成 3 篇

2602.06339 2026-05-13 cs.RO cs.AI 71%

Action Hallucination in Generative Vision-Language-Action Models

生成视觉-语言-动作模型中的动作幻觉

Harold Soh, Eugene Lim

机构 * Department of Computer Science, School of Computing(计算机科学系,计算系) Smart Systems Institute(智能系统研究所)

专题命中 其他图像生成 :generative vision(title)

AI总结 研究分析生成视觉-语言-动作模型中动作幻觉的根源,揭示拓扑、精度和地平线三类障碍对动作生成的影响,提出改进模型可靠性和可信度的方法。

Comments 24 pages; updated setup with minor changes to proofs. changed template

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22663 2026-05-13 cs.CV 57%

AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model

AIA: 重新思考统一多模态模型中的架构解耦策略

Dian Zheng, Manyuan Zhang, Hongyu Li, Kai Zou, Hongbo Liu, Ziyu Guo, Kaituo Feng, Yexin Liu, Ying Luo, Hongsheng Li

机构 * MMLab, CUHK(CUHK多媒体实验室) Meituan(美团) USTC(中国科学技术大学) TJU(天津大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出AIA损失函数,通过学习任务特定的多模态交互模式,缓解任务冲突而不依赖模型解耦,提升生成与理解性能。

Comments Project page: https://zhengdian1.github.io/AIA-project/ Code: https://github.com/zhengdian1/AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07473 2026-05-13 quant-ph cond-mat.stat-mech cs.AI cs.ET cs.LG 50%

Breaking QAOA's Fixed Target Hamiltonian Barrier: A Fully Connected Quantum Boltzmann Machine via Bilevel Optimization

突破QAOA固定目标哈密顿量障碍:通过双层优化的全连接量子玻尔兹曼机

Jun Liu

机构 * School of Economics, Hunan University of Finance and Economics(湖南财经大学经济学院)

专题命中 其他图像生成 :image generation(abstract)

AI总结 本文提出全连接量子玻尔兹曼机,通过双层优化架构改进传统QAOA电路,展示模型在单一层数下具有高测量精度,并在噪声环境下表现出强鲁棒性,同时在图像生成中也表现出稳定性。

Comments 34 pages, 8 figures, 3 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏