arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-23 至 2026-04-23 共收录 2 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 2 篇

2604.19954 2026-04-23 cs.CV 88%

Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens

通过学习视角令牌实现文本到图像生成的相机控制

Xinxuan Lu, Charless Fowlkes, Alexander C. Berg

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出通过学习参数化相机令牌实现文本到图像生成中的精确相机控制,结合3D渲染图像和真实增强图像,提升生成图像的准确性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19683 2026-04-23 cs.RO 50%

Mask World Model: Predicting What Matters for Robust Robot Policy Learning

遮罩世界模型:为鲁棒机器人策略学习预测重要的内容

Yunfan Lou, Xiaowei Chi, Xiaojie Zhang, Zezhong Qian, Chengxuan Li, Rongyu Zhang, Yaoxu Lyu, Guoyu Song, Chuyao Fu, Haoxuan Xu, Pengwei Wang, Shanghang Zhang

机构 * Peking University, Beijing, China State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University Beijing Academy of Artificial Intelligence, Beijing, China National University of Singapore, Singapore The Hong Kong University of Science Nanjing University, Nanjing, China

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出Mask World Model,通过预测语义遮罩而非像素,提升机器人策略学习的鲁棒性与泛化能力,实验证明其在仿真和现实任务中均优于现有方法。

Comments 16 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏