arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-19 至 2026-08-19 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 3 篇

2608.17559 2026-08-19 cs.CV 新提交 57%

MSEditor: Toward Consistent Multi-Shot Video Editing

MSEditor:面向一致性多镜头视频编辑

Kunyu Feng, Yue Ma, Bingyuan Wang, Yuefeng Wang, Zhiyuan Qin, Hao Cheng, Hao Li, Qifeng Chen, Zeyu Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对多镜头视频编辑的身份漂移与累积误差问题,提出首个专用框架MSEditor,通过监督适配器与跨镜头打包策略实现一致性编辑,在基准上性能优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16299 2026-08-19 cs.CV 版本更新 57%

Repurposing 3D Generative Model for Autoregressive Layout Generation

将3D生成模型重新利用于自回归布局生成

Haoran Feng, Yifan Niu, Zehuan Huang, Yang-Tian Sun, Yuxin Peng, Lu Sheng

机构 * School of Software, Beihang University(北航软件学院) Tsinghua University(清华大学) University of Hong Kong(香港大学) Tencent Hunyuan(腾讯文英) Peking University(北京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LaviGen框架,利用3D生成模型直接在3D空间中生成布局,通过自回归过程建模几何关系和物理约束,提升3D场景的物理合理性与效率。

Comments this https URL (https://fenghora.github.io/LaviGen-Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22782 2026-08-19 cs.CV 版本更新 57%

Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models

Know3D: 通过视觉-语言模型的知识提示3D生成

Wenyue Chen, Wenjue Chen, Peng Li, Qinghe Wang, Xu Jia, Heliang Zheng, Rongfei Jia, Yuan Liu, Ronggang Wang

机构 * Peking University(北京大学) Math Magic(数学魔术) The Hong Kong University of Science and Technology(香港科学与技术大学) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) Dalian University of Technology(大连理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Know3D框架,利用多模态大语言模型的知识提升3D生成的可控性,通过潜在状态注入实现语言可控的后视图生成,改进3D生成的几何细节与一致性。

Comments ECCV2026 page: this https URL (https://xishuxishu.github.io/Know3D.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏