arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-02 至 2026-04-02 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2509.16483 2026-04-02 cs.CV 83%

Octree Diffusion for Semantic Scene Generation and Completion

八叉树扩散用于语义场景生成与补全

Xujia Zhang, Brendan Crowe, Christoffer Heckman

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Autonomous Robotics and Perception Group(自主机器人与感知实验室)

专题命中 可控生成 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出Octree Latent Semantic Diffusion框架,通过八叉树隐式表示实现跨域的3D语义场景补全、扩展和生成,结合结构扩散与语义扩散生成语义标签,无需重训练即可完成单扫描的补全与零样本泛化。

Comments Accepted to ICRA 2026. Revised version with updated paragraphs

Journal ref Proceedings of the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01129 2026-04-02 cs.CV 57%

ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation

ReinDriveGen:强化学习后训练用于分布外驾驶场景生成

Hao Zhang, Lue Fan, Weikang Bian, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(MMLab,香港中文大学) CASIA(中国科学院自动化研究所) SenseTime Research(商汤科技研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ReinDriveGen通过动态点云场景生成与强化学习后训练,实现对驾驶场景的可控生成,提升安全关键场景的模拟质量。

Comments Project page: https://drive-sim.github.io/ReinDriveGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08210 2026-04-02 cs.CV 57%

Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA

Video2LoRA:通过每参考视频LoRA实现统一的语义控制视频生成

Zexi Wu, Baolu Li, Jing Dai, Yiming Zhang, Yue Ma, Qinghe Wang, Xu Jia, Hongming Xu

机构 * Dalian University of Technology(大连理工大学) HKUST(香港科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Video2LoRA框架,通过轻量级超网络预测个性化LoRA权重,实现灵活高效的语义控制视频生成,模型重量小于150MB,具备良好的零样本泛化能力。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15031 2026-04-02 cs.CV 57%

EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing

EditCtrl: 解耦的局部和全局控制用于实时生成视频编辑

Yehonathan Litman, Shikun Liu, Dario Seyb, Nicholas Milef, Yang Zhou, Carl Marshall, Shubham Tulsiani, Caleb Leak

机构 * Meta Reality Labs(Meta现实实验室) Carnegie Mellon University(卡内基梅隆大学) Meta AI

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出EditCtrl,通过局部和全局控制模块实现高效视频修复,提升编辑质量和计算效率,支持多区域编辑和内容传播。

Comments Project page: https://yehonathanlitman.github.io/edit_ctrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02226 2026-04-02 cs.CV cs.AI cs.LG 57%

TempoControl: Temporal Attention Guidance for Text-to-Video Models

TempoControl: 文本到视频模型中的时间注意力引导

Shira Schiber, Ofir Lindenbaum, Idan Schwartz

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TempoControl,通过新颖的优化方法实现文本到视频模型的时间对齐,无需重新训练,支持时间重排、动作时机控制和音频对齐等应用。

Comments Accepted CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10854 2026-04-02 math.NA cs.NA math.PR 50%

Numerical analysis for leaky-integrate-fire networks under Euler-Maruyama

漏积分-火网络在欧拉-马尔蒂尼法下的数值分析

Xu'an Dou, Frank Chen, Kevin K Lin, Zhuo-Cheng Xiao

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了基于电流的漏积分-火网络在欧拉-马尔蒂尼法下的数值误差,通过分析阈值事件和网格诱导的突触计数不匹配,得出了有限时间内的强误差和弱误差界,并探讨了确定性和噪声递归扩展。

Comments 55 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏