arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-08 至 2026-04-08 共收录 9 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 9 篇

2405.06535 2026-04-08 cs.CV cs.LG 85%

Controllable Image Generation with Composed Parallel Token Prediction

通过组合并行令牌预测实现可控图像生成

Jamie Stirling, Noura Al-Moubayed, Chris G. Willcocks, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种理论指导的离散生成过程组合方法,通过掩码生成(吸收扩散)实现多输入条件的精确组合,提升图像生成的可控性和效率。

Comments 8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05730 2026-04-08 cs.LG 85%

Controllable Image Generation with Composed Parallel Token Prediction

通过组合并行令牌预测实现可控图像生成

Jamie Stirling, Noura Al-Moubayed, Chris G. Willcocks, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract)

AI总结 本文提出一种理论指导的离散生成过程组合方法,通过掩码生成(吸收扩散)实现多输入条件的精确组合,相比现有方法在误差率和FID上均有显著提升,并实现高效的文本到图像生成控制。

Comments 8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF). arXiv admin note: substantial text overlap with arXiv:2405.06535

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05761 2026-04-08 cs.CV 70%

Improving Controllable Generation: Faster Training and Better Performance via $x_0$-Supervision

提升可控生成:通过$x_0$监督实现更快训练和更好性能

Amadou S. Sangare, Adrien Maglo, Mohamed Chaouch, Bertrand Luvison

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,法国原子能委员会,信息与系统实验室)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文通过分析去噪动态,提出$x_0$监督方法,提升可控扩散模型的收敛速度和生成质量,实验显示收敛速度提升2倍,视觉质量和条件准确性均得到改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04953 2026-04-08 cs.CV cs.AI cs.HC cs.IR cs.MM 62%

Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity

生成AI用于视频预告片合成:从提取启发式方法到自回归创造力

Abhishek Dharmaratnakar, Srivaths Ranganathan, Debanshu Das, Anushree Sinha

机构 * Google LLC(谷歌有限责任公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文综述了自动视频预告片生成领域从启发式提取到深度生成合成的转变,探讨了自回归Transformer、LLM协同流程和文本到视频基础模型等生成技术,并讨论了高保真神经合成的伦理挑战。

Comments 7 pages, 3 figures, accepted in WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00503 2026-04-08 cs.CV 57%

Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models

Diff4Splat:基于潜在动态重建模型的可控4D场景生成

Panwang Pan, Chenguo Lin, Jingjing Zhao, Chenxin Li, Yuchen Lin, Haopeng Li, Honglei Yan, Kairun Wen, Yunlong Lin, Yixuan Yuan, Yadong Mu

机构 * Peking University(北京大学) Xiamen University(厦门大学) CUHK(香港中文大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Diff4Splat通过单张图像和相机轨迹生成可控的4D场景,结合视频扩散模型的生成先验与大规模4D数据集学习的几何和运动约束,在单次前向传递中直接预测可变形3D高斯场,无需测试时优化。

Comments Accepted to CVPR 2026. Project page: https://paulpanwang.github.io/Diff4Splat

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05731 2026-04-08 cs.CV 57%

FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips

FoleyDesigner:基于精确时空对齐的沉浸式立体声 Foley 生成

Mengtian Li, Kunyan Dai, Yi Ding, Ruobing Ni, Ying Zhang, Wenwu Wang, Zhifeng Xie

机构 * Shanghai Film Academy, Shanghai University(上海大学上海电影学院) Shanghai Engineering Research Center of Motion Picture Special Effects(上海电影特效工程技术研究中心) University of Surrey, UK(英国萨里大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出 FoleyDesigner 框架,结合视频分析与可控 Foley 生成,引入 FilmStereo 数据集,实现高质量立体声生成与专业音频混合,提升电影沉浸体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18093 2026-04-08 cs.CV 57%

One-to-More: High-Fidelity Training-Free Anomaly Generation with Attention Control

一至多:基于注意力控制的高保真无训练异常生成

Haoxiang Rao, Zhao Wang, Chenyang Si, Yan Lyu, Yuanyi Duan, Fang Zhao, Caifeng Shan

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Shandong University of Science and Technology(山东科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出O2MAG方法,通过自注意力机制生成更真实的异常,解决传统方法训练耗时且分布不真实的问题,实验表明其在下游任务中表现更优。

Comments Accepted by CVPR2026. Code: https://github.com/echrao/O2MAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06133 2026-04-08 cs.RO 50%

Learning-Guided Force-Feedback Model Predictive Control with Obstacle Avoidance for Robotic Deburring

具有障碍物避障的力反馈模型预测控制学习方法用于机器人去毛刺

Krzysztof Wojciechowski, Ege Gursoy, Arthur Haffemayer, Sebastien Kleff, Vincent Bonnet, Florent Lamiraux, Nicolas Mansard

机构 * LAAS-CNRS, Universite de Toulouse, CNRS, Toulouse, France(法国国家科学研究中心LAAS实验室,图卢兹大学,法国图卢兹) Inria, AUCTUS team, Talence, France(法国国家信息与自动化研究所AUCTUS团队,法国塔朗斯) Image and Pervasive Access Laboratory (IPAL), CNRS-UMI, 2955, Singapore(图像与普适接入实验室(IPAL),法国国家科学研究中心-国际联合实验室2955,新加坡) Artificial and Natural Intelligence Toulouse Institute, France(图卢兹人工智能与自然智能研究所,法国)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出结合力反馈MPC与扩散运动先验的框架,解决机器人去毛刺任务中力控制、碰撞避免和复杂运动的问题,通过实验验证其在工业场景下的可靠性与有效性。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14093 2026-04-08 cs.LG cs.AI 50%

Not All Latent Spaces Are Flat: Hyperbolic Concept Control

并非所有潜在空间都是平坦的:双曲概念控制

Maria Rosaria Briglia, Simone Facchiano, Paolo Cursi, Alessio Sampieri, Emanuele Rodolà, Guido Maria D'Amely di Melendugno, Luca Franco, Fabio Galasso, Iacopo Masi

专题命中 可控生成 :text-to-image(abstract)

AI总结 本文提出双曲控制机制,利用双曲表示空间提升概念操控的表达力和稳定性,通过四个安全基准和四个T2I模型验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏