arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-20 至 2026-03-20 共收录 10 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2603.19227 2026-03-20 cs.CV 79%

Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer

通过扩散基离散运动分词器弥合语义与运动条件

Chenyang Gu, Mingyuan Zhang, Haozhe Xie, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出三阶段框架,结合连续扩散模型与离散分词生成器,通过MoTok分词器实现语义与运动控制的结合,提升运动生成的可控性与保真度。

Comments Project Page: https://rheallyc.github.io/projects/motok GitHub: https://github.com/rheallyc/MoTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18356 2026-03-20 cs.AI 67%

LGESynthNet: Controlled Scar Synthesis for Improved Scar Segmentation in Cardiac LGE-MRI Imaging

LGESynthNet:用于改进心脏LGE-MRI成像瘢痕分割的受控瘢痕合成

Athira J. Jacob, Puneet Sharma, Daniel Rueckert

机构 * Digital Technology and Innovation, Siemens Healthineers(西门子医疗数字化技术与创新部) Al in Healthcare and Medicine, Klinikum rechts der Isar, Technical University of Munich(医疗与医学AI,慕尼黑工业大学右侧医院) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract)

AI总结 本文提出LGESynthNet,一种基于潜在扩散模型的可控合成框架,通过奖励模型、提示模块和生物医学文本编码器,利用少量标注数据生成高质量瘢痕图像,提升后续分割和检测性能。

Comments Accepted at MICCAI STACOM workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19228 2026-03-20 cs.CV 57%

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐

Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan Chen, Hui Zhang, Haocheng Feng, Yu Lu, Hang Zhou, Chun Yuan, Jingdong Wang

机构 * Baidu(百度) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18427 2026-03-20 cs.CV cs.AI 57%

R&D: Balancing Reliability and Diversity in Synthetic Data Augmentation for Semantic Segmentation

R&D: 在语义分割中平衡可靠性与多样性以合成数据增强

Huy Che, Dinh-Duy Phan, Duc-Khai Lam

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(越南胡志明市信息科技学院) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种整合可控扩散模型的合成数据增强方法,通过类感知提示和视觉先验融合提升图像质量,有效提升语义分割性能,尤其在数据稀缺场景中表现优异。

Journal ref Computational Collective Intelligence, ICCCI 2025, Lecture Notes in Computer Science 16139 (2026) 433-448

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16098 2026-03-20 cs.CV cs.AI 57%

LICA: Layered Image Composition Annotations for Graphic Design Research

LICA:图形设计研究的分层图像组成标注

Elad Hirsch, Shubham Yadav, Mohit Garg, Purvanshi Mehta

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 LICA提出了一个包含155万个多层图形设计作品的数据集,通过分层结构和丰富的元数据,推动图形布局的结构理解和生成,同时引入动画布局挑战,支持时序感知生成模型等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20649 2026-03-20 cs.CV 57%

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

Infinity-RoPE: 自动回归自回滚中涌现的无限视频生成

Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Infinity-RoPE,通过Block-Relativistic RoPE、KV Flush和RoPE Cut三个组件解决自回归视频扩散模型的三个瓶颈,实现无限时域、可控和电影级视频生成。

Comments CVPR 2026 | Project Page: https://infinity-rope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18900 2026-03-20 math.AP math.OC 50%

Optimal Bilinear control restricted to the three-dimensional chemo-repulsion model with potential production

最优双线性控制受限于三维化学排斥模型及其潜在生产

Francisco Guillen-Gonzalez, Exequiel Mallea-Zepeda, Maria A. Rodriguez-Bellido, Elder J. Villamizar-Roa

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了带有潜在生产、逻辑反应和双线性控制的三维抛物型化学排斥模型,证明了在特定控制函数下全局弱解的存在性,并探讨了正则性条件对最优双线性控制问题的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18658 2026-03-20 eess.SY cs.SY 50%

Mean-field control barrier functions for stochastic multi-agent systems

均场控制屏障函数用于随机多智能体系统

Cinzia Tomaselli, Gian Carlo Maffettone, Samy Wu Fung, Levon Nurbekyan, Mario di Bernardo

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出均场控制屏障函数,用于保障随机多智能体系统安全,通过稳定性分析和数值模拟验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18367 2026-03-20 math.OC 50%

Stabilization of highly nonlinear hybrid stochastic differential delay equations by periodically intermittent feedback controls based on discrete-time observations with asynchronous switching

基于离散时间观测与异步切换的周期性间断反馈控制对高非线性混合随机微分延迟方程的稳定性研究

Guangqiang Lan, Fansai Meng

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究高非线性混合随机微分延迟方程的矩指数稳定性,设计基于离散时间观测与异步切换的周期性间断控制器,确定观测周期上界和控制宽度下界,证明控制系统的指数稳定性及收敛速度。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16952 2026-03-20 cs.RO cs.AI 50%

Embodied Foundation Models at the Edge: A Survey of Deployment Constraints and Mitigation Strategies

边缘端具身基础模型:部署约束及缓解策略综述

Utkarsh Grover, Ravi Ranjan, Mingyang Mao, Trung Tien Dong, Satvik Praveen, Zhenqi Wu, J. Morris Chang, Tinoosh Mohsenin, Yi Sheng, Agoritsa Polyzou, Eiman Kanjo, Xiaomin Lin

机构 * University of South Florida(佛罗里达州立大学) Florida International University(佛罗里达国际大学) Johns Hopkins University(约翰霍普金斯大学) Nottingham Trent University(诺丁汉特伦特大学) Imperial College London(伦敦帝国理工学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文综述了在边缘端部署具身基础模型时面临的系统性约束及缓解策略,重点探讨了内存带宽、计算延迟和执行成本等关键因素对自动回归视觉-语言-动作策略和扩散控制器的影响,强调了内存、调度、通信和模型架构的协同设计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏