arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-30 至 2026-03-30 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2506.01949 2026-03-30 cs.CV 83%

IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout

IMAGHarmony:具有一致物体数量和布局的可控图像编辑

Fei Shen, Yutong Gao, Jian Yu, Xiaoyu Du, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 可控生成 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出IMAGHarmony,通过和谐感知模块和偏好引导噪声选择策略,在保持物体数量和布局一致性的前提下实现多物体场景的可控图像编辑,实验表明其在结构一致性和语义准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08277 2026-03-30 cs.CV cs.AI 70%

PISCO: Precise Video Instance Insertion with Sparse Control

PISCO:具有稀疏控制的精确视频实例插入

Xiangbo Gao, Renjie Li, Xinghao Chen, Yuheng Wu, Suofei Feng, Qing Yin, Zhengzhong Tu

机构 * Stanford University(斯坦福大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出PISCO模型,通过稀疏关键帧控制实现精确视频实例插入,解决传统视频编辑中对空间时间定位、物理一致性及动态保持的挑战,采用变量信息引导和分布保持时间遮罩技术提升生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23376 2026-03-30 cs.CV cs.RO 57%

ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment

ABot-PhysWorld:用于机器人操作的交互世界基础模型,具有物理对齐

Yuzhi Chen, Ronghan Chen, Dongjie Huo, Yandan Yang, Dekang Qi, Haoyun Liu, Tong Lin, Shuang Zeng, Junjin Xiao, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ABot-PhysWorld通过物理对齐的交互世界模型,生成物理合理且可控的视频,解决了传统方法在物理仿真中的不足,通过新框架和基准测试提升了性能。

Comments Code: https://github.com/amap-cvlab/ABot-PhysWorld.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25985 2026-03-30 cs.CV 57%

JRM: Joint Reconstruction Model for Multiple Objects without Alignment

JRM:无对齐的多物体联合重建模型

Qirui Wu, Yawar Siddiqui, Duncan Frost, Samir Aroudj, Armen Avetisyan, Richard Newcombe, Angel X. Chang, Jakob Engel, Henry Howard-Jenkins

机构 * Meta Reality Labs Research(Meta现实实验室) Simon Fraser University(西蒙菲莎大学)

专题命中 可控生成 :personalized generation(abstract);分类 cs.CV

AI总结 本文提出JRM模型,通过将物体重建视为个性化生成任务,利用重复信号提升重建质量,无需显式对齐,增强鲁棒性并自然处理非刚性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25892 2026-03-30 cs.CV 57%

THFM: A Unified Video Foundation Model for 4D Human Perception and Beyond

THFM:一种用于4D人体感知及更广泛领域的统一视频基础模型

Letian Wang, Andrei Zanfir, Eduard Gabriel Bazavan, Misha Andriluka, Cristian Sminchisescu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 THFM是一种统一的视频基础模型,能够同时处理密集任务和稀疏任务,其基于预训练的文本到视频扩散模型,并通过可学习的标记增强稀疏预测能力,且在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26003 2026-03-30 math.PR 50%

Pathwise Convergence of a Modular Simulation Scheme for Hybrid SDEs with Memory

具有记忆的混合随机微分方程模拟能量方案的路径收敛性

Oscar Peralta

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种具有记忆的混合随机微分方程(mH-SDEs),扩展了传统混合随机微分方程模型,允许更丰富的依赖关系。开发了模块化-泊松算法,通过路径依赖均匀化生成离散跳跃,并利用现有SDE求解器进行欧几里得演化。理论贡献建立了路径收敛性并给出了显式速率,控制误差累积和过程解耦概率。

详情

展开后加载摘要…

URL PDF HTML 收藏