arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-07 至 2026-04-07 共收录 9 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 9 篇

2406.16042 2026-04-07 cs.CV 79%

Pose-dIVE: Pose-Diversified Augmentation with Diffusion Model for Person Re-Identification

姿态多样化扩散模型:用于人体重识别的姿态多样化增强

Inès Hyeonsu Kim, Woojeong Jin, Soowon Son, Junyoung Seo, Seokju Cho, JeongYeol Baek, Byeongwon Lee, JoungBin Lee, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) SK Telecom(SK电讯)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Pose-dIVE,通过扩散模型结合姿态和视角信息,增强重识别模型对姿态和视角变化的鲁棒性,提升模型泛化能力。

Comments CVPR 2026 Findings, Project page: https://cvlab-kaist.github.io/Pose-dIVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04057 2026-04-07 cs.IT math.IT 78%

CTD-Diff: Cooperative Time-Division Diffusion for Multi-User Semantic Communication Systems

CTD-Diff: 多用户语义通信系统中的协作时分扩散

Chengyang Liang, Dong Li

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出CTD-Diff框架,通过时分多址技术实现多用户协作,将物理信道噪声转化为扩散噪声,提升低信噪比下的语义通信可靠性与重建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04406 2026-04-07 cs.CV 57%

3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image

3D-Fixer:从单张图像生成3D场景的粗到细就地补全

Ze-Xin Yin, Liu Liu, Xinjie Wang, Wei Sui, Zhizhong Su, Jian Yang, Jin Xie

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Horizon Robotics(地平线机器人) D-Robotics

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出3D-Fixer,通过粗到细的生成方案解决单张图像生成3D场景的布局和3D资产恢复问题,结合双分支条件网络和Occlusion-Robust Feature Alignment策略,提升生成精度和效率,同时引入ARSG-110K数据集提升训练效果。

Comments 17 pages, 10 figures, CVPR 2026, project page: https://zx-yin.github.io/3dfixer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01554 2026-04-07 cs.LG cs.AI cs.CV 57%

InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs

InfoTok: 基于信息理论的容量受限共享视觉标记化在统一多模态大语言模型中的应用

Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出InfoTok,一种基于信息瓶颈原理的信息正则化标记化机制,通过互信息约束平衡压缩与任务相关性,提升统一多模态大语言模型的图像理解和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18716 2026-04-07 cs.CV 57%

SketchDeco: Training-Free Latent Composition for Precise Sketch Colourisation

SketchDeco:无需训练的潜在空间构图用于精确草图着色

Chaitat Utintu, Yi-Zhe Song

机构 * SketchX, CVSSP, University of Surrey(萨里大学CVSSP实验室SketchX团队)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SketchDeco通过无需训练的潜在空间构图方法,实现精确草图着色,结合专业设计需求与直观区域控制,利用简单掩码和颜色调色板实现空间和色彩精确指定,无需手动分配或文本提示模糊性。

Comments Accepted in CVPR 2026. Project page available at https://chaitron.github.io/SketchDeco/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03315 2026-04-07 cs.CV cs.AI 57%

StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics

StoryBlender: 具有时空动态的跨镜头一致且可编辑的3D分镜

Bingliang Li, Zhenhong Sun, Jiaming Bian, Yuehao Wu, Yifu Wang, Hongdong Li, Yatao Bian, Huadong Mo, Daoyi Dong

机构 * Independent Researcher(独立研究员) Australia National University(澳大利亚国立大学) Central South University(中南大学) University of New South Wales(新南威尔士大学) Vertex Lab(Vertex实验室) National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 StoryBlender通过三阶段流程实现跨镜头一致性和可编辑性,结合语义空间接地、资产材料化和时空动态,提升3D分镜生成的连续性和编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03305 2026-04-07 cs.CV 57%

HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis

HVG-3D: 联接真实与仿真领域用于3D条件手-物体交互视频合成

Mingjin Chen, Junhao Chen, Zhaoxin Fan, Yujian Lee, Zichen Dang, Lili Wang, Yawen Cui, Lap-Pui Chau, Yi Wang

机构 * Dept. of EEE, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院未来区块链与隐私计算北京高精尖创新中心) Tsinghua University(清华大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院虚拟现实技术与系统国家重点实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HVG-3D提出一种统一框架,通过显式3D表示条件生成3D-aware手-物体交互视频,结合3D ControlNet与扩散架构,实现高保真度与时空可控性。

Comments Project page: https://hvg3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04528 2026-04-07 cs.AI 50%

Receding-Horizon Control via Drifting Models

通过漂移模型实现滚动预测控制

Daniele Foffano, Alessio Russo, Alexandre Proutiere

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Boston University(波士顿大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出Drifting MPC框架,结合漂移生成模型与未知动态下的滚动规划,从离线轨迹数据中学习最优轨迹分布,提升轨迹生成效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09216 2026-04-07 cs.LG q-bio.QM stat.ML 50%

Controllable protein design with particle-based Feynman-Kac steering

基于粒子的费曼-卡茨引导可控蛋白质设计

Erik Hartman, Jonas Wallin, Johan Malmström, Jimmy Olsson

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出利用费曼-卡茨框架引导RFdiffusion生成具有指定性质的蛋白质,通过设计引导势能提升预测界面能量并提高结合设计性。

Comments In version 2 we added an experiment on improving designability through steering towards lower delta G

详情

展开后加载摘要…

URL PDF HTML 收藏