arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-20 至 2026-05-20 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2605.19060 2026-05-20 cs.CV cs.AI eess.IV 79%

LiFT: Lifted Inter-slice Feature Trajectories for 3D Image Generation from 2D Generators

LiFT:用于从2D生成器生成3D图像的提升跨切片特征轨迹

Xinhe Zhang, Yuyang Zhang, Pengfei Jin, Arnau Marin-Llobet, Na Li, Quanzheng Li

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Center for Advanced Medical Computing and Analysis, Massachusetts General Hospital and Harvard Medical School(马萨诸塞总医院和哈佛医学院高级医学计算与分析中心) Kempner Institute, Harvard University(哈佛大学凯普纳研究所)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出LiFT框架,通过将3D体积合成分解为单切片图像生成和跨切片轨迹学习,解决高分辨率3D医学图像生成中体积模型计算成本高和2D切片生成器在第三维度上无法保持解剖一致性的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19554 2026-05-20 cs.CV 70%

Self-Creative Text-to-Object Generation using Semantic-Aware Spatial Weighting

基于语义感知空间加权的自创文本到物体生成

Yue Yu, Haibo Chen, Shuo Chen, Jian Yang, Jun Li

机构 * Nanjing University of Science and Technology(南京理工大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种自创扩散模型SCDiff,通过学习空间加权模块和视觉-语义混合损失模块,提升文本到图像生成的创意性和语义对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19995 2026-05-20 cs.CV 57%

CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition

CogOmniControl: 通过创意意图认知实现推理驱动的可控视频生成

Hongji Yang, Songlian Li, Yucheng Zhou, Xiaotong Zhao, Alan Zhao, Chengzhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS实验室) Online-Video BU, Tencent(腾讯在线视频事业部)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CogOmniControl框架,通过将可控视频生成分解为创意意图认知和生成两个阶段,利用专门训练的CogVLM生成更专业清晰的输出,并通过强化学习对齐不同条件的控制,最终在两个基准测试中超越现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22940 2026-05-20 cs.CV 57%

One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer

一对一动画:无对齐角色动画和图像姿态转换

Shijun Shi, Jing Xu, Zhihang Li, Chunli Peng, Xiaoda Yang, Lijing Lu, Kai Hu, Jiangning Zhang

机构 * Jiangnan University(江南大学) University of Science and Technology of China(中国科学技术大学) Chinese Academy of Sciences(中国科学院) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种统一框架,用于高保真角色动画和图像姿态转换,解决了参考姿态错位问题,通过自监督补全任务和混合参考融合注意力机制提升生成质量。

Comments Project Page:https://ssj9596.github.io/one-to-all-animation-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12172 2026-05-20 cs.LG cs.CR cs.CV 57%

SEAL: Semantic Aware Image Watermarking

SEAL:语义感知图像水印

Kasra Arabi, R. Teal Witter, Chinmay Hegde, Niv Cohen

机构 * New York University(纽约大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种新的水印方法,通过将生成图像的语义信息直接嵌入水印中,实现无损水印验证,无需依赖密钥模式数据库。通过局部敏感哈希从图像语义嵌入中推断密钥模式,并基于原始图像内容条件检测水印,提高对抗伪造攻击的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19978 2026-05-20 math.OC math.AP math.PR 50%

Analytical Approach to Continuous-Time Causal Optimal Transport

连续时间因果最优传输的解析方法

Julio Backhoff, Erhan Bayraktar, Ibrahim Ekren, Antonios Zitridis

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了连续时间因果最优传输问题,通过将源替换为其给定目标观测的条件分布,利用全非线性抛物型主方程在扩展状态空间中刻画传输问题的值,并展示了该值与两个等价的随机控制问题在单纯形上的解一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11325 2026-05-20 math.OC 50%

A model reduction method based on nonlinear optimization for multiscale stochastic optimal control problems

基于非线性优化的多尺度随机最优控制问题模型降维方法

Lingling Ma, Jingyi Zhang, Qiuqi Li

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种基于非线性优化的多尺度随机最优控制问题的降维方法,通过非侵入式、数据驱动的降阶建模框架,利用梯度优化最小化L2范数输出误差,实现参数到输出的映射近似,适用于实时应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10891 2026-05-20 cs.RO cs.LG 50%

Iterative Compositional Data Generation for Robot Control

迭代组合数据生成用于机器人控制

Anh-Quan Pham, Marcel Hussing, Shubhankar P. Patankar, Dani S. Bassett, Jorge Mendez-Mendez, Eric Eaton

机构 * University of Pennsylvania(宾夕法尼亚大学) Stony Brook University(石溪大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种语义组合扩散变换器,通过注意力机制学习机器人、物体、障碍物和目标特定组件的交互,从而在有限任务集上训练后,能够零样本生成高质量过渡,进而学习未见任务组合的控制策略,并通过迭代自我改进过程提升零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏