arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-03 至 2026-04-03 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2604.01361 2026-04-03 cs.CV 79%

IGLOSS: Image Generation for Lidar Open-vocabulary Semantic Segmentation

IGLOSS:面向激光雷达开放词汇语义分割的图像生成

Nermin Samet, Gilles Puy, Renaud Marlet

机构 * LIGM, Ecole des Ponts, Univ Gustave Eiffel, CNRS(LIGM, 巴黎高科桥梁学院, 古斯塔夫·埃菲尔大学, 法国国家科学研究中心)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出一种新的方法,用于3D汽车激光雷达数据的零样本开放词汇语义分割。通过文本生成图像创建原型,利用2D视觉基础模型提取3D网络特征,实现点云标注,方法在nuScenes和SemanticKITTI上达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10720 2026-04-03 cs.LG 67%

Beyond the Black Box: Identifiable Interpretation and Control in Generative Models via Causal Minimality

超越黑箱:通过因果最小性在生成模型中实现可识别的解释与控制

Lingjing Kong, Shaoan Xie, Guangyi Chen, Yuewen Sun, Xiangchen Song, Eric P. Xing, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract)

AI总结 本文通过因果最小性原则,在生成模型中建立可解释性基础,提出层级选择模型框架,实现对生成模型的可控性与解释性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02222 2026-04-03 cs.CV 57%

SCALE: Semantic- and Confidence-Aware Conditional Variational Autoencoder for Zero-shot Skeleton-based Action Recognition

SCALE:语义和置信度感知的条件变分自编码器用于零样本骨骼动作识别

Soroush Oraki, Feng Ding, Jie Liang

机构 * School of Engineering Science, Simon Fraser University(西蒙菲莎大学工程科学学院) School of Information Science and Technology, Eastern Institute of Technology(东方理工信息科学与技术学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SCALE通过语义和置信度感知的条件变分自编码器,解决零样本骨骼动作识别中的语义混淆和细粒度动态问题,提升未见过类的识别性能。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14674 2026-04-03 cs.CV cs.LG 57%

LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models

LaVR:基于大规模4D重建模型的场景潜在条件生成视频轨迹重绘

Mingyang Xie, Numair Khan, Tianfu Wang, Naina Dhingra, Seonghyeon Nam, Haitao Yang, Zhuo Hui, Christopher Metzler, Andrea Vedaldi, Hamed Pirsiavash, Lei Luo

机构 * Meta University of Maryland(马里兰大学) University of Oxford(牛津大学) UC Davis(加州大学戴维斯分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LaVR模型,通过利用大规模4D重建模型的潜在空间中的隐式几何知识,解决视频重绘中几何未条件化模型的空间感知不足和几何条件化模型对深度不准确的依赖问题,实现状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06499 2026-04-03 cs.CV cs.AI 57%

ExGes: Expressive Human Motion Retrieval and Modulation for Audio-Driven Gesture Synthesis

ExGes:基于音频驱动的 gesture 合成中的 expressive 人类运动检索与调节

Xukun Zhou, Fengxin Li, Ming Chen, Yan Zhou, Pengfei Wan, Di Zhang, Yeying Jin, Zhaoxin Fan, Hongyan Liu, Jun He

机构 * Renmin University(中国人民大学) Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ExGes框架,通过运动库构建、运动检索模块和精度控制模块,提升音频驱动手势合成的表达性和与音频语义的一致性,实验表明其在Fréchet Gesture Distance和运动多样性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01364 2026-04-03 math.AP 50%

Nonlocal-to-local convergence of the $p$-Biharmonic evolution equation with the Dirichlet boundary condition

Kehan Shi, Yi Ran

专题命中 可控生成 :inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏