arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-21 至 2026-04-21 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2604.16680 2026-04-21 cs.CV 74%

C-GenReg: Training-Free 3D Point Cloud Registration by Multi-View-Consistent Geometry-to-Image Generation with Probabilistic Modalities Fusion

C-GenReg:基于多视角一致的几何到图像生成的无训练3D点云配准

Yuval Haitman, Amit Efraim, Joseph M. Francos

机构 * Ben-Gurion University(本·古里安大学)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 C-GenReg通过多视角一致的几何到图像生成,结合概率模态融合,实现无训练的3D点云配准,解决了跨模态、采样差异和环境的泛化问题。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18267 2026-04-21 cs.CV 57%

MARCO: Navigating the Unseen Space of Semantic Correspondence

MARCO:导航语义对应未知空间

Claudia Cuttano, Gabriele Trivigno, Carlo Masone, Stefan Roth

机构 * Politecnico di Torino(都灵理工大学) TU Darmstadt(德累斯顿理工大学) ELIZA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MARCO通过新颖的训练框架提升语义对应泛化能力,在多个数据集上取得新突破,同时更高效且更小。

Comments CVPR 2026 Oral. Project page: https://visinf.github.io/MARCO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01643 2026-04-21 cs.CV 57%

ViT$^3$: Unlocking Test-Time Training in Vision

ViT$^3$:解锁视觉中的测试时间训练

Dongchen Han, Yining Li, Tianyu Li, Zixuan Cao, Ziming Wang, Jun Song, Yu Cheng, Bo Zheng, Gao Huang

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出ViT$^3$,一种线性复杂度的纯测试时间训练模型,通过系统研究揭示了视觉序列建模中TTT设计的六个实用原则,并在多个视觉任务中验证其性能。

Comments CVPR 2026, oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17802 2026-04-21 eess.IV cs.CV 57%

Optimally Bridging Semantics and Data: Generative Semantic Communication via Schrödinger Bridge

最优地弥合语义与数据:通过施罗德桥的生成语义通信

Dahua Gao, Ruichao Liu, Minxi Yang, Shuai Ma, Youlong Wu, Guangming Shi

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Pazhou Lab(琶洲实验室) Peng Cheng Laboratory(鹏城实验室) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于施罗德桥的生成语义通信框架,通过优化传输轨迹减少幻觉和计算成本,改进FID和SSIM并加速推理速度。

Comments 23 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17005 2026-04-21 cs.CV cs.SD 57%

TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation

TeMuDance: 基于对比对齐的文本控制音乐驱动舞蹈生成

Xinran Liu, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng

机构 * University of Surrey, Guildford, Surrey, UK(萨里大学) Jiangnan University, Wuxi, Jiangsu, China(江南大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TeMuDance框架,通过统一嵌入空间对齐音乐、文本和运动数据,实现无需手动标注数据的文本控制音乐驱动舞蹈生成,提升语义可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16796 2026-04-21 cs.CV cs.IT eess.SP math.IT 57%

Generative Semantic Communication via Alternating Dual-Domain Posterior Sampling

通过交替双域后验采样实现生成语义通信

Shunpu Tang, Qianqian Yang

机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过交替双域后验采样提升无线图像传输的感知质量,解决传统方法在数据分布保留和领域间冲突的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17986 2026-04-21 cs.SD cs.AI 50%

Latent Fourier Transform

潜在傅里叶变换

Mason Wang, Cheng-Zhi Anna Huang

机构 * CSAIL(计算机科学与人工智能实验室)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出潜在傅里叶变换框架,通过频域控制生成音乐模型,分离音乐模式并保持时尺度特征,提升生成质量与可解释性。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01210 2026-04-21 physics.optics cond-mat.dis-nn physics.med-ph 50%

Harnessing coherent-wave control for sensing applications

利用相干波控制实现传感应用

Pablo Jara, Arthur Goetschy, Hui Cao, Alexey Yamilov

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出微观光学灵敏度理论,通过干涉效应提升光学灵敏度,展示相位共轭输入状态可实现最大灵敏度增强,而最大反射本征通道可全局增强灵敏度分布,为整合波前控制与扩散光学成像提供理论基础。

Comments 26 pages, 11 figures

Journal ref Phys. Rev. Appl. 24, 054027 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏