arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-06 至 2026-08-06 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 7 篇

2510.14190 2026-08-06 cs.LG 版本更新 78%

Contrastive Diffusion Alignment: Learning Structured Latents for Controllable Generation

对比扩散对齐:用于可控生成的结构化潜在学习

Ruchi Sandilya, Sumaira Perez, Charles Lynch, Lindsay Victoria, Benjamin Zebley, Derrick Matthew Buchanan, Mahendra T. Bhati, Nolan Williams, Timothy J. Spellman, Faith M. Gunning, Conor Liston, Logan Grosenick

机构 * Department of Psychiatry, Weill Cornell Medicine, New York, NY, USA(威立·科林斯医学中心精神科) Department of Psychiatry, Stanford University, Stanford, CA, USA(斯坦福大学精神科) Department of Neuroscience, University of Connecticut School of Medicine, Farmington, CT, USA(康涅狄格大学医学院神经科学系)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 ConDA通过对比学习在扩散模型中学习结构化潜在空间,实现可控生成和动态解释。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04737 2026-08-06 cs.CV cs.GR 新提交 62%

Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors

基于稀疏直接飞行时间传感器的密集度量深度补全

Hakyeong Kim, Ruicheng Wang, Chengtang Yao, Jiaolong Yang, Min H. Kim

机构 * KAIST(韩国科学技术院) USTC(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种深度引导双分支视觉Transformer框架,结合dToF模拟流程,实现稀疏dToF到密集度量深度的零样本泛化补全,性能优于现有方法且高效。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05069 2026-08-06 cs.CV cs.AI 新提交 57%

VQ-VAD: Vector-quantized Motion Representation Learning for Human-centric Video Anomaly Detection

VQ-VAD:面向以人为中心的视频异常检测的向量量化运动表示学习

Narges Rashvand, Ghazal Alinezhad Noghre, Shanle Yao, Gabriel Maldonado, Hamed Tabkhi

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 针对现有基于姿态的视频异常检测方法的局限,提出VQ-VAD框架,通过向量量化学习离散运动表示,在多评估设置的基准测试中取得优异性能,代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04622 2026-08-06 cs.CV 新提交 57%

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

DAC-Pose:用于姿态引导人体生成的双智能体协作框架

Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen University of Advanced Technology(深圳理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。

Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16060 2026-08-06 cs.CV 版本更新 57%

ArtChart: Faithful Artistic Chart Generation with Integrated Text Rendering

ArtChart:一个用于忠实生成艺术图表并集成文本渲染的基准测试

Meijia Huang, Yingjie Yin, Shihao Wang, Chenguang Ma

机构 * Ant Group(蚂蚁集团)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 研究旨在解决艺术图表生成难题,提出ArtChart框架,含特定即插即用模块及强化学习等策略,构建基准测试和评估套件,实验证明该框架能生成兼具美观与数学准确性的图表,优于开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12000 2026-08-06 cs.CV 版本更新 57%

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

MetaView:基于尺度感知隐式几何先验的单目新视图合成

Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) Kolors Team, Kuaishou Technology(快手科技色彩团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。

Comments accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24015 2026-08-06 math.OC cs.GT cs.SY econ.TH eess.SY 版本更新 50%

Continuous-Time Information-Mechanism Control

多区域电力系统协调的分布鲁棒联合信息与机制设计

Furkan Sezer

专题命中 可控生成 :diffusion(abstract)

AI总结 针对多区域电力系统协调问题,提出分布鲁棒的联合信息与机制设计框架,通过高斯公共信号和Groves转移机制实现激励对齐,并利用Isaacs方程求解,在2021年Uri暴风雪案例中验证了信息设计和市场耦合的互补性。

Comments 41 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏