arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4201 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4201 篇

2608.11884 2026-08-13 quant-ph cs.AI cs.CV 新提交 79%

CoQui: A Coordinate-Conditioned Quantum Implicit Generative Adversarial Network for End-to-End Image Generation

CoQui:用于端到端图像生成的坐标条件量子隐式生成对抗网络

Xue Yang, Rigui Zhou, ShiZheng Jia, Dax Enshan Koh, Siong Thye Goh, Young-Wook Cho, YaoChong Li, Xuezhi Ma, Hongyu Chen, Xin Wang

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本研究提出CoQui量子隐式生成对抗网络,通过坐标条件隐式函数学习解决现有QGAN的局限,在更少量子比特下于基准数据集实现优于FRQI、PQWGAN及经典基线的图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13311 2026-08-07 cs.CV 版本更新 79%

FashionPose: Unified Text-Driven Fashion Synthesis with Joint Geometric and Photometric Control

FashionPose:结合几何与光度控制的统一文本驱动时尚合成

Chuancheng Shi, Shaotian Li, Zhenlong Yuan, Zifeng Cheng, Fei Shen

机构 * The University of Sydney(悉尼大学) Shenyang Aerospace University(沈阳航空航天大学) Zhonghuan Information College, Tianjin University of Technology(天津工业大学中环信息学院)

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 提出FashionPose级联架构,通过双向对比对齐、身份锚定合成与提示条件重光照模块,结合PoseCap数据集,实现文本驱动的可控时尚合成,性能优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20924 2026-07-24 cs.CV 新提交 79%

MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer

MagicMakeup:用于高保真妆容转移的区域可控扩散Transformer

Ziyi Wang, Siming Zheng, Yang Yang, Shusong Xu, Hao Zhang, Bo Li, Changqing Zou, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司) vivo BlueImage Lab(vivo蓝图像实验室)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 研究妆容转移中区域可控性等难题,提出MagicMakeup框架,基于空间约束和概念解缠结,用令牌对齐区域门控和跨模态感知指导实现精确编辑与概念澄清,设计数据生成管道并建立基准,提升了多方面性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16409 2026-07-21 cs.CV cs.AI cs.LG 新提交 79%

Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models

思考、规划、绘制:统一模型中用于可控图像生成的布局感知推理

Junhao Liu, Jian-Wei Zhang, Tao Huang, Miles Yang, Zhao Zhong, Liefeng Bo

机构 * Tencent(腾讯) Peking University(北京大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 研究针对统一多模态大语言模型在可控图像生成中难以遵循复杂空间指令的问题,提出ATLAS框架,采用“思考、规划、绘制”范式及布局共享表示,经强化学习提升性能,在图像生成等任务中效果显著,还支持相关编辑与多模态基础,并引入评估基准。

Comments 22 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16286 2026-07-21 cs.CV cs.AI cs.LG 新提交 79%

Depth Estimators Are Implicit Neural Fields for 3D Scene Geometry Inpainting and Reconstruction

深度估计器是用于3D场景几何修复和重建的隐式神经场

Yingzhao Jian, Zihao Lin, Hehe Fan

机构 * College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院)

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV

AI总结 针对现实世界场景数据3D几何不完整问题,提出神经深度场(NDF),将深度估计器视为场景级隐式场解决问题,通过单测试时优化实现,实验表明其在3D场景几何修复中性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15619 2026-07-21 cs.CV 版本更新 79%

StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling

StructGen:通过结构化上下文建模消除多参考图像生成中的歧义

Jianing Peng, Mengyu Wang, Henghui Ding, Zixiang Li, Ting Liu, Xiaochao Qu, Luoqi Liu, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) Institute of Big Data, Fudan University(复旦大学大数据研究院) Visual Intelligence + X International Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际联合实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) MT Lab, Meitu Inc(美图公司MT实验室)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 研究多参考图像生成问题,现有方法因自然语言指令缺陷致效果不佳。提出StructGen,用结构化格式编码参考图像,构建数据集、训练框架和基准,实验证明其在语义对齐和生成一致性上优于现有方法。

Comments Project page: https://jianingpeng0382.github.io/StructGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04303 2026-07-07 cs.CV 新提交 79%

AquaStereo: Enabling Underwater Stereo Matching via Depth-Conditioned Diffusion and Geometry Self-Distillation

AquaStereo:通过深度条件扩散和几何自蒸馏实现水下立体匹配

Qizhe Wei, Yingping Liang, Shaodi You, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 针对水下立体匹配中数据稀缺和特征退化问题,提出AquaStereo框架。用深度条件扩散渲染水下立体对,结合自蒸馏策略,提升水下立体匹配的鲁棒性和零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31918 2026-07-03 cs.CV 新提交 79%

DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation

DriveWeaver: 基于点云条件的视频修复用于自动驾驶仿真中的可控车辆插入

Junzhe Jiang, Zipei Ma, Zijie Pan, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV

AI总结 提出DriveWeaver框架,通过点云条件视频修复实现自动驾驶仿真中可控车辆插入,解决光照不一致和3D资产依赖问题,支持大规模场景增强。

Comments Accepted at ECCV 2026, Project Page: https://github.com/LogosRoboticsGroup/DriveWeaver

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01761 2026-07-03 cs.CV 版本更新 79%

Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion

Control-DINO:用于可控图像到视频扩散的特征空间条件

Edoardo A. Dominici, Thomas Deixelberger, Konstantinos Vardis, Markus Steinberger

机构 * Huawei Technologies, Switzerland(华为技术(瑞士)) Huawei Technologies, Austria(华为技术(奥地利)) Graz University of Technology, Austria(格拉茨技术大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Control-DINO,通过解耦外观与其他特征,实现对视频扩散模型的可控生成,提升生成渲染的可控性。

Comments ECCV 2026 - Project Page https://dedoardo.github.io/projects/control-dino/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01202 2026-07-03 cs.CV cs.RO eess.IV 79%

A Multi-Sensor Fusion Approach for Rapid Orthoimage Generation in Large-Scale UAV Mapping

一种多传感器融合方法用于大规模无人机测绘中的快速正射影像生成

Jialei He, Zhihao Zhan, Zhituo Tu, Xiang Zhu, Jie Yuan

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与技术学院) TopXGun Robotics(TopXGun机器人)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出一种多传感器融合方法,通过优化姿态前馈特征匹配提升速度与精度,有效解决传统正射影像生成在时间性能、系统鲁棒性和地理参考精度方面的不足,适用于低纹理场景如农田的快速正射影像生成。

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00609 2026-07-02 cs.CV 新提交 79%

Diffusion-Based Multi-Class Normality for OOD Detection: An Application to CDP Authentication

基于扩散的多类正态性用于OOD检测:在CDP认证中的应用

Bolutife Atoki, Iuliia Tkachenko, Bertrand Kerautret, Carlos Crispim-Junior

机构 * CNRS(法国国家科学研究中心) INSA Lyon(里昂国立应用科学学院) LIRIS, UMR 5205(LIRIS实验室,UMR 5205)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 提出扩散多类正态性框架,用单一条件ControlNet训练于多类真实CDP,通过重构误差检测伪造,并引入双模板掩码提升性能。

Comments IEEE International Conference on Advanced Visual And Signal-Based Systems, Aug 2026, Lecce, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31924 2026-07-01 cs.CV 新提交 79%

InstanceControl: Controllable Complex Image Generation without Instance Labeling

InstanceControl: 无需实例标注的可控复杂图像生成

Xiaoyu Liu, Huan Wang, Fan Li, Zhixin Wang, Jiaqi Xu, Ming Liu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) HUAWEI Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 提出InstanceControl方法,利用视觉语言模型自动建立文本与视觉条件间的实例对应,无需人工标注,通过自适应掩码细化策略实现复杂多实例场景的精确可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31537 2026-07-01 cs.CV cs.MA 新提交 79%

DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation

DataEvolver: 面向文本丰富图像生成的自我进化多智能体数据构建

Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang

机构 * Central South University(中南大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 提出DataEvolver,一种自我进化的多智能体框架,通过反馈驱动策略迭代优化数据构建,显著提升文本丰富图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29282 2026-06-30 cs.CV 79%

ScaleErasure: Inference-Time Minimal Intervention for Precise Concept Erasure in Next-Scale Autoregressive Image Generation

ScaleErasure:下一尺度自回归图像生成中精确概念擦除的推理时最小干预

Cong Wang, Haiyu Wu, Zhiwei Jiang, Zifeng Cheng, Fei Shen, Yafeng Yin, Qing Gu

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 提出ScaleErasure方法,通过推理时对与不安全概念最相关的logits进行选择和引导,在下一尺度自回归图像生成中实现精确概念擦除,同时保持生成能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15889 2026-06-16 cs.CV 新提交 79%

SiGnature: Explicit Motion Diffusion for Stylized Semantic Gesture

SiGnature: 显式运动扩散用于风格化语义手势

Adi Rosenthal, Tomer Koren, Nadav Shaked, Doron Friedman, Ariel Shamir

机构 * Reichman University(赖希曼大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 提出SiGnature框架,通过显式关节旋转空间和免训练推理机制JMI,实现语义手势的精准控制与说话人风格的高保真保持,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09699 2026-06-09 cs.CV 新提交 79%

Cranio-Diff: Diffusion-based Cross-domain Craniofacial Reconstruction with 2D X-ray Skull Guidance and Structural Identity Constraints

Cranio-Diff: 基于扩散的跨模态颅面重建,利用二维X射线颅骨引导和结构身份约束

Ravi Shankar Prasad, Naresh Gurjar, Shashank Baghel, Chirag, Dinesh Singh

机构 * Indian Institute of Technology Mandi(印度理工学院曼迪分校) CSVTU Bhilai(恰蒂斯加尔邦斯瓦米·维韦卡南达技术大学比莱分校)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Cranio-Diff扩散框架,通过ControlNet的颅骨条件结构引导和生物特征文本条件,从2D X射线颅骨图像重建跨模态人脸,解决结构身份对齐问题,在120名受试者的颅面数据集上优于现有方法。

Comments 14 pages, 7 figures, BMVC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31266 2026-06-01 cs.CV cs.AI cs.LG 79%

Envisioning Beyond the Few: Disentangled Semantics and Primitives for Few-Shot Atypical Layout-to-Image Generation

超越少数:用于少样本非典型布局到图像生成的解耦语义与基元

Nan Bao, Yifan Zhao, Wenzhuang Wang, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Qingdao Research Institute, Beihang University, China(北京航空航天大学青岛研究所,中国)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 针对少样本非典型布局到图像生成中表示碎片化问题,提出通过语义锚定和基元注入解耦语义与视觉细节,实现鲁棒少样本适应。

Comments Accepted to ICML 2026; code available at https://github.com/iCVTEAM/DSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30774 2026-06-01 cs.CV 79%

CameraNoise: Enabling Faithful Camera Control in Video Diffusion through Geometry-Flow-Guided Noise Warping

CameraNoise: 通过几何流引导的噪声扭曲实现视频扩散中的忠实相机控制

Haoyu Zhao, Jiaxi Gu, Haoran Chen, Qingping Zheng, Yeying Jin, Hongyi Yang, Junqi Cheng, Yuang Zhang, Zenghui Lu, Huan Yu, Jie Jiang, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯) Xiamen University(厦门大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 提出CameraNoise方法,通过几何流引导的噪声扭曲将相机运动编码为时间一致的随机表示,实现视频扩散中忠实且几何一致的相机控制。

Comments 28 pages, 16 figures

Journal ref Proceedings of the Forty-third International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30248 2026-06-01 cs.CV 79%

GenClaw: Code-Driven Agentic Image Generation

GenClaw: 代码驱动的智能体图像生成

Junyan Ye, Jun He, Zilong Huang, Dongzhi Jiang, Xuan Yang, Rui Chen, Weijia Li

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 提出GenClaw,一种代码驱动的智能体图像生成范式,通过概念构思、代码草图绘制和纹理补充三个阶段,将黑盒图像生成转变为可控、可解释的分阶段过程。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28491 2026-05-28 cs.CV 79%

DiscoForcing: A Unified Framework for Real-Time Audio-Driven Character Control with Diffusion Forcing

DiscoForcing:基于扩散强制的实时音频驱动角色控制统一框架

Kaiyang Ji, Bingsheng Qian, Binghuan Wu, Kangyi Chen, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 针对实时音频响应角色控制问题,提出DiscoForcing框架,结合因果音乐编码器和扩散强制序列模型,在严格因果、有限延迟的流式生成中实现音频与全身运动的稳定对齐。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21343 2026-05-21 cs.CV 79%

OcclusionFormer: Arranging Z-Order for Layout-Grounded Image Generation

OcclusionFormer: 布局导向图像生成中的Z轴顺序安排

Ziye Li, Henghui Ding

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University, China(大数据研究院,计算机科学与人工智能学院,复旦大学,中国)

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出OcclusionFormer,一种基于Z轴顺序的扩散变换框架,通过解耦实例并利用体积渲染进行合成,以解决布局到图像模型中物体间遮挡问题,并通过查询对齐损失提升空间精度和语义一致性。

Comments ICML 2026, Project Page: https://henghuiding.com/OcclusionFormer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19060 2026-05-20 cs.CV cs.AI eess.IV 79%

LiFT: Lifted Inter-slice Feature Trajectories for 3D Image Generation from 2D Generators

LiFT:用于从2D生成器生成3D图像的提升跨切片特征轨迹

Xinhe Zhang, Yuyang Zhang, Pengfei Jin, Arnau Marin-Llobet, Na Li, Quanzheng Li

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Center for Advanced Medical Computing and Analysis, Massachusetts General Hospital and Harvard Medical School(马萨诸塞总医院和哈佛医学院高级医学计算与分析中心) Kempner Institute, Harvard University(哈佛大学凯普纳研究所)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出LiFT框架,通过将3D体积合成分解为单切片图像生成和跨切片轨迹学习,解决高分辨率3D医学图像生成中体积模型计算成本高和2D切片生成器在第三维度上无法保持解剖一致性的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16961 2026-05-19 cs.CV cs.AI 79%

Latent Action Control for Reasoning-Guided Unified Image Generation

潜在动作控制用于推理引导的统一图像生成

Fuxiang Zhai, Sixiang Chen, Yingjin Li, Shuaibo Li, Jianyu Lai, Tengjun Huang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出Latent Action Control (LAC),通过将推理表示为隐藏的连续动作,使推理过程可操作,从而在统一生成器中实现推理引导的图像生成。LAC通过角色结构化的潜在轨迹进行规划、内部视觉草图、诊断和细化,并将这些动作注入到条件流生成的隐藏流中,从而提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09425 2026-05-12 cs.CV cs.AI 79%

AtteConDA: Attention-Based Conflict Suppression in Multi-Condition Diffusion Models and Synthetic Data Augmentation

AtteConDA:基于注意力的多条件扩散模型与合成数据增强中的冲突抑制

Shogo Noguchi

机构 * Gunma University(群马大学)

专题命中 可控生成 :diffusion(title);image generation(abstract);分类 cs.CV

AI总结 本文提出AtteConDA方法,通过多条件生成模型处理图像生成中的条件冲突,提升结构保持能力,并建立驾驶任务的生成框架和评估协议,缓解高阶自动驾驶任务的数据稀缺问题。

Comments 44 pages, 20 figures. Code and project page available at: https://github.com/ShogoNoguchi/AtteConDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08050 2026-05-11 cs.CV 79%

MoCoTalk: Multi-Conditional Diffusion with Adaptive Router for Controllable Talking Head Generation

MoCoTalk: 多条件扩散与自适应路由的可控说话头生成

Xinyan Ye, Jiankang Deng, Abbas Edalat

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 MoCoTalk通过统一身份、头部姿态、面部表情和嘴部动态四个控制信号,提出自适应多条件路由框架,解决异构条件干扰问题,提升可控说话头生成的性能与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15507 2026-05-11 cs.CV 79%

A Unified and Controllable Framework for Layered Image Generation with Visual Effects

用于具有视觉效果的分层图像生成的统一且可控的框架

Jinrui Yang, Qing Liu, Yijun Li, Mengwei Ren, Letian Zhang, Zhe Lin, Cihang Xie, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) Adobe Research(Adobe研究)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出LASAGNA框架,通过单次前向传递生成逼真背景和具有视觉效果的RGBA前景,支持多种编辑操作,消除身份漂移,同时发布两个社区资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12969 2026-04-15 cs.CV 79%

AbdomenGen: Sequential Volume-Conditioned Diffusion Framework for Abdominal Anatomy Generation

AbdomenGen:用于腹部解剖生成的序列体积条件扩散框架

Yubraj Bhandari, Lavsen Dahal, Paul Segars, Joseph Y. Lo

机构 * Center for Virtual Imaging Trials, Dept. of Radiology, Duke University School of Medicine(虚拟成像试验中心,放射科,杜克大学医学部) Dept. of Electrical and Computer Engineering, Pratt School of Engineering, Duke University(电气与计算机工程系,普拉特工程学院,杜克大学) Dept. of Physics, Trinity School of Arts and Sciences, Duke University(物理系,特里尼蒂艺术与科学学院,杜克大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 AbdomenGen提出了一种序列体积条件扩散框架,通过Volume Control Scalar实现可控的腹部解剖生成,实现了高几何保真度和多器官解耦调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16644 2026-04-14 cs.CV 79%

CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance

CountLoop:通过迭代代理指导实现无训练的高实例图像生成

Anindya Mondal, Ayan Banerjee, Sauradip Nag, Josep Llados, Xiatian Zhu, Anjan Dutta

机构 * University of Surrey(萨里大学) Universitat Autònoma de Barcelona(巴塞罗那自治大学) Simon Fraser University(西蒙菲莎大学)

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 CountLoop通过迭代反馈机制实现高密度场景下的精确实例控制,结合视觉语言模型生成布局和评估反馈,减少计数误差并提升空间质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07664 2026-04-10 cs.CV eess.IV 79%

Monocular Depth Estimation From the Perspective of Feature Restoration: A Diffusion Enhanced Depth Restoration Approach

单目深度估计:从特征修复的角度出发:一种扩散增强的深度修复方法

Huibin Bai, Shuai Li, Hanxiao Zhai, Yanbo Gao, Chong Lv, Yibo Wang, Haipeng Ping, Wei Hua, Xingyu Gao

机构 * School of Software, Shandong University(山东大学软件学院) Shandong University-WeiHai Research Institute of Industrial Technology(山东大学威海工业技术研究院) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) Shandong Institute of Information Technology Industry Development(山东省信息技术产业发展研究院) Research Institute of Interdisciplinary Innovation, Zhejiang Lab(之江实验室交叉创新研究院) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文从特征修复角度提出扩散增强深度修复方法,通过改进编码器特征提升深度估计性能,在KITTI基准上取得显著提升。

Comments Accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16042 2026-04-07 cs.CV 79%

Pose-dIVE: Pose-Diversified Augmentation with Diffusion Model for Person Re-Identification

姿态多样化扩散模型:用于人体重识别的姿态多样化增强

Inès Hyeonsu Kim, Woojeong Jin, Soowon Son, Junyoung Seo, Seokju Cho, JeongYeol Baek, Byeongwon Lee, JoungBin Lee, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) SK Telecom(SK电讯)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Pose-dIVE,通过扩散模型结合姿态和视角信息,增强重识别模型对姿态和视角变化的鲁棒性,提升模型泛化能力。

Comments CVPR 2026 Findings, Project page: https://cvlab-kaist.github.io/Pose-dIVE

详情

展开后加载摘要…

URL PDF HTML 收藏