arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-27 至 2026-02-27 共收录 10 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2602.23359 2026-02-27 cs.CV cs.AI 88%

SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation

SeeThrough3D: 3D布局生成中的遮挡感知控制

Vaibhav Agrawal, Rishubh Parihar, Pradhaan Bhat, Ravi Kiran Sarvadevabhatla, R. Venkatesh Babu

机构 * IIIT Hyderabad(IIIT海得拉尔) IISc Bengaluru(IISc班加罗尔)

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 SeeThrough3D通过引入遮挡感知的3D场景表示和掩码自注意力机制,实现了对3D布局生成中遮挡关系的精确建模与控制。

Comments Project page: https://seethrough3d.github.io. Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22150 2026-02-27 cs.CV 83%

CoLoGen: Progressive Learning of Concept-Localization Duality for Unified Image Generation

CoLoGen:渐进式学习概念定位二元性以实现统一图像生成

YuXin Song, Yu Lu, Haoyuan Sun, Huanjin Yao, Fanglong Liu, Yifan Sun, Haocheng Feng, Hang Zhou, Jingdong Wang

机构 * Baidu Inc.(百度公司) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 CoLoGen通过渐进式学习概念与定位的二元性,实现统一图像生成的高效表示学习。

Comments Accepted by CVPR2026. 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14377 2026-02-27 cs.CV 83%

RelaCtrl: Relevance-Guided Efficient Control for Diffusion Transformers

RelaCtrl: 为扩散变换器实现相关性引导的高效控制

Ke Cao, Jing Wang, Ao Ma, Jiasong Feng, Xuanhua He, Run Ling, Haowei Liu, Jian Lu, Wei Feng, Haozhe Wang, Hongjuan Pei, Yihua Shao, Zhanjie Zhang, Jie Zhang

专题命中 可控生成 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 RelaCtrl通过相关性引导的方法优化扩散变换器的控制信号整合,减少参数和计算开销,提升生成效率。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19381 2026-02-27 cs.CV cs.GR 81%

Enhancing Sketch Animation: Text-to-Video Diffusion Models with Temporal Consistency and Rigidity Constraints

增强草图动画:带有时间一致性和刚性约束的文本到视频扩散模型

Gaurav Rai, Ojaswa Sharma

机构 * Graphics Research Group, Indraprastha Institute of Information Technology Delhi(印度普拉斯塔信息技术研究所图形研究组)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种基于文本到视频扩散模型的草图动画方法,通过引入时间一致性和刚性约束,提升了动画的平滑度和形状保持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21058 2026-02-27 cs.CV 79%

Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control

超越像素模拟:通过诊断语义标记和原型控制生成病理图像

Minghao Han, Yichen Liu, Yizhou Liu, Zizhi Chen, Jingqun Tang, Xuecheng Wu, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(Fysics智能科技有限公司) University of Science and Technology Beijing(北京科技大学) ByteDance(字节跳动) School of Computer Science and Technology(计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 UniPath通过诊断语义标记和原型控制实现可控的病理图像生成,取得SOTA性能,包括Patho-FID 80.9和98.7%的细粒度语义控制。

Comments accepted by CVPR 2026; 32 pages, 17 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22742 2026-02-27 cs.CV 57%

ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control

ProjFlow: 基于流匹配的投影采样用于零样本精确空间运动控制

Akihisa Watanabe, Qing Yu, Edgar Simo-Serra, Kent Fujiwara

机构 * Waseda University(早稻田大学) LY Corporation(LY公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 ProjFlow通过引入运动学感知度量和时间变化公式,在无需训练的情况下实现精确空间约束满足,提升运动现实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22596 2026-02-27 cs.CV cs.AI 57%

BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model

BetterScene: 一种基于表示对齐生成模型的3D场景合成

Yuci Han, Charles Toth, John E. Anderson, William J. Shuart, Alper Yilmaz

机构 * Dept. of Electrical and Computer Engineering, The Ohio State University(电气与计算机工程系,俄亥俄州立大学) USACE ERDC GRL(美国陆军工程兵队ERDC GRL)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BetterScene通过引入时间等价性正则化和视觉基础模型对齐的表示,提升3D场景合成的视角一致性与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22549 2026-02-27 cs.CV cs.AI 57%

DrivePTS: A Progressive Learning Framework with Textual and Structural Enhancement for Driving Scene Generation

DrivePTS: 一种结合文本和结构增强的渐进式学习框架用于驾驶场景生成

Zhechao Wang, Yiming Zeng, Lufan Ma, Zeqing Fu, Chen Bai, Ziyao Lin, Cheng Lu

机构 * XPeng Motors

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DrivePTS通过渐进式学习、多视角文本生成和频率引导结构损失,提升驾驶场景生成的保真度和可控性,生成稀有场景并增强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19565 2026-02-27 cs.CV cs.AI 57%

DICArt: Advancing Category-level Articulated Object Pose Estimation in Discrete State-Spaces

DICArt: 在离散状态空间中推进类别级拟合物体姿态估计

Li Zhang, Mingyu Mei, Ailing Wang, Xianhui Meng, Yan Zhong, Xinyuan Song, Liu Liu, Rujing Wang, Zaixing He, Cewu Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Peking University(北京大学) Emory University(埃默里大学) Hefei University of Technology(合肥工业大学) Jianghuai Advance Technology Center(江淮先进技术中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DICArt通过离散扩散过程和层次化运动学耦合策略,提升复杂环境下类别级6D姿态估计的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22868 2026-02-27 cs.CL 50%

Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference

拒绝混合:用于高效DLLM推理的快速语义传播掩码标记

Yushi Ye, Feng Hong, Huangjie Zheng, Xu Chen, Zhiyong Chen, Yanfeng Wang, Jiangchao Yao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学联合中位网创新中心,上海交通大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 ReMix通过在离散扩散解码过程中引入连续混合状态,实现高效DLLM推理,提升速度同时保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏