arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-09 至 2026-03-09 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2603.05769 2026-03-09 cs.CV 89%

Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers

逐层实例绑定用于文本到图像扩散变换器中的区域和遮挡控制

Ruidong Chen, Yancheng Bai, Xuanpu Zhang, Jianhao Zeng, Lanjun Wang, Dan Song, Lei Sun, Xiangxiang Chu, Anan Liu

机构 * Tianjin University(天津大学)

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 LayerBind通过逐层实例绑定实现文本到图像扩散变换器中的区域和遮挡控制,无需训练即可提升生成质量和遮挡管理能力。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15048 2026-03-09 cs.CV cs.AI cs.LG cs.MM 73%

Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information

使VLM在卡通角色图像上通过姿态信息识别视觉幻觉

Bumsoo Kim, Wonseop Shin, Kyuchul Lee, Yonghoon Jung, Sanghyun Seo

机构 * Chung-Ang University(Chung-Ang 大学) Coupang(韩国Coupang)

专题命中 可控生成 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于姿态信息的VLM幻觉检测方法,通过上下文学习提升识别准确率,实验表明在卡通角色图像中幻觉检测效果提升50%-80%。

Comments Accepted at WACV 2025, Project page: https://gh-bumsookim.github.io/Cartoon-Hallucinations-Detection/. (Fixed typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06014 2026-03-09 cs.CV 57%

EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation

EffectMaker:统一推理与生成以实现定制化视觉效果创建

Shiyuan Yang, Ruihuang Li, Jiale Tao, Shuai Shao, Qinglin Lu, Jing Liao

机构 * Tencent Hunyuan(腾讯文言) City University of Hong Kong(香港城市大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EffectMaker通过统一推理生成框架实现定制化视觉效果创建,利用多模态模型和扩散变换器提升效果质量和一致性,构建大规模数据集增强泛化能力。

Comments Project page: https://effectmaker.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05898 2026-03-09 cs.CV 57%

InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation

InnoAds-Composer: 电商海报生成中的高效条件组合

Yuxin Qin, Ke Cao, Haowei Liu, Ao Ma, Fengheng Li, Honghe Zhu, Zheng Zhang, Run Ling, Wei Feng, Xuanhua He, Zhanjie Zhang, Zhen Guo, Haoyi Bian, Jingjing Lv, Junjie Shen, Ching Law

机构 * JD.com, Inc.(京东公司) Chongqing University of Posts and Telecommunications(重庆邮电大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 InnoAds-Composer通过单阶段框架实现对电商海报生成中主体、文本和风格的高效三条件控制,提升了生成质量并减少了计算开销。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05845 2026-03-09 cs.CV 57%

Cog2Gen3D: Sculpturing 3D Semantic-Geometric Cognition for 3D Generation

Cog2Gen3D: 三维语义-几何认知雕刻用于三维生成

Haonan Wang, Hanyu Zhou, Haoyue Liu, Tao Gu, Luxin Yan

机构 * School of Artificial and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Cog2Gen3D通过结合语义和绝对几何信息,提出了一种三维认知引导的扩散框架,以实现可控的三维生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04461 2026-03-09 cs.CV 57%

UniTS: Unified Spatio-Temporal Generative Model for Remote Sensing

UniTS:面向遥感的统一时空生成模型

Yuxiang Zhang, Shunlin Liang, Wenyuan Li, Han Ma, Jianglei Xu, Yichuan Ma, Jiangwei Xie, Wei Li, Mengmeng Zhang, Ran Tao, Xiang-Gen Xia

机构 * Jockey Club STEM Laboratory of Quantitative Remote Sensing(裘英俊STEM实验室(定量遥感)) Department of Geography, the University of Hong Kong(香港大学地理系) School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息电子学院) Beijing Key Laboratory of Fractional Signals and Systems(北京分数信号与系统重点实验室) Department of Electrical and Computer Engineering, University of Delaware(德雷塞尔大学电气与计算机工程系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 UniTS提出了一种统一时空生成模型,整合时间序列重建、云去除、语义变化检测和预测等任务,通过自适应条件注入和时空感知调节器提升多模态生成质量,有效应对复杂环境挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04843 2026-03-09 cs.CV 57%

PoI: A Filter to Extract Pixel of Interest from Novel Views for Scene Coordinate Regression

PoI: 一种从新视角提取感兴趣像素的滤波器用于场景坐标回归

Feifei Li, Qi Song, Chi Zhang, Hui Shuai, Rui Huang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PoI通过像素级过滤策略提升场景坐标回归的定位精度,结合扩散模型和重投影误差优化新视角合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06282 2026-03-09 physics.flu-dyn cond-mat.soft 50%

Confined drying of a binary liquid mixture droplet: A quantitative interferometric study under humidity control

二元液体混合物滴状受限干燥:在湿度控制下的定量干涉研究

Ole Milark, Jean-Baptiste Salmon, Benjamin Sobac

专题命中 可控生成 :diffusion(abstract)

AI总结 本研究通过干涉仪和湿度控制实验,揭示了二元液体混合物在受限条件下的干燥动力学和传输机制,提取了浓度依赖的扩散系数和水的化学活性。

Journal ref Phys. Rev. Fluids 11, 033603 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏