arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-02 至 2026-04-02 共收录 33
2511.22690 2026-04-02 cs.CV

Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation

Ar2Can:利用画布进行多人体生成的架构与艺术家

Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research, an initiative of Qualcomm Technologies, Inc.(高通人工智能研究院,高通技术公司旗下)

AI总结 Ar2Can提出一种两阶段框架,通过分离空间规划与身份渲染,解决多人体生成中人脸身份丢失问题,采用空间引导的面部匹配奖励提升生成质量,使用合成数据实现高精度和保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01399 2026-04-02 cs.CV

Resolving the Identity Crisis in Text-to-Image Generation

缓解文本到图像生成中的身份危机

Shubhankar Borse, Farzad Farhadzadeh, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究院)

AI总结 本文提出DisCo框架,通过强化学习优化图像内和跨样本的身份多样性,解决多人类生成中的身份重复和计数错误问题,无需真实数据,在DiverseHumans数据集上取得高准确率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13129 2026-04-02 cs.CV cs.AI cs.LG

Science-T2I: Addressing Scientific Illusions in Image Synthesis

Science-T2I: 解决图像合成中的科学幻觉

Jialuo Li, Wenhao Chai, Xingyu Fu, Haiyang Xu, Saining Xie

机构 * New York University(纽约大学) University of Washington(华盛顿大学) University of Pennsylvania(宾夕法尼亚大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本文提出ScienceT2I数据集,评估18种图像生成模型,发现科学提示能显著提升生成效果,提出SciScore奖励模型和两阶段对齐框架提升科学推理能力。

Comments Accepted to CVPR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://jialuo-li.github.io/Science-T2I-Web

详情

展开后加载摘要…

URL PDF HTML 收藏