arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-01 至 2026-04-01 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2403.10853 2026-04-01 cs.LG cs.AI cs.CV 57%

GenOL: Generating Diverse Examples for Name-only Online Learning

GenOL:为名称-only在线学习生成多样化示例

Minhyuk Seo, Seongwon Cho, Minjae Lee, Diganta Misra, Hyeonbeom Choi, Seon Joo Kim, Jonghyun Choi

机构 * KU Leuven(鲁汶大学) Seoul National University(首尔大学) ELLIS(欧洲学习与智能系统实验室) MPI-IS Tübingen(马克斯·普朗克智能系统研究所图宾根) Yonsei University(延世大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 针对在线学习中数据分布偏移问题,提出GenOL框架,通过生成模型提升名称-only训练中图像的内在和跨模型多样性,优于传统监督和网络监督方法。

Comments TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29022 2026-04-01 cs.CV 57%

UltraG-Ray: Physics-Based Gaussian Ray Casting for Novel Ultrasound View Synthesis

UltraG-Ray:基于物理的高斯射线投射用于新型超声成像合成

Felix Duelmer, Jakob Klaushofer, Magdalena Wysocki, Nassir Navab, Mohammad Farid Azampour

机构 * Chair for Computer Aided Medical Procedures (CAMP), Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序教席) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出UltraG-Ray,通过学习3D高斯场和物理模块生成更真实的超声B模图像,提升成像真实性与质量。

Comments Accepted at MIDL 2026 / to appear in PMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09666 2026-04-01 cs.CV 57%

Unified Multimodal Models as Auto-Encoders

统一多模态模型作为自编码器

Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Haochen Wang, Zhendong Wang, Bin Lin, Hao Li, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Baidu(百度) Rabbitpre AI(兔展智能) SYSU(中山大学) USTC(中国科学技术大学) CASIA(中国科学院自动化研究所)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出统一GRPO方法,通过强化学习联合优化图像到文本和文本到图像任务,利用重建奖励提升语义一致性,增强多模态协同效果。

详情

展开后加载摘要…

URL PDF HTML 收藏