arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-18 至 2026-03-18 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2602.13693 2026-03-18 cs.CV 83%

A WDLoRA-Based Multimodal Generative Framework for Clinically Guided Corneal Confocal Microscopy Image Synthesis in Diabetic Neuropathy

基于WDLoRA的多模态生成框架用于临床指导的糖尿病性周围神经病变角膜共聚焦显微镜图像合成

Xin Zhang, Liangxiu Han, Tam Sobeih, Yue Shi, Yalin Zheng, Uazman Alam, Maryam Ferdousi, Rayaz Malik

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) Department of Eye and Vision Sciences, University of Liverpool(利物浦大学眼科学与视觉科学系) Faculty of Biology, Medicine and Health, University of Manchester(曼彻斯特大学生物、医学与健康学院) Department of Medicine, Weill Cornell Medicine-Qatar(韦尔·柯尔曼医学中心-卡塔尔医学系)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出基于WDLoRA的多模态生成框架,用于生成糖尿病性周围神经病变的角膜共聚焦显微镜图像,通过结合神经分割掩膜和疾病特异性临床提示,提升图像合成的解剖学一致性与临床诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18229 2026-03-18 cs.CV 79%

Unbiased Object Detection Beyond Frequency with Visually Prompted Image Synthesis

超越频率的无偏目标检测:基于视觉提示的图像合成

Xinhao Cai, Liulei Li, Gensheng Pei, Tao Chen, Jinshan Pan, Yazhou Yao, Wenguan Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 本文提出基于生成的去偏框架,通过视觉提示图像合成解决目标检测中的偏见问题,改进了稀有类别的性能,提升了生成图像的布局准确性。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08221 2026-03-18 cs.CV cs.AI cs.LG 70%

Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training

生成任意场景:基于场景图的数据合成用于视觉生成训练

Ziqi Gao, Weikai Huang, Jieyu Zhang, Aniruddha Kembhavi, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Generate Any Scene,通过系统生成场景图来合成高质量数据,用于提升视觉生成模型的合成能力与语义对齐。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15724 2026-03-18 cs.LG cs.AI 50%

Meta-TTRL: A Metacognitive Framework for Self-Improving Test-Time Reinforcement Learning in Unified Multimodal Models

Meta-TTRL:一种用于统一多模态模型中自改进测试时间强化学习的元认知框架

Lit Sin Tan, Junzhe Chen, Xiaolong Fu, Lichen Ma, Junshi Huang, Jianzhong Shi, Yan Li, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 文生图 :text-to-image(abstract)

AI总结 Meta-TTRL通过元认知信号实现测试时间参数优化,提升统一多模态模型的自改进能力,在文本到图像生成任务中取得显著成果。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏