arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-06 至 2026-04-06 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2601.03127 2026-04-06 cs.CV cs.AI 87%

Unified Thinker: A General Reasoning Modular Core for Image Generation

统一思考者:一种通用图像生成的推理模块核心

Sashuai Zhou, Qiang Zhou, Jijin Hu, Hanqing Yang, Yue Cao, Junpeng Ma, Yinchao Ma, Jun Song, Tiezheng Ge, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) Fudan University(复旦大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);image synthesis(abstract)

AI总结 本文提出统一思考者,一种通用图像生成的推理模块核心,旨在通过可执行推理解决生成模型中的推理-执行差距,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02355 2026-04-06 cs.LG cs.CV 79%

From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation

从广泛探索到稳定合成:基于熵的优化用于自回归图像生成

Han Song, Yucheng Zhou, Jianbing Shen, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) University of Macau(澳门大学)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出基于熵的优化方法EG-GRPO,通过调整不确定性分配提升文本到图像生成的稳定性与质量,实验显示其在标准基准上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02748 2026-04-06 cs.CV 70%

Visual Instruction-Finetuned Language Model for Versatile Brain MR Image Tasks

面向多样化脑部MRI任务的视觉指令微调语言模型

Jonghun Kim, Sinyoung Ra, Hyunjin Park

机构 * Sungkyunkwan University(成均馆大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Artificial Intelligence(人工智能系)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出LLaBIT模型,通过视觉指令微调提升语言模型在脑部MRI任务中的表现,通过特征图重用和文本数据生成提升性能,验证了其在报告生成、视觉问答、图像分割和图像翻译中的有效性。

Comments ICPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏