arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-11 至 2026-05-11 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2605.08043 2026-05-11 cs.CV cs.AI 83%

SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation

SCOPE:结构分解与条件技能协调用于复杂图像生成

Tianfei Ren, Zhipeng Yan, Yiming Zhao, Zhen Fang, Yu Zeng, Guohui Zhang, Hang Xu, Xiaoxiao Ma, Shiting Huang, Ke Xu, Wenxuan Huang, Lionel Z. Wang, Lin Chen, Zehui Chen, Jie Huang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知 MOE 实验室,中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出SCOPE框架,通过结构化规范和条件技能协调解决复杂图像生成中语义承诺的持续跟踪问题,通过Gen-Arena基准验证其有效性,取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07414 2026-05-11 cs.MA cs.AI cs.CR 78%

OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing

OrchJail:通过协调引导的模糊测试对工具调用文本到图像代理进行劫持

Jianming Chen, Yawen Wang, Junjie Wang, Zhe Liu, Qing Wang, Fanjiang Xu

机构 * Institute of Software, Chinese Academy of Sciences, Beijing, China Science \& Technology on Integrated Information System Laboratory, Beijing, China State Key Laboratory of Complex System Modeling University of Chinese Academy of Sciences, Beijing, China

专题命中 文生图 :text-to-image(title,abstract)

AI总结 研究提出OrchJail框架,通过协调引导的模糊测试方法提升对工具调用文本到图像代理的劫持效果,实现更高的攻击成功率和图像质量,同时降低查询成本。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07230 2026-05-11 cs.CV cs.AI 77%

CASCADE: Context-Aware Relaxation for Speculative Image Decoding

CASCADE:基于上下文的放松方法用于推测图像解码

Selin Yildirim, Subhajit Dutta Chowdhury, Mohammad Mahdi Kamani, Vikram Appia, Deming Chen

机构 * AMD(AMD公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CASCADE方法,通过捕捉目标模型隐藏状态中的冗余性,在不额外训练的情况下实现接受放松,提升推测解码效率,实验表明在多模态模型中达到3.6倍加速,保持图像质量和提示一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04676 2026-05-11 cs.CV cs.AI 57%

Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks

解码多图像理解任务中推理视觉语言模型的脉冲

Chenjun Li

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出PulseFocus方法,通过规划和聚焦块结构及软注意力门控,提升多图像推理任务性能,实现在BLINK和MuirBench上分别提升3.7%和1.07%。

Comments This article is withdrawn because the experimental results and analysis require substantial revision. The current version should not be cited as a reliable representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏