arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-18 至 2026-03-18 共收录 11 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 11 篇

2603.15484 2026-03-18 cs.CV cs.AI 83%

RSGen: Enhancing Layout-Driven Remote Sensing Image Generation with Diverse Edge Guidance

RSGen: 通过多样边缘引导增强布局驱动的遥感图像生成

Xianbao Hou, Yonghao He, Zeyd Boukhers, John See, Hu Su, Wei Sui, Cong Yang

机构 * School of Future Science and Engineering, Soochow University, Suzhou, China(未来科学与工程学院,苏州大学) D-Robotics, Beijing, China(北京D-机器人) Fraunhofer Institute for Applied Information Technology, Sankt Augustin, Germany(弗劳恩霍夫应用信息技术研究所) School of Mathematical and Computing Sciences, Heriot-Watt University Malaysia, Putrajaya, Malaysia(数学与计算科学学院,赫瑞-瓦德大学马来西亚分校) Institute of Automation, Chinese Academy of Sciences, Beijing, China(自动化研究所,中国科学院北京分院)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 RSGen通过多样边缘引导提升布局驱动的遥感图像生成,增强细粒度控制并严格遵守边界框约束,实验表明其显著提升了现有L2I模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16576 2026-03-18 cs.CV cs.AI cs.CR cs.LG 79%

REFORGE: Multi-modal Attacks Reveal Vulnerable Concept Unlearning in Image Generation Models

REFORGE:多模态攻击揭示图像生成模型中的脆弱概念反向学习

Yong Zou, Haoran Li, Fanxiao Li, Shenyang Wei, Yunyun Dong, Li Tang, Wei Zhou, Renyang Liu

机构 * Yunnan University(云南大学) Northeastern University(东北大学) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 REFORGE通过对抗性图像提示评估图像生成模型反向学习的鲁棒性,揭示现有方法的持续漏洞,提出更高效的多模态对抗攻击策略。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10402 2026-03-18 cs.LG cs.AI cs.CE 78%

Controllable Graph Generation with Diffusion Models via Inference-Time Tree Search Guidance

通过推理时间树搜索引导实现可控图生成

Jiachi Zhao, Zehong Wang, Yamei Liao, Chuxu Zhang, Yanfang Ye

机构 * University of Notre Dame(内布拉斯加大学) Independent Researcher(独立研究者) University of Connecticut(康涅狄格大学)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出TreeDiff框架,通过MCTS引导双空间扩散模型实现可控图生成,解决传统方法控制不足的问题,实验显示其在分子生成中表现优异。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16871 2026-03-18 cs.CV 57%

WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation

WorldCam: 交互式自回归3D游戏世界与相机姿态作为统一的几何表示

Jisu Nam, Yicong Hong, Chun-Hao Paul Huang, Feng Liu, JoungBin Lee, Jiyoung Kim, Siyoon Jin, Yunsung Lee, Jaeyoon Jung, Suhwan Choi, Seungryong Kim, Yang Zhou

机构 * Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldCam,通过将相机姿态作为统一的几何表示,解决交互式游戏世界中动作控制与长时序3D一致性问题,结合物理连续动作空间和全局相机姿态索引提升导航与视觉质量。

Comments Project page is available at https://cvlab-kaist.github.io/WorldCam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16373 2026-03-18 cs.CV 57%

Semantic One-Dimensional Tokenizer for Image Reconstruction and Generation

语义一维分词器用于图像重建与生成

Yunpeng Qu, Kaidong Zhang, Yukang Ding, Ying Chen, Jian Wang

机构 * Tsinghua University, Beijing, China(清华大学,北京,中国) Alibaba Group, Beijing, China(阿里巴巴集团,北京,中国)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出SemTok,一种语义一维分词器,通过压缩2D图像为1D离散token实现高效图像重建,采用三重创新框架提升生成效果。

Comments 18 pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16362 2026-03-18 cs.CV cs.AI 57%

$D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation

$D^3$-RSMDE:40倍更快且高保真度的遥感单目深度估计

Ruizhi Wang, Weihan Li, Zunlei Feng, Haofei Zhang, Mingli Song, Jiayu Wang, Jie Song, Li Sun

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出$D^3$-RSMDE框架,结合ViT快速生成初步深度图并利用轻量级U-Net进行细节优化,实现高效高保真度的遥感单目深度估计,比现有方法快40倍且LPIPS指标降低11.85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16188 2026-03-18 cs.CV 57%

ECHO: Edge-Cloud Humanoid Orchestration for Language-to-Motion Control

ECHO:边缘-云计算人形机器人语言到动作控制

Haozhe Jia, Jianfei Song, Yuan Zhang, Honglei Jin, Youcheng Fan, Wenshuo Chen, Wei Zhang, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LimX Dynamics Technology Co., Ltd.(LimX动力技术有限公司) Shandong University(山东大学) Institute of Deep Perception Technology, Jiangsu Industrial Technology Research Institute (JITRI)(江苏工业技术研究院深度感知技术研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ECHO提出边缘-云计算框架,通过云端扩散模型生成自然语言指令对应动作,边缘设备通过强化学习跟踪执行,采用紧凑的机器人本征动作表示实现高效控制,实现实时动作生成与安全执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16169 2026-03-18 cs.CV 57%

Gaze-guided Hand-Object Interaction Synthesis: Dataset and Method

引导注视的手-物体交互合成:数据集与方法

Jie Tian, Ran Ji, Lingxiao Yang, Suting Ni, Yuexin Ma, Lan Xu, Jingyi Yu, Ye Shi, Jingya Wang

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出 gaze-guided 手-物体交互合成任务,引入首个捕捉 gaze、手和物体交互的 GazeHOI 数据集,并提出 GHO-Diffusion 模型以解决高一致性与物理合理性问题。

Comments Accepted by IEEE Transactions on Multimedia (TMM), 2026. Project Page: https://takiee.github.io/gaze-hoi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16397 2026-03-18 cs.CL cs.AI 50%

Fanar 2.0: Arabic Generative AI Stack

Fanar 2.0:阿拉伯生成AI堆栈

FANAR TEAM, Ummar Abbas, Mohammad Shahmeer Ahmad, Minhaj Ahmad, Abdulaziz Al-Homaid, Anas Al-Nuaimi, Enes Altinisik, Ehsaneddin Asgari, Sanjay Chawla, Shammur Chowdhury, Fahim Dalvi, Kareem Darwish, Nadir Durrani, Mohamed Elfeky, Ahmed Elmagarmid, Mohamed Eltabakh, Asim Ersoy, Masoomali Fatehkia, Mohammed Qusay Hashim, Majd Hawasly, Mohamed Hefeeda, Mus'ab Husaini, Keivin Isufaj, Soon-Gyo Jung, Houssam Lachemat, Ji Kim Lucas, Abubakr Mohamed, Tasnim Mohiuddin, Basel Mousi, Hamdy Mubarak, Ahmad Musleh, Mourad Ouzzani, Amin Sadeghi, Husrev Taha Sencar, Mohammed Shinoy, Omar Sinan, Yifan Zhang

机构 * Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 可控生成 :image generation(abstract)

AI总结 Fanar 2.0在资源受限条件下实现卓越性能,通过数据质量优先、持续预训练和模型融合,提升阿拉伯语知识、语言、方言及英语能力,同时引入多项新功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16383 2026-03-18 math.OC 50%

Exact Cost-Increment Formula for Optimal Control of Semilinear Evolution Equations

半线性演算方程最优控制的精确成本增量公式

Roman Chertovskih, Nikolay Pogodaev, Maxim Staritsyn, A. Pedro Aguiar

专题命中 可控生成 :diffusion(abstract)

AI总结 本文推导了半线性演算方程在Banach空间中多控制通道最优控制的精确成本增量公式,提出无需线性化或步长调节的单调下降算法,并在受控反应扩散方程上验证了方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16359 2026-03-18 cs.HC 50%

One Kiss: Emojis as Agents of Genre Flux in Generative Comics

一吻:表情符号在生成漫画中的风格流动作用

Xiruo Wang, Xinyi Jiang, Ziqi Lyu

专题命中 可控生成 :text-to-image(abstract)

AI总结 One Kiss通过表情符号引导漫画生成,使用户通过表情符号设定情感基调,实现风格流动,重新定义用户角色为叙事导演。

Comments Accepted to CHI 202X Extended Abstracts

详情

展开后加载摘要…

URL PDF HTML 收藏