arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-14 至 2026-04-14 共收录 13 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 13 篇

2604.11680 2026-04-14 cs.RO 88%

Dual-Control Frequency-Aware Diffusion Model for Depth-Dependent Optical Microrobot Microscopy Image Generation

双控频率感知扩散模型用于深度依赖光学微机器人显微图像生成

Lan Wei, Zongcai Tan, Kangyi Lu, Jian-Qing Zheng, Dandan Zhang

机构 * Department of Bioengineering, Imperial-X AI Initiative, Imperial College London(帝国理工学院生物工程系、Imperial-X人工智能计划) CAMS-Oxford Institute, University of Oxford(牛津大学CAMS-Oxford研究所)

专题命中 可控生成 :diffusion(title,abstract);image generation(title);image synthesis(abstract)

AI总结 本文提出Du-FreqNet,通过双控频率感知扩散模型生成物理一致的显微图像,提升微机器人自主操作的3D感知能力,改进SSIM并增强下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16644 2026-04-14 cs.CV 79%

CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance

CountLoop:通过迭代代理指导实现无训练的高实例图像生成

Anindya Mondal, Ayan Banerjee, Sauradip Nag, Josep Llados, Xiatian Zhu, Anjan Dutta

机构 * University of Surrey(萨里大学) Universitat Autònoma de Barcelona(巴塞罗那自治大学) Simon Fraser University(西蒙菲莎大学)

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 CountLoop通过迭代反馈机制实现高密度场景下的精确实例控制,结合视觉语言模型生成布局和评估反馈,减少计数误差并提升空间质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10617 2026-04-14 eess.IV cs.CV cs.MM 73%

Brain-Grasp: Graph-based Saliency Priors for Improved fMRI-based Visual Brain Decoding

Brain-Grasp: 基于图的显著性先验用于改进基于fMRI的视觉脑解码

Mohammad Moradi, Morteza Moradi, Marco Grassia, Giuseppe Mangioni

机构 * University of Catania, Catania, Italy(卡塔尼亚大学,卡塔尼亚,意大利)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于图的显著性先验框架,利用脑信号结构线索生成空间掩码,结合语义信息引导扩散模型,提升fMRI视觉解码的结构和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17022 2026-04-14 cs.CV cs.AI cs.CL cs.LG cs.MM 62%

GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning

GoT-R1:通过强化学习提升MLLM的视觉生成推理能力

Chengqi Duan, Rongyao Fang, Yuqing Wang, Kun Wang, Linjiang Huang, Xingyu Zeng, Hongsheng Li, Xihui Liu

机构 * HKU MMLAB(香港大学多媒体实验室) CUHK MMLAB(香港中文大学多媒体实验室) Sensetime(商汤科技) Beihang University(北京航空航天大学) SUAT(上海人工智能实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM

AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。

Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10940 2026-04-14 cs.CV 57%

AmodalSVG: Amodal Image Vectorization via Semantic Layer Peeling

AmodalSVG:基于语义层剥离的模态图像向量化

Juncheng Hu, Ziteng Xue, Guotao Liang, Anran Qi, Buyu Li, Sheng Wang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Igarashi Lab, The University of Tokyo(东京大学五十岚实验室) Bambu Lab Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 AmodalSVG通过语义层剥离技术,实现对自然图像中遮挡区域的完整几何向量化,提升SVG的结构编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14671 2026-04-14 cs.CV 57%

Mirai: Autoregressive Visual Generation Needs Foresight

Mirai: 自回归视觉生成需要前瞻性

Yonghao Yu, Lang Huang, Zerun Wang, Runyi Li, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) Peking University(北京大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 研究探讨前瞻性训练信号对自回归视觉生成的影响,提出Mirai框架通过注入未来信息提升生成质量与收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10132 2026-04-14 cs.CV cs.AI 57%

Semantic Manipulation Localization

语义操控定位

Zhenshan Tan, Chenhan Lu, Yuxiang Huang, Ziwen He, Xiang Zhang, Yuzhe Sha, Xianyi Chen, Tianrun Chen, Zhangjie Fu

机构 * Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学数字取证教育部工程研究中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) KOKONI3D, Moxin (Hangzhou) Technology Company Ltd.(KOKONI3D,魔芯(杭州)科技有限公司)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 本文提出语义操控定位任务,通过TRACE框架实现对图像中微妙语义编辑的定位,优于传统IML方法,提供更完整的定位结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10030 2026-04-14 cs.CV 57%

Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation

提示中继:多事件视频生成的推理时时间控制

Gordon Chen, Ziqi Huang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Prompt Relay方法,通过在交叉注意力机制中引入惩罚项,实现多事件视频生成中的细粒度时间控制,提升文本-视频对齐和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11786 2026-04-14 cs.AI cs.MA 50%

GenTac: Generative Modeling and Forecasting of Soccer Tactics

GenTac:生成式足球战术建模与预测

Jiayuan Rao, Tianlin Gui, Haoning Wu, Yanfeng Wang, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 GenTac通过生成式框架建模足球战术的随机过程,实现长周期轨迹预测,支持多因素条件模拟,展现高精度战术生成与未来战术预测能力。

Comments 40 pages, 5 figures; technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11353 2026-04-14 eess.SY cs.SY 50%

Leader-Follower Density Control of Multi-Agent Systems with Interacting Followers: Feasibility and Convergence Analysis

多智能体系统中领导者-跟随者密度控制:可行性与收敛性分析

Beniamino Di Lorenzo, Gian Carlo Maffettone, Mario di Bernardo

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了领导者-跟随者多智能体系统中密度控制问题,考虑了跟随者间的交互作用,推导了可行性条件和反馈控制律,通过数值模拟验证了理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10798 2026-04-14 eess.SY cs.ET cs.SY 50%

A Control-Referenced Tri-Channel OECT Receiver for Hybrid Molecular Communication Toward Brain Organoid Interfaces

面向脑类器官接口的混合分子通信三通道OECT接收机

Hongbin Ni, Ozgur B. Akan

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种基于控制参考的三通道OECT接收机,用于混合分子通信中的神经递质检测,通过控制像素匹配降低漂移影响,提升接收性能。

Comments 16 pages, 7 figures, submitted to IEEE Transactions on Molecular, Biological, and Multi-Scale Communications (TMBMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10714 2026-04-14 math.OC 50%

A Hierarchical Robust Control Strategy for Stochastic Kuramoto--Sivashinsky--Korteweg--de Vries Equations

一种针对随机 Kuramoto-Sivashinsky-Korteweg-de Vries 方程的分层鲁棒控制策略

Abdellatif Elgrou, Omar Oukdach, Abdelaziz Rhandi

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种分层鲁棒控制策略,针对随机KS-KdV方程实现零可控性,通过鞍点存在性和Carleman估计解决强耦合前向-后向随机系统分析问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10201 2026-04-14 physics.flu-dyn cond-mat.mes-hall 50%

Fundamental thermo-visco mechanical interactions governing the acoustic response of laser-excited nanoparticles

支配激光激发纳米颗粒声学响应的基本热粘弹性力学相互作用

Stefano Giordano, Michele Diego, Francesco Banfi, Michele Brun

专题命中 可控生成 :diffusion(abstract)

AI总结 研究激光加热引发的声波生成与传播,分析热声效应与机械声效应的耦合机制,探讨粘性对声波衰减和穿透深度的影响。

Journal ref J. Appl. Phys. 139, 135105 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏