arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-23 至 2026-06-23 共收录 14 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 14 篇

2606.22945 2026-06-23 cs.GR cs.CV 新提交 86%

Controllable Texture Tiling with Transformed RoPE-Enhanced Diffusion Models

可控纹理平铺:基于变换RoPE增强扩散模型

Junrong Huang, Zhiyuan Zhang, Rui Tang, Hongbo Fu, Jnig Liao

机构 * City University of Hong Kong(香港城市大学) Manycore Tech Inc.(Manycore科技公司) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 可控生成 :diffusion(title,abstract);image editing(abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 提出基于扩散变换器的可控纹理平铺框架,通过坐标变换旋转位置编码实现精确平铺控制,并利用分离注意力掩码保持参考纹理结构,同时与场景光照几何无缝融合。

Comments The code and dataset are publicly accessible at https://github.com/junrongh/ControlTile

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22477 2026-06-23 cs.CV 新提交 83%

Physically-guided Image Generation for Multi-Projection Mapping

多投影映射的物理引导图像生成

Xingyun Liu, Yuqi Li, Jinhui Xiang, Pinyan Tang, Chong Wang

机构 * Ningbo University(宁波大学)

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对投影映射中理想化2D生成与物理约束不匹配的问题,提出统一可控的物理引导生成框架ConPhyG,支持合作与对抗两种范式,通过注入多维物理先验或数值优化实现几何对齐、色域利用和语义保真度的显著提升。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23679 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 81%

Semantic Browsing: Controllable Diversity for Image Generation

语义浏览:图像生成的可控多样性

Sara Dorfman, Maya Vishnevsky, Omer Dahary, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

专题命中 可控生成 :image generation(title);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 针对文本到图像模型生成多样性不足且缺乏语义结构的问题,提出一种在文本层面引入多样性的方法,通过视觉语言模型和代理工作流实现用户可导航的语义变化空间。

Comments ECCV 2026. Project page: https://saradorfman1.github.io/SemanticBrowsing-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14275 2026-06-23 eess.AS cs.AI cs.SD 版本更新 78%

Controllable Accent Normalization via Discrete Diffusion

通过离散扩散实现可控口音标准化

Qibing Bai, Yuhan Du, Tom Ko, Shuai Wang, Yannan Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Tencent Ethereal Audio Lab(腾讯虚音频实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出DLM-AN系统,利用掩蔽离散扩散和自监督语音令牌,通过选择性重用源令牌控制口音强度,结合流匹配时长比预测器调整节奏,实现低词错误率和可解释的口音强度控制。

Comments Accepted to Interspeech 2026 as a long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22527 2026-06-23 cs.CV 新提交 70%

Trajectory Forcing: Structure-First Generation with Controllable Semantic Trajectories

轨迹强制:具有可控语义轨迹的结构优先生成

Merve Kocabas, Gege Gao, Bernhard Schölkopf, Andreas Geiger

机构 * University of Tübingen(图宾根大学) ETH Zürich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute(ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出轨迹强制框架,将生成过程组织为从全局布局到细节的语义阶段,每个阶段产生可解码的潜在状态,支持局部编辑,实现结构优先的可控图像合成。

Comments Project page: https://mervekocabas.github.io/TrajectoryForcing/

Journal ref Proceedings of the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20237 2026-06-23 cs.CV 版本更新 70%

AnimeAdapter: A Modular Adapter for Appearance-Consistent Anime Character Generation

AnimeAdapter: 细粒度且一致的零样本动漫人物生成

Yixuan Han

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出了一种轻量级的外观适配器,用于在多样编辑条件下实现可控且一致的动漫人物生成,通过注入单张参考图像的细粒度视觉特征到扩散过程中,并结合CLIP的局部空间化特性,开发出语义选择性局部注意力机制,进一步解耦人物外观与空间布局,从而实现高效的动漫人物生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23675 2026-06-23 cs.CV 新提交 57%

IMAGIN-4D: Image-Guided Controllable Interaction Generation

IMAGIN-4D:图像引导的可控交互生成

Sai Kumar Dwivedi, Federica Bogo, Buğra Tekin, Chenhongyi Yang, Nadine Bertsch, Tomas Hodan, Michael J. Black, Dimitrios Tzionas, Shreyas Hampali

机构 * Meta, Zurich(Meta 苏黎世)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出IMAGIN-4D,一种基于扩散模型的人-物交互生成方法,通过时空分解的图像条件控制交互细节,提升细粒度交互控制能力。

Comments 15 pages, 8 figures. Project page: https://imagin4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22931 2026-06-23 cs.CV cs.AI 新提交 57%

BEV-Denoise: Learning Intrinsic Noise for Accurate Bird's-Eye-View Semantic Segmentation

BEV-Denoise:学习内在噪声以实现精确的鸟瞰图语义分割

Dooseop Choi, Kyounghwan An, Kyoung-Wook Min

机构 * Electronics and Telecommunications Research Institute (ETRI)(韩国电子通信研究院) University of Science and Technology (UST)(科学技术联合大学院大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出BEV-Denoise框架,利用UNet噪声估计模块从鸟瞰图特征中去除内在噪声,通过任务分解学习范式训练,提升多种视图变换模型的语义分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20891 2026-06-23 cs.CV cs.LG 新提交 57%

Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

Go-with-the-Track: 基于点追踪的视频合成与运动控制

Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li Ma, Andrea Vedaldi, Paul Debevec, Ning Yu

机构 * Netflix USA(Netflix美国) Eyeline Labs USA(Eyeline Labs美国) University of Oxford(牛津大学) Eyeline Labs Los Angeles USA(Eyeline Labs洛杉矶美国) University of California, Los Angeles(加州大学洛杉矶分校) Stony Brook University USA(石溪大学美国) Columbia University USA(哥伦比亚大学美国) Eyeline Labs United Kingdom(Eyeline Labs英国) Netflix Los Angeles USA(Netflix洛杉矶美国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Go-with-the-Track,通过联合条件多参考图像和参考锚定点轨迹,统一视频合成与运动控制,实现精确合成与运动控制。

Comments SIGGRAPH 2026, Project page: https://eyeline-labs.github.io/Go-with-the-Track/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21769 2026-06-23 q-fin.MF q-fin.TR 新提交 50%

Optimal Dynamic Fees for Automated Market Makers: A Stochastic Control Approach to Loss-Versus-Rebalancing

自动做市商的最优动态费用:针对再平衡损失的随机控制方法

Farbod Ghasemlu

专题命中 可控生成 :diffusion(abstract)

AI总结 研究恒定乘积自动做市商中流动性提供者的最优动态费用策略,通过随机控制方法平衡交易收入与套利损失,证明最优费用与波动率正相关且具有顺周期性。

Comments 18 pages, 3 figures, 1 table; JEL: G12, G14, C61, D47

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21765 2026-06-23 math.OC 新提交 50%

Optimal Control Problem with Mixed Control and State Constraints for Cancer Chemotherapy and Treatment Optimization

具有混合控制和状态约束的癌症化疗与治疗优化最优控制问题

David Lassounon, Aziz Belmiloudi, Mounir Haddou

专题命中 可控生成 :diffusion(abstract)

AI总结 针对化疗药物递送策略,提出具有混合控制和状态约束的最优控制问题,通过非线性反应扩散方程建模,推导最优性必要条件,并在肺癌消除案例中验证策略有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21575 2026-06-23 math.OC math.PR 新提交 50%

Nonsmooth Obstacles and Killed Resolvents in Reflected Stochastic Control

反射随机控制中的非光滑障碍与杀灭预解式

Louis Shuo Wang, Jiguang Yu, Ye Liang

专题命中 可控生成 :diffusion(abstract)

AI总结 针对具有非光滑最大型收益的二维反射扩散最优停止问题,提出测度值变分公式化,证明停止增益为带奇异性支撑的Radon测度,并给出杀灭预解表示,修正了无效的无限制预解公式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20906 2026-06-23 cs.RO cs.AI 版本更新 50%

DASIP: Dynamic Test-Time Compute Scaling for Robot Control with Stochastic Interpolant Policies

DASIP:基于随机插值策略的机器人控制动态测试时计算缩放

Inkook Chun, Seungjae Lee, Michael S. Albergo, Saining Xie, Eric Vanden-Eijnden

机构 * New York University(纽约大学) University of Maryland(马里兰大学) Harvard University(哈佛大学) Capital Fund Management(资本基金管理公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出难度感知随机插值策略(DA-SIP),通过难度分类器动态调整推理步数、求解器和ODE/SDE积分,在保持任务成功率的同时将计算时间减少2.6-4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02647 2026-06-23 math.OC cs.MS cs.NA math.NA 版本更新 50%

Multilevel Stochastic Gradient Descent for Optimal Control Under Uncertainty

不确定性下最优控制的多层随机梯度下降法

Niklas Baumgarten, David Schneiderhan

专题命中 可控生成 :diffusion(abstract)

AI总结 提出一种多层随机梯度下降法,用于求解受不确定输入数据影响的偏微分方程最优控制问题,通过并行多层蒙特卡洛估计随机梯度,实现线性收敛并显著优于标准随机梯度下降法。

详情

展开后加载摘要…

URL PDF HTML 收藏