arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-21 至 2026-07-21 共收录 13 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 13 篇

2605.20209 2026-07-21 cs.GR cs.LG cs.RO 版本更新 83%

NaP-Control: Navigating Diffusion Prior for Versatile and Fast Character Control

NaP-Control: 为多功能和快速字符控制导航扩散先验

Chia-Wen Chen, Yan Wu, Korrawe Karunratanakul, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出NaP-Control方法,通过强化学习操控任务无关的扩散策略先验的潜在噪声,实现快速、鲁棒且高保真的字符控制,同时通过环境交互优化任务奖励,提升成功率并适应挑战性场景。

Comments ECCV 2026. Project page: https://chiawenchen.github.io/nap-control-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16409 2026-07-21 cs.CV cs.AI cs.LG 新提交 79%

Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models

思考、规划、绘制:统一模型中用于可控图像生成的布局感知推理

Junhao Liu, Jian-Wei Zhang, Tao Huang, Miles Yang, Zhao Zhong, Liefeng Bo

机构 * Tencent(腾讯) Peking University(北京大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 研究针对统一多模态大语言模型在可控图像生成中难以遵循复杂空间指令的问题,提出ATLAS框架,采用“思考、规划、绘制”范式及布局共享表示,经强化学习提升性能,在图像生成等任务中效果显著,还支持相关编辑与多模态基础,并引入评估基准。

Comments 22 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16286 2026-07-21 cs.CV cs.AI cs.LG 新提交 79%

Depth Estimators Are Implicit Neural Fields for 3D Scene Geometry Inpainting and Reconstruction

深度估计器是用于3D场景几何修复和重建的隐式神经场

Yingzhao Jian, Zihao Lin, Hehe Fan

机构 * College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院)

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV

AI总结 针对现实世界场景数据3D几何不完整问题,提出神经深度场(NDF),将深度估计器视为场景级隐式场解决问题,通过单测试时优化实现,实验表明其在3D场景几何修复中性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15619 2026-07-21 cs.CV 版本更新 79%

StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling

StructGen:通过结构化上下文建模消除多参考图像生成中的歧义

Jianing Peng, Mengyu Wang, Henghui Ding, Zixiang Li, Ting Liu, Xiaochao Qu, Luoqi Liu, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) Institute of Big Data, Fudan University(复旦大学大数据研究院) Visual Intelligence + X International Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际联合实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) MT Lab, Meitu Inc(美图公司MT实验室)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 研究多参考图像生成问题,现有方法因自然语言指令缺陷致效果不佳。提出StructGen,用结构化格式编码参考图像,构建数据集、训练框架和基准,实验证明其在语义对齐和生成一致性上优于现有方法。

Comments Project page: https://jianingpeng0382.github.io/StructGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17916 2026-07-21 cs.GR cs.CV cs.MM 新提交 67%

Packet-Loss Robust 3D Gaussian Compression via Atomic Packaging and GNN-based Error Concealment

通过原子封装和基于GNN的错误隐藏实现抗丢包的3D高斯压缩

Yuxuan Tao, Xuerui Ma, Hao Zhang, Chunhua Peng

机构 * Central South University Changsha China Malanshan Audio \& Video Laboratory Changsha China Central South University Malanshan Audio \& Video Laboratory

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 研究3D高斯压缩在网络流传输中丢包问题,提出通过原子封装、分层随机分组及基于GNN的错误隐藏框架,改进丢包时的渲染效果,相比无隐藏传输有显著提升,平均PSNR退化限制在约3dB。

Comments 21 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17638 2026-07-21 cs.CV 新提交 57%

Reviving Ancient Paintings via Poem: A Colorization Framework for Aligning Cultural Semantics

通过诗歌复兴古画:一种用于对齐文化语义的色彩化框架

Junming Gao, Biao Zhu, Xiaosong Wang, Tan Tang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对古画褪色问题,提出PoemColor框架,通过诗歌绘画投影仪和结构感知语义注意力,将诗歌文化语义与绘画恢复对齐,并构建混合数据集。实验证明该框架显著优于现有方法,能实现可控色彩化,恢复古画历史真实性与诗歌语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19789 2026-07-21 cs.CV 版本更新 57%

OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation

OmniMotion-X:通用多模态全身运动生成

Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 介绍用于全身人类运动生成的OmniMotion-X框架,利用自回归扩散变换器,提出参考运动等方法,构建数据集并采用新训练策略,超越现有方法,在多模态任务中表现出色,可交互式生成逼真连贯可控的长时间运动。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08982 2026-07-21 cs.CV 版本更新 57%

CityLoc: 6DoF Pose Distributional Localization for Text Descriptions in Large-Scale Scenes with Gaussian Representation

CityLoc:基于高斯表示的大规模场景文本描述的6自由度姿态分布定位

Qi Ma, Runyi Yang, Bin Ren, Nicu Sebe, Ender Konukoglu, Luc Van Gool, Danda Pani Paudel

机构 * Computer Vision Lab, ETH Zurich(苏黎世联邦理工学院计算机视觉实验室) University of Pisa(比萨大学) University of Trento(特伦托大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究大规模场景文本描述的6自由度姿态分布定位问题,核心方法是用基于扩散架构结合预训练文本编码器细化姿态,经3D高斯渲染提高精度,通过与标准方法对比验证其在多数据集上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17146 2026-07-21 cond-mat.dis-nn cs.CL cs.LG 新提交 50%

The Geometry of Semantic Space: A Continuous Geometric Framework for the Transformer Architecture

语义空间的几何:Transformer架构的连续几何框架

Zhihua Liang

机构 * INFN, Sezione di Cagliari(意大利国家核物理研究所,卡利亚里分部)

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究提出连续几何框架,将Transformer架构运算建模为积分 - 微分方程,从几何公理出发转化其核心组件。通过实验验证,此框架能为大语言模型的稳定性、上下文及优化动态提供预测性描述词汇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26887 2026-07-21 math.AP 版本更新 50%

Local well-posedness for hyperbolic systems of equations with fractional dissipation

分数阶正则化双曲方程组的局部适定性

Felipe Angeles

专题命中 可控生成 :diffusion(abstract)

AI总结 针对具有分数阶耗散和非局部交换子的双曲拟线性演化系统,利用分数阶拉普拉斯的自伴性和傅里叶乘子交换子的代数恒等式,结合非齐次Littlewood-Paley理论建立局部适定性,并通过Schauder不动点定理克服Banach收缩原理失效的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13204 2026-07-21 math.OC 版本更新 50%

Indefinite Stochastic Linear-Quadratic Optimal Control Problems with Random Coefficients and Poisson Jumps: Closed-Loop Representation of Open-Loop Optimal Controls

不定随机线性二次最优控制问题:带有随机系数和泊松跳跃的闭环表示法

Kai Ding, Jiaqiang Wen, Jie Xiong, Xin Zhang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了具有随机系数和泊松跳跃的有限时间随机线性二次最优控制问题,证明了在均匀凸性条件下,带跳跃的随机黎曼-西格纳方程有唯一强正则解,从而得到开环最优控制的闭环表示。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27167 2026-07-21 math.NA cs.NA 50%

A monotone finite element method for an elliptic distributed optimal control problem with a convection-dominated state equation

一种用于对流主导状态方程的椭圆分布最优控制问题的单调有限元方法

SeongHee Jeong, Seulip Lee, Sijing Liu

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种单调有限元方法,用于求解对流主导的椭圆分布最优控制问题,通过保持离散最大原理和最优收敛阶次,确保数值稳定性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27497 2026-07-21 cs.LG cs.AI 版本更新 50%

InertialAR: Autoregressive 3D Molecule Generation with Inertial Frames

InertialAR:基于惯性框架的自回归3D分子生成

Haorui Li, Weitao Du, Yuqiang Li, Hongyu Guo, Shengchao Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Ottawa(渥太华大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 研究探索基于Transformer的自回归模型在3D分子生成上的应用。提出InertialAR,通过规范标记化、几何位置编码及分层自回归范式应对挑战,在无条件和可控生成任务中表现出色,多个指标达领先水平。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏