arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-03 至 2026-07-03 共收录 13 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 13 篇

2606.31918 2026-07-03 cs.CV 新提交 79%

DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation

DriveWeaver: 基于点云条件的视频修复用于自动驾驶仿真中的可控车辆插入

Junzhe Jiang, Zipei Ma, Zijie Pan, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV

AI总结 提出DriveWeaver框架,通过点云条件视频修复实现自动驾驶仿真中可控车辆插入,解决光照不一致和3D资产依赖问题,支持大规模场景增强。

Comments Accepted at ECCV 2026, Project Page: https://github.com/LogosRoboticsGroup/DriveWeaver

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01761 2026-07-03 cs.CV 版本更新 79%

Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion

Control-DINO:用于可控图像到视频扩散的特征空间条件

Edoardo A. Dominici, Thomas Deixelberger, Konstantinos Vardis, Markus Steinberger

机构 * Huawei Technologies, Switzerland(华为技术(瑞士)) Huawei Technologies, Austria(华为技术(奥地利)) Graz University of Technology, Austria(格拉茨技术大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Control-DINO,通过解耦外观与其他特征,实现对视频扩散模型的可控生成,提升生成渲染的可控性。

Comments ECCV 2026 - Project Page https://dedoardo.github.io/projects/control-dino/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01202 2026-07-03 cs.CV cs.RO eess.IV 79%

A Multi-Sensor Fusion Approach for Rapid Orthoimage Generation in Large-Scale UAV Mapping

一种多传感器融合方法用于大规模无人机测绘中的快速正射影像生成

Jialei He, Zhihao Zhan, Zhituo Tu, Xiang Zhu, Jie Yuan

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与技术学院) TopXGun Robotics(TopXGun机器人)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出一种多传感器融合方法,通过优化姿态前馈特征匹配提升速度与精度,有效解决传统正射影像生成在时间性能、系统鲁棒性和地理参考精度方面的不足,适用于低纹理场景如农田的快速正射影像生成。

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01390 2026-07-03 cs.CV cs.AI cs.MM 版本更新 62%

SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment

SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架

Xinyu Mao, Junsi Li, Haoji Zhang, Yu Liang, Ming Sun

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01990 2026-07-03 cs.CV 新提交 57%

Training-free Controllable Human Motion Generation under Heterogeneous Constraints

异构约束下无需训练的可控人体运动生成

Xiaofei Hui, Bo Yan, Haoxuan Qu, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Motion-Inference-as-Control框架,将扩散运动生成建模为随机控制问题,统一处理连续目标型和基于准则的约束,无需约束特定训练或可微性要求。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23041 2026-07-03 cs.CV 新提交 57%

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

SPAR: 语义-像素自对齐与自适应路由的统一多模态模型

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24969 2026-07-03 cs.CV 版本更新 57%

PASDiff: Physics-Aware Semantic Guidance for Joint Real-World Low-Light Face Enhancement and Restoration

PASDiff: 面向真实世界低光人脸增强与恢复的物理感知语义引导

Yilin Ni, Wenjie Li, Zhengxue Wang, Juncheng Li, Guangwei Gao, Jian Yang

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Beijing University of Posts and Telecommunications(北京邮电大学) PCA Lab, Nanjing University of Science and Technology(南京理工大学PCA实验室) East China Normal University(华东师范大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出PASDiff,一种无需训练的物理感知语义扩散模型,通过逆强度加权和Retinex理论引入光度约束,并利用风格无关结构注入从现成人脸先验中提取结构,在真实低光人脸增强上实现自然光照、色彩恢复和身份一致性的优越平衡。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12770 2026-07-03 cs.CV 版本更新 57%

One-Shot Feed-Forward 360$^{\circ}$ Animatable Avatar via Inpainted UV-Space Gaussian Modeling

通过修补UV空间高斯建模的一次前馈360度可动画化头像

Shuling Zhao, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zeekr Automobile R&D Co., Ltd(Zeekr汽车研发有限公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 提出一种基于UV空间高斯建模的一次前馈框架,利用预训练3D GAN的先验知识修补缺失区域,实现360度全头可动画化头像的高质量重建与实时动画。

Comments Accepted by ECCV 2026. Project page: https://shaelynz.github.io/fhavatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01204 2026-07-03 cs.CV 版本更新 57%

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen: 桌面场景生成与机器人操作的交互式仿真

Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) D-Robotics Horizon Robotics

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。

Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02195 2026-07-03 cs.RO 新提交 50%

Bridge-WA: Predicting Where and How the World Changes for Robotic Action

Bridge-WA: 预测世界变化的位置和方式以支持机器人动作

Yongjie Bai, Hanting Wang, Mingtong Dai, Qijun Zhong, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) X-Era AI Lab(X-Era AI实验室)

专题命中 可控生成 :image generation(abstract)

AI总结 提出Bridge-WA轻量框架,通过蒸馏未来变化教师模型为三个紧凑先验,引导动作生成聚焦于场景变化的位置和方式,提升机器人操作的成功率和鲁棒性。

Comments 21 pages, 8 figures, https://hcplab-sysu.github.io/BRIDGE-WA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01347 2026-07-03 math.OC 新提交 50%

Bilinear control of age--space structured populations

年龄-空间结构化群体的双线性控制

Jiguang Yu, Louis Shuo Wang

专题命中 可控生成 :diffusion(abstract)

AI总结 研究具有更新边界条件和内源性监测反馈的非局部年龄-空间结构化种群方程的双线性最优控制,通过特征温和公式建立闭环适定性和弗雷歇可微性,推导降阶和反馈校正伴随方程,并证明一阶最优性条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08580 2026-07-03 math.OC cs.LG 版本更新 50%

Adjoint Matching through the Lens of the Stochastic Maximum Principle in Optimal Control

通过随机最大原理视角的伴随匹配

Carles Domingo-Enrich, Jiequn Han

机构 * Microsoft Research New England(微软研究院新英格兰) Flatiron Institute(熨斗研究所)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文基于随机最优控制问题,重新推广并严谨推导了伴随匹配方法,将其置于随机最大原理基础上,提出通用Hamiltonian伴随匹配目标,并展示其在连续时间下的实现方法,为随机控制问题提供新的可实施目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18368 2026-07-03 cs.RO 版本更新 50%

Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation

学习多任务机器人操作的语义原子技能

Yihang Zhu, Weiqing Wang, Shijie Wu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出AtomSkill框架,通过语义对比对齐和关键姿态想象,从演示中学习可重用原子技能,实现多任务机器人操作,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏