arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-25 至 2026-03-25 共收录 74 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2505.09424 2026-03-25 cs.RO 50%

Exploring Pose-Guided Imitation Learning for Robotic Precise Insertion

探索基于姿态引导的模仿学习用于机器人精确插入

Han Sun, Sheng Liu, Yizhao Wang, Zhenning Zhou, Shuai Wang, Haibo Yang, Jingyuan Sun, Qixin Cao

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院) Karlsruhe Institute of Technology(卡尔斯鲁厄大学) Shanghai Huawei Technologies Co., Ltd.(上海华为技术有限公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出基于姿态引导的模仿学习方法,通过紧凑的对象中心观测实现精确插入任务,提升数据效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 2 篇

2512.25066 2026-03-25 cs.CV 83%

From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping

从修复到编辑:通过生成性自举解锁鲁棒的无掩膜视觉配音

Xu He, Haoxian Zhang, Hejia Chen, Changyuan Zheng, Liyang Chen, Songlin Tang, Jiehui Huang, Xiaoqiang Liu, Pengfei Wan, Zhiyong Wu

机构 * Tsinghua University(清华大学) Hong Kong University of Science(香港科学大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出X-Dub框架,通过生成性自举实现无掩膜视觉配音,解决传统掩膜修复方法在时空上下文破坏和鲁棒性差的问题,提升唇形同步和视觉质量。

Comments Project Page: https://github.com/KlingAIResearch/X-Dub

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20996 2026-03-25 cs.CV 83%

From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition

从修复到层分解:重新利用生成修复模型进行图像层分解

Jingxi Chen, Yixiao Zhang, Xiaoye Qian, Zongxia Li, Cornelia Fermuller, Caren Chen, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学) Amazon(亚马逊)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出利用生成修复模型进行图像层分解,通过轻量级微调和多模态上下文融合模块,实现更精确的物体移除和遮挡恢复,提升下游编辑和创意应用的可能性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 4 篇

2603.23010 2026-03-25 cs.CV 77%

Zero-Shot Personalization of Objects via Textual Inversion

通过文本逆向实现对象的零样本个性化

Aniket Roy, Maitreya Suin, Rama Chellappa

机构 * Johns Hopkins University(约翰霍普金斯大学) Samsung AI Center Toronto(三星AI中心多伦多)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种新框架,通过学习网络预测对象特定的文本逆向嵌入,实现快速零样本对象个性化,适用于多种任务和场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23462 2026-03-25 cs.CV 57%

RealMaster: Lifting Rendered Scenes into Photorealistic Video

RealMaster: 将渲染场景提升为逼真视频

Dana Cohen-Bar, Ido Sobol, Raphael Bensadoun, Shelly Sheynin, Oran Gafni, Or Patashnik, Daniel Cohen-Or, Amit Zohar

机构 * Tel Aviv University(特拉维夫大学) Reality Labs, Meta(Meta现实实验室) Technion Israel(技术学院以色列)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 RealMaster通过视频扩散模型将渲染视频提升为逼真视频,保持与3D引擎输出的精确对齐,同时通过IC-LoRA训练实现高质量输出和泛化能力。

Comments Project page: https://danacohen95.github.io/RealMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23295 2026-03-25 cs.CV 57%

Mamba-driven MRI-to-CT Synthesis for MRI-only Radiotherapy Planning

基于Mamba的MRI到CT合成用于仅MRI的放疗计划

Konstantinos Barmpounakis, Theodoros P. Vagenas, Maria Vakalopoulou, George K. Matsopoulos

机构 * School of Electrical Computer Engineering, National Technical University of Athens Archimedes, Athena Research Center CentraleSup\'elec, University of Paris-Saclay

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出基于Mamba架构的MRI到CT合成方法,以提高跨模态翻译的准确性与效率,通过3D Mamba架构捕捉复杂体积特征和长距离依赖,实现快速且精确的CT合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23265 2026-03-25 cs.CL cs.CV 57%

PaperBanana: Automating Academic Illustration for AI Scientists

PaperBanana:为AI科学家自动化学术插图

Dawei Zhu, Rui Meng, Yale Song, Xiyu Wei, Sujian Li, Tomas Pfister, Jinsung Yoon

机构 * Peking University(北京大学) Google Cloud AI Research(谷歌云AI研究)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 PaperBanana通过整合先进视觉语言模型和图像生成模型,自动化生成出版级学术插图,提升了科研流程中插图制作的效率与质量。

Comments Add Citations

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 7 篇

2603.23463 2026-03-25 cs.CV cs.AI 89%

InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting

InverFill:一种用于增强少步扩散修复的一步倒置方法

Duc Vu, Kien Nguyen, Trong-Tung Nguyen, Ngan Nguyen, Phong Nguyen, Khoi Nguyen, Cuong Pham, Anh Tran

机构 * Qualcomm AI Research(.qualcomm 高级研究院) Posts & Telecommunications Inst. of Tech., Vietnam(越南邮电技术研究所)

专题命中 效率与蒸馏 :diffusion(title,abstract);inpainting(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出InverFill,通过注入输入遮挡图像的语义信息到初始噪声中,实现高质量少步修复。该方法无需训练修复模型,利用文本到图像模型进行混合采样,提升图像质量和文本一致性。

Comments Accepted to CVPR'26 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22943 2026-03-25 cs.AI 85%

PersonalQ: Select, Quantize, and Serve Personalized Diffusion Models for Efficient Inference

PersonalQ: 选择、量化并服务个性化扩散模型以实现高效推理

Qirui Wang, Qi Guo, Yiding Sun, Junkai Yang, Dongxu Zhang, Shanmin Pang, Qing Guo

机构 * School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) Nankai University(南开大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 PersonalQ通过触发令牌连接检查点选择与量化,提升意图对齐并优化压缩质量,实现高效个性化扩散模型服务。

Comments Accepted in ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23487 2026-03-25 cs.CV 57%

TETO: Tracking Events with Teacher Observation for Motion Estimation and Frame Interpolation

TETO:利用教师观察进行事件跟踪以实现运动估计和帧插值

Jini Yang, Eunbeen Hong, Soowon Son, Hyunkoo Lee, Sunghwan Hong, Sunok Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) ETH Zurich(苏黎世联邦理工学院) Korea Aerospace University(韩国航空航天大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 TETO提出一种教师-学生框架,通过知识蒸馏从预训练的RGB跟踪器中学习事件运动估计,仅用25分钟未标注真实数据实现高精度点跟踪和光流估计,提升帧插值质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20565 2026-03-25 cs.CV 57%

DINO-Tok: Adapting DINO for Visual Tokenizers

DINO-Tok:为视觉分词器适应DINO

Mingkai Jia, Mingxiao Li, Zhijian Shu, Anlin Zheng, Liaoyuan Fan, Jiaxin Guo, Tianxing Shi, Dongyue Lu, Zeming Li, Xiaoyang Guo, Xiaojuan Qi, Xiao-Xiao Long, Qian Zhang, Ping Tan, Wei Yin

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Horizon Robotics(Horizon机器人) Nanjing University(南京大学) Hong Kong University(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DINO-Tok,一种基于冻结DINO编码器的视觉分词器,结合连续自编码和离散向量量化方法,提升高维潜在空间中的语义一致性和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22375 2026-03-25 cs.LG cs.AI cs.CV 57%

Three Creates All: You Only Sample 3 Steps

三步创造一切:你只需采样三步

Yuren Cai, Guangyi Wang, Zongqing Li, Li Li, Zhihui Liu, Songzhi Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Artificial Intelligence, Shenzhen Polytechnic University(深圳职业技术学院人工智能学院) Algorithm Research Department, Truesight(Truesight算法研究部)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MTEO方法,通过冻结预训练扩散模型并蒸馏分层时间嵌入,提升少步采样效率,实验证明在多样本集上达到最优性能,显著缩小蒸馏与轻量方法差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23227 2026-03-25 cs.RO 50%

Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation

基于球面谐波的高效混合SE(3)-等变视觉运动流策略用于机器人操作

Qinglun Zhang, Shen Cheng, Tian Dan, Haoqiang Fan, Guanghui Liu, Shuaicheng Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Dexmal

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出E3Flow框架,通过球面谐波表示实现高效且稳定的多模态等变学习,提升机器人操作的性能、效率和数据效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22304 2026-03-25 cs.LG 50%

Mitigating Premature Discretization with Progressive Quantization for Robust Vector Tokenization

通过渐进量化缓解早期内离散化以实现鲁棒的向量标记化

Wenhao Zhao, Qiran Zou, Zhouhan Lin, Dianbo Liu

机构 * National University of Singapore, Singapore(新加坡国立大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出渐进量化方法,通过引入量化难度动态作为VQ训练的关键维度,有效引导代码本向扩展良好的流形发展,提升了多模态模型的生成性能和生物序列建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏