arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-24 至 2026-07-24 共收录 78 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 62 篇

2606.12566 2026-07-24 stat.ME 版本更新 50%

Inferring resource selection and utilization distributions from irregular and error-prone animal tracking data

从不规则且带有误差的动物追踪数据推断资源选择和利用分布

Fanny Dupont, Brett T. McClintock, Jan-Ole Fischer, Marianne Marcoux, Nigel E. Hussey, Marie Auger-Méthé

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出基于拉普拉斯近似的单阶段框架,通过TMB实现,同时处理测量误差和不规则采样,在模拟和独角鲸数据中优于两步法。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04674 2026-07-24 nucl-th 版本更新 50%

Coupled charm and charmonium transport in a strongly coupled quark-gluon plasma

强耦合夸克-胶子等离子体中重 Charm 和 Charmonium 的输运

Kaiyu Fu, Biaogang Wu, Ralf Rapp

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出了一种基于热力学 T 矩阵相互作用的耦合 Charm-Charmonium 输运框架,用于描述强耦合 QGP 中 Charm-quark 扩散和 Charmonium 动力学。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01641 2026-07-24 math.PR 版本更新 50%

Quantitative Convergence for Sequential Interacting Diffusions via Incremental Relative Entropy

序列相互扩散的定量收敛与高斯波动:通过增量相对熵

Zhenfu Wang, Xianliang Zhao

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了序列相互扩散系统的定量收敛与高斯波动,通过增量相对熵证明了路径空间熵的衰减及经验测度的收敛性,并建立了波动测度的高斯极限。

Comments 35 pages, 2 figures. We split the first version to two parts. This is the first part

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22297 2026-07-24 quant-ph 版本更新 50%

Decoherence challenges in Nanoscience: A Quantum Phase Space perspective

纳米科学中的退相干挑战:量子相空间视角

Ravo Tokiniaina Ranaivoson, Angelo Mamitiana Ralaikoto, Diary Lova Ratsimbazafy, Rivo Herivola Manjakamanana Ravelonjato, Roland Raboanary, Raoelina Andriambololona, Nomenjanahary Tanjonirina Manampisoa, Fanamby Sahondraniandriana

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于量子相空间的框架,用于表征环境选择的指针态并建模退相干动力学,为纳米科学中的退相干问题提供新的理论工具和方法。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 4 篇

2607.20924 2026-07-24 cs.CV 新提交 79%

MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer

MagicMakeup:用于高保真妆容转移的区域可控扩散Transformer

Ziyi Wang, Siming Zheng, Yang Yang, Shusong Xu, Hao Zhang, Bo Li, Changqing Zou, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司) vivo BlueImage Lab(vivo蓝图像实验室)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 研究妆容转移中区域可控性等难题,提出MagicMakeup框架,基于空间约束和概念解缠结,用令牌对齐区域门控和跨模态感知指导实现精确编辑与概念澄清,设计数据生成管道并建立基准,提升了多方面性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20866 2026-07-24 cs.CV 新提交 57%

Agentic Designer: Progressive Multi-Agent Collaboration for Structure-Aware Interior Layout Generation

智能设计师:用于结构感知室内布局生成的渐进式多智能体协作

Zhijing Yang, Haocheng Lin, Zhihua Xu, Haojie Li, Keze Wang, Liang Lin, Tianshui Chen

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对室内布局生成难题,提出智能设计师这一渐进式多智能体框架,将布局生成视为迭代约束验证决策过程,通过渐进共识机制协调三个智能体,经实验验证其显著优于现有方法,提升了结构遵循和功能设计连贯性。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21436 2026-07-24 hep-lat hep-th 新提交 50%

Stochastic Quantization as Optimal Control

作为最优控制的随机量子化

Lingxiao Wang

专题命中 可控生成 :diffusion(abstract)

AI总结 研究将随机量子化表述为有限时间随机最优控制问题,利用可处理参考过程及参考校正终端成本,通过神经网络学习残余控制实现最优随机量子化,在多峰势和二维晶格标量\(\phi^4\)理论中取得成果,将量子化表述为控制。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04910 2026-07-24 cs.RO cs.AI cs.LG 版本更新 50%

VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory

VPWEM:非马尔可夫视觉-运动策略与工作记忆与事件记忆

Yuheng Lei, Zhixuan Liang, Hongyuan Zhang, Ping Luo

机构 * School of Computing and Data Science, University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 VPWEM通过引入工作记忆和事件记忆,提升机器人在非马尔可夫任务中的动作生成性能。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L). \textcopyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2607.20789 2026-07-24 cs.CV cs.GR 新提交 84%

3D-GIMP: When 3D Gaussian Inpainting Meets PatchMatch

3D-GIMP:当3D高斯图像修复与PatchMatch相遇

Xuening Tian, Dieter Schmalstieg, Shohei Mori

机构 * University of Stuttgart(斯图加特大学)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对3D场景编辑中迭代扩散模型的问题,提出3D-GIMP混合范式,通过在关键参考视图进行图像修复并利用3D感知PatchMatch算法传播纹理,优先保证重建一致性,在渲染速度和视图一致性上表现更优。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 2 篇

2607.21434 2026-07-24 cs.CV cs.AI 新提交 57%

Adaptive Identity Anchoring: Closed-Loop Keyframe Placement for Synthetic Paired Supervision in Video Face Swapping

自适应身份锚定:用于视频人脸交换中合成配对监督的闭环关键帧放置

Logan Robbins

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究视频人脸交换缺乏自然配对监督问题,提出自适应身份锚定(AIA)方法,通过闭环反馈放置锚定并结合现实参考纹理恢复,还给出可证伪实验,有望解决合成身份漂移及过度平滑皮肤问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21027 2026-07-24 cs.CV 新提交 57%

GroupVideo: Multi-Identity Customized Text-to-Video Generation

GroupVideo:多身份定制文本到视频生成

Xinyang Song, Libin Wang, Jianxin Sun, Qi Li, Dandan Zheng, JingDong Chen, Zhenan Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Ant Group(蚂蚁集团)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究多身份定制文本到视频生成问题,提出GroupVideo框架,融合多模态身份对齐及相关模块,构建高质量数据集,在生成多角色视频时能保持身份一致且动作自然,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 6 篇

2607.21446 2026-07-24 cs.LG cs.CV 新提交 79%

KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers

KroQuant:用于扩散Transformer高效训练后量化的克罗内克结构块变换

Yann Bouquet, Alireza Khodamoradi, Kristof Denolf, Mathieu Salzmann

机构 * EPFL(洛桑联邦理工学院) Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散Transformer训练后量化到W4A4质量严重下降问题,提出KroQuant方法,对激活值3个2元素块应用克罗内克结构可逆变换,存储参数少,运行快,结合离线LoRaQ权重校准,输出更接近FP参考且保持或提高图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20628 2026-07-24 cs.CV cs.AI 新提交 79%

RealVDeblur: One-Step Diffusion for Generalizable Real-World Video Deblurring

RealVDeblur:用于通用真实世界视频去模糊的一步扩散法

Renbiao Jin, Mingxin Yang, Yutian Chen, Junhao Zhuang, Xin Cai, Mulin Yu, Linning Xu, Wenxian Yu, Danping Zou, Shi Guo, Tianfan Xue

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多媒体实验室) CPII under InnoHK(创新香港研究院下的CPII) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 针对真实世界视频去模糊难题,提出RealVDeblur框架。构建模糊合成管道提供数据,利用视频扩散先验恢复,采用逐帧编码并简化采样为一步生成器,还有时间窗口掩码稳定推理,在多方面表现出色且提升3D重建鲁棒性。

Comments Project page with code: https://rbjin.github.io/RealVDeblur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21553 2026-07-24 cs.CV 新提交 57%

SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

SANA-Video 2.0:具有注意力残差的混合线性注意力用于高效视频生成

Junsong Chen, Jincheng Yu, Yitong Li, Shuchen Xue, Haozhe Liu, Jingyu Xin, Yuyang Zhao, Tian Ye, Zhangjie Wu, Zian Wang, Daquan Zhou, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA(英伟达)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 SANA-Video 2.0是一种混合视频扩散Transformer,采用混合线性-softmax注意力和块注意力残差,在单个GPU上生成高质量视频,成本大幅降低,实现可扩展长时、高分辨率视频生成,性能与大模型竞争且速度更快。

Comments 13 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20940 2026-07-24 cs.CV 新提交 57%

Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention

Ms. Forcing:通过多尺度分块和注意力实现高效流视频生成

Zekun Li, Xiaoyan Cong, Hongyu Li, Zhiyang Dou, Chuan Guo, Abhay Mittal, Sizhe An, Srinath Sridhar

机构 * Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院) Meta

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对流视频生成中传统方法的不足,提出Ms. Forcing范式,通过多尺度分块和注意力调整空间粒度,引入均匀噪声水平DMD减少不匹配,该方法提升了效率,在单个H200 GPU上性能显著优于Rolling Forcing。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00543 2026-07-24 cs.CV 版本更新 57%

ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs

ETC: 通过任务感知的视觉信息蒸馏实现视觉语言模型中的极端令牌压缩

Yiling Gao, Hongchen Wei, Zhenzhong Chen

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 提出ETC框架,基于变分信息蒸馏原理,在减少输入令牌数量时最小化任务损失,通过文本-图像交叉注意力加权视觉特征并引入变分信息蒸馏,实现单令牌压缩下仍保持强任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20467 2026-07-24 cs.AI cs.LG 新提交 50%

DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding

DC-Leap:通过草稿引导的连续跳跃解码实现无训练的dLLMs加速

Yanhua Jiao, Tianyi Wu, Xiaoxi Sun, Yulin Li, HuiLing Zhen, Libo Qin, Baotian Hu, Zhuotao Tian, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究针对dLLMs并行解码中因保守置信阈值致效率低的问题,提出DC-Leap框架。其采用动态连续验证策略消除JPDE,结合草稿引导解码机制。实验表明该框架能大幅加速dLLMs,长序列生成加速显著,且保证生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2607.20432 2026-07-24 cs.CL cs.PL 新提交 50%

Position: Natural Language Should Not Fully Replace Formal Languages

立场:自然语言不应完全取代形式语言

Eitan Wagner, Elisha Rosensweig, Omri Abend

专题命中 其他图像生成 :image generation(abstract)

AI总结 针对自然语言能否完全取代形式语言的争议,引入基于“任务特异性”的形式框架并证明“特异性交叉定理”,通过跨模态案例分析表明二者各有优势,是互补工具,倡导开发混合系统。

Comments To be published in ICML 2026 (position track)

详情

展开后加载摘要…

URL PDF HTML 收藏