arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-04 至 2026-08-04 共收录 11 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 11 篇

2608.01102 2026-08-04 cs.RO 新提交 67%

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

CAAT:用于数据高效接触丰富型操作的接触感知注意力缩放与触觉掩码方法

Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

机构 * ShanghaiTech University(上海科技大学) Beihang University(北京航空航天大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Zhejiang University(浙江大学) BUPT(北京邮电大学)

专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)

AI总结 该研究针对接触丰富型操作中视觉-触觉策略缺乏接触感知先验的问题,提出CAAT框架,通过注意力缩放和动态触觉掩码提升策略性能,在仿真和真实实验中均显著优于现有方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21429 2026-08-04 cs.LG cs.AI cs.SY eess.SY math.OC 版本更新 67%

Provably Safe Generative Sampling with Constricting Barrier Functions

具有约束屏障函数的可证明安全生成采样

Darshan Gadginmath, Ahmed Allibhoy, Fabio Pasqualetti

机构 * Mechanical Engineering University of California, Riverside(机械工程 加州大学河滨分校) Electrical Engineering and Computer Science University of California, Irvine(电气工程与计算机科学 加州大学伊尔弗分校)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract)

AI总结 通过约束屏障函数实现安全生成采样,确保生成样本满足硬约束并保持语义保真度。

Comments 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02504 2026-08-04 cs.CV 新提交 57%

Token Radius Attention for Efficient Video Generation

用于高效视频生成的 Token 半径注意力机制

Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01288 2026-08-04 cs.CV 新提交 57%

TurboClear: One-Step Object-Effect Removal via Region-Calibrated Distribution Matching and Fusion

TurboClear:基于区域校准分布匹配与融合的单步对象-效果去除方法

Jiawei Guo, Junxian Li, Yixin Tang, Bingya Zhang, Jiaxin Lu, Yulun Zhang, Shangchen Zhou

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于SDXL的单步对象-效果去除模型TurboClear,通过区域校准分布匹配与可学习空间融合,大幅降低计算开销且保持良好视觉质量,效率优于相关基线方法。

Comments Code: https://github.com/GuoCalix/TurboClear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00769 2026-08-04 cs.CV 新提交 57%

ChordVideo: One-Step, Training-Free, Temporally Consistent Video Editing via Low-Energy Transport

ChordVideo:基于低能量传输的一步式、无训练、时间一致的视频编辑

Zhiqiang Lao

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 ChordVideo扩展低能量原理到视频时间,通过共享噪声等技术解决ChordEdit的视频编辑时间问题,在TGVE/DAVIS上多指标提升,步数远少于多步编辑器

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00537 2026-08-04 cs.CV 新提交 57%

Hybrid-Domain Posterior Sampling for Inverse Problems via Latent Flow Matching

基于潜在流匹配的混合域后验采样用于逆问题

Hongjie Wu, Yiping Xie, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV

AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。

Comments Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14749 2026-08-04 eess.AS cs.CV 版本更新 57%

WanSong v1.0 Technical Report

万松v1.0技术报告

Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对音乐生成难题,提出万松方法,它是基于扩散的模型,可直接生成高保真多语言长歌曲并输出双声道,通过步长蒸馏加快推理,为微调定制提供途径,助力下游编辑任务。

Comments Wan Team, Alibaba Group

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30239 2026-08-04 cs.CV 版本更新 57%

CA-World: Multi-Object Counterfactual Alignment for Efficient Interactive-Ready Reconstruction

SAM3D-Phys:迈向真实世界中的多物体交互仿真

Xin Dong, Weijian Deng, Lihan Zhang, Tianru Dai, Wenfeng Deng, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室)

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV

AI总结 提出SAM3D-Phys框架,结合场景重建与SAM3D生成式先验,从部分观测中恢复完整可仿真物体几何,并通过物理约束优化和掩码引导外观蒸馏实现场景一致性,支持多物体同时交互仿真。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05372 2026-08-04 cs.CV cs.AI 57%

Two Steps Are All You Need: Efficient 3D Point Cloud Anomaly Detection with Consistency Models

两步即可:基于一致性模型的高效3D点云异常检测

Pranav A, Shashank B, Pranav Siddappa, Dominik Seuss, Minal Moharir, Subramanya KN

机构 * R.V. College of Engineering(R.V. 工程学院) Technical University of Applied Sciences Würzburg-Schweinfurt(Würzburg-Schweinfurt 应用科学大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于一致性学习的重建异常检测方法,通过简化推理过程提升效率,实现低延迟的3D点云异常检测,适用于资源受限设备。

Comments Accepted to CVPR 2026, at the 9th Workshop on Efficient Deep Learning for Computer Vision (ECV). To be published in the IEEE/CVF CVPR 2026 Workshop Proceedings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 3479-3487

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02028 2026-08-04 cs.LG 50%

Latent attention on masked patches for flow reconstruction

潜在注意力在遮蔽块上的应用用于流体重构

Ben Eze, Luca Magri, Andrea Nóvoa

机构 * Aeronautics Dept., Imperial College London(伦敦帝国理工学院航空系) DIMEAS, Politecnico di Torino(都灵理工大学机械与航空航天工程系) I-X, Imperial College London(伦敦帝国理工学院I-X)

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 本文提出LAMP模型,通过分块、降维和单层Transformer回归实现遮蔽流体重构,展示了在层流和湍流中的应用效果。

Comments 8 pages, 5 figures, accepted for publication in Springer's LNCS Series and for poster presentation at ICCS (International Conference on Computational Science) 2026

Journal ref Lecture Notes in Computer Science, vol 16788, pp. 181-188. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14549 2026-08-04 cs.LG cond-mat.stat-mech cs.AI cs.SY eess.SY stat.ML 版本更新 50%

Sampling Decisions: Exact Path-Space Control for Physics-Informed Generative Sampling

采样决策:精确路径空间校正、先验抵消和局部玻尔兹曼引导

Michael Chertkov, Hamidreza Behjoo, Sungsoo Ahn

机构 * Program in Applied Mathematics and Department of Mathematics, University of Arizona(应用数学项目和数学系,亚利桑那大学) Graduate School of AI at KAIST(韩国科学技术院人工智能研究生院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究如何校正离散空间便宜但有偏差的顺序有限时间范围采样器,核心方法是将采样决策公式化为路径空间相对熵投影,引入相关先验和校正。实验表明单例积先验有问题,局部玻尔兹曼引导效果好,确定了相关前缀引导对顺序采样的决定性作用。

Comments 35 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏