arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 114 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 114 篇

2608.09226 2026-08-11 cs.CV cs.AI 新提交 85%

RL-Native Distillation: Exploiting Scored Trajectories for Few-Step Image Generation

原生强化学习蒸馏:利用带分数轨迹实现少步图像生成

Yuhan Li, Fangao Zeng, Sicong Kang, Mengfei Xu, Hao Zhou, Wei Li, Pipei Huang, Bingbing Ni

机构 * Shanghai Jiao Tong University(上海交通大学) Taobao & Tmall group of Alibaba(阿里巴巴淘宝天猫集团)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出REST框架,将RL与蒸馏联合训练,通过AMD优化,实现少步无CFG图像生成,性能优于40步RL教师,成本低、迭代少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01642 2026-07-03 cs.CV 新提交 83%

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling

多分辨率流匹配:通过分阶段采样实现无训练扩散加速

Xingyu Zheng, Xianglong Liu, Yifu Ding, Weilun Feng, Junqing Lin, Jinyang Guo, Haotong Qin

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出MrFlow,一种基于分阶段低到高分辨率管道的无训练多分辨率加速策略,利用低分辨率采样减少计算量,像素空间超分辨率和高频重采样保持质量,实现10倍加速且质量损失小于1%。

Comments The code is available at https://github.com/Xingyu-Zheng/MrFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12575 2026-06-12 cs.CV 新提交 83%

High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation

高保真两步图像生成:通过教师对齐的端到端蒸馏

Dongyang Liu, Ruoyi Du, David Liu, Dengyang Jiang, Liangchen Li, Qilong Wu, Zhen Li, Steven C. H. Hoi, Hongsheng Li, Peng Gao

机构 * Z-Image Team, Alibaba Group(阿里巴巴集团Z-Image团队) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出Z-Image Turbo++,通过分布对齐对抗学习、步解耦参数化和迭代正则化端到端训练,将8步教师模型蒸馏为2步生成模型,显著缩小质量差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21446 2026-07-24 cs.LG cs.CV 新提交 79%

KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers

KroQuant:用于扩散Transformer高效训练后量化的克罗内克结构块变换

Yann Bouquet, Alireza Khodamoradi, Kristof Denolf, Mathieu Salzmann

机构 * EPFL(洛桑联邦理工学院) Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散Transformer训练后量化到W4A4质量严重下降问题,提出KroQuant方法,对激活值3个2元素块应用克罗内克结构可逆变换,存储参数少,运行快,结合离线LoRaQ权重校准,输出更接近FP参考且保持或提高图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20628 2026-07-24 cs.CV cs.AI 新提交 79%

RealVDeblur: One-Step Diffusion for Generalizable Real-World Video Deblurring

RealVDeblur:用于通用真实世界视频去模糊的一步扩散法

Renbiao Jin, Mingxin Yang, Yutian Chen, Junhao Zhuang, Xin Cai, Mulin Yu, Linning Xu, Wenxian Yu, Danping Zou, Shi Guo, Tianfan Xue

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多媒体实验室) CPII under InnoHK(创新香港研究院下的CPII) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 针对真实世界视频去模糊难题,提出RealVDeblur框架。构建模糊合成管道提供数据,利用视频扩散先验恢复,采用逐帧编码并简化采样为一步生成器,还有时间窗口掩码稳定推理,在多方面表现出色且提升3D重建鲁棒性。

Comments Project page with code: https://rbjin.github.io/RealVDeblur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32020 2026-07-01 cs.CV 新提交 79%

Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers

跨空间蒸馏:用现代扩散教师训练一步学生模型

Anh Nguyen, Ngan Nguyen, Duc Vu, Trung Dao, Viet Nguyen, Quan Dao, Kien Nguyen, Chi Tran, Phong Nguyen, Khoi Nguyen, Cuong Pham, Dimitris Metaxas, Vishal M. Patel, Anh Tran

机构 * Qualcomm AI Research(高通AI研究院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) Rutgers University(罗格斯大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出跨空间蒸馏框架,通过轻量级潜在接口Bridge解决教师与学生模型潜在空间不匹配问题,实现异构教师蒸馏到紧凑学生模型,显著提升性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31259 2026-07-01 cs.SD cs.AI cs.MM eess.AS 新提交 79%

SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation

SwiftAudio: 用于一步式文本到音频扩散生成的数据高效纯文本蒸馏

Binh Mai, Tran Quoc Bao Le, Hung Dinh, Cong Tran

机构 * Posts and Telecommunications Institute of Technology(邮电技术学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.MM

AI总结 提出SwiftAudio框架,通过仅使用文本描述从预训练扩散教师模型进行无音频蒸馏,实现一步式文本到音频生成,在AudioCaps和Clotho上达到最优性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27829 2026-06-29 cs.CV 新提交 79%

CSD: Content-aware Speculative Decoding for Efficient Image Generation

CSD: 内容感知的投机解码用于高效图像生成

Mingcheng Wang, Junbo Qiao, Yunchen Li, Lingfu Jiang, Wei Li, Jie Hu, Jiao Xie, Zhou Yu, Xinghao Chen, Guixu Zhang, Shaohui Lin

机构 * East China Normal University(东华大学) Huawei Foundation(华为基金会) Key Laboratory of Advanced Theory and Application in Statistics and Data Science-MOE(统计与数据科学高级理论与应用关键实验室-教育部)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 提出内容感知投机解码算法CSD,通过熵驱动的概率松弛和最优重采样策略,在保持生成质量的同时加速自回归图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25473 2026-06-25 cs.CV cs.LG 新提交 79%

Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models

Causal-rCM:一种用于流式视频生成和交互式世界模型中自回归扩散蒸馏的统一教师强制与自我强制开放配方

Kaiwen Zheng, Guande He, Min Zhao, Jintao Zhang, Huayu Chen, Jianfei Chen, Chen-Hsuan Lin, Ming-Yu Liu, Jun Zhu, Qianli Ma

机构 * Tsinghua University(清华大学) UT Austin(德克萨斯大学奥斯汀分校) NVIDIA(英伟达)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Causal-rCM框架,将扩散蒸馏扩展到自回归视频扩散,通过教师强制(前向散度)与自我强制(反向散度)互补,实现流式视频生成和交互式世界模型,在帧级和块级设置中达到最先进性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02942 2026-08-05 cs.CL 新提交 78%

OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models

OPTD:用于少步扩散语言模型的一致性引导自适应压缩的策略内转换蒸馏

Xiaocheng Lu, Hualei Zhang, Shuhan Guo, Jie Zhang, Xiaoyi Pang, Jian Liu, Haoxi Li, Bohai Gu, Haoxuan Che, Jingcai Guo, Song Guo

机构 * HKUST(香港科技大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 针对少步扩散语言模型现有离线策略蒸馏的轨迹不匹配问题,提出 OPTD 策略内转换蒸馏方法,在四个推理基准上改善质量效率权衡并取得最优质量约束 AUP。

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19333 2026-07-22 cs.LG cs.AI stat.ML 新提交 78%

Provable diffusion-based posterior sampling for linear inverse problems via DDIM

通过 DDIM 实现线性逆问题的可证明基于扩散的后验采样

Yuchen Jiao, Na Li, Changxiao Cai, Yuxin Chen, Gen Li

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 该研究针对线性逆问题,提出\pddim算法,通过对标准DDIM更新进行轻量级逐坐标修改并纳入测量模型,沿测量算子奇异方向分别采样。此算法收敛到贝叶斯后验,在图像恢复任务中性能优于现有方法,实现高效且具后验一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06644 2026-07-09 stat.ML cs.LG math.PR 新提交 78%

Fast determinantal sampling on general spaces and diffusion geometry

一般空间上的快速行列式采样与扩散几何

Hoang-Son Tran, Pranav Gupta, Subhroshekhar Ghosh

机构 * National University of Singapore(国立新加坡大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 研究在一般空间(如黎曼流形和加权网络)上的行列式采样,基于谱核建立明确速率保证,实现与可比维度欧几里得空间已知速率匹配,借助韦尔定律及马尔可夫扩散等理论工具。

Comments Preliminary version - to be updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06712 2026-06-08 cs.CL cs.AI 新提交 78%

Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation

数据高效的自回归到扩散语言模型通过策略内蒸馏

Xingyu Su, Jacob Helwig, Shubham Parashar, Atharv Chagi, Lakshmi Jotsna, Degui Zhi, James Caverlee, Dileep Kalathil, Shuiwang Ji

机构 * Department of Computer Science and Engineering, Texas A&M University(德克萨斯大学阿马尔科分校计算机科学与工程系) Department of Bioinformatics and Systems Medicine, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校生物信息学与系统医学系) Department of Electrical and Computer Engineering, Texas A&M University(德克萨斯大学阿马尔科分校电气与计算机工程系)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 提出策略内扩散语言模型(OPDLM),通过策略内蒸馏将自回归模型转换为扩散语言模型,解决分布偏移和训练-推理不匹配问题,实现15倍至7000倍更少训练数据下的强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24157 2026-07-28 cs.CV 新提交 77%

UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling

UniGen-AR:通过自回归建模统一视觉生成

Zhipeng Bao, Zhen Zhu, Nupur Kumari, Anurag Bagchi, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) Toyota Research Institute(丰田研究院)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究统一视觉生成问题,提出UniGen-AR框架,将通用多模态语言模型与视觉自回归解码器配对,能为多任务生成图像值输出,相比基于扩散的基线,推理延迟低达19倍,确立视觉自回归建模为统一视觉生成的高效主干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24403 2026-07-28 cs.CV 新提交 74%

GenSplatCodec: Feed-Forward Gaussian Splatting Compression via One-Step Diffusion

GenSplatCodec:通过一步扩散实现前馈高斯点云压缩

Qiang Hu, Zhenlong Wu, Lei Huang, Zihan Zheng, Xiaoyun Zhang, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协同媒体网络创新中心)

专题命中 效率与蒸馏 :diffusion(title);分类 cs.CV

AI总结 研究针对前馈3D高斯点云压缩难题,提出GenSplatCodec统一编解码器,采用双流编码与几何引导生成解码,经三阶段优化策略,在多数据集实验中展现出优于现有方法的率失真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04923 2026-07-07 cs.CV 新提交 74%

UniSpine-GS: An Efficient Physics-Aware Gaussian Framework for Cross-Modality Multi-view Spine Image Synthesis

UniSpine-GS:一种用于跨模态多视图脊柱图像合成的高效物理感知高斯框架

Qiuhua Chen, Changning Yu, Na Huang, Chao Sun, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) The Department of Ultrasound of Renmin Hospital East Branch of Wuhan University(武汉大学人民医院东院区超声科) Institute of Artificial Intelligence, Wuhan University(武汉大学人工智能研究院) National Engineering Research Center for Multimedia Software, Wuhan University(武汉大学多媒体软件国家工程研究中心) Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(武汉大学多媒体网络通信工程湖北省重点实验室)

专题命中 效率与蒸馏 :image synthesis(title);分类 cs.CV

AI总结 为解决脊柱疾病诊断中3D成像成本高、模态差异挑战等问题,提出UniSpine-GS框架,通过3D感知表示用于多视图脊柱成像新视图投影渲染,引入策略提升边界保真度和局部细节,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27678 2026-06-29 cs.CV 新提交 74%

Two-Stage Cross-Domain Cervical Abnormality Screening with Cytopathological Image Synthesis and Knowledge Distillation

两阶段跨域宫颈异常筛查:细胞病理图像合成与知识蒸馏

Jincheng Li, Yuzhi He, Yihui Zhan, Xinmei Zhang, Yifei Sun, Zelin Liu, Lichi Zhang, Minye Shao, Lili Zhao

机构 * School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院) School of Telecommunications Engineering, Xidian University(西安电子科技大学通信工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) Department of Computer Science, Durham University(杜伦大学计算机科学系)

专题命中 效率与蒸馏 :image synthesis(title);分类 cs.CV

AI总结 提出两阶段框架,先用SC-UNSB合成中间域缓解域偏移,再用知识蒸馏对齐特征,提升跨域宫颈细胞检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07620 2026-08-11 cs.CV 新提交 70%

FlowErase-OPD: Multi-Concept Erasure via Anchored On-Policy Distillation in Flow Matching Models

FlowErase-OPD:基于流匹配模型中锚定在线策略蒸馏的多概念擦除方法

Yi Sun, Yimin Zhou, Xinhao Zhong, Zhiqi Zhang, Junhao Li, Bin Chen

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 FlowErase-OPD是基于在线策略蒸馏的多概念擦除框架,通过引入AMTD和ARC缓解擦除与生成能力的权衡,在多概念擦除任务中实现了优于现有方法的性能,且模型鲁棒性较强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26004 2026-07-29 cs.CV cs.LG 新提交 70%

Parallel Decoding Distillation for Fast Image and Video Generation

用于快速图像和视频生成的并行解码蒸馏

Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

机构 * NVIDIA(英伟达) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散或流模型生成计算昂贵问题,提出并行解码蒸馏方法PDD,兼容预训练模型,通过预测多去噪步骤加速生成,在多个数据集上达SOTA性能,提升视频多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14728 2026-07-17 cs.CV cs.RO 新提交 70%

VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios

VQ-Touch:一种跨传感器和场景的数据高效触觉生成框架

Kailin Lyu, Long Xiao, Jianing Zeng, Di Wu, Lin Shu, Jie Hao

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决现有触觉生成方法依赖特定传感器数据集且泛化能力不足的问题。提出VQ-Touch框架,含DM-VQGAN提取特征及离散扩散解码器支持多模态生成,经少样本混合训练增强泛化能力,实验显示其在多任务中超越现有方法。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27377 2026-07-08 cs.CV cs.CL cs.LG 新提交 70%

DanceOPD: On-Policy Generative Field Distillation

DanceOPD:在策略生成场蒸馏

Wei Zhou, Xiongwei Zhu, Zelin Xu, Bo Dong, Lixue Gong, Yongyuan Liang, Meng Chu, Leigang Qu, Lingdong Kong, Wei Liu, Tat-Seng Chua

机构 * ByteDance Seed(字节跳动Seed) NUS(新加坡国立大学) UMD(马里兰大学) HKUST(香港科技大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出DanceOPD框架,通过将每个样本路由到能力场并查询低噪声学生诱导状态,用速度MSE损失训练流匹配模型,实现文本到图像、局部编辑和全局编辑的多能力组合,提升目标能力同时保持生成质量。

Comments Technical Report; 40 pages, 13 figures, 9 tables; Project Page at https://danceopd.github.io/ GitHub Repo at https://github.com/worldbench/DanceOPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03524 2026-07-07 cs.CV 新提交 70%

Perceptual Flow Matching for Few-Step Generative Modeling

用于少步生成建模的感知流匹配

Chuyang Zhao, Yifei Song, Hongfa Wang, Jianlong Yuan, Yuan Zhang, Siming Fu, Zhineng Chen, Huilin Deng, Haoyang Huang, Nan Duan

机构 * Joy Future Academy(京东探索研究院) Fudan University(复旦大学) Tsinghua University(清华大学) USTC(中国科学技术大学)

专题命中 效率与蒸馏 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 提出感知流匹配框架,在感知特征空间监督流匹配,改进少步生成能力,减少采样步骤,无需教师模型和辅助分数网络,实验表明其能产生高质量结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27371 2026-06-26 cs.CV 新提交 70%

Don't Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance

不要停留在众数!通过特征自引导缓解预训练流模型中的多样性坍塌

Pradhaan S Bhat, Rishubh Parihar, Abhijnya Bhat, R. Venkatesh Babu

机构 * Indian Institute of Science(印度科学研究所) Stanford University(斯坦福大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种无需训练的自引导机制,通过分散批次生成中的内部特征并施加流形正则化,在几乎不增加推理成本的前提下缓解预训练流模型的多样性坍塌问题。

Comments Accepted by ECCV 2026. Project page: https://dont-settle-at-the-mode.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21030 2026-06-23 eess.IV cs.CV 新提交 70%

FlowCodec: One-Step Flow Prior for Generative Image Compression

FlowCodec: 用于生成式图像压缩的一步流先验

Yinhuan Huang, Hao Cao, Pu chen, Wenqi Guo, Zhijin Qin

机构 * Tsinghua University(清华大学)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出FlowCodec框架,将预训练的大规模文本到图像先验嵌入超低比特率编解码器,通过解耦的潜在压缩和单步潜在传输实现高质量压缩,无需额外条件信号或辅助网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23682 2026-06-23 cs.CV 新提交 70%

Keep The Essentials: Efficient Reference Conditioned Generation via Token Dropping

保留精华:通过令牌丢弃实现高效的参考条件生成

Rishubh Parihar, Ayush Raina, R. Venkatesh Babu, Or Patashnik

机构 * IISc Bangalore(印度科学研究所班加罗尔分校) Tel Aviv University(特拉维夫大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出Sparse Context方法,通过丢弃大部分参考令牌并微调模型,实现参考条件生成中4倍(多参考)和2倍(单参考)的推理加速,且不降低视觉质量。

Comments Project Page: https://sparsecontext.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16131 2026-06-16 cs.CV cs.LG 新提交 70%

Shift-and-Sum Quantization for Visual Autoregressive Models

Shift-and-Sum 量化用于视觉自回归模型

Jaehyeon Moon, Bumsub Ham

机构 * Yonsei University(延世大学) Articron

专题命中 效率与蒸馏 :image generation(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出针对视觉自回归模型的训练后量化框架,通过移位求和量化减少注意力值乘积误差,并采用重采样策略校准数据,在图像生成等任务上达到新最优。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01102 2026-08-04 cs.RO 新提交 67%

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

CAAT:用于数据高效接触丰富型操作的接触感知注意力缩放与触觉掩码方法

Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

机构 * ShanghaiTech University(上海科技大学) Beihang University(北京航空航天大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Zhejiang University(浙江大学) BUPT(北京邮电大学)

专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)

AI总结 该研究针对接触丰富型操作中视觉-触觉策略缺乏接触感知先验的问题,提出CAAT框架,通过注意力缩放和动态触觉掩码提升策略性能,在仿真和真实实验中均显著优于现有方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27529 2026-07-31 cs.LG 新提交 67%

Latent-Kernel Discrete Flow Maps for Few-Step Generation

用于少步生成的隐核离散流图

Mansoor Ahmed, Yue-Tsz Fan, Hemanth Venkateswara, Murray Patterson

专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)

AI总结 提出隐核离散流图(LKF)模型,通过共享隐变量绑定分解组件实现少步生成,在两个文本基准上较似然基线提升困惑度2.1-3.3倍,M=8时优于现有少步采样器

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21014 2026-06-23 cs.RO 新提交 67%

BayesFP: Posterior Estimation for Flow-Based Policies via Feynman-Kac Sampling

BayesFP: 基于Feynman-Kac采样的流策略后验估计

Sreevardhan Sirigiri, Weiming Zhi, Fabio Ramos

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Australian Centre For Robotics, The University of Sydney(悉尼大学澳大利亚机器人中心) College of Connected Computing, Vanderbilt University(范德堡大学互联计算学院) NVIDIA(英伟达)

专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)

AI总结 提出BayesFP框架,将预训练扩散/流匹配策略的约束轨迹生成视为贝叶斯后验采样,利用Feynman-Kac校正器实现无需重训练的推理时采样,在模拟和真实操作任务中提升零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12555 2026-07-07 cs.SD cs.CV cs.MM 新提交 62%

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

AudioX-Turbo:高效任意到音频生成的统一框架

Zeyue Tian, Lei Ke, Zhaoyang Liu, Ruibin Yuan, Liumeng Xue, Yujiu Yang, Weijia Chen, Xu Tan, Qifeng Chen, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Noiz AI Independent Researcher(独立研究员)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 提出AudioX-Turbo,基于教师-学生范式的统一高效框架,通过多模态扩散Transformer和分布匹配蒸馏实现文本、视频、音频到音频的生成,仅需4步采样,NFE减少约25倍。

详情

展开后加载摘要…

URL PDF HTML 收藏