arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-24 至 2026-07-24 共收录 30 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2512.17951 2026-07-24 cs.CV 版本更新 70%

SuperFlow: Training Flow Matching Models with RL on the Fly

SuperFlow: 通过实时强化学习训练流匹配模型

Kaijie Chen, Zhiyang Xu, Ying Shen, Zihao Lin, Yuguang Yao, Lifu Huang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 SuperFlow通过实时强化学习优化流模型训练,提升文本-图像生成效率和质量。

Comments This article is withdrawn because it was submitted to arXiv without obtaining the consent of all listed authors

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 27 篇

2509.21913 2026-07-24 physics.med-ph cs.AI 版本更新 86%

Equivariant Conditional Diffusion Model for Head and Neck CT Image Synthesis from CBCT

用于从CBCT合成头颈CT图像的等变条件扩散模型

Alzahra Altalib, Chunhui Li, Alessandro Perelli

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title)

AI总结 针对CBCT图像有伪影、CT图像难捕捉治疗中解剖变化的问题,提出EqDiff-CT模型,基于扩散概率模型和群等变条件U-Net主干,从CBCT合成高质量CT图像,经实验验证在多方面有显著提升,为CBCT改进提供框架。

Comments 43 pages, 9 figures, 6 tables, accepted in Medical Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04731 2026-07-24 cs.CV 版本更新 83%

When Does High-CFG Diffusion Inversion Fail? A Controlled Study of Prompt--Latent Interactions

高CFG扩散反演何时失败?对提示-潜在交互的对照研究

Yan Zeng, Yusuke Hosoya, Huyen T. T. Tran, Takayuki Okatani

机构 * GSIS Tohoku University(东北大学全球信息社会研究院) RIKEN AIP JAPAN(日本理化学研究所先进智能项目中心)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 研究在图像编辑中,高CFG轨迹生成的目标图像何时能被反演。通过对照实验,用现有基准的提示生成图像并反演,揭示提示重建行为类型,定义提示压力分析生成,文本分析表明主体和措辞影响反演,评估干预措施支持局部轨迹感知分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16615 2026-07-24 cs.CV 版本更新 83%

Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers

用于高效扩散变压器的可训练对数线性稀疏注意力

Yifan Zhou, Zeqi Xiao, Tianyi Wei, Shuai Yang, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究针对扩散变压器二次自注意力成本限制长序列扩展问题,提出可训练的对数线性稀疏注意力机制LLSA,通过分层结构降低成本,经实验验证其能加速注意力推理和DiT训练,为高效训练长序列DiTs提供方向。

Comments Code is available at: https://github.com/SingleZombie/LLSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20955 2026-07-24 cs.CR cs.LG 版本更新 82%

Enhancing Membership Inference Attacks on Diffusion Models from a Frequency-Domain Perspective

从频域角度增强扩散模型的成员推理攻击

Puwei Lian, Yujun Cai, Songze Li, Bingkun Bao

机构 * Southeast University(东南大学) The University of Queensland(昆士兰大学) Hefei University of Technology(合肥工业大学) Engineering Research Center of Blockchain Application, Supervision and Management (Southeast University), Ministry of Education(区块链应用、监督与管理工程研究中心(东南大学),教育部)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文从频域角度揭示扩散模型处理高频信息的缺陷导致成员推理攻击误分类,并提出即插即用的高频滤波模块以提升攻击性能。

Comments Accepted to Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16947 2026-07-24 cs.RO cs.AI 版本更新 82%

Drive As You Like: Multi-Head Diffusion with Reinforcement Learning for Personalized Driving

随心所欲驾驶:基于强化学习的多头部扩散个性化驾驶

Fan Ding, Xuewen Luo, Fucai Ke, Hwa Hui Tew, Susilawati Susilawati, Vishnu Monn Baskaran, Junn Yong Loo

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) Southwest University, China(西南大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究旨在解决自动驾驶规划器忽视人类驾驶行为多样性及难以理解用户意图的问题。提出基于强化学习的多策略框架,集成多头部扩散规划器与语义理解,采用两阶段训练范式。实验表明该方法在nuPlan基准测试中性能良好,能满足实时规划并对齐用户意图。

Comments Has been submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11658 2026-07-24 cs.CV 版本更新 79%

EmoSpace: Immersive Affective Image Generation Guided by Fine-Grained Emotion Prototypes

EmoSpace: 细粒度情绪原型学习用于沉浸式情感内容生成

Bingyuan Wang, Xingbei Chen, Zongyang Qiu, Lin-Ping Yuan, Zeyu Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 EmoSpace通过视觉-语言对齐学习动态情绪原型,实现沉浸式情感内容生成的细粒度控制与多样化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21514 2026-07-24 cs.SI cond-mat.stat-mech cs.IT cs.LG math.IT physics.data-an 版本更新 78%

Conditional Entropy of Heat Diffusion on Temporal Networks

时间网络上热扩散的条件熵

Samuel Koovely, Alexandre Bovet

机构 * Department of Mathematical Modeling and Machine Learning(数学建模与机器学习系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了时间网络上热扩散的条件熵,提出了一种新的方法来检测时间网络中的相变点,并展示了其在信息论中的意义,类似于热力学第二定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17232 2026-07-24 cs.LG math.ST stat.ML stat.TH 版本更新 78%

Dimension-Free Convergence of Discrete Diffusion Models: Adjoint Equations Induce the Right Space

离散扩散模型的维度无关收敛性:伴随方程诱导了正确的空间

Kelvin Kan, Xingjian Li, Benjamin J. Zhang, Tuhin Sahai, Stanley Osher, Markos A. Katsoulakis

机构 * Department of Mathematics(数学系) Oden Institute School of Data Science and Society(数据科学与社会学院) UCLA(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Computational and Applied Sciences Group(计算与应用科学组) Department of Mathematics and Statistics(数学与统计学系) SRI International(SRI国际) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于伴随方程的统一框架,实现了任何积分概率度量(IPM)下的维度无关收敛保证,克服了传统KL和TV方法在处理大规模状态空间时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13026 2026-07-24 cs.LG cs.AI cs.CL 版本更新 78%

Understanding and Accelerating the Training of Masked Diffusion Language Models

理解并加速掩码扩散语言模型的训练

Chunsan Hong, Sanghyun Lee, Chieh-Hsin Lai, Satoshi Hayakawa, Yuhta Takida, Yuki Mitsufuji, Seungryong Kim, Jong Chul Ye

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) University of Tokyo(东京大学) Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了掩码扩散模型训练缓慢的原因,提出bell-shaped时间采样策略,显著提升训练效率和模型性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11052 2026-07-24 cs.SD 版本更新 78%

LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation

LaDA-Band:语言扩散模型用于人声到伴奏生成

Qi Wang, Zhexu Shen, Meng Chen, Guoxin Yu, Chaoxu Pang, Weifeng Zhao, Wenjiang Zhou

机构 * State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所人工智能安全国家重点实验室) Lyra Lab, Tencent Music Entertainment(腾讯音乐娱乐集团Lyra实验室) Pengcheng Laboratory(鹏城实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LaDA-Band通过引入离散掩码扩散模型,解决了人声到伴奏生成中保持音质真实、维持全局连贯性和产生动态编曲的三重挑战,提升了长距离结构一致性和时间同步性。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06846 2026-07-24 cs.SD 版本更新 78%

DynFOA: Generating First-Order Ambisonics with Conditional Diffusion for Dynamic and Acoustically Complex 360-Degree Videos

DynFOA: 基于条件扩散的动态和声学复杂的360度视频生成一阶混响

Ziyu Luo, Lin Chen, Qiang Qu, Xiaoming Chen, Yiran Shen

机构 * School of Computer and Artificial Intelligence, Beijing Technology and Business University, Beijing, China(计算机与人工智能学院,北京技术与商业大学) School of Computer Science, The University of Sydney, Sydney, NSW, Australia(计算机科学学院,悉尼大学) School of Software, Shandong University, Jinan, China(软件学院,山东大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DynFOA通过动态声学感知和条件扩散生成高质量的360度视频一阶混响,提升沉浸式音频体验。

Comments Revised version with updated content.This submission is the intended replacement of arXiv:2602.06846

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04019 2026-07-24 cs.LG cs.AI cs.CL 版本更新 78%

Simple Policy Gradients for Reasoning with Diffusion Language Models

为扩散语言模型进行推理的简单策略梯度

Anthony Zhan

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出 AGRPO 算法,通过优化 dLLM 的去噪步骤提升推理性能,实现多个任务上的显著增益。

Comments 19 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21284 2026-07-24 cs.LG cs.AI cs.ET math.AP 版本更新 78%

PILD: Physics-Informed Learning via Diffusion

PILD:通过扩散进行物理引导学习

Tianyi Zeng, Tianyi Wang, Jiaru Zhang, Zimo Zeng, Feiyang Zhang, Yiming Xu, Sikai Chen, Junfeng Jiao, Christian Claudel, Xinbo Chen

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) Zhejiang University, Hangzhou, Zhejiang, China(浙江大学) Tongji University, Shanghai, China(同济大学) University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 PILD通过引入虚拟残差观测和条件嵌入模块,结合物理约束与扩散模型,提升工程和科学任务中生成模型的准确性、稳定性和泛化能力。

Comments 34 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21057 2026-07-24 cs.HC 版本更新 78%

Privatization of Synthetic Gaze: Attenuating State Signatures in Diffusion-Generated Eye Movements

合成眼动的私有化:减弱扩散生成眼动中的状态特征

Kamrul Hasan, Oleg V. Komogortsev

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于扩散模型的合成眼动方法,通过分析合成眼动特征与主观报告之间的相关性,证明生成方法能有效抑制与隐私相关的内部状态特征,同时保留真实数据的信号特征。

Comments Accepted at IEEE International Joint Conference on Biometrics (IJCB) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12086 2026-07-24 cs.LG cs.CR 版本更新 78%

CLOAK: Contrastive Guidance for Latent Diffusion-Based Data Obfuscation

CLOAK:基于潜在扩散的数据混淆的对比引导

Xin Yang, Omid Ardakanian

机构 * University of Alberta(阿尔伯塔大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对数据混淆问题,提出基于潜在扩散模型的Cloak框架,用对比学习提取解纠缠表示,指导潜在扩散过程平衡隐私与效用。实验表明该框架优于现有技术,能降低效用和隐私损失,适合资源受限环境。

Journal ref Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, Volume 10, Issue 3, Article 184, September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09867 2026-07-24 cs.HC 版本更新 78%

Quantitative and Qualitative Comparison of Generative Models for Subject-Specific Gaze Synthesis: Diffusion vs GANs

特定主体注视合成生成模型的定量与定性比较:扩散模型与生成对抗网络

Kamrul Hasan, Dmytro Katrychuk, Mehedi Hasan Raju, Oleg V. Komogortsev

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究特定主体注视合成,对扩散模型和GAN进行修改,前者纳入用户嵌入,后者引入特定主体条件模块,通过眼动信号质量指标评估,发现扩散模型生成的注视序列更优,推进了对合成注视相关特性的理解及生物识别应用发展。

Comments Accepted at IEEE International Joint Conference on Biometrics (IJCB) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06714 2026-07-24 math.ST stat.TH 版本更新 71%

Expectation-Maximization algorithm to estimate the forcing parameter of a nonlinear McKean-Vlasov diffusion

用于估计非线性McKean-Vlasov扩散强迫参数的期望最大化算法

Eduardo Gutierrez-Turner, Kerlyns Martinez, Hector Olivero

专题命中 扩散模型 :diffusion(title)

AI总结 研究受瞬时湍动能模型启发的随机微分方程中强迫参数估计问题,基于期望最大化框架提出估计算法,证明其一致性并通过数值实验说明发现。

Comments 24 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11029 2026-07-24 cs.RO cs.CV 版本更新 57%

Learning to Navigate Efficiently with Only 0.58M Trainable Parameters

仅用58万个可训练参数学习高效导航

Edward Beng Wai Tan, Siew-Kei Lam

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视觉导航中单个任务族所需规模及替代结构,提出分解式导航模型,仅用少量可训练参数,在导航任务中接近最先进模型性能,还能用于无目标探索,故障模式可解析纠正。

Comments 6 pages, 4 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03819 2026-07-24 cs.GR cs.AI 版本更新 57%

CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-Centric 3D Scene Generation

CGGS:用于以自我为中心的3D场景生成的一致性增强几何高斯点云渲染

Zhenyu Sun, Xiaohan Zhang, Qi Liu, Huan Wang

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) School of Engineering, Westlake University(西湖大学工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 针对以自我为中心的3D场景生成难题,提出CGGS框架。通过微调多视图潜在扩散模型生成2D内容,利用光流等估计深度产生点云,再经几何细化器优化3D高斯重建,提升视觉质量与几何结构。

Comments Update format

Journal ref IEEE Transactions on Image Processing, vol. 35, pp. 7670-7684, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20114 2026-07-24 cs.CV cs.AI 版本更新 57%

Benchmarking Unlearning for Vision Transformers

对视觉变换器的去学习进行基准测试

Kairan Zhao, Iurie Luca, Peter Triantafillou

机构 * University of Warwick, United Kingdom(沃里克大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究首次对视觉变换器的去学习算法进行基准测试,评估不同数据集、算法和协议的影响,揭示了VTs在记忆训练数据方面的特性及性能基线。

Comments Accepted at CoLLAs 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18601 2026-07-24 econ.EM 版本更新 50%

Robust Signal Maximization in Spillover Experiments

溢出实验中的稳健信号最大化

Kirill Borusyak, Peter Hull, Evan Munro

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究溢出效应实验的最优设计与分析,刻画使最坏情况渐近方差最小化的处理分配分布和估计量,给出设计与分析问题的解决方案,框架在基准情形下有自然解并为一般网络提近似,半合成实验中方法降低标准误差、增加有效样本量。

Comments 70 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16619 2026-07-24 cs.RO cs.MA 版本更新 50%

SAGE: A Socially-Aware Generative Engine for Heterogeneous Multi-Agent Navigation

SAGE:用于异构多智能体导航的社会感知生成引擎

Lan Hu, Minghui Liwang, Wenbo Zhu, Xinlei Yi, Yiguang Hong, Xianbin Wang, Zhenzhen Jiao, Seyyedali Hosseinalipour

机构 * Guohao School, Tongji University(同济大学国豪书院) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能无人系统科学中心) Tongji University(同济大学) Western University(西安大略大学) Aeromind Technology Co., Ltd.(深圳智元科技有限公司) University at Buffalo-SUNY(纽约州立大学布法罗分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对开放人机环境中异构多智能体导航问题,提出SAGE,通过有向异构图和异构图变换器编码交互,扩散生成模块建模轨迹,无训练安全-社会能量引导机制优化轨迹,实验验证其有效性及可扩展性。

Comments 16 pages, 5 figures, and 14 tables. Includes supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18103 2026-07-24 physics.plasm-ph math-ph math.MP physics.flu-dyn 版本更新 50%

An Implicit Time-Domain Harmonic Balance Method for Radio-Frequency Capacitively Coupled Plasma Simulations

一种用于射频电容耦合等离子体模拟的隐式时域谐波平衡方法

Yuze Zhu, Yufeng Wei, Yue Zhang, Kun Xu

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究将时域谐波平衡方法扩展用于射频电容耦合等离子体模拟,采用时空算子分裂策略避免全局雅可比矩阵内存密集组装,经基准验证,其结果准确,能绕过物理瞬态,相比传统方法有显著加速,确立了高效模拟范例。

Comments 41 pages, 23 figures, research article

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12566 2026-07-24 stat.ME 版本更新 50%

Inferring resource selection and utilization distributions from irregular and error-prone animal tracking data

从不规则且带有误差的动物追踪数据推断资源选择和利用分布

Fanny Dupont, Brett T. McClintock, Jan-Ole Fischer, Marianne Marcoux, Nigel E. Hussey, Marie Auger-Méthé

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出基于拉普拉斯近似的单阶段框架,通过TMB实现,同时处理测量误差和不规则采样,在模拟和独角鲸数据中优于两步法。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04674 2026-07-24 nucl-th 版本更新 50%

Coupled charm and charmonium transport in a strongly coupled quark-gluon plasma

强耦合夸克-胶子等离子体中重 Charm 和 Charmonium 的输运

Kaiyu Fu, Biaogang Wu, Ralf Rapp

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出了一种基于热力学 T 矩阵相互作用的耦合 Charm-Charmonium 输运框架,用于描述强耦合 QGP 中 Charm-quark 扩散和 Charmonium 动力学。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01641 2026-07-24 math.PR 版本更新 50%

Quantitative Convergence for Sequential Interacting Diffusions via Incremental Relative Entropy

序列相互扩散的定量收敛与高斯波动:通过增量相对熵

Zhenfu Wang, Xianliang Zhao

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了序列相互扩散系统的定量收敛与高斯波动,通过增量相对熵证明了路径空间熵的衰减及经验测度的收敛性,并建立了波动测度的高斯极限。

Comments 35 pages, 2 figures. We split the first version to two parts. This is the first part

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22297 2026-07-24 quant-ph 版本更新 50%

Decoherence challenges in Nanoscience: A Quantum Phase Space perspective

纳米科学中的退相干挑战:量子相空间视角

Ravo Tokiniaina Ranaivoson, Angelo Mamitiana Ralaikoto, Diary Lova Ratsimbazafy, Rivo Herivola Manjakamanana Ravelonjato, Roland Raboanary, Raoelina Andriambololona, Nomenjanahary Tanjonirina Manampisoa, Fanamby Sahondraniandriana

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于量子相空间的框架,用于表征环境选择的指针态并建模退相干动力学,为纳米科学中的退相干问题提供新的理论工具和方法。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 可控生成 1 篇

2603.04910 2026-07-24 cs.RO cs.AI cs.LG 版本更新 50%

VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory

VPWEM:非马尔可夫视觉-运动策略与工作记忆与事件记忆

Yuheng Lei, Zhixuan Liang, Hongyuan Zhang, Ping Luo

机构 * School of Computing and Data Science, University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 VPWEM通过引入工作记忆和事件记忆,提升机器人在非马尔可夫任务中的动作生成性能。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L). \textcopyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 1 篇

2606.00543 2026-07-24 cs.CV 版本更新 57%

ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs

ETC: 通过任务感知的视觉信息蒸馏实现视觉语言模型中的极端令牌压缩

Yiling Gao, Hongchen Wei, Zhenzhong Chen

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 提出ETC框架,基于变分信息蒸馏原理,在减少输入令牌数量时最小化任务损失,通过文本-图像交叉注意力加权视觉特征并引入变分信息蒸馏,实现单令牌压缩下仍保持强任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏