arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1460
2604.00757 2026-06-29 cs.CV cs.AI 版本更新

IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models

IWP:大型视觉语言模型中的隐式权重剪枝与令牌剪枝

Dong-Jae Lee, Sunghyun Baek, Junmo Kim

机构 * KAIST(韩国科学技术院)

AI总结 提出基于注意力对偶形式的无训练令牌剪枝框架,通过度量令牌的信息量和冗余度,结合渐进式分块最大边际相关性选择子集,在保持性能的同时提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17455 2026-06-29 cs.CV cs.RO 版本更新

VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization

VLM引导的视觉地点识别用于行星级地理定位

Sania Waheed, Na Min An, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * Univ. of Southampton, UK(英国南安普顿大学) KAIST, South Korea(韩国科学技术院) QUT, Australia(昆士兰科技大学) Univ. of Essex, UK(英国埃塞克斯大学)

AI总结 提出VLM与检索式VPR结合的混合框架,利用VLM生成先验约束搜索空间,再通过检索和重排序实现行星级地理定位,在街道和城市级别分别提升4.51%和13.52%。

Journal ref Proceedings of the Australasian Conference on Robotics and Automation (ACRA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27307 2026-06-26 cs.CV 新提交

See & Sniff: Learning Visuo-Olfactory Representations

See & Sniff: 学习视觉-嗅觉表征

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Hankuk University of Foreign Studies(韩国外国语大学) Ulsan National Institute of Science and Technology(蔚山科学技术院)

AI总结 提出SmellNet-V数据集和See & Sniff自监督框架,通过密集局部对齐学习联合视觉-嗅觉表征,实现气味分类、跨模态检索和气味定位,性能提升7%。

Comments ECCV 2026. Project Page: https://mm.kaist.ac.kr/projects/SeeandSniff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26858 2026-06-26 cs.RO 新提交

PlanRL: A Trajectory Planning Architecture for Reinforcement Learning-based Driving Experts

PlanRL: 一种用于基于强化学习的驾驶专家的轨迹规划架构

Joonhee Lim, Yongjae Lee, Jangho Shin, Dongsuk Kum

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Hyundai Motor Company(现代汽车公司)

AI总结 提出一种将强化学习策略与多项式轨迹规划器结合的轨迹规划架构,通过Frenet坐标系简化道路几何并加入运动学可行性检查,在CARLA基准上驾驶评分提升5%-11%,成功率提升8%-19%。

Comments Accepted at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26762 2026-06-26 cs.CV cs.LG 新提交

ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory

ProtoKV: 延迟查询下的流式视频理解与摘要状态记忆

Le Tu Ngoc Minh, Jinyeong Lim, Dongsu Han

机构 * KAIST(韩国科学技术院)

AI总结 提出ProtoKV,一种固定内存的流式视频理解记忆机制,通过摘要状态表示远历史,在长延迟查询下准确率提升高达12.5点。

Comments 20 pages, 4 figures, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26538 2026-06-26 cs.LG cs.AI 新提交

CascadeFormer: Depth-Tapered Transformers Motivated by Gradient Fan-in Asymmetry

CascadeFormer: 由梯度扇入不对称性启发的深度锥形Transformer

Huzama Ahmad, Cao Viet Hai Nam, Se-Young Yun

机构 * KAIST(韩国科学技术院)

AI总结 针对深层Transformer中深层贡献不足的问题,提出CascadeFormer通过锥形宽度匹配信息流,以及CascadeFlow Pruning利用梯度剪枝层,基于梯度扇入不对称性(GFA)理论解释深层贡献少的原因。

Comments 18 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27354 2026-06-26 cs.LG cs.AI cs.CV cs.NA math.NA 新提交

Error-Conditioned Neural Solvers

误差条件神经求解器

Haina Jiang, Liam Wang, Peng-Chen Chen, Min Seop Kwak, Seungryong Kim, Brian Bell, Jeong Joon Park

机构 * University of Michigan(密歇根大学) KAIST AI(韩国科学技术院人工智能) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

AI总结 提出误差条件神经求解器(ENS),通过将PDE残差场作为网络输入,学习迭代校正策略,在多个PDE族上实现高精度预测,尤其适用于病态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15681 2026-06-26 cs.CL 版本更新

GenRecal: Generation after Recalibration from Large to Small Vision-Language Models

GenRecal:从大到小视觉语言模型的校准后生成

Byung-Kwan Lee, Ryo Hachiuma, Yong Man Ro, Yu-Chiang Frank Wang, Yueh-Hua Wu

机构 * NVIDIA KAIST(韩国成均馆大学)

AI总结 提出GenRecal通用蒸馏框架,通过校准器对齐异构VLM特征,实现从大到小模型的有效知识迁移,在多个基准上超越大规模开源和闭源VLM。

Comments Project page: https://byungkwanlee.github.io/GenRecal-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26087 2026-06-25 cs.CV 新提交

MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation

MVTrack4Gen: 多视角点跟踪作为4D视频生成的几何监督

JoungBin Lee, Jaewoo Jung, Jongmin Lee, Tongmin Kim, Hyunsung Kim, Takuya Narihira, Kazumi Fukuda, Jahyeok Koo, Jisang Han, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司)

AI总结 提出MVTrack4Gen框架,利用多视角点跟踪作为几何与运动监督信号,增强仅相机条件的新视角视频扩散模型的运动一致性和几何一致性。

Comments Project Page : https://cvlab-kaist.github.io/MVTrack4Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24950 2026-06-25 cs.LG cs.AI 新提交

MacroLens: A Multi-Task Benchmark for Contextual Financial Reasoning under Macroeconomic Scenarios

MacroLens:宏观经济情景下的多任务上下文金融推理基准

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

AI总结 针对金融决策中价格、基本面、宏观和文本四信号联合评估的缺失,构建了涵盖4426只美股、七个任务、1130个宏观事件的基准,评估19种方法,揭示上下文特征的重要性。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19887 2026-06-25 cs.CR cs.AI 新提交

FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming

FFinRED:面向金融大语言模型红队测试的专家引导基准生成与评估框架

Chaeyun Kim, Daeyoung Park, Junghwan Kim, Jinyoung Jeong, Eunji Song, Yongtaek Lim, Minwoo Kim

机构 * DATUMO INC.(DATUMO公司) Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学研究院) Financial Security Institute (FSI)(金融安全研究所)

AI总结 提出FinRED框架,通过专家引导的两级分类法将全球金融标准映射为威胁,并利用真实金融文档生成上下文丰富的红队行为提示,结合专家验证的评估标准,有效降低关键假阴性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28090 2026-06-25 cs.CV 版本更新

To View Transform or Not to View Transform: NeRF-based Pre-training Perspective

视图变换还是不视图变换:基于NeRF的预训练视角

Hyeonjun Jeong, Juyeb Shin, Dongsuk Kum

机构 * KAIST(韩国科学技术院)

AI总结 提出NeRP3D检测器,避免视图变换与NeRF的冲突先验,保留预训练NeRF网络,实现连续3D表示学习,在nuScenes上提升场景重建和检测性能。

Comments The Fourteenth International Conference on Learning Representations (ICLR'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11575 2026-06-25 cs.RO cs.AI cs.CV 版本更新

ReaDy-Go: Real-to-Sim Dynamic 3D Gaussian Splatting Simulation for Environment-Specific Visual Navigation with Moving Obstacles

ReaDy-Go: 面向动态障碍物环境特定视觉导航的实到仿动态3D高斯泼溅仿真

Seungyeon Yoo, Youngseok Jang, Dabin Kim, Youngsoo Han, Seungwoo Jung, H. Jin Kim

机构 * Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系) InnoCORE AI-Transformed Aerospace Research Center, KAIST(韩国科学技术院(KAIST)人工智能赋能航空航天研究中心)

AI总结 提出ReaDy-Go仿真管线,通过将静态3D高斯场景与动态人体高斯障碍物结合生成逼真动态场景,并训练导航策略,有效缩小仿真到现实的差距并处理移动障碍物。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L). Project page: https://syeon-yoo.github.io/ready-go-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22487 2026-06-25 cs.CL 版本更新

Constituency Structure over Eojeol in Korean Treebanks

韩语树库中基于语节的成分结构

Jungyeul Park, Chulwoo Park

机构 * KAIST(韩国国立科学技术院) Anyang University(安阳大学)

AI总结 针对韩语成分树库中终端单位选择问题,提出基于语节的成分表示,将形态分割和细粒度词性信息编码在非成分层,支持跨树库比较和成分-依存对齐。

Comments To appear in Korean Linguistics, John Benjamins

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15490 2026-06-25 cs.CV cs.LG eess.IV 版本更新

Improving Factuality of 3D Brain MRI Report Generation with Paired Image-domain Retrieval and Text-domain Augmentation

通过配对图像域检索和文本域增强提高3D脑MRI报告生成的事实准确性

Junhyeok Lee, Yujin Oh, Dahyoun Lee, Hyon Keun Joh, Minchul Kim, Chul-Ho Sohn, Sung Hyun Baik, Cheol Kyu Jung, Jung Hyun Park, Kyu Sung Choi, Byung-Hoon Kim, Jong Chul Ye

机构 * Cancer Biology, Seoul National University College of Medicine, Korea(首尔国立大学医学院癌症生物学系,韩国) Radiology, Massachusetts General Hospital(麻省总医院放射科) Harvard Medical School(哈佛医学院) Biomedical Systems Informatics, Yonsei University College of Medicine, Korea(延世大学医学院生物医学系统信息学系,韩国) Graduate School, Yonsei University, Korea(延世大学研究生院,韩国) Radiology, Seoul National University College of Medicine, Korea(首尔国立大学医学院放射科,韩国) Radiology, Seoul National University Hospital, Korea(首尔国立大学医院放射科,韩国) Radiology, Seoul National University Bundang Hospital, Korea(首尔国立大学 Bundang 医院放射科,韩国) Radiology, SMG-SNU Boramae Medical Center, Korea(SMG-SNU Boramae 医疗中心放射科,韩国) Psychiatry, Yonsei University College of Medicine, Korea(延世大学医学院精神病学系,韩国) Behavioral Sciences in Medicine, Yonsei University College of Medicine, Korea(延世大学医学院医学行为科学系,韩国) Yonsei Institute for Digital Health, Korea(延世大学数字健康研究院,韩国) Kim Jaechul Graduate School of AI, KAIST, Korea(金 Jaechul人工智能研究生院,韩国)

AI总结 提出PIRTA框架,通过检索相似3D DWI/ADC图像并利用其配对报告指导LLM生成,避免显式跨模态对齐,显著提高缺血区域准确性。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24648 2026-06-24 cs.SD cs.CL eess.AS 新提交

ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge

ParaPairAudioBench: 面向LALM-as-a-Judge的副语言成对音频基准

Jisu Jeon, Seungyeon Jwa, Joosung Lee, Jinhyeon Kim, Woojin Chung, Hwiyeol Jo, Jeonghoon Kim, Jonghyun Choi, Soyoon Kim

机构 * Hongik University(弘益大学) Seoul National University(首尔大学) NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

AI总结 提出ParaPairAudioBench,包含5,175对音频,覆盖风格、语速、重音、年龄和性别五个副语言维度,用于评估大型音频语言模型作为评判者的可靠性,发现其与人类判断差距大且校准失败严重。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24232 2026-06-24 cs.CV cs.GR 新提交

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA:基于单张肖像图像的前馈即时高斯编解码器化身

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) School of Computing, KAIST(韩国科学技术院计算机学院)

AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。

Comments Project page: https://kim-youwang.github.io/FiCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24049 2026-06-24 cs.RO 新提交

SPACE: Enabling Learning from Cross-Robot Data Toward Generalist Policies

SPACE:从跨机器人数据中学习通用策略

Haeone Lee, Byeongguk Jeon, Suchae Jeong, Jian Kim, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Yonsei University(延世大学)

AI总结 提出SPACE框架,通过笛卡尔状态增量作为通用动作表示,结合动作适配器处理机器人动力学差异,实现跨本体和硬件的策略学习,显著优于直接预测控制命令的方法。

Comments Project page: http://haeone.site/space-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22314 2026-06-24 cs.LG cs.AI cs.CV 新提交

Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution

扩散积分梯度:用于灵活特征归因的可控路径生成

Soyeon Kim, Kyowoon Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) Ajou University(亚洲大学) INEEJI Corp.(INEEJI公司)

AI总结 提出扩散积分梯度(DiffIG),通过扩散模型生成路径并嵌入用户引导,实现灵活可控的特征归因,在定量和定性上优于现有方法。

Comments 44 pages, 22 figures, 10 tables. Accepted to ECCV 2026; includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17046 2026-06-24 cs.RO cs.CV cs.LG 新提交

Geometric Action Model for Robot Policy Learning

几何动作模型用于机器人策略学习

Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

机构 * KAIST AI(韩国科学技术院人工智能学院) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心)

AI总结 提出几何动作模型(GAM),通过重用预训练几何基础模型(GFM)作为共享骨干,实现语言条件下的操作策略,在仿真和真实机器人任务中优于现有方法。

Comments Project page: https://cvlab-kaist.github.io/Geometric-Action-Model/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08558 2026-06-24 cs.CL cs.AI 版本更新

WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models

WAND: 窗口注意力与知识蒸馏用于高效自回归文本到语音模型

Hanna Lee, Tan Dat Nguyen, Jaehoon Kang, Kyuhong Shim

机构 * Korea Advanced Institute of Science and Technology, Republic of Korea(韩国科学技术院) Sungkyunkwan University, Republic of Korea(成均馆大学)

AI总结 提出WAND框架,通过分离注意力为全局持久注意力和局部滑动窗口注意力,结合课程学习与知识蒸馏,在保持合成质量的同时将AR-TTS模型的计算和内存复杂度降至常数,KV缓存减少66.2%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14792 2026-06-24 cs.CV 版本更新

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL: 用于开放词汇目标检测的多步伪标签方法

Hojun Choi, Youngsun Lim, Jaeyo Shin, Hyunjung Shim

机构 * KAIST AI(韩国韩世大学AI研究所) Boston University(波士顿大学)

AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02583 2026-06-24 cs.LG

Transformer-based Stagewise Decomposition for Large-Scale Multistage Stochastic Optimization

基于Transformer的分阶段分解用于大规模多阶段随机优化

Chanyeong Kim, Jongwoong Park, Hyunglip Bae, Woo Chang Kim

机构 * Department of Industrial and Systems Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学工业与系统工程系) NCSOFT Corporation, Seongnam, Republic of Korea(韩国水原NCSOFT公司)

AI总结 本文提出TranSDDP算法,利用Transformer结构改进传统SDDP,通过生成分段线性近似函数提升大规模多阶段随机优化问题的求解效率与精度。

Comments Accepted at ICML 2023 (Oral Presentation)

Journal ref Proceedings of the 40th International Conference on Machine Learning, PMLR 202:16747-16770, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21888 2026-06-23 eess.AS cs.SD 新提交

ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion

ProsoCodec:面向韵律的语音编解码器用于语音转换

Jeongsoo Choi, Ji-Hoon Kim, Shujie Hu, Joon Son Chung

机构 * KAIST, South Korea(韩国科学技术院) Chung-Ang University, South Korea(Chung-Ang 大学) The Chinese University of Hong Kong, China(香港中文大学)

AI总结 提出ProsoCodec,通过将韵律建模为条件残差而非分离流,在语音转换中改善韵律保留并减少源音色泄漏。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21588 2026-06-23 eess.IV cs.CV 新提交

Unsupervised Susceptibility Distortion Correction of EPI without Calibration Scans via Image Translation-Based Registration

无需校准扫描的EPI无监督磁敏感畸变校正:基于图像翻译的配准方法

Wooseung Kim, Sung-Hong Park

机构 * Department of Bio and Brain Engineering, Korea Advanced Institute of Science and Technology(生物与脑工程系,韩国科学技术院)

AI总结 提出SACRED框架,利用可逆神经网络进行BOLD与T1w图像翻译,结合无监督配准实现EPI几何畸变校正,无需额外校准扫描,在分布内和分布外数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23557 2026-06-23 cs.CV 新提交

Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

基于全局地图与局部视图的多视角3D推理的密集奖励

Jiho Choi, Seonho Lee, Seojeong Park, Hyunjung Shim

机构 * Graduate School of Artificial Intelligence, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) KRAFTON, Republic of Korea(韩国KRAFTON公司)

AI总结 提出DR-MV3D框架,通过全局一致性奖励和局部轨迹奖励对多视角3D VQA的中间推理过程进行密集监督,提升跨视图推理一致性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23217 2026-06-23 cs.CL cs.AI 新提交

MuPPET: A Benchmark for Contextual Privacy of LLM Assistants in Multi-Party Conversations

MuPPET:多轮对话中LLM助手上下文隐私的基准测试

Elena Sofia Ruzzetti, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Rome Tor Vergata(罗马第二大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) KAIST AI(韩国科学技术院人工智能研究所)

AI总结 提出MuPPET基准,评估多用户对话中LLM代理的隐私泄露风险,发现模型在多用户场景下泄露更严重,现有防御措施效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23132 2026-06-23 cs.CV 新提交

T-VSS: Test-Time Visual Subspace Steering for Adversarial Robustness of Vision-Language Models

T-VSS:面向视觉语言模型对抗鲁棒性的测试时视觉子空间引导

Jaehyuk Jang, Minseok Seo. Seungju Cho, Kangwook Ko, Changick Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院)

AI总结 提出T-VSS方法,通过在视觉特征空间中构建样本特定的低秩子空间并学习共享特征校正,直接适应受攻击特征,提升视觉语言模型的对抗鲁棒性,同时保持清洁准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22975 2026-06-23 cs.LG 新提交

TaLK: Text-attributed Graph Dataset Distillation via Coupling Language Model with Graph-Aware Kernel

TaLK: 通过耦合语言模型与图感知核的文本属性图数据集蒸馏

Yeongho Kim, Yeonje Choi, Kijung Shin

机构 * Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院)

AI总结 提出TaLK方法,通过耦合语言模型与图感知神经切线核实现文本属性图的高效数据集蒸馏,避免重复联合训练,仅用1%合成数据即可达到97%的全数据集性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22874 2026-06-23 cs.LG cs.AI 新提交

SpotAttention: Plug-In Block-Sparse Routing for Pretrained Long-Context Transformers

SpotAttention: 面向预训练长上下文Transformer的即插即用块稀疏路由

Huzama Ahmad, Se-Young Yun

机构 * KAIST(韩国科学技术院)

AI总结 提出SpotAttention,一种轻量级选择器,通过KL蒸馏学习估计注意力分布,实现块稀疏路由,在长上下文任务中匹配密集注意力精度并显著加速解码。

Comments 24 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏