IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
IWP:大型视觉语言模型中的隐式权重剪枝与令牌剪枝
机构 * KAIST(韩国科学技术院)
AI总结 提出基于注意力对偶形式的无训练令牌剪枝框架,通过度量令牌的信息量和冗余度,结合渐进式分块最大边际相关性选择子集,在保持性能的同时提升效率。
高校专区
IWP:大型视觉语言模型中的隐式权重剪枝与令牌剪枝
机构 * KAIST(韩国科学技术院)
AI总结 提出基于注意力对偶形式的无训练令牌剪枝框架,通过度量令牌的信息量和冗余度,结合渐进式分块最大边际相关性选择子集,在保持性能的同时提升效率。
VLM引导的视觉地点识别用于行星级地理定位
机构 * Univ. of Southampton, UK(英国南安普顿大学) ; KAIST, South Korea(韩国科学技术院) ; QUT, Australia(昆士兰科技大学) ; Univ. of Essex, UK(英国埃塞克斯大学)
AI总结 提出VLM与检索式VPR结合的混合框架,利用VLM生成先验约束搜索空间,再通过检索和重排序实现行星级地理定位,在街道和城市级别分别提升4.51%和13.52%。
Journal ref Proceedings of the Australasian Conference on Robotics and Automation (ACRA 2025)
See & Sniff: 学习视觉-嗅觉表征
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Hankuk University of Foreign Studies(韩国外国语大学) ; Ulsan National Institute of Science and Technology(蔚山科学技术院)
AI总结 提出SmellNet-V数据集和See & Sniff自监督框架,通过密集局部对齐学习联合视觉-嗅觉表征,实现气味分类、跨模态检索和气味定位,性能提升7%。
Comments ECCV 2026. Project Page: https://mm.kaist.ac.kr/projects/SeeandSniff/
PlanRL: 一种用于基于强化学习的驾驶专家的轨迹规划架构
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; Hyundai Motor Company(现代汽车公司)
AI总结 提出一种将强化学习策略与多项式轨迹规划器结合的轨迹规划架构,通过Frenet坐标系简化道路几何并加入运动学可行性检查,在CARLA基准上驾驶评分提升5%-11%,成功率提升8%-19%。
Comments Accepted at IROS 2026
ProtoKV: 延迟查询下的流式视频理解与摘要状态记忆
机构 * KAIST(韩国科学技术院)
AI总结 提出ProtoKV,一种固定内存的流式视频理解记忆机制,通过摘要状态表示远历史,在长延迟查询下准确率提升高达12.5点。
Comments 20 pages, 4 figures, Accepted to ICML 2026
CascadeFormer: 由梯度扇入不对称性启发的深度锥形Transformer
机构 * KAIST(韩国科学技术院)
AI总结 针对深层Transformer中深层贡献不足的问题,提出CascadeFormer通过锥形宽度匹配信息流,以及CascadeFlow Pruning利用梯度剪枝层,基于梯度扇入不对称性(GFA)理论解释深层贡献少的原因。
Comments 18 pages, 8 figures, 5 tables
误差条件神经求解器
机构 * University of Michigan(密歇根大学) ; KAIST AI(韩国科学技术院人工智能) ; Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)
AI总结 提出误差条件神经求解器(ENS),通过将PDE残差场作为网络输入,学习迭代校正策略,在多个PDE族上实现高精度预测,尤其适用于病态系统。
GenRecal:从大到小视觉语言模型的校准后生成
机构 * NVIDIA ; KAIST(韩国成均馆大学)
AI总结 提出GenRecal通用蒸馏框架,通过校准器对齐异构VLM特征,实现从大到小模型的有效知识迁移,在多个基准上超越大规模开源和闭源VLM。
Comments Project page: https://byungkwanlee.github.io/GenRecal-page/
MVTrack4Gen: 多视角点跟踪作为4D视频生成的几何监督
机构 * KAIST AI(韩国科学技术院人工智能学院) ; Sony AI(索尼人工智能) ; Sony Group Corporation(索尼集团公司)
AI总结 提出MVTrack4Gen框架,利用多视角点跟踪作为几何与运动监督信号,增强仅相机条件的新视角视频扩散模型的运动一致性和几何一致性。
Comments Project Page : https://cvlab-kaist.github.io/MVTrack4Gen/
MacroLens:宏观经济情景下的多任务上下文金融推理基准
机构 * KAIST(韩国科学技术院)
AI总结 针对金融决策中价格、基本面、宏观和文本四信号联合评估的缺失,构建了涵盖4426只美股、七个任务、1130个宏观事件的基准,评估19种方法,揭示上下文特征的重要性。
Comments 25 pages, 3 figures
FFinRED:面向金融大语言模型红队测试的专家引导基准生成与评估框架
机构 * DATUMO INC.(DATUMO公司) ; Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学研究院) ; Financial Security Institute (FSI)(金融安全研究所)
AI总结 提出FinRED框架,通过专家引导的两级分类法将全球金融标准映射为威胁,并利用真实金融文档生成上下文丰富的红队行为提示,结合专家验证的评估标准,有效降低关键假阴性。
视图变换还是不视图变换:基于NeRF的预训练视角
机构 * KAIST(韩国科学技术院)
AI总结 提出NeRP3D检测器,避免视图变换与NeRF的冲突先验,保留预训练NeRF网络,实现连续3D表示学习,在nuScenes上提升场景重建和检测性能。
Comments The Fourteenth International Conference on Learning Representations (ICLR'26)
ReaDy-Go: 面向动态障碍物环境特定视觉导航的实到仿动态3D高斯泼溅仿真
机构 * Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系) ; InnoCORE AI-Transformed Aerospace Research Center, KAIST(韩国科学技术院(KAIST)人工智能赋能航空航天研究中心)
AI总结 提出ReaDy-Go仿真管线,通过将静态3D高斯场景与动态人体高斯障碍物结合生成逼真动态场景,并训练导航策略,有效缩小仿真到现实的差距并处理移动障碍物。
Comments Accepted by IEEE Robotics and Automation Letters (RA-L). Project page: https://syeon-yoo.github.io/ready-go-site/
韩语树库中基于语节的成分结构
机构 * KAIST(韩国国立科学技术院) ; Anyang University(安阳大学)
AI总结 针对韩语成分树库中终端单位选择问题,提出基于语节的成分表示,将形态分割和细粒度词性信息编码在非成分层,支持跨树库比较和成分-依存对齐。
Comments To appear in Korean Linguistics, John Benjamins
通过配对图像域检索和文本域增强提高3D脑MRI报告生成的事实准确性
机构 * Cancer Biology, Seoul National University College of Medicine, Korea(首尔国立大学医学院癌症生物学系,韩国) ; Radiology, Massachusetts General Hospital(麻省总医院放射科) ; Harvard Medical School(哈佛医学院) ; Biomedical Systems Informatics, Yonsei University College of Medicine, Korea(延世大学医学院生物医学系统信息学系,韩国) ; Graduate School, Yonsei University, Korea(延世大学研究生院,韩国) ; Radiology, Seoul National University College of Medicine, Korea(首尔国立大学医学院放射科,韩国) ; Radiology, Seoul National University Hospital, Korea(首尔国立大学医院放射科,韩国) ; Radiology, Seoul National University Bundang Hospital, Korea(首尔国立大学 Bundang 医院放射科,韩国) ; Radiology, SMG-SNU Boramae Medical Center, Korea(SMG-SNU Boramae 医疗中心放射科,韩国) ; Psychiatry, Yonsei University College of Medicine, Korea(延世大学医学院精神病学系,韩国) ; Behavioral Sciences in Medicine, Yonsei University College of Medicine, Korea(延世大学医学院医学行为科学系,韩国) ; Yonsei Institute for Digital Health, Korea(延世大学数字健康研究院,韩国) ; Kim Jaechul Graduate School of AI, KAIST, Korea(金 Jaechul人工智能研究生院,韩国)
AI总结 提出PIRTA框架,通过检索相似3D DWI/ADC图像并利用其配对报告指导LLM生成,避免显式跨模态对齐,显著提高缺血区域准确性。
Comments MICCAI 2026
ParaPairAudioBench: 面向LALM-as-a-Judge的副语言成对音频基准
机构 * Hongik University(弘益大学) ; Seoul National University(首尔大学) ; NAVER Cloud(NAVER云) ; KAIST(韩国科学技术院)
AI总结 提出ParaPairAudioBench,包含5,175对音频,覆盖风格、语速、重音、年龄和性别五个副语言维度,用于评估大型音频语言模型作为评判者的可靠性,发现其与人类判断差距大且校准失败严重。
Comments Accepted to Interspeech 2026
FiCA:基于单张肖像图像的前馈即时高斯编解码器化身
机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) ; Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) ; School of Computing, KAIST(韩国科学技术院计算机学院)
AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。
Comments Project page: https://kim-youwang.github.io/FiCA
SPACE:从跨机器人数据中学习通用策略
机构 * KAIST(韩国科学技术院) ; Config ; Yonsei University(延世大学)
AI总结 提出SPACE框架,通过笛卡尔状态增量作为通用动作表示,结合动作适配器处理机器人动力学差异,实现跨本体和硬件的策略学习,显著优于直接预测控制命令的方法。
Comments Project page: http://haeone.site/space-website
扩散积分梯度:用于灵活特征归因的可控路径生成
机构 * KAIST(韩国科学技术院) ; Ajou University(亚洲大学) ; INEEJI Corp.(INEEJI公司)
AI总结 提出扩散积分梯度(DiffIG),通过扩散模型生成路径并嵌入用户引导,实现灵活可控的特征归因,在定量和定性上优于现有方法。
Comments 44 pages, 22 figures, 10 tables. Accepted to ECCV 2026; includes appendix
几何动作模型用于机器人策略学习
机构 * KAIST AI(韩国科学技术院人工智能学院) ; ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心)
AI总结 提出几何动作模型(GAM),通过重用预训练几何基础模型(GFM)作为共享骨干,实现语言条件下的操作策略,在仿真和真实机器人任务中优于现有方法。
Comments Project page: https://cvlab-kaist.github.io/Geometric-Action-Model/
WAND: 窗口注意力与知识蒸馏用于高效自回归文本到语音模型
机构 * Korea Advanced Institute of Science and Technology, Republic of Korea(韩国科学技术院) ; Sungkyunkwan University, Republic of Korea(成均馆大学)
AI总结 提出WAND框架,通过分离注意力为全局持久注意力和局部滑动窗口注意力,结合课程学习与知识蒸馏,在保持合成质量的同时将AR-TTS模型的计算和内存复杂度降至常数,KV缓存减少66.2%。
Comments Accepted at Interspeech 2026
MSPL: 用于开放词汇目标检测的多步伪标签方法
机构 * KAIST AI(韩国韩世大学AI研究所) ; Boston University(波士顿大学)
AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。
Comments This paper has been accepted by ECCV 2026
基于Transformer的分阶段分解用于大规模多阶段随机优化
机构 * Department of Industrial and Systems Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学工业与系统工程系) ; NCSOFT Corporation, Seongnam, Republic of Korea(韩国水原NCSOFT公司)
AI总结 本文提出TranSDDP算法,利用Transformer结构改进传统SDDP,通过生成分段线性近似函数提升大规模多阶段随机优化问题的求解效率与精度。
Comments Accepted at ICML 2023 (Oral Presentation)
Journal ref Proceedings of the 40th International Conference on Machine Learning, PMLR 202:16747-16770, 2023
ProsoCodec:面向韵律的语音编解码器用于语音转换
机构 * KAIST, South Korea(韩国科学技术院) ; Chung-Ang University, South Korea(Chung-Ang 大学) ; The Chinese University of Hong Kong, China(香港中文大学)
AI总结 提出ProsoCodec,通过将韵律建模为条件残差而非分离流,在语音转换中改善韵律保留并减少源音色泄漏。
Comments Interspeech 2026
无需校准扫描的EPI无监督磁敏感畸变校正:基于图像翻译的配准方法
机构 * Department of Bio and Brain Engineering, Korea Advanced Institute of Science and Technology(生物与脑工程系,韩国科学技术院)
AI总结 提出SACRED框架,利用可逆神经网络进行BOLD与T1w图像翻译,结合无监督配准实现EPI几何畸变校正,无需额外校准扫描,在分布内和分布外数据集上优于现有方法。
基于全局地图与局部视图的多视角3D推理的密集奖励
机构 * Graduate School of Artificial Intelligence, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) ; KRAFTON, Republic of Korea(韩国KRAFTON公司)
AI总结 提出DR-MV3D框架,通过全局一致性奖励和局部轨迹奖励对多视角3D VQA的中间推理过程进行密集监督,提升跨视图推理一致性。
Comments ECCV 2026
MuPPET:多轮对话中LLM助手上下文隐私的基准测试
机构 * Parameter Lab(参数实验室) ; University of Rome Tor Vergata(罗马第二大学) ; University of Oxford(牛津大学) ; NAVER AI Lab(NAVER AI实验室) ; KAIST AI(韩国科学技术院人工智能研究所)
AI总结 提出MuPPET基准,评估多用户对话中LLM代理的隐私泄露风险,发现模型在多用户场景下泄露更严重,现有防御措施效果有限。
T-VSS:面向视觉语言模型对抗鲁棒性的测试时视觉子空间引导
机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院)
AI总结 提出T-VSS方法,通过在视觉特征空间中构建样本特定的低秩子空间并学习共享特征校正,直接适应受攻击特征,提升视觉语言模型的对抗鲁棒性,同时保持清洁准确率和效率。
TaLK: 通过耦合语言模型与图感知核的文本属性图数据集蒸馏
机构 * Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院)
AI总结 提出TaLK方法,通过耦合语言模型与图感知神经切线核实现文本属性图的高效数据集蒸馏,避免重复联合训练,仅用1%合成数据即可达到97%的全数据集性能。
SpotAttention: 面向预训练长上下文Transformer的即插即用块稀疏路由
机构 * KAIST(韩国科学技术院)
AI总结 提出SpotAttention,一种轻量级选择器,通过KL蒸馏学习估计注意力分布,实现块稀疏路由,在长上下文任务中匹配密集注意力精度并显著加速解码。
Comments 24 pages, 10 figures, 9 tables