arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1464
2606.07673 2026-06-09 cs.SD cs.AI cs.LG 新提交

A Hierarchical Feature Engineering Framework for Automated Classification of Phonotraumatic and Non-Phonotraumatic Vocal Hyperfunction

声带创伤性与非声带创伤性声音亢进的自动分类的分层特征工程框架

June-Woo Kim, Kangwook Jang, Minu Kim, Hyunju Lee

机构 * Department of Electronic Engineering, Wonkwang University(圆光大学电子工程系) AI Convergence Research Institute, Wonkwang University(圆光大学人工智能融合研究院) GIST InnoCORE AI-Nano Convergence Institute for Early Detection of Neurodegenerative Diseases, Gwangju Institute of Science and Technology(光州科学技术院GIST InnoCORE AI-Nano神经退行性疾病早期检测融合研究所) School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院) Department of AI Convergence, Gwangju Institute of Science and Technology(光州科学技术院人工智能融合系)

AI总结 提出分层特征工程框架,包括静态、动态、比率和耦合特征,用于区分声带创伤性和非声带创伤性声音亢进,发现耦合特征对两类分类均关键,PVH AUC 0.891,NPVH AUC 0.728。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07617 2026-06-09 cs.LG cs.AI 新提交

Query Lens: Interpreting Sparse Key-Value Features with Indirect Effects

Query Lens: 通过间接效应解释稀疏键值特征

Hwiyeong Lee, Ingyu Bang, Uiji Hwang, Hyelim Lim, Taeuk Kim

机构 * KAIST(韩国科学技术院)

AI总结 提出Query Lens方法,通过考虑编码器侧键特征和解码器侧值特征以及下游模块的间接效应,实现对稀疏自编码器特征更全面、忠实的解释。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05816 2026-06-09 cs.CV cs.AI 版本更新

Emotion-Aware Image Generation from Korean Diary Text via LLM-based Prompt Translation and LoRA Fine-Tuning

基于LLM提示翻译和LoRA微调的韩语日记文本情感感知图像生成

Jihun Cho, Soo-Yeon Jeong, Sun-Young Ihm

机构 * KAIST(韩国科学技术院)

AI总结 提出一种情感感知文本到图像流水线,利用Qwen3-8B识别短日记中的隐含情感,并通过LoRA微调Stable Diffusion 3.5 Medium生成儿童手绘风格图像,同时探讨情感触发词的影响及CLIP Score作为评估指标的局限性。

Comments 4 pages, 4 figures, 2 tables, MITA 2026

Journal ref Proc. Int. Conf. Multimedia, Information Technology and its Applications (MITA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28207 2026-06-09 cs.CL cs.AI cs.LG 版本更新

Pruning and Distilling Mixture-of-Experts into Dense Language Models

将混合专家模型剪枝和蒸馏为密集语言模型

Junhyuck Kim, Jihun Yun, Haechan Kim, Gyeongman Kim, Joonghyun Bae, Jaewoong Cho

机构 * KRAFTON KAIST(韩国科学技术院)

AI总结 提出首个将混合专家(MoE)模型转换为标准密集架构的系统框架,通过专家评分、选择、分组、拼接和知识蒸馏,在参数匹配条件下比密集到密集剪枝平均下游准确率提升6.3个百分点,训练速度提升1.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18840 2026-06-09 cs.LG cs.SY eess.SY 版本更新

Bellman Residual Minimization for Control: Geometry, Stationarity, and Convergence

贝尔曼残差最小化用于控制:几何、站定性与收敛

Donghwan Lee, Hyukjun Yang

机构 * School of Electrical Engineering(电气工程学院) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文研究了控制中贝尔曼残差最小化方法的几何特性、站定性及收敛性,探讨其在策略优化中的基础理论与应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06210 2026-06-09 cs.CL cs.AI cs.CY cs.LG 版本更新

Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook

基于价值码本的LLM文化价值对齐的分布式开放式评估

Jaehyeok Lee, Xiaoyuan Yi, Jing Yao, Hyunjin Hwang, Roy Ka-Wei Lee, Xing Xie, JinYeong Bak

机构 * KAIST(韩国科学技术院)

AI总结 提出DOVE框架,通过率失真变分优化构建价值码本,利用不平衡最优传输度量分布对齐,解决LLM文化价值评估中的构造-组成-上下文挑战。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11669 2026-06-09 eess.AS cs.SD 版本更新

SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns

SEMamba++:一种利用全局、局部和周期性频谱模式的通用语音修复框架

Yongjoon Lee, Jung-Woo Choi

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出SEMamba++框架,通过整合全局、局部和周期性频谱特征,提升语音修复性能,同时保持计算效率。

Comments Accepted to Interspeech 2026 Long paper track. Project page: https://sites.google.com/view/semambapp

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02003 2026-06-09 cs.LG cond-mat.dis-nn hep-ph 版本更新

Bulk-boundary decomposition of neural networks

神经网络的体-边界分解

Donghee Lee, Hye-Sung Lee, Jaeok Yi

机构 * Department of Physics, Korea Advanced Institute of Science and Technology(物理系,韩国科学技术院)

AI总结 提出体-边界分解框架,将神经网络训练动力学分解为数据无关的体项和数据相关的边界项,揭示深层网络的局部齐次结构并推导能量连续性方程。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00977 2026-06-09 cs.CL 版本更新

Chinese Grammatical Error Correction: A Survey

中文语法纠错:综述

Mengyang Qiu, Qingyu Gao, Linxuan Yang, Yang Gu, Tran Minh Nguyen, Zihao Huang, Jungyeul Park

机构 * KAIST(韩国科学技术院)

AI总结 本文综述中文语法纠错(CGEC)研究,涵盖数据集、标注方案、评估方法和系统进展,指出关键挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06813 2026-06-08 cs.CV cs.AI 新提交

Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation

打破锁定:通过表示调制实现文本到图像生成的多样化

Dahee Kwon, Haeun Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院)

AI总结 针对文本到图像模型在固定提示下生成样本过于相似的问题,提出无训练表示级干预方法DAVE,通过选择性衰减早期生成中的零频空间平均分量来增强多样性,保持图像质量且计算开销极小。

Comments Accepted to ICML 2026. Code is available at: https://github.com/daheekwon/DAVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24935 2026-06-08 cs.CV cs.AI cs.LG 版本更新

Scalable GANs with Transformers

可扩展的Transformer生成对抗网络

Sangeek Hyun, MinKyu Lee, Jae-Pil Heo

机构 * KAIST(韩国科学技术院)

AI总结 本文通过紧凑变分自编码器潜在空间和纯Transformer架构,研究了生成对抗网络的可扩展性,并提出了轻量级中间监督和宽度自适应学习率调整来解决缩放时的失败模式,在ImageNet-256上以40个epoch达到2.96的FID。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06351 2026-06-05 stat.ML cs.LG

Function-Space Priors for Bayesian Neural ODEs with Application to Vessel Trajectory Prediction

贝叶斯神经常微分方程的函数空间先验及其在船舶轨迹预测中的应用

Jaeyeong Lee, Wonmo Koo, Heeyoung Kim

机构 * Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology (KAIST)(工业与系统工程系,韩国科学技术院(KAIST))

AI总结 针对船舶轨迹预测中不规则采样、缺失报告和复杂动力学挑战,提出一种在向量场上施加高斯过程核先验的正则化方法,并结合概率多重打靶实现长序列的不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06311 2026-06-05 cs.AI

AIS-Based Vessel Trajectory Prediction Using Memory-Augmented Neural Networks

基于记忆增强神经网络的AIS船舶轨迹预测

Wonmo Koo, Sanha Chang, Heeyoung Kim

机构 * Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology (KAIST)(工业与系统工程系,韩国科学技术院)

AI总结 本文提出使用记忆增强神经网络,基于AIS数据预测船舶轨迹,在墨西哥湾和纽约湾数据集上显著优于无外部记忆的深度学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06218 2026-06-05 cs.RO cs.AI

TAM: Torque Adaptation Module for Robust Motion Transfer in Manipulation

TAM: 用于鲁棒操作运动传递的扭矩自适应模块

Dongwon Son, Florian Shkurti, Jason Lee, Naman Shah, Beomjoon Kim, Dieter Fox

机构 * KAIST(韩国科学技术院) Allen Institute for AI(人工智能研究院) University of Toronto(多伦多大学) University of Washington(华盛顿大学)

AI总结 提出扭矩自适应模块(TAM),通过历史编码器和扭矩适配器修正扭矩指令,实现不同机器人或负载间的运动传递,无需领域随机化或重新收集数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05998 2026-06-05 cs.CV cs.AI

Deep Learning-based 3D Oral Cavity Reconstruction Using 2D Intraoral Images

基于深度学习的二维口内图像三维口腔重建

Jihun Cho, Soo-Yeon Jeong, Eun-Jeong Bae, Sun-Young Ihm

机构 * KAIST(韩国科学技术院)

AI总结 提出一种仅用十张二维口内图像进行三维口腔重建的软件方法,采用MobileNetV2与多头注意力机制,降低成本和不适,实现自动化重建。

Comments 4 pages, 5 figures. English version of a paper presented at the Korea Multimedia Society Conference, November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05743 2026-06-05 cs.CR cs.CL

Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense

Membrane: 一种用于LLM智能体防御的自演化对比安全记忆

Minseok Choi, Seungbin Yang, Dongjin Kim, Subin Kim, Jungmin Son, Yunseung Lee, Jaegul Choo, Youngjun Kwak

机构 * KAIST AI(韩国科学技术院人工智能实验室) Financial Tech Lab, KakaoBank Corp(Kakao银行金融科技实验室)

AI总结 提出Membrane,一种基于对比安全记忆(CSM)的自演化护栏,通过将有害交互及其良性对应物蒸馏为对比单元来防御不断演化的越狱攻击,无需重新训练即可实现高F1和低良性拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05179 2026-06-05 cs.CL

Efficient Punctuation Restoration via Weighted Lookahead Scoring Method for Streaming ASR Systems

流式ASR系统中基于加权前瞻评分的高效标点恢复方法

Sungmook Woo, Hyungu Kang, Chanwoo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 提出一种非自回归的加权前瞻评分方法,通过比较标点插入假设与无插入基线,在有限未来上下文中实现流式ASR的高效标点恢复,无需微调即可达到高F1分数。

Comments Accepted for presentation at The International Joint Conference on Neural Networks (IJCNN) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08215 2026-06-05 cs.CV cs.LG cs.RO

Test-Time Training for Visual Foresight Vision-Language-Action Models

测试时训练用于视觉前瞻视觉-语言-动作模型

Sangwu Park, Wonjoong Kim, Yeonjun In, Sein Kim, Hongseok Kang, Chanyoung Park

机构 * KAIST(韩国科学技术院)

AI总结 本文提出了一种测试时训练方法,用于增强视觉前瞻视觉-语言-动作模型在面对分布外数据时的鲁棒性,通过引入适应性更新过滤机制来减少测试时更新带来的实际挑战。

Comments Accepted at ICML 2026 Workshop on Continual Adaptation at Scale (CATS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21700 2026-06-05 cs.CL cs.AI cs.IR cs.MA cs.SI

Toward Culturally Aligned LLMs through Ontology-Guided Multi-Agent Reasoning

通过本体引导的多智能体推理实现文化对齐的大型语言模型

Wonduk Seo, Wonseok Choi, Junseo Koh, Juhyeon Lee, Hyunjin An, Minhyeong Yu, Jian Park, Qingshan Zhou, Seunghyun Lee, Yi Bu

机构 * KAIST(韩国科学技术院)

AI总结 本文提出OG-MAR框架,通过本体引导的多智能体推理方法,提高大型语言模型在文化对齐和鲁棒性方面的性能,并生成更透明的推理轨迹。

Comments Accepted by ICML 2026 Regular Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26236 2026-06-05 cs.RO

PHUMA: Physically Reliable Humanoid Locomotion Dataset

PHUMA:物理可靠的仿人运动数据集

Kyungmin Lee, Sibeen Kim, Youngdo Lee, Minho Park, Hyunseung Kim, Dongyoon Hwang, Donghu Kim, Hojoon Lee, Jaegul Choo

机构 * KAIST(韩国科学技术院)

AI总结 本文提出PHUMA数据集,通过结合物理感知的筛选和物理约束的重定向,整合动作捕捉和网络视频,生成物理可靠的仿人运动数据,提升仿人运动的稳定性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05162 2026-06-04 cs.CV

Controllable Dynamic 3D Shape Generation via 3D Trajectories and Text

基于3D轨迹和文本的可控动态3D形状生成

Jaeyeong Kim, Ines Kim, Jahyeok Koo, Seungryong Kim

机构 * KAIST AI Project(韩国科学技术院人工智能项目)

AI总结 提出T2Mo前馈框架,通过3D轨迹和文本条件生成可控动态3D形状,采用形状接地轨迹嵌入处理任意配置轨迹,实现空间精确跟随与全局语义一致。

Comments Project page: https://cvlab-kaist.github.io/T2Mo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04719 2026-06-04 cs.CL

Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

基于查询的跨模态投影器增强Mamba多模态大语言模型

SooHwan Eom, Jay Shim, Gwanhyeong Koo, Haebin Na, Mark A. Hasegawa-Johnson, Sungwoong Kim, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology / Korea, Republic of(韩国科学技术院) University of Illinois in Urbana-Champaign / United States of America(伊利诺伊大学厄巴纳-香槟分校) Korea University / Korea, Republic of(韩国大学)

AI总结 提出基于查询的跨模态投影器,通过交叉注意力压缩视觉令牌,消除手动设计2D扫描顺序的需求,提升Mamba多模态LLM的性能和吞吐量。

Comments Accepted to EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24698 2026-06-04 cs.RO

Dynamic Policy Learning for Legged Robot with Simplified Model Pretraining and Model-Homotopy-Inspired Transfer

基于简化模型预训练与模型同伦启发迁移的足式机器人动态策略学习

Dongyun Kang, Min-Gyu Kim, Tae-Gyu Song, Hajun Kim, Sehoon Ha, Hae-Won Park

机构 * Department of Mechanical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(机械工程系,韩国科学技术院(KAIST)) School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院)

AI总结 提出一种延续学习框架,结合简化模型预训练和模型同伦启发迁移,高效生成和优化足式机器人的复杂动态行为,并在真实四足机器人上验证了翻转和墙面辅助等动态任务。

Comments 8 pages

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8068-8075, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08094 2026-06-04 cs.CL

Segment, Embed, and Align: A Universal Recipe for Aligning Subtitles to Signing

分割、嵌入和对齐:将字幕与手语对齐的通用方法

Zifan Jiang, Youngjoon Jang, Liliane Momeni, Gül Varol, Sarah Ebling, Andrew Zisserman

机构 * VGG, Dept. of Engineering Science, University of Oxford(视觉感知与计算实验室,工程科学系,牛津大学) University of Zurich(苏黎世大学) KAIST(韩国科学技术院) LIGM, CNRS, Univ Gustave Eiffel, ENPC, IP Paris(LIGM,国家科学研究中心,古斯塔夫·埃菲尔大学,巴黎理工大学,IP巴黎)

AI总结 提出一种通用框架SEA,利用预训练模型分割视频帧序列为单个手势、嵌入手势片段到与文本共享的潜在空间,并通过轻量动态规划实现高效对齐,在多个手语数据集上达到最先进性能。

Comments Camera-ready version of ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17956 2026-06-04 cs.CL

Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environments

在跨语言和多语言环境中更好地理解程序思维推理

Patomporn Payoungkhamdee, Pume Tuchinda, Jinheon Baek, Samuel Cahyawijaya, Can Udomcharoenchaikit, Potsawee Manakul, Peerat Limkonchotiwat, Ekapol Chuangsuwanich, Sarana Nutanong

机构 * School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC) KAIST(韩国科学技术院) Cohere SCB 10X AI Singapore(AI新加坡) Department of Computer Engineering, Chulalongkorn University(朱拉隆梭大学计算机工程系)

AI总结 通过分离推理与代码执行,提出评估程序思维提示的框架,发现微调显著提升多语言推理能力,且推理质量与答案准确性强相关。

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05349 2026-06-04 math.OC cs.LG

Contextual Scenario Generation for Two-Stage Stochastic Programming

两阶段随机规划的情境生成

David Islip, Roy H. Kwon, Sanghyeon Bae, Woo Chang Kim

机构 * Department of Mechanical and Industrial Engineering, University of Toronto(机械与工业工程系,多伦多大学) Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology (KAIST)(工业与系统工程系,韩国科学技术院(KAIST))

AI总结 针对两阶段随机规划中情境数量大、部署受限的问题,提出两种情境生成方法(基于分布和基于任务),通过上下文信息学习生成少量替代情境,并保证决策质量。

Comments 79 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.01214 2026-06-04 cs.LG cs.SY eess.SY math.OC stat.ML

Enhancement of Energy-Based Swing-Up Controller via Entropy Search

通过熵搜索增强基于能量的摆动上控制器

Chang Sik Lee, Dong Eui Chang

机构 * School of Electrical Engineering, KAIST, Daejeon, Korea.(韩国成均馆大学电气工程学院)

AI总结 本文利用熵搜索进行贝叶斯优化,改进基于能量的控制器,以实现旋转倒立摆(Furuta摆)的摆动控制,实验表明该控制器在各种初始条件下性能优于常规控制器。

Comments 6 pages, 2019 Asian Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02642 2026-06-03 eess.AS cs.AI cs.CV cs.LG cs.MM cs.SD

SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

SVHalluc: 音频-视觉大语言模型中的语音-视觉幻觉基准测试

Chenshuang Zhang, Kyeong Seon Kim, Chengxin Liu, Tae-Hyun Oh

机构 * KAIST(韩国国立信息通信研究院)

AI总结 针对音频-视觉大语言模型中的语音-视觉幻觉问题,提出SVHalluc基准,从语义和时间两个维度评估模型将语音内容与视觉信号对齐的能力,发现现有模型存在跨模态理解局限。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02645 2026-06-03 stat.ML cs.AI cs.LG

Target Updates May Stabilize Linear Q-Learning: Periodic and Soft Dynamics

目标更新可能稳定线性Q学习:周期性和软动态

Donghwan Lee

机构 * School of Electrical Engineering, KAIST(韩国成均馆大学电气工程学院)

AI总结 本文通过精确的切换线性系统动力学和联合谱半径分析,证明了在特定谱和步长条件下,周期性硬目标更新和软目标更新可以保证线性Q学习收敛到精确的投影Q-Bellman解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03920 2026-06-03 cs.CV

Benchmarking Visual State Tracking in Multimodal Video Understanding

多模态视频理解中的视觉状态追踪基准测试

Sihyun Yu, Nanye Ma, Pinzhi Huang, Hyunseok Lee, Shusheng Yang, June Suk Choi, Ellis Brown, Oscar Michel, Boyang Zheng, Jinwoo Shin, Saining Xie

机构 * New York University(纽约大学) KAIST(韩国科学技术院)

AI总结 提出VSTAT基准,通过需要连续感知和整合整个视频流的问题评估多模态大语言模型的视觉状态追踪能力,发现当前模型远低于人类表现,失败主要源于视觉感知而非文本推理。

Comments Website: https://vision-x-nyu.github.io/vstat-site/

详情

展开后加载摘要…

URL PDF HTML 收藏