arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1472
2512.01559 2026-01-30 cs.SD

LLM2Fx-Tools: Tool Calling For Music Post-Production

LLM2Fx-Tools: 音乐后期制作中的工具调用

Seungheon Doh, Junghyun Koo, Marco A. Martínez-Ramírez, Woosung Choi, Wei-Hsiang Liao, Qiyu Wu, Juhan Nam, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

AI总结 LLM2Fx-Tools通过LLM实现音频效果模块的工具调用,生成可执行的音频效果序列,提升音乐后期制作的可解释性和可控性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20802 2026-01-30 eess.AS cs.SD

SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS

SPADE:结构剪枝与自适应知识蒸馏用于高效的LLM-TTS

Tan Dat Nguyen, Jaehun Kim, Ji-Hoon Kim, Shukjae Choi, Youshin Lim, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) dot Inc.(42dot公司)

AI总结 SPADE通过结构剪枝和自适应知识蒸馏,实现高效LLM-TTS模型,减半Transformer深度并提升实时生成速度,同时保持高质量语音输出。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13318 2026-01-30 cs.LG

Federated Learning for Heterogeneous Electronic Health Record Systems with Cost Effective Participant Selection

联邦学习在异构电子健康记录系统中的应用:具有成本有效的参与者选择

Jiyoun Kim, Junu Kim, Kyunghoon Hur, Edward Choi

机构 * KAIST(韩国科学技术院) Graduate School of AI(人工智能研究生院)

AI总结 本文提出EHRFL框架,通过文本基于的EHR建模和差分隐私的参与者选择策略,在预算内构建机构特定的预测模型,提高异构EHR系统的兼容性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20323 2026-01-29 cs.AI

ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue

ECG-Agent: 用于ECG多轮对话的设备端工具调用代理

Hyunseung Chung, Jungwoo Oh, Daeun Kyung, Jiho Kim, Yeonsu Kwon, Min-Gyu Kim, Edward Choi

机构 * KAIST(韩国科学技术院) Ajou University School of Medicine(全州大学医学院)

AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。

Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18800 2026-01-29 cs.LG cs.CV

NavFormer: IGRF Forecasting in Moving Coordinate Frames

NavFormer:在移动坐标系中进行IGRF预测

Yoontae Hwang, Dongwoo Lee, Minseok Choi, Heechan Park, Yong Sup Ihn, Daham Kim, Deok-Young Lee

机构 * Pusan National University, Busan, Republic of Korea(釜山国立大学) OAQ Co. Ltd., Republic of Korea(OAQ公司) Arrakis Technologies Corp., USA(Arrakis技术公司) Korea Advanced Institute of Science and Technology, Daejeon, Republic of Korea(韩国高级科学研究院)

AI总结 NavFormer通过旋转不变的标量特征和规范化的SPD模块,在移动坐标系中实现IGRF预测,实验表明其在多种训练条件下均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17641 2026-01-29 cs.CL cs.AI cs.LG cs.SD

AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?

AuditoryBench++: 语言模型能否在不听觉的情况下理解听觉知识?

Hyunjong Ok, Suho Yoo, Hyeonjun Kim, Jaeho Lee

机构 * Pohang University of Science and Technology(坡山科学技术大学) HJ AILAB Korea Advanced Institute of Science and Technology(韩国高级科学技术研究院)

AI总结 AuditoryBench++通过AIR-CoT方法提升语言模型在听觉知识推理中的表现。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00344 2026-01-29 cs.RO

Legged Robot State Estimation Using Invariant Neural-Augmented Kalman Filter with a Neural Compensator

使用具有神经补偿器的不变神经增强卡尔曼滤波器进行四足机器人状态估计

Seokju Lee, Hyun-Bin Kim, Kyung-Soo Kim

机构 * Mechatronics, Systems and Control Lab (MSC Lab)(机电系统与控制实验室) Department of Mechanical Engineering(机械工程系) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出了一种结合神经网络与卡尔曼滤波的不变方法,用于提升四足机器人状态估计的精度与鲁棒性。

Comments 8 pages, 10 figures, Accepted to IROS 2025

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19151 2026-01-28 cs.AI cs.MA

TS-Debate: Multimodal Collaborative Debate for Zero-Shot Time Series Reasoning

TS-Debate:多模态协作辩论用于零样本时间序列推理

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST Seoul(韩国科学技术院)

AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。

Comments Code will be available at https://github.com/DeepAuto-AI/TS-Debate

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09396 2026-01-27 cs.CV

Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA

过多的帧,但并非都有用:长视频问答的高效策略

Jongwoo Park, Kanchana Ranasinghe, Kumara Kahatapitiya, Wonjeong Ryu, Donghyun Kim, Michael S. Ryoo

机构 * Stony Brook University(石溪大学) KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

AI总结 LVNet通过高效的关键帧选择器提升长视频问答效率,实现四个基准数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17735 2026-01-27 cs.AI

ReFuGe: Feature Generation for Prediction Tasks on Relational Databases with LLM Agents

ReFuGe:基于LLM代理的关联数据库预测任务特征生成

Kyungho Kim, Geon Lee, Juyeon Kim, Dongwon Choi, Shinhwan Kang, Kijung Shin

机构 * KAIST(韩国科学技术院)

AI总结 ReFuGe通过LLM代理生成关联数据库预测任务的特征,提升预测性能。

Comments Accepted in ACM WWW 2026 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12285 2026-01-27 eess.AS cs.CL

How Far Do SSL Speech Models Listen for Tone? Temporal Focus of Tone Representation under Low-resource Transfer

SSL语音模型在语调感知方面能听多远?在低资源转移条件下语调表示的时序聚焦

Minu Kim, Ji Sub Um, Hoirin Kim

机构 * School of Electrical Engineering, KAIST, Daejeon, Republic of Korea(韩国科学技术院电子工程学院)

AI总结 本研究探讨SSL语音模型在低资源条件下对不同语言语调的感知范围及转移机制,发现下游任务影响语调表示的时序聚焦。

Comments 5 pages, 7 figures, accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03380 2026-01-27 cs.CL cs.AI

Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning

面向推理导向强化学习的在线难度过滤

Sanghwan Bae, Jiwoo Hong, Min Young Lee, Hanbyul Kim, JeongYeon Nam, Donghyun Kwak

机构 * NAVER Cloud(NAVER云) KAIST AI(韩国科学技术院人工智能研究所) TwelveLabs

AI总结 本研究提出一种面向推理导向强化学习的在线难度过滤方法,通过理论分析和实验验证,证明平衡过滤能提升学习效率和样本效率。

Comments To appear in EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05889 2026-01-26 cs.LG astro-ph.CO physics.comp-ph

GlueNN: gluing patchwise analytic solutions with neural networks

GlueNN: 通过神经网络拼接局部解析解

Doyoung Kim, Donghee Lee, Hye-Sung Lee, Jiheon Lee, Jaeok Yi

机构 * Department of Physics, Korea Advanced Institute of Science and Technology(物理系,韩国科学技术院)

AI总结 GlueNN通过学习可解释的系数函数,实现复杂物理系统中不同区域的精确过渡和物理信息的提取。

Comments Additional Example Included

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13680 2026-01-26 cs.CL cs.LG

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

VMMU:一个多任务多模态理解和推理基准

Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

机构 * KAIST(韩国科学技术院) MBZUAI(慕布扎伊大学)

AI总结 VMMU是一个评估视觉语言模型在非英语环境下多模态理解和推理能力的基准,通过2500个多模态问题测试模型对视觉和文本信息的整合与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02729 2026-01-26 cs.CL cs.AI cs.IR

Unified Multimodal Interleaved Document Representation for Retrieval

统一多模态交错文档表示用于检索

Jaewoo Lee, Joonho Ko, Jinheon Baek, Soyeong Jeong, Sung Ju Hwang

机构 * University of North Carolina Chapel Hill(北卡罗来纳大学教堂山分校) KAIST(韩国科学技术院) DeepAuto

AI总结 本文提出统一多模态交错文档表示方法,通过整合文本、图像和表格信息提升信息检索性能。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15872 2026-01-23 cs.SD cs.CV cs.LG cs.MM eess.AS

PF-D2M: A Pose-free Diffusion Model for Universal Dance-to-Music Generation

PF-D2M:一种无姿态扩散模型用于通用舞蹈-音乐生成

Jaekwon Im, Natalia Polouliakh, Taketo Akama

机构 * Graduate School of Culture Technology, KAIST, South Korea(韩国科学技术院文化科技研究生院) Sony Computer Science Laboratories, Tokyo, Japan(东京索尼计算机科学实验室)

AI总结 PF-D2M通过结合视觉特征和渐进训练策略,实现了通用舞蹈-音乐生成,提升了多舞者和非人类舞者场景下的同步性和音乐质量。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14255 2026-01-21 cs.CV cs.AI

VideoMaMa: Mask-Guided Video Matting via Generative Prior

VideoMaMa: 通过生成先验进行掩码引导的视频磨皮

Sangbeom Lim, Seoung Wug Oh, Jiahui Huang, Heeji Yoon, Seungryong Kim, Joon-Young Lee

机构 * Korea University(韩国大学) Adobe Research(Adobe研究) KAIST AI(韩国科学技术院人工智能)

AI总结 VideoMaMa通过生成先验和分割提示,实现从粗糙掩码到精确磨皮的转换,并构建大规模伪标签数据集提升视频磨皮研究

Comments Project page: https://cvlab-kaist.github.io/VideoMaMa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13657 2026-01-21 cs.RO cs.AI cs.LG cs.MA

Communication-Free Collective Navigation for a Swarm of UAVs via LiDAR-Based Deep Reinforcement Learning

基于激光雷达的深度强化学习实现无人机群通信自由的集体导航

Myong-Yol Choi, Hankyoul Ko, Hanse Cho, Changseung Kim, Seunghwan Kim, Jaemin Seo, Hyondong Oh

机构 * Department of Mechanical Engineering, Ulsan National Institute of Science and Technology(机械工程系,釜山国立科学技术研究院) Department of Mechanical Engineering, Korea Advanced Institute of Science and Technology(机械工程系,韩国科学技术院)

AI总结 本文提出一种基于激光雷达的深度强化学习方法,使无人机群在无通信和无外部定位的情况下实现稳健的集体导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03648 2026-01-21 cs.CL

ELO: Efficient Layer-Specific Optimization for Continual Pretraining of Multilingual LLMs

ELO:面向多语言大语言模型持续预训练的高效分层优化

HanGyeol Yoo, ChangSu Choi, Minjun Kim, Seohyun Song, SeungWoo Song, Inho Won, Jongyoul Park, Cheoneum Park, KyungTae Lim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) LG CNS Korea Advanced Institute of Science and Technology(韩国科学技术院) Hanbat National University(汉 bat 国立大学)

AI总结 ELO通过分层优化提升多语言大模型持续预训练效率,实现6.46倍加速和6.2%性能提升。

Comments 12 pages, Accepted to EACL 2026 (Industrial Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13143 2026-01-21 cs.LG

FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference

FastAV: 面向音频视觉大语言模型推理的高效令牌修剪

Chaeyoung Jung, Youngjoon Jang, Seungwoo Lee, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 FastAV通过两阶段令牌修剪策略,针对音频视觉大语言模型实现高效推理,减少FLOPs超过40%并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12802 2026-01-21 cs.SD eess.AS

UNMIXX: Untangling Highly Correlated Singing Voices Mixtures

UNMIXX:解构高度相关歌唱声混合物

Jihoo Jung, Ji-Hoon Kim, Doyeop Kwak, Junwon Lee, Juhan Nam, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 UNMIXX通过音乐导向的混合策略、跨源注意力和幅度惩罚损失,有效解决高度相关歌唱声混合分离难题,提升分离性能达2.2dB。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21092 2026-01-21 cs.CL cs.AI

BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge

BLUCK:一种用于孟加拉语语言理解和文化知识的基准数据集

Daeen Kabir, Minhajur Rahman Chowdhury Mahim, Sheikh Shafayat, Adnan Sadik, Arian Ahmed, Eunsu Kim, Alice Oh

机构 * KAIST(韩国科学技术院)

AI总结 BLUCK是一个用于评估大型语言模型在孟加拉语语言理解和文化知识方面性能的基准数据集,包含2366个多选题,涵盖23个类别,揭示了孟加拉语作为中等资源语言的地位。

Comments Accepted at BLP Workshop, IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11585 2026-01-21 cs.CL

Entropic Context Shaping: Information-Theoretic Filtering for Context-Aware LLM Agents

熵 context 形状:基于信息论的 context-aware LLM agent 的过滤方法

Hyunjun Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出熵 context 形状方法,通过信息论衡量 context 的语用效用,优于词汇相似性方法,在多轮 context 选择任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07222 2026-01-21 cs.LG cs.NA math.DS math.NA

Efficient Parametric SVD of Koopman Operator for Stochastic Dynamical Systems

高效参数化Koopman算子的SVD用于随机动力系统

Minchan Jeong, J. Jon Ryu, Se-Young Yun, Gregory W. Wornell

机构 * Kim Jaechul Graduate School of AI, KAIST, Daejeon 34141, South Korea(韩国科学技术院人工智能研究生院) Department of EECS, MIT, Cambridge, MA 02139, United States(麻省理工学院电子工程与计算机科学系)

AI总结 本文提出了一种基于低秩近似的高效方法,用于学习随机动力系统Koopman算子的前k个奇异函数,以提高大规模系统的可扩展性和稳定性。

Comments Accepted for NeurIPS 2025. The first two authors contributed equally. 30 pages, 5 figures, 4 tables. Code is available at https://github.com/MinchanJeong/NeuralKoopmanSVD

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11143 2026-01-19 cs.RO cs.AI

Learning Quadrupedal Locomotion for a Heavy Hydraulic Robot Using an Actuator Model

为重载液压机器人学习四足运动的致动器模型

Minho Lee, Hyeonseok Kim, Jin Tak Kim, Sangshin Park, Jeong Hyun Lee, Jungsan Cho, Jemin Hwangbo

机构 * Robotics and Artificial Intelligence Lab, KAIST(机器人与人工智能实验室,韩国科学技术院) Robotics Team, HYUNDAI Rotem(HYUNDAI Rotem机器人团队) Hydraulic Robot Laboratory, Human-Centric Robotics R&D Department, Korea Institue of Industrial Technology(液压机器人实验室,人本机器人研发部门,韩国工业技术研究院)

AI总结 本研究提出了一种基于液压动力学的分析致动器模型,用于重载液压四足机器人在RL中的运动控制,实现了稳定的sim-to-real转移。

Comments 9 pages, Accepted to IEEE Robotics and Automation Letters (RA-L) 2025

Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 12, December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15337 2026-01-19 stat.ML cs.LG math.ST stat.TH

Transfer Learning for Benign Overfitting in High-Dimensional Linear Regression

迁移学习在高维线性回归中良性过拟合的应用

Yeichan Kim, Ilmun Kim, Seyoung Park

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院)

AI总结 本文提出了一种两步转移MNI方法,通过分析其非渐近性超额风险,揭示了在特定条件下利用异质数据可提升高维线性回归的泛化能力。

Comments 42 pages; Camera-ready version accepted at NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00070 2026-01-19 cs.RO cs.AI

Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics

Robot-R1: 通过强化学习提升机器人中的具身推理

Dongyoung Kim, Sumin Park, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学) UC Berkeley(加州大学伯克利分校) RLWRLD

AI总结 Robot-R1通过强化学习提升机器人中的具身推理,优于SFT方法并超越GPT-4o在低级动作控制推理任务中

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10200 2026-01-16 cs.CV

ELITE: Efficient Gaussian Head Avatar from a Monocular Video via Learned Initialization and TEst-time Generative Adaptation

ELITE: 通过学习初始化和测试时生成适应从单目视频高效生成高斯头人偶

Kim Youwang, Lee Hyoseok, Subin Park, Gerard Pons-Moll, Tae-Hyun Oh

机构 * Dept. of Electrical Engineering, POSTECH(POSTECH电子工程系) School of Computing, KAIST(韩国科学技术院计算机学院) UNIST(全南大学) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

AI总结 ELITE通过学习初始化和测试时生成适应,高效生成高斯头人偶,实现高保真和强野外泛化,合成速度比2D方法快60倍。

Comments Project page: https://kim-youwang.github.io/elite

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04001 2026-01-15 cs.LG cs.AI cs.NA math.NA

FastLRNR and Sparse Physics Informed Backpropagation

快速低秩神经表示与稀疏物理信息反向传播

Woojin Cho, Kookjin Lee, Noseong Park, Donsub Rim, Gerrit Welper

机构 * Telepix Department of Computer Science, Arizona State University(亚利桑那州立大学计算机科学系) School of Computing, Korea Advanced Institute of Science and Technology(韩国科学技术院计算机科学学院) Department of Mathematics, Washington University in St. Louis(圣路易斯华盛顿大学数学系) Department of Mathematics, University of Central Florida(中央佛罗里达大学数学系)

AI总结 SPInProp通过构建更小的FastLRNR网络,加速了低秩神经表示架构的反向传播,从而提高了物理信息神经网络求解参数化偏微分方程的效率。

Comments 10 pages, 3 figures

Journal ref Results Appl Math 25, 100547 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07530 2026-01-15 cs.CV

Universal Few-Shot Spatial Control for Diffusion Models

通用少样本空间控制用于扩散模型

Kiet T. Nguyen, Chanhyuk Lee, Donggyun Kim, Dong Hoon Lee, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

AI总结 UFC通过通用少样本控制适配器实现对扩散模型的通用空间控制,能够在少量示例下实现与全监督基线相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏