LLM2Fx-Tools: Tool Calling For Music Post-Production
LLM2Fx-Tools: 音乐后期制作中的工具调用
机构 * KAIST(韩国科学技术院) ; Sony AI(索尼人工智能) ; Sony Group Corporation(索尼集团)
AI总结 LLM2Fx-Tools通过LLM实现音频效果模块的工具调用,生成可执行的音频效果序列,提升音乐后期制作的可解释性和可控性。
Comments ICLR 2026
高校专区
LLM2Fx-Tools: 音乐后期制作中的工具调用
机构 * KAIST(韩国科学技术院) ; Sony AI(索尼人工智能) ; Sony Group Corporation(索尼集团)
AI总结 LLM2Fx-Tools通过LLM实现音频效果模块的工具调用,生成可执行的音频效果序列,提升音乐后期制作的可解释性和可控性。
Comments ICLR 2026
SPADE:结构剪枝与自适应知识蒸馏用于高效的LLM-TTS
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; dot Inc.(42dot公司)
AI总结 SPADE通过结构剪枝和自适应知识蒸馏,实现高效LLM-TTS模型,减半Transformer深度并提升实时生成速度,同时保持高质量语音输出。
Comments ICASSP 2026
联邦学习在异构电子健康记录系统中的应用:具有成本有效的参与者选择
机构 * KAIST(韩国科学技术院) ; Graduate School of AI(人工智能研究生院)
AI总结 本文提出EHRFL框架,通过文本基于的EHR建模和差分隐私的参与者选择策略,在预算内构建机构特定的预测模型,提高异构EHR系统的兼容性和效率。
ECG-Agent: 用于ECG多轮对话的设备端工具调用代理
机构 * KAIST(韩国科学技术院) ; Ajou University School of Medicine(全州大学医学院)
AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。
Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)
NavFormer:在移动坐标系中进行IGRF预测
机构 * Pusan National University, Busan, Republic of Korea(釜山国立大学) ; OAQ Co. Ltd., Republic of Korea(OAQ公司) ; Arrakis Technologies Corp., USA(Arrakis技术公司) ; Korea Advanced Institute of Science and Technology, Daejeon, Republic of Korea(韩国高级科学研究院)
AI总结 NavFormer通过旋转不变的标量特征和规范化的SPD模块,在移动坐标系中实现IGRF预测,实验表明其在多种训练条件下均优于基线方法。
AuditoryBench++: 语言模型能否在不听觉的情况下理解听觉知识?
机构 * Pohang University of Science and Technology(坡山科学技术大学) ; HJ AILAB ; Korea Advanced Institute of Science and Technology(韩国高级科学技术研究院)
AI总结 AuditoryBench++通过AIR-CoT方法提升语言模型在听觉知识推理中的表现。
Comments ICASSP 2026
使用具有神经补偿器的不变神经增强卡尔曼滤波器进行四足机器人状态估计
机构 * Mechatronics, Systems and Control Lab (MSC Lab)(机电系统与控制实验室) ; Department of Mechanical Engineering(机械工程系) ; Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
AI总结 本文提出了一种结合神经网络与卡尔曼滤波的不变方法,用于提升四足机器人状态估计的精度与鲁棒性。
Comments 8 pages, 10 figures, Accepted to IROS 2025
Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
TS-Debate:多模态协作辩论用于零样本时间序列推理
机构 * KAIST Seoul(韩国科学技术院)
AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。
Comments Code will be available at https://github.com/DeepAuto-AI/TS-Debate
过多的帧,但并非都有用:长视频问答的高效策略
机构 * Stony Brook University(石溪大学) ; KAIST AI(韩国科学技术院人工智能研究所) ; Korea University(韩国大学)
AI总结 LVNet通过高效的关键帧选择器提升长视频问答效率,实现四个基准数据集上的最佳性能。
ReFuGe:基于LLM代理的关联数据库预测任务特征生成
机构 * KAIST(韩国科学技术院)
AI总结 ReFuGe通过LLM代理生成关联数据库预测任务的特征,提升预测性能。
Comments Accepted in ACM WWW 2026 (Short Paper)
SSL语音模型在语调感知方面能听多远?在低资源转移条件下语调表示的时序聚焦
机构 * School of Electrical Engineering, KAIST, Daejeon, Republic of Korea(韩国科学技术院电子工程学院)
AI总结 本研究探讨SSL语音模型在低资源条件下对不同语言语调的感知范围及转移机制,发现下游任务影响语调表示的时序聚焦。
Comments 5 pages, 7 figures, accepted to ICASSP 2026
面向推理导向强化学习的在线难度过滤
机构 * NAVER Cloud(NAVER云) ; KAIST AI(韩国科学技术院人工智能研究所) ; TwelveLabs
AI总结 本研究提出一种面向推理导向强化学习的在线难度过滤方法,通过理论分析和实验验证,证明平衡过滤能提升学习效率和样本效率。
Comments To appear in EACL 2026 (main conference)
GlueNN: 通过神经网络拼接局部解析解
机构 * Department of Physics, Korea Advanced Institute of Science and Technology(物理系,韩国科学技术院)
AI总结 GlueNN通过学习可解释的系数函数,实现复杂物理系统中不同区域的精确过渡和物理信息的提取。
Comments Additional Example Included
VMMU:一个多任务多模态理解和推理基准
机构 * KAIST(韩国科学技术院) ; MBZUAI(慕布扎伊大学)
AI总结 VMMU是一个评估视觉语言模型在非英语环境下多模态理解和推理能力的基准,通过2500个多模态问题测试模型对视觉和文本信息的整合与推理能力。
统一多模态交错文档表示用于检索
机构 * University of North Carolina Chapel Hill(北卡罗来纳大学教堂山分校) ; KAIST(韩国科学技术院) ; DeepAuto
AI总结 本文提出统一多模态交错文档表示方法,通过整合文本、图像和表格信息提升信息检索性能。
Comments EACL Findings 2026
PF-D2M:一种无姿态扩散模型用于通用舞蹈-音乐生成
机构 * Graduate School of Culture Technology, KAIST, South Korea(韩国科学技术院文化科技研究生院) ; Sony Computer Science Laboratories, Tokyo, Japan(东京索尼计算机科学实验室)
AI总结 PF-D2M通过结合视觉特征和渐进训练策略,实现了通用舞蹈-音乐生成,提升了多舞者和非人类舞者场景下的同步性和音乐质量。
Comments 4 pages, 2 figures
VideoMaMa: 通过生成先验进行掩码引导的视频磨皮
机构 * Korea University(韩国大学) ; Adobe Research(Adobe研究) ; KAIST AI(韩国科学技术院人工智能)
AI总结 VideoMaMa通过生成先验和分割提示,实现从粗糙掩码到精确磨皮的转换,并构建大规模伪标签数据集提升视频磨皮研究
Comments Project page: https://cvlab-kaist.github.io/VideoMaMa/
基于激光雷达的深度强化学习实现无人机群通信自由的集体导航
机构 * Department of Mechanical Engineering, Ulsan National Institute of Science and Technology(机械工程系,釜山国立科学技术研究院) ; Department of Mechanical Engineering, Korea Advanced Institute of Science and Technology(机械工程系,韩国科学技术院)
AI总结 本文提出一种基于激光雷达的深度强化学习方法,使无人机群在无通信和无外部定位的情况下实现稳健的集体导航。
ELO:面向多语言大语言模型持续预训练的高效分层优化
机构 * Seoul National University of Science and Technology(首尔科学技术大学) ; LG CNS ; Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Hanbat National University(汉 bat 国立大学)
AI总结 ELO通过分层优化提升多语言大模型持续预训练效率,实现6.46倍加速和6.2%性能提升。
Comments 12 pages, Accepted to EACL 2026 (Industrial Track)
FastAV: 面向音频视觉大语言模型推理的高效令牌修剪
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 FastAV通过两阶段令牌修剪策略,针对音频视觉大语言模型实现高效推理,减少FLOPs超过40%并保持性能
UNMIXX:解构高度相关歌唱声混合物
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 UNMIXX通过音乐导向的混合策略、跨源注意力和幅度惩罚损失,有效解决高度相关歌唱声混合分离难题,提升分离性能达2.2dB。
Comments Accepted by ICASSP 2026
BLUCK:一种用于孟加拉语语言理解和文化知识的基准数据集
机构 * KAIST(韩国科学技术院)
AI总结 BLUCK是一个用于评估大型语言模型在孟加拉语语言理解和文化知识方面性能的基准数据集,包含2366个多选题,涵盖23个类别,揭示了孟加拉语作为中等资源语言的地位。
Comments Accepted at BLP Workshop, IJCNLP-AACL 2025
熵 context 形状:基于信息论的 context-aware LLM agent 的过滤方法
机构 * KAIST(韩国科学技术院)
AI总结 本文提出熵 context 形状方法,通过信息论衡量 context 的语用效用,优于词汇相似性方法,在多轮 context 选择任务中取得显著提升。
高效参数化Koopman算子的SVD用于随机动力系统
机构 * Kim Jaechul Graduate School of AI, KAIST, Daejeon 34141, South Korea(韩国科学技术院人工智能研究生院) ; Department of EECS, MIT, Cambridge, MA 02139, United States(麻省理工学院电子工程与计算机科学系)
AI总结 本文提出了一种基于低秩近似的高效方法,用于学习随机动力系统Koopman算子的前k个奇异函数,以提高大规模系统的可扩展性和稳定性。
Comments Accepted for NeurIPS 2025. The first two authors contributed equally. 30 pages, 5 figures, 4 tables. Code is available at https://github.com/MinchanJeong/NeuralKoopmanSVD
为重载液压机器人学习四足运动的致动器模型
机构 * Robotics and Artificial Intelligence Lab, KAIST(机器人与人工智能实验室,韩国科学技术院) ; Robotics Team, HYUNDAI Rotem(HYUNDAI Rotem机器人团队) ; Hydraulic Robot Laboratory, Human-Centric Robotics R&D Department, Korea Institue of Industrial Technology(液压机器人实验室,人本机器人研发部门,韩国工业技术研究院)
AI总结 本研究提出了一种基于液压动力学的分析致动器模型,用于重载液压四足机器人在RL中的运动控制,实现了稳定的sim-to-real转移。
Comments 9 pages, Accepted to IEEE Robotics and Automation Letters (RA-L) 2025
Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 12, December 2025)
迁移学习在高维线性回归中良性过拟合的应用
机构 * Yonsei University(延世大学) ; KAIST(韩国科学技术院)
AI总结 本文提出了一种两步转移MNI方法,通过分析其非渐近性超额风险,揭示了在特定条件下利用异质数据可提升高维线性回归的泛化能力。
Comments 42 pages; Camera-ready version accepted at NeurIPS 2025 (Spotlight)
Robot-R1: 通过强化学习提升机器人中的具身推理
机构 * KAIST(韩国科学技术院) ; Yonsei University(延世大学) ; UC Berkeley(加州大学伯克利分校) ; RLWRLD
AI总结 Robot-R1通过强化学习提升机器人中的具身推理,优于SFT方法并超越GPT-4o在低级动作控制推理任务中
Comments NeurIPS 2025
ELITE: 通过学习初始化和测试时生成适应从单目视频高效生成高斯头人偶
机构 * Dept. of Electrical Engineering, POSTECH(POSTECH电子工程系) ; School of Computing, KAIST(韩国科学技术院计算机学院) ; UNIST(全南大学) ; University of Tübingen(图宾根大学) ; Tübingen AI Center(图宾根人工智能中心) ; Max Planck Institute for Informatics(马克斯·普朗克信息研究所)
AI总结 ELITE通过学习初始化和测试时生成适应,高效生成高斯头人偶,实现高保真和强野外泛化,合成速度比2D方法快60倍。
Comments Project page: https://kim-youwang.github.io/elite
快速低秩神经表示与稀疏物理信息反向传播
机构 * Telepix ; Department of Computer Science, Arizona State University(亚利桑那州立大学计算机科学系) ; School of Computing, Korea Advanced Institute of Science and Technology(韩国科学技术院计算机科学学院) ; Department of Mathematics, Washington University in St. Louis(圣路易斯华盛顿大学数学系) ; Department of Mathematics, University of Central Florida(中央佛罗里达大学数学系)
AI总结 SPInProp通过构建更小的FastLRNR网络,加速了低秩神经表示架构的反向传播,从而提高了物理信息神经网络求解参数化偏微分方程的效率。
Comments 10 pages, 3 figures
Journal ref Results Appl Math 25, 100547 (2025)
通用少样本空间控制用于扩散模型
机构 * KAIST(韩国科学技术院)
AI总结 UFC通过通用少样本控制适配器实现对扩散模型的通用空间控制,能够在少量示例下实现与全监督基线相当的性能。