arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-06-24 至 2026-06-24 共收录 8
2606.24648 2026-06-24 cs.SD cs.CL eess.AS 新提交

ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge

ParaPairAudioBench: 面向LALM-as-a-Judge的副语言成对音频基准

Jisu Jeon, Seungyeon Jwa, Joosung Lee, Jinhyeon Kim, Woojin Chung, Hwiyeol Jo, Jeonghoon Kim, Jonghyun Choi, Soyoon Kim

机构 * Hongik University(弘益大学) Seoul National University(首尔大学) NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

AI总结 提出ParaPairAudioBench,包含5,175对音频,覆盖风格、语速、重音、年龄和性别五个副语言维度,用于评估大型音频语言模型作为评判者的可靠性,发现其与人类判断差距大且校准失败严重。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24232 2026-06-24 cs.CV cs.GR 新提交

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA:基于单张肖像图像的前馈即时高斯编解码器化身

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) School of Computing, KAIST(韩国科学技术院计算机学院)

AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。

Comments Project page: https://kim-youwang.github.io/FiCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24049 2026-06-24 cs.RO 新提交

SPACE: Enabling Learning from Cross-Robot Data Toward Generalist Policies

SPACE:从跨机器人数据中学习通用策略

Haeone Lee, Byeongguk Jeon, Suchae Jeong, Jian Kim, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Yonsei University(延世大学)

AI总结 提出SPACE框架,通过笛卡尔状态增量作为通用动作表示,结合动作适配器处理机器人动力学差异,实现跨本体和硬件的策略学习,显著优于直接预测控制命令的方法。

Comments Project page: http://haeone.site/space-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22314 2026-06-24 cs.LG cs.AI cs.CV 新提交

Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution

扩散积分梯度:用于灵活特征归因的可控路径生成

Soyeon Kim, Kyowoon Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) Ajou University(亚洲大学) INEEJI Corp.(INEEJI公司)

AI总结 提出扩散积分梯度(DiffIG),通过扩散模型生成路径并嵌入用户引导,实现灵活可控的特征归因,在定量和定性上优于现有方法。

Comments 44 pages, 22 figures, 10 tables. Accepted to ECCV 2026; includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17046 2026-06-24 cs.RO cs.CV cs.LG 新提交

Geometric Action Model for Robot Policy Learning

几何动作模型用于机器人策略学习

Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

机构 * KAIST AI(韩国科学技术院人工智能学院) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心)

AI总结 提出几何动作模型(GAM),通过重用预训练几何基础模型(GFM)作为共享骨干,实现语言条件下的操作策略,在仿真和真实机器人任务中优于现有方法。

Comments Project page: https://cvlab-kaist.github.io/Geometric-Action-Model/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08558 2026-06-24 cs.CL cs.AI 版本更新

WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models

WAND: 窗口注意力与知识蒸馏用于高效自回归文本到语音模型

Hanna Lee, Tan Dat Nguyen, Jaehoon Kang, Kyuhong Shim

机构 * Korea Advanced Institute of Science and Technology, Republic of Korea(韩国科学技术院) Sungkyunkwan University, Republic of Korea(成均馆大学)

AI总结 提出WAND框架,通过分离注意力为全局持久注意力和局部滑动窗口注意力,结合课程学习与知识蒸馏,在保持合成质量的同时将AR-TTS模型的计算和内存复杂度降至常数,KV缓存减少66.2%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14792 2026-06-24 cs.CV 版本更新

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL: 用于开放词汇目标检测的多步伪标签方法

Hojun Choi, Youngsun Lim, Jaeyo Shin, Hyunjung Shim

机构 * KAIST AI(韩国韩世大学AI研究所) Boston University(波士顿大学)

AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02583 2026-06-24 cs.LG

Transformer-based Stagewise Decomposition for Large-Scale Multistage Stochastic Optimization

基于Transformer的分阶段分解用于大规模多阶段随机优化

Chanyeong Kim, Jongwoong Park, Hyunglip Bae, Woo Chang Kim

机构 * Department of Industrial and Systems Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学工业与系统工程系) NCSOFT Corporation, Seongnam, Republic of Korea(韩国水原NCSOFT公司)

AI总结 本文提出TranSDDP算法,利用Transformer结构改进传统SDDP,通过生成分段线性近似函数提升大规模多阶段随机优化问题的求解效率与精度。

Comments Accepted at ICML 2023 (Oral Presentation)

Journal ref Proceedings of the 40th International Conference on Machine Learning, PMLR 202:16747-16770, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏