arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-06-24 至 2026-06-24 共收录 5
2606.24648 2026-06-24 cs.SD cs.CL eess.AS 新提交

ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge

ParaPairAudioBench: 面向LALM-as-a-Judge的副语言成对音频基准

Jisu Jeon, Seungyeon Jwa, Joosung Lee, Jinhyeon Kim, Woojin Chung, Hwiyeol Jo, Jeonghoon Kim, Jonghyun Choi, Soyoon Kim

机构 * Hongik University(弘益大学) Seoul National University(首尔大学) NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

AI总结 提出ParaPairAudioBench,包含5,175对音频,覆盖风格、语速、重音、年龄和性别五个副语言维度,用于评估大型音频语言模型作为评判者的可靠性,发现其与人类判断差距大且校准失败严重。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24232 2026-06-24 cs.CV cs.GR 新提交

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA:基于单张肖像图像的前馈即时高斯编解码器化身

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) School of Computing, KAIST(韩国科学技术院计算机学院)

AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。

Comments Project page: https://kim-youwang.github.io/FiCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24049 2026-06-24 cs.RO 新提交

SPACE: Enabling Learning from Cross-Robot Data Toward Generalist Policies

SPACE:从跨机器人数据中学习通用策略

Haeone Lee, Byeongguk Jeon, Suchae Jeong, Jian Kim, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Yonsei University(延世大学)

AI总结 提出SPACE框架,通过笛卡尔状态增量作为通用动作表示,结合动作适配器处理机器人动力学差异,实现跨本体和硬件的策略学习,显著优于直接预测控制命令的方法。

Comments Project page: http://haeone.site/space-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22314 2026-06-24 cs.LG cs.AI cs.CV 新提交

Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution

扩散积分梯度:用于灵活特征归因的可控路径生成

Soyeon Kim, Kyowoon Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) Ajou University(亚洲大学) INEEJI Corp.(INEEJI公司)

AI总结 提出扩散积分梯度(DiffIG),通过扩散模型生成路径并嵌入用户引导,实现灵活可控的特征归因,在定量和定性上优于现有方法。

Comments 44 pages, 22 figures, 10 tables. Accepted to ECCV 2026; includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17046 2026-06-24 cs.RO cs.CV cs.LG 新提交

Geometric Action Model for Robot Policy Learning

几何动作模型用于机器人策略学习

Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

机构 * KAIST AI(韩国科学技术院人工智能学院) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心)

AI总结 提出几何动作模型(GAM),通过重用预训练几何基础模型(GFM)作为共享骨干,实现语言条件下的操作策略,在仿真和真实机器人任务中优于现有方法。

Comments Project page: https://cvlab-kaist.github.io/Geometric-Action-Model/

详情

展开后加载摘要…

URL PDF HTML 收藏