arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-07-31 至 2026-07-31 共收录 3
2607.28164 2026-07-31 cs.CV cs.GR 新提交

S-Avatar: Diffusion-Guided Gaussian Head Avatars from a Single Image

S-Avatar:基于单张图像的扩散引导高斯头部化身

Hail Song, Seokhwan Yang, Jiwon Yang, Woojin Cho, Woontack Woo

机构 * KAIST(韩国科学技术院) KAIST KI-ITC ARRC(韩国科学技术院KI-ITC ARRC)

AI总结 S-Avatar通过三阶段流水线,结合扩散引导3DGS生成与FLAME控制,从单张图像生成高逼真3D头部化身,提升了3D一致性,在新视点和表情生成上优于现有方法,适用于VR/AR应用。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27296 2026-07-31 cs.SD cs.MM 新提交

SKY-Piano: A Multimodal Piano Performance Dataset

SKY-Piano:多模态钢琴演奏数据集

Joonhyung Bae, Dawon Park, Taegyun Kwon, Yoon-Seok Choi, Hyeon Hur, Satoshi Obata, Shigeru Kai, Yohei Wada, Yu Takahashi, Akira Maezawa, Jaebum Park, Jonghwa Park, Juhan Nam

机构 * Seoul National University(首尔大学) KAIST(韩国科学技术院) Yamaha(雅马哈)

AI总结 该研究发布SKY-Piano多模态钢琴演奏数据集,含多类数据及标注工具,通过微调实验验证其用于MIDI到动作生成的可用性。

Comments Accepted to the 27th International Society for Music Information Retrieval Conference (ISMIR 2026), Abu Dhabi, UAE. Project page: https://joonhyungbae.github.io/skypiano/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24353 2026-07-31 cs.CV cs.LG 版本更新

Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints

开放词汇BEV分割:基于3D感知几何约束的方法

Hojun Choi, Seulbin Hwang, Daejung Kim, Kisung Kim, Hyunjung Shim, Jinhan Lee

机构 * KAIST AI(韩国科学技术院人工智能) NAVER LABS(NAVER实验室)

AI总结 针对开放词汇BEV分割中2D VLM语义到BEV的3D几何不一致问题,提出OVBEVSeg框架,通过三阶段几何约束(伪标签、场景优化、知识蒸馏)实现高效在线推理,在nuScenes上未见类别mIoU超越闭集方法15.3,推理速度提升2.5倍。

Comments This paper has been accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏