arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-04-02 至 2026-04-02 共收录 8
2604.00853 2026-04-02 cs.CV

MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer

MotionGrounder: 通过扩散变换器实现多物体运动迁移

Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电气工程学院) Adobe Research(Adobe研究院) CMLab, Chung-Ang University(中央大学CMLab)

AI总结 本文提出MotionGrounder,一种基于扩散变换器的多物体运动迁移框架,通过流式运动信号和对象-描述对齐损失实现稳定运动先验和空间对齐,实验显示其在定量、定性和人类评估中均优于现有方法。

Comments Please visit our project page at https://kaist-viclab.github.io/motiongrounder-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00510 2026-04-02 cs.AI

Adaptive Parallel Monte Carlo Tree Search for Efficient Test-time Compute Scaling

自适应并行蒙特卡洛树搜索用于高效测试时间计算扩展

Hongbeen Kim, Juhyun Lee, Sanghyeon Lee, Kwanghoon Choi, Jaehyuk Huh

机构 * School of Computing, Korea Advanced Institute of Science and Technology(韩国科学技术院计算学院)

AI总结 本文提出负早退和自适应提升机制,通过优化MCTS执行效率,降低端到端延迟并提升吞吐量,同时保持推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00507 2026-04-02 cs.CV

RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection

RegFormer:可转移的交互关系接地以实现高效的弱监督人类-物体交互检测

Jihwan Park, Chanhyeong Yang, Jinyoung Park, Taehoon Song, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) LG Energy Solution(LG新能源) Korea University(高丽大学)

AI总结 RegFormer通过空间接地信号实现高效的弱监督人类-物体交互检测,无需额外训练即可直接迁移至实例级推理,实验表明其在效率和性能上均优于传统方法。

Comments Accepted at CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00445 2026-04-02 cs.AI cs.CL

Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models

迈向大语言模型中可靠的真实性对齐不确定性估计

Ponhvoan Srey, Quang Minh Nguyen, Xiaobao Wu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) KAIST(韩国科学技术院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Truth AnChoring方法,通过将原始分数映射到事实对齐分数,解决不确定性估计指标在低信息区域的非判别性问题,提升大语言模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00383 2026-04-02 cs.CV

Mine-JEPA: In-Domain Self-Supervised Learning for Mine-Like Object Classification in Side-Scan Sonar

Mine-JEPA: 针对侧扫声呐中矿类物体分类的领域自监督学习

Taeyoun Kwon, Youngwon Choi, Hyeonyu Kim, Myeongkyun Cho, Junhyeok Choi, Moon Hwan Kim

机构 * Maum AI Inc.(Maum AI公司) Seoul National University(首尔大学) KAIST(韩国科学技术院) Yonsei University(延世大学)

AI总结 本文提出Mine-JEPA,首个针对侧扫声呐矿类物体分类的领域自监督学习框架,通过SIGReg损失在1170张未标记声呐图像上预训练,实现二分类F1得分0.935,优于DINOv3。

Comments 9 pages, 3 figures, 6 tables. Accepted at CVPR 2026 MACVi Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08040 2026-04-02 cs.LG cs.AI

FIRE: Frobenius-Isometry Reinitialization for Balancing the Stability-Plasticity Tradeoff

FIRE:弗罗贝尼乌斯-等距重初始化以平衡稳定性-可塑性权衡

Isaac Han, Sangyeon Park, Seungwon Oh, Donghu Kim, Hojoon Lee, Kyung-Joong Kim

机构 * Gwangju Institute of Science and Technology (GIST)(光州科学技术院) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Holiday Robotics

AI总结 FIRE通过量化稳定性与可塑性,平衡神经网络在非平稳数据训练中的稳定性与可塑性权衡,优于传统重初始化方法。

Comments ICLR'26 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00766 2026-04-02 cs.CV cs.AI

Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?

大视觉-语言模型是否准备好指导盲人和低视力者?

Eunki Kim, Na Min An, Wan Ju Kang, Sangryul Kim, James Thorne, Hyunjung Shim

机构 * SKT KAIST AI(韩国科学技术院人工智能) NAVER Theia Insights

AI总结 本文提出统一框架,通过用户研究和定制数据集,开发出更高效的评估器,提升大视觉-语言模型在盲人和低视力用户导航中的应用性能。

Comments 42 pages, 14 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00027 2026-04-02 cs.CL cs.LG

Multi-lingual Multi-institutional Electronic Health Record based Predictive Model

多语言多机构电子健康记录基于预测模型

Kyunghoon Hur, Heeyoung Kwak, Jinsu Jang, Nakhwan Kim, Edward Choi

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Science and Technology(韩国科学技术院金载哲人工智能研究生院) NAVER Digital Healthcare LAB(NAVER数字医疗实验室) Department of Health and Medical Information, Ansan University(安山大学健康与医疗信息系) Institute of Human Behavior and Genetics, Korea University College of Medicine(高丽大学医学院人类行为与遗传研究所)

AI总结 本文提出多语言多机构学习方法,通过文本对齐实现跨国ICU数据集的联合训练,优于多语言编码器和翻译方法,提升临床预测性能。

Comments On revision stage, 10 main pages, 3 supplementary pages

详情

展开后加载摘要…

URL PDF HTML 收藏