arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1464
2603.02050 2026-04-08 cs.HC cs.AI

"When to Hand Off, When to Work Together": Expanding Human-Agent Co-Creative Collaboration through Concurrent Interaction

何时交接,何时协作:通过并发交互扩展人机协同创作

Kihoon Son, Hyewon Lee, DaEun Choi, Yoonsu Kim, Tae Soo Kim, Yoonjoo Lee, John Joon Young Chung, HyunJoon Jung, Juho Kim

机构 * School of Computing, KAIST(韩国科学技术院计算学院) Computer Science and Engineering, University of Michigan(密歇根大学计算机科学与工程系)

AI总结 研究探讨人机协同创作中并发交互的模式与能力需求,提出决策模型和标注数据集,揭示并发交互提升委托效果的核心作用。

Comments Check the demo videos on the website: https://cleo.kixlab.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20546 2026-04-08 cs.CL cs.AI

Enhancing Hallucination Detection via Future Context

通过未来上下文增强幻觉检测

Joosung Lee, Cheonbok Park, Hwiyeol Jo, Jeonghoon Kim, Joonsuk Park, Kang Min Yoo

机构 * NAVER CLOUD(NAVER云) NAVER AI Lab(NAVER人工智能实验室) KAIST(韩国科学技术院) University of Richmond(里士满大学)

AI总结 本文提出通过采样未来上下文来增强幻觉检测,结合多种采样方法提升检测性能。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04646 2026-04-07 cs.CV cs.AI

Training-Free Refinement of Flow Matching with Divergence-based Sampling

无需训练的流匹配细化方法:基于发散性的采样

Yeonwoo Cha, Jaehoon Yoo, Semin Kim, Yunseo Park, Jinhyeon Kwon, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

AI总结 本文提出无需训练的流匹配细化方法,通过发散性采样提升生成质量,适用于文本到图像合成等任务。

Comments Project Page: https://yeonwoo378.github.io/official_fds

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04394 2026-04-07 cs.LG cs.SY eess.SY

Finite-Time Analysis of Q-Value Iteration for General-Sum Stackelberg Games

一般和解博弈中Q值迭代的有限时间分析

Narim Jeong, Donghwan Lee

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文从控制理论视角研究了双玩家一般和解马尔可夫博弈中Stackelberg Q值迭代的收敛性,提出放松的策略条件并建模学习动态为切换系统,通过构造上下比较系统,建立了Q函数的有限时间误差界并刻画其收敛特性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28816 2026-04-07 cs.DL cs.AI

ASTRA: Mapping Art-Technology Institutions via Conceptual Axes, Text Embeddings, and Unsupervised Clustering

ASTRA:通过概念轴、文本嵌入和无监督聚类映射艺术科技机构

Joonhyung Bae

机构 * Graduate School of Culture Technology, KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院文化技术研究生院)

AI总结 本文提出ASTRA方法,结合八轴概念框架和文本嵌入聚类技术,对78个文化科技机构进行统一分析,揭示其多维特征及跨学科联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28045 2026-04-07 cs.CV

Event6D: Event-based Novel Object 6D Pose Tracking

Event6D: 基于事件的新型物体6D位姿跟踪

Jae-Young Kang, Hoonhee Cho, Taeyeop Lee, Minjun Kang, Bowen Wen, Youngho Kim, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达)

AI总结 本文提出EventTrack6D框架,通过重建任意时间戳间的强度和深度,实现无需特定对象训练的新型物体6D位姿跟踪,支持高速动态场景下的实时跟踪。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16042 2026-04-07 cs.CV

Pose-dIVE: Pose-Diversified Augmentation with Diffusion Model for Person Re-Identification

姿态多样化扩散模型:用于人体重识别的姿态多样化增强

Inès Hyeonsu Kim, Woojeong Jin, Soowon Son, Junyoung Seo, Seokju Cho, JeongYeol Baek, Byeongwon Lee, JoungBin Lee, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) SK Telecom(SK电讯)

AI总结 本文提出Pose-dIVE,通过扩散模型结合姿态和视角信息,增强重识别模型对姿态和视角变化的鲁棒性,提升模型泛化能力。

Comments CVPR 2026 Findings, Project page: https://cvlab-kaist.github.io/Pose-dIVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03685 2026-04-07 cs.CV

DSERT-RoLL: Robust Multi-Modal Perception for Diverse Driving Conditions with Stereo Event-RGB-Thermal Cameras, 4D Radar, and Dual-LiDAR

DSERT-RoLL:多模态感知用于多样驾驶条件的鲁棒性,结合立体事件-RGB-热成像相机、4D雷达和双光雷达

Hoonhee Cho, Jae-Young Kang, Yuhwan Jeong, Yunseo Yang, Wonyoung Lee, Youngho Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab, KAIST(韩国科学技术院视觉智能实验室)

AI总结 本文提出DSERT-RoLL数据集,结合立体事件、RGB和热成像相机以及4D雷达和双光雷达,涵盖多样的天气和光照条件,提供精确的2D和3D边界框及轨迹ID,支持跨传感器组合的公平比较,提升新型传感器的数据可用性,并建立统一的3D和2D基准,促进传感器性能的系统研究。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02870 2026-04-06 cs.CV

Token Warping Helps MLLMs Look from Nearby Viewpoints

令牌扭曲帮助多模态大语言模型从近处视角观察

Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

AI总结 本文研究令牌扭曲如何帮助多模态大语言模型从近处视角理解场景,发现反向令牌扭曲在视角变化中更稳定且能更好保持语义一致性。

Comments CVPR 2026, Project Page: https://token-warping-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02836 2026-04-06 cs.CV

Factorized Multi-Resolution HashGrid for Efficient Neural Radiance Fields: Execution on Edge-Devices

因子化多分辨率哈希网格:用于高效神经辐射场的执行边缘设备

Kim Jun-Seong, Mingyu Kim, GeonU Kim, Tae-Hyun Oh, Jin-Hwa Kim

机构 * POSTECH(浦项科技大学) KAIST(韩国科学技术院) NAVER AI Lab(NAVER AI实验室)

AI总结 本文提出Fact-Hash,一种用于边缘设备神经辐射场训练的参数编码方法,通过融合张量分解与哈希编码技术,提升内存效率和渲染速度,实现高质量3D表示。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

Journal ref IEEE Robotics and Automation Letters (RA-L), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02766 2026-04-06 cs.LG cs.AI

Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs

随机难以超越:在线DPO中的主动选择

Giyeong Oh, Junghyun Lee, Jaehyun Park, Youngjae Yu, Wonho Bae, Junhyug Noh

机构 * Seoul National University(首尔大学) Ewha Womans University(梨花女子大学) KAIST(韩国科学技术院) UBC(不列颠哥伦比亚大学)

AI总结 本文研究了在线DPO中主动选择策略的有效性,发现即使在强先验基础上,主动选择的计算开销难以抵消简单随机采样带来的多样性优势。

Comments first commit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17677 2026-04-06 cs.CL cs.AI cs.LG

Adaptive Guidance for Retrieval-Augmented Masked Diffusion Models

适应性引导的检索增强掩码扩散模型

Jaemin Kim, Jong Chul Ye

机构 * KAIST(韩国科学技术院)

AI总结 本文提出ARAM框架,通过动态校准引导尺度提升检索增强扩散模型在知识密集型问答中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14267 2026-04-06 cs.CV cs.AI cs.MM cs.SD

DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization

DiFlowDubber:通过跨模态对齐与同步实现的离散流匹配自动化视频配音

Ngoc-Son Nguyen, Thanh V. T. Tran, Jeongsoo Choi, Hieu-Nghia Huynh-Nguyen, Truong-Son Hy, Van Nguyen

机构 * FPT Software AI Center, Vietnam(FPT软件人工智能中心,越南) KAIST, South Korea(韩国科学技术院) University of Alabama at Birmingham, USA(阿拉巴马大学伯明翰分校)

AI总结 本文提出DiFlowDubber框架,通过离散流匹配和两阶段训练策略,解决视频配音中内容准确性、表达语气、高质量音频和精确唇同步的问题。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01765 2026-04-06 cs.CV

Efficient Test-Time Optimization for Depth Completion via Low-Rank Decoder Adaptation

通过低秩解码器适应实现高效的深度完成测试时优化

Minseok Seo, Wonjun Lee, Jaehyuk Jang, Changick Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))

AI总结 本文提出一种轻量级测试时适应方法,通过更新低维子空间实现高效零样本深度完成,提升准确率与效率的平衡。

Comments 17 pages, 7 figures [We achieved a new Pareto frontier in test-time depth completion.]

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23880 2026-04-06 cs.CV

Learning Adaptive Pseudo-Label Selection for Semi-Supervised 3D Object Detection

学习自适应伪标签选择用于半监督3D目标检测

Taehun Kong, Tae-Kyun Kim

机构 * School of Computing, KAIST(韩国科学技术院计算机学院) AI Lab, LG Electronics(LG电子人工智能实验室)

AI总结 本文提出一种自适应伪标签选择框架,通过动态阈值和上下文信息提升3D目标检测性能,实验表明其在KITTI和Waymo数据集上效果显著。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02185 2026-04-03 cs.CV

CXR-LT 2026 Challenge: Projection-Aware Multi-Label and Zero-Shot Chest X-Ray Classification

CXR-LT 2026挑战:面向投影的多标签和零样本胸片分类

Juno Cho, Dohui Kim, Mingeon Kim, Hyunseo Jang, Chang Sun Lee, Jong Chul Ye

机构 * KAIST(韩国科学技术院) GIST(光州科学技术院) Korea University(高丽大学) KAIST Graduate School of AI (GSAI)(韩国科学技术院人工智能研究生院)

AI总结 该挑战针对已知胸片病变的多标签分类和未知病变的零样本分类,通过整合投影特定模型的分类网络,提出双分支架构结合对比学习和LLM生成提示,提升零样本泛化能力。

Comments 5 pages, 3 figures. Accepted to the IEEE ISBI 2026 CXR-LT Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29272 2026-04-03 cs.CV cs.GR cs.RO

MaskAdapt: Learning Flexible Motion Adaptation via Mask-Invariant Prior for Physics-Based Characters

MaskAdapt:通过mask不变先验实现灵活的运动适应

Soomin Park, Eunseong Lee, Kwang Bin Lee, Sung-Hee Lee

机构 * KAIST(韩国科学技术院)

AI总结 MaskAdapt通过两阶段残差学习框架,结合随机身体部分遮挡和正则化项训练mask不变基础策略,实现物理基人物体的灵活运动适应,展示了运动合成和文本驱动部分目标跟踪的应用。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00853 2026-04-02 cs.CV

MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer

MotionGrounder: 通过扩散变换器实现多物体运动迁移

Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电气工程学院) Adobe Research(Adobe研究院) CMLab, Chung-Ang University(中央大学CMLab)

AI总结 本文提出MotionGrounder,一种基于扩散变换器的多物体运动迁移框架,通过流式运动信号和对象-描述对齐损失实现稳定运动先验和空间对齐,实验显示其在定量、定性和人类评估中均优于现有方法。

Comments Please visit our project page at https://kaist-viclab.github.io/motiongrounder-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00510 2026-04-02 cs.AI

Adaptive Parallel Monte Carlo Tree Search for Efficient Test-time Compute Scaling

自适应并行蒙特卡洛树搜索用于高效测试时间计算扩展

Hongbeen Kim, Juhyun Lee, Sanghyeon Lee, Kwanghoon Choi, Jaehyuk Huh

机构 * School of Computing, Korea Advanced Institute of Science and Technology(韩国科学技术院计算学院)

AI总结 本文提出负早退和自适应提升机制,通过优化MCTS执行效率,降低端到端延迟并提升吞吐量,同时保持推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00507 2026-04-02 cs.CV

RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection

RegFormer:可转移的交互关系接地以实现高效的弱监督人类-物体交互检测

Jihwan Park, Chanhyeong Yang, Jinyoung Park, Taehoon Song, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) LG Energy Solution(LG新能源) Korea University(高丽大学)

AI总结 RegFormer通过空间接地信号实现高效的弱监督人类-物体交互检测,无需额外训练即可直接迁移至实例级推理,实验表明其在效率和性能上均优于传统方法。

Comments Accepted at CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00445 2026-04-02 cs.AI cs.CL

Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models

迈向大语言模型中可靠的真实性对齐不确定性估计

Ponhvoan Srey, Quang Minh Nguyen, Xiaobao Wu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) KAIST(韩国科学技术院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Truth AnChoring方法,通过将原始分数映射到事实对齐分数,解决不确定性估计指标在低信息区域的非判别性问题,提升大语言模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00383 2026-04-02 cs.CV

Mine-JEPA: In-Domain Self-Supervised Learning for Mine-Like Object Classification in Side-Scan Sonar

Mine-JEPA: 针对侧扫声呐中矿类物体分类的领域自监督学习

Taeyoun Kwon, Youngwon Choi, Hyeonyu Kim, Myeongkyun Cho, Junhyeok Choi, Moon Hwan Kim

机构 * Maum AI Inc.(Maum AI公司) Seoul National University(首尔大学) KAIST(韩国科学技术院) Yonsei University(延世大学)

AI总结 本文提出Mine-JEPA,首个针对侧扫声呐矿类物体分类的领域自监督学习框架,通过SIGReg损失在1170张未标记声呐图像上预训练,实现二分类F1得分0.935,优于DINOv3。

Comments 9 pages, 3 figures, 6 tables. Accepted at CVPR 2026 MACVi Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08040 2026-04-02 cs.LG cs.AI

FIRE: Frobenius-Isometry Reinitialization for Balancing the Stability-Plasticity Tradeoff

FIRE:弗罗贝尼乌斯-等距重初始化以平衡稳定性-可塑性权衡

Isaac Han, Sangyeon Park, Seungwon Oh, Donghu Kim, Hojoon Lee, Kyung-Joong Kim

机构 * Gwangju Institute of Science and Technology (GIST)(光州科学技术院) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Holiday Robotics

AI总结 FIRE通过量化稳定性与可塑性,平衡神经网络在非平稳数据训练中的稳定性与可塑性权衡,优于传统重初始化方法。

Comments ICLR'26 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00766 2026-04-02 cs.CV cs.AI

Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?

大视觉-语言模型是否准备好指导盲人和低视力者?

Eunki Kim, Na Min An, Wan Ju Kang, Sangryul Kim, James Thorne, Hyunjung Shim

机构 * SKT KAIST AI(韩国科学技术院人工智能) NAVER Theia Insights

AI总结 本文提出统一框架,通过用户研究和定制数据集,开发出更高效的评估器,提升大视觉-语言模型在盲人和低视力用户导航中的应用性能。

Comments 42 pages, 14 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00027 2026-04-02 cs.CL cs.LG

Multi-lingual Multi-institutional Electronic Health Record based Predictive Model

多语言多机构电子健康记录基于预测模型

Kyunghoon Hur, Heeyoung Kwak, Jinsu Jang, Nakhwan Kim, Edward Choi

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Science and Technology(韩国科学技术院金载哲人工智能研究生院) NAVER Digital Healthcare LAB(NAVER数字医疗实验室) Department of Health and Medical Information, Ansan University(安山大学健康与医疗信息系) Institute of Human Behavior and Genetics, Korea University College of Medicine(高丽大学医学院人类行为与遗传研究所)

AI总结 本文提出多语言多机构学习方法,通过文本对齐实现跨国ICU数据集的联合训练,优于多语言编码器和翻译方法,提升临床预测性能。

Comments On revision stage, 10 main pages, 3 supplementary pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29409 2026-04-01 cs.RO

CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics

CLaD:通过跨模态潜在动力学实现具有基础前瞻性的规划

Andrew Jeong, Jaemin Kim, Sebin Lee, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院)

AI总结 CLaD通过不对称跨注意力机制联合建模本体和语义状态演化,利用自监督目标和EMA编码器防止表征崩溃,实现高成功率的长序列动作生成。

Comments Project page: https://andrewwwj.github.io/clad

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29394 2026-04-01 cs.CV

AA-Splat: Anti-Aliased Feed-forward Gaussian Splatting

AA-Splat:抗锯齿前馈高斯点划

Taewoo Suh, Sungpyo Kim, Jongmin Park, Munchurl Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 AA-Splat通过引入OBBL设计,解决FF-3DGS在非分布采样下的渲染问题,实现任意分辨率的鲁棒抗锯齿渲染,相比DepthSplat在NVS性能上提升5.4-7.5dB。

Comments Please visit our project page at https://kaist-viclab.github.io/aasplat-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29077 2026-04-01 cs.CL

Dual Perspectives in Emotion Attribution: A Generator-Interpreter Framework for Cross-Cultural Analysis of Emotion in LLMs

情绪归因的双重视角:一种用于LLM中跨文化情绪分析的生成-解释框架

Aizirek Turdubaeva, Uichin Lee

机构 * KAIST(韩国科学技术院)

AI总结 本文提出生成-解释框架,从表达与解读双重视角分析情绪归因,评估六种LLM在15国数据上的表现,揭示文化背景对情绪类型和模型性能的影响,呼吁在LLM中实现文化敏感的情绪建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02789 2026-04-01 cs.CV cs.AI cs.LG

Align Your Query: Representation Alignment for Multimodality Medical Object Detection

对齐你的查询:多模态医学目标检测中的表示对齐

Ara Seo, Bryan Sangwoo Kim, Hyungjin Chung, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能学院) EverEx

AI总结 本文提出通过表示对齐提升多模态医学目标检测性能,引入模态令牌和QueryREPA预训练阶段,使查询表示更适应模态特征,提升检测精度。

Comments Project page: https://araseo.github.io/alignyourquery/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15288 2026-03-31 cs.CV

APPLE: Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping

APPLE:基于扩散模型的属性保留伪标签面部交换

Jiwon Kang, Yeji Choi, JoungBin Lee, Wooseok Jang, Jinhyeok Choi, Taekeun Kang, Yongjae Park, Myungin Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) SAMSUNG(三星)

AI总结 本文提出APPLE框架,通过条件去模糊和属性感知反向方案提升面部交换中属性保留能力,实现高保真属性与身份转移。

Comments Accepted at CVPR 2026. Project Page: https://cvlab-kaist.github.io/APPLE/

详情

展开后加载摘要…

URL PDF HTML 收藏