arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1464
2508.16112 2026-05-20 cs.AI

IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra

IR-Agent: 专家启发的LLM代理用于从红外光谱中解析分子结构

Heewoong Noh, Namkyeong Lee, Gyoung S. Na, Kibum Kim, Chanyoung Park

机构 * KAIST(韩国科学技术院) KRICT(韩国信息通信技术研究院)

AI总结 本文提出IR-Agent,一种新的多代理框架,用于从红外光谱中解析分子结构,通过模拟专家驱动的分析过程,提升结构解析的准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17726 2026-05-20 cs.CV cs.AI

Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM

Slot-MLLM: 多模态大语言模型中的面向对象视觉标记化

Donghwan Chi, Hyomin Kim, Yoonjin Oh, Yongjin Kim, Donghoon Lee, Daejin Jo, Jongmin Kim, Junyeob Baek, Sungjin Ahn, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kakao Corp(Kakao公司) School of Computing, KAIST(韩国科学技术院计算机学院)

AI总结 本文提出了一种面向对象的视觉标记化方法Slot-MLLM,通过基于Slot Attention的标记器,有效编码局部视觉细节并保持高层语义,从而提升多模态大语言模型在视觉内容理解和生成中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08248 2026-05-20 cs.CV

TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation

TextBoost: 通过文本编码器提升文本到图像生成的个性化

NaHyeon Park, Kunhee Kim, Hyunjung Shim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出TextBoost,一种高效的文本到图像扩散模型单次个性化方法,通过仅微调文本编码器提升计算和存储效率,并保持语义完整性,从而实现更快收敛和更低存储需求,同时保持高质量生成。

Comments Project page: https://textboost.github.io. Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18899 2026-05-20 cs.LG cs.AI

Don't Let Bandit Feedback Pull Continual LLM-Recommender Updates Off Target

不要让多臂老虎机反馈将连续LLM推荐系统更新偏离目标

Taesan Kim, Hyeongjun Yun, Jaegul Choo, Chung Park

机构 * SK Telecom(SK电信) KAIST(韩国科学技术院)

AI总结 本文提出了一种名为Anchored Bandit Policy Optimization (ABPO)的框架,用于持续改进基于生成式大语言模型的推荐系统,通过结合组内相对策略优化(GRPO)和显式处理曝光偏差和反馈模糊性,以减少因部署日志提供的策略形状上下文老虎机反馈导致的偏差,并提高推荐准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18864 2026-05-20 cs.LG cs.AI cs.CL

SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs

SAGE: 通过塑造锚点引导LLMs的RLVR探索

Chanuk Lee, Minki Kang, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

AI总结 本文提出SAGE框架,通过重塑反KL锚分布来实现可控的经验支持扩展,从而在数学推理基准中提升pass@1和pass@k的表现。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18766 2026-05-20 cs.IR cs.AI cs.CL

Retrieve Only Relevant Tables Whether Few or Many: Adaptive Table Retrieval Method

仅检索相关表格,无论多少:自适应表格检索方法

Taehee Kim, Seungbin Yang, Jihwan Kim, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所)

AI总结 本文提出了一种自适应表格检索方法,根据查询需求调整检索表格数量,通过自适应阈值机制和滑动窗口重排序算法,有效解决传统top-k检索策略的局限性,提升检索和下游任务性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08290 2026-05-19 cs.LG cs.AI

Minor First, Major Last: A Depth-Induced Implicit Bias of Sharpness-Aware Minimization

先浅后深:一种由深度诱导的sharpness-aware minimization的隐式偏见

Chaewon Moon, Dongkuk Si, Chulhee Yun

机构 * Graduate School of AI, KAIST(韩国成均馆大学人工智能研究生院) Mobilint, Inc.(Mobilint公司)

AI总结 该研究探讨了在训练线性可分二分类问题时,sharpness-aware minimization (SAM) 的隐式偏见,发现对于深度L=2的情况,SAM的行为与深度L=1时不同,展示了sequential feature amplification现象。

Comments Accepted to ICLR 2026, 84 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18039 2026-05-19 cs.CV

SGSoft: Learning Fused Semantic-Geometric Features for 3D Shape Correspondence via Template-Guided Soft Signals

SGSoft: 通过模板引导的软信号学习融合语义-几何特征以实现3D形状对应

Soyeon Yoon, Chang Wook Seo, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Anigma Technologies(Anigma科技公司)

AI总结 本文提出SGSoft方法,通过模板引导的软信号学习融合语义-几何特征,实现3D形状对应,解决了结构变化、非等距变形和拓扑不一致的挑战,实现了最先进的跨类别泛化和最佳精度-效率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12871 2026-05-19 cs.CL

MentalBench: A DSM-Grounded Benchmark for Evaluating Psychiatric Diagnostic Capability of Large Language Models

MentalBench: 一个用于评估大语言模型 psychiatric 诊断能力的 DSM 基础基准

Hoyun Song, Migyeong Kang, Jisu Shin, Jihyun Kim, Chanbi Park, Hangyeol Yoo, Jihyun An, Alice Oh, Jinyoung Han, KyungTae Lim

机构 * KAIST(韩国科学技术院) Sungkyunkwan University(成均馆大学) Dongguk University Medical Center(东国大学医学院) Seoultech(首尔技术大学) Samsung Medical Center(三星医疗中心)

AI总结 本文提出 MentalBench,一个用于评估大语言模型在不同临床模糊程度下能否做出 DSM 基础的 psychiatric 诊断决策的基准。该基准基于 psychiatrist 构建并验证的知识图谱,生成了 24,750 个合成临床案例,以系统地变化信息完整性和诊断复杂性,从而实现 DSM 基础的评估。实验表明,尽管最先进的 LLM 在噪声自由查询上表现良好,但它们在区分具有重叠症状的诊断时难以校准其信心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00924 2026-05-19 cs.AI

Supervised sparse auto-encoders for interpretable and compositional representations

监督稀疏自编码器用于可解释和组合性表示

Ouns El Harzli, Hugo Wallner, Yoonsoo Nam, Haixuan Xavier Tao

机构 * Department of Computer Science, University of Oxford, Oxford, UK(牛津大学计算机科学系) KAIST AI, Korean Advanced Institute of Science(韩国科学技术高级研究院AI研究所) Independent researcher(独立研究者)

AI总结 本文提出了一种监督稀疏自编码器,通过结合无约束特征模型和监督学习,解决稀疏自编码器在非光滑性及特征与人类语义对齐方面的不足,实现了组合性泛化和语义图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19300 2026-05-19 cs.LG

Queue Length Regret Bounds for Contextual Queueing Bandits

上下文队列强化学习中的队列遗憾界

Seoungbin Bae, Garyeong Kang, Dabeen Lee

机构 * Department of Industrial & Systems Engineering, KAIST(韩国科学技术院工业与系统工程系) Department of Mathematical Sciences, Seoul National University(首尔国立大学数学科学系) Research Institute of Mathematics, Seoul National University(首尔国立大学数学研究所) Korea Institute for Advanced Study(韩国高级研究院) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目)

AI总结 本文提出了一种新的上下文感知调度框架,即上下文队列强化学习,用于在同时学习未知服务速率的过程中进行调度。通过考虑异质的上下文特征,智能体选择任务并将其匹配到服务器以最大化离开速率。服务/离开速率由具有未知服务器特定参数的逻辑模型决定。为了评估策略的性能,我们考虑队列长度遗憾,定义为策略与最优策略之间队列长度的差异。主要挑战在于,在给定时间步长下,队列中剩余任务特征列表可能因策略与最优策略的不同而不同,因为它们可能以不同的顺序处理任务。为此,我们提出了带有复杂耦合论证的策略切换队列的概念。这导致了一种新的队列长度遗憾分解框架,使我们能够理解选择次优任务-服务器对的短期影响及其对队列状态差异的长期影响。我们证明了我们的算法CQB-ε达到了O(T^{-1/4})的遗憾上界。我们还考虑了对抗性选择的上下文设置,其中我们的第二个算法CQB-Opt达到了O(log²T)的遗憾上界。最后,我们提供了实验结果以验证我们的理论发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06907 2026-05-19 cs.AI cs.CV cs.NE

A Survey on Foundation Models for Personalized Federated Intelligence

面向个性化联邦智能的基础模型综述

Yu Qiao, Huy Q. Le, Avi Deb Raha, Phuong-Nam Tran, Apurba Adhikary, Mengchun Zhang, Loc X. Nguyen, Eui-Nam Huh, Dusit Niyato, Choong Seon Hong

机构 * School of Computing, Kyung Hee University(韩国庆熙大学计算机学院) Noakhali Science and Technology University(诺阿克利科学与技术大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文综述了基础模型在个性化联邦智能中的应用,探讨了联邦学习与基础模型的结合,提出了一种新的个性化联邦智能范式,旨在为实现人工智能个性化提供基础支持。

Comments Accepted ACM Computing Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16922 2026-05-19 cs.CV

Motion Cues from Image-based Point Tracking for LiDAR Scene Flow Estimation

基于图像点跟踪的运动线索用于LiDAR场景流估计

Youngdong Jang, Gyeongrok Oh, Jong Wook Kim, Hyunju Ryu, Hyung-gun Chi, SeungHyeon Kim, Seungryong Kim, Jonghyun Choi, Sangpil Kim

机构 * Korea University(韩国大学) Purdue University(普渡大学) KAIST(韩国科学技术院) Hyundai Motor Company(现代汽车公司)

AI总结 本文提出TrackCue框架,通过图像点跟踪获取密集轨迹以改进LiDAR场景流估计中的动态物体表示,通过视觉一致的运动补偿策略和视觉运动线索提升来实现更准确的静态-动态分类和更可靠的场景流学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16795 2026-05-19 cs.CV cs.AI cs.GR

3DPhysVideo: Consistency-Guided Flow SDE for Video Generation via 3D Scene Reconstruction and Physical Simulation

3DPhysVideo: 通过3D场景重建和物理模拟的一致性引导流SDE用于视频生成

Hwidong Kim, Yunho Kim, Tae-Kyun Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出了一种无需训练的管道,通过3D场景重建和物理模拟生成逼真视频,利用一致性引导流SDE分解预测速度以确保条件输入的一致性,从而在多物体和流体交互场景中实现从单张图像到物理合理视频的过渡。

Comments Project page: https://hwidong-kim.github.io/projects/3DPhysVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02167 2026-05-19 cs.LG cs.AI cs.CV

Manifold-Aligned Guided Integrated Gradients for Reliable Feature Attribution

面向流形的引导集成梯度用于可靠特征归因

Soyeon Kim, Seongwoo Lim, Kyowoon Lee, Jaesik Choi

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Science and Technology (KAIST)(金 Jaechul人工智能研究生院,韩国科学技术院(KAIST))

AI总结 本文提出面向流形的引导集成梯度(MA-GIG),通过在预训练变分自编码器的潜在空间中构建归因路径,减少非流形区域噪声,提升特征归因的可靠性。

Comments 32 pages, 13 figures, 12 tables. Accepted to ICML 2026; includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28134 2026-05-19 cs.CV

MeshReGen: A Unified 3D Geometry Regeneration Framework

MeshReGen: 一种统一的3D几何再生框架

Geon Yeong Park, Roman Shapovalov, Rakesh Ranjan, Jong Chul Ye, Andrea Vedaldi, Thu Nguyen-Phuoc

机构 * KAIST Meta Reality Labs(韩国科学技术院元宇宙实验室)

AI总结 MeshReGen通过基于VecSet的条件机制,实现从2D图像和初始3D形状再生3D对象,支持增强、重建和编辑等任务,无需额外标注即可在多个任务中实现可控的3D生成。

Comments Project page: https://geonyeong-park.github.io/meshregen/ 32 pages, 18 figures, 6 tables. Includes Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06807 2026-05-19 cs.RO cs.AI cs.LG

SuReNav: Superpixel Graph-based Constraint Relaxation for Navigation in Over-constrained Environments

SuReNav:基于超像素图的约束放松用于过约束环境中的导航

Keonyoung Koh, Moonkyeong Jung, Samuel Seungsup Lee, Daehyung Park

机构 * School of Computing, Korea Advanced Institute of Science and Technology, Korea(韩国科学技术院计算机学院)

AI总结 本文提出SuReNav方法,通过超像素图构建区域约束,利用图神经网络实现安全高效导航,适用于半静态环境中过约束规划问题,提升导航的人类类比性能。

Comments Accepted by ICRA 2026. Code and videos are available at https://sure-nav.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15961 2026-05-18 cs.CV

Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models

稀疏自编码器使CLIP模型的鲁棒且可解释的微调成为可能

Fabian Morelli, Arnas Uselis, Ankit Sonthalia, Seong Joon Oh

机构 * University of Tübingen(图宾根大学) KAIST(韩国科学技术院)

AI总结 本文提出SAE-FT方法,通过稀疏自编码器约束视觉表示的变化,实现CLIP模型的鲁棒且可解释的微调,提高下游任务性能同时保持模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15916 2026-05-18 cs.LG cs.AI cs.CV

LoCO: Low-rank Compositional Rotation Fine-tuning

LoCO:低秩组合旋转微调

An Nguyen, Jaesik Choi, Anh Tong

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) INEEJI

AI总结 LoCO提出一种低秩组合旋转微调方法,通过低秩斜对称矩阵构建正交变换,实现高效参数微调,适用于多领域模型适应,展现优于传统正交和非正交方法的性能。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15726 2026-05-18 cs.AI cs.CL

Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR

走出舒适区:为RLVR的高效策略引导探索

Chanuk Lee, Sangwoo Park, Minki Kang, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

AI总结 本文提出NudgeRL框架,通过策略引导实现结构化和多样性探索,提升RLVR在数学基准上的表现,相比标准GRPO和oracle引导方法更高效。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15713 2026-05-18 cs.RO cs.AI

Learning Dynamic Pick-and-Place for a Legged Manipulator

学习动态抓取与放置用于四足机械臂

Moonkyu Jung, Jiseong Lee, Zhengmao He, Donghoon Youm, Juhyeok Mun, HyeongJun Kim, Hyunsik Oh, Donghyuk Choi, Jungwoo Hur, Jie Song, Jemin Hwangbo

机构 * Robotics and Artificial Intelligence Lab, KAIST(机器人与人工智能实验室,韩国科学技术院)

AI总结 本文提出一种分层强化学习框架,用于四足机械臂的动态抓取与放置任务,通过模拟和现实实验验证了其在不同负载和工作空间下的高成功率。

Comments Accepted to IEEE Robotics and Automation Letters 2026

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7652-7659, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04909 2026-05-18 cs.LG

Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment

在关键领域学习:用于鲁棒偏好对齐的几何锚定

Youngjae Cho, Jongsuk Kim, Ji-Hoon Kim

机构 * PYLER KAIST(韩国科学技术院)

AI总结 GAPO通过动态几何锚定机制改进偏好对齐,通过局部敏感度自适应调整偏好对重要性,减少噪声影响,提升模型鲁棒性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15044 2026-05-15 cs.SD cs.AI cs.LG cs.MM eess.AS

SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

SpeakerLLM:一种面向说话人理解与验证推理的说话人专用音频大语言模型

KiHyun Nam, Jungwoo Heo, Siu Bae, Ha-Jin Yu, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) University of Seoul(首尔大学)

AI总结 SpeakerLLM通过统一说话人特征建模、录音条件理解及验证推理,提升音频大语言模型在说话人识别与验证中的性能与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13369 2026-05-15 cs.CL cs.AI cs.LG

Query-Conditioned Test-Time Self-Training for Large Language Models

基于查询的测试时自我训练用于大语言模型

Chaehee Song, Minseok Seo, Yeeun Seong, Doyi Kim, Changick Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院) Graduate School of Green Growth and Sustainability, KAIST(韩国科学技术院可持续增长与绿色发展研究生院)

AI总结 本文提出QueST框架,通过直接从输入查询生成查询条件对,实现测试时参数自适应,无需外部数据,在多个基准测试中优于现有方法。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17432 2026-05-15 cs.CL

Argument Reconstruction as Supervision for Critical Thinking in LLMs

论点重建作为大语言模型批判性思维的监督

Hyun Ryu, Gyouk Chu, Gregor Betz, Eunho Yang, Carolyn Rose, Sean Welleck

机构 * Carnegie Mellon University(卡内基梅隆大学) KAIST(韩国科学技术院) KIT(卡尔斯鲁厄理工学院)

AI总结 本文提出GAAR引擎和Arguinas数据集,探讨通过论点重建提升大语言模型批判性思维能力,实验显示在七项任务中训练模型表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15982 2026-05-15 cs.LG cs.AI

AMiD: Knowledge Distillation for LLMs with $α$-mixture Assistant Distribution

AMiD: 基于 α-混合助手分布的大型语言模型知识蒸馏

Donghyeok Shin, Yeongmin Kim, Suhyeon Jo, Byeonghu Na, Il-Chul Moon

机构 * Korea Advanced Institute of Science and Technology(韩国先进科学研究院)

AI总结 本文提出AMiD框架,通过引入α-混合助手分布解决LLM知识蒸馏中的容量差距和训练不稳定问题,提供更广泛的理论基础和更稳定的训练效果。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13959 2026-05-15 cs.LG cs.AI cs.RO

WarmPrior: Straightening Flow-Matching Policies with Temporal Priors

WarmPrior: 通过时间先验使流匹配策略更加平直

Sinjae Kang, Chanyoung Kim, Kaixin Wang, Li Zhao, Kimin Lee

机构 * KAIST(韩国科学技术院) Microsoft Research(微软研究院)

AI总结 本文提出WarmPrior,通过利用近期动作历史构建的时间先验,提升机器人操作任务的成功率,改进概率路径并提高样本效率和最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13880 2026-05-15 cs.AI cs.CL

PREPING: Building Agent Memory without Tasks

PREPING:在没有任务的情况下构建代理记忆

Yumin Choi, Sangwoo Park, Minki Kang, Jinheon Baek, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

AI总结 本文研究在无任务经验下通过自动生成合成实践构建代理记忆的方法,提出Preping框架,通过Proposer生成任务、Solver执行和Validator验证,提升性能并降低部署成本。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13467 2026-05-14 cs.CL

PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning

PDCR:感知分解置信度奖励用于视觉-语言推理

Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong, SooHwan Eom, Gwanhyeong Koo, Mark Hasegawa-Johnson, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research Asia (MSRA)(微软亚洲研究院)

AI总结 PDCR通过分解任务中的感知与推理步骤,提升视觉-语言推理的训练效果,解决全局奖励导致的信号退化问题。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13333 2026-05-14 cs.CV cs.AI cs.GR cs.LG

Stylized Text-to-Motion Generation via Hypernetwork-Driven Low-Rank Adaptation

通过超网络驱动的低秩适应生成风格化文本到动作生成

Junhyuk Jeon, Seokhyeon Hong, Junyong Noh

机构 * Visual Media Lab, KAIST(韩国庆熙大学视觉媒体实验室)

AI总结 本文提出轻量级风格条件框架,通过超网络生成LoRA参数动态调节预训练扩散模型,实现高效且通用的风格化动作生成。

Comments Accepted to SIGGRAPH 2026. Project page: https://junhyukjeon.github.io/projects/style-salad/

详情

展开后加载摘要…

URL PDF HTML 收藏