IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra
IR-Agent: 专家启发的LLM代理用于从红外光谱中解析分子结构
机构 * KAIST(韩国科学技术院) ; KRICT(韩国信息通信技术研究院)
AI总结 本文提出IR-Agent,一种新的多代理框架,用于从红外光谱中解析分子结构,通过模拟专家驱动的分析过程,提升结构解析的准确性。
Comments ICLR 2026
高校专区
IR-Agent: 专家启发的LLM代理用于从红外光谱中解析分子结构
机构 * KAIST(韩国科学技术院) ; KRICT(韩国信息通信技术研究院)
AI总结 本文提出IR-Agent,一种新的多代理框架,用于从红外光谱中解析分子结构,通过模拟专家驱动的分析过程,提升结构解析的准确性。
Comments ICLR 2026
Slot-MLLM: 多模态大语言模型中的面向对象视觉标记化
机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) ; Kakao Corp(Kakao公司) ; School of Computing, KAIST(韩国科学技术院计算机学院)
AI总结 本文提出了一种面向对象的视觉标记化方法Slot-MLLM,通过基于Slot Attention的标记器,有效编码局部视觉细节并保持高层语义,从而提升多模态大语言模型在视觉内容理解和生成中的性能。
TextBoost: 通过文本编码器提升文本到图像生成的个性化
机构 * KAIST(韩国科学技术院)
AI总结 本文提出TextBoost,一种高效的文本到图像扩散模型单次个性化方法,通过仅微调文本编码器提升计算和存储效率,并保持语义完整性,从而实现更快收敛和更低存储需求,同时保持高质量生成。
Comments Project page: https://textboost.github.io. Accepted to TMLR
不要让多臂老虎机反馈将连续LLM推荐系统更新偏离目标
机构 * SK Telecom(SK电信) ; KAIST(韩国科学技术院)
AI总结 本文提出了一种名为Anchored Bandit Policy Optimization (ABPO)的框架,用于持续改进基于生成式大语言模型的推荐系统,通过结合组内相对策略优化(GRPO)和显式处理曝光偏差和反馈模糊性,以减少因部署日志提供的策略形状上下文老虎机反馈导致的偏差,并提高推荐准确性。
SAGE: 通过塑造锚点引导LLMs的RLVR探索
机构 * KAIST(韩国科学技术院)
AI总结 本文提出SAGE框架,通过重塑反KL锚分布来实现可控的经验支持扩展,从而在数学推理基准中提升pass@1和pass@k的表现。
Comments Preprint
仅检索相关表格,无论多少:自适应表格检索方法
机构 * KAIST AI(韩国科学技术院人工智能研究所)
AI总结 本文提出了一种自适应表格检索方法,根据查询需求调整检索表格数量,通过自适应阈值机制和滑动窗口重排序算法,有效解决传统top-k检索策略的局限性,提升检索和下游任务性能。
Comments ACL 2026 Findings
先浅后深:一种由深度诱导的sharpness-aware minimization的隐式偏见
机构 * Graduate School of AI, KAIST(韩国成均馆大学人工智能研究生院) ; Mobilint, Inc.(Mobilint公司)
AI总结 该研究探讨了在训练线性可分二分类问题时,sharpness-aware minimization (SAM) 的隐式偏见,发现对于深度L=2的情况,SAM的行为与深度L=1时不同,展示了sequential feature amplification现象。
Comments Accepted to ICLR 2026, 84 pages, 35 figures
SGSoft: 通过模板引导的软信号学习融合语义-几何特征以实现3D形状对应
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Anigma Technologies(Anigma科技公司)
AI总结 本文提出SGSoft方法,通过模板引导的软信号学习融合语义-几何特征,实现3D形状对应,解决了结构变化、非等距变形和拓扑不一致的挑战,实现了最先进的跨类别泛化和最佳精度-效率权衡。
MentalBench: 一个用于评估大语言模型 psychiatric 诊断能力的 DSM 基础基准
机构 * KAIST(韩国科学技术院) ; Sungkyunkwan University(成均馆大学) ; Dongguk University Medical Center(东国大学医学院) ; Seoultech(首尔技术大学) ; Samsung Medical Center(三星医疗中心)
AI总结 本文提出 MentalBench,一个用于评估大语言模型在不同临床模糊程度下能否做出 DSM 基础的 psychiatric 诊断决策的基准。该基准基于 psychiatrist 构建并验证的知识图谱,生成了 24,750 个合成临床案例,以系统地变化信息完整性和诊断复杂性,从而实现 DSM 基础的评估。实验表明,尽管最先进的 LLM 在噪声自由查询上表现良好,但它们在区分具有重叠症状的诊断时难以校准其信心。
监督稀疏自编码器用于可解释和组合性表示
机构 * Department of Computer Science, University of Oxford, Oxford, UK(牛津大学计算机科学系) ; KAIST AI, Korean Advanced Institute of Science(韩国科学技术高级研究院AI研究所) ; Independent researcher(独立研究者)
AI总结 本文提出了一种监督稀疏自编码器,通过结合无约束特征模型和监督学习,解决稀疏自编码器在非光滑性及特征与人类语义对齐方面的不足,实现了组合性泛化和语义图像编辑。
上下文队列强化学习中的队列遗憾界
机构 * Department of Industrial & Systems Engineering, KAIST(韩国科学技术院工业与系统工程系) ; Department of Mathematical Sciences, Seoul National University(首尔国立大学数学科学系) ; Research Institute of Mathematics, Seoul National University(首尔国立大学数学研究所) ; Korea Institute for Advanced Study(韩国高级研究院) ; Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目)
AI总结 本文提出了一种新的上下文感知调度框架,即上下文队列强化学习,用于在同时学习未知服务速率的过程中进行调度。通过考虑异质的上下文特征,智能体选择任务并将其匹配到服务器以最大化离开速率。服务/离开速率由具有未知服务器特定参数的逻辑模型决定。为了评估策略的性能,我们考虑队列长度遗憾,定义为策略与最优策略之间队列长度的差异。主要挑战在于,在给定时间步长下,队列中剩余任务特征列表可能因策略与最优策略的不同而不同,因为它们可能以不同的顺序处理任务。为此,我们提出了带有复杂耦合论证的策略切换队列的概念。这导致了一种新的队列长度遗憾分解框架,使我们能够理解选择次优任务-服务器对的短期影响及其对队列状态差异的长期影响。我们证明了我们的算法CQB-ε达到了O(T^{-1/4})的遗憾上界。我们还考虑了对抗性选择的上下文设置,其中我们的第二个算法CQB-Opt达到了O(log²T)的遗憾上界。最后,我们提供了实验结果以验证我们的理论发现。
面向个性化联邦智能的基础模型综述
机构 * School of Computing, Kyung Hee University(韩国庆熙大学计算机学院) ; Noakhali Science and Technology University(诺阿克利科学与技术大学) ; Korea Advanced Institute of Science and Technology(韩国科学技术院) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
AI总结 本文综述了基础模型在个性化联邦智能中的应用,探讨了联邦学习与基础模型的结合,提出了一种新的个性化联邦智能范式,旨在为实现人工智能个性化提供基础支持。
Comments Accepted ACM Computing Survey
基于图像点跟踪的运动线索用于LiDAR场景流估计
机构 * Korea University(韩国大学) ; Purdue University(普渡大学) ; KAIST(韩国科学技术院) ; Hyundai Motor Company(现代汽车公司)
AI总结 本文提出TrackCue框架,通过图像点跟踪获取密集轨迹以改进LiDAR场景流估计中的动态物体表示,通过视觉一致的运动补偿策略和视觉运动线索提升来实现更准确的静态-动态分类和更可靠的场景流学习。
3DPhysVideo: 通过3D场景重建和物理模拟的一致性引导流SDE用于视频生成
机构 * KAIST(韩国科学技术院)
AI总结 本文提出了一种无需训练的管道,通过3D场景重建和物理模拟生成逼真视频,利用一致性引导流SDE分解预测速度以确保条件输入的一致性,从而在多物体和流体交互场景中实现从单张图像到物理合理视频的过渡。
Comments Project page: https://hwidong-kim.github.io/projects/3DPhysVideo
面向流形的引导集成梯度用于可靠特征归因
机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Science and Technology (KAIST)(金 Jaechul人工智能研究生院,韩国科学技术院(KAIST))
AI总结 本文提出面向流形的引导集成梯度(MA-GIG),通过在预训练变分自编码器的潜在空间中构建归因路径,减少非流形区域噪声,提升特征归因的可靠性。
Comments 32 pages, 13 figures, 12 tables. Accepted to ICML 2026; includes appendix
MeshReGen: 一种统一的3D几何再生框架
机构 * KAIST Meta Reality Labs(韩国科学技术院元宇宙实验室)
AI总结 MeshReGen通过基于VecSet的条件机制,实现从2D图像和初始3D形状再生3D对象,支持增强、重建和编辑等任务,无需额外标注即可在多个任务中实现可控的3D生成。
Comments Project page: https://geonyeong-park.github.io/meshregen/ 32 pages, 18 figures, 6 tables. Includes Appendix
SuReNav:基于超像素图的约束放松用于过约束环境中的导航
机构 * School of Computing, Korea Advanced Institute of Science and Technology, Korea(韩国科学技术院计算机学院)
AI总结 本文提出SuReNav方法,通过超像素图构建区域约束,利用图神经网络实现安全高效导航,适用于半静态环境中过约束规划问题,提升导航的人类类比性能。
Comments Accepted by ICRA 2026. Code and videos are available at https://sure-nav.github.io/
稀疏自编码器使CLIP模型的鲁棒且可解释的微调成为可能
机构 * University of Tübingen(图宾根大学) ; KAIST(韩国科学技术院)
AI总结 本文提出SAE-FT方法,通过稀疏自编码器约束视觉表示的变化,实现CLIP模型的鲁棒且可解释的微调,提高下游任务性能同时保持模型鲁棒性。
LoCO:低秩组合旋转微调
机构 * Korea University(韩国大学) ; KAIST(韩国科学技术院) ; INEEJI
AI总结 LoCO提出一种低秩组合旋转微调方法,通过低秩斜对称矩阵构建正交变换,实现高效参数微调,适用于多领域模型适应,展现优于传统正交和非正交方法的性能。
Comments IJCAI 2026
走出舒适区:为RLVR的高效策略引导探索
机构 * KAIST(韩国科学技术院)
AI总结 本文提出NudgeRL框架,通过策略引导实现结构化和多样性探索,提升RLVR在数学基准上的表现,相比标准GRPO和oracle引导方法更高效。
Comments 28 pages, 7 figures
学习动态抓取与放置用于四足机械臂
机构 * Robotics and Artificial Intelligence Lab, KAIST(机器人与人工智能实验室,韩国科学技术院)
AI总结 本文提出一种分层强化学习框架,用于四足机械臂的动态抓取与放置任务,通过模拟和现实实验验证了其在不同负载和工作空间下的高成功率。
Comments Accepted to IEEE Robotics and Automation Letters 2026
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7652-7659, 2026
在关键领域学习:用于鲁棒偏好对齐的几何锚定
机构 * PYLER ; KAIST(韩国科学技术院)
AI总结 GAPO通过动态几何锚定机制改进偏好对齐,通过局部敏感度自适应调整偏好对重要性,减少噪声影响,提升模型鲁棒性。
Comments Under Review
SpeakerLLM:一种面向说话人理解与验证推理的说话人专用音频大语言模型
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; University of Seoul(首尔大学)
AI总结 SpeakerLLM通过统一说话人特征建模、录音条件理解及验证推理,提升音频大语言模型在说话人识别与验证中的性能与准确性。
基于查询的测试时自我训练用于大语言模型
机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院) ; Graduate School of Green Growth and Sustainability, KAIST(韩国科学技术院可持续增长与绿色发展研究生院)
AI总结 本文提出QueST框架,通过直接从输入查询生成查询条件对,实现测试时参数自适应,无需外部数据,在多个基准测试中优于现有方法。
Comments 17 pages, 7 figures
论点重建作为大语言模型批判性思维的监督
机构 * Carnegie Mellon University(卡内基梅隆大学) ; KAIST(韩国科学技术院) ; KIT(卡尔斯鲁厄理工学院)
AI总结 本文提出GAAR引擎和Arguinas数据集,探讨通过论点重建提升大语言模型批判性思维能力,实验显示在七项任务中训练模型表现更优。
AMiD: 基于 α-混合助手分布的大型语言模型知识蒸馏
机构 * Korea Advanced Institute of Science and Technology(韩国先进科学研究院)
AI总结 本文提出AMiD框架,通过引入α-混合助手分布解决LLM知识蒸馏中的容量差距和训练不稳定问题,提供更广泛的理论基础和更稳定的训练效果。
Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)
WarmPrior: 通过时间先验使流匹配策略更加平直
机构 * KAIST(韩国科学技术院) ; Microsoft Research(微软研究院)
AI总结 本文提出WarmPrior,通过利用近期动作历史构建的时间先验,提升机器人操作任务的成功率,改进概率路径并提高样本效率和最终性能。
PREPING:在没有任务的情况下构建代理记忆
机构 * KAIST(韩国科学技术院)
AI总结 本文研究在无任务经验下通过自动生成合成实践构建代理记忆的方法,提出Preping框架,通过Proposer生成任务、Solver执行和Validator验证,提升性能并降低部署成本。
Comments Preprint
PDCR:感知分解置信度奖励用于视觉-语言推理
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) ; University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft Research Asia (MSRA)(微软亚洲研究院)
AI总结 PDCR通过分解任务中的感知与推理步骤,提升视觉-语言推理的训练效果,解决全局奖励导致的信号退化问题。
Comments CVPR 2026
通过超网络驱动的低秩适应生成风格化文本到动作生成
机构 * Visual Media Lab, KAIST(韩国庆熙大学视觉媒体实验室)
AI总结 本文提出轻量级风格条件框架,通过超网络生成LoRA参数动态调节预训练扩散模型,实现高效且通用的风格化动作生成。
Comments Accepted to SIGGRAPH 2026. Project page: https://junhyukjeon.github.io/projects/style-salad/