Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model
8个标记的规划:一种用于潜在世界模型的紧凑离散标记器
机构 * KAIST(韩国科学技术院) ; POSTECH(POSTECH大学) ; RLWRLD
AI总结 本文提出CompACT,一种将观测压缩为8个标记的离散标记器,显著降低计算成本并提升规划效率,为潜在世界模型的实际应用提供可行方案。
Comments CVPR 2026
高校专区
8个标记的规划:一种用于潜在世界模型的紧凑离散标记器
机构 * KAIST(韩国科学技术院) ; POSTECH(POSTECH大学) ; RLWRLD
AI总结 本文提出CompACT,一种将观测压缩为8个标记的离散标记器,显著降低计算成本并提升规划效率,为潜在世界模型的实际应用提供可行方案。
Comments CVPR 2026
通过分层注入条件嵌入进行语音增强
机构 * KAIST(韩国科学技术院)
AI总结 本文提出通过分层注入条件嵌入来提升语音增强效果,有效应对多种退化干扰。
Comments 5 pages, 1 figure, 4 tables, submitted to INTERSPEECH 2026
具有信息瓶颈的分布式强化学习用于不确定性感知的DRAM均衡
机构 * Control Laboratory, School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院控制实验室)
AI总结 本文提出了一种结合信息瓶颈与条件价值-at-风险优化的分布式强化学习框架,用于具有不确定性感知的DRAM均衡优化,实现了显著的性能提升和可靠性改进。
DMD增强的无配对神经施罗德桥用于超低场MRI增强
机构 * Korea University(韩国大学) ; KAIST(韩国科学技术院) ; NYU Langone Health(纽约大学朗格one健康)
AI总结 本文提出了一种基于DMD增强的无配对神经施罗德桥方法,用于提升超低场MRI图像质量,通过结合分布匹配与解剖结构保持正则化器,实现现实感与结构保真的平衡。
隐式偏置:逐样本Adam在可分离数据上的表现:偏离全批量模式
机构 * Seoul National University(首尔国立大学) ; KAIST(韩国科学技术院)
AI总结 本研究揭示增量Adam在可分离数据上的隐式偏置偏离全批量行为,而Signum则保持不变。
Comments Published at ICLR 2026
EgoWorld:利用丰富的外参照观测将外参照视角转换为自身参照视角
机构 * AI Lab, LG Electronics(LG电子人工智能实验室) ; KAIST(韩国科学技术院) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
AI总结 EgoWorld通过重建丰富的外参照观测来实现外参照到自身参照视角的转换,展示了在增强现实、虚拟现实和机器人应用中的先进性能和鲁棒性。
Comments Accepted by ICLR 2026. Project Page: https://redorangeyellowy.github.io/EgoWorld/
学习生成条件三平面以实现3D-aware的表达可控肖像动画
机构 * DeepBrainAI Inc.(DeepBrainAI公司) ; Graduate School of AI, KAIST, South Korea(人工智能研究生院,韩国科学技术院)
AI总结 本文提出Export3D方法,通过三平面生成器实现3D-aware的表达可控肖像动画,有效解决跨身份表情转移中的外观交换问题。
Comments ECCV 2024. Project page: https://export3d.github.io
帧引导:基于帧级信号的无训练引导用于视频扩散模型的可控生成
机构 * KAIST(韩国国立科学技术院) ; NTU Singapore(南洋理工大学) ; Adobe Research(Adobe研究)
AI总结 帧引导通过帧级信号实现无训练的视频生成控制,支持多种任务如关键帧引导、风格化和循环,无需训练即可生成高质量视频。
Comments ICLR 2026. Project page: https://frame-guidance-video.github.io/
ExpGuard: 专门领域中的大语言模型内容审核
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Financial Tech Lab, KakaoBank Corp(Kakao银行金融科技实验室)
AI总结 ExpGuard通过专门领域的大语言模型内容审核模型,有效提升对金融、医疗和法律领域有害内容的防御能力。
Comments ICLR 2026
ForestPersons: 一个大规模数据集用于树冠下失踪人员检测
机构 * Autonomous UAV Research Section, ETRI(ETRI自主无人机研究部) ; Kim Jaechul Graduate School of AI, KAIST(KAIST人工智能研究生院)
AI总结 ForestPersons是一个大规模数据集,用于解决森林树冠下失踪人员检测的挑战,通过提供地面级和低空视角的图像和注释,提升无人机在搜索和救援任务中的人员检测能力。
Comments ICLR 2026 Accepted
基于神经心理学的大型语言模型认知能力评估
机构 * School of Computing, KAIST, Daejeon, South Korea(韩国科学技术院计算机科学学院)
AI总结 本文提出NeuroCognition基准测试,通过神经心理学测试评估LLM的认知能力,揭示其在图像和复杂任务上的不足,并展示其改进LLM的潜力。
Comments 26 pages, 2 figures, 16 tables
辐射一致的高斯 Surfels 用于反演渲染
机构 * School of Computing(计算机学院) ; Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 RadioGS通过引入辐射一致性约束,结合高斯Surfels和二维高斯射线追踪,实现高效的反演渲染,提升对间接光照的建模精度。
Comments 9 pages, 6 figures, ICLR 2026 Oral paper
MSP-LLM:一种用于完整材料合成规划的统一大语言模型框架
机构 * Department of Industrial \& Systems Engineering, KAIST, Daejeon, Korea ; Graduate School of Data Science, KAIST, Daejeon, Republic of Korea ; Korea Research Institute of Chemical Technology, KRICT, Daejeon, Korea
AI总结 MSP-LLM提出一种统一的大语言模型框架,通过整合前驱材料预测和合成操作预测,有效解决材料合成规划问题。
从对话到查询执行:为电子健康记录数据库代理构建用户和工具交互基准
机构 * KAIST(韩国科学技术院) ; NAVER Cloud(NAVER云) ; Samsung Medical Center(三星医疗中心)
AI总结 EHR-ChatQA通过模拟环境评估数据库代理在处理用户查询模糊性和价值不匹配时的性能,揭示了构建安全关键EHR领域中鲁棒代理的重要性。
Comments ICLR 2026
双线性表示缓解反转诅咒并实现一致的模型编辑
机构 * MPI-SP(马克斯·普朗克研究所(德国)) ; SNU(首尔国立大学(韩国)) ; KAIST(韩国科学技术院(韩国))
AI总结 双线性表示缓解语言模型的反转诅咒,通过构建内在几何结构实现一致的模型编辑。
Comments ICLR 2026
利用时间数据库对大语言模型中的事实时间敏感问答进行系统评估
机构 * KAIST(韩国科学技术院) ; William & Mary(威廉与玛丽学院) ; Microsoft Research Asia(微软亚洲研究院)
AI总结 TDBench通过时间数据库技术系统构建TSQA对,引入时间准确性指标,实现大语言模型时间敏感问答的可扩展和全面评估。
Comments Published in Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026. Code and data are publicly available at: https://github.com/ssoy0701/tdbench.git
从潜在空间生成多表时间序列电子健康记录并最小化预处理
机构 * KAIST(韩国科学技术院) ; FuriosaAI
AI总结 RawMed通过最小预处理从潜在空间生成多表时间序列EHR,提升数据保真度和实用性。
Comments Accepted at NeurIPS 2025
刻画模式匹配及其在组合任务结构中的限制
机构 * KAIST AI(韩国科学技术院人工智能研究中心) ; UCL(伦敦大学学院) ; LG AI Research(LG人工智能研究)
AI总结 研究通过形式化模式匹配为函数等价性,分析LLMs在组合任务中的泛化能力及其限制,揭示路径模糊性对模型性能的影响,并提出链式思维的局限性。
Station2Radar: 基于查询条件的高斯散射用于降水场
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
AI总结 Station2Radar通过融合自动天气站观测与卫星图像,实现高效、灵活的实时降水场生成,提升降水预报精度。
Comments This paper was accepted to ICLR 2026
AdaRank: 适应性秩修剪以提升模型融合
机构 * KAIST(韩国科学技术院)
AI总结 AdaRank通过自适应秩修剪技术,有效减少多任务学习中的任务干扰,提升模型融合性能。
Comments ICLR 2026. Code available at: github.com/david3684/AdaRank
通过图像实现高效的物品表示用于LLM推荐系统
机构 * KAIST(韩国科学技术院) ; Amazon Alexa(亚马逊Alexa) ; UC San Diego(加州大学圣地亚哥分校)
AI总结 本文提出I-LLMRec方法,通过利用图像替代文本描述,提高LLM推荐系统的效率和有效性,同时增强对噪声的鲁棒性。
Comments ICLR 2026
可解释的视觉-语言模型社会公平性偏见消除
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; University of Copenhagen(哥本哈根大学) ; NVIDIA(英伟达公司)
AI总结 本研究提出DeBiasLens框架,通过稀疏自编码器局部化VLM中的社会属性神经元,以可解释的方式消除模型中的社会偏见,同时保持语义知识。
Comments 25 pages, 30 figures, 13 Tables Accepted to CVPR 2026
多视角编码器在基于大语言模型的代理工作流性能预测中的应用
机构 * KAIST(韩国科学技术院)
AI总结 本文提出Agentic Predictor,通过多视角编码技术与跨领域预训练,实现高效准确的代理工作流性能预测,提升LLM代理系统设计效率。
Comments ICLR 2026, Project Page: https://deepauto-ai.github.io/agentic-predictor/
Paper2Code: 从科学论文自动生成机器学习代码
机构 * KAIST(韩国科学技术院) ; LG AI Research(LG人工智能研究所)
AI总结 Paper2Code通过多代理LLM框架自动生成机器学习论文的高质量代码实现,有效提升代码生成效率和准确性。
Comments ICLR 2026
无标题,无问题:通过模型拟合嵌入进行无标题成员推断
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
AI总结 本文提出MoFit框架,通过模型拟合嵌入实现无标题成员推断,克服了传统方法对真实标题的依赖,提升了在无标注场景下的成员推断性能。
Comments Accepted to ICLR 2026
超越显式参考策略的改进离散扩散解掩政策
机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院) ; School of Computing, KAIST(计算学院,韩国科学技术院)
AI总结 本文提出了一种基于学习调度器的改进离散扩散解掩策略,通过KL正则化马尔可夫决策过程优化,显著提升了在多个基准测试中的性能。
Comments Accepted to ICLR 2026
EgoAVFlow:通过人类中心视频主动视觉实现机器人策略学习
机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院) ; InnoCORE AI-Transformed Aerospace Research Center, KAIST(AI转型航空航天研究中心,韩国成均馆大学)
AI总结 EgoAVFlow通过共享3D流表示从人类中心视频中学习机器人策略,实现主动视觉和稳健操纵,无需机器人演示。
打破多模态知识驱动视觉问答中的视觉捷径
机构 * Korea University(韩国大学) ; KAIST(韩国科学技术院) ; Amazon(亚马逊)
AI总结 本研究通过RETINA基准和MIMIR方法,打破多模态知识驱动视觉问答中的视觉捷径问题,验证现有模型对捷径的依赖并展示改进效果。
具有长度感知DETR的MomentMix增强技术用于时间鲁棒的时刻检索
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; Sejong University(世宗大学)
AI总结 本文提出Length-Aware Decoder和MomentMix增强技术,通过改进短时刻定位能力,在视频时刻检索任务中取得最佳性能。
Comments WACV 2026
DreamWaQ++: 基于障碍物感知的四足机器人运动控制与鲁棒多模强化学习
机构 * Urban Robotics Lab., School of Electrical Engineering, KAIST(韩国科学技术院电子工程系城市机器人实验室) ; KRAFTON(KRAFTON公司) ; URobotics(URobotics公司) ; Laboratory for Information and Decision Systems (LIDS), MIT(麻省理工学院信息与决策系统实验室)
AI总结 DreamWaQ++通过鲁棒多模强化学习融合本体和外源感觉,实现四足机器人在复杂环境中的鲁棒运动控制与敏捷性能。
Comments IEEE Transactions on Robotics 2026. Project site is available at https://dreamwaqpp.github.io