arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1464
2603.05438 2026-03-06 cs.CV cs.AI cs.RO

Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model

8个标记的规划:一种用于潜在世界模型的紧凑离散标记器

Dongwon Kim, Gawon Seo, Jinsung Lee, Minsu Cho, Suha Kwak

机构 * KAIST(韩国科学技术院) POSTECH(POSTECH大学) RLWRLD

AI总结 本文提出CompACT,一种将观测压缩为8个标记的离散标记器,显著降低计算成本并提升规划效率,为潜在世界模型的实际应用提供可行方案。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05302 2026-03-06 cs.SD

SLICE: Speech Enhancement via Layer-wise Injection of Conditioning Embeddings

通过分层注入条件嵌入进行语音增强

Seokhoon Moon, Kyudan Jung, Jaegul Choo

机构 * KAIST(韩国科学技术院)

AI总结 本文提出通过分层注入条件嵌入来提升语音增强效果,有效应对多种退化干扰。

Comments 5 pages, 1 figure, 4 tables, submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04768 2026-03-06 cs.LG

Distributional Reinforcement Learning with Information Bottleneck for Uncertainty-Aware DRAM Equalization

具有信息瓶颈的分布式强化学习用于不确定性感知的DRAM均衡

Muhammad Usama, Dong Eui Chang

机构 * Control Laboratory, School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院控制实验室)

AI总结 本文提出了一种结合信息瓶颈与条件价值-at-风险优化的分布式强化学习框架,用于具有不确定性感知的DRAM均衡优化,实现了显著的性能提升和可靠性改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03769 2026-03-06 cs.CV cs.AI cs.LG

DMD-augmented Unpaired Neural Schrödinger Bridge for Ultra-Low Field MRI Enhancement

DMD增强的无配对神经施罗德桥用于超低场MRI增强

Youngmin Kim, Jaeyun Shin, Jeongchan Kim, Taehoon Lee, Jaemin Kim, Peter Hsu, Jelle Veraart, Jong Chul Ye

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) NYU Langone Health(纽约大学朗格one健康)

AI总结 本文提出了一种基于DMD增强的无配对神经施罗德桥方法,用于提升超低场MRI图像质量,通过结合分布匹配与解剖结构保持正则化器,实现现实感与结构保真的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26303 2026-03-05 cs.LG cs.AI math.OC stat.ML

Implicit Bias of Per-sample Adam on Separable Data: Departure from the Full-batch Regime

隐式偏置:逐样本Adam在可分离数据上的表现:偏离全批量模式

Beomhan Baek, Minhak Song, Chulhee Yun

机构 * Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

AI总结 本研究揭示增量Adam在可分离数据上的隐式偏置偏离全批量行为,而Signum则保持不变。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17896 2026-03-05 cs.CV cs.AI

EgoWorld: Translating Exocentric View to Egocentric View using Rich Exocentric Observations

EgoWorld:利用丰富的外参照观测将外参照视角转换为自身参照视角

Junho Park, Andrew Sangwoo Ye, Taein Kwon

机构 * AI Lab, LG Electronics(LG电子人工智能实验室) KAIST(韩国科学技术院) Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

AI总结 EgoWorld通过重建丰富的外参照观测来实现外参照到自身参照视角的转换,展示了在增强现实、虚拟现实和机器人应用中的先进性能和鲁棒性。

Comments Accepted by ICLR 2026. Project Page: https://redorangeyellowy.github.io/EgoWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00636 2026-03-05 cs.CV cs.AI cs.MM

Learning to Generate Conditional Tri-plane for 3D-aware Expression Controllable Portrait Animation

学习生成条件三平面以实现3D-aware的表达可控肖像动画

Taekyung Ki, Dongchan Min, Gyeongsu Chae

机构 * DeepBrainAI Inc.(DeepBrainAI公司) Graduate School of AI, KAIST, South Korea(人工智能研究生院,韩国科学技术院)

AI总结 本文提出Export3D方法,通过三平面生成器实现3D-aware的表达可控肖像动画,有效解决跨身份表情转移中的外观交换问题。

Comments ECCV 2024. Project page: https://export3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07177 2026-03-04 cs.CV cs.AI

Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models

帧引导:基于帧级信号的无训练引导用于视频扩散模型的可控生成

Sangwon Jang, Taekyung Ki, Jaehyeong Jo, Jaehong Yoon, Soo Ye Kim, Zhe Lin, Sung Ju Hwang

机构 * KAIST(韩国国立科学技术院) NTU Singapore(南洋理工大学) Adobe Research(Adobe研究)

AI总结 帧引导通过帧级信号实现无训练的视频生成控制,支持多种任务如关键帧引导、风格化和循环,无需训练即可生成高质量视频。

Comments ICLR 2026. Project page: https://frame-guidance-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02588 2026-03-04 cs.CL

ExpGuard: LLM Content Moderation in Specialized Domains

ExpGuard: 专门领域中的大语言模型内容审核

Minseok Choi, Dongjin Kim, Seungbin Yang, Subin Kim, Youngjun Kwak, Juyoung Oh, Jaegul Choo, Jungmin Son

机构 * KAIST AI(韩国科学技术院人工智能研究所) Financial Tech Lab, KakaoBank Corp(Kakao银行金融科技实验室)

AI总结 ExpGuard通过专门领域的大语言模型内容审核模型,有效提升对金融、医疗和法律领域有害内容的防御能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02541 2026-03-04 cs.CV

ForestPersons: A Large-Scale Dataset for Under-Canopy Missing Person Detection

ForestPersons: 一个大规模数据集用于树冠下失踪人员检测

Deokyun Kim, Jeongjun Lee, Jungwon Choi, Jonggeon Park, Giyoung Lee, Yookyung Kim, Myungseok Ki, Juho Lee, Jihun Cha

机构 * Autonomous UAV Research Section, ETRI(ETRI自主无人机研究部) Kim Jaechul Graduate School of AI, KAIST(KAIST人工智能研究生院)

AI总结 ForestPersons是一个大规模数据集,用于解决森林树冠下失踪人员检测的挑战,通过提供地面级和低空视角的图像和注释,提升无人机在搜索和救援任务中的人员检测能力。

Comments ICLR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02540 2026-03-04 cs.AI

A Neuropsychologically Grounded Evaluation of LLM Cognitive Abilities

基于神经心理学的大型语言模型认知能力评估

Faiz Ghifari Haznitrama, Faeyza Rishad Ardi, Alice Oh

机构 * School of Computing, KAIST, Daejeon, South Korea(韩国科学技术院计算机科学学院)

AI总结 本文提出NeuroCognition基准测试,通过神经心理学测试评估LLM的认知能力,揭示其在图像和复杂任务上的不足,并展示其改进LLM的潜力。

Comments 26 pages, 2 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01491 2026-03-03 cs.CV cs.GR

Radiometrically Consistent Gaussian Surfels for Inverse Rendering

辐射一致的高斯 Surfels 用于反演渲染

Kyu Beom Han, Jaeyoon Kim, Woo Jae Kim, Jinhwan Seo, Sung-eui Yoon

机构 * School of Computing(计算机学院) Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 RadioGS通过引入辐射一致性约束,结合高斯Surfels和二维高斯射线追踪,实现高效的反演渲染,提升对间接光照的建模精度。

Comments 9 pages, 6 figures, ICLR 2026 Oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07543 2026-03-03 cs.AI cond-mat.mtrl-sci

MSP-LLM: A Unified Large Language Model Framework for Complete Material Synthesis Planning

MSP-LLM:一种用于完整材料合成规划的统一大语言模型框架

Heewoong Noh, Gyoung S. Na, Namkyeong Lee, Chanyoung Park

机构 * Department of Industrial \& Systems Engineering, KAIST, Daejeon, Korea Graduate School of Data Science, KAIST, Daejeon, Republic of Korea Korea Research Institute of Chemical Technology, KRICT, Daejeon, Korea

AI总结 MSP-LLM提出一种统一的大语言模型框架,通过整合前驱材料预测和合成操作预测,有效解决材料合成规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23415 2026-03-03 cs.AI

From Conversation to Query Execution: Benchmarking User and Tool Interactions for EHR Database Agents

从对话到查询执行:为电子健康记录数据库代理构建用户和工具交互基准

Gyubok Lee, Woosog Chay, Heeyoung Kwak, Yeong Hwa Kim, Haanju Yoo, Oksoon Jeong, Meong Hi Son, Edward Choi

机构 * KAIST(韩国科学技术院) NAVER Cloud(NAVER云) Samsung Medical Center(三星医疗中心)

AI总结 EHR-ChatQA通过模拟环境评估数据库代理在处理用户查询模糊性和价值不匹配时的性能,揭示了构建安全关键EHR领域中鲁棒代理的重要性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21993 2026-03-03 cs.AI cs.LG

Bilinear representation mitigates reversal curse and enables consistent model editing

双线性表示缓解反转诅咒并实现一致的模型编辑

Dong-Kyum Kim, Minsung Kim, Jea Kwon, Nakyeong Yang, Meeyoung Cha

机构 * MPI-SP(马克斯·普朗克研究所(德国)) SNU(首尔国立大学(韩国)) KAIST(韩国科学技术院(韩国))

AI总结 双线性表示缓解语言模型的反转诅咒,通过构建内在几何结构实现一致的模型编辑。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02045 2026-03-03 cs.CL

Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models

利用时间数据库对大语言模型中的事实时间敏感问答进行系统评估

Soyeon Kim, Jindong Wang, Xing Xie, Steven Euijong Whang

机构 * KAIST(韩国科学技术院) William & Mary(威廉与玛丽学院) Microsoft Research Asia(微软亚洲研究院)

AI总结 TDBench通过时间数据库技术系统构建TSQA对,引入时间准确性指标,实现大语言模型时间敏感问答的可扩展和全面评估。

Comments Published in Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026. Code and data are publicly available at: https://github.com/ssoy0701/tdbench.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06996 2026-03-03 cs.LG cs.AI

Generating Multi-Table Time Series EHR from Latent Space with Minimal Preprocessing

从潜在空间生成多表时间序列电子健康记录并最小化预处理

Eunbyeol Cho, Jiyoun Kim, Minjae Lee, Sungjin Park, Edward Choi

机构 * KAIST(韩国科学技术院) FuriosaAI

AI总结 RawMed通过最小预处理从潜在空间生成多表时间序列EHR,提升数据保真度和实用性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20278 2026-03-03 cs.LG cs.AI cs.CL

Characterizing Pattern Matching and Its Limits on Compositional Task Structures

刻画模式匹配及其在组合任务结构中的限制

Hoyeon Chang, Jinho Park, Hanseul Cho, Sohee Yang, Miyoung Ko, Hyeonbin Hwang, Seungpil Won, Dohaeng Lee, Youbin Ahn, Minjoon Seo

机构 * KAIST AI(韩国科学技术院人工智能研究中心) UCL(伦敦大学学院) LG AI Research(LG人工智能研究)

AI总结 研究通过形式化模式匹配为函数等价性,分析LLMs在组合任务中的泛化能力及其限制,揭示路径模糊性对模型性能的影响,并提出链式思维的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00418 2026-03-03 cs.CV

Station2Radar: query conditioned gaussian splatting for precipitation field

Station2Radar: 基于查询条件的高斯散射用于降水场

Doyi Kim, Minseok Seo, Changick Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 Station2Radar通过融合自动天气站观测与卫星图像,实现高效、灵活的实时降水场生成,提升降水预报精度。

Comments This paper was accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22178 2026-03-03 cs.LG cs.AI cs.CV

AdaRank: Adaptive Rank Pruning for Enhanced Model Merging

AdaRank: 适应性秩修剪以提升模型融合

Chanhyuk Lee, Jiho Choi, Chanryeol Lee, Donggyun Kim, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

AI总结 AdaRank通过自适应秩修剪技术,有效减少多任务学习中的任务干扰,提升模型融合性能。

Comments ICLR 2026. Code available at: github.com/david3684/AdaRank

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06238 2026-03-03 cs.IR cs.AI

Token-Efficient Item Representation via Images for LLM Recommender Systems

通过图像实现高效的物品表示用于LLM推荐系统

Kibum Kim, Sein Kim, Hongseok Kang, Jiwan Kim, Heewoong Noh, Yeonjun In, Kanghoon Yoon, Jinoh Oh, Julian McAuley, Chanyoung Park

机构 * KAIST(韩国科学技术院) Amazon Alexa(亚马逊Alexa) UC San Diego(加州大学圣地亚哥分校)

AI总结 本文提出I-LLMRec方法,通过利用图像替代文本描述,提高LLM推荐系统的效率和有效性,同时增强对噪声的鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24014 2026-03-02 cs.CV cs.AI

Interpretable Debiasing of Vision-Language Models for Social Fairness

可解释的视觉-语言模型社会公平性偏见消除

Na Min An, Yoonna Jang, Yusuke Hirota, Ryo Hachiuma, Isabelle Augenstein, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) University of Copenhagen(哥本哈根大学) NVIDIA(英伟达公司)

AI总结 本研究提出DeBiasLens框架,通过稀疏自编码器局部化VLM中的社会属性神经元,以可解释的方式消除模型中的社会偏见,同时保持语义知识。

Comments 25 pages, 30 figures, 13 Tables Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19764 2026-03-02 cs.LG cs.AI

Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows

多视角编码器在基于大语言模型的代理工作流性能预测中的应用

Patara Trirat, Wonyong Jeong, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

AI总结 本文提出Agentic Predictor,通过多视角编码技术与跨领域预训练,实现高效准确的代理工作流性能预测,提升LLM代理系统设计效率。

Comments ICLR 2026, Project Page: https://deepauto-ai.github.io/agentic-predictor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17192 2026-03-02 cs.CL

Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning

Paper2Code: 从科学论文自动生成机器学习代码

Minju Seo, Jinheon Baek, Seongyun Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) LG AI Research(LG人工智能研究所)

AI总结 Paper2Code通过多代理LLM框架自动生成机器学习论文的高质量代码实现,有效提升代码生成效率和准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22689 2026-02-27 cs.CV cs.CR

No Caption, No Problem: Caption-Free Membership Inference via Model-Fitted Embeddings

无标题,无问题:通过模型拟合嵌入进行无标题成员推断

Joonsung Jeon, Woo Jae Kim, Suhyeon Ha, Sooel Son, Sung-Eui Yoon

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出MoFit框架,通过模型拟合嵌入实现无标题成员推断,克服了传统方法对真实标题的依赖,提升了在无标注场景下的成员推断性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05725 2026-02-27 cs.LG cs.AI cs.CL

Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies

超越显式参考策略的改进离散扩散解掩政策

Chunsan Hong, Seonho An, Min-Soo Kim, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院) School of Computing, KAIST(计算学院,韩国科学技术院)

AI总结 本文提出了一种基于学习调度器的改进离散扩散解掩策略,通过KL正则化马尔可夫决策过程优化,显著提升了在多个基准测试中的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22461 2026-02-27 cs.RO

EgoAVFlow: Robot Policy Learning with Active Vision from Human Egocentric Videos via 3D Flow

EgoAVFlow:通过人类中心视频主动视觉实现机器人策略学习

Daesol Cho, Youngseok Jang, Danfei Xu, Sehoon Ha

机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院) InnoCORE AI-Transformed Aerospace Research Center, KAIST(AI转型航空航天研究中心,韩国成均馆大学)

AI总结 EgoAVFlow通过共享3D流表示从人类中心视频中学习机器人策略,实现主动视觉和稳健操纵,无需机器人演示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22843 2026-02-27 cs.CV

Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering

打破多模态知识驱动视觉问答中的视觉捷径

Dosung Lee, Sangwon Jung, Boyoung Kim, Minyoung Kim, Sungyeon Kim, Junyoung Sung, Paul Hongsuck Seo

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Amazon(亚马逊)

AI总结 本研究通过RETINA基准和MIMIR方法,打破多模态知识驱动视觉问答中的视觉捷径问题,验证现有模型对捷径的依赖并展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20816 2026-02-27 cs.CV cs.AI

MomentMix Augmentation with Length-Aware DETR for Temporally Robust Moment Retrieval

具有长度感知DETR的MomentMix增强技术用于时间鲁棒的时刻检索

Seojeong Park, Jiho Choi, Kyungjune Baek, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Sejong University(世宗大学)

AI总结 本文提出Length-Aware Decoder和MomentMix增强技术,通过改进短时刻定位能力,在视频时刻检索任务中取得最佳性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19709 2026-02-27 cs.RO cs.SY eess.SY

DreamWaQ++: Obstacle-Aware Quadrupedal Locomotion With Resilient Multi-Modal Reinforcement Learning

DreamWaQ++: 基于障碍物感知的四足机器人运动控制与鲁棒多模强化学习

I Made Aswin Nahrendra, Byeongho Yu, Minho Oh, Dongkyu Lee, Seunghyun Lee, Hyeonwoo Lee, Hyungtae Lim, Hyun Myung

机构 * Urban Robotics Lab., School of Electrical Engineering, KAIST(韩国科学技术院电子工程系城市机器人实验室) KRAFTON(KRAFTON公司) URobotics(URobotics公司) Laboratory for Information and Decision Systems (LIDS), MIT(麻省理工学院信息与决策系统实验室)

AI总结 DreamWaQ++通过鲁棒多模强化学习融合本体和外源感觉,实现四足机器人在复杂环境中的鲁棒运动控制与敏捷性能。

Comments IEEE Transactions on Robotics 2026. Project site is available at https://dreamwaqpp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏