arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1464
2605.22015 2026-05-22 cs.CV cs.AR

ORBIS: Output-Guided Token Reduction with Distribution-Aware Matching for Video Diffusion Acceleration

ORBIS: 通过分布感知匹配的输出引导标记减少以加速视频扩散

Hangyeol Lee, Joo-Young Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出ORBIS,一种针对视频扩散Transformer的SW-HW协同设计加速器,通过利用前一时间步的输出激活获得更准确的token相似性,从而提高匹配质量并实现更高的标记减少比例,同时引入分布感知标记匹配算法和专用硬件设计,实现比现有方法更高的标记减少率、更快的速度和更低的能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22011 2026-05-22 cs.CV

Rethinking Token Reduction for Diffusion Models via Output-Similarity-Awareness

重新思考扩散模型的token减少:通过输出相似性意识

Hangyeol Lee, Hyojeong Lee, Joo-Young Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出DiTo,一种基于输出中心的token减少方法,通过利用相邻时间步的输出相似性来建立token对应关系,从而减少计算复杂度并提高生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21999 2026-05-22 cs.LG

Toward Understanding Adversarial Distillation: Why Robust Teachers Fail

迈向理解对抗蒸馏:为何鲁棒教师失败

Hongsin Lee, Hye Won Chung

机构 * School of Electrical Engineering, KAIST, Daejeon, Korea(韩国科学技术院电子工程学院)

AI总结 本文研究了对抗蒸馏中鲁棒教师与学生鲁棒性之间的关系,揭示了教师监督信心与学生表示限制之间的不匹配导致鲁棒过拟合现象,并提出了理论框架和实验验证。

Comments Accepted to ICML 2026. Code is available at https://github.com/HongsinLee/why-robust-teachers-fail

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21958 2026-05-22 cs.CL

Diagnosis Is Not Prescription: Linguistic Co-Adaptation Explains Patching Hazards in LLM Pipelines

诊断并非处方:语言共适应解释了LLM流水线中的修补危害

Yoon Jeonghun, Kim Dongchan

机构 * KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院) NAVER Corp.(NAVER公司)

AI总结 本文研究了多模块LLM代理失败时,诊断与修补之间的矛盾,发现路由模块虽为瓶颈,但注入修正示例反而降低性能,而修正查询重写模块则更有效,提出了语言合同假说解释这种现象。

Comments Preprint. Under review at EMNLP 2026 (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20268 2026-05-22 cs.LG eess.SP stat.ML

Reliable Wireless Indoor Localization via Cross-Validated Prediction-Powered Calibration

通过交叉验证的预测驱动校准实现可靠的无线室内定位

Seonghoon Yoo, Houssem Sifaou, Sangwoo Park, Joonhyuk Kang, Osvaldo Simeone

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电子工程学院) King’s Communications, Learning & Information Processing (KCLIP) Lab, Centre for Intelligent Information Processing Systems (CIIPS), Department of Engineering, King’s College London(伦敦国王学院信息与通信实验室,智能信息处理系统中心,工程系) Institute for Intelligent Networked Systems, Northeastern University London(伦敦东北大学智能网络系统研究所)

AI总结 本文提出一种利用有限校准数据同时优化预测器和估计合成标签偏差的方法,通过交叉验证预测驱动校准提高无线室内定位的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24472 2026-05-21 cs.CL cs.LG

Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?

为什么自蒸馏(有时)会降低大语言模型的推理能力?

Jeonghye Kim, Xufang Luo, Minbeom Kim, Sangmook Lee, Dohyung Kim, Jiwon Jeon, Dongsheng Li, Yuqing Yang

机构 * Microsoft Research(微软研究院) KAIST(韩国成均馆大学) Seoul National University(首尔国立大学)

AI总结 本文研究了自蒸馏在数学推理中降低大语言模型推理能力的原因,发现其通过抑制模型在推理过程中的不确定性表达,导致在未见过的问题上表现下降,强调了适当表达不确定性对鲁棒推理的重要性。

Comments Code is available at https://github.com/beanie00/self-distillation-analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21086 2026-05-21 cs.CL

LoCar: Localization-Aware Evaluation of In-Vehicle Assistants through Fine-Grained Sociolinguistic Control

LoCar: 通过细粒度社会语言学控制评估车载助手的本地化

Seogyeong Jeong, Kiwoong Park, Seyoung Song, Eunsu Kim, Ken E. Friedl, Jaeho Kim, Alice Oh

机构 * KAIST(韩国科学技术院) BMW Group(宝马集团)

AI总结 本文提出了一种新的车载助手评估框架,专注于韩语本地化,揭示了当前LLM在细粒度韩语敬语控制方面的不稳定性以及策略性对话指标上的表现不足,强调了汽车AI需要向精确语言定制和可靠安全交互管理发展。

Comments To appear in ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21061 2026-05-21 cs.CV cs.AI cs.RO

Grounding Driving VLA via Inverse Kinematics

通过逆运动学接地驾驶VLA

Junsung Park, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) KimJaeChul AI Graduate School(金 JaeChul人工智能研究生院)

AI总结 本文提出通过逆运动学求解器重新设计驾驶VLA,以解决轨迹预测中对视觉token的忽略问题,通过引入视觉状态预测和逆运动学网络,提升了视觉接地和轨迹规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20910 2026-05-21 cs.CV

FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching

FlowLong: 通过流形约束的 Tweedie 匹配实现推理时的长视频生成

Jangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye

机构 * KAIST(韩国科学技术院) Amazon(亚马逊)

AI总结 本文提出了一种新的推理时长视频生成方法,通过流形约束的Tweedie匹配在重叠滑动窗口中生成长视频,同时保持时间和空间一致性,并且无需额外训练。

Comments Project Page: https://flowlong-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20624 2026-05-21 cs.CV cs.AI cs.LG

Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models

用自回归扩散模型加速视频逆问题求解器

Taesung Kwon, Jonghyun Park, Hyungjin Chung, Jong Chul Ye

机构 * KAIST(韩国科学技术院) EverEx

AI总结 本文提出自回归视频逆问题求解器(AVIS),通过自回归扩散模型实现流式视频恢复,显著降低初始延迟并提高吞吐量,同时保持高质量的恢复效果,并进一步提出加速变体AVIS Flash,实现更高的吞吐量和更优的效率-性能权衡,为实时部署铺平道路。

Comments Project page is available here: https://avis-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19376 2026-05-21 cs.AI

Generative Recursive Reasoning

生成性递归推理

Junyeob Baek, Mingyu Jo, Minsu Kim, Mengye Ren, Yoshua Bengio, Sungjin Ahn

机构 * KAIST(韩国科学技术院) Mila – Québec AI Institute(魁北克人工智能研究所) New York University(纽约大学) Université de Montréal(蒙特利尔大学)

AI总结 本文提出Gram框架,通过将递归潜在推理转化为概率多轨迹计算,解决了传统递归推理模型的确定性问题,实现了条件推理和无条件生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11661 2026-05-21 cs.LG cs.AI

Towards Autonomous Mechanistic Reasoning in Virtual Cells

向虚拟细胞中的自主机理推理迈进

Yunhui Jang, Lu Zhu, Jake Fawkes, Alisandra Kaye Denton, Dominique Beaini, Emmanuel Noutahi

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Valence Labs(Valence实验室) University College London(伦敦大学学院)

AI总结 本文提出了一种结构化解释形式化方法,用于虚拟细胞中的生物推理,通过机理动作图实现系统验证和反驳,并引入VCR-Agent多智能体框架,结合生物基础知识检索和基于验证器的过滤方法,生成并验证机理推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03019 2026-05-21 q-bio.GN cs.CL

DNACHUNKER: Learnable Tokenization for DNA Language Models

DNACHUNKER: 用于DNA语言模型的可学习分词

Taewon Kim, Jihwan Shin, Hyomin Kim, Youngmok Jung, Jonghoon Lee, Won-Chul Lee, Sungsoo Ahn, Insu Han

机构 * Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院) Department of Electrical Engineering, KAIST(韩国科学技术院电气工程系) Inocras Korea Inc.(Inocras韩国公司)

AI总结 本文提出DNACHUNKER,一种可学习的DNA分词方法,通过动态分段模块生成上下文依赖的变长单元,提升DNA语言模型在基因组序列处理中的鲁棒性和效率。

Comments ICML 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19075 2026-05-21 cs.AI cs.CL cs.LG

Universal Reasoner: A Single, Composable Plug-and-Play Reasoner for Frozen LLMs

Universal Reasoner: 一个单一、可组合的即插即用推理器用于冻结的LLM

Jaemin Kim, Hangeol Chang, Hyunmin Hwang, Choonghan Kim, Jong Chul Ye

机构 * Graduate School of Artificial Intelligence, Korea Advanced Institute of Science and Technology(人工智能研究生院,韩国科学技术院)

AI总结 本文提出Universal Reasoner,一种可组合且即插即用的推理模块,能够在冻结的大规模语言模型上提供专门的推理能力,通过共享或对齐的token空间实现弱到强的泛化,实验表明其在数学推理和机器翻译中优于现有微调方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08976 2026-05-21 stat.ML cs.LG math.ST stat.TH

Computational-Statistical Trade-off in Kernel Two-Sample Testing with Random Fourier Features

核两样本检验中计算与统计的权衡:随机傅里叶特征

Ikjun Choi, Ilmun Kim

机构 * Department of Statistics and Data Sciences, The University of Texas at Austin(德克萨斯大学奥斯汀分校统计与数据科学系) Department of Mathematical Sciences, KAIST(韩国科学技术院数学科学系)

AI总结 本文研究了使用随机傅里叶特征近似MMD检验在计算复杂度与统计功效之间的权衡,证明通过合理选择随机特征数量可以在亚二次时间内达到与MMD检验相同的最小最大分离率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20388 2026-05-21 cs.CV

How You Move Tells What You'll Do: Trajectory-Conditioned Egocentric Prediction

如何移动决定了将来的行动:轨迹条件的自身视角预测

Sejoon Jun, Hai Nguyen-Truong, Luigi Seminara, Lorenzo Torresani

机构 * Khoury College of Computer Sciences, Northeastern University, Boston(北德文斯克学院,东北大学,波士顿) Korea Advanced Institute of Science and Technology, Daejeon(韩国科学技术院,大田) Department of Mathematics and Computer Science, University of Catania, Italy(卡塔尼亚大学数学与计算机科学系,意大利)

AI总结 该研究通过轨迹条件自身视角预测,发现轨迹能更精确地表达意图,从而在任务规划中优于语言条件,且在预测时无需观察轨迹即可获得显著优势。

Comments Project page: https://farsightlab.github.io/TrajPilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20292 2026-05-21 cs.LG

TreeText-CTS: Compact, Source-Traceable Tree-Path Evidence for Irregular Clinical Time-Series Prediction

TreeText-CTS: 用于不规则临床时间序列预测的紧凑、可追溯的树路径证据

Kwanhyung Lee, Juhwan Choi, Jongheon Kim, Joohyung Lee, Hyeongwon Jang, Eunho Yang

机构 * Kim Jaechul Graduate School of AI, KAIST(金 Jaechul人工智能研究生院,韩国科学技术院)

AI总结 本文提出TreeText-CTS,一种用于不规则临床时间序列预测的紧凑、可追溯的树路径证据方法,通过冻结XGBoost模型生成多尺度窗口摘要,并将激活的树路径转换为确定性、可追溯的证据单元,从而在多个数据集上实现了最佳的AUROC和AUPRC性能。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20258 2026-05-21 cs.LG cs.AI cs.CR

It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs

需要两人:互补的自我蒸馏用于大语言模型中的上下文完整性

Sangwoo Park, Woongyeong Yeo, Seanie Lee, Yumin Choi, Hyomin Lee, Kangsan Kim, Jinheon Baek, Seong Joon Oh, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

AI总结 本文提出SELFCI框架,通过分离信息抑制与任务解决,解决大语言模型中隐私与效用的权衡问题,通过互补的自我蒸馏方法提升上下文完整性。

Comments 28 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20249 2026-05-21 cs.LG cs.AI

Automated Kernel Discovery Towards Understanding High-dimensional Bayesian Optimization

面向高维贝叶斯优化理解的自动核发现

Taeyoung Yun, Woocheol Shin, Inhyuck Song, Jaewoo Lee, Jinkyoo Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出了一种基于大语言模型的进化框架,用于高维贝叶斯优化中的自动核发现,通过扩展核空间并避免依赖观测条件,提高了高维问题中核设计的有效性。

Comments 36 pages, 27 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20222 2026-05-21 quant-ph cs.LG

Quantum End-to-End Learning for Contextual Combinatorial Optimization

量子端到端学习用于上下文组合优化

Jaehwan Lee, Changhyun Kwon

机构 * KAIST(韩国科学技术院) Omelet

AI总结 本文提出量子端到端学习框架QEL,用于解决上下文组合优化问题,通过量子近似优化算法实现端到端训练,有效捕捉上下文、不确定系数和最优解之间的复杂关系,避免调用NP难优化求解器,展现出在量子时代应用的潜力。

Comments 23 pages, 2 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20079 2026-05-20 cs.CV cs.AI cs.LG eess.IV

Probability-Conserving Flow Guidance

概率守恒的流引导

Parsa Esmati, Junha Hyung, Amirhossein Dadashzadeh, Jaegul Choo, Majid Mirmehdi

机构 * University of Bristol(布里斯托大学) KAIST(韩国科学技术院)

AI总结 本文提出了一种概率守恒的流引导方法AdaMaG,通过分析连续方程,将引导效果分解为发散项和分数平行项,并通过时间依赖的调度和分数平行衰减来控制这两个项,从而在不增加推理成本的情况下提高生成质量并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20006 2026-05-20 cs.AI

GeoX: Mastering Geospatial Reasoning Through Self-Play and Verifiable Rewards

GeoX:通过自我对战和可验证奖励掌握地理空间推理

Kyeongjin Ahn, Seungeon Lee, Krishna P. Gummadi, Meeyoung Cha

机构 * KAIST(韩国科学技术院) MPI-SP(马克斯·普朗克研究所) MPI-SWS(马克斯·普朗克研究所)

AI总结 本文提出GeoX框架,通过自我对战和可验证奖励解决图像 grounded 的复杂空间问题,无需大规模人工标注数据,提升了基础视觉语言模型在地理空间理解上的性能。

Comments 26 pages,12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16062 2026-05-20 cs.LG

Gauge-Equivariant Graph Networks via Self-Interference Cancellation

通过自干扰消除的 gauge-等变图网络

Yoonhyuk Choi, Jiho Choi, Jiwoo Kang

机构 * Department of Artificial Intelligence, Sookmyung Women's University, Seoul, South Korea(首尔大学女子大学人工智能系) Korea Advanced Institute of Science and Technology, Seoul, South Korea(韩国科学技术院)

AI总结 本文提出了一种通过自干扰消除的 gauge-等变图网络(GESC),该网络通过投影机制替代传统的加法聚合,有效处理异质图中的自干扰问题,从而提升模型在异质图上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19631 2026-05-20 cs.RO cs.CV

HEAT: Heterogeneous End-to-End Autonomous Driving via Trajectory-Guided World Models

HEAT: 基于轨迹引导的世界模型实现异构端到端自动驾驶

Hoonhee Cho, Giwon Lee, Jae-Young Kang, Hyemin Yang, Heejun Park, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 本文提出一种基于轨迹引导的学习方法,通过规划轨迹组织训练,使模型能够捕捉驾驶意图的领域不变表示,并结合预测未来潜在特征的世界模型,提高特征一致性并缓解领域偏见,从而在多个异构数据集上实现强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19355 2026-05-20 cs.GR cs.AI cs.CV cs.LG

Skinned Motion Retargeting with Spatially Adaptive Interaction Guidance

具有空间自适应交互引导的皮肤运动重定向

Soojin Choi, Seokhyeon Hong, Chaelin Kim, Junghyun Nam, Junhyuk Jeon, Junyong Noh

机构 * Visual Media Lab(视觉媒体实验室) KAIST(韩国科学技术院)

AI总结 本文提出了一种几何感知的运动重定向框架,通过在空间自适应锚点上进行接近匹配,保留交互语义,以解决在不同身体形状角色之间重定向运动时保持交互语义(如自接触和近身体接近)的挑战。

Comments SIGGRAPH 2026 / ACM TOG. Project page available at https://suzyn.github.io/space_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19317 2026-05-20 cs.LG cs.AI

Inference-Time Scaling in Diffusion Models through Iterative Partial Refinement

通过迭代部分细化在扩散模型中实现推理时间扩展

Taegu Kang, Jaesik Yoon, Sungjin Ahn

机构 * KAIST(韩国科学技术院)

AI总结 本文提出了一种无需外部验证器的扩散模型推理时间扩展方法Iterative Partial Refinement,通过在混合噪声条件下迭代部分细化生成更一致的样本,在MNIST Sudoku任务中提升了有效解率。

Comments Accepted at the ICLR 2026 Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19206 2026-05-20 cs.RO

CLUE: Adaptively Prioritized Contextual Cues by Leveraging a Unified Semantic Map for Effective Zero-Shot Object-Goal Navigation

CLUE: 通过利用统一语义地图实现适应性优先级上下文线索

Taeyun Kim, Alvin Jinsung Choi, Dasol Hong, Hyun Myung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

AI总结 CLUE通过利用统一语义地图,采用适应性优先级上下文线索的方法,有效解决零样本物体-目标导航问题,提高了导航的鲁棒性和效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17889 2026-05-20 cs.LG

CoX-MoE: Coalesced Expert Execution for High-Throughput MoE Inference with AMX-Enabled CPU-GPU Co-Execution

CoX-MoE: 通过AMX启用的CPU-GPU协同执行提升高吞吐量MoE推理的协同专家执行

Muyoung Son, Yi Chen, Seungjae Yoo, Soongyu Choi, Joo-Young Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出CoX-MoE,一种通过AMX启用的CPU-GPU协同系统,通过协同专家执行和战略工作负载编排优化MoE推理,提升吞吐量。CoX-MoE引入了coalescing-aware orchestration策略和静态专家-aware分层方案,分别优化资源分配和减少PCIe传输开销,从而在吞吐量上比现有框架提升7.1倍和2.4倍。

Comments 7 pages, 8 figures, accepted to DAC '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11089 2026-05-20 cs.CV

Structured State-Space Regularization for Generation-Friendly Image Tokenization

结构化状态空间正则化用于生成友好的图像标记化

Jinsung Lee, Jaemin Oh, Namhun Kim, Dongwon Kim, Byung-Jun Yoon, Suha Kwak

机构 * POSTECH Brown University(布朗大学) KAIST(韩国科学技术院) Texas A&M University(德克萨斯大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

AI总结 本文提出结构化状态空间正则化方法,通过诱导潜在空间的频谱结构提升图像标记化生成性能,同时保持重建保真度。

Comments Related blog posts in https://jinsingsangsung.github.io/collections/blog/ : Towards 2-Dimensional State-Space Models series

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25620 2026-05-20 cs.CL

PICon: A Multi-Turn Interrogation Framework for Evaluating Persona Agent Consistency

PICon: 一种用于评估人设代理一致性的多轮询问框架

Minseo Kim, Sujeong Im, Junseong Choi, Junhee Lee, Chaeeun Shim, Hwajung Hong, Edward Choi

机构 * KAIST(韩国科学技术院)

AI总结 本文提出PICon框架,通过逻辑链式的多轮提问评估人设代理的一致性,发现即使之前被认为高度一致的系统在三个维度上也未能达到人类基准水平,揭示了矛盾和逃避回应。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏