arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1464
2606.03774 2026-06-03 cs.CV

AmbientEye: A Dataset for Pupil Segmentation under Natural Ambient Infrared Illumination

AmbientEye: 自然环境红外光照下的瞳孔分割数据集

Mingyu Han, Hyunyoung Han, Nitheekulawatn Thommakoon, Gangtae Park, Jieun Han, Xucong Zhang, Ian Oakley

机构 * Electrical Engineering, Korea Advanced Institute of Science and Technology(电子工程系,韩国科学技术院) Intelligent Systems Department, Delft University of Technology(智能系统系,代尔夫特理工大学)

AI总结 本文提出AmbientEye数据集,探索在无主动红外光源、仅依靠环境阳光的户外场景中,利用被动红外相机实现可靠瞳孔检测,并评估现有算法性能下降。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03347 2026-06-03 cs.LG cs.AI stat.ML

AugMask: Training Diffusion Models on Incomplete Tabular Data via Stochastic Augmentation and Masking

AugMask: 通过随机增强和掩码在不完整表格数据上训练扩散模型

Jungkyu Kim, Taeyoung Park, Kibok Lee

机构 * KAIST(韩国科学技术院)

AI总结 提出AugMask训练框架,通过条件随机增强和仅对观测坐标去噪,使标准扩散模型适应缺失表格数据,并连接Rao-Blackwellized目标实现方差加权惩罚,优于专门处理缺失的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03310 2026-06-03 cs.LG cs.AI

Learning Multi-Scale Hypergraph for High-Order Brain Connectivity Analysis

学习多尺度超图用于高阶脑连接分析

Jaeyoon Sim, Soojin Hwang, Seunghun Baek, Guorong Wu, Won Hwa Kim

机构 * KAIST(韩国科学技术院)

AI总结 提出自适应多尺度超边学习框架MuHL,通过构建层次节点特征并动态学习高阶交互,在多个脑网络基准上提升神经退行性疾病分类性能并识别关键脑区。

Comments 24 pages, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03210 2026-06-03 cs.CE cs.LG cs.NA math.NA

Critical evaluation of PINN for FWD inverse analysis and differentiable FEM as an alternative

PINN 在 FWD 反分析中的批判性评估及可微有限元方法作为替代方案

Yongjin Choi, Hyeonbin Moon, Seunghwa Ryu

机构 * KAIST(韩国科学技术院)

AI总结 本文批判性评估了物理信息神经网络(PINN)在多层路面系统落锤式弯沉仪(FWD)反分析中的表现,并提出可微有限元方法(DiffFEM)作为更准确、稳定和高效的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03183 2026-06-03 cs.MM cs.CV cs.SD eess.AS

Inference-Time Scaling for Joint Audio-Video Generation

联合音视频生成的推理时缩放

Jaemin Jung, Kyeongha Rho, Inkyu Shin, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Luma AI

AI总结 针对联合音视频生成中多目标优化的挑战,提出多验证器框架与自适应奖励加权算法,在无需额外训练的情况下显著提升语义对齐、感知质量和音视频同步。

Comments Accepted by Transactions on Machine Learning Research (TMLR). Project page: https://jung-jaemin.github.io/ITS-AVGen-Proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03068 2026-06-03 cs.LG cs.AI

Learn When and Where to Connect: Adaptive Virtual Nodes for Dynamic Message Passing on Graphs

学习何时何地连接:图上动态消息传递的自适应虚拟节点

Jaejun Lee, Joyce Jiyoung Whang

机构 * School of Computing, KAIST(计算机学院,韩国科学技术院) Department of AI Computing, KAIST(人工智能计算系,韩国科学技术院)

AI总结 提出MAVN框架,通过端到端可微分的方式自适应地决定在消息传递神经网络的哪一层为哪些节点引入虚拟节点,并基于双向评分机制建立连接,理论证明其能模拟任意节点-虚拟节点连接模式,实验表明在多个数据集上显著提升骨干网络性能。

Comments 12 pages, 6 figures, 10 tables, 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02588 2026-06-03 cs.LO cs.AI cs.PL

Lean-GAP: A Dataset of Formalized Graduate Algebra Problems

Lean-GAP:形式化研究生代数问题数据集

Seewoo Lee, Byung-Hak Hwang, Hyojae Lim, Jihoon Hyun, Ilkyoo Choi, Yeachan Park, Jineon Baek, Hyukpyo Hong, Keewoo Lee, Jaeseong Heo, Hyungryul Baik, Chul-hee Lee, Kyu-Hwan Lee

机构 * University of California, Berkeley(加州大学伯克利分校) Korea Advanced Institute of Science and Technology(韩国科学技术院) Hanyang University(翰阳大学) Hufs University(Hufs大学) Sungkyunkwan University(成均馆大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Sejong University(世宗大学) University of Connecticut(康涅狄格大学)

AI总结 本文提出Lean-GAP数据集,包含430个来自Dummit和Foote《抽象代数》的形式化研究生代数问题,并开发了从PDF预处理到自动形式化再到验证的可扩展流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20217 2026-06-03 cs.LG cs.AI

KnapSpec: Self-Speculative Decoding via Adaptive Layer Selection as a Knapsack Problem

KnapSpec: 通过自适应层选择作为背包问题的自推测解码

Seongjin Cha, Gyuwan Kim, Dongsu Han, Tao Yang, Insu Han

机构 * KAIST(韩国科学技术院)

AI总结 提出KnapSpec,一种无需训练的框架,将草稿模型选择重新表述为背包问题,通过解耦注意力与MLP层并建模其硬件特定延迟,使用并行动态规划算法自适应确定最优草稿配置,实现令牌吞吐量最大化。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09685 2026-06-03 cs.IR cs.AI cs.MM cs.SD eess.AS

TalkPlayData 2: An Agentic Synthetic Data Pipeline for Multimodal Conversational Music Recommendation

TalkPlayData 2:用于多模态对话式音乐推荐的智能体合成数据流水线

Keunwoo Choi, Seungheon Doh, Juhan Nam

机构 * KAIST(韩国科学技术院)

AI总结 提出TalkPlayData 2,一个由智能体数据流水线生成的多模态对话式音乐推荐合成数据集,通过多角色大语言模型模拟对话并覆盖多种场景,以支持生成式推荐模型训练。

Comments 2025-10-08: updating the stat table with the latest numbers. updated the abstract per the latest license terms

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01698 2026-06-03 cs.IR cs.MM cs.SD eess.AS

TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling

TalkPlay-Tools: 基于大语言模型工具调用的对话式音乐推荐

Seungheon Doh, Keunwoo Choi, Juhan Nam

机构 * KAIST(韩国科学技术院) talkpl.ai

AI总结 提出一种基于LLM工具调用的统一检索-重排序流水线,通过布尔过滤、稀疏检索、稠密检索和生成式检索的组合,实现端到端的对话式音乐推荐。

Comments Accepted for publication at The Workshop on AI for Music, Neural Information Processing Systems (NeurIPS-AI4Music)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13713 2026-06-03 cs.IR cs.SD eess.AS

TALKPLAY: Multimodal Music Recommendation with Large Language Models

TALKPLAY: 基于大语言模型的多模态音乐推荐

Seungheon Doh, Keunwoo Choi, Juhan Nam

机构 * KAIST(韩国科学技术院) talkpl.ai

AI总结 提出TALKPLAY系统,通过将推荐转化为token生成问题,利用大语言模型处理多模态音乐特征,实现端到端对话式推荐,显著优于单模态方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02578 2026-06-02 cs.CV cs.AI

Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

通过感知扰动和奖励建模减轻多模态大语言模型作为评判者中的感知判断偏差

Seojeong Park, Jiho Choi, Junyong Kang, Seonho Lee, Jaeyo Shin, Hyunjung Shim

机构 * University of California, Berkeley(加州大学伯克利分校) KAIST(韩国科学技术院)

AI总结 本文通过构建感知扰动数据集和结合GRPO奖励与批排序目标的统一训练框架,解决了多模态大语言模型作为评判者时因视觉证据与文本线索冲突而产生的感知判断偏差问题,显著提升了感知忠实度和与人类评价的一致性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02491 2026-06-02 cs.CV

MORPHOS: Autoregressive 4D Generation with Temporal Structured Latents

MORPHOS: 基于时间结构化潜变量的自回归4D生成

Minkyung Kwon, Jinhyeok Choi, Youngjin Shin, Jaeyeong Kim, JongMin Lee, Seungryong Kim

机构 * KAIST AI(韩国国立科学技术院人工智能实验室)

AI总结 提出MORPHOS框架,利用时间结构化潜变量(T-SLAT)统一表示4D动态资产,通过自回归因果注意力生成,解决多表示兼容、拓扑变化和长时间一致性问题。

Comments Project page: https://cvlab-kaist.github.io/MORPHOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02479 2026-06-02 cs.CV

Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video Generation

检索缺失内容:面向一致长视频生成的覆盖最大化检索

Minseok Joo, Dogyun Park, Taehoon Lee, Kyujin Lee, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院)

AI总结 提出基于深度的覆盖最大化检索增强生成框架COVRAG,利用预训练3D先验构建轻量级覆盖图作为记忆证据,通过迭代检索最大化残差覆盖来提升长视频生成的几何一致性。

Comments 19 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02404 2026-06-02 cs.CL

K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

K-BrowseComp:基于韩国语境的网页浏览代理基准测试

Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim

机构 * Chung-Ang University(Chung-Ang 大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) OnelineAI NAVER Cloud AI Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对韩国语境,构建包含400个问题的网页浏览代理基准K-BrowseComp,评估前沿模型性能,发现其准确率显著低于BrowseComp,并公开数据与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02096 2026-06-02 cs.CV

WebSpline: Structure-Informed Splines for Real-Time 3D Gaussians from Monocular Videos

WebSpline:面向单目视频实时三维高斯的结构化样条

Jongmin Park, Jeonghwan Yun, Minh-Quan Viet Bui, Munchurl Kim

机构 * KAIST(韩国科学技术院)

AI总结 提出WebSpline框架,利用结构信息样条(SIS)表示和结构代理图(SPG),实现从单目视频中实时、高保真、结构连贯的动态三维高斯重建。

Comments The first two authors contributed equally to this work (equal contribution). Please visit our project page at https://kaist-viclab.github.io/webspline-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02047 2026-06-02 stat.ML cs.LG math.ST stat.ME stat.TH

Convex Distance Operator Transport: A Convex and Geometry-Preserving Formulation

凸距离算子传输:一种凸且保持几何的公式

Junhyoung Chung, Euijong Song, Won Hwa Kim, Gunwoong Park

机构 * KAIST(韩国科学技术院)

AI总结 提出凸距离算子传输(CDOT),通过算子正则化联合保持特征对应与内在几何结构,实现异质分布对齐,并证明其伪度量性质及与Gromov-Wasserstein的关系。

Comments This paper is 41 pages long, contains 6 figures, and has been accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01725 2026-06-02 cs.AI cs.LG

Characterization of Multi-Model Agentic AI Systems on General Tasks via Trace-Driven Simulation

基于迹驱动仿真的通用任务多模型智能体AI系统特征分析

Donghwan Kim, Prakhar Singh, Younghoon Min, Jongryool Kim, Jongse Park, Kiwan Maeng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) SK Hynix(SK海力士) KAIST(韩国科学技术院)

AI总结 本文提出GAIATrace数据集和Vidur-Agent仿真器,通过迹驱动仿真分析多模型智能体AI系统在通用任务上的行为特征。

Comments 13 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01686 2026-06-02 cs.SD cs.AI

HAIM: Human-AI Music Datasets for AI Music Production Tracking Benchmark

HAIM: 用于AI音乐制作跟踪基准的人机音乐数据集

Seonghyeon Go, Yumin Kim

机构 * KAIST(韩国科学技术院)

AI总结 针对当前AI音乐检测局限于二元分类的不足,提出HAIM数据集,通过多阶段标签定义“AI音乐跟踪”任务,评估现有检测器缺陷,推动向细粒度结构化评估转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01021 2026-06-02 cs.CV

Learning Neural Deformation Representation for 4D Dynamic Shape Generation

学习神经变形表示用于4D动态形状生成

Gyojin Han, Jiwan Hur, Jaehyun Choi, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 提出一种新的神经变形表示,结合条件神经符号距离场,设计解耦运动与形状潜在空间的4D表示架构,通过扩散模型生成高质量、高时间一致性的4D动态形状。

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01014 2026-06-02 cs.CV cs.AI

Cross-Axis Feature Fusion with Joint-Wise Motion Difference Prediction for Text-Based 3D Human Motion Editing

基于文本的三维人体运动编辑中的跨轴特征融合与关节运动差异预测

Gyojin Han, Junmo Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

AI总结 提出一种跨轴特征融合架构和辅助任务,通过联合锚定变换器预测关节运动差异,实现文本驱动的三维人体运动编辑,在MotionFix数据集上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00837 2026-06-02 cs.RO cs.LG

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning

粗到细的组合扩散用于长时域规划

Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

机构 * KAIST(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出Coarse-to-Fine Compositional Diffusion (CoFi)方法,通过先形成全局骨架再细化局部细节,在长时域机器人规划、全景图像生成和长视频生成中提升全局一致性和局部质量,同时减少2-8倍去噪评估次数。

Comments Project page: https://cofi-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00460 2026-06-02 cs.CL eess.AS

SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors

SALSA: 通过学习的引导激活向量实现语音感知的LLM适配

Yekaterina Yegorova, Argyrios Gerogiannis, Haolong Zheng, Julia Hockenmaier, Chang D. Yoo, Mark A. Hasegawa-Johnson

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 提出SALSA方法,通过监督学习优化逐层引导向量,在儿童语音、多语种语音和普通话-英语代码切换基准上显著提升零样本推理和语音上下文学习性能,最高相对提升46.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30748 2026-06-02 cs.SD cs.AI eess.AS

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS

Chatterbox-Flash: 用于流式零样本TTS的先验校准块扩散

Deokjin Seo, Gangin Park, Kihyun Nam

机构 * Resemble AI Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

AI总结 提出Chatterbox-Flash,通过将预训练自回归TTS解码器微调为块扩散解码器,实现块内并行生成与块间流式推理,并引入先验校准评分和早期解码调度解决长尾分布导致的生成质量下降问题。

Comments 8 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08646 2026-06-02 cs.LG

Gradient Preconditioning for Efficient and Reliable Reward-Guided Generation

梯度预处理实现高效可靠的奖励引导生成

Jisung Hwang, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

AI总结 提出一种梯度预处理方法,通过将奖励梯度投影到白高斯噪声可行集上,实现一步生成模型在奖励引导生成中的高效性和可靠性,防止奖励黑客攻击并加速优化。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01711 2026-06-02 cs.RO cs.LG

Contrastive Representation Regularization for Vision-Language-Action Models

视觉-语言-动作模型的对比表示正则化

Taeyoung Kim, Jimin Lee, Myungkyu Koo, Dongyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

AI总结 提出机器人状态感知对比损失(RS-CL),通过对比学习对齐VLM表示与机器人本体感受状态,提升VLA模型在机器人操作任务中的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01752 2026-06-02 cs.LG

Robust Linear Dueling Bandits with Post-serving Context under Unknown Delays and Adversarial Corruptions

鲁棒线性决斗赌博机:在未知延迟和对抗性破坏下的服务后上下文

Youngmin Oh

机构 * KAIST(韩国科学技术院)

AI总结 针对同时存在服务后上下文、延迟反馈和对抗性破坏的易变环境,提出RCDP-UCB算法,通过预测服务后上下文和自适应加权策略,实现了延迟无关的遗憾上界,并揭示了破坏与延迟之间的加性成本结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18077 2026-06-02 cs.AI cs.LG cs.MA

LLM-Guided Communication for Cooperative Multi-Agent Reinforcement Learning

LLM引导的通信用于合作多智能体强化学习

Sangjun Bae, Yisak Park, Sanghyeon Lee, Seungyul Han

机构 * KAIST(韩国科学技术院)

AI总结 提出LMAC框架,利用大语言模型的推理能力设计通信协议,使所有智能体尽可能准确一致地重建底层状态,从而提升多智能体强化学习中的状态重建和性能。

Comments 9 pages for main, 32 pages for total, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16451 2026-06-02 cs.LG cs.AI

Physics-Guided Geometric Diffusion for Macro Placement Generation

物理引导的几何扩散用于宏单元布局生成

Jongho Yoon, Jinsung Jeon, Seokhyeong Kang

机构 * POSTECH Institute of Artificial Intelligence(POSTECH人工智能研究所) KAIST InnoCORE LLM(韩国科学技术院InnoCORE语言模型实验室) Seoul National University(首尔国立大学) Pohang University of Science and Technology(釜山科学技术大学)

AI总结 提出MacroDiff+框架,通过双域去噪架构和物理引导采样策略,在宏单元布局中同时优化拓扑连接和物理约束,在ISPD2005 MMS基准上实现线长减少6.1-6.2%。

Comments Accepted to IJCAI 2026. 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13178 2026-06-02 cs.CV cs.AI

CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models

CLIP Tricks You: 面向大型视觉-语言模型中高效像素定位的无训练令牌剪枝

Sangin Lee, Yukyung Choi

机构 * KAIST(韩国科学技术院)

AI总结 提出LiteLVLM,一种无需训练、文本引导的令牌剪枝策略,通过反转CLIP视觉-文本相似度排序,保留指代区域令牌并恢复上下文令牌,实现高效像素定位推理,在多种令牌预算下性能提升超5%,保持90%原始性能同时加速22%并减少2.3倍内存。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏