arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 206
2606.09855 2026-06-12 cs.MM cs.CV cs.LG 新提交

MinhwaNet: Faithful but Insufficient Object Grounding in Korean Folk Painting

MinhwaNet: 韩国民俗画中忠实但不足的对象定位

Joonhyung Bae

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 提出MinhwaNet,通过部分级检测器生成对象证据图,发现韩国民俗画中符号列表不足以预测画作类型,而符号布局更重要,揭示了忠实但不足的解离现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12300 2026-06-11 cs.CV cs.AI 新提交

Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical Decomposition

自然语言在小时级视频中的时间定位是一个搜索问题:基准与经验分解

Sukmin Seo, Geewook Kim

机构 * NAVER Cloud AI KAIST AI(韩国科学技术院人工智能系)

AI总结 针对小时级视频的自然语言时间定位,提出搜索是主要瓶颈而非识别,发布首个开放小时级定位基准ExtremeWhenBench,并通过检索-定位混合方法显著提升性能。

Comments 10 pages, 6 figures, Code and benchmark: https://github.com/naver-ai/ExtremeWhenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11568 2026-06-11 cs.CV 新提交

4DP-QA: Scalable QA for 4D Perception in Vision Language Models

4DP-QA:面向视觉语言模型中4D感知的可扩展问答

Seokju Cho, Abhishek Badki, Hang Su, Jindong Jiang, Ziyao Zeng, Seungryong Kim, Sifei Liu, Orazio Gallo

机构 * NVIDIA(英伟达) Yale University(耶鲁大学) KAIST AI(韩国科学技术院人工智能学院)

AI总结 针对视觉语言模型难以理解动态场景的问题,提出一种关注运动场景理解的问答生成流水线,通过真运动追踪解耦物体与相机运动,生成大规模数据集4DP-QA和基准4DP-QA-Bench,训练现有模型在外部基准上取得性能提升。

Comments Project page: https://research.nvidia.com/labs/lpr/4dpqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11236 2026-06-11 cs.NE cs.CV cs.LG 新提交

A2SG:Adaptive and Asymmetric Surrogate Gradients for Training Deep Spiking Neural Networks

A2SG:用于训练深度脉冲神经网络的适应性和非对称替代梯度

Yechan Kang, Yongjin Kweon, Mingyeong Seo, Sohee Park, Yeonguk Jeon, Jongkil Park, Hyun Jae Jang, Jaewook Kim, YeonJoo Jeong, Suyoun Lee, Seongsik Park

机构 * KAIST(韩国科学技术院)

AI总结 提出适应性和非对称替代梯度(A2SG)框架,通过自适应窗口调整梯度方向一致性、非对称梯度反映神经元动态,降低梯度变化并促进收敛到平坦最小值,在多种SNN模型和任务上提升精度与能效。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11180 2026-06-10 cs.CV 新提交

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

Lip Forcing: 用于实时唇部同步的少步自回归扩散

Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee, Joungbin Lee, Siyoon Jin, Heeseong Shin, Jung Yi, Yunjin Park, Chulmin Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) AIPARK

AI总结 提出Lip Forcing,首个用于视频到视频唇部同步的自回归扩散方法,通过蒸馏14B教师模型为因果学生模型,仅需两步去噪即可实现实时同步,并引入同步窗口DMD、两步推理计划和SyncNet奖励。

Comments Project Page: https://cvlab-kaist.github.io/LipForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11172 2026-06-10 cs.LG 新提交

Predicting Future Behaviors in Reasoning Models Enables Better Steering

推理模型中预测未来行为以实现更好的引导

Evgenii Kortukov, Piotr Komorowski, Florian Klein, Paula Engl, Gabriele Sarti, Seong Joon Oh, Sebastian Lapuschkin, Wojciech Samek

机构 * Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所) Northeastern University(东北大学) KAIST(韩国科学技术院)

AI总结 通过训练激活探针预测推理模型未来行为,提出未来探针控制生成(FPCG)方法,在多个评估中实现几乎无质量下降的引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10835 2026-06-10 cs.LG cs.AI 新提交

Geometrically Averaged Hard Target Updates for Linear Q-Learning

线性Q学习的几何平均硬目标更新

Donghwan Lee

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院)

AI总结 提出λ-几何加权平均的周期目标更新方法,用于线性Q学习,通过切换系统模型分析其稳定性,连接了单周期更新和投影Q值迭代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10614 2026-06-10 cs.RO cs.CV cs.LG 新提交

Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations

灵巧点策略:从人类演示中学习基于点的灵巧手策略

Beomjun Kim, Seong Hyeon Park, Seunghoon Sim, Seungjun Moon, Sanghyeok Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

AI总结 提出Dexterous Point Policy框架,通过统一3D关键点表示从人类视频学习灵巧操作策略,无需机器人演示,在真实任务中达到75%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10276 2026-06-10 cs.RO cs.AI 新提交

Hierarchical Policies from Verbal and Egocentric Human Signals for Natural Human-Robot Interaction

基于语言和自我中心人类信号的分层策略用于自然人机交互

Dongjun Lee, Juheon Choi, Dong Kyu Shin, Sinjae Kang, Kimin Lee

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学)

AI总结 提出EDITH框架,通过智能眼镜捕捉人类第一人称视角、注视和语言信号,设计分层策略将非语言信号与语言指令结合,实现更自然的人机交互,减少用户表达意图的负担。

Comments We provide video demos and code in: https://project-edith.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09668 2026-06-09 cs.LG 新提交

Algorithm for Contextual Queueing Bandits with Rate-Optimal Queue Length Regret

具有速率最优队列长度遗憾的上下文队列赌博机算法

Seoungbin Bae, Dabeen Lee

机构 * KAIST(韩国科学技术院) Seoul National University(首尔大学)

AI总结 针对上下文队列赌博机问题,提出三阶段算法CQB-η-2,通过仅在截止轮前进行随机探索,将队列长度遗憾从Õ(T^{-1/4})改进到Õ(T^{-1/2}),并证明该速率在最小最大意义下最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09124 2026-06-09 cs.AI 新提交

A Regret Minimization Framework on Preference Learning in Large Language Models

大语言模型中偏好学习的遗憾最小化框架

Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee

机构 * KAIST(韩国科学技术院)

AI总结 提出基于遗憾的偏好优化方法RePO,通过遗憾最小化而非奖励最大化来建模人类偏好,在数学推理和人类偏好数据集上取得一致性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09030 2026-06-09 cs.LG cs.AI cs.CL 新提交

TRIAGE: Dialectical Reasoning for Explainable Risk Prediction on Irregularly Sampled Medical Time Series with LLMs

TRIAGE: 基于辩证推理的不规则采样医学时间序列风险可解释预测方法

Hyeongwon Jang, Gyouk Chu, Changhun Kim, Joonhyung Park, Hangyul Yoon, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 提出TRIAGE框架,利用大语言模型对竞争性临床结果生成辩证推理,缓解风险极化,实现连续风险评分与可解释推理,在三个基准上AUPRC提升3.3%,校准误差降低81%。

Comments Code is available at https://github.com/HyeongWon-Jang/TRIAGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08935 2026-06-09 cs.LG cs.AI 新提交

PAI: Preserving Amplitude Information in Representation-Based Time-Series Anomaly Detection

PAI:在基于表示的时间序列异常检测中保留振幅信息

Kang Zhang, Wei Jian Lau, Shoushou Ren, Dong Lin, Joon Son Chung, Chuanhao Sun

机构 * HUAWEI(华为) KAIST(韩国科学技术院)

AI总结 针对现有基于表示的时间序列异常检测方法忽略振幅信息导致性能下降的问题,提出PAI方案,通过诊断模块和分数增强函数融合振幅相关分数,在TSB-AD-U-Eva和TAB UV数据集上平均VUS-PR提升98.4%和36.8%。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08814 2026-06-09 cs.AI cs.LG 新提交

STAR: Rethinking MoE Routing as Structure-Aware Subspace Learning

STAR: 将MoE路由重新思考为结构感知的子空间学习

Sumin Park, Noseong Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 提出STAR方法,通过广义Hebbian算法学习主子空间来增强路由对输入结构的感知,实现专家稳定专业化,在合成数据和语言视觉任务上提升路由质量和下游性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08804 2026-06-09 cs.AI cs.LG 新提交

Q-Delta: Beyond Key-Value Associative State Evolution

Q-Delta:超越键值关联状态演化

Sumin Park, Seojin Kim, Noseong Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 提出Q-Delta,一种查询感知的delta规则,将混合键-查询预测误差融入状态演化,实现联合校正动态,在语言建模和长上下文检索任务上优于强基线。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08672 2026-06-09 cs.CV cs.LG 新提交

Learning to Solve Generative ODEs Beyond the Linear Span

学习求解生成式常微分方程:超越线性跨度

Sihyeon Kim, Seunghun Lee, Vikas Singh, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 针对扩散和流生成模型中ODE求解器步数多的问题,提出SpanLift轻量神经求解器,通过空间残差算子增强标量系数更新,实现少步采样且不增加模型NFE,在多个任务上达到最先进性能。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08634 2026-06-09 cs.CV 新提交

SSAFE: Simple and Strong AI-Generated Image Detection via Frozen Vision Encoders

SSAFE: 通过冻结视觉编码器实现简单而强大的AI生成图像检测

Seunghyun Lee, Byoungkwon Kim, Jaehyun Nam, Kyungmin Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Google Cloud AI(谷歌云AI)

AI总结 本文发现冻结的多模态视觉编码器在嵌入空间中自然分离真实与合成图像,通过线性分类器即可实现强检测性能,并提出一种表示感知的数据策展策略,仅用10K图像训练,在多个基准上表现优异。

Comments Preprint. 22 pages, 10 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08243 2026-06-09 cs.CL 新提交

Building Comparative Motivation Profiles with Instrumental Interventions

构建带有工具性干预的比较动机概况

David Vella Zarb, Rustem Turtayev, Taywon Min, Jinghua Ou, Shi Feng

机构 * MATS University of Cambridge(剑桥大学) KAIST(韩国科学技术院) George Washington University(乔治华盛顿大学)

AI总结 通过对称工具性干预区分对齐伪装中的策略性自我保护与研究者期望追踪,发现模型对期望追踪更敏感,提示需要构念效度检验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08200 2026-06-09 cs.AI cs.LG 新提交

Online Agent-as-a-Judge: Situation-Generating Evaluation for Interactive Agents

在线智能体作为裁判:面向交互式智能体的情境生成评估

Hyogon Ryu, Jeonghwan Kim, Yewon Lim, Chaeun Lee, Jeongwook Kim, Donghoon Ham

机构 * KAIST(韩国科学技术院)

AI总结 提出在线智能体作为裁判框架,通过部署环境内评估智能体主动生成相关情境,以评估交互式社交智能体的能力,提高标准覆盖率和与人类标签的一致性。

Comments ICML 2026 Workshop on Trustworthy AI for Good

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08041 2026-06-09 cs.GR cs.CV 新提交

Wispy to Voluminous: Prior-free Multi-view Capture of Strand-level Facial Hair

从稀疏到浓密:无先验的多视角面部毛发级联重建

Jaeseong Lee, Giljoo Nam, Adrian Jarabo, Carlos Aliaga

机构 * KAIST(韩国科学技术院) Meta Codec Avatar Lab(Meta 编码人像实验室) Meta Reality Labs Research(Meta现实实验室)

AI总结 提出从多视角图像自动重建面部毛发(胡须、眉毛等)的管线,将无结构3D高斯表示转换为显式曲线发丝,解决几何歧义,实现高保真发丝重建。

Comments 27 pages, 16 figures, supplementary included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07999 2026-06-09 cs.AI 新提交

Efficient Skill Grounding via Code Refactoring with Small Language Models

通过小型语言模型的代码重构实现高效技能落地

Sera Choi, Wonje Choi, Saehun Chun, Daehee Lee, Jooyoung Kim, Chaeun Lee, Honguk Woo

机构 * KAIST(韩国科学技术院)

AI总结 提出RECENT框架,通过将技能语义与执行绑定解耦,利用小型语言模型进行代码重构实现高效技能落地,在动态环境中达到与大型语言模型相当的性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07837 2026-06-09 cs.HC cs.AI 新提交

Does Persona Make LLMs K-pop Fans? A Pilot Study of LLM-Based Online Concert Audience Agents

角色设定会让LLM成为K-pop粉丝吗?基于LLM的在线演唱会观众智能体初步研究

Kirak Kim, Hyojin Kim, Yejin Son, Sungyoung Kim, Kyung Myun Lee

机构 * Graduate School of Culture Technology, KAIST, Daejeon, South Korea(韩国成均馆大学文化科技研究生院) Department of Artificial Intelligence, Yonsei University, Seoul, South Korea(延世大学人工智能系)

AI总结 研究通过多智能体系统模拟K-pop演唱会实时粉丝聊天,发现角色设定能提升聊天质量和自然度,但未增强社交连接或情感反应,表明有意义的集体体验需更深层次对齐。

Comments Accepted at the ICML 2026 Workshop on Culture x AI: Evaluating AI as a Cultural Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07694 2026-06-09 cs.LG stat.ML 新提交

Vessel Traffic Flow Prediction on Sparse Data via Spatio-Temporal Graph Neural Networks with a Learnable Tweedie Head

基于可学习Tweedie头的时空图神经网络在稀疏数据上的船舶交通流预测

Kyeongjun Lee, Heeyoung Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 针对船舶交通流数据高度稀疏且间歇性爆发的问题,提出一种模型无关的可学习Tweedie头作为即插即用输出模块,通过优化闭合形式的Tweedie单元偏差并预测均值,同时学习节点级方差幂以捕获港口区域异质性,在真实AIS数据上显著提升RMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07673 2026-06-09 cs.SD cs.AI cs.LG 新提交

A Hierarchical Feature Engineering Framework for Automated Classification of Phonotraumatic and Non-Phonotraumatic Vocal Hyperfunction

声带创伤性与非声带创伤性声音亢进的自动分类的分层特征工程框架

June-Woo Kim, Kangwook Jang, Minu Kim, Hyunju Lee

机构 * Department of Electronic Engineering, Wonkwang University(圆光大学电子工程系) AI Convergence Research Institute, Wonkwang University(圆光大学人工智能融合研究院) GIST InnoCORE AI-Nano Convergence Institute for Early Detection of Neurodegenerative Diseases, Gwangju Institute of Science and Technology(光州科学技术院GIST InnoCORE AI-Nano神经退行性疾病早期检测融合研究所) School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院) Department of AI Convergence, Gwangju Institute of Science and Technology(光州科学技术院人工智能融合系)

AI总结 提出分层特征工程框架,包括静态、动态、比率和耦合特征,用于区分声带创伤性和非声带创伤性声音亢进,发现耦合特征对两类分类均关键,PVH AUC 0.891,NPVH AUC 0.728。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07617 2026-06-09 cs.LG cs.AI 新提交

Query Lens: Interpreting Sparse Key-Value Features with Indirect Effects

Query Lens: 通过间接效应解释稀疏键值特征

Hwiyeong Lee, Ingyu Bang, Uiji Hwang, Hyelim Lim, Taeuk Kim

机构 * KAIST(韩国科学技术院)

AI总结 提出Query Lens方法,通过考虑编码器侧键特征和解码器侧值特征以及下游模块的间接效应,实现对稀疏自编码器特征更全面、忠实的解释。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06813 2026-06-08 cs.CV cs.AI 新提交

Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation

打破锁定:通过表示调制实现文本到图像生成的多样化

Dahee Kwon, Haeun Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院)

AI总结 针对文本到图像模型在固定提示下生成样本过于相似的问题,提出无训练表示级干预方法DAVE,通过选择性衰减早期生成中的零频空间平均分量来增强多样性,保持图像质量且计算开销极小。

Comments Accepted to ICML 2026. Code is available at: https://github.com/daheekwon/DAVE

详情

展开后加载摘要…

URL PDF HTML 收藏