arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1464
2606.21588 2026-06-23 eess.IV cs.CV 新提交

Unsupervised Susceptibility Distortion Correction of EPI without Calibration Scans via Image Translation-Based Registration

无需校准扫描的EPI无监督磁敏感畸变校正:基于图像翻译的配准方法

Wooseung Kim, Sung-Hong Park

机构 * Department of Bio and Brain Engineering, Korea Advanced Institute of Science and Technology(生物与脑工程系,韩国科学技术院)

AI总结 提出SACRED框架,利用可逆神经网络进行BOLD与T1w图像翻译,结合无监督配准实现EPI几何畸变校正,无需额外校准扫描,在分布内和分布外数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23557 2026-06-23 cs.CV 新提交

Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

基于全局地图与局部视图的多视角3D推理的密集奖励

Jiho Choi, Seonho Lee, Seojeong Park, Hyunjung Shim

机构 * Graduate School of Artificial Intelligence, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) KRAFTON, Republic of Korea(韩国KRAFTON公司)

AI总结 提出DR-MV3D框架,通过全局一致性奖励和局部轨迹奖励对多视角3D VQA的中间推理过程进行密集监督,提升跨视图推理一致性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23217 2026-06-23 cs.CL cs.AI 新提交

MuPPET: A Benchmark for Contextual Privacy of LLM Assistants in Multi-Party Conversations

MuPPET:多轮对话中LLM助手上下文隐私的基准测试

Elena Sofia Ruzzetti, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Rome Tor Vergata(罗马第二大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) KAIST AI(韩国科学技术院人工智能研究所)

AI总结 提出MuPPET基准,评估多用户对话中LLM代理的隐私泄露风险,发现模型在多用户场景下泄露更严重,现有防御措施效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22975 2026-06-23 cs.LG 新提交

TaLK: Text-attributed Graph Dataset Distillation via Coupling Language Model with Graph-Aware Kernel

TaLK: 通过耦合语言模型与图感知核的文本属性图数据集蒸馏

Yeongho Kim, Yeonje Choi, Kijung Shin

机构 * Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院)

AI总结 提出TaLK方法,通过耦合语言模型与图感知神经切线核实现文本属性图的高效数据集蒸馏,避免重复联合训练,仅用1%合成数据即可达到97%的全数据集性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22874 2026-06-23 cs.LG cs.AI 新提交

SpotAttention: Plug-In Block-Sparse Routing for Pretrained Long-Context Transformers

SpotAttention: 面向预训练长上下文Transformer的即插即用块稀疏路由

Huzama Ahmad, Se-Young Yun

机构 * KAIST(韩国科学技术院)

AI总结 提出SpotAttention,一种轻量级选择器,通过KL蒸馏学习估计注意力分布,实现块稀疏路由,在长上下文任务中匹配密集注意力精度并显著加速解码。

Comments 24 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22866 2026-06-23 cs.LG cs.AI 新提交

Discovering Crystal Structure Prediction Algorithms with an AI Co-Scientist

利用AI合作科学家发现晶体结构预测算法

Kiyoung Seong, Nayoung Kim, Sungsoo Ahn

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 提出人机协同发现系统HACO,通过跨域搜索和稀疏人类引导,从视觉领域引入掩码生成模型MaskGIT用于晶体结构预测,并改进为MaskGXT,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22785 2026-06-23 cs.SI cs.CL cs.CR 新提交

Cross-National Information Attacks: A Two-Decade Analysis of Troll Behavior in Korea

跨国信息攻击:韩国巨魔行为的二十年分析

Jaehong Kim, Hyeonseung Kim, Jiseon Kim, Alice Oh, Thorsten Holz, Wonjae Lee, Meeyoung Cha

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学研究院) Max Planck Institute for Security and Privacy (MPI-SP)(马克斯·普朗克安全与隐私研究所)

AI总结 提出可解释机器学习框架,对韩国112M条新闻评论进行检测,识别出23,998个疑似协调操纵账户,发现其依赖道德谴责修辞而非直接宣传外国叙事,且此类修辞获得更高用户参与,主要针对国内政治人物,可能加剧两极分化。

Comments Accepted at the 35th USENIX Security Symposium (USENIX Security '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22251 2026-06-23 cs.RO 新提交

Geometric Reconstruction of Extrinsic Contact Trajectories using Tactile Sensing and Proprioception for Tool Manipulation

利用触觉感知和本体感觉进行工具操作中外在接触轨迹的几何重建

Seojung Min, Yoonjin Kim, Jeong-Jung Kim, Jung Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Korea Institute of Machinery and Materials(韩国机械与材料研究院)

AI总结 提出一种基于触觉感知和机器人本体感觉重建工具尖端外在接触轨迹的方法,通过单点接触假设和校准段估计全局接触位置,结合连续接触下的相对运动估计,实现实时轨迹重建。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21670 2026-06-23 cs.SD cs.AI cs.LG 新提交

Improving Text-to-Music Generation with Human Preference Rewards

利用人类偏好奖励改进文本到音乐生成

Yonghyun Kim, Junwon Lee, Haiwen Xia, Yinghao Ma, Chris Donahue

机构 * Georgia Tech(佐治亚理工学院) KAIST(韩国科学技术院) Peking University(北京大学) Queen Mary University of London(伦敦玛丽女王大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出结合人类偏好奖励(TuneJury)的文本到音乐生成方法,通过训练时奖励条件化、专家迭代、偏好微调等五项工程决策,在ATTM挑战中提升FAD-CLAP和CLAP分数。

Comments ICME 2026 Grand Challenge on Academic Text-to-Music Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21453 2026-06-23 cs.HC cs.AI cs.SD eess.AS 新提交

CORTIS: Text-Only Adaptation of Spoken Language Models for Task-Oriented Voice Agents

CORTIS:面向任务型语音代理的纯文本口语语言模型适配

Youngwon Choi, Hyeonyu Kim, Taeyoun Kwon, Donghyuk Jung, Myeongkyun Cho

机构 * Maum AI Inc.(马姆人工智能公司) Seoul National University(首尔国立大学) Korea Culture Technology Institute(韩国文化科技研究所) KAIST(韩国科学技术院)

AI总结 提出CORTIS框架,通过纯文本任务监督微调口语语言模型,实现推理时直接生成结构化输出,无需配对语音-目标数据,在声学退化下优于级联方法。

Comments Submitted to EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21378 2026-06-23 cs.LG 新提交

Enhancing Creativity in 3D Generative Design via a TRIZ-Inspired Text-to-CAD Framework

通过TRIZ启发的文本到CAD框架增强3D生成设计的创造力

Dongeon Lee, Leekyo Jeong, Soyoung Yoo, Sunwoong Yang, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, KAIST, Daejeon, Republic of Korea(韩国科学技术院(KAIST)赵正植移动研究生院,大田,韩国) Samsung Electronics, Suwon, Republic of Korea(三星电子,水原,韩国) Department of Mechanical Engineering, Hanyang University, Ansan, Republic of Korea(汉阳大学机械工程系,安山,韩国) Narnia Labs, Daejeon, Republic of Korea(纳尼亚实验室,大田,韩国)

AI总结 提出TRIZ启发的文本到CAD框架,利用LLM生成可编辑CAD模型并系统探索创新设计方案,通过三阶段流程实现结构多样性与质量优化,案例显示质量减少4.0-14.7%。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21157 2026-06-23 cs.SD eess.AS 新提交

SDP-Codec: A Speaker-Decoupled Speech Codec with Pitch Injection for Low-Bitrate Coding and Zero-Shot Voice Conversion

SDP-Codec:一种带有音高注入的说话人解耦语音编解码器,用于低比特率编码和零样本语音转换

Hounsu Kim, Juhan Nam

机构 * Graduate School of Culture Technology, KAIST(韩国科学技术院文化技术研究生院)

AI总结 提出SDP-Codec,通过单阶段优化从预训练自监督编码器中提取局部令牌并注入归一化F0,实现说话人解耦,在低比特率下达到竞争性重构和强零样本语音转换,且说话人泄露最少。

Comments Accepted to Interspeech 2026. Code and demo: https://github.com/hanshounsu/sdpcodec-open/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21098 2026-06-23 cs.CL cs.AI 新提交

LLM-Based Multi-Reference Evaluation for Efficient and Robust Assessment of Phrase Break Annotations

基于LLM的多参考评估方法用于短语边界标注的高效稳健评估

Younghan Park, Hoyeon Lee, Hawon Jeong, Jong-Hwan Kim

机构 * NAVER Cloud(NAVER云) Yonsei University(延世大学) KAIST AI(韩国科学技术院人工智能)

AI总结 提出基于LLM的多参考评估方法(LMRE),通过生成多个有效短语边界解决单参考评估的局限性,在韩语测试中与人类判断一致性更强。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21096 2026-06-23 cs.LG cs.AI 新提交

SLeDGe: Semi-Supervised Learning on Data Streams with Graph Structure Learning

SLeDGe: 基于图结构学习的数据流半监督学习

Heechan Moon, Kijung Shin

机构 * KAIST(韩国科学技术院)

AI总结 提出SLeDGe方法,通过联合学习预测模型和自适应图结构,在严格内存和标签约束下实现数据流半监督学习,在12个数据集上平均相对准确率提升31.7%(0.1%标签)和14.8%(1%标签)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21020 2026-06-23 cs.CV cs.AI 新提交

CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays

CheXpercept: 评估胸部X光片中专家级病变感知的基准

Geon Choi, Hangyul Yoon, Nalee Kim, Jeong Yun Jang, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医疗中心) Konkuk University Medical Center(建国大学医疗中心)

AI总结 提出CheXpercept基准,通过粗粒度检测、细粒度轮廓评估与修正、语义级属性提取三个层次评估视觉语言模型在胸部X光片上的专家级病变感知能力,发现当前模型仅在粗粒度任务上表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20754 2026-06-23 cs.RO 新提交

Perturbation-Based Uncertainty for Failure Detection in Vision-Language-Action Models

基于扰动的视觉-语言-动作模型不确定性用于故障检测

Yousung Lee, Dongsoo Har

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 提出一种无标签、模型无关的扰动框架,通过注入高斯扰动到隐藏激活中估计认知不确定性,在分布偏移下提升故障检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20246 2026-06-23 cs.RO cs.AI 新提交

Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think

微调视觉-语言-动作模型所需的层数比你想象的少

Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tung M. Luu, Tuan Dam, Vu Duong, Trung Le, Nghi D. Q. Bui, Minh Vu, Tran Nguyen Le, An Thai Le, Ngan Le, Daniel Sonntag, James Zou, Jan Peters, Duy M. H. Nguyen, Ngo Anh Vien

机构 * Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) VinRobotics University of Arkansas(阿肯色大学) Technical University of Denmark(丹麦技术大学) Hanoi University of Science and Technology(河内科技大学) KAIST(韩国科学技术院) Monash University(莫纳什大学) Oldenburg University(奥尔登堡大学) DFKI(德国人工智能研究中心) University of Stuttgart(斯图加特大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院) Stanford University(斯坦福大学) Technische Universität Darmstadt(达姆施塔特工业大学)

AI总结 本文发现VLA模型存在层间表示冗余,提出无需训练的压缩方法,通过去除冗余层将模型深度减少50%,实现40-50%训练加速和30%推理加速,性能不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20118 2026-06-23 cs.RO cs.LG 新提交

Pose6DAug: Physically Plausible Multi-view Object Swapping for Robot Data Augmentation

Pose6DAug: 用于机器人数据增强的物理合理多视图物体替换

Jonghoon Lee, Seong Hyeon Park, Byungwoo Jeon, Minha Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Korea University(韩国大学) RLWRLD

AI总结 提出Pose6DAug,一种基于失败驱动的数据增强框架,通过3D网格和6D姿态轨迹替换成功轨迹中的物体,生成多视图一致的物理合理演示,无需额外数据收集,在新型物体上提升VLA策略成功率16.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17276 2026-06-23 cs.IR cs.LG 新提交

On the Memorization Behavior of LLMs in Generative Recommendation: Observations, Implications, and Training Strategies

LLM在生成式推荐中的记忆行为:观察、启示与训练策略

Sunwoo Kim, Sunkyung Lee, Clark Mingxuan Ju, Donald Loveland, Bhuvesh Kumar, Kijung Shin, Neil Shah, Liam Collins

机构 * KAIST(韩国科学技术院) Sungkyunkwan University(成均馆大学) Snap Inc.(Snap公司)

AI总结 研究LLM在生成式推荐中的记忆倾向,发现其过度依赖一跳记忆,提出IIRG训练策略以学习多跳协同与语义关系,显著提升对非一跳记忆用户的推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09178 2026-06-23 cs.CL cs.AI 新提交

Culturally-Adapted Red-Teaming Across East and Southeast Asian Contexts: A Methodological and Comparative Analysis

跨东亚和东南亚语境的文化适应红队测试:方法论与比较分析

Hyeji Choi, Yongtaek Lim, Minwoo Kim

机构 * University of California, Berkeley(加州大学伯克利分校) Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 针对大语言模型的多语言安全评估,通过构建直接翻译与文化适应数据集,发现文化适应提示的攻击成功率平均提升9.3个百分点,直接翻译低估风险,且文化深度评分显著低于文化适应版本,表明适应文化语境对有效评估至关重要。

Comments Accepted to ICML 2026 Workshop on Culture X AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03717 2026-06-23 cs.LG cs.AI

Universal Time-Series Representation Learning: A Survey

通用时间序列表示学习:综述

Patara Trirat, Yooju Shin, Junhyeok Kang, Youngeun Nam, Jihye Na, Minyoung Bae, Joeun Kim, Byunghyun Kim, Jae-Gil Lee

机构 * KAIST(韩国延世大学)

AI总结 本文综述了时间序列数据表示学习方法,探讨了深度学习在提取隐藏模式中的优势,并提出了新的分类方法以指导未来研究。

Comments Accepted by ACM Computing Surveys. Extended version: 41 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13435 2026-06-23 cs.LG cs.AI 版本更新

Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy

Q-Flow: 基于流的稳定且表达力强的强化学习

JaeHyeok Doo, Byeongguk Jeon, Seonghyeon Ye, Kimin Lee, Minjoon Seo

机构 * KAIST AI(韩国科学技术院人工智能实验室)

AI总结 Q-Flow通过利用流动力学的确定性,将终端轨迹价值显式传播到中间潜在状态,实现稳定策略优化,同时在OGBench数据集上表现优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20937 2026-06-23 cs.LG 版本更新

Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs

面向高效视频大语言模型的sink-token感知剪枝:用于细粒度视频理解

Kibum Kim, Jiwan Kim, Kyle Min, Yueqi Wang, Jinyoung Moon, Julian McAuley, Chanyoung Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) Oracle University of California, San Diego(加州大学圣地亚哥分校) Electronics and Telecommunications Research Institute (ETRI)(电子电信研究院)

AI总结 本文提出Sink-Token-aware Pruning方法,通过识别并抑制semantically uninformative tokens,提升细粒度视频理解性能,在多种基准测试中表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17901 2026-06-23 cs.CV cs.MM cs.SD 版本更新

Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施

Geewook Kim, Minjoon Seo

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国国立庆北大学AI)

AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02742 2026-06-23 cs.RO 版本更新

Robust Tightly-Coupled Filter-Based Monocular Visual-Inertial State Estimation and Graph-Based Evaluation for Autonomous Drone Racing

基于鲁棒紧耦合滤波器的单目视觉惯性状态估计与图优化评估用于自主无人机竞速

Maulana Bisyir Azhari, Donghun Han, Sung Jun Park, David Hyunchul Shim

机构 * Unmanned Systems Research Group (USRG), School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(无人系统研究组(USRG)、电气工程学院、韩国科学技术院(KAIST))

AI总结 提出ADR-VINS,一种基于误差状态卡尔曼滤波器的单目视觉惯性框架,通过直接像素重投影误差实现鲁棒状态估计,仅需两个可见角点;并引入ADR-FGO离线图优化生成高保真参考轨迹,用于无GNSS环境下的性能评估。

Comments Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10971 2026-06-23 cs.LG stat.ML 版本更新

A Jointly Efficient and Optimal Algorithm for Heteroskedastic Generalized Linear Bandits with Adversarial Corruptions

面向异方差广义线性Bandits的联合高效与最优抗对抗性破坏算法

Sanghwa Kim, Junghyun Lee, Se-Young Yun

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

AI总结 针对含对抗性破坏的异方差广义线性Bandits问题,提出HCW-GLB-OMD算法,结合在线镜像下降估计器与基于Hessian的置信权重,实现计算高效(每轮O(1)时空复杂度)和实例级极小化最优遗憾界。

Comments 40 pages, 1 table (ver2: some updates)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12930 2026-06-23 cs.LG cs.AR

SeVeDo: A Heterogeneous Transformer Accelerator for Low-Bit Inference via Hierarchical Group Quantization and SVD-Guided Mixed Precision

SeVeDo:一种通过分层分组量化和SVD引导混合精度的异构Transformer加速器

Yuseon Choi, Sangjin Kim, Jungjun Oh, Byeongcheol Kim, Hoi-Jun Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 SeVeDo通过分层分组量化和SVD引导混合精度,提高低比特推理的能效,实现13.8TOPS/W的峰值能效,优于传统设计。

Comments IEEE International Symposium on Circuits and Systems (ISCAS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20110 2026-06-19 cs.CV 新提交

FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model

FrozenDrive: 零样本文本引导驾驶场景生成与数据增强的无参数冻结扩散模型

Yuhwan Jeong, Hyeonseong Kim, Daehyun We, Seonkyu Song, Jinnyeong Yang, Hyun-Kurl Jang, Youngho Yoon, Kuk-Jin Yoon

机构 * KAIST, Visual Intelligence Lab(韩国科学技术院视觉智能实验室)

AI总结 提出FrozenDrive框架,利用冻结的预训练扩散模型,通过知识保留的时空注意力实现多视图一致性和时间连贯性,无需微调即可生成恶劣天气下的驾驶场景,提升自动驾驶模型鲁棒性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20076 2026-06-19 cs.CV cs.AI 新提交

Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers

基于可学习全局合并的可变长度分词用于扩散变换器

Dong Hoon Lee, Seunghoon Hong

机构 * Kim Jaechul Graduate School of AI, KAIST, Daejeon, South Korea(韩国科学技术院金载哲人工智能研究生院,大田,韩国) School of Computing, KAIST, Daejeon, South Korea(韩国科学技术院计算学院,大田,韩国)

AI总结 针对固定压缩比限制扩散模型质量-计算权衡的问题,提出基于可学习全局合并的可变长度分词器,通过合并令牌实现跨长度表示对齐,在ImageNet 256×256生成中实现更优的gFID-计算权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20068 2026-06-19 cs.AI 新提交

Process-Verified Reinforcement Learning for Theorem Proving via Lean

基于Lean的过程验证强化学习用于定理证明

Minsu Kim, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能系)

AI总结 提出利用Lean证明助手提供过程级验证信号,结合GRPO风格强化学习目标,通过策略级监督提升定理证明性能。

详情

展开后加载摘要…

URL PDF HTML 收藏