arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 203
2606.31682 2026-07-01 cs.RO 新提交

HABIT: Human-Aware Behavior and Interaction Training Dataset for Robot Manipulation

HABIT:用于机器人操作的人类感知行为与交互训练数据集

Jaehwi Song, Suchae Jeong, Byeongguk Jeon, Sungdong Kim, Minjoon Seo, Hyungmok Son, Kimin Lee

机构 * KAIST(韩国科学技术院)

AI总结 提出HABIT数据集,包含10K+集、160+小时的人类在场机器人演示,覆盖协作、共事和监督三类交互任务,训练出人类感知行为(时空同步、避让、手势理解)并支持快速适应新交互任务。

Comments 30 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31172 2026-07-01 cs.CV 新提交

HSDF-Lane: Height-Aligned Signed Distance Field with Semantic Lane Prior for 3D Lane Detection

HSDF-Lane: 高度对齐符号距离场与语义车道先验用于3D车道检测

Jiyong Boo, Byeongin Joung, Hyemin Yang, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 提出HSDF-Lane,通过高度对齐符号距离场隐式建模道路表面,结合可微渲染生成准确高度图和表面对齐特征,并引入车道感知语义位置编码注入车道先验,在OpenLane基准上实现3D车道检测和高度图估计的最优性能。

Comments ECCV 2026, Project page: https://jiyongboo.github.io/HSDF-Lane-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31480 2026-07-01 cs.LG math.OC 新提交

Constrained Online Convex Optimization without Slater's Condition

无Slater条件的约束在线凸优化

Kihyun Yu, Junehee Lee, Dabeen Lee

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学)

AI总结 提出一种自适应正则化的原始-对偶框架,无需Slater条件即可实现随机约束下$O(\sqrt{T})$遗憾和$O(\sqrt{T}\log T)$约束违反,并扩展到对抗约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20196 2026-07-01 cs.CV 新提交

Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation

一次蒸馏,终身适应:探索数据集蒸馏用于持续测试时适应

Hyun-Kurl Jang, Jihun Kim, Hyeokjun Kweon, Kuk-Jin Yoon

机构 * KAIST, Visual Intelligence Lab(韩国科学技术院,视觉智能实验室) Chung-Ang University, FOV Lab(中央大学,FOV实验室)

AI总结 提出DO-ALL框架,通过数据集蒸馏生成紧凑的合成锚点,在持续测试时适应中提供稳定参考,无需保留原始源数据,提升长期鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27679 2026-06-29 cs.CL cs.AI 新提交

From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Models

从信号到迁移:基于探针的大语言模型不确定性估计的分解研究

Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Quang Minh Nguyen, Duc Anh Vu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity KAIST(韩国科学技术院)

AI总结 通过分解研究,发现原始隐藏状态和注意力特征在域内表现优异,但结构化压缩特征在分布偏移下更鲁棒,提示和标签构建显著影响探针行为,并训练出可迁移的预训练探针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27671 2026-06-29 cs.CV 新提交

Multi-Modal Conditioned High-Resolution Transformer for Urban Electromagnetic Field Map Prediction Download PDF

面向城市电磁场地图预测的多模态条件高分辨率Transformer

Do-Eon Kim, Dongryul Park, Seungyoung Ahn, Namwoo Kang, Seong-heum Kim, Seongsin Kim

机构 * Soongsil University(崇实大学) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(韩国科学技术院赵春植移动研究生院) Department of Intelligent Semiconductors, Soongsil University(崇实大学智能半导体系)

AI总结 提出多条件密集预测框架,利用高分辨率Transformer骨干网络,结合特征线性调制和交叉注意力机制,从建筑布局和天线配置生成500×500电磁场地图,通过复合损失函数和测试时增强提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27659 2026-06-29 cs.CV 新提交

GeoFace: Consistent Multi-View Face Generation with Geometry-Constrained Diffusion

GeoFace: 基于几何约束的一致多视角人脸生成扩散模型

Yeji Choi, Jinhyeok Choi, Jaewon Min, Minkyung Kwon, Jin Hyeon Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

AI总结 提出GeoFace,一种几何约束的多视角扩散框架,通过外观与几何流的共享注意力层和几何引导注意力对齐损失,实现从单张输入生成一致的多视角人脸图像和3D几何,显著提升跨视角几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27584 2026-06-29 cs.CV cs.AI 新提交

CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance

CoIn:基于高斯泼溅引导的全面2D-3D修复

Hana Kim, Minje Kim, Tae-Kyun Kim

机构 * LG Electronics(LG电子) KAIST(韩国科学技术院)

AI总结 提出CoIn框架,通过多阶段一致性流水线桥接2D修复模型与3D高斯泼溅,支持任意形状掩码的物体移除与插入,实现双向信息流引导的3D场景修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26715 2026-06-29 cs.CV cs.GR 新提交

Extracting Neural Materials from Multi-view Images

从多视角图像中提取神经材质

Kim Youwang, Jon Hasselgren, Peter Kocsis, Andrea Weidlich, Tae-Hyun Oh, Jacob Munkberg

机构 * NVIDIA(英伟达) POSTECH(浦项科技大学) KAIST(韩国科学技术院)

AI总结 提出NeuMatEx方法,利用大型材质重建模型(LMRM)初始化神经材质潜变量,结合逆路径追踪优化,从多视角图像中提取空间变化的神经材质,优于传统PBR方法。

Comments Project website: https://nvlabs.github.io/neumatex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10791 2026-06-29 cs.SD 新提交

Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge

ESDD2概述:环境感知语音与声音深度伪造检测挑战赛

Xueping Zhang, Han Yin, Yang Xiao, Lin Zhang, Ting Dang, Rohan Kumar Das, Ming Li

机构 * Duke Kunshan University(昆山杜克大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) The University of Melbourne(墨尔本大学) Johns Hopkins University(约翰霍普金斯大学) Fortemedia Singapore(Fortemedia新加坡) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 介绍ESDD2挑战赛,评估语音和环境声音独立或联合操纵的检测系统,最佳系统Macro-F1达0.8775,模块化分解、跨域自监督编码器、数据增强和选择性集成是关键。

Comments Accepted to 2026 ICME workshop. arXiv admin note: text overlap with arXiv:2601.07303

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27307 2026-06-26 cs.CV 新提交

See & Sniff: Learning Visuo-Olfactory Representations

See & Sniff: 学习视觉-嗅觉表征

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Hankuk University of Foreign Studies(韩国外国语大学) Ulsan National Institute of Science and Technology(蔚山科学技术院)

AI总结 提出SmellNet-V数据集和See & Sniff自监督框架,通过密集局部对齐学习联合视觉-嗅觉表征,实现气味分类、跨模态检索和气味定位,性能提升7%。

Comments ECCV 2026. Project Page: https://mm.kaist.ac.kr/projects/SeeandSniff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26858 2026-06-26 cs.RO 新提交

PlanRL: A Trajectory Planning Architecture for Reinforcement Learning-based Driving Experts

PlanRL: 一种用于基于强化学习的驾驶专家的轨迹规划架构

Joonhee Lim, Yongjae Lee, Jangho Shin, Dongsuk Kum

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Hyundai Motor Company(现代汽车公司)

AI总结 提出一种将强化学习策略与多项式轨迹规划器结合的轨迹规划架构,通过Frenet坐标系简化道路几何并加入运动学可行性检查,在CARLA基准上驾驶评分提升5%-11%,成功率提升8%-19%。

Comments Accepted at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26762 2026-06-26 cs.CV cs.LG 新提交

ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory

ProtoKV: 延迟查询下的流式视频理解与摘要状态记忆

Le Tu Ngoc Minh, Jinyeong Lim, Dongsu Han

机构 * KAIST(韩国科学技术院)

AI总结 提出ProtoKV,一种固定内存的流式视频理解记忆机制,通过摘要状态表示远历史,在长延迟查询下准确率提升高达12.5点。

Comments 20 pages, 4 figures, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26538 2026-06-26 cs.LG cs.AI 新提交

CascadeFormer: Depth-Tapered Transformers Motivated by Gradient Fan-in Asymmetry

CascadeFormer: 由梯度扇入不对称性启发的深度锥形Transformer

Huzama Ahmad, Cao Viet Hai Nam, Se-Young Yun

机构 * KAIST(韩国科学技术院)

AI总结 针对深层Transformer中深层贡献不足的问题,提出CascadeFormer通过锥形宽度匹配信息流,以及CascadeFlow Pruning利用梯度剪枝层,基于梯度扇入不对称性(GFA)理论解释深层贡献少的原因。

Comments 18 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27354 2026-06-26 cs.LG cs.AI cs.CV cs.NA math.NA 新提交

Error-Conditioned Neural Solvers

误差条件神经求解器

Haina Jiang, Liam Wang, Peng-Chen Chen, Min Seop Kwak, Seungryong Kim, Brian Bell, Jeong Joon Park

机构 * University of Michigan(密歇根大学) KAIST AI(韩国科学技术院人工智能) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

AI总结 提出误差条件神经求解器(ENS),通过将PDE残差场作为网络输入,学习迭代校正策略,在多个PDE族上实现高精度预测,尤其适用于病态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26087 2026-06-25 cs.CV 新提交

MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation

MVTrack4Gen: 多视角点跟踪作为4D视频生成的几何监督

JoungBin Lee, Jaewoo Jung, Jongmin Lee, Tongmin Kim, Hyunsung Kim, Takuya Narihira, Kazumi Fukuda, Jahyeok Koo, Jisang Han, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司)

AI总结 提出MVTrack4Gen框架,利用多视角点跟踪作为几何与运动监督信号,增强仅相机条件的新视角视频扩散模型的运动一致性和几何一致性。

Comments Project Page : https://cvlab-kaist.github.io/MVTrack4Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24950 2026-06-25 cs.LG cs.AI 新提交

MacroLens: A Multi-Task Benchmark for Contextual Financial Reasoning under Macroeconomic Scenarios

MacroLens:宏观经济情景下的多任务上下文金融推理基准

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

AI总结 针对金融决策中价格、基本面、宏观和文本四信号联合评估的缺失,构建了涵盖4426只美股、七个任务、1130个宏观事件的基准,评估19种方法,揭示上下文特征的重要性。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19887 2026-06-25 cs.CR cs.AI 新提交

FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming

FFinRED:面向金融大语言模型红队测试的专家引导基准生成与评估框架

Chaeyun Kim, Daeyoung Park, Junghwan Kim, Jinyoung Jeong, Eunji Song, Yongtaek Lim, Minwoo Kim

机构 * DATUMO INC.(DATUMO公司) Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学研究院) Financial Security Institute (FSI)(金融安全研究所)

AI总结 提出FinRED框架,通过专家引导的两级分类法将全球金融标准映射为威胁,并利用真实金融文档生成上下文丰富的红队行为提示,结合专家验证的评估标准,有效降低关键假阴性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24648 2026-06-24 cs.SD cs.CL eess.AS 新提交

ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge

ParaPairAudioBench: 面向LALM-as-a-Judge的副语言成对音频基准

Jisu Jeon, Seungyeon Jwa, Joosung Lee, Jinhyeon Kim, Woojin Chung, Hwiyeol Jo, Jeonghoon Kim, Jonghyun Choi, Soyoon Kim

机构 * Hongik University(弘益大学) Seoul National University(首尔大学) NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

AI总结 提出ParaPairAudioBench,包含5,175对音频,覆盖风格、语速、重音、年龄和性别五个副语言维度,用于评估大型音频语言模型作为评判者的可靠性,发现其与人类判断差距大且校准失败严重。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24232 2026-06-24 cs.CV cs.GR 新提交

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA:基于单张肖像图像的前馈即时高斯编解码器化身

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) School of Computing, KAIST(韩国科学技术院计算机学院)

AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。

Comments Project page: https://kim-youwang.github.io/FiCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24049 2026-06-24 cs.RO 新提交

SPACE: Enabling Learning from Cross-Robot Data Toward Generalist Policies

SPACE:从跨机器人数据中学习通用策略

Haeone Lee, Byeongguk Jeon, Suchae Jeong, Jian Kim, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Yonsei University(延世大学)

AI总结 提出SPACE框架,通过笛卡尔状态增量作为通用动作表示,结合动作适配器处理机器人动力学差异,实现跨本体和硬件的策略学习,显著优于直接预测控制命令的方法。

Comments Project page: http://haeone.site/space-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22314 2026-06-24 cs.LG cs.AI cs.CV 新提交

Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution

扩散积分梯度:用于灵活特征归因的可控路径生成

Soyeon Kim, Kyowoon Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) Ajou University(亚洲大学) INEEJI Corp.(INEEJI公司)

AI总结 提出扩散积分梯度(DiffIG),通过扩散模型生成路径并嵌入用户引导,实现灵活可控的特征归因,在定量和定性上优于现有方法。

Comments 44 pages, 22 figures, 10 tables. Accepted to ECCV 2026; includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17046 2026-06-24 cs.RO cs.CV cs.LG 新提交

Geometric Action Model for Robot Policy Learning

几何动作模型用于机器人策略学习

Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

机构 * KAIST AI(韩国科学技术院人工智能学院) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心)

AI总结 提出几何动作模型(GAM),通过重用预训练几何基础模型(GFM)作为共享骨干,实现语言条件下的操作策略,在仿真和真实机器人任务中优于现有方法。

Comments Project page: https://cvlab-kaist.github.io/Geometric-Action-Model/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21888 2026-06-23 eess.AS cs.SD 新提交

ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion

ProsoCodec:面向韵律的语音编解码器用于语音转换

Jeongsoo Choi, Ji-Hoon Kim, Shujie Hu, Joon Son Chung

机构 * KAIST, South Korea(韩国科学技术院) Chung-Ang University, South Korea(Chung-Ang 大学) The Chinese University of Hong Kong, China(香港中文大学)

AI总结 提出ProsoCodec,通过将韵律建模为条件残差而非分离流,在语音转换中改善韵律保留并减少源音色泄漏。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21588 2026-06-23 eess.IV cs.CV 新提交

Unsupervised Susceptibility Distortion Correction of EPI without Calibration Scans via Image Translation-Based Registration

无需校准扫描的EPI无监督磁敏感畸变校正:基于图像翻译的配准方法

Wooseung Kim, Sung-Hong Park

机构 * Department of Bio and Brain Engineering, Korea Advanced Institute of Science and Technology(生物与脑工程系,韩国科学技术院)

AI总结 提出SACRED框架,利用可逆神经网络进行BOLD与T1w图像翻译,结合无监督配准实现EPI几何畸变校正,无需额外校准扫描,在分布内和分布外数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23557 2026-06-23 cs.CV 新提交

Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

基于全局地图与局部视图的多视角3D推理的密集奖励

Jiho Choi, Seonho Lee, Seojeong Park, Hyunjung Shim

机构 * Graduate School of Artificial Intelligence, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) KRAFTON, Republic of Korea(韩国KRAFTON公司)

AI总结 提出DR-MV3D框架,通过全局一致性奖励和局部轨迹奖励对多视角3D VQA的中间推理过程进行密集监督,提升跨视图推理一致性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23217 2026-06-23 cs.CL cs.AI 新提交

MuPPET: A Benchmark for Contextual Privacy of LLM Assistants in Multi-Party Conversations

MuPPET:多轮对话中LLM助手上下文隐私的基准测试

Elena Sofia Ruzzetti, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Rome Tor Vergata(罗马第二大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) KAIST AI(韩国科学技术院人工智能研究所)

AI总结 提出MuPPET基准,评估多用户对话中LLM代理的隐私泄露风险,发现模型在多用户场景下泄露更严重,现有防御措施效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23132 2026-06-23 cs.CV 新提交

T-VSS: Test-Time Visual Subspace Steering for Adversarial Robustness of Vision-Language Models

T-VSS:面向视觉语言模型对抗鲁棒性的测试时视觉子空间引导

Jaehyuk Jang, Minseok Seo. Seungju Cho, Kangwook Ko, Changick Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院)

AI总结 提出T-VSS方法,通过在视觉特征空间中构建样本特定的低秩子空间并学习共享特征校正,直接适应受攻击特征,提升视觉语言模型的对抗鲁棒性,同时保持清洁准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22975 2026-06-23 cs.LG 新提交

TaLK: Text-attributed Graph Dataset Distillation via Coupling Language Model with Graph-Aware Kernel

TaLK: 通过耦合语言模型与图感知核的文本属性图数据集蒸馏

Yeongho Kim, Yeonje Choi, Kijung Shin

机构 * Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院)

AI总结 提出TaLK方法,通过耦合语言模型与图感知神经切线核实现文本属性图的高效数据集蒸馏,避免重复联合训练,仅用1%合成数据即可达到97%的全数据集性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22874 2026-06-23 cs.LG cs.AI 新提交

SpotAttention: Plug-In Block-Sparse Routing for Pretrained Long-Context Transformers

SpotAttention: 面向预训练长上下文Transformer的即插即用块稀疏路由

Huzama Ahmad, Se-Young Yun

机构 * KAIST(韩国科学技术院)

AI总结 提出SpotAttention,一种轻量级选择器,通过KL蒸馏学习估计注意力分布,实现块稀疏路由,在长上下文任务中匹配密集注意力精度并显著加速解码。

Comments 24 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏