arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1460
2607.00714 2026-07-02 cs.CL cs.AI 新提交

Self-conditioned Flow Map Language Models via Fixed-point Flows

自条件流映射语言模型通过不动点流

Jaehoon Yoo, Wonjung Kim, Floor Eijkelboom, Chanhyuk Lee, Nicholas M. Boffi, Seunghoon Hong, Jinwoo Kim

机构 * KAIST(韩国科学技术院) University of Amsterdam(阿姆斯特丹大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出不动点流框架,将自条件机制解释为不动点迭代,并设计二维流模型同时压缩迭代与流过程,实现少步生成,在OpenWebText上超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31329 2026-07-02 cs.RO cs.AI 新提交

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

3D HAMSTER:通过3D轨迹引导在分层视觉语言动作模型中桥接规划与控制

Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo

机构 * Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院金载哲人工智能研究生院) Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) KRAFTON AI

AI总结 提出3D HAMSTER框架,通过让规划器直接输出度量可靠的3D轨迹,弥合2D引导与3D低层策略之间的差距,在3D轨迹预测、仿真和真实操作中优于现有方法。

Comments Published in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. Code: https://github.com/DAVIAN-Robotics/3D_HAMSTER. Project page: https://davian-robotics.github.io/3D_HAMSTER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17314 2026-07-02 cs.SE cs.LG 版本更新

Clotho: Measuring Task-Specific Pre-Generation Test Adequacy for LLM Inputs

Clotho:用于LLM输入的任务特定预生成测试充分性度量

Juyeon Yoon, Somin Kim, Robert Feldt, Shin Yoo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Chalmers University of Technology Gothenburg Sweden(楚德大学哥德堡瑞典) Chalmers University of Technology(楚德大学)

AI总结 Clotho通过分析LLM隐藏状态直接估计输入难度,无需生成输出即可评估测试输入的有效性,提升测试效率并降低LLM执行成本。

Comments FSE 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21013 2026-07-02 cs.LG cs.AI 版本更新

Predicting LLM Reasoning Performance with Small Proxy Model

用小代理模型预测LLM推理性能

Woosung Koh, Juyoung Suk, Sungjun Han, Se-Young Yun, Jamin Shin

机构 * Trillion Labs KAIST AI(韩国科学技术院人工智能系)

AI总结 提出rBridge方法,通过任务对齐加权负对数似然,使小模型(≤1B)有效预测大模型推理性能,成本降低超100倍,在1B-32B规模上实现最强相关性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31825 2026-07-01 cs.CV cs.AI 新提交

Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning

打破失败级联:面向医学多模态推理的步骤感知强化学习

Junha Jung, Minbyul Jeong, Suhyeon Lim, Sungwook Jung, Jaehoon Yun, Taeyun Roh, Mujeen Sung, Jaewoo Kang

机构 * Korea University(高丽大学) Upstage AI Kyung Hee University(庆熙大学) KAIST(韩国科学技术院) Hanyang University College of Medicine(汉阳大学医学院) AIGEN Sciences

AI总结 提出步骤感知强化学习算法MRPO,通过为早期错误推理步骤分配指数级惩罚,打破失败级联,显著提升医学视觉问答准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31682 2026-07-01 cs.RO 新提交

HABIT: Human-Aware Behavior and Interaction Training Dataset for Robot Manipulation

HABIT:用于机器人操作的人类感知行为与交互训练数据集

Jaehwi Song, Suchae Jeong, Byeongguk Jeon, Sungdong Kim, Minjoon Seo, Hyungmok Son, Kimin Lee

机构 * KAIST(韩国科学技术院)

AI总结 提出HABIT数据集,包含10K+集、160+小时的人类在场机器人演示,覆盖协作、共事和监督三类交互任务,训练出人类感知行为(时空同步、避让、手势理解)并支持快速适应新交互任务。

Comments 30 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31172 2026-07-01 cs.CV 新提交

HSDF-Lane: Height-Aligned Signed Distance Field with Semantic Lane Prior for 3D Lane Detection

HSDF-Lane: 高度对齐符号距离场与语义车道先验用于3D车道检测

Jiyong Boo, Byeongin Joung, Hyemin Yang, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 提出HSDF-Lane,通过高度对齐符号距离场隐式建模道路表面,结合可微渲染生成准确高度图和表面对齐特征,并引入车道感知语义位置编码注入车道先验,在OpenLane基准上实现3D车道检测和高度图估计的最优性能。

Comments ECCV 2026, Project page: https://jiyongboo.github.io/HSDF-Lane-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31480 2026-07-01 cs.LG math.OC 新提交

Constrained Online Convex Optimization without Slater's Condition

无Slater条件的约束在线凸优化

Kihyun Yu, Junehee Lee, Dabeen Lee

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学)

AI总结 提出一种自适应正则化的原始-对偶框架,无需Slater条件即可实现随机约束下$O(\sqrt{T})$遗憾和$O(\sqrt{T}\log T)$约束违反,并扩展到对抗约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20196 2026-07-01 cs.CV 新提交

Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation

一次蒸馏,终身适应:探索数据集蒸馏用于持续测试时适应

Hyun-Kurl Jang, Jihun Kim, Hyeokjun Kweon, Kuk-Jin Yoon

机构 * KAIST, Visual Intelligence Lab(韩国科学技术院,视觉智能实验室) Chung-Ang University, FOV Lab(中央大学,FOV实验室)

AI总结 提出DO-ALL框架,通过数据集蒸馏生成紧凑的合成锚点,在持续测试时适应中提供稳定参考,无需保留原始源数据,提升长期鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14965 2026-07-01 cs.CV 版本更新

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS: 基于几何的视频扩散模型用于新视角合成

Minjun Kang, Inkyu Shin, Taeyeop Lee, Myungchul Kim, In So Kweon, Kuk-Jin Yoon

机构 * KAIST, South Korea(韩国科学技术院) Luma AI, USA(Luma AI(美国))

AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。

Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04390 2026-07-01 cs.CV cs.AI 版本更新

FMA-Net++: Motion- and Exposure-Aware Joint Video Super-Resolution and Deblurring

FMA-Net++:运动与曝光感知的联合视频超分辨率与去模糊

Geunhyuk Youk, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) CMLab, Chung-Ang University(中央大学CMLab)

AI总结 提出非循环序列级框架FMA-Net++,通过层次细化双向聚合块实现并行处理与长时域建模,引入曝光时间感知调制层处理曝光依赖模糊,在合成数据上训练达到SOTA性能。

Comments Accepted to ECCV 2026. Project Page: https://kaist-viclab.github.io/fmanetpp_site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14661 2026-07-01 stat.ML cs.LG math.ST stat.TH 版本更新

When few labeled target data suffice: a theory of semi-supervised domain adaptation via fine-tuning from multiple adaptive starts

当少量标注目标数据足够:基于多自适应起点微调的半监督域适应理论

Wooseok Ha, Yuansi Chen

机构 * Department of Mathematical Sciences, KAIST(韩国科学技术院数学科学系) Department of Mathematics, ETH Zürich(苏黎世联邦理工学院数学系)

AI总结 本文在结构因果模型下研究半监督域适应,提出三种干预模型对应的最优方法及多自适应起点微调算法,证明目标标签复杂度仅依赖于干预维度而非环境维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30580 2026-06-30 eess.AS cs.SD

MeloDISinger: Melody-Aware & Duration-Preserving Singing Voice Editing with Audio Infilling

MeloDISinger: 旋律感知与时长保持的歌唱声音编辑与音频填充

Yoonjeong Park, Jaekwon Im, Juhan Nam

机构 * Graduate School of Artificial Intelligence, KAIST, South Korea(韩国釜山科学技术院人工智能研究生院) Graduate School of Culture Technology, KAIST, South Korea(韩国釜山科学技术院文化科技研究生院)

AI总结 提出基于流匹配的MeloDISinger模型,通过MeloDRP模块预测固定预算时长比率实现旋律感知的时长分配,结合流匹配梅尔解码器进行音频填充,在歌唱声音编辑任务上达到最优性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30166 2026-06-30 cs.RO

Self-supervised Geometry Reasoning for LiDAR Simultaneous Localization and Mapping

自监督几何推理用于LiDAR同时定位与地图构建

Jiwoo Kim, Jinwoo Lee, Woojae Shin, Giseop Kim, Hyondong Oh

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学研究院) Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

AI总结 提出自监督框架,通过学习局部几何的显式符号表示(高斯分布协方差)并递归优化LiDAR SLAM,无需密集标签,提升低分辨率或稀疏点云下的定位与建图精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29985 2026-06-30 cs.CL

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning

我们是在衡量策略还是措辞?LLM数学推理中表面多样性与方法层面多样性的差距

Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung

机构 * Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

AI总结 提出方法层面多样性概念,发现现有多样性指标无法反映策略差异,且多样性感知强化学习会降低方法多样性,直接优化方法多样性仍具挑战。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29855 2026-06-30 cs.CV

RainODE: Continuous-Time Precipitation Forecasting with Latent Neural ODEs

RainODE: 基于潜在神经ODE的连续时间降水预报

Yeeun Seong, Doyi Kim, Minseok Seo, Changick Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 提出RainODE框架,将降水预报建模为连续时间动力系统,使用神经ODE在潜在空间建模,结合布朗桥随机源模块处理非平流变化,实现任意时间推理并保持预测清晰度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29801 2026-06-30 cs.CV

Concept Removal Guidance: Evidence-Calibrated Negative Guidance for Safe Diffusion Sampling

概念移除引导:用于安全扩散采样的证据校准负引导

Yoonseok Choi, Chaeyoung Oh, Hyunjun Choi, Seokin Seo, Kee-Eung Kim

机构 * KAIST(韩国科学技术院) KIST(韩国科学技术院)

AI总结 提出概念移除引导(CRG),一种无需训练的方法,通过从模型噪声预测中估计不良概念存在并自适应校准负引导权重,在保持良性保真度的同时降低攻击成功率。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29791 2026-06-30 cs.LG cs.AI stat.ML

What Drives the Inlier-Memorization Effect? A Theory of Outlier Detection via Early Training Dynamics

什么驱动了内点记忆效应?基于早期训练动态的异常检测理论

Kunwoong Kim, Dongha Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Department of Statistics Center for Data Science(统计系数据科学中心) Sungshin Women’s University(顺天妇女大学)

AI总结 本文从理论上分析了深度模型在早期训练中优先记忆内点而非异常点的内点记忆效应,揭示了其出现、强度与持久性依赖于数据分布和参数初始化,并据此提出数据预处理与初始化策略,在ADBench上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29480 2026-06-30 eess.AS cs.SD

DTM-Codec: Dynamic Token Masking for VFR Speech Coding with Efficient Boundary Selection

DTM-Codec:基于高效边界选择的变帧率语音编码动态令牌掩码

Hoyeol Sohn, Juhan Nam

机构 * Graduate School of Cultural Technology, KAIST, South Korea(韩国科学技术院文化技术研究生院)

AI总结 提出DTM-Codec,通过动态令牌掩码和路径长度均衡(PLE)边界选择器,在严格匹配总比特率下优于固定帧率基线,提升重建质量和可懂度。

Comments 10 pages, 2 figures, accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29082 2026-06-30 cs.CL cs.LG

Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks

进化微调:在371个优化任务中学习发现

Young-Jun Lee, Seungone Kim, Minki Kang, Alistair Cheong Liang Chuen, Zerui Chen, Seungho Han, Taehee Jung, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学) Carnegie Mellon University(卡内基梅隆大学) KAIST(韩国科学技术院) University of Cambridge(剑桥大学) Hanyang University(翰阳大学) Amazon(亚马逊)

AI总结 提出进化微调(EFT)方法,通过将进化搜索轨迹转化为监督信号,教会大语言模型跨任务迭代优化解决方案,在22个保留任务上平均提升10.22%。

Comments Project page: https://open-galapagos.github.io/evolution_finetuning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28745 2026-06-30 cs.CV

FreqOrtho-SR: Frequency-Guided Orthogonal Expert Learning for Real-World Image Super-Resolution

FreqOrtho-SR:面向真实世界图像超分辨率的频率引导正交专家学习

Minh Son Hoang, Dinh Phu Tran, Quyen Nguyen Duc, Dam Hoang Phuong, Daeyoung Kim

机构 * School of Computing, KAIST, Republic of Korea(韩国科学技术院计算机学院)

AI总结 针对真实图像超分辨率中像素保真度与语义质量平衡难、退化多样性适应差的问题,提出FreqOrtho-SR,通过频率引导的LoRA专家混合(FreqMoE)实现退化类型特化,并利用正交梯度投影(OGP)保证像素与语义目标互补学习,在多个基准上取得优异性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20606 2026-06-30 cs.CV

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking

探查并利用视频扩散变换器特征以实现稳健的点跟踪

Soowon Son, Honggyu An, Jisu Nam, Hyunah Ko, Chaehyun Kim, Dahyun Chung, Siyoon Jin, Jung Yi, Junhwa Hur, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) Google DeepMind(谷歌DeepMind)

AI总结 本文探讨了视频扩散变换器在点跟踪中的优势,提出DiTracker框架,通过整合视频DiT特征提升跟踪鲁棒性,实验证明其在挑战性场景下表现优异。

Comments Project Page: https://cvlab-kaist.github.io/DiTracker/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02393 2026-06-30 cs.CV cs.GR

PLOT: Pseudo-Labeling via Object Tracking for Monocular 3D Object Detection

PLOT:通过物体跟踪进行伪标签的单目3D目标检测

Seokyeong Lee, Sithu Aung, Junyong Choi, Seungryong Kim, Ig-Jae Kim, Junghyun Cho

机构 * Korea Institute of Science and Technology (KIST)(韩国科学技术研究院) KAIST AI(韩国科学技术院人工智能系) VRG, FEE, Czech Technical University in Prague(布拉格捷克理工大学电气工程学院视觉识别组) Samsung Research(三星研究院) AI-Robotics, KIST School, University of Science and Technology (UST)(科学技术联合大学院KIST学院人工智能机器人系) Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学延世-KIST融合研究院)

AI总结 PLOT通过物体跟踪生成单目视频中的3D标注,无需辅助传感器或模型重训练,实现了在自动驾驶、机器人和监控等领域的可靠3D目标检测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08108 2026-06-30 cs.CV cs.CL cs.CR

Exploiting Vision Encoder Vulnerabilities for Universal Adversarial Perturbations on Large Vision-Language Models

利用视觉编码器漏洞对大视觉-语言模型生成通用对抗扰动

Hee-Seon Kim, Minbeom Kim, Seokil Ham, Changick Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文研究了大视觉-语言模型在输入图像中对小对抗扰动的脆弱性,提出了一种针对视觉编码器内部组件的通用对抗扰动攻击框架,通过分析注意力机制识别关键脆弱组件,实现高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27679 2026-06-29 cs.CL cs.AI 新提交

From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Models

从信号到迁移:基于探针的大语言模型不确定性估计的分解研究

Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Quang Minh Nguyen, Duc Anh Vu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity KAIST(韩国科学技术院)

AI总结 通过分解研究,发现原始隐藏状态和注意力特征在域内表现优异,但结构化压缩特征在分布偏移下更鲁棒,提示和标签构建显著影响探针行为,并训练出可迁移的预训练探针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27671 2026-06-29 cs.CV 新提交

Multi-Modal Conditioned High-Resolution Transformer for Urban Electromagnetic Field Map Prediction Download PDF

面向城市电磁场地图预测的多模态条件高分辨率Transformer

Do-Eon Kim, Dongryul Park, Seungyoung Ahn, Namwoo Kang, Seong-heum Kim, Seongsin Kim

机构 * Soongsil University(崇实大学) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(韩国科学技术院赵春植移动研究生院) Department of Intelligent Semiconductors, Soongsil University(崇实大学智能半导体系)

AI总结 提出多条件密集预测框架,利用高分辨率Transformer骨干网络,结合特征线性调制和交叉注意力机制,从建筑布局和天线配置生成500×500电磁场地图,通过复合损失函数和测试时增强提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27659 2026-06-29 cs.CV 新提交

GeoFace: Consistent Multi-View Face Generation with Geometry-Constrained Diffusion

GeoFace: 基于几何约束的一致多视角人脸生成扩散模型

Yeji Choi, Jinhyeok Choi, Jaewon Min, Minkyung Kwon, Jin Hyeon Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

AI总结 提出GeoFace,一种几何约束的多视角扩散框架,通过外观与几何流的共享注意力层和几何引导注意力对齐损失,实现从单张输入生成一致的多视角人脸图像和3D几何,显著提升跨视角几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27584 2026-06-29 cs.CV cs.AI 新提交

CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance

CoIn:基于高斯泼溅引导的全面2D-3D修复

Hana Kim, Minje Kim, Tae-Kyun Kim

机构 * LG Electronics(LG电子) KAIST(韩国科学技术院)

AI总结 提出CoIn框架,通过多阶段一致性流水线桥接2D修复模型与3D高斯泼溅,支持任意形状掩码的物体移除与插入,实现双向信息流引导的3D场景修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26715 2026-06-29 cs.CV cs.GR 新提交

Extracting Neural Materials from Multi-view Images

从多视角图像中提取神经材质

Kim Youwang, Jon Hasselgren, Peter Kocsis, Andrea Weidlich, Tae-Hyun Oh, Jacob Munkberg

机构 * NVIDIA(英伟达) POSTECH(浦项科技大学) KAIST(韩国科学技术院)

AI总结 提出NeuMatEx方法,利用大型材质重建模型(LMRM)初始化神经材质潜变量,结合逆路径追踪优化,从多视角图像中提取空间变化的神经材质,优于传统PBR方法。

Comments Project website: https://nvlabs.github.io/neumatex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10791 2026-06-29 cs.SD 新提交

Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge

ESDD2概述:环境感知语音与声音深度伪造检测挑战赛

Xueping Zhang, Han Yin, Yang Xiao, Lin Zhang, Ting Dang, Rohan Kumar Das, Ming Li

机构 * Duke Kunshan University(昆山杜克大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) The University of Melbourne(墨尔本大学) Johns Hopkins University(约翰霍普金斯大学) Fortemedia Singapore(Fortemedia新加坡) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 介绍ESDD2挑战赛,评估语音和环境声音独立或联合操纵的检测系统,最佳系统Macro-F1达0.8775,模块化分解、跨域自监督编码器、数据增强和选择性集成是关键。

Comments Accepted to 2026 ICME workshop. arXiv admin note: text overlap with arXiv:2601.07303

详情

展开后加载摘要…

URL PDF HTML 收藏