arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-06-30 至 2026-06-30 共收录 12
2606.30580 2026-06-30 eess.AS cs.SD

MeloDISinger: Melody-Aware & Duration-Preserving Singing Voice Editing with Audio Infilling

MeloDISinger: 旋律感知与时长保持的歌唱声音编辑与音频填充

Yoonjeong Park, Jaekwon Im, Juhan Nam

机构 * Graduate School of Artificial Intelligence, KAIST, South Korea(韩国釜山科学技术院人工智能研究生院) Graduate School of Culture Technology, KAIST, South Korea(韩国釜山科学技术院文化科技研究生院)

AI总结 提出基于流匹配的MeloDISinger模型,通过MeloDRP模块预测固定预算时长比率实现旋律感知的时长分配,结合流匹配梅尔解码器进行音频填充,在歌唱声音编辑任务上达到最优性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30166 2026-06-30 cs.RO

Self-supervised Geometry Reasoning for LiDAR Simultaneous Localization and Mapping

自监督几何推理用于LiDAR同时定位与地图构建

Jiwoo Kim, Jinwoo Lee, Woojae Shin, Giseop Kim, Hyondong Oh

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学研究院) Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

AI总结 提出自监督框架,通过学习局部几何的显式符号表示(高斯分布协方差)并递归优化LiDAR SLAM,无需密集标签,提升低分辨率或稀疏点云下的定位与建图精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29985 2026-06-30 cs.CL

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning

我们是在衡量策略还是措辞?LLM数学推理中表面多样性与方法层面多样性的差距

Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung

机构 * Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

AI总结 提出方法层面多样性概念,发现现有多样性指标无法反映策略差异,且多样性感知强化学习会降低方法多样性,直接优化方法多样性仍具挑战。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29855 2026-06-30 cs.CV

RainODE: Continuous-Time Precipitation Forecasting with Latent Neural ODEs

RainODE: 基于潜在神经ODE的连续时间降水预报

Yeeun Seong, Doyi Kim, Minseok Seo, Changick Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 提出RainODE框架,将降水预报建模为连续时间动力系统,使用神经ODE在潜在空间建模,结合布朗桥随机源模块处理非平流变化,实现任意时间推理并保持预测清晰度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29801 2026-06-30 cs.CV

Concept Removal Guidance: Evidence-Calibrated Negative Guidance for Safe Diffusion Sampling

概念移除引导:用于安全扩散采样的证据校准负引导

Yoonseok Choi, Chaeyoung Oh, Hyunjun Choi, Seokin Seo, Kee-Eung Kim

机构 * KAIST(韩国科学技术院) KIST(韩国科学技术院)

AI总结 提出概念移除引导(CRG),一种无需训练的方法,通过从模型噪声预测中估计不良概念存在并自适应校准负引导权重,在保持良性保真度的同时降低攻击成功率。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29791 2026-06-30 cs.LG cs.AI stat.ML

What Drives the Inlier-Memorization Effect? A Theory of Outlier Detection via Early Training Dynamics

什么驱动了内点记忆效应?基于早期训练动态的异常检测理论

Kunwoong Kim, Dongha Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Department of Statistics Center for Data Science(统计系数据科学中心) Sungshin Women’s University(顺天妇女大学)

AI总结 本文从理论上分析了深度模型在早期训练中优先记忆内点而非异常点的内点记忆效应,揭示了其出现、强度与持久性依赖于数据分布和参数初始化,并据此提出数据预处理与初始化策略,在ADBench上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29480 2026-06-30 eess.AS cs.SD

DTM-Codec: Dynamic Token Masking for VFR Speech Coding with Efficient Boundary Selection

DTM-Codec:基于高效边界选择的变帧率语音编码动态令牌掩码

Hoyeol Sohn, Juhan Nam

机构 * Graduate School of Cultural Technology, KAIST, South Korea(韩国科学技术院文化技术研究生院)

AI总结 提出DTM-Codec,通过动态令牌掩码和路径长度均衡(PLE)边界选择器,在严格匹配总比特率下优于固定帧率基线,提升重建质量和可懂度。

Comments 10 pages, 2 figures, accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29082 2026-06-30 cs.CL cs.LG

Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks

进化微调:在371个优化任务中学习发现

Young-Jun Lee, Seungone Kim, Minki Kang, Alistair Cheong Liang Chuen, Zerui Chen, Seungho Han, Taehee Jung, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学) Carnegie Mellon University(卡内基梅隆大学) KAIST(韩国科学技术院) University of Cambridge(剑桥大学) Hanyang University(翰阳大学) Amazon(亚马逊)

AI总结 提出进化微调(EFT)方法,通过将进化搜索轨迹转化为监督信号,教会大语言模型跨任务迭代优化解决方案,在22个保留任务上平均提升10.22%。

Comments Project page: https://open-galapagos.github.io/evolution_finetuning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28745 2026-06-30 cs.CV

FreqOrtho-SR: Frequency-Guided Orthogonal Expert Learning for Real-World Image Super-Resolution

FreqOrtho-SR:面向真实世界图像超分辨率的频率引导正交专家学习

Minh Son Hoang, Dinh Phu Tran, Quyen Nguyen Duc, Dam Hoang Phuong, Daeyoung Kim

机构 * School of Computing, KAIST, Republic of Korea(韩国科学技术院计算机学院)

AI总结 针对真实图像超分辨率中像素保真度与语义质量平衡难、退化多样性适应差的问题,提出FreqOrtho-SR,通过频率引导的LoRA专家混合(FreqMoE)实现退化类型特化,并利用正交梯度投影(OGP)保证像素与语义目标互补学习,在多个基准上取得优异性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20606 2026-06-30 cs.CV

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking

探查并利用视频扩散变换器特征以实现稳健的点跟踪

Soowon Son, Honggyu An, Jisu Nam, Hyunah Ko, Chaehyun Kim, Dahyun Chung, Siyoon Jin, Jung Yi, Junhwa Hur, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) Google DeepMind(谷歌DeepMind)

AI总结 本文探讨了视频扩散变换器在点跟踪中的优势,提出DiTracker框架,通过整合视频DiT特征提升跟踪鲁棒性,实验证明其在挑战性场景下表现优异。

Comments Project Page: https://cvlab-kaist.github.io/DiTracker/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02393 2026-06-30 cs.CV cs.GR

PLOT: Pseudo-Labeling via Object Tracking for Monocular 3D Object Detection

PLOT:通过物体跟踪进行伪标签的单目3D目标检测

Seokyeong Lee, Sithu Aung, Junyong Choi, Seungryong Kim, Ig-Jae Kim, Junghyun Cho

机构 * Korea Institute of Science and Technology (KIST)(韩国科学技术研究院) KAIST AI(韩国科学技术院人工智能系) VRG, FEE, Czech Technical University in Prague(布拉格捷克理工大学电气工程学院视觉识别组) Samsung Research(三星研究院) AI-Robotics, KIST School, University of Science and Technology (UST)(科学技术联合大学院KIST学院人工智能机器人系) Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学延世-KIST融合研究院)

AI总结 PLOT通过物体跟踪生成单目视频中的3D标注,无需辅助传感器或模型重训练,实现了在自动驾驶、机器人和监控等领域的可靠3D目标检测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08108 2026-06-30 cs.CV cs.CL cs.CR

Exploiting Vision Encoder Vulnerabilities for Universal Adversarial Perturbations on Large Vision-Language Models

利用视觉编码器漏洞对大视觉-语言模型生成通用对抗扰动

Hee-Seon Kim, Minbeom Kim, Seokil Ham, Changick Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文研究了大视觉-语言模型在输入图像中对小对抗扰动的脆弱性,提出了一种针对视觉编码器内部组件的通用对抗扰动攻击框架,通过分析注意力机制识别关键脆弱组件,实现高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏