arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1472
2505.20899 2025-12-30 cs.CL cs.SD eess.AS

Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing

Dub-S2ST: 无文本语音到语音翻译用于无缝配音

Jeongsoo Choi, Jaehun Kim, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 Dub-S2ST通过无文本语音到语音翻译模型实现无缝配音,保留语音特征并提升翻译质量。

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01324 2025-12-30 cs.LG cs.AI

Fair Class-Incremental Learning using Sample Weighting

基于样本加权的公平类增量学习

Jaeyoung Park, Minsu Kim, Steven Euijong Whang

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 本文提出了一种基于样本加权的公平类增量学习框架,通过调整训练权重减少敏感群体的遗忘,提升模型公平性。

Comments 30 pages, 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21797 2025-12-29 cs.CV

Diffusion Posterior Sampling for Super-Resolution under Gaussian Measurement Noise

在高斯测量噪声下用于超分辨率的扩散后验采样

Abu Hanif Muhammad Syarubany

机构 * Korea Advanced Institute of Science \& Technology (KAIST) Daejeon, South Korea

AI总结 本文提出了一种在高斯噪声下通过扩散后验采样实现超分辨率的方法,通过优化指导尺度和噪声水平提升重建质量,平衡先验与梯度强度以获得稳定高质量结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21099 2025-12-25 cs.GR cs.AI cs.CV

TexAvatars : Hybrid Texel-3D Representations for Stable Rigging of Photorealistic Gaussian Head Avatars

TexAvatars : 混合的texel-3D表示用于稳定驱动的逼真高斯头avatars

Jaeseong Lee, Junyeong Ahn, Taewoong Kang, Jaegul Choo

机构 * KAIST(韩国科学技术院) Hanyang University(翰阳大学)

AI总结 TexAvatars通过混合texel-3D表示,结合分析rigging的几何基础与texel空间的连续性,实现逼真头avatars的稳定驱动和高保真表达。

Comments 3DV 2026, Project page with videos: https://summertight.github.io/TexAvatars/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06433 2025-12-25 cs.CV

Diagnose Like A REAL Pathologist: An Uncertainty-Focused Approach for Trustworthy Multi-Resolution Multiple Instance Learning

像真正的病理科医生一样诊断:一种以不确定性为核心的多分辨率多实例学习方法

Sungrae Hong, Sol Lee, Jisu Shin, Jiwon Jeong, Mun Yong Yi

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 本文提出UFC-MIL方法,通过多分辨率图像和不确定性校准,提升多实例学习的诊断可靠性。

Comments Accepted by IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04529 2025-12-25 cs.SD

ESDD 2026: Environmental Sound Deepfake Detection Challenge Evaluation Plan

ESDD 2026:环境声音深度伪造检测挑战评估计划

Han Yin, Yang Xiao, Rohan Kumar Das, Jisheng Bai, Ting Dang

机构 * 1 School of Electrical Engineering, KAIST, Daejeon, Republic of Korea 2 University of Melbourne, Australia 3 Fortemedia Singapore, Singapore 4 Xi'an University of Posts \& Telecommunications, Xi'an, China

AI总结 ESDD 2026挑战旨在通过EnvSDD数据集检测环境声音深度伪造,涵盖未见过生成器和低资源场景的两种赛道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20482 2025-12-24 cs.SE cs.AI

SweRank+: Multilingual, Multi-Turn Code Ranking for Software Issue Localization

SweRank+: 多语言、多轮次代码排名用于软件问题定位

Revanth Gangi Reddy, Ye Liu, Wenting Zhao, JaeHyeok Doo, Tarun Suresh, Daniel Lee, Caiming Xiong, Yingbo Zhou, Semih Yavuz, Shafiq Joty

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Salesforce AI Research(Salesforce AI研究院) KAIST AI(韩国科学技术院AI研究中心)

AI总结 SweRank+结合跨语言代码排名工具和代理搜索设置,实现多轮次的代码库推理,提升多语言软件问题定位的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20475 2025-12-24 cs.RO

Drift-Corrected Monocular VIO and Perception-Aware Planning for Autonomous Drone Racing

校正漂移的单目视觉惯性里程计与感知感知的自主无人机竞速

Maulana Bisyir Azhari, Donghun Han, Je In You, Sungjun Park, David Hyunchul Shim

机构 * Department of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程系,韩国科学技术院(KAIST))

AI总结 本文提出了一种校正VIO漂移的方法,结合YOLO门检测器和卡尔曼滤波器,以提升无人机竞速中的视觉惯性里程计精度与感知规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20409 2025-12-24 cs.CV cs.AI

DETACH : Decomposed Spatio-Temporal Alignment for Exocentric Video and Ambient Sensors with Staged Learning

DETACH:解构时空对齐用于外向视频和环境传感器的分阶段学习

Junho Yoon, Jaemo Jung, Hyunju Kim, Dongman Lee

机构 * KAIST(韩国科学技术院)

AI总结 DETACH通过解构时空对齐方法,解决外向视频与环境传感器在动作识别中的对齐问题,提升模型在Opportunity++和HWU-USP数据集上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20296 2025-12-24 cs.CV cs.AI eess.AS eess.IV

TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation

TAVID:基于文本的音频视觉交互对话生成

Ji-Hoon Kim, Junseok Ahn, Doyeop Kwak, Joon Son Chung, Shinji Watanabe

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 TAVID通过统一框架同步生成交互面部和对话语音,实现音频视觉多模态对话生成。

Comments Project page: https://mm.kaist.ac.kr/projects/TAVID

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20062 2025-12-24 cs.CR cs.AI

On the Effectiveness of Instruction-Tuning Local LLMs for Identifying Software Vulnerabilities

关于指令微调本地LLM在识别软件漏洞中的有效性

Sangryu Park, Gihyuk Ko, Homook Cho

机构 * KAIST Cyber Security Research Center(韩国科学技术院网络安全研究中心)

AI总结 本文提出通过指令微调本地LLM来提升软件漏洞识别效果,替代依赖API的大型模型,实现更高效、安全的漏洞管理。

Comments The 9th International Conference on Mobile Internet Security (MobiSec 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05710 2025-12-24 cs.RO

DRO-EDL-MPC: Evidential Deep Learning-Based Distributionally Robust Model Predictive Control for Safe Autonomous Driving

DRO-EDL-MPC:基于证据深度学习的分布鲁棒模型预测控制用于安全自动驾驶

Hyeongchan Ham, Heejin Ahn

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)

AI总结 DRO-EDL-MPC通过结合证据深度学习和分布鲁棒优化,提升自动驾驶中的安全性和控制可靠性。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08528 2025-12-24 cs.LG cs.AI cs.CV

GradMix: Gradient-based Selective Mixup for Robust Data Augmentation in Class-Incremental Learning

GradMix: 基于梯度的选取混合法用于类别增量学习中的鲁棒数据增强

Minsu Kim, Seong-Hyeon Hwang, Steven Euijong Whang

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 GradMix是一种基于梯度的选取混合方法,用于减少类别增量学习中的灾难性遗忘,通过混合有益类对样本以提升模型性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19048 2025-12-23 cs.CV

WaTeRFlow: Watermark Temporal Robustness via Flow Consistency

WaTeRFlow:通过流一致性实现水印时间鲁棒性

Utae Jeong, Sumin In, Hyunju Ryu, Jaewan Choi, Feng Yang, Jongheon Jeong, Seungryong Kim, Sangpil Kim

机构 * Korea University(韩国大学) Google DeepMind(谷歌DeepMind) KAIST AI(韩国科学技术院人工智能)

AI总结 WaTeRFlow通过流一致性提升I2V场景下的水印鲁棒性,结合FUSE引擎、时间一致性损失和语义保持损失,实现跨模态水印恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18692 2025-12-23 cs.CV

EcoSplat: Efficiency-controllable Feed-forward 3D Gaussian Splatting from Multi-view Images

EcoSplat: 可控效率的多视角图像前馈3D高斯点云生成

Jongmin Park, Minh-Quan Viet Bui, Juan Luis Gonzalez Bello, Jaeho Moon, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) Flawless AI Department of Imaging Science, GSAIM, Chung-Ang University(Chung-Ang 大学影像科学系)

AI总结 EcoSplat是一种可控制效率的前馈3D高斯点云生成框架,通过两阶段优化过程实现自适应的3D表示生成,适用于灵活的下游渲染任务。

Comments The first two authors contributed equally to this work (equal contribution). The last two authors advised equally to this work. Please visit our project page at https://kaist-viclab.github.io/ecosplat-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12520 2025-12-23 cs.CV

Good Noise Makes Good Edits: A Training-Free Diffusion-Based Video Editing with Image and Text Prompts

好的噪声带来好的编辑:一种基于扩散的视频编辑方法,无需训练,结合图像和文本提示

Saemee Choi, Sohyun Jeong, Hyojin Jang, Jaegul Choo, Jinhee Kim

机构 * KAIST(韩国科学技术院)

AI总结 VINO是一种无需训练的视频编辑方法,结合图像和文本提示,通过ρ-启动采样和扩张双掩码实现结构化噪声地图,从而实现高质量视频编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16073 2025-12-23 cs.CV cs.RO

OW-Rep: Open World Object Detection with Instance Representation Learning

OW-Rep: 开放世界目标检测中的实例表示学习

Sunoh Lee, Minsik Jeon, Jihong Min, Junwon Seo

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) Agency for Defense Development(国防发展局)

AI总结 OW-Rep通过引入实例表示学习,提升开放世界目标检测中未知目标的检测精度和语义嵌入质量,增强下游任务表现。

Comments Accepted to WACV 2026. Our project website can be found at https://sunohlee.github.io/OW-Rep/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09921 2025-12-23 cs.CV

FaceShield: Defending Facial Image against Deepfake Threats

FaceShield:防御面部图像 against 深度伪造威胁

Jaehwan Jeong, Sumin In, Sieun Kim, Hannie Shin, Jongheon Jeong, Sang Ho Yoon, Jaewook Chung, Sangpil Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Samsung Research(三星研究)

AI总结 FaceShield通过操控扩散模型的注意力机制和面部特征提取器,提出了一种主动防御深度伪造的方案,有效提升对抗性扰动的鲁棒性和不可察觉性。

Comments Accepted to ICCV 2025. Keywords: Deepfake, Adversarial Attack, Diffusion Models, GANs, Face Swap, Proactive Defense

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17675 2025-12-22 cs.CV cs.AI

An Empirical Study of Sampling Hyperparameters in Diffusion-Based Super-Resolution

扩散基超分辨率中采样超参数的实证研究

Yudhistira Arief Wibowo

机构 * Technical University of Munich(慕尼黑技术大学) Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 本研究通过实证分析发现,在扩散模型超分辨率中,条件步长对性能影响显著大于扩散步数,最佳步长范围为[2.0, 3.0]。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17302 2025-12-22 cs.CV

MatLat: Material Latent Space for PBR Texture Generation

MatLat:用于PBR纹理生成的材料潜在空间

Kyeongmin Yeo, Yunhong Min, Jaihoon Kim, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

AI总结 MatLat通过微调预训练VAE学习材料潜在空间,提升PBR纹理生成的保真度和性能

Comments Project page: https://matlat-proj.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17040 2025-12-22 cs.CV

Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation

无限透视作为摄像机控制的鲁棒条件化方法用于摄像机控制的视频生成

Min-Jung Kim, Jeongho Kim, Hoiyeong Jin, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所)

AI总结 InfCam通过无限透视变形和数据增强管道,实现高姿态保真度的摄像机控制视频生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10689 2025-12-22 cs.CL

Learning to Contextualize Web Pages for Enhanced Decision Making by LLM Agents

通过LLM代理增强决策的网页上下文化学习

Dongjun Lee, Juyong Lee, Kyuyoung Kim, Jihoon Tack, Jinwoo Shin, Yee Whye Teh, Kimin Lee

机构 * KAIST AI(韩国科学技术院人工智能实验室) University of Oxford(牛津大学)

AI总结 LCoW通过上下文化学习提升LLM代理在网页自动化任务中的决策能力,显著提高闭源和开源模型的成功率。

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18883 2025-12-22 cs.SE cs.LG

Predictive Prompt Analysis

预测提示分析

Jae Yong Lee, Sungmin Kang, Shin Yoo

机构 * KAIST(韩国科学技术院)

AI总结 本文提出预测提示分析方法,通过稀疏自编码器快速分析提示并预测LLM响应,提升LLM在软件开发中的应用效率。

Comments Accepted by FSE 2025, 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18267 2025-12-19 cs.LG cs.AI

ARD-LoRA: Dynamic Rank Allocation for Parameter-Efficient Fine-Tuning of Foundation Models with Heterogeneous Adaptation Needs

ARD-LoRA:动态秩分配用于具有异质适应需求的基础模型参数高效微调

Haseeb Ullah Khan Shinwari, Muhammad Usama

机构 * Newton AI Lab(牛顿人工智能实验室) School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)

AI总结 ARD-LoRA通过动态秩分配提升基础模型微调效率,实现参数高效且适应性更强的模型调整。

Journal ref IEEE Transactions on Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19712 2025-12-18 cs.CE cs.AI

Rigid-Deformation Decomposition AI Framework for 3D Spatio-Temporal Prediction of Vehicle Collision Dynamics

用于车辆碰撞动力学的3D时空预测的刚体变形分解AI框架

Sanghyuk Kim, Minsik Seo, Sunwoong Yang, Namwoo Kang

机构 * Department of Mechanical Engineering, KAIST(韩国科学技术院机械工程系) Narnia Labs(Narnia实验室) Cho Chun Shik Graduate School of Mobility, KAIST(韩国科学技术院Cho Chun Shik移动研究生院)

AI总结 本文提出了一种刚体变形分解AI框架,通过分离刚体运动与局部变形,提升车辆碰撞动力学预测的准确性和物理可解释性。

Comments 38 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13250 2025-12-16 cs.CV

Toward Ambulatory Vision: Learning Visually-Grounded Active View Selection

迈向便携视觉:基于视觉的主动视角选择

Juil Koo, Daehyeon Choi, Sangwoo Youn, Phillip Y. Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

AI总结 本文提出基于视觉的主动视角选择方法,通过仅利用当前图像中的视觉信息来选择最有信息量的视角,从而提升视觉问答的性能和泛化能力。

Comments Project page: https://active-view-selection.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12630 2025-12-16 cs.HC cs.AI

ORIBA: Exploring LLM-Driven Role-Play Chatbot as a Creativity Support Tool for Original Character Artists

ORIBA:探索基于大语言模型的对话机器人作为原创角色艺术家创造力支持工具

Yuqian Sun, Xingyu Li, Shunyu Yao, Noura Howell, Tristan Braud, Chang Hee Lee, Ali Asadipour

机构 * Computer Science Research Centre, Royal College of Art(皇家艺术学院计算机科学研究中心) Digital Media, School of Literature, Media, and Communication, Georgia Institute of Technology(佐治亚理工学院数字媒体系) Princeton University(普林斯顿大学) Digital Media, Georgia Institute of Technology(佐治亚理工学院数字媒体系) Division of Integrative Systems and Design, The Hong Kong University of Science and Technology(香港科学大学整合系统与设计 division) Industrial Design Department, College of Engineering, KAIST(韩国科学技术院工程学院工业设计系)

AI总结 ORIBA通过大语言模型支持原创角色艺术家的创意过程,平衡AI辅助与创意自主权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12610 2025-12-16 cs.CV cs.IR

Patch-wise Retrieval: A Bag of Practical Techniques for Instance-level Matching

基于补丁的检索:实例级匹配的实用技术集合

Wonseok Choi, Sohwi Lim, Nam Hyeon-Woo, Moon Ye-Bin, Dong-Ju Jeong, Jinyoung Hwang, Tae-Hyun Oh

机构 * POSTECH KAIST(韩国科学技术院) Samsung Research(三星研究所)

AI总结 Patchify通过基于补丁的检索框架实现高效实例级匹配,结合LocScore评估空间正确性,提升检索性能与可解释性。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12375 2025-12-16 cs.CV

V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping

V-Warper:通过价值扭曲实现外观一致的视频扩散个性化

Hyunkoo Lee, Wooseok Jang, Jini Yang, Taehwan Kim, Sangoh Kim, Sangwon Jung, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

AI总结 V-Warper通过价值扭曲实现视频扩散模型的无训练粗到细个性化,提升外观一致性与生成质量。

Comments Project Page: https://cvlab-kaist.github.io/V-Warper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14945 2025-12-16 cs.CV

3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation

用于场景一致的摄像机可控视频生成的3D场景提示

JoungBin Lee, Jaewoo Jung, Jisang Han, Takuya Narihira, Kazumi Fukuda, Junyoung Seo, Sunghwan Hong, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Sony AI(索尼人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Sony Group Corporation(索尼集团)

AI总结 3DScenePrompt通过双时空条件化和3D场景记忆实现场景一致且可控的视频生成,提升生成质量与摄像机控制精度。

Comments Project page : https://cvlab-kaist.github.io/3DScenePrompt/

详情

展开后加载摘要…

URL PDF HTML 收藏