Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing
Dub-S2ST: 无文本语音到语音翻译用于无缝配音
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 Dub-S2ST通过无文本语音到语音翻译模型实现无缝配音,保留语音特征并提升翻译质量。
Comments EMNLP 2025 Findings
高校专区
Dub-S2ST: 无文本语音到语音翻译用于无缝配音
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 Dub-S2ST通过无文本语音到语音翻译模型实现无缝配音,保留语音特征并提升翻译质量。
Comments EMNLP 2025 Findings
基于样本加权的公平类增量学习
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 本文提出了一种基于样本加权的公平类增量学习框架,通过调整训练权重减少敏感群体的遗忘,提升模型公平性。
Comments 30 pages, 30 figures
在高斯测量噪声下用于超分辨率的扩散后验采样
机构 * Korea Advanced Institute of Science \& Technology (KAIST) Daejeon, South Korea
AI总结 本文提出了一种在高斯噪声下通过扩散后验采样实现超分辨率的方法,通过优化指导尺度和噪声水平提升重建质量,平衡先验与梯度强度以获得稳定高质量结果。
TexAvatars : 混合的texel-3D表示用于稳定驱动的逼真高斯头avatars
机构 * KAIST(韩国科学技术院) ; Hanyang University(翰阳大学)
AI总结 TexAvatars通过混合texel-3D表示,结合分析rigging的几何基础与texel空间的连续性,实现逼真头avatars的稳定驱动和高保真表达。
Comments 3DV 2026, Project page with videos: https://summertight.github.io/TexAvatars/
像真正的病理科医生一样诊断:一种以不确定性为核心的多分辨率多实例学习方法
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 本文提出UFC-MIL方法,通过多分辨率图像和不确定性校准,提升多实例学习的诊断可靠性。
Comments Accepted by IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026
ESDD 2026:环境声音深度伪造检测挑战评估计划
机构 * 1 School of Electrical Engineering, KAIST, Daejeon, Republic of Korea 2 University of Melbourne, Australia 3 Fortemedia Singapore, Singapore 4 Xi'an University of Posts \& Telecommunications, Xi'an, China
AI总结 ESDD 2026挑战旨在通过EnvSDD数据集检测环境声音深度伪造,涵盖未见过生成器和低资源场景的两种赛道。
SweRank+: 多语言、多轮次代码排名用于软件问题定位
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Salesforce AI Research(Salesforce AI研究院) ; KAIST AI(韩国科学技术院AI研究中心)
AI总结 SweRank+结合跨语言代码排名工具和代理搜索设置,实现多轮次的代码库推理,提升多语言软件问题定位的准确性和效率。
校正漂移的单目视觉惯性里程计与感知感知的自主无人机竞速
机构 * Department of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程系,韩国科学技术院(KAIST))
AI总结 本文提出了一种校正VIO漂移的方法,结合YOLO门检测器和卡尔曼滤波器,以提升无人机竞速中的视觉惯性里程计精度与感知规划性能。
DETACH:解构时空对齐用于外向视频和环境传感器的分阶段学习
机构 * KAIST(韩国科学技术院)
AI总结 DETACH通过解构时空对齐方法,解决外向视频与环境传感器在动作识别中的对齐问题,提升模型在Opportunity++和HWU-USP数据集上的性能。
TAVID:基于文本的音频视觉交互对话生成
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 TAVID通过统一框架同步生成交互面部和对话语音,实现音频视觉多模态对话生成。
Comments Project page: https://mm.kaist.ac.kr/projects/TAVID
关于指令微调本地LLM在识别软件漏洞中的有效性
机构 * KAIST Cyber Security Research Center(韩国科学技术院网络安全研究中心)
AI总结 本文提出通过指令微调本地LLM来提升软件漏洞识别效果,替代依赖API的大型模型,实现更高效、安全的漏洞管理。
Comments The 9th International Conference on Mobile Internet Security (MobiSec 2025)
DRO-EDL-MPC:基于证据深度学习的分布鲁棒模型预测控制用于安全自动驾驶
机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)
AI总结 DRO-EDL-MPC通过结合证据深度学习和分布鲁棒优化,提升自动驾驶中的安全性和控制可靠性。
Comments Accepted to IEEE Robotics and Automation Letters (RA-L)
GradMix: 基于梯度的选取混合法用于类别增量学习中的鲁棒数据增强
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 GradMix是一种基于梯度的选取混合方法,用于减少类别增量学习中的灾难性遗忘,通过混合有益类对样本以提升模型性能。
Comments Accepted to KDD 2026
WaTeRFlow:通过流一致性实现水印时间鲁棒性
机构 * Korea University(韩国大学) ; Google DeepMind(谷歌DeepMind) ; KAIST AI(韩国科学技术院人工智能)
AI总结 WaTeRFlow通过流一致性提升I2V场景下的水印鲁棒性,结合FUSE引擎、时间一致性损失和语义保持损失,实现跨模态水印恢复。
EcoSplat: 可控效率的多视角图像前馈3D高斯点云生成
机构 * KAIST(韩国科学技术院) ; Flawless AI ; Department of Imaging Science, GSAIM, Chung-Ang University(Chung-Ang 大学影像科学系)
AI总结 EcoSplat是一种可控制效率的前馈3D高斯点云生成框架,通过两阶段优化过程实现自适应的3D表示生成,适用于灵活的下游渲染任务。
Comments The first two authors contributed equally to this work (equal contribution). The last two authors advised equally to this work. Please visit our project page at https://kaist-viclab.github.io/ecosplat-site/
好的噪声带来好的编辑:一种基于扩散的视频编辑方法,无需训练,结合图像和文本提示
机构 * KAIST(韩国科学技术院)
AI总结 VINO是一种无需训练的视频编辑方法,结合图像和文本提示,通过ρ-启动采样和扩张双掩码实现结构化噪声地图,从而实现高质量视频编辑。
OW-Rep: 开放世界目标检测中的实例表示学习
机构 * KAIST(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学) ; Agency for Defense Development(国防发展局)
AI总结 OW-Rep通过引入实例表示学习,提升开放世界目标检测中未知目标的检测精度和语义嵌入质量,增强下游任务表现。
Comments Accepted to WACV 2026. Our project website can be found at https://sunohlee.github.io/OW-Rep/
FaceShield:防御面部图像 against 深度伪造威胁
机构 * Korea University(韩国大学) ; KAIST(韩国科学技术院) ; Samsung Research(三星研究)
AI总结 FaceShield通过操控扩散模型的注意力机制和面部特征提取器,提出了一种主动防御深度伪造的方案,有效提升对抗性扰动的鲁棒性和不可察觉性。
Comments Accepted to ICCV 2025. Keywords: Deepfake, Adversarial Attack, Diffusion Models, GANs, Face Swap, Proactive Defense
扩散基超分辨率中采样超参数的实证研究
机构 * Technical University of Munich(慕尼黑技术大学) ; Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 本研究通过实证分析发现,在扩散模型超分辨率中,条件步长对性能影响显著大于扩散步数,最佳步长范围为[2.0, 3.0]。
MatLat:用于PBR纹理生成的材料潜在空间
机构 * KAIST(韩国科学技术院)
AI总结 MatLat通过微调预训练VAE学习材料潜在空间,提升PBR纹理生成的保真度和性能
Comments Project page: https://matlat-proj.github.io
无限透视作为摄像机控制的鲁棒条件化方法用于摄像机控制的视频生成
机构 * KAIST AI(韩国科学技术院人工智能研究所)
AI总结 InfCam通过无限透视变形和数据增强管道,实现高姿态保真度的摄像机控制视频生成,优于现有方法。
通过LLM代理增强决策的网页上下文化学习
机构 * KAIST AI(韩国科学技术院人工智能实验室) ; University of Oxford(牛津大学)
AI总结 LCoW通过上下文化学习提升LLM代理在网页自动化任务中的决策能力,显著提高闭源和开源模型的成功率。
Comments Accepted to ICLR 2025
预测提示分析
机构 * KAIST(韩国科学技术院)
AI总结 本文提出预测提示分析方法,通过稀疏自编码器快速分析提示并预测LLM响应,提升LLM在软件开发中的应用效率。
Comments Accepted by FSE 2025, 5 pages, 2 figures
ARD-LoRA:动态秩分配用于具有异质适应需求的基础模型参数高效微调
机构 * Newton AI Lab(牛顿人工智能实验室) ; School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)
AI总结 ARD-LoRA通过动态秩分配提升基础模型微调效率,实现参数高效且适应性更强的模型调整。
Journal ref IEEE Transactions on Artificial Intelligence, 2025
用于车辆碰撞动力学的3D时空预测的刚体变形分解AI框架
机构 * Department of Mechanical Engineering, KAIST(韩国科学技术院机械工程系) ; Narnia Labs(Narnia实验室) ; Cho Chun Shik Graduate School of Mobility, KAIST(韩国科学技术院Cho Chun Shik移动研究生院)
AI总结 本文提出了一种刚体变形分解AI框架,通过分离刚体运动与局部变形,提升车辆碰撞动力学预测的准确性和物理可解释性。
Comments 38 pages, 24 figures
迈向便携视觉:基于视觉的主动视角选择
机构 * KAIST(韩国科学技术院)
AI总结 本文提出基于视觉的主动视角选择方法,通过仅利用当前图像中的视觉信息来选择最有信息量的视角,从而提升视觉问答的性能和泛化能力。
Comments Project page: https://active-view-selection.github.io/
ORIBA:探索基于大语言模型的对话机器人作为原创角色艺术家创造力支持工具
机构 * Computer Science Research Centre, Royal College of Art(皇家艺术学院计算机科学研究中心) ; Digital Media, School of Literature, Media, and Communication, Georgia Institute of Technology(佐治亚理工学院数字媒体系) ; Princeton University(普林斯顿大学) ; Digital Media, Georgia Institute of Technology(佐治亚理工学院数字媒体系) ; Division of Integrative Systems and Design, The Hong Kong University of Science and Technology(香港科学大学整合系统与设计 division) ; Industrial Design Department, College of Engineering, KAIST(韩国科学技术院工程学院工业设计系)
AI总结 ORIBA通过大语言模型支持原创角色艺术家的创意过程,平衡AI辅助与创意自主权。
基于补丁的检索:实例级匹配的实用技术集合
机构 * POSTECH ; KAIST(韩国科学技术院) ; Samsung Research(三星研究所)
AI总结 Patchify通过基于补丁的检索框架实现高效实例级匹配,结合LocScore评估空间正确性,提升检索性能与可解释性。
Comments WACV 2026
V-Warper:通过价值扭曲实现外观一致的视频扩散个性化
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Korea University(韩国大学)
AI总结 V-Warper通过价值扭曲实现视频扩散模型的无训练粗到细个性化,提升外观一致性与生成质量。
Comments Project Page: https://cvlab-kaist.github.io/V-Warper
用于场景一致的摄像机可控视频生成的3D场景提示
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Sony AI(索尼人工智能研究所) ; ETH Zürich(苏黎世联邦理工学院) ; Sony Group Corporation(索尼集团)
AI总结 3DScenePrompt通过双时空条件化和3D场景记忆实现场景一致且可控的视频生成,提升生成质量与摄像机控制精度。
Comments Project page : https://cvlab-kaist.github.io/3DScenePrompt/