arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-03-31 至 2026-03-31 共收录 17
2601.15288 2026-03-31 cs.CV

APPLE: Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping

APPLE:基于扩散模型的属性保留伪标签面部交换

Jiwon Kang, Yeji Choi, JoungBin Lee, Wooseok Jang, Jinhyeok Choi, Taekeun Kang, Yongjae Park, Myungin Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) SAMSUNG(三星)

AI总结 本文提出APPLE框架,通过条件去模糊和属性感知反向方案提升面部交换中属性保留能力,实现高保真属性与身份转移。

Comments Accepted at CVPR 2026. Project Page: https://cvlab-kaist.github.io/APPLE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28333 2026-03-31 cs.CV cs.AI

Integrating Multimodal Large Language Model Knowledge into Amodal Completion

将多模态大语言模型知识整合到无模态补全中

Heecheol Yun, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS

AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27967 2026-03-31 cs.CV

Learning Multi-View Spatial Reasoning from Cross-View Relations

从跨视图关系学习多视图空间推理

Suchae Jeong, Jaehwi Song, Haeone Lee, Hanna Kim, Jian Kim, Dongjun Lee, Dong Kyu Shin, Changyeon Kim, Dongyoon Hahm, Woogyeol Jin, Juheon Choi, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Hanyang University(汉阳大学) Yonsei University(延世大学) Seoul National University(首尔国立大学)

AI总结 本文提出Cross-View Relations数据集,通过训练视觉语言模型提升多视图空间推理能力,在MindCube和RoboSpatial基准测试中取得显著提升,并在RoboCasa任务中提高机器人操作成功率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27884 2026-03-31 cs.LG math.OC

Near-Optimal Primal-Dual Algorithm for Learning Linear Mixture CMDPs with Adversarial Rewards

近优 primal-dual 算法用于具有对抗性奖励的线性混合 CMDP 学习

Kihyun Yu, Seoungbin Bae, Dabeen Lee

机构 * Department of Industrial and Systems Engineering, KAIST(韩国科学技术院工业与系统工程系) Department of Mathematical Sciences, Seoul National University(首尔大学数学科学系) Research Institute of Mathematics, Seoul National University(首尔大学数学研究所) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能跨学科项目) Korea Institute for Advanced Study(韩国高等研究院)

AI总结 本文提出了一种 primal-dual 算法,在有限时间 horizon 的线性混合约束马尔可夫决策过程 (CMDP) 中,针对对抗性奖励和全信息反馈,实现了近最优的 regret 和约束违反界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25750 2026-03-31 cs.SD cs.AI eess.AS

Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models

Sommelier: 可扩展的开放式多轮音频预处理用于全双工语音语言模型

Kyudan Jung, Jihwan Kim, Soyoon Kim, Jeonghoon Kim, Jaegul Choo, Cheonbok Park

机构 * KAIST AI(韩国科学技术院人工智能) NAVER Cloud(NAVER云)

AI总结 为全双工语音语言模型设计了一种鲁棒且可扩展的开源数据处理流程,以解决自然对话中的重叠和背通道问题,提升多说话人对话数据的质量和可用性。

Comments 34 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19575 2026-03-31 cs.CV

ConceptPrism: Concept Disentanglement in Personalized Diffusion Models via Residual Token Optimization

ConceptPrism:通过残差标记优化实现个性化扩散模型的概念解耦

Minseo Kim, Minchan Kwon, Dongyeun Lee, Yunho Jeon, Junmo Kim

机构 * KAIST(韩国科学技术院) Hanbat National University(韩巴大学)

AI总结 本文提出ConceptPrism框架,通过残差标记优化实现个性化扩散模型中的概念解耦,提升生成图像的质量与准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08282 2026-03-31 cs.CV cs.MM cs.SD

PAVAS: Physics-Aware Video-to-Audio Synthesis

PAVAS:物理感知的视频到音频合成

Oh Hyun-Bin, Yuhta Takida, Toshimitsu Uesaka, Tae-Hyun Oh, Yuki Mitsufuji

机构 * POSTECH(浦项科技大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司) KAIST(韩国科学技术院)

AI总结 PAVAS通过引入物理推理,结合物理参数估计器和物理驱动音频适配器,生成符合物理规律的音频,优于现有视频到音频生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06233 2026-03-31 cs.CV

AnthroTAP: Learning Point Tracking with Real-World Motion

AnthroTAP: 通过真实世界运动学习点跟踪

Inès Hyeonsu Kim, Seokju Cho, Jahyeok Koo, Junghyun Park, Jiahui Huang, Honglak Lee, Joon-Young Lee, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) Adobe Research(Adobe研究院) University of Michigan(密歇根大学) LG AI Research(LG人工智能研究院)

AI总结 AnthroTAP通过生成大规模伪标注点跟踪数据提升真实世界视频的点跟踪性能,利用人类运动的结构复杂性,结合SMPL模型和光流一致性过滤,实现优于现有方法的性能。

Comments CVPR 2026. Project Page: https://cvlab-kaist.github.io/AnthroTAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11035 2026-03-31 cs.LG

Deep Latent Variable Model based Vertical Federated Learning with Flexible Alignment and Labeling Scenarios

基于深度潜在变量模型的垂直联邦学习:支持灵活对齐和标注场景

Kihun Hong, Sejun Park, Ganguk Hwang

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出一种深度潜在变量模型,解决垂直联邦学习中数据对齐和标注的灵活性问题,通过统一框架在不同缺失机制下提升性能,实验显示在160种情况下优于所有基线方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11877 2026-03-31 cs.LG cs.AI

Learning the Model While Learning Q: Finite-Time Sample Complexity of Online SyncMBQ

在学习Q值的同时学习模型:在线同步MBQ的有限时间样本复杂度

Han-Dong Lim, HyeAnn Lee, Donghwan Lee

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST)) Samsung Electronics(三星电子)

AI总结 本文研究了将Q学习与模型基于方法结合时的样本复杂度,提出在在线方式下同时学习模型和Q值,证明了在广泛步长范围内接近最优的样本复杂度结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27637 2026-03-31 cs.CV

OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generation

OPRO:用于面板感知上下文图像生成的正交面板相对运算符

Sanghyeon Lee, Minwoo Lee, Euijin Shin, Kangyeol Kim, Seunghwan Choi, Jaegul Choo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出一种参数高效的方法,通过在预训练扩散转换器的冻结位置编码上添加可学习的面板特定正交运算符,提升上下文图像生成的面板感知能力,实验表明其方法具有通用性和有效性。

Comments Accepted to CVPR 2026. 16 pages, 9 figures. Includes Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27593 2026-03-31 cs.CV cs.AI

STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding

STRIDE:当语音识别与序列去噪相结合用于流媒体视频理解

Junho Kim, Hosu Lee, James M. Rehg, Minsu Kim, Yong Man Ro

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) KAIST(韩国科学技术院) Google DeepMind(谷歌DeepMind)

AI总结 本文提出STRIDE方法,通过结构化序列建模解决流媒体视频中的主动激活问题,提升在线流媒体场景下的'何时说话'决策质量。

Comments Project page: https://interlive-team.github.io/STRIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27542 2026-03-31 cs.CV

MV-RoMa: From Pairwise Matching into Multi-View Track Reconstruction

MV-RoMa:从成对匹配到多视角轨迹重建

Jongmin Lee, Seungyeop Kang, Sungjoo Yoo

机构 * KAIST(韩国科学技术院) Seoul National University(首尔大学)

AI总结 MV-RoMa通过多视角密集匹配模型,联合估计源图像到多个共视目标的密集对应关系,提升3D重建的准确性和密度。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27530 2026-03-31 cs.CL

A gentle tutorial and a structured reformulation of Bock's algorithm for minimum directed spanning trees

一个温和的教程和Bock算法的结构化重述:用于最小有向生成树

Yuxi Wang, Jungyeul Park

机构 * UBC(不列颠哥伦比亚大学) KAIST(韩国科学技术院)

AI总结 本文通过结构化重述Bock算法,使其更易读易复现,强调其作为非投影图依赖解析精确解码器的相关性,展示了算法的阶段结构和控制流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27294 2026-03-31 cs.CV

Class-Distribution Guided Active Learning for 3D Occupancy Prediction in Autonomous Driving

基于类分布的主动学习用于自动驾驶中的3D占用预测

Wonjune Kim, In-Jae Lee, Sihwan Hwang, Sanmin Kim, Dongsuk Kum

机构 * KAIST(韩国科学技术院) Seoul National University(首尔大学) Kookmin University(国民大学)

AI总结 本文提出一种基于类分布的主动学习框架,通过三种互补标准选择训练样本,以解决自动驾驶中3D占用预测的类别不平衡和标注成本问题,实现在仅42.4%标注数据下达到26.62 mIoU的性能。

Comments IEEE RA-L 2026

Journal ref IEEE Robotics and Automation Letters (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24984 2026-03-31 cs.CV

MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

MoE-GRPO:通过强化学习优化基于专家混合的视觉-语言模型

Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

AI总结 本文提出MoE-GRPO,通过强化学习优化视觉-语言模型中的专家路由,提升专家选择多样性,缓解专家过拟合问题。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05097 2026-03-31 cs.RO

AIM-SLAM: Dense Monocular SLAM via Adaptive and Informative Multi-View Keyframe Prioritization with Foundation Model

AIM-SLAM:基于自适应和信息丰富的多视图关键帧优先级的密集单目SLAM

Jinwoo Jeon, Dong-Uk Seo, Eungchang Mason Lee, Hyun Myung

机构 * KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院(KAIST)) KAIST InnoCORE LLM, KAIST(韩国科学技术院 InnoCORE LLM)

AI总结 AIM-SLAM通过自适应多视图关键帧优先级提升单目SLAM的密集重建性能,结合视觉几何基础模型实现更准确的位姿估计和一致的多视图对齐。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏