arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1464
2603.28333 2026-03-31 cs.CV cs.AI

Integrating Multimodal Large Language Model Knowledge into Amodal Completion

将多模态大语言模型知识整合到无模态补全中

Heecheol Yun, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS

AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27967 2026-03-31 cs.CV

Learning Multi-View Spatial Reasoning from Cross-View Relations

从跨视图关系学习多视图空间推理

Suchae Jeong, Jaehwi Song, Haeone Lee, Hanna Kim, Jian Kim, Dongjun Lee, Dong Kyu Shin, Changyeon Kim, Dongyoon Hahm, Woogyeol Jin, Juheon Choi, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Hanyang University(汉阳大学) Yonsei University(延世大学) Seoul National University(首尔国立大学)

AI总结 本文提出Cross-View Relations数据集,通过训练视觉语言模型提升多视图空间推理能力,在MindCube和RoboSpatial基准测试中取得显著提升,并在RoboCasa任务中提高机器人操作成功率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27884 2026-03-31 cs.LG math.OC

Near-Optimal Primal-Dual Algorithm for Learning Linear Mixture CMDPs with Adversarial Rewards

近优 primal-dual 算法用于具有对抗性奖励的线性混合 CMDP 学习

Kihyun Yu, Seoungbin Bae, Dabeen Lee

机构 * Department of Industrial and Systems Engineering, KAIST(韩国科学技术院工业与系统工程系) Department of Mathematical Sciences, Seoul National University(首尔大学数学科学系) Research Institute of Mathematics, Seoul National University(首尔大学数学研究所) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能跨学科项目) Korea Institute for Advanced Study(韩国高等研究院)

AI总结 本文提出了一种 primal-dual 算法,在有限时间 horizon 的线性混合约束马尔可夫决策过程 (CMDP) 中,针对对抗性奖励和全信息反馈,实现了近最优的 regret 和约束违反界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25750 2026-03-31 cs.SD cs.AI eess.AS

Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models

Sommelier: 可扩展的开放式多轮音频预处理用于全双工语音语言模型

Kyudan Jung, Jihwan Kim, Soyoon Kim, Jeonghoon Kim, Jaegul Choo, Cheonbok Park

机构 * KAIST AI(韩国科学技术院人工智能) NAVER Cloud(NAVER云)

AI总结 为全双工语音语言模型设计了一种鲁棒且可扩展的开源数据处理流程,以解决自然对话中的重叠和背通道问题,提升多说话人对话数据的质量和可用性。

Comments 34 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19575 2026-03-31 cs.CV

ConceptPrism: Concept Disentanglement in Personalized Diffusion Models via Residual Token Optimization

ConceptPrism:通过残差标记优化实现个性化扩散模型的概念解耦

Minseo Kim, Minchan Kwon, Dongyeun Lee, Yunho Jeon, Junmo Kim

机构 * KAIST(韩国科学技术院) Hanbat National University(韩巴大学)

AI总结 本文提出ConceptPrism框架,通过残差标记优化实现个性化扩散模型中的概念解耦,提升生成图像的质量与准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08282 2026-03-31 cs.CV cs.MM cs.SD

PAVAS: Physics-Aware Video-to-Audio Synthesis

PAVAS:物理感知的视频到音频合成

Oh Hyun-Bin, Yuhta Takida, Toshimitsu Uesaka, Tae-Hyun Oh, Yuki Mitsufuji

机构 * POSTECH(浦项科技大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司) KAIST(韩国科学技术院)

AI总结 PAVAS通过引入物理推理,结合物理参数估计器和物理驱动音频适配器,生成符合物理规律的音频,优于现有视频到音频生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06233 2026-03-31 cs.CV

AnthroTAP: Learning Point Tracking with Real-World Motion

AnthroTAP: 通过真实世界运动学习点跟踪

Inès Hyeonsu Kim, Seokju Cho, Jahyeok Koo, Junghyun Park, Jiahui Huang, Honglak Lee, Joon-Young Lee, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) Adobe Research(Adobe研究院) University of Michigan(密歇根大学) LG AI Research(LG人工智能研究院)

AI总结 AnthroTAP通过生成大规模伪标注点跟踪数据提升真实世界视频的点跟踪性能,利用人类运动的结构复杂性,结合SMPL模型和光流一致性过滤,实现优于现有方法的性能。

Comments CVPR 2026. Project Page: https://cvlab-kaist.github.io/AnthroTAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11035 2026-03-31 cs.LG

Deep Latent Variable Model based Vertical Federated Learning with Flexible Alignment and Labeling Scenarios

基于深度潜在变量模型的垂直联邦学习:支持灵活对齐和标注场景

Kihun Hong, Sejun Park, Ganguk Hwang

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出一种深度潜在变量模型,解决垂直联邦学习中数据对齐和标注的灵活性问题,通过统一框架在不同缺失机制下提升性能,实验显示在160种情况下优于所有基线方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11877 2026-03-31 cs.LG cs.AI

Learning the Model While Learning Q: Finite-Time Sample Complexity of Online SyncMBQ

在学习Q值的同时学习模型:在线同步MBQ的有限时间样本复杂度

Han-Dong Lim, HyeAnn Lee, Donghwan Lee

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST)) Samsung Electronics(三星电子)

AI总结 本文研究了将Q学习与模型基于方法结合时的样本复杂度,提出在在线方式下同时学习模型和Q值,证明了在广泛步长范围内接近最优的样本复杂度结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27637 2026-03-31 cs.CV

OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generation

OPRO:用于面板感知上下文图像生成的正交面板相对运算符

Sanghyeon Lee, Minwoo Lee, Euijin Shin, Kangyeol Kim, Seunghwan Choi, Jaegul Choo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出一种参数高效的方法,通过在预训练扩散转换器的冻结位置编码上添加可学习的面板特定正交运算符,提升上下文图像生成的面板感知能力,实验表明其方法具有通用性和有效性。

Comments Accepted to CVPR 2026. 16 pages, 9 figures. Includes Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27593 2026-03-31 cs.CV cs.AI

STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding

STRIDE:当语音识别与序列去噪相结合用于流媒体视频理解

Junho Kim, Hosu Lee, James M. Rehg, Minsu Kim, Yong Man Ro

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) KAIST(韩国科学技术院) Google DeepMind(谷歌DeepMind)

AI总结 本文提出STRIDE方法,通过结构化序列建模解决流媒体视频中的主动激活问题,提升在线流媒体场景下的'何时说话'决策质量。

Comments Project page: https://interlive-team.github.io/STRIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27542 2026-03-31 cs.CV

MV-RoMa: From Pairwise Matching into Multi-View Track Reconstruction

MV-RoMa:从成对匹配到多视角轨迹重建

Jongmin Lee, Seungyeop Kang, Sungjoo Yoo

机构 * KAIST(韩国科学技术院) Seoul National University(首尔大学)

AI总结 MV-RoMa通过多视角密集匹配模型,联合估计源图像到多个共视目标的密集对应关系,提升3D重建的准确性和密度。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27530 2026-03-31 cs.CL

A gentle tutorial and a structured reformulation of Bock's algorithm for minimum directed spanning trees

一个温和的教程和Bock算法的结构化重述:用于最小有向生成树

Yuxi Wang, Jungyeul Park

机构 * UBC(不列颠哥伦比亚大学) KAIST(韩国科学技术院)

AI总结 本文通过结构化重述Bock算法,使其更易读易复现,强调其作为非投影图依赖解析精确解码器的相关性,展示了算法的阶段结构和控制流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27294 2026-03-31 cs.CV

Class-Distribution Guided Active Learning for 3D Occupancy Prediction in Autonomous Driving

基于类分布的主动学习用于自动驾驶中的3D占用预测

Wonjune Kim, In-Jae Lee, Sihwan Hwang, Sanmin Kim, Dongsuk Kum

机构 * KAIST(韩国科学技术院) Seoul National University(首尔大学) Kookmin University(国民大学)

AI总结 本文提出一种基于类分布的主动学习框架,通过三种互补标准选择训练样本,以解决自动驾驶中3D占用预测的类别不平衡和标注成本问题,实现在仅42.4%标注数据下达到26.62 mIoU的性能。

Comments IEEE RA-L 2026

Journal ref IEEE Robotics and Automation Letters (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24984 2026-03-31 cs.CV

MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

MoE-GRPO:通过强化学习优化基于专家混合的视觉-语言模型

Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

AI总结 本文提出MoE-GRPO,通过强化学习优化视觉-语言模型中的专家路由,提升专家选择多样性,缓解专家过拟合问题。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05097 2026-03-31 cs.RO

AIM-SLAM: Dense Monocular SLAM via Adaptive and Informative Multi-View Keyframe Prioritization with Foundation Model

AIM-SLAM:基于自适应和信息丰富的多视图关键帧优先级的密集单目SLAM

Jinwoo Jeon, Dong-Uk Seo, Eungchang Mason Lee, Hyun Myung

机构 * KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院(KAIST)) KAIST InnoCORE LLM, KAIST(韩国科学技术院 InnoCORE LLM)

AI总结 AIM-SLAM通过自适应多视图关键帧优先级提升单目SLAM的密集重建性能,结合视觉几何基础模型实现更准确的位姿估计和一致的多视图对齐。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26332 2026-03-30 cs.CL cs.AI

CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Law

CALRK-Bench:评估韩国法律中的情境感知法律推理

JiHyeok Jung, TaeYoung Yoon, HyunSouk Cho

机构 * KAIST AI(韩国科学技术院人工智能学院) Law School, Ajou University(亚洲大学法学院) Department of Artificial Intelligence, Ajou University(亚洲大学人工智能系)

AI总结 本文提出CALRK-Bench,一个基于韩国法律体系的情境感知法律推理基准,评估模型对法律规范时效性、案件法律信息充分性及法律判断变化原因的理解能力,实验表明大语言模型在这些任务上表现不佳。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26317 2026-03-30 cs.CV cs.AI cs.LG

Label-Free Cross-Task LoRA Merging with Null-Space Compression

无标签跨任务LoRA融合与空域压缩

Wonyoung Lee, Wooseong Jeong, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 本文提出无标签的NSC融合方法,通过适配器几何设置合并权重,实现跨分类、回归和序列生成任务的高效融合,优于现有方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26299 2026-03-30 cs.CV cs.AI cs.LG

Preference-Aligned LoRA Merging: Preserving Subspace Coverage and Addressing Directional Anisotropy

偏好对齐的LoRA融合:保持子空间覆盖与解决方向各向异性

Wooseong Jeong, Wonyoung Lee, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 本文提出TARA-Merging方法,通过偏好加权交叉熵伪损失对齐融合权重,保持任务相关LoRA子空间,提升子空间覆盖和缓解各向异性,实验显示优于基线方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26181 2026-03-30 cs.CV

GLINT: Modeling Scene-Scale Transparency via Gaussian Radiance Transport

GLINT:通过高斯辐射传输建模场景级透明度

Youngju Na, Jaeseong Yun, Soohyun Ryu, Hyunsu Kim, Sung-Eui Yoon, Suyong Yeon

机构 * KAIST(韩国科学技术院) NAVER LABS

AI总结 GLINT通过显式分解的高斯表示建模场景级透明度,分离反射和透射辐射,利用几何分离线索和预训练视频照明模型提升透明场景重建性能。

Comments CVPR 2026, Project page: https://youngju-na.github.io/GLINT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26173 2026-03-30 cs.MM cs.CV cs.GR cs.HC

ComVi: Context-Aware Optimized Comment Display in Video Playback

ComVi:基于上下文的优化评论显示

Minsun Kim, Dawon Lee, Junyong Noh

机构 * KAIST(韩国科学技术院) Kookmin University(国民大学)

AI总结 ComVi通过音频视频相关性计算,将评论映射到相关视频时间点,并优化时间相关性、流行度和显示时长,提升视频观看时的评论体验。

Comments To appear in Proceedings of the ACM CHI Conference on Human Factors in Computing Systems (CHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26113 2026-03-30 cs.MM cs.SD eess.AS

Cinematic Audio Source Separation Using Visual Cues

电影音频源分离使用视觉线索

Kang Zhang, Suyeon Lee, Arda Senocak, Joon Son Chung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院) Graduate School of Artificial Intelligence, UNIST(蔚山科学技术院人工智能研究生院)

AI总结 本文提出首个结合视觉信息的电影音频源分离框架AV-CASS,通过条件流匹配实现多模态音频分离,并设计专用视觉编码器提升分离质量。

Comments CVPR 2026. Project page: https://cass-flowmatching.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26099 2026-03-30 cs.HC cs.AI

"Oops! ChatGPT is Temporarily Unavailable!": A Diary Study on Knowledge Workers' Experiences of LLM Withdrawal

Oops! ChatGPT 是暂时不可用!:一项关于知识工作者面对 LLM 暂停使用的日记研究

Eunseo Oh, Suyoun Lee, Jae Young Choi, Soobin Park, Youn-kyung Lim

机构 * KAIST(韩国科学技术院)

AI总结 本研究通过四天的日记记录,探讨频繁使用 LLM 的知识工作者在 LLM 暂停时的工作流程中断、自我导向工作对专业价值观的重新发现以及日常实践揭示的 LLM 规范性影响。

Comments 5 pages excluding reference and appendix. Accepted at ACM CHI EA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21606 2026-03-30 cs.LG cs.AI

mSFT: Addressing Dataset Mixtures Overfitting Heterogeneously in Multi-task SFT

mSFT:在多任务SFT中异质性地解决数据混合过拟合问题

Woosung Koh, Jeyoung Jeon, Youngjin Song, Yujin Cheon, Soowon Oh, Jaehyeong Choi, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能系) Yonsei University(延世大学) Samsung Advanced Institute of Technology(三星高级技术研究所)

AI总结 mSFT通过迭代和过拟合感知的搜索算法,解决多任务数据混合中的过拟合问题,优于四个基线方法,在十个基准和六个基模型上表现优异,且在不同数据规模和任务粒度下保持鲁棒性。

Comments Pre-print (newer versions are minor edits)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22949 2026-03-30 cs.CV

OpenFS: Multi-Hand-Capable Fingerspelling Recognition with Implicit Signing-Hand Detection and Frame-Wise Letter-Conditioned Synthesis

OpenFS: 多手能力的指字母识别与隐式手部检测及帧级字母条件合成

Junuk Cha, Jihyeon Kim, Han-Mu Park

机构 * KAIST(韩国科学技术院) KETI(韩国电子技术研究院)

AI总结 本文提出OpenFS,通过隐式手部检测和帧级字母条件合成解决指字母识别中的手部歧义、训练损失不足和词汇外问题,实现单手和多手输入的高精度识别与合成。

Comments Accepted to CVPR 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07855 2026-03-30 cs.CV cs.AI

RoAD Benchmark: How LiDAR Models Fail under Coupled Domain Shifts and Label Evolution

RoAD基准:LiDAR模型在耦合域偏移和标签演变下为何失效

Subeen Lee, Siyeong Lee, Namil Kim, Jaesik Choi

机构 * LG AI Research(LG AI 研究院) NAVER LABS(NAVER 实验室) KAIST(韩国科学技术院)

AI总结 RoAD基准评估LiDAR目标分类在域偏移与标签演变交织下的模型鲁棒性,通过三种学习场景测试模型适应能力,揭示子类细化和未见类插入导致的有限迁移性和持续学习中的快速遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02650 2026-03-30 cs.CV cs.LG cs.MM cs.SD eess.AS

Hear What Matters! Text-conditioned Selective Video-to-Audio Generation

听重点!基于文本的视频到音频生成

Junwon Lee, Juhan Nam, Jiyoung Lee

机构 * Graduate School of Cultural Technology, KAIST(韩国科学技术院文化技术研究生院) Division of AI and Software, Ewha Womans University(梨花女子大学人工智能与软件学部)

AI总结 本文提出基于文本的视频到音频生成任务,通过文本提示选择性提取视频中相关声音源,提升多对象视频音频处理精度。SELVA模型通过文本提示选择视频编码器中的视觉特征,结合补充标记和自监督学习提升音频质量与同步性。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02425 2026-03-30 cs.CV cs.AI cs.CL cs.IR cs.LG

WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning

WorldMM: 动态多模态记忆代理用于长视频推理

Woongyeong Yeo, Kangsan Kim, Jaehong Yoon, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡南洋理工大学)

AI总结 WorldMM通过构建和检索多种互补记忆,提升长视频推理能力,实现8.4%的性能提升。

Comments CVPR 2026. Project page : https://worldmm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25864 2026-03-30 cs.CV cs.AI cs.HC

GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks

GUIDE:一个用于理解和协助用户进行开放性GUI任务的基准测试

Saelyne Yang, Jaesang Yu, Yi-Hao Peng, Kevin Qinghong Lin, Jae Won Cho, Yale Song, Juho Kim

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) Konkuk University(建国大学) Google Inc.(谷歌公司) SkillBench

AI总结 GUIDE基准测试旨在评估AI模型在开放性GUI任务中感知用户行为、推断意图和提供帮助的能力,通过120名新手用户的10种软件屏幕记录,发现模型在行为状态和帮助预测上准确率仅为44.6%和55.0%,但提供用户上下文可提升帮助预测性能达50.2个百分点。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15186 2026-03-27 cs.CV

Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset

基于指令的胸部X光片病变分割方法及大规模数据集构建

Geon Choi, Hangyul Yoon, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Eunho Yang, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医学中心) AITRICS

AI总结 本文提出基于指令的病变分割方法,构建首个大规模指令-回答数据集,通过自动化流程生成标注,提升胸部X光片病变分割的实用性与准确性。

Comments Camera-ready version for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏