Integrating Multimodal Large Language Model Knowledge into Amodal Completion
将多模态大语言模型知识整合到无模态补全中
机构 * KAIST(韩国科学技术院) ; AITRICS
AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。
高校专区
将多模态大语言模型知识整合到无模态补全中
机构 * KAIST(韩国科学技术院) ; AITRICS
AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。
从跨视图关系学习多视图空间推理
机构 * KAIST(韩国科学技术院) ; Config ; Hanyang University(汉阳大学) ; Yonsei University(延世大学) ; Seoul National University(首尔国立大学)
AI总结 本文提出Cross-View Relations数据集,通过训练视觉语言模型提升多视图空间推理能力,在MindCube和RoboSpatial基准测试中取得显著提升,并在RoboCasa任务中提高机器人操作成功率。
Comments Accepted to CVPR 2026
近优 primal-dual 算法用于具有对抗性奖励的线性混合 CMDP 学习
机构 * Department of Industrial and Systems Engineering, KAIST(韩国科学技术院工业与系统工程系) ; Department of Mathematical Sciences, Seoul National University(首尔大学数学科学系) ; Research Institute of Mathematics, Seoul National University(首尔大学数学研究所) ; Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能跨学科项目) ; Korea Institute for Advanced Study(韩国高等研究院)
AI总结 本文提出了一种 primal-dual 算法,在有限时间 horizon 的线性混合约束马尔可夫决策过程 (CMDP) 中,针对对抗性奖励和全信息反馈,实现了近最优的 regret 和约束违反界。
Sommelier: 可扩展的开放式多轮音频预处理用于全双工语音语言模型
机构 * KAIST AI(韩国科学技术院人工智能) ; NAVER Cloud(NAVER云)
AI总结 为全双工语音语言模型设计了一种鲁棒且可扩展的开源数据处理流程,以解决自然对话中的重叠和背通道问题,提升多说话人对话数据的质量和可用性。
Comments 34 pages, 7 figures, 11 tables
ConceptPrism:通过残差标记优化实现个性化扩散模型的概念解耦
机构 * KAIST(韩国科学技术院) ; Hanbat National University(韩巴大学)
AI总结 本文提出ConceptPrism框架,通过残差标记优化实现个性化扩散模型中的概念解耦,提升生成图像的质量与准确性。
Comments Accepted to CVPR 2026
PAVAS:物理感知的视频到音频合成
机构 * POSTECH(浦项科技大学) ; Sony AI(索尼人工智能) ; Sony Group Corporation(索尼集团公司) ; KAIST(韩国科学技术院)
AI总结 PAVAS通过引入物理推理,结合物理参数估计器和物理驱动音频适配器,生成符合物理规律的音频,优于现有视频到音频生成模型。
AnthroTAP: 通过真实世界运动学习点跟踪
机构 * KAIST AI(韩国科学技术院人工智能) ; Adobe Research(Adobe研究院) ; University of Michigan(密歇根大学) ; LG AI Research(LG人工智能研究院)
AI总结 AnthroTAP通过生成大规模伪标注点跟踪数据提升真实世界视频的点跟踪性能,利用人类运动的结构复杂性,结合SMPL模型和光流一致性过滤,实现优于现有方法的性能。
Comments CVPR 2026. Project Page: https://cvlab-kaist.github.io/AnthroTAP/
基于深度潜在变量模型的垂直联邦学习:支持灵活对齐和标注场景
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
AI总结 本文提出一种深度潜在变量模型,解决垂直联邦学习中数据对齐和标注的灵活性问题,通过统一框架在不同缺失机制下提升性能,实验显示在160种情况下优于所有基线方法。
Comments Accepted to ICLR 2026
在学习Q值的同时学习模型:在线同步MBQ的有限时间样本复杂度
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST)) ; Samsung Electronics(三星电子)
AI总结 本文研究了将Q学习与模型基于方法结合时的样本复杂度,提出在在线方式下同时学习模型和Q值,证明了在广泛步长范围内接近最优的样本复杂度结果。
OPRO:用于面板感知上下文图像生成的正交面板相对运算符
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
AI总结 本文提出一种参数高效的方法,通过在预训练扩散转换器的冻结位置编码上添加可学习的面板特定正交运算符,提升上下文图像生成的面板感知能力,实验表明其方法具有通用性和有效性。
Comments Accepted to CVPR 2026. 16 pages, 9 figures. Includes Supplementary Material
STRIDE:当语音识别与序列去噪相结合用于流媒体视频理解
机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) ; KAIST(韩国科学技术院) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出STRIDE方法,通过结构化序列建模解决流媒体视频中的主动激活问题,提升在线流媒体场景下的'何时说话'决策质量。
Comments Project page: https://interlive-team.github.io/STRIDE
MV-RoMa:从成对匹配到多视角轨迹重建
机构 * KAIST(韩国科学技术院) ; Seoul National University(首尔大学)
AI总结 MV-RoMa通过多视角密集匹配模型,联合估计源图像到多个共视目标的密集对应关系,提升3D重建的准确性和密度。
Comments CVPR 2026 Accepted
一个温和的教程和Bock算法的结构化重述:用于最小有向生成树
机构 * UBC(不列颠哥伦比亚大学) ; KAIST(韩国科学技术院)
AI总结 本文通过结构化重述Bock算法,使其更易读易复现,强调其作为非投影图依赖解析精确解码器的相关性,展示了算法的阶段结构和控制流。
基于类分布的主动学习用于自动驾驶中的3D占用预测
机构 * KAIST(韩国科学技术院) ; Seoul National University(首尔大学) ; Kookmin University(国民大学)
AI总结 本文提出一种基于类分布的主动学习框架,通过三种互补标准选择训练样本,以解决自动驾驶中3D占用预测的类别不平衡和标注成本问题,实现在仅42.4%标注数据下达到26.62 mIoU的性能。
Comments IEEE RA-L 2026
Journal ref IEEE Robotics and Automation Letters (2026)
MoE-GRPO:通过强化学习优化基于专家混合的视觉-语言模型
机构 * Korea University(高丽大学) ; KAIST(韩国科学技术院)
AI总结 本文提出MoE-GRPO,通过强化学习优化视觉-语言模型中的专家路由,提升专家选择多样性,缓解专家过拟合问题。
Comments Accepted at CVPR 2026
AIM-SLAM:基于自适应和信息丰富的多视图关键帧优先级的密集单目SLAM
机构 * KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院(KAIST)) ; KAIST InnoCORE LLM, KAIST(韩国科学技术院 InnoCORE LLM)
AI总结 AIM-SLAM通过自适应多视图关键帧优先级提升单目SLAM的密集重建性能,结合视觉几何基础模型实现更准确的位姿估计和一致的多视图对齐。
Comments 8 pages
CALRK-Bench:评估韩国法律中的情境感知法律推理
机构 * KAIST AI(韩国科学技术院人工智能学院) ; Law School, Ajou University(亚洲大学法学院) ; Department of Artificial Intelligence, Ajou University(亚洲大学人工智能系)
AI总结 本文提出CALRK-Bench,一个基于韩国法律体系的情境感知法律推理基准,评估模型对法律规范时效性、案件法律信息充分性及法律判断变化原因的理解能力,实验表明大语言模型在这些任务上表现不佳。
Comments 15 pages
无标签跨任务LoRA融合与空域压缩
机构 * KAIST(韩国科学技术院)
AI总结 本文提出无标签的NSC融合方法,通过适配器几何设置合并权重,实现跨分类、回归和序列生成任务的高效融合,优于现有方法。
Comments Accepted at CVPR 2026
偏好对齐的LoRA融合:保持子空间覆盖与解决方向各向异性
机构 * KAIST(韩国科学技术院)
AI总结 本文提出TARA-Merging方法,通过偏好加权交叉熵伪损失对齐融合权重,保持任务相关LoRA子空间,提升子空间覆盖和缓解各向异性,实验显示优于基线方法。
Comments Accepted at CVPR 2026
GLINT:通过高斯辐射传输建模场景级透明度
机构 * KAIST(韩国科学技术院) ; NAVER LABS
AI总结 GLINT通过显式分解的高斯表示建模场景级透明度,分离反射和透射辐射,利用几何分离线索和预训练视频照明模型提升透明场景重建性能。
Comments CVPR 2026, Project page: https://youngju-na.github.io/GLINT
ComVi:基于上下文的优化评论显示
机构 * KAIST(韩国科学技术院) ; Kookmin University(国民大学)
AI总结 ComVi通过音频视频相关性计算,将评论映射到相关视频时间点,并优化时间相关性、流行度和显示时长,提升视频观看时的评论体验。
Comments To appear in Proceedings of the ACM CHI Conference on Human Factors in Computing Systems (CHI 2026)
电影音频源分离使用视觉线索
机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院) ; Graduate School of Artificial Intelligence, UNIST(蔚山科学技术院人工智能研究生院)
AI总结 本文提出首个结合视觉信息的电影音频源分离框架AV-CASS,通过条件流匹配实现多模态音频分离,并设计专用视觉编码器提升分离质量。
Comments CVPR 2026. Project page: https://cass-flowmatching.github.io
Oops! ChatGPT 是暂时不可用!:一项关于知识工作者面对 LLM 暂停使用的日记研究
机构 * KAIST(韩国科学技术院)
AI总结 本研究通过四天的日记记录,探讨频繁使用 LLM 的知识工作者在 LLM 暂停时的工作流程中断、自我导向工作对专业价值观的重新发现以及日常实践揭示的 LLM 规范性影响。
Comments 5 pages excluding reference and appendix. Accepted at ACM CHI EA 2026
mSFT:在多任务SFT中异质性地解决数据混合过拟合问题
机构 * KAIST AI(韩国科学技术院人工智能系) ; Yonsei University(延世大学) ; Samsung Advanced Institute of Technology(三星高级技术研究所)
AI总结 mSFT通过迭代和过拟合感知的搜索算法,解决多任务数据混合中的过拟合问题,优于四个基线方法,在十个基准和六个基模型上表现优异,且在不同数据规模和任务粒度下保持鲁棒性。
Comments Pre-print (newer versions are minor edits)
OpenFS: 多手能力的指字母识别与隐式手部检测及帧级字母条件合成
机构 * KAIST(韩国科学技术院) ; KETI(韩国电子技术研究院)
AI总结 本文提出OpenFS,通过隐式手部检测和帧级字母条件合成解决指字母识别中的手部歧义、训练损失不足和词汇外问题,实现单手和多手输入的高精度识别与合成。
Comments Accepted to CVPR 2026, camera-ready version
RoAD基准:LiDAR模型在耦合域偏移和标签演变下为何失效
机构 * LG AI Research(LG AI 研究院) ; NAVER LABS(NAVER 实验室) ; KAIST(韩国科学技术院)
AI总结 RoAD基准评估LiDAR目标分类在域偏移与标签演变交织下的模型鲁棒性,通过三种学习场景测试模型适应能力,揭示子类细化和未见类插入导致的有限迁移性和持续学习中的快速遗忘问题。
听重点!基于文本的视频到音频生成
机构 * Graduate School of Cultural Technology, KAIST(韩国科学技术院文化技术研究生院) ; Division of AI and Software, Ewha Womans University(梨花女子大学人工智能与软件学部)
AI总结 本文提出基于文本的视频到音频生成任务,通过文本提示选择性提取视频中相关声音源,提升多对象视频音频处理精度。SELVA模型通过文本提示选择视频编码器中的视觉特征,结合补充标记和自监督学习提升音频质量与同步性。
Comments accepted to CVPR 2026
WorldMM: 动态多模态记忆代理用于长视频推理
机构 * KAIST(韩国科学技术院) ; NTU Singapore(新加坡南洋理工大学)
AI总结 WorldMM通过构建和检索多种互补记忆,提升长视频推理能力,实现8.4%的性能提升。
Comments CVPR 2026. Project page : https://worldmm.github.io
GUIDE:一个用于理解和协助用户进行开放性GUI任务的基准测试
机构 * KAIST(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Oxford(牛津大学) ; Konkuk University(建国大学) ; Google Inc.(谷歌公司) ; SkillBench
AI总结 GUIDE基准测试旨在评估AI模型在开放性GUI任务中感知用户行为、推断意图和提供帮助的能力,通过120名新手用户的10种软件屏幕记录,发现模型在行为状态和帮助预测上准确率仅为44.6%和55.0%,但提供用户上下文可提升帮助预测性能达50.2个百分点。
Comments Accepted at CVPR 2026
基于指令的胸部X光片病变分割方法及大规模数据集构建
机构 * KAIST(韩国科学技术院) ; Samsung Medical Center(三星医学中心) ; AITRICS
AI总结 本文提出基于指令的病变分割方法,构建首个大规模指令-回答数据集,通过自动化流程生成标注,提升胸部X光片病变分割的实用性与准确性。
Comments Camera-ready version for CVPR 2026