Token Warping Helps MLLMs Look from Nearby Viewpoints
令牌扭曲帮助多模态大语言模型从近处视角观察
机构 * KAIST(韩国科学技术院)
AI总结 本文研究令牌扭曲如何帮助多模态大语言模型从近处视角理解场景,发现反向令牌扭曲在视角变化中更稳定且能更好保持语义一致性。
Comments CVPR 2026, Project Page: https://token-warping-mllm.github.io
高校专区
令牌扭曲帮助多模态大语言模型从近处视角观察
机构 * KAIST(韩国科学技术院)
AI总结 本文研究令牌扭曲如何帮助多模态大语言模型从近处视角理解场景,发现反向令牌扭曲在视角变化中更稳定且能更好保持语义一致性。
Comments CVPR 2026, Project Page: https://token-warping-mllm.github.io
因子化多分辨率哈希网格:用于高效神经辐射场的执行边缘设备
机构 * POSTECH(浦项科技大学) ; KAIST(韩国科学技术院) ; NAVER AI Lab(NAVER AI实验室)
AI总结 本文提出Fact-Hash,一种用于边缘设备神经辐射场训练的参数编码方法,通过融合张量分解与哈希编码技术,提升内存效率和渲染速度,实现高质量3D表示。
Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L)
Journal ref IEEE Robotics and Automation Letters (RA-L), 2024
随机难以超越:在线DPO中的主动选择
机构 * Seoul National University(首尔大学) ; Ewha Womans University(梨花女子大学) ; KAIST(韩国科学技术院) ; UBC(不列颠哥伦比亚大学)
AI总结 本文研究了在线DPO中主动选择策略的有效性,发现即使在强先验基础上,主动选择的计算开销难以抵消简单随机采样带来的多样性优势。
Comments first commit
适应性引导的检索增强掩码扩散模型
机构 * KAIST(韩国科学技术院)
AI总结 本文提出ARAM框架,通过动态校准引导尺度提升检索增强扩散模型在知识密集型问答中的性能。
DiFlowDubber:通过跨模态对齐与同步实现的离散流匹配自动化视频配音
机构 * FPT Software AI Center, Vietnam(FPT软件人工智能中心,越南) ; KAIST, South Korea(韩国科学技术院) ; University of Alabama at Birmingham, USA(阿拉巴马大学伯明翰分校)
AI总结 本文提出DiFlowDubber框架,通过离散流匹配和两阶段训练策略,解决视频配音中内容准确性、表达语气、高质量音频和精确唇同步的问题。
Comments Accepted at CVPR 2026 Findings
通过低秩解码器适应实现高效的深度完成测试时优化
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))
AI总结 本文提出一种轻量级测试时适应方法,通过更新低维子空间实现高效零样本深度完成,提升准确率与效率的平衡。
Comments 17 pages, 7 figures [We achieved a new Pareto frontier in test-time depth completion.]
学习自适应伪标签选择用于半监督3D目标检测
机构 * School of Computing, KAIST(韩国科学技术院计算机学院) ; AI Lab, LG Electronics(LG电子人工智能实验室)
AI总结 本文提出一种自适应伪标签选择框架,通过动态阈值和上下文信息提升3D目标检测性能,实验表明其在KITTI和Waymo数据集上效果显著。
Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026