Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy
Q-Flow: 基于流的稳定且表达力强的强化学习
机构 * KAIST AI(韩国科学技术院人工智能实验室)
AI总结 Q-Flow通过利用流动力学的确定性,将终端轨迹价值显式传播到中间潜在状态,实现稳定策略优化,同时在OGBench数据集上表现优于现有方法。
Comments ICML 2026
高校专区
Q-Flow: 基于流的稳定且表达力强的强化学习
机构 * KAIST AI(韩国科学技术院人工智能实验室)
AI总结 Q-Flow通过利用流动力学的确定性,将终端轨迹价值显式传播到中间潜在状态,实现稳定策略优化,同时在OGBench数据集上表现优于现有方法。
Comments ICML 2026
面向高效视频大语言模型的sink-token感知剪枝:用于细粒度视频理解
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) ; Oracle ; University of California, San Diego(加州大学圣地亚哥分校) ; Electronics and Telecommunications Research Institute (ETRI)(电子电信研究院)
AI总结 本文提出Sink-Token-aware Pruning方法,通过识别并抑制semantically uninformative tokens,提升细粒度视频理解性能,在多种基准测试中表现优异。
Comments ECCV 2026
现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施
机构 * NAVER Cloud AI(NAVER云AI) ; KAIST AI(韩国国立庆北大学AI)
AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。
Comments Accepted to Interspeech 2026
基于鲁棒紧耦合滤波器的单目视觉惯性状态估计与图优化评估用于自主无人机竞速
机构 * Unmanned Systems Research Group (USRG), School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(无人系统研究组(USRG)、电气工程学院、韩国科学技术院(KAIST))
AI总结 提出ADR-VINS,一种基于误差状态卡尔曼滤波器的单目视觉惯性框架,通过直接像素重投影误差实现鲁棒状态估计,仅需两个可见角点;并引入ADR-FGO离线图优化生成高保真参考轨迹,用于无GNSS环境下的性能评估。
Comments Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
面向异方差广义线性Bandits的联合高效与最优抗对抗性破坏算法
机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)
AI总结 针对含对抗性破坏的异方差广义线性Bandits问题,提出HCW-GLB-OMD算法,结合在线镜像下降估计器与基于Hessian的置信权重,实现计算高效(每轮O(1)时空复杂度)和实例级极小化最优遗憾界。
Comments 40 pages, 1 table (ver2: some updates)