Self-conditioned Flow Map Language Models via Fixed-point Flows
自条件流映射语言模型通过不动点流
机构 * KAIST(韩国科学技术院) ; University of Amsterdam(阿姆斯特丹大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出不动点流框架,将自条件机制解释为不动点迭代,并设计二维流模型同时压缩迭代与流过程,实现少步生成,在OpenWebText上超越现有模型。
高校专区
自条件流映射语言模型通过不动点流
机构 * KAIST(韩国科学技术院) ; University of Amsterdam(阿姆斯特丹大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出不动点流框架,将自条件机制解释为不动点迭代,并设计二维流模型同时压缩迭代与流过程,实现少步生成,在OpenWebText上超越现有模型。
3D HAMSTER:通过3D轨迹引导在分层视觉语言动作模型中桥接规划与控制
机构 * Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院金载哲人工智能研究生院) ; Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) ; KRAFTON AI
AI总结 提出3D HAMSTER框架,通过让规划器直接输出度量可靠的3D轨迹,弥合2D引导与3D低层策略之间的差距,在3D轨迹预测、仿真和真实操作中优于现有方法。
Comments Published in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. Code: https://github.com/DAVIAN-Robotics/3D_HAMSTER. Project page: https://davian-robotics.github.io/3D_HAMSTER/
Clotho:用于LLM输入的任务特定预生成测试充分性度量
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Chalmers University of Technology Gothenburg Sweden(楚德大学哥德堡瑞典) ; Chalmers University of Technology(楚德大学)
AI总结 Clotho通过分析LLM隐藏状态直接估计输入难度,无需生成输出即可评估测试输入的有效性,提升测试效率并降低LLM执行成本。
Comments FSE 2026 Camera Ready version
用小代理模型预测LLM推理性能
机构 * Trillion Labs ; KAIST AI(韩国科学技术院人工智能系)
AI总结 提出rBridge方法,通过任务对齐加权负对数似然,使小模型(≤1B)有效预测大模型推理性能,成本降低超100倍,在1B-32B规模上实现最强相关性。
Comments ICLR 2026
打破失败级联:面向医学多模态推理的步骤感知强化学习
机构 * Korea University(高丽大学) ; Upstage AI ; Kyung Hee University(庆熙大学) ; KAIST(韩国科学技术院) ; Hanyang University College of Medicine(汉阳大学医学院) ; AIGEN Sciences
AI总结 提出步骤感知强化学习算法MRPO,通过为早期错误推理步骤分配指数级惩罚,打破失败级联,显著提升医学视觉问答准确率。
HABIT:用于机器人操作的人类感知行为与交互训练数据集
机构 * KAIST(韩国科学技术院)
AI总结 提出HABIT数据集,包含10K+集、160+小时的人类在场机器人演示,覆盖协作、共事和监督三类交互任务,训练出人类感知行为(时空同步、避让、手势理解)并支持快速适应新交互任务。
Comments 30 pages, 26 figures
HSDF-Lane: 高度对齐符号距离场与语义车道先验用于3D车道检测
机构 * KAIST(韩国科学技术院)
AI总结 提出HSDF-Lane,通过高度对齐符号距离场隐式建模道路表面,结合可微渲染生成准确高度图和表面对齐特征,并引入车道感知语义位置编码注入车道先验,在OpenLane基准上实现3D车道检测和高度图估计的最优性能。
Comments ECCV 2026, Project page: https://jiyongboo.github.io/HSDF-Lane-project-page
无Slater条件的约束在线凸优化
机构 * KAIST(韩国科学技术院) ; Seoul National University(首尔国立大学)
AI总结 提出一种自适应正则化的原始-对偶框架,无需Slater条件即可实现随机约束下$O(\sqrt{T})$遗憾和$O(\sqrt{T}\log T)$约束违反,并扩展到对抗约束。
一次蒸馏,终身适应:探索数据集蒸馏用于持续测试时适应
机构 * KAIST, Visual Intelligence Lab(韩国科学技术院,视觉智能实验室) ; Chung-Ang University, FOV Lab(中央大学,FOV实验室)
AI总结 提出DO-ALL框架,通过数据集蒸馏生成紧凑的合成锚点,在持续测试时适应中提供稳定参考,无需保留原始源数据,提升长期鲁棒性。
Comments ECCV 2026
GeoNVS: 基于几何的视频扩散模型用于新视角合成
机构 * KAIST, South Korea(韩国科学技术院) ; Luma AI, USA(Luma AI(美国))
AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。
Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)
FMA-Net++:运动与曝光感知的联合视频超分辨率与去模糊
机构 * KAIST(韩国科学技术院) ; CMLab, Chung-Ang University(中央大学CMLab)
AI总结 提出非循环序列级框架FMA-Net++,通过层次细化双向聚合块实现并行处理与长时域建模,引入曝光时间感知调制层处理曝光依赖模糊,在合成数据上训练达到SOTA性能。
Comments Accepted to ECCV 2026. Project Page: https://kaist-viclab.github.io/fmanetpp_site/
当少量标注目标数据足够:基于多自适应起点微调的半监督域适应理论
机构 * Department of Mathematical Sciences, KAIST(韩国科学技术院数学科学系) ; Department of Mathematics, ETH Zürich(苏黎世联邦理工学院数学系)
AI总结 本文在结构因果模型下研究半监督域适应,提出三种干预模型对应的最优方法及多自适应起点微调算法,证明目标标签复杂度仅依赖于干预维度而非环境维度。
MeloDISinger: 旋律感知与时长保持的歌唱声音编辑与音频填充
机构 * Graduate School of Artificial Intelligence, KAIST, South Korea(韩国釜山科学技术院人工智能研究生院) ; Graduate School of Culture Technology, KAIST, South Korea(韩国釜山科学技术院文化科技研究生院)
AI总结 提出基于流匹配的MeloDISinger模型,通过MeloDRP模块预测固定预算时长比率实现旋律感知的时长分配,结合流匹配梅尔解码器进行音频填充,在歌唱声音编辑任务上达到最优性能。
Comments Accepted to Interspeech 2026
自监督几何推理用于LiDAR同时定位与地图构建
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学研究院) ; Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)
AI总结 提出自监督框架,通过学习局部几何的显式符号表示(高斯分布协方差)并递归优化LiDAR SLAM,无需密集标签,提升低分辨率或稀疏点云下的定位与建图精度。
我们是在衡量策略还是措辞?LLM数学推理中表面多样性与方法层面多样性的差距
机构 * Seoul National University(首尔国立大学) ; KAIST(韩国科学技术院)
AI总结 提出方法层面多样性概念,发现现有多样性指标无法反映策略差异,且多样性感知强化学习会降低方法多样性,直接优化方法多样性仍具挑战。
Comments 27 pages, 6 figures
RainODE: 基于潜在神经ODE的连续时间降水预报
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 提出RainODE框架,将降水预报建模为连续时间动力系统,使用神经ODE在潜在空间建模,结合布朗桥随机源模块处理非平流变化,实现任意时间推理并保持预测清晰度。
概念移除引导:用于安全扩散采样的证据校准负引导
机构 * KAIST(韩国科学技术院) ; KIST(韩国科学技术院)
AI总结 提出概念移除引导(CRG),一种无需训练的方法,通过从模型噪声预测中估计不良概念存在并自适应校准负引导权重,在保持良性保真度的同时降低攻击成功率。
Comments Published at ICML 2026
什么驱动了内点记忆效应?基于早期训练动态的异常检测理论
机构 * KAIST AI(韩国科学技术院人工智能实验室) ; Department of Statistics Center for Data Science(统计系数据科学中心) ; Sungshin Women’s University(顺天妇女大学)
AI总结 本文从理论上分析了深度模型在早期训练中优先记忆内点而非异常点的内点记忆效应,揭示了其出现、强度与持久性依赖于数据分布和参数初始化,并据此提出数据预处理与初始化策略,在ADBench上取得最优性能。
DTM-Codec:基于高效边界选择的变帧率语音编码动态令牌掩码
机构 * Graduate School of Cultural Technology, KAIST, South Korea(韩国科学技术院文化技术研究生院)
AI总结 提出DTM-Codec,通过动态令牌掩码和路径长度均衡(PLE)边界选择器,在严格匹配总比特率下优于固定帧率基线,提升重建质量和可懂度。
Comments 10 pages, 2 figures, accepted to INTERSPEECH 2026
进化微调:在371个优化任务中学习发现
机构 * University of Minnesota(明尼苏达大学) ; Carnegie Mellon University(卡内基梅隆大学) ; KAIST(韩国科学技术院) ; University of Cambridge(剑桥大学) ; Hanyang University(翰阳大学) ; Amazon(亚马逊)
AI总结 提出进化微调(EFT)方法,通过将进化搜索轨迹转化为监督信号,教会大语言模型跨任务迭代优化解决方案,在22个保留任务上平均提升10.22%。
Comments Project page: https://open-galapagos.github.io/evolution_finetuning/
FreqOrtho-SR:面向真实世界图像超分辨率的频率引导正交专家学习
机构 * School of Computing, KAIST, Republic of Korea(韩国科学技术院计算机学院)
AI总结 针对真实图像超分辨率中像素保真度与语义质量平衡难、退化多样性适应差的问题,提出FreqOrtho-SR,通过频率引导的LoRA专家混合(FreqMoE)实现退化类型特化,并利用正交梯度投影(OGP)保证像素与语义目标互补学习,在多个基准上取得优异性能。
Comments Accepted at ECCV 2026
探查并利用视频扩散变换器特征以实现稳健的点跟踪
机构 * KAIST AI(韩国科学技术院人工智能) ; Google DeepMind(谷歌DeepMind)
AI总结 本文探讨了视频扩散变换器在点跟踪中的优势,提出DiTracker框架,通过整合视频DiT特征提升跟踪鲁棒性,实验证明其在挑战性场景下表现优异。
Comments Project Page: https://cvlab-kaist.github.io/DiTracker/
PLOT:通过物体跟踪进行伪标签的单目3D目标检测
机构 * Korea Institute of Science and Technology (KIST)(韩国科学技术研究院) ; KAIST AI(韩国科学技术院人工智能系) ; VRG, FEE, Czech Technical University in Prague(布拉格捷克理工大学电气工程学院视觉识别组) ; Samsung Research(三星研究院) ; AI-Robotics, KIST School, University of Science and Technology (UST)(科学技术联合大学院KIST学院人工智能机器人系) ; Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学延世-KIST融合研究院)
AI总结 PLOT通过物体跟踪生成单目视频中的3D标注,无需辅助传感器或模型重训练,实现了在自动驾驶、机器人和监控等领域的可靠3D目标检测。
Comments Accepted to ECCV 2026
利用视觉编码器漏洞对大视觉-语言模型生成通用对抗扰动
机构 * KAIST(韩国科学技术院)
AI总结 本文研究了大视觉-语言模型在输入图像中对小对抗扰动的脆弱性,提出了一种针对视觉编码器内部组件的通用对抗扰动攻击框架,通过分析注意力机制识别关键脆弱组件,实现高效攻击。
从信号到迁移:基于探针的大语言模型不确定性估计的分解研究
机构 * Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; VinUniversity ; KAIST(韩国科学技术院)
AI总结 通过分解研究,发现原始隐藏状态和注意力特征在域内表现优异,但结构化压缩特征在分布偏移下更鲁棒,提示和标签构建显著影响探针行为,并训练出可迁移的预训练探针。
面向城市电磁场地图预测的多模态条件高分辨率Transformer
机构 * Soongsil University(崇实大学) ; Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(韩国科学技术院赵春植移动研究生院) ; Department of Intelligent Semiconductors, Soongsil University(崇实大学智能半导体系)
AI总结 提出多条件密集预测框架,利用高分辨率Transformer骨干网络,结合特征线性调制和交叉注意力机制,从建筑布局和天线配置生成500×500电磁场地图,通过复合损失函数和测试时增强提升性能。
GeoFace: 基于几何约束的一致多视角人脸生成扩散模型
机构 * KAIST AI(韩国科学技术院人工智能研究所)
AI总结 提出GeoFace,一种几何约束的多视角扩散框架,通过外观与几何流的共享注意力层和几何引导注意力对齐损失,实现从单张输入生成一致的多视角人脸图像和3D几何,显著提升跨视角几何一致性。
CoIn:基于高斯泼溅引导的全面2D-3D修复
机构 * LG Electronics(LG电子) ; KAIST(韩国科学技术院)
AI总结 提出CoIn框架,通过多阶段一致性流水线桥接2D修复模型与3D高斯泼溅,支持任意形状掩码的物体移除与插入,实现双向信息流引导的3D场景修复。
从多视角图像中提取神经材质
机构 * NVIDIA(英伟达) ; POSTECH(浦项科技大学) ; KAIST(韩国科学技术院)
AI总结 提出NeuMatEx方法,利用大型材质重建模型(LMRM)初始化神经材质潜变量,结合逆路径追踪优化,从多视角图像中提取空间变化的神经材质,优于传统PBR方法。
Comments Project website: https://nvlabs.github.io/neumatex/
ESDD2概述:环境感知语音与声音深度伪造检测挑战赛
机构 * Duke Kunshan University(昆山杜克大学) ; Korea Advanced Institute of Science and Technology(韩国科学技术院) ; The University of Melbourne(墨尔本大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Fortemedia Singapore(Fortemedia新加坡) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 介绍ESDD2挑战赛,评估语音和环境声音独立或联合操纵的检测系统,最佳系统Macro-F1达0.8775,模块化分解、跨域自监督编码器、数据增强和选择性集成是关键。
Comments Accepted to 2026 ICME workshop. arXiv admin note: text overlap with arXiv:2601.07303