ERPPO: Entropy Regularization-based Proximal Policy Optimization
ERPPO:基于熵正则化的近端策略优化
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 本文提出ERPPO算法,通过引入熵正则化项解决多维环境中多智能体强化学习的非平稳观测问题,提升目标定位的准确性和稳定性。
Comments 9 pages, 5 figures
高校专区
ERPPO:基于熵正则化的近端策略优化
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 本文提出ERPPO算法,通过引入熵正则化项解决多维环境中多智能体强化学习的非平稳观测问题,提升目标定位的准确性和稳定性。
Comments 9 pages, 5 figures
GuardMarkGS: 3D高斯溅射的统一所有权追溯与编辑威慑
机构 * Korea University(韩国大学) ; KAIST(韩国科学技术院) ; Hanshin University(汉西大学)
AI总结 本文提出GuardMarkGS框架,通过结合全局水印目标与对抗目标,实现3D高斯溅射资产的统一所有权追溯与未经授权编辑的威慑,实验表明其在比特精度、编辑威慑和渲染质量间取得良好平衡。
Comments Preprint
TB-AVA:文本作为语义桥梁用于音频-视觉参数高效微调
机构 * AI2 Lab, KAIST(AI2实验室,韩国科学技术院)
AI总结 本文提出利用文本作为语义桥梁,通过冻结音频和视觉编码器构建参数高效微调框架,实现音频与视觉流的文本介导交互,实验表明其在多个基准上取得最佳性能。
Comments 12 pages, 6 figures
生成模型中奖励对齐的无梯度噪声优化
机构 * KAIST AI(韩国科学技术院人工智能实验室) ; Snap Inc.(Snap公司)
AI总结 本文提出ZeNO框架,通过路径积分控制问题实现无梯度噪声优化,适用于不可微生成器,展示了在蛋白质结构生成等任务中的有效性。
THINKSAFE: 为推理模型生成的自我安全对齐
机构 * KAIST(韩国科学技术院) ; KRAFTON(KRAFTON公司) ; UC Berkeley(加州大学伯克利分校)
AI总结 THINKSAFE通过自我生成对齐框架提升推理模型的安全性,无需外部教师,实验表明其在安全性和推理能力上优于GRPO,计算成本显著降低。
Comments 17 pages, 13 figures
突破离散扩散:确定性绕过采样壁垒
机构 * KAIST(韩国科学技术院) ; EPFL(苏黎世联邦理工学院) ; Microsoft(微软) ; SAP ; NYU(纽约大学)
AI总结 本文提出Loopholing机制,通过确定性潜在路径解决离散扩散模型采样瓶颈问题,显著降低生成困惑度,提升文本连贯性,并在推理任务中表现优异。
Comments Accepted at ICLR 2026
TrackCraft3R:将视频扩散变换器重新用于密集3D跟踪
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出TrackCraft3R,通过重新利用预训练的视频扩散变换器,实现了基于单目视频的密集3D跟踪,采用双潜表示和时间RoPE对齐设计,提升了跟踪性能和效率。
Comments Project page and code are available at https://cvlab-kaist.github.io/TrackCraft3r/
紧凑的理性是否免费?测量冻结WSI-MIL中的瓷砖选择余地
机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) ; Kim Jaechul Graduate School of AI, KAIST(金 Jaechul人工智能研究生院,韩国科学技术院) ; Department of Integrative Medicine, College of Medicine, Yonsei University(延世大学医学院整合医学系) ; Department of Biomedical Systems Informatics, College of Medicine, Yonsei University(延世大学医学院生物医学系统信息学系) ; H-Data Strategy Center, Hallym University Chuncheon Sacred Heart Hospital(翰林大学春川圣心医院H-Data战略中心)
AI总结 本文研究了冻结WSI-MIL中的后验理性高亮,通过FOCI层验证了在不重新训练的情况下,能否从紧凑的瓷砖子集恢复滑片级预测,展示了选择余地指数SHI及不同模型的表现。
弥合缺失模态的差距:改进纯文本校准的视觉语言模型
机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)
AI总结 本文提出Latent Imagination Module,通过预测文本输入的潜在嵌入来提升纯文本环境下视觉语言模型的准确性和校准性能。
Comments 9 pages, 16 figures. Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety across Modalities
MEME:多实体与演进记忆评估
机构 * KAIST AI(韩国科学技术院人工智能实验室) ; Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) ; NAVER AI Lab(NAVER人工智能实验室)
AI总结 研究探讨多实体与演进内存系统在持续环境中的表现,发现默认配置下所有系统在依赖推理上表现不佳,仅文件型代理配合Claude Opus 4.7能部分改善,但成本高且不实用。
重新思考神经车辆路径问题中的位置编码
机构 * KAIST(韩国科学技术院) ; Radical Numerics ; Bielefeld University(比勒菲尔德大学) ; University of Vienna(维也纳大学) ; MIT(麻省理工学院) ; University of British Columbia(不列颠哥伦比亚大学)
AI总结 本文针对车辆路径问题中位置编码的不足,提出一种层次化各向异性位置编码,结合几何基础原理,通过分析多种PE方法,证明几何引导的PE在不同问题变体和模型架构中均表现更优。
EvoNav:基于大语言模型的机器人导航奖励函数进化设计
机构 * KAIST(韩国科学技术院) ; Radical Numerics ; UC Riverside(加州大学河滨分校) ; Omelet AI4CO
AI总结 本文提出EvoNav框架,利用大语言模型自动设计机器人导航奖励函数,通过逐步升温-提升流程降低训练成本,实验表明其优于人工设计和现有方法。
DySurface: 通过连接显式高斯和隐式函数实现一致的4D表面重建
机构 * KAIST(韩国科学技术院) ; Sungkyunkwan University(全北国立大学)
AI总结 本文提出DySurface框架,通过连接显式高斯和隐式SDF,解决动态场景中几何表面重建的连续性问题,提升表面重建质量与边界完整性。
DarkQA:在低光室内场景中对视觉-原始问题进行问答的视觉语言模型基准测试
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)
AI总结 DarkQA针对低光环境下视觉语言模型的感知基本能力进行基准测试,通过多级低光条件评估,揭示模型在复杂任务中的局限性。
Comments This work has been submitted to the IEEE for possible publication
FlowLPS: 基于流的逆问题求解器中的 Langevin-近端采样
机构 * KAIST(韩国科学技术院)
AI总结 本文提出 FlowLPS,一种基于 Langevin-近端采样的训练自由潜流逆问题求解器,通过少量 Langevin 更新和局部 MAP 风格近端细化,在保持测量一致性的同时提升感知质量。
保留音频无法表达的内容:面向多模态大语言模型的上下文保留令牌修剪
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 本文提出ContextGuard框架,通过保留音频-视觉上下文并去除跨模态冗余,实现多模态大语言模型的高效令牌修剪,实验表明其在多个基准测试中表现优异,能有效减少输入令牌数量。
学习弱通信平均奖励CMDP:强对偶性与改进的后悔
机构 * Department of Industrial & Systems Engineering, KAIST(韩国科学技术院工业与系统工程系) ; Department of Mathematical Sciences, Seoul National University(首尔国立大学数学科学系)
AI总结 本文研究弱通信假设下的无限时间平均奖励约束马尔可夫决策过程,通过建立强对偶性和改进的后悔界,提出了一种基于对偶的剪裁值迭代算法。
具有物体交互的动态全身体态代理通过融合预训练模块控制器
机构 * KAIST(韩国科学技术院)
AI总结 本文提出一种框架,通过结合预训练的运动先验和模仿代理,在规划和执行阶段生成动态且长期的人-物交互动作,如持桌奔跑,提升了动态人-物交互任务的成功率。
Comments CVPR Findings 2026
LPDP:用于可变长度DNA生成的推理时间奖励控制
机构 * KAIST AI(韩国釜山科学技术院人工智能实验室)
AI总结 本文提出LPDP,一种无需训练的局部重解算子,用于可变长度DNA编辑动作生成。通过局部离散程序聚焦于连贯的替换、插入和删除子图,并利用硬Max或软LSE备份聚合局部延续,用于增强子优化和外显子内含子外显子修复。
Comments 22 pages, 5 figures
利用诊断指南评估大语言模型的预咨询能力
机构 * AITRICS ; KAIST(韩国科学技术院) ; Severance Hospital, Yonsei University(延世大学松云医院) ; College of Medicine, The Catholic University of Korea(韩国天主大学医学院)
AI总结 本文提出EPAG基准数据集和框架,通过HPI-诊断指南对比和疾病诊断评估大语言模型的预咨询能力,发现小规模开源模型在预咨询任务中表现优于前沿模型,且预咨询语言影响对话特征。
Comments EACL 2026 Industry
B4DL:用于空间时间理解的4D激光雷达LLM基准
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 本文提出B4DL基准,用于训练和评估多模态大语言模型对4D激光雷达数据的理解,结合可扩展的数据生成管道和新模型,实现动态户外环境的空间时间推理。
Comments Accepted at ACM MM 2025
离线约束强化学习在部分数据覆盖下的应用
机构 * KAIST(韩国科学技术院) ; University of Michigan(密歇根大学)
AI总结 本文提出PDOCRL算法,通过分解线性规划公式实现约束强化学习,避免了需要数据生成分布的策略提取,提供近最优且可行的策略,具有$\widetilde{\mathcal O}(ε^{-2})$样本保证。
反叛学生:通过自蒸馏RLVR反转教师信号进行推理探索
机构 * Microsoft Research(微软研究院) ; KAIST(韩国科学技术院)
AI总结 本文提出RLRT,通过反转自蒸馏信号增强正确路径上的推理,提升RLVR性能,建立信息不对称作为新设计轴。
无限掩码扩散用于少步蒸馏
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
AI总结 本文提出无限掩码扩散模型,通过引入随机无限状态掩码降低因子化误差下限,解决了传统掩码扩散模型在少步生成中的性能问题,并在LM1B和OpenWebText上超越现有少步蒸馏方法。
多模态数据中长尾识别与多模态融合的联合处理
机构 * Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology (KAIST)(工业与系统工程系,韩国科学技术院(KAIST))
AI总结 本文提出一种处理长尾分布多模态数据的新框架,通过融合异质数据并利用模态特定网络增强信息,提升在长尾类不平衡场景下的性能。
学习点云几何作为统计流形:理论与实践
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)
AI总结 本文提出Point-to-Ellipsoid方法,通过统计流形建模实现点云几何的自监督学习,提升机器人感知任务的几何推理能力与鲁棒性。
Agent-X:边缘设备上AI代理的全流水线加速
机构 * KAIST(韩国科学技术院)
AI总结 本文提出Agent-X框架,通过优化预填充和解码阶段,实现边缘设备上AI代理的加速,无精度损失且集成简便,首次系统性消除代理延迟瓶颈。
Comments Accepted for publication at MobiSys-2026
通过规划实现高效的LLM协作
机构 * KAIST(韩国科学技术院) ; Yonsei University(延世大学)
AI总结 本文提出COPE框架,通过规划模型与执行模型的协作,提升小模型和大模型在复杂任务中的性能,同时显著降低推理成本。
基于多片段Q值估计的自适应动作分块
机构 * KAIST(韩国科学技术院)
AI总结 本文提出自适应动作分块方法,通过动态调节分块长度提升强化学习性能,实验表明其在复杂环境中具有更好的泛化能力和学习效率。
几何4D缝合用于基础4D生成
机构 * KAIST AI(韩国科学技术院人工智能实验室)
AI总结 本文提出Geometric 4D Stitching框架,通过显式识别缺失几何区域并补充几何基础的4D缝合,提升4D生成的几何一致性与效率。