Trust Region Q Adjoint Matching
信任区域Q伴随匹配
机构 * KAIST AI(韩国科学技术院人工智能) ; Seoul National University(首尔国立大学) ; RLWRLD
AI总结 针对预训练流策略的离策略强化学习不稳定性,提出信任区域Q伴随匹配方法,通过投影对偶下降自适应控制路径空间KL散度,实现稳定微调,在50个OGBench任务中离线RL成功率达68%。
高校专区
信任区域Q伴随匹配
机构 * KAIST AI(韩国科学技术院人工智能) ; Seoul National University(首尔国立大学) ; RLWRLD
AI总结 针对预训练流策略的离策略强化学习不稳定性,提出信任区域Q伴随匹配方法,通过投影对偶下降自适应控制路径空间KL散度,实现稳定微调,在50个OGBench任务中离线RL成功率达68%。
为什么它们记不住?揭示多轮声学记忆中的表征和检索瓶颈
机构 * The University of Melbourne(墨尔本大学) ; KAIST(韩国科学技术院) ; The University of Auckland(奥克兰大学) ; UNSW Sydney(新南威尔士大学悉尼分校)
AI总结 本文通过引入EnvMem基准,发现大型音频语言模型在多轮交互中非语音信息记忆失败的主要原因是表征轨迹漂移,而非注意力分配不足。
JuICE:评估LLM裁判识别文化错误的基准
机构 * KAIST(韩国科学技术院) ; Google(谷歌) ; Universitas Gadjah Mada(加查马达大学)
AI总结 提出JuICE基准,包含7470个文化语言错误标注的多语言数据集,用于评估LLM裁判在长文本中识别深层文化错误的能力,发现最强模型F1仅0.52且常遗漏本地人易识别的错误。
无适应异构协同感知:应对未见过的智能体配置
机构 * School of Electrical Engineering(电气工程学院) ; Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
AI总结 提出ALF框架,通过将轻量级框级消息提升为自车兼容的辅助特征,实现与未见配置智能体的零适应协同感知,在V2X-Real上零样本评估中相对mAP@0.7提升35.91%,带宽仅需约9.6 Kbps。
Comments 9 pages main paper, 23 pages including references and appendix, 7 figures
迈向无差错的电子健康记录:临床笔记与结构化表格之间的推理密集型一致性验证
机构 * KAIST(韩国科学技术院) ; Ghent University(根特大学) ; Samsung Medical Center(三星医疗中心) ; Samsung Changwon Hospital(三星昌原医院) ; Asan Medical Center(亚山医疗中心)
AI总结 针对电子健康记录中临床笔记与结构化表格数据不一致的问题,提出推理密集型基准EHR-ReasonCon和基于大语言模型的框架EHR-Inspector,通过锚点实体提取、时间引用和表格探索工具实现高效一致性验证。
大型语言模型的对齐调优:以数据为中心的对齐数据管道视角
机构 * KAIST(韩国科学技术院)
AI总结 本文以数据为中心,将对齐调优重构为管道设计问题,分解为响应合成、偏好评估和偏好实例化三个阶段,并基于此框架统一分类现有对齐方法,总结设计权衡与失败模式,提炼高层原则,最后指出开放挑战。
Comments Accepted at the Findings of ACL 2026
个性化具身多模态大语言模型代理在长期用户交互中的应用
机构 * Yonsei University(延世大学) ; KAIST(韩国科学技术院)
AI总结 提出POLAR框架,通过多模态知识图谱记忆机制增强具身代理在长期交互中的个性化能力,显著提升多步推理和用户上下文跟踪性能。
几何感知表示去噪用于鲁棒的多视角3D重建
机构 * KAIST AI(韩国国立科学技术院人工智能研究所) ; Samsung Electronics(三星电子)
AI总结 提出几何感知表示去噪(GARD)框架,在前馈3D重建模型的特征空间中执行扩散式多视角恢复,同时恢复场景几何与高质量RGB图像,在DA3基准上验证有效性。
原子级蛋白质表示学习改进蛋白质结构预测
机构 * KAIST(韩国科学技术院)
AI总结 提出结构感知预训练方法TriProRep,通过VQ-VAE联合建模三种对齐的残基级视图,在结构预测任务中优于仅序列和先前结构感知表示模型。
Comments Project Page: https://holymollyhao.github.io/TriProRep/
Hide to See: 面向VLM蒸馏中视觉锚定思维的推理前缀掩码
机构 * KAIST(韩国科学技术院) ; NVIDIA(英伟达) ; POSTECH(POSTECH大学)
AI总结 提出一种推理前缀掩码蒸馏框架,通过掩码学生模型的显著推理前缀,迫使其在推理过程中更依赖视觉证据,从而缓解长推理轨迹中的视觉遗忘问题,提升多模态推理性能。
Comments Pre-print
不确定性下通过策略信息分配理解LLM中的推理
机构 * Microsoft Research(微软研究院) ; KAIST(韩国科学技术院) ; Seoul National University(首尔国立大学)
AI总结 本文提出一个信息论框架,将推理分解为程序推进和认知外化(不确定性标记级外化),证明零散外化能在无显式错误触发时恢复收敛,并通过实验表明小规模SFT即可调控该能力,从而将推理重新定义为不确定性下的策略信息分配。
EconCausal: 面向大语言模型的上下文感知经济推理基准
机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) ; College of Business, KAIST(韩国科学技术院商学院) ; Data Science for Humanity Group, MPI-SP(马克斯·普朗克所际数据科学为人类集团) ; School of Computing, KAIST(韩国科学技术院计算学院) ; Division of Social Science, HKUST(香港科技大学社会科学系)
AI总结 提出EconCausal基准,包含从顶级经济金融期刊提取的10,490个上下文标注因果三元组,评估大语言模型在指定上下文中推断因果方向及随上下文变化调整判断的能力。