Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion
通过语义扩展实现音频-语言模型的通用提示微调
机构 * KAIST(韩国科学技术院)
AI总结 本文提出SEPT框架,通过引入语义扩展损失提升音频-语言模型提示微调的泛化能力,增强嵌入空间语义结构,改进基到新泛化和跨数据集迁移。
Comments ACL 2026 findings
高校专区
通过语义扩展实现音频-语言模型的通用提示微调
机构 * KAIST(韩国科学技术院)
AI总结 本文提出SEPT框架,通过引入语义扩展损失提升音频-语言模型提示微调的泛化能力,增强嵌入空间语义结构,改进基到新泛化和跨数据集迁移。
Comments ACL 2026 findings
混合向量检索用于视觉丰富文档:结合单向量效率和多向量准确性
机构 * KAIST(韩国科学技术院) ; Hanyang University(翰阳大学)
AI总结 本文提出HEAVEN框架,通过单向量高效检索与多向量精确排序相结合,提升视觉丰富文档检索效率与准确性,同时引入ViMDoc基准测试。
Comments ACL 2026 Findings
风格胜过故事:通过结构化选择测量大语言模型的叙事偏好
机构 * School of Digital Humanities and Computational Social Sciences, KAIST(数字人文与计算社会科学学院,韩国科学技术院)
AI总结 通过结构化选择实验测量大语言模型的叙事偏好,发现模型在风格优先于叙事内容方面表现一致,且风格偏好稳定,而内容元素则存在模型间差异和指令敏感性。
Comments Accepted to ACL 2026 (Findings), camera-ready version
层归一化在Transformer解码器中诱导近期偏差
机构 * KAIST(韩国科学技术院) ; Microsoft Research(微软研究院)
AI总结 研究揭示Transformer解码器中层归一化与自注意力机制相互作用导致近期偏差的机制,分析残差连接和输入嵌入分布的影响,提出改进位置编码的新思路。
Comments Codes available at: https://github.com/starmpcc/layernorm_recency_bias
Journal ref ACL 2026 Findings
Evalet:通过功能碎片化评估大型语言模型
机构 * School of Computing, KAIST(韩国庆北大学计算机学院) ; Computer Science and Engineering, University of Michigan(美国密歇根大学计算机科学与工程学院)
AI总结 本文提出通过功能碎片化方法,分析生成AI输出中的关键片段,揭示其在评估标准下的作用,帮助用户发现更多模型输出中的问题。
Comments The first two authors hold equal contribution. Presented at CHI 2026
忘却重要信息,保留其余:信息性标记的选择性反学习
机构 * Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) ; Hanbat National University, South Korea(汉阳大学)
AI总结 本文提出ETW方法,通过熵引导标记加权实现信息性标记的选择性反学习,提升模型效用。
Comments Accepted to ACL 2026 Main Conference. 17 pages, 9 figures
误差作为信号:通过嵌入式龙格-库塔引导的刚性感知扩散采样
机构 * Korea University(韩国大学) ; KAIST(韩国科学技术院) ; Seoul National University(首尔国立大学) ; Korea Institute for Advanced Study(韩国高级研究院)
AI总结 本文提出嵌入式龙格-库塔引导方法,通过识别刚性区域减少局部截断误差,提升扩散模型采样稳定性与质量。
Comments ICLR 2026
EGMOF:一种高效生成金属有机框架的混合扩散-Transformer架构
机构 * Department of Chemical and Biomolecular Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院化学与生物分子工程系) ; Department of Chemistry, University of Toronto(多伦多大学化学系) ; Vector Institute for Artificial Intelligence(人工智能矢量研究所) ; Department of Chemistry, Sungkyunkwan University(成均馆大学化学系) ; Acceleration Consortium(加速联盟) ; Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Department of Materials Science & Engineering, University of Toronto(多伦多大学材料科学与工程系) ; Department of Chemical Engineering & Applied Chemistry, University of Toronto(多伦多大学化学工程与应用化学系) ; Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute (CIFAR)) ; NVIDIA
AI总结 EGMOF通过模块化流程实现高效MOF逆向设计,利用扩散模型与Transformer模型生成结构,仅需1000个训练样本即取得显著提升,适用于多种属性数据集。
他们是恋人还是朋友?评估LLMs在英语和韩语对话中的社交推理能力
机构 * KAIST(韩国科学技术院) ; LT3 ; IDLab(ID实验室) ; Universiteit Gent(根特大学) ; Boston University(波士顿大学)
AI总结 本文通过SCRIPTS数据集评估LLMs在英语和韩语对话中推断人物关系的能力,发现当前模型在英语和韩语中的准确率分别为75-80%和58-69%,且存在显著的社交推理局限性。
Comments Accepted to ACL 2026
推测验证:利用信息增益来细化推测解码
机构 * Hanyang University(翰阳大学) ; Seoul National University(首尔国立大学) ; KAIST(韩国科学技术院) ; Machine Learning Systems Lab(机器学习系统实验室)
AI总结 本文提出推测验证(SV),通过动态预测推测准确性并调整验证长度来提升推测解码效率,实验证明SV在多个NLP任务中显著优于SD和标准解码。
Comments 16 pages, 8 figures, accepted to ACL 2026 Findings
视觉语言模型存在偏见
机构 * KAIST(韩国科学技术院) ; College of William and Mary(威廉与玛丽学院) ; University of Alberta(阿尔伯塔大学) ; Auburn University(阿伯茨维尔大学)
AI总结 研究探讨了视觉语言模型在计数和识别任务中的偏见问题,发现其在不同领域表现不佳,去除背景可显著提升准确率,揭示上下文视觉线索导致偏见。
Comments Code and qualitative examples are available at: vlmsarebiased.github.io
基于机器学习的金属有机框架中质子导电性预测
机构 * Department of Chemical and Biomolecular Engineering, Korea Advanced Institute of Science and Technology(化学与生物分子工程系,韩国科学技术院) ; Department of Chemistry and Medical Chemistry, Yonsei University(化学与医学化学系,延世大学)
AI总结 本文利用机器学习方法构建了质子导电性MOF数据库,通过描述符和Transformer模型预测质子导电性,发现Transformer迁移学习模型具有最佳性能,MAE为0.91,为设计质子导电性MOF提供理论支持。
mEOL:无需训练的指令引导多模态嵌入器用于矢量图形和图像检索
机构 * KAIST(韩国科学技术院) ; POSTECH
AI总结 本文提出无需训练的指令引导多模态嵌入框架,通过多模态大语言模型将文本、位图和SVG代码映射到对齐的嵌入空间,利用模态特定指令和结构化SVG提示实现嵌入方向控制,构建首个文本到SVG检索基准,展示出优于传统基线的性能。
Comments Round 1 early acceptance to WACV 2026, Project page: https://scene-the-ella.github.io/meol
超越静态基准:基于人设的模拟合成有害内容以实现稳健评估
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
AI总结 本文提出基于人设的模拟合成有害内容框架,通过整合人口统计信息与主题兴趣,生成多样化且情境相关的有害交互,验证了其在有害性、挑战性和多样性方面的有效性,为评估检测系统提供更鲁棒的测试工具。
Comments ACL 2026
基于可微渲染的视觉-RRT:通过可微渲染寻找视觉目标路径
机构 * KAIST(韩国科学技术院) ; Samsung Electronics(三星电子)
AI总结 本文提出视觉-RRT,结合可微机器人渲染与RRT采样探索,实现视觉目标路径规划,实验表明其在模拟和现实环境中均有效。