Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion
通过语义扩展实现音频-语言模型的通用提示微调
机构 * KAIST(韩国科学技术院)
AI总结 本文提出SEPT框架,通过引入语义扩展损失提升音频-语言模型提示微调的泛化能力,增强嵌入空间语义结构,改进基到新泛化和跨数据集迁移。
Comments ACL 2026 findings
高校专区
通过语义扩展实现音频-语言模型的通用提示微调
机构 * KAIST(韩国科学技术院)
AI总结 本文提出SEPT框架,通过引入语义扩展损失提升音频-语言模型提示微调的泛化能力,增强嵌入空间语义结构,改进基到新泛化和跨数据集迁移。
Comments ACL 2026 findings
混合向量检索用于视觉丰富文档:结合单向量效率和多向量准确性
机构 * KAIST(韩国科学技术院) ; Hanyang University(翰阳大学)
AI总结 本文提出HEAVEN框架,通过单向量高效检索与多向量精确排序相结合,提升视觉丰富文档检索效率与准确性,同时引入ViMDoc基准测试。
Comments ACL 2026 Findings
风格胜过故事:通过结构化选择测量大语言模型的叙事偏好
机构 * School of Digital Humanities and Computational Social Sciences, KAIST(数字人文与计算社会科学学院,韩国科学技术院)
AI总结 通过结构化选择实验测量大语言模型的叙事偏好,发现模型在风格优先于叙事内容方面表现一致,且风格偏好稳定,而内容元素则存在模型间差异和指令敏感性。
Comments Accepted to ACL 2026 (Findings), camera-ready version
层归一化在Transformer解码器中诱导近期偏差
机构 * KAIST(韩国科学技术院) ; Microsoft Research(微软研究院)
AI总结 研究揭示Transformer解码器中层归一化与自注意力机制相互作用导致近期偏差的机制,分析残差连接和输入嵌入分布的影响,提出改进位置编码的新思路。
Comments Codes available at: https://github.com/starmpcc/layernorm_recency_bias
Journal ref ACL 2026 Findings
Evalet:通过功能碎片化评估大型语言模型
机构 * School of Computing, KAIST(韩国庆北大学计算机学院) ; Computer Science and Engineering, University of Michigan(美国密歇根大学计算机科学与工程学院)
AI总结 本文提出通过功能碎片化方法,分析生成AI输出中的关键片段,揭示其在评估标准下的作用,帮助用户发现更多模型输出中的问题。
Comments The first two authors hold equal contribution. Presented at CHI 2026
忘却重要信息,保留其余:信息性标记的选择性反学习
机构 * Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) ; Hanbat National University, South Korea(汉阳大学)
AI总结 本文提出ETW方法,通过熵引导标记加权实现信息性标记的选择性反学习,提升模型效用。
Comments Accepted to ACL 2026 Main Conference. 17 pages, 9 figures
误差作为信号:通过嵌入式龙格-库塔引导的刚性感知扩散采样
机构 * Korea University(韩国大学) ; KAIST(韩国科学技术院) ; Seoul National University(首尔国立大学) ; Korea Institute for Advanced Study(韩国高级研究院)
AI总结 本文提出嵌入式龙格-库塔引导方法,通过识别刚性区域减少局部截断误差,提升扩散模型采样稳定性与质量。
Comments ICLR 2026
EGMOF:一种高效生成金属有机框架的混合扩散-Transformer架构
机构 * Department of Chemical and Biomolecular Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院化学与生物分子工程系) ; Department of Chemistry, University of Toronto(多伦多大学化学系) ; Vector Institute for Artificial Intelligence(人工智能矢量研究所) ; Department of Chemistry, Sungkyunkwan University(成均馆大学化学系) ; Acceleration Consortium(加速联盟) ; Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Department of Materials Science & Engineering, University of Toronto(多伦多大学材料科学与工程系) ; Department of Chemical Engineering & Applied Chemistry, University of Toronto(多伦多大学化学工程与应用化学系) ; Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute (CIFAR)) ; NVIDIA
AI总结 EGMOF通过模块化流程实现高效MOF逆向设计,利用扩散模型与Transformer模型生成结构,仅需1000个训练样本即取得显著提升,适用于多种属性数据集。
他们是恋人还是朋友?评估LLMs在英语和韩语对话中的社交推理能力
机构 * KAIST(韩国科学技术院) ; LT3 ; IDLab(ID实验室) ; Universiteit Gent(根特大学) ; Boston University(波士顿大学)
AI总结 本文通过SCRIPTS数据集评估LLMs在英语和韩语对话中推断人物关系的能力,发现当前模型在英语和韩语中的准确率分别为75-80%和58-69%,且存在显著的社交推理局限性。
Comments Accepted to ACL 2026
推测验证:利用信息增益来细化推测解码
机构 * Hanyang University(翰阳大学) ; Seoul National University(首尔国立大学) ; KAIST(韩国科学技术院) ; Machine Learning Systems Lab(机器学习系统实验室)
AI总结 本文提出推测验证(SV),通过动态预测推测准确性并调整验证长度来提升推测解码效率,实验证明SV在多个NLP任务中显著优于SD和标准解码。
Comments 16 pages, 8 figures, accepted to ACL 2026 Findings
视觉语言模型存在偏见
机构 * KAIST(韩国科学技术院) ; College of William and Mary(威廉与玛丽学院) ; University of Alberta(阿尔伯塔大学) ; Auburn University(阿伯茨维尔大学)
AI总结 研究探讨了视觉语言模型在计数和识别任务中的偏见问题,发现其在不同领域表现不佳,去除背景可显著提升准确率,揭示上下文视觉线索导致偏见。
Comments Code and qualitative examples are available at: vlmsarebiased.github.io
基于机器学习的金属有机框架中质子导电性预测
机构 * Department of Chemical and Biomolecular Engineering, Korea Advanced Institute of Science and Technology(化学与生物分子工程系,韩国科学技术院) ; Department of Chemistry and Medical Chemistry, Yonsei University(化学与医学化学系,延世大学)
AI总结 本文利用机器学习方法构建了质子导电性MOF数据库,通过描述符和Transformer模型预测质子导电性,发现Transformer迁移学习模型具有最佳性能,MAE为0.91,为设计质子导电性MOF提供理论支持。
mEOL:无需训练的指令引导多模态嵌入器用于矢量图形和图像检索
机构 * KAIST(韩国科学技术院) ; POSTECH
AI总结 本文提出无需训练的指令引导多模态嵌入框架,通过多模态大语言模型将文本、位图和SVG代码映射到对齐的嵌入空间,利用模态特定指令和结构化SVG提示实现嵌入方向控制,构建首个文本到SVG检索基准,展示出优于传统基线的性能。
Comments Round 1 early acceptance to WACV 2026, Project page: https://scene-the-ella.github.io/meol
超越静态基准:基于人设的模拟合成有害内容以实现稳健评估
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
AI总结 本文提出基于人设的模拟合成有害内容框架,通过整合人口统计信息与主题兴趣,生成多样化且情境相关的有害交互,验证了其在有害性、挑战性和多样性方面的有效性,为评估检测系统提供更鲁棒的测试工具。
Comments ACL 2026
基于可微渲染的视觉-RRT:通过可微渲染寻找视觉目标路径
机构 * KAIST(韩国科学技术院) ; Samsung Electronics(三星电子)
AI总结 本文提出视觉-RRT,结合可微机器人渲染与RRT采样探索,实现视觉目标路径规划,实验表明其在模拟和现实环境中均有效。
AHS: 通过合成数据增强实现自适应头部合成
机构 * KAIST(韩国国立科学技术院) ; Korea University(韩国大学) ; FLIPTION
AI总结 本文提出AHS方法,通过合成数据增强解决头部合成中视角和表情多样性的限制,提升真实场景下的泛化能力。
Comments CVPR 2026, Project Page : https://keh0t0.github.io/AHS/
对视觉-语言模型所见所感知进行对齐与适应性信息流
机构 * KAIST(韩国科学技术院) ; POSTECH
AI总结 本文提出通过调节信息流提升视觉-语言模型的感知能力,通过动态令牌方法确定视觉令牌的重要性,从而提高视觉问答、视觉定位等任务的性能。
Comments CVPR 2026. Project page: https://cxliu0.github.io/AIF/
GaussianFlow SLAM:基于GaussianFlow的单目Gaussian Splatting SLAM
机构 * School of Electrical Engineering, KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院电子工程学院)
AI总结 本文提出GaussianFlow SLAM,通过光学流引导场景结构和相机姿态优化,提升单目SLAM的映射质量和跟踪精度。
Comments 8 pages, 5 figures, 7 tables, accepted to IEEE RA-L
CXR-LT 2026挑战:多中心长尾和零样本胸片分类
机构 * Department of Population Health Sciences, Weill Cornell Medicine(韦尔·科恩医学中心流行病学与公共卫生科学系) ; Department of Radiology, Fuwai Hospital, National Center for Cardiovascular Diseases, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院阜外医院心血管病国家中心放射科) ; Department of Radiology, West China School of Medicine, Sichuan University(四川大学西昌医学院放射科) ; Sichuan University Affiliated Chengdu Second People’s Hospital(四川大学附属成都第二人民医院) ; Department of Radiology, Weill Cornell Medicine(韦尔·科恩医学中心放射科) ; School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电子工程学院) ; Gwangju Institute of Science and Technology(光州科学技术院) ; Department of Biomedical Engineering, Case Western Reserve University(凯斯西储大学生物医学工程系) ; School of Electrical and Computer Engineering, Cornell Tech(康奈尔科技学院电气与计算机工程系) ; Department of Mathematics and Computer Science, Universitat de les Illes Balears(巴利阿里大学数学与计算机科学系) ; School of Computer Science and Engineering, VNU-HCM International University(VNU-HCM国际大学计算机科学与工程系) ; Vietnam National University, Ho Chi Minh City(越南国家大学河内市分校) ; School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系) ; VNU-HCM University of Science, Ho Chi Minh City(VNU-HCM科技大学河内市分校)
AI总结 本文提出CXR-LT 2026挑战,通过多中心数据集和零样本任务,研究长尾分布和开放世界下的胸片分类问题,评估视觉语言模型在罕见疾病检测中的表现。
Comments 25 pages, 6 figures
视频推理:评估大语言模型如何提取、整合和重构时空证据
机构 * UNIST(全南大学) ; KAIST(韩国科学技术院)
AI总结 本文评估大语言模型在视频中的时空推理能力,提出VAEX-BENCH基准,通过合成数据测试抽象推理任务,揭示模型在抽象任务中的局限性。
Comments Project page: https://disl-lab.github.io/VAEX-Bench/
RoleConflictBench: 一个用于评估LLM上下文敏感性的角色冲突场景基准
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 本文提出RoleConflictBench基准,通过生成13000个角色冲突场景,评估LLM在角色冲突中的上下文敏感性,发现模型更倾向于遵循角色偏好而非动态上下文线索。
Comments Accepted to Findings of ACL 2026
Atropos:通过早期终止和模型热切换提升基于LLM的代理在自一致性下的成本效益权衡
机构 * KAIST(韩国明知大学)
AI总结 本文提出Atropos技术,通过预测早期终止和模型热切换提升基于LLM的代理在自一致性下的成本效益权衡,实验表明其能将性能提升至闭合LLM的74.35%,成本降低至23.9%。
Comments Will appear at ISSTA 2026
CURaTE:在实时中实现连续反学习以确保大语言模型知识的保留
机构 * KT Corporation(KT公司) ; KAIST(韩国科学技术院)
AI总结 本文提出CURaTE方法,通过训练句子嵌入模型实现实时连续反学习,有效提升遗忘效果并保持知识完整性。
Comments Accepted to Findings of ACL 2026
用于PDEs的选时段获取的主动学习
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 本文提出STAP方法,通过选择性获取关键时间步减少计算成本,提升PDE代理模型的主动学习效率。
Comments This manuscript is an improvement over the camera-ready version in ICML 2025. We have added a clearer motivation for our acquisition function. (See Sections 2.3 and 3.2)
Journal ref ICML 2025
记忆迁移学习:编码代理跨领域记忆是如何转移的
机构 * KAIST(韩国国立科学技术院) ; New York University(纽约大学)
AI总结 本文研究了记忆迁移学习,通过统一的记忆池跨异构领域提升编码代理性能,发现高层抽象优于低层痕迹,记忆池规模影响迁移效果。
Comments Preprint
为何及何时视觉标记修剪失效?对多模态大语言模型解码中相关视觉信息转移的研究
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; NVIDIA
AI总结 本文研究了视觉标记修剪在复杂视觉推理任务中的失效原因,提出解码阶段感知标记修剪方法,有效缓解了修剪方法在复杂推理任务中的性能下降。
Comments Preprint, Project : https://ptkjw1997.github.io/DSTP-page/
HAMLET: 将视觉-语言-动作模型转换为历史感知策略
机构 * KAIST(韩国科学技术院) ; UC Berkeley(伯克利大学)
AI总结 本文提出HAMLET框架,通过引入时刻标记和轻量记忆模块,使视觉-语言-动作模型能关注历史上下文,提升长周期任务表现,实验显示在多个基准测试中均取得显著提升。
Comments ICLR 2026. Project page: https://myungkyukoo.github.io/hamlet/
H-AdminSim:一种用于真实医院行政工作流的多智能体模拟器,集成FHIR
机构 * KAIST(韩国科学技术院) ; Samsung Medical Center(三星医疗中心)
AI总结 H-AdminSim通过结合真实数据生成与多智能体模拟,系统评估LLM在医院行政工作流中的表现,利用FHIR实现跨异构环境的标准化测试平台。
Comments Accepted at CHIL 2026
DeepASA: 一种面向多用途的面向对象网络用于听觉场景分析
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
AI总结 DeepASA提出了一种多用途模型,通过统一框架实现多输入多输出声源分离、消回声、声音事件检测、音频分类和到达方向估计。采用面向对象处理策略,通过链式推理机制提升任务鲁棒性。
Comments 21 pages, 13 figures, 11 tables, published in NeurIPS 2025
ARGOS:智能多摄像机人像搜索中的谁、哪里和何时
机构 * KAIST(韩国科学技术院) ; University of Seoul(首尔大学) ; KIST(韩国科学技术院)
AI总结 ARGOS首次将多摄像机人像搜索转化为交互推理问题,通过智能体在信息不对称下规划、提问和消除候选,包含14个真实场景的2691个任务,实验表明该基准远未解决。
Comments Accepted to CVPR 2026 Workshop on Multimodal Spatial Intelligence (MUSI)