The Imperfective Paradox in Large Language Models
大型语言模型中的不完美悖论
机构 * LMU Munich(慕尼黑大学) ; The University of Tokyo(东京大学)
AI总结 研究揭示大型语言模型在事件复合语义理解上的局限性,发现其依赖表面概率启发式而非逻辑推理,提出ImperfectiveNLI数据集揭示目标导向事件的预测偏差。
Comments ACL 2026
期刊&会议
Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing
大型语言模型中的不完美悖论
机构 * LMU Munich(慕尼黑大学) ; The University of Tokyo(东京大学)
AI总结 研究揭示大型语言模型在事件复合语义理解上的局限性,发现其依赖表面概率启发式而非逻辑推理,提出ImperfectiveNLI数据集揭示目标导向事件的预测偏差。
Comments ACL 2026
通过系统2策略解析大语言模型中大规模计数的机制
机构 * Sharif University of Technology(谢里夫理工大学)
AI总结 本文提出一种系统2策略,通过分解大计数任务为小问题来提升LLM计数精度,揭示了计数机制并验证了其有效性。
Comments ACL 2026
超越多数投票:面向细粒度和更可靠的测试时间强化学习奖励信号
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)
AI总结 本文提出SCOPE框架,通过结合模型置信度和动态子组划分,解决测试时间强化学习中多数投票策略导致的确认偏误和稀疏奖励问题,提升大语言模型推理能力。
Comments Accepted to ACL 2025 Main Conference. 15 pages, 9 figures, 5 tables
从基础出发的可解释性:面向教育评估的自动评分者设计
机构 * Graduate School of Education, Stanford University(斯坦福大学教育研究生院) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
AI总结 本文提出FGTI可解释性原则,开发AnalyticScore框架,在文本构造响应评分中提升准确性并接近人类标注表现。
Comments In Findings of the Association for Computational Linguistics (ACL 2026)
通过象征框架实现语义感知的逻辑推理
机构 * Huazhong University of Science and Technology(华中科技大学) ; La Trobe University(拉筹伯大学)
AI总结 本文提出LogicAgent框架,结合自动推演与反思验证,解决逻辑复杂性与语义复杂性的交互问题,通过RepublicQA基准验证其在抽象命题和逻辑深度上的表现,实现SOTA性能。
Comments Accepted at ACL 2026 (Main Conference)
SMARTER: 一种数据高效框架,通过自增强大语言模型提升毒性检测与解释
机构 * University of Maryland(马里兰大学)
AI总结 SMARTER通过两阶段框架利用大语言模型自身输出生成解释,提升内容审核的可解释性,实验表明在三个基准任务中实现13%的宏F1提升,且数据使用量仅为全训练数据的分数。
Comments ACL 2026. NLP, Hate speech detection, explanation, LLM. Version 3
任务分层的知识扩展规律用于训练后量化的大语言模型
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)
AI总结 本文提出任务分层的知识扩展规律,通过统一模型大小、位宽和细粒度因素,验证了293种不同的训练后量化配置,揭示了不同知识能力对精度、规模和校准的敏感性。
Comments Accepted to Findings of ACL 2026
ReasonRank: 通过强推理能力增强文档排序
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 分校) ; Baidu Inc., Beijing, China(百度公司,北京,中国) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出ReasonRank,通过自动化生成推理密集型训练数据和两阶段训练方法,提升文档排序性能,实验表明其优于现有基线并具有更低延迟。
Comments 25 pages, accepted by ACL2026 main conference
RExBench:代码代理能否自主实现AI研究扩展?
机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) ; UniVie Doctoral School Computer Science, University of Vienna(维也纳大学UniVie计算机科学博士学院) ; Boston University(波士顿大学)
AI总结 本文提出RExBench基准,评估代码代理自主实现AI研究扩展的能力,发现现有代理在无人类指导时成功率不足44%。
Comments ACL 2026
基于多臂老虎机优化的上下文归因
机构 * Lucy Family Institute for Data & Society, University of Notre Dame(数据与社会学院卢西家庭研究所,圣约翰大学) ; Department of Computer Science & Engineering, University of Notre Dame(计算机科学与工程系,圣约翰大学) ; IBM Research(IBM研究院)
AI总结 本文提出一种将上下文归因问题建模为组合多臂老虎机问题的框架,利用线性汤普森采样高效识别关键上下文片段,减少模型查询次数,实验表明在多个问答基准上实现30%的查询减少同时保持归因质量。
Comments Accepted as a Findings paper at ACL 2026
模型内部侦探:在现代语言模型中寻找词汇身份和屈折特征
机构 * Carnegie Mellon University - Language Technologies Institute(卡内基梅隆大学-语言技术研究所)
AI总结 研究通过分析25个模型的词汇身份和屈折特征,发现屈折特征在模型中线性可解,而词汇身份在早期显著但随深度减弱,揭示了transformer在层间保持屈折特征但牺牲词汇身份以获得紧凑预测表示的机制。
Comments Accepted to ACL 2026 (Main Conference)
CRAFT:无训练 cascaded 检索用于表格问答
机构 * Arizona State University(亚利桑那州立大学) ; Rensselaer Polytechnic Institute(伦塞拉尔理工学院) ; Microsoft(微软)
AI总结 CRAFT 提出了一种无训练 cascaded 检索方法,通过稀疏检索模型筛选候选表格后,再用密集模型进行重排序,提升检索质量并在 NQ-Tables 和 OTT-QA 数据集上表现优异。
Comments Accepted to ACL 2026 Mains
OMIBench:用于大型视觉-语言模型在奥林匹克级多图像推理中的基准测试
机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Central South University(中南大学) ; Fudan University(复旦大学) ; The University of Hong Kong(香港大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center(教育部文本计算与认知智能工程研究中心) ; Guizhou University(贵州大学)
AI总结 OMIBench旨在评估多图像推理能力,包含生物、化学、数学和物理奥林匹克问题,提供精确和语义答案匹配的评估协议,实验显示现有模型性能存在显著差距。
Comments ACL 2026 Camera Ready
增强代理任务性能的补充生成训练
机构 * University of Pennsylvania(宾夕法尼亚大学) ; AWS Agentic AI Labs(AWS智能代理AI实验室)
AI总结 本文提出补充生成训练(SGT),通过小型LLM生成补充文本帮助大模型更高效完成任务,降低计算成本并提升部署灵活性。
Comments Accepted to the Findings of ACL 2026
显式特征推断用于多智能体协调
机构 * University of Southern California(南加州大学) ; AWS Agentic AI Labs(AWS 代理AI实验室)
AI总结 本文提出显式特征推断方法,通过推断伙伴特征提升多智能体协调效率,在经济游戏和复杂多智能体场景中均取得显著效果。
Comments Accepted at ACL 2026 Main Conference
WISCA:一种轻量级模型转换方法,通过权重缩放提高LLM训练
机构 * Meituan, Beijing, China(美团,北京,中国) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) ; Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学,香港特别行政区,中国) ; Xiamen University, Xiamen, China(厦门大学,厦门,中国)
AI总结 WISCA通过优化神经网络权重模式提升LLM训练效率和模型质量,实验显示在GQA架构和LoRA微调任务中显著提升收敛质量。
Comments Findings of the Association for Computational Linguistics: ACL 2026
推理中逻辑的断裂:通过控制LLM推理链中的逻辑连接词进行逻辑感知路径选择
机构 * University of Florida(佛罗里达大学)
AI总结 本文研究LLM在多步逻辑推导中的脆弱性,提出通过干预逻辑连接词选择来提升推理准确性,采用多层框架优化逻辑关键节点,实现准确率与效率的平衡。
Journal ref 2026 ACL Findings
Evian:迈向可解释的视觉指令微调数据审计
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; ByteDance Seed(字节跳动种子)
AI总结 本文提出Evian框架,通过分解评估模型响应的三大认知组件,解决数据审计中逻辑一致性与事实准确性不足的问题,验证高质量小规模数据优于大规模低质量数据。
Comments Accepted at ACL 2026
HiGMem:一种分层且基于LLM的长期对话代理内存系统
机构 * East China Normal University(东华大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 HiGMem通过分层事件-对话轮次内存系统,利用事件摘要作为语义锚点,提升检索效率和证据集可靠性,优于现有方法。
Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Camera-ready version. 10 pages, 2 figures. Code: https://github.com/ZeroLoss-Lab/HiGMem
记忆、涌现与解释反转失败:对LLMs中关系语义的受控研究
机构 * Kyoto University(京都大学) ; University of Tokyo(东京大学) ; NII LLMC(日本信息处理学会LLMC) ; RIKEN(理化学研究所)
AI总结 研究通过受控知识图谱框架探讨LLMs在关系任务中的记忆、逻辑推理和泛化能力,发现关系语义在足够逻辑监督下涌现,并揭示反转失败主要由自回归顺序偏差引起。
Comments ACL2026 Main Long Paper
CodeRL+: 通过执行语义对齐改进代码生成
机构 * School of Computer Science, Peking University(北京大学计算机科学系) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室) ; School of Computer Science, Wuhan University(武汉大学计算机科学系)
AI总结 本文提出CodeRL+,通过将执行语义对齐整合到RLVR训练流程中,提升代码生成的准确性,实验显示其在pass@1指标上平均提升4.6%。
Comments Accepted by ACL 2026
从节点到叙事:利用LLM和图上下文解释图神经网络
机构 * University of Illinois Chicago(伊利诺伊大学香槟分校) ; Indian Institute of Technology Kharagpur(印度理工学院Khargapur分校)
AI总结 本文提出GSPELL框架,利用大语言模型生成图神经网络预测的可解释性解释,通过将节点嵌入投影到LLM嵌入空间并构建混合提示,提升解释的准确性和简洁性。
Comments Accepted to ACL 2026