Evaluating Multi-turn Human-AI Interaction
评估多轮人机交互
AI总结 本文探讨了当前NLP评估方法的局限性,提出TCR框架用于评估人机交互,强调透明性、一致性和细化等维度,通过结构化评估提示和示例展示如何补充聚合指标和LLM作为评判者的方法。
Comments ACL 2026 EvalEval Workshop
期刊&会议
Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing
评估多轮人机交互
AI总结 本文探讨了当前NLP评估方法的局限性,提出TCR框架用于评估人机交互,强调透明性、一致性和细化等维度,通过结构化评估提示和示例展示如何补充聚合指标和LLM作为评判者的方法。
Comments ACL 2026 EvalEval Workshop
MA$^{2}$P: 一种用于复杂说服的元认知自主智能体框架
机构 * School of Computer Science and Engineering, Key Laboratory of Computer Network and Information Integration, Ministry of Education, Southeast University, China(计算机科学与工程学院、计算机网络与信息集成重点实验室、教育部、东南大学,中国) ; Department of Informatics, King’s College London(信息学院、伦敦国王学院)
AI总结 本文提出MA$^{2}$P框架,通过自主多智能体架构和元认知配置器,解决复杂说服中说服者需解读内部状态、推断潜在心理状态并生成策略一致行动的挑战,提升说服成功率。
Comments 22 pages, 8 figures. Accepted to Findings of ACL 2026
条件句中的预设与推理:人类与LLM的理论研究
机构 * Department of Cognitive Science, Carleton University(卡尔顿大学认知科学系) ; School of Computer Science, McGill University(麦吉尔大学计算机科学学院) ; Mila – Quebec AI Institute(魁北克人工智能研究所)
AI总结 本文通过对比人类判断和LLM预测,研究条件句中预设投影的机制,发现人类结合概率和语用线索进行判断,而LLM存在不一致的对齐模式,表明LLM的表现可能源于表面模式匹配而非语用能力。
Comments To appear in the Proceedings of CoNLL 2026, colocated with ACL 2026
CodeBind: 一种用于多模态对齐的解耦表示学习框架
机构 * Visual AI Lab, The University of Hong Kong(视觉人工智能实验室,香港大学)
AI总结 CodeBind通过统一的组合代码本设计优化多模态表示空间,解决了传统方法在跨模态信息差异和数据稀缺导致的对齐空间不足问题,实现了多模态分类和检索任务中的最佳性能。
Comments ACL 2026 Findings; Project page: https://visual-ai.github.io/codebind
Speech-Hands: 一种基于自我反思的语音代理方法用于语音识别和多感知音频推理
机构 * NVIDIA ; Kyoto University(京都大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出Speech-Hands框架,通过自我反思决策机制解决语音识别和外部声音理解任务中的信任问题,提升了模型在多任务音频推理中的准确性和鲁棒性。
Comments Accepted to ACL 2026. Oral Presentation. Code: https://github.com/YukinoWan/Speech-Hands OpenClaw Branch: https://github.com/openclaw/openclaw/pull/69073
重新思考表格修剪在表格问答中的应用:从顺序修订到黄金轨迹监督的并行搜索
机构 * University of Science and Technology of China(中国科学技术大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)
AI总结 本文提出TabTrim框架,通过将表格修剪从顺序修订转变为由黄金轨迹监督的并行搜索,解决了现有方法中无法检测关键答案数据丢失的问题,并在多个表格推理任务中实现了最先进的性能。
Comments 17 pages, 5 figures, accepted to ACL 2026 Oral
当表格问答遇见噪声:为复杂问题和大规模表格设计的双去噪框架
机构 * University of Science and Technology of China(中国科学技术大学) ; The University of Melbourne(墨尔本大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
AI总结 本文提出EnoTab双去噪框架,通过改进相关性过滤和表格修剪能力,解决复杂问题和大规模表格中的噪声问题,提升表格问答性能。
Comments 24 pages, 24 figures, accepted to ACL 2026 Main
PROTEA:多智能体大语言模型工作流的离线评估与迭代优化
机构 * Sony Group Corporation(索尼集团公司)
AI总结 本文提出PROTEA,一种用于多智能体大语言模型工作流的离线评估和迭代优化接口,通过配置评分标准和可视化工作流图中的节点状态,帮助开发者定位瓶颈并改进工作流性能。
Comments 9 pages, 3 figures, 1 table. To appear in Proceedings of ACL 2026 System Demonstrations
推理时对修辞角色标注中困难示例的语义重排序
机构 * Nantes Université, École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学,中央理工学院,国家科学研究中心,LS2N,UMR 6004) ; University of Lorraine(洛林大学)
AI总结 本文提出RISE框架,在推理时利用标签语义对修辞角色标注中的困难示例进行重排序,提升模型预测的准确性和鲁棒性。
Comments Accepted at ACL 2026 (Main Conference)
DuIVRS-2: 基于大语言模型的大型兴趣点属性采集交互语音响应系统
机构 * Baidu Inc.(百度公司)
AI总结 本文提出DuIVRS-2,一种基于大语言模型的端到端框架,用于大规模兴趣点属性采集,通过有限状态机引导的数据增强策略、选择生成方案与思维链机制,提高了输出稳定性并有效消除幻觉,最终在生产环境中实现了83.9%的任务成功率。
Comments Accepted to ACL 2026 Industry Track. 14 pages, including appendix
从文档到段落:一种用于主题分配的上下文重述
机构 * LG AI Research(LG AI研究院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出了一种基于段落的主题分配方法(SBTA),通过将主题分配到短小且连贯的文本段落而非整个文档,以解决传统主题模型中文档多主题问题导致的主题污染问题,从而提升主题分析的清晰度和可解释性。
Comments Findings of ACL 2026
MARQUIS:视频检索增强生成的三阶段流水线
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Human Language Technology Center of Excellence(人机语言技术卓越中心)
AI总结 本文提出MARQUIS三阶段流水线,通过查询扩展、融合和重排序、校准的结构化证据提取以及从提取证据生成文章,解决了视频检索增强生成中检索和生成的不足,提升了检索性能和文章生成质量。
Comments Accepted as an oral presentation at the ACL 2026 Workshop MAGMaR Systems. 27 pages, 4 figures. Code can be found here: https://github.com/debashishc/marquis
通过更好的令牌学习:用于专业文本摘要的参数高效词汇适应
机构 * Dept. of Computer Science and Engg., IIT Kharagpur(印度Kharagpur理工学院计算机科学与工程系) ; Dept. of Medicine (Biomedical Informatics), Stanford University(斯坦福大学医学院(生物医学信息学))
AI总结 本文提出了一种参数高效的领域适应方法,通过结合词汇适应和预训练,提升大型语言模型在专业领域文本摘要任务中的性能,同时减少训练时间和参数数量。
Comments 16 pages. Accepted in the 64th Annual Meeting of the Association for Computational Linguistics [ACL (Main) 2026] as a long paper
在大型语言模型中微调与上下文学习:从形式语言学习的角度
机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) ; Boston University(波士顿大学)
AI总结 本文从形式语言学习的角度比较了大型语言模型中的微调与上下文学习,通过设计精确的语言边界、受控字符串采样和无数据污染的任务,发现微调在分布内泛化上优于上下文学习,而两者在分布外泛化上表现相当,且两者在不同熟练度水平上的归纳偏置也有所不同。
Comments Accepted at ACL 2026 (Main)
STEM: 用于知识图谱驱动检索增强生成的结构追踪证据挖掘
机构 * AI Product Center, Kingsoft Corporation(金山办公人工智能产品中心)
AI总结 本文提出STEM框架,通过将多跳推理重新定义为以模式引导的图搜索任务,解决知识图谱结构异质性和现有推理路径检索方法缺乏全局结构视角的问题,从而提升多跳推理的准确性和证据完整性。
Comments 34 pages, 16 figures, accepted to ACL 2026 (Main Conference, Oral Presentation)
超越最终作者:为细粒度LLM生成文本检测建模创作者与编辑的双重角色
机构 * ict.ac.cn(中国科学院)
AI总结 本文提出RACE方法,通过建模创作者和编辑的双重角色,实现细粒度LLM生成文本检测,以更精确地区分不同类型的文本,从而为LLM监管提供政策对齐的解决方案。
Comments ACL 2026 (Oral)
领域专精的幻觉:揭示混合专家模型中的领域不变‘ standing committee ’
机构 * The Fin AI(Fin AI) ; Georgia Institute of Technology(佐治亚理工学院) ; Cornell University(康奈尔大学) ; Stevens Institute of Technology(史蒂文斯理工学院) ; The University of Manchester(曼彻斯特大学)
AI总结 本研究质疑混合专家模型通过稀疏路由实现领域专精的假设,提出COMMITTEEAUDIT框架分析专家组而非个体专家的路由行为,发现领域不变的standing committee,揭示模型存在向集中计算偏倚的结构倾向,表明混合专家模型中的专精程度远低于预期。
Comments Accepted by ACL 2026 main conference. Camera-ready version
QuCo-RAG:从预训练语料库中量化不确定性以实现动态检索增强生成
机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) ; New York University(纽约大学) ; Monash University(莫纳什大学)
AI总结 本研究提出QuCo-RAG,通过从预训练语料库中提取客观统计信息来量化不确定性,以解决动态检索增强生成中大语言模型的幻觉问题,实验表明其在多跳问答基准测试中优于现有方法,并在多个模型上实现了显著的提升。
Comments ACL Findings 2026
通过模板填充解锁扩散语言模型的潜力
机构 * Seoul National University(首尔国立大学)
AI总结 本文提出了一种针对扩散语言模型的模板填充方法,通过在生成响应空间中建立全局蓝图,提升了数学推理、代码生成和旅行规划等任务的性能,同时在多token生成中实现了生成质量与速度的平衡。
Comments ACL 2026 Main Conference - Long Paper, Oral Presentation
Merlin's Whisper:通过黑盒说服提示增强大语言模型的高效推理
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Sea AI Lab(Sea AI实验室) ; Peking University(北京大学)
AI总结 本文提出Whisper框架,通过黑盒说服提示减少大语言模型(LRM)的推理过程中的token使用量,同时保持性能,展示了在多个基准测试中显著的token减少效果。
Comments ACL 2026 (Long Paper), camera-ready version
代码的缩放规律:一个更数据渴求的阶段
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Chinese Academy of Sciences(中国科学院) ; Fudan University(复旦大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
AI总结 本文研究了代码的缩放规律,通过大规模实验发现Farseer定律在准确性上更优,代码模型在模型大小上表现良好,但需要更高的数据与参数比,且在代码-自然语言混合数据中,自然语言在资源受限场景下有益,但在更高计算预算下成为负担。
Comments Accepted by ACL2026
Red-Bandit:通过带引导的LoRA专家实现LLM红队测试的测试时适应
机构 * Imperial College London(伦敦帝国学院)
AI总结 本文提出Red-Bandit框架,通过带引导的LoRA专家在不同攻击风格下实现LLM的测试时适应,通过强化学习生成不安全提示,并利用多臂老虎机策略动态选择攻击风格专家,从而在AdvBench上取得最佳结果,同时生成更易读的提示。
Comments Accepted to the Main Conference at ACL 2026
OPeRA: 一个用于评估LLM在模拟人类在线购物行为上的表现的观察、人设、推理和行动数据集
机构 * Northeastern University(东北大学) ; University of Southern California(南加州大学) ; Stony Brook University(石溪大学) ; Independent Researcher(独立研究者) ; Ohio State University(俄亥俄州立大学) ; University of Notre Dame(Notre Dame 大学) ; Columbia University(哥伦比亚大学)
AI总结 本文提出OPeRA数据集,用于评估LLM在模拟人类在线购物行为上的能力,通过收集真实用户在在线购物会话中的观察、人设、推理和行动,建立首个评估LLM预测特定用户下一步行动和推理的基准。
Comments ACL 2026 main
稀疏到密集:一种无损加速视频理解的LLM免费午餐
机构 * Singapore Management University(新加坡国立管理学院) ; Sea AI Lab(Sea AI实验室) ; National University of Singapore(国立新加坡大学)
AI总结 本文提出了一种名为Sparse-to-Dense(StD)的解码策略,通过结合稀疏top-K注意力和密集全注意力模块,实现视频大语言模型(Video-LLMs)的无损加速,从而在处理长视频序列时显著提高处理速度。
Comments Accepted by ACL 2025
PluRule:一种用于社交媒体上多元社区调节的基准测试
机构 * Observatory on Social Media, Indiana University, USA(社交媒体观察站,印第安纳大学,美国) ; Center Synergy of Systems, TUD Dresden University of Technology, Germany(系统协同中心,德累斯顿技术大学,德国)
AI总结 研究探讨了AI模型在调节社交媒体上多元社区中的挑战,提出PluRule基准测试以检测13371条规则违规情况,发现即使使用最先进的视觉语言模型,也难以有效识别违规行为。
Comments Accepted to ACL 2026 Main Conference
PersonaArena: 用于评估和提升大语言模型层面角色扮演的动态模拟
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; Microsoft Research Asia(微软亚洲研究院) ; Microsoft Gaming(微软游戏) ; Provincial Key Laboratory of Intelligent Communication and Digital Society Governance, Shenzhen University(深圳大学省级智能通信与数字社会治理重点实验室)
AI总结 本文提出PersonaArena框架,通过动态模拟评估和提升大语言模型在角色扮演层面的能力,利用用户生成的社会内容构建细致的个性库,并在模拟社交环境中进行多轮上下文丰富的交互,通过多代理辩论裁判实现全面公正的评估。
Comments ACL 2026 Findings
大型语言模型中的语言习得装置
机构 * The University of Tokyo(东京大学)
AI总结 本文提出了一种受语言习得装置启发的预预训练方法,通过在MP-STRUCT形式语言上进行预训练,提高了大型语言模型的数据效率,并展示了其对结构不合理的语言的抗性。
Comments Accepted to ACL2026 Main Conference
从孤立评分到协作排名:一种基于LLM的论文评估比较原生框架
机构 * School of Economics and Management, East China Normal University(东华大学经济管理学院) ; School of Information Management, Wuhan University(武汉大学信息管理学院) ; China Academic Degrees & Graduate Education Development Center(中国学位与研究生教育发展中心)
AI总结 本文提出CNPE框架,通过整合比较机制于数据构建和模型学习,提升论文评估的相对质量判断,实验显示比DeepReview-14B平均提升21.8%。
Comments Accepted at Findings of ACL 2026
CounterRefine:用于事实问答中推理时知识修复的答案条件计数证据检索
机构 * Ryquo ; App-In Club
AI总结 CounterRefine通过在推理时检索特定证据并进行约束性修正,提升事实问答的准确性,实验表明其在多个基准测试中有效改进了基础模型的表现。
Comments Accepted at the 4th Workshop on Towards Knowledgeable Foundation Models at ACL 2026
培养可推广的多模态操纵检测的推理能力
机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) ; CSIRO(澳大利亚联邦科学与工业研究组织) ; Northwestern Polytechnical University(西北工业大学) ; University of Macau(澳门大学)
AI总结 本文提出REFORM框架,通过推理驱动的方法改进多模态操纵检测,提升泛化能力,在多个数据集上取得新高准确率。
Comments Accepted to ACL 2026