arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10304
2604.10693 2026-04-21 cs.AI

FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning

FACT-E:基于因果的可信推理链评估

Yuxi Sun, Aoqi Zuo, Haotian Xie, Wei Gao, Mingming Gong, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学)

AI总结 FACT-E通过因果方法评估推理链的可信度,结合内部一致性与推理-答案一致性,提升推理轨迹选择质量并增强噪声下的鲁棒性。

Comments Accepted to Association for Computational Linguistics Findings (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07960 2026-04-21 cs.CV cs.AI cs.CL

TOOLCAD: Exploring Tool-Using Large Language Models in Text-to-CAD Generation with Reinforcement Learning

TOOLCAD: 探索用于文本到CAD生成的工具使用大型语言模型与强化学习

Yifei Gong, Xing Wu, Wenda Liu, Kang Tu

机构 * School of Computer Engineering & Science, Shanghai University(上海大学计算机工程与科学学院)

AI总结 本文提出TOOLCAD框架,利用LLM作为工具使用代理进行文本到CAD生成,并通过交互式CAD建模环境和强化学习提升模型性能。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07937 2026-04-21 cs.CL

HCRE: LLM-based Hierarchical Classification for Cross-Document Relation Extraction with a Prediction-then-Verification Strategy

HCRE: 基于大语言模型的跨文档关系抽取的分层分类方法

Guoqi Ma, Liang Zhang, Hongyao Tu, Hao Fu, Hui Li, Yujie Lin, Longyue Wang, Weihua Luo, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Li Auto Inc.(Li Auto公司) Alibaba International Digital Commerce Group(阿里巴巴国际数字贸易集团)

AI总结 本文提出HCRE方法,通过分层关系树减少LLM需考虑的关系选项,结合预测-验证策略提升可靠性,实验表明其优于现有基线。

Comments ACL 2026 Findings; camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07549 2026-04-21 cs.CL cs.AI

EMSDialog: Synthetic Multi-person Emergency Medical Service Dialogue Generation from Electronic Patient Care Reports via Multi-LLM Agents

EMSDialog: 通过多LLM代理从电子患者护理报告生成合成多人紧急医疗服务体系对话

Xueren Ge, Sahil Murtaza, Anthony Cortez, Homa Alemzadeh

机构 * School of Engineering and Applied Sciences, University of Virginia(弗吉尼亚大学工程与应用科学学院) School of Medicine, University of Virginia(弗吉尼亚大学医学院)

AI总结 本文提出基于ePCR的多代理生成流程,生成4414个合成多说话者EMS对话数据集,提升EMS对话诊断预测的准确性、及时性和稳定性。

Comments Accepted by ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07484 2026-04-21 cs.AI cs.CL cs.LG

ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training

ConsistRM:通过一致性感知自训练改进生成奖励模型

Yu Liang, Liangxin Liu, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Daiting Shi

机构 * Baidu Inc.(百度公司)

AI总结 本文提出ConsistRM框架,通过一致性感知答案奖励和批评奖励提升生成奖励模型的稳定性与一致性,实验表明其在五个基准数据集上优于传统强化微调方法。

Comments Published as a Main conference paper at the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06155 2026-04-21 cs.LG cs.AI cs.CL

Toward Consistent World Models with Multi-Token Prediction and Latent Semantic Enhancement

迈向一致的世界模型:多令牌预测与潜在语义增强

Qimin Zhong, Hao Liao, Haiming Qin, Mingyang Zhou, Rui Mao, Wei Chen, Naipeng Chao

机构 * Shenzhen University(深圳大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文通过多令牌预测和潜在语义增强方法,解决大语言模型内部世界模型一致性问题,提升表示对齐性和鲁棒性。

Comments Accepted by ACL 2026 Main Conference. 21 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04815 2026-04-21 cs.CL cs.AI

LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection

LiveFact:一种动态、时间感知的LLM驱动虚假新闻检测基准

Cheng Xu, Changhong Jin, Yingjie Niu, Nan Yan, Yuke Mei, Shuhao Guan, Liming Chen, M-Tahar Kechadi

机构 * University College Dublin(都柏林大学) Georgia Institute of Technology(佐治亚理工学院) Dalian University of Technology(大连理工大学) Bebxy(贝比)

AI总结 LiveFact引入动态时间感知基准,评估模型在处理演进不完整信息时的推理能力,发现传统静态基准无法检测的推理差距。

Comments ACL 2026 Main; Homepage at https://livefact.bebxy.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23404 2026-04-21 cs.CV cs.CL

Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning

通过文本表示引导推理来解锁多模态大语言模型中的空间推理

Jiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu

机构 * College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

AI总结 本文提出TRACE方法,通过生成文本表示来提升多模态大语言模型的空间推理能力,实验表明其在多个基准测试中表现优异。

Comments Accepted to ACL 2026. 22 pages, 6 figures, 10 tables. Project page: https://trace-reasoning.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16120 2026-04-21 cs.CL

Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users

语言模型不知道你想要什么:评估深度研究中个性化需求需要真实用户

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eunsol Choi, Jordan Lee Boyd-Graber, Aakanksha Naik

机构 * University of Maryland(马里兰大学) Allen Institute for Artificial Intelligence(人工智能研究院) New York University(纽约大学)

AI总结 本文提出MyScholarQA系统,通过用户兴趣分析、个性化查询响应和报告生成,评估深度研究中个性化需求,发现LLM评估存在不足,需真实用户参与以实现有效个性化。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21228 2026-04-21 cs.CL cs.AI

ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following

ImpRIF:更强的隐式推理导致更好的复杂指令遵循

Yuancheng Yang, Lin Yang, Xu Wang, Chao Tong, Haihua Yang

机构 * ByteDance China(字节跳动中国) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室)

AI总结 本文提出ImpRIF方法,通过构建可验证推理图提升大语言模型对隐式推理指令的理解,从而增强复杂指令遵循能力,在五个基准测试中表现优异。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20743 2026-04-21 cs.CL

Adaptive Text Anonymization: Learning Privacy-Utility Trade-offs via Prompt Optimization

自适应文本匿名化:通过提示优化学习隐私-效用权衡

Gabriel Loiseau, Damien Sileo, Damien Riquet, Maxime Meyer, Marc Tommasi

机构 * Hornetsecurity Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(Lille大学、Inria、CNRS、Centrale Lille、UMR 9189 - CRIStAL)

AI总结 本文提出自适应文本匿名化任务,通过提示优化框架自动构建匿名化指令,实现隐私与效用的动态平衡,优于现有方法且计算高效。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06221 2026-04-21 cs.CL

BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks

BenchMarker:一种受教育启发的工具包,用于突出多项选择基准测试中的缺陷

Nishant Balepur, Bhavya Rajasekaran, Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Scale AI George Mason University(乔治·梅森大学)

AI总结 本文提出BenchMarker工具,利用LLM检测多项选择基准测试中的三项常见缺陷,通过人工标注和审计12个基准测试,发现自动和众包数据中存在大量缺陷,且修复方法可能引入新问题,影响NLP评估质量。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21278 2026-04-21 cs.CV cs.AI cs.CL cs.LG

GeoRC: A Benchmark for Geolocation Reasoning Chains

GeoRC:地理定位推理链基准测试

Mohit Talreja, Joshua Diao, Jim Thannikary James, Radu Casapu, Tejas Santanam, Ethan Mendes, Alan Ritter, Wei Xu, James Hays

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出GeoRC基准,通过Champion级GeoGuessr专家生成的800条真实推理链,评估VLM生成推理链的准确性,发现大模型在生成可审计推理链上仍逊于人类专家,而小型模型表现更差。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21244 2026-04-21 cs.LG cs.AI cs.CL

Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification

更少的噪声,更多的声音:通过指令净化进行推理的强化学习

Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

机构 * Department of Computer Science, Aarhus University(计算机科学系,阿arhus大学) Baidu Inc.(百度公司)

AI总结 本文提出LENS框架,通过去除干扰标记提升强化学习推理效率,实验显示其在数学推理和科学推理中性能更优,收敛更快。

Comments Accepted at ACL 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21191 2026-04-21 cs.CL cs.AI

Function Words as Statistical Cues for Language Learning

功能词作为语言学习的统计线索

Xiulin Yang, Heidi Getz, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学)

AI总结 研究探讨功能词的统计特性如何促进抽象语法知识的学习,通过跨语言语料分析验证了功能词的高频、句法关联性和短语边界对齐性是普遍规律,实验表明保留这些特性能提升神经网络学习效果。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20867 2026-04-21 cs.SD cs.AI eess.AS

Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion

通过语义扩展实现音频-语言模型的通用提示微调

Jaehyuk Jang, Wonjun Lee, Kangwook Ko, Changick Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出SEPT框架,通过引入语义扩展损失提升音频-语言模型提示微调的泛化能力,增强嵌入空间语义结构,改进基到新泛化和跨数据集迁移。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16934 2026-04-21 cs.CL cs.AI

Information Representation Fairness in Long-Document Embeddings: The Peculiar Interaction of Positional and Language Bias

长文档嵌入中的信息表示公平性:位置偏见与语言偏见的特殊交互

Elias Schuhmacher, Andrianos Michail, Juri Opitz, Rico Sennrich, Simon Clematide

机构 * Department of Computational Linguistics(计算语言学系)

AI总结 研究提出基于排列的评估框架,发现长文档嵌入模型存在系统性位置和语言偏见,早期段落和高资源语言段落被过度表示,而后期段落和低资源语言段落被边缘化,提出注意力校准方法缓解此问题。

Comments To appear in ACL2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15220 2026-04-21 cs.CL

Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models

隐私崩溃:良性微调可能在语言模型中破坏上下文隐私

Anmol Goel, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) TU Darmstadt(图腾达姆斯塔特大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) University of Tübingen(图宾根大学)

AI总结 研究发现语言模型在良性微调过程中可能因训练数据中的细微模式导致上下文隐私崩溃,揭示了当前安全评估在专用代理部署中的关键缺口。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07711 2026-04-21 cs.CL

Is Agentic RAG worth it? An experimental comparison of RAG approaches

代理RAG值得吗?RAG方法的实验比较

Pietro Ferrazzi, Milica Cvjeticanin, Alessio Piraccini, Davide Giannuzzi

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) University of Padova(帕多瓦大学) Cargill Geneve(卡吉尔日内夫) Alkemy(阿尔凯米) Komebi Studio(科梅比工作室)

AI总结 本文通过多场景多维度实验比较了增强型和代理型RAG方法,揭示了两者在性能与成本上的权衡,为实际应用提供选择指导。

Comments Accepted at ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06803 2026-04-21 cs.CL cs.CV

Forest Before Trees: Latent Superposition for Efficient Visual Reasoning

森林在树之前:用于高效视觉推理的潜在叠加

Yubo Wang, Juntian Zhang, Yichen Wu, Yankai Lin, Nils Lukas, Yuhan Liu

机构 * MBZUAI Fudan University(复旦大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Harvard University(哈佛大学)

AI总结 本文提出Laser方法,通过动态窗口对齐学习实现视觉推理的'森林在树之前'认知层次,提升模型在保持全局特征叠加的同时,实现高效且可解释的视觉推理。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05777 2026-04-21 cs.SE

EET: Experience-Driven Early Termination for Cost-Efficient Software Engineering Agents

EET:基于经验的早期终止以提高软件工程代理的效率

Yaoqi Guo, Ying Xiao, Jie M. Zhang, Mark Harman, Yiling Lou, Yang Liu, Zhenpeng Chen

AI总结 本文提出EET方法,通过利用历史经验减少软件工程代理的运行成本,同时保持任务性能,实验显示在SWE-bench基准上平均节省19%-55%的成本,且解决率损失极小。

Comments Accepted by the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026) Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05543 2026-04-21 cs.CL cs.SD eess.AS

Closing the Modality Reasoning Gap for Speech Large Language Models

弥合语音大语言模型的模态推理差距

Chaoren Wang, Heng Lu, Xueyao Zhang, Shujie Liu, Yan Lu, Jinyu Li, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Corporation(微软公司)

AI总结 本文提出TARS框架,通过不对称奖励设计对齐文本和语音条件轨迹,显著缩小模态推理差距并在7B级语音大语言模型中取得最佳性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05053 2026-04-21 cs.AI cs.CL

Reinforced Efficient Reasoning via Semantically Diverse Exploration

通过语义多样探索增强高效推理

Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang, Dawei Yin, Xin Xin

机构 * Shandong University(山东大学) Leiden University(莱顿大学) Baidu Inc.(百度公司)

AI总结 本文提出ROSE方法,通过语义熵分支策略和ε探索机制提升大语言模型的推理多样性与效率,并通过实验验证其有效性。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04052 2026-04-21 cs.RO cs.CL

Stable Language Guidance for Vision-Language-Action Models

用于视觉-语言-动作模型的稳定语言引导

Zhihao Zhan, Yuhao Chen, Jiaying Zhou, Qinhan Lyu, Hao Liu, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

AI总结 本文提出RSS框架,通过解耦物理 affordance 与语义执行,提升视觉-语言-动作模型在语言扰动下的鲁棒性,实验表明其在多种操作基准测试中达到最优性能。

Comments Accepted to ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04043 2026-04-21 cs.CL

When Helpers Become Hazards: A Benchmark for Analyzing Multimodal LLM-Powered Safety in Daily Life

当助手变成危险:一个多模态大语言模型在日常生活中的安全分析基准

Xinyue Lou, Jinan Xu, Jingyi Yin, Xiaolong Wang, Zhaolu Kang, Youwei Liao, Yixuan Wang, Xiangyu Shi, Fengran Mo, Su Yao, Kaiyu Huang

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能在交通运输中的关键实验室(北京交通大学),教育部) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) Tsinghua University(清华大学) Peking University(北京大学) University of Montreal(蒙特利尔大学)

AI总结 本文提出SaLAD基准,通过2013个真实世界图像-文本样本评估多模态大语言模型在日常生活中的安全影响,揭示模型在识别危险行为方面的局限性。

Comments Accepted by ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04029 2026-04-21 cs.CL

SpeakerSleuth: Can Large Audio-Language Models Judge Speaker Consistency across Multi-turn Dialogues?

SpeakerSleuth: 大型音频-语言模型能否在多轮对话中判断说话者一致性?

Jonggeun Lee, Junseong Pyo, Gyuhyeon Seo, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

AI总结 本文提出SpeakerSleuth基准测试,评估大型音频-语言模型在多轮对话中判断说话者一致性的能力,发现模型在识别声音不一致性和处理文本上下文时存在显著偏差。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03938 2026-04-21 cs.LG cs.AI cs.CL

FOREVER: Forgetting Curve-Inspired Memory Replay for Language Model Continual Learning

FOREVER: 基于遗忘曲线的记忆回放用于语言模型连续学习

Yujie Feng, Hao Wang, Jian Li, Xu Chu, Zhaolu Kang, Yiran Liu, Yasha Wang, Philip S. Yu, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) ShineMo Ltd., China(中国 ShineMo 公司) Solar System of OVB, Tencent, China(腾讯 OVB 太阳系中国) Peking University(北京大学) University College London(伦敦大学学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 FOREVER通过引入遗忘曲线概念,提出了一种基于模型自身时间的连续学习框架,有效缓解了语言模型在持续学习中的灾难性遗忘问题。

Comments ACL 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03331 2026-04-21 cs.CV cs.AI cs.LG

MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models

MMErroR:面向视觉-语言模型错误推理的基准测试

Yang Shi, Yifeng Xie, Minzhe Guo, Liangsi Lu, Mingxuan Huang, Jingchao Wang, Zhihong Zhu, Boyan Xu, Zhiqi Huang

机构 * Guangdong University of Technology(广东工业大学) Hong Kong Baptist University(香港 Baptist大学) Sun Yat-sen University(中山大学) Peking University(北京大学)

AI总结 本文提出MMErroR基准,通过1997个包含单一推理错误的样本,评估视觉-语言模型检测错误推理的能力,发现即使最佳模型也仅能正确分类66.65%的错误。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03154 2026-04-21 cs.CL

Decoupling the Effect of Chain-of-Thought Reasoning: A Human Label Variation Perspective

解耦链式推理的影响:从人类标签变异视角出发

Beiduo Chen, Tiancheng Hu, Caiqi Zhang, Robert Litschko, Anna Korhonen, Barbara Plank

机构 * MaiNLP Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) LMU Munich, Germany(慕尼黑大学,德国) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国) Language Technology Lab, University of Cambridge, United Kingdom(语言技术实验室,剑桥大学,英国)

AI总结 本文通过系统解耦实验探讨了链式推理对分布任务的影响,发现推理内容对最终准确性贡献大,而模型先验对分布排名起主导作用。

Comments Accepted by ACL 2026 Findings, 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02970 2026-04-21 cs.CL cs.LG

Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning

可靠性感知的自一致性自适应方法用于LLM推理中的高效采样

Junseok Kim, Nakyeong Yang, Kyungmin Min, Kyomin Jung

机构 * IPAI, Seoul National University(首尔国立大学IPAI)

AI总结 本文提出ReASC,通过将自适应采样从响应计数转向证据充分性,提升推理可靠性。在五个模型和四个数据集上,ReASC在准确率与成本之间取得最佳平衡,显著提升推理效率。

Comments ACL 2026, Code is available at https://github.com/junseokkim00/ReASC

详情

展开后加载摘要…

URL PDF HTML 收藏