arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10296
2605.10714 2026-05-12 cs.CL cs.AI

Why Low-Resource NLP Needs More Than Cross-Lingual Transfer: Lessons Learned from Luxembourgish

为何低资源NLP需要比跨语言迁移更多:从卢森堡语学到的教训

Fred Philippy, Siwen Guo, Jacques Klein, Tegawendé F. Bissyandé

机构 * SnT, University of Luxembourg(卢森堡大学SnT学院) Luxembourg Institute of Science and Technology(卢森堡科学技术研究院)

AI总结 本文探讨了低资源语言处理中跨语言迁移与语言特定努力的互补性,指出两者需结合以构建可持续的NLP流程。

Comments Accepted at BigPicture Workshop 2026 (co-located with ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10627 2026-05-12 cs.CL cs.AI

Interpretable Coreference Resolution Evaluation Using Explicit Semantics

基于显式语义的可解释指代消解评估

Bruno Gatti, Giuliano Martinelli, Roberto Navigli

机构 * Sapienza NLP Group(萨皮恩扎自然语言处理组) Sapienza University of Rome(罗马萨皮恩扎大学)

AI总结 本文提出一种语义增强的指代消解评估框架,通过叠加概念和命名实体识别,揭示指代消解中不同语义类别的系统性缺陷,并设计针对性的数据增强策略以提升模型性能。

Comments Accepted at main conference for ACL 2026. 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10622 2026-05-12 cs.MM cs.CV

Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination

LVLMs中的词汇劫持:通过排除惰性标记来揭示关键注意力头以缓解幻觉

Yangneng Chen, Junlin Li, Weijun Yao, Xilai Ma, Guodong Du, Wenya Wang, Jing Li

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

AI总结 本文通过分析LVLMs的注意力机制,揭示了词汇劫持现象,提出HABI方法定位惰性标记,并引入NHAR指标评估其影响,最终提出HAVAE方法增强关键注意力头以减少幻觉。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10253 2026-05-12 cs.CR cs.AI

Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation

针对医疗多模态检索增强生成的知识污染攻击

Peiru Yang, Haoran Zheng, Tong Ju, Shiting Wang, Wanchun Ni, Jiajun Liu, Shangguang Wang, Yongfeng Huang, Tao Qi

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Northwestern Polytechnical University(西北工业大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出M³Att框架,针对医疗多模态RAG系统,通过在文本数据中注入隐蔽虚假信息并利用配对视觉数据作为查询无关触发器,提升检索概率,从而在不依赖用户查询先验知识的情况下实现知识污染攻击。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10171 2026-05-12 cs.CL cs.AI

When Reviews Disagree: Fine-Grained Contradiction Analysis in Scientific Peer Reviews

当评论存在分歧时:科学同行评审中的细粒度矛盾分析

Sandeep Kumar, Yash Kamdar, Abid Hossain, Bharti Kumari, Tanik Saikh, Asif Ekbal

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(印度理工学院帕纳瓦分校计算机科学与工程系) School of Computer Engineering, KIIT Deemed to be University, Bhubaneswar, India(比哈尔邦布尔萨大学计算机工程学院)

AI总结 本文提出细粒度的同行评审矛盾分析方法,通过识别矛盾证据跨度并分配矛盾强度评分,改进了现有二元矛盾检测方法,引入RevCI基准和IMPACT框架,并通过TIDE模型实现高效部署。

Comments accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07575 2026-05-12 cs.CV cs.AI

Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding

响应-G1:面向前瞻性流视频理解的显式场景图建模

Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Liu

机构 * Northwestern Polytechnical University(北华大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Harbin Engineering University(哈尔滨工程大学)

AI总结 响应-G1通过显式场景图建模提升前瞻性流视频理解,通过三阶段流程实现视频证据与查询条件的结构化对齐,提高响应时机的可解释性和准确性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28902 2026-05-12 cs.AI

ChartDiff: A Large-Scale Benchmark for Comprehending Pairs of Charts

ChartDiff:一种大规模的图表对理解基准

Rongtian Ye

机构 * Department of Computer Science, Aalto University(阿尔托大学计算机科学系)

AI总结 本文提出ChartDiff,首个大规模多图表对比总结基准,通过8541对图表数据评估不同模型,揭示通用模型与专用模型在对比总结中的性能差异。

Comments 21 pages, 17 figures, accepted to ACL 2026: the 4th Workshop on Advances in Language and Vision Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03042 2026-05-12 cs.CL

BaseCal: Unsupervised Confidence Calibration via Base Model Signals

BaseCal: 通过基础模型信号实现无监督的置信度校准

Hexiang Tan, Wanli Yang, Junwei Zhang, Xin Chen, Rui Tang, Du Su, Jingang Wang, Yuanzhuo Wang, Fei Sun, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院)

AI总结 本文提出BaseCal方法,利用基础模型信号校准大语言模型的置信度,通过两种方法减少校准误差,实验表明其在多个数据集上有效降低了ECE。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19995 2026-05-12 cs.CL cs.AI cs.LG

Schoenfeld's Anatomy of Mathematical Reasoning by Language Models

语言模型的数学推理解剖:Schoenfeld的推理结构

Ming Li, Chenrui Fan, Yize Cheng, Soheil Feizi, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文通过Schoenfeld的事件理论,提出ThinkARM框架,解剖语言模型的推理过程,揭示推理与非推理模型在结构上的差异,并通过案例研究展示探索步骤与正确性及效率方法的影响。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24859 2026-05-12 cs.LG cs.CL

Beyond Multiple Choice: Evaluating Steering Vectors for Summarization

超越多项选择:评估摘要中的引导向量

Joschka Braun, Carsten Eickhoff, Seyed Ali Bahrainian

机构 * University of Tübingen(图宾根大学)

AI总结 本文评估引导向量在摘要生成中对主题焦点、情感、毒性及可读性的控制效果,发现高引导强度会导致重复和事实性幻觉,混合方法在中等强度下表现最佳。

Comments Published in Findings of EACL 2026. Extended version of the ICML 2025 Workshop on Reliable and Responsible Foundation Models paper (v1, v2). 36 pages, 21 figures, 15 tables

Journal ref Findings of the Association for Computational Linguistics: EACL 2026, pages 3849-3884

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10766 2026-05-12 cs.LG cs.AI cs.CL

How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients

指令和推理数据如何塑造训练后阶段:通过层梯度的视角探讨数据质量

Ming Li, Yanhong Li, Ziyue Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Allen Institute for AI(Allen人工智能研究所)

AI总结 本文通过层梯度的谱分析,揭示了高质量指令和推理数据对大语言模型训练后阶段的影响,统一了数据评估指标,并展示了数据质量与训练稳定性之间的关系。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10043 2026-05-12 cs.CL cs.AI

Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework

通过二元反馈个性化大语言模型:一种偏好校正的优化框架

Xilai Ma, Liye Zhao, Weijun Yao, Haibing Di, Wenya Wang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) Nanyang Technological University(南洋理工大学)

AI总结 本文提出C-BPO框架,通过偏好校正的二元信号实现LLM个性化,解决用户间差异问题,实验表明其在多种任务中优于基线方法。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09922 2026-05-12 cs.CL cs.AI

Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs

基于双自适应加权的团队自博弈:用于微调大语言模型

Wu Li, Yigeng Zhou, Zesheng Shi, Yequan Wang, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院)

AI总结 本文提出TPAW算法,通过团队协作与竞争机制提升自监督下LLM对齐效果,采用双自适应加权机制提高优化效率,实验证明其在多种模型和基准测试中表现优异。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09920 2026-05-12 cs.LG cs.AI

Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward

通过内在梯度-范数奖励实现无需验证器的LLM强化学习

Xuexiang Wen, Hang Yu, Linchao Zhu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 本文提出VIGOR,一种无需外部验证器的强化学习奖励机制,通过内在偏好信号提升政策优化效果,在数学推理和代码基准测试中表现优于现有方法。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09739 2026-05-12 cs.CL cs.AI

The Silent Vote: Improving Zero-Shot LLM Reliability by Aggregating Semantic Neighborhoods

沉默投票:通过聚合语义邻域提高零样本LLM可靠性

Sanket Badhe, Priyanka Tiwari, Deep Shah

机构 * Google(谷歌)

AI总结 本文提出Semantic Softmax方法,通过聚合目标标签的语义邻域得分,解决零样本分类中的Renormalization Bias问题,提升模型校准性和准确性。

Comments Accepted at GEM Workshop @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09497 2026-05-12 cs.AI cs.CR

Don't Click That: Teaching Web Agents to Resist Deceptive Interfaces

别点那个:教网络代理抵抗欺骗界面

Yilin Zhang, Yingkai Hua, Chunyu Wei, Xin Wang, Yueguo Chen

机构 * Renmin University of China(中国人民大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)

AI总结 本文提出DUDE框架,通过混合奖励学习和不对称惩罚,结合经验总结,提升网络代理对欺骗界面的抵抗力,实验显示欺骗敏感度降低53.8%。

Comments Accepted to ACL 2026 Main Conference. 23 pages, 8 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09414 2026-05-12 cs.CL

Cross-Cultural Transfer of Emoji Semantics and Sentiment in Financial Social Media

跨文化情感与语义在金融社交媒体中的迁移

Ahmed Mahrous, Roberto Di Pietro

机构 * King Abdullah University of Science and Technology(卡塔尔国王阿卜杜勒阿齐兹大学科学与技术学院)

AI总结 研究探讨了emoji在不同金融社区中的语义和情感稳定性,发现emoji能提供跨语言的通用情感线索,提升模型泛化能力。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26961 2026-05-12 cs.SE cs.AI cs.PL

Static Program Slicing Using Language Models With Dataflow-Aware Pretraining and Constrained Decoding

基于语言模型的数据流感知静态程序切片

Pengfei He, Shaowei Wang, Tse-Hsun Chen, Muhammad Asaduzzaman

机构 * Department of Computer Science, University of Manitoba(曼尼托巴大学计算机科学系) School of Engineering and Computer Science, Concordia University(Concordia大学工程与计算机科学学院) School of Computer Science, University of Windsor(温莎大学计算机科学学院)

AI总结 本文提出Sliceformer,通过数据流感知预训练和约束解码改进静态程序切片,提升依赖建模精度和减少生成幻觉,实验显示在Java和Python基准上精确匹配提升22%。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11087 2026-05-12 cs.LG

CausalGaze: Unveiling Hallucinations via Counterfactual Graph Intervention in Large Language Models

CausalGaze: 通过反事实图干预揭示大语言模型的幻觉

Linggang Kong, Lei Wu, Yunlong Zhang, Xiaofeng Zhong, Zhen Wang, Yongjie Wang, Yao Pan

机构 * College of Electronic Engineering, National University of Defense Technology(国防科技大学电子工程学院) Anhui Province Key Laboratory of Cyberspace Security Situation Awareness and Evaluation(安徽省网络空间安全态势感知与评估重点实验室) Institute of Computer Application, China Academy of Engineering Physics(中国工程物理研究院计算机应用研究所)

AI总结 CausalGaze通过反事实图干预揭示大语言模型的幻觉,利用结构因果模型提升模型可解释性,在四个数据集和三个常用LLM上实验表明其有效性,尤其在TruthfulQA数据集上比现有方法提升3.3%的AUROC。

Comments Accepted as ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08178 2026-05-12 cs.AI

Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling

通过规划对齐代理:一个轨迹级奖励建模的基准测试

Jiaxuan Wang, Yulan Hu, Wenjin Yang, Zheng Pan, Xin Li, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP)

AI总结 本文提出Plan-RewardBench,用于评估奖励模型在复杂工具使用场景中区分优选与干扰代理轨迹的能力,揭示了代理级奖励建模在长周期轨迹上的挑战。

Comments accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21362 2026-05-12 cs.AI cs.CL

AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning

AdaRubric:面向可靠LLM代理评估和奖励学习的任务自适应评分标准

Liang Ding

机构 * The University of Sydney(悉尼大学)

AI总结 AdaRubric通过自适应生成任务特定评分标准,结合置信度加权评分和密集奖励信号,提升LLM代理评估的准确性与可靠性,实验表明其在多个基准测试中表现优异。

Comments KnowFM @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14889 2026-05-12 eess.AS cs.CL cs.LG

SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness

SDiaReward:基于模态和口语性的语音对话奖励建模与基准测试

Jingyu Lu, Yuhan Wang, Fan Zhuo, Xize Cheng, Changhao Pan, Xueyi Pu, Yifu Chen, Chenyuhao Wen, Tianle Liang, Zhou Zhao

机构 * Zhejiang University(浙江大学)

AI总结 本文提出SDiaReward,一种端到端的多轮奖励模型,通过SDiaReward-Dataset数据集解决模态和口语性差距问题,实现对语音对话中模态和口语性的联合评估,实验表明其在配对偏好准确率上优于通用音频大语言模型。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24863 2026-05-12 cs.CL cs.AI cs.CY

Big AI is accelerating the metacrisis: What can we do?

大AI正在加速元危机:我们能做什么?

Steven Bird

机构 * Charles Darwin University(查尔斯·达尔文大学)

AI总结 大AI加剧了生态、意义和语言危机,本文呼吁语言工程师团结一致,探索替代方案,设计以人类繁荣为核心的自然语言处理未来。

Comments 12 pages, 2 figures, to appear in Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), San Diego, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18880 2026-05-12 cs.CL cs.AI cs.CY

Can LLMs Estimate Student Struggles? Human-AI Difficulty Alignment with Proficiency Simulation for Item Difficulty Prediction

LLMs能否估计学生困难?人类-人工智能难度对齐用于项目难度预测的 proficiency 模拟

Ming Li, Han Chen, Yunze Xiao, Jian Chen, Hong Jiao, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学) MBZUAI

AI总结 本文研究了LLMs在估计学生困难方面的表现,发现模型规模扩大并不总能提高准确性,且模型倾向于形成机器共识而非与人类对齐,揭示了当前模型在自动难度预测中的挑战。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11470 2026-05-12 cs.LG cs.CL

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning

重新思考在LLM后训练中专家轨迹的利用

Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出Plasticity-Ceiling框架,通过分解最终性能上限,揭示SFT与RL的协同优化方法,建立SFT-然后-RL的流水线,解决同步方法的稳定性问题,并提供精确的缩放指南。

Comments ACL-26, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23074 2026-05-12 cs.CR cs.CL

Fast-MIA: Efficient and Scalable Membership Inference for LLMs

Fast-MIA:高效且可扩展的大型语言模型成员推断

Hiromu Takahashi, Shotaro Ishihara

机构 * Independent Researcher(独立研究者) Nikkei Inc.(日本 Nikkei 公司)

AI总结 本文提出Fast-MIA库,通过高吞吐量批量推理和交叉方法缓存架构,提升LLM成员推断攻击的效率与可扩展性,支持统一框架和灵活配置,促进可重复的隐私风险审计研究。

Comments ACL 2026 System Demonstrations

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22767 2026-05-12 cs.LG cs.CL

TELL-TALE: Task Efficient LLMs with Task Aware Layer Elimination

TELL-TALE:任务高效的大语言模型与任务感知的层消除

Omar Naim, Krish Sharma, Niyar R Barman, Nicholas Asher

机构 * IRIT Université de Toulouse(IRIT图卢兹大学) IRIT CNRS(IRIT国家科学研究中心)

AI总结 TELL-TALE通过任务感知的层消除方法优化任务性能,减少计算成本,同时在零样本和少样本设置下实现性能提升,适用于任务专用的大语言模型推理。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14685 2026-05-12 cs.CL

SSA: Improving Performance With a Better Scoring Function

SSA:通过更好的评分函数提升性能

Omar Naim, Swarnadeep Bhar, Jérôme Bolte, Nicholas Asher

机构 * IRIT Université de Toulouse(图卢兹大学IRIT研究所) Toulouse School of Economics University of Toulouse Capitole(图卢兹经济学院大学图卢兹校区) IRIT CNRS(IRIT国家科学研究中心)

AI总结 本文提出SSA评分函数,通过改进Transformer模型的注意力机制,提升上下文学习任务和NLP基准测试的表现。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11604 2026-05-12 cs.CL

Talk to Your Slides: High-Efficiency Slide Editing via Language-Driven Structured Data Manipulation

与幻灯片对话:通过语言驱动的结构化数据操作实现高效幻灯片编辑

Kyudan Jung, Hojun Cho, Jooyeol Yun, Soyoung Yang, Jaehyeok Jang, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Chung-Ang University(Chung-Ang 大学)

AI总结 本文提出Talk-to-Your-Slides,通过语言驱动的结构化数据操作实现高效幻灯片编辑,相较于基于图像的GUI方法,其在文本处理和格式任务中更快、更准确且成本更低。

Comments 30 pages, Accepted at ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05383 2026-05-12 cs.AI cs.MA

AVA: Attentive VLM Agent for Mastering StarCraft II

AVA:面向星际2的注意力视觉语言代理

Weiyu Ma, Yuqian Fu, Zecheng Zhang, Bernard Ghanem, Guohao Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 AVA提出一个支持多智能体强化学习和视觉语言模型的星际2基准,通过RGB图像、自然语言观察和结构化状态信息,比较训练和零样本方法在21种场景中的表现,揭示训练效率、性能上限、可解释性和部署成本的权衡。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏