arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

共收录 17
2608.06564 2026-08-14 cs.LG cs.CL 版本更新

Which Decisions Low-Bit Quantization Breaks, and How to Predict Them

量化损伤是乘法性的,而非加法性的

Zekun Wu, Swati Dhiman, Adriano Koshiyama

机构 * Holistic AI(霍利斯提克人工智能公司) University College London(伦敦大学学院)

AI总结 该研究发现大型语言模型的量化损伤是乘法性的,而非加法性的,提出边际收缩概念,拟合关系可准确预测决策翻转率,增加1位是修复损伤最廉价的方式。

Comments 18 pages, 9 figures, 8 tables. Under review at the Third Workshop on Uncertainty-Aware NLP (UncertaiNLP), EMNLP 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18940 2026-08-11 cs.LG cs.AI cs.CL 版本更新

NeuroAda: Activating Each Neuron's Potential for Parameter-Efficient Fine-Tuning

NeuroAda:激活每个神经元的潜力以实现参数高效的微调

Zhi Zhang, Yixian Shen, Congfeng Cao, Ekaterina Shutova

机构 * ILLC, University of Amsterdam(伊拉斯谟范例研究中心,阿姆斯特丹大学)

AI总结 该研究提出新型PEFT方法NeuroAda,通过为选中的网络参数引入旁路连接,仅更新旁路连接实现细粒度微调,仅需≤0.02%可训练参数,内存降60%,在23+任务上达SOTA性能

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16666 2026-08-07 cs.CL 版本更新

Robust Native Language Identification through Agentic Decomposition

基于智能体分解的鲁棒原生语言识别

Ahmet Yavuz Uluslu, Tannon Kew, Tilia Ellendorff, Gerold Schneider, Rico Sennrich

机构 * University of Zurich(苏黎世大学)

AI总结 本文针对LLM原生语言识别易依赖表面线索的问题,提出受法医语言学启发的智能体分解流程,通过专用智能体积累分类证据、协调智能体综合预测,在基准数据集上提升了NLI的鲁棒性与性能一致性。

Comments Accepted at EMNLP* 2025

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pp. 8398-8414

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26275 2026-08-05 cs.CL 版本更新

SPEAR: Code-Augmented Agentic Prompt Optimization

SPEAR: 代码增强的智能体提示优化

Mengyin Lu, Cong Feng, Huimin Han, Guangming Lu, Yu Sun, Xiaonan Ding, Shihui Long, Fengyi Li, Tanvi Motwani

机构 * LinkedIn Corporation(领英公司)

AI总结 提出SPEAR方法,将代码执行作为智能体工具进行提示优化,通过Python沙箱实现结构错误分析,并在工业任务和基准测试中取得显著提升。

Comments 19 pages, 3 figures, EMNLP 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06458 2026-07-31 cs.CL cs.AI cs.LG 版本更新

LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints

基于DeCRIM的大语言模型自校正:分解、批判与优化,提升多约束指令遵循能力

Thomas Palmeira Ferraz, Kartik Mehta, Yu-Hsiang Lin, Haw-Shiuan Chang, Shereen Oraby, Sijia Liu, Vivek Subramanian, Tagyoung Chung, Mohit Bansal, Nanyun Peng

AI总结 针对LLM处理多约束指令的不足,研究推出RealInstruct基准,提出DeCRIM自校正流程,可提升开源模型性能,结合强反馈时其表现能超越GPT-4。

Comments EMNLP 2024, see https://aclanthology.org/2024.findings-emnlp.458/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04843 2026-07-22 cs.AI 版本更新

Fluid Reasoning Representations

推理模型中的流体表示

Dmitrii Kharlapenko, Terry Jingchen Zhang, Arth Singh, Alessandro Stolfo, Arthur Conmy, Mrinmaya Sachan, Zhijing Jin

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学)

AI总结 研究揭示了推理模型通过上下文细化令牌表示提升抽象问题解决能力的机制,提出流体推理表示概念。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11059 2026-07-14 cs.SE cs.AI cs.CL 版本更新

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

SWE-MERA:一种用于在软件工程任务中对大型语言模型进行代理评估的动态基准测试

Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Fenogenova, Valentin Malykh

机构 * GigaCode ITMO University(ITMO大学) MWS AI(MWS人工智能) IITU university(IITU大学)

AI总结 针对现有软件工程基准测试局限性,提出SWE-MERA动态基准测试,通过自动收集GitHub问题及严格验证确保质量,最小化污染风险,利用Aider编码代理评估多个大型语言模型,展示了其强大区分能力及模型性能表现。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14612 2026-06-29 eess.AS cs.AI cs.LG 版本更新

Event-Grounded Question Answering over Long Audio via Structured Retrieval

基于结构化检索的长音频事件问答

Kartik Hegde, Arvind Krishna Sridhar, Naveen Vakada, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies, Inc., India(印度高通技术公司) Qualcomm Technologies, Inc., USA(美国高通技术公司) University of Turku, Finland(芬兰图尔库大学)

AI总结 提出LA-RAG框架,通过音频基础模型将长音频转为带时间戳的事件记录并存入SQL数据库,结合意图感知检索和LLM生成,实现低延迟高精度的长音频问答,在多个基准上提升时间定位F1达11-17%。

Comments Submitted to EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03217 2026-06-29 cs.CL cs.AI cs.CY cs.IR 版本更新

Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim Verification

混合事实核查:集成知识图谱、大语言模型和基于搜索的检索代理提高可解释的声明验证

Shaghayegh Kolli, Richard Rosenbaum, Timo Cavelius, Lasse Strothe, Andrii Lata, Jana Diesner

机构 * Technical University Munich(慕尼黑工业大学)

AI总结 提出一种混合事实核查方法,集成知识图谱、大语言模型和实时搜索代理,通过三步流水线(KG检索、LM分类、Web搜索)在FEVER基准上达到0.93 F1分数,无需微调,并有效处理信息不足情况。

Comments Paper has been accepted at 9th wiNLP workshop at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04890 2026-06-24 cs.CL 版本更新

Few shot chain-of-thought driven reasoning to prompt LLMs for open ended medical question answering

少样本思维链推理以提示LLMs进行开放式医学问答

Saeel Sandeep Nachane, Ojas Gramopadhye, Prateek Chanda, Ganesh Ramakrishnan, Kshitij Sharad Jadhav, Yatin Nandwani, Dinesh Raghu, Sachindra Joshi

机构 * IBM Research(IBM研究院) Indian Institute of Technology Bombay(印度理工学院孟买分校)

AI总结 提出MEDQA-OPEN数据集和CLINICR提示方法,通过思维链推理提升LLMs在开放式医学问答中的表现,并引入奖励模型进行答案验证。

Comments The paper is accepted in EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00658 2026-06-23 cs.CL cs.AI 版本更新

Sarc7: Evaluating Sarcasm Detection and Generation with Seven Types and Emotion-Informed Techniques

Sarc7: 基于七种类型和情感感知技术评估讽刺检测与生成

Raina Gao, Alyssa Jeong, Lang Xiong, Yicheng Fu, Sean O'Brien, Vasu Sharma, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

AI总结 提出Sarc7基准,将MUStARD数据集标注为七种讽刺类型,并通过零样本、少样本、思维链及新型情感提示技术进行分类评估,同时开发基于情感的生成方法,实验表明情感提示技术优于其他设置。

Comments Accepted to EMNLP WiNLP and COLM Melt, Solar, PragLM, and Origen

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13550 2026-06-23 cs.CL cs.AI 版本更新

Are LLMs Effective Negotiators? Systematic Evaluation of the Multifaceted Capabilities of LLMs in Negotiation Dialogues

LLMs 是有效的谈判者吗?LLMs 在谈判对话中多方面能力的系统评估

Deuksin Kwon, Emily Weiss, Tara Kulshrestha, Kushal Chawla, Gale M. Lucas, Jonathan Gratch

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校) Capital One

AI总结 系统评估大型语言模型在谈判中的多方面能力,发现 GPT-4 表现优异,但在主观评估和生成策略性响应方面存在挑战。

Comments Accepted to Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22376 2026-06-16 cs.IR cs.AI 版本更新

Closing the Auto-Research Loop: An AI Co-Scientist for Production Search Ranking

关闭自动研究循环:面向生产搜索排名的AI合作科学家

Liwei Wu, Cho-Jui Hsieh

机构 * Trip.com Group(Trip.com集团) UCLA(加州大学洛杉矶分校)

AI总结 提出AI合作科学家框架,通过LLM代理与云计算集成,自动迭代生成想法、实现代码、进行GPU实验并分析结果,在搜索排名任务中带来额外+0.083%离线增益。

Comments Submitted to EMNLP for review on June 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17104 2026-06-16 cs.AI cs.CL cs.LO 版本更新

Towards Advanced Mathematical Reasoning for LLMs via First-Order Logic Theorem Proving

迈向基于一阶逻辑定理证明的大语言模型高级数学推理

Chuxue Cao, Mengze Li, Juntao Dai, Jinluan Yang, Zijian Zhao, Shengyu Zhang, Weijie Shi, Chengzhong Liu, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 针对大语言模型在多步一阶逻辑数学推理中的困难,提出DREAM方法,通过公理驱动策略多样化和子命题错误反馈提升推理多样性和正确性,在定理证明数据集上性能提升0.6%-6.4%。

Comments Accepted by EMNLP 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14418 2026-06-16 cs.CL 版本更新

Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents

隐藏的幽灵之手:揭示MLLM驱动的移动GUI代理中的后门漏洞

Pengzhou Cheng, Haowen Hu, Zheng Wu, Zongru Wu, Tianjie Ju, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Huawei Inc.(华为公司)

AI总结 本研究提出AgentGhost框架,通过组合目标和交互层触发器,利用监督对比学习和微调注入后门,在移动GUI代理中实现高成功率和隐蔽性,攻击准确率达99.7%。

Comments EMNLP-Findings 2025 (Correcting model settings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14368 2026-06-16 cs.CR cs.CL 版本更新

From ASR to ASP: Evaluating Prompt Attack Vulnerabilities Against Open-Source LLMs

从ASR到ASP:评估针对开源大语言模型的提示攻击漏洞

Jiawen Wang, Pritha Gupta, Ivan Habernal, Eyke Hüllermeier, Xiaoxue Gao, Nancy F. Chen

机构 * LMU Munich(慕尼黑莱茵恩大学) RUB Bochum(波恩鲁姆大学) MCML A*STAR(新加坡科技研究局)

AI总结 提出攻击成功概率(ASP)指标,评估14个开源和3个闭源LLM对提示注入攻击的脆弱性,发现催眠攻击可达约90% ASP,忽略前缀攻击可突破所有开源模型。

Comments 8 pages, 2 figures, EMNLP 2026 under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01060 2026-06-09 cs.CL cs.AI cs.LG 版本更新

MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models

MENTIS: 对齐改变了什么信念?语言模型中多尺度潜在扭转的测量

Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani 去掉 Goa 的机构名,因为该机构名中包含 'Goa',但根据规则,如果机构已有常见中文名,使用常见中文名。'Pragya Lab, BITS Pilani' 是 BITS Pilani 的一个实验室,因此翻译为 'BITS Pilani 实验室') IIIT Delhi, India(德里印度理工学院) Amazon, USA(美国亚马逊) Meta, USA(美国Meta) Apple, USA(美国苹果)

AI总结 提出MENTIS框架,通过层间协方差扭转范数、谱扭转诊断和能量-辐射-激活度量,测量偏好对齐在语言模型内部计算中引起的选择性、深度局部的几何结构变化。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏