arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

共收录 25
2608.10725 2026-08-12 cs.CV cs.SC 新提交

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

重新思考大语言模型验证:证据结构、不确定性与选择性优化

Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) Microsoft Research(微软研究院) SCB Dental College and Hospital(SCB牙科学院与医院)

AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。

Comments Findings Track at the Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09941 2026-08-12 cs.CL 新提交

The Multilingual Quantization Tax: Structural Collapse and Typological Fragility in Edge SLMs

多语言量化代价:边缘端小型语言模型(SLM)中的结构崩溃与类型学脆弱性

Mohammad Wathiq Soualhi

AI总结 本研究针对Gemma 4、Qwen 3.5架构开展4比特量化的零样本多语言评估,发现量化存在类型学脆弱性等四类现象,揭示了量化代价的多语言差异。

Comments Under review at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06171 2026-08-07 cs.CL 新提交

Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents

路由在最具价值处最不可学习:Web智能体的表示路由边界

Jiaming Wei, Zekun Wu, Adriano Koshiyama, Maria Perez-Ortiz

机构 * University College London(伦敦大学学院) Holistic AI

AI总结 该研究针对Web智能体的观察模式路由问题,发现路由在智能体最需处因标签不足而不可学,固定合适模式的效果优于多数路由策略,仅稀疏单元有例外。

Comments Preprint. Under review at the Second Workshop for Research on Agent Language Models (REALM), EMNLP 2026 (non-archival track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05643 2026-08-07 cs.AI cs.CL 新提交

Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning

过重采样优化:大语言模型推理的测试时自校正

Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Lena Trigg, Ali Subhan, Muhammad Ali, Dean F. Hougen

机构 * University of Oklahoma(俄克拉荷马大学) Stanford University(斯坦福大学) Universitat Pompeu Fabra(庞培法布拉大学) Air University(空军大学)

AI总结 本文提出无验证器的广度-深度优化框架,通过迭代自我批判与校正优化采样的 LLM 推理轨迹,在多个数学推理数据集及多款开放权重模型上,较基线方法实现了推理准确率的显著提升。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03446 2026-08-05 cs.CL 新提交

Predicting Multilingual Classification and Translation Performance of LLMs with Cross-Lingual Alignment $\unicode{x2013}$ Is English Enough?

用跨语言对齐性预测大语言模型的多语言分类与翻译性能——英语足够了吗?

Adnan Al Ali, Kathy Hämmerl, Jindřich Libovický, Alexander Fraser

AI总结 该研究对比分析27种跨语言对齐分数变体,提出基于PMI的翻译指标,发现用英语的跨语言对齐可相当或更好预测LLMs翻译性能,为LLMs以英语为内部枢纽语言提供新证据。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16621 2026-07-21 cs.CL 新提交

From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents

从记忆到技能:基于证据的长期大语言模型智能体协同进化治理

Bo Tang, Yang Zhang, Guomian Zhuang, Wenqiang Wei, Gaoyang Zheng, Lindong Xie, Yanchao Tan, Feiyu Xiong, Qingyu Yang, Edward Chung, Zhiyu li

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Polytechnic University(香港理工大学) Fuzhou University(福州大学) Xi’an Jiaotong University(西安交通大学)

AI总结 针对长期大语言模型智能体记忆系统问题,提出无需训练的MSCE框架,将经验组织为多种形式,把证据支持的策略转化为可调用技能,引入反射加权值回填,实验证明其性能优于基线,有跨域转移性和终身进化能力。

Comments Submitted into EMNLP'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07895 2026-07-10 cs.CL 新提交

Scalable and Culturally Specific Stereotype Dataset Construction via Human-LLM Collaboration

通过人机协作构建可扩展的特定文化刻板印象数据集

Weicheng Ma, John Guerrerio, Soroush Vosoughi

机构 * Dartmouth(达特茅斯学院)

AI总结 针对大语言模型刻板印象研究多集中于英语语境的问题,引入人机协作标注框架构建西班牙语刻板印象数据集EspanStereo,验证框架有效性,揭示各国刻板行为差异,该框架可扩展用于多语言,拓宽了刻板印象分析范围并奠定跨文化偏见评估基础。

Comments Weicheng Ma, John Guerrerio: equal contribution; published in EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05441 2026-07-08 cs.IR cs.AI 新提交

PORTS: Preference-Optimized Retrievers for Tool Selection with Large Language Models

PORTS:用于大语言模型工具选择的偏好优化检索器

Lorenzo Molfetta, Giacomo Frisoni, Nicolò Monaldini, Gianluca Moro

机构 * Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学)

AI总结 研究针对大语言模型工具选择中现有检索器与LLMs不一致问题,提出PORTS方法,利用受困惑度启发的偏好信号,通过优化相关性及施加对比语义损失微调检索器,经多实验验证其通用性及提高工具选择准确性的能力,且计算需求低便于推广。

Comments Please cite the definitive, peer-reviewed version of this article published in the Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, edited by Christos Christodoulopoulos et al., Association for Computational Linguistics, pp. 10007-10030, 2025. DOI: https://doi.org/10.18653/v1/2025.emnlp-main.507

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, Association for Computational Linguistics, pp. 10007-10030, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00274 2026-07-02 cs.CL cs.AI 新提交

SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework

SEFORA:学生论文反馈语料库及LLM反馈评估框架

Shayan Peyghambari Oskoui, Norah Almousa, Zhaoyi Joey Hou, Carolina Gustafson, Gayle Rogers, Raquel Coelho, Diane Litman, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学)

AI总结 为解决大规模写作反馈中缺乏真实课堂反馈语料和评估方法的问题,构建了SEFORA语料库和UniMatch评估框架,实验表明LLM生成的反馈与教师反馈一致性低(F1≤0.4)。

Comments Under review for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27314 2026-06-26 cs.CL 新提交

Beyond Surface Forms: A Comprehensive, Mechanism-Oriented Taxonomy of Indirect Linguistic Encoding for LLM-Based Coded Language Detection

超越表面形式:面向LLM的编码语言检测的全面、机制导向的间接语言编码分类法

Hamid Reza Firoozfar, Mohammadsadegh Abolhasani, Reza Mousavi, Paul Jen-Hwa Hu

AI总结 提出一种机制导向的间接语言表达分类法,通过抽象编码操作而非沟通目标,在LLM提示中集成后,在TikTok和Bluesky数据集上检测准确率提升4.7%,F1提升5.4%。

Comments Submitted for review in ARR for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25852 2026-06-25 cs.LG cs.AI 新提交

Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents

语义一致性策略优化:用于LLM智能体强化学习

Peng Xu, Sijia Chen, Junzhuo Li, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对基于组的强化学习中语义一致的中间步骤因轨迹成败获得相反信用的问题,提出无价值奖励塑造方法SCPO,通过从组内成功兄弟步骤恢复信用,在ALFWorld和WebShop上达到93.7%和74.8%的成功率。

Comments 16 pages, 7 figures, 5 tables. Under review at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23271 2026-06-23 cs.CL 新提交

Scaling LLM Knowledge Boundaries via Distribution-Optimized Synthesis

通过分布优化合成扩展LLM知识边界

Songze Li, Yarong Lan, Zhongpu Bo, Zhaoyang Wang, Zhiqiang Liu, Yuan Yuan, Chengtao Gan, Menghao Qian, Enpei Niu, Xiaoke Guo, Yuanxiang Liu, Zhaoyan Gong, Xiangjin Hu, Liangyurui Liu, Jingdian Lu, Lei Liang, Jun Zhou, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

AI总结 提出KDoS框架,通过知识密度驱动的三阶段反馈机制优化合成数据的知识分布,显著扩展LLM知识边界,并在多模型和多数据规模上验证了最优分布的稳定性和有效性。

Comments ACL ARR May (EMNLP 2026) Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22361 2026-06-23 cs.CL cs.AI 新提交

First-Token Broadcasters: Mechanistic Origins of Language Identity and Distributed Robustness in Transformers

首个令牌广播者:Transformer中语言身份与分布式鲁棒性的机制起源

Arjun Pillai, Christian Hoang, Anjelo Jann Laroza

机构 * Irvington High School(欧文顿高中) GenAI4E Mapua University(马普阿大学)

AI总结 通过因果干预方法LIHA,发现Transformer中少量注意力头(如GPT-2的L6H1)持续关注首个令牌并广播语言信号,且消融后补偿呈现层级前馈模式;指令微调将语言身份电路重组至早期层。

Comments Under review at BlackboxNLP (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22349 2026-06-23 cs.CL cs.HC 新提交

Curiosity as Linguistic Intervention: Using LLM Tutoring Dialogues to Influence Exploratory Learning Behavior

好奇心作为语言干预:利用LLM辅导对话影响探索性学习行为

Gevindu Ganganath, Pasindu Bolonghege, Qianru Lyu, Pradeep Varakantham, Thivya Kandappu

机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Human-Computer Interaction Institute, Carnegie Mellon University(卡内基梅隆大学人机交互研究所)

AI总结 提出CURIOBOT框架,通过LLM对话中的语言干预(新奇性、复杂性、冲突、不确定性)激发探索性学习行为,实验显示对话轮次增加2.4倍。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21453 2026-06-23 cs.HC cs.AI cs.SD eess.AS 新提交

CORTIS: Text-Only Adaptation of Spoken Language Models for Task-Oriented Voice Agents

CORTIS:面向任务型语音代理的纯文本口语语言模型适配

Youngwon Choi, Hyeonyu Kim, Taeyoun Kwon, Donghyuk Jung, Myeongkyun Cho

机构 * Maum AI Inc.(马姆人工智能公司) Seoul National University(首尔国立大学) Korea Culture Technology Institute(韩国文化科技研究所) KAIST(韩国科学技术院)

AI总结 提出CORTIS框架,通过纯文本任务监督微调口语语言模型,实现推理时直接生成结构化输出,无需配对语音-目标数据,在声学退化下优于级联方法。

Comments Submitted to EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19744 2026-06-19 cs.CL cs.AI cs.HC 新提交

Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings

超越统一遗忘:不同偏好设置下顺序直接偏好优化的研究

Pranav Bhandari, Nicolas Fay, Amitava Datta, Usman Naseem, Mehwish Nasim

机构 * Network Analysis and Social Influence Modelling (NASIM) Lab(网络分析与社会影响建模实验室) School of Physics Maths and Computing, The University of Western Australia(西澳大学物理数学与计算学院) School of Psychological Science, The University of Western Australia(西澳大学心理科学学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

AI总结 研究顺序DPO在不同偏好设置下的影响,发现遗忘模式并非统一,而是取决于目标关系、信号强度和训练顺序,并提出未来对齐流程应考虑目标兼容性。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19347 2026-06-19 cs.CL cs.AI cs.PL 新提交

How LLMs Fail and Generalize in RTL Coding for Hardware Design?

LLM在硬件设计的RTL编码中如何失败与泛化?

Guan-Ting Liu, Chao-Han Huck Yang, Chenhui Deng, Zhongzhi Yu, Brucek Khailany, Yu-Chiang Frank Wang

机构 * NVIDIA Research(英伟达研究院)

AI总结 提出基于问题可解性的错误分类法,揭示LLM在RTL编码中受限于预训练知识,对齐技术仅教会编译,而推理能力才是关键瓶颈。

Comments Preview, under submission for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17209 2026-06-17 cs.AI cs.IR 新提交

Beyond Parallel Sampling: Diverse Query Initialization for Agentic Search

超越并行采样:面向智能搜索的多样化查询初始化

Sidhaarth Murali, João Coelho, Jingjie Ning, João Magalhães, Bruno Martins, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Instituto Superior Técnico and INESC-ID, University of Lisbon(里斯本大学高等技术学院和INESC-ID) NOVA LINCS, NOVA School of Science and Technology(新里斯本大学科学与技术学院NOVA LINCS)

AI总结 针对智能搜索中的广度缩放,提出DivInit方法,通过在第一轮生成多样化查询而非独立采样,缓解查询冗余问题,在多跳问答任务中平均提升5-7个点。

Comments 15 pages, 8 figures; under review at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17174 2026-06-17 cs.CL cs.CY cs.MA 新提交

From Parasocial Scripts to Dyadic Persistence in Autonomous AI-Agent Communities

从准社会脚本到自主AI智能体社区中的二元持久性

Mohammadsadegh Abolhasani, Hamid Reza Firoozfar, Reza Mousavi, Paul Jen-Hwa Hu

机构 * University of Utah(犹他大学) University of Virginia(弗吉尼亚大学)

AI总结 研究自主AI智能体社区中是否存在准社会互动(PSI)线索,通过关键词匹配、少样本LLM标注等方法分析帖子与评论,发现PSI线索与OP再参与及互惠回复结构强相关,并通过二元持久性测试验证了互动层面的PSI脚本与重复二元模式的一致性。

Comments Submitted for review in ARR for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15161 2026-06-16 cs.CL 新提交

Beyond Layer Importance in Layer-wise Sparsity: An Inter-Layer Perturbation-Absorption Perspective

超越逐层稀疏中的层重要性:层间扰动吸收视角

Tao Jing, Ningxin Wu, Chen Kang, Dong Yu, Changliang Li, Pengyuan Liu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文通过受控扰动实验发现大语言模型中不同层对剪枝扰动的响应存在异质性,早期层放大扰动而中后期层吸收扰动,并基于此提出吸收感知校正方法,在70%稀疏度下降低困惑度7.13%并提升零样本准确率1.02%。

Comments 10 pages, 4 figures, 4 tables. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15144 2026-06-16 cs.CL cs.AI 新提交

PACUTE: Phonology-, Affix-, and Character-level Understanding of Tokens for Filipino

PACUTE: 面向菲律宾语的音韵、词缀和字符级词元理解

Jann Railey Montalan, David Demitri Africa, Jimson Paulo Layacan, Richell Isaiah Flores, Ivan Yuri De Leon, Lance Calvin Gamboa

机构 * AI Singapore(AI新加坡) Nanyang Technological University(南洋理工大学) UK AI Security Institute(英国人工智能安全研究所) Ateneo de Manila University(马尼拉雅典耀大学) University of Birmingham(伯明翰大学)

AI总结 提出PACUTE基准,包含4600个任务,通过六层诊断框架评估大语言模型在菲律宾语中的形态理解,发现开放权重模型在语素分解上接近随机,前沿模型在组合任务上远低于字符级上限。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14691 2026-06-15 cs.CL 新提交

CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

CORA: 通过一致性导向的推理对齐分析与弥合多模态RLVR中的思考-答案差距

Jiayue Cao, Zhicong Lu, Xuehan Sun, Wei Jia, Hongling Zheng, Changyuan Tian, Zichuan Lin, Wenqian Lv, Nayu Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Wuhan University(武汉大学) Tsinghua University(清华大学) Tianjin University(天津大学)

AI总结 本文分析多模态RLVR中思考与答案的语义不一致问题,提出CORA方法,通过轻量级一致性奖励模型引入语义一致性,并采用混合奖励优势分裂稳定优化,提升推理忠实度。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10400 2026-06-10 cs.CL cs.CV 新提交

Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark

视觉语言模型是看见还是猜测?通过措辞控制基准衡量和减少文本先验依赖

Pratham Singla, Shivank Garg, Vihan Singh, Paras Chopra

机构 * Lossfunk Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Raeth AI

AI总结 本文构建了540张图像的基准,通过为同一图像生成四种措辞变体,衡量视觉语言模型对文本先验的依赖,发现所有模型在最难变体上性能下降,开放模型下降最严重,并通过无图像消融等分析证实了真正的图像依赖。

Comments 17 pages, 7 figures, Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09435 2026-06-09 cs.CL 新提交

MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models

MUDIDI:一种基于语言模型的多语言词典数字化两阶段框架

David Setiawan, Temuulen Khishigsuren, Milind Agarwal, Pagnarith Pit, Aso Mahmudi, Ekaterina Vylomova

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) Melbourne School of Psychological Sciences, The University of Melbourne(墨尔本大学墨尔本心理科学学院) LILT

AI总结 提出MUDIDI两阶段框架,结合语言模型实现多语言词典数字化,在字符识别、标记保留和词条分割上优于现有OCR和视觉语言模型,并发布30本公共领域词典的标注数据集。

Comments 9 pages, preprint, submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08562 2026-06-09 cs.CL 新提交

Inside the LLM Word Factory

LLM单词工厂内部

Benzi Busigin, Yuval Pinter

机构 * Stein Faculty of Computer and Information Science(Stein计算机与信息科学学院)

AI总结 通过激活修补实验,定位Llama2-7B中英语去分词化过程为第1层的两阶段机制:注意力传递非最终子词的令牌特定信号,MLP将其与局部嵌入组合。该结构泛化至八族十二模型,但深度取决于位置编码类型。

Comments 17 pages, 12 figures. Under review at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏