arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-04-14 至 2026-04-14 共收录 81
2507.03336 2026-04-14 cs.AI cs.CL cs.LG

Disambiguation-Centric Finetuning Makes Enterprise Tool-Calling LLMs More Realistic and Less Risky

以消歧为核心的知识蒸馏使企业工具调用LLM更真实且更安全

Ashutosh Hathidara, Julien Yu, Sebastian Schreiber

机构 * SAP Labs(SAP实验室)

AI总结 本文提出DiaFORGE框架,通过三阶段流程提升企业工具调用LLM的准确性和安全性,实验显示其在工具调用成功率上优于GPT-4o和Claude-3.5-Sonnet。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07523 2026-04-14 cs.CL

Aligning What LLMs Do and Say: Towards Self-Consistent Explanations

对LLMs的行为与说法进行对齐:迈向自洽的解释

Sahar Admoni, Ofra Amir, Assaf Hallak, Yftah Ziser

机构 * Technion – Israel Institute of Technology(以色列理工学院) Nvidia Research(英伟达研究院) University of Groningen(格罗宁根大学)

AI总结 研究通过比较回答与解释的特征重要性分布,发现后验自一致性银行(PSCB)能更可靠地体现模型决策与解释的一致性,应用DPO优化提升对齐性而不影响任务精度。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21380 2026-04-14 cs.CL

Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models

挑战推理的边界:为大语言模型设计的奥林匹克级数学基准

Haoxiang Sun, Yingqian Min, Zhipeng Chen, Wayne Xin Zhao, Ji-Rong Wen

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

AI总结 OlymMATH是一个包含350道题的奥林匹克级数学基准,通过自然语言和形式验证两种方式评估大语言模型,揭示语言间性能差异及模型推理不足问题。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13166 2026-04-14 quant-ph cs.AI cs.CL cs.LG

Large Language Models Can Help Mitigate Barren Plateaus in Quantum Neural Networks

大型语言模型有助于缓解量子神经网络中的 barren plateaus

Jun Zhuang, Chaowen Guan

机构 * Boise State University(博伊西州立大学) University of Cincinnati(辛辛那提大学)

AI总结 本文提出AdaInit框架,利用具有亚鞅性质的大语言模型迭代合成量子神经网络的初始参数,以维持梯度方差,缓解 barren plateaus 问题。

Comments [ACL'26 Findings] TL;DR: We propose a new LLM-driven submartingale-based framework that adaptively generates effective initial parameters for quantum neural networks to mitigate barren plateaus by leveraging LLMs with the submartingale property

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05572 2026-04-14 cs.IR

Why These Documents? Explainable Generative Retrieval with Hierarchical Category Paths

为何这些文档?基于层次类别路径的可解释生成检索

Sangam Lee, Ryang Heo, SeongKu Kang, Susik Yoon, Jinyoung Yeo, Dongha Lee

AI总结 HyPE通过生成层次类别路径提升生成检索的可解释性,通过外部高质量语义层级构建路径并优化模型,提高检索性能和解释性。

Comments Accepted to ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10953 2026-04-14 cs.CL

A Multilingual Dataset and Empirical Validation for the Mutual Reinforcement Effect in Information Extraction

一种多语言数据集和信息提取中相互强化效应的实证验证

Chengguang Gan, Sunbowen Lee, Qingyu Yin, Yunhao Liang, Xinyang He, Hanjun Wei, Younghun Lim, Shijian Wang, Hexiang Huang, Qinghao Zhang, Shiwen Ni, Tatsunori Mori

机构 * Yokohama National University(横滨国立大学) Shenzhen University of Advanced Technology(深圳理工大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Chengdu Institute of Computer Applications, Chinese Academy of Sciences(中国科学院成都计算机应用研究所) Southeast University(东南大学) University of Tsukuba(筑波大学) Pusan National University(釜山大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 本文提出多语言MRE混合数据集,通过LLM辅助框架减少标注工作,验证了多语言环境下信息提取中相互强化效应的普遍性。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01139 2026-04-14 cs.CV cs.AI cs.CL cs.LG

SCITUNE: Aligning Large Language Models with Human-Curated Scientific Multimodal Instructions

SCITUNE:对齐大型语言模型与人类整理的科学多模态指令

Sameera Horawalavithana, Sai Munikoti, Ian Stewart, Henry Kvinge, Karl Pazdernik

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

AI总结 SCITUNE通过多模态指令提升大语言模型在科学任务中的表现,优于现有模型并在ScienceQA基准上超越人类性能。

Comments In Proceedings of the 1st Workshop on NLP for Science, Association for Computational Linguistics

Journal ref Proc. 1st Workshop on Natural Language Processing for Science (NLP4Science 2024) (2024) 58-72

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14299 2026-04-14 cs.CL cs.AI

Template-assisted Contrastive Learning of Task-oriented Dialogue Sentence Embeddings

基于模板的对话句嵌入对比学习

Minsik Oh, Jiwei Li, Guoyin Wang

机构 * Stanford University(斯坦福大学) Zhejiang University(浙江大学) Alibaba Qwen Pilot(阿里巴巴Qwen Pilot)

AI总结 本文提出TaDSE方法,利用模板信息通过自监督对比学习学习对话句嵌入,通过合成数据集增强效果,并在五个对话基准数据集上验证了其有效性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10299 2026-04-14 cs.CV cs.CL

Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking

见善不为:通过对抗性注意力劫持使大视觉-语言模型失明以确保安全

Jingru Li, Wei Ren, Tianqing Zhu

机构 * China University of Geosciences, Wuhan(中国地质大学(武汉)) City University of Macau(澳门城市大学)

AI总结 本文提出Attention-Guided Visual Jailbreaking方法,通过操控注意力模式规避安全对齐机制,减少梯度冲突并提高攻击成功率,揭示了安全失明的失败模式。

Comments Accepted to ACL 2026. Code: https://github.com/Landsayy/AttentionJailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10189 2026-04-14 cs.CL

FAITH: Factuality Alignment through Integrating Trustworthiness and Honestness

FAITH:通过整合可信度和诚实度实现事实一致性

Xiaoning Dong, Chengyan Wu, Yajie Wen, Yu Chen, Yun Xue, Jing Zhang, Wei Xu, Bolei Ma

机构 * Tsinghua University, Institute for Interdisciplinary Information Sciences(清华大学,交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院) South China Normal University, School of Electronic Science and Engineering(华南师范大学,电子科学与工程学院) Guangzhou Richstone Data Technologies Co., Ltd.(广州瑞驰数据技术有限公司) LMU Munich & Munich Center for Machine Learning(慕尼黑大学 & 慕尼黑机器学习中心)

AI总结 FAITH通过整合可信度和诚实度信号,提升大语言模型的事实准确性。采用PPO算法优化奖励函数,并结合检索增强模块增强内外知识一致性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10150 2026-04-14 cs.AI cs.CL

Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration

从空缺中学习:通过内容无关概率校准去偏列表重排序

Hang Lv, Hongchao Gu, Ruiqing Yang, Liangyue Li, Zulong Chen, Defu Lian, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出CapCal框架,通过内容无关的概率校准方法,解决列表重排序中的位置偏差问题,提升轻量模型性能。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10071 2026-04-14 cs.CV

Spotlight and Shadow: Attention-Guided Dual-Anchor Introspective Decoding for MLLM Hallucination Mitigation

聚光与阴影:基于注意力的双锚点反思解码用于MLLM幻觉缓解

Yebo Wu, Han Jin, Zhijiang Guo, Li Li

机构 * State Key Laboratory of IOTSC, University of Macau(澳门大学物联网国家重点实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出双锚点反思解码框架DaID,通过动态校准每个token生成来缓解MLLM幻觉,利用视觉注意力分布指导双锚点选择,提升推理能力。

Comments Accepted for Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10031 2026-04-14 cs.CL cs.AI

CoSToM:Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models

CoSToM: 为大语言模型内在理论思维对齐的因果导向引导

Mengfan Li, Xuanhua Shi, Yang Deng

机构 * National Engineering Research Center for Big Data Technology and System, Services Computing Technology and System Lab, Cluster and Grid Computing Lab, Huazhong University of Science and Technology(华中科技大学国家大数据技术与系统工程技术研究中心、服务计算技术与系统实验室、集群与网格计算实验室) Singapore Management University(新加坡管理大学)

AI总结 本文提出CoSToM框架,通过因果追踪和激活引导提升大语言模型的社会推理能力与对话质量。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09721 2026-04-14 cs.IR cs.MM cs.SD

Jamendo-MT-QA: A Benchmark for Multi-Track Comparative Music Question Answering

Jamendo-MT-QA:多轨比较音乐问答基准测试

Junyoung Koh, Jaeyun Lee, Soo Yong Kim, Gyu Hyeong Choi, Jung In Koh, Jordan Phillips, Yeonjin Lee, Min Song

机构 * Yonsei University(延世大学) KRAFTON University of Oxford(牛津大学) George Mason University(乔治梅森大学) Sungkyul University(圣洁大学) MODULABS MAAP Onoma AI

AI总结 本文提出Jamendo-MT-QA基准测试,用于评估多轨比较音乐问答能力,基于Jamendo-QA数据集构建36519个比较问答项,采用LLM辅助生成和过滤问题,并通过自动指标和LLM-as-a-Judge评估模型性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09624 2026-04-14 cs.CL cs.LG

Self-Calibrating Language Models via Test-Time Discriminative Distillation

通过测试时判别蒸馏实现自校准语言模型

Mohamed Rissal Hedna, Jan Strich, Martin Semmann, Chris Biemann

AI总结 本文提出SECL方法,利用模型在回答正确性问题时的真实概率与声明置信度之间的差距进行无监督训练,有效降低校准误差,优于现有方法。

Comments Submitted to ACL March 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24251 2026-04-14 cs.SI

GRAPHIA: Harnessing Social Graph Data to Enhance LLM-Based Social Simulation

GRAPHIA:利用社交图数据增强基于LLM的社会模拟

Jiarui Ji, Zehua Zhang, Zhewei Wei, Bin Tong, Guan Wang, Bo Zheng

AI总结 GRAPHIA通过强化学习利用社交图数据作为LLM训练的监督信号,提升社会模拟的微观和宏观对齐效果,实验显示其在多个真实网络中显著提高预测精度和社会现象复制能力。

Comments accepted by ACL26 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06965 2026-04-14 cs.CL cs.AI

EDUMATH: Generating Standards-aligned Educational Math Word Problems

EDUMATH: 生成符合标准的教育数学应用题

Bryan R. Christ, Penelope Molitz, Beau LeBlond, Zachary Gottesman, Jonathan Kropko, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

AI总结 本文提出利用大语言模型生成符合学生兴趣和数学标准的数学应用题,通过教师标注数据集训练模型,展示其在教育中的有效性。

Comments 33 pages, 16 figures ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24778 2026-04-14 cs.CL

Revisiting Epistemic Markers in Confidence Estimation: Can Markers Accurately Reflect Large Language Models' Uncertainty?

重新审视置信度标记在置信度估计中的作用:标记能否准确反映大语言模型的不确定性?

Jiayu Liu, Qing Zong, Weiqi Wang, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)

AI总结 研究探讨了大语言模型中置信度标记是否能准确反映其不确定性,通过多数据集评估发现标记在同分布下表现稳定,但异分布下存在不一致,质疑了置信度标记的可靠性。

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13987 2026-04-14 cs.CL

RiTeK: A Dataset for Large Language Models Complex Reasoning over Textual Knowledge Graphs in Medicine

RiTeK:一个用于大型语言模型在医学领域文本知识图谱上复杂推理的数据集

Jiatan Huang, Mingchen Li, Zonghai Yao, Dawei Li, Yuxin Zhang, Zhichao Yang, Yongkang Xiao, Feiyun Ouyang, Xiaohan Li, Shuo Han, Hong Yu

机构 * University of Connecticut(康涅狄格大学) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) School of Computing, and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) UMass Chan Medical School(马萨诸塞大学陈医学院) University of Minnesota(明尼苏达大学) Rollins School of Public Health, Emory University(埃默里大学罗林斯公共卫生学院) Optum AI University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校)

AI总结 本文提出RiTeK数据集,用于评估大型语言模型在医学领域文本知识图谱上的复杂推理能力,通过合成高质量查询和专家评估,揭示现有检索方法的不足。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13621 2026-04-14 cs.CL cs.CV cs.LG

LaMI: Augmenting Large Language Models via Late Multi-Image Fusion

LaMI:通过晚期多图像融合增强大型语言模型

Guy Yariv, Idan Schwartz, Yossi Adi, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Bar-Ilan University(巴伊兰大学)

AI总结 LaMI通过在测试时融合多个图像提升视觉常识推理能力,同时保持文本推理性能,适用于视觉和NLP任务。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11290 2026-04-14 cs.IR cs.AI cs.CL cs.LG

An Iterative Utility Judgment Framework Inspired by Philosophical Relevance via LLMs

一种受哲学相关性启发的迭代效用判断框架

Hengran Zhang, Keping Bi, Jiafeng Guo, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出ITEM框架,通过迭代提升信息检索中相关性排序、效用判断和答案生成的性能,实验表明在多个数据集上均优于基线模型。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏