arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10296
2604.06091 2026-05-05 cs.CL cs.AI cs.MA

Social Dynamics as Critical Vulnerabilities that Undermine Objective Decision-Making in LLM Collectives

社交动态作为削弱LLM集体客观决策的脆弱性

Changgeon Ko, Jisu Shin, Hoyun Song, Huije Lee, Eui Jun Hwang, Jong C. Park

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 研究探讨了社交动态如何影响LLM集体中代表代理的决策准确性,发现社交压力增加时,代理性能显著下降,且修辞策略会影响判断。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03380 2026-05-05 cs.CL

Noise Steering for Controlled Text Generation: Improving Diversity and Reading-Level Fidelity in Arabic Educational Story Generation

噪声引导用于受控文本生成:在阿拉伯语教育故事生成中提高多样性与阅读水平的保真度

Haziq Mohammad Khalid, Salsabeel Shapsough, Imran Zualkernan

机构 * American University of Sharjah(阿联酋沙迦美国大学)

AI总结 本文探讨了噪声引导方法在生成阿拉伯语早期阅读评估故事中的应用,通过对比不同策略发现内部表示扰动比输出层面的随机性更适用于受约束的教育内容生成。

Comments Accepted to BEA @ ACL 26'

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05254 2026-05-05 cs.IR cs.CL

TagRAG: Tag-guided Hierarchical Knowledge Graph Retrieval-Augmented Generation

TagRAG:基于标签的分层知识图谱检索增强生成

Wenbiao Tao, Xinyuan Li, Yunshi Lan, Weining Qian

机构 * East China Normal University(东华师范大学)

AI总结 TagRAG通过构建标签知识图谱和标签引导的检索生成框架,提升小语言模型的全局推理能力和知识增量效率,实验显示其在多个领域数据集上表现优异。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09883 2026-05-05 cs.CL cs.LG

DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning

DELTA: 动态层感知令牌注意力机制用于高效的长上下文推理

Hossein Entezari Zarch, Lei Gao, Chaoyi Jiang, Murali Annavaram

机构 * University of Southern California(南加州大学)

AI总结 DELTA通过动态层感知令牌注意力机制提升长上下文推理效率,减少计算成本而不牺牲准确性,在AIME和GPQA-Diamond等基准上表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17677 2026-05-05 cs.AI

EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving

EngiBench:用于评估大型语言模型在工程问题解决上的基准

Xiyuan Zhou, Xinlei Wang, Yirui He, Yang Wu, Ruixi Zou, Yuheng Cheng, Yulu Xie, Wenxuan Liu, Huan Zhao, Yan Xu, Jinjin Gu, Junhua Zhao

机构 * Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) The University of Hong Kong(香港大学) Hong Kong Polytechnic University(香港理工大学) AIRS

AI总结 EngiBench是一个分层基准,用于评估大型语言模型在解决工程问题上的能力,涵盖基础知识检索、情境推理和开放性建模三个层次,揭示当前LLM在现实工程中仍缺乏高级推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19227 2026-05-05 cs.CL cs.AI cs.HC

Generative Interfaces for Language Models

生成式接口用于语言模型

Jiaqi Chen, Yanzhe Zhang, Yutong Zhang, Yijia Shao, Diyi Yang

机构 * Stanford University(斯坦福大学) Georgia Tech(佐治亚理工学院)

AI总结 本文提出生成式接口,通过主动生成用户界面提升多轮交互效率,实验表明其在人类偏好上提升达72%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12778 2026-05-05 cs.CL

HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language Tasks

HeteroRAG:一种用于医疗视觉语言任务的异构检索增强生成框架

Zhe Chen, Yusheng Liao, Zhiyuan Zhu, Haolin Li, Hongcheng Liu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出HeteroRAG框架,通过异构知识源增强医疗大视觉语言模型,解决异构数据检索问题,提升事实准确性与可靠性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02046 2026-05-05 cs.RO cs.LG

NaviMaster: Learning a Unified Policy for GUI and Embodied Navigation Tasks

NaviMaster: 学习GUI和具身导航任务的统一策略

Zhihao Luo, Wentao Yan, Jingyu Gong, Min Wang, Zhizhong Zhang, Xuhong Wang, Yuan Xie, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室) SenseTime Research(商汤科技研究院)

AI总结 本文提出NaviMaster,通过统一框架整合GUI导航和具身导航,采用视觉目标轨迹收集管道、统一强化学习框架和距离感知奖励,提升泛化能力。

Comments ACL 2026 Main Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10920 2026-05-05 cs.CL cs.LG

Constructing Interpretable Features from Compositional Neuron Groups

从组合神经元组中构建可解释特征

Or Shafran, Atticus Geiger, Mor Geva

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(特拉维夫大学Blavatnik计算机科学与人工智能学院)

AI总结 本文提出SNMF方法,通过半非负矩阵分解直接分解MLP激活,生成稀疏线性组合的可解释特征,并在多个模型上验证其在因果操控中的优越性。

Comments Accepted at ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03820 2026-05-05 cs.CL

Automatic Correction of Writing Anomalies in Hausa Texts

Hausa 文本中书写异常的自动纠正

Ahmad Mustapha Wali, Sergiu Nisioi

机构 * Human Language Technologies Research Center(人类语言技术研究中心) Faculty of Mathematics and Computer Science(数学与计算机科学学院) University of Bucharest(布加勒斯特大学)

AI总结 本文提出通过微调变压器模型自动纠正 Hausa 文本中的书写异常,构建了大规模噪声-清洁句子对数据集,并展示了 M2M100 等模型在提升下游任务中的效果。

Comments Accepted at ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00706 2026-05-04 cs.CL

FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios

FinSafetyBench:评估LLM在现实金融场景中的安全性

Yutao Hou, Yihan Jiang, Yuhan Xie, Jian Yang, Liwen Zhang, Hailiang Huang, Guanhua Chen, Yun Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北航) Southern University of Science and Technology(南方科技大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究重点实验室)

AI总结 本文提出FinSafetyBench,一个双语红队基准,用于测试LLM对违反金融合规请求的拒绝能力,揭示了对抗性提示绕过合规保障的关键漏洞及中文环境下更严重的易受攻击性。

Comments Accepted by Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00551 2026-05-04 cs.CL cs.AI

A11y-Compressor: A Framework for Enhancing the Efficiency of GUI Agent Observations through Visual Context Reconstruction and Redundancy Reduction

A11y-Compressor:通过视觉上下文重建和冗余减少提升GUI代理观察效率的框架

Michito Takeshita, Takuro Kawada, Takumi Ohashi, Shunsuke Kitada, Hitoshi Iyatomi

机构 * Hosei University(Hosei大学)

AI总结 本文提出A11y-Compressor框架,通过视觉上下文重建和冗余减少技术,将线性化可访问性树转换为紧凑结构化表示,实验表明其在OSWorld基准测试中将输入token减少至原22%,任务成功率提升5.1个百分点。

Comments 18 pages, 5 figures, 5 tables. Accepted to ACL SRW 2026. Project page: https://iyatomilab.github.io/a11y-compressor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00506 2026-05-04 cs.CL

Surprisal Minimisation over Goal-directed Alternatives Predicts Production Choice in Dialogue

基于目标导向替代的惊奇最小化预测对话中的产出选择

Tom Utting, Mario Giulianelli, Arabella Sinclair

机构 * University of Aberdeen(阿伯丁大学) University College London(伦敦大学学院)

AI总结 本文通过概率成本敏感选择模型,探讨对话中基于目标导向和上下文合理性的替代选择,发现基于目标导向替代的惊奇最小化在预测对话产出选择中表现最佳。

Comments 9 pages, to appear at ACL 2026 (Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00063 2026-05-04 cs.IR cs.AI

A Survey of Reasoning-Intensive Retrieval: Progress and Challenges

检索推理综述:进展与挑战

Yiyang Wei, Tingyu Song, Siyue Zhang, Yilun Zhao

机构 * Zhejiang University(浙江大学) University of the Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Yale University(耶鲁大学)

AI总结 本文综述了推理密集型检索领域,系统分析了现有基准,提出了结构化分类体系,并总结了挑战与未来方向。

Comments Accepted to the ACL 2026 Main Conference; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00022 2026-05-04 cs.CL cs.AI cs.SD

Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment

让人类优先:高效LAM评估的人类偏好对齐

Woody Haosheng Gan, William Held, Diyi Yang

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学) OpenAthena

AI总结 本文研究了如何通过最小子集高效评估LAM,发现50个样本即可达到高相关性,并通过回归模型提升预测效果,提出HUMANS基准作为高效评估代理。

Comments Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19098 2026-05-04 cs.CL cs.AI cs.LG

SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning

SAHM:阿拉伯语金融与伊斯兰合规推理的基准

Rania Elbadry, Sarfraz Ahmad, Ahmed Heakl, Dani Bouch, Momina Ahsan, Muhra AlMahri, Marwa Elsaid khalil, Yuxia Wang, Salem Lahlou, Sophia Ananiadou, Veselin Stoyanov, Jimin Huang, Xueqing Peng, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧赫里迪斯") The University of Manchester(曼彻斯特大学) The Fin AI(Fin AI)

AI总结 本文提出SAHM基准,涵盖七个任务,包含14380个专家验证实例,评估20个LLM发现阿拉伯语流畅性不等于金融推理能力,特别是在事件因果推理上存在显著差距。

Comments 29 page

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15949 2026-05-04 cs.CL

BanglaSocialBench: A Benchmark for Evaluating Sociopragmatic and Cultural Alignment of LLMs in Bangladeshi Social Interaction

BanglaSocialBench: 一个评估大语言模型在孟加拉社会互动中社会语用和文化对齐的基准

Tanvir Ahmed Sijan, S. M Golam Rifat, Pankaj Chowdhury Partha, Md. Tanjeed Islam, Md. Musfique Anwar

机构 * Jahangirnagar University(贾亨吉尔纳加尔大学) Rajshahi University of Engineering & Technology(拉贾沙希工程与技术大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

AI总结 本文提出BanglaSocialBench,通过情境依赖的语言使用评估孟加拉语的社会语用能力,发现当前LLM在文化对齐上存在系统性偏差。

Comments Accepted at ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05833 2026-05-04 cs.CL

Peek2: Regex-free Byte-level Byte-Pair Encoding Pretokenizer for LLM Inference on Edge Devices

Peek2:无需正则表达式的字节级字节对编码预分词器用于边缘设备上的大语言模型推理

Liu Zai, Iraklis Klampanos

机构 * University of Glasgow(格拉斯哥大学)

AI总结 Peek2是一种线性时间复杂度且内存消耗低的预分词算法,适用于边缘设备,提升了字节级BPE编码的吞吐量,且结果与基于正则表达式的分词器相同。

Comments 7 pages, 5 figures, accepted to ACL SRW 2026, for associated code, see https://github.com/omegacoleman/tokenizers_peek2 v2: updated to match accepted version in ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01020 2026-05-04 cs.AI cs.CL

Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics

用法律问题树准则评估法律推理轨迹

Jinu Lee, Kyoung-Woon On, Simeng Han, Arman Cohan, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) LBOX Stanford(斯坦福) Yale(耶鲁)

AI总结 本文提出 LEGIT 数据集,用于评估 LLM 在法律领域推理轨迹的质量,发现法律问题覆盖度和正确性影响 LLM 推理能力,RAG 和带准则的 RL 分别提升整体能力与正确性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10913 2026-05-04 cs.CL

ADVICE: Answer-Dependent Verbalized Confidence Estimation

ADVICE: 答案依赖性口头置信度估计

Ki Jung Seo, Sehun Lim, Taeuk Kim

机构 * Department of Computer Science, Hanyang University(韩国汉阳大学计算机科学系)

AI总结 本文提出ADVICE框架,通过增强答案依赖性改进大语言模型的置信度校准,减少过度自信现象,提升可信度。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07630 2026-05-04 cs.CL cs.AI cs.CV

InterChart: Benchmarking Visual Reasoning Across Decomposed and Distributed Chart Information

InterChart:跨分解与分布式图表信息的基准测试

Anirudh Iyengar Kaniyar Narayana Iyengar, Srija Mukhopadhyay, Adnan Qidwai, Shubhankar Singh, Dan Roth, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) IIIT, Hyderabad(海得拉巴印度理工学院) Mercer Mettl University(梅森-梅特尔大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 InterChart通过评估视觉语言模型在多图表间推理的能力,揭示了模型在复杂图表集成中的局限性,推动多模态推理的发展。

Comments 22 pages, 8 figures, 14 tables. Accepted at IJCNLP-AACL 2025

Journal ref Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics 2025, 2046-2067

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06698 2026-05-04 cs.CL

SCAN: Structured Capability Assessment and Navigation for LLMs

SCAN:面向大语言模型的结构化能力评估与导航

Zongqi Wang, Tianle Gu, Chen Gong, Xin Tian, Siqi Bao, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) School of Cyber Engineering, Xidian University(西安电子科技大学电子工程学院) Baidu, Inc(百度公司)

AI总结 本文提出SCAN框架,通过细粒度评估实现对LLM能力的深入分析,揭示了同一类别下不同子能力的显著性能差异,强调了细粒度评估的重要性。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28147 2026-05-01 cs.CL

On the Proper Treatment of Units in Surprisal Theory

关于在惊奇理论中正确处理单位的探讨

Samuel Kiegeland, Vésteinn Snæbjarnarson, Tim Vieira, Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院) University of Copenhagen(哥本哈根大学)

AI总结 本文探讨了在惊奇理论中正确处理语言单位的重要性,提出应明确区分单位定义与预测区域选择,并统一框架处理任意单位库。

Comments ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27934 2026-05-01 cs.AI cs.CL

MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection

MM-StanceDet:基于检索的多模态多智能体立场检测

Weihai Lu, Zhejun Zhao, Yanshu Li, Huan He

机构 * Peking University(北京大学) Baidu Inc(百度公司) Brown University(布朗大学) Amazon(亚马逊)

AI总结 本文提出MM-StanceDet框架,通过整合检索增强、多模态分析代理、辩论阶段和自我反思,解决多模态立场检测中的上下文 grounding、跨模态解释模糊和单次推理脆弱问题,实验表明其在五个数据集上优于现有方法。

Comments Accepted on ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27929 2026-05-01 cs.CL

DPN-LE: Dual Personality Neuron Localization and Editing for Large Language Models

DPN-LE: 大语言模型双人格神经元定位与编辑

Lifan Zheng, Xue Yang, Jiawei Chen, Chenyan Wu, Jingyuan Zhang, Fanheng Kong, Xinyi Zeng, Xiang Chen, Yu Tian

机构 * Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Zhejiang University of Technology(浙江工业大学) Kuaishou Technology(快手科技) Northeastern University(东北大学) Tsinghua University(清华大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 本文提出DPN-LE方法,通过对比高特质与低特质样本的MLP激活,定位并编辑双人格神经元,实现精准的人格控制与能力保留。

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27766 2026-05-01 cs.CL cs.AI

Instruction-Guided Poetry Generation in Arabic and Its Dialects

基于指令的阿拉伯语诗歌生成及其方言

Abdelrahman Sadallah, Kareem Elozeiri, Mervat Abassy, Rania Elbadry, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

AI总结 本文提出基于指令的阿拉伯语诗歌生成方法,通过构建大规模指令数据集,实现诗歌创作、修改和延续,并通过实验验证模型生成诗歌的能力。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10702 2026-05-01 cs.CL cs.AI cs.IR

Grounding Agent Memory in Contextual Intent

在上下文意图中 grounding 代理记忆

Ruozhen Yang, Yucheng Jiang, Yueqi Jiang, Priyanka Kargupta, Yunyi Zhang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

AI总结 STITCH通过上下文意图索引提升长周期交互的记忆检索能力,有效减少歧义和干扰,实现在动态目标轨迹中的高效检索。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08611 2026-05-01 cs.IR cs.AI cs.CV cs.MM

VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking

VeriTaS:首个动态多模态自动事实核查基准

Mark Rothermel, Marcus Kornmann, Marcus Rohrbach, Anna Rohrbach

机构 * Multimodal AI Lab(多模态AI实验室) Technical University of Darmstadt(达姆施塔特技术大学)

AI总结 为应对在线虚假信息的扩大规模,本文提出VeriTaS动态基准,通过自动化流程持续更新,涵盖104个专业机构的25000个真实声明,支持多模态事实核查评估。

Comments ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22099 2026-05-01 cs.LG cs.AI

Decomposed Trust: Privacy, Adversarial Robustness, Ethics, and Fairness in Low-Rank LLMs

分解信任:低秩大语言模型中的隐私、对抗鲁棒性、伦理与公平性

Daniel Agyei Asante, Md Mokarram Chowdhury, Yang Li

机构 * Department of Computer Science, Iowa State University, United States(爱荷华州立大学计算机科学系) Meta, United States(Meta)

AI总结 本文研究低秩因子化对大语言模型信任性的影响,发现其在隐私保护上有所保留,但会削弱对话中个人身份信息的保护,同时增强对抗鲁棒性,但伦理和公平性有所下降。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07180 2026-05-01 cs.CL cs.AI cs.CV

Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs

视频中的奉承:视频大语言模型中奉承行为的基准测试与分析

Wenrui Zhou, Mohamed Hendy, Shu Yang, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证负责任人工智能与数据 analytics 实验室) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学与技术大学) HKUST(香港科技大学) MBZUAI(穆罕默德·本·拉希德人工智能研究所) University of Science and Technology of China(中国科学技术大学) Kyungpook National University(庆尚国立大学)

AI总结 本文提出VISE基准,用于评估视频大语言模型在面对误导性输入时的奉承行为,通过多类型分析和两种无训练缓解策略提升模型可靠性。

Comments 27 Pages, Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏