arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10304
2604.17141 2026-04-22 cs.CL

SciImpact: A Multi-Dimensional, Multi-Field Benchmark for Scientific Impact Prediction

SciImpact:一个多维度、多领域的科学影响预测基准

Hangxiao Zhu, Yuyu Zhang, Ping Nie, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) Verdent AI University of Waterloo(滑铁卢大学)

AI总结 本文提出SciImpact基准,涵盖19个领域,通过整合异构数据源评估科学影响的多维度,验证了多任务监督微调对不同模型性能的影响。

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17072 2026-04-22 cs.MA

CogGen: A Cognitively Inspired Recursive Framework for Deep Research Report Generation

CogGen:一种受认知启发的递归框架用于深度研究报告生成

Kuo Tian, Pengfei Sun, Zhen Wu, Junran Ding, Xinyu Dai

AI总结 CogGen通过递归架构模拟认知写作,实现灵活规划与全局重构,引入抽象视觉表示和认知负荷评估框架,提升多模态内容生成质量。

Comments 28 pages, 3 figures, Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16937 2026-04-22 cs.CL

No One Fits All: From Fixed Prompting to Learned Routing in Multilingual LLMs

没有万能的方案:从固定提示到学习路由在多语言大语言模型中

Wei-Chi Wu, Sheng-Lun Wei, Hen-Hsen Huang, Hsin-Hsi Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University, Taiwan(国立台湾大学计算机科学与资讯工程学系) Institute of Information Science, Academia Sinica, Taiwan(台湾“中央研究院”信息科学研究所) AI Research Center (AINTU), National Taiwan University, Taiwan(国立台湾大学人工智能研究中心)

AI总结 研究评估了十种语言和四个基准的提示策略,发现无单一策略最优,提出学习路由方法提升多语言性能。

Comments Accepted as a short findings paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05090 2026-04-22 cs.CL cs.LG

Multilingual Language Models Encode Script Over Linguistic Structure

多语言语言模型编码脚本而非语言结构

Aastha A K Verma, Anwoy Chatterjee, Mehak Gupta, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里)

AI总结 研究揭示多语言模型通过表面形式而非语言结构组织表示,发现正字法影响显著,深层结构逐渐显现。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22608 2026-04-22 cs.AI cs.CL

Understanding LLM Performance Degradation in Multi-Instance Processing: The Roles of Instance Count and Context Length

理解多实例处理中LLM性能下降:实例数量和上下文长度的作用

Jingxuan Chen, Mohammad Taher Pilehvar, Jose Camacho-Collados

机构 * School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学学院)

AI总结 研究多实例处理中LLM性能下降的原因,发现实例数量和上下文长度均影响性能,但实例数量影响更显著。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14432 2026-04-22 cs.SD

Affectron: Emotional Speech Synthesis with Affective and Contextually Aligned Nonverbal Vocalizations

Affectron:基于情感和语境对齐的非语言语音生成

Deok-Hyeon Cho, Hyung-Seok Oh, Seung-Bin Kim, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)

AI总结 Affectron通过引入非语言语音增强训练策略和结构掩码技术,提升情感语音合成中非语言语音的多样性与自然性,同时保持语音流的自然性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01455 2026-04-22 cs.CV cs.AI cs.CL cs.IR cs.MM

From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents

从逐字到概要:基于语义信息瓶颈的金字塔多模态记忆压缩用于长视界视频智能体

Niu Lian, Yuting Wang, Hanshu Yao, Jinpeng Wang, Bin Chen, Yaowei Wang, Min Zhang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出MM-Mem架构,通过金字塔多模态记忆压缩,结合语义信息瓶颈目标,实现长视界视频理解中的高效记忆组织与任务相关信息保留。

Comments Accepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09642 2026-04-22 cs.CL cs.AI

MATA: Multi-Agent Framework for Reliable and Flexible Table Question Answering

MATA:用于可靠和灵活的表格问答的多智能体框架

Sieun Hyeon, Jusang Oh, Sunghwan Steve Cho, Jaeyoung Do

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目)

AI总结 MATA通过多智能体框架和小语言模型工具,提升表格问答的可靠性与灵活性,实验显示其在不同LLM上均取得最佳准确率和高效推理。

Comments Accepted to ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00758 2026-04-22 cs.CL cs.IR

Temporal Leakage in Search-Engine Date-Filtered Web Retrieval: A Retrospective Forecasting Case Study

搜索引擎日期过滤网页检索中的时间泄漏:一项回顾性预测案例研究

Ali El Lahib, Ying-Jieh Xia, Zehan Li, Yuxuan Wang, Xinyu Pi

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Chicago(芝加哥大学)

AI总结 研究发现搜索引擎日期过滤存在显著时间泄漏问题,导致预测准确性虚高,建议加强检索保障或使用时间戳快照进行评估。

Comments 9 pages, 2 figures. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18296 2026-04-22 cs.CL cs.AI cs.LG

Temp-R1: A Unified Autonomous Agent for Complex Temporal KGQA via Reverse Curriculum Reinforcement Learning

Temp-R1:通过反向课程强化学习实现复杂时间知识图谱问答的统一自主代理

Zhaoyan Gong, Zhiqiang Liu, Songze Li, Xiaoke Guo, Yuanxiang Liu, Xinle Deng, Zhizhen Liu, Lei Liang, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

AI总结 本文提出Temp-R1,首个通过强化学习训练的时间知识图谱问答自主代理,通过扩展动作空间和反向课程学习提升复杂问题的推理能力,在MultiTQ和TimelineKGQA上取得最佳性能。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15755 2026-04-22 cs.CL

Beyond Marginal Distributions: A Framework to Evaluate the Representativeness of Demographic-Aligned LLMs

超越边缘分布:评估与文化价值观对齐的大型语言模型代表性的框架

Tristan Williams, Franziska Weeber, Sebastian Padó, Alan Akbik

机构 * Humboldt University of Berlin(柏林洪堡大学) University of Stuttgart(斯图加特大学)

AI总结 本文提出评估对齐模型代表性的框架,通过多变量相关性模式和边缘分布相结合,比较两种模型引导技术,发现尽管细调模型更接近边缘分布,但提示方法在再现调查项目相关性结构上更优,但两者均未与人类相关性模式一致。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03512 2026-04-22 cs.SE cs.AI

Bootstrapping Code Translation with Weighted Multilanguage Exploration

通过加权多语言探索进行代码翻译的 bootstrap

Yuhan Wu, Huan Zhang, Wei Cheng, Chen Shen, Jingyue Yang, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) National Institute of Healthcare Data Science, Nanjing University, China(南京大学医疗数据科学国家研究院)

AI总结 本文提出BootTrans方法,通过利用测试套件的功能不变性和跨语言可移植性,解决代码翻译中平行数据稀缺和优化不平衡的问题,通过双池架构和语言感知加权机制提升多语言强化学习训练效果。

Comments Accepted in the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03066 2026-04-22 cs.CL cs.AI cs.LG

Do LLMs Encode Functional Importance of Reasoning Tokens?

大型语言模型是否编码了推理标记的功能重要性?

Janvijay Singh, Dilek Hakkani-Tür

机构 * Grainger College of Engineering(格雷格纳工程学院) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文研究了大型语言模型是否内部编码了推理标记的功能重要性,提出贪心剪枝方法,在保持模型似然的前提下剪除对答案生成影响最小的推理标记,验证了模型在压缩推理链时的功能重要性结构。

Comments Updated after ACL Main 2026 acceptance; 25 pages, 8 figures, 4 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02993 2026-04-22 cs.CL

Stable-RAG: Mitigating Retrieval-Permutation-Induced Hallucinations in Retrieval-Augmented Generation

Stable-RAG:缓解检索排列引起的幻觉

Qianchi Zhang, Hainan Zhang, Liang Pang, Hongwei Zheng, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) School of Artificial Intelligence, Beihang University(北航人工智能学院) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 Stable-RAG通过利用检索排列敏感性估计,缓解检索排列引起的幻觉,提升问答准确性与一致性。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22673 2026-04-22 cs.AI

Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks

超越行程规划——多轮和工具使用旅行任务的现实世界基准

Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院) National University of Singapore(新加坡国立大学) Beihang University(北航) AMAP, Alibaba Group(阿里云实验室)

AI总结 本文提出TravelBench,一个现实世界旅行规划基准,通过多轮对话和工具使用评估LLM的独立解决问题、隐含偏好获取和能力边界识别能力。

Comments Accepted to the ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20182 2026-04-22 cs.CL cs.AI

FaithLens: Detecting and Explaining Faithfulness Hallucination

FaithLens:检测并解释忠实性幻觉

Shuzheng Si, Qingyi Wang, Haozhe Zhao, Yuzhuo Bai, Guanqiao Chen, Kangyang Luo, Gang Chen, Fanchao Qi, Minjia Zhang, Baobao Chang, Maosong Sun

机构 * Tsinghua University(清华大学) DeepLang AI Fudan University(复旦大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Peking University(北京大学)

AI总结 本文提出FaithLens模型,通过合成训练数据和规则强化学习,有效检测并解释大语言模型中的忠实性幻觉,优于GPT-5.2和o3模型,提升可信度与效率。

Comments ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15907 2026-04-22 cs.CL

TabReX : Tabular Referenceless eXplainable Evaluation

TabReX : 不依赖参考的表格可解释性评估

Tejas Anvekar, Junha Park, Aparna Garimella, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究)

AI总结 TabReX 提出了一种不依赖参考的表格生成评估框架,通过图推理方法将源文本和生成表格转化为知识图谱,并计算可解释的评分,实现结构和事实的准确性评估。

Comments Accepted to ACL 2026 (Main Conference). Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07761 2026-04-22 cs.AI cs.LG

TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards

TROJail: 多轮对话中针对大语言模型的多轮攻击优化

Xiqiao Xiong, Ouxiang Li, Zhuo Liu, Moxin Li, Wentao Shi, Fengbin Zhu, Qifan Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meta AI

AI总结 本文提出TROJail,通过多轮强化学习优化攻击策略,引入过程奖励提升攻击成功率,实验显示在多个模型和基准上效果显著。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06380 2026-04-22 cs.SD cs.AI

Protecting Bystander Privacy via Selective Hearing in Audio LLMs

通过选择性聆听保护旁观者隐私

Xiao Zhan, Guangzhi Sun, Jose Such, Phil Woodland

机构 * VRAIN, Universitat Politècnica de València(VRAIN,瓦伦西亚理工大学) Department of Engineering, University of Cambridge(剑桥大学工程系) INGENIO (CSIC-Universitat Politècnica de València)(INGENIO(CSIC-瓦伦西亚理工大学))

AI总结 本文提出SH-Bench基准和BPFT训练方法,评估音频大语言模型的选择性聆听能力,发现现有模型存在旁观者隐私泄露问题,BPFT显著提升隐私保护效果。

Comments To Appear at ACL 2026 main conference; Dataset: https://huggingface.co/datasets/BrianatCambridge/SelectiveHearingBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06168 2026-04-22 cs.AI

Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models

思维链作为镜像:评估大语言模型与人类偏好之间结构化推理的对齐

Boxuan Wang, Zhuoyun Li, Xinmiao Huang, Xiaowei Huang, Yi Dong

机构 * School of Computer Science and Informatics, University of Liverpool, United Kingdom(利物浦大学计算机科学与信息学学院)

AI总结 本文提出一种量化评估大语言模型多步结构化推理与人类偏好对齐的方法,引入对齐分数指标,通过构建基于语义熵的矩阵比较模型生成的思维链与人类偏好参考,发现对齐分数在2步推理时达到峰值,支持其作为诊断信号。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27052 2026-04-22 cs.CL

VISTA: Verification In Sequential Turn-based Assessment

VISTA:基于顺序回合评估的验证

Ashley Lewis, Andrew Perrault, Eric Fosler-Lussier, Michael White

机构 * The Ohio State University(俄亥俄州立大学)

AI总结 VISTA通过声明级验证和顺序一致性追踪评估对话事实性,提升多轮对话中幻觉检测效果,改进现有基准测试的一致性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18333 2026-04-22 cs.CR cs.CL

Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption

位置:LLM水印应使所有相关方的利益一致以实现实际应用

Yepeng Liu, Xuandong Zhao, Dawn Song, Gregory W. Wornell, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) UC Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文探讨了LLM水印技术中利益相关方激励不一致的问题,提出通过设计激励一致的水印方法,如上下文水印,来解决实际应用中的障碍,强调在特定领域内实现可靠工具的重要性。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05608 2026-04-22 cs.CL

A Goal Without a Plan Is Just a Wish: Efficient and Effective Global Planner Training for Long-Horizon Agent Tasks

没有计划的愿望只是愿望:为长周期智能体任务高效且有效的全局规划器训练

Shuzheng Si, Haozhe Zhao, Kangyang Luo, Gang Chen, Fanchao Qi, Minjia Zhang, Baobao Chang, Maosong Sun

机构 * Tsinghua University(清华大学) Peking University(北京大学) DeepLang AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出EAGLET方法,通过两步流程训练高效规划器,提升智能体规划能力,实验显示其在长周期任务中优于现有方法,且训练成本降低8倍。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03828 2026-04-22 cs.LG stat.ML

IMPACT: Importance-Aware Activation Space Reconstruction

IMPACT: 基于重要性的激活空间重建

Md Mokarram Chowdhury, Daniel Agyei Asante, Ernie Chang, Yang Li

机构 * Department of Computer Science, Iowa State University, United States(爱荷华州立大学计算机科学系) Meta, United States(Meta公司)

AI总结 本文提出IMPACT框架,通过结合激活结构与梯度重要性,实现低秩压缩优化,实验显示在保持准确性的同时,模型大小可减少55.4%。

Comments To appear in the Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00642 2026-04-22 cs.AR

ChatHLS: Towards Systematic Design Automation and Optimization for High-Level Synthesis

ChatHLS: 面向高阶综合的系统化设计自动化与优化

Runkai Li, Jia Xiong, Xiuyuan He, Jieru Zhao, Jiaqi Lv, Haowen Fang, Lei Qi, Xi Wang

AI总结 ChatHLS通过多智能体框架实现高阶综合的自动化调试与指令优化,提升硬件开发效率。

Comments Accepted by ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22176 2026-04-22 cs.CL

TabXEval: Why this is a Bad Table? An eXhaustive Rubric for Table Evaluation

TabXEval:为什么这是一个糟糕的表格?一个全面的表格评估准则

Vihang Pancholi, Jainit Bafna, Tejas Anvekar, Manish Shrivastava, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) IIIT Hyderabad(海得拉巴IIIT)

AI总结 本文提出TabXEval框架,通过结构对齐和语义比较实现精确表格评估,通过TabXBench验证其鲁棒性和可解释性。

Comments Accepeted for Findings at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21242 2026-04-22 cs.CL

Evaluation of LLMs in Medical Text Summarization: The Role of Vocabulary Adaptation in High OOV Settings

评估LLMs在医学文本摘要中的表现:词汇适应在高OOV设置中的作用

Gunjan Balde, Soumyadeep Roy, Mainack Mondal, Niloy Ganguly

机构 * Indian Institute of Technology Kharagpur(印度理工学院克哈格布尔分校)

AI总结 本文评估了LLMs在医学文本摘要中的表现,发现词汇适应能有效缓解高OOV数据点带来的性能下降问题,并通过实验验证了词汇适应对医疗领域定制化的重要性。

Comments 16 pages. Accepted for publication in the Findings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16968 2026-04-22 cs.AR cs.AI cs.CL cs.LG cs.PL

CASS: Nvidia to AMD Transpilation with Data, Models, and Benchmark

CASS:Nvidia到AMD的跨架构代码转换:数据、模型和基准

Ahmed Heakl, Gustavo Bertolo Stahl, Sarim Hashmi, Seung Hun Eddie Han, Mukul Ranjan, Arina Kharlamova, Salman Khan, Abdulrahman Mahmoud

机构 * MBZUAI Australian National University(澳大利亚国立大学)

AI总结 CASS是首个用于GPU代码转换的数据库和模型集,通过6万对验证的主机-设备代码实现跨ISA和运行时边界的学习转换,其模型在CUDA到HIP和SASS到RDNA3转换中准确率分别达88.2%和69.1%,超越商业基线。

Comments 20 pages, 11 figures, 5 tables

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18563 2026-04-21 cs.CL

Dual Alignment Between Language Model Layers and Human Sentence Processing

语言模型层与人类句子加工的双重对齐

Tatsuki Kuribayashi, Alex Warstadt, Yohei Oseki, Ethan Gotlieb Wilcox

机构 * MBZUAI Tohoku University(东北大学) UC San Diego(南加州大学) The University of Tokyo(东京大学) Georgetown University(乔治城大学)

AI总结 研究探讨了语言模型内部层在处理语法歧义时对人类认知努力的估计能力,发现后期层更准确但仍低估人类数据,揭示了人类与语言模型在句子加工中的不同模式。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18539 2026-04-21 cs.CL cs.AI

Transition-Matrix Regularization for Next Dialogue Act Prediction in Counselling Conversations

对话动作预测中的转移矩阵正则化:在咨询对话中的应用

Eric Rudolph, Philipp Steigerwald, Jens Albrecht

机构 * Technische Hochschule Nürnberg(纽伦堡技术大学)

AI总结 本文通过KL正则化使对话动作预测与转移模式对齐,在德国咨询分类中提升宏F1分数9-42%,并验证其跨语言和领域泛化能力,尤其在数据稀少任务中表现突出。

Comments Accepted as ACL findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏