arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-04-17 至 2026-04-17 共收录 72
2604.15294 2026-04-17 cs.AI

How Do LLMs and VLMs Understand Viewpoint Rotation Without Vision? An Interpretability Study

大语言模型和视觉语言模型如何在没有视觉信息的情况下理解视角旋转?一项可解释性研究

Zhen Yang, Ping Jian, Zhongbin Guo, Zuming Zhang, Chengzhi Li, Yonghong Deng, Xinyue Zhang, Wenpeng Lu

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算功率网络与信息安全部重点实验室,山东计算机科学中心(济南国家超级计算中心),齐鲁工业大学(山东省科学院))

AI总结 本文研究了在无视觉信息情况下,大语言模型和视觉语言模型理解视角旋转的能力,发现两者表现不佳,而人类可达到100%准确率,揭示了模型与空间智能需求之间的差距。

Comments Published as a main-conference paper at The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15203 2026-04-17 cs.CL

MADE: A Living Benchmark for Multi-Label Text Classification with Uncertainty Quantification of Medical Device Adverse Events

MADE:一个多标签文本分类的活体基准,用于具有不确定性量化的医疗设备不良事件

Raunak Agarwal, Markus Wenzel, Simon Baur, Jonas Zimmer, George Harvey, Jackie Ma

机构 * Department of Artificial Intelligence(人工智能系) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫茨研究所) Berlin(柏林)

AI总结 本文提出MADE基准,用于多标签文本分类,通过持续更新医疗设备不良事件报告,避免训练数据污染,评估不同模型在不确定性量化中的表现。

Comments Accepted at ACL 2026 Mains

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15022 2026-04-17 cs.CR cs.AI cs.CL cs.LG

Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization

通往罗马的攻击:通过对抗性后缀优化引导LLM路由器选择昂贵模型

Haochun Tang, Yuliang Yan, Jiahua Lu, Huaxiao Liu, Enyan Dai

机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering, MoE, Jilin University(符号计算与知识工程重点实验室,MoE,吉林大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出R$^2$A方法,通过对抗性后缀优化误导黑盒LLM路由器选择昂贵模型,解决现有攻击在黑盒场景下的不足。

Journal ref ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14970 2026-04-17 cs.CL

Explain the Flag: Contextualizing Hate Speech Beyond Censorship

解释旗帜:超越审查的仇恨言论语境化

Jason Liartis, Eirini Kaldeli, Lambrini Gyftokosta, Eleftherios Chelioudakis, Orfeas Menis Mastromichalakis

机构 * National Technical University of Athens(国家技术大学雅典) Datoptron Homo Digitalis University of the Aegean(爱琴海大学) Instituto de Telecomunicações(电信研究所)

AI总结 本文提出一种结合大语言模型和新编词汇的混合方法,用于检测并解释英语、法语和希腊语中的仇恨言论,提升透明度和可问责性。

Comments Accepted in the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14956 2026-04-17 cs.MA

FedGUI: Benchmarking Federated GUI Agents across Heterogeneous Platforms, Devices, and Operating Systems

FedGUI:在异构平台、设备和操作系统上基准测试联邦GUI代理

Wenhao Wang, Haoting Shi, Mengying Yuan, Yiquan Lin, Panrong Tong, Hanzhang Zhou, Guangyi Liu, Pengxiang Zhao, Yue Wang, Siheng Chen

AI总结 FedGUI通过六个定制数据集系统研究跨平台、跨设备、跨操作系统和跨源的异质性,揭示跨平台协作提升性能及平台和操作系统对性能的影响,为构建更可扩展和隐私保护的GUI代理提供基础。

Comments ACL 2026 Findings, Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11502 2026-04-17 cs.CL cs.AI

METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models

METER:评估大型语言模型中的多级上下文因果推理

Pengfeng Li, Chen Huang, Chaoqun Hao, Hongyao Chen, Xiao-Yong Wei, Wenqiang Lei, See-Kiong Ng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, China(中国教育部机器学习与产业智能工程研究中心)

AI总结 本文提出METER基准,系统评估大型语言模型在因果阶梯的三个层级上的表现,发现随着任务层级升高,模型能力显著下降,揭示了模型在因果推理中的两大失效模式。

Comments ACL 2026. Our code and dataset are available at https://github.com/SCUNLP/METER

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10120 2026-04-17 cs.MA cs.AI cs.CL

TopoDIM: One-shot Topology Generation of Diverse Interaction Modes for Multi-Agent Systems

TopoDIM:多智能体系统中多样化交互模式的一键拓扑生成

Rui Sun, Jie Ding, Chenghua Gong, Tianjun Gu, Yihang Jiang, Juyuan Zhang, Liming Pan, Linyuan Lü

机构 * University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学)

AI总结 TopoDIM通过一键生成拓扑结构,实现多智能体系统中多样化交互模式,提升任务性能和token效率,实验表明其在token消耗和性能提升方面优于现有方法。

Comments ACL Findings Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07667 2026-04-17 cs.CL cs.AI cs.LG

Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference

针对LLM推理中分层令牌剪枝的自适应层选择

Rei Taniguchi, Yuyang Dong, Makoto Onizuka, Chuan Xiao

机构 * NEC Corporation(日本电报电话株式会社) Osaka University(大阪大学) Nagoya University(名古屋大学)

AI总结 本文提出ASL方法,通过自适应选择KV缓存中的层,平衡不同任务性能并满足KV预算要求,优于现有分层令牌剪枝方法。

Comments ACL 2026 Findings. Source code available at https://github.com/TANIGUCHIREI/ASL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06559 2026-04-17 cs.CV

ArrowGEV: Grounding Events in Video via Learning the Arrow of Time

ArrowGEV:通过学习时间之箭来视频中接地事件

Fangxu Yu, Ziyao Lu, Liqiang Niu, Fandong Meng, Jie Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院,中国) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院,中国)

AI总结 本文提出ArrowGEV框架,通过学习时间方向性提升视频中事件接地与时间理解能力,通过区分时间敏感和时间不敏感事件增强模型鲁棒性与泛化能力。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14509 2026-04-17 cs.SE cs.AI cs.CL

E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task

E2EDev:端到端软件开发任务中大语言模型的基准测试

Jingyao Liu, Chen Huang, Zhizhao Guan, Wenqiang Lei, Yang Deng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) CHAT NLP Group, Singapore Management University(新加坡国立管理大学CHAT NLP组) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, China(教育部长机器学习与产业智能工程研究中心)

AI总结 本文提出E2EDev基准,基于行为驱动开发原则,通过模拟真实用户交互评估端到端软件开发框架的能力,揭示现有方法在解决复杂任务中的不足。

Comments Accepted to ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07890 2026-04-17 cs.CL

Standard-to-Dialect Transfer Trends Differ across Text and Speech: A Case Study on Intent and Topic Classification in German Dialects

标准到方言的转移趋势在文本和语音上有所不同:以德语方言意图和主题分类的案例研究

Verena Blaschke, Miriam Winkler, Barbara Plank

机构 * MaiNLP lab, CIS, LMU Munich, Germany(慕尼黑大学自然语言处理实验室、计算机研究所、慕尼黑大学,德国) Munich Center for Machine Learning, Germany(慕尼黑机器学习中心,德国)

AI总结 研究比较了标准到方言的文本和语音转移效果,发现语音处理在方言数据上表现最佳,而文本处理在标准数据上更优,同时提出了首个方言语音意图分类数据集。

Comments ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15066 2026-04-17 cs.LG cs.AI cs.MM

Time-RA: Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback

Time-RA:面向时间序列推理的异常诊断方法:基于LLM反馈

Yiyuan Yang, Zichuan Liu, Lei Song, Kai Ying, Zhiguang Wang, Tom Bamford, Svitlana Vyetrenko, Jiang Bian, Qingsong Wen

机构 * University of Oxford(牛津大学) Nanjing University(南京大学) MSRA(微软研究院) SJTU(上海交通大学) Abel AI Outsampler University of Strasbourg(斯特拉斯堡大学) Squirrel Ai Learning(Squirrel AI学习)

AI总结 本文提出Time-RA,通过引入RATs40K多模态数据集,改进时间序列异常检测的生成式推理方法,提升诊断准确性和解释性,实现可解释的多模态时间序列分析。

Comments ACL 2026 Findings. 27 pages, 11 figures, 15 tables. Code and dataset are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19807 2026-04-17 cs.AI cs.CL cs.CV cs.LG cs.MA

KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality

KnowRL: 探索知识增强型强化学习以提升事实性

Baochang Ren, Shuofei Qiao, Da Zheng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

AI总结 KnowRL通过整合事实性奖励提升慢思考模型的事实准确性,实验表明其有效缓解了幻觉问题并保持推理能力。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20214 2026-04-17 cs.AI

When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning

当慢并非真:多模态推理中真理性的反比例定律

Sitong Fang, Wenjing Cao, Jiahao Li, Xuyao Wang, Juntao Dai, Chi-Min Chan, Sirui Han, Yike Guo, Yaodong Yang, Jiaming Ji

机构 * Institute for AI(人工智能研究院) Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究探讨了多模态推理中慢思考模式的反比例定律,发现慢思考模型在面对不完整或误导性视觉输入时更易生成虚假细节,揭示了推理模型在处理模糊输入时的脆弱性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16409 2026-04-17 cs.CL cs.CY

Counterfactual Probing for the Influence of Affect and Specificity on Intergroup Bias

反事实探测用于情感和特异性对群体偏见的影响

Venkata S Govindarajan, Kyle Mahowald, David I. Beaver, Junyi Jessy Li

机构 * Department of Linguistics(语言学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文通过反事实探测研究情感和特异性如何影响群体偏见,发现神经模型在预测群体关系标签时可靠使用情感,但特异性的使用不明确。

Comments To appear in Findings of ACL 2023

Journal ref Findings of the Association for Computational Linguistics: ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.06687 2026-04-17 cs.CL

How people talk about each other: Modeling Generalized Intergroup Bias and Emotion

人们如何谈论彼此:建模一般化的群体偏见和情感

Venkata S Govindarajan, Katherine Atwell, Barea Sinno, Malihe Alikhani, David I. Beaver, Junyi Jessy Li

机构 * Department of Linguistics, The University of Texas at Austin(德克萨斯大学奥斯汀分校语言学系) Department of Computer Sciences, University of Pittsburgh(匹兹堡大学计算机科学系) Department of Political Science, Rutgers University(罗格斯大学政治学系)

AI总结 本文探讨了群体偏见的广义建模,通过细粒度的人际情感预测人际关系,构建了首个标注人际情感的英文推文数据集,展示了神经模型在识别偏见方面的优越性能。

Comments To be presented at EACL 2023

Journal ref Proceedings of the 17th Conference of the European Chapter of the Association for Computational Linguistics 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.11429 2026-04-17 cs.CL

Decomposing Generalization: Models of Generic, Habitual, and Episodic Statements

分解泛化:通用、习惯性和事件性陈述的模型

Venkata Subrahmanyan Govindarajan, Benjamin Van Durme, Aaron Steven White

机构 * University of Rochester(罗切斯特大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出语义框架建模泛化表达,构建涵盖Universal Dependencies数据集,并验证类型级和词级信息在预测泛化表达中的有效性。

Journal ref Transactions of the Association for Computational Linguistics, 2019, Volume 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14885 2026-04-17 cs.CL cs.AI

RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding

RACER:检索增强的上下文快速推测解码

Zihong Zhang, Zuchao Li, Lefei Zhang, Ping Wang, Hai Zhao

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Information Management, Wuhan University(武汉大学信息管理学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院)

AI总结 RACER通过整合检索的精确模式与logit驱动的未来提示,提升大语言模型的推理效率,实现超过2倍的加速,优于现有无训练方法。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14856 2026-04-17 cs.CL cs.AI

ClimateCause: Complex and Implicit Causal Structures in Climate Reports

气候原因:气候报告中的复杂和隐含因果结构

Liesbeth Allein, Nataly Pineda-Castañeda, Andrea Rocci, Marie-Francine Moens

机构 * Department of Computer Science, KU Leuven, Belgium(比利时库勒芬大学计算机科学系) Department of Electronics and Information Systems, Ghent University, Belgium(比利时根特大学电子与信息系统系) Institute of Argumentation, Linguistics, and Semiotics (IALS), Università della Svizzera italiana, Switzerland(瑞士意大利大学论证、语言学与象征学研究所)

AI总结 本文提出ClimateCause数据集,通过专家标注揭示气候报告中的高阶因果结构,包括隐含和嵌套因果关系,用于提升因果推理和可读性量化。

Comments Accepted to ACL 2026 [Findings]

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14847 2026-04-17 cs.AI

TrigReason: Trigger-Based Collaboration between Small and Large Reasoning Models

TrigReason:基于触发的大小推理模型协作

Yi Zhao, Yajuan Peng, Cam-Tu Nguyen, Zuchao Li, Xiaoliang Wang, Xiaoming Fu, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(AGI研究院,计算机科学学院,上海交通大学,上海,中国) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University, Shanghai, China(上海市教育委员会智能交互与认知工程重点实验室,上海交通大学,上海,中国) Shanghai Key Laboratory for Intelligent Information Processing, Fudan University(上海市智能信息处理重点实验室,复旦大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Wuhan University(人工智能学院,武汉大学) Institute of Computer Science, University of Göttingen, Göttingen, Germany(计算机科学研究所,哥廷根大学,哥廷根,德国)

AI总结 本文提出TrigReason框架,通过触发机制将大部分推理任务交给小型模型,仅在必要时调用大模型,提升推理效率与准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14808 2026-04-17 cs.CL

Modeling LLM Unlearning as an Asymmetric Two-Task Learning Problem

将LLM去学习视为一个非对称的双任务学习问题

Zeguan Xiao, Siqing Li, Yong Wang, Xuetao Wei, Jian Yang, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海金融学院) Alibaba Group(阿里巴巴集团) Southern University of Science and Technology(南方科技大学) Beihang University(北航) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济交叉学科研究教育部重点实验室)

AI总结 本文将LLM去学习视为非对称双任务问题,提出优先保留的梯度合成框架,通过分离任务特定梯度提取与冲突感知组合,改进梯度冲突解决方法,实验证明通过重塑梯度几何而非重新平衡损失,有效缓解去学习-保留的权衡。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14773 2026-04-17 cs.CL

CoPA: Benchmarking Personalized Question Answering with Data-Informed Cognitive Factors

CoPA:基于数据驱动认知因素的个性化问答基准测试

Hang Su, Zequn Liu, Chen Hu, Xuesong Lu, Yingce Xia, Zhen Liu

机构 * East China Normal University(东华师范大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出CoPA基准,通过挖掘社区-个体偏好分歧,提炼六个个性化因素,用于细粒度评估模型输出与用户认知偏好的匹配程度,提升个性化问答评估的全面性与区分度。

Comments Accepted to ACL. 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14768 2026-04-17 cs.AI

CoTEvol: Self-Evolving Chain-of-Thoughts for Data Synthesis in Mathematical Reasoning

CoTEvol:用于数学推理数据合成的自演化思维链

Zhuo Wang, Zhuo Zhang, Yafu Li, Yu Cheng, Lizhen Qu, Zenglin Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Monash University(墨尔本大学) Independent Researcher(独立研究者) Shanghai Academy of AI for Science(上海人工智能科学研究院)

AI总结 本文提出CoTEvol,一种基于遗传算法的思维链生成框架,通过全局交叉和局部突变提升生成准确性和多样性,实验表明其在数学推理任务中效果优于传统方法。

Comments acl2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14749 2026-04-17 cs.CL cs.AI

Which bird does not have wings: Negative-constrained KGQA with Schema-guided Semantic Matching and Self-directed Refinement

没有翅膀的鸟:带有模式引导语义匹配和自导向细化的负约束知识图谱问答

Midan Shim, Seokju Hwang, Kaehyun Um, Kyong-Ho Lee

机构 * Department of Computer Science, Yonsei University(延世大学计算机科学系)

AI总结 本文提出负约束知识图谱问答任务NEST-KGQA,设计PyLF逻辑形式和CUCKOO框架,通过模式引导语义匹配和自导向细化提升负约束问题的解答能力。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14672 2026-04-17 cs.CL

SPAGBias: Uncovering and Tracing Structured Spatial Gender Bias in Large Language Models

SPAGBias:揭示和追踪大型语言模型中的结构化空间性别偏见

Binxian Su, Haoye Lou, Shucheng Zhu, Weikang Wang, Ying Liu, Dong Yu, Pengyuan Liu

机构 * School of Information Science, Beijing Language and Culture University(北京语言大学信息科学学院) Libraries, Renmin University of China(中国人民大学图书馆) School of Humanities, Tsinghua University(清华大学人文学院) Shanghai University of Finance and Economics(上海财经大学) National Print Media Language Resources Monitoring & Research Center(国家印刷媒体语言资源监测与研究中心)

AI总结 本文提出SPAGBias框架,系统评估LLM中的空间性别偏见,通过62种城市微空间分类、提示库和三层诊断方法,揭示性别空间关联及偏见来源,扩展了偏见研究到空间领域。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14644 2026-04-17 cs.CL cs.LG

CURaTE: Continual Unlearning in Real Time with Ensured Preservation of LLM Knowledge

CURaTE:在实时中实现连续反学习以确保大语言模型知识的保留

Seyun Bae, Seokhan Lee, Eunho Yang

机构 * KT Corporation(KT公司) KAIST(韩国科学技术院)

AI总结 本文提出CURaTE方法,通过训练句子嵌入模型实现实时连续反学习,有效提升遗忘效果并保持知识完整性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14631 2026-04-17 cs.CL cs.AI

StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code Generation

StoryCoder: 为LLM代码生成中的结构化推理提供叙述改写

Geonhui Jang, Dongyoon Han, YoungJoon Yoo

机构 * Dept. of Artificial Intelligence, Chung-Ang University(Chung-Ang 大学人工智能系) NAVER AI Lab(NAVER AI 实验室)

AI总结 StoryCoder通过将代码生成问题转化为连贯的自然语言叙述,提升模型推理和规划能力,实验显示在多个数据集上平均提升18.7%的零样本准确率,且改进了算法策略和代码结构。

Comments 21 pages, 12 figures. ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14602 2026-04-17 cs.CL cs.AI

CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification

CausalDetox:语言模型去毒化的因果头部选择与干预

Yian Wang, Yuen Chen, Agam Goyal, Hari Sundaram

机构 * Department of Computer Science(计算机科学系)

AI总结 本文提出CausalDetox框架,通过因果分析识别并干预导致有毒生成的特定注意力头,利用PNS方法隔离必要且充分的头部,结合局部推理干预和PNS引导微调策略,有效提升去毒效果并保持语言流畅性。

Comments Accepted to ACL 2026. 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14564 2026-04-17 cs.AI cs.CL

MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation

MARS$^2$:通过强化学习提升多智能体树搜索用于代码生成

Pengfei Li, Shijie Wang, Fangyuan Li, Yikun Fu, Kaifeng Liu, Kaiyan Zhang, Dazhi Zhang, Yuqiang Li, Biqing Qi, Bowen Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学)

AI总结 MARS$^2$通过多智能体协作与树搜索结合,提升强化学习在代码生成中的性能,实验表明其在多种模型和训练设置下均有效。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14528 2026-04-17 cs.AI cs.CL

Dissecting Failure Dynamics in Large Language Model Reasoning

解析大语言模型推理中的故障动态

Wei Zhu, Jian Zhang, Lixing Yu, Kun Yue, Zhiwen Tang

机构 * School of Information Science and Engineering, Yunnan University, Kunming, China(云南大学信息科学与工程学院,昆明,中国) Yunnan Key Laboratory of Intelligent Systems and Computing, Kunming, China(云南省智能系统与计算重点实验室,昆明,中国)

AI总结 研究揭示大语言模型推理错误多源于早期少量转换点,提出GUARD框架通过不确定性信号引导干预,提升推理可靠性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏