arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 155
2607.20430 2026-07-24 cs.CL cs.AI 新提交

LLM-INSTRUCT at UZH Shared Task 2026: Constraint-Aware Retrieval and Selective Debate for Paragraph-Level Argument Mining

LLM-INSTRUCT在UZH 2026共享任务中的应用:用于段落级论证挖掘的约束感知检索和选择性辩论

Phuong Huu Vu Tran, Long Minh Vo, Son Nguyen Minh Le, Hoang Van

机构 * Vietnamese-German University(越南-德国大学) RMIT University Vietnam(皇家墨尔本理工大学越南分校) VANGIA INNOVATIONS(VANGIA创新公司)

AI总结 本文介绍了在UZH 2026共享任务中用于段落级论证挖掘的获胜系统LLM-INSTRUCT,通过元数据感知检索、约束解码等方法缩小决策空间,提高了准确性和提交稳健性,在官方排行榜上取得优异成绩。

Comments Accepted to the 13th Workshop on Argument Mining (ArgMining 2026) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19354 2026-07-23 cs.AI 新提交

FormulaSPIN: Self-Play Fine-Tuning for Natural Language to Spreadsheet Formula Generation

FormulaSPIN:用于自然语言到电子表格公式生成的自博弈微调

Cy Xie

AI总结 研究自然语言到电子表格公式生成问题,提出FORMULASPIN自博弈框架,利用公式生成优势及双人博弈实现迭代自我改进,引入ExecVote提高准确性,实验证明其性能达最优,凸显自博弈解决稀缺数据任务的潜力。

Comments 15 pages,7 figures, 14 tables. Accepted to ACL 2026 Main Conference Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18749 2026-07-22 cs.LG cs.CL cs.ET q-bio.NC 新提交

Is EEG-to-Text Feasible in Real-World Scenarios? An In-Depth Analysis Using a Neuropsychology-Inspired Benchmark

脑电到文本在现实场景中可行吗?使用受神经心理学启发的基准进行深入分析

Zihan Zhang, Yu Bao, Xiao Ding, Tianyi Jiang, Kai Xiong

机构 * Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(哈尔滨工业大学社会计算与交互机器人研究中心) Shanghai Innovation Institute(上海创新院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Zhongguancun Laboratory(中关村实验室)

AI总结 探讨脑电到文本在现实场景的可行性,利用受神经心理学启发的范式,发现现有基准忽略脑电不稳定性问题。通过实验为无教师强制的EEG2Text解码提供证据,构建COFETT基准,可区分模型性能,实现稳健评估,推动EEG2Text实际应用。

Comments 17 pages, 8 figures. Published in Proceedings of ACL 2026 Main Conference

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, Volume 1: Long Papers (2026), 1378-1393

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18245 2026-07-22 cs.AI 新提交

SAAG: Structured Agent Assessment and Grounding

SAAG:结构化智能体评估与基础

Ritvik Garimella, Vedant Khandelwal, Anvi Kohli, Amit Sheth

机构 * Artificial Intelligence Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) Indian AI Research Organization(印度人工智能研究组织)

AI总结 研究针对智能体调用评估问题,提出SAAG级联诊断框架,将其分解为三个阶段进行评估,能实现迭代自我修复。经实验,结构化反馈可提高参数精度、减少值幻觉,表明阶段分解诊断评估对提升智能体调用可靠性很关键。

Comments Accepted to KnowFM @ ACL 2026 workshop (Non-Archival). 16 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15281 2026-07-20 cs.AI 新提交

Causal-Audit: Explicit and Auditable Graph-based Reasoning via Target-Aware Causal Chain Construction

因果审计:通过目标感知因果链构建进行显式且可审计的基于图的推理

Su Lan, Xuefei Yin, Yanming Zhu, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)

AI总结 针对无上下文干预问答,提出因果审计框架,通过目标感知因果图构建和路径级因果证据聚合机制,将因果推理结构化,实验证明该框架优于现有方法,能提供可解释且可审计的推理痕迹。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15280 2026-07-20 cs.AI 新提交

GraphDx: A Cost-Aware Knowledge-Enhanced Multi-Agent Framework for Sequential Diagnosis

GraphDx:一种用于顺序诊断的成本感知知识增强多智能体框架

Shaoting Tan, Ning Liu, Yuntao Du, Shuyue Wei, Wu Shuai, Qian Li, Yanyu Xu, Wei Zhang, Lizhen Cui, Haitao Yuan

机构 * Shandong University(山东大学) Nankai University(南开大学) East China Normal University(华东师范大学) National Technological University(国立科技大学)

AI总结 研究针对顺序诊断中平衡诊断准确性与资源成本的问题,提出GraphDx框架。该框架通过构建特殊知识图谱及引入协作智能体实现创新,实验表明其能显著提高诊断成功率并降低测试成本,为自动临床诊断提供有效方案。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 21721-21736, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11893 2026-07-15 cs.CL cs.AI 新提交

I'm Sorry, but I Can't Help with Braille: Revealing Accessibility Failures in State-of-the-Art LLMs

对不起,我无法处理盲文:揭示当前最先进语言模型中的无障碍性缺陷

Abdullah Abdullah

机构 * orinu Inc.(奥里努公司)

AI总结 研究评估先进语言模型在韩语-盲文翻译上的表现,发现其存在缺陷。通过人工标注数据集测试,发现输出差且不稳定。对比发现,对小模型进行监督微调效果更好,揭示了当前语言模型的局限,证明特定监督的有效性。

Comments Accepted at the LTEDI Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10787 2026-07-14 cs.CV cs.CL 新提交

Detecting AI-Generated Video: A Vision-Language Dual-View Survey

检测人工智能生成的视频:视觉-语言双视角综述

Dylan Xinming Hou, Juntian Zhang, Xu Gu, Yichen Wu, Nils Lukas, Gus Xia, Xiuying Chen, Yuhan Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院) Harvard University(哈佛大学)

AI总结 综述人工智能生成视频检测,将任务重定义为事实保真度验证,提出视觉-语言双视角分类法,基于对221篇论文回顾,综合生成范式、审视检测方法、回顾评估指标,讨论挑战并指出未来方向。

Comments 51 pages, accepted by ACL 2026

Journal ref Association for Computational Linguistics 2026 pages 32221 to 32255

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10715 2026-07-14 cs.CL cs.AI 新提交

A Corpus of Persuasion Techniques in Slavic Languages

斯拉夫语中的说服技巧语料库

Jakub Piskorski, Dimitar Iliyanov Dimitrov, Marina Ernst, Jacek Haneczok, Michał Marcińczuk, Arkadiusz Modzelewski, Roman Yangarber

机构 * Institute of Computer Science, Polish Academy of Science(波兰科学院计算机科学研究所) Sofia University "St. Kliment Ohridski"(索菲亚大学圣克莱门特·奥赫里德斯基分校) University of Koblenz(科布伦茨大学) Visa Technology Europe(维萨欧洲技术公司) CodeNLP(代码自然语言处理公司) University of Padua(帕多瓦大学) University of Helsinki(赫尔辛基大学)

AI总结 本文聚焦斯拉夫语构建说服技巧语料库,涵盖三国语言、约7500个文本跨度及25种细粒度技巧。描述创建过程并统计,研究话题与技巧相关性,还用多种模型提供检测和分类的基线及基准结果。

Comments Corpus used for SlavicNLP 2025 Workshop co-located with ACL 2025, Published at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09263 2026-07-13 cs.CV 新提交

Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval

语义难度并非视觉难度:用于手语检索的符号感知硬负样本挖掘

Junmyeong Lee, Chan Hur, ChangSu Choi, Sukmin Cho, Fitsum Gaim, Eui Jun Hwang, Hoyun Song, KyungTae Lim

机构 * School of Computing(计算机学院) Graduate School of Culture Technology(文化技术研究生院) Korea Advanced Institute of Science and Technology(韩国科学技术院) ETRI Medical Informatics Laboratory(电子通信研究院医学信息学实验室)

AI总结 研究手语检索在细粒度场景的问题,提出符号感知硬负样本挖掘方法,通过在嵌入空间基于视觉易混淆性构建硬负样本,实验证明该方法能提升细粒度检索性能且保持粗粒度准确性。

Comments Accepted to ACL 2026 main

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2026, pages 28262-28277

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07740 2026-07-13 cs.LG cs.AI 新提交

Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE

Jet-Long:使用动态双焦点旋转位置编码的高效长上下文扩展

Haozhan Tang, Zerui Wang, Yuxian Gu, Song Han, Han Cai

机构 * NVIDIA(英伟达)

AI总结 研究针对现代语言模型长上下文应用中零样本上下文扩展问题,提出Jet-Long方法,通过动态双焦点RoPE及相关技术,在推理时开销小,在多种模型和基准测试中表现优异,还能推广到其他架构且超参数弹性强。

Comments added discussion of AdaGroPE and LaMPE (Findings of ACL 2026) with clarified contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08057 2026-07-10 cs.LG cs.AI cs.CL 新提交

Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

迈向高效大语言模型服务:关于系统感知键值缓存优化的综述

Jiantong Jiang, Peiyu Yang, Rui Zhang, Feng Liu

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

AI总结 该综述聚焦大语言模型服务中系统感知的键值缓存优化,从执行与调度、放置与迁移、表示与保留三个维度回顾相关工作,分析跨行为协同设计及行为与目标联系,为理解和创新键值缓存设计提供基础。

Comments Accepted to ACL 2026 as a Findings paper

Journal ref Findings of the Association for Computational Linguistics: ACL 2026 (pp. 38450-38476)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07937 2026-07-10 cs.CL 新提交

When Debiasing Backfires: Counterintuitive Side Effects of Preprocessing-Based Stereotype Mitigation

当去偏措施适得其反:基于预处理的刻板印象缓解的反直觉副作用

Yahan Zheng, John Guerrerio, Soroush Vosoughi, Weicheng Ma

机构 * Dartmouth College(达特茅斯学院) Oakland University(奥克兰大学)

AI总结 研究基于预处理的刻板印象缓解方法的副作用,通过两个模型家族、多种策略及不同数据规模验证副作用存在,标准基准常忽略,注意力分析显示副作用与注意力流变化无关,还讨论评估意义并提供诊断方法及主张透明缓解措施。

Comments Published in ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07907 2026-07-10 cs.LG cs.AI cs.CL cs.CR cs.MM 新提交

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准的综述

Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

AI总结 综述跨视觉、语言、音频和视频的多模态遗忘,基于相关进展等提供统一视角,通过分类法系统比较模型架构和模态,阐明权衡,强调开放问题与实际考虑,支持未来研究与部署,并发布存储库。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07318 2026-07-09 cs.CL cs.LG 新提交

R^3: Advertisement Compliance Rectification via Group-Relative Experience Extractor and Curriculum Reinforcement

R^3:通过群组相对经验提取器和课程强化进行广告合规整改

Yuan Chen, Zhenyu Hu, Mengge Xue, Te Cao, Liqun Liu, Peng Shu, Huan Yu, Jie Jiang

机构 * Tencent(腾讯)

AI总结 针对视频广告文本违规整改问题,提出R^3框架,集成经验驱动数据合成、课程强化学习策略和综合视频整改框架,通过实验验证该框架在违规整改与意图保留间能实现最优权衡,优于现有基线。

Comments ACL 2026 (Poster, Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07251 2026-07-09 cs.CL 新提交

Evaluation of Multilingual Ability to Use Spatial Deictic Expressions in Vision-Language Models

视觉语言模型中使用空间指示表达式的多语言能力评估

Kaito Watanabe, Taisei Yamamoto, Tomoki Doi, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) Tohoku University(东北大学)

AI总结 研究聚焦视觉语言模型的空间推理能力,通过开发基准评估其使用四种语言空间指示表达式的多语言能力,实验发现测试模型使用指示词方式与人类不同,特别是在依距离选指示词方面。

Comments Accepted to ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06818 2026-07-09 cs.CL cs.AI cs.LG 新提交

Ad Headline Generation using Self-Critical Masked Language Model

使用自批判掩码语言模型生成广告标题

Yashal Shakti Kanungo, Sumit Negi, Aruna Rajan

机构 * amazon(亚马逊)

AI总结 研究如何为电商网站生成吸引人的广告标题,核心方法是将强化学习策略梯度方法应用于基于Transformer的掩码语言模型,通过联合多种产品信息生成标题,该方法在指标和质量审核上优于现有方法,生成标题质量也优于人工提交的。

Comments Accepted at NAACL-HLT 2021 (Industry Track). 9 pages, 3 tables, 3 figures - ACL Anthology URL: https://aclanthology.org/2021.naacl-industry.33/ - Editors of the proceedings: Young-bum Kim, Yunyao Li, Owen Rambow - Bibkey: kanungo-etal-2021-ad

Journal ref Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies: Industry Papers, pages 263-271, June 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05441 2026-07-08 cs.IR cs.AI 新提交

PORTS: Preference-Optimized Retrievers for Tool Selection with Large Language Models

PORTS:用于大语言模型工具选择的偏好优化检索器

Lorenzo Molfetta, Giacomo Frisoni, Nicolò Monaldini, Gianluca Moro

机构 * Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学)

AI总结 研究针对大语言模型工具选择中现有检索器与LLMs不一致问题,提出PORTS方法,利用受困惑度启发的偏好信号,通过优化相关性及施加对比语义损失微调检索器,经多实验验证其通用性及提高工具选择准确性的能力,且计算需求低便于推广。

Comments Please cite the definitive, peer-reviewed version of this article published in the Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, edited by Christos Christodoulopoulos et al., Association for Computational Linguistics, pp. 10007-10030, 2025. DOI: https://doi.org/10.18653/v1/2025.emnlp-main.507

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, Association for Computational Linguistics, pp. 10007-10030, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05174 2026-07-07 cs.AI 新提交

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

AgentGym2:在去理想化真实世界环境中评测大语言模型智能体

Zhiheng Xi, Dingwen Yang, Jiaqi Liu, Jixuan Huang, Honglin Guo, Baodai Huang, Tinggang Chen, Qi Zhang, Zhonghang Lu, Chenyu Liu, Jiajun Sun, Jiazheng Zhang, Dingwei Zhu, Xin Guo, Junzhe Wang, Zhihao Zhang, Yuming Yang, Junjie Ye, Minghe Gao, Dongrui Liu, Jiaming Ji, Guohao Li, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghaijiaotong University(上海交通大学) Peking University(北京大学)

AI总结 针对现有LLM智能体基准过于理想化的问题,提出去理想化评测框架AgentGym2,可全面测查智能体实操能力,实验显示当前SOTA模型仍存在明显性能缺口。

Comments Accepted as a main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04854 2026-07-07 cs.AI 新提交

CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs

CARL:用于大语言模型规划的约束感知强化学习

Qiuyi Qi, Jinjian Zhang, Mutian Bao, Tian Liang, Guocong Li, Dongnan Liu, Wei Zhou, Jie Liu, Ming Kong, Linjian Mo, Feng Zhang, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学) College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

AI总结 研究大语言模型生成违反任务约束计划的问题,提出约束感知强化学习框架CARL,通过比较不同输入下模型输出分布引入奖励,提升模型约束意识,实验证明其优于基线和现有模型。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04727 2026-07-07 cs.SE cs.AI cs.CV 新提交

Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards

Dashboard2Code:在重建交互式仪表板上评估多模态模型

Tianhao Niu, Ziyu Han, Qiguang Chen, Shiqi Zhou, Baocai Shan, Hengjie Fang, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究院)

AI总结 研究多模态模型在交互式仪表板重建任务,介绍Dashboard2Code任务,提出DashboardMimic基准及自动化评估框架,实验发现开源与闭源模型在此任务上有差距。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03833 2026-07-07 cs.CL cs.AI 新提交

Beyond Static Rules: Automated Discovery of Latent Vulnerabilities in Text-to-SQL

超越静态规则:文本到SQL中潜在漏洞的自动发现

Hanqing Wang, Yongdong Chi, Jian Yang, Lei Yang, Jiehui Zhao, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北京航空航天大学) Deepexi Technology Co. Ltd.(深圳市智元机器有限公司) Southern University of Science and Technology(南方科技大学)

AI总结 研究LLMs在文本到SQL任务中潜在可靠性问题,提出SAGE框架,通过生成漏洞假设、参考漏洞法典设计扰动来发现潜在故障模式,实验证明其能发现大量故障案例及法典的跨模型转移性。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03709 2026-07-07 cs.CL 新提交

GRASP: Graph-Reasoning Aided Survey Planning for High-Fidelity Related Work Generation

GRASP:用于高保真相关工作生成的图推理辅助综述规划

Haoming Li, Jessica Ouyang

机构 * Department of Computer Science(计算机科学系)

AI总结 研究如何写文献综述,核心方法是结合大语言模型规划与图算法,主要贡献是提出GRASP框架,其两层图结构及拓扑感知剪枝能生成与人工撰写匹配的相关工作部分。

Comments 23 pages, 3 figures. Published in Findings of the Association for Computational Linguistics: ACL 2026

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 36427-36449, San Diego, California, United States. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03466 2026-07-07 cs.CL cs.AI cs.LG 新提交

CaresAI at SMM4H-HeaRD 2026: Predicting TNM Staging

CaresAI在SMM4H-HeaRD 2026中的应用:预测TNM分期

Joseph Itopa Abubakar, Jorge Jarme, Favour Igwezeke, Mary Adewunmi

机构 * CaresAI(关爱人工智能) Ateneo De Naga University(那牙雅典耀大学) Faculty of Pharmaceutical Sciences, Nsukka, Enugu, Nigeria(尼日利亚埃努古州恩苏卡药学院) Menzies School of Health Research(孟席斯健康研究学院)

AI总结 该研究以癌症基因组图谱病理报告为基础,将预测TNM分期问题转化为多标签分类任务,探索经典和深度学习方法,结果显示组合嵌入能提升预测能力,虽有局限但提供了基线模型和可重复流程。

Journal ref Association for Computational Linguistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03213 2026-07-07 cs.CV cs.AI cs.CL cs.HC 新提交

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance

OpenGlass:用于本地MLLM驱动的实时视觉辅助的传感-计算分离架构

Mengzhang Li, Yuan Yao

机构 * Shanghai Qizhi Institute(上海期智研究院) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 针对视障和低视力用户,OpenGlass以传感-计算分离解决云MLLM辅助需上传数据、有网络延迟,以及可穿戴眼镜计算和电量受限问题,在本地设备实现低延迟多模态视觉辅助,并给出评估结果。

Comments Accepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03003 2026-07-07 cs.CL 新提交

psytechlab at CLPsych 2026: Utilising Natural Language Processing methods and Large Language Models for Social Media Text Analysis

CLPsych 2026 中的心理技术实验室:利用自然语言处理方法和大语言模型进行社交媒体文本分析

Igor Buyanov, Nafisa Valieva, Ekaterina Mazurina

机构 * psytechlab(心理技术实验室)

AI总结 在 CLPsych 2026 共享任务中,利用自然语言处理方法和大语言模型对社交媒体文本进行自我状态和幸福感分析与总结,为改进心理健康支持系统做贡献。

Comments Accepted by CLPsych2026. CLPsych 2026 will be held at ACL in San Diego July 4th, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09118 2026-07-07 cs.AI 新提交

ComplexConstraints and Beyond: Expert Rubrics for RLVR

复杂约束与超越:RLVR的专家评分标准

Sushant Mehta, Liudas Panavas, Suhaas Garre, Edwin Chen

机构 * Surge AI

AI总结 提出专家设计的评分标准作为评估和训练信号,通过复杂指令遵循和企业智能体任务验证,在RL训练中显著提升模型性能。

Comments Accepted to the GEM workshop at ACL 2026: https://gem-workshop.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02459 2026-07-03 cs.CL 新提交

Language Models as Measurement Apparatus for Culture

语言模型作为文化测量仪器

Kent K. Chang

机构 * School of Information University of California, Berkeley(信息学院加州大学伯克利分校)

AI总结 本文提出语言模型的文化测量是物质-话语实践,通过Karen Barad的能动切割概念,论证模型设计选择构成所测量的文化现实,并通过三个案例和三个仪器检查展示这一观点。

Comments Accepted to the Big Picture workshop co-located with ACL 2026. This version expands the camera-ready (adding Fig. 3 and section 6.3, as well as correcting minor typos) in Proceedings of The Big Picture v2: Crafting a Research Narrative, pp. 131--143, San Diego, CA, USA. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01883 2026-07-03 cs.CL 新提交

PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation

PairCoder++:结对编程作为验证代码驱动的多模态与结构化工件生成的通用范式

Junhao Chen, Xiang Li, Mingjin Chen, Boran Zhang, Henghaofan Zhang, Yibin Xu, Yuehan Cui, Fangsheng Weng, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * THU(清华大学) PKU(北京大学) PolyU, Hong Kong(香港理工大学) USTC(中国科学技术大学) UESTC(电子科技大学) Tongji University(同济大学) Tianjin University(天津大学) Independent Researcher(独立研究者) Guangming Lab(光明实验室) BAAI(北京智源人工智能研究院)

AI总结 提出PairCoder框架,通过驱动者和导航者两个智能体结对编程,利用工具链反馈验证代码生成,在17个基准测试中显著提升可验证工件的生成质量。

Comments Accepted by ACL 2026. Project Page: https://yisuanwang.github.io/PairCoder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01242 2026-07-03 cs.HC cs.AI cs.CL cs.IR 新提交

ExPerT: Personalizing LLM Responses to Users' Domain Expertise via Query-Wise Semantic and Keystroke Behavioral Cues

ExPerT: 通过查询级语义和击键行为线索个性化LLM对用户领域专业知识的响应

Yeji Park, Jiwon Tark, Taesik Gong

AI总结 提出ExPerT框架,结合语义和击键行为线索推断用户查询级专业知识,动态调整LLM响应细节和复杂度,实验表明专业知识推断误差降低65.7%,响应满意度提升17.52%。

Comments Accepted to ACL 2026 (Main, Long)

详情

展开后加载摘要…

URL PDF HTML 收藏