arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31957 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31957 篇

2603.04459 2026-05-18 cs.CR cs.AI cs.SE 90%

Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks

基准的基准:解构影响与代码仓库质量在LLM安全基准中的作用

Junjie Chu, Xinyue Shen, Ye Leng, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) University of Waterloo(滑铁卢大学) Flexera(Flexera公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过系统研究31个LLM安全基准及382篇非基准论文,发现仅39%的基准仓库可直接运行,且缺乏伦理考量。研究揭示社区采用基准与作者声望和代码运行性相关,但与代码质量无关,指出安全基准可能存在安全隐患和不可比性问题。

Comments 24 pages. 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08522 2026-05-15 cs.CL 90%

Coordinates of Capability: A Unified MTMM-Geometric Framework for LLM Evaluation

能力坐标:一种统一的MTMM-几何框架用于LLM评估

Adib Sakhawat, Tahsin Islam, Takia Farhin, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种统一的MTMM-几何框架,将九种评估指标统一到共享的潜在坐标空间中,通过三个正交维度分析模型能力,提供稳健且经验稳定的基准设计方法。

Comments The paper has mistake of undertaking political spaces to semantic dimensions. This needs to be removed because this is a fetal flaw in consideration. The initial hypothesis and premise needs to be rigorously formulated within the political landscape not generalizing the metrics. Hence a withdrawal for now is necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24586 2026-05-15 cs.SE cs.CL 90%

Comparing Developer and LLM Biases in Code Evaluation

比较开发者与LLM在代码评估中的偏见

Aditya Mittal, Ryan Shar, Zichu Wu, Shyam Agarwal, Tongshuang Wu, Chris Donahue, Ameet Talwalkar, Wayne Chi, Valerie Chen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出TRACE框架,评估LLM在代码评估中的偏见,发现LLM在与开发者偏好对齐方面表现不佳,揭示了人类与模型在代码质量标准上的系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03630 2026-05-15 cs.CL 90%

Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases

推理模型优于LLM-判官,但存在偏见

Hui Huang, Xuanxin Wu, Muyun Yang, Yuki Arase

机构 * Institute of Science Tokyo(东京科学研究院) Harbin Institute of Technology(哈尔滨工业大学) The University of Osaka(大阪大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文系统比较了推理模型在判断任务中的表现,发现其在准确性、指令遵循和抗攻击能力上优于非推理LLM,但存在显著偏见,提出PlanJudge策略以缓解偏见问题。

Comments Accepted by ACL 2026 Workshop EvalEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11581 2026-05-14 cs.CL 90%

Hidden Measurement Error in LLM Pipelines Distorts Annotation, Evaluation, and Benchmarking

LLM pipelines 中隐藏的测量误差扭曲了注释、评估和基准测试

Solomon Messing

机构 * Center for Social Media, AI, and Politics(社交媒体、人工智能与政治中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文分析了LLM评估流程中隐藏的测量误差来源,通过设计研究减少总评估误差,并展示改进后的精度和基准测试效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12022 2026-05-13 cs.CL 90%

SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation

SAGE:可扩展的自动鲁棒性增强用于LLM知识评估

Xiaoyuan Li, Yuzhe Wang, Moxin Li, Keqin Bao, Rui Men, Yichang Zhang, Dayiheng Liu, Wenjie Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SAGE通过细调小型模型构建大规模鲁棒性增强的知识评估基准,成本显著低于人工标注的HellaSwag-Pro,且细调模型可泛化至MMLU。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11376 2026-05-13 cs.AI 90%

LLM-X: A Scalable Negotiation-Oriented Exchange for Communication Among Personal LLM Agents

LLM-X:一种可扩展的面向协商的交换机制用于个人LLM代理间的通信

Giuliano Lorenzoni, Paulo Alencar, Donald Cowan

机构 * University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出LLM-X,一种可扩展的面向协商的交换机制,支持个人代理间的结构化通信。该机制引入了消息总线和路由子层,支持LLM间的协调,并保证了模式有效性和政策执行。贡献包括LLM-X的架构、类型化消息协议以及首次大规模LLM多代理协商的实证评估。

Comments 8 pages, 7 figures, accepted at AGENT 2026 Workshop, co-located with ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11269 2026-05-13 gr-qc astro-ph.HE astro-ph.IM cs.AI 90%

gwBenchmarks: Stress-Testing LLM Agents on High-Precision Gravitational Wave Astronomy

gwBenchmarks: 对高精度引力波天文学中LLM代理的应力测试

Tousif Islam, Digvijay Wadekar, Zihan Zhou

机构 * Kavli Institute for Theoretical Physics, University of California Santa Barbara, Kohn Hall, Lagoon Rd, Santa Barbara, CA 93106(加州大学圣芭芭拉分校凯弗利理论物理研究所) Center for Gravitational Physics, University of Texas at Austin, Austin, TX 78712, USA(德克萨斯大学奥斯汀分校引力物理中心) Department of Physics, Princeton University, Princeton, NJ 08540, USA(普林斯顿大学物理系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了最先进的LLM编码代理能否完成端到端的科学建模任务,通过八个任务测试其精度和物理系统推理能力,发现代理在复杂任务上表现不佳,无法达到领域要求。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10990 2026-05-13 cs.SE cs.AI 90%

Skill Drift Is Contract Violation: Proactive Maintenance for LLM Agent Skill Libraries

技能漂移是合同违约:为LLM代理技能库的主动维护

Linfeng Fan, Yuan Tian, Ziwei Li, Zhiwu Lu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出通过提取可执行环境合同来检测LLM代理技能库中的技能漂移,通过区分噪声监控与精准维护信号,提升检测精度和修复效果,同时发布了一个技能退化基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10779 2026-05-12 cs.CR cs.CL 90%

LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

LITMUS:在真实操作系统环境中评估LLM代理行为越狱的基准测试

Chiyu Zhang, Huiqin Yang, Bendong Jiang, Xiaolei Zhang, Yiran Zhao, Ruyi Chen, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 LITMUS通过语义-物理双重验证机制和操作系统级状态回滚,解决现有基准测试在物理层危害评估和测试隔离上的不足,揭示LLM代理在行为安全方面的缺陷和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10405 2026-05-12 cs.LG 90%

Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization

通过低秩分解实现LLM评估中的最佳模型识别

Elad Tolochinsky, Yaniv Tenzer, Yaniv Romano

机构 * Department of Computer Science, Technion – Israel Institute of Technology(计算机科学系,技术离子理工学院) Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术离子理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出结合多臂老虎机与低成本预测评分的框架,通过低秩分解减少方差,构建有效的置信区间,实现实验结果的准确识别与计算成本的降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04956 2026-05-12 cs.LG cs.PF 90%

KernelBenchX: A Comprehensive Benchmark for Evaluating LLM-Generated GPU Kernels

KernelBenchX: 一个全面的评估LLM生成GPU内核的基准测试

Han Wang, Jintao Zhang, Kai Jiang, Haoxu Wang, Jianfei Chen, Jun Zhu

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出KernelBenchX基准测试,通过176个任务的分类评估,揭示LLM生成GPU内核在正确性和硬件效率上的表现,发现任务结构比方法设计更重要,迭代优化提升正确性但不改善性能,正确性不等于效率,量化问题仍未解决。

Comments minor textual revision; no changes to technical content or results

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22919 2026-05-12 cs.CL 90%

ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room

ER-Reason:用于急诊科大型语言模型临床推理的基准数据集

Nikita Mehandru, Niloufar Golchini, Namrata Garg, Kathy T. LeSaint, Christopher J. Nash, Anu Ramachandran, Travis Zack, Liam G. McCoy, Adam Rodman, David Bamman, Melanie Molina, Ahmed Alaa

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Duke University(杜克大学) University of Alberta(阿尔伯塔大学) Beth Israel Deaconess Medical Center(贝斯以色列德aconess医疗中心) UC Berkeley and UCSF(伯克利大学和旧金山分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ER-Reason基准数据集通过真实患者病例评估LLM在急诊流程中逐步推理能力,包含25174份脱敏临床记录,采用Script Concordance Test风格问题测试模型在积累临床证据时的诊断信念更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09222 2026-05-12 cs.DB cs.AI cs.SE 90%

Detect, Localize, and Explain: Interactive Hierarchical Log Anomaly Analytics with LLM Augmentation

检测、定位与解释:基于LLM增强的交互式分层日志异常分析

Lei Ma, Suhani Chaudhary, Ethan Shanbaum, Athanasios Tassiadamis, Peter M. VanNostrand, Dennis M. Hofmann, Haowen Xu, Elke Rundensteiner

机构 * Worcester Polytechnic Institute, USA(沃斯特理工学院,美国) University of Nevada, Las Vegas, USA(内华达大学拉斯维加斯分校,美国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Krone系统,通过分层日志抽象和 orchestration 框架,结合LLM推理实现日志异常的精准检测、定位与解释,提供交互式可视化工具支持软件工程师和系统运维人员进行可解释的分层日志分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07102 2026-05-11 cs.CL 90%

SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive Dimensions

SAGE:基于本体的层级LLM文学评价

Tianyu Wang, Nianjun Zhou

机构 * Mercy University, Math & Computer Science Department(梅里大学数学与计算机科学系) IBM T.J. Watson Research Center(IBM 托马斯·贾维斯·沃森研究中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SAGE通过本体引导的解释性维度对文学质量进行分层评估,利用结构化大语言模型评估和多轮迭代反思,实现98.8%的评分收敛和94%的评分者一致性,揭示了文学质量的层次结构和影响因素。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23478 2026-05-11 cs.CL 90%

JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems

JudgeSense: 一个用于评估LLM作为裁判系统提示敏感性的基准

Rohith Reddy Bellibatlu, Edward Raff, Wenbin Zhang

机构 * Florida International University(佛罗里达国际大学) CrowdStrike University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出JudgeSense基准,用于评估LLM作为裁判系统在提示重述下的稳定性,分析不同任务和架构的决策稳定性,并发现一致性不依赖模型规模。

Comments 20 pages, 2 figures, 1 table. Code: https://github.com/rohithreddybc/judgeSense. Dataset (JudgeSense Benchmark): https://huggingface.co/datasets/Rohithreddybc/judgesense-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06584 2026-05-08 cs.AI 90%

NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research

NeuroAgent:用于多模态神经影像分析和研究的LLM代理

Lujia Zhong, Yihao Xia, Jianwei Zhang, Shuo huang, Jiaxin Yue, Mingyang Xia, Yonggang Shi

机构 * Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Viterbi School of Engineering, University of Southern California(维特比工程学院,南加州大学) Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程部门,维特比工程学院,南加州大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 NeuroAgent通过LLM驱动的代理框架自动化多模态神经影像预处理与分析,支持自然语言查询,提升神经影像研究的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06161 2026-05-08 cs.AI cs.SE 90%

Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges

超越准确性:将政策不变性作为LLM安全裁判的可靠性测试

Shihao Weng, Yang Feng, Xiaofei Xie

机构 * Nanjing University(南京大学) Singapore Management University(新加坡国立管理学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出政策不变性作为LLM安全裁判可靠性测试,通过三个可测试原则揭示现有裁判在面对规范性变化和结构性重写时的失效模式,并提出政策不变性分数和裁判卡报告协议以评估裁判可靠性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05846 2026-05-08 cs.CR cs.AI 90%

LoopTrap: Termination Poisoning Attacks on LLM Agents

LoopTrap: 对 LLM agent 的终止污染攻击

Huiyu Xu, Zhibo Wang, Wenhui Zhang, Ziqi Zhu, Yaopeng Wang, Kui Ren, Chun Chen

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) School of Cyber Science and Engineering(网络安全与工程学院) Southeast University(东南大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了LLM agent迭代执行循环中的终止污染风险,提出10种攻击策略并通过实验证明不同agent的行为特征影响攻击效果,设计了自动化框架LoopTrap以提升红队攻击效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05731 2026-05-08 cs.AI 90%

Knee Osteoarthritis Severity Grading Using Optimized Deep Learning and LLM-Driven Intelligent AI on Computationally Limited Systems

利用优化深度学习和LLM驱动智能AI对膝骨关节炎严重程度进行分级

Dayam Nadeem, Neha, Safdar Mustafa, Adnan Alvi, Mohd Hussain

机构 * Jamia Hamdard(贾迈亚哈姆达德大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结合深度学习CNN与TensorFlow Lite平台的自动诊断方法,用于膝骨关节炎严重程度分级,通过迁移学习和优化模型实现94.48%的测试准确率,并利用Gemini-2.0-flash生成解释性结果,提升AI辅助筛查的可及性。

Comments 6 pages, 11 figures, Accepted and presented at the 2nd International Conference on Emerging Computational Intelligence (ICECI 2026), IEEE. Published in conference proceedings. To appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05726 2026-05-08 cs.AI 90%

SkillRet: A Large-Scale Benchmark for Skill Retrieval in LLM Agents

SkillRet:一种大规模技能检索基准,用于LLM代理

Hongcheol Cho, Ryangkyung Kang, Youngeun Kim

机构 * ThakiCloud

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出SkillRet基准,用于评估LLM代理中的技能检索。该基准包含17810个公开技能,提供63259个训练样本和4997个评估查询,通过任务特定微调显著提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00800 2026-05-04 cs.LG 90%

Generating Statistical Charts with Validation-Driven LLM Workflows

通过验证驱动的LLM工作流生成统计图表

Pavlin G. Poličar, Andraž Pevcin, Blaž Zupan

机构 * University of Ljubljana Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出一种结构化的LLM工作流,通过验证输出来生成多样且易读的统计图表,解决可视化特有的失败模式,如可读性和语义不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22628 2026-05-04 cs.CR cs.AI 90%

Sentra-Guard: A Real-Time Multilingual Defense Against Adversarial LLM Prompts

Sentra-Guard:一种实时多语言对抗对抗性LLM提示的防御系统

Md. Mehedi Hasan, Sk Tanzir Mehedi, Ziaur Rahman, Rafid Mostafiz, Md. Abir Hossain

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Sentra-Guard通过混合架构和分类器-检索器融合模块,实时检测并缓解针对大语言模型的劫持和提示注入攻击,实现多语言鲁棒性与高检测率。

Comments 11 pages, 5 figures. Preprint version under review in the area of Artificial Intelligence (cs.AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00060 2026-05-04 cs.AI cs.SY eess.SY 90%

TADI: Tool-Augmented Drilling Intelligence via Agentic LLM Orchestration over Heterogeneous Wellsite Data

TADI:通过异构钻井现场数据的代理LLM编排实现工具增强的钻井智能

Rong Lu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TADI通过代理LLM编排整合钻井数据,实现证据驱动的分析智能,展示了领域专用工具设计对分析质量的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27014 2026-05-01 cs.LG cs.CR 90%

Fidelity, Diversity, and Privacy: A Multi-Dimensional LLM Evaluation for Clinical Data Augmentation

保真度、多样性与隐私:面向临床数据增强的多维LLM评估

Guillermo Iglesias, Gema Bello-Orgaz, María Navas-Loro, Cristian Ramirez-Atencia, Mercè Salvador Robert, Enrique Baca-Garcia

机构 * Universidad Politécnica de Madrid(马德里理工大学) University Hospital Rey Juan Carlos(雷伊·卡洛斯大学医院) University Hospital Jimenez Diaz Foundation(吉梅尼兹·迪亚兹基金会大学医院) General Hospital of Villalba(维拉尔巴综合医院) University Hospital Infanta Elena(伊菲塔·埃莱娜大学医院) Universidad Catolica del Maule(马乌尔天主教大学) Madrid Autonomous University(马德里自治大学) CIBERSAM, ISCIII

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出多维LLM评估框架,用于生成符合ICD-10编码的合成心理健康评估报告,评估保真度、多样性及隐私安全,提升临床NLP训练数据质量。

Comments 9 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26955 2026-05-01 cs.CY cs.AI 90%

Policy-Governed LLM Routing with Intent Matching for Instrument Laboratories

基于意图匹配的政策引导LLM路由用于仪器实验室

Emmanuel A. Olowe, Danial Chitnis

机构 * School of Engineering The University of Edinburgh Edinburgh, UK(工程学院 苏格兰爱丁堡大学 爱丁堡 英国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出基于意图匹配的政策引导LLM路由系统,通过Routiium和EduRouter实现对实验室辅助系统的管理和控制,提升学习挑战度和任务完成率。

Comments IEEE EduCon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16516 2026-05-01 cs.CL 90%

Supercharging Agenda Setting Research: The ParlaCAP Dataset of 28 European Parliaments and a Scalable Multilingual LLM-Based Classification

提升议程设定研究:28个欧洲议会的ParlaCAP数据集及可扩展的多语言LLM分类方法

Taja Kuzman Pungeršek, Peter Rupnik, Daniela Širinić, Nikola Ljubešić

机构 * Jožef Stefan Institute(焦兹夫·斯蒂芬研究所) Faculty of Computer and Information Science(计算机与信息科学系) University of Ljubljana(卢布尔雅那大学) Institute of Contemporary History(当代历史研究所) Faculty of Political Science(政治科学系) University of Zagreb(扎格列布大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍ParlaCAP数据集,用于分析欧洲议会议程设定,并提出一种低成本的领域特定政策主题分类方法,通过多语言ParlaMint语料库构建分类器,展示其在目标领域内的有效性。

Comments 17 pages, 7 figures, 7 tables. Presented in the PoliticalNLP 2026 workshop, co-located with LREC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20749 2026-04-30 cs.CL 90%

Can LLM Agents Simulate Multi-Turn Human Behavior? Evidence from Real Online Customer Behavior Data

LLM代理能否模拟多轮人类行为?基于真实在线客户行为数据的证据

Yuxuan Lu, Jing Huang, Yan Han, Bingsheng Yao, Sisong Bei, Jiri Gesi, Yaochen Xie, Yisi Sang, Zheshen, Wang, Qi He, Dakuo Wang

机构 * Northeastern University(东北大学) Amazon.com, Inc.(亚马逊公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过购物案例研究,首次对先进LLM在模拟人类行为方面的准确性进行大规模定量评估,发现基于提示的LLM仅能生成11.86%的人类行为,通过微调提升至17.26%和33.86%的F1分数,建立首个严谨的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25862 2026-04-29 cs.SE cs.AI 90%

RESTestBench: A Benchmark for Evaluating the Effectiveness of LLM-Generated REST API Test Cases from NL Requirements

RESTestBench:一个评估LLM生成REST API测试用例有效性的基准

Leon Kogler, Stefan Hangler, Maximilian Ehrhart, Benedikt Dornauer, Roland Wuersching, Peter Schrammel

机构 * CASABLANCA hotelsoftware GmbH(CASABLANCA酒店软件公司) University of Innsbruck(因斯布鲁克大学) Technical University of Munich(慕尼黑技术大学) Diffblue Ltd(Diffblue有限公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 RESTestBench通过精确和模糊的自然语言需求评估LLM生成的REST测试用例有效性,引入基于需求的变异测试指标,评估两种生成方法在不同LLM中的表现。

Comments Accepted for EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25580 2026-04-29 cs.CL 90%

Bye Bye Perspective API: Lessons for Measurement Infrastructure in NLP, CSS and LLM Evaluation

再见视角API:NLP、CSS和LLM评估中的测量基础设施教训

David Hartmann, Manuel Tonneau, Angelie Kraft, LK Seiling, Dimitri Staufer, Pieter Delobelle, Jan Fillies, Anna Ricarda Luther, Jan Batzner, Mareike Lisker

机构 * Weizenbaum Institute(韦izenbaum研究所) TU Berlin(柏林技术大学) University of Oxford(牛津大学) KU Leuven(根特大学) Pleias(Pleias公司) Freie Universität Berlin(柏林自由大学) University of Bremen(不莱梅大学) ifib research(ifib研究) TU Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) HTW Berlin(柏林应用技术大学) University of Hamburg(汉堡大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 视角API的关闭使NLP、CSS和LLM评估领域失去自动化毒性测量的基准,本文探讨其依赖问题及对研究的影响,呼吁建立独立、可验证的测量基础设施。

Comments 13 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏