arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2572 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2572 篇

2607.27674 2026-07-31 cs.SE 新提交 94%

Can Large Language Models Resolve Real Java Merge Conflicts? An Evaluation with a Calibrated LLM-as-Judge

大语言模型能否解决真实的Java合并冲突?一项使用校准后的LLM作为评判者的评估

Bowen Shen

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对真实Java合并冲突,构建仅用推理信号的LLM求解器,经校准的LLM评判者评估发现,其解决冲突的覆盖和匹配开发者方案的表现优于传统工具AutoMerge,但结构正确性仍需确定性检查保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19828 2026-06-19 cs.CV 新提交 94%

3D-PLOT-LLM: Part-Level Object Tokens for 3D Large Language Models

3D-PLOT-LLM: 用于三维大语言模型的部件级对象标记

Jintang Xue, Xinyu Wang, Yixing Wu, Jingwen Chen, C. -C. Jay Kuo

机构 * University of Southern California(南加州大学) Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract)

AI总结 提出3D-PLOT-LLM,通过重组输入标记流使部件可直接通过LLM词汇寻址,无需分割解码器或边界框,在部件级基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12443 2026-06-12 cs.CY cs.AI cs.CL 新提交 94%

Occupational Prompting Reveals Cultural Bias in Large Language Models

职业提示揭示大型语言模型中的文化偏见

Maksim E. Eren, Andrea Brennen, Ryan C. Barron, Eric Michalak

机构 * U.S. Government(美国政府)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

AI总结 通过职业提示(如会计师、教师)替代国籍提示,研究开源LLM在价值观调查中的响应,发现不同职业导致文化地图内偏移,表明职业角色引发结构化价值模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09717 2026-08-11 cs.CL cs.AI cs.CY 新提交 93%

How Do Large Language Models Judge Social Attraction? Evidence from Theory-Grounded Persona Ratings Across Multiple LLMs and Humans

大型语言模型如何评判社交吸引力?来自跨多个LLM与人类的基于理论的人格特质评分的证据

Hasan Mahmud, Khawaja Abaid Ullah, Mohammad Javad Khojasteh, Jamison Heard, Prabu David

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探究LLMs能否评估社交吸引力,经三项研究发现,34个LLM评分稳定且与人类排序一致,但LLMs对吸引力与无吸引力档案的评分偏差更大,且两者均无性别呈现的显著整体效应。

Comments 9 pages, 2 figures, 2 tables. Includes technical supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19183 2026-06-18 cs.CL cs.AI 新提交 93%

Language Models as Interfaces, Not Oracles: A Hybrid LLM-ML System for Pediatric Appendicitis

语言模型作为接口而非预言机:用于小儿阑尾炎的混合LLM-ML系统

Soheyl Bateni, Maryam Abdolali

机构 * K. N. Toosi University of Technology(K.N. Toosi技术大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ClaMPAPP混合系统,利用LLM从自由文本中提取结构化特征,再由XGBoost分类器进行诊断,在两个独立队列中优于端到端LLM,提高了诊断稳定性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08085 2026-08-11 cs.DC cs.AI 新提交 93%

Effect of Abstractions and Prompting Strategies on LLM-Guided High-Performance Optimizations

抽象与提示策略对大语言模型(LLM)指导的高性能优化的影响

Jiří Klepl, Maty'aš Brabec, Martin Kruliš

专题命中 评测与基准 :LLM(title,title_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文探究传统抽象对LLM指导并行HPC应用优化的影响,以PolyBench为基准评估发现,获特定优化目标的LLM生成C代码的性能与有效性优于成熟框架,建议探索可验证的替代优化方法。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00054 2026-08-04 cs.AI cs.SE 新提交 93%

RAG-TESTER: Automated End-to-End Testing of Retrieval-Augmented Large Language Models

RAG-TESTER:检索增强型大语言模型的自动化端到端测试工具

Ange Maiztegi, Jon Ayerdi, Miren Illarramendi, Aitor Arrieta

机构 * Mondragon University(蒙德拉贡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI

AI总结 RagTester是针对RAG系统的自动化端到端测试方法,通过生成测试用例、利用LLM评估结果,在24种配置中20种优于基线,可有效检测RAG的交互故障并支持部署评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07494 2026-08-11 cs.HC cs.AI 新提交 93%

How to Ask the AI: A User Perspective Survey for Large Language Model Prompting

如何向AI提问:大型语言模型提示工程的用户视角调查

Yiqun Zhang, Yunfan Zhang, Mingjie Zhao, Sen Feng, Yiu-ming Cheung

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract,abstract_cn)

AI总结 该研究从用户视角开展大型语言模型提示工程调查,提出提示有效性评估策略、应用工作流并维护开源项目,为用户制定适配场景的有效提示提供可操作指南。

Comments Accepted to TAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29389 2026-08-03 cs.LG cs.SE 新提交 93%

Simulation Code Generation for Fluid Systems using Large Language Models: Benchmarking Models and Prompting Strategies

基于大语言模型的流体系统仿真代码生成:模型与提示策略的基准测试

Jan Marius Stürmer, Jascha Knack, Tobias Koch, Andreas Weinmann

机构 * German Aerospace Centre (DLR)(德国航空航天中心) Technische Hochschule Würzburg-Schweinfurt(维尔茨堡-施韦因富特应用技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract,abstract_cn)

AI总结 本研究通过系统比较10种大语言模型与6种提示策略,评估其将流体系统模型图表示转换为WNTR、Modelica代码的能力,为相关设计流程提供指导,同时指出仿真保真度仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07529 2026-08-11 cs.CL cs.AI 新提交 93%

WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management

WuYuEval:面向固体废物管理的大语言模型多级基准测试

Yi Zhang, Hongyang Wang, Zheng Hao Leong, Zihao Wu, Kaijun Lin, Zhixing Pan, Qixun Huangfu, Wei Ren, Wenyan Wu, Fangyun Wang, Wenting Yu, Hengyu Lin, Muling Yang, Zongguo Wen

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 WuYuEval是面向固体废物管理的多级基准测试,含基础与专家模块,评估33个LLM的SWM能力,发现其在专业任务表现差,为开发专用基础模型提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20526 2026-07-24 cs.AI cs.LG stat.ML 新提交 93%

ConfidenceBench: Evaluating Confidence Calibration in Large Language Models

ConfidenceBench:评估大语言模型中的置信度校准

Matthew ffrench-Constant, Daniel Yang, Xinmeng Huang, Sanyam Kapoor

机构 * ETH Zurich(苏黎世联邦理工学院) University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 研究针对大语言模型在特定场景下仅靠准确性不足的问题,提出ConfidenceBench校准基准,用Brier分数评估15个前沿LLMs口头置信度,经实验发现模型准确性与校准差异大,证明口头置信度校准是LLM可靠性重要维度,补充了基于准确性的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19424 2026-07-23 cs.CR cs.AI cs.CL 新提交 93%

JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

JailMeter:一种基于证据的大语言模型越狱攻击评估框架

Qingjia Huang, Jingyu Zhang, Jianguo Wu, Yakai Li, Weijuan Zhang, Yankai Rong, Junyi Yao, Shengzhi Zhang, Xiaoqi Jia

专题命中 评测与基准 :SLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);small language model(abstract)

AI总结 针对大语言模型越狱攻击评估标准和方法不一致的问题,提出基于证据评估框架JailMeter,受信息瓶颈理论启发用双反馈优化过滤噪声,在JailMeter-Eva上评估准确率达97.27%,还提炼出JailMeter\textsubscript{SLM}降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14109 2026-07-17 cs.CL cs.AI 新提交 93%

Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation

简单性悖论:揭穿关于大语言模型评估中提示和数据集的神话

Inder Preet, Shuxin Lin, Dhaval Patel

专题命中 评测与基准 :LLM(title,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型评估中提示和数据集相关问题,通过对8种提示技术在10个MCQA数据集上的实证研究,发现基线提示常优于复杂技术,还研究了相关关键现象,表明LLM评估社区或使提示工程过复杂,存在性能差距,为模型改进提供机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28062 2026-06-29 cs.DB cs.AI cs.CL cs.IR 新提交 93%

Single and Multi Truth Data Fusion using Large Language Models

使用大型语言模型的单真值与多真值数据融合

Hira Beril Kucuk, Norman W Paton, Jiaoyan Chen, Zhenyu Wu

机构 * Department of Computer Science University of Manchester(计算机科学系曼彻斯特大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 研究利用大型语言模型(LLM)解决表格数据的单真值和多真值数据融合问题,通过多种提示策略在三个基准数据集上实验,结果表明LLM方法优于传统无监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27383 2026-06-29 cs.DL cs.AI cs.CL 新提交 93%

CalBrief: A Pilot Diagnostic Benchmark for Evidence-Calibrated Scientific Briefing with Large Language Models

CalBrief:面向大型语言模型证据校准科学简报的试点诊断基准

Yu Fu, Yongqi Kang, Yong Zhao

机构 * Sichuan University(四川大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出CalBrief基准,通过16个科学证据包和96个人工验证要点,诊断LLM在证据校准简报中的不足,发现保守性主要源于标签空间扩展而非信号注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17350 2026-06-17 cs.CL cs.AI 新提交 93%

Do Large Language Models Always Tell The Same Stories?

大型语言模型总是讲述相同的故事吗?

Thennal DK, Hans Ole Hatzel

机构 * University of Hamburg(汉堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 通过对比框架和人类故事数据集,研究10种LLM生成故事的叙事相似性,发现LLM故事比人类故事更相似,前沿模型趋向于“平均”通用叙事,且常见缓解策略无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31639 2026-07-01 cs.CR cs.AI cs.GT cs.LO 新提交 92%

A Lifecycle and Application-Stack Survey of Large Language Model Vulnerabilities: Attacks, Risks, Defenses, and Open Problems

大语言模型漏洞的生命周期与应用栈调查:攻击、风险、防御与开放问题

Seyed Bagher Hashemi Natanzi, Bo Tang

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 本文通过生命周期与应用栈视角系统化梳理大语言模型系统的漏洞,涵盖数据收集、预训练、对齐、供应链、检索、推理、工具执行和部署等阶段,分析攻击、风险与防御,并提出安全研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31307 2026-07-01 cs.CL 新提交 92%

When the Database Fails: Prompting LLM Dialogue Agents for Safe Recovery in Task-Oriented Dialogue

当数据库失败时:提示LLM对话代理在任务导向对话中安全恢复

Mohammad Alijanpour Shalmani, Alale Rezvani Boroujeni, Jiann Shiun Yuan

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院) Department of Marketing, University of Central Florida(中佛罗里达大学市场营销系)

专题命中 评测与基准 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对任务导向对话中后端数据库失败导致LLM产生不安全响应的问题,提出基于提示的轻量级恢复策略,无需重训练即可将幻觉率降低42-50%。

Comments Accepted at SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15577 2026-06-16 cs.AI 新提交 92%

Large Language Models as Optimizers: A Survey of Direct vs. Tool-Augmented Approaches and Their Performance Frontiers

大型语言模型作为优化器:直接方法与工具增强方法的调查及其性能前沿

Roko Peran, Luka Hobor, Mihael Kovac, Mario Brcic

机构 * University of Zagreb, Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 综述LLM作为优化器的三种范式(直接优化、工具增强优化、工具创造优化),分析性能前沿与推理差距,探讨直接优化的未来潜力与工具增强优化的可审计性之间的权衡。

Comments 6 pages, 1 figure, 2 tables, accepted at 49th ICT and Electronics Convention, MIPRO - https://mipro.hr; Paper ID: #23463

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26348 2026-07-30 cs.CL cs.AI cs.CY cs.HC 新提交 92%

When Synthetic Users Fail: A Cross-Domain Benchmark of LLM-Simulated Human Survey Responses

当合成用户失效时:LLM模拟人类调查回复的跨领域基准测试

Zihan Chen, Di Zhu, Lei Nico Zheng

机构 * Stevens Institute of Technology(史蒂文斯理工学院) University of Massachusetts Boston(马萨诸塞大学波士顿分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究构建跨领域基准与评估框架,发现LLM模拟人类调查回复存在个体表现逊于基线、过度确定人口统计特征等失效问题,且无法通过更大模型纠正,会误导细分目标决策。

Comments 19 pages, 5 figures, 4 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26130 2026-06-26 cs.CL cs.AI cs.DL 新提交 92%

Thinking Like a Scientist? A Structural Study of LLM-Generated Research Methods

像科学家一样思考?LLM生成研究方法的结构性研究

Francesca Carlon, Brecht Verbeken, Vincent Ginis, Andres Algaba

机构 * Data Analytics Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学数据分析实验室) imec-SMIT, Vrije Universiteit Brussel(布鲁塞尔自由大学imec-SMIT) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过对比LLM在最小提示下生成的方法建议与论文实际方法,发现LLM在模型选择上存在显著偏差,且方法多样性大幅缩减。

Comments 46 pages, 13 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25782 2026-06-25 cs.CL cs.AI 新提交 92%

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation

编码器足够吗?用于LLM对抗性评估的编码器与解码器安全评判器的系统比较

Han Jeon, Shiv Medler, Joseph Voyles, Matt Wood

机构 * PricewaterhouseCoopers(普华永道)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 系统比较ModernBERT系列编码器分类器与基于LLM的解码器评判器在识别有害LLM输出上的性能,发现编码器可在保持低延迟和低成本的同时接近LLM评判器的效果。

Comments 13 pages, 5 figures, Accepted into ICANN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08247 2026-06-09 eess.AS cs.AI cs.LG eess.SP 新提交 92%

AeroSpectra Sentinel: An Auditable LLM Prompt-Chaining Decision-Support Workflow for Acute Asthma Risk Assessment from Respiratory Sounds and Clinical Signals

AeroSpectra Sentinel:一种用于从呼吸音和临床信号进行急性哮喘风险评估的可审计LLM提示链决策支持工作流

Aueaphum Aueawatthanaphisut

机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology, Thammasat University(泰国朱拉隆梭国际技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出AeroSpectra Sentinel,结合STFT呼吸音分析、轻量ML筛查、临床特征融合和五阶段LLM提示链,实现可审计的急性哮喘风险评估,在公开数据集上验证了音频筛查和LLM工作流的有效性。

Comments 10 pages, 8 figures, 5 tables, 14 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12391 2026-08-14 cs.CL cs.AI cs.LG 新提交 92%

Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models

面向大语言模型复杂图推理的统一多维度基准

Fali Wang, Ali Al-Lawati, Iliyas Bektas, Jinxuan Fang, Alek Melenski, Tianxiang Zhao, Yao Ma, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有图推理基准的局限,提出半自动框架构建含202个任务的统一多维度基准,评估LLM在不同推理模式下的表现,揭示模型局限并提供实证指导。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25561 2026-06-25 cs.CR 新提交 92%

CrypFormBench: Benchmarking Formal Analysis Capability of Large Language Models for Cryptographic Schemes

CrypFormBench:评估大型语言模型在密码方案形式化分析中的能力基准

Zhaoxuan Li, Qionglu Zhang, Hengyuan Liu, Xiaoyan Gu, Xianhui Lu, Hongbo Liu, Bingzheng Wang, Haihui Fan, Ziming Zhao, Rui Zhang, Li Zhou

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出CrypFormBench基准,涵盖符号与计算安全,评估LLM在密码方案形式化分析中的五项核心能力,发现模型在生成、转换和修正方面表现有限。

Comments 23 pages, 17 figures, FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17582 2026-06-17 cs.DB 新提交 92%

Collaborative Large and Small Language Models for Accurate and Scalable Data Repair

协作式大小语言模型实现准确且可扩展的数据修复

Qian Chen, Jianwei Wang, Wenjie Zhang

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 提出LasRepair框架,利用大语言模型作为指导者选择全局修复上下文,小语言模型作为校正者高效修复错误数据,并通过EM过程和置信度加权进一步提升修复质量。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24573 2026-07-28 cs.AI 新提交 92%

LLM-SoccerArena: Benchmarking LLMs on Real-World Predictions in Sports

LLM - 足球竞技场:在体育领域的现实世界预测中对大语言模型进行基准测试

Jonas Schröder, Jonas Schweisthal, Oliver Müller, Markus Weinmann, Stefan Feuerriegel

机构 * MCML & LMU Munich(慕尼黑机器学习中心及慕尼黑大学) Paderborn University(帕德博恩大学) University of Cologne(科隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究旨在评估大语言模型预测现实世界体育赛事的能力,核心方法是引入LLM - 足球竞技场这一前瞻性实时基准,通过对2026年世界杯的评估,详细分析模型性能各维度表现,为LLMs预测性能提供新证据及开源平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20436 2026-06-19 cs.CR cs.AI 新提交 92%

Multi-View Decompilation for LLM-Based Malware Classification

基于LLM的恶意软件分类的多视角反编译

Bercan Turkmen, Vyas Raina

机构 * Independent Researcher(独立研究员) SPARK

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出多反编译器视角提升LLM恶意软件分类性能,通过Ghidra和RetDec的互补伪C代码提高召回率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11493 2026-08-13 cs.AI cs.LG 新提交 92%

From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation

从提示工程到行为对齐:用于推荐评估的个性化大语言模型评判者

Alireza S. Ziabari, Kat Ellis, Colleen Chan, Ding Tong

机构 * Netflix(网飞公司)

专题命中 评测与基准 :LLM(title,summary_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 该研究针对离线推荐评估中LLM存在的双向合理化问题,提出序列行为对齐框架,经真实日志验证,其Macro-F1较零样本基线提升32.19%,可缓解失效模式且无需人工管道开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09925 2026-08-11 cs.CL cs.AI 新提交 92%

From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch

从价值到基准:评估用于荷兰政府场景的大型语言模型

Laurens Samson, Iva Gornishka, Gossa Lô, Yuki M. Asano, Sennay Ghebreab

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出面向荷兰政府场景的“Grip on LLMs”评估框架,确定六大评估维度,发现模型在质量、成本、能耗等维度存在权衡,发布模型概览供政府LLM选择使用。

Comments Accepted at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏