INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models
INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准
机构 * Fudan University(复旦大学)
AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。
Comments 18 pages, including appendices; 11 figures and 12 tables