arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Scale AI

2026-07-20 至 2026-07-20 共收录 1
2607.16122 2026-07-20 cs.AI cs.LG 新提交

CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data

CRAFT:聚类评分标准以诊断大型语言模型的能力短板并生成针对性的微调数据

Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong He

机构 * Scale AI(Scale人工智能公司)

AI总结 研究针对评估应指导模型改进及提供训练数据的问题,提出CRAFT方法,将评分标准评估数据集转化为模型能力短板诊断,通过聚类能力描述、评估模型节点等生成微调数据,实验表明该方法能更精准诊断模型弱点并提升性能。

Comments 18 pages, 3 Tables, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏