DebugLM: Learning Traceable Training Data Provenance for LLMs
DebugLM: 为大语言模型学习可追溯的训练数据来源
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Southern California(南加州大学)
AI总结 DebugLM通过内置数据溯源能力,使LLM能追溯行为来源,支持测试时针对性修复,提升调试效率和模型鲁棒性。
高校专区
DebugLM: 为大语言模型学习可追溯的训练数据来源
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Southern California(南加州大学)
AI总结 DebugLM通过内置数据溯源能力,使LLM能追溯行为来源,支持测试时针对性修复,提升调试效率和模型鲁棒性。
评估LLM模拟的对话在建模不一致和不合作行为中的表现
机构 * Microsoft Corporation(微软公司) ; Penn State University(宾夕法尼亚州立大学) ; University of Southern California(南加州大学)
AI总结 本文提出CoCoEval框架,通过检测10种不一致和不合作行为评估LLM生成对话与人类对话的差异,发现LLM生成的对话在常规提示下较少出现不一致行为,但通过提示工程难以有效控制,监督微调可能导致过度生成特定行为。
道德基础Reddit语料库
机构 * University of Southern California(南加州大学)
AI总结 该研究提出一个包含16123条Reddit评论的语料库,用于标注道德情感,通过评估不同模型表现,强调了人工标注数据在AI对齐评估中的重要性。