Learning Latent Reasoning Traces for Scalar Reward Models End-to-End
学习标量奖励模型的端到端潜在推理轨迹
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL
AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
学习标量奖励模型的端到端潜在推理轨迹
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL
AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。
ConnectED:面向越南教学课程规划与学生学习的课程对齐AI系统
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI
AI总结 该研究提出以人为本的AI系统ConnectED,基于VietEduQwen构建,支持越南教育完整教学生命周期,经评估其准确率优于基准模型,可缩短教师备课时间且获师生高满意度。