Democratic ICAI: Debating Our Way to Steering Principles from Preferences
民主ICAI:通过辩论从偏好中推导指导原则
机构 * TCS Research(TCS研究)
AI总结 提出Democratic ICAI方法,通过结构化角色辩论收集多元理由,从偏好中提取更全面的指导原则,提升偏好预测准确性。
Comments Accepeted to the ICLR 2026 HCAIR Workshop, 40 pages
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
民主ICAI:通过辩论从偏好中推导指导原则
机构 * TCS Research(TCS研究)
AI总结 提出Democratic ICAI方法,通过结构化角色辩论收集多元理由,从偏好中提取更全面的指导原则,提升偏好预测准确性。
Comments Accepeted to the ICLR 2026 HCAIR Workshop, 40 pages
深度强化学习中SO(3)动作表示入门
AI总结 针对SO(3)动作表示在强化学习中的选择问题,系统评估了多种表示在PPO、SAC、TD3算法下的效果,发现切向量表示最可靠。
Comments Published at The Fourteenth International Conference on Learning Representations (ICLR 2026)
PreferThinker: 基于推理的个性化图像偏好评估
AI总结 提出预测-评估范式的推理框架,通过用户偏好画像和思维链推理实现个性化图像偏好评估,采用两阶段训练和相似性奖励提升性能。
Comments This paper is accepted by ICLR 2026