Deliberative Searcher: Improving LLM Reliability via Reinforcement Learning with constraints
反思搜索器:通过带有约束的强化学习提高大语言模型的可靠性
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 本文提出反思搜索器框架,结合置信度校准与基于检索的搜索,通过强化学习优化准确性,提升模型输出的可靠性。
Comments Accepted by ACL 2026