arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-05 至 2026-03-05 共收录 1 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1 篇

2603.04069 2026-03-05 cs.CL cs.AI 79%

Monitoring Emergent Reward Hacking During Generation via Internal Activations

通过内部激活监控生成过程中的涌现奖励黑客行为

Patrick Wilhelm, Thorsten Wittkopp, Odej Kao

机构 * Technical University of Berlin(柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 通过分析内部激活来监控生成过程中的奖励黑客行为,提升微调语言模型的安全性。

Journal ref ICLR2026 Workshop: Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏