arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Michigan(密歇根大学安娜堡分校)

2026-07-20 至 2026-07-20 共收录 3
2606.10931 2026-07-20 cs.CL 版本更新

It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO

一个样本就能带偏所有:单次GRPO打破对齐

Naihao Deng, Yilun Zhu, Naichen Shi, Clayton Scott, Rada Mihalcea

机构 * University of Michigan(密歇根大学) Northwestern University(西北大学)

AI总结 研究发现,仅用单个有偏样本进行一步GRPO训练就能诱导大语言模型产生系统性偏见,且刻板印象推理泛化到多种属性、类别和基准测试,揭示了对齐机制的关键脆弱性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07019 2026-07-20 stat.ME cs.AI stat.AP stat.ML 版本更新

Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length

延迟-响应理论模型:通过响应准确性和思维链长度评估大语言模型

Zhiyu Xu, Jia Liu, Yixin Wang, Yuqi Gu

机构 * Department of Statistics, Columbia University(哥伦比亚大学统计系) Department of Statistics, University of Michigan(密歇根大学统计系)

AI总结 针对大语言模型评估问题,提出延迟-响应理论(LaRT)模型,联合考虑响应准确性和思维链长度,通过引入关键参数建模,推导高效算法估计参数,经理论和模拟研究验证其优势,实际数据评估中表现优于项目反应理论(IRT)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10897 2026-07-20 cs.LG cs.SE 版本更新

AutoSpec: Automated Generation of Neural Network Specifications

AutoSpec:神经网络规范的自动生成

Shuowei Jin, Taobo Liao, Anuj Kalia, Xenofon Foukas, Huan Zhang, Cheng Tan, Z. Morley Mao, Francis Y. Yan

机构 * University of Michigan(密歇根大学) Microsoft Research(微软研究院) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对神经网络在学习增强系统中对模型安全鲁棒性需求,AutoSpec提出首个自动生成和评估神经网络规范的综合框架,通过基于树算法、统计认证框架及评估框架,经实验验证其性能优于手动定义规范和现有基线算法。

详情

展开后加载摘要…

URL PDF HTML 收藏