arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2026-07-14 至 2026-07-14 共收录 4
2607.11871 2026-07-14 cs.LG cs.AI cs.CL 新提交

Inside the Unfair Judge: A Mechanistic Interpretability Account of LLM-as-Judge Bias

剖析不公平的评判者:基于大语言模型作为评判者的偏差的机械可解释性分析

Zixiang Xu, Sixian Li, Huaxing Liu, Xiang Wang, Shuai Li, Zirui Song, Xiuying Chen

机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Southern California(南加州大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

AI总结 研究大语言模型作为评判者的偏差,提出偏差在隐藏状态有表示层面解释。通过七位评判者等实验发现,偏差输入沿特定子空间移动,操纵隐藏状态可控制评分,线性投影能预测评判失败,统一多方面内容。

Comments 58 pages, 13 figures, 30 tables; project page: https://xzx34.github.io/unfair-judge/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10633 2026-07-14 cs.LG cs.AI 新提交

Auditing Construct Overlap in Explainable Machine Learning: Evidence from Burnout-Depression Prediction Across Student Cohorts

可解释机器学习中构建重叠的审计:来自跨学生队列倦怠-抑郁预测的证据

Alireza Dehghan, Negin Ashrafi

机构 * Sharif University of Technology(伊朗德黑兰谢里夫理工大学) University of Southern California(美国南加州大学)

AI总结 研究可解释机器学习应用于心理健康结果时构建重叠问题,通过弹性网络管道及多组数据验证,发现特质焦虑和健康满意度占主导,经残差化实验揭示机制,指出残差化协议可用于相关XAI研究避免误判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09794 2026-07-14 cs.AI cs.MA 新提交

Agentic Context Learning with Self-Discovered Specification

通过自我发现的规范进行智能体上下文学习

Jike Zhong, Ming Li, Yuxiang Lai, Ziyan Yang, Jingyu Xie, Jihyung Kil, Zheda Mai, Shao-Yuan Lo, Ren Xiang, Konstantinos Psounis, Yuanyuan Lei

机构 * University of Southern California(南加州大学) University of Florida(佛罗里达大学) Emory University(埃默里大学) Adobe Research(Adobe研究院) The Ohio State University(俄亥俄州立大学) National Taiwan University(国立台湾大学)

AI总结 研究上下文学习困难的原因,发现其不仅需内容获取还需规范获取。设计PSCI干预措施,提取并强化局部规范,在多个模型上取得显著提升,验证了规范获取的重要性,表明上下文学习依赖内容与规范获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09692 2026-07-14 cs.LG cs.CL 新提交

Reference-Based Distillation Detection in LLMs

大语言模型中基于参考的蒸馏检测

Rajat Rawat, Sizhe Chen, Akshay Anand, Michael Duan, Bob Rotsted, Sewon Min

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校) University of Southern California(南加利福尼亚大学) OpenAI

AI总结 研究旨在检测大语言模型是否经蒸馏而来,提出基于参考的成员推理蒸馏检测方法,通过比较模型与不同候选教师输出的优先对齐程度识别教师及蒸馏证据,能处理未知管道,扩展到开放世界设置,应用于当代模型获潜在蒸馏关系新证据。

Comments 27 pages (14 main), 21 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏