Benchmarking Cognitive Biases in Large Language Models as Evaluators
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Publishsed at ACL 2024. 29 pages, 9 figures, 14 tables
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Publishsed at ACL 2024. 29 pages, 9 figures, 14 tables
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 9 pages (excluding references), accepted to ACL 2024 Main Conference
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments NAACL 2024 Findings
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 5 pages, 4 figures. Conference: ICASSP 2024
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 15 pages main content, 27 pages overall, 2 Figures, accepted for publication at ISWC 2023 research track
诚实的人工智能顾问:偏好错位下大语言模型诚实性的预设基准
机构 * Amazon Lab126, HW Tech Org.(亚马逊实验室126,硬件技术组织) ; Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡分校) ; Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth 分校)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 通过Crawford-Sobel廉价谈话模型构建基准,评估大语言模型在偏好冲突时是否诚实,发现模型过度揭示信息,偏离策略最优。
Comments 19 pages. Code and data: https://github.com/iHamidHasani/cheap-talk-llm-benchmark
哪种大语言模型是你理想的陪伴者?基于成人依恋理论评估大语言模型的情感陪伴能力
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究基于成人依恋理论构建情感陪伴基准ECBench,评估32个LLM的依恋倾向,探究其在多轮交互中的表现及可调整性,为情感陪伴类LLM的选择提供理论与工具支持。
ProbGuard:基于大语言模型输出分布的校准安全风险估计
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 研究针对现有LLM安全防护的确定性范式局限,提出概率架构无关防护框架ProbGuard,利用早期输出分布信号校准安全风险,实现提前终止不安全输出,在9种组合设置及6种越狱攻击中均表现优异。
人不只是其所属国家:在欧洲范围内解耦大型语言模型(LLM)价值对齐的社会决定因素
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI
AI总结 本研究依托欧洲社会调查,发现LLMs与不同社会人口学群体的价值观对齐存在差异,国籍作为单独变量的解释力与全部社会人口学变量相当,国家与社会人口学因素在解释对齐模式上互补。
Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society)
当更好的代码手册还不够:LLM政治事件编码中的预测性能与行为可靠性
机构 * Independent Researcher(独立研究者) ; Illinois Institute of Technology(伊利诺伊理工学院) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL
AI总结 本研究探讨在政治事件编码任务中,将专家代码手册优化为LLM友好形式能显著提升分类性能,但预测增益并未完全转化为行为可靠性,模型在代码手册变化下仍可能失效。
Comments 13 pages, 3 figures, 13 tables. Revised version with updated experiments, behavioral reliability analyses, and additional API-model results
JudgeArena:用于可复现LLM-评判者评估的统一框架
机构 * University of Freiburg(弗莱堡大学) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Microsoft AI(微软人工智能部门) ; Cohere Labs(Cohere实验室) ; Prior Labs(Prior实验室)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL
AI总结 JudgeArena是统一主流LLM评判者基准的开源框架,支持可替换评判者,配备调优开源评判者配置,可高精度模拟LMArena Elo分数,减少对闭源模型的依赖,提升评估的透明度与可复现性。
ModelEquivBench:LLM生成优化模型的多关系验证评估系统
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出多关系评估系统ModelEquivBench,将其用于评估GPT-5.4等三个LLM生成的优化模型,发现不同模型在特征不同阶段失败,无法简化为单一准确率分数。
Comments 9 pages, 2 figures, 3 tables
海报:通过现实世界风险场景重新思考大语言模型代码生成中的安全性
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究LLM代码生成的安全行为,识别出三种风险场景,构建含2700个测试用例的基准评估安全性,发现先进LLMs平均漏洞率超56%,证明安全感知提示可大幅降低风险。
解耦侦察与利用:测量基于LLM的Web渗透测试的能力边界
机构 * University of Science and Technology of China(中国科学技术大学) ; Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州先进研究院) ; Nanjing University of Science and Technology(南京理工大学) ; Research Institute, Runjian Co., Ltd(润杰有限公司研究院)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出解耦评估框架分离侦察与利用阶段,发现LLM代理在准确漏洞上下文下功能成功率可达90.0%,但自主侦察召回率仅约50.0%,揭示了能力差距。
评判评判者:LLM-as-a-Judge pipelines中偏见缓解策略的系统评估
机构 * Independent Researcher(独立研究员)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI
AI总结 本文系统评估了LLM-as-a-Judge pipelines中九种偏见缓解策略,发现风格偏见是最主要的偏见类型,且所有模型在扩展对上偏好简洁性,但截断控制能区分质量和长度,表明质量敏感的评估而非单纯长度偏见。
Comments 22 pages, 4 figures. Published in Transactions on Machine Learning Research (2026)
Journal ref Transactions on Machine Learning Research (2026)
无效度的可靠性:LLM-as-a-Judge 模型在一致性、稳定性和偏差上的系统性大规模评估
机构 * UC Berkeley School of Information(加州大学伯克利分校信息学院)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL
AI总结 本研究通过大规模系统性评估(21个裁判模型、118次运行、约54.1万次判断),发现LLM-as-a-Judge在一致性、稳定性和偏差方面存在普遍问题,包括kappa通缩、排名偏移、高重测信度与严重位置偏差并存,并提出了最小可行验证协议。
下一代LLM智能体系统中合作的演化动力学:跨提供商的实证扩展
机构 * Institución Universitaria Colegio Mayor del Cauca(大学机构科尔多瓦大学)
专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI
AI总结 本研究通过扩展Willis等人的基准,测试2025-2026年四个前沿LLM模型在迭代囚徒困境中的合作偏差,发现合作偏差普遍存在但提供商间差异显著,且噪声仍是普遍挑战。
Comments v2 (erratum): two truncated Gemini 3.1 Pro libraries regenerated; cooperative-plurality 9/12->10/12, conclusions unchanged. 11 pages, 3 figures, 8 tables. Extends arXiv:2501.16173. Code and n=500 replication: https://github.com/arqFranciscoLeon/evollm (archived: https://doi.org/10.5281/zenodo.20248615)
法官偏爱英语吗?评估LLM作为法官时的语言切换不变性
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出Judge-LS协议,通过语言切换变体评估LLM作为自动法官的可靠性,发现语言切换导致10.7-14.4%偏好翻转,但翻译等价测试未显示系统英语偏好。
科米-亚兹瓦语-俄语平行语料库及零样本和少样本LLM翻译评估协议
机构 * HSE University, Perm, Russia(俄罗斯彼尔姆国立经济大学) ; School of Management SKOLKOVO, Moscow, Russia(莫斯科SKOLKOVO管理学院)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 构建首个科米-亚兹瓦语-俄语平行语料库,并提出显式评估协议,研究大语言模型在极度低资源濒危语言翻译中的零样本和检索增强少样本性能。
Comments 18 pages, 6 tables, 3 figures
社交媒体立场检测的上下文化提示
机构 * Institute of Intensive Care, University Hospital of Zurich and University of Zurich(重症医学研究所,苏黎世大学医院和苏黎世大学) ; Institute of Computer Science, University of Goettingen(计算机科学研究所,哥廷根大学) ; GESIS Leibniz Institute for the Social Sciences(社会科学研究莱比锡研究所) ; Institut für Publizistik, Johannes Gutenberg-University Mainz(主笔研究所,美因茨约翰· Gutenberg 大学) ; Ubiquitous Knowledge Processing Lab, Technical University of Darmstadt(无处不在知识处理实验室,达姆施塔特技术大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)
AI总结 通过系统实验,研究在零样本提示中融入真实世界、推导和LLM生成的上下文特征对Twitter立场检测的影响,发现LLM生成的目标描述能持续提升准确率,而其他用户元数据效果不一。
本体约束的多LLM评分在预测处理文献中假设支持度的应用
机构 * University of Edinburgh(爱丁堡大学) ; University of Cambridge(剑桥大学)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI
AI总结 本文提出一个本地多LLM流水线,通过本体约束对预测编码文献中的研究进行评分,将异构文献映射到定量证据空间,并揭示假设间的结构化分歧。
Comments 33 pages, 5 tables and 9 figures
从“是什么”到“怎么样”和“为什么”:与远程家庭成员共享老年人被动追踪数据的LLM生成回顾性摘要
机构 * Northeastern University(东北大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究利用大型语言模型(LLM)从多模态追踪数据生成回顾性摘要,通过技术探针和访谈重新设计系统,显著提升了远程家庭成员对摘要的满意度、帮助性、信任和接收意愿,并提出了支持其从“是什么”到“怎么样”和“为什么”的认知转变的设计启示。
LLM作为评判者的几何学:为什么LLM间共识不等于人类对齐
专题命中 评测与基准 :LLM(title,title_cn);preference optimization(abstract);分类 cs.CL
AI总结 通过几何量测量,发现LLM评判者之间高度一致但与人类对齐差,其评分子空间与人类子空间几乎正交,共识源于子空间坍缩而非人类对齐。
MCP-Persona:通过环境模拟在真实个人应用上基准测试LLM智能体
机构 * Tsinghua University(清华大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有基准忽略个人社交应用中工具与个人账户或本地数据库交互的挑战,提出MCP-Persona基准,通过模拟真实个性化MCP工具评估LLM智能体性能,实验表明现有智能体在个性化工具使用上存在显著困难。
Comments ICML 2026 Camera Ready
基于LLM引导搜索的双变量自行车码的进化发现
机构 * IBM Research(IBM研究院) ; IBM T. J. Watson Research Center(IBM T.J. 巴特勒研究中心)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI
AI总结 提出一种LLM引导的进化工作流,通过变异生成双变量自行车码和扰动变体的Python程序,在约1650次迭代中筛选约2×10^5个候选码,发现了465个不同候选码,包括非CSS扰动码和CSS码,展示了LLM引导的程序进化在结构化量子码发现中的实用性。
DECK: LLM幻觉的一致性×置信度分类法
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 评测与基准 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL
AI总结 提出一种基于样本间一致性和词级置信度的2×2分类法(DECK),将LLM幻觉分为四个行为区域,每个区域对应可检测的评分器家族,并通过实验验证其有效性及识别出输出级不确定性评估的普遍盲点。
Comments 18 pages, 3 figures, 5 tables
FALAT: 通过依赖引导搜索追踪LLM智能体轨迹中的失败
机构 * SPEAR Lab(SPEAR实验室) ; Concordia University(康科德大学) ; DePaul University(德保罗大学)
专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI
AI总结 提出FALAT框架,通过依赖引导搜索方法,在LLM智能体轨迹中识别导致失败的关键步骤和责任智能体。