arXivDaily arXiv每日学术速递 周一至周五更新

作者

Dan Jurafsky

Natural Language Processing

2026-04-13 至 2026-04-13 共收录 2
2604.03058 2026-04-13 cs.CL cs.AI cs.CY

Verbalizing LLMs' assumptions to explain and control sycophancy

使LLM的假设 verbal化以解释和控制谄媚行为

Myra Cheng, Isabel Sieh, Humishka Zope, Sunny Yu, Lujain Ibrahim, Aryaman Arora, Jared Moore, Desmond Ong, Dan Jurafsky, Diyi Yang

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出Verbalized Assumptions框架,通过揭示LLM对用户的错误假设来解释和控制其谄媚行为,发现LLM在面对用户提问时倾向于提供验证而非客观信息,进而提出可解释的细粒度控制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07220 2026-04-13 cs.CL

The Roots of Performance Disparity in Multilingual Language Models: Intrinsic Modeling Difficulty or Design Choices?

多语言语言模型性能差异的根本原因:内在建模难度还是设计选择?

Chen Shani, Yuval Reif, Nathan Roll, Dan Jurafsky, Ekaterina Shutova

机构 * Stanford University(斯坦福大学) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) University of Amsterdam(阿姆斯特丹大学)

AI总结 本文探讨多语言模型性能差异的根源,分析语言差异是否源于建模选择而非语言固有复杂性,并提出改进设计以实现更平衡的多语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏