arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-04-03 至 2026-04-03 共收录 3
2604.01594 2026-04-03 cs.AI

Do Large Language Models Mentalize When They Teach?

大型语言模型在教学时是否具备心智化能力?

Sevan K. Harootonian, Mark K. Ho, Thomas L. Griffiths, Yael Niv, Ilia Sucholutsky

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

AI总结 研究通过控制任务探讨LLM教学决策机制,发现LLM在教学策略上与人类相似,但Bayes-Optimal模型最佳解释其选择,提示提示合规性不等于教学效果提升。

Comments 9 pages, 5 figures. Workshop paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05500 2026-04-03 cs.AI

The Illusion of AI Expertise Under Uncertainty: Navigating Elusive Ground Truth via a Probabilistic Paradigm

人工智能专家能力的幻觉:通过概率范式导航 elusive 的真实地面真相

Aparna Elangovan, Lei Xu, Mahsa Elyasi, Ismail Akdulum, Mehmet Aksakal, Enes Gurun, Brian Hur, Saab Mansour, Ravid Shwartz Ziv, Karin Verspoor, Dan Roth

机构 * Independent Researcher(独立研究员) Amazon(亚马逊) Gazi University(加齐大学) University of Colorado(科罗拉多大学) Samsun University(萨姆松大学) The University Of Melbourne(墨尔本大学) New York University(纽约大学) RMIT University(皇家墨尔本理工大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出概率范式,揭示高置信度真实答案对专家高分的必要性,指出在真实答案变化大的数据集中,随机标注者与专家表现差异不大,强调在低专家表现时,按真实答案概率分层评估至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09031 2026-04-03 cs.LG cs.AI

A Comprehensive Graph Pooling Benchmark: Effectiveness, Robustness and Generalizability

图池化全面基准:有效性、鲁棒性和泛化性

Pengyun Wang, Junyu Luo, Yanxin Shen, Ming Zhang, Shaoen Qin, Hanwen Xing, Siyu Heng, Xiao Luo

机构 * University of Chicago(芝加哥大学) Peking University(北京大学) Nankai University(南开大学) University of Southern California(南加州大学) New York University(纽约大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文构建了包含17种图池化方法和28个图数据集的全面基准,系统评估了图池化方法在有效性、鲁棒性和泛化性三方面的性能,通过不同任务和噪声攻击实验验证其强大能力。

详情

展开后加载摘要…

URL PDF HTML 收藏