arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-07-24 至 2026-07-24 共收录 3
2607.21155 2026-07-24 cs.CV cs.AI 新提交

CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析

Hanseok Oh, Parishad BehnamGhader, Benno Krojer, Hyunji Lee, Paul Liang, Siva Reddy, Verna Dankers

机构 * New York University(纽约大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) UNC Chapel Hill(北卡罗来纳大学教堂山分校) MIT(麻省理工学院)

AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20526 2026-07-24 cs.AI cs.LG stat.ML 新提交

ConfidenceBench: Evaluating Confidence Calibration in Large Language Models

ConfidenceBench:评估大语言模型中的置信度校准

Matthew ffrench-Constant, Daniel Yang, Xinmeng Huang, Sanyam Kapoor

机构 * ETH Zurich(苏黎世联邦理工学院) University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

AI总结 研究针对大语言模型在特定场景下仅靠准确性不足的问题,提出ConfidenceBench校准基准,用Brier分数评估15个前沿LLMs口头置信度,经实验发现模型准确性与校准差异大,证明口头置信度校准是LLM可靠性重要维度,补充了基于准确性的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20429 2026-07-24 cs.CL cs.AI 新提交

More Is Not More: What Matters for Diversity in LLM Opinions?

更多并非更好:大语言模型观点多样性的关键因素是什么?

Qiyang Yao

机构 * New York University(纽约大学)

AI总结 研究大语言模型观点多样性,通过析因实验分离输入条件设定和交互架构两维度,在7个模型上评估,发现更多角色细节非单调增多样性,不同架构探索不同观点区,组合架构覆盖更广,低成本措施效果差,揭示多样性受干预结构形式和组合影响。

详情

展开后加载摘要…

URL PDF HTML 收藏