arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Oracle(甲骨文)

2026-04-21 至 2026-04-21 共收录 4
2604.17771 2026-04-21 cs.CL cs.AI cs.DB

SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks

SPENCE:一种用于检测NL2SQL基准污染的句法探针

Mohammadtaher Safarzadeh, Hitesh Laxmichand Patel, Afshin Orojlooyjadid, Graham Horwood, Dan Roth

机构 * Oracle AI

AI总结 SPENCE通过生成句法变体检测NL2SQL基准中的污染,分析模型在句法差异下的执行准确性变化,揭示基准释放时间与污染程度的关系。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17768 2026-04-21 cs.AI

When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias

当视觉-语言模型评判而不看:揭示信息性偏差

Xiaohan Zou, Roshan Sridhar, Mohammadtaher Safarzadeh, Dan Roth

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Oracle AI

AI总结 研究揭示视觉-语言模型在评判时存在的信息性偏差问题,提出BIRCH方法通过修正图像与答案的一致性提升评判可靠性,实验显示偏差降低17%,性能提升9.8%。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11038 2026-04-21 cs.CL

Budget-Aware Anytime Reasoning with LLM-Synthesized Preference Data

具有预算意识的任意时间推理与LLM合成的偏好数据

Xuanming Zhang, Shwan Ashrafi, Aziza Mirsaidova, Amir H. Rezaeian, Miguel Ballesteros, Lydia B. Chilton, Zhou Yu, Dan Roth

机构 * Columbia University(哥伦比亚大学) Oracle AI

AI总结 研究在有限计算预算下LLM的推理行为,提出任意时间推理框架和Anytime Index指标,通过LLM合成的偏好数据提升推理效率与质量。

Comments ACL 2026 Findings, 13 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16397 2026-04-21 cs.CL cs.AI

From Attribution to Abstention: Training-Free Attention-Based Auditing for Clinical Summarization

从归因到回避:基于注意力的无训练审计用于临床摘要

Qianqi Yan, Huy Nguyen, Sumana Srivatsa, Hari Bandi, Xin Eric Wang, Krishnaram Kenthapadi

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Oracle Health AI

AI总结 本文提出ClinTrace框架,通过解码器注意力权重提取临床有用信号,实现无训练的注意力基于审计,提升临床摘要的透明性和可靠性,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏