arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-13 至 2026-05-13 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2605.12446 2026-05-13 cs.LG cs.CL 81%

ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models

ORCE:面向大型语言模型中明确自信度的顺序感知对齐

Chen Li, Xiaoling Hu, Songzhu Zheng, Jiawei Zhou, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Morgan Stanley(摩根大通)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种解耦且顺序感知的明确自信度校准框架,通过分离自信度估计与答案生成过程,提升校准和失败预测性能,同时保持答案准确性。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11398 2026-05-13 cs.AI cs.CL 81%

AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment

AcuityBench:评估语言模型对医疗紧急情况识别和不确定性对齐

Robin Linzmayer, Georgianna Lin, Di Coneybeare, Jason Chu, Trudi Cloyd, Manish Garg, Miles Gordon, Elizabeth Hartofilis, Benjamin Hong, Ashraf Hussain, Eugene Y. Kim, Oluchi Iheagwara King, Ross McCormack, Erica Olsen, John K. Riggins, Mustafa N. Rasheed, Dana L. Sacco, Vinay Saggar, Osman R. Sayan, Amit Shembekar, Janice Shin-Kim, Wendy W. Sun, Bernard P. Chang, David Kessler, Noémie Elhadad

机构 * Department of Computer Science, Columbia University, New York, NY, USA(计算机科学系,哥伦比亚大学,纽约,纽约州,美国) Department of Biomedical Informatics, Columbia University, New York, NY, USA(生物医学信息学系,哥伦比亚大学,纽约,纽约州,美国) Department of Emergency Medicine, Columbia University Irving Medical Center, New York, NY, USA(急诊医学系,哥伦比亚大学伊文思医疗中心,纽约,纽约州,美国)

专题命中 幻觉与事实性 :alignment(title);safety(abstract);分类 cs.CL、cs.AI

AI总结 AcuityBench通过统一框架评估语言模型对医疗紧急程度的识别能力,包含914个案例,涵盖明确和模糊情况,揭示模型在不同任务格式下的表现差异及不确定性处理问题。

Comments 41 pages, 5 figures. Preprint under review for the Track on Evaluations and Datasets at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10082 2026-05-13 cs.CL cs.LG 62%

FERA: Uncertainty-Aware Federated Reasoning for Large Language Models

FERA:面向大语言模型的不确定性感知联邦推理

Ruhan Wang, Chengkai Huang, Zhiyong Wang, Junda Wu, Rui Wang, Tong Yu, Julian McAuley, Lina Yao, Dongruo Zhou

机构 * Indiana University(印第安纳大学) The University of New South Wales(新南威尔士大学) The Chinese University of Hong Kong(香港中文大学) University of California San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 FERA通过迭代服务器-客户端协同细化,解决联邦推理中客户端可靠性依赖查询的问题,提升多步骤推理能力,实验表明其在多个推理基准上优于联邦训练和无训练基线。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11259 2026-05-13 cs.AI 57%

Template-as-Ontology: Configurable Synthetic Data Infrastructure for Cross-Domain Manufacturing AI Validation

模板作为本体:用于跨领域制造人工智能验证的可配置合成数据基础设施

Grama Chethan

机构 * Siemens Digital Industries Software(西门子数字工业软件)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种模板作为本体的方法,通过单一Python配置模块生成制造仿真和AI分析工具的统一数据结构,验证了跨领域制造AI验证的可行性。

Comments 18 pages, 1 fugure

详情

展开后加载摘要…

URL PDF HTML 收藏