arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-14 至 2026-05-14 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 7 篇

2605.13723 2026-05-14 cs.HC cs.AI cs.LG cs.SI 62%

Humanwashing -- It Should Leave You Feeling Dirty

人类洗清——它应该让你感到肮脏

Ben Wilson, Matimba Swana, Peter Winter, Matt Roach

机构 * Computational Foundry, Swansea University, UK(计算泉研究所,斯wansea大学,英国) University of Bristol, UK(布里斯托大学,英国)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文质疑'人类在环'概念在AI决策系统中的有效性,指出其可能掩盖真实过程与结果,提出'人类洗清'现象需引起关注。

Comments 10 pages, 1 figure. Reviewed and accepted for presentation at HHAI 2026, Brussels

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12521 2026-05-14 cs.CL cs.AI 62%

ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues

ToolWeave:复杂多轮工具调用对话的结构化合成

Dinesh Khandelwal, Gnana Prakash Punnavajhala, GPS Bhargav, Gaurav Pandey, Sachin Joshi, Hima Karanam, Dinesh Raghu

机构 * IBM Research(IBM研究院) IIIT Hyderabad(Hyderabad理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ToolWeave通过构建带有内置依赖关系的工具,生成更真实的多轮工具调用对话,减少参数幻觉,提升LLM在多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12510 2026-05-14 cs.SI cs.CL cs.CY 62%

WhatsApp Vaccine Discourse (WhaVax): An Expert-Annotated Dataset and Benchmark for Health Misinformation Detection

WhatsApp疫苗 discourse(WhaVax):一个专家标注的数据集和基准,用于健康虚假信息检测

Jônatas H. dos Santos, Julio C. S. Reis, Philipe Melo, João F. H. Olivetti, Thales H. Silva, Matheus Gontijo Guimaraes, Glaucio de Souza, Marcos A. Gonçalves, Fabricio Benevenuto, Filipe B. B. Zanovello, Marco A. G. Rodrigues, Cristiano X. Lima

机构 * Universidade Federal de Minas Gerais (UFMG)(巴西联邦大学矿务学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文介绍了WhaVax数据集,用于检测健康虚假信息,通过专家标注和多阶段协议生成高质量数据集,并评估了不同模型在数据稀缺条件下的表现。

Comments 10 pages. This is a preprint version of a paper accepted for the International AAAI Conference on Web and Social Media (ICWSM'26). Please cite the conference version rather than this preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13595 2026-05-14 cs.CL 57%

Inducing Artificial Uncertainty in Language Models

在语言模型中诱导人工不确定性

Sophia Hager, Simon Zeng, Nicholas Andrews

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 本文研究了在缺乏挑战性数据时如何通过诱导人工不确定性来提升语言模型的不确定性量化能力,通过训练探测器识别人工不确定性,实现了在困难数据上的高校准性,且对简单数据的性能影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10415 2026-05-14 cs.CL 57%

Aligning LLM Uncertainty with Human Disagreement in Subjectivity Analysis

对主观分析中语言模型不确定性与人类分歧的对齐

Junyu Lu, Deyi Ji, Xuanyi Liu, Lanyun Zhu, Bo Xu, Liang Yang, Xian-Sheng Hua, Hongfei Lin

机构 * School of Computer Science and Technology, Dalian University of Technology, China(大连理工大学计算机科学与技术学院) Tencent(腾讯) Peking University(北京大学) Tongji University(同济大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出DPUA框架,通过感知分歧和对齐不确定性,提升模型在主观分析中的可靠性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05157 2026-05-14 cs.LG cs.DS 57%

Efficient distributional regression trees learning algorithms for calibrated non-parametric probabilistic forecasts

高效分布回归树学习算法用于校准的非参数概率预测

Quentin Duchemin, Guillaume Obozinski

机构 * Swiss Data Science Center(瑞士数据科学中心) EPFL(瑞士联邦理工学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出高效算法用于校准非参数概率预测,通过min-max堆等数据结构提升计算效率,展示其在WIS和CRPS损失函数下的竞争力,并利用树结构实现可解释的群体条件覆盖保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12517 2026-05-14 cs.CL cs.AI cs.CV 54%

Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models

弥合缺失模态的差距:改进纯文本校准的视觉语言模型

Mingyeong Kim, Jungwon Choi, Chaeyun Jang, Juho Lee

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 幻觉与事实性 :分类 cs.CL、cs.AI;safety(comments);trustworthy(comments)

AI总结 本文提出Latent Imagination Module,通过预测文本输入的潜在嵌入来提升纯文本环境下视觉语言模型的准确性和校准性能。

Comments 9 pages, 16 figures. Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety across Modalities

详情

展开后加载摘要…

URL PDF HTML 收藏