arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-10 至 2026-08-10 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 2 篇

2608.07141 2026-08-10 cs.CV 新提交 78%

Human-AI Perceptual Alignment by Playing Hues and Cues

通过玩Hues and Cues游戏实现人类与AI的感知对齐

Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver, Pablo Hernández-Cámara, Valero Laparra, Jesús Malo

机构 * Universitat de València(瓦伦西亚大学) Image Processing Lab(图像处理实验室)

专题命中 幻觉与事实性 :alignment(title,abstract)

AI总结 本研究提出基于Hues and Cues游戏的评估框架,对比162个CVLMs与人类的颜色感知对齐,发现其在抽象领域偏离人类基线,筛选的预训练数据集可缓解错位。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07139 2026-08-10 cs.LG 新提交 57%

Online Conformal Prediction Beyond Feedback

超越反馈的在线共形预测

Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 针对超越反馈的在线共形预测场景,本文提出OCPQ方法,将标签高效预测器适配到该设置,实现了低查询率下的高覆盖率,且在真实数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏