arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-27 至 2026-07-27 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2607.21632 2026-07-27 cs.CL 新提交 70%

A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models

一种基于共识的大语言模型相对偏好评估框架

Mohtashim Khan

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 针对大语言模型传统评估基准不足,本文提出基于共识的评估框架,通过不同模型对候选响应排序,以模型间一致性衡量质量,经多模型跨领域研究揭示偏好模式,提供了可扩展的比较评估方法。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21757 2026-07-27 cs.CY cs.AI cs.HC 新提交 62%

Co-design of LLM-based preference agents: participation may drive overtrust

基于大语言模型的偏好智能体协同设计:参与可能导致过度信任

Michael J. Fell

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨大语言模型模拟人类偏好引发的问题,通过12名参与者在家庭能源领域协同设计个人偏好智能体的定性研究,发现参与和过程透明度或成“过度信任引擎”,并将此发展为参与式偏好智能体设计核心机制。

Comments 43 pages (18 main text plus supplementary material), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12447 2026-07-27 cs.LG cs.AI 版本更新 62%

The Computational Basis of Confidence in Large Language Models

大语言模型中置信度的计算基础

Dharshan Kumaran, Viorica Patraucean, Maks Ovsjanikov, Petar Veličković, Nathaniel Daw

机构 * Google DeepMind(谷歌DeepMind) École Polytechnique(巴黎综合理工学院) Princeton University(普林斯顿大学)

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型中置信度的计算基础,利用统计决策置信度框架,通过答案 - 对数差异测试其预测特征,结果表明在多种任务中答案对数可作潜在决策变量读出,为多模态语言模型置信度提供解释并统一研究框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20556 2026-07-27 cs.AI 版本更新 57%

KeySI: An Interaction Framework for Tuning Text Embeddings Based on Human Feedback

KeySI:基于人类反馈调整文本嵌入的交互框架

Yan Zhu, Y. Chen, Rebecca Faust

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 研究针对预训练语言模型调整难的问题,提出KeySI交互框架,通过基于关键词的概念规范实现特征级反馈,减少人工文档处理需求,经用户研究等评估,证明其能有效捕捉用户意图并改善嵌入对齐。

Comments Accepted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏