arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-28 至 2026-04-28 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 7 篇

2502.14888 2026-04-28 cs.CV cs.AI 79%

Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models

超越跨模态对齐:测量和利用模态差距在视觉-语言模型中

Hanqi Yan, Xiangxiang Cui, Lu Yin, Jindong Gu, Paul Pu Liang, Yulan He, Yifei Wang

机构 * King’s College London(伦敦国王学院) University of Surrey(萨里大学) University of Oxford(牛津大学) MIT CSAIL(麻省理工学院CSAIL实验室) The Alan Turing Institute(阿兰·图灵研究院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出通过测量和利用模态差距改进视觉-语言模型的下游任务,引入模态主导分数和自动可解释性度量,实现轻量级编辑和系统分析。

Comments accepted by ACL26-findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22775 2026-04-28 cs.HC 78%

Cognitive Alignment Deciphered: A Self-Developed Scenario-Based Prompt Scale Coupled with Representational Similarity Analysis and Social Network Analysis for Unraveling Bias Mechanisms Across Humans and LLMs

认知对齐解码:一种自研的基于场景的提示量表结合表征相似性分析和社会网络分析,用于揭示人类和大语言模型中的偏见机制

Chengrui Zhou

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 本文提出基于场景的CBAS量表,结合RSA和SNA分析,揭示人类和LLM的偏见机制,通过干预提升LLM响应准确率,建立可复现的认知对齐研究流程。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24076 2026-04-28 cs.AI cs.CL cs.CR 73%

An Information-Geometric Framework for Stability Analysis of Large Language Models under Entropic Stress

一个信息几何框架用于在熵应力下分析大语言模型的稳定性

Hikmat Karimov, Rahid Zahid Alekberli

机构 * Institute of Defense Technologies and Cybersecurity, Azerbaijan Technical University(国防技术与网络安全研究所,阿塞拜疆技术大学)

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个信息几何框架,通过整合任务效用、熵、内部结构指标,评估大语言模型在不确定性下的稳定性,实验显示该方法在高熵条件下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11318 2026-04-28 cs.AI cs.CL cs.CY 67%

The Consensus Trap: Dissecting Subjectivity and the "Ground Truth" Illusion in Data Annotation

共识陷阱:数据标注中主观性与‘真实真相’幻觉的剖析

Sheza Munir, Benjamin Mah, Krisha Kalsi, Shivani Kapania, Julian Posada, Edith Law, Ding Wang, Syed Ishtiaque Ahmed

机构 * University of Toronto Computer Science(多伦多大学计算机科学系) University of Toronto Engineering Science(多伦多大学工程科学系) Carnegie Mellon University School of Computer Science(卡内基梅隆大学计算机科学学院) Yale University American Studies(耶鲁大学美国研究系) University of Waterloo Computer Science(滑铁卢大学计算机科学系) Google Research(谷歌研究) University of Toronto(多伦多大学) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) University of Waterloo(滑铁卢大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过分析2020-2025年间七大赛事的346篇论文,揭示数据标注实践中‘共识陷阱’的机制,指出位置可读性失效与模型中介标注导致的锚定偏见,以及地理霸权对西方标准的强制性,呼吁将分歧视为高保真信号以构建文化胜任模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24686 2026-04-28 cs.AI 57%

Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents

治理你无法观察的事物:面向自主AI代理的自适应运行时治理

German Marin, Jatin Chaudhary

机构 * Department of Computing, University of Turku(图尔库大学计算机系)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出信息有效性原理,通过估计未观察风险上界并设定安全余量,实现自主AI代理的自适应运行时治理,结合Aubin viability理论构建Agent有效性框架,引入风险门机制实现预测性治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23949 2026-04-28 cs.AI 57%

Context-Aware Hospitalization Forecasting Evaluations for Decision Support using LLMs

基于上下文的医院化疗预测评估:利用LLMs进行决策支持

Rhea Makkuni, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文评估了利用LLMs进行医院化疗预测的方法,通过三种方法在60个县的数据上验证了上下文增强的混合模型在非平稳医疗资源预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15050 2026-04-28 cs.CV 50%

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

DRIFT:用于高效MLLM微调的推理先验转移

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

机构 * University of Rochester(罗切斯特大学) AMD

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。

Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏