arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-21 至 2026-04-21 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 11 篇

2506.00079 2026-04-21 cs.CY cs.AI cs.LG 82%

Who Gets the Kidney? Human-AI Alignment, Indecision, and Moral Values

谁获得肾脏?人类-人工智能对齐、犹豫与道德价值观

John P. Dickerson, Hadi Hosseini, Samarth Khanna, Leona Pierce

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 研究评估了LLM在器官分配中的行为,发现其在优先级设定上偏离人类价值观,并且在犹豫机制上表现不同,低秩监督微调能提升决策一致性与犹豫建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17413 2026-04-21 cs.CY cs.AI 81%

The Open-Weight Paradox: Why Restricting Access to AI Models May Undermine the Safety It Seeks to Protect

开放权重悖论:为何限制访问AI模型可能反而削弱其安全防护

Vinicius Santana Gomes

机构 * Government of the Federal District of Brazil(巴西联邦区政府) School of Government of the Federal District of Brazil(巴西联邦区政府学校)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文挑战开放权重AI模型治理的二元选择框架,提出无监管替代方案的访问限制可能转移而非减少风险,主张通过硬件层治理和多边机构架构提升AI安全。

Comments 23 pages, 2 figures, 1 table. Preprint also deposited at Zenodo (DOI: 10.5281/zenodo.19484877) on 2026-04-09. Licensed under CC BY 4.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18444 2026-04-21 cs.LG cs.AI cs.CV 62%

ProtoCLIP: Prototype-Aligned Latent Refinement for Robust Zero-Shot Chest X-Ray Classification

ProtoCLIP:基于原型对齐的潜在细化用于鲁棒零样本胸部X光分类

Florian Kittler, Sheethal Bhat, Andreas Maier

机构 * Friedrich-Alexander University Erlangen-Nuremberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ProtoCLIP通过针对性数据筛选和锚点对齐优化,提升零样本胸部X光分类的鲁棒性,在VinDr-CXR数据集上提升AUC2-10个百分点,尤其在肺部气胸检测中达到0.94的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24827 2026-04-21 cs.LG 57%

Inter-Agent Relative Representations for Multi-Agent Option Discovery

多智能体选项发现的智能体相对表示

Raul D. Steleac, Mohan Sridharan, David Abel

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种多智能体选项发现方法,通过压缩状态空间并保留协调信息,提升多智能体协作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06700 2026-04-21 cs.CL 57%

How Language Models Conflate Logical Validity with Plausibility: A Representational Analysis of Content Effects

语言模型如何将逻辑有效性与合理性混淆:内容效应的表征分析

Leonardo Bertolazzi, Sandro Pezzelle, Raffaella Bernardi

机构 * University of Trento(特伦托大学) University of Amsterdam(阿姆斯特丹大学) Free University of Bozen-Bolzano(博赞-博洛尼亚自由大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究揭示语言模型中逻辑有效性与合理性概念的表征关联,通过构建去偏向量减少内容效应,提升推理准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17504 2026-04-21 cs.CV cs.AI 57%

RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

RS-HyRe-R1: 一种混合奖励机制以克服遥感图像理解中的感知惯性

Gaozhi Zhou, Hu He, Peng Shen, Jipeng Zhang, Liujue Zhang, Linrui Xu, Zeyuan Wang, Ziyu Li, Xuezhi Cui, Wang Guo, Haifeng Li

机构 * School of Mechanical and Electrical Engineering, Central South University(中南大学机械与电气工程学院) School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出RS-HyRe-R1混合奖励机制,旨在克服遥感图像理解中的感知惯性问题,通过引入空间推理激活奖励、感知正确性奖励和视觉-语义路径演化奖励,提升模型的全面视觉证据挖掘能力,实验显示其在多个任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01486 2026-04-21 cs.CL 57%

Human-Centered Supervision for Sentiment Analysis in Telugu: A Systematic Inquiry Beyond Accuracy

面向泰卢格语情感分析的人本监督:超越准确性的系统探究

Vallabhaneni Raj Kumar, Ashwin S, Supriya Manna, Niladri Sett, Cheedella V S N M S Hema Harshitha, Kurakula Harshitha, Anand Kumar Sharma, Basina Deepakraj, Tanuj Sarkar, Bondada Navaneeth Krishna, Samanthapudi Shakeer

机构 * SRM University AP, India(印度AP SRM大学) University of Maryland, College Park, USA(美国马里兰大学 College Park分校) GITAM University, Bangalore, India(印度班加罗尔GITAM大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出TeSent数据集,通过人类选择的解释进行模型对齐,探讨在低资源语言中监督学习对预测性能和公平性的影响。

Comments Camera-ready version; ACL Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16790 2026-04-21 cs.SE cs.AI 57%

Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

循环中的偏见:用于软件工程的LLM作为评判者的审计

Zixiao Zhao, Amirreza Esmaeili, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14922 2026-04-21 cs.CL 57%

Synthia: Scalable Grounded Persona Generation from Social Media Data

Synthia:从社交媒体数据中可扩展的 grounded 人格生成

Vahid Rahimzadeh, Erfan Moosavi Monazzah, Mohammad Taher Pilehvar, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies(德黑兰高级研究 institute) University of Tehran(德黑兰大学) Cardiff University(卡迪夫大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 Synthia通过结合真实社交媒体数据与语言模型,生成更贴近现实的人格,提升与人类意见分布的一致性,同时在公平性和偏见分析中表现更优,保留交互图结构以支持网络感知分析。

Comments Accepted at ACL 2026 Main Conference, the dataset is available on HuggingFace (see https://huggingface.co/datasets/teias-ai/synthia)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17730 2026-04-21 cs.CY 57%

Gender Bias in Perception of Human Managers Extends to AI Managers

人工智能管理者的人格偏见延伸至人类管理者

Hao Cui, Taha Yasseri

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

AI总结 研究探讨了AI管理者与人类管理者在感知上的差异,发现性别对管理者的评价有显著影响,尤其是女性AI管理者在未获奖时面临更多负面评价。

Comments 40 pages, 26 figures, 8 tables

Journal ref Computers in Human Behavior Reports, 21 (2026), 100984

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16884 2026-04-21 cs.CV 50%

Bias-constrained multimodal intelligence for equitable and reliable clinical AI

具有偏见约束的多模态智能用于公平且可靠的临床AI

Cheng Li, Weijian Huang, Jiarun Liu, Hao Yang, Qi Yang, Song Wu, Ye Li, Hairong Zheng, Shanshan Wang

机构 * Paul C. Lauterbur Research Center for Biomedical Imaging(Paul C. Lauterbur生物医学成像研究中心) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Radiology, Beijing Chaoyang Hospital, Capital Medical University(首都医科大学北京朝阳医院放射科) Department of Urology, South China Hospital, Medical School, Shenzhen University(深圳大学南方医院泌尿科) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文提出BiasCareVL框架,通过在模型设计中直接引入偏见控制,解决医疗影像与文本整合中公平性和可靠性问题,展示了其在多任务和基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏