arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-31 至 2026-03-31 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2503.05371 2026-03-31 cs.LG cs.AI cs.CL 75%

Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs

视角转换:用于LLM中鲁棒偏见缓解的引导向量

Zara Siddique, Irtaza Khalid, Liam D. Turner, Luis Espinosa-Anke

机构 * School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) AMPLYFI

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过引导向量修改模型激活以缓解LLM中的偏见,通过8个社会偏见轴(如年龄、性别、种族)在BBQ数据集子集上计算引导向量,并在四个数据集上比较其与三种其他偏见缓解方法的效果,展示其在减少偏见方面的有效性。

Comments Published to EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28589 2026-03-31 cs.AI cs.LG 62%

Towards a Medical AI Scientist

迈向医疗AI科学家

Hongtao Wu, Boyun Zheng, Dingjie Song, Yu Jiang, Jianfeng Gao, Lei Xing, Lichao Sun, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Lehigh University(里海大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出医疗AI科学家框架,通过临床工程师协同推理机制生成可落地的医学研究想法,并基于结构化医学规范和伦理政策撰写论文,验证其在171案例、19临床任务和6种数据模态中的高质量表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12433 2026-03-31 cs.CL cs.AI 62%

Exploring Cultural Variations in Moral Judgments with Large Language Models

探索大语言模型在道德判断中的文化差异

Hadi Mohammadi, Ayoub Bagheri

机构 * Utrecht University(乌得勒支大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型在捕捉文化多样性道德价值观方面的能力,通过对比不同模型与全球态度调查数据的关联性,发现指令微调模型在跨文化道德规范上表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27411 2026-03-31 cs.HC 50%

Relational Co-Adaptation in Emotionally Supportive AI: Tensions in Authentic Emotional Interaction

情感支持型AI中的关系共适应:真实情感互动中的张力

Mengqi Shi

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究探讨了情感支持型AI中双向对齐的悖论,指出技术有效性可能引发伦理问题,如AI成为老年人唯一选项、情感需求与系统干预不匹配等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22419 2026-03-31 cs.CV 50%

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

CLIP存在短视:超越第一句话的注意力分配

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander

机构 * University of Toronto Robotics Institute(多伦多大学机器人研究所) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 CLIP模型在大规模数据上通过图像-文本对比学习获取可迁移的多模态特征,但其预训练过程偏向于短描述,导致复杂场景对齐不足。本文提出DeBias-CLIP,通过去除摘要句和子采样提升对齐效果,实现更优的长文本检索和鲁棒性。

Comments 20 pages, 15 figures, to be published in the CVPR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏