arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-16 至 2026-03-16 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 6 篇

2508.16624 2026-03-16 cs.CY cs.AI 62%

The GPT-4o Shock Emotional Attachment to AI Models and Its Impact on Regulatory Acceptance: A Cross-Cultural Analysis of the Immediate Transition from GPT-4o to GPT-5

GPT-4o震惊的对AI模型的情感依附及其对监管接受度的影响:对从GPT-4o到GPT-5即时过渡的跨文化分析

Hiroki Naito

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了GPT-4o到GPT-5的即时过渡引发的情感依附与监管接受度的跨文化影响,发现日文内容更侧重于损失叙事,英文内容包含更多愤怒与批判,且日文内容的情感依附显著更高。

Comments 9 pages ,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13189 2026-03-16 cs.MA cs.AI 57%

LLM Constitutional Multi-Agent Governance

大语言模型宪法多智能体治理

J. de Curtò, I. de Zarzà

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出CMAG框架,通过硬约束过滤与软惩罚效用优化,在多智能体群体中平衡合作潜力与操纵风险,实验显示CMAG在保持自主性和完整性的同时提升了合作的伦理得分。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08093 2026-03-16 cs.CL 57%

Evolution and compression in LLMs: On the emergence of human-aligned categorization

语言模型中的进化与压缩:关于人类对齐分类的出现

Nathaniel Imel, Noga Zaslavsky

机构 * New York University(纽约大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究探讨LLM是否能进化出高效的人类对齐语义系统,通过颜色分类实验发现,大模型在复杂性和英语对齐性上表现各异,仅最强模型能复现人类近最优的信息瓶颈贸易-offs。

Comments Published as a conference paper at ICLR 2026 (The Fourteenth International Conference on Learning Representations). OpenReview: https://openreview.net/forum?id=s7gSTR2AqA&noteId=s7gSTR2AqA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11277 2026-03-16 cs.AI 57%

COMPASS: The explainable agentic framework for Sovereignty, Sustainability, Compliance, and Ethics

COMPASS:面向主权、可持续性、合规性和伦理的可解释代理框架

Jean-Sébastien Dessureault, Alain-Thierry Iliho Manzi, Soukaina Alaoui Ismaili, Khadim Lo, Mireille Lalancette, Éric Bélanger

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出COMPASS框架,通过模块化治理机制整合主权、可持续性、合规性和伦理,利用RAG技术提升AI决策的可解释性和透明度。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12600 2026-03-16 cs.HC 50%

How GenAI Mentor Configurations Shape Early Collaborative Dynamics: A Classroom Comparison of Individual and Shared Agents

生成式人工智能导师配置如何塑造早期协作动态:个体与共享代理的课堂比较

Siyu Zha, Weijing Liu, Fei Qin, Jie Cao, Yanjin Wang, Yujia Liu, Kaiyi Zhang, Jiangtao Gong, Yingqing Xu

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究探讨了生成式人工智能配置对课堂协作调节的影响,发现共享AI促进收敛性协作,而个体AI则导致更分散的互动模式,需教师更多干预。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12406 2026-03-16 cs.SE 50%

Team Diversity Promotes Software Fairness: An Experiment on Fairness-Aware Requirements Prioritization

团队多样性促进软件公平性:一项关于公平意识需求优先级排序的实验

Cleyton Magalhes, Ronnie de Souza Santos, Bimpe Ayoola, Brody Stuart-Verner, Italo Santos

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究探讨了软件团队多样性对需求优先级排序中公平意识行为的影响,发现多样性团队更一致地拒绝存在公平风险的故事,且决策理由更强调包容性和伦理责任。

详情

展开后加载摘要…

URL PDF HTML 收藏