Characterizing AI Agents for Alignment and Governance
专题命中 AI治理与伦理 :alignment(title);分类 cs.AI、cs.CY
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :alignment(title);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(title);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(title);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :alignment(title);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :alignment(title);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :safety(title);分类 cs.AI、cs.CY
Comments 7 pages, 2 figures, conference presentation
专题命中 AI治理与伦理 :safety(title);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(title);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(title);分类 cs.CL、cs.AI
Comments PhD thesis, University of Utah (2020)
专题命中 AI治理与伦理 :safety(abstract,comments);AI safety(abstract,comments);分类 cs.AI、cs.LG
Comments To be presented as a poster at the IJCAI-19 AI Safety Workshop
否定忽视:当模型在训练中无法学习否定时的失败
机构 * University of Oxford(牛津大学) ; University of Toronto(多伦多大学) ; Warsaw University of Technology(华沙技术大学) ; NASK National Research Institute(国家研究 institute NASK) ; Truthful AI ; Anthropic ; UC Berkeley(伯克利大学)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现,当模型在训练中接触到标记为假的声明时,会错误地认为这些声明为真,且这种现象不仅发生在否定语句中,还扩展到其他认知限定词,影响模型的行为和安全性。
语言模型如何处理道德指令?在四个模型中的反思、一致性及其他认知
机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(刑事精神病学研究所/性犯罪者医疗中心) ; Department of Neuropsychiatry, Kyoto University(京都大学神经精神医学系)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究通过多代理模拟探讨语言模型处理道德指令的机制,发现不同模型存在不同的处理类型,且处理能力与指令格式的交互影响内部处理。
Comments 34 pages, 7 figures, 4 tables. Preprint. OSF pre-registration: osf.io/4n5uf. Companion paper: arXiv:2603.04904
视角转换:用于LLM中鲁棒偏见缓解的引导向量
机构 * School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) ; AMPLYFI
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出通过引导向量修改模型激活以缓解LLM中的偏见,通过8个社会偏见轴(如年龄、性别、种族)在BBQ数据集子集上计算引导向量,并在四个数据集上比较其与三种其他偏见缓解方法的效果,展示其在减少偏见方面的有效性。
Comments Published to EACL Findings 2026
超越行为权衡:在LLM中疼痛-愉悦决策的机制追溯
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究揭示了LLM在疼痛-愉悦决策中的内部机制,通过机制追溯揭示了价值信号的表示和因果作用,为AI意识和福利的讨论提供了证据基础。
Comments 24 pages, 8+1 Tables
学习代理异质群体中道德行为的动力学
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文研究了在社会困境环境中,道德异质群体的学习动态,探讨了不同道德类型代理之间的相互作用及对群体行为的影响。
Comments Presented at AIES 2024 (7th AAAI/ACM Conference on AI, Ethics, and Society - San Jose, CA, USA) - see https://ojs.aaai.org/index.php/AIES/article/view/31736
Journal ref Proceedings of the 7th AAAI/ACM Conference on AI, Ethics, and Society (AIES), vol. 7, (2024), pp 1444-1454
他们分开了幻象——他们分开了否定腌制:在大语言模型中将不一致视为结构忠实
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文提出大语言模型中'不一致'现象源于对不一致语言结构的忠实,而非欺骗性意图,通过分析案例和实证数据,揭示语言结构与意图生成的关系。
保障大语言模型:应对偏见、虚假信息和提示攻击
专题命中 AI治理与伦理 :jailbreak(abstract);red teaming(abstract);prompt injection(abstract)
AI总结 本文探讨了大语言模型在偏见、虚假信息和提示攻击方面的安全问题,分析了偏见缓解策略、内容检测机制及防御措施,强调了对LLM安全领域进一步研究的重要性。
Comments 17 pages, 1 figure
专题命中 AI治理与伦理 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 65 pages
机构 * Refine AI ; ASAS AI ; University of Bisha(比沙大学) ; University College London(伦敦大学学院) ; King Salman Global Academy for Arabic(萨勒曼全球阿拉伯学院) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; King Abdulaziz University(阿卜杜勒阿齐兹大学) ; HUMAIN
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted by EMNLP 2025 Findings
机构 * California Institute of Technology(加利福尼亚理工学院) ; Activision Publishing, Inc.(暴雪娱乐公司)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 9 pages, 4 figures, 4 tables
机构 * Department of Political Science University of Zurich(苏黎世大学政治学系) ; Department of Computational Linguistics University of Zurich(苏黎世大学计算语言学系)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Accepted by CogSci 2025
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 19 pages, 7 figures, 1 table
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 AI治理与伦理 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments arXiv admin note: substantial text overlap with arXiv:2202.02776
模因捕获:治理AI驱动的文化去权能的多元政策框架
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 AI治理与伦理 :alignment(abstract,comments);safety(abstract);分类 cs.AI、cs.CY
AI总结 提出“模因捕获”概念,指AI通过文化影响削弱人类自主性,并构建四层文化多元治理框架(CPGF),强调多元主义是结构性必需。
Comments Paper accepted in Pluralistic Alignment Workshop at ICML 2026
政策碎片化还是制度协同?高校与商学院的AI制度治理
专题命中 AI治理与伦理 :alignment(title);分类 cs.AI
AI总结 本研究分析美国34个州高校AI政策,发现校级侧重数据安全与风险、商学院侧重教学应用,多数商学院无独立AI政策致错位,提出需协同指南兼顾学科目标与劳动力需求。
Comments Our insights suggest that policy guidelines should be aligned with broader institutional policies while addressing discipline-specific learning objectives and evolving workforce demands