A Technical Policy Blueprint for Trustworthy Decentralized AI
可信去中心化人工智能的技术政策蓝图
专题命中 AI治理与伦理 :trustworthy(title);分类 cs.CY
AI总结 提出一种技术政策蓝图,通过将治理需求编码为策略即代码对象,并解耦策略验证与执行,实现去中心化AI系统的透明、可扩展和可验证治理。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
可信去中心化人工智能的技术政策蓝图
专题命中 AI治理与伦理 :trustworthy(title);分类 cs.CY
AI总结 提出一种技术政策蓝图,通过将治理需求编码为策略即代码对象,并解耦策略验证与执行,实现去中心化AI系统的透明、可扩展和可验证治理。
偏见能走多远?从预训练数据到对齐的偏见追溯
机构 * CIS, LMU Munich(慕尼黑大学语言信息学研究所) ; ILLC, University of Amsterdam(阿姆斯特丹大学语言研究所) ; Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
专题命中 AI治理与伦理 :alignment(title);分类 cs.CL
AI总结 研究探讨预训练数据中的性别职业偏见如何在LLM中表现,通过零样本提示和词元共现分析,发现训练数据中的偏见被放大,指令微调部分缓解了代表性偏见,但整体性别刻板印象仍存在。
人工智能治理中的政治更替:合规设计的对齐表面
机构 * University of Poitiers(波尔多大学)
专题命中 AI治理与伦理 :alignment(title);分类 cs.AI
AI总结 研究探讨了在政治更替背景下,合规层如何影响AI治理的稳定性与透明性,分析了自动化程度、编码程度及迭代使用保障对系统脆弱性的影响。
是生成还是判别?衡量LLM文化契合度的方法论考虑
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学)
专题命中 AI治理与伦理 :alignment(title);分类 cs.CL
AI总结 本文通过反向社会人口提示方法探讨LLM文化契合度测量问题,发现真实行为表现优于模拟行为,但个体层面个性化存在局限。
Comments IJCNLP-AACL 2025
ChatGpt 内容检测:一种使用XLM-RoBERTa对齐的新方法
专题命中 AI治理与伦理 :alignment(title);分类 cs.LG
AI总结 本文提出利用XLM-RoBERTa模型检测AI生成文本,通过特征提取和模型微调提高区分人类与AI文本的准确性,并探讨其在学术诚信和AI伦理中的应用。
机构 * Indian Institute of Information Technology, Kalyani(印度信息技术学院,卡里尼) ; BITS Pilani Goa(比尔·斯图尔特学院,果阿) ; IIT Madras(马德拉斯理工学院) ; DTU(达丁理工大学) ; Artificial Intelligence Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) ; Meta AI ; Amazon GenAI(亚马逊生成人工智能)
专题命中 AI治理与伦理 :alignment(title);分类 cs.CL
专题命中 AI治理与伦理 :trustworthy(title);分类 cs.CY
专题命中 AI治理与伦理 :trustworthy(title);分类 cs.AI
Journal ref International Journal of Web Research, vol.8, no.2,pp.11-24, 2025,
专题命中 AI治理与伦理 :alignment(title);分类 cs.LG
专题命中 AI治理与伦理 :alignment(title);分类 cs.LG
Comments Accepted for publication in Nature Communications. SI Eq.71 is corrected
谁能获得权限?AI生成的学术守门场景中的全球区域与学术地位偏差
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
AI总结 该研究构建LLM模拟学术守门场景,发现LLM存在学术地位偏差,且模型架构导致区域偏好差异,凸显需审计AI系统的公平性与价值对齐。
为何公共服务人工智能治理框架在通用人工智能时代面临失败风险:来自警务领域的教训
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 研究公共服务中通用人工智能治理框架面临的风险,以警务为例,指出其特性破坏安全条件,常用缓解措施失效,建议明确分类、技术简约、暂停部署并建立国家安全基础设施。
Comments Preprint; submitted for peer review
ImplicitBBQ: 通过基于特征的提示对大语言模型中的隐性偏见进行基准测试
机构 * International Institute of Information Technology, Hyderabad(国际信息技术学院海得拉巴) ; Indian Institute of Technology, Kharagpur(印度理工学院克勒格布尔分校)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出ImplicitBBQ基准测试,通过基于特征的提示评估大语言模型中的隐性偏见,发现隐性偏见在模糊情境中比显性偏见高六倍,现有方法难以有效缓解。
大型语言模型的在线策略蒸馏综述
机构 * Tencent, China(腾讯,中国)
专题命中 AI治理与伦理 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文综述了大型语言模型的在线策略蒸馏方法,探讨了蒸馏过程中如何通过反馈减少累积误差,提出了基于f-散度最小化的蒸馏框架,并分析了蒸馏与强化学习之间的联系。
Comments Ongoing Work
智能作为受管自主:代理型AI系统的失败、升级与治理
机构 * DNRS.ai USA(DNRS.ai美国公司)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出SMARt模型,通过形式化能力检测认知漂移、暂停推理、尝试恢复并在可靠性下降时放弃控制,以解决自主AI系统中的幻觉和持续不合理行为问题。
Comments This peer-reviewed paper is to appear in the Journal of Intelligent and Robotic Systems
大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; Purdue University(普渡大学) ; Meta ; Apple(苹果公司) ; Wright State University(怀特州立大学) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY、cs.LG
AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。
LLM生成的自闭症交流中的算法脆弱性与人格偏见
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Georgia Institute of Technology(佐治亚理工学院) ; Cornell University(康奈尔大学) ; Cardiff University(卡迪夫大学)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 通过双人格改写范式,发现LLM在生成自闭症人格文本时存在词汇与情感偏离、输出坍塌等系统性失败,且对齐策略而非参数规模主导这些失败,表明当前对齐训练导致深层表征鸿沟。
Comments main paper: 9 pages; total: 19 pages; 2 figures; 5 tables
人类与人工智能共存的共进化理论:互惠、治理与复杂社会中的动态
机构 * School of Chemistry and Chemical Engineering(化学与化工学院)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出在治理下的人机共存互惠框架,通过共进化关系设计人类与AI的共存,强调互惠、可逆性、心理安全和社会合法性,通过动态系统模型分析共存条件与稳定性。
低于平均水平的盲目性:在小语言模型中受提示的欠绩效产生位置偏差而非答案回避
机构 * Independent Researcher(独立研究者)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了在小规模语言模型中,受提示的欠绩效是否导致位置偏差而非答案回避,发现模型在受指令下表现出位置偏好的倾向,而非刻意回避答案。
Comments 10 pages, 2 figures, 2 tables. Pre-registered: https://osf.io/6zftv/
一个信息几何框架用于在熵应力下分析大语言模型的稳定性
机构 * Institute of Defense Technologies and Cybersecurity, Azerbaijan Technical University(国防技术与网络安全研究所,阿塞拜疆技术大学)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一个信息几何框架,通过整合任务效用、熵、内部结构指标,评估大语言模型在不确定性下的稳定性,实验显示该方法在高熵条件下表现更优。
在公共部门治理前沿通用人工智能:通过2030年的不确定性实现适应性风险管理与政策能力
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 本文探讨公共部门在2030年前应对前沿通用人工智能的治理挑战,提出基于适应性风险管理、情景感知监管和社会技术转型的治理框架,强调政策能力提升与责任分配的重要性。
Comments 7 PAGES, 1 FIGURE
AI治理控制堆栈用于操作稳定性:在AI系统中实现强化治理
机构 * Morgan Signing House(摩根签名公司)
专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
AI总结 本文提出AI治理控制堆栈,通过六个互补层确保AI系统行为可追溯且具有韧性,结合解释性基础设施与持续监控,为复杂企业环境中的强化AI治理提供蓝图。
Comments 10 pages, 4 figures, 1 table. Research paper introducing an operational AI governance architecture aligned with emerging regulatory frameworks including the EU AI Act, ISO/IEC 42001, and the NIST AI Risk Management Framework
专题命中 AI治理与伦理 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
UGID: 用于去偏大型语言模型的统一图同构
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) ; South China University of Technology(华南理工大学)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 UGID通过构建Transformer的结构化计算图,在内部表示层面减少模型偏见,通过约束注意力路由和隐藏表示,提升模型行为一致性并保持安全性和实用性。
弥合负责任AI分歧的鸿沟
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 本文通过分析3550篇论文,探讨AI安全与AI伦理之间的分歧与重叠,提出通过解决关键问题促进负责任的AI治理。
细粒度微调在激活差异中留下明显可读的痕迹
机构 * EPFL(苏黎世联邦理工学院) ; Ecole Normale Supérieure Paris-Saclay(巴黎-萨克雷高等师范学校) ; Université Paris-Saclay(巴黎-萨克雷大学) ; Harvard University(哈佛大学) ; MATS
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 研究发现狭窄微调会在激活中留下明显痕迹,揭示了微调领域偏见,并警告了使用此类模型进行广泛微调研究的局限性。
Comments ICLR 2026
推理时的推理选择性减少大语言模型中的隐性社会偏见
机构 * Cognitive Science Program Department of Psychological & Brain Sciences Indiana University Bloomington(心理与脑科学系认知科学计划印第安纳大学布卢明顿)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY
AI总结 该研究通过推理增强减少大语言模型中的隐性社会偏见,揭示推理对公平性评估的影响。
机构 * University of Southern California(南加州大学) ; Amazon AGI(亚马逊人工智能实验室)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
机构 * Pure Storage
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments Accepted at 3rd Regulatable ML Workshop at NEURIPS 2025