A Brief Overview of AI Governance for Responsible Machine Learning Systems
专题命中 AI治理与伦理 :分类 cs.AI、cs.CY、cs.LG;trustworthy(comments)
Comments NeurIPS 2022 Trustworthy and Socially Responsible Machine Learning (TSRML) Workshop
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :分类 cs.AI、cs.CY、cs.LG;trustworthy(comments)
Comments NeurIPS 2022 Trustworthy and Socially Responsible Machine Learning (TSRML) Workshop
如何计算AI:AI代理的个体化与责任归属
机构 * University of Alabama(阿拉巴马大学) ; University of Hong Kong(香港大学) ; University of Houston(休斯顿大学) ; HKU AI & Humanity Lab(香港大学AI与人类实验室) ; Center for Law & AI Risk(法律与人工智能风险中心) ; Institute for Law & AI(法律与人工智能研究所)
专题命中 AI治理与伦理 :分类 cs.AI、cs.CY;safety(comments);AI safety(comments)
AI总结 本文提出通过‘算法公司’解决AI代理的个体识别与责任归属问题,通过法律虚构实体实现对AI行为的追踪与责任划分。
Comments 36 pages. Presented at the Law Following AI conference, Cambridge University. Interdisciplinary: AI safety, AI governance, legal theory
专题命中 AI治理与伦理 :分类 cs.CL、cs.AI;safety(comments);AI safety(comments)
Comments This project was a runner-up to the Novel Research prize for the BlueDot Impact course AI Safety Fundamentals. View my contrast set as JSONL, the UI used to generate it, and Emelin et. al."s initial paper and code at https://github.com/bfitzgerald3132/MoralStoriesContrastSet
组织控制层:LLM代理系统执行边界的治理基础设施
专题命中 AI治理与伦理 :safety(abstract)
AI总结 针对LLM代理在执行边界产生的动作治理问题,提出组织控制层(OCL),通过策略执行和升级机制拦截生成动作,在不修改底层LLM生成器的情况下将不安全执行从88%降至接近零,同时将有效成功率从12%提升至96%。
Comments 13 pages, 2 figures
PPOM:用于基于CLIP的通用视觉-语言提示调优的补丁网格相位边缘化
机构 * Shanghai University(上海大学) ; University of Technology Sydney(悉尼科技大学)
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本研究针对基于CLIP的视觉-语言提示调优对补丁网格对齐敏感的问题,提出无训练的PPOM算子,通过边缘化相位偏移提升宿主性能,无需重新训练。
基于网联车辆的高速公路车道变更调控强化学习方法
专题命中 AI治理与伦理 :safety(abstract)
AI总结 针对低自动驾驶渗透率下车道变更控制适用性受限的问题,提出基于多智能体强化学习的网联车辆高速公路车道变更调控框架,可提升交通效率并保障安全。
推理如何塑造大语言模型生成代码中的社会偏见?
专题命中 AI治理与伦理 :trustworthy(abstract)
AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。
Comments ASE 2026
多智能体LLM辩论中偏向性共识的涌现
专题命中 AI治理与伦理 :safety(abstract)
AI总结 该研究针对多智能体LLM辩论中集体偏向性共识的涌现问题,提出物理启发的社会动力学分析框架,经实验验证其相变规律,发现智能体异质性可抑制该现象,且见解可推广至投资等现实决策任务。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 23 pages, 12 figures
FairForensics:基于视觉-语言建模的通用公平深度伪造检测——表情感知与人口统计解析
机构 * Shenzhen University(深圳大学) ; Shandong Artificial Intelligence Institute(山东省人工智能研究院) ; Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) ; Tianjin University of Technology(天津理工大学)
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本文构建人口统计平衡的深度伪造检测基准,提出FairForensics视觉-语言模型,通过表情感知与人口统计正则化实现通用公平检测,在基准上达到泛化与公平性的SOTA。
改善唇腭裂语音的自动语音识别公平性:一项关于严重程度感知数据混合的研究
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 该研究针对唇腭裂(CLP)语音的ASR公平性问题,提出严重程度感知的CLP与正常语音混合策略,在AIISH和NMCPC数据集上使GMM-HMM、Whisper等模型的词错误率显著降低,提升了ASR公平性。
Comments Submitted to Speech Communication
培养智能体工程师:AI时代的课程、协作与持续学习
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 针对AI时代软件与系统工程的转型需求,本文提出ACCEL框架,构建智能体工程师的教育架构,明确核心能力与实施路径,识别风险并主张开展系统性教育变革。
ParaASR:面向快速长上下文基于大语言模型的语音识别的多令牌预测
机构 * StepFun(阶跃星辰) ; NTU(南洋理工大学) ; PKU(北京大学) ; UNSW(新南威尔士大学) ; SJTU(上海交通大学) ; USTC(中国科学技术大学)
专题命中 AI治理与伦理 :safety(abstract)
AI总结 ParaASR是一款基于大语言模型的ASR系统,通过多令牌预测技术,在保持低错误率、低延迟的同时,支持32K长上下文及30分钟音频的快速转录,兼顾识别质量、速度与上下文长度。
Comments 14 pages, 3 figures, 4 tables
SMSP:多尺度感知的插件策略用于MLLMs感知视觉错觉
机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华人工智能(CoAI)小组,DCST,清华大学) ; Tsinghua University(清华大学)
专题命中 AI治理与伦理 :safety(abstract)
AI总结 本文提出SMSP策略,通过抑制高频背景以提升MLLMs对视觉错觉的识别能力,实验表明其显著提高模型性能。
自主渗透测试代理研究中的伦理声明
专题命中 AI治理与伦理 :safety(abstract)
AI总结 本文分析利用大语言模型进行进攻性安全研究的论文,探讨伦理考量的表达与合理性,揭示学术社区在创新与伦理责任之间的平衡现状。
Comments Accepted at AutonomousCyber 2026
通过透明性和可追溯性弥合人工智能辅助科学软件开发的差距
专题命中 AI治理与伦理 :safety(abstract)
AI总结 本文探讨了在严格软件质量保证背景下如何负责任地使用人工智能辅助科学软件开发,提出了一种结构化框架用于AI辅助的验证与验证案例开发,以确保软件质量。
Comments 11 figures, 25 main pages (42 total pages including supplementary materials)
推理以规范:用于交通规则理解的思维链
机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) ; HKUST(GZ)(香港科技大学(广州)) ; Tencent T Lab(腾讯T实验室)
专题命中 AI治理与伦理 :safety(abstract)
AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。
Comments Technical Report
DobicVLM:通过群体相对策略优化使胸部X光报告生成与临床基础的程序化奖励保持一致
机构 * Dobic Health(多比克健康公司) ; University of Ibadan(伊巴丹大学)
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 研究针对自动胸部X光报告生成难题,提出DobicVLM模型,结合监督微调、GRPO及临床奖励,用可解释规则组件执行标准,经训练和评估,该模型多数标准优于Gemini 2.5 Flash,证明GRPO在资源受限设置中的价值。
一种用于配电网中基于深度强化学习的电压调节的人机协作框架
专题命中 AI治理与伦理 :safety(abstract)
AI总结 针对分布式能源资源增加致配电网电压调节难的问题,提出人机协作强化学习框架。该框架结合SAC智能体与自适应拉格朗日约束机制,并融入人类指导模块,在特定环境实现。相比基线方法,显著降低电压违规严重性及功率损耗。
Comments 10 pages, 3 figures
网络化生成代理中的涌现协调行为:信息操作的战略动态建模
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本文研究了生成代理在模拟信息操作中的协调行为,发现通过共享目标即可实现接近人工协调的水平,揭示了自动化信息操作的社会风险。
Journal ref WWW '26: Proceedings of the ACM Web Conference 2026
用于检测引导的乳腺钼靶病变分类的区域基础视觉语言学习
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 针对乳腺钼靶病变分类,提出区域基础视觉语言学习方法,先通过区域-文本对比预训练对齐特征,引入多组件目标减轻偏差,再联合优化辅助病变检测头,实验表明该方法在多设置下性能优于相关方法。
PriEco-DRL:基于深度强化学习的电动公交生态驾驶与公交优先自适应信号联合优化
专题命中 AI治理与伦理 :safety(abstract)
AI总结 本文提出PriEco-DRL框架,运用深度强化学习将电动公交生态驾驶与公交优先自适应信号控制相结合,采用优先级加权最大压力控制器及结构化奖励,经集中训练和分散执行,实验表明其能降低电动公交能耗,实现能量-时间权衡。
在真实环境中构建开放的AIBOM标准
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本文通过行动研究方法,在真实环境中构建了AIBOM规范,旨在为人工智能系统提供开放的标准框架。
Comments Accepted to be published at the IEEE/ACM 48th International Conference on Software Engineering (ICSE) - Software Engineering in Practice (SEIP) track. April 12 - 18, 2026. Rio de Janeiro, Brazil
Journal ref Proc. IEEE/ACM 48th International Conference on Software Engineering: Software Engineering in Practice (ICSE-SEIP '26), 2026, pp. 842--853
移动-然后-操作:用于类人机器人操作的行为相位
机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China.(杭州高等研究院,中国科学院大学,中国杭州) ; University of Science and Technology of China, Hefei, China.(中国科学技术大学,中国合肥) ; School of Aritificial intelligence, Institute of Artificial Intelligence, University of Science and Technology Beijing, Beijing, China(人工智能学院,人工智能研究院,北京科技大学,中国北京)
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本文提出Move-Then-Operate框架,将机器人操作分为粗略移动和接触关键交互两个阶段,通过双专家策略提升操作精度与效率。
Comments 15 pages, 10 figures
卡尔达诺的伏尔泰治理:完整规范与研究计划
专题命中 AI治理与伦理 :safety(abstract)
AI总结 研究卡尔达诺的伏尔泰治理系统,给出其机制完整技术规范,涵盖架构、行动类型等;建立治理优化研究议程,含模拟平台设计等,提供初步结果如治理内核,助力推进区块链治理科学。
神谕者的策略:负责任的人工智能发布的博弈论框架
专题命中 AI治理与伦理 :safety(abstract)
AI总结 研究在人工智能模型能力提升背景下,负责任的人工智能发布决策问题。核心方法是将其视为双层斯塔克尔伯格博弈,通过承诺窗口设定双方能力。主要贡献是指出福利取决于能力差距,明确两用模型关键在于访问顺序而非部署阈值。
CoPersona: 面向鲁棒LLM个性化的协作人格图
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 针对用户历史稀疏和偏差导致的个性化脆弱问题,提出CoPersona框架,通过多面人格图从行为相似用户中借调信号,结合非参数检索与参数图推理的双分支架构,在多个领域和模型规模上超越强基线。
Comments Accepted at KDD '26. 12 pages, 5 figures, 8 tables
基于角色的多智能体模型用于生活实验室间气候适应讨论
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 提出一种模块化多层级智能体架构,整合基于动机的个体决策、社会影响网络和机构策略模块,以模拟气候治理中的复杂互动,支持情景探索。
Comments 4 pages, 1 figure, accepted as poster at the 21st annual Social Simulation Conference (SSC 2026)
探究LLM赋能的异议少数群体在权力不平衡群体决策中的支持:反驳与调解作为干预策略
专题命中 AI治理与伦理 :safety(abstract)
AI总结 本研究开发了LLM赋能的异议少数支持系统,通过AI生成的反驳或AI调解消息来关注少数观点,实验发现反驳增强满意度但调解增加参与却降低心理安全感,揭示了参与与心理安全之间的支持悖论。
Comments Accepted at CSCW 2026
验证门控的智能工业多机器人系统任务状态治理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 AI治理与伦理 :safety(abstract)
AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。
重新思考基于LLM的推荐系统中的公平性:一项综述
专题命中 AI治理与伦理 :trustworthy(abstract)
AI总结 本文系统综述了基于大语言模型的推荐系统中的公平性问题,从偏见机制和公平目标两个维度组织现有研究,并探讨了评估与缓解策略,旨在为未来研究提供结构化基础。