STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models
STaR:用于大推理模型中去学习的敏感轨迹调节
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 STaR通过敏感轨迹调节方法,实现了大推理模型中高效且稳定的隐私保护去学习,减少隐私泄露风险。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
STaR:用于大推理模型中去学习的敏感轨迹调节
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 STaR通过敏感轨迹调节方法,实现了大推理模型中高效且稳定的隐私保护去学习,减少隐私泄露风险。
通过内容完整性保护实现身份鲁棒的语言模型生成
机构 * New York University(纽约大学) ; Adobe Research(Adobe研究)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL
AI总结 本文提出了一种轻量级、无需训练的框架,通过保留语义关键属性并中和非关键身份信息,实现身份鲁棒的语言模型生成,有效减少身份依赖性偏见。
LERA:将判断作为执行的结构性前提重新引入自动化系统中
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
AI总结 LERA提出判断作为执行的结构性前提,通过治理门将执行合法性绑定到判断完成,确保执行权威的问责性。
Comments 12 pages, 1 figure. Conceptual architecture paper
视觉-语言模型和生成图像模型中的偏见检测与旋转鲁棒性缓解
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出旋转鲁棒缓解策略,通过数据增强、表征对齐和模型正则化,提升视觉-语言和生成图像模型在旋转和分布偏移下的鲁棒性和公平性。
Comments Preprint. This work is derived from the author's Master's research. Code and supplementary materials will be released separately
面向中文医疗伦理的以人为本的大型语言模型对齐流水线
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 本文提出MedES基准和 guardian-in-the-loop 框架,通过监督微调和偏好优化,实现中文医疗伦理场景下的LLM对齐,提升伦理任务表现。
认知主权与神经安全治理鸿沟:来自新加坡的证据
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
AI总结 本文探讨了认知主权与神经安全治理鸿沟,通过新加坡案例分析,提出认知主权框架以保护神经过程免受外部干扰。
Comments 18 pages, 0 figures
模糊表示规范
机构 * Gran Sasso Science Institute(格兰萨索科学研究所)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出了一种基于模糊逻辑的SLEEC规则表示方法,用于在自主系统中嵌入伦理要求,以解决AI系统可能遇到的伦理困境。
生成式AI用于社会影响
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 生成式AI通过LLM代理和扩散模型解决社会影响中的部署瓶颈,实现可扩展且人类对齐的资源优化系统。
Comments To appear in IEEE Intelligent Systems
从抽象威胁到制度现实:对美、欧、中三国人工智能安全化的比较语义网络分析
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
AI总结 本文通过比较语义网络分析,揭示美欧中三国在人工智能治理上的制度逻辑差异,指出结构性不可通约性导致治理协调困难。
Comments Submitted to the 2026 ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT)
一个三层框架用于LLM增强的可解释AI:从技术解释到自然语言
机构 * Andalusian Research Institute in Data Science and Computational Intelligence(数据科学与计算智能安达卢西亚研究机构) ; Universidad de Granada(格拉纳达大学) ; Department of Computer Science(计算机科学系) ; Artificial Intelligence Lab(人工智能实验室) ; Vrije Universiteit Brussel(布鲁塞尔自由大学)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出一个三层框架,利用大型语言模型提升AI解释的可解释性,通过动态对话解释增强社会透明度和用户信任。
Comments 22 pages, 5 figures
Journal ref Bello, M., Bello, R., García, M. M., Nowé, A., Sevillano-García, I., & Herrera, F. (2025). A Three-level Framework for LLM-enhanced Explainable AI: From Technical Explanations to Natural Language. Information Systems Frontiers, 1-22
从静态到动态:通过MLLM引导的生成修复技术评估城市场景中动态元素的感知影响
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
AI总结 通过MLLM引导的生成修复技术,研究评估了动态元素在城市场景中的感知影响,发现移除动态元素导致活力显著下降,揭示了光照、人类存在和深度变化对感知变化的关键作用。
Comments 31 pages, 5 figures
C2PO:诊断和解构大语言模型中的偏见捷径
机构 * Jinan University(济南大学) ; Nanyang Technological University(南洋理工大学) ; Engineering Research Center of Trustworthy AI (Ministry of Education)(可信人工智能工程研究中心) ; Guangxi Key Laboratory of Trusted Software(广西可信软件重点实验室)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 C2PO通过因果对比偏好优化框架,解决大语言模型中的偏见问题,同时保持推理能力。
迈向负责任和可解释的AI代理:基于共识驱动的推理
机构 * Old Dominion University, Norfolk, VA, USA(老奥本大学) ; Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) ; Florida International University, USA(佛罗里达国际大学) ; Nanyang Technological University, Singapore(南洋理工大学) ; University of Colombo, Sri Lanka(科伦坡大学) ; Accenture Technology Labs, Arlington, VA, USA(Accenture技术实验室)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 本文提出了一种基于多模型共识和推理层治理的负责任和可解释的AI代理架构,通过结构化整合不同模型的输出以提升系统鲁棒性、透明度和责任性。
完全控制AI风险的决策路径:AI治理的基本控制机制
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
AI总结 本文提出通过五支柱和六种控制机制,构建AI治理架构,以全面控制AI风险并减少潜在威胁。
Comments Added 1 paragraph to Ackowledgements
音调下的偏见:LLM驱动的UX系统中音调偏见的实证刻画
机构 * Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL
AI总结 本文研究了LLM驱动UX系统中的音调偏见问题,通过合成数据集和弱监督方法,揭示了模型在对话中存在系统性的音调偏差,为设计公平可信的对话AI提供了依据。
多教师学习中的保守偏见:为什么智能体更偏好低奖励顾问
机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) ; Escuela de Ingeniería, Universidad Central de Chile(智利中央大学工程学院)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 本文揭示了多教师学习中智能体偏好保守低奖励顾问的现象,发现其受保守偏见主导,并在特定阈值下失效,同时在概念漂移情况下显著优于基线Q学习。
Comments 10 pages, 5 figures. Accepted at ACRA 2025 (Australasian Conference on Robotics and Automation)
社会责任栈:一种基于控制理论的治理社会技术AI的架构
机构 * Department of Electrical and Computer Engineering University of Waterloo(电气与计算机工程系滑铁卢大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 本文提出社会责任栈架构,通过控制理论将社会价值观嵌入AI系统,实现责任闭环控制,提升AI系统的可问责性和可审计性。
从个性化到偏见:记忆增强型AI招聘代理中的偏见与歧视
机构 * Phi Labs, Quantiphi Inc.(Phi实验室、Quantiphi公司)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 研究揭示了记忆增强型AI招聘代理中偏见的系统性引入与强化,强调了对LLM基础AI代理的额外防护措施的必要性。
Comments In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26)
Journal ref In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26), 2026, Boise, ID, USA. ACM, New York, NY, USA
NDRL:基于嵌套双智能体强化学习的棉花灌溉与氮肥施用
机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) ; Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) ; Xinjiang Key Laboratory of Signal Detection and Processing(新疆信号检测与处理重点实验室) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
AI总结 NDRL通过嵌套双智能体强化学习优化棉花灌溉与氮肥施用,提升产量和资源利用效率。
Comments Accepted by ICONIP 2025
相信我,我知道这个函数:利用偏见进行LLM静态分析的劫持
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG
AI总结 本文提出利用LLM的抽象偏见进行代码分析的攻击方法,通过注入熟悉模式攻击来劫持LLM的控制流,揭示了LLM在静态分析中的安全漏洞。
Journal ref The Network and Distributed System Security Symposium (NDSS). 2026
感知差异?真实与LLM生成CBT对话中情感弧的比较分析
机构 * Department of Computer Science, Shantou University(汕头大学计算机科学系) ; Department of Automation, Tsinghua University(清华大学自动化系) ; BNRIST, Tsinghua University(清华大学脑科学与类脑智能研究院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 本研究通过比较真实与LLM生成的CBT对话,揭示了合成对话在情感动态上的不足,强调了情感真实性的关键作用。
Comments Accepted at 2025 EMNLP findings,19 page,2 figures
Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 19999-20017
面向特殊报道的AIGC辅助图像生成中的人机协作机制研究
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出了一种人机协作机制,用于在特殊报道中通过AIGC辅助图像生成,结合高精度分割、语义对齐和风格调节技术,确保内容准确性和可验证性。
Comments AAAI-AISI 2026
大语言模型中的‘我们 vs 他们’偏见
专题命中 AI治理与伦理 :DPO(abstract);分类 cs.CY
AI总结 本研究发现大语言模型在不同人设下表现出‘我们 vs 他们’偏见,通过微调和DPO方法可有效缓解这种偏见。
具有价值意识的多智能体系统
机构 * Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究 institute (IIIA-CSIC))
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出了一种具有价值意识的多智能体系统框架,通过三个核心支柱实现价值对齐和行为可解释性,并展示了其在现实领域的应用。
Journal ref In Coordination, Organizations, Institutions, Norms, and Ethics for Governance of Multi-Agent Systems XVII. COINE 2024. LNCS, vol 15398. Springer, Cham (2025)
SafeGen: 在文本到图像生成中嵌入伦理保障
机构 * Posts and Telecommunications Institute of Technology(电信技术研究所)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
AI总结 SafeGen通过整合BGE-M3和Hyper-SD,实现文本到图像生成中的伦理保障,有效过滤有害提示并生成高质量图像。
通过词语缓解偏见:通过文本编码在人脸识别模板中诱导人口统计学模糊性
机构 * Fraunhofer IGD(弗劳恩霍夫研究所(IGD)) ; TU Darmstadt(德累斯顿技术大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 通过引入文本编码,UTIE在人脸识别模板中诱导人口统计学模糊性,以减少偏见并提升验证性能。
Comments Accepted at BMVC workshop (SRBS) 2025
人机关系中的记忆权力不对称:在数字时代保持相互遗忘
机构 * School of Business, University of California, Riverside(加州大学河滨分校商学院)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 本文提出记忆权力不对称概念,探讨人机关系中因记忆能力差异导致的权力失衡,并提出六个恢复健康记忆平衡的设计原则。
Comments 31 pages, 2 tables, 2 figures
代理人工智能用于乌干达的伦理网络安全:一种强化学习框架用于资源受限环境中的威胁检测
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY
AI总结 本研究提出一种结合强化学习和伦理治理的代理人工智能框架,用于资源受限环境中的网络安全威胁检测,实现了100%的检测率和零假阳性,提升网络安全效果和公平性。
Comments 29 pages, 7 figures, 2 tables, 1 appendix
基于区域邻接图的结构感知特征校正用于无训练开放词汇语义分割
机构 * The MIx Group, School of Computer Science University of Birmingham(米克集团,计算机科学学院,伯明翰大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出基于区域邻接图的结构感知特征校正方法,通过增强局部辨别能力来提升开放词汇语义分割的性能。
Comments Accepted to WACV2026
民主或威权?探讨大型语言模型中政治偏见的新维度
机构 * University of Zürich(苏黎世大学) ; ETH Zürich(苏黎世联邦理工学院) ; MPI for Intelligent Systems(智能系统研究所) ; University of Michigan(密歇根大学) ; University of Toronto(多伦多大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 本文探讨了大型语言模型在民主与威权政治偏见方面的表现,通过引入F-scale、FavScore和角色模型探测方法,揭示了模型在不同语言提示下对民主与威权倾向性的差异。