arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1832 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1832 篇

2601.09281 2026-01-15 cs.AI 57%

STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models

STaR:用于大推理模型中去学习的敏感轨迹调节

Jingjing Zhou, Gaoxiang Cong, Li Su, Liang Li

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 STaR通过敏感轨迹调节方法,实现了大推理模型中高效且稳定的隐私保护去学习,减少隐私泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09141 2026-01-15 cs.CL 57%

Identity-Robust Language Model Generation via Content Integrity Preservation

通过内容完整性保护实现身份鲁棒的语言模型生成

Miao Zhang, Kelly Chen, Md Mehrab Tanjim, Rumi Chunara

机构 * New York University(纽约大学) Adobe Research(Adobe研究)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本文提出了一种轻量级、无需训练的框架,通过保留语义关键属性并中和非关键身份信息,实现身份鲁棒的语言模型生成,有效减少身份依赖性偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08880 2026-01-15 cs.CY 57%

LERA: Reinstating Judgment as a Structural Precondition for Execution in Automated Systems

LERA:将判断作为执行的结构性前提重新引入自动化系统中

Jing, Liu

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 LERA提出判断作为执行的结构性前提,通过治理门将执行合法性绑定到判断完成,确保执行权威的问责性。

Comments 12 pages, 1 figure. Conceptual architecture paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08860 2026-01-15 cs.CV cs.AI 57%

Bias Detection and Rotation-Robustness Mitigation in Vision-Language Models and Generative Image Models

视觉-语言模型和生成图像模型中的偏见检测与旋转鲁棒性缓解

Tarannum Mithila

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出旋转鲁棒缓解策略,通过数据增强、表征对齐和模型正则化,提升视觉-语言和生成图像模型在旋转和分布偏移下的鲁棒性和公平性。

Comments Preprint. This work is derived from the author's Master's research. Code and supplementary materials will be released separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07954 2026-01-14 cs.CL 57%

A Human-Centric Pipeline for Aligning Large Language Models with Chinese Medical Ethics

面向中文医疗伦理的以人为本的大型语言模型对齐流水线

Haoan Jin, Han Ying, Jiacheng Ji, Hanhui Xu, Mengyue Wu

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出MedES基准和 guardian-in-the-loop 框架,通过监督微调和偏好优化,实现中文医疗伦理场景下的LLM对齐,提升伦理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06040 2026-01-13 cs.CY 57%

Cognitive Sovereignty and the Neurosecurity Governance Gap: Evidence from Singapore

认知主权与神经安全治理鸿沟:来自新加坡的证据

Hailee Carter

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨了认知主权与神经安全治理鸿沟,通过新加坡案例分析,提出认知主权框架以保护神经过程免受外部干扰。

Comments 18 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04249 2026-01-09 cs.AI 57%

Fuzzy Representation of Norms

模糊表示规范

Ziba Assadi, Paola Inverardi

机构 * Gran Sasso Science Institute(格兰萨索科学研究所)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于模糊逻辑的SLEEC规则表示方法,用于在自主系统中嵌入伦理要求,以解决AI系统可能遇到的伦理困境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04238 2026-01-09 cs.CY 57%

Generative AI for Social Impact

生成式AI用于社会影响

Lingkai Kong, Cheol Woo Kim, Davin Choo, Milind Tambe

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 生成式AI通过LLM代理和扩散模型解决社会影响中的部署瓶颈,实现可扩展且人类对齐的资源优化系统。

Comments To appear in IEEE Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04107 2026-01-08 cs.CY 57%

From Abstract Threats to Institutional Realities: A Comparative Semantic Network Analysis of AI Securitisation in the US, EU, and China

从抽象威胁到制度现实:对美、欧、中三国人工智能安全化的比较语义网络分析

Ruiyi Guo, Bodong Zhang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文通过比较语义网络分析,揭示美欧中三国在人工智能治理上的制度逻辑差异,指出结构性不可通约性导致治理协调困难。

Comments Submitted to the 2026 ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05887 2026-01-06 cs.AI 57%

A three-Level Framework for LLM-Enhanced eXplainable AI: From technical explanations to natural language

一个三层框架用于LLM增强的可解释AI:从技术解释到自然语言

Marilyn Bello, Rafael Bello, Maria-Matilde García, Ann Nowé, Iván Sevillano-García, Francisco Herrera

机构 * Andalusian Research Institute in Data Science and Computational Intelligence(数据科学与计算智能安达卢西亚研究机构) Universidad de Granada(格拉纳达大学) Department of Computer Science(计算机科学系) Artificial Intelligence Lab(人工智能实验室) Vrije Universiteit Brussel(布鲁塞尔自由大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出一个三层框架,利用大型语言模型提升AI解释的可解释性,通过动态对话解释增强社会透明度和用户信任。

Comments 22 pages, 5 figures

Journal ref Bello, M., Bello, R., García, M. M., Nowé, A., Sevillano-García, I., & Herrera, F. (2025). A Three-level Framework for LLM-enhanced Explainable AI: From Technical Explanations to Natural Language. Information Systems Frontiers, 1-22

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24513 2026-01-05 cs.CY 57%

From Static to Dynamic: Evaluating the Perceptual Impact of Dynamic Elements in Urban Scenes via MLLM-Guided Generative Inpainting

从静态到动态:通过MLLM引导的生成修复技术评估城市场景中动态元素的感知影响

Zhiwei Wei, Mengzi Zhang, Boyan Lu, Zhitao Deng, Nai Yang, Hua Liao

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 通过MLLM引导的生成修复技术,研究评估了动态元素在城市场景中的感知影响,发现移除动态元素导致活力显著下降,揭示了光照、人类存在和深度变化对感知变化的关键作用。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23430 2025-12-30 cs.CL 57%

C2PO: Diagnosing and Disentangling Bias Shortcuts in LLMs

C2PO:诊断和解构大语言模型中的偏见捷径

Xuan Feng, Bo An, Tianlong Gu, Liang Chang, Fengrui Hao, Peipeng Yu, Shuai Zhao

机构 * Jinan University(济南大学) Nanyang Technological University(南洋理工大学) Engineering Research Center of Trustworthy AI (Ministry of Education)(可信人工智能工程研究中心) Guangxi Key Laboratory of Trusted Software(广西可信软件重点实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 C2PO通过因果对比偏好优化框架,解决大语言模型中的偏见问题,同时保持推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21699 2025-12-29 cs.AI 57%

Towards Responsible and Explainable AI Agents with Consensus-Driven Reasoning

迈向负责任和可解释的AI代理:基于共识驱动的推理

Eranga Bandara, Tharaka Hewa, Ross Gore, Sachin Shetty, Ravi Mukkamala, Peter Foytik, Abdul Rahman, Safdar H. Bouk, Xueping Liang, Amin Hass, Sachini Rajapakse, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University, Norfolk, VA, USA(老奥本大学) Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) Florida International University, USA(佛罗里达国际大学) Nanyang Technological University, Singapore(南洋理工大学) University of Colombo, Sri Lanka(科伦坡大学) Accenture Technology Labs, Arlington, VA, USA(Accenture技术实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于多模型共识和推理层治理的负责任和可解释的AI代理架构,通过结构化整合不同模型的输出以提升系统鲁棒性、透明度和责任性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04489 2025-12-29 cs.CY 57%

The Decision Path to Control AI Risks Completely: Fundamental Control Mechanisms for AI Governance

完全控制AI风险的决策路径:AI治理的基本控制机制

Yong Tao

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文提出通过五支柱和六种控制机制,构建AI治理架构,以全面控制AI风险并减少潜在威胁。

Comments Added 1 paragraph to Ackowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19950 2025-12-24 cs.CL cs.HC 57%

Bias Beneath the Tone: Empirical Characterisation of Tone Bias in LLM-Driven UX Systems

音调下的偏见:LLM驱动的UX系统中音调偏见的实证刻画

Heet Bodara, Md Masum Mushfiq, Isma Farah Siddiqui

机构 * Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL

AI总结 本文研究了LLM驱动UX系统中的音调偏见问题,通过合成数据集和弱监督方法,揭示了模型在对话中存在系统性的音调偏差,为设计公平可信的对话AI提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17180 2025-12-24 cs.RO cs.AI 57%

Conservative Bias in Multi-Teacher Learning: Why Agents Prefer Low-Reward Advisors

多教师学习中的保守偏见:为什么智能体更偏好低奖励顾问

Maher Mesto, Francisco Cruz

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Escuela de Ingeniería, Universidad Central de Chile(智利中央大学工程学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文揭示了多教师学习中智能体偏好保守低奖励顾问的现象,发现其受保守偏见主导,并在特定阈值下失效,同时在概念漂移情况下显著优于基线Q学习。

Comments 10 pages, 5 figures. Accepted at ACRA 2025 (Australasian Conference on Robotics and Automation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16873 2025-12-19 cs.AI 57%

The Social Responsibility Stack: A Control-Theoretic Architecture for Governing Socio-Technical AI

社会责任栈:一种基于控制理论的治理社会技术AI的架构

Otman A. Basir

机构 * Department of Electrical and Computer Engineering University of Waterloo(电气与计算机工程系滑铁卢大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出社会责任栈架构,通过控制理论将社会价值观嵌入AI系统,实现责任闭环控制,提升AI系统的可问责性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16532 2025-12-19 cs.AI cs.IR 57%

From Personalization to Prejudice: Bias and Discrimination in Memory-Enhanced AI Agents for Recruitment

从个性化到偏见:记忆增强型AI招聘代理中的偏见与歧视

Himanshu Gharat, Himanshi Agrawal, Gourab K. Patro

机构 * Phi Labs, Quantiphi Inc.(Phi实验室、Quantiphi公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究揭示了记忆增强型AI招聘代理中偏见的系统性引入与强化,强调了对LLM基础AI代理的额外防护措施的必要性。

Comments In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26)

Journal ref In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26), 2026, Boise, ID, USA. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16408 2025-12-19 cs.LG cs.MA 57%

NDRL: Cotton Irrigation and Nitrogen Application with Nested Dual-Agent Reinforcement Learning

NDRL:基于嵌套双智能体强化学习的棉花灌溉与氮肥施用

Ruifeng Xu, Liang He

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) Xinjiang Key Laboratory of Signal Detection and Processing(新疆信号检测与处理重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 NDRL通过嵌套双智能体强化学习优化棉花灌溉与氮肥施用,提升产量和资源利用效率。

Comments Accepted by ICONIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17361 2025-12-19 cs.LG cs.CR 57%

Trust Me, I Know This Function: Hijacking LLM Static Analysis using Bias

相信我,我知道这个函数:利用偏见进行LLM静态分析的劫持

Shir Bernstein, David Beste, Daniel Ayzenshteyn, Lea Schonherr, Yisroel Mirsky

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文提出利用LLM的抽象偏见进行代码分析的攻击方法,通过注入熟悉模式攻击来劫持LLM的控制流,揭示了LLM在静态分析中的安全漏洞。

Journal ref The Network and Distributed System Security Symposium (NDSS). 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20764 2025-12-18 cs.CL 57%

Feel the Difference? A Comparative Analysis of Emotional Arcs in Real and LLM-Generated CBT Sessions

感知差异?真实与LLM生成CBT对话中情感弧的比较分析

Xiaoyi Wang, Jiwei Zhang, Guangtao Zhang, Honglei Guo

机构 * Department of Computer Science, Shantou University(汕头大学计算机科学系) Department of Automation, Tsinghua University(清华大学自动化系) BNRIST, Tsinghua University(清华大学脑科学与类脑智能研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本研究通过比较真实与LLM生成的CBT对话,揭示了合成对话在情感动态上的不足,强调了情感真实性的关键作用。

Comments Accepted at 2025 EMNLP findings,19 page,2 figures

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 19999-20017

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13739 2025-12-17 cs.CV cs.AI 57%

Human-AI Collaboration Mechanism Study on AIGC Assisted Image Production for Special Coverage

面向特殊报道的AIGC辅助图像生成中的人机协作机制研究

Yajie Yang, Yuqing Zhao, Xiaochao Xi, Yinan Zhu

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种人机协作机制,用于在特殊报道中通过AIGC辅助图像生成,结合高精度分割、语义对齐和风格调节技术,确保内容准确性和可验证性。

Comments AAAI-AISI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13699 2025-12-17 cs.CY 57%

Us-vs-Them bias in Large Language Models

大语言模型中的‘我们 vs 他们’偏见

Tabia Tanzin Prama, Julia Witte Zimmerman, Christopher M. Danforth, Peter Sheridan Dodds

专题命中 AI治理与伦理 :DPO(abstract);分类 cs.CY

AI总结 本研究发现大语言模型在不同人设下表现出‘我们 vs 他们’偏见,通过微调和DPO方法可有效缓解这种偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12652 2025-12-16 cs.AI cs.MA 57%

Value-Aware Multiagent Systems

具有价值意识的多智能体系统

Nardine Osman

机构 * Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究 institute (IIIA-CSIC))

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种具有价值意识的多智能体系统框架,通过三个核心支柱实现价值对齐和行为可解释性,并展示了其在现实领域的应用。

Journal ref In Coordination, Organizations, Institutions, Norms, and Ethics for Governance of Multi-Agent Systems XVII. COINE 2024. LNCS, vol 15398. Springer, Cham (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12501 2025-12-16 cs.AI 57%

SafeGen: Embedding Ethical Safeguards in Text-to-Image Generation

SafeGen: 在文本到图像生成中嵌入伦理保障

Dang Phuong Nam, Nguyen Kieu, Pham Thanh Hieu

机构 * Posts and Telecommunications Institute of Technology(电信技术研究所)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 SafeGen通过整合BGE-M3和Hyper-SD,实现文本到图像生成中的伦理保障,有效过滤有害提示并生成高质量图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08981 2025-12-11 cs.CV cs.AI 57%

Mitigating Bias with Words: Inducing Demographic Ambiguity in Face Recognition Templates by Text Encoding

通过词语缓解偏见:通过文本编码在人脸识别模板中诱导人口统计学模糊性

Tahar Chettaoui, Naser Damer, Fadi Boutros

机构 * Fraunhofer IGD(弗劳恩霍夫研究所(IGD)) TU Darmstadt(德累斯顿技术大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 通过引入文本编码,UTIE在人脸识别模板中诱导人口统计学模糊性,以减少偏见并提升验证性能。

Comments Accepted at BMVC workshop (SRBS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06616 2025-12-10 cs.HC cs.AI 57%

Memory Power Asymmetry in Human-AI Relationships: Preserving Mutual Forgetting in the Digital Age

人机关系中的记忆权力不对称:在数字时代保持相互遗忘

Rasam Dorri, Rami Zwick

机构 * School of Business, University of California, Riverside(加州大学河滨分校商学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出记忆权力不对称概念,探讨人机关系中因记忆能力差异导致的权力失衡,并提出六个恢复健康记忆平衡的设计原则。

Comments 31 pages, 2 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07909 2025-12-10 cs.CR cs.CY 57%

Agentic Artificial Intelligence for Ethical Cybersecurity in Uganda: A Reinforcement Learning Framework for Threat Detection in Resource-Constrained Environments

代理人工智能用于乌干达的伦理网络安全:一种强化学习框架用于资源受限环境中的威胁检测

Ibrahim Adabara, Bashir Olaniyi Sadiq, Aliyu Nuhu Shuaibu, Yale Ibrahim Danjuma, Venkateswarlu Maninti, Mutebi Joe

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

AI总结 本研究提出一种结合强化学习和伦理治理的代理人工智能框架,用于资源受限环境中的网络安全威胁检测,实现了100%的检测率和零假阳性,提升网络安全效果和公平性。

Comments 29 pages, 7 figures, 2 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07360 2025-12-09 cs.CV cs.AI 57%

Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic Segmentation

基于区域邻接图的结构感知特征校正用于无训练开放词汇语义分割

Qiming Huang, Hao Ai, Jianbo Jiao

机构 * The MIx Group, School of Computer Science University of Birmingham(米克集团,计算机科学学院,伯明翰大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于区域邻接图的结构感知特征校正方法,通过增强局部辨别能力来提升开放词汇语义分割的性能。

Comments Accepted to WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12758 2025-12-09 cs.CL 57%

Democratic or Authoritarian? Probing a New Dimension of Political Biases in Large Language Models

民主或威权?探讨大型语言模型中政治偏见的新维度

David Guzman Piedrahita, Irene Strauss, Bernhard Schölkopf, Rada Mihalcea, Zhijing Jin

机构 * University of Zürich(苏黎世大学) ETH Zürich(苏黎世联邦理工学院) MPI for Intelligent Systems(智能系统研究所) University of Michigan(密歇根大学) University of Toronto(多伦多大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文探讨了大型语言模型在民主与威权政治偏见方面的表现,通过引入F-scale、FavScore和角色模型探测方法,揭示了模型在不同语言提示下对民主与威权倾向性的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏