arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1832 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1832 篇

2608.12669 2026-08-14 cs.CY 新提交 57%

From Fair Representation to Just Recognition in Generative AI

从生成式AI中的公平表征到公正承认

Severin Engelmann, Daniel Susser

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 该研究针对生成式AI的公平挑战,指出现有表征公平策略存在局限,提出借鉴参与平等理论,从表征公平转向承认正义以解决相关问题。

Comments Accepted for publication at the 2026 AAAI/ACM Conference on AI, Ethics, and Society (AIES)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11207 2026-08-13 cs.AI 新提交 57%

Dynamic Governance of Multi-LLM Agent Systems for Collaborative Conversational Outcomes

用于实现协作式对话结果的多大型语言模型智能体系统的动态管控

Alexander Liss, Nicholas Desmond, Santiago Gil Gallego

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文针对多LLM智能体对话崩溃问题,提出体验编排器EO管控层,通过三种机制提升顾问联系率,在6万次模拟中取得显著效果,为多智能体协作提供新方案。

Comments 13 pages, 3 figures, 3 tables. Submitted to AI Engineer World's Fair 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15770 2026-08-12 cs.CV cs.LG 版本更新 57%

Concept Labels Are Not Enough: Rethinking Concept Bottleneck Models through Representation Integrity

通过解耦概念瓶颈缓解多媒体识别中的虚假背景偏差

Gaoxiang Huang, Songning Lai, Yutao Yue

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出轻量解耦概念瓶颈模型LDCBM,通过滤波分组损失和联合概念监督提升视觉模式与概念的对齐,实验证明其在概念和分类准确率上优于现有CBMs,且计算复杂度更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09857 2026-08-11 cs.RO cs.AI 新提交 57%

Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

智能体 harness:面向机器人自主的大语言模型驱动验证层

Rohan Bhagra, Mahantesh Halapannavar, Uddhav Bhattarai

机构 * Carnegie Mellon University(卡内基梅隆大学) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 针对机器人规划模型的安全与伦理风险,提出LLM驱动的验证层作为中间件管控计划,实现近85%的类别准确率、97%的对抗性攻击遏制率,为机器人自主提供可靠保障。

Comments 7 pages. Not yet finalized for conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08284 2026-08-11 cs.AI 新提交 57%

Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders

表面上公平?对LLM推荐器的隐藏输出公平性差距进行基准测试

Chan Aristella Lu, Arya Fayyazi, Junhao Zhang, Saeid Shokoufa, Yue Xing, Zhen Xiang, Kyu Hyung Lee, Mehdi Kamal, Massoud Pedram

机构 * University of Georgia(佐治亚大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Michigan State University(密歇根州立大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 该研究提出首个联合评估LLM推荐器可观测输出与隐藏表示公平性的基准FairGap,发现二者存在根本张力,现有框架无法诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08220 2026-08-11 cs.AI 新提交 57%

Metanormative Theory for RL-Based Moral Agents

基于强化学习的道德智能体的元规范理论

Aleks Knoks, Marija Slavkovik

机构 * University of Luxembourg(卢森堡大学) University of Bergen(卑尔根大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文针对强化学习(RL)道德智能体设计中哲学文献被边缘化的问题,提炼元规范理论的相关理念审视RL架构,以明确RL智能体道德行为的判定标准,为评估相关RL方法奠定基础。

Comments The 14th International Workshop on Engineering Multi-Agent Systems (EMAS 2026) held May 25-26, 2026 Co-located with AAMAS 2026 Paphos, Cyprus

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07515 2026-08-11 cs.CY 新提交 57%

Bridging AI Risk Frameworks: Reconciling ISO/IEC 42001, the NIST AI Risk Management Framework, and the EU AI Act into a Uni ed Governance Taxonomy

衔接AI风险框架:将ISO/IEC 42001、美国国家标准与技术研究院AI风险管理框架(NIST AI RMF 1.0)及欧盟AI法案整合为统一治理分类体系

Vinod Dhiman

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

AI总结 本文整合ISO/IEC 42001、NIST AI RMF和欧盟AI法案,构建统一AI治理分类体系,提出实施模型与示例,助力组织同时满足三者要求且无需重复付出。

Comments 17 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07477 2026-08-11 cs.HC cs.AI 新提交 57%

Designing for Ethical AI: HCI Feature Considerations to Improve Fairness and User Experience in AutoML use for Human Resources

面向伦理人工智能的设计:用于人力资源的自动机器学习(AutoML)中提升公平性与用户体验的人机交互(HCI)功能考量

Sundaraparipurnan Narayanan

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 该论文结合多视角研究AutoML在人力资源招聘中的公平性,发现现有平台存在缺陷,提出五维度HCI公平评估框架,建议将公平性嵌入AutoML设计以提升伦理可持续性。

Comments 295 pages; Doctoral Thesis;28 figures; 42 tables; 248 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20255 2026-08-10 cs.CR cs.AI 版本更新 57%

The Ethics of Autonomous AI Agents for Offensive Security

用于进攻性安全的自主人工智能代理的伦理问题

Andreas Happe, Jürgen Cito, Jasmin Wachter

机构 * TU Wien(维也纳技术大学) University of Klagenfurt(克雷格福大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究使用自主人工智能代理进行进攻性安全时的伦理问题,分析道德归因在多方的扩散及技术对利益相关者的影响,通过研究其不确定性等特性及攻防成本不对称性,为现有框架不适用于此情况提供分层建议。

Comments accepted at FAIEMA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06353 2026-08-07 cs.GT cs.AI cs.MA 新提交 57%

Resourced Authority A Mechanism-Design Model for Participatory Governance of Deployed AI Agents

资源权威:部署AI代理参与式治理的机制设计模型

Praphul Chandra, Sujit Gujar, Ganesh Ghalme

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本研究提出资源权威机制设计模型,用于通过计算预算使授权自我执行,实现对已部署AI代理的参与式治理,同时指出被治理代理操纵治理 electorate 是核心开放问题。

Comments 22 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06246 2026-08-07 cs.LG 新提交 57%

A Six-Dimensional Taxonomy of Post-Training Adaptation Techniques with Applications in AI Governance

用于人工智能治理的后训练适应技术的六维分类法

Fardin Afdideh, Fernando Seoane, Farhad Abtahi

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本综述构建了后训练适应技术的六维分类法,梳理技术间关系,为AI治理提供术语支持,并指出该领域的开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06115 2026-08-07 cs.AI 新提交 57%

Mind the Gaps: Mixture-of-Minds for Human Simulation

关注差距:用于人类模拟的思维混合模型

Pranav Dahiya

机构 * Semilattice(半格)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出Anacreon受众模拟模型,基于Gemma 4 12B构建思维混合模型,通过聚类个体、情感链等技术,在个体层面序数对齐达0.775,缩小了群体与个体模拟的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04382 2026-08-06 cs.LG stat.ML 新提交 57%

Non-asymptotic implicit bias of logistic regression at early-stage gradient descent dynamics

早期梯度下降动力学下逻辑回归的非渐近隐式偏置

Han Bao

机构 * The Institute of Statistical Mathematics(统计数理研究所) Tohoku University(东北大学) RIKEN AIP(理化学研究所人工智能项目)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本研究揭示早期梯度下降动力学中逻辑回归参数向量与最大间隔方向弱对齐的机制,给出对齐迭代次数的紧上界,为理解训练时长与泛化性能的关联提供理论支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03670 2026-08-05 cs.CY 新提交 57%

Accountability Asymmetry and Structural Trust in Autonomous AI Systems

自主AI系统中的问责不对称性与结构性信任

Nathan DeBardeleben

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文针对自主AI系统中问责不对称导致的信任问题,提出将其治理视为基础设施可靠性问题,通过工程异质性方案,即独立监测审查补充流程,解决该问题。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02685 2026-08-05 cs.SE cs.AI 新提交 57%

BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests

BulkPR-Bench:针对交互拉取请求的队列级治理基准

Zetong Xiong, Qiao Zhao, Jun Zhang, Xueying Lyu, Zhi Li, Yixiang Tu, Xiaowen Yang, Yunjie Zhang, Yufeng Wang, Zhe Zhang, Kaize Yu, Hanwen Du, Zhongkai Sun, Zhuoxin Liu, Zekun Lin, Jianwen Yang, Ruining Chen, Ying Zhang, Tingxuan Pan, Ke Chen, Shubin Han, Chuanhao Sun, Yehua Yang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 该研究推出BulkPR-Bench基准,针对交互PR队列治理,实验显示现有模型在该任务上表现优于顺序基准,但仍存在较大提升空间。

Comments 12 pages, 5 figures. Artifact: https://github.com/Eureka246/BulkPR-Bench-Release ; archived artifact: https://doi.org/10.5281/zenodo.21717780

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00937 2026-08-04 cs.CR cs.AI cs.MA 新提交 57%

Neuro-Symbolic Participation Governance for Verifiable AI Agents in Open Digital Twin Ecosystems

开放数字孪生生态中可验证AI智能体的神经符号参与治理

Juan Li, Wei Cai, Yan Bai

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 该研究针对开放数字孪生生态中AI智能体的验证需求,提出神经符号去中心化治理框架,结合神经推理与制度治理,通过区块链智能合约实现可审计参与,经原型验证可管控开销下保障合规协作。

Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026), Bellevue, WA, USA, October 4-7, 2026. 7 pages, 1 figure, 5 tables. Code: https://github.com/weicaiuw/verigov-ai (DOI: 10.5281/zenodo.21706699)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15249 2026-08-04 cs.CV cs.AI 57%

Intersectional Fairness in Vision-Language Models for Medical Image Disease Classification

视觉-语言模型在医学影像疾病分类中的交叉公平性

Yupeng Zhang, Adam G. Dunn, Usman Naseem, Jinman Kim

机构 * Biomedical Data Analysis and Visualisation (BDAV) Lab, School of Computer Science(生物医学数据分析与可视化实验室,计算机科学学院) Sydney School of Public Health(悉尼公共卫生学院) School of Computing(计算学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出CMAC-MMD框架,通过标准化交叉亚组的诊断确定性,减少医学影像疾病分类中的交叉偏见,提升诊断准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23396 2026-08-03 stat.ML cs.LG 57%

AICO: Feature Significance Tests for Supervised Learning

AICO:监督学习中的特征重要性检验

Kay Giesecke, Enguerrand Horel, Chartsiri Jirachotkulthorn

机构 * Stanford University, Department of Management Science and Engineering and Institute for Computational and Mathematical Engineering(斯坦福大学管理科学与工程系和计算与数学工程研究所) Upstart, Inc.(Upstart公司) Stanford University, Institute for Computational and Mathematical Engineering(斯坦福大学计算与数学工程研究所)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG

AI总结 AICO提出一种高效统计方法,通过屏蔽特征信息来测试特征对预测性能的贡献,为大规模模型提供无分布假设的可解释性工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10680 2026-08-03 cs.HC cs.AI 57%

A Platform-Agnostic Multimodal Digital Human Modelling Framework: Neurophysiological Sensing in Game-Based Interaction

一种平台无关的多模态数字人类建模框架:基于游戏交互的神经生理传感

Daniel J. Buxton, Mufti Mahmud, Jordan J. Bird, Thomas Hughes-Roberts, David J. Brown

机构 * Nottingham Trent University(诺丁汉特伦大学) King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种平台无关的多模态数字人类建模框架,通过统一的神经生理传感和游戏交互环境,支持AI驱动的可重复、可扩展的交互研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06945 2026-08-03 cs.LG cond-mat.dis-nn physics.data-an quant-ph 版本更新 57%

Fisher Information, Training and Bias in Fourier Regression Models

傅里叶回归模型中的费舍尔信息、训练与偏差

Lorenzo Pastori, Veronika Eyring, Mierk Schwabe

机构 * Deutsches Zentrum für Luft- und Raumfahrt (DLR), Institut für Physik der Atmosphäre(德国航空航天中心(DLR)大气物理研究所) Institute of Environmental Physics (IUP), University of Bremen(环境物理学研究所(IUP),不莱梅大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 该研究利用量子神经网络与傅里叶模型的等价性,推导傅里叶模型的费舍尔信息矩阵,分析有效维度与任务偏差对模型训练和性能的影响,还引入傅里叶模型的张量网络表示,为机器学习研究提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28094 2026-07-31 cs.AI 新提交 57%

An Instrument to Evaluate Governance Proposals: AI Policy Analysis at Scale

一种用于评估治理提案的工具:规模化AI政策分析

Paulo Carvao, Claudio Mayrink Verdun, Isabel Adler, Jeffrey Zhou

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种AI政策分析框架,结合专家见解与计算分析,以领域校准模型为基准评估商业LLM,助力用户评估AI治理提案的属性一致性,支持政策制定等人员应对复杂环境。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27744 2026-07-31 cs.AI 版本更新 57%

A Policy-Driven Runtime Layer for Agentic LLM Serving

一种面向智能体LLM服务的策略驱动运行时层

Rui Zhang, Chaeeun Kim, Liting Hu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 针对多智能体LLM系统中跨层策略难以高效实现的问题,提出在框架与引擎之间插入智能体运行时层,通过四个原语支持任意智能体感知策略,并在KV缓存策略CacheSage上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18687 2026-07-31 econ.GN cs.AI cs.GT q-fin.EC 版本更新 57%

When Do AI Gains Become Broadly Shareable? A Policy Threshold for AI-Driven Automation

为AI自动化经济中的租金资助型全民基本收入设定AI能力阈值

Aran Nayebi

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 该研究为AI自动化经济中通过AI能力阈值可持续资助UBI提供了闭式条件,并探讨了政策工具和市场结构对阈值的影响。

Comments 15 pages, 3 figures. To appear in AI, Ethics, and Society (AIES) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26355 2026-07-30 cs.CL 新提交 57%

Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs

偏见交响曲:探索多模态大语言模型(LLMs)与乐器的性别关联

Farhan Farsi, Shayan Bali, Mohammad Heydari Rad, Negar Heidary, Donya Rooein

机构 * Amirkabir University of Technology(阿米尔卡比尔理工大学) King’s College London(伦敦国王学院) University of Tehran(德黑兰大学) Bocconi University(博科尼大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本研究推出多模态数据集Symphony-Bias,评估多模态模型在乐器性别关联上的偏见,发现多数结果符合社会研究,契合度随文本、视觉、音频依次减弱。

Comments 32 pages, 23 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25507 2026-07-29 cs.CL 新提交 57%

Phase Structure in Rotary Attention: A Spectral Framework for Semantic Continuity and Execution-Boundary Governance

旋转注意力中的相位结构:语义连续性和执行边界治理的谱框架

Abraham Chachamovits

机构 * ENTRUST AI(ENTRUST人工智能公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究Transformer语言模型中旋转注意力的相位结构,通过定义有效域、推导分数和引入函数构建谱框架,可区分表征连续性与执行边界可接受性,为相关研究提供理论和方法程序。

Comments 14 pages; theoretical framework and proposed experimental program

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25227 2026-07-29 cs.CR cs.LG 新提交 57%

Decision-Level Hijacking: Injecting Cognitive Bias into Large Language Models via Bit-Flip Attacks

决策级劫持:通过位翻转攻击向大语言模型注入认知偏差

Yu Yan, Jiahao Chen, Siqi Lu, Yongjuan Wang, Ziming Zhao, Zhaoxuan Li, Tianyu Du, Qingjun Yuan, Shouling Ji

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 研究大语言模型在高风险决策场景中的决策级劫持问题,提出CogBias框架,利用位翻转攻击,通过可微情感评估器等将主观偏好转化为优化信号,经实验验证该方法能在少量位翻转下诱导目标主题立场转变,破坏模型价值对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22016 2026-07-27 cs.CV cs.AI 新提交 57%

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

EVL-MCoT:用于有害模因检测的增强视觉语言多思维链

Hao Yang, Jin Wang, Xuejie Zhang

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 针对有害模因检测,提出增强视觉语言多CoT(EVL-MCoT)方法,通过促进多CoT及设计解码框架,解决现有方法局限,在相关数据集上获良好结果,且公开了源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20695 2026-07-24 cs.CY 新提交 57%

Language Models Embody and Amplify Human Cognitive Distortions: What Is to Be Done?

语言模型体现并放大人类认知扭曲:该怎么办?

Arnau Marin-Llobet, Steven A. Lehr, Mahzarin R. Banaji

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 研究指出语言模型存在社会认知偏见,它不仅体现人类偏见,还会放大、加剧并传递偏见,鉴于其对决策影响巨大,提出了从诊断、监管和操作方面应对语言模型偏见问题的对策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20410 2026-07-23 cs.CL 新提交 57%

LKValues: Aligning Large Language Models with Sri Lankan Societal Values

LKValues:使大语言模型与斯里兰卡社会价值观保持一致

Nethmi Muthugala, Supryadi, Surangika Ranathunga, Nisansa de Silva, Ruijie Tao, Ovindu Gunatunga, Pengyun Zhu, Shaowei Zhang, Jingting Zheng, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室) School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) Department of Computer Science & Engineering, University of Moratuwa(莫拉图瓦大学计算机科学与工程系) Johns Hopkins University(约翰霍普金斯大学) School of Computing, University of Colombo(科伦坡大学计算机学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究针对大语言模型价值对齐存在西方文化偏见问题,以斯里兰卡为例,提出LKValues资源套件,通过调查得出社会价值观,构建语料库和评估基准,经实验发现其能改善模型表现,为低资源国家价值对齐提供可复制流程。

Comments 37 pages, 10 figures, and 15 tables. Includes appendices. Datasets are available at the project repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18246 2026-07-22 cs.AI cs.SE 新提交 57%

Phionyx: A Deterministic AI Runtime Architecture with Structured State Management and Pre-Response Governance

Phionyx:一种具有结构化状态管理和响应前治理的确定性人工智能运行时架构

Ali Toygar Abak

机构 * Phionyx Research(Phionyx研究公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究提出Phionyx确定性人工智能运行时架构,源于Echoism框架,以治理为先。通过结构化状态向量实现确定性状态演化,集成三层架构。实验验证其在单实例部署中可降低计算开销、提高数据保留率,还介绍了架构及实验证据,分布式或多租户部署待后续研究。

Comments 27 pages, 4 figures, 5 tables. Reference implementation, reproducibility pack, and evaluation artifacts available via GitHub (https://github.com/halvrenofviryel/phionyx-research) and Zenodo (DOI: 10.5281/zenodo.20027534)

详情

展开后加载摘要…

URL PDF HTML 收藏