arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-04 至 2026-08-04 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 8 篇

2511.00382 2026-08-04 cs.AI cs.LG 版本更新 88%

Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs

效率与对齐:研究大语言模型参数高效微调中的安全与公平风险

Mina Taraghi, Yann Pequignot, Amin Nikanjam, Mohamed Amine Merzouk, Foutse Khomh

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究发现良性参数高效微调会改变大语言模型的安全与公平性,基于适配器的方法更安全,基础模型和PEFT类型会影响对齐偏移,需按类别审计安全与公平性。

Comments Revised version with expanded experiments, robustness analyses, and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00175 2026-08-04 cs.LG cs.AI 新提交 81%

Inference-Time Policy Alignment for Fair Reinforcement Learning

用于公平强化学习的推理时策略对齐

Umer Siddique, Peilang Li, Conor Wallace, Yongcan Cao

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出乘法策略塑造框架,在不更新预训练RL策略参数的情况下,于推理时提升公平性,同时保留核心任务性能,适用于各类深度RL智能体。

Comments Accepted at the Reinforcement Learning Conference (RLC) 2026. 13 pages main + appendix, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02244 2026-08-04 cs.DC cs.SY eess.SY 新提交 71%

Efficiency and Cost Alignment in Batched LLM Serving via Resource-Fair Scheduling

通过资源公平调度实现批量大语言模型(LLM)服务的效率与成本对齐

Dayi Yao, Zijie Zhou

专题命中 AI治理与伦理 :alignment(title)

AI总结 本文针对批量LLM服务中异构请求导致的资源分配低效问题,提出ISJL算法,实现高吞吐量的同时对齐最大驱动批次成本与token计量收入,达到3/4的竞争比下界,平衡了FCFS与LJF的优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24742 2026-08-04 cs.AI cs.LG cs.MA nlin.AO 版本更新 62%

Trust or Check? Understanding the (Evolutionary) Dynamics of User Trust in AI Systems

信任作为监控:用户信任与AI开发者行为的进化动态

Adeela Bashir, Zhao Song, Ndidi Bianca Ogbo, Nataliya Balabanova, Martin Smit, Chin-wing Leung, Paolo Bova, Manuel Chica Serrano, Dhanushka Dissanayake, Manh Hong Duong, Elias Fernandez Domingos, Nikita Huber-Kralj, Marcus Krellner, Andrew Powell, Stefan Sarkadi, Fernando P. Santos, Zia Ush Shamszaman, Chaimaa Tarzi, Paolo Turrini, Grace Ibukunoluwa Ufeoshi, Victor A. Vargas-Perez, Alessandro Di Stefano, Simon T. Powers, The Anh Han

机构 * School Computing, Engineering and Digital Technologies, Teesside University(特塞斯大学计算、工程和数字技术学院) School of Mathematics, University of Birmingham(伯明翰大学数学学院) Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学院) Department of Computer Science, University of Warwick(沃里克大学计算机科学系) Department of Computer Science and Artificial Intelligence (DECSAI) and Andalusian Research Institute DaSCI “Data Science and Computational Intelligence”, University of Granada, Spain(格拉纳达大学计算机科学与人工智能系(DECSAI)和安达卢西亚数据科学与计算智能研究所) Machine Learning Group, Université libre de Bruxelles(布鲁塞尔自由大学机器学习组) AI Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学人工智能实验室) University of Technology Dresden(德累斯顿技术大学) School of Engineering and Physical Sciences, University of Lincoln(林肯大学工程与物理科学学院) Division of Computing Science and Mathematics, University of Stirling(斯特灵大学计算科学与数学系)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究用户信任与AI开发者行为的进化动态,通过进化博弈论分析不同监控成本和制度下信任策略的演变,发现只有安全且广泛采纳的系统是理想结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00937 2026-08-04 cs.CR cs.AI cs.MA 新提交 57%

Neuro-Symbolic Participation Governance for Verifiable AI Agents in Open Digital Twin Ecosystems

开放数字孪生生态中可验证AI智能体的神经符号参与治理

Juan Li, Wei Cai, Yan Bai

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 该研究针对开放数字孪生生态中AI智能体的验证需求,提出神经符号去中心化治理框架,结合神经推理与制度治理,通过区块链智能合约实现可审计参与,经原型验证可管控开销下保障合规协作。

Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026), Bellevue, WA, USA, October 4-7, 2026. 7 pages, 1 figure, 5 tables. Code: https://github.com/weicaiuw/verigov-ai (DOI: 10.5281/zenodo.21706699)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15249 2026-08-04 cs.CV cs.AI 57%

Intersectional Fairness in Vision-Language Models for Medical Image Disease Classification

视觉-语言模型在医学影像疾病分类中的交叉公平性

Yupeng Zhang, Adam G. Dunn, Usman Naseem, Jinman Kim

机构 * Biomedical Data Analysis and Visualisation (BDAV) Lab, School of Computer Science(生物医学数据分析与可视化实验室,计算机科学学院) Sydney School of Public Health(悉尼公共卫生学院) School of Computing(计算学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出CMAC-MMD框架,通过标准化交叉亚组的诊断确定性,减少医学影像疾病分类中的交叉偏见,提升诊断准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01661 2026-08-04 cs.CV 新提交 50%

FairForensics: Seeing Expressions and Parsing Demographics via Vision-Language Modeling for Generalizable Fair Deepfake Detection

FairForensics:基于视觉-语言建模的通用公平深度伪造检测——表情感知与人口统计解析

Yaning Zhang, Jiao Wu, Zan Gao, Linlin Shen

机构 * Shenzhen University(深圳大学) Shandong Artificial Intelligence Institute(山东省人工智能研究院) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) Tianjin University of Technology(天津理工大学)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文构建人口统计平衡的深度伪造检测基准,提出FairForensics视觉-语言模型,通过表情感知与人口统计正则化实现通用公平检测,在基准上达到泛化与公平性的SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03697 2026-08-04 eess.AS 版本更新 50%

Improving ASR Fairness for Cleft Lip and Palate Speech: A Study on Severity-Aware Data Mixing

改善唇腭裂语音的自动语音识别公平性:一项关于严重程度感知数据混合的研究

Susmita Bhattacharjee, Jagabandhu Mishra, H. S. Shekhawat, Ravi Jasuja, S. R. Mahadeva Prasanna

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 该研究针对唇腭裂(CLP)语音的ASR公平性问题,提出严重程度感知的CLP与正常语音混合策略,在AIISH和NMCPC数据集上使GMM-HMM、Whisper等模型的词错误率显著降低,提升了ASR公平性。

Comments Submitted to Speech Communication

详情

展开后加载摘要…

URL PDF HTML 收藏