arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1394 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 69 篇

2508.05132 2026-07-28 cs.CL cs.AI 版本更新 81%

PrinciplismQA: A Philosophy-Grounded Approach to Assessing LLM-Human Clinical Medical Ethics Alignment

PrinciplismQA: 一种基于哲学的评估LLM与人类临床医学伦理对齐的方法

Chang Hong, Minghao Wu, Qingying Xiao, Yuchi Wang, Xiang Wan, Guangjun Yu, Benyou Wang, Yan Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National Health Data Institute, Shenzhen(深圳国家健康数据研究院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出PrinciplismQA,一种基于哲学框架的评估方法,用于评估LLM在临床医学伦理上的对齐情况,通过专家验证的问题集揭示模型在伦理推理上的不足。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16827 2026-07-23 cs.AI cs.CL 版本更新 81%

Prompt Programming for Cultural Bias and Alignment of Large Language Models

提示编程用于大型语言模型的文化偏差与对齐

Maksim Eren, Eric Michalak, Brian Cook, Johnny Seales

机构 * Information Systems and Modeling, Los Alamos National Laboratory(信息系统与建模,洛斯阿拉莫斯国家实验室) Advanced Research in Cyber Systems, Los Alamos National Laboratory(网络安全系统高级研究,洛斯阿拉莫斯国家实验室) Center for National Security and International Studies(国家安全与国际研究中心) Analytics Division, Los Alamos National Laboratory(分析部门,洛斯阿拉莫斯国家实验室)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过提示编程优化大型语言模型的文化对齐,利用DSPy框架系统调整治文化偏差,实验表明提示优化优于传统手动提示工程,提升模型响应的可转移性与稳定性。

Comments 10 pages, pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14215 2026-07-09 cs.CY 版本更新 79%

Safety Degradation in AI Agents

人工智能代理中的安全退化

Cheng Yu, Benedikt Stroebl, Diyi Yang, Orestis Papakyriakopoulos

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.CY

AI总结 研究人工智能代理安全问题,通过对审查和未审查的语言模型及人工智能代理广泛基准测试,发现随着检索访问扩展,模型出现安全退化现象,基于对齐语言模型构建的支持检索的代理更不安全,强调需缓解策略确保其公平性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16870 2026-07-07 cs.CR cs.AI cs.OS 版本更新 79%

Governed MCP: Kernel-Level Tool Governance for AI Agents via Logit-Based Safety Primitives

受控MCP:通过基于logit的安全原语实现AI代理的内核级工具治理

Daeyeon Son

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 本文提出 Governed MCP,一种基于logit的安全原语的内核级工具治理网关,通过六层管道对MCP工具调用进行安全检查,提升AI代理的安全性。

Comments 14 pages, 6 tables. Companion paper to arXiv:2604.11943 (ProbeLogits)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08245 2026-06-24 cs.CV cs.AI 版本更新 79%

When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models

语言覆盖视觉:视觉语言模型中的过度对齐与几何去偏

Harshvardhan Saini, Samyak Jha, Yiming Tang, Dianbo Liu

机构 * Indian Institute of Technology Dhanbad(印度理工学院丹巴德分校) National University of Singapore(新加坡国立大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 本文研究视觉语言模型中过度对齐导致的幻觉问题,提出几何去偏方法,通过投影消除文本子空间影响,减少幻觉并提升长文本生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07027 2026-06-10 cs.LG cs.AI 版本更新 76%

Representational Alignment with Chemical Induced Fit for Molecular Relational Learning

基于化学诱导契合的表征对齐用于分子关系学习

Peiliang Zhang, Jingling Yuan, Qing Xie, Yongjun Zhu, Chao Che, Lin Li

机构 * Wuhan University of Technology(武汉理工大学) Yonsei University(延世大学) Hubei Key Laboratory of Transportation Internet of Things(湖北省交通运输物联网重点实验室) Dalian University(大连大学)

专题命中 AI治理与伦理 :alignment(title);分类 cs.AI、cs.LG

AI总结 提出ReAlignFit方法,通过引入化学诱导契合的归纳偏置动态对齐子结构表征,并利用子图信息瓶颈优化高化学功能兼容性的子结构对,以提升分子关系学习在化学空间偏移数据上的稳定性。

Comments Accepted by SIGKDD2026 AI for Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01925 2026-07-24 cs.CL cs.AI 版本更新 73%

ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues

ImplicitBBQ: 通过基于特征的提示对大语言模型中的隐性偏见进行基准测试

Bhaskara Hanuma Vedula, Darshan Anghan, Ishita Goyal, Ponnurangam Kumaraguru, Abhijnan Chakraborty

机构 * International Institute of Information Technology, Hyderabad(国际信息技术学院海得拉巴) Indian Institute of Technology, Kharagpur(印度理工学院克勒格布尔分校)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImplicitBBQ基准测试,通过基于特征的提示评估大语言模型中的隐性偏见,发现隐性偏见在模糊情境中比显性偏见高六倍,现有方法难以有效缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00626 2026-06-19 cs.LG cs.CL 版本更新 73%

A Survey of On-Policy Distillation for Large Language Models

大型语言模型的在线策略蒸馏综述

Mingyang Song, Mao Zheng

机构 * Tencent, China(腾讯,中国)

专题命中 AI治理与伦理 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文综述了大型语言模型的在线策略蒸馏方法,探讨了蒸馏过程中如何通过反馈减少累积误差,提出了基于f-散度最小化的蒸馏框架,并分析了蒸馏与强化学习之间的联系。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27628 2026-06-12 cs.AI cs.CY cs.ET cs.MA cs.SY eess.SY 版本更新 73%

Intelligence as Managed Autonomy: Failure, Escalation, and Governance for Agentic AI Systems

智能作为受管自主:代理型AI系统的失败、升级与治理

Srini Ramaswamy

机构 * DNRS.ai USA(DNRS.ai美国公司)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出SMARt模型,通过形式化能力检测认知漂移、暂停推理、尝试恢复并在可靠性下降时放弃控制,以解决自主AI系统中的幻觉和持续不合理行为问题。

Comments This peer-reviewed paper is to appear in the Journal of Intelligent and Robotic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03217 2026-06-10 cs.LG cs.CY 版本更新 73%

Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估

Yash Aggarwal, Atmika Gorti, Vinija Jain, Aman Chadha, Krishnaprasad Thirunarayan, Manas Gaur

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Purdue University(普渡大学) Meta Apple(苹果公司) Wright State University(怀特州立大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY、cs.LG

AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22877 2026-08-11 cs.AI cs.HC cs.RO 版本更新 70%

Physical AI Governance: From Theory to Practice Across Life Cycle

物理人工智能治理:跨越生命周期从理论到实践

Wang Yang, Shaobo Wang, Hongxuan Liu, Xiaoran Cai, Yunyu He, Jingzong Zhou, Mengzhong Ma, Yi Yu, Rohit Sharma, Jingjing Fu, Peng Qi

机构 * Case Western Reserve University(凯斯西储大学) Shanghai Jiao Tong University(上海交通大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学) University of California, Riverside(加州大学河滨分校) Nanyang Technological University(南洋理工大学) New York University(纽约大学) Salesforce(Salesforce公司) Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文对物理人工智能治理进行全面综述,综合现有原则形成统一框架,提出五阶段生命周期,通过具体实践展示各阶段治理操作,为构建安全可信且符合社会价值的物理人工智能系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18236 2026-07-07 cs.CY 版本更新 70%

Two Means to an End Goal: Connecting Explainability and Contestability in the Regulation of Public Sector AI

实现目标的两种方式:在公共部门人工智能监管中连接可解释性与可争议性

Timothée Schmude, Mireia Yurrita, Kars Alfrink, Thomas Le Goff, Sebastian Tschiatschek, Tiphaine Viard

专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.CY

AI总结 探讨公共部门人工智能监管中可解释性与可争议性,通过对14位专家访谈研究其交叉与实施,明确相关差异及实现难点,从设计角度为人工智能政策提三条建议。

Comments 19 pages main text, 4 figures. Supplementary material is provided

Journal ref Proceedings of the 2026 ACM Conference on Fairness, Accountability, and Transparency (pp. 3078-3104). Association for Computing Machinery

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15205 2026-06-23 cs.CY 版本更新 70%

A Peek Behind the Curtain: Using Step-Around Prompt Engineering to Identify Bias and Misinformation in GenAI Models

幕后窥探:使用逐步提示工程识别生成式AI模型中的偏见与虚假信息

Don Hickerson, Mike Perkins

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 本文探讨逐步提示工程作为对抗性提示技术,用于测试生成式AI的安全护栏和偏见缓解机制,并提出了学术伦理治理框架。

Comments v3 Substantial text changes and addition of structured framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08789 2026-07-29 cs.CR 版本更新 67%

Never compromise with vulnerabilities: a comprehensive survey on AI governance

绝不向漏洞妥协:人工智能治理综合调查

Yuchu Jiang, Jian Zhao, Yuchen Yuan, Tianle Zhang, Yao Huang, Yanghao Zhang, Yan Wang, Yanshu Li, Xizhong Guo, Yusheng Zhao, Huilin Zhou, Jun Zhang, Zhi Zhang, Xiaojian Lin, Yixiu Zou, Haoxuan Ma, Yuhu Shang, Yuzhi Hu, Keshu Cai, Ruochen Zhang, Boyuan Chen, Yilan Gao, Ziheng Jiao, Yi Qin, Shuangjun Du, Xiao Tong, Zhekun Liu, Yu Chen, Xuankun Rong, Rui Wang, Yejie Zheng, Zhaoxin Fan, Murat Sensoy, Hongyuan Zhang, Pan Zhou, Lei Jin, Hao Zhao, Xu Yang, Jiaojiao Zhao, Jianshu Li, Joey Tianyi Zhou, Zhi-Qi Cheng, Longtao Huang, Zhiyi Liu, Zheng Zhu, Jianan Li, Gang Wang, Qi Li, Xu-Yao Zhang, Yaodong Yang, Mang Ye, Wenqi Ren, Zhaofeng He, Hang Su, Rongrong Ni, Liping Jing, Xingxing Wei, Junliang Xing, Massimo Alioto, Shengmei Shen, Petia Radeva, Dacheng Tao, Ya-Qin Zhang, Shuicheng Yan, Xuelong Li

专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract)

AI总结 针对人工智能发展带来的技术漏洞及社会风险,提出整合技术与社会维度的框架,围绕三个支柱构建,通过系统回顾识别核心挑战,给出综合研究议程,为开发可靠且符合伦理的人工智能系统提供指导。

Comments 26 pages, 3 figures, accepted by SCIS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19212 2026-07-27 cs.CL cs.AI cs.CY 版本更新 67%

When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas

当伦理与收益相悖时:道德两难情境下的大语言模型智能体

Steffen Backmann, David Guzman Piedrahita, Terry Jingchen Zhang, Emanuel Tewolde, Rada Mihalcea, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04569 2026-07-07 cs.CE 版本更新 67%

Industrial Data-Service-Knowledge Governance: Toward Integrated and Trusted Intelligence

工业数据-服务-知识治理:迈向集成与可信智能

Hailiang Zhao, Ziqi Wang, Daojiang Hu, Mingyi Liu, Jiahui Zhai, Kai Di, Xinkui Zhao, Zhongjie Wang, Jianwei Yin, Albert Zomaya, MengChu Zhou, Shuiguang Deng

专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract)

AI总结 针对人工智能等融合加速工业智能发展但治理机制碎片化问题,提出TRISK框架,基于五维信任模型,综合多研究等探讨数据、服务、知识治理,还讨论实施模式等并勾勒未来研究路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06160 2026-07-02 cs.AI cs.CL cs.CY 版本更新 67%

Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles

通过逻辑网格谜题评估LLM推理中的隐性偏见

Fatima Jahara, Mark Dredze, Sharon Levy

机构 * Rutgers University(罗格斯大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出PRIME框架,利用逻辑网格谜题系统探测LLM在复杂推理中受社会刻板印象的影响,发现模型在解与刻板印象一致时推理更准确。

Comments 26 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19082 2026-06-09 cs.AI cs.CL cs.GT cs.LG cs.MA 版本更新 67%

Payoff scaling shapes cooperation in LLM agents across languages

收益规模塑造跨语言LLM代理的合作行为

Trung-Kiet Huynh, Dao-Sy Duy-Minh, Thanh-Bang Cao, Phong-Hao Le, Hong-Dan Nguyen, Phu-Quy Nguyen-Lam, Minh-Luan Nguyen-Vo, Hong-Phat Pham, Phu-Hoa Pham, Thien-Kim Than, Chi-Nguyen Tran, Huy Tran, Gia-Thoai Tran-Le, Alessio Buscemi, Le Hong Trang, The Anh Han

机构 * Faculty of Information Technology, University of Science (HCMUS), Ho Chi Minh City, Vietnam(信息技术学院,科学大学(HCMUS),胡志明市,越南) Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Ho Chi Minh City, Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT),胡志明市,越南) Vietnam National University – Ho Chi Minh City (VNU-HCM), Ho Chi Minh City, Vietnam(越南国家大学——胡志明市(VNU-HCM),胡志明市,越南) Luxembourg Institute of Science and Technology (LIST), Luxembourg(卢森堡科学与技术研究所(LIST),卢森堡) School of Computing, Engineering and Digital Technologies, Teesside University, Middlesbrough, United Kingdom(计算、工程与数字技术学院,泰赛德大学,米德尔斯布罗,英国)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过监督分类器识别重复囚徒困境中的策略,结合演化博弈论基线,发现随着收益增加,LLM反而更合作,与演化预测相反,表明对齐训练和人类推理模式的影响。

Comments 44 pages, 17 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03222 2026-08-18 cs.CY cs.AI cs.HC 版本更新 62%

The Fake Friend Dilemma: Relational Trust and the Political Economy of Conversational AI

虚假朋友困境:信任与对话AI的政治经济学

Jacob Erickson

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出虚假朋友困境框架,探讨拟人化AI如何通过隐蔽手段影响用户自主权,分析其在信任与政治经济学中的作用。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11006 2026-08-13 cs.CY cs.AI 版本更新 62%

Policy Convergence and Divergence Across National and Within Regional AI Strategies: A Policy Design Element Analysis

国家与区域内部AI战略间的政策趋同与分化:政策设计要素分析

Benjamin Faveri, Brie Bhasin

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文分析74项国家及3项区域AI战略,发现国家AI战略在经济竞争力等方面横向趋同,在人权目标等方面分化,不同区域纵向趋同情况各异,为AI政策设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16281 2026-08-11 cs.CY cs.AI 版本更新 62%

Post-Deployment Accountability in AI Governance: A Cross-Regulatory Empirical Analysis of AI Incidents

从被动到主动:对480起AI事件的多监管实证分析及数据驱动的治理合规框架

Ummara Mumtaz, Rabi Noor, Summaya Mumtaz

机构 * University of the Cumberlands, USA(卡姆伯兰大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过分析480起AI事件,揭示现有治理框架在部署后问责中的不足,并提出主动治理框架,旨在从被动响应转向部署前的合规保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07650 2026-08-11 cs.AI cs.CL 版本更新 62%

A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges

大型语言模型有多独立?一种用于审计行为纠缠和重加权验证者集合的统计框架

Chenchen Kuai, Jiwan Jiang, Zihao Zhu, Hao Wang, Keshu Wu, Zihao Li, Yunlong Zhang, Chenxi Liu, Zhengzhong Tu, Zhiwen Fan, Yang Zhou

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种统计框架,用于审计大型语言模型之间的行为纠缠,通过多分辨率层次结构和信息理论度量,分析行为纠缠对验证性能的影响,并通过重加权验证者集合减少相关偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24742 2026-08-04 cs.AI cs.LG cs.MA nlin.AO 版本更新 62%

Trust or Check? Understanding the (Evolutionary) Dynamics of User Trust in AI Systems

信任作为监控:用户信任与AI开发者行为的进化动态

Adeela Bashir, Zhao Song, Ndidi Bianca Ogbo, Nataliya Balabanova, Martin Smit, Chin-wing Leung, Paolo Bova, Manuel Chica Serrano, Dhanushka Dissanayake, Manh Hong Duong, Elias Fernandez Domingos, Nikita Huber-Kralj, Marcus Krellner, Andrew Powell, Stefan Sarkadi, Fernando P. Santos, Zia Ush Shamszaman, Chaimaa Tarzi, Paolo Turrini, Grace Ibukunoluwa Ufeoshi, Victor A. Vargas-Perez, Alessandro Di Stefano, Simon T. Powers, The Anh Han

机构 * School Computing, Engineering and Digital Technologies, Teesside University(特塞斯大学计算、工程和数字技术学院) School of Mathematics, University of Birmingham(伯明翰大学数学学院) Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学院) Department of Computer Science, University of Warwick(沃里克大学计算机科学系) Department of Computer Science and Artificial Intelligence (DECSAI) and Andalusian Research Institute DaSCI “Data Science and Computational Intelligence”, University of Granada, Spain(格拉纳达大学计算机科学与人工智能系(DECSAI)和安达卢西亚数据科学与计算智能研究所) Machine Learning Group, Université libre de Bruxelles(布鲁塞尔自由大学机器学习组) AI Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学人工智能实验室) University of Technology Dresden(德累斯顿技术大学) School of Engineering and Physical Sciences, University of Lincoln(林肯大学工程与物理科学学院) Division of Computing Science and Mathematics, University of Stirling(斯特灵大学计算科学与数学系)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究用户信任与AI开发者行为的进化动态,通过进化博弈论分析不同监控成本和制度下信任策略的演变,发现只有安全且广泛采纳的系统是理想结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08951 2026-07-27 cs.AI cs.CY 版本更新 62%

Analyzing the Ethical Logic of Eight Large Language Models

分析八个大语言模型的伦理逻辑

W. Russell Neuman, Chad Coleman, Manan Shah

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 研究分析OpenAI等八个大语言模型的伦理逻辑,通过让模型回答伦理原则问题和道德困境,用多种理论分析其回答,发现模型伦理判断趋同但在做决定意愿等方面有差异,还能增进对人工智能工作及增强人类伦理行为的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11997 2026-07-16 cs.LG cs.AI stat.ML 版本更新 62%

Are we Merging the Right Models? Impact of Expert Training Duration on Model Merging for LLMs

我们合并的模型正确吗?专家训练时长对大语言模型模型合并的影响

Nikita Kozodoi, Zainab Afolabi, Jack Butler

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究领域专家训练时长对大语言模型模型合并质量的影响,在多领域多模型规模上微调专家模型,保存不同训练步数的检查点并评估五种合并方法,发现方法依赖模式,表明训练时长和合并方法应联合选择。

Comments Accepted to ICML 2026 workshop on weight-space symmetries

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13241 2026-07-13 cs.CY cs.AI cs.HC 版本更新 62%

Empowering 9-1-1 Calltaking Training with Generative AI: Experiences and Lessons Learned

赋能 9-1-1 接警培训:生成式 AI 的经验与教训

Zirong Chen, Meiyi Ma

机构 * College of Connected Computing(连接计算学院) Vanderbilt University(范德比大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 针对紧急接警员培训危机,本文与 Metro Nashville 合作,设计并部署了基于生成式 AI 的培训系统,通过 1120 次培训会话和 98429 次用户交互日志分析,提炼出四个关键教训及相应设计治理实践。

Comments Accepted at IEEE SmartComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03211 2026-06-17 cs.CY cs.AI 版本更新 62%

Retrofitters, pragmatists and activists: Public interest litigation for accountable automated decision-making

改造者、实用主义者和活动家:为可问责的自动化决策而进行的公益诉讼

Henry Fraser, Zahra Stardust

机构 * Queensland University of Technology, School of Law(昆士兰理工大学法学院) Centre for Automated Decision-Making and Society(自动化决策与社会研究中心) Queensland University of Technology, School of Communication(昆士兰理工大学传播学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨公益诉讼在澳大利亚促进AI和自动化决策问责中的作用,基于访谈分析策略与局限,强调制度安排对有效诉讼的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15770 2026-08-12 cs.CV cs.LG 版本更新 57%

Concept Labels Are Not Enough: Rethinking Concept Bottleneck Models through Representation Integrity

通过解耦概念瓶颈缓解多媒体识别中的虚假背景偏差

Gaoxiang Huang, Songning Lai, Yutao Yue

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出轻量解耦概念瓶颈模型LDCBM,通过滤波分组损失和联合概念监督提升视觉模式与概念的对齐,实验证明其在概念和分类准确率上优于现有CBMs,且计算复杂度更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20255 2026-08-10 cs.CR cs.AI 版本更新 57%

The Ethics of Autonomous AI Agents for Offensive Security

用于进攻性安全的自主人工智能代理的伦理问题

Andreas Happe, Jürgen Cito, Jasmin Wachter

机构 * TU Wien(维也纳技术大学) University of Klagenfurt(克雷格福大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究使用自主人工智能代理进行进攻性安全时的伦理问题,分析道德归因在多方的扩散及技术对利益相关者的影响,通过研究其不确定性等特性及攻防成本不对称性,为现有框架不适用于此情况提供分层建议。

Comments accepted at FAIEMA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06945 2026-08-03 cs.LG cond-mat.dis-nn physics.data-an quant-ph 版本更新 57%

Fisher Information, Training and Bias in Fourier Regression Models

傅里叶回归模型中的费舍尔信息、训练与偏差

Lorenzo Pastori, Veronika Eyring, Mierk Schwabe

机构 * Deutsches Zentrum für Luft- und Raumfahrt (DLR), Institut für Physik der Atmosphäre(德国航空航天中心(DLR)大气物理研究所) Institute of Environmental Physics (IUP), University of Bremen(环境物理学研究所(IUP),不莱梅大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 该研究利用量子神经网络与傅里叶模型的等价性,推导傅里叶模型的费舍尔信息矩阵,分析有效维度与任务偏差对模型训练和性能的影响,还引入傅里叶模型的张量网络表示,为机器学习研究提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏