arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-17 至 2026-04-17 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2604.14371 2026-04-17 cs.HC 78%

Smart But Not Moral? Moral Alignment In Human-AI Decision-Making

聪明但不道德?人类与AI决策中的道德一致性

Christiane Ernst, Luis Gutmann, Domenique Zipperling, Kathrin Figl, Niklas Kühl

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 本文探讨了高风险AI决策中道德一致性的重要性,提出道德一致性是人类与AI决策的核心维度,基于道德基础理论分析多利益相关者视角下的道德一致性影响。

Comments Accepted at the TREO Forum of the European Conference on Information Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14898 2026-04-17 cs.AI cs.CY cs.HC 62%

Governing Reflective Human-AI Collaboration: A Framework for Epistemic Scaffolding and Traceable Reasoning

引导反思的人工智能协作:一种知识支架和可追溯推理的框架

Rikard Rosenbacke, Carl Rosenbacke, Victor Rosenbacke, Martin McKee

机构 * Faculty of Medicine, Lund University(Lund大学医学院) Department of Economics, Lund University School of Economics and Management(Lund大学经济学与管理学院经济系) Department of Health Services Research and Policy, London School of Hygiene & Tropical Medicine(伦敦卫生与热带医学学院健康服务研究与政策系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一种人机协作的推理框架,通过知识支架和可追溯推理提升AI透明度与可控性,不依赖新模型架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01956 2026-04-17 cs.CR cs.AI 57%

Towards Adaptive, Learning-Based Security in Decentralized Applications

迈向去中心化应用中的自适应、基于学习的安全性

Stefan Kambiz Behfar, Jon Crowcroft

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, United Kingdom(计算机科学与技术系,剑桥大学,剑桥,英国)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文探讨了Web3系统中传统安全机制的局限性,提出基于学习的安全原语,通过AI驱动的智能证书实现持续推理与适应,以应对动态演变的攻击策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14520 2026-04-17 cs.CV 50%

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs

模态链:从静态融合到动态编排在多模态大语言模型中

Ziyang Luo, Nian Liu, Junwei Han

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出CoM框架,通过动态编排解决多模态融合的静态融合问题,提升模型在不同任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10069 2026-04-17 cs.RO 50%

Humanoid Factors: Design Principles for AI Humanoids in Human Worlds

人形因素:人工智能人形在人类世界中的设计原则

Xinyuan Liu, Eren Sadikoglu, Ransalu Senanayake, Lixiao Huang

机构 * School of Computing and Augmented Intelligence, Arizona State University, AZ, USA(计算与增强智能学院,亚利桑那州立大学,亚利桑那州,美国) School of Manufacturing Systems and Networks, Arizona State University, AZ, USA(制造系统与网络学院,亚利桑那州立大学,亚利桑那州,美国) Human Systems Engineering, Arizona State University, AZ, USA(人机系统工程,亚利桑那州立大学,亚利桑那州,美国)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出人形因素框架,旨在指导人工智能人形与人类共存与协作的设计,强调物理、认知、社会和伦理四个支柱,以解决人形与人类交互中的新挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏