arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-14 至 2026-04-14 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 6 篇

2604.11322 2026-04-14 cs.CL cs.AI 81%

Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations

LLMs是否了解工具无关性?解密工具调用中的结构对齐偏差

Yilong Liu, Xixun Lin, Pengfei Cao, Ge Zhang, Fang Fang, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Computer Science and Technology, Donghua University(东华大学计算机科学与技术学院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLMs在面对无关工具时的调用偏差,提出SABEval数据集和Contrastive Attention Attribution方法,揭示结构对齐偏差的成因并提出缓解策略。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11065 2026-04-14 cs.AI 77%

AI Integrity: A New Paradigm for Verifiable AI Governance

AI可信性:可验证AI治理的新范式

Seulki Lee

机构 * AI Integrity Organization (AIO)(人工智能诚信组织(AIO))

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出AI可信性概念,旨在通过保护AI系统中的权威堆栈,确保推理过程可验证,不同于现有AI伦理、安全和对齐范式。

Comments 13 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10590 2026-04-14 cs.CL cs.AI 62%

Bridging Linguistic Gaps: Cross-Lingual Mapping in Pre-Training and Dataset for Enhanced Multilingual LLM Performance

弥合语言鸿沟:预训练和数据集中的跨语言映射以提升多语言大语言模型性能

Weihua Zheng, Chang Liu, Zhengyuan Liu, Xin Huang, Kui Wu, Muhammad Huzaifah Md Shahrin, Aiti Aw, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research(新加坡科技研究局)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出在预训练阶段引入跨语言映射任务,提升多语言对齐能力,通过语言对齐系数量化一致性,实验显示在机器翻译、跨语言自然语言理解及问答任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11974 2026-04-14 cs.AI 57%

Normative Common Ground Replication (NormCoRe): Replication-by-Translation for Studying Norms in Multi-Agent AI

规范共同基础复制(NormCoRe):通过翻译研究多智能体AI中的规范

Luca Deck, Simeon Allmendinger, Lucas Müller, Niklas Kühl

机构 * University of Bayreuth(拜罗伊特大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出NormCoRe框架,通过将人类实验设计翻译到多智能体AI环境,系统研究规范形成机制,展示在分配正义实验中AI代理的规范判断与人类基线的差异。

Comments ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10367 2026-04-14 cs.AI cs.SD 57%

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels

超越独白:基于对话音频上下文感知核的交互式谈话-倾听虚拟角色生成

Yuzhe Weng, Haotian Wang, Xinyi Yu, Xiaoyan Wu, Haoran Xu, Shan He, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK(科大讯飞)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于对话音频上下文感知核的交互式虚拟角色生成方法,通过引入多头高斯核解决谈话与倾听行为的时间尺度差异问题,构建了能同时处理双流音频输入的全双工虚拟代理,并在VoxHear数据集上验证了其在生成自然响应的全双工数字人类方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13538 2026-04-14 cs.SE cs.ET 50%

Model Context Protocol (MCP) at First Glance: Studying the Security and Maintainability of MCP Servers

模型上下文协议(MCP)初探:研究MCP服务器的安全性和可维护性

Mohammed Mehedi Hasan, Hao Li, Emad Fallahzadeh, Gopi Krishnan Rajbahadur, Bram Adams, Ahmed E. Hassan

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文首次对MCP服务器进行大规模实证研究,发现其存在八种独特漏洞,强调需专门的漏洞检测技术,并呼吁加强MCP生态系统的治理。

详情

展开后加载摘要…

URL PDF HTML 收藏