arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-02 至 2026-06-02 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 12 篇

2509.05367 2026-06-02 cs.CR cs.AI 88%

Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs

进退维谷:大型语言模型中伦理推理与安全对齐之间的张力

Shei Pern Chua, Zhen Leng Thai, Kai Jun Teh, Xiao Li, Qibing Ren, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist,清华大学) IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦克戈文脑科学研究院,清华大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院(CIBR)) Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文提出TRIAL多轮红队方法,通过将有害请求嵌入伦理框架来利用模型伦理推理能力,并引入ERR防御框架(分层有害门控LoRA架构)以区分工具性回应与解释性回应,实现鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26397 2026-06-02 cs.CL cs.AI 73%

Algorithmic Fragility and Persona Bias in LLM-Generated Autistic Communication

LLM生成的自闭症交流中的算法脆弱性与人格偏见

Naba Rizvi, Mohammed Rizvi, Harper Strickland, Saleha Ahmedi, Nedjma Ousidhoum

机构 * University of California, San Diego(加州大学圣地亚哥分校) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) Cardiff University(卡迪夫大学)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 通过双人格改写范式,发现LLM在生成自闭症人格文本时存在词汇与情感偏离、输出坍塌等系统性失败,且对齐策略而非参数规模主导这些失败,表明当前对齐训练导致深层表征鸿沟。

Comments main paper: 9 pages; total: 19 pages; 2 figures; 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00003 2026-06-02 cs.CY cs.CR cs.HC 70%

Learning from Mistakes: Can LLM Self-Recover after Misalignment?

从错误中学习:LLM 在错位后能否自我恢复?

Olga E. Sorokoletova, Francesco Giarrusso, Vincenzo Suriani, Daniele Nardi

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 研究大语言模型在遭受恶意攻击后,是否具有内在的自我对齐恢复能力,并提出一种建模用户-助手交互安全轨迹并检测恢复趋势的方法。

Comments AAAI'26 Workshop (WS37), Machine Ethics: from formal methods to emergent machine ethics, January 20--27, 2026, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01991 2026-06-02 cs.AI cs.CL cs.CY 67%

SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning

SafeMCP:基于环境接地前瞻推理的LLM智能体防御主动功率调节

Lichao Wang, Zhaoxing Ren, Tianzhuo Yang, Jiaming Ji, Chi Harold Liu, Yaodong Yang, Juntao Dai

机构 * Beijing Institute of Technology(北京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 针对LLM智能体因动作空间扩大而面临功率寻求风险,提出SafeMCP服务器端防御插件,通过内部世界模型进行前瞻推理,实现主动工具过滤和即时干预两级防御,在保持智能体效用的同时有效降低风险。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00020 2026-06-02 cs.CL cs.AI 62%

CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards

CSRP:基于效率感知奖励的强化学习链式推理中文文本纠错

Wei Tian, Yuhao Zhou, Man Lan

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(东华大学教育人工智能研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出CSRP三阶段框架,通过连续预训练、链式推理监督微调和基于效率感知奖励的组相对策略优化,在NACGEC基准上实现最优性能,有效缓解过度纠正偏差。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24005 2026-06-02 cs.AI cs.CL 62%

LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition

LC-ERD:通过一致性调节奖励分解挖掘潜在逻辑以实现自我进化推理

Yanyu Chen, Jiyue Jiang, Dianzhi Yu, Zheng Wu, Jiahong Liu, Jiaming Han, Xiao Guo, Jinhu Qi, Yu Li, Yifei Zhang, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型推理中高质量过程数据稀缺的问题,提出LC-ERD框架,通过潜在逻辑挖掘和一致性调节的奖励分解,实现自我对齐与推理进化。

Comments Accepted in SIGKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16139 2026-06-02 cs.CY cs.AI 62%

Enhancing Trust Through Standards: A Comparative Risk-Impact Framework for Aligning ISO AI Standards with Global Ethical and Regulatory Contexts

通过标准增强信任:一种用于对齐ISO AI标准与全球伦理和监管背景的比较风险-影响框架

Sridharan Sankaran

机构 * Research and Innovation Group(研究与创新组) Tata Consultancy Services(塔塔咨询服务)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 提出比较风险-影响评估框架,分析ISO AI标准在不同监管环境下的伦理风险覆盖情况,并建议通过强制审计、区域附件和隐私模块增强其全球适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02578 2026-06-02 cs.CV cs.AI 57%

Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

通过感知扰动和奖励建模减轻多模态大语言模型作为评判者中的感知判断偏差

Seojeong Park, Jiho Choi, Junyong Kang, Seonho Lee, Jaeyo Shin, Hyunjung Shim

机构 * University of California, Berkeley(加州大学伯克利分校) KAIST(韩国科学技术院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文通过构建感知扰动数据集和结合GRPO奖励与批排序目标的统一训练框架,解决了多模态大语言模型作为评判者时因视觉证据与文本线索冲突而产生的感知判断偏差问题,显著提升了感知忠实度和与人类评价的一致性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00359 2026-06-02 cs.CY 57%

Next-Billion AI Index: The compass for AI utility and adoption in the global majority

Next-Billion AI Index: 面向全球大多数人口的AI实用性与采用指南针

Ambrish Rawat, Jessica He, Subhabrata Majumdar, Claudio Pinhanez, Yann Le Beux, Satyapriya Krishna, Rahul Gupta, Rumman Chowdhury, Kush R. Varshney

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文提出Next Billion AI Index (nexbax)诊断框架,通过经济可行性、运营可部署性和治理对齐三个主题下的10个维度,评估AI在下一个十亿用户环境中的实用性,并通过专家访谈验证其有效性。

Comments 13 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17909 2026-06-02 cs.AI cs.LO 57%

Ethical Hyper-Velocity (EHV): A Hardware-Rooted Zero-Trust Runtime Enforcement Architecture for Agentic AI Systems

伦理超高速 (EHV):一种面向代理型AI系统的硬件根零信任运行时强制架构

Riddhi Mohan Sharma

机构 * Senior Member, IEEE(IEEE高级会员)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 提出伦理超高速 (EHV) 架构,通过结合语法约束解码、因果图CRDT、可信执行环境和OSCAL审计日志,实现硬件根的零信任运行时强制,将策略执行点嵌入推理管线,显著降低治理延迟并支持形式化验证。

Comments 12 pages, 3 TikZ Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09566 2026-06-02 cs.CV cs.AI 57%

Hot-Start Chinese Language Modeling:Visual Glyphs Accelerate Sample-Efficient Learning

热启动中文语言建模:视觉字形加速样本高效学习

Shuyang Xiang, Hao Guan

机构 * Independent Researcher(独立研究者) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文通过将汉字渲染为视觉字形图像,研究其对字符级语言建模的归纳偏置,发现视觉输入产生显著的热启动效应,但最终精度与基于索引的方法一致。

Comments 15 pages, 5 figures, submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01800 2026-06-02 cs.AI 57%

REBot: From RAG to CatRAG with Semantic Enrichment and Graph Routing

REBot: 从RAG到CatRAG——语义增强与图路由

Thanh Ma, Tri-Tam La, Lam-Thu Le Huu, Minh-Nghi Nguyen, Khanh-Van Pham Luu

机构 * CTU(越南科技大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 提出REBot,一种基于CatRAG混合检索推理框架的LLM增强咨询聊天机器人,通过语义增强的分层类别知识图谱和图路由实现学术法规建议,在分类和问答任务上达到98.89%的F1分数。

Comments Published in Communications in Computer and Information Science (CCIS), Springer, 2025. DOI: 10.1007/978-981-95-4960-3_35

Journal ref Communications in Computer and Information Science (CCIS), Springer, 2025, pp. 435-447

详情

展开后加载摘要…

URL PDF HTML 收藏