arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-14 至 2026-04-14 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 11 篇

2509.13356 2026-04-14 cs.CY cs.CL 62%

CogniAlign: Survivability-Grounded Multi-Agent Moral Reasoning for Safe and Transparent AI

CogniAlign:基于生存性的多智能体道德推理以实现安全透明的AI

Hasin Jawad Ali, Ilhamul Azam, Ajwad Abrar, Md. Kamrul Hasan, Hasan Mahmud

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 CogniAlign通过基于自然主义道德现实的多智能体框架,将道德推理 grounded 在生存性上,通过学科专家智能体的结构化辩论实现透明和经验锚定的判断,证明了可审计的AI对齐方法的可行性。

Comments Under Review

Journal ref AI and Ethics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10557 2026-04-14 cs.CL cs.AI 62%

LLMs Should Incorporate Explicit Mechanisms for Human Empathy

LLMs应纳入显式的人类共情机制

Xiaoxing You, Qiang Huang, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了LLM应纳入显式共情机制以保持人类视角,指出现有模型在共情方面存在系统性缺陷,提出通过认知、文化和关系维度分析共情失败,并推动建立共情意识的目标、基准和训练信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00013 2026-04-14 cs.CL cs.AI 62%

C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis

C2F-Thinker:基于提示引导强化学习的粗到细推理用于多模态情感分析

Miaosen Luo, Zhenhao Yang, Jieshen Long, Jinghu Sun, Yichu Liu, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出C2F-Thinker框架,通过粗到细结构推理与提示引导强化学习,提升多模态情感分析的可解释性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10991 2026-04-14 cs.HC cs.AI 57%

Examining EAP Students' AI Disclosure Intention: A Cognition-Affect-Conation Perspective

审视EAP学生的AI披露意愿:一种认知-情感-动机视角

Yiran Du, Huimin He

机构 * University of Cambridge(剑桥大学) Xi'an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究从认知-情感-动机视角探讨EAP学生使用AI工具披露意愿的影响因素,发现心理安全正向预测披露意愿,而对负面评价的恐惧则负向预测,强调了清晰政策和支持性教学环境的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10504 2026-04-14 cs.AI 57%

CARO: Chain-of-Analogy Reasoning Optimization for Robust Content Moderation

CARO:用于鲁棒内容审核的类比推理优化

Bingzhe Wu, Haotian Lu, Yuchen Mou

机构 * National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Shenzhen University(深圳大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :DPO(abstract);分类 cs.AI

AI总结 CARO通过两阶段训练框架提升LLM的类比推理能力,有效缓解内容审核中的误导性决策短路问题,实验显示其在模糊审核基准上平均F1得分提升24.9%。

Comments Accepted to ACL 2026 findings; under official publication process

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10316 2026-04-14 cs.CL 57%

Comparative Analysis of Large Language Models in Healthcare

医疗领域大型语言模型的比较分析

Subin Santhosh, Farwa Abbas, Hussain Ahmad, Claudia Szabo

机构 * Adelaide University(阿德莱德大学) South Australian Health and Medical Research Institute(南澳大利亚健康与医学研究所)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文通过评估多个医疗任务,比较了ChatDoctor等领域模型与Grok等通用模型的性能,发现领域模型在医疗文本生成中更准确,而通用模型在问答任务中表现更优,强调了任务特定评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09963 2026-04-14 cs.DC cs.AI cs.SE 57%

Rebooting Microreboot: Architectural Support for Safe, Parallel Recovery in Microservice Systems

重振微重启:用于微服务系统的安全并行恢复架构支持

Laurent Bindschaedler

机构 * Max Planck Institute for Software Systems (MPI-SWS)(马克斯·普朗克软件系统研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种安全并行恢复架构,通过分离规划与执行,利用类型化的修复计划和微内核确保安全,实验证明其在工业级数据和故障注入测试中有效减少修复带来的损害。

Comments 18 pages, 1 figure, 4 tables. Published at ARCS 2026

Journal ref Proc. 39th GI/ITG International Conference on Architecture of Computing Systems (ARCS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12639 2026-04-14 cs.CV 50%

RoboStereo: Dual-Tower 4D Embodied World Models for Unified Policy Optimization

RoboStereo: 双塔4D具身世界模型用于统一策略优化

Ruicheng Zhang, Guangyu Chen, Zunnan Xu, Zihao Liu, Zhizhou Zhong, Mingyang Zhang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot HKUST(香港科技大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出RoboStereo,通过双塔4D具身世界模型实现统一策略优化,解决几何幻觉和缺乏统一优化框架的问题,实验显示在细粒度操作任务中平均相对提升超过97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01241 2026-04-14 cs.CR 50%

Peering Behind the Shield: Guardrail Identification in Large Language Models

窥视屏障之后:大型语言模型中的屏障识别

Ziqing Yang, Yixin Wu, Rui Wen, Michael Backes, Yang Zhang

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AP-Test方法,通过对抗性提示检测黑盒AI代理中的屏障,解决安全对齐LLM和缺乏决策策略的问题,实验显示其在多种场景下实现完美分类准确率。

Comments To Appear in the 64th Annual Meeting of the Association for Computational Linguistics, July 2-7, 2026. ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10598 2026-04-14 cs.RO 50%

AWARE: Adaptive Whole-body Active Rotating Control for Enhanced LiDAR-Inertial Odometry under Human-in-the-Loop Interaction

AWARE: 一种适应性全身主动旋转控制用于增强人体在环交互下的激光雷达惯性里程计

Yizhe Zhang, Jianping Li, Liangliang Yin, Zhen Dong, Bisheng Yang

机构 * organization= State Key Laboratory of Information Engineering in Surveying, Mapping Remote Sensing , addressline= Wuhan University , city= Wuhan , postcode= 430079 , country= China organization= School of Electrical Electronic Engineering , addressline= Nanyang Technological University , postcode= 639798 , country= Singapore

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AWARE框架,通过UAV自身旋转能力扩展传感器视野,提升LIO可观测性。采用可微分MPC与强化学习结合,实现估计精度与飞行稳定性平衡,并通过安全飞行走廊机制确保操作安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07299 2026-04-14 cs.NE cs.SY eess.SY 50%

Optimizing Chlorination in Water Distribution Systems via Surrogate-assisted Neuroevolution

通过代理辅助神经进化优化水分配系统中的氯化

Rivaaj Monsia, Daniel Young, Olivier Francon, Risto Miikkulainen

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于神经进化、多目标优化和代理建模的框架,用于优化水分配系统中氯气的投放策略,通过进化神经网络实现氯气在关键节点的投放,以减少总投放量并保持浓度均匀,优于传统强化学习方法。

Comments 13 pages, 9 figures, GECCO '26

详情

展开后加载摘要…

URL PDF HTML 收藏