arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-06 至 2026-04-06 共收录 23 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2604.02695 2026-04-06 cs.CV 88%

XrayClaw: Cooperative-Competitive Multi-Agent Alignment for Trustworthy Chest X-ray Diagnosis

XrayClaw:协作-竞争多智能体对齐用于可信的胸部X光诊断

Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology, Shenzhen, China(深圳理工大学,深圳,中国)

专题命中 安全评测 :alignment(title,abstract);trustworthy(title,abstract)

AI总结 本文提出XrayClaw框架,通过协作-竞争架构提升胸部X光诊断的可靠性,实现高准确性和临床推理一致性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01444 2026-04-06 cs.CR 85%

Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models

制造风险:在大型语言模型中基准测试和降低食品安全风险

Weidi Luo, Xiaofei Wen, Tenghao Huang, Hongyi Wang, Zhen Xiang, Chaowei Xiao, Kristina Gligorić, Muhao Chen

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract)

AI总结 本文提出FoodGuardBench基准,用于评估大型语言模型在食品安全领域的安全性和鲁棒性,发现现有模型存在对食品相关领域安全对齐不足、生成有害指令及防护措施失效等问题,并提出FoodGuard-4B作为改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03121 2026-04-06 cs.CR cs.AI cs.CL 84%

An Independent Safety Evaluation of Kimi K2.5

Kimi K2.5 的独立安全性评估

Zheng-Xin Yong, Parv Mahajan, Andy Wang, Ida Caspary, Yernat Yestekov, Zora Che, Mosh Levy, Elle Najt, Dennis Murphy, Prashant Kulkarni, Lev McKinney, Kei Nishimura-Gasparian, Ram Potham, Aengus Lynch, Michael L. Chen

机构 * Constellation Anthropic Fellows Program(Anthropic研究员项目) Brown University(布朗大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Imperial College London(伦敦帝国学院) University of Maryland, College Park(马里兰大学帕克分校) Georgia Institute of Technology(佐治亚理工学院) Bar Ilan University(巴伊兰大学) University of Toronto(多伦多大学) University of Oxford(牛津大学)

专题命中 安全评测 :safety(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 Kimi K2.5作为开源大模型,在安全评估中显示出潜在风险,包括CBRNE滥用、网络安全漏洞及政治偏见,但其在拒绝恶意请求方面表现较弱,凸显开源模型的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01589 2026-04-06 cs.LG cs.AI 84%

SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond

SafeSci: 科学领域及更广泛场景下大型语言模型的安全性评估

Xiangyang Zhu, Yuan Tian, Qi Jia, Kaiwei Zhang, Zicheng Zhang, Chunyi Li, Kaiyuan Ji, Dongrui Liu, Zijian Chen, Lu Sun, Renrui Zhang, Yan Teng, Jing Shao, Wei Sun, Xia Hu, Yu Qiao, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室) ECNU(华东师范大学) ByteDance(字节跳动)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeSci框架,通过SafeSciBench和SafeSciTrain评估和提升科学领域LLM的安全性,发现现有模型存在关键漏洞,并展示微调提升安全对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02359 2026-04-06 cs.CL cs.AI 81%

Using LLM-as-a-Judge/Jury to Advance Scalable, Clinically-Validated Safety Evaluations of Model Responses to Users Demonstrating Psychosis

利用LLM作为法官/陪审团推进模型响应用户表现精神病的可扩展、临床验证的安全性评估

May Lynn Reese, Markela Zeneli, Mindy Ng, Jacob Haimes, Andreea Damien, Elizabeth Stade

机构 * Apart Research Odyssean Institute London School of Economics and Political Science(伦敦政治经济学院) Stanford Institute for Human-Centered AI(斯坦福大学以人为本人工智能研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLM作为法官或陪审团评估模型响应用户精神病表现的方法,开发了七项临床验证的安全标准,并展示了LLM作为法官在临床验证中的有效性。

Comments published at IASEAI 2026, preliminary work presented at GenAI4Health workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07553 2026-04-06 cs.CL 79%

VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents

VeriOS: 基于查询的人机GUI交互以实现可信操作系统代理

Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 VeriOS通过引入查询驱动的人机GUI交互框架,提升操作系统代理在不可信环境中的任务完成能力,实验显示其在不可信场景中性能显著提升,同时保持正常场景下的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02372 2026-04-06 cs.CR cs.LG 74%

Backdoor Attacks on Decentralised Post-Training

在去中心化后训练中的后门攻击

Oğuzhan Ersoy, Nikolay Blagoev, Jona te Lintelo, Stefanos Koffas, Marina Krček, Stjepan Picek

机构 * University of Neuchâtel(纳沙泰尔大学) Radboud University(拉德堡德大学) Delft University of Technology(代尔夫特理工大学) SecureML University of Zagreb(萨格勒布大学)

专题命中 安全评测 :safety(abstract,comments);alignment(abstract);分类 cs.LG;trustworthy(comments)

AI总结 本文提出首个针对流水线并行的后门攻击,通过控制中间阶段实现模型对齐偏差,实验显示触发词可使对齐率从80%降至6%,且在安全对齐训练下仍成功60%。

Comments Accepted to ICLR 2026 Workshop 'Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities'

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02947 2026-04-06 cs.AI 70%

AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

AgentHazard:用于评估计算机使用代理有害行为的基准

Yunhao Feng, Yifan Ding, Yingshui Tan, Xingjun Ma, Yige Li, Yutao Wu, Yifeng Gao, Kun Zhai, Yanming Guo

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学) Singapore Management University(新加坡管理大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 AgentHazard基准通过2653个实例评估计算机使用代理的有害行为,揭示了模型在连续上下文和工具使用中识别安全风险的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02669 2026-04-06 cs.CL 70%

Redirected, Not Removed: Task-Dependent Stereotyping Reveals the Limits of LLM Alignments

转向而非移除:任务依赖性刻板印象揭示了LLM对齐的局限

Divyanshu Kumar, Ishita Gupta, Nitin Aravind Birur, Tanay Baswa, Sahil Agarwal, Prashanth Harshangi

机构 * Enkrypt AI

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究通过任务依赖性刻板印象分析,揭示LLM对齐的局限性,指出单一基准测试无法全面反映模型偏见,且对齐实践可能掩盖而非减轻代表性伤害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00290 2026-04-06 cs.AI cs.MA 70%

ClinicalReTrial: Clinical Trial Redesign with Self-Evolving Agents

临床试验重设计:具有自进化代理的临床试验重设计

Sixue Xing, Kerui Wu, Xuanye Xia, Meng Jiang, Jintai Chen, Tianfan Fu

机构 * University of Notre Dame(圣母大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Georgia Institute of Technology(佐治亚理工学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出ClinicalReTrial系统,通过自进化代理对临床试验协议进行迭代重设计,提升成功率并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03174 2026-04-06 cs.CL cs.AI 62%

Beyond the Parameters: A Technical Survey of Contextual Enrichment in Large Language Models: From In-Context Prompting to Causal Retrieval-Augmented Generation

超越参数:大型语言模型中上下文丰富技术的综述:从上下文提示到因果检索增强生成

Prakhar Bansal, Shivangi Agarwal

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中通过增加结构化上下文来提升性能的技术,涵盖上下文学习、提示工程、检索增强生成等方法,并提出透明的文献筛选协议和可信检索增强NLP的研究优先级。

Comments 7 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02527 2026-04-06 cs.LG cs.AI 62%

Jump Start or False Start? A Theoretical and Empirical Evaluation of LLM-initialized Bandits

先发优势还是虚假开端?基于LLM初始化的多臂老虎机的理论与实证评估

Adam Bayley, Xiaodan Zhu, Raquel Aoki, Yanshuai Cao, Kevin H. Wilson

机构 * Queen’s University(女王大学) RBC Borealis

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM生成的偏好在存在噪声和系统性偏差时对多臂老虎机性能的影响,发现30%以内噪声下初始化有效,40%后效果下降,50%后性能劣化。系统性偏差下,LLM初始化可能比冷启动更差,通过理论分析得出LLM初始化优于冷启动的充分条件。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03216 2026-04-06 cs.CL 57%

BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence

BAS:一种基于决策理论的评估大语言模型置信度的方法

Sean Wu, Fredrik K. Gustafsson, Edward Phillips, Boyan Gao, Anshul Thakur, David A. Clifton

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Oxford Suzhou Centre for Advanced Research(牛津大学苏州高等研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出BAS,一种基于决策理论的评估方法,用于评估大语言模型置信度在不同风险偏好下的决策支持能力,揭示置信度与决策可靠性之间的关系,并展示如何通过干预提升置信度可靠性。

Comments 24 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03201 2026-04-06 cs.AI 57%

Coupled Control, Structured Memory, and Verifiable Action in Agentic AI (SCRAT -- Stochastic Control with Retrieval and Auditable Trajectories): A Comparative Perspective from Squirrel Locomotion and Scatter-Hoarding

耦合控制、结构化记忆与可验证行为在代理AI中的应用(SCRAT -- 随机控制与可审计轨迹:从松鼠运动与散落储藏的比较视角)

Maximiliano Armesto, Christophe Kolb

机构 * Taller Technologies

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文从松鼠生态角度探讨代理AI中控制、记忆与可验证行为的耦合机制,提出结构化记忆模型与延迟验证信号,验证三种假设以提升系统鲁棒性与可靠性。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03131 2026-04-06 cs.CR cs.AI 57%

A Systematic Security Evaluation of OpenClaw and Its Variants

对OpenClaw及其变种的系统性安全评估

Yuhang Wang, Haichang Gao, Zhenxing Niu, Zhaoxiang Liu, Wenjing Zhang, Xiang Wang, Shiguo Lian

机构 * Xidian University(西安电子科技大学) Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文系统评估了六个OpenClaw系列代理框架的安全性,发现代理系统存在显著安全漏洞,且其风险高于孤立使用的基础模型。

Comments 39 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02678 2026-04-06 stat.ME cs.AI stat.AP 57%

Eligibility-Aware Evidence Synthesis: An Agentic Framework for Clinical Trial Meta-Analysis

有资格意识的证据合成:一个用于临床试验元分析的代理框架

Yao Zhao, Zhiyue Zhang, Yanxun Xu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 EligMeta框架整合了自动化试验发现与有资格意识的元分析,通过自然语言查询生成可复现的试验选择,并基于资格对研究加权,以产生特定群体的汇总估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02539 2026-04-06 cs.IR cs.LG 57%

Synapse: Evolving Job-Person Fit with Explainable Two-phase Retrieval and LLM-guided Genetic Resume Optimization

Synapse:通过可解释的双阶段检索和LLM引导的遗传简历优化实现就业-个人匹配

Ansel Kaplan Erol, Seohee Yoon, Keenan Hom, Xisheng Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 Synapse通过双阶段检索和遗传优化提升招聘推荐系统,解决信息不平衡问题,提高推荐精度和透明度,实验显示nDCG@10提升22%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18545 2026-04-06 cs.CV cs.AI 57%

CoDA: Exploring Chain-of-Distribution Attacks and Post-Hoc Token-Space Repair for Medical Vision-Language Models

CoDA:探索链式分布攻击及事后令牌空间修复用于医疗视觉-语言模型

Xiang Chen, Fangfang Yang, Chunlei Meng, Yuxian Dong, Ang Li, Yiwei Wei, Jiahuan Long, Jiujiang Guo, Chengyin Hu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出CoDA框架,通过构建临床合理的流程偏移,评估医疗视觉-语言模型在真实临床工作流中的可靠性,发现零样本性能显著下降,并引入事后修复策略提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13303 2026-04-06 cs.LG 57%

On the Extreme Variance of Certified Local Robustness Across Model Seeds

关于模型种子下认证局部鲁棒性极值方差的研究

Minh Le, Phuong Cao

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究揭示了训练种子差异导致认证鲁棒性极值方差显著,质疑了验证结果的可靠性,并呼吁增加置信区间报告和更全面的验证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03231 2026-04-06 cs.CV 50%

CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning

CoME-VL:扩展互补多编码视觉语言学习

Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出CoME-VL框架,通过融合对比学习和自监督编码器提升视觉语言模型性能,实验显示在多个基准上优于单编码基线。

Comments 16 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02934 2026-04-06 cs.CV 50%

PolyReal: A Benchmark for Real-World Polymer Science Workflows

PolyReal:一个用于现实世界聚合物科学工作流程的基准

Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Tongji University(同济大学) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :safety(abstract)

AI总结 PolyReal是一个新的多模态基准,用于评估大规模语言模型在聚合物实验全流程中的能力,揭示了模型在实践任务上的不足,填补了评估空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02896 2026-04-06 cs.CV 50%

EvaNet: Towards More Efficient and Consistent Infrared and Visible Image Fusion Assessment

EvaNet:迈向更高效且一致的红外与可见图像融合评估

Chunyang Cheng, Tianyang Xu, Xiao-Jun Wu, Tao Zhou, Hui Li, Zhangyong Tang, Josef Kittler

机构 * Jiangnan University(江南大学) University of Surrey(萨里大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出EvaNet框架,通过轻量网络高效近似常用指标,结合对比学习和大语言模型感知评估,实现更一致的图像融合评估。

Comments 20 figures,accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02425 2026-04-06 cs.CR 50%

Evolution and Perspectives of the Keep IT Secure Ecosystem:A Six-Year Analysis of Cybersecurity Experts Supporting Belgian SMEs

网络安全生态系统的发展与展望:对比利时中小企业网络安全专家支持的六年分析

Christophe Ponsard, Jean-François Daune, Denis Darquennes, Malik Bouhou, Nicolas Point

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过六年研究,探讨了比利时中小企业网络安全支持生态系统的发展,分析了专家网络的构建与评估,并展示了结构化评估方法对提升中小企业网络安全的作用。

Comments Preprint ICISSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏