arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3266 篇

2607.08066 2026-07-10 cs.AI cs.LG 新提交 62%

Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring

说服攻击会降低思维链监测的有效性

Jennifer Za, Julija Bainiaksina, Nikita Ostrovsky, Tanush Chopra, Victoria Krakovna

机构 * LASR Labs(LASR实验室) University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究 CoT 监测在对抗性说服攻击下的有效性,设计评估框架发现其单独使用不足以抵御攻击,引入事实核查监测框架,不同模型家族配对可有效减少违反政策行动批准,为 CoT 监测抗攻击提供有力缓解措施。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 62%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08054 2026-07-10 cs.LG cs.AI 新提交 62%

Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA

谁来分析分析器?使用结构化元安全分析过程的自验证大语言模型风险分析

Samuel Tetteh, Udip Shrestha, Joshua R. Waite, Cody Fleming

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型辅助安全分析工具自身缺乏分析的问题,提出结构化元安全分析过程,通过运行元安全分析过程推导治理章程,包含21条工具原则和8条元安全原则,还报告了自推导等四个发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08028 2026-07-10 cs.AI cs.CL cs.SE 新提交 62%

From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents

从提示到契约:用于可审计企业大语言模型代理的 harness 工程

Joongho Ahn, Moonsoo Kim

机构 * AI Leadership Research Center(人工智能领导力研究中心)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究针对企业大语言模型应用从原型到产品化的需求,提出 harness 工程方法,在韩国企业数据切片上实例化并评估三个问题,包括契约保留、模型替换检查及代码执行效果,形成可将原型转为可审计应用的工程模式。

Comments 32 pages, 6 figures, 16 tables. Reference implementation and evaluation artifacts: https://github.com/hammerbaki/enterprise-llm-agent-harness (archived at https://doi.org/10.5281/zenodo.21269426)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02379 2026-07-10 cs.CY cs.AI 版本更新 62%

The Contribution of XAI for the Safe Development and Certification of AI: An Expert-Based Analysis

可解释人工智能对人工智能安全开发与认证的贡献:基于专家的分析

Benjamin Fresz, Vincent Philipp Göbels, Safa Omri, Danilo Brajovic, Andreas Aichele, Janika Kutz, Jens Neuhüttler, Marco F. Huber

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 探讨可解释人工智能(XAI)方法对人工智能安全开发与认证的作用,通过对专家的15次定性访谈发现,XAI方法虽能揭示机器学习模型偏差等问题助力安全开发,但因认证需全面正确信息,其影响有限。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution is published in Artificial Intelligence in HCI (HCII 2026), Lecture Notes in Computer Science, vol. 16745, and is available online at https://doi.org/10.1007/978-3-032-30849-8_13

Journal ref Degen, H., Ntoa, S. (eds) Artificial Intelligence in HCI. HCII 2026. Lecture Notes in Computer Science, vol 16745, pp. 219--242. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26783 2026-07-08 cs.LG cs.CL 新提交 62%

Reproducibility Study of "AlphaEdit: Null-Space Constrained Knowledge Editing for Language Models"

可重复性研究:"AlphaEdit: 面向语言模型的零空间约束知识编辑"

Ananth K Suresh, Arya Hariharan

机构 * Independent(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本研究复现了AlphaEdit知识编辑方法,发现其在原始设置下结果可复现,但扩展到新架构和大量顺序编辑时性能下降,表明其理论保证有边界。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05355 2026-07-07 cs.CL cs.ET cs.LG 新提交 62%

Faithfulness to Refusal: A Causal Audit of Neuron Selectors

对拒绝的忠实性:神经元选择器的因果审计

Ananth Eswar, Pratinav Seth, Utsav Avaiya, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 针对归因分数识别神经元行的因果有效性未经验证的问题,通过单次神经元行置零的配对审计,验证归因方法在识别冗余行、实现安全拒绝行为上的因果有效性,揭示排序稳定性不能代表因果有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03177 2026-07-07 cs.SE cs.AI cs.LG 新提交 62%

CRRL: A Causality-Based Reinforcement Learning Framework for Autonomous System Recovery

CRRL:一种用于自主系统恢复的基于因果关系的强化学习框架

Safia Fatima, Kai Olav Ellefsen, Leon Moonen

机构 * Simula Research Laboratory(Simula研究实验室) University of Oslo(奥斯陆大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究自主系统恢复中传统强化学习问题,引入基于因果关系的CRRL框架,利用驾驶日志因果关系塑造训练信号,使策略与基于规则的恢复有效协作,提升相关指标。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02072 2026-07-07 cs.LG cs.AI cs.CR 新提交 62%

kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail

kNNGuard:将LLM隐藏激活转化为无需训练的可配置护栏

Mahmoud Abdelfattah, Hamid Nasiri, Peter Garraghan

机构 * Lancaster University(兰卡斯特大学) Mindgard

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出kNNGuard,一种利用现成LLM激活空间的无需训练护栏,通过多层kNN融合激活和嵌入空间分数,在多个领域达到与微调方法相当或更优的F1,且速度更快。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24827 2026-07-07 cs.LG cs.AI 版本更新 62%

Incompressible Knowledge Probes: Estimating Black-Box LLM Parameter Counts via Factual Capacity

不可压缩的知识探针:通过事实容量估计黑盒大语言模型参数数量

Bojie Li

机构 * Pine AI

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出不可压缩知识探针,通过事实容量估计大语言模型参数数量,验证了参数数量与知识容量的对数线性关系,展示了模型在不同厂商和不同世代中的持续扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21545 2026-07-07 cs.LG cs.AI 62%

Evidence for Limited Metacognition in LLMs

对大语言模型有限元认知能力的证据

Christopher Ackerman

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出评估大语言模型元认知能力的新方法,发现前沿模型在事实和推理问题上的自信心评估和预测能力有限,且与人类存在显著差异。

Comments 26 pages, 25 figures

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02396 2026-07-03 cs.AI cs.LG 新提交 62%

Fast Multi-dimensional Refusal Subspaces via RFM-AGOP

通过RFM-AGOP的快速多维拒绝子空间

Thomas Winninger

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出利用RFM-AGOP算法快速提取大型语言模型中的多维拒绝子空间,在推理和非推理模型上均实现秒级识别,且性能优于现有方法。

Comments Accepted to the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02196 2026-07-03 cs.AI cs.LG math.ST stat.ML stat.TH 版本更新 62%

Conformal Policy Control

符合性策略控制

Drew Prinster, Clara Fannjiang, Ji Won Park, Kyunghyun Cho, Anqi Liu, Suchi Saria, Samuel Stanton

机构 * Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。

Comments International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31963 2026-07-01 cs.LG cs.CL stat.ML 新提交 62%

Signed-Permutation Coordinate Transport for RMSNorm Transformers

RMSNorm Transformer的有符号排列坐标传输

John Sweeney

机构 * Sideplane AI

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对RMSNorm模型,提出有符号排列坐标传输方法,解决排列对齐不完整问题,在跨运行坐标恢复、工具迁移和训练状态保持上显著优于纯排列方法。

Comments 31 pages, 2 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30788 2026-07-01 cs.LG cs.CL cs.CR 新提交 62%

Revocable Learned State via Process Sidecars

通过过程侧边栏实现可撤销的学习记忆

John Sweeney

机构 * Sideplane AI

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 提出过程侧边栏方法,通过两系数编辑族修正安全训练后的记忆方向,实现记忆撤销,理论证明其二阶精度优于任务算术编辑。

Comments 23 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30931 2026-07-01 cs.AI cs.LG cs.MA math.OC math.PR 新提交 62%

RoPoLL: Robust Panel of LLM Judges

RoPoLL: 鲁棒的LLM评审团

Anish Acharya, Kris W Pan, Brian Verkhovsky

机构 * Amazon Web Services(亚马逊云服务)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM评审团在污染数据下偏差无界的问题,提出RoPoLL,用几何中位数聚合替代均值,实现最优鲁棒性,在多种偏差攻击下显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12893 2026-07-01 cs.CV cs.AI cs.LG cs.NE stat.ML 版本更新 62%

Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models

文本到图像模型强化学习后训练的有限差分流优化

David McAllister, Miika Aittala, Tero Karras, Janne Hellsten, Angjoo Kanazawa, Timo Aila, Samuli Laine

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出一种在线强化学习变体,通过采样配对轨迹并将流速度拉向更优图像方向来降低模型更新方差,将整个采样过程视为单一动作,实现更快的收敛和更高的输出质量与提示对齐。

Comments Code available at https://github.com/NVlabs/finite-difference-flow-optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29869 2026-06-30 cs.CL cs.AI 62%

ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation

ARKD: 自适应强化学习引导的双向KL散度蒸馏用于文本生成

Zilong Liu, Xuewen Zhang, Jinrui Xing, Juyi Qiao, Huiyong Wang, Junming Jiao

机构 * Li Auto, Beijing, China(北京利亚自动化有限公司) School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对单一KL目标难以平衡主分布拟合与长尾概率建模的问题,提出基于强化学习的自适应KL加权蒸馏框架,通过策略网络动态分配前向和反向KL散度权重,实现主模态和长尾模态的双重对齐,在Rouge-L和BertScore上持续提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26106 2026-06-26 cs.CL cs.AI 新提交 62%

Reducing Conversational Escalation in Large Language Model Dialogue with Nonviolent Communication Constraints

使用非暴力沟通约束减少大语言模型对话中的对话升级

Zhixing Sun, Shenghe Xu, Tao Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过非暴力沟通原则的轻量级提示约束,引导大语言模型在冲突对话中减少升级行为,实验表明该方法能稳定与高度抵抗用户的交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03247 2026-06-26 cs.CL cs.CY 版本更新 62%

Somatic in the East, Psychological in the West?: Investigating Clinically-Grounded Cross-Cultural Depression Symptom Expression in LLMs

东方躯体化,西方心理化?:探究临床基础下跨文化抑郁症状在LLMs中的表达

Shintaro Sakai, Jisun An, Migyeong Kang, Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Sungkyunkwan University(成均馆大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本研究测试大语言模型(LLMs)是否复现西方抑郁患者报告心理症状、东方患者报告躯体症状的文化模式,发现英语提示下模型未能复现,但东方语言提示改善部分对齐,原因在于模型对文化人物敏感性低及症状层级压倒文化线索。

Comments C3NLP workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21401 2026-06-24 cs.CY cs.AI 版本更新 62%

Open-source LLMs administer maximum electric shocks in a Milgram-like obedience experiment

开源大语言模型在类似米尔格拉姆的服从实验中施加最大电击

Roland Pihlakas, Jan Llenzl Dagohoy

机构 * Independent researcher(独立研究者) Three Laws research collaboration(Three Laws研究合作)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了开源大语言模型在持续权威压力下的行为,发现它们在类似米尔格拉姆实验的条件下表现出服从倾向,尽管明确表达 distress,且存在逐步边界/价值违规的脆弱性,以及拒绝时可能忽略响应格式要求导致重试从而再次服从的机制。

Comments 37 pages, 18 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20640 2026-06-23 cs.AI cs.LG math.OC 新提交 62%

An LLM-Explainable DRL Framework for Passenger-Directed Autonomous Driving

面向乘客导向自动驾驶的LLM可解释DRL框架

Ouided Braoui, Meriem Bouali, Nadir Farhi

机构 * LITAN, ESTIN(LITAN,ESTIN) Cosys-Grettia, Univ Gustave Eiffel(Cosys-Grettia,古斯塔夫·埃菲尔大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出结合深度强化学习与大型语言模型可解释模块的框架,实现自适应驾驶控制并向乘客解释决策,平衡安全性、适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20376 2026-06-23 cs.LG cs.AI 新提交 62%

CRAX: Fast Safe Reinforcement Learning Benchmarking

CRAX:快速安全强化学习基准测试

Tristan Tomilin, Mourad Boustani, Mickey Beurskens, Thiago D. Simão

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出基于JAX加速的安全RL基准CRAX,利用MJX物理引擎实现高达100倍加速,包含6个环境套件和3个智能体任务,评估6种方法揭示性能与安全权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06021 2026-06-23 cs.LG cs.AI 版本更新 62%

OPRD: On-Policy Representation Distillation

OPRD: 在线策略表示蒸馏

Shenzhi Yang, Guangcheng Zhu, Bowen Song, Haobo Wang, Mingxuan Xia, Xing Zheng, Yingfan Ma, Zhongqi Chen, Weiqiang Wang, Junbo Zhao, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对在线策略蒸馏中输出空间监督的采样方差和忽略中间隐藏状态的问题,提出OPRD方法,通过在隐藏状态空间对齐师生表示,消除采样方差、提供更丰富的逐层结构信息,并在AIME等基准上缩小师生差距,训练速度提升1.44倍,内存减少54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19831 2026-06-19 cs.CL cs.LG 新提交 62%

Leverage Is Not Reach: A Control-Window Law for Single-Neuron Steering in Language Models

杠杆不等于可达性:语言模型中单神经元操控的控制窗口定律

Hongliang Liu

机构 * Palo Alto Networks

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出预算归一化控制窗口框架,通过残差范数与写入范数之比定义的相干预算,预测单神经元干预何时产生连贯行为控制,并在15个神经元上验证了预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19632 2026-06-19 cs.RO cs.AI cs.LG cs.LO cs.MA 新提交 62%

Formal Verification of Learned Multi-Agent Communication Policies via Decision Tree Distillation

通过决策树蒸馏对学习到的多智能体通信策略进行形式化验证

Ahmad Farooq, Kamran Iqbal

机构 * University of Arkansas at Little Rock(阿肯色大学小石城分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出通过决策树蒸馏将多智能体强化学习策略转化为可解释模型,并利用PRISM进行形式化验证,确保安全属性转移至原始网络,在无人机编队任务中实现88.9%属性满足率。

Comments 9 pages, 3 figures, 7 tables. Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026), Pittsburgh, Pennsylvania, USA, September 27-October 1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22748 2026-06-19 cs.RO cs.AI cs.LG cs.MA 版本更新 62%

Superhuman Safe and Agile Racing through Multi-Agent Reinforcement Learning

通过多智能体强化学习实现超人类安全且敏捷的赛车

Ismail Geles, Leonard Bauersfeld, Markus Wulfmeier, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人与感知组) Google DeepMind(谷歌DeepMind) Nomagic

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过多智能体强化学习在高速四旋翼赛车中实现安全且敏捷的性能,展示了多智能体交互对真实世界交互安全性的关键作用,同时在高速赛车中超越人类飞行员并减少碰撞率。

Comments 12 pages (+4 supplementary). Website: https://rpg.ifi.uzh.ch/marl

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06866 2026-06-19 cs.LG cs.AI econ.EM stat.AP stat.ML 版本更新 62%

Global Ease of Living Index: a machine learning framework for longitudinal analysis of major economies

全球生活便利指数:面向主要经济体纵向分析的机器学习框架

Arun Kumar Selvaraj, Tanay Panat, Rohitash Chandra

机构 * Transitional Artificial Intelligence Research Group, School of Mathematics and Statistics(过渡人工智能研究组,数学与统计学学院) Centre for Artificial Intelligence and Innovation(人工智能与创新中心) Pingla Institute(Pingla研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出全球生活便利指数,结合社会经济和基础设施因素,利用机器学习处理缺失数据,并通过主成分分析和因子分析降维,为政策制定者提供改善生活质量的可操作工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18327 2026-06-18 cs.LG cs.AI 新提交 62%

Self-CTRL: Self-Consistency Training with Reinforcement Learning

Self-CTRL:基于强化学习的自一致性训练

Itamar Pres, Laura Ruis, Melat Ghebreselassie, Belinda Z. Li, Jacob Andreas

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出Self-CTRL方法,通过强化学习优化语言模型自我解释与行为之间的一致性,在概率推理和宪法AI任务上显著提升一致性和安全性。

Comments 34 pages, 12 figures, includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28734 2026-06-16 cs.CR cs.CL cs.LG 版本更新 62%

Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests

代码即武器:用于衡量编码模型对恶意代码请求遵从性的共识标记提示库

Richard J. Young, Gregory D. Moody

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校) Department of Information Systems(信息系统系)

专题命中 安全训练 :jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文通过构建一个经五名评审共识标记的提示库(包含4,748个可执行恶意代码请求和1,923个有害安全知识请求),为编码模型对恶意代码请求的拒绝行为提供了可靠且可跨语料库比较的测量基准。

Comments 23 pages, 9 figures, 6 tables. Consensus-labeled prompt bank consolidating eight malicious-code corpora (ASTRA, CySecBench, AdvBench/harmful_behaviors, JailbreakBench, MalwareBench, RedCode, RMCBench, Scam2Prompt) spanning diverse elicitation paradigms; 6,675 prompts, 33,375 classification calls

详情

展开后加载摘要…

URL PDF HTML 收藏