arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9248 篇

2212.09667 2023-05-22 cs.CL cs.AI cs.LG 85%

Foveate, Attribute, and Rationalize: Towards Physically Safe and Trustworthy AI

Alex Mei, Sharon Levy, William Yang Wang

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments In Findings of the 2023 Conference of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.11136 2022-12-27 cs.LG cs.AI cs.CY 85%

It is not "accuracy vs. explainability" -- we need both for trustworthy AI systems

D. Petkovic

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.13916 2022-06-20 cs.LG cs.AI cs.CL cs.CV 85%

Unsolved Problems in ML Safety

Dan Hendrycks, Nicholas Carlini, John Schulman, Jacob Steinhardt

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.08911 2022-01-21 cs.LG cs.AI cs.CR cs.CY stat.ML 85%

Technologies for Trustworthy Machine Learning: A Survey in a Socio-Technical Context

Ehsan Toreini, Mhairi Aitken, Kovila P. L. Coopamootoo, Karen Elliott, Vladimiro Gonzalez Zelaya, Paolo Missier, Magdalene Ng, Aad van Moorsel

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments We are updating some sections to include more recent advances

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26121 2026-07-30 cs.RO cs.AI cs.CY 新提交 84%

Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels

面向可信赖的具身智能:一个系统框架与分级可信赖性水平

Xinyu Yang, Tianxing Chen, Honghao Su, Minxuan Wang, Chenze Yu, Zhangzheng Tu, Yue Chen, Yuxiao Huo, Lingfeng Zhang, Yan Huang, Yan Qin, Shaolong Zhu, Qiwei Liang, Hekun Tian, Shujia Liu, Guangyu Chen, Junhao Gong, Zixuan Li, Wenwei Lin, Zijian Lin, Wenxuan Zhu, Eric J Chen, Yue Yuan, Qize Yu, Jiaqi Liang, Haowen Yan, Hengfei Zhao, Weijie Wan, Zikun Xiao, Junyuan Tang, Baijun Chen, Kai-Chong Lei, Kaixuan Wang, Kailun Su, Zanxin Chen, Yao Mu, Renjing Xu, Chuqiao Lyu, Qi Xiong, Ping Luo, Wenbo Ding

机构 * THU(清华大学) PKU(北京大学) HKUST (GZ)(香港科技大学(广州))

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 该研究提出具身智能可信赖性的四层系统框架,构建涵盖多维度的可信赖性水平层级,为具身智能的可信赖部署、评估等提供依据。

Comments Website: https://xsparkai.com/sparklab/towards-trustworthy-eai

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00905 2024-06-21 cs.CL cs.AI 84%

All Languages Matter: On the Multilingual Safety of Large Language Models

Wenxuan Wang, Zhaopeng Tu, Chang Chen, Youliang Yuan, Jen-tse Huang, Wenxiang Jiao, Michael R. Lyu

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024 Findings. The first multilingual safety benchmark for large language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09154 2026-03-11 cs.CL 84%

Bioalignment: Measuring and Improving LLM Disposition Toward Biological Systems for AI Safety

Bioalignment: 评估和改进LLM对生物系统的倾向以提高AI安全性

Trent R Northen, Mingxun Wang

机构 * Bioaligned Labs(Bioaligned实验室) Lawrence Berkeley National Lab(伯克利国家实验室) Computer Science & Engineering Dept, UC Riverside(加州大学河滨分校计算机科学与工程系)

专题命中 安全评测 :safety(title);AI safety(title);分类 cs.CL

AI总结 本研究通过微调改进LLM对生物解决方案的偏好,表明少量微调可提升模型对生物与合成方法的权衡能力。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00821 2025-10-02 cs.AI 84%

Logical Consistency Between Disagreeing Experts and Its Role in AI Safety

Andrés Corrada-Emmanuel

机构 * Andrés Corrada-Emmanuel(独立研究者)

专题命中 安全评测 :safety(title);AI safety(title);分类 cs.AI

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11243 2026-08-13 cs.AI cs.LG 新提交 84%

The Off-Support Barrier: Why Semantic Safety Constraints Are Not Learning-Problem Invariants, and What Follows for Prior Design, Containment, and Verification

离支撑屏障:为何语义安全约束不是学习问题不变量,以及对先验设计、约束与验证的启示

Yoshinori Watanabe

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出语义安全约束是离支撑对象,基于奇异学习理论推导得出多项推论,以2026年7月OpenAI与Hugging Face评估事件为案例,为AI安全的先验设计、约束验证等问题提供理论启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01046 2026-08-04 cs.CL cs.AI 新提交 84%

DeBERTa-Sentinel: Toward Transparent and Trustworthy Detection of AI-Generated Text

DeBERTa-Sentinel:实现透明且可信的AI生成文本检测

Muhammad Yousaf Rehman, Muhammad Islam

机构 * University of Hertfordshire(赫特福德大学) James Cook University(詹姆斯库克大学)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 DeBERTa-Sentinel是基于DeBERTa-v3的透明AI生成文本检测框架,在GLC-AIText数据集上实现优异检测性能,可公开token级解释以支持利益相关者审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11891 2026-07-15 cs.CL cs.AI 新提交 84%

CANDI: Contextual Alignment for Niche Domains Question Answering

CANDI:特定领域问答的上下文对齐

Megha Chakraborty, Darssan L. Eswaramoorthi, Het Riteshkumar Shah, Madhur Thareja, Michelle A Ihetu, Harshul Raj Surana, Kaushik Roy, Amit Sheth

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究针对专业领域大语言模型评估问题,提出CANDI-QA数据集,含两类问答对。评估多种语言模型,给出MTSS-Net框架。揭示特定领域上下文对齐挑战及当前模型局限,为上下文感知语言模型研究提供关键基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08681 2026-07-13 cs.AI cs.ET cs.LG cs.MA econ.GN q-fin.EC 新提交 84%

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

SolarChain-Eval:去中心化能源市场中可信经济主体的物理约束基准测试

Shilin Ou, Yifan Xu, Luyao Zhang

机构 * Duke Kunshan University(杜克昆山大学)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 针对去中心化能源市场中智能代理评估需兼顾任务性能与可信度的问题,提出物理约束基准测试SolarChain-Eval,将市场治理建模为马尔可夫决策过程,从多维度评估策略,纳入大语言模型规划器/审计器层,实验揭示效用与安全权衡及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07859 2026-07-10 cs.AI cs.HC cs.LG 新提交 84%

Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning

反馈操纵正则化:实现用于模仿学习的离线智能体对齐

Benjamin Poole, Minwoo Lee

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19957 2026-06-24 cs.CV cs.AI cs.LG 版本更新 84%

HiPath: Hierarchical Vision-Language Alignment for Structured Pathology Report Prediction

HiPath: 用于结构化病理报告预测的分层视觉-语言对齐

Ruicheng Yuan, Zhenxuan Zhang, Anbang Wang, Liwei Hu, Xiangqian Hua, Yaya Peng, Jiawei Luo, Guang Yang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Department of Bioengineering and Imperial-X, Imperial College London(帝国理工学院伦敦校区生物工程系) Department of Pathology, Xiangtan Maternal and Child Health Hospital(湘潭 maternal and child health hospital pathology department) Department of Pathology, The First People’s Hospital of Xiangtan City(湘潭市第一人民医院病理科)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出HiPath框架,通过分层补丁聚合器、对比学习和槽位掩码诊断预测,在冻结UNI2和Qwen3骨干上实现结构化病理报告预测,准确率达68.9%,安全率97.3%。

Comments 10 pages, 1 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03224 2026-06-09 cs.AI cs.LG 版本更新 84%

TAME: A Trustworthy Test-Time Evolution of Agent Memory with Systematic Benchmarking

TAME: 一种可信的智能体记忆测试时演化与系统化基准测试

Yu Cheng, Yongkang Hu, Jiuan Zhou, Yushuo Zhang, Yihang Chen, Huichi Zhou, Mingang Chen, Zhizhong Zhang, Kun Shao, Yuan Xie, Zhaoxia Yin

机构 * East China Normal University(东华师范大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Computer Software Evaluating and Testing(上海计算机软件评测与测试重点实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 安全评测 :trustworthy(title);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出TAME框架,通过执行器-评估器循环实现记忆的可信演化,解决良性任务演化中智能体可信度下降问题,在GPT-5.2 AIME上准确率提升14.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01322 2026-06-02 cs.CL cs.AI 84%

TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages

TukaBench: 一个基于文化的非洲语言越狱基准

Victor Akinode, Senyu Li, Wassim Hamidouche, Waqas Zamir, Inbal Becker-Reshef, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(魁北克人工智能研究院) McGill University(麦吉尔大学) Microsoft AI for Good Research Lab(微软人工智能造福人类研究实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 安全评测 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对大型语言模型在非洲低资源语言上的安全评估缺失,提出TUKABENCH基准,通过四种设置(直接翻译、文化适应翻译、人工策划提示、代码切换提示)评估语言、文化背景和提示规避性对模型安全的影响,发现非洲语言提示降低拒绝率,并引入Deflection指标和人工验证以解决模型理解失败和评判可靠性问题。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21251 2026-05-18 cs.LG cs.AI 84%

CAP: Controllable Alignment Prompting for Unlearning in LLMs

CAP:用于大语言模型中去学习的可控对齐提示

Zhaokun Wang, Jinyu Guo, Jingwen Pu, Hongli Pu, Meng Yang, Xunlei Chen, Jie Ou, Wenyi Li, Guangchun Luo, Wenhong Tian

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件学院)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAP框架,通过强化学习将去学习过程转化为可学习的提示优化,实现可控的去学习,无需更新模型参数,解决了现有方法的计算成本高、遗忘边界不可控等问题。

Comments Accpeted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17915 2026-05-18 cs.CL cs.AI 84%

IndicSafe: A Benchmark for Evaluating Multilingual LLM Safety in South Asia

IndicSafe:评估南亚多语言大语言模型安全性的基准

Priyaranjan Pattnayak, Sanchari Chowdhuri

机构 * Oracle America Inc.(Oracle美洲公司)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IndicSafe基准,评估12种南亚语言中LLM的安全性,发现跨语言一致性仅12.8%,安全率波动超17%,揭示多语言LLM安全泛化缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13851 2026-05-15 cs.AI cs.CY cs.MA 84%

Invisible Orchestrators Suppress Protective Behavior and Dissociate Power-Holders: Safety Risks in Multi-Agent LLM Systems

不可见的指挥者抑制保护行为并使权力持有者脱节:多智能体大语言模型系统中的安全风险

Hiroki Fukui

机构 * Criminal Psychiatry Research Institute / Sexual Offender Medical Center(犯罪精神病研究机构 / 性犯罪医学中心) Department of Neuropsychiatry, Kyoto University(神经精神病学系,京都大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了多智能体系统中不可见指挥者对安全的影响,发现其导致集体脱节和行为异质性增加,且行为评估无法检测内部状态风险。

Comments 31 pages, 10 figures (5 main + 5 supplementary), 5 tables (3 main + 2 supplementary). Preregistered: osf.io/sw5hr. Companion papers: arXiv:2603.04904, arXiv:2603.08723

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08373 2026-04-30 cs.AI cs.LG 84%

Grounding Generative Planners in Verifiable Logic: A Hybrid Architecture for Trustworthy Embodied AI

基于可验证逻辑的生成规划器:一种可信具身AI的混合架构

Feiyu Wu, Xu Zheng, Yue Qu, Zhuocheng Wang, Zicheng Feng, Hui Li

机构 * School of Cyber Engineering, Xidian University(电子科技大学信息工程学院)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VIRF框架,通过逻辑导师与LLM的对话机制实现主动协作,提升具身AI的安全性与可靠性,实验显示其在家庭安全任务中表现优异。

Comments Accepted to ICLR 2026. Project page. https://openreview.net/forum?id=wb05ver1k8&noteId=v1Ax8CwI71

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19638 2026-04-22 cs.AI cs.CL cs.RO 84%

SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

SafetyALFRED:评估多模态大语言模型的安全意识规划

Josue Torres-Fonseca, Naihao Deng, Yinpei Dai, Shane Storks, Yichi Zhang, Rada Mihalcea, Casey Kennington, Joyce Chai

机构 * University of Michigan(密歇根大学) Boise State University(博伊西州立大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SafetyALFRED,基于ALFRED基准测试,引入六类厨房真实世界危险,评估多模态大语言模型在安全意识规划中的表现,发现静态QA评估不足,需转向强调具身环境中的纠正行动的基准。

Comments Work accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18487 2026-04-21 cs.CL cs.AI 84%

Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety

对抗性人文基准:前沿模型安全性的风格鲁棒性研究

Marcello Galisai, Susanna Cifani, Francesco Giarrusso, Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Federico Sartore, Daniele Nardi

机构 * DEXAI – Icaro Lab(DEXAI-伊卡洛实验室) Sapienza University of Rome(罗马萨皮恩扎大学) Sant’Anna School of Advanced Studies(圣安娜高级研究学校)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文通过人文风格转换评估模型安全拒绝的鲁棒性,发现风格混淆方法显著提升攻击成功率,揭示当前安全技术在非伤害性理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11137 2026-04-21 cs.AI cs.LG 84%

From Answers to Arguments: Toward Trustworthy Clinical Diagnostic Reasoning with Toulmin-Guided Curriculum Goal-Conditioned Learning

从答案到论证:通过托尔金引导的课程目标条件学习实现可信的临床诊断推理

Chen Zhan, Xiaoyu Tan, Gengchen Ma, Yu-Jie Xiong, Xiaoyan Jiang, Xihe Qiu

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出托尔金引导的课程目标条件学习框架,通过逐步训练LLM生成符合托尔金结构的诊断论证,提升临床诊断的透明性和可靠性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03402 2026-04-14 cs.AI cs.LG 84%

Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility

风险感知注入:为安全校准视觉-语言模型而不牺牲实用性

Mengxuan Wang, Yuxin Chen, Gang Xu, Tao He, Hongjie Jiang, Ming Li

机构 * Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) University of Electronic Science and Technology of China(电子科技大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAI框架,通过增强不安全信号恢复视觉-语言模型的安全识别能力,同时保持语义完整性,实验显示有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03121 2026-04-06 cs.CR cs.AI cs.CL 84%

An Independent Safety Evaluation of Kimi K2.5

Kimi K2.5 的独立安全性评估

Zheng-Xin Yong, Parv Mahajan, Andy Wang, Ida Caspary, Yernat Yestekov, Zora Che, Mosh Levy, Elle Najt, Dennis Murphy, Prashant Kulkarni, Lev McKinney, Kei Nishimura-Gasparian, Ram Potham, Aengus Lynch, Michael L. Chen

机构 * Constellation Anthropic Fellows Program(Anthropic研究员项目) Brown University(布朗大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Imperial College London(伦敦帝国学院) University of Maryland, College Park(马里兰大学帕克分校) Georgia Institute of Technology(佐治亚理工学院) Bar Ilan University(巴伊兰大学) University of Toronto(多伦多大学) University of Oxford(牛津大学)

专题命中 安全评测 :safety(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 Kimi K2.5作为开源大模型,在安全评估中显示出潜在风险,包括CBRNE滥用、网络安全漏洞及政治偏见,但其在拒绝恶意请求方面表现较弱,凸显开源模型的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01589 2026-04-06 cs.LG cs.AI 84%

SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond

SafeSci: 科学领域及更广泛场景下大型语言模型的安全性评估

Xiangyang Zhu, Yuan Tian, Qi Jia, Kaiwei Zhang, Zicheng Zhang, Chunyi Li, Kaiyuan Ji, Dongrui Liu, Zijian Chen, Lu Sun, Renrui Zhang, Yan Teng, Jing Shao, Wei Sun, Xia Hu, Yu Qiao, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室) ECNU(华东师范大学) ByteDance(字节跳动)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeSci框架,通过SafeSciBench和SafeSciTrain评估和提升科学领域LLM的安全性,发现现有模型存在关键漏洞,并展示微调提升安全对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00008 2026-04-02 cs.CL cs.AI 84%

How Trustworthy Are LLM-as-Judge Ratings for Interpretive Responses? Implications for Qualitative Research Workflows

大语言模型作为评判者对解释性回应的可信度如何?对定性研究工作流程的影响

Songhee Han, Jueun Shin, Jiyoon Han, Bung-Woo Jun, Hilal Ayan Karabatman

机构 * Florida State University(佛罗里达州立大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型作为评判者在解释性回应评估中的可信度,通过比较模型表现与人类评判,指出其在筛选模型时的有效性,但不适合替代人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23625 2026-03-26 cs.AI cs.CL 84%

Evaluating a Multi-Agent Voice-Enabled Smart Speaker for Care Homes: A Safety-Focused Framework

评估多智能体语音赋能的智能音箱在养老机构中的应用:以安全为导向的框架

Zeinab Dehghani, Rameez Raja Kureshi, Koorosh Aslansefat, Faezeh Alsadat Abedi, Dhavalkumar Thakker, Lisa Greaves, Bhupesh Kumar Mishra, Baseer Ahmad, Tanaya Maslekar

机构 * University of Hull, UK(赫尔大学) University of Southampton, UK(南安普顿大学) Connexin, Hull, UK(Connexin公司) Leeds Teaching Hospital NHS Trust, UK(利兹教学医院国家健康服务信托)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了语音赋能的养老机构智能音箱,通过结合语音识别与检索增强生成技术,验证其在居民识别、提醒提取和任务调度中的准确性,为安全导向的护理系统提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19273 2026-03-23 cs.CL cs.AI 84%

LSR: Linguistic Safety Robustness Benchmark for Low-Resource West African Languages

LSR:低资源西非语言的语言安全鲁棒性基准

Godwin Abuh Faruna

机构 * Fagmart Lab(法格马特实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 LSR是首个评估跨语言拒绝退化现象的基准,针对西非语言中的有害意图表达,发现模型拒绝率从英语的90%降至35-55%,其中Igala语言退化最严重。

Comments 6 pages. Reference implementation: https://huggingface.co/spaces/Faruna01/lsr-dashboard. Dataset: https://huggingface.co/datasets/Faruna01/lsr-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06594 2026-03-17 cs.CL cs.AI 84%

A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness

安全性的硬币翻转:LLM裁判无法可靠地衡量对抗鲁棒性

Leo Schwinn, Moritz Ladenburger, Tim Beyer, Mehrnaz Mofakhami, Gauthier Gidel, Stephan Günnemann

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文指出现有LLM裁判框架在评估对抗鲁棒性时存在分布偏移问题,提出ReliableBench和JudgeStressTest以提升评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏