Foveate, Attribute, and Rationalize: Towards Physically Safe and Trustworthy AI
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments In Findings of the 2023 Conference of the Association for Computational Linguistics
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments In Findings of the 2023 Conference of the Association for Computational Linguistics
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Position Paper
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments We are updating some sections to include more recent advances
面向可信赖的具身智能:一个系统框架与分级可信赖性水平
机构 * THU(清华大学) ; PKU(北京大学) ; HKUST (GZ)(香港科技大学(广州))
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY
AI总结 该研究提出具身智能可信赖性的四层系统框架,构建涵盖多维度的可信赖性水平层级,为具身智能的可信赖部署、评估等提供依据。
Comments Website: https://xsparkai.com/sparklab/towards-trustworthy-eai
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted by ACL 2024 Findings. The first multilingual safety benchmark for large language models
Bioalignment: 评估和改进LLM对生物系统的倾向以提高AI安全性
机构 * Bioaligned Labs(Bioaligned实验室) ; Lawrence Berkeley National Lab(伯克利国家实验室) ; Computer Science & Engineering Dept, UC Riverside(加州大学河滨分校计算机科学与工程系)
专题命中 安全评测 :safety(title);AI safety(title);分类 cs.CL
AI总结 本研究通过微调改进LLM对生物解决方案的偏好,表明少量微调可提升模型对生物与合成方法的权衡能力。
Comments 17 pages, 4 figures
机构 * Andrés Corrada-Emmanuel(独立研究者)
专题命中 安全评测 :safety(title);AI safety(title);分类 cs.AI
Comments 10 pages, 7 figures
离支撑屏障:为何语义安全约束不是学习问题不变量,以及对先验设计、约束与验证的启示
专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出语义安全约束是离支撑对象,基于奇异学习理论推导得出多项推论,以2026年7月OpenAI与Hugging Face评估事件为案例,为AI安全的先验设计、约束验证等问题提供理论启示。
DeBERTa-Sentinel:实现透明且可信的AI生成文本检测
机构 * University of Hertfordshire(赫特福德大学) ; James Cook University(詹姆斯库克大学)
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 DeBERTa-Sentinel是基于DeBERTa-v3的透明AI生成文本检测框架,在GLC-AIText数据集上实现优异检测性能,可公开token级解释以支持利益相关者审计。
CANDI:特定领域问答的上下文对齐
专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 研究针对专业领域大语言模型评估问题,提出CANDI-QA数据集,含两类问答对。评估多种语言模型,给出MTSS-Net框架。揭示特定领域上下文对齐挑战及当前模型局限,为上下文感知语言模型研究提供关键基准。
SolarChain-Eval:去中心化能源市场中可信经济主体的物理约束基准测试
机构 * Duke Kunshan University(杜克昆山大学)
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 针对去中心化能源市场中智能代理评估需兼顾任务性能与可信度的问题,提出物理约束基准测试SolarChain-Eval,将市场治理建模为马尔可夫决策过程,从多维度评估策略,纳入大语言模型规划器/审计器层,实验揭示效用与安全权衡及相关问题。
反馈操纵正则化:实现用于模仿学习的离线智能体对齐
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。
HiPath: 用于结构化病理报告预测的分层视觉-语言对齐
机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) ; Department of Bioengineering and Imperial-X, Imperial College London(帝国理工学院伦敦校区生物工程系) ; Department of Pathology, Xiangtan Maternal and Child Health Hospital(湘潭 maternal and child health hospital pathology department) ; Department of Pathology, The First People’s Hospital of Xiangtan City(湘潭市第一人民医院病理科)
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 提出HiPath框架,通过分层补丁聚合器、对比学习和槽位掩码诊断预测,在冻结UNI2和Qwen3骨干上实现结构化病理报告预测,准确率达68.9%,安全率97.3%。
Comments 10 pages, 1 figures, 3 tables
TAME: 一种可信的智能体记忆测试时演化与系统化基准测试
机构 * East China Normal University(东华师范大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Key Laboratory of Computer Software Evaluating and Testing(上海计算机软件评测与测试重点实验室) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 安全评测 :trustworthy(title);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 提出TAME框架,通过执行器-评估器循环实现记忆的可信演化,解决良性任务演化中智能体可信度下降问题,在GPT-5.2 AIME上准确率提升14.6个百分点。
TukaBench: 一个基于文化的非洲语言越狱基准
机构 * Mila - Quebec AI Institute(魁北克人工智能研究院) ; McGill University(麦吉尔大学) ; Microsoft AI for Good Research Lab(微软人工智能造福人类研究实验室) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 安全评测 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 针对大型语言模型在非洲低资源语言上的安全评估缺失,提出TUKABENCH基准,通过四种设置(直接翻译、文化适应翻译、人工策划提示、代码切换提示)评估语言、文化背景和提示规避性对模型安全的影响,发现非洲语言提示降低拒绝率,并引入Deflection指标和人工验证以解决模型理解失败和评判可靠性问题。
Comments Under review
CAP:用于大语言模型中去学习的可控对齐提示
机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件学院)
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出CAP框架,通过强化学习将去学习过程转化为可学习的提示优化,实现可控的去学习,无需更新模型参数,解决了现有方法的计算成本高、遗忘边界不可控等问题。
Comments Accpeted to ACL 2026 Main Conference
IndicSafe:评估南亚多语言大语言模型安全性的基准
机构 * Oracle America Inc.(Oracle美洲公司)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出IndicSafe基准,评估12种南亚语言中LLM的安全性,发现跨语言一致性仅12.8%,安全率波动超17%,揭示多语言LLM安全泛化缺口。
不可见的指挥者抑制保护行为并使权力持有者脱节:多智能体大语言模型系统中的安全风险
机构 * Criminal Psychiatry Research Institute / Sexual Offender Medical Center(犯罪精神病研究机构 / 性犯罪医学中心) ; Department of Neuropsychiatry, Kyoto University(神经精神病学系,京都大学)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY
AI总结 研究探讨了多智能体系统中不可见指挥者对安全的影响,发现其导致集体脱节和行为异质性增加,且行为评估无法检测内部状态风险。
Comments 31 pages, 10 figures (5 main + 5 supplementary), 5 tables (3 main + 2 supplementary). Preregistered: osf.io/sw5hr. Companion papers: arXiv:2603.04904, arXiv:2603.08723
基于可验证逻辑的生成规划器:一种可信具身AI的混合架构
机构 * School of Cyber Engineering, Xidian University(电子科技大学信息工程学院)
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出VIRF框架,通过逻辑导师与LLM的对话机制实现主动协作,提升具身AI的安全性与可靠性,实验显示其在家庭安全任务中表现优异。
Comments Accepted to ICLR 2026. Project page. https://openreview.net/forum?id=wb05ver1k8¬eId=v1Ax8CwI71
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
SafetyALFRED:评估多模态大语言模型的安全意识规划
机构 * University of Michigan(密歇根大学) ; Boise State University(博伊西州立大学)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出SafetyALFRED,基于ALFRED基准测试,引入六类厨房真实世界危险,评估多模态大语言模型在安全意识规划中的表现,发现静态QA评估不足,需转向强调具身环境中的纠正行动的基准。
Comments Work accepted at ACL 2026 Findings
对抗性人文基准:前沿模型安全性的风格鲁棒性研究
机构 * DEXAI – Icaro Lab(DEXAI-伊卡洛实验室) ; Sapienza University of Rome(罗马萨皮恩扎大学) ; Sant’Anna School of Advanced Studies(圣安娜高级研究学校)
专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 本文通过人文风格转换评估模型安全拒绝的鲁棒性,发现风格混淆方法显著提升攻击成功率,揭示当前安全技术在非伤害性理解上的不足。
从答案到论证:通过托尔金引导的课程目标条件学习实现可信的临床诊断推理
机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出托尔金引导的课程目标条件学习框架,通过逐步训练LLM生成符合托尔金结构的诊断论证,提升临床诊断的透明性和可靠性。
Comments Accepted at ACL 2026
风险感知注入:为安全校准视觉-语言模型而不牺牲实用性
机构 * Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RAI框架,通过增强不安全信号恢复视觉-语言模型的安全识别能力,同时保持语义完整性,实验显示有效降低攻击成功率。
Kimi K2.5 的独立安全性评估
机构 * Constellation ; Anthropic Fellows Program(Anthropic研究员项目) ; Brown University(布朗大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Imperial College London(伦敦帝国学院) ; University of Maryland, College Park(马里兰大学帕克分校) ; Georgia Institute of Technology(佐治亚理工学院) ; Bar Ilan University(巴伊兰大学) ; University of Toronto(多伦多大学) ; University of Oxford(牛津大学)
专题命中 安全评测 :safety(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI
AI总结 Kimi K2.5作为开源大模型,在安全评估中显示出潜在风险,包括CBRNE滥用、网络安全漏洞及政治偏见,但其在拒绝恶意请求方面表现较弱,凸显开源模型的安全挑战。
SafeSci: 科学领域及更广泛场景下大型语言模型的安全性评估
机构 * Shanghai AI Lab(上海人工智能实验室) ; ECNU(华东师范大学) ; ByteDance(字节跳动)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SafeSci框架,通过SafeSciBench和SafeSciTrain评估和提升科学领域LLM的安全性,发现现有模型存在关键漏洞,并展示微调提升安全对齐性。
大语言模型作为评判者对解释性回应的可信度如何?对定性研究工作流程的影响
机构 * Florida State University(佛罗里达州立大学)
专题命中 安全评测 :trustworthy(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了大语言模型作为评判者在解释性回应评估中的可信度,通过比较模型表现与人类评判,指出其在筛选模型时的有效性,但不适合替代人类判断。
评估多智能体语音赋能的智能音箱在养老机构中的应用:以安全为导向的框架
机构 * University of Hull, UK(赫尔大学) ; University of Southampton, UK(南安普顿大学) ; Connexin, Hull, UK(Connexin公司) ; Leeds Teaching Hospital NHS Trust, UK(利兹教学医院国家健康服务信托)
专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 本文评估了语音赋能的养老机构智能音箱,通过结合语音识别与检索增强生成技术,验证其在居民识别、提醒提取和任务调度中的准确性,为安全导向的护理系统提供支持。
LSR:低资源西非语言的语言安全鲁棒性基准
机构 * Fagmart Lab(法格马特实验室)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 LSR是首个评估跨语言拒绝退化现象的基准,针对西非语言中的有害意图表达,发现模型拒绝率从英语的90%降至35-55%,其中Igala语言退化最严重。
Comments 6 pages. Reference implementation: https://huggingface.co/spaces/Faruna01/lsr-dashboard. Dataset: https://huggingface.co/datasets/Faruna01/lsr-benchmark
安全性的硬币翻转:LLM裁判无法可靠地衡量对抗鲁棒性
专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 本文指出现有LLM裁判框架在评估对抗鲁棒性时存在分布偏移问题,提出ReliableBench和JudgeStressTest以提升评估可靠性。