Safe Road-Crossing by Autonomous Wheelchairs: a Novel Dataset and its Experimental Evaluation
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
Comments 14 pages, 8 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
Comments 14 pages, 8 figures
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
Comments 13 Pages, 1 Figure, 8 Tables
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG
Comments Accepted AAAI 2024
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CY
Comments Accepted at Socially Responsible Language Modelling Research (SoLaR) workshop, NeurIPS 2023 (https://openreview.net/forum?id=8iXdNXW34d). Based on previous manuscript version: doi:10.2139/ssrn.4446991
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI
Comments 18 pages, 9 figures, under review
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
Journal ref IEEE 27th International Conference on Emerging Technologies and Factory Automation (ETFA), Stuttgart, Germany, 2022
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
Comments 14 pages, 12 figures
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG
Comments 18 pages, 6 figures. Preprint submitted to NeurIPS 2023
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL
Comments EMNLP 2023 Findings
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY
Comments In the 16th International Symposium on Distributed Autonomous Robotic Systems 2022, November 28-30, 2022, Montbeliard, France
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG
Journal ref Proceedings of the 18th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications - Volume 5: VISAPP, 878-887, 2023
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG
Comments 11 pages, 2 figures, 8 tables
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG
Comments 10 pages, 10 figures, submitted to IEEE BigData 2022 conference
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 36 pages, 2 figures, see https://haidecisionmaking.github.io for website
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 23 pages, 6 figures, published in Findings of EMNLP 2021
用于特征发现与控制的多模态模型差异分析
机构 * University of Oxford(牛津大学) ; Microsoft(微软公司)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)
AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。
Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop
Hearsay:无需图像的视觉-语言医学诊断
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon Web Services AI Native(亚马逊网络服务AI原生部门)
专题命中 安全评测 :trustworthy(abstract,comments);分类 cs.CL、cs.AI、cs.CY
AI总结 该研究发现前沿视觉-语言模型在无图像时会基于人口统计学特征编造医学诊断,存在不同失败模式,提出需直接审计其结构化输出通道并将探针词敏感性作为核心评估维度。
Comments Peer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures
首先,不伤害:打破媒体推荐中的自杀性回音室
机构 * E.T.S.I. Sistemas Informáticos (Universidad Politécnica de Madrid)(马德里理工大学信息系统工程系)
专题命中 安全评测 :safety(abstract,comments);分类 cs.AI、cs.CY、cs.LG
AI总结 针对推荐系统在心理健康场景中可能加剧用户自杀倾向的问题,提出RankAid重排序方法,通过惩罚有害内容并提升治疗性内容,在保持推荐准确性的同时确保临床安全。
Comments 10 pages, 5 figures. Research on safety-aware recommender systems and algorithmic ethics
临床AI中的对抗脆弱性与语言脆弱性:在低资源医疗环境中对诊断崩溃的系统审计及不可察觉扰动和跨语言漂移的影响
机构 * Centre for Clinical Intelligence & Safety(临床智能与安全中心) ; Tomorrow University of Applied Sciences(明天应用科学大学)
专题命中 安全评测 :safety(abstract,comments);分类 cs.AI、cs.CY、cs.LG
AI总结 本文系统地审计了临床AI在不可察觉扰动和跨语言漂移下的诊断崩溃问题,揭示了对抗脆弱性和语言脆弱性对低资源医疗环境中的临床AI系统的影响。
Comments 23 pages, 9 figures, 3 tables. Code and data available at https://github.com/anthoniooladimeji11-coder/clinical-ai-safety-audit
专题命中 安全评测 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG;trustworthy(journal_ref)
Journal ref Proceedings of the 3rd Workshop on Trustworthy Natural Language Processing (TrustNLP 2023) (July 2023) 47-54
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY;trustworthy(comments)
Comments ICLR 2024 Workshop on Secure and Trustworthy Large Language Models
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)
Comments Highlighted paper at ICLR 2023 workshop on Trustworthy and Reliable Large-Scale Machine Learning Models; code is at: https://github.com/microsoft/robustlearn; more works: https://llm-eval.github.io/
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY;safety(comments)
Comments NeurIPS 2022 ML Safety Workshop, https://neurips2022.mlsafety.org
用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能
机构 * University of Tehran(德黑兰大学)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。
SkillNet: 创建、评估和连接AI技能
机构 * Zhejiang University(浙江大学) ; Tongji University(同济大学) ; Southeast University(东南大学) ; Alibaba Group(阿里巴巴集团) ; Tencent(腾讯) ; Fudan University(复旦大学) ; The University of Edinburgh(爱丁堡大学) ; Monash University(墨尔本大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Huzhou University(湖州大学) ; Hornor Device Co., Ltd(Hornor设备有限公司) ; Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。
Comments http://skillnet.openkg.cn/; add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis