HealthBranches: Synthesizing Clinically-Grounded Question Answering Datasets via Decision Pathways
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ACL 2025 (Main)
机构 * Edinburgh Napier University(爱丁堡纳皮尔大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
机构 * Oxford Internet Institute(牛津互联网研究所) ; University of Oxford(牛津大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * Salesforce AI Research(Salesforce AI研究部) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 25 Pages, 17 Figures, 6 Tables
专题命中 安全评测 :red teaming(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Winner Defender Team at Amazon Nova AI Challenge 2025
机构 * Dept. of Electrical Engineering(电气工程系) ; Indian Institute of Technology Delhi(印度理工学院德里) ; Media and Data Science Research(媒体与数据科学研究) ; Adobe Inc., India(Adobe公司,印度)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments To appear in Transactions of the Association for Computational Linguistics (TACL)
机构 * Independent Researcher, Cambridge Boston Alignment Initiative(独立研究者,剑桥波士顿对齐计划)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Accepted to Generative AI and Law Workshop at the International Conference on Machine Learning (ICML 2024)
机构 * Department of Physical, Computer and Mathematical Sciences - University of Modena and Reggio Emilia(物理、计算机和数学科学系 - 模纳和雷吉奥艾米利亚大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * College of Science and Engineering (CSE), Hamad Bin Khalifa University (HBKU)(哈马德·本·卡伊夫大学科学与工程学院) ; Networked Systems Security Group, KTH Royal Institute of Technology -- Stockholm, Sweden(瑞典皇家理工学院网络系统安全组)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
Comments To be published in https://link.springer.com/book/9789819672370
机构 * Aalto University(阿alto大学) ; TU Wien(维也纳技术大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
Comments 9 pages
Journal ref The Future of Human-Robot Synergy in Interactive Environments: The Role of Robots at the Workplace @ CHIWork 2025
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
机构 * Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(生物医学工程研究所,工程科学系,牛津大学) ; Imperial College London(伦敦帝国学院) ; University of Sheffield(谢菲尔德大学) ; Novo Nordisk Research Centre Oxford (NNRCO)(牛津诺和硕研究中心(NNRCO)) ; Royal Society(皇家学会)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Under journal revision
机构 * University of Maryland(马里兰大学) ; NVIDIA(英伟达)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments CVPR 2025
Journal ref Proceedings of the Computer Vision and Pattern Recognition Conference (CVPR), 2025, pp. 28575-28585
机构 * Intuit AI Research(Intuit AI研究院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2025; 18 pages, 8 figures
机构 * Liverpool John Moores University(利物浦约翰·穆里斯大学) ; Birla Institute of Technology(比拉理工学院) ; Christ University(基督大学) ; Columbia University(哥伦比亚大学) ; New York University(纽约大学) ; University of Washington(华盛顿大学) ; Hanyang University(翰阳大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; University of Tokyo(东京大学) ; Tsinghua University(清华大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ICML 2025. Project website at https://mib-bench.github.io
机构 * LMU(慕尼黑大学) ; MIPT(莫斯科 Institute of Physics and Technology) ; AIRI(空气研究所)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2025 (Main Conference)
机构 * Zhejiang University(浙江大学) ; Tencent(腾讯) ; National University of Singapore(新加坡国立大学) ; NUS-NCS Joint Lab(新加坡国立大学NCS联合实验室)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2025
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Journal ref ICML 2025 Spotlight
机构 * Graduate School of Life Science and Systems Engineering, Kyushu Institute of Technology(九州工学院生命科学与系统工程研究生院) ; Department of Informatics, Universitas 17 Agustus 1945 Surabaya(Surabaya 17 August 1945 大学信息系)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 43 pages, 18 figures. Accepted for publication in MDPI Sensors (2025). Final version before journal publication
Journal ref Sensors 2025, 25, 3324
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Accepted to ICML 2025
机构 * MTS AI(MTS人工智能公司) ; ITMO University(ITMO大学) ; IITU University(IITU大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * R&D Lab F-Initiatives(F-Initiatives研发实验室) ; Université d’Orleans(奥尔良大学) ; Université Sorbonne Paris Nord(巴黎-索邦大学) ; University of Dubai(迪拜大学) ; IULM University(IULM大学)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
Comments Under review