arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9248 篇

2404.13043 2024-09-10 cs.CV cs.CL cs.LG 81%

Data Alignment for Zero-Shot Concept Generation in Dermatology AI

Soham Gadgil, Mahtab Bigverdi

专题命中 安全评测 :alignment(title);trustworthy(abstract);分类 cs.CL、cs.LG

Comments Accepted as a workshop paper to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04641 2024-09-10 cs.LG cs.AI 81%

Stacked Universal Successor Feature Approximators for Safety in Reinforcement Learning

Ian Cannon, Washington Garcia, Thomas Gresavage, Joseph Saurine, Ian Leong, Jared Culbertson

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10311 2024-09-04 cs.CL cs.AI 81%

CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models

Wenjing Zhang, Xuejiao Lei, Zhaoxiang Liu, Meijuan An, Bikun Yang, KaiKai Zhao, Kai Wang, Shiguo Lian

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08318 2024-08-19 cs.CY cs.AI 81%

First Analysis of the EU Artifical Intelligence Act: Towards a Global Standard for Trustworthy AI?

Marion Ho-Dac

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.CY

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04242 2024-08-09 cs.LG cs.AI cs.NE 81%

The Ungrounded Alignment Problem

Marc Pickett, Aakash Kumar Nain, Joseph Modayil, Llion Jones

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments 7 pages, plus references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16902 2024-07-25 cs.CY cs.AI 81%

The Potential and Perils of Generative Artificial Intelligence for Quality Improvement and Patient Safety

Laleh Jalilian, Daniel McDuff, Achuta Kadambi

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12421 2024-07-18 cs.LG cs.AI 81%

SafePowerGraph: Safety-aware Evaluation of Graph Neural Networks for Transmission Power Grids

Salah Ghamizi, Aleksandar Bojchevski, Aoxiang Ma, Jun Cao

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12135 2024-07-18 cs.CY cs.AI cs.SE 81%

Trustworthy AI in practice: an analysis of practitioners' needs and challenges

Maria Teresa Baldassarre, Domenico Gigante, Marcos Kalinowski, Azzurra Ragone, Sara Tibidò

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.CY

Journal ref 28th International Conference on Evaluation and Assessment in Software Engineering (EASE 2024), June 18-21, 2024, Salerno, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16220 2024-06-25 cs.LG cs.AI cs.CV 81%

Learning Run-time Safety Monitors for Machine Learning Components

Ozan Vardal, Richard Hawkins, Colin Paterson, Chiara Picardi, Daniel Omeiza, Lars Kunze, Ibrahim Habli

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15371 2024-06-25 cs.CY cs.AI 81%

Affirmative safety: An approach to risk management for high-risk AI

Akash R. Wasil, Joshua Clymer, David Krueger, Emily Dardaman, Simeon Campos, Evan R. Murphy

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05205 2024-06-11 cs.CV cs.CL cs.LG cs.MM eess.IV 81%

CPLIP: Zero-Shot Learning for Histopathology with Comprehensive Vision-Language Alignment

Sajid Javed, Arif Mahmood, Iyyakutti Iyappan Ganapathi, Fayaz Ali Dharejo, Naoufel Werghi, Mohammed Bennamoun

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11195 2024-05-21 cs.LG cs.AI cs.IT math.IT 81%

Trustworthy Actionable Perturbations

Jesse Friedbaum, Sudarshan Adiga, Ravi Tandon

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at the 41st International Conference on Machine Learning (ICML) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05466 2024-05-14 cs.CL cs.AI 81%

Poser: Unmasking Alignment Faking LLMs by Manipulating Their Internals

Joshua Clymer, Caden Juang, Severin Field

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14068 2024-04-23 cs.AI cs.LG 81%

Holistic Safety and Responsibility Evaluations of Advanced AI Models

Laura Weidinger, Joslyn Barnhart, Jenny Brennan, Christina Butterfield, Susie Young, Will Hawkins, Lisa Anne Hendricks, Ramona Comanescu, Oscar Chang, Mikel Rodriguez, Jennifer Beroshi, Dawn Bloxwich, Lev Proleev, Jilin Chen, Sebastian Farquhar, Lewis Ho, Iason Gabriel, Allan Dafoe, William Isaac

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 10 pages excluding bibliography

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10928 2024-04-16 cs.CL cs.AI 81%

FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets

Seonghyeon Ye, Doyoung Kim, Sungdong Kim, Hyeonbin Hwang, Seungone Kim, Yongrae Jo, James Thorne, Juho Kim, Minjoon Seo

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments ICLR 2024 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06003 2024-04-10 cs.CL cs.AI 81%

FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models

Zhuohao Yu, Chang Gao, Wenjin Yao, Yidong Wang, Zhengran Zeng, Wei Ye, Jindong Wang, Yue Zhang, Shikun Zhang

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

Comments We open-source all our code at: https://github.com/WisdomShell/FreeEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04642 2024-04-09 cs.CL cs.AI 81%

TRAQ: Trustworthy Retrieval Augmented Question Answering via Conformal Prediction

Shuo Li, Sangdon Park, Insup Lee, Osbert Bastani

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

Comments 23 pages, 17 figures, 2024 Annual Conference of the North American Chapter of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13313 2024-03-21 cs.AI cs.CL 81%

Polaris: A Safety-focused LLM Constellation Architecture for Healthcare

Subhabrata Mukherjee, Paul Gamble, Markel Sanz Ausin, Neel Kant, Kriti Aggarwal, Neha Manjunath, Debajyoti Datta, Zhengliang Liu, Jiayuan Ding, Sophia Busacca, Cezanne Bianco, Swapnil Sharma, Rae Lasko, Michelle Voisard, Sanchay Harneja, Darya Filippova, Gerry Meixiong, Kevin Cha, Amir Youssefi, Meyhaa Buvanesh, Howard Weingram, Sebastian Bierman-Lytle, Harpreet Singh Mangat, Kim Parikh, Saad Godil, Alex Miller

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09015 2024-02-26 cs.CL cs.AI 81%

Towards better Human-Agent Alignment: Assessing Task Utility in LLM-Powered Applications

Negar Arabzadeh, Julia Kiseleva, Qingyun Wu, Chi Wang, Ahmed Awadallah, Victor Dibia, Adam Fourney, Charles Clarke

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13635 2024-02-22 cs.LG cs.AI 81%

The METRIC-framework for assessing data quality for trustworthy AI in medicine: a systematic review

Daniel Schwabe, Katinka Becker, Martin Seyferth, Andreas Klaß, Tobias Schäffter

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12417 2024-02-21 cs.LG cs.AI 81%

Predicting trucking accidents with truck drivers 'safety climate perception across companies: A transfer learning approach

Kailai Sun, Tianxiang Lan, Say Hong Kam, Yang Miang Goh, Yueng-Hsiang Huang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments submitted to journal: accident analysis and prevention

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02055 2024-02-06 cs.LG cs.AI 81%

Variance Alignment Score: A Simple But Tough-to-Beat Data Selection Method for Multimodal Contrastive Learning

Yiping Wang, Yifang Chen, Wendan Yan, Kevin Jamieson, Simon Shaolei Du

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01096 2024-02-05 cs.LG cs.AI cs.CR cs.DC 81%

Trustworthy Distributed AI Systems: Robustness, Privacy, and Governance

Wenqi Wei, Ling Liu

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

Comments Manuscript accepted to ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.18058 2024-02-01 cs.CL cs.LG 81%

LongAlign: A Recipe for Long Context Alignment of Large Language Models

Yushi Bai, Xin Lv, Jiajie Zhang, Yuze He, Ji Qi, Lei Hou, Jie Tang, Yuxiao Dong, Juanzi Li

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12474 2024-01-24 cs.CL cs.LG 81%

Large Language Models are Superpositions of All Characters: Attaining Arbitrary Role-play via Self-Alignment

Keming Lu, Bowen Yu, Chang Zhou, Jingren Zhou

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.02779 2024-01-18 eess.IV cs.AI cs.CV cs.LG 81%

A Dempster-Shafer approach to trustworthy AI with application to fetal brain MRI segmentation

Lucas Fidon, Michael Aertsen, Florian Kofler, Andrea Bink, Anna L. David, Thomas Deprest, Doaa Emam, Frédéric Guffens, András Jakab, Gregor Kasprian, Patric Kienast, Andrew Melbourne, Bjoern Menze, Nada Mufti, Ivana Pogledic, Daniela Prayer, Marlene Stuempflen, Esther Van Elslander, Sébastien Ourselin, Jan Deprest, Tom Vercauteren

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

Comments Published in IEEE TPAMI. Minor revision compared to the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16101 2023-11-28 cs.CV cs.CL cs.LG 81%

How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs

Haoqin Tu, Chenhang Cui, Zijun Wang, Yiyang Zhou, Bingchen Zhao, Junlin Han, Wangchunshu Zhou, Huaxiu Yao, Cihang Xie

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

Comments H.T., C.C., and Z.W. contribute equally. Work done during H.T. and Z.W.'s internship at UCSC, and C.C. and Y.Z.'s internship at UNC

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10819 2023-11-28 cs.CL cs.AI 81%

Evaluating the Instruction-Following Robustness of Large Language Models to Prompt Injection

Zekun Li, Baolin Peng, Pengcheng He, Xifeng Yan

专题命中 安全评测 :prompt injection(title,abstract);分类 cs.CL、cs.AI

Comments The data and code can be found at https://github.com/Leezekun/instruction-following-robustness-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02457 2023-11-16 cs.CL cs.CY 81%

The Empty Signifier Problem: Towards Clearer Paradigms for Operationalising "Alignment" in Large Language Models

Hannah Rose Kirk, Bertie Vidgen, Paul Röttger, Scott A. Hale

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.CY

Comments Socially Responsible Language Modelling Research (SoLaR) @ NeurIPs 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03795 2023-11-08 cs.AI cs.HC cs.LG 81%

AI-Supported Assessment of Load Safety

Julius Schöning, Niklas Kruse

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 9 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏