arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9248 篇

2502.10410 2025-02-18 cs.CY cs.AI 81%

Auto-Evaluation: A Critical Measure in Driving Improvements in Quality and Safety of AI-Generated Lesson Resources

Hannah-Beth Clark, Margaux Dowland, Laura Benton, Reka Budai, Ibrahim Kaan Keskin, Emma Searle, Matthew Gregory, Mark Hodierne, William Gayne, John Roberts

专题命中 安全评测 :safety(title);alignment(abstract);分类 cs.AI、cs.CY

Comments 27 pages, Part of MIT Open Learning AI and Open Education Initiative Series, published Jan 2025 https://aiopeneducation.pubpub.org/pub/i36sncz8/release/3?readingCollection=06969c6d

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06470 2025-02-11 cs.CL cs.AI 81%

A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks

Hieu Minh "Jord" Nguyen

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

Comments Advancing Artificial Intelligence through Theory of Mind Workshop, AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16806 2025-02-11 cs.CL cs.AI 81%

Entity Alignment with Noisy Annotations from Large Language Models

Shengyuan Chen, Qinggang Zhang, Junnan Dong, Wen Hua, Qing Li, Xiao Huang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05591 2025-02-11 cs.CV cs.CL cs.LG 81%

Linear Alignment of Vision-language Models for Image Captioning

Fabian Paischer, Markus Hofmarcher, Sepp Hochreiter, Thomas Adler

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

Comments 9 pages (+ references and appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14778 2025-01-28 cs.CY cs.AI cs.HC 81%

Advancing Trustworthy AI for Sustainable Development: Recommendations for Standardising AI Incident Reporting

Avinash Agarwal, Manisha J Nene

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.CY

Comments 8 pages, 10 tables, and 1 figure. Accepted at the International Telecommunication Union (ITU) Kaleidoscope 2024

Journal ref 2024 ITU Kaleidoscope: Innovation and Digital Transformation for a Sustainable World (ITU K), New Delhi, India, 2024, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14051 2025-01-27 cs.CV cs.AI cs.LG 81%

Revisiting CLIP: Efficient Alignment of 3D MRI and Tabular Data using Domain-Specific Foundation Models

Jakob Krogh Petersen, Valdemar Licht, Mads Nielsen, Asbjørn Munk

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments 10 pages, 2 figures. To be published in ISBI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15474 2025-01-03 cs.CV cs.AI cs.LG cs.RO 81%

EC-IoU: Orienting Safety for Object Detectors via Ego-Centric Intersection-over-Union

Brian Hsuan-Cheng Liao, Chih-Hong Cheng, Hasan Esen, Alois Knoll

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 8 pages (IEEE double column format), 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14940 2024-12-30 cs.LG cs.CL 81%

Baichuan Alignment Technical Report

Mingan Lin, Fan Yang, Yanjun Shen, Haoze Sun, Tianpeng Li, Tao Zhang, Chenzheng Zhu, Tao Zhang, Miao Zheng, Xu Li, Yijie Zhou, Mingyang Chen, Yanzhao Qin, Youquan Li, Hao Liang, Fei Li, Yadong Li, Mang Wang, Guosheng Dong, Kun Fang, Jianhua Xu, Bin Cui, Wentao Zhang, Zenan Zhou, Weipeng Chen

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15265 2024-12-24 cs.CL cs.AI 81%

Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models

Yingshui Tan, Boren Zheng, Baihui Zheng, Kerui Cao, Huiyun Jing, Jincheng Wei, Jiaheng Liu, Yancheng He, Wenbo Su, Xiangyong Zhu, Bo Zheng, Kaifu Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16300 2024-12-20 cs.CL cs.AI 81%

BayLing 2: A Multilingual Large Language Model with Efficient Language Alignment

Shaolei Zhang, Kehao Zhang, Qingkai Fang, Shoutao Guo, Yan Zhou, Xiaodong Liu, Yang Feng

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments BayLing 2's online demo: http://nlp.ict.ac.cn/bayling/demo. BayLing 2's code and models: https://github.com/ictnlp/BayLing

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06512 2024-12-10 cs.AI cs.CL cs.SE 81%

The Fusion of Large Language Models and Formal Methods for Trustworthy AI Agents: A Roadmap

Yedi Zhang, Yufan Cai, Xinyue Zuo, Xiaokun Luan, Kailong Wang, Zhe Hou, Yifan Zhang, Zhiyuan Wei, Meng Sun, Jun Sun, Jing Sun, Jin Song Dong

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19530 2024-12-02 cs.CR cs.AI cs.LG 81%

Quantized Delta Weight Is Safety Keeper

Yule Liu, Zhen Sun, Xinlei He, Xinyi Huang

专题命中 安全评测 :safety(title);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16736 2024-11-27 cs.CL cs.AI physics.chem-ph 81%

ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain

Haochen Zhao, Xiangru Tang, Ziran Yang, Xiao Han, Xuanzhi Feng, Yueqing Fan, Senhao Cheng, Di Jin, Yilun Zhao, Arman Cohan, Mark Gerstein

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08977 2024-11-25 cs.CY cs.CL 81%

Robustness and Confounders in the Demographic Alignment of LLMs with Human Perceptions of Offensiveness

Shayan Alipour, Indira Sen, Mattia Samory, Tanushree Mitra

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05403 2024-11-11 cs.CL cs.AI 81%

Benchmarking Distributional Alignment of Large Language Models

Nicole Meister, Carlos Guestrin, Tatsunori Hashimoto

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14125 2024-11-08 cs.AI cs.CL 81%

ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation

Jingnan Zheng, Han Wang, An Zhang, Tai D. Nguyen, Jun Sun, Tat-Seng Chua

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Journal ref 2024 Neurips

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17871 2024-11-06 cs.CV cs.AI cs.CL 81%

Seeing the Image: Prioritizing Visual Correlation by Contrastive Alignment

Xin Xiao, Bohong Wu, Jiacong Wang, Chunyuan Li, Xun Zhou, Haoyuan Guo

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments NeurlPS 2024, Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02094 2024-11-05 cs.HC cs.AI cs.LG 81%

Alignment-Based Adversarial Training (ABAT) for Improving the Robustness and Accuracy of EEG-Based BCIs

Xiaoqing Chen, Ziwei Wang, Dongrui Wu

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

Journal ref IEEE Trans. on Neural Systems and Rehabilitation Engineering, 32:1703-1714, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13911 2024-11-05 cs.CV cs.AI cs.CL 81%

TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment

Wei Li, Hehe Fan, Yongkang Wong, Mohan Kankanhalli, Yi Yang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2024 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12649 2024-11-04 cs.LG cs.AI cs.CV stat.ML 81%

Probabilistic Conceptual Explainers: Trustworthy Conceptual Explanations for Vision Foundation Models

Hengyi Wang, Shiwei Tan, Hao Wang

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

Comments Proceedings of the 41st International Conference on Machine Learning (ICML 2024)

Journal ref PMLR 235:51502-51522, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23703 2024-11-01 cs.LG cs.CL 81%

OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models

Junda Wu, Xintong Li, Ruoyu Wang, Yu Xia, Yuxin Xiong, Jianing Wang, Tong Yu, Xiang Chen, Branislav Kveton, Lina Yao, Jingbo Shang, Julian McAuley

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21695 2024-10-30 cs.CL cs.LG 81%

CFSafety: Comprehensive Fine-grained Safety Assessment for LLMs

Zhihao Liu, Chenhui Hu

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21346 2024-10-30 cs.LG cs.AI 81%

Towards Trustworthy Machine Learning in Production: An Overview of the Robustness in MLOps Approach

Firas Bayram, Bestoun S. Ahmed

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11446 2024-10-28 cs.LG cs.AI stat.ML 81%

Exploration of the Rashomon Set Assists Trustworthy Explanations for Medical Data

Katarzyna Kobylińska, Mateusz Krzyziński, Rafał Machowicz, Mariusz Adamek, Przemysław Biecek

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16606 2024-10-23 cs.LG cs.AI 81%

GALA: Graph Diffusion-based Alignment with Jigsaw for Source-free Domain Adaptation

Junyu Luo, Yiyang Gu, Xiao Luo, Wei Ju, Zhiping Xiao, Yusheng Zhao, Jingyang Yuan, Ming Zhang

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10093 2024-10-15 cs.CL cs.LG 81%

How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective

Teng Xiao, Mingxiao Li, Yige Yuan, Huaisheng Zhu, Chao Cui, Vasant G Honavar

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16700 2024-10-08 cs.CV cs.CL cs.LG 81%

Implicit Multimodal Alignment: On the Generalization of Frozen LLMs to Multimodal Inputs

Mustafa Shukor, Matthieu Cord

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2024. Code: https://github.com/mshukor/ima-lmms. Project page: https://ima-lmms.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01927 2024-10-04 cs.CY cs.AI econ.GN q-fin.EC 81%

Risk Alignment in Agentic AI Systems

Hayley Clatterbuck, Clinton Castro, Arvo Muñoz Morán

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00741 2024-10-01 cs.AI cs.LG cs.RO 81%

Diffusion Models for Offline Multi-agent Reinforcement Learning with Safety Constraints

Jianuo Huang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments The experiment and method plan are abolished and need to be redesigned

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17819 2024-09-27 cs.CL cs.AI 81%

Inference-Time Language Model Alignment via Integrated Value Guidance

Zhixuan Liu, Zhanhui Zhou, Yuanfu Wang, Chao Yang, Yu Qiao

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏