arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9331 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9331 篇

2407.15851 2024-10-08 cs.CV cs.AI cs.CY cs.HC cs.LG 67%

A Survey on Trustworthiness in Foundation Models for Medical Image Analysis

Congzhen Shi, Ryan Rezai, Jiaxi Yang, Qi Dou, Xiaoxiao Li

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08460 2024-10-04 cs.CL cs.AI cs.LG 67%

LongForm: Effective Instruction Tuning with Reverse Instructions

Abdullatif Köksal, Timo Schick, Anna Korhonen, Hinrich Schütze

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024 Findings. This version extends the training with recent LLMs, evaluation with new metrics, and NLU tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10702 2024-09-25 cs.HC cs.AI cs.CL cs.LG 67%

Model-in-the-Loop (MILO): Accelerating Multimodal AI Data Annotation with LLMs

Yifan Wang, David Stevens, Pranay Shah, Wenwen Jiang, Miao Liu, Xu Chen, Robert Kuo, Na Li, Boying Gong, Daniel Lee, Jiabo Hu, Ning Zhang, Bob Kamma

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11415 2024-09-24 cs.CR cs.AI cs.CL cs.HC cs.LG 67%

A Security Risk Taxonomy for Prompt-Based Interaction With Large Language Models

Erik Derner, Kristina Batistič, Jan Zahálka, Robert Babuška

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13120 2024-09-23 cs.CL cs.AI cs.CY 67%

Are Large Language Models Good Essay Graders?

Anindita Kundu, Denilson Barbosa

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13054 2024-09-23 cs.CL cs.AI cs.LG 67%

LLM Surgery: Efficient Knowledge Unlearning and Editing in Large Language Models

Akshaj Kumar Veldanda, Shi-Xiong Zhang, Anirban Das, Supriyo Chakraborty, Stephen Rawls, Sambit Sahu, Milind Naphade

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00706 2024-08-29 cs.CL cs.AI cs.CY 67%

From Complexity to Clarity: How AI Enhances Perceptions of Scientists and the Public's Understanding of Science

David M. Markowitz

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13273 2024-08-27 cs.CL cs.AI cs.LG 67%

Retrieval-Augmented Generation Meets Data-Driven Tabula Rasa Approach for Temporal Knowledge Graph Forecasting

Geethan Sannidhi, Sagar Srinivas Sakhinana, Venkataramana Runkana

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Paper was accepted at ACM KDD -2024 -- Undergraduate Consortium. Please find the link: https://kdd2024.kdd.org/undergraduate-consortium/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11865 2024-08-23 cs.CL cs.AI cs.LG 67%

How Susceptible are LLMs to Influence in Prompts?

Sotiris Anagnostidis, Jannis Bulian

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11237 2024-08-22 cs.AI cs.CL cs.CV cs.LG 67%

Out-of-Distribution Detection with Attention Head Masking for Multimodal Document Classification

Christos Constantinou, Georgios Ioannides, Aman Chadha, Aaron Elkins, Edwin Simpson

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08584 2024-08-19 cs.RO cs.AI cs.CV cs.CY cs.LG 67%

S-RAF: A Simulation-Based Robustness Assessment Framework for Responsible Autonomous Driving

Daniel Omeiza, Pratik Somaiya, Jo-Ann Pattinson, Carolyn Ten-Holter, Jack Stilgoe, Marina Jirotka, Lars Kunze

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06992 2024-08-19 cs.IR cs.AI cs.CL cs.LG 67%

Robust Neural Information Retrieval: An Adversarial and Out-of-distribution Perspective

Yu-An Liu, Ruqing Zhang, Jiafeng Guo, Maarten de Rijke, Yixing Fan, Xueqi Cheng

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00628 2024-08-12 cs.CL cs.CR cs.CY cs.LG 67%

Transforming Computer Security and Public Trust Through the Exploration of Fine-Tuning Large Language Models

Garrett Crumrine, Izzat Alsmadi, Jesus Guerrero, Yuvaraj Munian

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.CY、cs.LG

Comments A preprint, 17 pages. 11 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03281 2024-08-08 cs.CL cs.AI cs.LG 67%

StructEval: Deepen and Broaden Large Language Model Assessment via Structured Evaluation

Boxi Cao, Mengjie Ren, Hongyu Lin, Xianpei Han, Feng Zhang, Junfeng Zhan, Le Sun

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2024;Benchmark at https://github.com/c-box/StructEval ;Leaderboard at https://huggingface.co/spaces/Bowieee/StructEval_leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11704 2024-08-08 cs.CL cs.AI cs.LG 67%

Nemotron-4 340B Technical Report

Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H. Anh, Pallab Bhattacharya, Annika Brundyn, Jared Casper, Bryan Catanzaro, Sharon Clay, Jonathan Cohen, Sirshak Das, Ayush Dattagupta, Olivier Delalleau, Leon Derczynski, Yi Dong, Daniel Egert, Ellie Evans, Aleksander Ficek, Denys Fridman, Shaona Ghosh, Boris Ginsburg, Igor Gitman, Tomasz Grzegorzek, Robert Hero, Jining Huang, Vibhu Jawa, Joseph Jennings, Aastha Jhunjhunwala, John Kamalu, Sadaf Khan, Oleksii Kuchaiev, Patrick LeGresley, Hui Li, Jiwei Liu, Zihan Liu, Eileen Long, Ameya Sunil Mahabaleshwarkar, Somshubra Majumdar, James Maki, Miguel Martinez, Maer Rodrigues de Melo, Ivan Moshkov, Deepak Narayanan, Sean Narenthiran, Jesus Navarro, Phong Nguyen, Osvald Nitski, Vahid Noroozi, Guruprasad Nutheti, Christopher Parisien, Jupinder Parmar, Mostofa Patwary, Krzysztof Pawelec, Wei Ping, Shrimai Prabhumoye, Rajarshi Roy, Trisha Saar, Vasanth Rao Naik Sabavat, Sanjeev Satheesh, Jane Polak Scowcroft, Jason Sewall, Pavel Shamis, Gerald Shen, Mohammad Shoeybi, Dave Sizer, Misha Smelyanskiy, Felipe Soares, Makesh Narsimhan Sreedhar, Dan Su, Sandeep Subramanian, Shengyang Sun, Shubham Toshniwal, Hao Wang, Zhilin Wang, Jiaxuan You, Jiaqi Zeng, Jimmy Zhang, Jing Zhang, Vivienne Zhang, Yian Zhang, Chen Zhu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12038 2024-08-07 cs.CL cs.AI cs.LG 67%

Soft Prompting for Unlearning in Large Language Models

Karuna Bhaila, Minh-Hao Van, Xintao Wu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01869 2024-08-06 cs.CL cs.AI cs.IR cs.LG cs.MA q-bio.QM 67%

MALADE: Orchestration of LLM-powered Agents with Retrieval Augmented Generation for Pharmacovigilance

Jihye Choi, Nils Palumbo, Prasad Chalasani, Matthew M. Engelhard, Somesh Jha, Anivarya Kumar, David Page

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Paper published at Machine Learning for Healthcare 2024 (MLHC'24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01800 2024-08-06 cs.CV 67%

MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Yuan Yao, Tianyu Yu, Ao Zhang, Chongyi Wang, Junbo Cui, Hongji Zhu, Tianchi Cai, Haoyu Li, Weilin Zhao, Zhihui He, Qianyu Chen, Huarong Zhou, Zhensheng Zou, Haoye Zhang, Shengding Hu, Zhi Zheng, Jie Zhou, Jie Cai, Xu Han, Guoyang Zeng, Dahai Li, Zhiyuan Liu, Maosong Sun

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11539 2024-08-02 cs.AI cs.CL cs.LG 67%

KGLens: Towards Efficient and Effective Knowledge Probing of Large Language Models with Knowledge Graphs

Shangshang Zheng, He Bai, Yizhe Zhang, Yi Su, Xiaochuan Niu, Navdeep Jaitly

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2024 Workshop Towards Knowledgeable Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12858 2024-07-19 cs.CL cs.AI cs.CV cs.LG 67%

Grounding and Evaluation for Large Language Models: Practical Challenges and Lessons Learned (Survey)

Krishnaram Kenthapadi, Mehrnoosh Sameki, Ankur Taly

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Survey Article for the ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD 2024) Tutorial

Journal ref Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03418 2024-07-08 cs.LG cs.AI cs.CL cs.CV 67%

HEMM: Holistic Evaluation of Multimodal Foundation Models

Paul Pu Liang, Akshay Goindani, Talha Chafekar, Leena Mathur, Haofei Yu, Ruslan Salakhutdinov, Louis-Philippe Morency

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code available at https://github.com/pliang279/HEMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13193 2024-06-21 cs.LG cs.AI cs.CL physics.chem-ph 67%

PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomes

He Cao, Yanjun Shao, Zhiyuan Liu, Zijing Liu, Xiangru Tang, Yuan Yao, Yu Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12399 2024-06-19 cs.CL cs.AI cs.CY 67%

QueerBench: Quantifying Discrimination in Language Models Toward Queer Identities

Mae Sosto, Alberto Barrón-Cedeño

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01291 2024-06-19 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

Evaluating Text-to-Visual Generation with Image-to-Text Generation

Zhiqiu Lin, Deepak Pathak, Baiqi Li, Jiayao Li, Xide Xia, Graham Neubig, Pengchuan Zhang, Deva Ramanan

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments We open-source our data, model, and code at: https://github.com/linzhiqiu/t2v_metrics ; Project page: https://linzhiqiu.github.io/papers/vqascore

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00378 2024-06-18 cs.CL cs.AI cs.CY 67%

ValueDCG: Measuring Comprehensive Human Value Understanding Ability of Language Models

Zhaowei Zhang, Fengshuo Bai, Jun Gao, Yaodong Yang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04845 2024-06-10 cs.CL cs.AI cs.DC cs.LG cs.MA 67%

FedLLM-Bench: Realistic Benchmarks for Federated Learning of Large Language Models

Rui Ye, Rui Ge, Xinyu Zhu, Jingyi Chai, Yaxin Du, Yang Liu, Yanfeng Wang, Siheng Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03007 2024-06-06 cs.CL cs.AI cs.CR cs.LG 67%

BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents

Yifei Wang, Dizhan Xue, Shengjie Zhang, Shengsheng Qian

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14472 2024-05-29 cs.CL cs.AI cs.CV cs.HC cs.LG 67%

Detoxifying Large Language Models via Knowledge Editing

Mengru Wang, Ningyu Zhang, Ziwen Xu, Zekun Xi, Shumin Deng, Yunzhi Yao, Qishen Zhang, Linyi Yang, Jindong Wang, Huajun Chen

专题命中 安全评测 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2024. Project website: https://zjunlp.github.io/project/SafeEdit Benchmark: https://huggingface.co/datasets/zjunlp/SafeEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16136 2024-05-28 cs.AI cs.CL cs.LG cs.SD eess.AS 67%

C3LLM: Conditional Multimodal Content Generation Using Large Language Models

Zixuan Wang, Qinkai Duan, Yu-Wing Tai, Chi-Keung Tang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15817 2024-05-20 cs.AI cs.CL cs.LG 67%

Identifying the Risks of LM Agents with an LM-Emulated Sandbox

Yangjun Ruan, Honghua Dong, Andrew Wang, Silviu Pitis, Yongchao Zhou, Jimmy Ba, Yann Dubois, Chris J. Maddison, Tatsunori Hashimoto

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏