arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 7971 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 7971 篇

2309.17179 2024-02-12 cs.LG cs.AI cs.CL 67%

Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training

Xidong Feng, Ziyu Wan, Muning Wen, Stephen Marcus McAleer, Ying Wen, Weinan Zhang, Jun Wang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11562 2024-01-26 cs.AI cs.CL cs.CV cs.LG 67%

A Survey of Reasoning with Foundation Models

Jiankai Sun, Chuanyang Zheng, Enze Xie, Zhengying Liu, Ruihang Chu, Jianing Qiu, Jiaqi Xu, Mingyu Ding, Hongyang Li, Mengzhe Geng, Yue Wu, Wenhai Wang, Junsong Chen, Zhangyue Yin, Xiaozhe Ren, Jie Fu, Junxian He, Wu Yuan, Qi Liu, Xihui Liu, Yu Li, Hao Dong, Yu Cheng, Ming Zhang, Pheng Ann Heng, Jifeng Dai, Ping Luo, Jingdong Wang, Ji-Rong Wen, Xipeng Qiu, Yike Guo, Hui Xiong, Qun Liu, Zhenguo Li

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 20 Figures, 160 Pages, 750+ References, Project Page https://github.com/reasoning-survey/Awesome-Reasoning-Foundation-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09454 2024-01-19 cs.CV cs.AI cs.CL cs.LG 67%

Voila-A: Aligning Vision-Language Models with User's Gaze Attention

Kun Yan, Lei Ji, Zeyu Wang, Yuntao Wang, Nan Duan, Shuai Ma

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19680 2024-01-17 cs.CL cs.AI cs.LG 67%

Integrating Pre-trained Language Model into Neural Machine Translation

Soon-Jae Hwang, Chang-Sung Jeong

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11671 2024-01-05 cs.CL cs.AI cs.LG 67%

Evaluating Language-Model Agents on Realistic Autonomous Tasks

Megan Kinniment, Lucas Jun Koba Sato, Haoxing Du, Brian Goodrich, Max Hasin, Lawrence Chan, Luke Harold Miles, Tao R. Lin, Hjalmar Wijk, Joel Burget, Aaron Ho, Elizabeth Barnes, Paul Christiano

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05503 2023-12-12 cs.CL cs.AI cs.LG 67%

Aligner: One Global Token is Worth Millions of Parameters When Aligning Large Language Models

Zhou Ziheng, Yingnian Wu, Song-Chun Zhu, Demetri Terzopoulos

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 81 pages, 77 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10313 2023-12-06 cs.CL cs.AI cs.LG 67%

Investigating the Catastrophic Forgetting in Multimodal Large Language Models

Yuexiang Zhai, Shengbang Tong, Xiao Li, Mu Cai, Qing Qu, Yong Jae Lee, Yi Ma

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10093 2023-11-08 cs.CV cs.AI cs.CL cs.LG 67%

Investigating the Role of Attribute Context in Vision-Language Models for Object Recognition and Detection

Kyle Buettner, Adriana Kovashka

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at Winter Conference on Applications of Computer Vision (WACV), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02105 2023-11-07 cs.LG cs.AI cs.CY 67%

Making Harmful Behaviors Unlearnable for Large Language Models

Xin Zhou, Yi Lu, Ruotian Ma, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00047 2023-11-02 cs.AI cs.CL cs.CV cs.LG 67%

Grounding Visual Illusions in Language: Do Vision-Language Models Perceive Illusions Like Humans?

Yichi Zhang, Jiayi Pan, Yuchen Zhou, Rui Pan, Joyce Chai

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2023 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18366 2023-10-31 cs.CL cs.AI cs.LG 67%

A Multilingual Virtual Guide for Self-Attachment Technique

Alicia Jiayun Law, Ruoyu Hu, Lisa Alazraki, Anandha Gopalan, Neophytos Polydorou, Abbas Edalat

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref 2022 IEEE 4th International Conference on Cognitive Machine Intelligence (CogMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.17218 2023-10-27 cs.CY cs.AI cs.HC cs.LG cs.SY eess.SY 67%

Artificial intelligence in government: Concepts, standards, and a unified framework

Vincent J. Straub, Deborah Morgan, Jonathan Bright, Helen Margetts

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 35 pages with references and appendix, 3 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01423 2023-10-24 cs.CL cs.AI cs.LG 67%

An Empirical Study of AI Generated Text Detection Tools

Arslan Akram

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 Pages, 4 Figures, 2 Tables, 42 References

Journal ref 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03135 2023-10-13 cs.CV cs.AI cs.CL cs.LG 67%

Distilling Large Vision-Language Model with Out-of-Distribution Generalizability

Xuanlin Li, Yunhao Fang, Minghua Liu, Zhan Ling, Zhuowen Tu, Hao Su

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published at International Conference on Computer Vision (ICCV) 2023. Poster at https://xuanlinli17.github.io/pdfs/iccv23_large_vlm_distillation_poster.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03840 2023-10-09 cs.LG cs.AI cs.CL 67%

Contextualized Structural Self-supervised Learning for Ontology Matching

Zhu Wang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10891 2023-09-21 cs.CL cs.AI cs.LG 67%

Self-Augmentation Improves Zero-Shot Cross-Lingual Transfer

Fei Wang, Kuan-Hao Huang, Kai-Wei Chang, Muhao Chen

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments AACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14683 2023-08-29 cs.CL cs.AI cs.LG 67%

Fine-Tuning Llama 2 Large Language Models for Detecting Online Sexual Predatory Chats and Abusive Texts

Thanh Thi Nguyen, Campbell Wilson, Janis Dalins

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.13563 2023-08-29 cs.CL cs.AI cs.IR cs.LG 67%

Large Language Models in Analyzing Crash Narratives -- A Comparative Study of ChatGPT, BARD and GPT-4

Maroa Mumtarin, Md Samiullah Chowdhury, Jonathan Wood

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09970 2023-08-22 cs.CL cs.AI cs.LG 67%

Tackling Vision Language Tasks Through Learning Inner Monologues

Diji Yang, Kezhen Chen, Jinmeng Rao, Xiaoyuan Guo, Yawen Zhang, Jie Yang, Yi Zhang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09804 2023-08-22 cs.CV cs.AI cs.CL cs.LG 67%

VL-PET: Vision-and-Language Parameter-Efficient Tuning via Granularity Control

Zi-Yuan Hu, Yanyang Li, Michael R. Lyu, Liwei Wang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICCV 2023 (17 pages, 6 figures, 22 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07326 2023-08-16 cs.AI cs.CL cs.LG 67%

AI Text-to-Behavior: A Study In Steerability

David Noever, Sam Hyams

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12128 2023-07-25 cs.CV cs.AI cs.CY cs.LG 67%

AI on the Road: A Comprehensive Analysis of Traffic Accidents and Accident Detection System in Smart Cities

Victor Adewopo, Nelly Elsayed, Zag Elsayed, Murat Ozer, Victoria Wangia-Anderson, Ahmed Abdelgawad

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 8,8

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09782 2023-07-24 cs.LG cs.AI cs.CL 67%

ZeroQuant-FP: A Leap Forward in LLMs Post-Training W4A8 Quantization Using Floating-Point Formats

Xiaoxia Wu, Zhewei Yao, Yuxiong He

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03419 2023-07-12 cs.CY cs.AI cs.DS cs.LG 67%

QI2 -- an Interactive Tool for Data Quality Assurance

Simon Geerkens, Christian Sieberichs, Alexander Braun, Thomas Waschulzik

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04114 2023-07-11 cs.LG cs.AI cs.CL cs.CV cs.MM 67%

FILM: How can Few-Shot Image Classification Benefit from Pre-Trained Language Models?

Zihao Jiang, Yunkai Dang, Dong Pang, Huishuai Zhang, Weiran Huang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00633 2023-07-04 cs.RO cs.AI cs.CY cs.HC cs.LG 67%

Effects of Explanation Specificity on Passengers in Autonomous Driving

Daniel Omeiza, Raunak Bhattacharyya, Nick Hawes, Marina Jirotka, Lars Kunze

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.04636 2023-06-30 cs.AI cs.CL cs.LG 67%

"That Is a Suspicious Reaction!": Interpreting Logits Variation to Detect NLP Adversarial Attacks

Edoardo Mosca, Shreyash Agarwal, Javier Rando, Georg Groh

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00020 2023-06-02 cs.CL cs.AI cs.LG 67%

GPT4GEO: How a Language Model Sees the World's Geography

Jonathan Roberts, Timo Lüddecke, Sowmen Das, Kai Han, Samuel Albanie

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12219 2023-05-26 cs.LG cs.AI cs.CL 67%

Collaborative Development of NLP models

Fereshte Khani, Marco Tulio Ribeiro

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.04013 2023-04-04 cs.CL cs.AI cs.LG 67%

There is No Big Brother or Small Brother: Knowledge Infusion in Language Models for Link Prediction and Question Answering

Ankush Agarwal, Sakharam Gawade, Sachin Channabasavarajendra, Pushpak Bhattacharyya

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏