arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 7978 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 7978 篇

2407.10049 2024-07-16 cs.CL cs.AI 62%

AutoGRAMS: Autonomous Graphical Agent Modeling Software

Ben Krause, Lucia Chen, Emmanuel Kahembwe

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09541 2024-07-16 cs.CL cs.AI cs.CV 62%

MATE: Meet At The Embedding -- Connecting Images with Long Texts

Young Kyun Jang, Junmo Kang, Yong Jae Lee, Donghyun Kim

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08890 2024-07-15 cs.SE cs.AI cs.LG 62%

DeepCodeProbe: Towards Understanding What Models Trained on Code Learn

Vahid Majdinasab, Amin Nikanjam, Foutse Khomh

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08328 2024-07-12 cs.AI cs.LG 62%

Unveiling Disparities in Maternity Care: A Topic Modelling Approach to Analysing Maternity Incident Investigation Reports

Georgina Cosma, Mohit Kumar Singh, Patrick Waterson, Gyuchan Thomas Jun, Jonathan Back

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05385 2024-07-09 cs.LG cs.AI cs.CV stat.ML 62%

Harmony in Diversity: Merging Neural Networks with Canonical Correlation Analysis

Stefan Horoi, Albert Manuel Orozco Camacho, Eugene Belilovsky, Guy Wolf

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

Comments Proceedings of the Forty-first International Conference on Machine Learning (ICML 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01851 2024-07-04 cs.CV cs.AI cs.LG eess.AS 62%

Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time

Sanjoy Chowdhury, Sayan Nag, Subhrajyoti Dasgupta, Jun Chen, Mohamed Elhoseiny, Ruohan Gao, Dinesh Manocha

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12736 2024-07-04 cs.CL cs.LG 62%

Learning and Forgetting Unsafe Examples in Large Language Models

Jiachen Zhao, Zhun Deng, David Madras, James Zou, Mengye Ren

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.LG

Comments accepted by ICML 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02209 2024-07-03 cs.CL cs.AI 62%

Generative Monoculture in Large Language Models

Fan Wu, Emily Black, Varun Chandrasekaran

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01790 2024-07-03 cs.CV cs.AI cs.LG 62%

Label-free Neural Semantic Image Synthesis

Jiayi Wang, Kevin Alexander Laube, Yumeng Li, Jan Hendrik Metzen, Shin-I Cheng, Julio Borges, Anna Khoreva

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10162 2024-07-02 cs.AI cs.CL 62%

Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models

Carson Denison, Monte MacDiarmid, Fazl Barez, David Duvenaud, Shauna Kravec, Samuel Marks, Nicholas Schiefer, Ryan Soklaski, Alex Tamkin, Jared Kaplan, Buck Shlegeris, Samuel R. Bowman, Ethan Perez, Evan Hubinger

专题命中 其他安全 :harmlessness(abstract);分类 cs.CL、cs.AI

Comments Make it easier to find samples from the model, and highlight that our operational definition of reward tampering has false positives where the model attempts to complete the task honestly but edits the reward. Add paragraph to conclusion to this effect, and add sentence to figure 1 to this effect

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01273 2024-07-02 cs.LG cs.CL stat.ME 62%

TWIN-GPT: Digital Twins for Clinical Trials via Large Language Model

Yue Wang, Tianfan Fu, Yinlong Xu, Zihan Ma, Hongxia Xu, Yingzhou Lu, Bang Du, Honghao Gao, Jian Wu

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19853 2024-07-01 cs.CL cs.AI 62%

YuLan: An Open-source Large Language Model

Yutao Zhu, Kun Zhou, Kelong Mao, Wentong Chen, Yiding Sun, Zhipeng Chen, Qian Cao, Yihan Wu, Yushuo Chen, Feng Wang, Lei Zhang, Junyi Li, Xiaolei Wang, Lei Wang, Beichen Zhang, Zican Dong, Xiaoxue Cheng, Yuhan Chen, Xinyu Tang, Yupeng Hou, Qiangqiang Ren, Xincheng Pang, Shufang Xie, Wayne Xin Zhao, Zhicheng Dou, Jiaxin Mao, Yankai Lin, Ruihua Song, Jun Xu, Xu Chen, Rui Yan, Zhewei Wei, Di Hu, Wenbing Huang, Ze-Feng Gao, Yueguo Chen, Weizheng Lu, Ji-Rong Wen

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02706 2024-06-27 cs.AI cs.CL 62%

Large Knowledge Model: Perspectives and Challenges

Huajun Chen

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

Comments Data Intelligence, Published: Jun 18, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17706 2024-06-26 cs.LG cs.CL cs.DC 62%

FedBiOT: LLM Local Fine-tuning in Federated Learning without Full Model

Feijie Wu, Zitao Li, Yaliang Li, Bolin Ding, Jing Gao

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

Comments KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16512 2024-06-26 cs.CL cs.AI 62%

LLMs Are Few-Shot In-Context Low-Resource Language Learners

Samuel Cahyawijaya, Holy Lovenia, Pascale Fung

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14280 2024-06-25 cs.CL cs.AI 62%

RomanSetu: Efficiently unlocking multilingual capabilities of Large Language Models via Romanization

Jaavid Aktar Husain, Raj Dabre, Aswanth Kumar, Jay Gala, Thanmay Jayakumar, Ratish Puduppully, Anoop Kunchukuttan

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13160 2024-06-25 cs.LG cs.AI cs.CV 62%

How to train your VAE

Mariano Rivera

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13898 2024-06-21 cs.CV cs.CL cs.CY 62%

The Use of Multimodal Large Language Models to Detect Objects from Thermal Images: Transportation Applications

Huthaifa I. Ashqar, Taqwa I. Alhadidi, Mohammed Elhenawy, Nour O. Khanfar

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13133 2024-06-21 cs.CL cs.LG q-bio.GN 62%

PathoLM: Identifying pathogenicity from the DNA sequence through the Genome Foundation Model

Sajib Acharjee Dip, Uddip Acharjee Shuvo, Tran Chau, Haoqiu Song, Petra Choi, Xuan Wang, Liqing Zhang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11736 2024-06-18 cs.CL cs.AI 62%

Interactive Evolution: A Neural-Symbolic Self-Training Framework For Large Language Models

Fangzhi Xu, Qiushi Sun, Kanzhi Cheng, Jun Liu, Yu Qiao, Zhiyong Wu

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11249 2024-06-18 cs.AI cs.LG 62%

Relational Learning in Pre-Trained Models: A Theory from Hypergraph Recovery Perspective

Yang Chen, Cong Fang, Zhouchen Lin, Bing Liu

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11069 2024-06-18 cs.CV cs.AI cs.CL 62%

WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences

Yujie Lu, Dongfu Jiang, Wenhu Chen, William Yang Wang, Yejin Choi, Bill Yuchen Lin

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

Comments link: https://hf.co/spaces/WildVision/vision-arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10961 2024-06-18 cs.CV cs.AI cs.CY 62%

Open-Vocabulary X-ray Prohibited Item Detection via Fine-tuning CLIP

Shuyang Lin, Tong Jia, Hao Wang, Bowen Ma, Mingyuan Li, Dongyue Chen

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04371 2024-06-18 cs.CL cs.AI 62%

Phased Instruction Fine-Tuning for Large Language Models

Wei Pang, Chuan Zhou, Xiao-Hua Zhou, Xiaojie Wang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

Comments The final version, to be appear at ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11684 2024-06-18 cs.CL cs.AI 62%

ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models

Guiming Hardy Chen, Shunian Chen, Ruifei Zhang, Junying Chen, Xiangbo Wu, Zhiyi Zhang, Zhihong Chen, Jianquan Li, Xiang Wan, Benyou Wang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04664 2024-06-18 cs.CL cs.LG eess.AS q-bio.NC 62%

Speech language models lack important brain-relevant semantics

Subba Reddy Oota, Emin Çelik, Fatma Deniz, Mariya Toneva

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

Comments 26 pages, 20 figures, The 62nd Annual Meeting of the Association for Computational Linguistics, Long paper - Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10297 2024-06-18 cs.CL cs.AI 62%

SememeLM: A Sememe Knowledge Enhanced Method for Long-tail Relation Representation

Shuyi Li, Shaojuan Wu, Xiaowang Zhang, Zhiyong Feng

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17053 2024-06-18 cs.NI cs.AI cs.LG 62%

WirelessLLM: Empowering Large Language Models Towards Wireless Intelligence

Jiawei Shao, Jingwen Tong, Qiong Wu, Wei Guo, Zijian Li, Zehong Lin, Jun Zhang

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06624 2024-06-17 cs.LG cs.CY 62%

Exploring the Determinants of Pedestrian Crash Severity Using an AutoML Approach

Amir Rafe, Patrick A. Singleton

专题命中 其他安全 :safety(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14492 2024-06-17 cs.CL cs.AI 62%

Towards Robust Instruction Tuning on Multimodal Large Language Models

Wei Han, Hui Chen, Soujanya Poria

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏