arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9331 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9331 篇

2405.03162 2024-05-07 cs.CV cs.AI cs.CL cs.LG 67%

Advancing Multimodal Medical Capabilities of Gemini

Lin Yang, Shawn Xu, Andrew Sellergren, Timo Kohlberger, Yuchen Zhou, Ira Ktena, Atilla Kiraly, Faruk Ahmed, Farhad Hormozdiari, Tiam Jaroensri, Eric Wang, Ellery Wulczyn, Fayaz Jamil, Theo Guidroz, Chuck Lau, Siyuan Qiao, Yun Liu, Akshay Goel, Kendall Park, Arnav Agharwal, Nick George, Yang Wang, Ryutaro Tanno, David G. T. Barrett, Wei-Hung Weng, S. Sara Mahdavi, Khaled Saab, Tao Tu, Sreenivasa Raju Kalidindi, Mozziyar Etemadi, Jorge Cuadros, Gregory Sorensen, Yossi Matias, Katherine Chou, Greg Corrado, Joelle Barral, Shravya Shetty, David Fleet, S. M. Ali Eslami, Daniel Tse, Shruthi Prabhakara, Cory McLean, Dave Steiner, Rory Pilgrim, Christopher Kelly, Shekoofeh Azizi, Daniel Golden

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01565 2024-05-06 cs.SE 67%

The Role of Code Proficiency in the Era of Generative AI

Gregorio Robles, Christoph Treude, Jesus M. Gonzalez-Barahona, Raula Gaikovina Kula

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

Comments submitted to Software Engineering 2030

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01413 2024-05-03 cs.CV cs.AI cs.CL cs.LG 67%

MiniGPT-3D: Efficiently Aligning 3D Point Clouds with Large Language Models using 2D Priors

Yuan Tang, Xu Han, Xianzhi Li, Qiao Yu, Yixue Hao, Long Hu, Min Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18416 2024-05-02 cs.AI cs.CL cs.CV cs.LG 67%

Capabilities of Gemini Models in Medicine

Khaled Saab, Tao Tu, Wei-Hung Weng, Ryutaro Tanno, David Stutz, Ellery Wulczyn, Fan Zhang, Tim Strother, Chunjong Park, Elahe Vedadi, Juanma Zambrano Chaves, Szu-Yeu Hu, Mike Schaekermann, Aishwarya Kamath, Yong Cheng, David G. T. Barrett, Cathy Cheung, Basil Mustafa, Anil Palepu, Daniel McDuff, Le Hou, Tomer Golany, Luyang Liu, Jean-baptiste Alayrac, Neil Houlsby, Nenad Tomasev, Jan Freyberg, Charles Lau, Jonas Kemp, Jeremy Lai, Shekoofeh Azizi, Kimberly Kanada, SiWai Man, Kavita Kulkarni, Ruoxi Sun, Siamak Shakeri, Luheng He, Ben Caine, Albert Webson, Natasha Latysheva, Melvin Johnson, Philip Mansfield, Jian Lu, Ehud Rivlin, Jesper Anderson, Bradley Green, Renee Wong, Jonathan Krause, Jonathon Shlens, Ewa Dominowska, S. M. Ali Eslami, Katherine Chou, Claire Cui, Oriol Vinyals, Koray Kavukcuoglu, James Manyika, Jeff Dean, Demis Hassabis, Yossi Matias, Dale Webster, Joelle Barral, Greg Corrado, Christopher Semturs, S. Sara Mahdavi, Juraj Gottweis, Alan Karthikesalingam, Vivek Natarajan

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17120 2024-04-30 cs.CL cs.AI cs.LG 67%

Talking Nonsense: Probing Large Language Models' Understanding of Adversarial Gibberish Inputs

Valeriia Cherepanova, James Zou

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06579 2024-04-11 cs.CL cs.AI cs.LG 67%

Less is More for Improving Automatic Evaluation of Factual Consistency

Tong Wang, Ninad Kulkarni, Yanjun Qi

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted in NAACL24 Industry; 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06224 2024-04-10 cs.CL cs.AI cs.LG 67%

Low-Cost Generation and Evaluation of Dictionary Example Sentences

Bill Cai, Clarence Boon Liang Ng, Daniel Tan, Shelvia Hotama

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14652 2024-03-25 cs.CY cs.AI cs.CL cs.MM 67%

MemeCraft: Contextual and Stance-Driven Multimodal Meme Generation

Han Wang, Roy Ka-Wei Lee

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 8 pages, 7 figures, ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14641 2024-03-25 cs.CY cs.AI cs.LG 67%

Testing autonomous vehicles and AI: perspectives and challenges from cybersecurity, transparency, robustness and fairness

David Fernández Llorca, Ronan Hamon, Henrik Junklewitz, Kathrin Grosse, Lars Kunze, Patrick Seiniger, Robert Swaim, Nick Reed, Alexandre Alahi, Emilia Gómez, Ignacio Sánchez, Akos Kriston

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 44 pages, 8 figures, submitted to a peer-review journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10499 2024-03-18 cs.LG cs.AI cs.CL cs.CV 67%

Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study

Chenguang Wang, Ruoxi Jia, Xin Liu, Dawn Song

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05606 2024-03-12 cs.LG cs.AI cs.CL cs.CV 67%

A Concept-based Interpretable Model for the Diagnosis of Choroid Neoplasias using Multimodal Data

Yifan Wu, Yang Liu, Yue Yang, Michael S. Yao, Wenli Yang, Xuehui Shi, Lihong Yang, Dongjun Li, Yueming Liu, James C. Gee, Xuan Yang, Wenbin Wei, Shi Gu

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03067 2024-03-12 cs.AI cs.CL cs.LG cs.LO 67%

DeepOnto: A Python Package for Ontology Engineering with Deep Learning

Yuan He, Jiaoyan Chen, Hang Dong, Ian Horrocks, Carlo Allocca, Taehun Kim, Brahmananda Sapkota

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by the Semantic Web Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17588 2024-02-28 cs.CL cs.AI cs.LG 67%

Diagnosing Transformers: Illuminating Feature Spaces for Clinical Decision-Making

Aliyah R. Hsu, Yeshwanth Cherapanamjeri, Briton Park, Tristan Naumann, Anobel Y. Odisho, Bin Yu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09939 2024-02-16 cs.AI cs.CL cs.HC cs.IR cs.LG 67%

Generative AI in the Construction Industry: A State-of-the-art Analysis

Ridwan Taiwo, Idris Temitope Bello, Sulemana Fatoama Abdulai, Abdul-Mugis Yussif, Babatunde Abiodun Salami, Abdullahi Saka, Tarek Zayed

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 74 pages, 11 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01748 2024-02-08 cs.NI cs.AI cs.CL cs.LG 67%

Large Multi-Modal Models (LMMs) as Universal Foundation Models for AI-Native Wireless Systems

Shengzhe Xu, Christo Kurisummoottil Thomas, Omar Hashash, Nikhil Muralidhar, Walid Saad, Naren Ramakrishnan

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15812 2024-02-07 cs.LG cs.AI cs.CL 67%

Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models

Hritik Bansal, John Dang, Aditya Grover

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 31 pages, Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02513 2024-02-06 cs.LG cs.AI cs.CL cs.NE 67%

Early stopping by correlating online indicators in neural networks

Manuel Vilares Ferro, Yerai Doval Mosquera, Francisco J. Ribadas Pena, Victor M. Darriba Bilbao

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 26 pages, 6 figures

Journal ref Neural Networks, 159 (2023), pp 109-124. ISSN 1879-2782. Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17268 2024-01-31 cs.CL cs.AI cs.LG 67%

Weaver: Foundation Models for Creative Writing

Tiannan Wang, Jiamin Chen, Qingrui Jia, Shuai Wang, Ruoyu Fang, Huilin Wang, Zhaowei Gao, Chunzhao Xie, Chuou Xu, Jihong Dai, Yibin Liu, Jialong Wu, Shengwei Ding, Long Li, Zhiwei Huang, Xinle Deng, Teng Yu, Gangan Ma, Han Xiao, Zixin Chen, Danjun Xiang, Yunxia Wang, Yuanyuan Zhu, Yi Xiao, Jing Wang, Yiru Wang, Siran Ding, Jiayang Huang, Jiayi Xu, Yilihamu Tayier, Zhenyu Hu, Yuan Gao, Chengfeng Zheng, Yueshu Ye, Yihang Li, Lei Wan, Xinyue Jiang, Yujie Wang, Siyu Cheng, Zhule Song, Xiangru Tang, Xiaohua Xu, Ningyu Zhang, Huajun Chen, Yuchen Eleanor Jiang, Wangchunshu Zhou

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13086 2024-01-25 cs.CL cs.AI cs.LG 67%

Towards Trustable Language Models: Investigating Information Quality of Large Language Models

Rick Rejeleene, Xiaowei Xu, John Talburt

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11970 2023-12-20 cs.AI cs.CL cs.CY cs.MA 67%

Large Language Models Empowered Agent-based Modeling and Simulation: A Survey and Perspectives

Chen Gao, Xiaochong Lan, Nian Li, Yuan Yuan, Jingtao Ding, Zhilun Zhou, Fengli Xu, Yong Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10524 2023-12-19 cs.SE 67%

Comprehensive Evaluation of ChatGPT Reliability Through Multilingual Inquiries

Poorna Chander Reddy Puttaparthi, Soham Sanjay Deo, Hakan Gul, Yiming Tang, Weiyi Shang, Zhe Yu

专题命中 安全评测 :jailbreak(abstract);prompt injection(abstract)

Comments 10 pages, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01564 2023-12-05 cs.LG cs.AI cs.CL cs.CV 67%

APoLLo: Unified Adapter and Prompt Learning for Vision Language Models

Sanjoy Chowdhury, Sayan Nag, Dinesh Manocha

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2023 (Main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01837 2023-11-29 cs.CV cs.AI cs.CL cs.LG 67%

Extending CAM-based XAI methods for Remote Sensing Imagery Segmentation

Abdul Karim Gizzini, Mustafa Shukor, Ali J. Ghandour

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07575 2023-11-14 cs.CV cs.AI cs.CL cs.LG 67%

SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models

Ziyi Lin, Chris Liu, Renrui Zhang, Peng Gao, Longtian Qiu, Han Xiao, Han Qiu, Chen Lin, Wenqi Shao, Keqin Chen, Jiaming Han, Siyuan Huang, Yichi Zhang, Xuming He, Hongsheng Li, Yu Qiao

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress. Code and demos are released at https://github.com/Alpha-VLLM/LLaMA2-Accessory

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01918 2023-11-06 cs.CL cs.AI cs.LG 67%

Large Language Models Illuminate a Progressive Pathway to Artificial Healthcare Assistant: A Review

Mingze Yuan, Peng Bao, Jiajia Yuan, Yunhao Shen, Zifan Chen, Yi Xie, Jie Zhao, Yang Chen, Li Zhang, Lin Shen, Bin Dong

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 24 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13064 2023-09-27 q-fin.GN cs.AI cs.CL cs.LG 67%

InvestLM: A Large Language Model for Investment using Financial Domain Instruction Tuning

Yi Yang, Yixuan Tang, Kar Yan Tam

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Link: https://github.com/AbaciNLP/InvestLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13442 2023-09-26 cs.LG cs.AI cs.CY 67%

How Do Drivers Behave at Roundabouts in a Mixed Traffic? A Case Study Using Machine Learning

Farah Abu Hamad, Rama Hasiba, Deema Shahwan, Huthaifa I. Ashqar

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13243 2023-08-22 cs.LG cs.AI cs.CL cs.CV 67%

Toward Transparent AI: A Survey on Interpreting the Inner Structures of Deep Neural Networks

Tilman Räuker, Anson Ho, Stephen Casper, Dylan Hadfield-Menell

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02520 2023-07-18 cs.CL cs.AI cs.LG 67%

A Study of Situational Reasoning for Traffic Understanding

Jiarui Zhang, Filip Ilievski, Kaixin Ma, Aravinda Kollaa, Jonathan Francis, Alessandro Oltramari

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages, 6 figures, 5 tables, camera ready version of SIGKDD 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13000 2023-06-23 cs.CY cs.AI cs.CL 67%

Apolitical Intelligence? Auditing Delphi's responses on controversial political issues in the US

Jonathan H. Rystrøm

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏