arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9331 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9331 篇

2502.16880 2025-05-27 cs.CL cs.AI cs.LG 67%

CORAL: Learning Consistent Representations across Multi-step Training with Lighter Speculative Drafter

Yepeng Weng, Dianwen Mei, Huishi Qiu, Xujie Chen, Li Liu, Jiang Tian, Zhongchao Shi

机构 * AI Lab, Lenovo Research(联想研究院人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02539 2025-05-27 cs.CV cs.AI cs.CL cs.LG 67%

Parrot: Multilingual Visual Instruction Tuning

Hai-Long Sun, Da-Wei Zhou, Yang Li, Shiyin Lu, Chao Yi, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, De-Chuan Zhan, Han-Jia Ye

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICML 2025. Code and dataset are available at: https://github.com/AIDC-AI/Parrot

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18464 2025-05-27 cs.HC cs.AI cs.CL cs.CY 67%

From Reddit to Generative AI: Evaluating Large Language Models for Anxiety Support Fine-tuned on Social Media Data

Ugur Kursuncu, Trilok Padhi, Gaurav Sinha, Abdulkadir Erol, Jaya Krishna Mandivarapu, Christopher R. Larrison

机构 * Georgia State University(佐治亚州立大学) University of Georgia(佐治亚大学) Microsoft(微软) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15477 2025-05-22 cs.CV 67%

MediConfusion: Can you trust your AI radiologist? Probing the reliability of multimodal medical foundation models

Mohammad Shahab Sepehri, Zalan Fabian, Maryam Soltanolkotabi, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering, University of Southern California(电气与计算机工程系,南加州大学) Department of Radiology and Imaging Sciences, University of Utah(放射学与影像科学系,犹他大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

Comments 24 Pages, 9 figures, The Thirteenth International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11200 2025-05-19 cs.SD cs.AI cs.CL cs.HC cs.LG eess.AS 67%

Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese

Xihuai Wang, Ziyi Zhao, Siyu Ren, Shao Zhang, Song Li, Xiaoyu Li, Ziwen Wang, Lin Qiu, Guanglu Wan, Xuezhi Cao, Xunliang Cai, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10257 2025-05-16 cs.CV 67%

Sage Deer: A Super-Aligned Driving Generalist Is Your Copilot

Hao Lu, Jiaqi Tang, Jiyao Wang, Yunfan LU, Xu Cao, Qingyong Hu, Yin Wang, Yuting Zhang, Tianxin Xie, Yunpeng Zhang, Yong Chen, Jiayu. Gao, Bin Huang, Dengbo He, Shuiguang Deng, Hao Chen, Ying-Cong Chen

专题命中 安全评测 :alignment(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08818 2025-05-15 cs.CY cs.AI cs.LG 67%

Position: Restructuring of Categories and Implementation of Guidelines Essential for VLM Adoption in Healthcare

Amara Tariq, Rimita Lahiri, Charles Kahn, Imon Banerjee

机构 * Amara Tariq, Ph.D(博士) Rimita Lahiri, Ph.D(博士) Charles Kahn, M.D(医学博士) Imon Banerjee, Ph.D(博士)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 15 pages, 2, tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06246 2025-05-13 cs.CY cs.AI cs.LG stat.AP 67%

United States Road Accident Prediction using Random Forest Predictor

Dominic Parosh Yamarthi, Haripriya Raman, Shamsad Parvin

机构 * Computer Science and Engineering University at Buffalo(计算机科学与工程大学布法罗分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 5 Pages, 8 Figures

Journal ref IEEE Access (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18086 2025-05-02 cs.RO cs.AI cs.CL cs.GR cs.LG 67%

Generating Traffic Scenarios via In-Context Learning to Learn Better Motion Planner

Aizierjiang Aiersilan

机构 * Aizierjiang Aiersilan(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments We are excited to announce that this paper has been accepted for oral presentation at the AAAI 2025 Main Conference. We are grateful for the insightful feedback from the reviewers and look forward to contributing to the discussions at AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20769 2025-04-30 cs.CL cs.AI cs.LG 67%

Chain-of-Defensive-Thought: Structured Reasoning Elicits Robustness in Large Language Models against Reference Corruption

Wenxiao Wang, Parsa Hosseini, Soheil Feizi

机构 * Department of Computer Science, University of Maryland, College Park, Maryland, USA(计算机科学系,马里兰大学,College Park,马里兰,美国)

专题命中 安全评测 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13261 2025-04-21 cs.CL cs.AI cs.CY cs.HC cs.SI 67%

CPG-EVAL: A Multi-Tiered Benchmark for Evaluating the Chinese Pedagogical Grammar Competence of Large Language Models

Dong Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 12 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13216 2025-04-21 cs.CL cs.AI cs.LG 67%

KFinEval-Pilot: A Comprehensive Benchmark Suite for Korean Financial Language Understanding

Bokwang Hwang, Seonkyu Lim, Taewoong Kim, Yongjae Geun, Sunghyun Bang, Sohyun Park, Jihyun Park, Myeonggyu Lee, Jinwoo Lee, Yerin Kim, Jinsun Yoo, Jingyeong Hong, Jina Park, Yongchan Kim, Suhyun Kim, Younggyun Hahm, Yiseul Lee, Yejee Kang, Chanhyuk Yoon, Chansu Lee, Heeyewon Jeong, Jiyeon Lee, Seonhye Gu, Hyebin Kang, Yousang Cho, Hangyeol Yoo, KyungTae Lim

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10738 2025-04-16 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

CleanMAP: Distilling Multimodal LLMs for Confidence-Driven Crowdsourced HD Map Updates

Ankit Kumar Shaw, Kun Jiang, Tuopu Wen, Chandan Kumar Sah, Yining Shi, Mengmeng Yang, Diange Yang, Xiaoli Lian

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Kun Jiang, Mengmeng Yang and Diange Yang are Corresponding Author. The main paper and supplementary material are both included here, total 23 pages (main paper is 10 pages and supplementary material is 13 pages), total 17 figures (6 figures in main paper and 11 figures in supplementary material), this paper is Accepted to CVPR WDFM-AD Workshop 2025, The code will be available at https://Ankit-Zefan.github.io/CleanMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08281 2025-04-14 cs.CL cs.AI cs.LG 67%

ELSA: A Style Aligned Dataset for Emotionally Intelligent Language Generation

Vishal Gandhi, Sagar Gandhi

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07174 2025-04-11 cs.CL cs.AI cs.LG 67%

HypoEval: Hypothesis-Guided Evaluation for Natural Language Generation

Mingxuan Li, Hanchen Li, Chenhao Tan

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages, 3 figures, code link: https://github.com/ChicagoHAI/HypoEval-Gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10144 2025-04-09 cs.CL cs.AI cs.LG cs.LO cs.PL 67%

NLP Verification: Towards a General Methodology for Certifying Robustness

Marco Casadio, Tanvi Dinkar, Ekaterina Komendantskaya, Luca Arnaboldi, Matthew L. Daggitt, Omri Isac, Guy Katz, Verena Rieser, Oliver Lemon

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04373 2025-04-08 cs.CL cs.AI cs.LG 67%

StyleRec: A Benchmark Dataset for Prompt Recovery in Writing Style Transformation

Shenyang Liu, Yang Gao, Shaoyan Zhai, Liqiang Wang

专题命中 安全评测 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 2024 IEEE International Conference on Big Data (BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12784 2025-04-08 cs.AI cs.CL cs.LG 67%

JudgeBench: A Benchmark for Evaluating LLM-based Judges

Sijun Tan, Siyuan Zhuang, Kyle Montgomery, William Y. Tang, Alejandro Cuadron, Chenguang Wang, Raluca Ada Popa, Ion Stoica

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00398 2025-04-04 cs.SD cs.AI cs.CL cs.LG eess.AS 67%

TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification

Nishit Anand, Ashish Seth, Ramani Duraiswami, Dinesh Manocha

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to SALMA Workshop ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00882 2025-04-02 cs.DB cs.AI cs.CL cs.IR cs.LG 67%

CrackSQL: A Hybrid SQL Dialect Translation System Powered by Large Language Models

Wei Zhou, Yuyang Gao, Xuanhe Zhou, Guoliang Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Extension of our SIGMOD 2025 paper. Please refer to source code available at: https://github.com/weAIDB/CrackSQL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08814 2025-03-31 cs.AI cs.CL cs.CY 67%

SAIF: A Comprehensive Framework for Evaluating the Risks of Generative AI in the Public Sector

Kyeongryul Lee, Heehyeon Kim, Joyce Jiyoung Whang

专题命中 安全评测 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 6 pages, 2 figures, 1 tables. AI for Public Missions (AIPM) Workshop at the 39th AAAI Conference on Artificial Intelligence (AAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10661 2025-03-25 cs.CV 67%

CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models

Xiangyu Yin, Jiaxu Liu, Zhen Chen, Jinwei Hu, Yi Dong, Xiaowei Huang, Wenjie Ruan

专题命中 安全评测 :jailbreak(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11355 2025-03-25 cs.CL cs.AI cs.CR cs.CY 67%

Nuclear Deployed: Analyzing Catastrophic Risks in Decision-making of Autonomous LLM Agents

Rongwu Xu, Xiaojian Li, Shuo Chen, Wei Xu

专题命中 安全评测 :harmlessness(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Please visit https://llm-catastrophic-risks.github.io for a quick tour of our research. Our code is available at https://github.com/pillowsofwind/LLM-CBRN-Risks

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17085 2025-03-24 cs.LG cs.AI cs.CY cs.HC 67%

Deterministic AI Agent Personality Expression through Standard Psychological Diagnostics

J. M. Diederik Kruijssen, Nicholas Emmons

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 25 pages, 8 figures, 4 tables; appeared in ADI (March 2025)

Journal ref ADI 2, 15-39 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16566 2025-03-24 cs.CV 67%

REVAL: A Comprehension Evaluation on Reliability and Values of Large Vision-Language Models

Jie Zhang, Zheng Yuan, Zhongqi Wang, Bei Yan, Sibo Wang, Xiangkui Cao, Zonghui Guo, Shiguang Shan, Xilin Chen

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

Comments 45 pages, 5 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16416 2025-03-21 cs.AI cs.CL cs.LG 67%

Survey on Evaluation of LLM-based Agents

Asaf Yehudai, Lilach Eden, Alan Li, Guy Uziel, Yilun Zhao, Roy Bar-Haim, Arman Cohan, Michal Shmueli-Scheuer

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15521 2025-03-21 cs.HC cs.AI cs.CL cs.CY 67%

From Divergence to Consensus: Evaluating the Role of Large Language Models in Facilitating Agreement through Adaptive Strategies

Loukas Triantafyllopoulos, Dimitris Kalles

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 32 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13335 2025-03-18 cs.CL cs.AI cs.LG stat.AP 67%

Reliable and Efficient Amortized Model-based Evaluation

Sang Truong, Yuheng Tu, Percy Liang, Bo Li, Sanmi Koyejo

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05788 2025-03-17 cs.LG cs.AI cs.CL 67%

Emergent Abilities in Large Language Models: A Survey

Leonardo Berti, Flavio Giorgi, Gjergji Kasneci

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04828 2025-03-10 cs.CL cs.AI cs.LG 67%

Beyond Next Word Prediction: Developing Comprehensive Evaluation Frameworks for measuring LLM performance on real world applications

Vishakha Agrawal, Archie Chaudhury, Shreya Agrawal

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏