arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2505.22967 2025-05-30 cs.LG cs.MA 79%

MermaidFlow: Redefining Agentic Workflow Generation via Safety-Constrained Evolutionary Programming

Chengqi Zheng, Jianda Chen, Yueming Lyu, Wen Zheng Terence Ng, Haopeng Zhang, Yew-Soon Ong, Ivor Tsang, Haiyan Yin

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21828 2025-05-29 cs.AI 79%

SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts

Chen Yueh-Han, Guy Davidson, Brenden M. Lake

机构 * New York Univeristy(纽约大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20824 2025-05-28 cs.MA cs.AI 79%

MedSentry: Understanding and Mitigating Safety Risks in Medical LLM Multi-Agent Systems

Kai Chen, Taihang Zhen, Hewei Wang, Kailai Liu, Xinfeng Li, Jing Huo, Tianpei Yang, Jinfeng Xu, Wei Dong, Yang Gao

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19933 2025-05-27 cs.AI 79%

Subtle Risks, Critical Failures: A Framework for Diagnosing Physical Safety of LLMs for Embodied Decision Making

Yejin Son, Minseo Kim, Sungwoong Kim, Seungju Han, Jian Kim, Dongju Jang, Youngjae Yu, Chanyoung Park

机构 * Yonsei University(延世大学) Stanford University(斯坦福大学) University of Washington, Seattle WA(华盛顿大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments 37 pages, 13 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19502 2025-05-27 cs.SE cs.AI 79%

CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation

Guang Yang, Yu Zhou, Xiang Chen, Wei Zheng, Xing Hu, Xin Zhou, David Lo, Taolue Chen

机构 * College of Computer Science and Technology(计算机科学与技术学院) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) School of Software(软件学院) School of Software Technology(软件技术学院) School of Computing and Information Systems(计算与信息系统学院) School of Computing and Mathematical Sciences(计算与数学科学学院)

专题命中 安全评测 :alignment(title);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12464 2025-05-23 cs.CL 79%

SafeRoute: Adaptive Model Selection for Efficient and Accurate Safety Guardrails in Large Language Models

Seanie Lee, Dong Bok Lee, Dominik Wagner, Minki Kang, Haebin Seong, Tobias Bocklet, Juho Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) Technische Hochschule Nürnberg Georg Simon Ohm(图林根工业大学诺伊堡分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments ACL 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14470 2025-05-21 cs.CL 79%

Agent-SafetyBench: Evaluating the Safety of LLM Agents

Zhexin Zhang, Shiyao Cui, Yida Lu, Jingzhuo Zhou, Junxiao Yang, Hongning Wang, Minlie Huang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12762 2025-05-20 cs.AI 79%

IDEAL: Data Equilibrium Adaptation for Multi-Capability Language Model Alignment

Chenlin Ming, Chendi Qu, Mengzhang Cai, Qizhi Pei, Zhuoshi Pan, Yu Li, Xiaoming Duan, Lijun Wu, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08844 2025-05-15 q-bio.GN cs.AI 79%

CellTypeAgent: Trustworthy cell type annotation with Large Language Models

Jiawen Chen, Jianghao Zhang, Huaxiu Yao, Yun Li

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07772 2025-05-13 cs.CY 79%

The Value of Disagreement in AI Design, Evaluation, and Alignment

Sina Fazelpour, Will Fleisher

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

Comments Accepted to ACM Conference on Fairness, Accountability, and Transparency (FAccT) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04251 2025-05-08 cs.SE cs.AI cs.MA 79%

Facilitating Trustworthy Human-Agent Collaboration in LLM-based Multi-Agent System oriented Software Engineering

Krishna Ronanki

机构 * Chalmers University of Technology — University of Gothenburg(查尔姆斯理工大学——戈尔达堡大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03196 2025-05-07 cs.NI cs.AI 79%

A Trustworthy Multi-LLM Network: Challenges,Solutions, and A Use Case

Haoxiang Luo, Gang Sun, Yinqiu Liu, Dusit Niyato, Hongfang Yu, Mohammed Atiquzzaman, Schahram Dustdar

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) University of Oklahoma(俄克拉荷马大学) TU Wien(维也纳技术大学) Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02056 2025-05-06 cs.CV cs.LG 79%

Handling Imbalanced Pseudolabels for Vision-Language Models with Concept Alignment and Confusion-Aware Calibrated Margin

Yuchen Wang, Xuefeng Bai, Xiucheng Li, Weili Guan, Liqiang Nie, Xinyang Chen

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00843 2025-05-05 cs.CR cs.AI 79%

OET: Optimization-based prompt injection Evaluation Toolkit

Jinsheng Pan, Xiaogeng Liu, Chaowei Xiao

机构 * University of Rochester(罗切斯特大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 安全评测 :prompt injection(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00515 2025-05-02 cs.RO cs.AI cs.MA 79%

Safety-Critical Traffic Simulation with Guided Latent Diffusion Model

Mingxing Peng, Ruoyu Yao, Xusen Guo, Yuting Xie, Xianda Chen, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) School of Computer Science and Engineering(计算机科学与工程学院) Sun Yat-sen University(中山大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16134 2025-04-24 cs.CV cs.CL 79%

Multimodal Large Language Models for Enhanced Traffic Safety: A Comprehensive Review and Future Trends

Mohammad Abu Tami, Mohammed Elhenawy, Huthaifa I. Ashqar

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14526 2025-04-22 cs.CV cs.CL 79%

Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding

Tong Zeng, Longfeng Wu, Liang Shi, Dawei Zhou, Feng Guo

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系) Virginia Tech Transportation Institute, Virginia Tech(弗吉尼亚理工学院交通研究所) Department of Statistics, Virginia Tech(弗吉尼亚理工学院统计学系)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18491 2025-04-15 cs.CL 79%

ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models

Hengxiang Zhang, Hongfu Gao, Qiang Hu, Guanhua Chen, Lili Yang, Bingyi Jing, Hongxin Wei, Bing Wang, Haifeng Bai, Lei Yang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00615 2025-04-14 cs.AI 79%

Towards Responsible and Trustworthy Educational Data Mining: Comparing Symbolic, Sub-Symbolic, and Neural-Symbolic AI Methods

Danial Hooshyar, Eve Kikas, Yeongwook Yang, Gustav Šír, Raija Hämäläinen, Tommi Kärkkäinen, Roger Azevedo

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07022 2025-04-10 cs.CL 79%

Evaluating Retrieval Augmented Generative Models for Document Queries in Transportation Safety

Chad Melton, Alex Sorokine, Steve Peterson

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments 14 pages, 3 Figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08688 2025-04-10 cs.CY 79%

Randomness, Not Representation: The Unreliability of Evaluating Cultural Alignment in LLMs

Ariba Khan, Stephen Casper, Dylan Hadfield-Menell

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06277 2025-04-10 cs.IR cs.AI 79%

Dynamic Evaluation Framework for Personalized and Trustworthy Agents: A Multi-Session Approach to Preference Adaptability

Chirag Shah, Hideo Joho, Kirandeep Kaur, Preetam Prabhu Srikar Dammu

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03906 2025-04-08 cs.CL 79%

CliME: Evaluating Multimodal Climate Discourse on Social Media and the Climate Alignment Quotient (CAQ)

Abhilekh Borah, Hasnat Md Abdullah, Kangda Wei, Ruihong Huang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19852 2025-04-07 cs.AI 79%

AI Alignment: A Comprehensive Survey

Jiaming Ji, Tianyi Qiu, Boyuan Chen, Borong Zhang, Hantao Lou, Kaile Wang, Yawen Duan, Zhonghao He, Lukas Vierling, Donghai Hong, Jiayi Zhou, Zhaowei Zhang, Fanzhi Zeng, Juntao Dai, Xuehai Pan, Kwan Yee Ng, Aidan O'Gara, Hua Xu, Brian Tse, Jie Fu, Stephen McAleer, Yaodong Yang, Yizhou Wang, Song-Chun Zhu, Yike Guo, Wen Gao

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments Continually updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12909 2025-04-03 cs.LG physics.comp-ph 79%

Scalable Training of Trustworthy and Energy-Efficient Predictive Graph Foundation Models for Atomistic Materials Modeling: A Case Study with HydraGNN

Massimiliano Lupo Pasini, Jong Youl Choi, Kshitij Mehta, Pei Zhang, David Rogers, Jonghyun Bae, Khaled Z. Ibrahim, Ashwin M. Aji, Karl W. Schulz, Jorda Polo, Prasanna Balaprakash

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

Comments 51 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19598 2025-03-26 cs.CL 79%

The Greatest Good Benchmark: Measuring LLMs' Alignment with Utilitarian Moral Dilemmas

Giovanni Franco Gabriel Marraffini, Andrés Cotton, Noe Fabian Hsueh, Axel Fridman, Juan Wisznia, Luciano Del Corro

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03766 2025-03-26 cs.CL 79%

Hierarchical Contextual Manifold Alignment for Structuring Latent Representations in Large Language Models

Meiquan Dong, Haoran Liu, Yan Huang, Zixuan Feng, Jianhong Tang, Ruoxi Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18817 2025-03-25 cs.CV cs.AI 79%

Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations

Jeonghyeon Kim, Sangheum Hwang

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15707 2025-03-21 cs.RO cs.AI 79%

Safety Aware Task Planning via Large Language Models in Robotics

Azal Ahmad Khan, Michael Andrev, Muhammad Ali Murtaza, Sergio Aguilera, Rui Zhang, Jie Ding, Seth Hutchinson, Ali Anwar

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14672 2025-03-20 cs.CV cs.AI 79%

FiVL: A Framework for Improved Vision-Language Alignment through the Lens of Training, Evaluation and Explainability

Estelle Aflalo, Gabriela Ben Melech Stan, Tiep Le, Man Luo, Shachar Rosenman, Sayak Paul, Shao-Yen Tseng, Vasudev Lal

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏