arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2509.13569 2025-09-18 cs.CL 79%

Overview of Dialog System Evaluation Track: Dimensionality, Language, Culture and Safety at DSTC 12

John Mendonça, Lining Zhang, Rahul Mallidi, Alon Lavie, Isabel Trancoso, Luis Fernando D'Haro, João Sedoc

机构 * INESC-ID Instituto Superior Técnico - University of Lisbon(理工学院 - 里斯本大学) Department of Technology, Operations, and Statistics, New York University(技术、运营与统计系,纽约大学) Speech Technology and Machine Learning Group - Universidad Politécnica de Madrid(语音技术与机器学习小组 - 马德里理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments DSTC12 Track 1 Overview Paper. https://chateval.org/dstc12

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13244 2025-09-17 cs.CL 79%

Evaluating LLM Alignment on Personality Inference from Real-World Interview Data

Jianfeng Zhu, Julina Maharjan, Xinyu Li, Karin G. Coifman, Ruoming Jin

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09303 2025-09-12 cs.CL 79%

From scratch to silver: Creating trustworthy training data for patent-SDG classification using Large Language Models

Grazia Sveva Ascione, Nicolò Tamagnone

机构 * Department of Industrial Engineering, Polytechnic University of Turin(工业工程系,都灵理工学院) Venice School of Management, Ca Foscari University of Venice(威尼斯管理学院,威尼斯福斯卡里大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08839 2025-09-12 cs.CY 79%

Evaluating the Clinical Safety of LLMs in Response to High-Risk Mental Health Disclosures

Siddharth Shah, Amit Gupta, Aarav Mann, Alexandre Vaz, Benjamin E. Caldwell, Robert Scholz, Peter Awad, Rocky Allemandi, Doug Faust, Harshita Banka, Tony Rousmaniere

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

Comments Previously posted as a preprint on Research Square (DOI: 10.21203/rs.3.rs-7364128/v1), under a CC BY 4.0 License

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05838 2025-09-09 cs.CY 79%

Towards an Automated Framework to Audit Youth Safety on TikTok

Linda Xue, Francesco Corso, Nicolo' Fontana, Geng Liu, Stefano Ceri, Francesco Pierri

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

Comments 7 pages, 3 figures, submitted to EMNLP 2025 and ECAT Research Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08613 2025-09-08 cs.CL 79%

Assessing the Sensitivity and Alignment of FOL Closeness Metrics

Ramya Keerthy Thatikonda, Wray Buntine, Ehsan Shareghi

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,莫纳什大学) College of Engineering and Computer Science, VinUniversity(工程与计算机科学学院,文大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04536 2025-09-08 cs.LG math.QA math.ST stat.TH 79%

Q-SafeML: Safety Assessment of Quantum Machine Learning via Quantum Distance Metrics

Oliver Dunn, Koorosh Aslansefat, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17695 2025-09-04 cs.AI cs.NI 79%

Symbiotic Agents: A Novel Paradigm for Trustworthy AGI-driven Networks

Ilias Chatzistefanidis, Navid Nikaein

机构 * Eurecom(埃鲁埃康)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments Submitted to Computer Networks AI for 6G

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11419 2025-09-03 cs.CL 79%

InsBank: Evolving Instruction Subset for Ongoing Alignment

Jiayi Shi, Yiwei Li, Shaoxiong Feng, Peiwen Yuan, Xinglin Wang, Yueqi Zhang, Chuyi Tan, Boyuan Pan, Huan Ren, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(计算机科学学院,北京理工大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16427 2025-09-03 cs.AI 79%

HAICOSYSTEM: An Ecosystem for Sandboxing Safety Risks in Human-AI Interactions

Xuhui Zhou, Hyunwoo Kim, Faeze Brahman, Liwei Jiang, Hao Zhu, Ximing Lu, Frank Xu, Bill Yuchen Lin, Yejin Choi, Niloofar Mireshghallah, Ronan Le Bras, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Allen Institute for AI(人工智能研究院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments Both the second and third authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19096 2025-08-27 cs.AI 79%

Trustworthy Agents for Electronic Health Records through Confidence Estimation

Yongwoo Song, Minbyul Jeong, Mujeen Sung

机构 * Kyung Hee University(庆熙大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11398 2025-08-26 cs.HC cs.AI cs.IR 79%

Trustworthy AI Psychotherapy: Multi-Agent LLM Workflow for Counseling and Explainable Mental Disorder Diagnosis

Mithat Can Ozgun, Jiahuan Pei, Koen Hindriks, Lucia Donatelli, Qingzhi Liu, Junxiao Wang

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Wageningen University and Research(瓦赫宁根大学和研究中心) Guangzhou University(广州大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments This paper has been accepted by CIKM 2025 as a full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16157 2025-08-25 cs.CV cs.AI 79%

Beyond Human-prompting: Adaptive Prompt Tuning with Semantic Alignment for Anomaly Detection

Pi-Wei Chen, Jerry Chun-Wei Lin, Wei-Han Chen, Jia Ji, Zih-Ching Chen, Feng-Hao Yeh, Chao-Chun Chen

机构 * Silesian University of Technology(西里西亚技术大学) National Cheng Kung University(国立成功大学) Nvidia AI Technology Center(Nvidia AI技术中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15588 2025-08-22 cs.AI 79%

A Dynamical Systems Framework for Reinforcement Learning Safety and Robustness Verification

Ahmed Nasir, Abdelhafid Zenati

机构 * Engineering Department, School of Science and Technology (SST), City University of London(伦敦城市大学科学与技术学院工程系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15526 2025-08-22 cs.CL 79%

SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking

Xiangyang Zhu, Yuan Tian, Chunyi Li, Kaiwei Zhang, Wei Sun, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室) East China Normal University(东华大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments Code and dataset are available at https://github.com/yangyangyang127/SafetyFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14741 2025-08-21 cs.LG 79%

CaTE Data Curation for Trustworthy AI

Mary Versa Clemens-Sewall, Christopher Cervantes, Emma Rafkin, J. Neil Otte, Tom Magelinski, Libby Lewis, Michelle Liu, Dana Udwin, Monique Kirkman-Bey

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13787 2025-08-20 cs.MA cs.AI cs.NI 79%

BetaWeb: Towards a Blockchain-enabled Trustworthy Agentic Web

Zihan Guo, Yuanjian Zhou, Chenyi Wang, Linlin You, Minjie Bian, Weinan Zhang

机构 * Shanghai Innovation Institute(上海创新研究院) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Shanghai Data Group Co., Ltd(上海数据集团有限公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments A technical report with 21 pages, 3 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10872 2025-08-19 cs.CV cs.AI cs.ET 79%

V-RoAst: Visual Road Assessment. Can VLM be a Road Safety Assessor Using the iRAP Standard?

Natchapon Jongwiriyanurak, Zichao Zeng, June Moh Goo, Xinglei Wang, Ilya Ilyankou, Kerkritt Sriroongvikrai, Nicola Christie, Meihui Wang, Huanfa Chen, James Haworth

机构 * University College London(伦敦大学学院) Chulalongkorn University(朱拉隆梭大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11406 2025-08-18 cs.RO cs.AI 79%

Open, Reproducible and Trustworthy Robot-Based Experiments with Virtual Labs and Digital-Twin-Based Execution Tracing

Benjamin Alt, Mareike Picklum, Sorin Arion, Franklin Kenghagho Kenfack, Michael Beetz

机构 * AICOR Institute for Artificial Intelligence, University of Bremen(人工智能研究所,不莱梅大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments 8 pages, 6 figures, submitted to the 1st IROS Workshop on Embodied AI and Robotics for Future Scientific Discovery

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05148 2025-08-14 cs.RO cs.AI 79%

Chemist Eye: A Visual Language Model-Powered System for Safety Monitoring and Robot Decision-Making in Self-Driving Laboratories

Francisco Munguia-Galeano, Zhengxue Zhou, Satheeshkumar Veeramani, Hatem Fakhruldeen, Louis Longley, Rob Clowes, Andrew I. Cooper

机构 * Cooper Group, Department of Chemistry, University of Liverpool(Cooper集团,化学系,利物浦大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23486 2025-08-14 cs.CL 79%

A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains

Shirui Wang, Zhihui Tang, Huaxia Yang, Qiuhong Gong, Tiantian Gu, Hongyang Ma, Yongxin Wang, Wubin Sun, Zeliang Lian, Kehang Mao, Yinan Jiang, Zhicheng Huang, Lingyun Ma, Wenjie Shen, Yajie Ji, Yunhui Tan, Chunbo Wang, Yunlu Gao, Qianling Ye, Rui Lin, Mingyu Chen, Lijuan Niu, Zhihao Wang, Peng Yu, Mengran Lang, Yue Liu, Huimin Zhang, Haitao Shen, Long Chen, Qiguang Zhao, Si-Xuan Liu, Lina Zhou, Hua Gao, Dongqiang Ye, Lingmin Meng, Youtao Yu, Naixin Liang, Jianxiong Wu

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07866 2025-08-14 cs.AI 79%

System 2 Reasoning for Human-AI Alignment: Generality and Adaptivity via ARC-AGI

Sejin Kim, Sundong Kim

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07390 2025-08-12 cs.HC cs.AI 79%

Urbanite: A Dataflow-Based Framework for Human-AI Interactive Alignment in Urban Visual Analytics

Gustavo Moreira, Leonardo Ferreira, Carolina Veiga, Maryam Hosseini, Fabio Miranda

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments Accepted at IEEE VIS 2025. Urbanite is available at https://urbantk.org/urbanite

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07031 2025-08-12 eess.IV cs.AI cs.CV 79%

Trustworthy Medical Imaging with Large Language Models: A Study of Hallucinations Across Modalities

Anindya Bijoy Das, Shahnewaz Karim Sakib, Shibbir Ahmed

机构 * The University of Akron(阿克隆大学) University of Tennessee at Chattanooga(田纳西大学查塔努加分校) Texas State University(德克萨斯州立大学)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06885 2025-08-12 cs.LG 79%

Conformal Prediction and Trustworthy AI

Anthony Bellotti, Xindi Zhao

机构 * School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波校区计算机科学学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

Comments Preprint for an essay to be published in The Importance of Being Learnable (Enhancing the Learnability and Reliability of Machine Learning Algorithms) Essays Dedicated to Alexander Gammerman on His 80th Birthday, LNCS Springer Nature Switzerland AG ed. Nguyen K.A. and Luo Z

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05855 2025-08-11 cs.AI cs.RO 79%

Safety of Embodied Navigation: A Survey

Zixia Wang, Jia Hu, Ronghui Mu

机构 * University of Exeter(埃克塞特大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04251 2025-08-07 cs.LG 79%

T3Time: Tri-Modal Time Series Forecasting via Adaptive Multi-Head Alignment and Residual Fusion

Abdul Monaf Chowdhury, Rabeya Akter, Safaeid Hossain Arib

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03117 2025-08-06 cs.AI 79%

Toward a Trustworthy Optimization Modeling Agent via Verifiable Synthetic Data Generation

Vinicius Lima, Dzung T. Phan, Jayant Kalagnanam, Dhaval Patel, Nianjun Zhou

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21782 2025-07-30 cs.CL 79%

The Problem with Safety Classification is not just the Models

Sowmya Vajjala

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments Pre-print, Short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14900 2025-07-24 cs.CL 79%

From Neurons to Semantics: Evaluating Cross-Linguistic Alignment Capabilities of Large Language Models via Neurons Alignment

Chongxuan Huang, Yongshi Ye, Biao Fu, Qifeng Su, Xiaodong Shi

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能学院) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),文化和旅游部)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments ACL main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏