arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9324 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9324 篇

2604.09069 2026-04-13 cs.CL cs.AI cs.LG 75%

NyayaMind- A Framework for Transparent Legal Reasoning and Judgment Prediction in the Indian Legal System

NyayaMind:一个用于印度法律体系中透明法律推理和判决预测的框架

Parjanya Aditya Shukla, Shubham Kumar Nigam, Debtanu Datta, Balaramamahanthi Deepak Patnaik, Noel Shallum, Pradeep Reddy Vanga, Saptarshi Ghosh, Arnab Bhattacharya

机构 * IIT Kanpur, India(印度理工学院坎普尔分校) IIT Kharagpur, India(印度理工学院克勒格布尔分校) Symbiosis Law School Pune, India(印度共生法学院浦那分校) Dattam Labs, India(印度Dattam实验室) University of Birmingham, Dubai, United Arab Emirates(英国伯明翰大学迪拜校区)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NyayaMind通过整合检索、推理和验证机制,提升印度司法系统中判决预测与解释的透明度和准确性,为可信的人工智能辅助法律决策提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13531 2026-03-09 cs.CY cs.AI cs.CL 75%

AdAEM: An Adaptively and Automated Extensible Measurement of LLMs' Value Difference

AdAEM:一种自适应和自动扩展的大型语言模型价值差异测量方法

Jing Yao, Shitong Duan, Xiaoyuan Yi, Dongkuan Xu, Peng Zhang, Tun Lu, Ning Gu, Zhicheng Dou, Xing Xie

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 AdAEM是一种自适应和自动扩展的LLMs价值差异测量方法,通过自动生成和扩展测试问题,提高评估的多样性和信息性。

Comments This paper is accepted by ICLR 2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03206 2026-03-04 cs.LG cs.AI cs.CL 75%

Understanding and Mitigating Dataset Corruption in LLM Steering

理解并缓解LLM引导中的数据集损坏

Cullen Anderson, Narmeen Oozeer, Foad Namjoo, Remy Ogasawara, Amirali Abdullah, Jeff M. Phillips

机构 * Department of Computer Science, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校计算机科学系) Kahlert School of Computing, University of Utah(犹他大学凯尔特计算学校)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究对比引导在数据集损坏下的鲁棒性,发现其对中等损坏较稳健,但恶意篡改会引发副作用,通过替换高维均值计算为鲁棒估计器可缓解影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03152 2026-02-10 cs.CL cs.AI cs.LG 75%

MedVAL: Toward Expert-Level Medical Text Validation with Language Models

MedVAL: 向语言模型的专家级医学文本验证迈进

Asad Aali, Vasiliki Bikia, Maya Varma, Nicole Chiou, Sophie Ostmeier, Arnav Singhvi, Magdalini Paschali, Ashwin Kumar, Andrew Johnston, Karimar Amador-Martinez, Eduardo Juan Perez Guerrero, Paola Naovi Cruz Rivera, Sergios Gatidis, Christian Bluethgen, Eduardo Pontes Reis, Eddy D. Zandee van Rilland, Poonam Laxmappa Hosamani, Kevin R Keet, Minjoung Go, Evelyn Ling, David B. Larson, Curtis Langlotz, Roxana Daneshjou, Jason Hom, Sanmi Koyejo, Emily Alsentzer, Akshay S. Chaudhari

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MedVAL通过自监督蒸馏方法,利用合成数据提升语言模型在医学文本验证中的性能,达到专家级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21517 2026-01-30 cs.CV 75%

HERS: Hidden-Pattern Expert Learning for Risk-Specific Vehicle Damage Adaptation in Diffusion Models

HERS:隐藏模式专家学习用于扩散模型中特定风险车辆损伤适应

Teerapong Panboonyuen

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 HERS通过领域特定专家学习提升扩散模型中车辆损伤生成的保真度与可控性,提高保险领域应用的安全性与可靠性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21360 2026-01-30 cs.CL cs.AI cs.ET cs.LG cs.SE 75%

The Compliance Paradox: Semantic-Instruction Decoupling in Automated Academic Code Evaluation

合规悖论:自动学术代码评估中的语义指令解耦

Devanshu Sahoo, Manish Prasad, Vasudev Majhi, Arjun Neekhra, Yash Sinha, Murari Mandal, Vinay Chamola, Dhruv Kumar

机构 * KIIT University(KIIT大学)

专题命中 安全评测 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了自动学术代码评估中模型因优先考虑隐藏格式约束而无法正确评估代码的问题,提出SPACI和AST-ASIP框架以检测和对抗此类解耦现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03089 2025-12-04 cs.CR cs.AI cs.CY cs.LG 75%

Password-Activated Shutdown Protocols for Misaligned Frontier Agents

密码激活的停机协议用于对齐不一致的前沿代理

Kai Williams, Rohan Subramani, Francis Rhys Ward

机构 * MATS

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 密码激活停机协议通过在接收到密码时安全停机,降低前沿AI对齐不一致带来的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20736 2025-11-27 cs.CY cs.AI cs.CL 75%

Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts

大语言模型在社会法律情境中对非法指令的共谋回应

Xing Wang, Huiyuan Xie, Yiyan Wang, Chaojun Xiao, Huimin Chen, Holli Sargeant, Felix Steffek, Jie Shao, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究探讨大语言模型在社会法律情境中对非法指令的共谋回应,揭示其在不同情境下的安全性和易感性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10770 2025-11-17 cs.RO 75%

From Framework to Reliable Practice: End-User Perspectives on Social Robots in Public Spaces

Samson Oruma, Ricardo Colomo-Palacios, Vasileios Gkioulos

机构 * Department of Computer Science and Communication(计算机科学与通信系) Østfold University College(奥斯Fold大学学院) Escuela Técnica Superior de Ingenieros Informáticos(信息工程高级技术学院) Universidad Politécnica de Madrid(马德里理工大学) Department of Information Security and Communication Technology(信息安全与通信技术系) Norwegian University of Science and Technology(挪威科学与技术大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17418 2025-11-17 cs.HC cs.SE 75%

What Needs Attention? Prioritizing Drivers of Developers' Trust and Adoption of Generative AI

Rudrajit Choudhuri, Bianca Trinkenreich, Rahul Pandita, Eirini Kalliamvakou, Igor Steinmacher, Marco Gerosa, Christopher Sanchez, Anita Sarma

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

Comments Journal extension of ICSE 2025 paper (arXiv:2409.04099)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00843 2025-11-04 cs.HC 75%

Portal UX Agent -- A Plug-and-Play Engine for Rendering UIs from Natural Language Specifications

Xinsong Li, Ning Jiang, Jay Selvaraj

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12864 2025-10-16 cs.AI cs.CL cs.LG 75%

From Literal to Liberal: A Meta-Prompting Framework for Eliciting Human-Aligned Exception Handling in Large Language Models

Imran Khan

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 pages. Code and data are available at https://github.com/strongSoda/LITERAL-TO-LIBERAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08569 2025-10-10 cs.CL cs.AI cs.LG 75%

ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation

Qin Liu, Jacob Dineen, Yuxi Huang, Sheng Zhang, Hoifung Poon, Ben Zhou, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) Arizona State University(亚利桑那州立大学) Microsoft Research(微软研究院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02334 2025-10-06 cs.CL cs.AI cs.LG 75%

Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing

Zhe Li, Wei Zhao, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01780 2025-10-03 cs.CR cs.AI cs.CY cs.LG 75%

Secure Multi-Modal Data Fusion in Federated Digital Health Systems via MCP

Aueaphum Aueawatthanaphisut

机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology, Thammasat University(泰国朱拉安吞国际技术学院,泰国 Thammasat 大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 6 pages, 8 figures, 7 equations, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15871 2025-09-18 cs.CY cs.AI cs.CL 75%

A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare

Manar Aljohani, Jun Hou, Sindhura Kommu, Xuan Wang

机构 * Virginia Tech(维吉尼亚理工大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08852 2025-09-12 cs.CY cs.AI cs.LG 75%

Safe and Certifiable AI Systems: Concepts, Challenges, and Lessons Learned

Kajetan Schweighofer, Barbara Brune, Lukas Gruber, Simon Schmid, Alexander Aufreiter, Andreas Gruber, Thomas Doms, Sebastian Eder, Florian Mayer, Xaver-Paul Stadlbauer, Christoph Schwald, Werner Zellinger, Bernhard Nessler, Sepp Hochreiter

机构 * TRUSTIFAI GMBH(TRUSTIFAI公司) TÜV AUSTRIA HOLDING AG(TÜV奥地利控股公司) Software Competence Center Hagenberg(哈根贝格软件竞争力中心) Johannes Kepler University Linz - Institute for Machine Learning(林茨约瑟夫·约瑟夫斯大学-机器学习研究所)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 63 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05042 2025-09-08 cs.RO 75%

Shared Autonomy through LLMs and Reinforcement Learning for Applications to Ship Hull Inspections

Cristiano Caissutti, Estelle Gerbier, Ehsan Khorrambakht, Paolo Marinelli, Andrea Munafo', Andrea Caiti

机构 * Dept. of Information Engineering University of Pisa, Italy Pisa, Italy(信息工程系 乌迪内大学 乌迪内,意大利)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09864 2025-08-14 cs.LG cs.AI cs.CL cs.CV 75%

LUMA: A Benchmark Dataset for Learning from Uncertain and Multimodal Data

Grigor Bezirganyan, Sana Sellami, Laure Berti-Équille, Sébastien Fournier

机构 * Aix Marseille Univ, CNRS, LIS(阿维尼翁-马赛大学、国家科学研究中心、LIS)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments SIGIR 2025

Journal ref Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00159 2025-08-06 cs.AI cs.CY cs.LG econ.TH math.OC 75%

Model-Based Soft Maximization of Suitable Metrics of Long-Term Human Power

Jobst Heitzig, Ram Potham

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13666 2025-07-28 cs.CL cs.AI cs.CY 75%

Evaluation of LLM Vulnerabilities to Being Misused for Personalized Disinformation Generation

Aneta Zugecova, Dominik Macko, Ivan Srba, Robert Moro, Jakub Kopal, Katarina Marcincinova, Matus Mesarcik

机构 * Kempelen Institute of Intelligent Technologies(凯普勒智能技术研究所) University of Copenhagen(哥本哈根大学) Comenius University in Bratislava(布拉迪斯拉瓦科เมนius大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

Comments ACL 2025 main

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025 Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10706 2025-07-23 cs.CL cs.AI cs.CY cs.HC cs.RO 75%

SciFi-Benchmark: Leveraging Science Fiction To Improve Robot Behavior

Pierre Sermanet, Anirudha Majumdar, Vikas Sindhwani

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Minor improvements over previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16804 2025-06-25 cs.LG cs.AI cs.CY cs.ET 75%

Multimodal Machine Learning in Mental Health: A Survey of Data, Algorithms, and Challenges

Zahraa Al Sahili, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London United Kingdom Queen Mary University of London \& Jo z ef Stefan Institute United Kingdom \& Slovenia Queen Mary University of London Queen Mary University of London \& Jo z ef Stefan Institute

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18213 2025-06-06 cs.LG cs.AI cs.CL cs.CR 75%

Scaling Trends in Language Model Robustness

Nikolaus Howe, Ian McKenzie, Oskar Hollinsworth, Michał Zajac, Tom Tseng, Aaron Tucker, Pierre-Luc Bacon, Adam Gleave

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 59 pages; updated to ICML version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18635 2025-05-09 cs.LG cs.AI cs.CL 75%

Faster, Cheaper, Better: Multi-Objective Hyperparameter Optimization for LLM and RAG Systems

Matthew Barker, Andrew Bell, Evan Thomas, James Carr, Thomas Andrews, Umang Bhatt

机构 * Trustwise AI New York University(纽约大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00049 2025-05-02 cs.CY cs.CL cs.HC cs.LG 75%

Humanizing LLMs: A Survey of Psychological Measurements with Tools, Datasets, and Human-Agent Applications

Wenhan Dong, Yuemeng Zhao, Zhen Sun, Yule Liu, Zifan Peng, Jingyi Zheng, Zongmin Zhang, Ziyi Zhang, Jun Wu, Ruiming Wang, Shengmin Xu, Xinyi Huang, Xinlei He

机构 * Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)信息中心) School of Psychology, South China Normal University(华南师范大学心理学学院) College of Computer and Cyber Security, Fujian Normal University(福建师范大学计算机与网络安全学院) College of Cyber Security, Jinan University(济南大学网络安全学院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.CY、cs.LG

Comments 26 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09024 2025-04-21 cs.LG cs.AI cs.CL 75%

AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents

Maksym Andriushchenko, Alexandra Souly, Mateusz Dziemian, Derek Duenas, Maxwell Lin, Justin Wang, Dan Hendrycks, Andy Zou, Zico Kolter, Matt Fredrikson, Eric Winsor, Jerome Wynne, Yarin Gal, Xander Davies

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23213 2025-04-01 cs.CL cs.AI cs.LG 75%

RECALL-MM: A Multimodal Dataset of Consumer Product Recalls for Risk Analysis using Computational Methods and Large Language Models

Diana Bolanos, Mohammadmehdi Ataei, Daniele Grandi, Kosa Goucher-Lambert

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05812 2025-03-11 cs.CY cs.AI cs.CR cs.HC cs.LG 75%

Intolerable Risk Threshold Recommendations for Artificial Intelligence

Deepika Raman, Nada Madkour, Evan R. Murphy, Krystal Jackson, Jessica Newman

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 79 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17710 2025-02-26 cs.AI cs.CL cs.CV cs.LG 75%

Mind the Gesture: Evaluating AI Sensitivity to Culturally Offensive Non-Verbal Gestures

Akhila Yerukola, Saadia Gabriel, Nanyun Peng, Maarten Sap

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 40 pages, 49 figures

详情

展开后加载摘要…

URL PDF HTML 收藏