arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9331 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9331 篇

2405.13923 2025-09-03 cs.CL 70%

Why Not Transform Chat Large Language Models to Non-English?

Xiang Geng, Ming Zhu, Jiahuan Li, Zhejian Lai, Wei Zou, Shuaijie She, Jiaxin Guo, Xiaofeng Zhao, Yinglu Li, Yuang Li, Chang Su, Yanqing Zhao, Xinglin Lyu, Min Zhang, Jiajun Chen, Hao Yang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家重点实验室,南京大学,南京) Translation Services Center, Huawei Inc., Beijing 100085, China(翻译服务部,华为公司,北京)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-50646-z}

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20108 2025-09-03 cs.LG cs.IT math.IT stat.ML 70%

Graded Transformers

Tony Shaska

机构 * Department of Mathematics Statistics, Oakland University, Rochester, MI 48309

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20776 2025-08-29 cs.CV cs.AI 70%

Safer Skin Lesion Classification with Global Class Activation Probability Map Evaluation and SafeML

Kuniko Paxton, Koorosh Aslansefat, Amila Akagić, Dhavalkumar Thakker, Yiannis Papadopoulos

机构 * School of Computer Science, University of Hull(赫尔大学计算机科学学院) Faculty of Electrical Engineering, University of Sarajevo(萨拉热窝大学电气工程学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20737 2025-08-29 cs.SE cs.AI 70%

Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol

Wei Ma, Yixiao Yang, Qiang Hu, Shi Ying, Zhi Jin, Bo Du, Zhenchang Xing, Tianlin Li, Junjie Shi, Yang Liu, Linxiao Jiang

机构 * Singapore Management University Singapore Capital Normal University Beijing China Tianjin University Tianjin China Wuhan University China CSIRO's Data61 \& Australian National University Australia Nanyang Technological University Singapore Singapore Management University Capital Normal University Tianjin University Wuhan University CSIRO's Data61 \& Australian National University Nanyang Technological University

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18076 2025-08-29 cs.CL 70%

Neither Valid nor Reliable? Investigating the Use of LLMs as Judges

Khaoula Chehbouni, Mohammed Haddou, Jackie Chi Kit Cheung, Golnoosh Farnadi

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所) Statistics Canada(加拿大统计局)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

Comments Prepared for conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16850 2025-08-26 cs.AI 70%

RADAR: A Reasoning-Guided Attribution Framework for Explainable Visual Data Analysis

Anku Rani, Aparna Garimella, Apoorv Saxena, Balaji Vasan Srinivasan, Paul Pu Liang

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14925 2025-08-22 cs.CR cs.LG 70%

MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers

Zhiqiang Wang, Yichao Gao, Yanting Wang, Suyuan Liu, Haifeng Sun, Haoran Cheng, Guanquan Shi, Haohua Du, Xiangyang Li

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06225 2025-08-19 cs.AI 70%

Overconfidence in LLM-as-a-Judge: Diagnosis and Confidence-Driven Solution

Zailong Tian, Zhuoheng Han, Yanzhe Chen, Haozhe Xu, Xi Yang, Richeng Xuan, Houfeng Wang, Lizi Liao

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11647 2025-08-19 cs.LO cs.AI 70%

Categorical Construction of Logically Verifiable Neural Architectures

Logan Nye

机构 * Carnegie Mellon University School of Computer Science(卡内基梅隆大学计算机科学学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10146 2025-08-15 cs.AI 70%

Agentic AI Frameworks: Architectures, Protocols, and Design Challenges

Hana Derouiche, Zaki Brahmi, Haithem Mazeni

机构 * University of Kairouan(卡鲁安大学) SMART Lab, University of Tunis(图纳大学SMART实验室) University of Sousse(索斯大学) Riadi Lab, Compus Manouba(曼努巴大学里亚迪实验室) University of Jandouba(贾杜巴大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14097 2025-07-21 cs.AI cs.CV 70%

Generative AI-Driven High-Fidelity Human Motion Simulation

Hari Iyer, Neel Macwan, Atharva Jitendra Hude, Heejin Jeong, Shenghan Guo

机构 * The Polytechnic School, Ira A. Fulton Schools of Engineering, Arizona State University(亚利桑那州立大学工程学院Polytechnic学院) School of Manufacturing Systems and Networks, Ira A. Fulton Schools of Engineering, Arizona State University(亚利桑那州立大学工程学院制造系统与网络学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09588 2025-07-15 cs.AI 70%

eSapiens: A Platform for Secure and Auditable Retrieval-Augmented Generation

Isaac Shi, Zeyuan Li, Fan Liu, Wenli Wang, Lewei He, Yang Yang, Tianyu Shi

机构 * eSapiens Team(eSapiens团队)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02986 2025-07-09 cs.CL 70%

GAF-Guard: An Agentic Framework for Risk Management and Governance in Large Language Models

Seshu Tirupathi, Dhaval Salwala, Elizabeth Daly, Inge Vejsbjerg

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22270 2025-07-01 cs.CY 70%

Public Service Algorithm: towards a transparent, explainable, and scalable content curation for news content based on editorial values

Ahmad Mel, Sebastien Noir

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CY

Journal ref IAMCR 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04043 2025-06-05 cs.CL cs.AI cs.CY cs.HC cs.LG 70%

Think Like a Person Before Responding: A Multi-Faceted Evaluation of Persona-Guided LLMs for Countering Hate

Mikel K. Ngueajio, Flor Miriam Plaza-del-Arco, Yi-Ling Chung, Danda B. Rawat, Amanda Cercas Curry

机构 * Howard University(霍华德大学) LIACS, Leiden University(莱顿大学LIACS) Genaios(基因奥斯) CENTAI Institute(CENTAI研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted at ACL WOAH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07071 2025-06-03 cs.AI 70%

Value Compass Benchmarks: A Platform for Fundamental and Validated Evaluation of LLMs Values

Jing Yao, Xiaoyuan Yi, Shitong Duan, Jindong Wang, Yuzhuo Bai, Muhua Huang, Peng Zhang, Tun Lu, Zhicheng Dou, Maosong Sun, Xing Xie

机构 * Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学) Tsinghua University(清华大学) The University of Chicago(芝加哥大学) Renmin University of China(中国人民大学) William & Mary(威廉与玛丽大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23559 2025-05-30 cs.AI 70%

SafeScientist: Toward Risk-Aware Scientific Discoveries by LLM Agents

Kunlun Zhu, Jiaxun Zhang, Ziheng Qi, Nuoxing Shang, Zijia Liu, Peixuan Han, Yue Su, Haofei Yu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21741 2025-05-29 cs.MA cs.CY cs.IR 70%

AI-Supported Platform for System Monitoring and Decision-Making in Nuclear Waste Management with Large Language Models

Dongjune Chang, Sola Kim, Young Soo Park

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CY

Journal ref Proceedings of the WM2025 Conference, March 9-13, 2025, Phoenix, Arizona, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19690 2025-05-27 cs.AI 70%

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models

Baihui Zheng, Boren Zheng, Kerui Cao, Yingshui Tan, Zhendong Liu, Weixun Wang, Jiaheng Liu, Jian Yang, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12798 2025-05-20 cs.AI 70%

BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models

Yige Li, Hanxun Huang, Yunhan Zhao, Xingjun Ma, Jun Sun

机构 * Singapore Management University(新加坡管理大学) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13365 2025-05-01 cs.CY 70%

Generative AI and the problem of existential risk

Lynette Webb

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CY

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15579 2025-04-29 cs.CV cs.CL 70%

An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training

Yuxiang Nie, Sunan He, Yequan Bie, Yihui Wang, Zhixuan Chen, Shu Yang, Zhiyuan Cai, Hongmei Wang, Xi Wang, Luyang Luo, Mingxiang Wu, Xian Wu, Ronald Cheong Kin Chan, Yuk Ming Lau, Yefeng Zheng, Pranav Rajpurkar, Hao Chen

机构 * Shenzhen People’s Hospital(深圳人民医院) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09593 2025-04-18 cs.CR cs.LG 70%

ControlNET: A Firewall for RAG-based LLM System

Hongwei Yao, Haoran Shi, Yidou Chen, Yixin Jiang, Cong Wang, Zhan Qin

专题命中 安全评测 :prompt injection(abstract);harmlessness(abstract);分类 cs.LG

Comments Project Page: https://ai.zjuicsr.cn/firewall

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06011 2025-04-09 cs.CL 70%

Llama-3-Nanda-10B-Chat: An Open Generative Large Language Model for Hindi

Monojit Choudhury, Shivam Chauhan, Rocktim Jyoti Das, Dhruv Sahnan, Xudong Han, Haonan Li, Aaryamonvikram Singh, Alok Anil Jadhav, Utkarsh Agarwal, Mukund Choudhary, Debopriyo Banerjee, Fajri Koto, Junaid Bhat, Awantika Shukla, Samujjwal Ghosh, Samta Kamboj, Onkar Pandit, Lalit Pradhan, Rahul Pal, Sunil Sahu, Soundar Doraiswamy, Parvez Mullah, Ali El Filali, Neha Sengupta, Gokul Ramakrishnan, Rituraj Joshi, Gurpreet Gosal, Avraham Sheinin, Natalia Vassilieva, Preslav Nakov

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23424 2025-04-01 cs.LG cs.AI cs.CL cs.CR cs.CY 70%

What Makes an Evaluation Useful? Common Pitfalls and Best Practices

Gil Gekker, Meirav Segal, Dan Lahav, Omer Nevo

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22610 2025-03-31 cs.HC cs.AI cs.CL cs.CY cs.LG 70%

Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users

Antonia Karamolegkou, Malvina Nikandrou, Georgios Pantazopoulos, Danae Sanchez Villegas, Phillip Rust, Ruchira Dhar, Daniel Hershcovich, Anders Søgaard

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07306 2025-03-11 cs.CL 70%

Benchmarking Chinese Medical LLMs: A Medbench-based Analysis of Performance Gaps and Hierarchical Optimization Strategies

Luyi Jiang, Jiayuan Chen, Lu Lu, Xinwei Peng, Lihao Liu, Junjun He, Jie Xu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14491 2025-03-11 cs.AI 70%

Statistical Scenario Modelling and Lookalike Distributions for Multi-Variate AI Risk

Elija Perrier

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02157 2025-03-05 cs.CV cs.AI 70%

MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models

Aofei Chang, Le Huang, Parminder Bhatia, Taha Kass-Hout, Fenglong Ma, Cao Xiao

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09927 2025-02-17 cs.CV cs.AI 70%

Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence

Granite Vision Team, Leonid Karlinsky, Assaf Arbelle, Abraham Daniels, Ahmed Nassar, Amit Alfassi, Bo Wu, Eli Schwartz, Dhiraj Joshi, Jovana Kondic, Nimrod Shabtay, Pengyuan Li, Roei Herzig, Shafiq Abedin, Shaked Perek, Sivan Harary, Udi Barzelay, Adi Raz Goldfarb, Aude Oliva, Ben Wieles, Bishwaranjan Bhattacharjee, Brandon Huang, Christoph Auer, Dan Gutfreund, David Beymer, David Wood, Hilde Kuehne, Jacob Hansen, Joseph Shtok, Ken Wong, Luis Angel Bathen, Mayank Mishra, Maksym Lysak, Michele Dolfi, Mikhail Yurochkin, Nikolaos Livathinos, Nimrod Harel, Ophir Azulai, Oshri Naparstek, Rafael Teixeira de Lima, Rameswar Panda, Sivan Doveh, Shubham Gupta, Subhro Das, Syed Zawad, Yusik Kim, Zexue He, Alexander Brooks, Gabe Goodhart, Anita Govindjee, Derek Leist, Ibrahim Ibrahim, Aya Soffer, David Cox, Kate Soule, Luis Lastras, Nirmit Desai, Shila Ofek-koifman, Sriram Raghavan, Tanveer Syeda-Mahmood, Peter Staar, Tal Drory, Rogerio Feris

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏