arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9331 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9331 篇

2603.15408 2026-03-17 cs.CR cs.AI cs.CL cs.LG cs.MA 67%

TrinityGuard: A Unified Framework for Safeguarding Multi-Agent Systems

TrinityGuard:多智能体系统的统一防护框架

Kai Wang, Biaojie Zeng, Zeming Wei, Chang Jin, Hefeng Zhou, Xiangtian Li, Chao Yang, Jingjing Qu, Xingcheng Xu, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TrinityGuard框架,用于评估和监控基于大语言模型的多智能体系统安全风险,通过三级风险分类识别20种风险类型,结合测试模块和运行时监控实现预开发评估与运行时监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15044 2026-03-17 cs.AI cs.CY cs.LG 67%

Prompt Readiness Levels (PRL): a maturity scale and scoring framework for production grade prompt assets

提示准备等级(PRL):一种用于生产级提示资产的成熟度量表和评分框架

Sebastien Guinard

机构 * Univ. Grenoble Alpes(格勒诺布尔大学) CEA(法国原子能委员会) DRT(法国国家科研机构)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出PRL和PRS,通过九级成熟度量表和多维评分方法,为提示资产的规范、测试、可追溯性、安全评估和部署准备性提供结构化框架,实现跨团队和行业的可重复评估。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12644 2026-03-16 cs.CR 67%

Uncovering Security Threats and Architecting Defenses in Autonomous Agents: A Case Study of OpenClaw

揭示自主代理中的安全威胁并构建防御体系:以OpenClaw为例

Zonghao Ying, Xiao Yang, Siyang Wu, Yumeng Song, Yang Qu, Hainan Li, Tianlin Li, Jiakai Wang, Aishan Liu, Xianglong Liu

专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract)

AI总结 本文分析了自主代理在安全领域的挑战,提出三层次风险分类和FASA架构,旨在提升自主代理的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08281 2026-03-13 cs.CL cs.AI cs.CY 67%

Evaluating LLM-Based Grant Proposal Review via Structured Perturbations

通过结构化扰动评估基于LLM的项目申请评审

William Thorne, Joseph James, Yang Wang, Chenghua Lin, Diana Maynard

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过结构化扰动评估基于LLM的项目评审,发现逐部分分析方法在检测和评分可靠性上表现最佳,但LLM反馈存在偏颇,需进一步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04583 2026-03-13 cs.AI cs.CL cs.CV cs.LG 67%

Jr. AI Scientist and Its Risk Report: Autonomous Scientific Exploration from a Baseline Paper

初级AI科学家及其风险报告:从基础论文出发的自主科学探索

Atsuyuki Miyai, Mashiro Toyooka, Takashi Otonari, Zaiying Zhao, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京科学大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Jr. AI Scientist通过模仿初级研究人员的工作流程,自主生成科学论文,但存在潜在风险和局限性,需进一步研究。

Comments TMLR2026. Issues, comments, and questions are all welcome in https://github.com/Agent4Science-UTokyo/Jr.AI-Scientist

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09996 2026-03-12 cs.CL cs.AI cs.CR cs.LG 67%

There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective

没有愚蠢的问题:从土耳其视角评估离线LLM能力

Edibe Yilmaz, Kahraman Kostas

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究从土耳其视角评估了离线LLM在遗产语言教育中的鲁棒性和教学安全性,发现参数范围在8B-14B的模型在成本与安全性之间达到最佳平衡。

Comments 5 pages, 6 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09394 2026-03-12 cs.HC 67%

EyeAgent: An Agentic AI System for Multimodal Clinical Decision Support in Ophthalmology

EyeAgent:一种用于眼科多模态临床决策支持的智能AI系统

Danli Shi, Xiaolan Chen, Bingjie Yan, Weiyi Zhang, Pusheng Xu, Jiancheng Yang, Ruoyu Chen, Siyu Huang, Bowen Liu, Xinyuan Wu, Meng Xie, Ziyu Gao, Yue Wu, Senlin Lin, Kai Jin, Xia Gong, Yih Chung Tham, Xiujuan Zhang, Li Dong, Yuzhou Zhang, Jason Yam, Guangming Jin, Xiaohu Ding, Haidong Zou, Yalin Zheng, Zongyuan Ge, Mingguang He

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 EyeAgent通过整合53种眼科工具提升诊断准确率,实现多模态临床决策支持,为眼科AI系统提供新范式。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07847 2026-03-11 cs.CR 67%

Robustness Over Time: Understanding Adversarial Examples' Effectiveness on Longitudinal Versions of Large Language Models

时间鲁棒性:对抗示例在大型语言模型纵向版本中的有效性

Yugeng Liu, Tianshuo Cong, Zhengyu Zhao, Michael Backes, Yun Shen, Yang Zhang

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

AI总结 本文研究了大型语言模型在纵向版本中的对抗鲁棒性,发现更新并不总是提升鲁棒性,部分模型在误分类和幻觉方面有所下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03294 2026-03-09 cs.CL cs.AI cs.LG 67%

Fine-Tuning and Evaluating Conversational AI for Agricultural Advisory

对话式农业建议的微调与评估

Sanyam Singh, Naga Ganesh, Vineet Singh, Lakshmi Pedapudi, Ritesh Kumar, SSP Jyothi, Archana Karanam, Waseem Pasha, Ekta Kumari, C. Yashoda, Mettu Vijaya Rekha Reddy, Shesha Phani Debbesa, Chandan Dash

机构 * Digital Green

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种混合LLM架构,通过微调和拼接层提升农业建议的准确性与安全性,释放了farmerchat-prompts库以促进领域特定农业AI的发展。

Comments 22 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04124 2026-03-05 cs.AI cond-mat.mtrl-sci cs.CL cs.LG 67%

BeamPERL: Parameter-Efficient RL with Verifiable Rewards Specializes Compact LLMs for Structured Beam Mechanics Reasoning

BeamPERL: 参数高效强化学习与可验证奖励用于结构梁力学推理

Tarjei Paule Hage, Markus J. Buehler

机构 * Department of Mechanical Engineering(机械工程系) Massachusetts Institute of Technology(麻省理工学院) Department of Civil and Environmental Engineering(土木与环境工程系) Schwarzman College of Computing(施瓦茨曼计算学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BeamPERL通过参数高效强化学习与可验证奖励,提升紧凑语言模型在结构梁力学推理中的能力,发现精确奖励无法保证可转移的物理推理,需结合结构化推理支架以实现稳健科学推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03315 2026-03-05 cs.CL cs.AI cs.LG 67%

M-QUEST -- Meme Question-Understanding Evaluation on Semantics and Toxicity

M-QUEST -- 周期性问题理解评估在语义和毒性上

Stefano De Giorgis, Ting-Chih Chen, Filip Ilievski

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 M-QUEST提出一个语义框架和基准,用于自动提取迷因知识,评估模型在毒性理解上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21023 2026-03-04 cs.CL cs.AI cs.LG 67%

Param$Δ$ for Direct Weight Mixing: Post-Train Large Language Model at Zero Cost

ParamΔ 用于直接权重混合:零成本的后训练大语言模型

Sheng Cao, Mingrui Wu, Karthik Prasad, Yuandong Tian, Zechun Liu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ParamΔ通过零成本方法实现基础模型的后训练能力迁移,提升模型性能与开发效率。

Comments Published as a conference paper at ICLR 2025

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01564 2026-03-03 cs.CR 67%

From Secure Agentic AI to Secure Agentic Web: Challenges, Threats, and Future Directions

从安全代理AI到安全代理网络:挑战、威胁与未来方向

Zhihang Deng, Jiaping Gui, Weinan Zhang

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文探讨了从安全代理AI到安全代理网络的过渡,分析了代理系统在开放网络环境中的安全挑战与威胁,并提出了应对策略和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01042 2026-03-03 cs.CL cs.AI cs.LG 67%

Thoth: Mid-Training Bridges LLMs to Time Series Understanding

Thoth:中期训练使LLM具备时间序列理解能力

Jiafeng Lin, Yuxuan Wang, Jialong Wu, Huakun Luo, Zhongyi Pei, Jianmin Wang

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Thoth通过中期训练和Book-of-Thoth语料库,使LLM具备时间序列理解能力,并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20294 2026-02-25 cs.CL cs.AI cs.CY 67%

InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation

InterviewSim: 一种可扩展的基于面试的人格模拟框架

Yu Li, Pranav Narayanan Venkit, Yada Pruksachatkun, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce 研究)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 InterviewSim提出了一种基于真实面试数据的多维评估框架,通过系统比较证明基于真实访谈数据的方法在人格模拟中表现更优,并揭示了不同方法在人格风格与事实一致性方面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19547 2026-02-24 cs.CR 67%

CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents

CIBER:代码解释器代理安全评估的综合基准

Lei Ba, Qinbin Li, Songze Li

专题命中 安全评测 :alignment(abstract);prompt injection(abstract)

AI总结 CIBER提出了一种综合基准,评估代码解释器代理对四种主要对抗性攻击的鲁棒性,揭示了模型架构、对齐和智能水平对安全的影响,以及自然语言伪装和安全极化现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18583 2026-02-24 cs.CL cs.AI cs.LG 67%

Luna-2: Scalable Single-Token Evaluation with Small Language Models

Luna-2:基于小语言模型的可扩展单令牌评估

Vatsal Goel, Rishon Dsouza, Nikhil Ega, Amey Ramesh Rambatla, Rob Friel, Shuai Shao, Yash Sheth

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Luna-2利用小语言模型实现高效、准确的单令牌评估,大幅降低计算成本和延迟,提升内容安全与幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17687 2026-02-23 cs.IR cs.AI cs.CL cs.LG 67%

IRPAPERS: A Visual Document Benchmark for Scientific Retrieval and Question Answering

IRPAPERS: 一个用于科学检索和问答的视觉文档基准

Connor Shorten, Augustas Skaburskas, Daniel M. Jones, Charles Pierse, Roberto Esposito, John Trengrove, Etienne Dilocker, Bob van Luijt

机构 * Weaviate

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IRPAPERS基准通过比较图像和文本检索系统,揭示了多模态混合搜索在科学文档检索和问答中的优势。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17672 2026-02-23 cs.HC cs.AI cs.CL cs.CR cs.CY 67%

Assessing LLM Response Quality in the Context of Technology-Facilitated Abuse

评估在技术辅助虐待情境下的LLM响应质量

Vijay Prakash, Majed Almansoori, Donghan Hu, Rahul Chatterjee, Danny Yuxing Huang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文评估了四种LLM在技术辅助虐待情境下的响应质量,揭示其在支持幸存者方面的有效性和局限性,并提出改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14285 2026-02-17 cs.DL cs.AI cs.CL cs.LG 67%

FMMD: A multimodal open peer review dataset based on F1000Research

FMMD:基于F1000Research的多模态开放同行评审数据集

Zhenzhen Zhuang, Yuqing Fu, Jing Zhu, Zhangping Zhou, Jialiang Lin

机构 * School of Computer Science and Engineering, Guangzhou Institute of Science and Technology(计算机科学与工程学院,广州科学与技术研究所) College of Foreign Languages and Cultures, Xiamen University(外语学院,厦门大学) Science and Education Evaluation Lab, Guangzhou Institute of Science and Technology(科学与教育评估实验室,广州科学与技术研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FMMD是一个基于F1000Research的多模态开放同行评审数据集,旨在通过整合多模态数据和版本特定的评审信息,填补现有数据集在同行评审与稿件演变关系上的空白。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21842 2026-02-17 cs.CV cs.CR 67%

Modal Aphasia: Can Unified Multimodal Models Describe Images From Memory?

模态失语:统一多模态模型能否从记忆中描述图像?

Michael Aerni, Joshua Swanson, Kristina Nikolić, Florian Tramèr

机构 * Michael Aerni(独立研究者) Joshua Swanson(独立研究者) Kristina Nikolić(独立研究者) Florian Tramèr(独立研究者)

专题命中 安全评测 :safety(abstract);AI safety(abstract)

AI总结 研究发现统一多模态模型在视觉记忆与文本表达间存在系统性缺陷,导致安全框架可能因单一模态防护而失效。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18776 2026-02-17 cs.CL cs.AI cs.LG 67%

AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field

AECBench: 一个用于评估大型语言模型在AEC领域知识能力的分层基准

Chen Liang, Zhaoqi Huang, Haofen Wang, Fu Chai, Chunying Yu, Huanhuan Wei, Zhengjie Liu, Yanpeng Li, Hongjun Wang, Ruifeng Luo, Xianzhong Zhao

机构 * College of Civil Engineering, Tongji University(同济大学土木工程学院) Shanghai Qi Zhi Institute(上海启智研究院) Arcplus Group East China Architectural Design & Research Institute Co., Ltd.(Arcplus集团东部建筑设计与研究研究院有限公司) College of Design and Innovation, Tongji University(同济大学设计与创新学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AECBench提出一个分层基准,评估大型语言模型在AEC领域知识能力,揭示模型在复杂推理和文档生成方面的不足。

Comments Accepted by Advanced Engineering Informatics. Code and data available at: https://github.com/ArchiAI-LAB/AECBench

Journal ref Advanced Engineering Informatics, Vol. 71, Article 104314 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07978 2026-02-16 cs.AI cs.CL cs.LG 67%

VoiceAgentBench: Are Voice Assistants ready for agentic tasks?

VoiceAgentBench: 聊天助手是否准备好处理代理任务?

Dhruv Jain, Harshit Shukla, Gautam Rajeev, Ashish Kulkarni, Chandra Khatri, Shubham Agarwal

机构 * OLA Electric(OLA电讯) Krutrim AI(Krutrim人工智能)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VoiceAgentBench评估语音模型在代理任务中的表现,发现ASR-LLM在英语任务中表现优于端到端SpeechLMs,但两者在多语言和安全评估中均存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06446 2026-02-09 cs.CL cs.AI cs.LG 67%

CORE: Comprehensive Ontological Relation Evaluation for Large Language Models

CORE:面向大语言模型的全面本体关系评估

Satyam Dwivedi, Sanjukta Ghosh, Shivam Dwivedi, Nishi Kumari, Anil Thakur, Anurag Purushottam, Deepak Alok, Praveen Gatla, Manjuprasad B, Bipasha Patgiri

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CORE提出一个全面评估大语言模型语义关系区分能力的数据集和基准测试,揭示其在无关性推理上的显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06256 2026-02-09 cs.LG cs.AI cs.CL 67%

Steering Safely or Off a Cliff? Rethinking Specificity and Robustness in Inference-Time Interventions

在悬崖边转向还是偏离?重新思考推断时间干预中的特异性和鲁棒性

Navita Goyal, Hal Daumé

机构 * University of Maryland College Park(马里兰大学学院市)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出模型转向中特异性和鲁棒性的评估框架,揭示转向方法在提升效率的同时可能牺牲安全性。

Comments EACL 2026 Main, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02515 2026-02-05 cs.AI cs.CL cs.LG 67%

CreditAudit: 2$^\text{nd}$ Dimension for LLM Evaluation and Selection

CreditAudit: 2维度用于LLM评估与选择

Yiliang Song, Hongjun An, Jiangong Xiao, Haofei Zhao, Jiawei Shao, Xuelong Li

机构 * Northwestern Polytechnical University Institute of Artificial Intelligence (TeleAI), China Telecom(西北工业大学人工智能研究所(TeleAI),中国电信) Dalian Maritime University Institute of Artificial Intelligence (TeleAI), China Telecom(大连海事大学人工智能研究所(TeleAI),中国电信) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Guangxi Normal University Institute of Artificial Intelligence (TeleAI), China Telecom(广西师范大学人工智能研究所(TeleAI),中国电信)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CreditAudit 通过 2D 信用评级框架,提供基于稳定性风险的 LLM 部署评估方法,支持更精确的模型选择与分层部署。

Comments Second update

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04033 2026-02-05 cs.CL cs.AI cs.CY 67%

On the Credibility of Evaluating LLMs using Survey Questions

关于通过调查问题评估LLM可信度的研究

Jindřich Libovický

机构 * Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics(查尔斯大学,数学与物理学院,形式与应用语言学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过调查问题评估LLM可信度,发现提示方法和解码策略显著影响结果,并引入自相关距离度量标准以评估答案一致性。

Comments Accepted to the Workshop on Multilingual and Multicultural Evaluation at EACL 2026, 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00070 2026-02-03 cs.CY cs.CL cs.LG 67%

FoundationalASSIST: An Educational Dataset for Foundational Knowledge Tracing and Pedagogical Grounding of LLMs

FoundationalASSIST: 一个用于基础知识追踪和LLM教学基础的教育数据集

Eamon Worden, Cristina Heffernan, Neil Heffernan, Shashank Sonkar

机构 * Worcester Polytechnic Institute(沃斯特理工大学) The ASSISTments Foundation(ASSISTments基金会) University of Central Florida(中央佛罗里达大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 FoundationalASSIST 是首个为研究LLM在教育中的应用而设计的英文教育数据集,提供完整问题文本、学生实际回答和对齐标准,用于评估LLM在知识追踪和教学基础方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07110 2026-01-27 cs.CL cs.AI cs.CY 67%

The Need for a Socially-Grounded Persona Framework for User Simulation

用户模拟中需要基于社会的个性框架

Pranav Narayanan Venkit, Yu Li, Yada Pruksachatkun, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出SCOPE框架,通过社会心理学协议构建更高质量的个性,提升大语言模型在社会模拟中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16699 2026-01-26 cs.SE 67%

Supporting Stakeholder Requirements Expression with LLM Revisions: An Empirical Evaluation

通过LLM修订支持利益相关者需求表达:一项实证评估

Michael Mircea, Emre Gevrek, Elisa Schmid, Kurt Schneider

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文通过实证研究展示LLM在辅助利益相关者表达需求方面的有效性,证明其能提升需求表达的完整性、清晰度和一致性。

Comments This paper has been accepted at the research track of the 32nd International Working Conference on Requirements Engineering: Foundation for Software Quality (REFSQ 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏