arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-26 至 2026-03-26 共收录 22 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 22 篇

2603.23625 2026-03-26 cs.AI cs.CL 84%

Evaluating a Multi-Agent Voice-Enabled Smart Speaker for Care Homes: A Safety-Focused Framework

评估多智能体语音赋能的智能音箱在养老机构中的应用:以安全为导向的框架

Zeinab Dehghani, Rameez Raja Kureshi, Koorosh Aslansefat, Faezeh Alsadat Abedi, Dhavalkumar Thakker, Lisa Greaves, Bhupesh Kumar Mishra, Baseer Ahmad, Tanaya Maslekar

机构 * University of Hull, UK(赫尔大学) University of Southampton, UK(南安普顿大学) Connexin, Hull, UK(Connexin公司) Leeds Teaching Hospital NHS Trust, UK(利兹教学医院国家健康服务信托)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了语音赋能的养老机构智能音箱,通过结合语音识别与检索增强生成技术,验证其在居民识别、提醒提取和任务调度中的准确性,为安全导向的护理系统提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24543 2026-03-26 cs.CR cs.CL 83%

Analysing the Safety Pitfalls of Steering Vectors

分析转向向量的安全隐患

Yuxiao Li, Alina Fastowski, Efstratios Zaradoukas, Bardh Prenkaj, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文研究转向向量在对抗攻击中的影响,发现其能显著改变攻击成功率,揭示可控性与安全性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00430 2026-03-26 cs.LG cs.AI cs.CV 81%

PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment

PromptLoop: 通过潜在反馈实现扩散模型对齐的即插即用提示精炼

Suhyeon Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 PromptLoop通过引入潜在反馈的逐步提示精炼方法,提升扩散模型在奖励优化、泛化能力及对抗奖励黑客方面的性能,同时保持灵活性和通用性。

Comments CVPR26 poster. 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24079 2026-03-26 cs.CV cs.AI cs.CR 79%

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

当理解成为风险:新兴图像生成范式中的真实性与安全性风险

Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Xi’an Jiaotong University(西安交通大学) Flexera(Flexera公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。

Comments Accepted by CVPR 2026. 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24414 2026-03-26 cs.CR cs.AI 74%

ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers

ClawKeeper: 通过技能、插件和观察者为OpenClaw代理提供全面的安全保护

Songyang Liu, Chaozhuo Li, Chenxu Wang, Jinyu Hou, Zejian Chen, Litian Zhang, Zheng Liu, Qiwei Ye, Yiming Hei, Xi Zhang, Zhongyuan Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) China Academy of Information and Communications Technology(信息通信技术研究院)

专题命中 安全评测 :safety(title);分类 cs.AI

AI总结 ClawKeeper通过技能、插件和观察者三层机制,提供实时安全防护,解决OpenClaw生态的安全漏洞问题,经过评估证明其有效性。

Comments 22 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24389 2026-03-26 cs.CL cs.AI cs.CY 67%

When AI Meets Early Childhood Education: Large Language Models as Assessment Teammates in Chinese Preschools

当人工智能遇见早期教育:大型语言模型作为中国幼儿园的评估伙伴

Xingming Li, Runke Huang, Yanan Bao, Yuye Jin, Yuru Jiao, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Oxford(牛津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨AI如何通过提取结构化质量指标,提升中国幼儿园教师与儿童互动评估的可扩展性,提出TEPE-TCI-370h数据集和Interaction2Eval框架,实现88%的评估一致性,并验证AI在提升评估效率和促进教育公平中的潜力。

Comments Accepted to AIED 2026, Project page: https://qingyonghu.github.io/Interaction2Eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23848 2026-03-26 cs.CL cs.CY 62%

BeliefShift: Benchmarking Temporal Belief Consistency and Opinion Drift in LLM Agents

BeliefShift:评估LLM代理中时间信念一致性和意见漂移的基准测试

Praveen Kumar Myakala, Manan Agrawal, Rahul Manche

机构 * Independent AI Researcher(独立AI研究员) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Independent Researcher(独立研究员)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 BeliefShift提出一个长期基准测试,评估多会话LLM交互中的信念动态,涵盖时间信念一致性、矛盾检测和证据驱动修正三个赛道,通过2400个标注交互轨迹验证模型在零样本和RAG设置下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23519 2026-03-26 cs.CL cs.AI 62%

MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?

MedMT-Bench: LLMs能否在医学场景中记忆并理解长多轮对话?

Lin Yang, Yuancheng Yang, Xu Wang, Changkun Liu, Haihua Yang

机构 * ByteDance(字节跳动)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 MedMT-Bench通过模拟诊断治疗流程,测试LLM在长上下文记忆、干扰鲁棒性和安全防御方面的表现,发现17种前沿模型均无法达到60%以上的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23506 2026-03-26 cs.CL cs.AI 62%

Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking

利用计算自适应测试对大型语言模型进行成本效益的医学基准评估

Tianpeng Zheng, Zhehan Jiang, Jiayi Liu, Shicong Feng

机构 * Institute of Medical Education, Health Science Center, Peking University(北京大学医学教育研究院、健康科学中心) School of Public Health, Peking University(北京大学公共卫生学院) Peking University Health Science Center-Chaoxing Joint Laboratory for Digital and Smart Medical(北京大学健康科学中心-超星数字与智能医疗联合实验室) Graduate School of Education, Peking University(北京大学教育学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于项目反应理论的计算自适应测试框架,用于高效评估大型语言模型在标准化医学知识中的表现,通过模拟和实证研究验证了其在成本效益和评估效率上的优势。

Comments 37 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20001 2026-03-26 cs.CL cs.SI 57%

A Machine Learning Approach for Detection of Mental Health Conditions and Cyberbullying from Social Media

从社交媒体检测心理健康状况和网络欺凌的一种机器学习方法

Edward Ajayi, Martha Kachweka, Mawuli Deku, Emily Aiken

机构 * Carnegie Mellon University Africa Kigali, Rwanda(卡内基梅隆大学非洲分校基加利分校,刚果(金))

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出统一的多类分类框架,用于从社交媒体数据中检测十种不同的心理健康和网络欺凌类别,通过实验表明端到端微调对性能至关重要,MentalBERT模型在准确率和宏F1分数上表现优异。

Comments Best Paper Award at the AAAI-26 Bridge Program on AI for Medicine and Healthcare. Published in Proceedings of the Second AAAI Bridge Program on AI for Medicine and Healthcare, PMLR 317:15-26, 2026. Paper URL: https://proceedings.mlr.press/v317/ajayi26a.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16501 2026-03-26 cs.AI 57%

Learning To Guide Human Decision Makers With Vision-Language Models

通过视觉-语言模型引导人类决策者

Debodeep Banerjee, Stefano Teso, Burcu Sayin, Andrea Passerini

机构 * DI, University of Pisa(比萨大学DI) DISI, University of Trento(特伦托大学DISI) CIMEC, University of Trento(特伦托大学CIMEC) Rajib Pal Bankura Sammilani Medical College(拉吉布·帕尔班克尔医学学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出LTG框架,通过视觉-语言模型生成可解释的决策指导,使人类负责最终决策,提升高风险场景下的决策质量与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24073 2026-03-26 cs.CL 57%

ConceptKT: A Benchmark for Concept-Level Deficiency Prediction in Knowledge Tracing

ConceptKT:一种用于知识追踪中概念层面缺陷预测的基准

Yu-Chen Kang, Yu-Chien Tang, An-Zi Yen

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出ConceptKT基准,通过标注问题所需概念和错误响应下的缺失概念,评估大语言模型和推理模型在概念层面缺陷预测中的性能。

Comments Accepted by LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23527 2026-03-26 cs.CL 57%

Compression Method Matters: Benchmark-Dependent Output Dynamics in LLM Prompt Compression

压缩方法至关重要:在LLM提示压缩中的基准依赖性输出动态

Warren Johnson

机构 * Plexor Labs(Plexor实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究探讨了提示压缩对输出长度和推理成本的影响,提出指令生存概率指标,并揭示了不同基准下的压缩效果差异,强调提示结构对压缩安全性和效率的重要性。

Comments 19 pages. Includes figures and tables. Companion code/data repository and direct NVML calibration dataset are cited in manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23479 2026-03-26 cs.CL 57%

FHIRPath-QA: Executable Question Answering over FHIR Electronic Health Records

FHIRPath-QA:基于FHIR电子健康记录的可执行问答

Michael Frew, Nishit Bheda, Bryan Tripp

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出FHIRPath-QA,首个支持患者特定问题的开放数据集和基准,通过将推理转向FHIRPath查询合成,提升问答效率与准确性,验证了其在临床应用中的潜力。

Comments Accepted to LREC 2026 CL4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11733 2026-03-26 cs.MA cs.AI 57%

SafeSieve: From Heuristics to Experience in Progressive Pruning for LLM-based Multi-Agent Communication

SafeSieve: 从启发式到经验在基于大语言模型的多智能体通信中的渐进剪枝

Ruijia Zhang, Xinyan Zhao, Ruixiang Wang, Sigen Chen, Guibin Zhang, An Zhang, Kun Wang, Qingsong Wen

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出SafeSieve,一种渐进适应的多智能体剪枝算法,通过双重机制动态优化智能体间通信。实验显示其在多个基准上实现了高准确率并显著降低token使用量,同时在异构环境下保持性能。

Comments AAAI-2026 poster; 7 pages for main content, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24484 2026-03-26 cs.CV 50%

Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

视频-only ToM:增强多模态大语言模型的理论思维

Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。

Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24204 2026-03-26 cs.IR 50%

SumRank: Aligning Summarization Models for Long-Document Listwise Reranking

SumRank:对长文档列表级重排序进行总结化对齐

Jincheng Feng, Wenhan Liu, Zhicheng Dou

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出SumRank模型,通过压缩长文档为简洁的排序对齐摘要,提升列表级重排序的效率与效果,实验显示其在多个基准数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05629 2026-03-26 cs.SE cs.CV 50%

ROMAN: Reward-Orchestrated Multi-Head Attention Network for Autonomous Driving System Testing

ROMAN:基于奖励协调的多头注意力网络用于自动驾驶系统测试

Jianlei Chi, Yuzhen Wu, Jiaxuan Hou, Xiaodong Zhang, Ming Fan, Suhui Sun, Weijun Dai, Bo Li, Jianguo Sun, Jun Sun

机构 * IEEE Publication Technology Group(IEEE出版技术组) Hangzhou Institute of Technology, Xidian University(杭州科技学院,西安电子科技大学) Qingdao Port International Co., Ltd.(青岛港口国际有限公司) Shandong Port Qingdao Port Group Co., Ltd.(山东港口青岛港集团有限公司) University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) Singapore Management University(新加坡管理大学)

专题命中 安全评测 :safety(abstract)

AI总结 ROMAN通过结合多头注意力网络与交通法规加权机制,生成高风险违规场景,提升自动驾驶系统测试的全面性与针对性。

Comments The manuscript includes 13 pages, 8 tables, and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23925 2026-03-26 cs.CV 50%

DP^2-VL: Private Photo Dataset Protection by Data Poisoning for Vision-Language Models

DP^2-VL: 通过数据污染保护隐私照片的视觉语言模型隐私威胁模型

Hongyi Miao, Jun Jia, Xincheng Wang, Qianli Ma, Wei Sun, Wangqiu Zhou, Dandan Zhu, Yewen Cao, Zhi Liu, Guangtao Zhai

机构 * Shandong University(山东大学) Shanghai Jiao Tong University(上海交通大学) Donghua University(东华大学) Shanghai Normal University(上海师范大学) East China Normal University(华东师范大学) Hefei University of Technology(合肥工业大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出DP2-VL框架,通过数据污染保护隐私照片,分析视觉语言模型在身份关联泄露中的脆弱性,并展示其在不同保护比例下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23801 2026-03-26 cs.CR 50%

AgentRFC: Security Design Principles and Conformance Testing for Agent Protocols

AgentRFC:关于智能体协议的安全设计原则与合规性测试

Shenghan Zheng, Qifan Zhang

专题命中 安全评测 :safety(abstract)

AI总结 本文提出AgentProtocolStack、Agent-AgnosticSecurityModel和AgentConform,旨在为智能体协议提供系统性的安全框架,解决协议合规性测试问题,并揭示协议组合时的安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19775 2026-03-26 cs.CV 50%

Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach

基于大语言模型的图像编辑评估:一个全面的基准和中间层探针方法

Shiqi Gao, Zitong Xu, Kang Fu, Huiyu Duan, Xiongkuo Min, Jia wang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出TIEdit基准和EditProbe方法,通过5120张编辑图像和专家评分,评估文本引导图像编辑方法的感知质量、对齐性和内容保真度,同时利用大语言模型中间层探针提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19507 2026-03-26 physics.acc-ph 50%

AI-Ready Control System for the Fermilab Accelerator Complex

面向 Fermilab 加速器复杂系统的 AI 准备控制系统

Tia Miceli, Erik Gottschalk, Donovan Tooke, Evan Milton, Robert Santucci, Hayden Hoschouer, Michael Balcewicz, Jennifer Case, Abhishek Deshpande, Kit Fieldhouse, Sudeshna Ganguly, Beau Harrison, Aisha Ibrahim, Thomas Kobilarcik, Michael Olander, Abhishek Pathak, Jason St. John, Aaron Sauers

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出面向 Fermilab 加速器复杂系统的 AI 准备控制系统,涵盖 MLOps 框架、数据质量框架及大语言模型整合,以支持高强度可靠运行。

Comments 43 pages, 31 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏