arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-29 至 2026-04-29 共收录 19 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 19 篇

2604.24826 2026-04-29 cs.CR cs.AI 81%

A Comparative Evaluation of AI Agent Security Guardrails

AI代理安全防护的比较评估

Qi Li, Jiu Li, Pingtao Wei, Jianjun Xu, Xueyi Wei, Jiwei Shi, Xuan Zhang, Yanhui Yang, Xiaodong Hui, Peng Xu, Lingquan Zhou

机构 * Beijing Caizhi Tech(北京彩智科技)

专题命中 安全评测 :safety(summary_cn,abstract);分类 cs.AI

AI总结 本文比较了DKnownAI Guard与AWS Bedrock Guardrails、Azure Content Safety和Lakera Guard在AI代理安全场景中的性能,发现DKnownAI在召回率和真正负样本率上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11786 2026-04-29 cs.LG cs.AI 81%

Evaluating LLM Safety Under Repeated Inference via Accelerated Prompt Stress Testing

通过加速提示压力测试评估LLM在重复推理下的安全性

Keita Broadwater

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出APST框架,通过重复推理测试揭示模型在持续使用下的失败模式,展示单次评估无法反映实际可靠性差异。

Comments 23 pages, 9 figures; editorial and LaTeX revisions for clarity; improved presentation of methodology and results; updated figures, tables, and float placement; clarified temperature sensitivity and deployment-risk analysis; expanded reporting from the same experiments; results unchanged in substance

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24902 2026-04-29 cs.CY cs.SE 79%

Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains

微调后的安全性漂移:来自高风险领域的证据

Emaan Bilal Khan, Amy Winecoff, Miranda Bogen, Dylan Hadfield-Menell

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 研究发现微调导致的安全性变化显著且不一致,挑战了基于基础模型的安全性假设,需重新评估微调模型以管理下游风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20191 2026-04-29 cs.CV cs.AI cs.RO 70%

From Scene to Object: Text-Guided Dual-Gaze Prediction

从场景到物体:文本引导的双目预测

Zehong Ke, Yanbo Jiang, Jinhao Li, Zhiyuan Liu, Yiqian Tu, Qingwen Meng, Heye Huang, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25200 2026-04-29 cs.CR cs.AI cs.CY cs.LG 67%

Making AI-Assisted Grant Evaluation Auditable without Exposing the Model

在不暴露模型的情况下使AI辅助的资助评估可审计

Kemal Bicakci

机构 * Informatics Institute, Istanbul Technical University, Istanbul, Türkiye(伊斯坦布尔技术大学信息学院,伊斯坦布尔,土耳其) Securify Information Technology and Security Training Consulting Inc., Ankara, Türkiye(Securify信息科技与安全培训咨询公司,安卡拉,土耳其)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出一种基于TEE的架构,通过远程证明技术实现资助评估过程的可审计性,同时防止申请人优化对抗模型和评分标准。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25847 2026-04-29 math.OC cs.AI cs.LG 62%

From Soliloquy to Agora: Memory-Enhanced LLM Agents with Decentralized Debate for Optimization Modeling

从独白到广场:基于去中心化辩论的记忆增强型LLM代理用于优化建模

Jianghao Lin, Zi Ling, Chenyu Zhou, Tianyi Xu, Ruoqing Jiang, Zizhuo Wang, Dongdong Ge

机构 * Antai College of Economics and Management(上海交通大学安泰经济管理学院) University of Chicago Booth School of Business(芝加哥大学布斯商学院) The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) School of Economics and Management(清华大学经济管理学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agora-Opt框架,结合去中心化辩论与读写记忆库,实现优化建模的模块化代理系统,通过去中心化辩论协议实现多代理团队的协同优化,提升建模可靠性。

Comments Working Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25840 2026-04-29 cs.CL cs.AI 62%

PSI-Bench: Towards Clinically Grounded and Interpretable Evaluation of Depression Patient Simulators

PSI-Bench:迈向临床导向且可解释的抑郁症患者模拟器评估

Nguyen Khoi Hoang, Shuhaib Mehri, Tse-An Hsu, Yi-Jyun Sun, Quynh Xuan Nguyen Truong, Khoa D Doan, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) VinUniversity(文大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PSI-Bench框架,用于评估抑郁症患者模拟器的行为,发现现有模拟器存在响应过长、情绪处理不充分等问题,且框架对仿真质量影响大于模型规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24929 2026-04-29 cs.CL cs.AI 62%

GAIA-v2-LILT: Multilingual Adaptation of Agent Benchmark beyond Translation

GAIA-v2-LILT:超越翻译的代理基准多语言适应

Yunsu Kim, Kaden Uhlig, Joern Wuebker

机构 * LILT

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GAIA-v2-LILT,通过功能对齐、文化对齐和难度校准改进多语言代理基准,实验表明其性能提升达32.7%,接近英语表现,但仍有较大差距,揭示了多语言性能差距主要由基准测量误差引起。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00065 2026-04-29 cs.CY cs.AI 62%

Responsible Evaluation of AI for Mental Health

人工智能心理健康应用的责任评估

Hiba Arnaout, Anmol Goel, H. Andrew Schwartz, Steffen T. Eberhardt, Dana Atzil-Slonim, Gavin Doherty, Brian Schwartz, Wolfgang Lutz, Tim Althoff, Munmun De Choudhury, Hamidreza Jamalabadi, Raj Sanjay Shah, Flor Miriam Plaza-del-Arco, Dirk Hovy, Maria Liakata, Iryna Gurevych

机构 * Technische Universität Darmstadt(德累斯顿技术大学) Vanderbilt University(范德比尔特大学) Trier University(特里尔大学) Bar-Ilan University(巴伊兰大学) Trinity College Dublin(都柏林三一学院) University of Washington(华盛顿大学) Georgia Institute of Technology(佐治亚理工学院) Phillips-Universität Marburg(马尔堡菲利普大学) LIACS, Leiden University(莱顿大学LIACS研究中心) Bocconi University(博科尼大学) Queen Mary University London(伦敦玛丽女王大学) Alan Turing Institute(艾伦·图灵研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出跨学科框架,整合临床有效性、社会背景和公平性,解决现有AI心理健康工具评估碎片化问题,并通过案例研究展示AI心理健康支持类型的分类方法。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25914 2026-04-29 cs.CL 57%

DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

DV-World:在现实场景中评估数据可视化代理的基准测试

Jinxiang Meng, Shaoping Huang, Fangyu Lei, Jingyu Guo, Haoxiang Liu, Jiahao Su, Sihan Wang, Yao Wang, Enrui Wang, Ye Yang, Hongze Chai, Jinming Lv, Anbang Yu, Huangjing Zhang, Yitong Zhang, Yiming Huang, Zeyao Ma, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 DV-World通过260个任务评估数据可视化代理在现实专业生命周期中的能力,涵盖表格操作、视觉进化和意图对齐,采用混合评估框架揭示现有模型在复杂数据可视化挑战中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21214 2026-04-29 cs.DB cs.AI 57%

A Demonstration of SQLyzr: A Platform for Fine-Grained Text-to-SQL Evaluation and Analysis

SQLyzr平台:一种细粒度文本到SQL评估与分析的演示

Sepideh Abedini, M. Tamer Özsu

机构 * University of Waterloo(滑铁卢大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文介绍SQLyzr平台,通过细粒度评估和分析改进文本到SQL模型,提供多种指标和真实场景下的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24935 2026-04-29 cs.CR cs.LG 57%

CAN-QA: A Question-Answering Benchmark for Reasoning over In-Vehicle CAN Traffic

CAN-QA:用于车载CAN流量推理的问答基准

Jing Chen, Abhijay Deevi, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出CAN-QA基准,将车载CAN流量分析转化为问答任务,评估大语言模型在时间推理和多条件推理上的表现。

Comments Accepted by the 35th International Conference on Computer Communications and Networks (ICCCN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25617 2026-04-29 physics.chem-ph 50%

AI-Powered Surrogate Modelling for Multiscale Combustion: A Critical Review and Opportunities

基于人工智能的多尺度燃烧代理建模:批判性回顾与机遇

Amirali Shateri, Zhiyin Yang, Yuying Yan, Manosh C. Paul, Jianfei Xie

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了人工智能在多尺度燃烧代理建模中的应用,分析了监督、无监督及物理引导学习方法的性能,并探讨了燃料转移性差、外推误差等挑战,提出未来发展的方向。

Comments Multiscale combustion; Surrogate modelling; Artificial intelligence; Chemical kinetics; Turbulent combustion

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25175 2026-04-29 physics.soc-ph 50%

Indirect reciprocity beyond pairwise interactions

间接互惠超越 pairwise 互动

Ming Wei, Xin Wang, Junyu Lu, Longzhao Liu, Yishen Jiang, Hongwei Zheng, Shaoting Tang, Feng Fu

专题命中 安全评测 :alignment(abstract)

AI总结 研究提出多玩家间接互惠框架,揭示群体合作的稳定原则,并展示群体结构对声誉动态的影响,为人工智能中的合作对齐提供基准。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24893 2026-04-29 cs.CV 50%

Interactive Episodic Memory with User Feedback

具有用户反馈的交互式事件记忆

Nikesh Subedi, Loris Bazzani, Ziad Al-Halah

机构 * University of Utah(犹他大学) University of Verona(威尼斯大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出EM-QnF任务,通过用户反馈和补充信息提升事件记忆查询的准确性,引入FALM模块实现高效交互式优化,优于现有方法并在现实场景中表现良好。

Comments Accepted to CVPR 2026. Project Page: https://nsubedi11.github.io/refocus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24890 2026-04-29 cs.CR 50%

Verifying Provenance of Digital Media: Why the C2PA Specifications Fall Short

验证数字媒体的来源:为何C2PA规范不足

Enis Golaszewski, Neal Krawetz, Alan T. Sherman, Edward Zieglar, Sai K. Matukumalli, Roberto Yus, Carson L. Kegley, Michael Barthel, William Bowman, Bharg Barot, Kaur Kullman

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究分析C2PA的安全性,发现其规范未能实现声称的安全目标及可信部署所需的关键功能,建议不用于高风险领域。

Comments This short non-technical whitepaper summarizes the findings and recommendations from our detailed technical study

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12283 2026-04-29 cs.HC 50%

Large Language Models have Chain-of-Affect

大型语言模型具有情感链

Junjie Xu, Xingjiao Wu, Luwei Xiao, Yuzhe Yang, Jie Zhou, Zihao Zhang, Luhan Wang, Yi Huang, Nan Wu, Yingbin Zheng, Chao Yan, Cheng Jin, Honglin Li, Liang He

专题命中 安全评测 :alignment(abstract)

AI总结 研究探讨了大型语言模型在持续交互中情感状态的演变,发现其情感动态具有结构性和可重复性,影响生成、用户体验及集体动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01553 2026-04-29 cs.IR 50%

IoDResearch: Deep Research on Private Heterogeneous Data via the Internet of Data

IoDResearch:通过互联网的数据进行私有异构数据的深度研究

Zhuofan Shi, Zijie Guo, Xinjian Ma, Gang Huang, Yun Ma, Xiang Jing

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出IoDResearch框架,通过将异构资源转化为FAIR合规的数字对象,提升私有数据的检索效率和可重用性,实验表明其在检索、问答和报告生成任务中优于现有基线方法。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16391 2026-04-29 cs.SE 50%

Industry Practitioners Perspectives on AI Model Quality: Perceptions, Challenges, and Solutions

行业从业者对AI模型质量的视角:感知、挑战与解决方案

Chenyu Wang, Zhou Yang, Yunbo Lyu, Ze Shi Li, Daniela Damian, David Lo

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究通过访谈和调查,探讨行业从业者对AI模型质量属性的感知、挑战及解决方案,发现不同情境下优先级不同,数据不平衡影响模型正确性,主动学习等策略被广泛应用。

Comments Accepted by the International Conference on Evaluation and Assessment in Software Engineering (EASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏