arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-30 至 2026-04-30 共收录 19 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 19 篇

2602.08373 2026-04-30 cs.AI cs.LG 84%

Grounding Generative Planners in Verifiable Logic: A Hybrid Architecture for Trustworthy Embodied AI

基于可验证逻辑的生成规划器:一种可信具身AI的混合架构

Feiyu Wu, Xu Zheng, Yue Qu, Zhuocheng Wang, Zicheng Feng, Hui Li

机构 * School of Cyber Engineering, Xidian University(电子科技大学信息工程学院)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VIRF框架,通过逻辑导师与LLM的对话机制实现主动协作,提升具身AI的安全性与可靠性,实验显示其在家庭安全任务中表现优异。

Comments Accepted to ICLR 2026. Project page. https://openreview.net/forum?id=wb05ver1k8&noteId=v1Ax8CwI71

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22134 2026-04-30 cs.CL 83%

SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs

SHAPE:统一安全、帮助性和教学法以用于教育LLM

Sihang Zhao, Kangrui Yu, Youliang Yuan, Pinjia He, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(纽约大学上海数据科学中心) Courant Institute of Mathematical Sciences, New York University(纽约大学Courant数学科学研究所) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出SHAPE基准,通过知识掌握图统一安全、帮助性和教学行为,改进教育LLM在对抗压力下的安全性和帮助性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10924 2026-04-30 cs.CL cs.AI cs.CR cs.CV cs.SE 81%

A Survey on the Safety and Security Threats of Computer-Using Agents: JARVIS or Ultron?

对计算机使用代理的安全性和安全威胁的综述:贾维斯或乌tron?

Ada Chen, Yongjiang Wu, Junyuan Zhang, Jingyu Xiao, Shu Yang, Jen-tse Huang, Kun Wang, Wenxuan Wang, Shuai Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) KAUST(卡塔尔科技大学) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) The Hong Kong University of Science and Technology(香港科学大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了计算机使用代理的安全威胁,定义了安全分析适用的代理类型,分类了当前的安全威胁,提出了防御策略的分类,并总结了评估代理安全性和性能的基准、数据集和评估指标。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25982 2026-04-30 cs.LG cs.AI cs.CY cs.ET 80%

Open Problems in Frontier AI Risk Management

前沿人工智能风险管理中的开放问题

Marta Ziosi, Miro Plueckebaum, Stephen Casper, Henry Papadatos, Ze Shen Chin, Peter Slattery, James Gealy, Tim G. J. Rudner, Brian Tse, Ariel Gil, Patricia Paskov, Maximilian Negele, Rokas Gipiškis, Nada Madkour, Vera Lummis, Rupal Jain, Luise Eder, Kristina Fort, Malou C. van Draanen Glismann, Inès Belhadj, Amin Oueslati, Anna K. Wisakanto, Richard Mallah, Koen Holtman, Ranj Zuhdi, Daniel S. Schiff, Jessica Newman, Malcolm Murray, Robert Trager

机构 * Oxford Martin AI Governance Initiative, University of Oxford(牛津大学人工智能治理倡议) MIT Computer Science and Artificial Intelligence Laboratory, MIT(麻省理工学院计算机科学与人工智能实验室) MIT Future Tech(麻省理工学院未来技术) Stanford University(斯坦福大学) Governance and Responsible AI Lab, Purdue University(普渡大学治理与负责任的人工智能实验室) University of Toronto(多伦多大学) Mercatus Center, George Mason University(乔治·马歇尔大学麦卡锡中心) Vilnius University(维尔纽斯大学) Vijil SaferAI AI Standards Lab(人工智能标准实验室) The Future Society(未来社会) Concordia AI(康科德人工智能) Pivotal Research Center for AI Risk Management & Alignment(人工智能风险管理和对齐中心) UC Berkeley Center for Long-Term Cybersecurity(伯克利大学长期网络安全中心) Independent(独立)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文探讨前沿人工智能风险管理中的核心问题,通过文献综述识别未解决的挑战,并分类问题类型以指导未来研究与治理。

Comments 81 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26411 2026-04-30 cs.LG 79%

Unifying Runtime Monitoring Approaches for Safety-Critical Machine Learning: Application to Vision-Based Landing

统一运行时监控方法以确保安全关键机器学习:应用于基于视觉的着陆

Mathieu Dario, Florent Chenevier, Kévin Delmas, Joris Guerin, Jérémie Guiochet

机构 * LAAS-CNRS(法国图卢兹Laas--cnrs研究所) University of Toulouse(图卢兹大学) Thales(泰勒斯) ONERA(法国国家航空器研究与测试中心) Espace-Dev, IRD, Université de Montpellier(Espace-Dev, 法国国家农业与食品研发机构, 图卢兹大学) Universidade Federal do Rio Grande do Norte(巴西北里奥格兰德联邦大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出统一框架,将运行时监控分为三种类型,通过航空安全应用实验验证其有效性,促进监控设计与评估。

Comments 15 pages, 5 figures, 3 tables, submitted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14858 2026-04-30 cs.AI cs.SE 79%

Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-Codex

轨迹安全评估与诊断的基准测试:OpenClaw和Codex中的ATBench-Claw和ATBench-Codex

Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出ATBench-Claw和ATBench-Codex,用于评估和诊断OpenClaw和Codex环境中的轨迹安全,通过定制安全分类法实现基准测试的可扩展性。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03992 2026-04-30 cs.CV cs.AI 77%

Value-Guided Iterative Refinement and the DIQ-H Benchmark for Evaluating VLM Robustness

基于价值引导的迭代精炼与DIQ-H基准:评估VLM鲁棒性的新方法

Hanwen Wan, Zexin Lin, Yixuan Deng, Xiaoqiang Ji

机构 * The School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) The School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) The Shenzhen Institute of Artificial Intelligence and Robotics for Society, Shenzhen, China(深圳人工智能与机器人社会研究院)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出DIQ-H基准和VIR框架,通过模拟真实世界压力源评估VLM在连续序列中的鲁棒性,提升误差恢复和伦理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24966 2026-04-30 cs.CY cs.AI 73%

Risk Reporting for Developers' Internal AI Model Use

为开发者内部AI模型使用进行风险报告

Oscar Delaney, Sambhav Maheshwari, Joe O'Brien, Theo Bearman, Oliver Guest

机构 * IAPS

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了前沿AI公司内部部署先进模型的风险管理,提出统一的风险报告标准,帮助开发者和监管机构识别和管理内部AI使用中的潜在风险。

Comments 31 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25067 2026-04-30 cs.MA cs.AI cs.LG 73%

Frontier Coding Agents Can Now Implement an AlphaZero Self-Play Machine Learning Pipeline For Connect Four That Performs Comparably to an External Solver

前沿编码代理如今可以实现一个AlphaZero自博弈机器学习流水线用于连接四游戏,其性能可与外部求解器相媲美

Joshua Sherwood, Ben Aybar, Benjamin Kaplan

机构 * Department of Computer Science(计算机科学系) University of Chicago(芝加哥大学) Independent Researcher(独立研究员)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基准测试,评估前沿编码代理自主实现AlphaZero式机器学习流水线的能力,通过简洁任务描述而非完整前序工作参考,评估连接四游戏AI性能,发现Claude Opus 4.7在七次试验中胜过Pons求解器,其他代理表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26679 2026-04-30 cs.HC 71%

MultEval: Supporting Collaborative Alignment for LLM-as-a-Judge Evaluation Criteria

MultEval: 支持LLM-as-a-Judge评估标准的协作对齐

Charles Chiang, Simret Gebreegziabher, Annalisa Szymanski, Yukun Yang, Hyo Jin Do, Zahra Ashktorab, Werner Geyer, Toby Li, Diego Gomez-Zara

专题命中 安全评测 :alignment(title)

AI总结 研究探讨了LLM-as-a-Judge评估标准的协作制定过程,提出MultEval系统支持多方协商和迭代修订标准,提升评估透明度与一致性。

Comments 17 pages, 5 figures

Journal ref Proceedings of the 5th Annual Symposium on Human-Computer Interaction for Work (CHIWORK '26), June 22--25, 2026, Linz, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26671 2026-04-30 cs.CL cs.AI cs.CY 67%

From Black-Box Confidence to Measurable Trust in Clinical AI: A Framework for Evidence, Supervision, and Staged Autonomy

从黑盒信心到可测量的信任:临床AI可信框架的构建

Serhii Zabolotnii, Viktoriia Holinko, Olha Antonenko

机构 * Cherkasy State Business College(切尔卡西州商业学院) healthPrecision

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出一个基于证据、监督和分阶段自主的临床AI可信框架,通过模块化提示和层级升级机制提升信任度,强调信任是系统属性而非单一模型属性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04325 2026-04-30 cs.CL cs.AI cs.CV cs.LG cs.MM 67%

Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models

超越排行榜:重新思考大型语言模型的医疗基准

Wenting Chen, Guo Yu, Yiu-Fai Cheung, Meidan Ding, Jie Liu, Zizhan Ma, Wenxuan Wang, Linlin Shen

机构 * Stanford University(斯坦福大学) Shenzhen University(深圳大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MedCheck框架,用于评估医疗领域大型语言模型的基准,揭示现有基准在临床相关性、数据完整性及安全性方面的系统性问题。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01929 2026-04-30 cs.SD cs.AI cs.LG 62%

Woosh: A Sound Effects Foundation Model

Woosh:一种声音效果基础模型

Gaëtan Hadjeres, Marc Ferras, Khaled Koutini, Benno Weck, Alexandre Bittar, Thomas Hummel, Zineb Lahrichi, Hakim Missoum, Joan Serrà, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍了Sony AI发布的Woosh声音效果基础模型,提供高质量音频编码器/解码器、文本-音频对齐模型及文本到音频和视频到音频生成模型,展示了其在公开和私有数据上的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26630 2026-04-30 cs.CL 57%

SAGE: A Strategy-Aware Graph-Enhanced Generation Framework For Online Counseling

SAGE:一种面向在线咨询的策略感知图增强生成框架

Eliya Naomi Aharon, Meytal Grimland, Avi Segal, Loona Ben Dayan, Inbar Shenfeld, Yossi Levi Belz, Kobi Gal

机构 * Ben-Gurion University of the Negev(贝叶特·沙瓦大学) University of Haifa(海法大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 SAGE通过整合心理框架和实时压力信号,提升在线咨询的策略预测与响应质量,为高风险危机咨询提供决策支持工具。

Comments Full version of the work accepted as a short paper at the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26). 9 pages, 4 figures, 5 tables

Journal ref Proceedings of the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26), June 08--11, 2026, Gothenburg, Sweden

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25960 2026-04-30 cs.SE cs.LG cs.PL 57%

Large Language Models for Multilingual Code Intelligence: A Survey

大型语言模型用于多语言代码智能:综述

Chao Jiang, Dugang Liu, Cheng Wen, Zhiwu Xu, Hua Zheng, Muhammad Sadiq, Jawwad Ahmed Shamsi, Shengchao Qin, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Guangzhou Institute of Technology, Xidian University, China(广州理工大学,西安电子科技大学,中国) Guangzhou University of Software, China(广州软件大学,中国) Shenzhen University of Information Technology(深圳信息大学) National University of Computer and Emerging Sciences Karachi, Pakistan(巴基斯坦卡拉奇国家计算机与新兴科学大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文综述了多语言代码生成与翻译的关键任务,探讨了现有方法、基准和评估指标,指出多语言代码智能在现实系统中的重要性及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26614 2026-04-30 cs.CV 50%

State Beyond Appearance: Diagnosing and Improving State Consistency in Dial-Based Measurement Reading

超越外观:诊断并改进基于指针的测量读数中的状态一致性

Yuanze Hu, Gen Li, Yuqin Lan, Qingchen Yu, Zhichao Yang, Junwei Jing, Zhaoxin Fan, Xiaotie Deng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) Beihang University(北航) Fudan University(复旦大学) Peking University(北京大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文研究了多模态大语言模型在指针式测量读数任务中的表现问题,发现现有模型在状态一致性上存在缺陷,提出TriSCA框架以提升状态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26352 2026-04-30 cs.HC 50%

UIGaze: How Closely Can VLMs Approximate Human Visual Attention on User Interfaces?

UIGaze: VLMs在用户界面上如何接近人类视觉注意力?

Min Song, Yoonseong Lee, Yeonhu Seo

专题命中 安全评测 :alignment(abstract)

AI总结 UIGaze研究VLMs在用户界面中预测人类视觉注意力的能力,通过零样本坐标预测管道评估九种先进模型,发现VLMs在不同UI类型和更长时间观看中表现出不同程度的匹配。

Comments 6 pages, 4 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26079 2026-04-30 cs.CR 50%

Large Language Models as Explainable Cyberattack Detectors for Energy Industrial Control Systems

大语言模型作为可解释的网络攻击检测器用于能源工业控制系统

Weiyi Kong, Ahmad Mohammad Saber, Amr Youssef, Deepa Kundur

专题命中 安全评测 :safety(abstract)

AI总结 本文研究了大语言模型在工业控制系统中检测Modbus流量攻击的可行性,通过二分类任务实现对异常行为的检测,并生成可审计的事件记录。

Comments Accepted to ACM EnergySP 2026, co-located with ACM e-Energy 2026. Author accepted manuscript. 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02731 2026-04-30 cs.SD cs.CV cs.MM 50%

Omni2Sound: Towards Unified Video-Text-to-Audio Generation

Omni2Sound:迈向统一的视频-文本到音频生成

Yusheng Dai, Zehua Chen, Yuxuan Jiang, Baolong Gao, Qiuhong Ke, Jianfei Cai, Jun Zhu

机构 * Tsinghua University(清华大学) Monash University(莫纳什大学) Shengshu AI(盛数人工智能)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出Omni2Sound模型,解决视频-音频、文本-音频及联合视频-文本-音频生成中的数据稀缺与任务竞争问题,通过SoundAtlas数据集和三阶段训练策略实现统一生成。

详情

展开后加载摘要…

URL PDF HTML 收藏