arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-15 至 2026-04-15 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 17 篇

2604.12875 2026-04-15 cs.AI 88%

AISafetyBenchExplorer: A Metric-Aware Catalogue of AI Safety Benchmarks Reveals Fragmented Measurement and Weak Benchmark Governance

AISafetyBenchExplorer:一个基于指标的AI安全基准目录揭示了测量碎片化和弱基准治理

Abiodun A. Solanke

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 本文提出AISafetyBenchExplorer,通过多表结构记录195个AI安全基准的元数据、指标定义等,揭示当前基准体系中测量标准化滞后于基准繁衍的问题,强调碎片化而非稀缺性是领域的主要失败模式。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11120 2026-04-15 cs.AI 83%

Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs

不受欢迎的人:针对具有人格特征的LLM,单一方法的安全性评估是不完整的

Wenkai Li, Fan Yang, Shaunak A. Mehta, Koichi Onoue

机构 * Carnegie Mellon University(卡内基梅隆大学) Fujitsu Research of America Inc.(富士通美国研究公司)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文指出,针对具有人格特征的LLM,仅通过提示进行的安全性评估不完整,因为提示和激活引导暴露了不同的、依赖于架构的漏洞特征。研究显示,激活引导的漏洞无法通过提示侧排名预测,且在不同架构模型中表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12216 2026-04-15 cs.CR cs.CL 79%

TimeMark: A Trustworthy Time Watermarking Framework for Exact Generation-Time Recovery from AIGC

TimeMark: 一种用于从AIGC中精确生成时间恢复的可信时间水印框架

Shangkun Che, Silin Du, Ge Gao

机构 * Economics and Management School, Wuhan University(武汉大学经济管理学院) School of Economics and Management, Tsinghua University(清华大学经济管理学院) School of Business Administration, Southwestern University of Finance and Economics(西南财经大学商学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 本文提出TimeMark框架,通过加密技术和监管监督下的时间依赖秘密密钥,实现100%准确的生成时间恢复,防止任意时间戳伪造,解决现有水印技术的可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12411 2026-04-15 cs.CV 78%

DeferredSeg: A Multi-Expert Deferral Framework for Trustworthy Medical Image Segmentation

DeferredSeg: 一种多专家延迟框架用于可信的医学图像分割

Qiuyu Tian, Haoliang Sun, Yunshan Wang, Yinghuan Shi, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Department of Clinical Laboratory, Shandong Provincial Hospital Affiliated to Shandong First Medical University(山东第一医科大学附属山东省人民医院临床检验科) School of Computer Science and Technology, Nanjing University(南京大学计算机科学与技术学院)

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 DeferredSeg通过引入延迟感知分割框架,在医学图像分割中实现人机协作,通过动态路由和损失函数提升分割可靠性,优于基线方法。

Comments 27 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11868 2026-04-15 cs.CV 67%

MedConcept: Unsupervised Concept Discovery for Interpretability in Medical VLMs

MedConcept: 医学视觉语言模型中的无监督概念发现以实现可解释性

Md Rakibul Haque, KM Arefeen Sultan, Tushar Kataria, Shireen Elhabian

机构 * Kahlert School of Computing, University of Utah Scientific Computing(犹他大学计算学校科学计算) Imaging Institute, University of Utah(犹他大学影像研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 MedConcept通过无监督方法发现医学VLMs中的潜在概念,并利用临床可验证的文本语义进行解释,提供定量评估协议和三个概念评分以评估模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07178 2026-04-15 cs.AI cs.HC cs.LG 62%

ContextualSHAP : Enhancing SHAP Explanations Through Contextual Language Generation

ContextualSHAP:通过上下文语言生成增强SHAP解释

Latifa Dwiyanti, Sergio Ryan Wibisono, Hidetaka Nambo

机构 * Kanazawa University(金泽大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结合大语言模型生成上下文解释的ContextualSHAP,提升SHAP解释的可理解性与实用性,通过医疗案例验证其有效性。

Comments This paper was accepted and presented at the 7th World Symposium on Software Engineering (WSSE) 2025 on 25 October 2025 in Okayama, Japan, and is currently awaiting publication

Journal ref WSSE '25: Proceedings of the 2025 7th World Symposium on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05795 2026-04-15 cs.CL 57%

Measuring What Matters!! Assessing Therapeutic Principles in Mental-Health Conversation

衡量重要性!!评估心理健康对话中的治疗原则

Abdullah Mazhar, Het Riteshkumar Shah, Aseem Srivastava, Smriti Joshi, Md Shad Akhtar

机构 * IIIT Delhi(印度德里理工学院) MBZUAI(马尔科姆·比尔人工智能研究所) Wysa

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出CARE框架,通过多阶段方法评估AI生成的治疗回应是否符合临床标准,实验显示其在F-1分数上优于基线模型,展示了结构化推理和上下文建模的重要性。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12282 2026-04-15 cs.CL 57%

Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning

面向多代理多格式推理的鲁棒现实世界电子表格理解

Houxing Ren, Mingjie Zhan, Zimu Lu, Ke Wang, Yunqiao Yang, Haotian Hou, Hongsheng Li

机构 * CUHK MMLab(CUHK多模态实验室) SenseTime Research(商汤科技研究院) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出SpreadsheetAgent框架,通过多模态逐步阅读推理解决大规模电子表格处理问题,通过结构草图和行列摘要提升推理可靠性,实验表明其在Spreadsheet Bench上表现优异。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12034 2026-04-15 cs.AI 57%

Memory as Metabolism: A Design for Companion Knowledge Systems

记忆作为代谢:一种陪伴知识系统的 设计

Stefan Miteski

机构 * CODE University Berlin(CODE大学柏林)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种针对单用户知识维基的治理框架,通过五项操作处理记忆中的矛盾证据,以避免固化问题。

Comments 41 pages, 1 table. Preprint v3.642. Concept DOI: 10.5281/zenodo.19501651

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06390 2026-04-15 cs.CV cs.AI 57%

MorphDistill: Distilling Unified Morphological Knowledge from Pathology Foundation Models for Colorectal Cancer Survival Prediction

MorphDistill: 从病理基础模型中提取统一形态学知识以预测结直肠癌生存率

Hikmat Khan, Usama Sajjad, Metin N. Gurcan, Anil Parwani, Wendy L. Frankel, Wei Chen, Muhammad Khalid Khan Niazi

机构 * Department of Pathology, College of Medicine, The Ohio State University Wexner Medical Center(俄亥俄州立大学医学学院病理学系,韦克斯纳医学中心) Center for Artificial Intelligence Research, Wake Forest University School of Medicine(威克森林大学医学院人工智能研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出MorphDistill框架,通过多病理基础模型提取互补知识,构建紧凑的结直肠癌特异性编码器,提升生存预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12793 2026-04-15 cs.HC 56%

Human Agency, Causality, and the Human Computer Interface in High-Stakes Artificial Intelligence

人类代理、因果性与高风险人工智能中的人机接口

Georges Hattab

专题命中 安全评测 :trustworthy(abstract);alignment(comments)

AI总结 本文探讨高风险人工智能系统中人类代理的保护问题,提出因果代理框架以解决人机交互中的不确定性与因果控制问题。

Comments 2026 CHI Workshop on Human-AI Interaction Alignment: Designing, Evaluating, and Evolving Value-Centered AI For Reciprocal Human-AI Futures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12833 2026-04-15 cs.CV 50%

Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks

用可部署的多模态语义照明攻击挑战视觉-语言模型

Yingying Zhao, Chengyin Hu, Qike Zhang, Xin Li, Xin Wang, Yiwei Wei, Jiujiang Guo, Jiahuan Long, Tingsong Jiang, Wen Yao

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出MSLA攻击框架,通过可控对抗性照明攻击视觉-语言模型的多模态语义理解,揭示其在现实世界中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12781 2026-04-15 cs.CV 50%

Fragile Reconstruction: Adversarial Vulnerability of Reconstruction-Based Detectors for Diffusion-Generated Images

脆弱的重建:基于重建的检测器在扩散生成图像中的对抗脆弱性

Haoyang Jiang, Mingyang Yi, Shaolei Zhang, Junxian Cai, Qingbin Liu, Xi Chen, Ju Fan

机构 * Renmin University of China(中国人民大学) Tencent Inc.(腾讯公司)

专题命中 安全评测 :safety(abstract)

AI总结 研究发现基于重建的检测器在扩散生成图像检测中存在严重对抗脆弱性,通过微小对抗扰动可使检测准确率降至近零,揭示了现有检测策略的安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12693 2026-04-15 cs.CV 50%

Risk-Calibrated Learning: Minimizing Fatal Errors in Medical AI

风险校准学习:在医学AI中最小化致命错误

Abolfazl Mohammadi-Seif, Ricardo Baeza-Yates

机构 * Department of Engineering(工程系) Universitat Pompeu Fabra(庞培乌法拉大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出风险校准学习方法,通过区分视觉模糊与结构性错误,提升医学AI的可靠性,实验表明其在多种影像模态中显著降低关键错误率。

Comments This work has been accepted for publication in the Proceedings of the 2026 International Joint Conference on Neural Networks (IJCNN 2026). The final published version should be cited

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11767 2026-04-15 cs.PL cs.MA cs.SE 50%

$λ_A$: A Typed Lambda Calculus for LLM Agent Composition

$λ_A$: 一种用于LLM代理组合的类型lambda演算

Qin Liu

专题命中 安全评测 :safety(abstract)

AI总结 本文提出$λ_A$类型lambda演算,通过引入oracle调用、有界固定点、概率选择和可变环境扩展简单类型lambda演算,证明类型安全性和终止性,并展示其在代理配置检测中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12403 2026-04-15 cs.CV 50%

Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning

双模锚引导过滤用于测试时提示微调

Jungwon Choi, Eunwoo Kim

机构 * School of Computer Science and Engineering, Chung-Ang University(Chung-Ang大学计算机科学与工程学院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出双模锚引导框架,通过语义证据指导视图选择,结合文本和图像锚点进行过滤和集成,提升测试时提示微调的鲁棒性。

Comments Accepted by CVPR 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12048 2026-04-15 cs.SE 50%

ORBIT: Guided Agentic Orchestration for Autonomous C-to-Rust Transpilation

ORBIT: 用于自主C到Rust转换的引导代理 orchestration

Muhammad Farrukh, Baris Coskun, Tapti Palit, Michalis Polychronakis

专题命中 安全评测 :safety(abstract)

AI总结 ORBIT 提出一种自主代理框架,通过动态上下文收集和依赖引导 orchestration 实现项目级 C到Rust转换,显著提升大规模代码转换的准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏