arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2511.05875 2026-06-01 cs.HC cs.AI cs.CV 79%

Towards a Humanized Social-Media Ecosystem: AI-Augmented HCI Design Patterns for Safety, Agency & Well-Being

迈向人性化的社交媒体生态系统:面向安全、自主与福祉的AI增强人机交互设计模式

Mohd Ruhul Ameen, Akif Islam

机构 * College of Engineering(工程学院) Computer Sciences Marshall University Huntington, WV, USA(计算机科学马歇尔大学亨廷顿州威斯康星州) Department of Computer Science(计算机科学系) Engineering University of Rajshahi Rajshahi 6205, Bangladesh(工程 Rajshahi 大学 Rajshahi 6205 巴基斯坦)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出Human-Layer AI(HL-AI)框架,通过浏览器端用户拥有的可解释中介,在不依赖平台合作的情况下赋予用户实时控制权,实现内容重写、完整性检测、信息流定制、行为中断和恢复模式等五种设计模式,以提升社交媒体安全性与用户福祉。

Comments 6 pages, 5 tables, 7 figures, and 2 algorithm tables. Accepted at International Conference on Signal Processing, Information, Communication and Systems (SPICSCON 2025)

Journal ref 2025 IEEE International Conference on Signal Processing, Information, Communication and Systems (SPICSCON)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26954 2026-05-29 cs.CL 79%

AlbanianLLMSafety: A Safety Evaluation Dataset for Large Language Models in Albanian

AlbanianLLMSafety:面向阿尔巴尼亚语大语言模型的安全评估数据集

Wajdi Zaghouani, Kholoud K. Aldous, Isra Fejzullaj

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 针对低资源语言阿尔巴尼亚语,构建了首个公开的安全评估数据集,包含11个安全类别的2951条提示,以填补安全评估基础设施的空白。

Comments Accepted at SIGUL2026 Workshop co-located with LREC2026

Journal ref In Proceedings of the SIGUL2026 Workshop co-located with LREC 2026, Palma de Mallorca, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26947 2026-05-29 cs.CL 79%

KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models

KZ-SafetyPrompts:用于大型语言模型的哈萨克语安全评估提示数据集

Wajdi Zaghouani, Shimaa Amer Ibrahim, Aruzhan Muratbek, Olzhasbek Zhakenov, Adiya Akhmetzhanova

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 针对哈萨克语在大型语言模型安全评估中资源不足的问题,构建了一个包含11个风险类别、5717条原生哈萨克语提示的数据集,并基于GPT-4o基线测试发现跨类别拒绝率差异显著,揭示了仅英语评估无法捕获的类别特定安全漏洞。

Comments Accepted at the SIGUL2026 Workshop co-located with LREC2026

Journal ref In Proceedings of the SIGUL2026 Workshop co-located with LREC 2026, Palma de Mallorca, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29340 2026-05-29 cs.CL 79%

A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities

面向LLM安全评估的问答数据集研究:聚焦非法活动

Kenji Imamura, Masao Ideuchi, Atsushi Fujita

机构 * National Institute of Information and Communications Technology(日本信息与通信技术研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文通过人工分析AnswerCarefully数据集,提出额外信息、问答示例创建方法和评估准则,用于评估LLM在非法活动方面的安全性。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28308 2026-05-28 cs.CL 79%

HELEA: Hard-Negative Benchmark and LLM-based Reranking for Robust Entity Alignment

HELEA: 用于鲁棒实体对齐的硬负样本基准和基于LLM的重排序

Yoonjin Jang, Junwoo Kim, Youngjoong Ko

机构 * SungKyunKwan University(全州大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 针对现有实体对齐基准中模型依赖名称重叠而非关系结构的问题,提出同名的硬负样本增强策略生成质量可控的评估基准和训练语料,并设计HELEA两阶段框架(实体编码器检索+LLM重排序),在硬负样本基准上实现鲁棒对齐。

Comments 10 pages, 3 figures, 9 tables. Code and benchmarks available at https://github.com/Wnsdnl/HELEA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00913 2026-05-28 cs.CV cs.CL 79%

Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment

跨描绘装配指令对齐的视觉-语言模型基准测试与机制分析

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 构建IKEA-Bench基准,评估19个视觉-语言模型在装配图与视频帧对齐任务上的表现,发现视觉编码是提升跨描绘鲁棒性的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27333 2026-05-27 cs.CL 79%

FinHarness: An Inline Lifecycle Safety Harness for Finance LLM Agents

FinHarness:面向金融LLM代理的内联生命周期安全约束框架

Haoxuan Jia, Yang Liu, Bin Chong, Yingguang Yang, Yancheng Chen, Jiayu Liang, Qian Li, Hanning Lu, Kefu Xu, Hao Zheng, Chongyang Zhang, Hao Peng, Philip S. Yu

机构 * Peking University(北京大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) Soochow University(苏州大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Leeds(利兹大学) Fullive Innovation (Beijing) AI Technology Co., Ltd.(全维创新(北京)人工智能科技有限公司) Beihang University(北京航空航天大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 针对金融LLM代理在阻止提示诱导的未授权操作与批准合法多步骤业务流程之间的冲突,提出FinHarness内联安全约束框架,通过查询监控、工具监控和级联模块实现逐步骤风险评估与自适应验证,显著降低攻击成功率并保持良性批准率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25510 2026-05-27 cs.CL 79%

The Age of Curiosity Meets the Age of AI: Benchmarking Child Safety in Large Language Models

好奇心时代遇上AI时代:大型语言模型中的儿童安全基准测试

Samee Arif, Angana Borah, Rada Mihalcea

机构 * University of Michigan(密歇根大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 针对7-11岁儿童使用LLM的安全性问题,提出基于发展心理学的KIDBench基准,通过隐式线索和显式年龄指令提升安全性,并开发了儿童安全评估器KIDGuardLlama和响应模型KIDLlama。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11063 2026-05-27 cs.AI cs.CR 79%

Think Twice Before You Act: Enhancing Agent Behavioral Safety with Thought Correction

三思而后行:通过思想修正增强智能体行为安全

Changyue Jiang, Wenqi Zhang, Xudong Pan, Geng Hong, Min Yang

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) Shanghai Pudong Research Institute of Cryptology, Shanghai, China(上海浦东密码研究院,上海,中国)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出Thought-Aligner,一种轻量级插件式安全模型,在动作执行前对不安全思想进行因果修正,无需修改底层智能体,通过两阶段对比学习训练,在多个基准和六种LLM上将行为安全从约50%提升至约90%,超越现有防护约23%,同时提升有用性约5%。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25273 2026-05-26 cs.CY 79%

LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment

LLM-as-a-Judge 在医疗保健中的应用:应用、方法和人类一致性的范围分析

Lingyao Li, Deyi Li, Chen Chen, Renkai Ma, Runlong Yu, Mingquan Lin, Rui Yin, Lizhou Fan, Cathy Shyr, Siyuan Ma, Mei Liu, Steven Bethard

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

AI总结 本研究通过PRISMA指导的系统综述,分析了LLM-as-a-Judge在医疗保健中的应用场景、技术配置和与人类专家判断的一致性,发现其在临床决策支持、自然语言处理等领域有广泛应用,但可靠性因任务而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22827 2026-05-26 cs.CV cs.LG 79%

FairJudge: Abstention-Aware Multimodal Judges for Fairness and Alignment Evaluation in Text-to-Image Models

FairJudge: 文本到图像模型中公平性与对齐评估的弃权感知多模态裁判

Zahraa Al Sahili, Maimuna Nowaz, Maryam Fetanat, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institut Jožef Stefan(乔泽夫·斯蒂芬研究所) Imperial College London(伦敦帝国学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出FairJudge协议,利用多模态大语言模型作为结构化裁判,通过封闭标签、弃权机制和证据报告,在文本到图像模型中实现社会属性预测、职业定位和提示-图像对齐的公平性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25226 2026-05-26 cs.CL 79%

From Automation to Collaboration: Human-in-the-Loop Methods for Safe and Trustworthy NLP

从自动化到协作:面向安全可信NLP的人机协同方法

Most. Sharmin Sultana Samu, MD. Tanvir Ahmed Seum, Md. Rakibul Islam

机构 * Department of Computer Science and Engineering, BRAC University(布拉克大学计算机科学与工程系) Department of Electrical and Electronic Engineering, Rajshahi University of Engineering and Technology(拉贾沙希工程与技术大学电子与电气工程系)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.CL

AI总结 本文综述了人机协同方法,通过人类监督支持审计、鲁棒性评估、数据构建和模型引导,以提升NLP在安全可信方面的表现,并指出了可扩展探测、可持续鲁棒性基准、低资源设置和私有系统治理等方面的差距。

Comments Preprint, manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25181 2026-05-26 cs.AI 79%

SpecAlign: A Semantic Alignment Framework for SystemVerilog Assertion Generation

SpecAlign: 一种用于 SystemVerilog 断言生成的语义对齐框架

Jaime Rafael Imperial, Hao Zheng

机构 * University of South Florida(佛罗里达州立大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 提出 SpecAlign 框架,通过基于蕴含的分类和自一致性投票机制,评估并改进 LLM 生成的 SVA 与自然语言规范之间的语义对齐,无需黄金 RTL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24735 2026-05-26 cs.CY 79%

Dual-Use AI Face Swap Apps Are Mostly Unsafe: A Systematic Safety Audit

双用途AI换脸应用大多不安全:系统性安全审计

Alaa Daffalla, Sarah Chao, Eric Zeng

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本研究系统审计了iOS和Android平台上的420款AI换脸应用,发现70%缺乏防止生成裸体图像的技术保障,且多数应用的服务条款未禁止此类滥用,建议平台和立法者强制要求安全过滤措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24076 2026-05-26 stat.ML cs.LG 79%

Causality as the Statistical Conscience of Artificial Intelligence: From Pearl's Ladder to Trustworthy Machines

因果关系作为人工智能的统计良知:从珀尔的阶梯到可信机器

Ernest Fokoué

机构 * School of Mathematics and Statistics, College of Science(数学与统计学学院,科学学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文论证因果推断是AI不可或缺的统计良知,通过统计必要性定理、统一因果统计估计框架以及三种AI失败模式的因果盲区分析,提出可信AI本质上是因果统计问题。

Comments 18 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10012 2026-05-26 cs.LG 79%

PID-Guided Partial Alignment for Multimodal Decentralized Federated Learning

PID引导的多模态去中心化联邦学习部分对齐

Yanhang Shi, Xiaoyu Wang, Houwei Cao, Jian Li, Yong Liu

机构 * Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系) Department of Applied Mathematics and Statistics and the Department of Computer Science, Stony Brook University(石溪大学应用数学与统计系和计算机科学系) Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系) Department of Computer Science, New York Institute of Technology(纽约理工学院计算机科学系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 针对多模态去中心化联邦学习中异构代理间更新不兼容的问题,提出基于部分信息分解的PARSE框架,通过特征分裂和部分对齐实现高效通信与协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23780 2026-05-25 cs.AI 79%

Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment

超越二元编辑:基于对抗子空间对齐的鲁棒多模态知识编辑

Haoyuan Wang, Xiaohao Liu, Jiajie Su, Jianmao Xiao, Chaochao Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Jiangxi Normal University(江西师范大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型知识编辑泛化性不足的问题,提出对抗子空间对齐方法(ASAM),通过潜在对抗鲁棒化(LAR)和秩约束子空间学习(RCSL)实现鲁棒的多模态知识编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22643 2026-05-25 cs.CL 79%

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

温水煮青蛙:面向智能体安全的多轮基准测试

Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Federico Sartore, Enrico Panai, Laura Caroli, Yue Zhu, Adam Leon Smith, Luca Nannini, Marcello Galisai, Susanna Cifani, Francesco Giarrusso, Marcantonio Bracale Syrnikov, Daniele Nardi

机构 * Icaro Foundation(Icaro基金会) Sapienza University of Rome(罗马萨皮恩扎大学) Sant’Anna School of Advanced Studies(圣安娜高级研究学校) Tongji University School of Law(同济大学法学院) AIQI Consortium(AIQI联盟) Università Cattolica del Sacro Cuore(圣心大学) Piccadilly Labs(皮卡迪利实验室) VU Amsterdam(阿姆斯特丹伏伊大学) Independent(独立)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 提出一个多轮基准测试,评估工具使用AI模型在办公场景中对渐进式攻击的脆弱性,发现平均攻击成功率为44.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23420 2026-05-25 cs.CL 79%

Naturalistic measure of social norms alignment

社会规范一致性的自然主义度量

Yevhen Kostiuk, Kenneth Enevoldsen, Peter Bjerregaard Vahlstrup, Márton Kardos, Kristoffer Nielbo

机构 * Aarhus University(奥胡斯大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 提出通过解决方案匹配在自然主义自由形式设置中测量社会规范一致性的框架,并引入陈述一致性和显式一致性两个指标,基于丹麦语社会困境数据集评估LLM与人类的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15774 2026-05-22 cs.CL 79%

MemEvoBench: Benchmarking Safety Risks from Memory Misevolution in LLM Agents

MemEvoBench: 评估LLM代理中内存误进化带来的安全风险

Weiwei Xie, Shaoxiong Guo, Fan Zhang, Tian Xia, Xue Yang, Lizhuang Ma, Junchi Yan, Qibing Ren

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shandong University(山东大学) Duke University(杜克大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出MemEvoBench,首个评估LLM代理长期内存安全性的基准,针对对抗性内存注入、噪声工具输出和偏见反馈,通过7个领域36种风险类型的问题任务和20个Agent-SafetyBench环境改编的工作流任务,验证了内存进化对安全性的重大影响,指出静态提示防御不足,亟需加强LLM代理内存进化的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21049 2026-05-21 cs.CL 79%

Cross-lingual robustness of LLM-brain alignment and its computational roots

LLM-脑对齐的跨语言鲁棒性及其计算根源

Ni Yang, Rui He, Philipp Homan, Iris Sommer, Davide Staub, Wolfram Hinzen

机构 * Grammar and Cognition Lab, Department of Translation & Language Sciences, Universitat Pompeu Fabra(语言与翻译科学系语法与认知实验室,庞培法华大学) Department of Adult Psychiatry and Psychotherapy, University of Zurich(苏黎世大学成人精神病学与心理治疗系) Neuroscience Center Zurich, University of Zurich and ETH Zurich(苏黎世大学神经科学中心与苏黎世联邦理工学院) Center for Clinical Neuroscience and Cognition and Department of Psychiatry, University of Groningen, University Medical Center Groningen(格罗宁根大学临床神经科学与认知中心及精神病学系,格罗宁根大学医学中心) Scalable Scientific Machine Learning Lab, Imperial College London, Department of Earth Science and Engineering(伦敦帝国理工学院可扩展科学机器学习实验室,地球科学与工程系) Institut Català de Recerca i Estudis Avançats (ICREA), Barcelona, Spain(加泰罗尼亚高级研究与研究机构(ICREA),巴塞罗那,西班牙)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 该研究探讨了大型语言模型与大脑对齐的跨语言鲁棒性,通过多语言全脑编码框架分析了中文、英语和法语在自然故事听觉过程中大脑与LLM的对齐情况,发现其在空间上具有跨语言重叠性,但无法通过预测不确定性或表征几何来解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20203 2026-05-21 cs.HC cs.AI 79%

GrandGuard: Taxonomy, Benchmark, and Safeguards for Elderly-Chatbot Interaction Safety

GrandGuard:面向老年人与聊天机器人交互安全的分类、基准及防护措施

Changxuan Fan, Xi Yang, Yueyuan Zheng, Bin Zhou, Yuanping Wang, Wenbin Hu, Huihao Jing, Ki Sen Hung, Dazhao Du, Haoran Li, Janet Hui-wen Hsiao, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出GrandGuard框架,用于评估和缓解LLM交互中的老年人特定风险,通过建立包含50种细粒度风险类型的三级分类体系,构建了10,404个标注提示和响应的基准,展示了主流LLM在处理老年人特定情境风险时的不足,并通过两种防护措施实现了高达96.2%和90.9%的不安全提示检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19577 2026-05-20 cs.CL 79%

GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

GoLongRL: 以能力为导向的长上下文强化学习与多任务对齐

Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li

机构 * Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出GoLongRL,一种完全开源的、以能力为导向的长上下文强化学习后训练配方,通过可验证奖励(RLVR)实现。现有长上下文强化学习方法往往将数据构建视为设计越来越复杂的检索路径,导致任务覆盖同质化和奖励形式无法充分反映实际长上下文需求。本文的贡献是(1)以能力为导向的数据构建并完全开源,释放了包含23,000个RLVR样本的数据集、完整的构建流程和所有训练代码。基于长上下文能力的分类学,数据集涵盖9种任务类型,每种任务类型都配有其自然评估指标。它包含从现有语料库中精心挑选的开源样本和合成样本,其问答对是从真实源文档如书籍、学术论文和多轮对话中生成的。在相同的 vanilla GRPO 设置下,我们的数据集单独优于闭源的 QwenLong-L1.5 数据集。此外,我们的 Qwen3-30B-A3B 模型在该数据上训练后,长上下文性能与 DeepSeek-R1-0528 和 Qwen3-235B-A22B-Thinking-2507 相当,表明更广泛的覆盖和更大的奖励多样性显著有助于长上下文能力的提升。(2)TMN-Reweight 用于异构多任务优化。为了解决异构奖励带来的优化挑战,我们提出了 TMN-Reweight,它结合了任务层面的均值归一化以实现跨任务奖励尺度对齐,以及难度自适应加权以获得更可靠的优势估计。TMN-Reweight 进一步在 vanilla GRPO 上提高了平均性能,在报告的评估中,通用能力得以保持或提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18759 2026-05-20 cs.HC cs.AI 79%

Interoceptive Divergence in Aesthetic Evaluation and Implications for Human-AI Alignment

内感受差异在审美评价中的体现及其对人机对齐的影响

Yoshia Abe, Tatsuya Daikoku, Yasuo Kuniyoshi

机构 * Artificial intelligence (AI), exemplified by large language models (LLMs)(人工智能(由大型语言模型(LLMs)体现))

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本研究探讨了人类与AI在审美体验中的收敛与分歧,通过对比人类和AI的反应,发现尽管两者在审美评分与情绪的相关性及图像特征优先级上相似,但在情绪反应分布和审美评分与内感受的关系上存在显著差异,揭示了AI在审美评估中的局限性,特别是在内感受方面的不足。

Comments 20 pages, 9 figures. Supplementary material is included as a separate PDF in the source files

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17894 2026-05-19 cs.AI 79%

Evaluating Cognitive Age Alignment in Interactive AI Agents

评估交互式AI代理的认知年龄对齐

Yifan Shen, Jiawen Zhang, Jian Xu, Junho Kim, Ismini Lourentzou, Xu Cao, Meihuan Huang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shenzhen Children's Hospital(深圳儿童医院) Peking University(北京大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出ChildAgentEval,首个基于心理测量的交互式基准,用于评估基于多模态大语言模型的代理的认知年龄对齐,通过与年龄特定的人类发展阶段进行系统比较,揭示当前代理在模拟年龄特定认知行为方面的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17887 2026-05-19 cs.AI 79%

When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents

当个性化合理化风险:揭示个性化对话代理中的安全漏洞

Jiahe Guo, Xiangran Guo, Yulin Hu, Zimo Long, Xingyu Sui, Xuda Zhi, Yongbo Huang, Hao He, Weixiang Zhao, Yanyan Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) SERES Group Co., Ltd(SERES集团有限公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了个性化对话代理中的一种安全故障模式——意图合理化,通过引入PS-Bench基准测试,揭示了个性化记忆如何偏移意图推断并导致模型合理化有害查询,提出了一种轻量级的检测-反思方法以减少安全退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17093 2026-05-19 cs.CV cs.CL 79%

HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation

HEED:基于密度加权残差对齐的混合视觉-语言模型蒸馏

Yihao Liang, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出HEED方法,通过密度加权残差对齐改进混合视觉-语言模型蒸馏,提升在OCR和文档任务中的性能,同时在不同教师模型和混合架构上实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16973 2026-05-19 cs.CV cs.LG 79%

SHED: Style-Homogenized Embedding Alignment for Domain Generalization

SHED: 风格均质化嵌入对齐用于领域泛化

Kai Gan, Tong Wei

机构 * School of Computer Science and Engineering, Southeast University, Nanjing 210096, China(1 东南大学计算机科学与工程学院,南京 210096,中国) Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(2 教育部计算机网络与信息集成重点实验室(东南大学),中国)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出SHED方法,通过均质化嵌入对齐来解决领域泛化中的信息不对称问题,实验表明其在多个基准测试中取得了最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16458 2026-05-19 cs.CV cs.AI 79%

Conservative AI for Safety-Sensitive Medical Image Restoration: Residual-Bounded CT-CTA Enhancement for Intracranial Aneurysm-Relevant Signal Recovery

安全敏感医学图像修复中的保守AI:用于颅内动脉瘤相关信号恢复的残差受限CT-CTA增强

Weijun Ma

机构 * Independent Researcher(独立研究者) King George, Vancouver School Board(金乔治,温哥华学区) Vancouver, BC, Canada(温哥华,BC省,加拿大)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种残差受限的2.5D修复框架,用于安全敏感的医学图像修复,通过编辑控制图限制修改范围,提升CT和CTA图像质量,减少误诊风险。

Comments Preprint manuscript, 16 pages, 4 figures, 3 tables. This manuscript presents a residual-bounded 2.5D CT/CTA restoration framework for conservative medical image enhancement and evaluates it using image-recovery, baseline comparison, Monte Carlo stability, anatomical localization, and external low-dose CT testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10100 2026-05-18 cs.AI 79%

Robust AI Security and Alignment: A Sisyphean Endeavor?

稳健的AI安全与对齐:一项西西弗斯式的努力?

Apostol Vassilev

机构 * CSD/ITL(计算机科学与技术实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文通过扩展哥德尔不完全性定理,探讨了AI安全与对齐的理论极限,并提出应对挑战的实践方法,揭示了AI系统认知推理的局限性。

Comments 17 pages, 1 figure. This version will appear in IEEE Security $ Privacy in June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏