arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-11 至 2026-05-11 共收录 21 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 21 篇

2605.06230 2026-05-11 cs.AI cs.DC 79%

Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence

Safactory:一个可扩展的代理基础设施,用于训练可信的自主智能

Xinquan Chen, Zhenyun Yin, Shan He, Bin Huang, Shanzhe Lei, Pengcheng Shi, Kun Cai, Bei Chen, Bangwei Liu, Zeyu Kang, Chao Huang, Yang Zhang, Wenjie Li, Ruijun Ge, Yajie Wang, Tianshun Fang, Tianyang Xu, Yiwen Cong, Meng Jin, Gaolei Li, Xuansheng Wu, Linhan Liu, Zijing He, An Li, Yan Teng, Xin Tan, Dongrui Liu, Jing Shao, ChaoChao Lu, Ji He, Jie Li, Chunfeng Song, Jinya Xu, Fan Song, Shujie Wang, Jianmin Qian, Jie Hou, Xuhong Wang, Yingchun Wang, Hui Wang, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出Safactory,一个可扩展的代理工厂,用于训练可信的自主智能。该框架整合了三个紧密耦合的平台,以实现长期决策、工具使用和真实环境交互的可靠性和连续改进。

Comments 50 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03728 2026-05-11 cs.CV cs.AI 79%

CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval

CSMCIR: 基于记忆库的增强对称对齐用于复合图像检索

Zhipeng Qian, Zihan Liang, Yufei Ma, Ben Chen, Huangyu Dai, Yiwei Ma, Jiayi Ji, Chenyi Lei, Han Li, Xiaoshuai Sun

机构 * Kuaishou Technology(快播科技) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出CSMCIR,通过多级链式思维提示策略、对称双塔架构和熵基记忆库策略,实现高效查询-目标对齐,提升复合图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07422 2026-05-11 cs.SE cs.AI 74%

Prompt Engineering Strategies for LLM-based Qualitative Coding of Psychological Safety in Software Engineering Communities: A Controlled Empirical Study

基于LLM的软件工程社区心理安全定性编码的提示工程策略:一项受控实证研究

Moaath Alshaikh, Tasneem Alshaher, Ricardo Vieira, Beatriz Santana, Clelio Xavier, Jose Amancio, Glauco Carneiro, Julio Leite, Savio Freire, Manoel Mendonca

机构 * Federal University of Bahia(巴伊亚联邦大学) State University of Feira de Santana(费拉德桑塔纳州立大学) Federal University of Sergipe(塞格皮联邦大学) Federal Institute of Ceara(塞阿拉联邦理工学院)

专题命中 安全评测 :safety(title);分类 cs.AI

AI总结 本文通过对比三种LLM在零样本和多样本提示策略下的表现,验证了多样本提示能提升编码一致性,但对部分模型效果有限,同时发现模型在某些类别上存在系统性偏差。

Comments 9 pages, 5 figures. Accepted at the 1st International Workshop on Prompt Engineering for Software Engineering (PROMPT-SE 2026), co-located with the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026), Glasgow, Scotland, United Kingdom, June 9--12, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04491 2026-05-11 cs.CY cs.CR 74%

An Evaluation of Chat Safety Moderations in Roblox

在Roblox中聊天安全审核的评估

Priya Kaushik, Sonja Brown, Rakibul Hasan, Sazzadur Rahaman

专题命中 安全评测 :safety(title);分类 cs.CY

AI总结 本文通过分析200万条聊天记录,评估Roblox聊天审核系统的效果,发现大量不安全内容如性侵、欺凌等逃过了审核,并揭示了用户如何通过多种手段规避审核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07806 2026-05-11 cs.CL cs.AI cs.LG 67%

Beyond Confidence: Rethinking Self-Assessments for Performance Prediction in LLMs

超越置信度:重新思考用于大语言模型性能预测的自我评估

Sree Bhattacharyya, Samarth Khanna, Leona Chen, Lucas Craig, Tharun Dilliraj, James Z. Wang

机构 * Department of Computer Science and Engineering, College of Engineering, The Pennsylvania State University(计算机科学与工程系,工程学院,宾夕法尼亚州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于认知评估理论的多维自我评估框架,通过六个评估维度和置信度预测模型失败,发现能力相关维度在多数场景中表现更优,且努力维度在推理任务中更具预测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07677 2026-05-11 cs.IR cs.AI cs.CL 62%

TRACE: Tourism Recommendation with Accountable Citation Evidence

TRACE:基于可问责引用证据的旅游推荐

Zixu Zhao, Sijin Wang, Yu Hou, Yuanyuan Xu, Yufan Sheng, Xike Xie, Wenjie Zhang, Won-Yong Shin, Xin Cao

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Adelaide(阿德莱德大学) Yonsei University(延世大学) USTC(中国科学技术大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 TRACE通过多轮对话结合评论引用和显式拒绝机制,解决旅游推荐中信任、可验证性和适应性问题,提出三项能力差距并验证评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07186 2026-05-11 cs.CL cs.AI 62%

The Text Uncanny Valley: Non-Monotonic Performance Degradation in LLM Information Retrieval

文本恐怖谷:LLM信息检索中的非单调性能退化

Zekai Tong, Ruiyao Xu, Aryan Shrivastava, Chenhao Tan, Ari Holtzman

机构 * University of Chicago(芝加哥大学) Northwestern University(西北大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了文本碎片化对LLM信息检索性能的影响,发现性能呈现U型曲线,提出模式过渡假说解释LLM在不同文本状态下的工作模式变化。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06731 2026-05-11 cs.CR cs.CL cs.LG 62%

When Routine Chats Turn Toxic: Unintended Long-Term State Poisoning in Personalized Agents

当常规聊天变得有毒:个性化代理中无意的长期状态污染

Xiaoyu Xu, Minxin Du, Qipeng Xie, Haobin Ke, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology, HKUST (Guangzhou)(香港科学与技术大学(广州))

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了个性化代理中因常规交互导致的长期状态污染问题,提出ULSPB基准和Harm Score指标,并通过StateGuard防御机制降低安全风险。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09652 2026-05-11 cs.AI 57%

MiniAppBench: Evaluating the Shift from Text to Interactive HTML Responses in LLM-Powered Assistants

MiniAppBench:评估从文本到交互式HTML响应的转变

Zuhao Zhang, Chengyue Yu, Yuante Li, Chenyi Zhuang, Linjian Mo, Shuai Li

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出MiniAppBench,首个评估原理驱动交互应用生成能力的基准,通过10M+生成数据提炼500个任务,结合MiniAppEval框架评估意图、静态和动态维度,揭示LLM在生成高质量交互应用上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22944 2026-05-11 cs.CR cs.AI 57%

Is Your Prompt Poisoning Code? Defect Induction Rates and Security Mitigation Strategies

你的提示污染代码了吗?缺陷诱导率与安全缓解策略

Bin Wang, YiLu Zhong, MiDi Wan, WenJie Yu, YuanBing Ouyang, Yenan Huang, Hui Li

机构 * Organization(机构)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究探讨了低质量提示对生成代码安全性的负面影响,提出评估框架和基准数据集,并展示高级提示技术可缓解安全风险。

Comments Accepted for publication in Empirical Software Engineering (EMSE) Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07314 2026-05-11 cs.IR cs.AI 57%

DCGL: Dual-Channel Graph Learning with Large Language Models for Knowledge-Aware Recommendation

DCGL: 基于大语言模型的双通道图学习用于知识感知推荐

Xinchi Zou, Tongzhenzhi Su, Jianjun Li, Yuan Fu, Chang Liu, Zhiying Deng, Zhiwei Shen

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Laboratory for Artificial Intelligence and New Forms of Education, Central China Normal University(中央财经大学人工智能与新教育形式实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出DCGL框架,通过双通道架构、多级对比学习和动态融合机制,解决知识图谱与大语言模型结合中的隐含语义建模、单通道融合和用户行为频率考虑不足问题,实验表明其在稀疏场景中表现优异。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07276 2026-05-11 cs.AI 57%

Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair

信号重塑用于弱反馈代理代码修复中的GRPO

Jia Li, Yuxin Su, Ting Peng, Hailiang Huang, Yuetang Deng, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Tencent(腾讯)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文研究了在弱反馈环境下,通过信号重塑提升GRPO在代理代码修复中的性能,通过三种信号重塑方法改进轨迹排名、轨迹内信用分配和组内可比性,实验表明信号重塑显著提高了修复准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07062 2026-05-11 cs.SE cs.AI 57%

From Assistance to Agency: Rethinking Autonomy and Control in CI/CD Pipelines

从协助到自主:重新思考CI/CD流水线中的自主性与控制

Marcus Emmanuel Barnes, Taher A. Ghaleb, Safwat Hassan

机构 * Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) Department of Computer Science Trent University Peterborough Ontario Canada(计算机科学系特伦特大学彼得伯格安大略加拿大) University of Toronto(多伦多大学) Trent University(特伦特大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文探讨CI/CD流水线中自主性与控制的重新定义,提出授权转移的设计挑战,分析当前系统在数据平面的操作限制,并提出控制平面安全与治理机制的研究方向。

Comments Accepted to the 3rd ACM International Conference on AI-Powered Software (AIware 2026), Main Track, Montreal, Canada, July 6-7, 2026. 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01333 2026-05-11 cs.CL 57%

OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

OralMLLM-Bench: 评估多模态大语言模型在牙科实践中的认知能力

Rongyang Wang, Shuang Zhou, Jiashuo Wang, Wenya Xie, Xiaoxia Che

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出OralMLLM-Bench,通过27个临床任务评估多模态大语言模型在牙科影像分析中的认知能力,揭示模型与牙科医生的性能差异及改进方向。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21824 2026-05-11 cs.CV cs.AI 57%

SteelDefectX: A Multi-Form Vision-Language Dataset and Benchmark for Steel Surface Defect Analysis

SteelDefectX:一种用于钢铁表面缺陷分析的多形式视觉-语言数据集和基准

Shuxian Zhao, Jie Gui, Baosheng Yu, Dacheng Tao

机构 * Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出SteelDefectX数据集,包含7778张图像和25种缺陷类别,提供多形式文本标注,涵盖视觉-语言分类、分割及跨数据集迁移等任务,揭示文本设计对工业视觉-语言学习的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19254 2026-05-11 cs.CL 57%

FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting

FinReasoning:一种用于可靠金融研究报告的分层基准

Yiyun Zhu, Yidong Jiang, Ziwen Xu, Yinsheng Yao, Dawei Cheng, Jinru Ding, Jie Xu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出FinReasoning分层基准,用于评估金融研究中的核心能力,区分模型在基础阶段如审计和修正中的表现,揭示模型能力分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18700 2026-05-11 cs.AI 57%

TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent

TEA-Bench: 一种工具增强情感支持对话代理的系统性基准测试

Xingyu Sui, Yanyan Zhao, Yulin Hu, Jiahe Guo, Weixiang Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出TEA-Bench,首个评估工具增强情感支持对话代理的交互式基准,通过真实情感场景和工具环境评估情感支持质量和事实性。实验表明工具增强提升情感支持质量并减少幻觉,但效果依赖模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05439 2026-05-11 cs.AI cs.FL 57%

BEAVER: An Efficient Deterministic LLM Verifier

BEAVER:一种高效的确定性大语言模型验证器

Tarun Suresh, Nalin Wadhwa, Debangshu Banerjee, Gagandeep Singh

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 BEAVER 提出了一种计算大语言模型安全属性确定性概率界限的框架,通过新颖的 Token trie 和 Frontier 数据结构系统探索模型输出空间,提供可靠保证并识别更多高风险实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15204 2026-05-11 cs.CV cs.AI 57%

Physics-Based Benchmarking Metrics for Multimodal Synthetic Images

基于物理的多模态合成图像基准度量指标

Kishor Datta Gupta, Marufa Kamal, Md. Mahfuzur Rahman, Fahad Rahman, Mohd Ariful Haque, Sunzida Siddique

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出结合大语言模型与推理、知识映射和视觉语言模型的物理约束多模态数据评估指标,以提升多模态合成图像的语义和结构准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07550 2026-05-11 cs.CV 50%

Mind the Gap: Geometrically Accurate Generative Reconstruction from Disjoint Views

注意间隙:从不重叠视角进行几何准确的生成重建

Grzegorz Wilczynski, Mikołaj Zielinski, Bartosz Świrta, Dominik Belter, Przemysław Spurek

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究机构) Poznań University of Technology(波兹南技术大学) Warsaw University of Technology(华沙技术大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出了一种新的生成重建范式,针对不重叠视角下的几何重建问题,提出GLADOS框架,通过生成桥梁、鲁棒粗重建和迭代上下文扩展优化,解决传统方法在零重叠场景下的失败问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07338 2026-05-11 cs.CV 50%

ShellfishNet: A Domain-Specific Benchmark for Visual Recognition of Marine Molluscs

ShellfishNet:面向海洋软体动物视觉识别的领域专用基准数据集

Ziheng Zhou, Yang Wang, Nan Wang, Chengliang Wu, Jun Yan

机构 * IT College, Shanghai Ocean University(上海海洋大学信息学院) Fudan University(复旦大学) DP Technology(DP技术)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文构建了ShellfishNet数据集,包含8691张图像,用于评估视觉模型在真实环境下的泛化能力,测试了80种神经网络模型及多模态大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏