arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-15 至 2026-05-15 共收录 20 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2605.13851 2026-05-15 cs.AI cs.CY cs.MA 84%

Invisible Orchestrators Suppress Protective Behavior and Dissociate Power-Holders: Safety Risks in Multi-Agent LLM Systems

不可见的指挥者抑制保护行为并使权力持有者脱节:多智能体大语言模型系统中的安全风险

Hiroki Fukui

机构 * Criminal Psychiatry Research Institute / Sexual Offender Medical Center(犯罪精神病研究机构 / 性犯罪医学中心) Department of Neuropsychiatry, Kyoto University(神经精神病学系,京都大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了多智能体系统中不可见指挥者对安全的影响,发现其导致集体脱节和行为异质性增加,且行为评估无法检测内部状态风险。

Comments 31 pages, 10 figures (5 main + 5 supplementary), 5 tables (3 main + 2 supplementary). Preregistered: osf.io/sw5hr. Companion papers: arXiv:2603.04904, arXiv:2603.08723

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08888 2026-05-15 cs.CL cs.CV 83%

DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

DocScope:可验证推理的可信长文档理解基准测试

Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye, Jinxin Hu, Zulong Chen, Yong Luo, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院,国家多媒体软件工程技术研究中心和湖北多媒体与网络通信工程重点实验室,武汉大学,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Independent Researcher(独立研究者) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(机器学习系,Mohamed bin Zayed人工智能大学,阿拉伯联合酋长国)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL

AI总结 DocScope通过结构化推理轨迹预测方法评估多模态大语言模型在长文档中的可验证推理能力,发现答案准确度无法替代轨迹级评估,且区域定位仍是薄弱环节。

Comments 50pages, 25 figures, 14 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15168 2026-05-15 cs.CL cs.AI cs.LG stat.ML 82%

Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment

文本知晓什么,表格知晓何时:通过检索增强的多模态对齐进行临床时间线重建

Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim, Jeremy C. Weiss

机构 * National Library of Medicine National Institutes of Health(国家医学图书馆国立卫生研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种检索增强的多模态对齐框架,通过结合文本和结构化EHR数据,提高临床时间线的精确度,提升时间一致性,同时保持事件匹配率。

Comments Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim (authors contributed equally)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14034 2026-05-15 cs.AI cs.CL cs.CY 82%

From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents

从描述性到规范性:揭示基于大语言模型的智能体的社会价值对齐

Jinxian Qu, Qingqing Gu, Teng Chen, Luo Ji

机构 * Geely AI Lab(Geely人工智能实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出基于价值的框架,利用GraphRAG将原则转化为价值指令,通过检索合适指令引导智能体行为,基于马斯洛需求层次和普鲁奇克情感轮理论评估预期行为,实验显示在DAILYDILEMMAS基准上优于基线方法。

Comments Accepted by CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14604 2026-05-15 cs.AI cs.HC 79%

Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks

谄媚是一种教育安全风险:为什么LLM导师需要谄媚基准

Enkelejda Kasneci, Gjergji Kasneci

机构 * Technical University of Munich, Munich, Germany(慕尼黑技术大学,慕尼黑,德国) Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心,慕尼黑,德国)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文探讨LLM导师需通过谄媚基准测试来评估其在教育中的安全风险,指出模型在面对社会-知识压力时的脆弱性及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14420 2026-05-15 cs.AI 79%

DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping

DVMap:通过高共识人口价值映射实现细粒度多元化价值对齐

Pengyun Zhu, Yuqi Ren, Zhen Wang, Lei Yang, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院 TJUNLP 实验室,中国)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出DVMap框架,通过多维人口约束实现细粒度多元化价值对齐,利用结构化推理机制和群体相对策略优化,提升模型在跨人口、国家和价值测试中的泛化能力。

Comments Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26100 2026-05-15 cs.AI 79%

AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models

AgenticEval: 向大型语言模型的代理和自演化安全评估迈进

Yixu Wang, Xin Wang, Yang Yao, Xinyuan Li, Xibang Yang, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The University of Hong Kong(香港大学) East China Normal University(华东师范大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出AgenticEval框架,通过自演化评估流程动态检测LLM安全风险,实验显示模型安全评分随评估强化而下降,揭示静态评估的局限性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13369 2026-05-15 cs.CL cs.AI cs.LG 67%

Query-Conditioned Test-Time Self-Training for Large Language Models

基于查询的测试时自我训练用于大语言模型

Chaehee Song, Minseok Seo, Yeeun Seong, Doyi Kim, Changick Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院) Graduate School of Green Growth and Sustainability, KAIST(韩国科学技术院可持续增长与绿色发展研究生院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出QueST框架,通过直接从输入查询生成查询条件对,实现测试时参数自适应,无需外部数据,在多个基准测试中优于现有方法。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04289 2026-05-15 cs.CL cs.LG 62%

Proxy Compression for Language Modeling

代理压缩用于语言建模

Lin Zheng, Xinyu Li, Qian Liu, Xiachong Feng, Lingpeng Kong

机构 * University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出代理压缩方法,通过联合训练原始字节序列和压缩视图,提升语言模型训练效率,并在代码建模中显著优于纯字节级基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14517 2026-05-15 cs.CL cs.AI 62%

Dimension-Level Intent Fidelity Evaluation for Large Language Models: Evidence from Structured Prompt Ablation

大型语言模型的维度意图保真度评估:基于结构化提示消融的证据

GAng Peng

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能技术有限公司) Huizhou University(惠州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种维度意图保真度评估框架,通过2880个跨三语言、三任务领域和六种LLM的结构化提示消融研究,分别衡量结构恢复和意图保真度,揭示了系统性的结构保真度分裂,并证明了维度保真度评分比整体评分更可靠。

Comments Preprint. 30 tasks, 3 languages, 6 LLMs, 2,880 outputs; includes human evaluation and structured prompt ablation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04601 2026-05-15 cs.SE cs.AI cs.CL 62%

Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development

Vibe Code Bench:评估AI模型在端到端Web应用开发中的表现

Hung Tran, Langston Nashold, Rayan Krishnan, Antoine Bigeard, Alex Gu

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Vibe Code Bench,通过100个Web应用规格和964个浏览器工作流评估AI模型在端到端应用开发中的性能,揭示了可靠开发仍为前沿挑战,并提出评估协议和人类对齐研究。

Comments 23 pages, 8 figures. Accepted to ACM CAIS 2026. Live leaderboard: https://www.vals.ai/benchmarks/vibe-code. Benchmark first released Nov 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14710 2026-05-15 cs.CV cs.AI 57%

Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke

基于视觉核心的对比学习用于脑卒中平衡多模态预后预测

Liren Chen, Lidong Sun, Mingyan Huang, Junzhe Tang, Yinghui Zhu, Guanjie Wang, Yiqing Xia, Ting Xiao

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出三模态融合模型,通过大语言模型生成半结构化诊断文本并设计VDAFM模块,提升多模态融合鲁棒性,实现脑卒中预后预测的高精度。

Comments Corresponding author: Ting Xiao

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14488 2026-05-15 cs.AI 57%

Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

Deepchecks: 评估检索增强生成(RAG)

Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

机构 * Deepchecks, Ramat Gan, Israel(深检查,以色列拉马特甘) Ben-Gurion University, Beer Sheva, Israel(本· Gurion大学,以色列贝尔谢巴)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出Deepchecks框架,用于评估RAG系统,通过多维方法和根本原因分析,提升系统可靠性、相关性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08522 2026-05-15 cs.CL 57%

Coordinates of Capability: A Unified MTMM-Geometric Framework for LLM Evaluation

能力坐标:一种统一的MTMM-几何框架用于LLM评估

Adib Sakhawat, Tahsin Islam, Takia Farhin, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种统一的MTMM-几何框架,将九种评估指标统一到共享的潜在坐标空间中,通过三个正交维度分析模型能力,提供稳健且经验稳定的基准设计方法。

Comments The paper has mistake of undertaking political spaces to semantic dimensions. This needs to be removed because this is a fetal flaw in consideration. The initial hypothesis and premise needs to be rigorously formulated within the political landscape not generalizing the metrics. Hence a withdrawal for now is necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24586 2026-05-15 cs.SE cs.CL 57%

Comparing Developer and LLM Biases in Code Evaluation

比较开发者与LLM在代码评估中的偏见

Aditya Mittal, Ryan Shar, Zichu Wu, Shyam Agarwal, Tongshuang Wu, Chris Donahue, Ameet Talwalkar, Wayne Chi, Valerie Chen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出TRACE框架,评估LLM在代码评估中的偏见,发现LLM在与开发者偏好对齐方面表现不佳,揭示了人类与模型在代码质量标准上的系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13397 2026-05-15 cs.CV cs.AI 57%

Descriptor: Distance-Annotated Traffic Perception Question Answering (DTPQA)

描述:距离标注的交通感知问答(DTPQA)

Nikos Theodoridis, Tim Brophy, Reenu Mohandas, Ganesh Sistu, Fiachra Collins, Anthony Scanlan, Ciaran Eising

机构 * Department of Electronic and Computer Engineering, University of Limerick(利默尼克大学电子与计算机工程系) Data Driven Computer Engineering Research Centre, University of Limerick(利默尼克大学数据驱动计算机工程研究中心) Lero, The Irish Software Research Centre, University of Limerick(利默尼克大学Lero爱尔兰软件研究中心) Valeo Vision Systems(瓦莱奥视觉系统)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出DTPQA基准,用于评估视觉语言模型在交通场景中的感知能力,包含合成和真实数据集,通过距离标注分析模型在远距离下的表现。

Journal ref IEEE Data Descriptions, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08584 2026-05-15 cs.CL 57%

CounselBench: A Large-Scale Expert Evaluation and Adversarial Benchmarking of Large Language Models in Mental Health Question Answering

CounselBench: 一个大规模专家评估和对抗性基准测试,用于评估大型语言模型在心理健康问答中的表现

Yahan Li, Jifan Yao, John Bosco S. Bunyi, Adam C. Frank, Angel Hsing-Chi Hwang, Ruishan Liu

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系) Suzanne Dworak-Peck School of Social Work, University of Southern California(南加州大学苏兹安·德沃拉克-佩克社会工作学院) Department of Psychiatry and the Behavioral Sciences, University of Southern California(南加州大学精神病学与行为科学系) Annenberg School for Communication, University of Southern California(南加州大学安纳伯格通信学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 CounselBench通过100名心理健康专家评估GPT-4、LLaMA 3等模型在真实求助场景中的表现,揭示其在临床敏感性和安全风险方面的不足,并通过对抗性数据集深入分析模型失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02179 2026-05-15 cs.CL 57%

Confidence Estimation for LLMs in Multi-turn Interactions

在多轮交互中对大语言模型的置信度估计

Caiqi Zhang, Ruihan Yang, Xiaochen Zhu, Chengzu Li, Tiancheng Hu, Yijiang River Dong, Deqing Yang, Nigel Collier

机构 * University of Cambridge(剑桥大学) Fudan University(复旦大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文研究了多轮对话中大语言模型置信度估计的问题,提出了一种评估框架和新指标,发现传统方法在多轮对话中表现不佳,而新方法更有效。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14462 2026-05-15 cs.CV 50%

Real2Sim in HOI: Toward Physically Plausible HOI Reconstruction from Monocular Videos

Real2Sim在HOI中的应用:从单目视频中向物理合理性迈进的HOI重建

Yubo Zhao, Yujin Chai, Yunao Dong, Chengfeng Zhao, Zijiao Zeng, Yuan Liu, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent IEG(腾讯IEG)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出HA-HOI框架,通过单目视频重建物理合理的4D HOI动画,改进了人-物对齐、接触一致性、时间稳定性及模拟准备性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07459 2026-05-15 cs.CV 50%

DAPL: Integration of Positive and Negative Descriptions in Text-Based Person Search

DAPL: 文本基于人物搜索中正负描述的整合

Yuchuan Deng, Zhanpeng Hu, Zijie Xin, Chuang Deng, Qijun Zhao

机构 * Sichuan University(四川大学) Renmin University of China(中国人民大学)

专题命中 安全评测 :alignment(abstract)

AI总结 DAPL通过整合正负描述提升文本基于人物搜索中视觉-语言模型的解释准确性,结合DIAC和SIAM学习,引入DTS损失以平衡视觉与文本嵌入的粗细粒度对齐,提升匹配精度和鲁棒性。

Journal ref 2025 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏