arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9248 篇

2410.07173 2026-01-19 cs.CL cs.AI cs.CV 81%

Better Language Models Exhibit Higher Visual Alignment

表现更佳的语言模型具有更高的视觉对齐性

Jona Ruthardt, Gertjan J. Burghouts, Serge Belongie, Yuki M. Asano

机构 * Fundamental AI Lab, University of Technology Nuremberg(技术基础人工智能实验室,不莱梅技术大学) Intelligent Imaging, TNO(智能成像,TNO) Department of Computer Science, University of Copenhagen(计算机科学系,哥本哈根大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ShareLock 方法,通过融合冻结的视觉和语言模型骨干,提升视觉对齐能力,实现高效跨语言图像分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09756 2026-01-16 cs.CR cs.AI cs.CL 81%

Synthetic Data for Veterinary EHR De-identification: Benefits, Limits, and Safety Trade-offs Under Fixed Compute

兽医电子健康记录的合成数据:在固定计算下的好处、限制和安全权衡

David Brundage

机构 * University of Wisconsin-Madison, School of Veterinary Medicine(威斯康星大学麦迪逊分校兽医学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了合成数据在兽医电子健康记录去标识化中的应用,发现合成数据在固定预算下无法替代真实数据,但适度混合可提升性能,但需注意训练暴露增加而非数据质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05465 2026-01-16 cs.AI cs.CL 81%

VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models

VAL-Bench:信念一致性作为语言模型价值观对齐的度量标准

Aman Gupta, Denny O'Shea, Fazl Barez

机构 * MasterClass University of Oxford(牛津大学) WhiteBox Martian

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 VAL-Bench通过评估语言模型在现实价值相关提示中的信念一致性,提出了一种衡量价值观对齐的新基准,揭示了不同模型在一致性上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16281 2026-01-15 cs.RO cs.AI cs.LG 81%

Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification

按言行事:通过运行时推理-动作对齐验证引导视觉-语言-动作模型

Yilin Wu, Anqi Li, Tucker Hermans, Fabio Ramos, Andrea Bajcsy, Claudia Pérez-D'Arpino

机构 * NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) University of Utah(犹他大学) University of Sydney(悉尼大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 通过运行时推理-动作对齐验证方法提升视觉-语言-动作模型的鲁棒性和行为组合能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08673 2026-01-14 cs.AI cs.CY 81%

Why AI Alignment Failure Is Structural: Learned Human Interaction Structures and AGI as an Endogenous Evolutionary Shock

为何AI对齐失败是结构性的:学习的人类互动结构与AGI作为内生性演化冲击

Didier Sornette, Sandro Claudio Lera, Ke Wu

机构 * Institute of Risk Analysis, Prediction and Management (Risks-X)(风险分析、预测与管理研究所) Southern University of Science and Technology (SUSTech)(南方科技大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本文探讨AI对齐失败的结构性问题,指出AGI作为内生性演化冲击,其风险源于放大人类智能、权力与矛盾,而非对抗意图。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11218 2026-01-13 cs.CL cs.AI 81%

The Curious Case of Factual (Mis)Alignment between LLMs' Short- and Long-Form Answers

事实性(误解)一致性在LLM短形式和长形式回答中的奇特案例

Saad Obaid ul Islam, Anne Lauscher, Goran Glavaš

机构 * WüNLP, CAIDAS, University of Würzburg(乌尔姆大学) Data Science Group, University of Hamburg(汉堡大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SLAQ框架,揭示LLM在短长形式回答中存在事实一致性问题,通过机制分析发现重叠内部结构与78%预测准确率,挑战现有评估实践。

Comments Code: https://github.com/WorldHellow/SLAQ/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06704 2026-01-13 cs.LG cs.AI cs.CV 81%

Beyond Perfect Scores: Proof-by-Contradiction for Trustworthy Machine Learning

超越完美分数:基于矛盾证明的可信机器学习证明

Dushan N. Wadduwage, Dineth Jayakody, Leonidas Zimianitis

机构 * Old Dominion University(旧 Dominion 大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于矛盾证明的可信度测试方法,通过随机排列标签来评估模型是否依赖真实临床线索,从而提高机器学习在生物医学中的可信度和临床应用潜力。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06167 2026-01-13 cs.LG cs.AI 81%

Parent-Guided Adaptive Reliability (PGAR): A Behavioural Meta-Learning Framework for Stable and Trustworthy AI

指导式自适应可靠性(PGAR):一种用于稳定和可信赖AI的行为元学习框架

Anshum Rankawat

机构 * Anshum Rankawat(独立研究者)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 PGAR通过引入监督父层提升AI的稳定性与可靠性,通过有界可靠性指数调节学习率,实现更稳健的优化与学习过程。

Comments 9 pages, 8 figures, 2 tables. Submitted to IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03444 2026-01-08 cs.CL cs.AI cs.HC 81%

Grading Scale Impact on LLM-as-a-Judge: Human-LLM Alignment Is Highest on 0-5 Grading Scale

评分尺度对LLM作为裁判的影响:人类与LLM的对齐在0-5评分尺度上最高

Weiyue Li, Minda Zhao, Weixuan Dong, Jiahui Cai, Yuze Wei, Michael Pocress, Yi Li, Wanyan Yuan, Xiaoyue Wang, Ruoyu Hou, Kaiyuan Lou, Wenqi Zeng, Yutong Yang, Yilun Du, Mengyu Wang

机构 * Harvard University(哈佛大学) CMU(卡内基梅隆大学) Stanford University(斯坦福大学) UC San Diego(圣地亚哥大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了评分尺度对LLM作为裁判一致性的影响,发现0-5评分尺度在人类与LLM之间产生最强的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07015 2025-12-29 cs.CL cs.AI cs.IR 81%

FVA-RAG: Falsification-Verification Alignment for Mitigating Sycophantic Hallucinations

FVA-RAG:通过对抗性上下文对齐缓解趋炎附势幻觉

Mayank Ravishankara

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 FVA-RAG通过引入对抗性上下文检索,有效缓解了因前提错误导致的幻觉问题,其在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21551 2025-12-29 cs.HC cs.AI cs.CL 81%

Human-AI Interaction Alignment: Designing, Evaluating, and Evolving Value-Centered AI For Reciprocal Human-AI Futures

人机交互对齐:为互惠人机未来设计、评估和演化以价值为中心的AI

Hua Shen, Tiffany Knearem, Divy Thakkar, Pat Pataranutaporn, Anoop Sinha, Yike, Shi, Jenny T. Liang, Lama Ahmad, Tanu Mitra, Brad A. Myers, Yang Li

机构 * NYU Shanghai, New York University(纽约大学上海校区) Google(谷歌) Massachusetts Institute of Technologyy(麻省理工学院) Google, Paradigms of Intelligence(谷歌、智能范式) Carnegie Mellon University, New York University(卡内基梅隆大学、纽约大学) Carnegie Mellon University(卡内基梅隆大学) OpenAI University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研讨会探讨如何通过设计、评估和演化以价值为中心的AI,实现人机之间的互惠协作与动态对齐。

Comments CHI 2026 BiAlign Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20755 2025-12-25 cs.LG cs.AI 81%

Bridging Efficiency and Safety: Formal Verification of Neural Networks with Early Exits

弥合效率与安全:具有早期退出的神经网络形式验证

Yizhak Yisrael Elboher, Avraham Raviv, Amihay Elboher, Zhouxing Shi, Omri Azencot, Hillel Kugler, Guy Katz

机构 * The Hebrew University of Jerusalem, Israel(特拉维夫大学) Bar Ilan University, Israel(巴伊兰大学) Ben-Gurion University of the Negev, Israel(贝纳亚克大学) University of California, Riverside, USA(加州大学河滨分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种针对具有早期退出机制的神经网络进行形式验证的方法,通过定制鲁棒性属性和优化策略,在保证正确性的同时提升验证效率和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20688 2025-12-25 cs.GT cs.AI cs.LG cs.MA 81%

Mechanism-Based Intelligence (MBI): Differentiable Incentives for Rational Coordination and Guaranteed Alignment in Multi-Agent Systems

基于机制的智能(MBI):用于多智能体系统中理性协调和保证对齐的可微激励

Stefano Grassi

专题命中 安全评测 :alignment(title);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 基于机制的智能(MBI)通过可微价格机制实现多智能体系统的理性协调和保证对齐,提供高效、可审计且可扩展的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18092 2025-12-23 cs.AI cs.LG 81%

Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability

可信且稳定的神经元解释用于可信的机制可解释性

Ge Yan, Tuomas Oikarinen, Tsui-Wei, Weng

机构 * CSE, UCSD(计算机科学与工程系,加州大学圣塔莫尼卡分校) HDSI, UCSD(人类-数字系统研究所,加州大学圣塔莫尼卡分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出理论分析和方法,解决神经元识别中的忠实性和稳定性问题,通过理论保证和实验验证提升机制可解释性的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07347 2025-12-19 eess.SY cs.AI cs.LG cs.SY 81%

Distributed Risk-Sensitive Safety Filters for Uncertain Discrete-Time Systems

分布式风险敏感安全滤波器用于不确定离散时间系统

Armin Lederer, Erfaun Noorani, Andreas Krause

机构 * Department of Electrical and Computer Engineering, College of Design and Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系,设计与工程学院) Learning & Adaptive Systems Group, Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系学习与自适应系统小组)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种分布式风险敏感安全滤波器,用于不确定离散时间多智能体系统,通过价值函数定义的控制屏障函数和两种替代策略确保安全性与鲁棒性。

Journal ref IEEE Control Systems Letters, vol. 9, pp. 1231-1236, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15617 2025-12-18 cs.CL cs.AI 81%

Evaluating Metrics for Safety with LLM-as-Judges

用LLM作为裁判评估安全度的指标

Kester Clegg, Richard Hawkins, Ibrahim Habli, Tom Lawton

机构 * Centre for Assuring Autonomy, University of York(自主性保障中心、约克大学) Bradford Royal Infirmary(布拉德福德皇家医院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过加权指标和置信度阈值来提升LLM作为裁判在关键信息流中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13658 2025-12-16 cs.CY cs.AI 81%

Embedding-Based Rankings of Educational Resources based on Learning Outcome Alignment: Benchmarking, Expert Validation, and Learner Performance

基于学习成果对齐的教育资源排名:基准测试、专家验证与学习者表现

Mohammadreza Molavi, Mohammad Moein, Mohammadreza Tavakoli, Abdolali Faraji, Stefan T. Mol, Gábor Kismihók

机构 * Leibniz Information Centre for Science and Technology (TIB)(莱比锡科学与技术信息中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究提出基于嵌入的对齐框架,通过基准测试和专家验证,证明了教育资源与学习成果对齐度对学习表现的正向影响。

Comments Accepted for publication at the 16th International Conference on Learning Analytics & Knowledge (LAK 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04118 2025-12-05 cs.CY cs.LG 81%

Patient Safety Risks from AI Scribes: Signals from End-User Feedback

人工智能记录员对患者安全的风险:来自终端用户反馈的信号

Jessica Dai, Anwen Huang, Catherine Nasrallah, Rhiannon Croci, Hossein Soleimani, Sarah J. Pollet, Julia Adler-Milstein, Sara G. Murray, Jinoos Yazdany, Irene Y. Chen

机构 * University of California Berkeley(加州大学伯克利分校) University of California San Francisco(加州大学旧金山分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.CY、cs.LG

AI总结 本研究通过混合方法分析了AI记录员在医疗反馈中引发的患者安全风险,发现转录错误可能导致药物和治疗方面的风险,需进一步研究以明确风险程度。

Comments ML4H Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01786 2025-12-02 cs.AI cs.LG 81%

Who Judges the Judge? LLM Jury-on-Demand: Building Trustworthy LLM Evaluation Systems

谁评判法官?LLM陪审团即需:构建可信的LLM评估系统

Xiaochuan Li, Ke Wang, Girija Gouda, Shubham Choudhary, Yaqun Wang, Linwei Hu, Joel Vaughan, Freddy Lecue

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM陪审团即需,通过动态学习框架提升LLM评估的可靠性和可扩展性,实验表明其在关键决策中的相关性优于传统方法。

Comments 66 pages, 22 figures, 37 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14469 2025-12-02 cs.CL cs.AI 81%

Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations

大语言模型在混合语言扰动下的归因安全故障

Somnath Banerjee, Pratyush Chatterjee, Shanu Kumar, Sayan Layek, Parag Agrawal, Rima Hazra, Animesh Mukherjee

机构 * Microsoft Corporation(微软公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在混合语言扰动下存在归因安全故障,提出显著性漂移归因框架并提出翻译基恢复策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18008 2025-12-02 cs.CY cs.CL 81%

GermanPartiesQA: Benchmarking Commercial Large Language Models and AI Companions for Political Alignment and Sycophancy

GermanPartiesQA: 对商业大语言模型和AI伴侣在政治倾向和趋炎附势方面的基准测试

Jan Batzner, Volker Stocker, Stefan Schmid, Gjergji Kasneci

机构 * TUM(慕尼黑大学) TUB(慕尼黑大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.CY

AI总结 GermanPartiesQA研究了六个商业LLMs在政治倾向和趋炎附势方面的表现,揭示了LLMs在生成事实性政党立场上的局限性以及模型特定的意识形态倾向模式。

Comments Published at AAAI/ACM AIES 2025. Presented at NeurIPS 2025 Workshop on LLM Evaluation and the International Monetary Fund's 12th Statistical Forum. GermanPartiesQA Benchmark under https://github.com/janbatzner/germanpartiesqa

Journal ref Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 8(1), 2025, pp. 330-342

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21737 2025-12-01 cs.CL cs.AI 81%

Polarity-Aware Probing for Quantifying Latent Alignment in Language Models

考虑极性的人探针用于量化语言模型中的潜在对齐

Sabrina Sadiekh, Elena Ericheva, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出考虑极性的CCS方法,用于量化语言模型潜在对齐的鲁棒性,揭示模型内部表示的一致性差异。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21363 2025-11-27 cs.LG cs.AI 81%

The Directed Prediction Change - Efficient and Trustworthy Fidelity Assessment for Local Feature Attribution Methods

定向预测变化 - 用于局部特征归因方法高效且可信的保真度评估

Kevin Iselborn, David Dembinsky, Adriano Lucieri, Andreas Dengel

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DPC度量标准,用于高效且可信地评估局部特征归因方法的保真度,通过改进预测变化度量并消除随机性,实现快速且确定性的评估。

Comments 13 pages, 10 figures, 5 tables, accepted at AAAI SECURE-AI4H workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20726 2025-11-27 cs.LG cs.AI 81%

Learning from Risk: LLM-Guided Generation of Safety-Critical Scenarios with Prior Knowledge

从风险学习:利用先验知识的LLM引导的安全关键场景生成

Yuhang Wang, Heye Huang, Zhenhua Xu, Kailai Sun, Baoshen Guo, Jinhua Zhao

机构 * Chinese Academy of Sciences, China(中国科学院) Department of Urban Studies and Planning, Massachusetts Institute of Technology, USA(麻省理工学院城市研究与规划系) School of Vehicle and Mobility, Tsinghua University, China(清华大学车辆与移动系统学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用LLM和CVAE生成安全关键场景的方法,通过知识驱动优化提升自动驾驶系统在罕见高风险事件下的鲁棒性与可控性。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01710 2025-11-11 cs.CL cs.LG 81%

CultureGuard: Towards Culturally-Aware Dataset and Guard Model for Multilingual Safety Applications

Raviraj Joshi, Rakesh Paul, Kanishk Singla, Anusha Kamath, Michael Evans, Katherine Luna, Shaona Ghosh, Utkarsh Vaidya, Eileen Long, Sanjay Singh Chauhan, Niranjan Wartikar

机构 * NVIDIA(英伟达)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07416 2025-11-07 cs.CV cs.CL cs.LG 81%

RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability

Jonggwon Park, Byungmu Yoon, Soobum Kim, Kyoyun Choi

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26024 2025-10-31 cs.CL cs.AI 81%

Rethinking Cross-lingual Alignment: Balancing Transfer and Cultural Erasure in Multilingual LLMs

HyoJung Han, Sweta Agrawal, Eleftheria Briakou

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22095 2025-10-28 cs.AI cs.CL 81%

Embracing Trustworthy Brain-Agent Collaboration as Paradigm Extension for Intelligent Assistive Technologies

Yankai Chen, Xinni Zhang, Yifei Zhang, Yangning Li, Henry Peng Zou, Chunyu Miao, Weizhi Zhang, Xue Liu, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI(马克斯·普朗克人工智能研究所) McGill University(麦吉尔大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS'25 Position Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25271 2025-10-24 cs.AI cs.CV cs.LG cs.MA 81%

RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration

Xiuyuan Chen, Jian Zhao, Yuchen Yuan, Tianle Zhang, Huilin Zhou, Zheng Zhu, Ping Hu, Linghe Kong, Chi Zhang, Weiran Huang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) University of Science and Technology of China(中国科学技术大学) GigaAI School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04150 2025-10-22 cs.CL cs.AI 81%

Temporal Alignment of LLMs through Cycle Encoding for Long-Range Time Representations

Xue Han, Qian Hu, Yitong Wang, Wenchun Gao, Lianlian Zhang, Qing Wang, Lijun Mei, Chao Deng, Junlan Feng

机构 * JIUTIAN Team China Mobile Research Institute(中国移动研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏