arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9324 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9324 篇

2512.13655 2026-01-09 cs.CL cs.SE 70%

Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation

大语言模型擦除方法的比较分析:跨架构评估

Richard J. Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究比较了四种擦除工具在不同模型架构上的效果,发现数学推理能力对擦除干预最敏感,且单次通过方法在保持能力方面表现更优。

Comments 25 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16036 2026-01-09 cs.CL 70%

OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models

OpenEthics: 对开源生成大语言模型的全面伦理评估

Yıldırım Özen, Burak Erinç Çetin, Kaan Engür, Elif Naz Demiryılmaz, Cagri Toraman

机构 * Middle East Technical University(中东技术大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本研究对29个开源生成大语言模型进行全面伦理评估,评估鲁棒性、可靠性、安全性和公平性,发现较大模型在伦理表现上更优,禁言模板对多数模型无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03783 2026-01-08 cs.CL 70%

HearSay Benchmark: Do Audio LLMs Leak What They Hear?

HearSay基准:音频大语言模型是否泄露所听内容?

Jin Wang, Liang Lin, Kaiwen Luo, Weiliu Wang, Yitian Chen, Moayad Aloqaily, Xuehai Tang, Zhenhong Zhou, Kun Wang, Li Sun, Qingsong Wen

机构 * XDU(北华大学) NTU(国立台湾大学) NCEPU(南京工程大学) BUPT(北京邮电大学) SHU(上海大学) UAEU(阿联酋大学) UCAS-IIE(中国科学院大学国际学院) Squirrel AI

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 HearSay基准研究发现音频大语言模型通过声纹泄露隐私,揭示其固有隐私风险及安全机制不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02669 2026-01-07 cs.CL 70%

Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking

面向大规模语言模型事实核查的全面阶段性基准评估

Hongzhan Lin, Zixin Chen, Zhiqi Shen, Ziyang Luo, Zhen Ye, Jing Ma, Tat-Seng Chua, Guandong Xu

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Salesforce AI Research(Salesforce AI 研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) The Education University of Hong Kong(香港教育大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 FactArena提出一个全面的LLM事实核查阶段基准评估框架,通过标准化流程和动态生成挑战性声明,揭示LLM在事实推理中的鲁棒性与准确性差异。

Comments 17 pages, 21 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03750 2026-01-07 cs.LG cs.AI cs.CL cs.CY 70%

The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems

MASK基准:在人工智能系统中区分诚实与准确性

Richard Ren, Arunim Agarwal, Mantas Mazeika, Cristina Menghini, Robert Vacareanu, Brad Kenstler, Mick Yang, Isabelle Barrass, Alice Gatti, Xuwang Yin, Eduardo Trevino, Matias Geralnik, Adam Khoja, Dean Lee, Summer Yue, Dan Hendrycks

机构 * Center for AI Safety(人工智能安全中心) Scale AI

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出MASK基准,通过大规模人工数据集区分LLM的准确性和诚实性,发现大模型虽更准确但不更诚实,简单干预可提升诚实度,强调需加强评估与干预以确保模型可信。

Comments Website: https://www.mask-benchmark.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23506 2026-01-06 cs.AI cs.HC 70%

Emotion-Coherent Reasoning for Multimodal LLMs via Emotional Rationale Verifier

通过情感推理验证器实现多模态大语言模型的情感一致性推理

Hyeongseop Rha, Jeong Hun Yeo, Yeonju Kim, Yong Man Ro

机构 * Corresponding author(通讯作者)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出情感推理验证器和解释奖励,通过引导模型生成与目标情绪一致的推理,提升多模态大语言模型在情绪识别中的解释准确性与一致性。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24587 2026-01-01 stat.ML cs.LG 70%

MultiRisk: Multiple Risk Control via Iterative Score Thresholding

MultiRisk: 多风险控制 via 迭代分数阈值

Sunay Joshi, Yan Sun, Hamed Hassani, Edgar Dobriban

机构 * University of Pennsylvania(宾夕法尼亚大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 MultiRisk通过迭代分数阈值控制多个风险约束,利用动态规划算法实现对大型语言模型在安全约束下的有效控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23312 2025-12-30 cs.RO cs.AI 70%

Explainable Neural Inverse Kinematics for Obstacle-Aware Robotic Manipulation: A Comparative Analysis of IKNet Variants

可解释的神经逆向运动学用于障碍物感知的机器人操作:对IKNet变体的比较分析

Sheng-Kai Chen, Yi-Ling Tsai, Chun-Chih Chang, Yan-Chen Chen, Po-Chiang Lin

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本研究提出了一种可解释性工作流程,通过Shapley值归因和物理障碍规避评估,改进IKNet变体以提升机器人操作的透明性和安全性。

Comments 27 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21583 2025-12-29 cs.AI 70%

A Medical Multimodal Diagnostic Framework Integrating Vision-Language Models and Logic Tree Reasoning

一种整合视觉-语言模型和逻辑树推理的医学多模态诊断框架

Zelin Zang, Wenyi Gu, Siqi Ma, Dan Yang, Yue Shen, Zhu Zhang, Guohui Fan, Wing-Kuen Ling, Fuji Yang

机构 * Tsientang Institute of Advanced Study (TIAS)(钱塘先进研究所) Westlake University(西湖大学) Ant Group(蚂蚁集团) China-Japan Friendship Hospital(中日友好医院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种整合视觉-语言模型与逻辑树推理的医学诊断框架,旨在提升多模态医学AI的可信度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06489 2025-12-19 cs.CL 70%

On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks

大语言模型在对抗攻击下的语言自信度鲁棒性研究

Stephen Obadinma, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Ingenuity Labs Research Institute(创新实验室研究所) Queen’s University(皇后大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文研究了大语言模型在对抗攻击下的语言自信度鲁棒性,发现现有防御技术效果有限,需设计更稳健的自信表达机制。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15033 2025-12-18 cs.AI 70%

Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation

超越准确性:大型语言模型在国际象棋评估中的几何稳定性分析

Xidan Song, Weiqi Wang, Ruifeng Cao, Qingya Hu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出几何稳定性框架,用于评估大型语言模型在国际象棋评估中的几何推理能力,揭示了模型在几何变换下的稳定性差异及性能悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14712 2025-12-18 cs.LG cs.AI cs.CL cs.CV cs.CY 70%

SepsisSuite: Beyond Risk Stratification -- A Comparative Analysis of Deep Fusion vs. Expert Stacking for Prescriptive Sepsis AI

SepsisSuite: 超越风险分层 -- 深度融合与专家堆叠的比较分析用于处方性脓毒症AI

Ryan Cartularo

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 SepsisSuite通过深度融合与专家堆叠对比,提出SepsisLateFusion架构,实现预测临床发作前4小时的AUC 0.915,并提升抗生素选择性能。

Comments 7 Pages, 4 Tables, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01354 2025-12-10 cs.AI cs.CL cs.CY cs.LG q-fin.TR 70%

The Necessity of Imperfection:Reversing Model Collapse via Simulating Cognitive Boundedness

不完美之必要:通过模拟认知局限性逆转模型崩溃

Zhongjie Jiang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出通过模拟认知局限性生成具有真实功能增益的合成数据,以解决模型崩溃问题。

Comments 60 pages,9 figures. v3: Major update. Added 3D topological visualization (Figure 1) and independent computational verification of the Adaptive Markets Hypothesis (AMH). Includes comprehensive Supplementary Materials (algorithmic pseudocode, system architecture, and real-time GARCH logs) for technical reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07059 2025-12-09 cs.CL 70%

Replicating TEMPEST at Scale: Multi-Turn Adversarial Attacks Against Trillion-Parameter Frontier Models

在大规模上复制TEMPEST:针对万亿参数前沿模型的多轮对抗攻击

Richard Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究通过TEMPEST框架评估了十种前沿模型对多轮对抗攻击的鲁棒性,发现模型规模不影响鲁棒性,而思考模式能提升安全性。

Comments 30 pages, 11 figures, 5 tables. Code and data: https://github.com/ricyoung/tempest-replication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03072 2025-12-09 cs.AI cs.LO 70%

Beyond the Black Box: A Cognitive Architecture for Explainable and Aligned AI

超越黑箱:可解释和对齐的AI认知架构

Hu Keyi

机构 * Tongji University(同济大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出'权重计算主义'认知架构,通过分解认知为逻辑原子和基本操作,实现可解释、普遍和可追溯的价值对齐,为通用人工智能的发展提供理论和实践基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19397 2025-12-09 cs.LG 70%

Are Time-Series Foundation Models Deployment-Ready? A Systematic Study of Adversarial Robustness Across Domains

时间序列基础模型是否已准备好部署?跨领域的对抗鲁棒性系统研究

Jiawen Zhang, Zhenwei Zhang, Shun Zheng, Xumeng Wen, Jia Li, Jiang Bian

机构 * HKUST (GZ)(香港科技大学) Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本研究系统分析了时间序列基础模型在跨领域对抗攻击下的鲁棒性,揭示了模型脆弱性及改进方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00591 2025-12-05 cs.CL 70%

Probe-Rewrite-Evaluate: A Workflow for Reliable Benchmarks and Quantifying Evaluation Awareness

探测-重写-评估:一种用于可靠基准和量化评估意识的工作流程

Lang Xiong, Nishant Bhargava, Jianhang Hong, Jeremy Chang, Haihao Liu, Vasu Sharma, Kevin Zhu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究提出探测-重写-评估工作流程,通过量化LLM在不同上下文中的行为变化,揭示评估意识对模型安全性和诚实性的影响,并展示更真实的评估框架的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01191 2025-12-02 cs.CL 70%

Generalist Large Language Models Outperform Clinical Tools on Medical Benchmarks

通用大语言模型在医疗基准测试中优于临床工具

Krithik Vishwanath, Mrigayu Ghosh, Anton Alyakin, Daniel Alexander Alber, Yindalon Aphinyanaphongs, Eric Karl Oermann

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 通用大语言模型在医疗基准测试中表现优于临床工具,揭示了临床AI系统在某些关键能力上的不足。

Comments 17 pages, 4 figures (2 regular, 2 supplemental)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00019 2025-12-02 cs.RO cs.AI cs.CV 70%

A Comprehensive Survey on Surgical Digital Twin

外科数字孪生的全面综述

Afsah Sharaf Khan, Falong Fan, Doohwan DH Kim, Abdurrahman Alshareef, Dong Chen, Justin Kim, Ernest Carter, Bo Liu, Jerzy W. Rozenblit, Bernard Zeigler

机构 * IEEE

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文综述了外科数字孪生的技术现状与挑战,提出分类方法并识别了验证、安全性和数据治理等开放问题,旨在推动其在临床中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18192 2025-12-01 cs.CV cs.AI 70%

ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization

ARIAL:一个用于文档视觉问答的代理框架,具有精确答案定位

Ahmad Mohammadshirazi, Pinaki Prasad Guha Neogi, Dheeraj Kulshrestha, Rajiv Ramnath

机构 * Ohio State University(俄亥俄州立大学) Flairsoft(Flairsoft公司)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 ARIAL通过代理协调专门工具,实现文档VQA的高精度和可解释性,取得最佳性能和可解释性成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12565 2025-12-01 cs.CL 70%

Self Iterative Label Refinement via Robust Unlabeled Learning

通过鲁棒无标签学习实现自迭代标签细化

Hikaru Asano, Tadashi Kozuno, Yukino Baba

机构 * The University of Tokyo(东京大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出了一种通过鲁棒无标签学习实现自迭代标签细化的方法,有效提升了LLM在分类任务中的性能,并在安全对齐和生成任务中展示了优越性。

Comments To appear in the Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15716 2025-11-21 cs.AI 70%

MACIE: Multi-Agent Causal Intelligence Explainer for Collective Behavior Understanding

MACIE:多智能体因果智能解释器用于集体行为理解

Abraham Itzhak Weinberg

机构 * AI-WEINBERG, AI Experts, Tel Aviv, Israel(AI-WEINBERG,AI专家,特拉维夫,以色列)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 MACIE通过结合因果模型和反事实分析,为多智能体强化学习提供全面的因果解释,解决集体行为归因、涌现智能量化和可操作解释问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14805 2025-11-20 cs.SE cs.AI 70%

Towards Continuous Assurance with Formal Verification and Assurance Cases

Dhaminda B. Abeywickrama, Michael Fisher, Frederic Wheeler, Louise Dennis

机构 * Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Regulatory Support Directorate, Amentum(Amentum监管支持部门)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09904 2025-11-19 cs.AI 70%

CTRL-ALT-DECEIT: Sabotage Evaluations for Automated AI R&D

Francis Rhys Ward, Teun van der Weij, Hanna Gábor, Sam Martin, Raja Mehta Moreno, Harel Lidar, Louis Makower, Thomas Jodrell, Lauren Robson

机构 * LawZero Apollo Research Imperial College London(帝国理工学院伦敦校区)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments 53 pages, 21 figures, 8 tables. Accepted as a spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21359 2025-11-19 cs.CL cs.AI cs.CY cs.LG econ.GN q-fin.EC 70%

Can Machines Think Like Humans? A Behavioral Evaluation of LLM Agents in Dictator Games

Ji Ma

机构 * Gradel Institute of Charity, New College, University of Oxford(格拉德学院,牛津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13670 2025-11-18 cs.HC cs.AI 70%

Person-AI Bidirectional Fit - A Proof-Of-Concept Case Study Of Augmented Human-Ai Symbiosis In Management Decision-Making Process

Agnieszka Bieńkowska, Jacek Małecki, Alexander Mathiesen-Ohman, Katarzyna Tworek

机构 * Department of Management Systems and Organizational Development, Faculty of Management, Wrocław University of Science and Technology(管理系统与组织发展系,管理学院,沃林大学科学与技术学院) Department of Mathematics, Faculty of Mathematics, Wrocław University of Science and Technology(数学系,数学学院,沃林大学科学与技术学院) AMOTHO Research Institute, Vallsjön 20, 780 00 Rörbäcksnäs, Sweden(AMOTHO研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

Comments 30 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13381 2025-11-18 cs.CL 70%

Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts

Siyu Zhu, Mouxiao Bian, Yue Xie, Yongyu Tang, Zhikang Yu, Tianbin Li, Pengcheng Chen, Bing Han, Jie Xu, Xiaoyan Dong

机构 * Shanghai Children’s Hospital, School of Medicine,Shanghai Jiao Tong University(上海儿童医学中心,上海交通大学医学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai University of Traditional Chinese Medicine(上海中医药大学) University of Washington(华盛顿大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05682 2025-11-11 cs.CV cs.LG 70%

VMDT: Decoding the Trustworthiness of Video Foundation Models

Yujin Potter, Zhun Wang, Nicholas Crispino, Kyle Montgomery, Alexander Xiong, Ethan Y. Chang, Francesco Pinto, Yuqi Chen, Rahul Gupta, Morteza Ziyadi, Christos Christodoulopoulos, Bo Li, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) Amazon(亚马逊) Information Commissioner’s Office(信息专员办公室)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

Comments NeurIPS 2025 Datasets & Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13333 2025-11-11 cs.AI 70%

Evaluation Awareness Scales Predictably in Open-Weights Large Language Models

Maheep Chaudhary, Ian Su, Nikhil Hooda, Nishith Shankar, Julia Tan, Kevin Zhu, Ryan Lagasse, Vasu Sharma, Ashwinee Panda

机构 * Independent(独立研究者) UC Irvine(加州大学尔湾分校) University of Waterloo(滑铁卢大学) UW Madison(威斯康星大学麦迪逊分校) University of Toronto(多伦多大学) Algoverse(Algoverse公司) META University of Maryland(马里兰大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04886 2025-11-10 cs.CV cs.AI 70%

Beta Distribution Learning for Reliable Roadway Crash Risk Assessment

Ahmad Elallaf, Nathan Jacobs, Xinyue Ye, Mei Chen, Gongbo Liang

机构 * Texas A&M University-San Antonio(德克萨斯A&M大学-圣安东尼奥分校) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Alabama(阿拉巴马大学) University of Kentucky(肯塔基大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏