arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9324 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9324 篇

2604.22143 2026-04-27 cs.CY cs.CL 73%

Recognition Without Authorization: LLMs and the Moral Order of Online Advice

无需授权的识别:大语言模型与在线建议的道德秩序

Tom van Nuenen

机构 * Social Sciences Data Lab(社会科学数据实验室) UC Berkeley(伯克利大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文研究大语言模型在处理日常人际困境时的建议倾向,发现其在识别问题时较少给予行动授权,特别是在社区共识强烈的情况下,模型推荐退出的比例显著低于人类,且保持较高的谨慎和治疗框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19790 2026-04-23 cs.AI cs.LG 73%

Hidden Reliability Risks in Large Language Models: Systematic Identification of Precision-Induced Output Disagreements

大语言模型中的隐藏可靠性风险:系统性识别精度诱导的输出分歧

Yifei Wang, Tianlin Li, Xiaohan Zhang, Xiaoyu Zhang, Wei Ma, Mingfei Cheng, Li Pan

机构 * Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院)

专题命中 安全评测 :alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PrecisionDiff框架,用于系统检测大语言模型在不同精度下的行为分歧,通过生成精度敏感测试输入并进行跨精度比较分析,揭示传统方法难以发现的细微差异,实验表明此类分歧在多个开源对齐LLM中普遍存在,PrecisionDiff在检测此类问题上表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01770 2026-04-21 cs.CR cs.AI cs.LG cs.SE 73%

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction

ReGA:通过表示引导抽象的基于模型的安全保障方法

Zeming Wei, Chengcan Wu, Meng Sun

机构 * Peking University(北京大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ReGA框架,通过利用安全关键表示缩小模型分析在大规模语言模型中的可扩展性差距,有效区分安全与有害输入,提升LLM安全性。

Comments FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22174 2026-04-17 cs.DC cs.AI cs.AR cs.CR cs.LG 73%

BitFlipScope: Scalable Fault Localization and Recovery for Bit-Flip Corruptions in LLMs

BitFlipScope:面向LLM中位翻故障的可扩展故障定位与恢复

Muhammad Zeeshan Karamat, Sadman Saif, Christiana Chamon Garcia

机构 * Bradly Dept. of ECE(布拉利电子工程系) Virginia Tech(弗吉尼亚理工学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 BitFlipScope通过两种部署场景实现LLM中位翻故障的定位与恢复,利用差分分析和残差路径扰动等方法,支持轻量级性能恢复,提升硬件环境下的模型可靠性。

Comments Accepted at the IEEE International Symposium on Hardware Oriented Security and Trust (HOST) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23636 2026-04-16 cs.LG cs.AI 73%

FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation

FlexGuard: 严格度自适应的连续风险评分用于LLM内容审核

Zhihao Ding, Jinming Li, Ze Lu, Jieming Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FlexGuard,一种基于LLM的连续风险评分系统,通过风险对齐优化提升审核准确性和在不同严格度下的鲁棒性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24857 2026-04-09 cs.CL cs.CY 73%

Between Help and Harm: An Evaluation of Mental Health Crisis Handling by LLMs

在帮助与伤害之间:对LLM处理心理健康危机的评估

Adrian Arnaiz-Rodriguez, Miguel Baidal, Erik Derner, Jenn Layton Annable, Mark Ball, Mark Ince, Elvira Perez Vallejos, Nuria Oliver

机构 * ELLIS Alicante(ELLIS 阿利坎特) CTU in Prague(捷克布拉格理工大学) School of Health Science, The University of Nottingham(诺丁汉大学健康科学学院) School of Psychology, Public Health and Social Care, Derby University(德比大学心理学、公共卫生与社会关怀学院) Mental Health Practitioner, Social Worker & Independent Scholar(心理健康从业者、社会工作者与独立学者) School of Computer Science & School of Medicine, The University of Nottingham(诺丁汉大学计算机科学学院与医学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文评估了LLM在处理心理健康危机时的性能,提出六类危机分类、2252个示例数据集及临床评估协议,发现部分模型在自残和自杀类别中存在不安全输出,强调需加强安全防护和上下文感知能力。

Comments Accepted for publication in JMIR Mental Health. DOI: 10.2196/88435

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03121 2026-03-31 cs.CL cs.AI cs.SY eess.SY 73%

Control Barrier Function for Aligning Large Language Models

用于对齐大语言模型的控制屏障函数

Yuya Miyaoka, Masaki Inoue

机构 * Keio University(庆应义塾大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于控制的框架,利用控制屏障函数确保用户期望的文本生成,通过安全过滤器干预生成文本,无需微调基模型。

Comments This work is an extenede version of arXiv:2408.15625 and has been submitted to the IEEE for possible publication

Journal ref IEEE Transactions on Control Systems Technology 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01187 2026-03-31 cs.CL cs.CY 73%

Surfacing Subtle Stereotypes: A Multilingual, Debate-Oriented Evaluation of Modern LLMs

揭示微妙的刻板印象:一种多语言、辩论导向的现代大语言模型评估

Muhammed Saeed, Muhammad Abdul-mageed, Shady Shehata

机构 * The University of British Columbia(不列颠哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文提出多语言辩论基准测试,揭示生成模型中叙事偏见。通过8400个跨语言辩论提示,评估模型对敏感领域刻板印象的再现,发现所有模型均存在偏见,且低资源语言中偏见更严重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17570 2026-03-19 cs.LG cs.AI 73%

FoMo X: Modular Explainability Signals for Outlier Detection Foundation Models

FoMo X:用于异常检测基础模型的模块化可解释性信号

Simon Klüttermann, Tim Katzke, Phuong Huong Nguyen, Emmanuel Müller

机构 * TU Dortmund University, Dortmund, Germany(图卢兹大学(德累斯顿)) Research Center Trustworthy Data Science and Security, University Alliance Ruhr, Dortmund, Germany(可信数据科学与安全研究中心,鲁尔大学联盟,德累斯顿,德国)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 FoMo-X通过模块化框架为异常检测基础模型提供内在轻量级诊断能力,利用预训练PFN背骨的冻结嵌入编码丰富关系信息,通过附加诊断头实现高效可解释性,实验证明其在合成和真实世界基准上具有高保真度和低推理开销。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06183 2026-03-18 cs.CL cs.AI cs.CV 73%

CRIMSON: A Clinically-Grounded LLM-Based Metric for Generative Radiology Report Evaluation

CRIMSON:一种基于临床的LLM评估指标用于生成放射学报告评估

Mohammed Baharoon, Thibault Heintz, Siavash Raissi, Mahmoud Alabbad, Mona Alhammad, Hassan AlOmaish, Sung Eun Kim, Oishi Banerjee, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Department of Radiation Oncology, Mass General Brigham(放射肿瘤科,麻省总医院与布里奇沃特医院) King Fahad Hospital, Al-Ahsa Health Cluster, Al Hofuf, Saudi Arabia(国王法赫德医院,阿尔阿萨卫生集群,阿尔霍夫,沙特阿拉伯) Ras-Tanura General Hospital, Ministry of Health, Eastern Province, Saudi Arabia(拉斯-坦纳医院,卫生部,东部省,沙特阿拉伯) Department of Medical Imaging, King Abdulaziz Medical City, Ministry of National Guard, Riyadh, Saudi Arabia(医学影像科,国王阿卜杜勒-阿齐兹医疗城,国民卫队部,利雅得,沙特阿拉伯)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 CRIMSON是一种基于临床的LLM评估指标,用于评估生成的放射学报告,通过考虑诊断正确性、上下文相关性和患者安全,提供更全面的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16211 2026-03-13 cs.SD cs.AI cs.CL eess.AS 73%

AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models

AudioTrust: 音频大语言模型多维可信度基准测试

Kai Li, Can Shen, Yile Liu, Jirui Han, Kelong Zheng, Xuechao Zou, Lionel Z. Wang, Shun Zhang, Xingjian Du, Hanjun Luo, Yingbin Jin, Xinxin Xing, Ziyang Ma, Yue Liu, Yifan Zhang, Junfeng Fang, Kun Wang, Yibo Yan, Gelei Deng, Haoyang Li, Yiming Li, Xiaobin Zhuang, Tianlong Chen, Qingsong Wen, Tianwei Zhang, Yang Liu, Haibo Hu, Zhizheng Wu, Xiaolin Hu, Eng-Siong Chng, Wenyuan Xu, XiaoFeng Wang, Wei Dong, Xinfeng Li

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 AudioTrust通过多维度评估音频大语言模型的可信度,揭示其在高风险音频场景下的局限性,为安全部署提供关键洞察。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15237 2026-03-10 cs.AI cs.CV cs.LG 73%

MICA: Multi-Agent Industrial Coordination Assistant

MICA:多智能体工业协调助手

Di Wen, Kunyu Peng, Junwei Zheng, Yufan Chen, Yitian Shi, Jiale Wei, Ruiping Liu, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄大学) INSAIT Hunan University(湖南大学) Carl Zeiss Stiftung(卡尔蔡司基金会) University of Excellence(卓越大学) Helmholtz Association(海德堡协会) State of Baden-Württemberg(巴登-符腾堡州) German Research Foundation(德国研究基金会) National Natural Science Foundation of China(国家自然科学基金委员会) Hunan Provincial Research and Development Project(湖南省研发项目) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 MICA是一种基于感知和语音交互的多智能体系统,通过自适应步骤融合技术提升工业任务的执行效率和可靠性。

Comments Accepted to ICRA 2026. The source code will be made publicly available at https://github.com/Kratos-Wen/MICA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22224 2026-03-03 cs.SE cs.AI cs.LG cs.LO cs.SY eess.SY 73%

Taming Silent Failures: A Framework for Verifiable AI Reliability

驯服沉默故障:一种可验证AI可靠性的框架

Guan-Yan Yang, Farn Wang

机构 * National Taiwan University(台湾大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FAME框架,通过结合离线形式化合成与在线运行时监控,有效检测自动驾驶系统中的安全违规,提供可验证的AI可靠性解决方案。

Comments This preprint has been accepted by IEEE Reliability Magazine. 10 pages, 3 figures

Journal ref IEEE Reliability Magazine ( Volume: 2, Issue: 4, December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12186 2026-03-03 cs.LG cs.AI cs.CR 73%

Self-Destructive Language Model

自我毁灭型语言模型

Yuhui Wang, Rongyi Zhu, Ting Wang

机构 * Department of Computer Science(计算机科学系)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 SEAM是一种通过自我毁灭机制增强大语言模型安全性的新型防御方法,通过使模型在面对有害数据微调时性能急剧下降,从而有效抵御攻击。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08781 2026-02-27 cs.AI cs.CL 73%

Evaluating the Evaluator: Measuring LLMs' Adherence to Task Evaluation Instructions

评估评估者:衡量LLMs对任务评估指令的遵守情况

Bhuvanashree Murugadoss, Christian Poelitz, Ian Drosos, Vu Le, Nick McKenna, Carina Suzana Negreanu, Chris Parnin, Advait Sarkar

专题命中 安全评测 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLMs在任务评估中的表现,发现提示对评估结果影响有限,困惑度有时比提示更符合人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20976 2026-02-25 cs.CL cs.CY 73%

Evaluating Proactive Risk Awareness of Large Language Models

评估大型语言模型的前瞻性风险意识

Xuan Luo, Yubin Chen, Zhiyu Hou, Linpu Yu, Geng Tu, Jing Li, Ruifeng Xu

机构 * The Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University, Hong Kong(香港理工大学) Southern University of Science and Technology, Shenzhen(南方科技大学) Shenzhen Loop Area Institute, Shenzhen, China(深圳南山区研究院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文提出前瞻性风险意识评估框架,通过Butterfly数据集评估LLMs在生态领域预见潜在危害的能力,发现响应长度限制和多模态保护盲点等问题,强调部署LLM时需加强主动防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18468 2026-02-24 cs.CY cs.CL 73%

The Algorithmic Unconscious: Structural Mechanisms and Implicit Biases in Large Language Models

算法无意识:大型语言模型中的结构机制与隐性偏见

Philippe Boisnard

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨了大型语言模型中结构性机制与隐性偏见,揭示了分词、注意力等机制对偏见的影响,并提出技术诊所框架以促进AI基础设施的批判性利用。

Comments 18 pages, 5 figures, Extended version of a paper presented at the international conference 'Artificial Intelligence and Transformations of Information' (LOGOS/FLSH, Hassan II University of Casablanca, Morocco, December 2025), accepted for publication in LOGOS after double-blind peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07117 2026-02-16 cs.AI cs.LG 73%

The Conditions of Physical Embodiment Enable Generalization and Care

物理具身的条件使泛化和关怀成为可能

Leonardo Christov-Moore, Arthur Juliani, Alex Kiefer, Joel Lehman, Nicco Reggente, B. Scot Rousse, Adam Safron, Nicolás Hinrichs, Daniel Polani, Antonio Damasio

机构 * Institute for Advanced Consciousness Studies(先进意识研究所) Monash Centre for Consciousness and Contemplative Studies(莫纳什意识与冥想研究中心) University of Oxford(牛津大学) Topos Institute(拓斯研究所) Allen Discovery Center(艾伦发现中心) Okinawa Institute of Science and Technology(冲绳科学技术研究所) Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所) University of Hertfordshire(赫特福德郡大学) Brain and Creativity Institute(大脑与创造力研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出物理具身的条件是泛化和关怀的基础,通过稳态驱动和因果建模实现智能体在开放环境中的鲁棒性和可信对齐。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11412 2026-02-13 cs.CY cs.AI cs.HC 73%

When Visibility Outpaces Verification: Delayed Verification and Narrative Lock-in in Agentic AI Discourse

当可见性超越验证:代理AI discourse中的延迟验证与叙述锁定

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱文大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文研究了代理AI讨论中可见性与验证时间的关系,揭示了高可见度讨论因延迟验证导致的叙述锁定现象,并提出知识摩擦作为平衡平台的干预措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07963 2026-02-10 cs.CL cs.AI 73%

Lost in Translation? A Comparative Study on the Cross-Lingual Transfer of Composite Harms

迷失在翻译中?复合危害的跨语言迁移比较研究

Vaibhav Shukla, Hardik Sharma, Adith N Reganti, Soham Wasmatkar, Bagesh Kumar, Vrijendra Singh

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过复合危害基准测试,探讨了跨语言迁移中安全对齐的稳定性,发现攻击成功率在印度语言中显著上升,但上下文性危害迁移较温和,强调翻译基准在多语言安全测试中的必要性。

Comments Accepted at the AICS Workshop, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02862 2026-02-04 cs.AI cs.LG 73%

STEER: Inference-Time Risk Control via Constrained Quality-Diversity Search

STEER: 通过受约束的质量多样性搜索实现推理时间的风险控制

Eric Yang, Jong Ha Lee, Jonathan Amar, Elissa Ye, Yugang Jia

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 STEER通过受约束的质量多样性搜索实现推理时间的风险控制,提供可调节的决策保守性调整,提升临床分诊等场景下的行为覆盖和准确性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16584 2026-02-03 cs.CL cs.AI 73%

From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations

从分数到步骤:诊断和改进证据医学计算中LLM的性能

Benlu Wang, Iris Xia, Yifan Zhang, Junda Wang, Feiyun Ouyang, Shuo Han, Arman Cohan, Hong Yu, Zonghai Yao

机构 * Department of Computer Science, Yale University, CT, USA(耶鲁大学计算机科学系) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA贝福德医疗中心健康组织与实施研究中心) Miner School of Computer and Information Sciences, UMass Lowell, MA, USA(UMass洛厄尔矿尔计算机与信息科学学院) Manning College of Information and Computer Sciences, UMass Amherst, MA, USA(UMass阿默斯特马宁信息与计算机科学学院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedRaC框架,通过分步评估和代码执行提升LLM在证据医学计算中的准确性,揭示现有评估方法的不足,并推动临床可信度的提升。

Comments Equal contribution for the first two authors. To appear as an Oral presentation in the proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21505 2026-01-30 cs.AI cs.CL cs.HC 73%

The Effectiveness of Style Vectors for Steering Large Language Models: A Human Evaluation

风格向量对大型语言模型的控制效果:一项人类评估

Diaoulé Diallo, Katharina Dworatzyk, Sophie Jentzsch, Peer Schütt, Sabine Theis, Tobias Hecking

机构 * German Aerospace Center (DLR), Institute of Software Technology(德国航空航天中心(DLR)软件技术研究所)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过人类评估验证了激活引导在控制大型语言模型情绪输出中的有效性,发现中等强度引导能显著增强目标情绪并保持文本可理解性,且模型升级后效果更稳定。

Journal ref IEEE Access 13 (2025) 191443-191457

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00600 2026-01-28 cs.CL cs.LG 73%

A Context-Aware Dual-Metric Framework for Confidence Estimation in Large Language Models

一种面向上下文的双指标框架用于大型语言模型中的置信度估计

Mingruo Yuan, Shuyi Zhang, Ben Kao

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 CRUX是一种面向上下文的双指标框架,通过上下文熵减少和统一一致性检验提升大型语言模型的置信度估计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17312 2026-01-27 cs.CL cs.AI 73%

Meta-Judging with Large Language Models: Concepts, Methods, and Challenges

元评判与大型语言模型:概念、方法与挑战

Hugo Silva, Mateus Mendes, Hugo Gonçalo Oliveira

机构 * University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra, Department of Informatics Engineering(科英布拉大学,CISUC/LASI——科英布拉大学信息与系统研究中心,信息工程系) Polytechnic University of Coimbra, Rua da Misericórdia, Lagar dos Cortiços, S. Martinho do Bispo, 3045-093 Coimbra, Portugal(科英布拉理工大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了LLM-as-a-Meta-Judge在提升自动化评估稳定性与可信度方面的潜力,同时指出需解决的成本、提示敏感性及共享偏差等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12409 2026-01-26 cs.LG cs.AI cs.NE 73%

Interpretable Fine-Gray Deep Survival Model for Competing Risks: Predicting Post-Discharge Foot Complications for Diabetic Patients in Ontario

可解释的细灰深度生存模型用于竞争风险:预测安大略省糖尿病患者出院后足部并发症

Dhanesh Ramachandram, Anne Loefler, Surain Roberts, Amol Verma, Maia Norman, Fahad Razak, Conrad Pow, Charles de Mestral

机构 * Vector Institute(向量研究所) GEMINI University of Toronto(多伦多大学) Diabetes Action Canada(加拿大糖尿病行动)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种可解释的细灰深度生存模型,用于预测糖尿病患者出院后足部并发症,通过透明的预测方法提高医疗AI的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04688 2026-01-09 cs.CL cs.AI cs.FL 73%

ToolGate: Contract-Grounded and Verified Tool Execution for LLMs

ToolGate: 以合同为基础并经过验证的工具执行用于LLMs

Yanming Liu, Xinyue Peng, Jiannan Cao, Xinyi Wang, Songhang Deng, Jintao Chen, Jianwei Yin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 ToolGate通过形式化合同和验证机制,确保LLM调用工具时逻辑安全和状态演变的可验证性,提升系统可靠性与可调试性。

Comments First version of ToolGate

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22145 2025-12-30 cs.DL cs.AI cs.CY 73%

Pre-review to Peer review: Pitfalls of Automating Reviews using Large Language Models

预审至同行评审:使用大型语言模型自动化评审的陷阱

Akhil Pandey Akella, Harish Varma Siravuri, Shaurya Rohatgi

机构 * AllSci Corp(AllSci公司) Sunwater Capital(Sunwater资本) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) Dept. of Computer Science, Northern Illinois University(北伊利诺伊大学计算机科学系) Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文研究了使用大型语言模型进行学术评审的潜力与风险,发现其作为预审筛选工具具有一定效用,但存在与人类评审不一致的风险及系统性高估偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19025 2025-12-24 cs.CR cs.AI cs.LG 73%

The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation

擦除幻觉:对LLM遗忘评估泛化能力的压测试

Hengrui Jia, Taoran Li, Jonas Guan, Varun Chandrasekaran

机构 * University of Toronto and Vector Institute(多伦多大学和向量研究所)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PSG框架,通过生成语义衍生但嵌入空间不同的替代数据集,揭示LLM无学习评估中普遍存在的度量不准确问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17920 2025-12-23 cs.CL cs.AI 73%

Separating Constraint Compliance from Semantic Accuracy: A Novel Benchmark for Evaluating Instruction-Following Under Compression

分离约束合规性与语义准确性:一种新的基准,用于在压缩下评估指令遵循

Rahul Baxi

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CDCT基准,揭示LLMs在压缩下约束合规性与语义准确性之间的矛盾,发现中等压缩时约束违规主要由RLHF训练的有用性行为导致。

Comments 19 pages, 9 figures; currently under peer review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏