arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-24 至 2026-04-24 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2503.07341 2026-04-24 econ.GN cs.AI q-fin.EC 77%

The Economics of p(doom): Scenarios of Existential Risk and Economic Growth in the Age of Transformative AI

transformative AI 的经济影响:转型人工智能时代存在风险与经济增长的场景

Jakub Growiec, Klaus Prettner

机构 * SGH Warsaw School of Economics(SGH华沙经济学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文探讨了转型人工智能对人类经济和存在风险的影响,分析了不同场景下的整体福利影响,指出即使低概率的灾难性结果也需加大AI安全与对齐研究投入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20869 2026-04-24 cs.CY cs.AI cs.HC cs.IR cs.LG 75%

Clinical Reasoning AI for Oncology Treatment Planning: A Multi-Specialty Case-Based Evaluation

肿瘤治疗规划的临床推理AI:多专科基于病例的评估

Philippe E. Spiess, Md Muntasir Zitu, Alison Walker, Daniel A. Anaya, Robert M. Wenham, Michael Vogelbaum, Daniel Grass, Ali-Musa Jaffer, Amod Sarnaik, Caitlin McMullen, Christine Sam, John V. Kiluk, Tianshi Liu, Tiago Biachi, Julio Powsang, Jing-Yi Chern, Roger Li, Seth Felder, Samuel Reynolds, Michael Shafique, Alison Sheehan, Ashley Layman, Cydney A. Warfield, Derrick Legoas, Jaclyn Parrinello, Jena Schmitz, Kevin Eaton, Mark Honor, Luis Felipe, Issam ElNaqa, Elier Delgado, Talia Berler, Rachael V. Phillips, Frantz Francisque, Carlos Garcia Fernandez, Gilmer Valdes

机构 * Moffitt Cancer Center and Research Institute(莫菲特癌症中心与研究学院) Innova Montréal Inc.(蒙特利尔创新公司) Oncobrain, Inc.(Oncobrain公司) Advanced Cancer Treatment Centers(先进癌症治疗中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文评估了OncoBrain在多专科病例中的表现,展示了其在肿瘤治疗规划中的准确性、安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21263 2026-04-24 cs.AI cs.PL cs.SE q-bio.QM 74%

Trustworthy Clinical Decision Support Using Meta-Predicates and Domain-Specific Languages

可信的临床决策支持使用元谓词和领域特定语言

Michael Bouzinier, Sergey Trifonov, Michael Chumack, Eugenia Lvova, Dmitry Etin

机构 * Harvard University(哈佛大学) IDEXX Laboratories(IDEXX实验室) Forome Association(Forome协会) Deggendorf Institute of Technology(德格多夫技术学院)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文提出使用元谓词和领域特定语言来确保临床决策规则的证据适当性,通过元谓词验证在部署前约束证据使用,提升决策的可审计性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21076 2026-04-24 cs.CL cs.AI 62%

Serialisation Strategy Matters: How FHIR Data Format Affects LLM Medication Reconciliation

序列化策略至关重要:FHIR数据格式如何影响LLM药物重整

Sanjoy Pator

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨FHIR数据序列化对LLM药物重整性能的影响,发现临床叙述格式在小模型中表现更优,而大模型更倾向使用原始JSON,揭示了序列化策略对临床安全审计的重要性。

Comments 14 pages, 7 figures, independent research

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09253 2026-04-24 cs.LG cs.AI 62%

RIFT: Repurposing Negative Samples via Reward-Informed Fine-Tuning

RIFT:通过奖励引导微调重用负样本

Zehua Liu, Shuqi Liu, Tao Zhong, Mingxuan Yuan

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 RIFT通过奖励引导微调利用所有自生成样本,重用负轨迹并重新加权损失,提升对齐效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17085 2026-04-24 cs.LG cs.AI 62%

Why Do Language Model Agents Whistleblow?

为何语言模型代理会泄露信息?

Kushal Agrawal, Frank Xiao, Guido Bergman, Asa Cooper Stickland

机构 * Relativity California Institute of Technology(加州理工学院) BAISH

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了语言模型在作为工具使用代理时的对齐训练新表现,发现模型可能在无用户指令的情况下披露疑似违规行为,通过多样化场景评估发现模型泄露行为受模型家族、任务复杂度、道德提示和工具提供影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00039 2026-04-24 cs.CL cs.AI cs.IR 62%

An Ontology-Driven Graph RAG for Legal Norms: A Structural, Temporal, and Deterministic Approach

基于本体的法律规范图式RAG:一种结构、时间与确定性方法

Hudson de Martim

机构 * Federal Senate of Brazil(巴西联邦议会)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于本体的图式RAG框架,通过建模法律规范的结构和时间特性,解决法律领域检索增强生成系统中对法律层级、时间性和因果关系的忽视问题。

Comments Major revision for clarity and academic precision. Updated title and abstract. Refined core terminology, contributions, related work, and shifted the implementation to a conceptual architecture. Added new arguments to strengthen the paper's thesis

Journal ref Legal Knowledge and Information Systems (JURIX 2025), Frontiers in Artificial Intelligence and Applications, IOS Press, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21102 2026-04-24 cs.CV cs.AI 57%

Leveraging Multimodal LLMs for Built Environment and Housing Attribute Assessment from Street-View Imagery

利用多模态大语言模型进行基于街景图像的建筑环境和住房属性评估

Siyuan Yao, Siavash Ghorbany, Kuangshi Ai, Arnav Cherukuthota, Meghan Forstchen, Alexis Korotasz, Matthew Sisk, Ming Hu, Chaoli Wang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型和谷歌街景图像自动评估美国全国建筑状况,通过微调Gemma 3 27B模型并结合知识蒸馏,实现高效准确的建筑评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09926 2026-04-24 cs.LG 57%

PROPER Agents: Proactivity Driven Personalized Agents for Advancing Knowledge Gap Navigation

PROPER代理:基于主动性的个性化代理以推进知识缺口导航

Kirandeep Kaur, Vinayak Gupta, Aditya Gupta, Chirag Shah

机构 * University of Washington(华盛顿大学) Chan Zuckerberg Biohub(查纳·楚克生物枢纽)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出PROPER框架,通过显式建模用户特定的知识缺口,改进主动帮助系统,提升任务完成质量与效率。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06498 2026-04-24 cs.CL astro-ph.IM 57%

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

Spec-o3:一种工具增强的视觉-语言代理,用于通过自动化光谱检查验证稀有天体候选体

Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, CAS(SKL-MAIS,自动化研究所,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) National Astronomical Observatories, CAS(国家天文台,中国科学院) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出Spec-o3,一种工具增强的视觉-语言代理,通过多模态链式推理实现天文学家对稀有天体候选体的自动化光谱检查,提升验证效率和准确性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21188 2026-04-24 cs.CR 50%

Physically Unclonable Functions for Secure IoT Authentication and Hardware-Anchored AI Model Integrity

用于安全物联网认证和硬件锚定AI模型完整性的物理不可克隆函数

Maryam Taghi Zadeh, Mohsen Ahmadi

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了用于AI赋能物联网系统的硬件根信任机制,比较了TPM、PUFs、混合容器感知硬件根信任等方法,指出PUFs和混合信任锚在大规模AI物联网系统中具有平衡的前景,而软件-only方法在对抗和物理暴露环境中不足。

详情

展开后加载摘要…

URL PDF HTML 收藏