arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9331 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9331 篇

2601.15267 2026-01-22 cs.CY cs.AI cs.CL 67%

Evaluation of Large Language Models in Legal Applications: Challenges, Methods, and Future Directions

评估大型语言模型在法律应用中的表现:挑战、方法与未来方向

Yiran Hu, Huanghai Liu, Chong Wang, Kunran Li, Tien-Hsuan Wu, Haitao Li, Xinran Xu, Siqing Huo, Weihang Su, Ning Zheng, Siyuan Zheng, Qingyao Ai, Yun Liu, Renjun Bian, Yiqun Liu, Charles L. A. Clarke, Weixing Shen, Ben Kao

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Waterloo(多伦多大学) Shanghai Jiaotong University(上海交通大学) Peking University(北京大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨了大型语言模型在法律应用中的评估挑战与方法,分析了现有评估框架的局限性,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12348 2026-01-21 cs.MA 67%

Generative AI Agents for Controllable and Protected Content Creation

可控且受保护的内容生成的生成式AI代理

Haris Khan, Sadia Asif

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文提出了一种多代理框架,通过整合可控内容生成和来源保护,解决生成式AI在可控性和内容保护方面的挑战。

Comments Accepted GenProCC NeurIPS 2025, Paper # 33

Journal ref GenProCC NeurIPS 2025, Paper # 33

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12346 2026-01-21 cs.CV 67%

MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents

MMDeepResearch-Bench: 一个多模态深度研究代理的基准

Peizhou Huang, Zixuan Zhong, Zhongwei Wan, Donghao Zhou, Samiul Alam, Xin Wang, Zexin Li, Zhihao Dou, Li Zhu, Jing Xiong, Chaofan Tao, Yan Xu, Dimitrios Dimitriadis, Tuo Zhang, Mi Zhang

机构 * OSU(俄亥俄州立大学) Amazon(亚马逊公司) UMich(密歇根大学) UCL(伦敦大学学院) CUHK(香港中文大学) UCR(加州大学尔湾分校) CWRU(克里夫兰医学中心) HKU(香港大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 MMDeepResearch-Bench提出一个多模态深度研究代理的基准,强调报告式合成与引用证据的结合,揭示多模态完整性对深度研究代理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07968 2026-01-21 cs.CR 67%

From Defender to Devil? Unintended Risk Interactions Induced by LLM Defenses

从守护者到魔鬼?由LLM防御引发的意外风险交互

Xiangtao Meng, Tianshuo Cong, Li Wang, Wenyu Chen, Zheng Li, Shanqing Guo, Xiaoyun Wang

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

AI总结 本文提出CrossRiskEval框架,系统研究LLM防御在安全、公平性与隐私间的相互影响,揭示防御措施对其他风险的非随机交互机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11746 2026-01-21 cs.CL cs.AI cs.LG 67%

LIME-LLM: Probing Models with Fluent Counterfactuals, Not Broken Text

LIME-LLM:通过流畅的反事实而非破碎文本来探测模型

George Mihaila, Suleyman Olcay Polat, Poli Nemkova, Himanshu Sharma, Namratha V. Urs, Mark V. Albert

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LIME-LLM通过假设驱动的可控扰动提升NLP模型的可解释性,实现更准确的局部解释效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11582 2026-01-21 cs.CY cs.AI cs.CL 67%

Overview of the SciHigh Track at FIRE 2025: Research Highlight Generation from Scientific Papers

FIRE 2025 科学高跟踪概述:从科学论文中生成研究亮点

Tohida Rehman, Debarshi Kumar Sanyal, Samiran Chattopadhyay

机构 * Jadavpur University(贾梵pur大学) Indian Association for the Cultivation of Science(印度科学培养协会) Techno India University(技术印度大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 FIRE 2025 科学高跟踪旨在通过预训练语言模型等方法,从科学论文摘要中自动生成简洁的亮点,以提升文献阅读效率和学术资源检索质量。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20323 2026-01-16 cs.CL cs.AI cs.LG 67%

PMOA-TTS: Introducing the PubMed Open Access Textual Times Series Corpus

PMOA-TTS:引入PubMed开放获取文本时间序列语料库

Shahriar Noroozizadeh, Sayantan Kumar, George H. Chen, Jeremy C. Weiss

机构 * Machine Learning Department, School of Computer Science(计算机科学系机器学习部门) Heinz College of Information Systems and Public Policy(信息系统与公共政策学院) National Library of Medicine(国家医学图书馆)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PMOA-TTS通过大规模语言模型管道构建,为时间序列分析提供结构化文本时间线,支持时间推理、生存建模和事件预测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08155 2026-01-14 cs.CV 67%

Instance-Aligned Captions for Explainable Video Anomaly Detection

实例对齐的描述用于可解释的视频异常检测

Inpyo Song, Minjun Joo, Joonhyung Kwon, Eunji Jeon, Jangwon Lee

机构 * SungKyunKwan University(顺 Kyun 峰大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文提出实例对齐的描述方法,用于提升视频异常检测的可解释性和可信度,通过空间定位和实例关联增强解释的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02109 2026-01-13 cs.AI cs.CL cs.CY 67%

Deep Value Benchmark: Measuring Whether Models Generalize Deep Values or Shallow Preferences

深度价值基准:衡量模型是泛化深度价值还是浅层偏好

Joshua Ashkinaze, Hua Shen, Saipranav Avula, Eric Gilbert, Ceren Budak

机构 * University of Michigan Ann Arbor(密歇根大学安娜堡分校) New York University Shanghai(纽约大学上海)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 深度价值基准通过测试模型泛化深度价值还是浅层偏好,评估AI对齐的核心能力。

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06464 2026-01-13 cs.CV 67%

On the Adversarial Robustness of 3D Large Vision-Language Models

关于3D大视觉-语言模型的对抗鲁棒性

Chao Liu, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文研究了3D大视觉-语言模型的对抗鲁棒性,提出两种攻击策略评估其鲁棒性,发现其在无目标攻击下较脆弱,但在有目标攻击中更稳健。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06193 2026-01-13 cs.LG cs.AI cs.CL 67%

MLB: A Scenario-Driven Benchmark for Evaluating Large Language Models in Clinical Applications

MLB:面向临床应用的大型语言模型评估场景驱动基准

Qing He, Dongsheng Bi, Jianrong Lu, Minghui Yang, Zixiao Chen, Jiacheng Lu, Jing Chen, Nannan Du, Xiao Cu, Sijing Wu, Peng Xiang, Yinyin Hu, Yi Guo, Chunpu Li, Shaoyang Li, Zhuo Dong, Ming Jiang, Shuai Guo, Liyun Feng, Jin Peng, Jian Wang, Jinjie Gu, Junwei Liu

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Health Information Center of Zhejiang Province(浙江省健康信息中心) Peking University(北京大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MLB基准通过场景驱动的评估方法,评估大型语言模型在临床应用中的表现,揭示模型在结构化任务与患者交互场景间的性能差异。

Comments 11 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06106 2026-01-13 cs.LG cs.AI cs.CL cs.CV cs.MA 67%

Judge Model for Large-scale Multimodality Benchmarks

大规模多模态基准的判断模型

Min-Han Shih, Yu-Hsin Wu, Yu-Wei Chen

机构 * Department of Electrical and Computer Engineering, Viterbi School of Engineering, University of Southern California(电气与计算机工程系,维特比工程学院,南加州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种多模态判断模型,用于评估多种任务,通过聚合多模态判断并生成诊断反馈,展示了其在多模态AI研究中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03113 2026-01-13 cs.CE 67%

A Probabilistic Digital Twin of UK En Route Airspace for Training and Evaluating AI Agents for Air Traffic Control

基于英国航路空域的概率数字孪生:用于训练和评估空管AI代理

Nick Pepper, Adam Keane, Amy Hodgkin, Dewi Gould, Edward Henderson, Lynge Lauritsen, Christos Vlahos, George De Ath, Richard Everson, Richard Cannon, Alvaro Sierra Castro, John Korna, Ben Carvell, Marc Thomas

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文提出基于英国航路空域的概率数字孪生,用于训练和评估空管AI代理,通过结合历史与实时数据及概率模型,提供高保真虚拟环境以支持AI代理的开发与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05648 2026-01-12 q-bio.GN cs.AI cs.CL cs.LG 67%

Open World Knowledge Aided Single-Cell Foundation Model with Robust Cross-Modal Cell-Language Pre-training

开放世界知识辅助的单细胞基础模型与鲁棒跨模态细胞-语言预训练

Haoran Wang, Xuanyi Zhang, Shuangsang Fang, Longke Ran, Ziqing Deng, Yong Zhang, Yuxiang Li, Shaoshuai Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OKR-CELL通过开放世界知识和鲁棒跨模态预训练,提升单细胞基础模型在细胞-语言跨模态任务中的表现。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03025 2026-01-07 cs.IR cs.AI cs.CL cs.LG 67%

LORE: A Large Generative Model for Search Relevance

LORE:一种大规模生成模型用于搜索相关性

Chenji Lu, Zhuo Chen, Hui Zhao, Zhiyuan Zeng, Gang Zhao, Junjie Ren, Ruicong Xu, Haoran Li, Songyan Liu, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LORE提出了一种基于大规模生成模型的搜索相关性框架,通过两阶段训练和分层部署策略提升搜索效果,为垂直领域提供方法参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21813 2026-01-07 cs.AI cs.CL cs.IR cs.LG 67%

OAEI-LLM-T: A TBox Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching

OAEI-LLM-T:用于理解大规模语言模型幻觉的本体匹配TBox基准数据集

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang, Jing Jiang

机构 * Australian National University(澳大利亚国立大学) Monash University(墨尔本大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OAEI-LLM-T是一个用于研究大规模语言模型在本体匹配中幻觉问题的TBox基准数据集,通过分类幻觉类型并提供评估工具,促进对LLM在OM任务中表现的深入理解。

Comments 14 pages, 4 figures, 4 tables, 2 prompt templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01532 2026-01-06 cs.AI cs.CL cs.LG 67%

Aletheia: Quantifying Cognitive Conviction in Reasoning Models via Regularized Inverse Confusion Matrix

Aletheia: 通过正则化逆混淆矩阵量化推理模型中的认知信念

Fanzhe Fu

机构 * Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Aletheia通过正则化逆混淆矩阵量化推理模型中的认知信念,探索AI科学诚信的测量方法。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00355 2026-01-05 eess.IV cs.CV 67%

The Impact of Lesion Focus on the Performance of AI-Based Melanoma Classification

病变聚焦对基于AI的黑色素瘤分类性能的影响

Tanay Donde

机构 * Department of Computer Science University of Illinois Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本研究探讨了病变聚焦对AI黑色素瘤分类性能的影响,通过分析模型对病变区域的关注程度,揭示了可解释AI在医疗诊断中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24415 2026-01-01 cs.CR cs.HC 67%

Language Model Agents Under Attack: A Cross Model-Benchmark of Profit-Seeking Behaviors in Customer Service

语言模型代理受攻击:客户服务中心中逐利行为的跨模型基准测试

Jingyu Zhang

专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract)

AI总结 本文提出了一项跨领域基准测试,评估客户服务中心中LLM代理在面对利润驱动攻击时的鲁棒性,揭示了攻击的领域和技术依赖性,并提供了可复现的评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23037 2026-01-01 cs.AI cs.CL cs.LG 67%

Agentic Large Language Models, a survey

代理大语言模型:综述

Aske Plaat, Max van Duijn, Niki van Stein, Mike Preuss, Peter van der Putten, Kees Joost Batenburg

机构 * Leiden University Leiden Netherlands Leiden University \& AI Lab, Pegasystems Leiden Netherlands Leiden University Leiden University \& AI Lab, Pegasystems

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了代理大语言模型的研究现状,探讨了其在医疗诊断、物流和金融分析等领域的应用,并提出通过推理、行动和交互提升大语言模型能力的未来研究方向。

Comments Website: https://askeplaat.github.io/agentic-llm-survey-site/

Journal ref JAIR volume 84, article 29, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21439 2025-12-29 cs.CL cs.AI cs.LG 67%

Morality is Contextual: Learning Interpretable Moral Contexts from Human Data with Probabilistic Clustering and Large Language Models

道德是情境性的:从人类数据中学习可解释的道德情境,结合概率聚类和大语言模型

Geoffroy Morlat, Marceau Nahon, Augustin Chartouny, Raja Chatila, Ismael T. Freire, Mehdi Khamassi

机构 * Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne University(索邦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 COMETH通过结合概率聚类和大语言模型,从人类数据中学习可解释的道德情境,提升道德判断的准确性与可解释性。

Comments 11 pages, 5 figures, +24 pages of Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20634 2025-12-25 cs.LG cs.AI cs.CL 67%

Real Time Detection and Quantitative Analysis of Spurious Forgetting in Continual Learning

持续学习中虚假遗忘的实时检测与定量分析

Weiwei Wang

机构 * Shenzhen Sunline Tech Co., Ltd.(深圳Sunline科技有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出浅层与深层对齐框架,通过定量指标和实时检测方法解决持续学习中的虚假遗忘问题,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16969 2025-12-22 cs.AI cs.CL cs.LG 67%

Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows

通过科学家对齐的工作流探测大语言模型的科学通用智能

Wanghan Xu, Yuhao Zhou, Yifan Zhou, Qinglong Cao, Shuo Li, Jia Bu, Bo Liu, Yixin Chen, Xuming He, Xiangyu Zhao, Xiang Zhuang, Fengxiang Wang, Zhiwang Zhou, Qiantai Feng, Wenxuan Huang, Jiaqi Wei, Hao Wu, Yuejin Yang, Guangshuai Wang, Sheng Xu, Ziyan Huang, Xinyao Liu, Jiyao Liu, Cheng Tang, Wei Li, Ying Chen, Junzhi Ning, Pengfei Jiang, Chenglong Ma, Ye Du, Changkai Ji, Huihui Xu, Ming Hu, Jiangbin Zheng, Xin Chen, Yucheng Wu, Feifei Jiang, Xi Chen, Xiangru Tang, Yuchen Fu, Yingzhou Lu, Yuanyuan Zhang, Lihao Sun, Chengbo Li, Jinzhe Ma, Wanhao Liu, Yating Liu, Kuo-Cheng Wu, Shengdu Chai, Yizhou Wang, Ouwen Zhangjin, Chen Tang, Shufei Zhang, Wenbo Cao, Junjie Ren, Taoyong Cui, Zhouheng Yao, Juntao Deng, Yijie Sun, Feng Liu, Wangxu Wei, Jingyi Xu, Zhangrui Li, Junchao Gong, Zijie Guo, Zhiyu Yao, Zaoyu Chen, Tianhao Peng, Fangchen Yu, Bo Zhang, Dongzhan Zhou, Shixiang Tang, Jiaheng Liu, Fenghua Ling, Yan Lu, Yuchen Ren, Ben Fei, Zhen Zhao, Xinyu Gu, Rui Su, Xiao-Ming Wu, Weikang Si, Yang Liu, Hao Chen, Xiangchao Yan, Xue Yang, Junchi Yan, Jiamin Wu, Qihao Zheng, Chenhui Li, Zhiqiang Gao, Hao Kong, Junjun He, Mao Su, Tianfan Fu, Peng Ye, Chunfeng Song, Nanqing Dong, Yuqiang Li, Huazhu Fu, Siqi Sun, Lijing Cheng, Jintai Lin, Wanli Ouyang, Bowen Zhou, Wenlong Zhang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于实用探究模型的科学通用智能定义,通过四个科学家对齐任务构建SGI-Bench,揭示大语言模型在科学推理中的不足,并引入测试时强化学习提升创新性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11362 2025-12-22 cs.RO 67%

An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges

视觉-语言-动作模型的解剖:从模块到里程碑与挑战

Chao Xu, Suyu Zhang, Yang Liu, Baigui Sun, Weihong Chen, Bo Xu, Qi Liu, Juncheng Wang, Shujun Wang, Shan Luo, Jan Peters, Athanasios V. Vasilakos, Stefanos Zafeiriou, Jiankang Deng

机构 * IROOTECH TECHNOLOGY(IROOTECH技术公司) Wolf 1069 b Lab, Sany Group(Sany集团沃尔夫1069b实验室) Department of Engineering, King’s College London(伦敦国王学院工程系) Hong Kong Polytechnic University(香港理工大学) Computer Science Department of the Technische Universität Darmstadt(德累斯顿技术大学计算机科学系) Department of ICT and Center for AI Research, University of Agder (UiA)(阿格德大学信息与通信技术系及人工智能研究中心) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文系统分析了视觉-语言-动作模型的核心挑战,从模块构建到里程碑发展,为研究者提供结构化指南和未来研究方向。

Comments project page: https://suyuz1.github.io/VLA-Survey-Anatomy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21112 2025-12-17 cs.AI cs.CE cs.CL cs.CY cs.IR 67%

Optimizing Large Language Models for ESG Activity Detection in Financial Texts

优化大型语言模型以检测金融文本中的ESG活动

Mattia Birti, Andrea Maurino, Francesco Osborne

机构 * Department of Informatics, Systems and Communication, University of Milano-Bicocca(信息学、系统与通信系,米兰-比科卡大学) University of Milano-Bicocca(米兰-比科卡大学) The Open University(开放大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出通过微调优化大型语言模型,提升金融文本中ESG活动检测的准确性。

Comments Published in the Proceedings of the ACM International Conference on AI in Finance (ICAIF). ACM version

Journal ref Proceedings of the ACM International Conference on AI in Finance (ICAIF), 2024, ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11412 2025-12-15 cs.CE cs.AI cs.CL cs.LG q-bio.BM 67%

Task-Specific Sparse Feature Masks for Molecular Toxicity Prediction with Chemical Language Models

针对分子毒性预测的特定任务稀疏特征掩码与化学语言模型

Kwun Sy Lee, Jiawei Chen, Fuk Sheng Ford Chung, Tianyu Zhao, Zhenyuan Chen, Debby D. Wang

机构 * School of Science and Technology(科学与技术学院) Hong Kong Metropolitan University(香港 Metropolitan 大学) Faculty of Engineering(工程学院) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种多任务学习框架,通过稀疏注意力机制提升化学分子毒性预测的准确性和可解释性。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18234 2025-12-15 cs.AI cs.CL cs.LG 67%

The Illusion of Readiness in Health AI

健康AI中的“准备”幻觉

Yu Gu, Jingjing Fu, Xiaodong Liu, Jeya Maria Jose Valanarasu, Noel CF Codella, Reuben Tan, Qianchu Liu, Ying Jin, Sheng Zhang, Jinyu Wang, Rui Wang, Lei Song, Guanghui Qin, Naoto Usuyama, Cliff Wong, Hao Cheng, HoHin Lee, Praneeth Sanapathi, Sarah Hilado, Tristan Naumann, Javier Alvarez-Valle, Jiang Bian, Mu Wei, Khalil Malik, Lidong Zhou, Jianfeng Gao, Eric Horvitz, Matthew P. Lungren, Doug Burger, Eric Topol, Hoifung Poon, Paul Vozila

机构 * Scripps Research Translational Institute(斯克里普斯研究转化研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过对抗性压力测试揭示了健康AI在现实应用中的鲁棒性和推理能力不足,强调了对AI系统责任和真实医疗需求的重视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08451 2025-12-10 cs.LG cs.AI cs.CY cs.ET 67%

Biothreat Benchmark Generation Framework for Evaluating Frontier AI Models II: Benchmark Generation Process

生物威胁基准生成框架用于评估前沿AI模型II:基准生成过程

Gary Ackerman, Zachary Kallenborn, Anna Wetzel, Hayley Peterson, Jenna LaTourette, Olivia Shoemaker, Brandon Behlendorf, Sheriff Almakki, Doug Clifford, Noah Sheinbaum

专题命中 安全评测 :red teaming(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出生物威胁基准生成框架,通过三种方法生成细菌生物威胁基准数据集,用于评估前沿AI模型的生物安全风险。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06751 2025-12-09 cs.CL cs.AI cs.LG 67%

Becoming Experienced Judges: Selective Test-Time Learning for Evaluators

成为经验丰富的法官:用于评估者的选择性测试时间学习

Seungyeon Jwa, Daechul Ahn, Reokyoung Kim, Dongyeop Kang, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) University of Minnesota(明尼苏达大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出选择性测试时间学习框架,使评估者在推理过程中逐步改进,通过自适应元提示提升评估效果,实验证明其在多个基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16543 2025-12-09 cs.IR cs.AI cs.CL cs.LG 67%

The Oracle and The Prism: A Decoupled and Efficient Framework for Generative Recommendation Explanation

oracle 与 prism:一种解耦且高效的生成推荐解释框架

Jiaheng Zhang, Daqiang Zhang

机构 * Sun Yat-sen University(中山大学) School of Software Engineer Tong ji University(同济大学软件工程学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 prism 通过解耦推荐过程和蒸馏技术,提升可解释推荐系统的效率与可信度。

Comments 12pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏