PASS: Probabilistic Agentic Supernet Sampling for Interpretable and Adaptive Chest X-Ray Reasoning
基于概率代理超网采样的可解释和自适应胸片推理系统
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 PASS通过概率代理超网采样实现可解释、自适应和多模态的胸片推理,提升医疗AI的安全性和效率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
基于概率代理超网采样的可解释和自适应胸片推理系统
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 PASS通过概率代理超网采样实现可解释、自适应和多模态的胸片推理,提升医疗AI的安全性和效率。
大语言模型能否产生赌博成瘾?
机构 * Department of AI Convergence, Gwangju Institute of Science and Technology(人工智能融合系,全州科学技术院)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 本研究探讨大语言模型在老虎机实验中表现出赌博成瘾行为,揭示其决策机制与风险认知特征,指出模型行为受抽象决策特征控制而非单纯依赖训练数据。
Comments 26 pages, 14 figures
利用ChatGPT、Claude和Gemini评估绿地吸引力:AI模型能反映人类感知吗?
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
AI总结 本文研究了AI模型在评估绿地吸引力方面的表现,发现其在正式绿地和非正式空间的判断一致性较高,但存在对安全性和本地嵌入质量的低估问题。
SproutBench: 为青少年设计的安全和伦理大型语言模型基准
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 SproutBench通过1283个发展性对抗提示评估47种LLMs,揭示儿童安全漏洞,为青少年AI设计提供指导。
Comments Accepted in AAAI 2026 Workshop on AI for Education
基于原则的大型语言模型在健康与健身领域开发与评估框架
机构 * Google Research(谷歌研究)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
AI总结 本文提出基于原则的框架,用于系统评估LLM在健康与健身领域的应用,通过迭代开发生命周期整合综合评估技术,提升系统安全性和用户反馈的可靠性。
为什么链式思维在临床文本理解中失效
机构 * Harvard Medical School(哈佛医学院) ; MIT(麻省理工学院) ; Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 本研究发现链式思维在临床文本理解中导致性能下降,揭示了其在临床任务中可靠性与可解释性的矛盾。
道德一致性流水线:面向大语言模型的持续道德评估
机构 * SWAT Laboratory, Polytechnique Montréal(蒙特利尔大学SWAT实验室) ; Concordia Institute for Information Systems Engineering, Concordia University(Concordia大学信息系统工程研究所)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 MoCoP通过闭环框架持续评估大语言模型的道德一致性,揭示伦理与毒性间的强负相关,推动自主AI系统中计算道德研究。
揭开黑箱:一个受物理和专家知识启发的可解释、少样本AI4E框架
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一个受物理和专家知识启发的可解释、少样本AI4E框架,通过生成合成数据和优化策略提升工程领域模型的可解释性和准确性。
稀疏自编码器在视觉-语言模型中学习单义特征
机构 * Technical University of Munich(慕尼黑技术大学) ; Helmholtz Munich(亥姆霍兹慕尼黑) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Munich Data Science Institute(慕尼黑数据科学研究所) ; University of Tübingen(图宾根大学) ; University of Copenhagen(哥本哈根大学)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过稀疏自编码器提升视觉-语言模型中神经元的单义性,展示其在增强模型可解释性和可控性方面的有效性。
Comments Accepted at NeurIPS 2025
LLM4Cell: 一种用于单细胞生物学的大语言和代理模型综述
机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) ; Department of Computational Modeling and Data Analytics, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算建模与数据分析系) ; Institute of Information and Technology, University of Dhaka, Dhaka, Bangladesh(达卡大学信息技术学院) ; Fralin Biomedical Research Institute at VTC: Cancer Research Center, Washington DC, USA(弗拉林生物医学研究中心:癌症研究中心)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 LLM4Cell综述了58个用于单细胞生物学的大语言和代理模型,分析了其在注释、轨迹建模和药物反应预测等任务中的表现,并指出了可解释性、标准化和可信模型开发的挑战。
Comments 34 pages, 5 figures, 7 tables
蒙特卡洛预期威胁(MOCET)评分
机构 * Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 MOCET是一种可解释且双重可扩展的指标,用于量化大语言模型在现实世界中的安全风险。
Comments Accepted to NeurIPS 2025 BioSafe GenAI
SafeR-CLIP: 通过保留预训练知识来缓解视觉-语言模型中的不适宜内容
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 SafeR-CLIP通过最小化干预策略,在保留预训练知识的同时提升视觉-语言模型的安全性,实现性能与安全性的平衡。
Comments AAAI 2026 (Main Technical Track)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
机构 * BreathingCORE
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
机构 * Tencent(腾讯)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
机构 * University of Houston(德克萨斯大学休斯敦分校)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
机构 * Tufts University(塔夫茨大学) ; University of South Florida(佛罗里达州立大学) ; Sharif University of Technology(谢赫·穆吉布技术大学) ; Meta ; Resolution(解决方案)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG
Comments 9 pages, 3 figures, 3 tables
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
Comments Under Review
机构 * NYU Shanghai(纽约大学上海校区) ; National University of Singapore(新加坡国立大学) ; Yale University(耶鲁大学) ; Center for Data Science, New York University(纽约大学数据科学中心)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG
Comments EMNLP 2025 Main
机构 * Savassan(萨瓦桑)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
机构 * Zhongnan University of Economics and Law(中南财经政法大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
Comments 41 pages, 12 figures, 6 tables
机构 * Department of Statistics and Operations Research, UNC-Chapel Hill(统计与运筹学系,北卡罗来纳大学 Chapel Hill 分校) ; Imperial College Business School, Imperial College London(帝国理工学院伦敦校区商学院)
专题命中 安全评测 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG
机构 * Institute for Infocomm Research, Agency for Science, Technology and Research, Singapore(新加坡资讯通信研究院,科技研究局) ; Propulsion and Space Research Center, Technology Innovation Institute, UAE(阿联酋技术创新研究所推进与航天研究中心) ; James Watt School of Engineering, University of Glasgow, UK(格拉斯哥大学詹姆斯·瓦特工程学院) ; ISTD Pillar at SUTD(新加坡科技设计大学ISTD支柱)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
机构 * University of Chicago(芝加哥大学) ; University of Illinois(伊利诺伊大学) ; Virtue AI ; Meta
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
Comments 60 pages, 16 figures
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
机构 * Institute for Transportation(交通研究所) ; Iowa State University(爱荷华州立大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation
机构 * CUHK MMLab(香港中文大学多媒体实验室) ; SenseTime Research(商汤科技研究院) ; CPII under InnoHK(创新香港下的CPII)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
机构 * State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,计算机科学与工程学院,北京航空航天大学) ; Hangzhou Innovation Institute of Beihang University, Zhejiang Key Laboratory of Industrial Big Data and Robot Intelligent Systems, Hangzhou, China(北京航空航天大学杭州创新研究院,浙江省工业大数据与机器人智能系统重点实验室) ; Center for AI Business Innovation, Department of Management Science and Systems, University at Buffalo, Buffalo, New York, USA(人工智能商业创新中心,管理科学与系统系,布法罗大学) ; University of North Texas, Denton, Texas, USA(德克萨斯大学达文波特分校) ; Zhongguancun Laboratory, Beijing, China(中关村实验室)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG
Comments 28 pages, 32 figures, accepted to the Findings of EMNLP 2025