Open Technical Problems in Open-Weight AI Model Risk Management
开放权重AI模型风险管理中的开放技术问题
Stephen Casper, Kyle O'Brien, Shayne Longpre, Elizabeth Seger, Kevin Klyman, Rishi Bommasani, Aniruddha Nrusimha, Ilia Shumailov, Sören Mindermann, Steven Basart, Frank Rudzicz, Kellin Pelrine, Avijit Ghosh, Andrew Strait, Robert Kirk, Dan Hendrycks, Peter Henderson, Zico Kolter, Geoffrey Irving, Yarin Gal, Yoshua Bengio, Dylan Hadfield-Menell
Comments5 pages, 1 figure, 1 table. Accepted at the FoRMA workshop (Foundation Models in the RO-MAN Age: Responsible Development for Social Robotics) at IEEE RO-MAN 2026, Kitakyushu, Japan. Workshop homepage: https://sites.google.com/cam.ac.uk/forma/
CommentsPreprint of an article submitted for consideration in the Pacific Symposium on Biocomputing (PSB 2027). Copyright 2026 World Scientific Publishing Company. https://psb.stanford.edu/
Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models
大的、明亮的还是不可见的:3D CT基础模型的冻结特征基准测试
Maulik Chevli, Johannes Brandt, Rickmer Braren, Daniel Rueckert, Philip Müller
机构
*
Technical University of Munich (TUM)(慕尼黑工业大学(TUM))
;
TUM University Hospital(慕尼黑工业大学医院)
;
Imperial College London(伦敦帝国理工学院)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
UKE Hamburg(汉堡大学医院)
机构
*
Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京航空航天大学未来区块链与隐私计算高精尖创新中心)
;
Beihang University(北京航空航天大学)
;
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
;
School of Mathematical Sciences, Beihang University(北京航空航天大学数学科学学院)
;
Zhongguancun Laboratory(中关村实验室)
CommentsThis paper has already been accepted and presented at the IEEE 27th International Conference on Information Reuse and Integration for Data Science (IRI 2026) from July 31 to August 2, 2026, in Seattle, WA, USA
DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots
DelusionEval:评估AI聊天机器人中与妄想相关的行为
Jared Moore, Andrea Mock, Yifan Mai, Jacy Reese Anthis, Ryan Louie, William Agnew, Ashish Mehta, Kevin Klyman, Percy Liang, Nick Haber, Eric Lin, Desmond C. Ong
机构
*
Stanford University(斯坦福大学)
;
University of Chicago(芝加哥大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Harvard University(哈佛大学)
;
The University of Texas at Austin(德克萨斯大学奥斯汀分校)
Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations
评估视觉-语言模型在视觉和文本扰动下的诊断鲁棒性
Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili
机构
*
University of Tehran(德黑兰大学)
;
Tehran University of Medical Sciences(德黑兰医科大学)
;
Advanced Diagnostic and Interventional Radiology Research Center (ADIR)(高级诊断与介入放射学研究中心(ADIR))
Why Ranking Anomaly Detection Algorithms Isn't as Reliable as You May Think
为何异常检测算法的排名并不如你所想的可靠
Simon Klüttermann, Jérôme Rutinowski, Frederik Polachowski, Alice Kirchheim
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
TU Dortmund University(多特蒙德工业大学)
;
Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)
;
iits Consulting GmbH(iits咨询有限公司)
;
Fraunhofer Institute for Material Flow and Logistics IML(弗劳恩霍夫物流与材料流动研究所IML)
Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Minhyeok Jung, Doyoung Kim, Heegyu Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Byungoh Ko, Changhun Lee, Dohaeng Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Minwoo Lee, Wonkee Lee, Sangha Park, Sungjune Park, Kwangrok Ryoo, Kijung Seo, Minju Seo, Yongwoo Song, Sejong Yang, Heuiyeen Yeen, Stanley Jungkyu Choi, Yemuk Choi, Yongchan Chun, Jiwon Ham, Dasol Hong, Sujeong Im, Kijeong Jeon, Gerrard Jeongwon Jo, Hyeongjun Jo, Yujin Jo, Jiyeon Jung, Naeun Kang, Daeseong Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, Chaeeun Lee, ChaeYoon Lee, Edward Hwayoung Lee, Honglak Lee, Hwansoo Lee, Minkyung Lee, Sangeun Lee, Solji Lim, Woohyung Lim, Chanwoo Moon, Jueun Mun, Jimin Park, Seojeong Park, Yongmin Park, Hyerin Seo, Donghyeon Shin, Donghyun Son, Eunyong Son, Kaehyun Um, Sihoon Yang, Chang En Yea, Sihyuk Yi, Kyungjae Yoo, Chansik Yoon
机构
*
LG AI Research(LG AI研究院)
专题命中
安全评测
:safety(abstract);分类 cs.CL
AI总结
该报告介绍LG AI Research开发的K-EXAONE 2.0,这是一款7500亿参数的MoE多语言基础模型,经升级前代模型而来,支持25.6万token上下文,在多类评估中表现优异,以Apache 2.0许可发布,助力AI生态发展。
Journal refProceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany