Multi-Adapter Representation Interventions via Energy Calibration
通过能量校准的多适配器表示干预
Manjiang Yu, Hongji Li, Junwei Chen, Xue Li, Priyanka Singh, Yang Cao, Lijie Hu
机构
*
The University of Queensland, Brisbane, Australia(昆士兰大学)
;
Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(马尔代夫 bin Zayed 人工智能大学)
;
Institute of Science Tokyo, Tokyo, Japan(东京科学研究所)
机构
*
Finance Division, Columbia Business School(哥伦比亚商学院金融系)
;
Department of IEOR, Columbia University(哥伦比亚大学工业工程与运筹学系)
;
Decision, Risk, and Operations Division, Columbia Business School(哥伦比亚商学院决策、风险与运营系)
;
Department of IEOR and Data Science Institute, Columbia University(哥伦比亚大学工业工程与运筹学系和数据科学研究所)
Subspace Control: Turning Constrained Model Steering into Controllable Spectral Optimization
子空间控制:将受约束的模型操控转化为可控的谱优化
Yancheng Huang, Changsheng Wang, Chongyu Fan, Yicheng Lang, Bingqi Shang, Yang Zhang, Mingyi Hong, Qing Qu, Alvaro Velasquez, Sijia Liu
机构
*
OPTML, Michigan State University(OPTML,密歇根州立大学)
;
MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI Lab,IBM研究院)
;
University of Minnesota(明尼苏达大学)
;
University of Michigan(密歇根大学)
;
University of Colorado Boulder(科罗拉多大学博尔德分校)
CommentsVersion 2: Substantially extended version with (1) multi-layer verification framework (format, evidence, negation, temporal, exclusion), (2) automated knowledge base expansion from unlabeled clinical text, (3) formal zero Type-I hallucination guarantees, and (4) expanded experimental evaluation on 5,000 cases with detailed error analysis. 28 pages, 3 figure, original research paper;
Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations
无需可操作性:机制方法无法纠正语言模型错误,尽管内部表示几乎完美
Sanjay Basu, Sadiq Y. Patel, Parth Sheth, Bhairavi Muralidharan, Namrata Elamaran, Aakriti Kinra, John Morgan, Rajaie Batniji
机构
*
University of California San Francisco(加州大学旧金山分校)
;
Waymark
;
University of Pennsylvania(宾夕法尼亚大学)
;
Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学)
;
Stanford University(斯坦福大学)
CARE Drive A Framework for Evaluating Reason-Responsiveness of Vision Language Models in Automated Driving
CARE Drive:一种用于评估视觉语言模型在自动驾驶中推理响应性的框架
Lucas Elbert Suryana, Farah Bierenga, Sanne van Buuren, Pepijn Kooij, Elsefien Tulleners, Federico Scari, Simeon Calvert, Bart van Arem, Arkady Zgonnikov
机构
*
organization= Department of Transport \& Planning, Faculty of Civil Engineering
;
Geosciences, Delft University of Technology
;
organization= Department of Cognitive Robotics, Faculty of Mechanical Engineering, Delft University of Technology
;
organization= Centre for Meaningful Human Control, Delft University of Technology
;
organization= Faculty of Mechanical Engineering, Delft University of Technology , city= Delft , country= The Netherlands
FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering
FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答
Chaodong Tong, Qi Zhang, Chen Li, Lei Jiang, Yanbing Liu
机构
*
Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)
Investigating CoT Monitorability in Large Reasoning Models
探究大型推理模型中的CoT可监控性
Shu Yang, Junchao Wu, Xilin Gong, Xuansheng Wu, Derek Wong, Ninghao Liu, Di Wang
机构
*
Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析师实验室)
;
King Abdullah University of Science and Technology(卡布斯大学)
;
University of Georgia(佐治亚大学)
;
University of Macau(澳门大学)
Uncertainty Quantification of Surrogate Models using Conformal Prediction
利用符合预测对代理模型的不确定性量化
Vignesh Gopakumar, Ander Gray, Joel Oskarsson, Lorenzo Zanisi, Daniel Giles, Matt J. Kusner, Stanislas Pamela, Marc Peter Deisenroth
机构
*
Centre for Artificial Intelligence Department of Computer Science University College London(人工智能中心 计算机科学系 伦敦大学学院)
;
Heudiasyc Laboratory Université de Technologie de Compiègne(Heudiasyc实验室 技术大学Compiègne)
;
Department of Computer and Information Science Linköping University(计算机与信息科学系 链接普大学)
;
Computing Division UK Atomic Energy Authority(计算部门 英国原子能局)
CommentsPreprint. Conceptual and exploratory framework focusing on uncertainty-aware and abstention-enabled decision support for acute ischemic stroke imaging
Uncertainty Reasoning with Photonic Bayesian Machines
基于光子贝叶斯机器的不确定性推理
F. Brückerhoff-Plückelmann, H. Borras, S. U. Hulyal, L. Meyer, X. Ji, J. Hu, J. Sun, B. Klein, F. Ebert, J. Dijkstra, L. McRae, P. Schmidt, T. J. Kippenberg, H. Fröning, W. Pernice
PIXEL: Adaptive Steering Via Position-wise Injection with eXact Estimated Levels under Subspace Calibration
Manjiang Yu, Hongji Li, Priyanka Singh, Xue Li, Di Wang, Lijie Hu
机构
*
University of Queensland(昆士兰大学)
;
Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
;
Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析师实验室)
;
King Abdullah University of Science and Technology (KAUST)(国王 Abdullah 科学与技术大学)
Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge Editing
Yuchen Wu, Liang Ding, Li Shen, Dacheng Tao
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
The University of Sydney(悉尼大学)
;
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
;
Nanyang Technological University(南洋理工大学)