From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails
从拒绝到恢复:一种生成AI防护机制的控制论方法
Ravi Pandya, Madison Bland, Duy P. Nguyen, Changliu Liu, Jaime Fernández Fisac, Andrea Bajcsy
机构
*
Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
;
Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)
;
Equal Advising(平等指导)
Backtracking When It Strays: Mitigating Dual Exposure Biases in LLM Reasoning Distillation
在偏离时回溯:缓解大语言模型推理蒸馏中的双重暴露偏差
Bing Wang, Shaotian Yan, Chen Shen, kaiyuan liu, Sinan Fan, Ximing Li, Rui Miao, Xiaosong Yuan, Zhanming Shen, Jieping Ye
机构
*
College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)
;
Key Laboratory of Symbolic Computation and Knowledge Engineering, MoE, Jilin University(吉林大学符号计算与知识工程重点实验室)
;
Tongyi Lab, Alibaba Group(阿里集团通义实验室)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)