Revealing Hidden Model Behaviors with Task-Specific Self-Reports
通过特定任务自我报告揭示隐藏模型行为
Taras Kutsyk, Bartosz Zieliński
机构
*
Jagiellonian University, Faculty of Mathematics and Computer Science(雅盖隆大学数学与计算机科学系)
;
Jagiellonian University, Doctoral School of Exact and Natural Sciences(雅盖隆大学精确与自然科学研究博士学院)
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
OmniAD:基于多模态推理的工业异常检测与理解
Shifang Zhao, Yiheng Lin, Lu Han, Yao Zhao, Yunchao Wei
机构
*
Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院)
;
Visual Intelligence + X International Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际合作实验室)
;
Key Laboratory of Noise and Vibration Research, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所噪声与振动重点实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
GPT-Red: Automated Red Teaming via Self-Play at Scale
GPT-Red:基于大规模自博弈的自动化红队测试
Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer, Dylan Hunn, Stephanie Lin, Yuxin Wen, Xiangyu Qi, Christopher Wolff, Zizhao Wang, Milad Nasr, Sicheng Zhu, Chuan Guo, Juan Felipe Cerón Uribe, Kaiwen Wang, Aiden Low, Kai Xiao, Kai Chen
Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO
通过基于方差感知的评分规则奖励与GRPO改进LLMs中心脏医学问答
Arash Ahmadi, Parisa Masnadi Khiabani, Sarah Sharif, Charles Nicholson, David Ebert, Mike Banad
机构
*
School of Electrical and Computer Engineering, University of Oklahoma, Norman, OK, USA(电气与计算机工程学院,俄克拉荷马大学,诺曼,OK,USA)
;
Intelligent Neuromorphic and Quantum Understanding for Innovative Research and Engineering (INQUIRE) Laboratory, University of Oklahoma, Norman, OK, USA(创新研究与工程智能神经形态与量子理解实验室,俄克拉荷马大学,诺曼,OK,USA)
;
Khiabani Data Science and Analytics Institute, University of Oklahoma, Norman, OK, USA(Khiabani数据科学与分析研究所,俄克拉荷马大学,诺曼,OK,USA)
;
Data Institute for Societal Challenges (DISC), University of Oklahoma, Norman, OK, USA(社会挑战数据研究所(DISC),俄克拉荷马大学,诺曼,OK,USA)
;
School of Industrial and Systems Engineering, University of Oklahoma, Norman, OK, USA(工业与系统工程学院,俄克拉荷马大学,诺曼,OK,USA)
;
Office of Responsible Artificial Intelligence (ORAI), University of Arizona, Tucson, AZ, USA(负责任人工智能办公室(ORAI),亚利桑那大学,图森,AZ,USA)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of California, San Diego(加利福尼亚大学圣迭戈分校)
;
University of California, Merced(加利福尼亚大学默塞德分校)
;
Adobe Research(奥多比研究院)
;
Texas A&M University(德克萨斯农工大学)