Surgical Knowledge Rewrite in Compact LLMs: An 'Unlearn-then-Learn' Strategy with ($IA^3$) for Localized Factual Modulation and Catastrophic Forgetting Mitigation
WebGuard: Building a Generalizable Guardrail for Web Agents
Boyuan Zheng, Zeyi Liao, Scott Salisbury, Zeyuan Liu, Michael Lin, Qinyuan Zheng, Zifan Wang, Xiang Deng, Dawn Song, Huan Sun, Yu Su
机构
*
The Ohio State University(俄亥俄州立大学)
;
Scale AI
;
University of California, Berkeley(加州大学伯克利分校)
专题命中
安全训练
:safety(abstract);分类 cs.CL、cs.AI
CommentsWe publicly release WebGuard, along with its annotation tools and fine-tuned models, to facilitate open-source research on monitoring and safeguarding web agents. All resources are available at https://github.com/OSU-NLP-Group/WebGuard
Mitigation of Camouflaged Adversarial Attacks in Autonomous Vehicles--A Case Study Using CARLA Simulator
Yago Romano Martinez, Brady Carter, Abhijeet Solanki, Wesam Al Amiri, Syed Rafay Hasan, Terry N. Guo
机构
*
Department of Computer Engineering Tennessee Technological University(计算机工程系田纳西技术大学)
;
Department of Computer Science Tennessee Technological University(计算机科学系田纳西技术大学)
Variational OOD State Correction for Offline Reinforcement Learning
Ke Jiang, Wen Jiang, Xiaoyang Tan
机构
*
College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics, MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(计算机科学与技术学院,南京航空航天大学,信息科技部模式分析与机器智能重点实验室)
Identification of Potentially Misclassified Crash Narratives using Machine Learning (ML) and Deep Learning (DL)
Sudesh Bhagat, Ibne Farabi Shihab, Jonathan Wood
机构
*
Department of Civil, Construction and Environmental Engineering(土木、建设与环境工程系)
;
Iowa State University(爱荷华州立大学)
;
Department of Computer Science(计算机科学系)
Leveraging the Potential of Prompt Engineering for Hate Speech Detection in Low-Resource Languages
Ruhina Tabasshum Prome, Tarikul Islam Tamiti, Anomadarshi Barua
机构
*
Bangladesh Institute of Governance and Management (BIGM)(孟加拉国治理与管理研究所)
;
Department of Cyber Security Engineering, George Mason University(网络安全工程系,乔治·梅森大学)
On the Generalization of Data-Assisted Control in port-Hamiltonian Systems (DAC-pH)
Mostafa Eslami, Maryam Babazadeh
机构
*
Sharif University of Technology(谢里夫大学)
专题命中
安全训练
:safety(abstract);分类 cs.AI、cs.LG
CommentsThis paper presents an early investigation of Data-Assisted Control (DAC) with reinforcement learning, showcasing its potential through a simple example. Theoretical analysis is ongoing to establish formal support and guarantees for the proposed approach
COSMIC: Generalized Refusal Direction Identification in LLM Activations
Vincent Siu, Nicholas Crispino, Zihao Yu, Sam Pan, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang
机构
*
Washington University in St. Louis(华盛顿大学圣路易斯分校)
;
University of California, Berkeley(加州大学伯克利分校)
;
University of California, Santa Cruz(加州大学圣克ruz分校)
Melrose Tia, Jezreel Sophia Lanuzo, Lei Rigi Baltazar, Marie Joy Lopez-Relente, Diwa Malaya Quiñones, Jason Albia
机构
*
Netopia AI, Inc.(Netopia AI公司)
;
Institute of Statistics, University of the Philippines Los Baños(菲律宾大学Los Baños统计研究所)
;
Department of Psychology, University of the Philippines Diliman(菲律宾大学Diliman心理学系)
Is LLM an Overconfident Judge? Unveiling the Capabilities of LLMs in Detecting Offensive Language with Annotation Disagreement
Junyu Lu, Kai Ma, Kaichun Wang, Kelaiti Xiao, Roy Ka-Wei Lee, Bo Xu, Liang Yang, Hongfei Lin
机构
*
Key Laboratory of Social Computing and Cognitive Intelligence, Dalian University of Technology(大连理工大学社会计算与认知智能重点实验室)
;
School of Computer Science and Technology, Xinjiang Normal University(新疆师范大学计算机科学与技术学院)
;
Social AI Studio, Singapore University of Technology and Design(新加坡科技设计大学社会AI工作室)
Performance Gains of LLMs With Humans in a World of LLMs Versus Humans
Lucas McCullum, Pelagie Ami Agassi, Leo Anthony Celi, Daniel K. Ebner, Chrystinne Oliveira Fernandes, Rachel S. Hicklen, Mkliwa Koumbia, Lisa Soleymani Lehmann, David Restrepo