LLMs Encode Harmfulness and Refusal Separately
大语言模型分别编码有害性和拒绝性
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学)
AI总结 研究大语言模型对有害性的理解,发现其有害性和拒绝性在模型内分别编码,有害性方向与拒绝方向不同,据此揭示越狱方法原理及对抗微调影响,提出潜在危害表示的安全应用。
高校专区
大语言模型分别编码有害性和拒绝性
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学)
AI总结 研究大语言模型对有害性的理解,发现其有害性和拒绝性在模型内分别编码,有害性方向与拒绝方向不同,据此揭示越狱方法原理及对抗微调影响,提出潜在危害表示的安全应用。
TrendFact:自动事实核查中热点感知的基准
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; National University of Defense Technology(国防科学技术大学) ; Northeastern University(东北大学) ; East China Normal University(华东师范大学) ; Beihang University(北京航空航天大学) ; Tsinghua University(清华大学)
AI总结 研究自动事实核查范式在资源受限环境下面临风险不对称挑战,引入TrendFact基准及评估热点感知能力的指标,提出FactISR框架提升热点感知能力和计算效率。
DrugAgent:用于药物-靶点相互作用评估的冲突生物医学证据的可靠多智能体整合
机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) ; Computational Biology Branch, National Library of Medicine(国家医学图书馆计算生物学分支) ; Khoury College of Computer Sciences, Northeastern University(东北大学计算机科学学院) ; State Key Laboratory for Novel Software Technology at Nanjing University, School of Computer Science, Nanjing University(南京大学新型软件技术国家重点实验室,南京大学计算机科学学院) ; Developmental Therapeutics Branch, National Cancer Institute(国家癌症研究所发育治疗分支)
AI总结 研究药物-靶点相互作用评估中整合异构数据问题,核心方法是基于大语言模型的多智能体系统DrugAgent,贡献是能进行异构证据支持的DTI评估,补充独立DTI预测,还提供相关策略。