Verbalizable Representations Form a Global Workspace in Language Models
语言模型中的可言语化表征形成全局工作空间
Wes Gurnee, Nicholas Sofroniew, Adam Pearce, Mateusz Piotrowski, Isaac Kauvar, Runjin Chen, Anna Soligo, Paul Bogdan, Euan Ong, Rowan Wang, Ben Thompson, David Abrahams, Subhash Kantamneni, Emmanuel Ameisen, Joshua Batson, Jack Lindsey
机构
*
Anthropic(A÷)
专题命中
后训练与偏好优化
:language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
Comments17 pages, 12 figures, 14 tables. Preprint; under review at EACL 2027 (ACL Rolling Review, August 2026 cycle). Code and data: https://github.com/mohammadi-hadi/MAP-PO
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Xiaomi Corporation(小米公司)
;
State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
NJIT(新泽西理工学院)
;
Jilin University(吉林大学)
;
Institute of Computing Technology, CAS(中国科学院计算技术研究所)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中
后训练与偏好优化
:preference optimization(title);LLM(abstract_cn);large language model(abstract);language model(abstract)
GPT-Red: Automated Red Teaming via Self-Play at Scale
GPT-Red:基于大规模自博弈的自动化红队测试
Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer, Dylan Hunn, Stephanie Lin, Yuxin Wen, Xiangyu Qi, Christopher Wolff, Zizhao Wang, Milad Nasr, Sicheng Zhu, Chuan Guo, Juan Felipe Cerón Uribe, Kaiwen Wang, Aiden Low, Kai Xiao, Kai Chen
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Tsinghua University(清华大学)
;
The Hong Kong Polytechnic University(香港理工大学)
机构
*
School of Computer Science, Peking University(北京大学计算机学院)
;
School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)
;
School of Physics, Peking University(北京大学物理学院)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Central Research Institute, ZTE Corporation(中兴公司中央研究院)
专题命中
后训练与偏好优化
:post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue
TD-DPO:用于减轻临床自闭症干预对话中谄媚行为的差异感知偏好优化
Shuzhong Lai, Junhong Lai, Chenxi Li, Qing Zhou, Haifeng Li, Gang Pan, Lin Yao, Yueming Wang
机构
*
Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所)
;
MOE Frontiers Science Center for Brain and Brain-Machine Integration, Zhejiang University(浙江大学脑与脑机融合教育部前沿科学中心)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
Children’s Hospital Zhejiang University School of Medicine(浙江大学医学院附属儿童医院)
;
State Key Laboratory of Brain-Machine Intelligence(脑机智能技术国家重点实验室)
;
Department of Neurobiology, Affiliated Mental Health Center and Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属精神卫生中心和杭州市第七人民医院神经生物学系)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG