Beyond Goodhart's Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems
超越古德哈特定律:多智能体系统中合规性评估的动态基准
Yiyang Zhao, Zhuo Zhang, Qingxuan Le, Lizhen Qu, Zenglin Xu
机构
*
Fudan University(复旦大学)
;
Shanghai Academy of AI for Science(上海人工智能科学研究院)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Monash University(莫纳什大学)
CommentsPeer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures
Humans Are More Diverse: Frontier LLMs Show Extreme Policies in Idealised AI Development Races
人类更多样化:前沿大语言模型(LLM)在理想化AI开发竞赛中表现出极端策略
Phu Hoa Pham, Duy Minh Dao Sy, Trung Kiet Huynh, Phu Quy Nguyen Lam, Chi Nguyen Tran, Minh Trung Le, Phong Hao Le, Dinh Nam Nguyen, Thien Ky Nguyen Dong, Elias Fernandez Domingos, Le Hong Trang, The Anh Han
机构
*
Ho Chi Minh City University of Science(胡志明市科学大学)
;
Vietnam National University Ho Chi Minh City (VNU-HCM)(越南国家大学胡志明市分校)
;
Ho Chi Minh City University of Technology (HCMUT)(胡志明市技术大学(HCMUT))
Unifying Adversarially Robust Model Experts in Vision-Language Models
统一视觉-语言模型中的对抗鲁棒模型专家
Nguyen Duc Thai, Junhao Dong, Sua Qi Rong, Hua Yu, Yew-Soon Ong
机构
*
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
;
Center for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心)
Verbalizable Representations Form a Global Workspace in Language Models
语言模型中的可言语化表征形成全局工作空间
Wes Gurnee, Nicholas Sofroniew, Adam Pearce, Mateusz Piotrowski, Isaac Kauvar, Runjin Chen, Anna Soligo, Paul Bogdan, Euan Ong, Rowan Wang, Ben Thompson, David Abrahams, Subhash Kantamneni, Emmanuel Ameisen, Joshua Batson, Jack Lindsey
机构
*
Universidad de Buenos Aires, Facultad de Ciencias Exactas y Naturales, Departamento de Computación(布宜诺斯艾利斯大学,精确与自然科学学院,计算机系)
;
AI Safety Argentina (AISAR)(阿根廷人工智能安全组织 (AISAR))
;
Department of Computer Science, University of Oxford(牛津大学计算机科学系)
;
CONICET-Universidad de Buenos Aires, Instituto de Ciencias de la Computación (ICC)(阿根廷国家科学与技术研究理事会-布宜诺斯艾利斯大学,计算机科学研究所 (ICC))