Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations
LLMs是否了解工具无关性?解密工具调用中的结构对齐偏差
Yilong Liu, Xixun Lin, Pengfei Cao, Ge Zhang, Fang Fang, Yanan Cao
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Computer Science and Technology, Donghua University(东华大学计算机科学与技术学院)
CourtGuard: A Model-Agnostic Framework for Zero-Shot Policy Adaptation in LLM Safety
CourtGuard:一种用于大语言模型安全的模型无关框架,用于零样本策略适应
Umid Suleymanov, Rufiz Bayramov, Suad Gafarli, Seljan Musayeva, Taghi Mammadov, Aynur Akhundlu, Murat Kantarcioglu
机构
*
Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)
;
School of IT(信息技术学院)
;
Engineering, ADA University(工程学院,ADA大学)
;
School of Law, ADA University(法学院,ADA大学)
Intra-Fairness Dynamics: The Bias Spillover Effect in Targeted LLM Alignment
内在公平动态:定向大语言模型对齐中的偏见溢出效应
Eva Paraschou, Line Harder Clemmensen, Sneha Das
机构
*
Department of Applied Mathematics and Computer Science, Technical University of Denmark(应用数学与计算机科学系,丹麦技术大学)
;
Department of Mathematical Sciences, University of Copenhagen(数学科学系,哥本哈根大学)
Aligning Trustworthy AI with Democracy: A Dual Taxonomy of Opportunities and Risks
将可信AI与民主对齐:机会与风险的双重分类
Oier Mentxaka, Natalia Díaz-Rodríguez, Mark Coeckelbergh, Marcos López de Prado, Emilia Gómez, David Fernández Llorca, Enrique Herrera-Viedma, Francisco Herrera
机构
*
Dept. of Computer Science and Artificial Intelligence, DaSCI, University of Granada, Spain(计算机科学与人工智能系,DaSCI,格拉纳达大学)
;
Dept. of Philosophy, University of Vienna, Vienna, Austria(哲学系,维也纳大学)
;
School of Engineering, Cornell University, Ithaca, NY, United States(工程学院,康奈尔大学)
;
Dept. of Mathematics, Khalifa University of Science and Technology, Abu Dhabi, UAE(数学系,科学与技术大学,阿布扎赫德,阿联酋)
;
ADIA Lab, Al Maryah Island, Abu Dhabi, UAE(ADIA实验室,阿布扎赫德,阿联酋)
;
Joint Research Centre, European Commission, Seville, Spain(联合研究中心,欧洲委员会,塞维利亚,西班牙)
;
Computer Engineering Dept., University of Alcalá, Alcalá de Henares, Spain(计算机工程系,阿尔卡拉大学)
Cross-cultural value alignment frameworks for responsible AI governance: Evidence from China-West comparative analysis
跨文化价值观对齐框架用于负责任的AI治理:来自中西方比较分析的证据
Haijiang Liu, Jinguang Gu, Xun Wu, Daniel Hershcovich, Qiaoling Xiao
机构
*
Wuhan University of Science and Technology(武汉理工大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
University of Copenhagen(哥本哈根大学)
;
WUST-Madrid Complutense Institute(武汉理工大学-马德里康普顿斯研究所)
Kunwoong Kim, Jihu Lee, Sangchul Park, Yongdai Kim
机构
*
Department of Statistics, Seoul National University, Republic of Korea(统计系,首尔国立大学,大韩民国)
;
School of Law, Seoul National University, Republic of Korea(法学院,首尔国立大学,大韩民国)
Position: Towards Bidirectional Human-AI Alignment
Hua Shen, Tiffany Knearem, Reshmi Ghosh, Kenan Alkiek, Kundan Krishna, Yachuan Liu, Ziqiao Ma, Savvas Petridis, Yi-Hao Peng, Li Qiwei, Sushrita Rakshit, Chenglei Si, Yutong Xie, Jeffrey P. Bigham, Frank Bentley, Joyce Chai, Zachary Lipton, Qiaozhu Mei, Rada Mihalcea, Michael Terry, Diyi Yang, Meredith Ringel Morris, Paul Resnick, David Jurgens
机构
*
NYU Shanghai, New York University(纽约大学上海研究院,纽约大学)
;
MBZUAI(穆桑大学人工智能研究所)
;
Microsoft(微软公司)
;
University of Michigan(密歇根大学)
;
Apple(苹果公司)
;
Google(谷歌公司)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Stanford University(斯坦福大学)
;
Google DeepMind(谷歌DeepMind)
机构
*
School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院)
;
Faculty of Computer Science and Technology, Qilu University of Technology, Shandong, China(青岛科技大学计算机科学与技术学院)
;
Zhongguancun Academy, Beijing, China(中关村学院)
Whose Truth? Pluralistic Geo-Alignment for (Agentic) AI
Krzysztof Janowicz, Zilong Liu, Gengchen Mai, Zhangyu Wang, Ivan Majic, Alexandra Fortacz, Grant McKenzie, Song Gao
机构
*
University of Vienna(维也纳大学)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
University of Maine(缅因大学)
;
McGill University(麦吉尔大学)
;
University of Wisconsin(威斯康星大学)