Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement
通过认知权利评估大语言模型的二阶偏见
Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed, Zhijing Jin, Shion Guha, Syed Ishtiaque Ahmed
机构
*
University of Toronto(多伦多大学)
;
Vector Institute(向量研究所)
;
EuroSafeAI
;
Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所(德国图宾根))
The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer
基准测试幻觉:剪枝后的大语言模型能通过多项选择但无法回答问题
Rui Wen, Lu Sun, Jiayang Liu, Zesheng Xu, Tianshuo Cong, Zheng Li
机构
*
Institute of Science Tokyo(东京科学大学)
;
Tohoku University(东北大学)
;
Nanyang Technological University(南洋理工大学)
;
KTH Royal Institute of Technology(瑞典皇家理工学院)
;
Shandong University(山东大学)
专题命中
评测与基准
:LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
机构
*
Meituan(美团)
;
The University of Hong Kong(香港大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Nanjing University(南京大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所)
;
Ludwig Maximilian University of Munich(慕尼黑大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Queen Mary University of London(伦敦玛丽女王大学)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
Geometric Consistency Protocol for Foundation Model Features in Multi-View Satellite Imagery
多视图卫星图像中基础模型特征的几何一致性协议
Qiyan Luo, Jie Yang, Yingdong Pi, Lekang Wen, Mi Wang
机构
*
Hubei Province Key Research and Development Program(湖北省重点研发计划)
;
LIESMARS Special Research Funding(测绘遥感信息工程国家重点实验室专项研究基金)
;
National Science Fund for Distinguished Young Scholars(国家杰出青年科学基金)
RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills
RubricsTree: 面向个人健康代理在健康记忆与医疗技能上的可扩展且不断演进的开放式评估
Weizhi Zhang, Zechen Li, Hamid Palangi, Ben Graef, A. Ali Heydari, Simon A. Lee, Salman Rahman, Ray Luo, Zeinab Esmaeilpour, Erik Schenck, Chloe Zhang, Yamin Li, Menglian Zhou, Philip S. Yu, Daniel McDuff, Lindsey Sunden, Mark Malhotra, Shwetak Patel, Ahmed A. Metwally
机构
*
Google Research(谷歌研究院)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
Securing Multi-Agent GIS Systems: Risk Evaluation and Prompt Hardening Optimization
保护多智能体GIS系统:风险评估与提示硬化优化
Kyle Gao, Pranavi Kotta, Linlin Xu, Jonathan Li, David A. Clausi
机构
*
Department of Systems Design Engineering, University of Waterloo(系统设计工程系,滑铁卢大学)
;
Department of Mechatronics Engineering, University of Waterloo(机电工程系,滑铁卢大学)
;
Department of Geomatics Engineering, University of Calgary(测绘工程系,卡尔加里大学)
;
Department of Geography and Environmental Management, University of Waterloo(地理与环境管理系,滑铁卢大学)
Mind-Studio: Executable World Models with Lookahead Evaluation for Partially Observable Games
Mind-Studio: 针对部分可观测游戏的可执行世界模型与前向评估
Yifei Dong, Mingen Zheng, Linquan Wu, Jeff Z. Pan, Jiaxin Bai
机构
*
Hong Kong University of Science and Technology(香港科技大学)
;
City University of Hong Kong(香港城市大学)
;
University of Edinburgh(爱丁堡大学)
;
Hong Kong Baptist University(香港浸会大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation
MODE-RAG: 基于流形异常诊断和能量的检索增强生成评估
Zehang Wei, Jiaxin Dai, Jiamin Yan, Xiang Xiang
机构
*
School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)
;
School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving
DRIVESPATIAL:自动驾驶中视觉语言模型时空智能的基准
Hao Vo, Khoa Vo, Phu Loc Nguyen, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Gladys Gawugah, Sreevenkata Anjani Tishita Godavarthi, Chase Rainwater, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le
机构
*
University of Arkansas, USA(美国阿肯色大学)
;
Google Research, Google(谷歌研究院)
;
University of Liverpool, UK(英国利物浦大学)
;
Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校)
机构
*
University of Liverpool, UK(利物浦大学)
;
Nanyang Technological University, SG(南洋理工大学)
;
The Chinese University of Hong Kong, Shenzhen, Guangdong, China(香港中文大学(深圳))
;
Wuhan University(武汉大学)
;
Hangzhou Dianzi University(杭州电子科技大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract)