REBAR: Reference Ethical Benchmark for Autonomy Readiness
REBAR:自主性准备的参考伦理基准
Jonathan Diller, David Barnes, Rebekah Bogdanoff, Rhett Collier, Roddy Collins, Keith Fieldhouse, Yonatan Gefen, Cameron Johnson, Anuriha Kodali, Brad Kriel, Varun Murali, James Niehaus, Mish Sukharev, Joseph VanPelt, Anthony Hoogs, Vijay Kumar, Arslan Basharat
机构
*
University of Pennsylvania(宾夕法尼亚大学)
;
David Barnes, LLC(大卫·巴恩斯公司)
;
Kitware, Inc.(Kitware公司)
;
Duality Robotics, Inc.(Duality机器人公司)
;
Texas A&M University(德克萨斯大学)
;
Charles River Analytics(查尔斯河分析公司)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
QQJ: 量化定性判断以实现可扩展且与人类对齐的生成AI评估
Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri
机构
*
AI Lab, Arioobarzan Engineering Team(艾伊罗巴赞工程团队人工智能实验室)
;
Department of Computer Engineering and Information Technology(计算机工程与信息科技系)
;
Department of Informatics, Bioengineering, Robotics and Systems Engineering(信息学、生物工程、机器人与系统工程系)
;
University of Genoa(热那亚大学)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Employing Vision-Language Models for Face Image Quality Assessment
利用视觉-语言模型进行人脸图像质量评估
Erdi Sarıtaş, Eren Onaran, Vitomir Štruc, Hazım Kemal Ekenel
机构
*
Department of Computer Engineering, Istanbul Technical University(伊斯坦布尔技术大学计算机工程系)
;
Faculty of Electrical Engineering, University of Ljubljana(卢布尔雅那大学电气工程系)
;
Division of Engineering, NYU Abu Dhabi(纽约大学阿布扎克分校工程系)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
EPIC-Bench: 一种以感知为中心的细粒度具身视觉 grounding 的基准
Haozhe Shan, Xiancong Ren, Han Dong, Haoyuan Shi, Yingji Zhang, Jiayu Hu, Yi Zhang, Yong Dai, Bin Shen, Lizhen Qu, Zenglin Xu, Xiaozhu Ju
机构
*
X-Humanoid
;
Fudan University(复旦大学)
;
University of Science and Technology of China(中国科学技术大学)
;
University of Manchester(曼彻斯特大学)
;
Monash University(墨尔本大学)
;
Celonis AI
;
University of New South Wales(新南威尔士大学)
VISOR: A Vision-Language Model-based Test Oracle for Testing Robots
VISOR:基于视觉-语言模型的机器人测试 oracle
Prasun Saurabh, Pablo Valle, Aitor Arrieta, Shaukat Ali, Paolo Arcaini
机构
*
Simula Research Laboratory(Simula研究实验室)
;
Oslo Metropolitan University(奥斯陆理工大学)
;
Mondragon University(蒙dragon大学)
;
National Institute of Informatics(国立信息研究所)
Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
反学习不是删除:调查机器反学习在大语言模型中的可逆性
Xiaoyu Xu, Xiang Yue, Yang Liu, Qingqing Ye, Huadi Zheng, Peizhao Hu, Minxin Du, Haibo Hu
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of California, Santa Cruz(加州大学圣克ruz分校)
;
Huawei Technologies(华为技术有限公司)
;
Research Centre for Privacy and Security Technologies in Future Smart Systems, PolyU(未来智能系统中的隐私与安全技术研究中心,PolyU)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构
*
Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系)
;
Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天工程系)
STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics
STT-Arena:一种更现实的工具使用环境,包含时空动态
Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan, Sen Su, Chunxiao Liu, Ning Miao
机构
*
Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学)
;
Department of Data Science, City University of Hong Kong(数据科学系,香港城市大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Li Auto Inc.(李汽有限公司)
;
Independent Researcher(独立研究者)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
MediQAl: A French Medical Question Answering Dataset for Knowledge and Reasoning Evaluation
MediQAl: 一个用于知识和推理评估的法语医学问答数据集
Adrien Bazoge
机构
*
Data Clinic, University Hospital of Nantes, France(南特大学医院数据诊所,法国)
;
Nantes Université, École Centrale Nantes, CNRS, LS2N, France(南特大学,中央理工学院南特分校,国家科学研究中心,LS2N,法国)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI