Instrumental Choices: Measuring the Propensity of LLM Agents to Pursue Instrumental Behaviors
工具选择:测量LLM代理追求工具性行为的倾向
Jonas Wiedermann-Möller, Leonard Dung, Maksym Andriushchenko
机构
*
Universität Bielefeld(比勒菲尔德大学)
;
Ruhr-Universität Bochum(波鸿鲁尔大学)
;
ELLIS Institute(ELLIS研究所)
;
Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所)
;
Tübingen AI Center(图宾根人工智能中心)
Beyond Task Success: Measuring Workflow Fidelity in LLM-Based Agentic Payment Systems
超越任务成功:衡量基于大语言模型的代理支付系统的工作流保真度
Donghao Huang, Joon Kiat Chua, Zhaoxia Wang
机构
*
School of Computing and Information Systems, Singapore Management University(新加坡管理学院)
;
School of Computing(计算学院)
;
Research and Development, Mastercard(Mastercard研发)
AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification
AstroAlertBench: 评估多模态大语言模型在天文学分类中的准确性、推理和诚实性
Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu, Facundo Perez Paolino, Luke Handley, Theophile Jegou du Laz, Ricky Nilsson, Alice Zou, Matthew Graham, Ashish Mahabal
机构
*
California Institute of Technology(加州理工学院)
;
Massachusetts Institute of Technology(麻省理工学院)
;
Purdue University(普渡大学)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
Beyond BLEU: A Semantic Evaluation Method for Code Translation
超越BLEU:代码翻译的语义评估方法
Julius Näumann, Sven Keidel, Amir Molzam Sharifloo, Mira Mezini
机构
*
TU Darmstadt(图宾根大学)
;
Hessian Center for Artificial Intelligence(黑森人工智能中心)
;
National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)
Omnilingual MT: Machine Translation for 1,600 Languages
多语言机器翻译:支持1600种语言的机器翻译
Omnilingual MT Team, Belen Alastruey, Niyati Bafna, Andrea Caciolai, Kevin Heffernan, Artyom Kozhevnikov, Christophe Ropers, Eduardo Sánchez, Charles-Eric Saint-James, Ioannis Tsiamas, Xiang "Tony" Cao, Chierh Cheng, Joe Chuang, Paul-Ambroise Duquenne, Mark Duppenthaler, Nate Ekberg, Cynthia Gao, Pere Lluís Huguet Cabot, João Maria Janeiro, Jean Maillard, Gabriel Mejia Gonzalez, Holger Schwenk, Edan Toledo, Arina Turkatenko, Albert Ventayol-Boada, Rashel Moritz, Alexandre Mourachko, Surya Parimi, Mary Williamson, Shireen Yates, David Dale, Marta R. Costa-jussà
机构
*
FAIR at Meta(Meta的FAIR)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
SynBench: A Benchmark for Differentially Private Text Generation
SynBench:差分隐私文本生成的基准测试
Yidan Sun, Viktor Schlegel, Srinivasan Nandakumar, Iqra Zahid, Yuping Wu, Yulong Wu, Hao Li, Jie Zhang, Warren Del-Pinto, Goran Nenadic, Siew Kei Lam, Anil Anthony Bharath
机构
*
Imperial College London, Imperial Global Singapore(帝国学院伦敦,帝国全球新加坡)
;
University of Manchester, United Kingdom(曼彻斯特大学,英国)
;
CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(CFAR和IHPC,科技研究局(A*STAR),新加坡)
;
Nanyang Technological University, Singapore(南洋理工大学,新加坡)
;
Imperial College London, United Kingdom(帝国学院伦敦,英国)
机构
*
Australian Artificial Intelligence Institute, University of Technology Sydney(澳大利亚人工智能研究所,悉尼技术大学)
;
College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)
;
School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)
;
Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系)
PulseLM: A Foundation Dataset and Benchmark for PPG-Text Learning
PulseLM:PPG-文本学习的基础数据集和基准
Hung Manh Pham, Jinyang Wu, Xiao Ma, Yiming Zhang, Yixin Xu, Aaqib Saeed, Bin Zhu, Zhou Pan, Dong Ma
机构
*
Singapore Management University(新加坡管理大学)
;
Queen Mary University of London(伦敦玛丽女王大学)
;
Eindhoven University of Technology(埃因霍温理工大学)
;
University of Cambridge(剑桥大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI