A Dual-Positive Monotone Parameterization for Multi-Segment Bids and a Validity Assessment Framework for Reinforcement Learning Agent-based Simulation of Electricity Markets
多段报价的双正单调参数化及强化学习代理仿真电力市场的有效性评估框架
Zunnan Xu, Zhaoxia Jing, Zhanhua Pan
机构
*
School of Electric Power Engineering, South China University of Technology(华南理工大学电力学院)
;
Department of Engineering, University of Exeter(埃克塞特大学工程学院)
LABBench2: An Improved Benchmark for AI Systems Performing Biology Research
LABBench2:一种改进的AI系统进行生物研究的基准测试
Jon M Laurent, Albert Bou, Michael Pieler, Conor Igoe, Alex Andonian, Siddharth Narayanan, James Braza, Alexandros Sanchez Vassopoulos, Jacob L Steenwyk, Blake Lash, Andrew D White, Samuel G Rodriques
机构
*
Broad Institute, Cambridge, MA, USA(博德研究所,美国马萨诸塞州剑桥市)
If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs
如果一个大语言模型是一个角色,它会知道自己故事吗?评估大语言模型的终身学习
Siqi Fan, Xiusheng Huang, Yiqun Yao, Xuezhi Fang, Kang Liu, Peng Han, Shuo Shang, Aixin Sun, Yequan Wang
机构
*
University of Electronic Science and Technology of China(电子科技大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室)
;
Nanyang Technological University(南洋理工大学)
;
Peking University(北京大学)
;
Spin Matrix, China(中国Spin Matrix公司)
EVGeoQA: Benchmarking LLMs on Dynamic, Multi-Objective Geo-Spatial Exploration
EVGeoQA:基于动态多目标地理空间探索的LLM基准测试
Jianfei Wu, Zhichun Wang, Zhensheng Wang, Zhiyu He
机构
*
School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
;
Beijing Key Laboratory of Artificial Intelligence for Education(北京市教育人工智能重点实验室)
;
Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(教育部智能技术与教育应用工程研究中心)
;
College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)
ReContraster: Making Your Posters Stand Out with Regional Contrast
ReContraster:利用区域对比让海报脱颖而出
Peixuan Zhang, Zijian Jia, Ziqi Cai, Shuchen Weng, Si Li, Boxin Shi
机构
*
School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
;
State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)
;
National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
RPA-Check: A Multi-Stage Automated Framework for Evaluating Dynamic LLM-based Role-Playing Agents
RPA-Check:一种多阶段自动框架,用于评估基于大语言模型的角色扮演代理
Riccardo Rosati, Edoardo Colucci, Massimiliano Bolognini, Adriano Mancini, Paolo Sernani
机构
*
Department of Political Sciences, Communication and International Relations, University of Macerata(马切拉塔大学政治学、传播与国际关系系)
;
Department of Law, University of Macerata(马切拉塔大学法律系)
IMPACT: A Dataset for Multi-Granularity Human Procedural Action Understanding in Industrial Assembly
IMPACT:一个多粒度工业装配中的人类过程动作理解数据集
Di Wen, Zeyun Zhong, David Schneider, Manuel Zaremski, Linus Kunzmann, Yitian Shi, Ruiping Liu, Yufan Chen, Junwei Zheng, Jiahang Li, Jonas Hemmerich, Qiyi Tong, Patric Grauberger, Arash Ajoudani, Danda Pani Paudel, Sven Matthiesen, Barbara Deml, Jürgen Beyerer, Luc Van Gool, Rainer Stiefelhagen, Kunyu Peng
机构
*
Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
;
ETH Zurich(苏黎世联邦理工学院)
;
Italian Institute of Technology(意大利理工学院)
;
INSAIT, Sofia University(索非亚大学INSAIT研究所)
HealthAdminBench: Evaluating Computer-Use Agents on Healthcare Administration Tasks
HealthAdminBench: 评估基于计算机使用的代理在医疗管理任务上的性能
Suhana Bedi, Ryan Welch, Ethan Steinberg, Michael Wornow, Taeil Matthew Kim, Haroun Ahmed, Peter Sterling, Bravim Purohit, Qurat Akram, Angelic Acosta, Esther Nubla, Pritika Sharma, Michael A. Pfeffer, Sanmi Koyejo, Nigam H. Shah
机构
*
Stanford University(斯坦福大学)
;
Kinetic Systems
;
Stanford Health Care(斯坦福医疗保健)