Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games
Orak:面向多样化视频游戏的LLM代理训练与评估基础基准
Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, Jaewoong Cho
机构
*
KRAFTON
;
Seoul National University(首尔国立大学)
;
NVIDIA
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
Ludo Robotics
Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety
大规模安全:大型模型和智能体安全的全面综述
Xingjun Ma, Yifeng Gao, Yixu Wang, Ruofan Wang, Xin Wang, Ye Sun, Yifan Ding, Hengyuan Xu, Yunhao Chen, Yunhan Zhao, Hanxun Huang, Yige Li, Yutao Wu, Jiaming Zhang, Xiang Zheng, Yang Bai, Zuxuan Wu, Xipeng Qiu, Jingfeng Zhang, Yiming Li, Xudong Han, Haonan Li, Jun Sun, Cong Wang, Jindong Gu, Baoyuan Wu, Siheng Chen, Tianwei Zhang, Yang Liu, Mingming Gong, Tongliang Liu, Shirui Pan, Cihang Xie, Tianyu Pang, Yinpeng Dong, Ruoxi Jia, Yang Zhang, Shiqing Ma, Xiangyu Zhang, Neil Gong, Chaowei Xiao, Sarah Erfani, Tim Baldwin, Bo Li, Masashi Sugiyama, Dacheng Tao, James Bailey, Yu-Gang Jiang
机构
*
Fudan University(复旦大学)
;
The University of Melbourne(墨尔本大学)
;
Singapore Management University(新加坡国立大学)
;
Deakin University(德肯大学)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
City University of Hong Kong(香港城市大学)
;
University of Oxford(牛津大学)
;
Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
The University of Sydney(悉尼大学)
;
Griffith University(格里菲斯大学)
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Sea AI Lab(Sea AI实验室)
;
Tsinghua University(清华大学)
;
Virginia Tech(弗吉尼亚理工大学)
;
CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全部)
;
University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
;
Purdue University(普渡大学)
;
Duke University(杜克大学)
;
University of Wisconsin - Madison(威斯康星大学麦迪逊分校)
;
RIKEN(理化学研究所)
;
The University of Tokyo(东京大学)
CLSGen: A Dual-Head Fine-Tuning Framework for Joint Probabilistic Classification and Verbalized Explanation
CLSGen:一种用于联合概率分类和 verbalized 解释的双头微调框架
WonJin Yoon, Kangyu Zhu, Ian Bulovic, Autumn Sehy, Yanjun Gao, Dmitriy Dligach, Majid Afshar, Timothy A. Miller
机构
*
Boston Children’s Hospital(波士顿儿童医院)
;
Harvard Medical School(哈佛医学院)
;
University of Colorado Anschutz Medical Campus(科罗拉多大学安施图茨医学院)
;
Loyola University Chicago(芝加哥洛约拉大学)
;
University of Wisconsin Madison(威斯康星大学麦迪逊分校)
机构
*
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
Henry Ford Health(亨利·福特健康)
;
University of Connecticut(康涅狄格大学)
;
University of Waterloo(滑铁卢大学)
;
Pennsylvania State University(宾夕法尼亚州立大学)
TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training
TensorHub: 用于LLM强化学习训练的可扩展和弹性权重传输
Chenhao Ye, Huaizheng Zhang, Mingcong Han, Baoquan Zhong, Xiang Li, Qixiang Chen, Xinyi Zhang, Weidong Zhang, Kaihua Jiang, Wang Zhang, He Sun, Wencong Xiao, Andrea C. Arpaci-Dusseau, Remzi H. Arpaci-Dusseau
机构
*
ByteDance Seed(字节跳动Seed)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
Evaluating Low-Light Image Enhancement Across Multiple Intensity Levels
在多种光照级别下评估低光图像增强
Maria Pilligua, David Serrano-Lozano, Pai Peng, Ramon Baldrich, Michael S. Brown, Javier Vazquez-Corral
机构
*
Computer Vision Center(计算机视觉中心)
;
Universitat Autònoma de Barcelona(巴塞罗那自治大学)
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
York University(约克大学)
机构
*
Yale University(耶鲁大学)
;
Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所)
;
Google DeepMind(谷歌DeepMind)
;
Stanford University(斯坦福大学)
;
Genentech(基因泰克)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Cornell University(康奈尔大学)
;
Harvard University(哈佛大学)
Zheng-Xin Yong, Parv Mahajan, Andy Wang, Ida Caspary, Yernat Yestekov, Zora Che, Mosh Levy, Elle Najt, Dennis Murphy, Prashant Kulkarni, Lev McKinney, Kei Nishimura-Gasparian, Ram Potham, Aengus Lynch, Michael L. Chen
机构
*
Constellation
;
Anthropic Fellows Program(Anthropic研究员项目)
;
Brown University(布朗大学)
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
Imperial College London(伦敦帝国学院)
;
University of Maryland, College Park(马里兰大学帕克分校)
;
Georgia Institute of Technology(佐治亚理工学院)
;
Bar Ilan University(巴伊兰大学)
;
University of Toronto(多伦多大学)
;
University of Oxford(牛津大学)
AI总结
Kimi K2.5作为开源大模型,在安全评估中显示出潜在风险,包括CBRNE滥用、网络安全漏洞及政治偏见,但其在拒绝恶意请求方面表现较弱,凸显开源模型的安全挑战。
V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views
V2X-QA:面向自动驾驶多视角的多模态大语言模型综合数据集与基准测试
Junwei You, Pei Li, Zhuoyu Jiang, Weizhe Tang, Zilin Huang, Rui Gan, Jiaxi Liu, Yan Zhao, Sikai Chen, Bin Ran
机构
*
Department of Civil and Environmental Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校土木与环境工程系)
;
Department of Civil and Architectural Engineering and Construction Management, University of Wyoming(怀俄明大学土木与建筑工程及施工管理系)
;
School of Transportation, Southeast University(东南大学交通学院)
机构
*
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
LinkedIn Corporation(领英公司)
;
Northeastern University(东北大学)
;
University of California, Davis(加州大学戴维斯分校)