机构
*
Southern University of Science and Technology(南方科技大学)
;
Hong Kong University of Science and Technology(香港科学大学)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科学大学(广州))
;
Hong Kong Polytechnic University(香港理工大学)
;
LIGHTSPEED
SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents
SeClaw: 面向自主代理评估的规范驱动安全任务合成
Hao Cheng, Changtao Miao, Tianle Song, Yin Wu, He Liu, Erjia Xiao, Junchi Chen, Xiaoyu Shi, Yichi Wang, Jing Yang, Taowen Wang, Jinhao Duan, Mengshu Sun, Peiyan Dong, Xuan Shen, Yang Cao, Renjing Xu, Kaidi Xu, Jindong Gu, Bo Zhang, Jize Zhang, Chenhao Lin, Philip Torr, Chao Shen
机构
*
The Hong Kong University of Science and Technology(香港科技大学)
;
Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)
;
Xi’an Jiaotong University(西安交通大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
University of Oxford(牛津大学)
;
City University of Hong Kong(香港城市大学)
;
Institute of Science Tokyo(东京科学研究所)
;
Zhejiang University(浙江大学)
;
Massachusetts Institute of Technology(麻省理工学院)
;
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
Beijing University of Technology(北京理工大学)
机构
*
Sichuan University(四川大学)
;
PLA Academy of Military Science(中国人民解放军军事科学院)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
Thinking Economically: A Hierarchical Framework for Adaptive-Complexity Reasoning in LLMs
经济思维:面向LLM自适应复杂度推理的分层框架
Yubo Gao, Haotian Wu, Hong Chen, Junquan Huang, Yibo Yan, Jungang Li, Zihao Dongfang, Sicheng Tao, Puay Siew Tan, Jie Zhang, Xuming Hu
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Nanyang Technological University(南洋理工大学)
;
Singapore Institute of Manufacturing Technology, A*STAR(新加坡制造技术研究所,A*STAR)
机构
*
Sustainable Energy and Environment Thrust, The Hong Kong University of Science and Technology (Guangzhou)(可持续能源与环境方向,香港科学与技术大学(广州))
;
School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院)
;
Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(数据科学与分析方向,香港科学与技术大学(广州))
;
Material Genome Institute, Shanghai University(材料基因组研究所,上海大学)
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
The Hong Kong University of Science and Technology(香港科技大学)
;
MBZUAI
;
University of California, Merced(加州大学默塞德分校)
;
Sun Yat-sen University(中山大学)
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
HKUST (GZ)(香港科技大学(广州))
;
South China University of Technology(华南理工大学)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
LookWise: 知道何时何地关注多模态大语言模型中的细粒度视觉推理
Yuxiang Shen, Hailong Huang, Zhenkun Gao, Xueheng Li, Man Zhou, Chengjun Xie, Haoxuan Che, Xuanhua He, Jie Zhang
机构
*
Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Zhejiang University(浙江大学)
;
East China Normal University(华东师范大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
Code2Math: Can Your Code Agent Effectively Evolve Math Problems Through Exploration?
Code2Math:你的代码智能体能否通过探索有效演化数学问题?
Dadi Guo, Yuejin Xie, Qingyu Liu, Weixian Huang, Jiayu Liu, Zhiyuan Fan, Qihan Ren, Shuai Shao, Tianyi Zhou, Jianjie Feng, Wenze Su, Yujiu Yang, Dongrui Liu, Yi R. Fung
机构
*
Hong Kong University of Science and Technology(香港科技大学)
;
Tsinghua University(清华大学)
;
Zhejiang University(浙江大学)
;
Nanjing Tech University(南京工业大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of Michigan(密歇根大学)
;
Independent Researcher(独立研究者)
DenseMLLM: Standard Multimodal LLMs for Dense Prediction
DenseMLLM:用于密集预测的标准多模态大语言模型
Yi Li, Hongze Shen, Lexiang Tang, Xin Li, Xinpeng Ding, Yinsong Liu, Deqiang Jiang, Xing Sun, Xiaomeng Li
机构
*
Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学电子与计算机工程系)
;
Tencent, Youtu-Lab, China(腾讯优图实验室)
T-POP: Test-Time Personalization with Online Preference Feedback
T-POP:基于在线偏好反馈的测试时个性化
Zikun Qu, Min Zhang, Mingze Kong, Xiang Li, Zhiwei Shang, Zhiyong Wang, Yikun Ban, Shuang Qiu, Yao Shu, Zhongxiang Dai
机构
*
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
East China Normal University(华东师范大学)
;
Shenzhen Loop Area Institute(深圳河套学院)
;
Tianjin University(天津大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Beihang University(北京航空航天大学)
;
City University of Hong Kong(香港城市大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
Lessons from the Trenches on Reproducible Evaluation of Language Models
关于语言模型可重复评估的前线经验教训
Stella Biderman, Hailey Schoelkopf, Lintang Sutawika, Leo Gao, Jonathan Tow, Baber Abbasi, Alham Fikri Aji, Pawan Sasanka Ammanamanchi, Sidney Black, Jordan Clive, Anthony DiPofi, Julen Etxaniz, Benjamin Fattori, Jessica Zosa Forde, Charles Foster, Jeffrey Hsu, Mimansa Jaiswal, Wilson Y. Lee, Haonan Li, Charles Lovering, Niklas Muennighoff, Ellie Pavlick, Jason Phang, Aviya Skowron, Samson Tan, Xiangru Tang, Kevin A. Wang, Genta Indra Winata, François Yvon, Andy Zou
机构
*
MBZUAI
;
IIIT Hyderabad
;
EleutherAI
;
HiTZ Center - Ixa, UPV/EHU
;
Ivy Natal
;
University of Michigan
;
HubSpot
;
LibrAI
;
Kensho
;
Contextual AI
;
Brown University
;
New York University
;
Amazon
;
Yale University
;
HKUST
;
Sorbonne University
;
CMU
AI总结
本文基于开发Language Model Evaluation Harness框架的三年经验,总结了语言模型评估中面临的方法论挑战、缺乏可重复性和透明度等问题,并提供了改进评估严谨性和信心的建议。