T-POP: Test-Time Personalization with Online Preference Feedback
T-POP:基于在线偏好反馈的测试时个性化
Zikun Qu, Min Zhang, Mingze Kong, Xiang Li, Zhiwei Shang, Zhiyong Wang, Yikun Ban, Shuang Qiu, Yao Shu, Zhongxiang Dai
机构
*
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
East China Normal University(华东师范大学)
;
Shenzhen Loop Area Institute(深圳河套学院)
;
Tianjin University(天津大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Beihang University(北京航空航天大学)
;
City University of Hong Kong(香港城市大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
Lessons from the Trenches on Reproducible Evaluation of Language Models
关于语言模型可重复评估的前线经验教训
Stella Biderman, Hailey Schoelkopf, Lintang Sutawika, Leo Gao, Jonathan Tow, Baber Abbasi, Alham Fikri Aji, Pawan Sasanka Ammanamanchi, Sidney Black, Jordan Clive, Anthony DiPofi, Julen Etxaniz, Benjamin Fattori, Jessica Zosa Forde, Charles Foster, Jeffrey Hsu, Mimansa Jaiswal, Wilson Y. Lee, Haonan Li, Charles Lovering, Niklas Muennighoff, Ellie Pavlick, Jason Phang, Aviya Skowron, Samson Tan, Xiangru Tang, Kevin A. Wang, Genta Indra Winata, François Yvon, Andy Zou
机构
*
MBZUAI
;
IIIT Hyderabad
;
EleutherAI
;
HiTZ Center - Ixa, UPV/EHU
;
Ivy Natal
;
University of Michigan
;
HubSpot
;
LibrAI
;
Kensho
;
Contextual AI
;
Brown University
;
New York University
;
Amazon
;
Yale University
;
HKUST
;
Sorbonne University
;
CMU
AI总结
本文基于开发Language Model Evaluation Harness框架的三年经验,总结了语言模型评估中面临的方法论挑战、缺乏可重复性和透明度等问题,并提供了改进评估严谨性和信心的建议。
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与发展中心)
;
Hong Kong Baptist University(香港 Baptist 大学)
SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
SpatialAct:探测VLM智能体在3D场景中的空间推理到行动能力
Tianhui Liu, Jie Feng, Zhiheng Zheng, Shengyuan Wang, Yiming Guo, Yanxin Xi, Hangyu Fan, Yong Li, Pan Hui
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
Zhongguancun Academy(中关村学院)
;
Tsinghua University(清华大学)
;
Helsinki University(赫尔辛基大学)
TARIC: Memory-Augmented Traversability-Aware Outdoor VLN under Interrupted Semantic Cues
TARIC: 语义线索中断下基于记忆增强的可通行性感知户外视觉语言导航
Tianle Zeng, Hanjing Ye, Jianwei Peng, Jingwen Yu, Hanxuan Chen, Hong Zhang
机构
*
Shenzhen Key Laboratory of Robotics and Computer Vision(深圳机器人与计算机视觉重点实验室)
;
Southern University of Science and Technology(南方科技大学)
;
CKS Robotics Institute(CKS机器人研究所)
;
Hong Kong University of Science and Technology(香港科技大学)
;
College of Electrical and Information Engineering(电气与信息工程学院)
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Lingnan University(岭南大学)
;
The Third Affiliated Hospital of Kunming Medical University, Yunnan Cancer Hospital, Peking University Cancer Hospital Yunnan(昆明医科大学第三附属医院、云南癌症医院、北京大学肿瘤医院云南分院)
;
Guangzhou First People's Hospital, South China University of Technology(广州第一人民医院、华南理工大学)
;
The Third Affiliated Hospital, Sun Yat-Sen University(中山大学第三附属医院)
;
HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究院)
Fighting Numerical Hallucinations via Data-centric Compilation for Online Financial QA
通过数据为中心的编译对抗在线金融问答中的数值幻觉
Hao Chen, Xing Tang, Qirui Liu, Weijie Shi, Shiwei Li, Fuyuan Lyu, Weihong Luo, Xiku Du, Xiuqiang He
机构
*
Shenzhen Technology University(深圳科技大学)
;
FiT, Tencent(腾讯金融科技部)
;
South China University of Technology(华南理工大学)
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Huazhong University of Science and Technology(华中科技大学)
;
McGill University(麦吉尔大学)
Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination
组合合成:通过原子分解与重组扩展代码RLVR
Jiasheng Zheng, Boxi Cao, Boxi Yu, Yuzhong Zhang, Jialun Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun
机构
*
Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Lero the Research Ireland Centre for Software, University of Limerick(利默尼克大学爱尔兰软件研究中心)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
The Hong Kong University of Science and Technology(香港科技大学)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
MergeTok: 通过令牌合并实现统一连续和离散视觉令牌化
Luyuan Zhang, Siyuan Li, Zedong Wang, Qingsong Xie, Cheng Tan, Anna Wang, Yanhao Zhang, Chen Chen, Haonan Lu, Haoqian Wang
机构
*
Tsinghua University(清华大学)
;
Westlake University(西湖大学)
;
Zhejiang University(浙江大学)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
OPPO
;
Shanghai AI Lab(上海人工智能实验室)
机构
*
University of California, San Diego(加州大学圣地亚哥分校)
;
University of Michigan, Ann Arbor(密歇根大学安娜堡分校)
;
The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州))
;
ShanghaiTech University(上海科技大学)
;
University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校)
Vision-Based Localization in Dense Urban Environments: A Case Study of an Urban Village in China
基于视觉的密集城市环境定位:中国城中村案例研究
Menglin Wu, Rui Cao
机构
*
Thrust of Urban Governance and Design, Society Hub, The Hong Kong University of Science and Technology (Guangzhou)(城市治理与设计 thrust,社会枢纽,香港科技大学(广州))
机构
*
Hong Kong University of Science and Technology(香港科技大学)
;
Nanyang Technological University(南洋理工大学)
;
Northwestern Polytechnical University(西北工业大学)
;
Southeast University(东南大学)
;
Huazhong University of Science and Technology(华中科技大学)
GEM: Geometric Entropy Mixing for Optimal LLM Data Curation
GEM: 用于最优LLM数据策展的几何熵混合
Yue Min, Ziyun Qiao, Ruining Chen, Yujun Li
机构
*
The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学)
;
Peking University, Beijing, China(北京大学)
;
University of Science and Technology of China, Hefei, China(中国科学技术大学)
SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments
SpaMEM:具身环境中通过感知-记忆集成进行动态空间推理的基准测试
Chih-Ting Liao, Xi Xiao, Chunlei Meng, Zhangquan Chen, Yitong Qiao, Weilin Zhou, Tianyang Wang, Xu Zheng, Xin Cao
机构
*
The University of New South Wales(新南威尔士大学)
;
The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
;
Fudan University(复旦大学)
;
Tsinghua University(清华大学)
;
Zhejiang University(浙江大学)
;
Xinjiang University(新疆大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries
LangForce: 通过潜在动作查询对视觉语言动作模型进行贝叶斯分解
Shijie Lian, Bin Yu, Xiaopeng Lin, Laurence T. Yang, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Cong Huang, Kai Chen
机构
*
Huazhong University of Science and Technology(华中科技大学)
;
Beijing Zhongguancun Academy(北京中关村学院)
;
Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Zhengzhou University(郑州大学)
;
Beihang University(北航)
;
East China Normal University(东华大学)
;
DeepCybot Co., Ltd.(DeepCybot有限公司)
An Intention-driven Lane Change Framework Considering Heterogeneous Dynamic Cooperation in Mixed-traffic Environment
考虑混合交通中异构动态协作的意图驱动换道框架
Xiaoyun Qiu, Haichao Liu, Yue Pan, Jun Ma, Xinhu Zheng
机构
*
Intelligent Transportation Thrust, Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)智能交通研究所,系统中心)
;
Guangdong Provincial Key Lab of Integrated Communication, Sensing and Computation for Ubiquitous Internet of Things(广东省集成通信、感知与计算 ubiquitous internet of things 关键实验室)
;
Robotics and Autonomous Systems Thrust, Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)机器人与自主系统研究所)
Yufei Li, Yisen Gao, Jiaxuan Xiong, Jiaxin Bai, Shijie Zhong, Haoyu Huang, Zhongwei Xie, Hong Ting Tsang, Yangqiu Song
机构
*
HKUST(香港理工大学)
;
Beijing Institute of Technology(北京理工大学)
;
Hong Kong Baptist University(香港 Baptist 大学)
;
Guangdong University of Technology(广东技术大学)
MASPOB: Bandit-Based Prompt Optimization for Multi-Agent Systems with Graph Neural Networks
MASPOB: 基于图神经网络的多智能体系统提示优化方法
Zhi Hong, Qian Zhang, Jiahang Sun, Zhiwei Shang, Mingze Kong, Xiangyi Wang, Yao Shu, Zhongxiang Dai
机构
*
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
South China University of Technology(华南理工大学)
;
Ritsumeikan University(立命馆大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
DTBench: A Synthetic Benchmark for Document-to-Table Extraction
DTBench:文档到表格提取的合成基准
Yuxiang Guo, Zhuoran Du, Nan Tang, Kezheng Tang, Congcong Ge, Yunjun Gao
机构
*
Zhejiang University(浙江大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
The Hong Kong University of Science(香港科学与技术大学)
Jian Mu, Qixin Zhang, Zhiyong Wang, Menglin Yang, Shuang Qiu, Chengwei Qin, Zhongxiang Dai, Yao Shu
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Nanyang Technological University(南洋理工大学)
;
University of Edinburgh(爱丁堡大学)
;
City University of Hong Kong(香港城市大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))