QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization
QLPO:用于长度感知策略优化的象限加权采样
Siwei Chen, Siqi Chen, Xupeng Miao, Bin Cui
机构
*
School of Computer Science, Peking University(北京大学计算机科学学院)
;
Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University(北京大学软硬件协同人工智能系统北京市重点实验室)
;
Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
;
Institute of Computational Social Science, Peking University (Qingdao)(北京大学(青岛)计算社会科学研究院)
Certified Speculative Execution for Untrusted AI Agents
不可信AI代理的认证推测执行
Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou
机构
*
School of Engineering, Institute of Science Tokyo, Japan(东京科学大学工学院)
;
College of Control Science and Engineering, Zhejiang University, China(浙江大学控制科学与工程学院)
;
Department of Electrical and Computer Engineering, National University of Singapore, Singapore(新加坡国立大学电气与计算机工程系)
AVIS: Adaptive Test-Time Scaling for Vision-Language Models
AVIS: 视觉语言模型的自适应测试时缩放
Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni, Hakki Can Karaimer, Hue Nguyen, Iqbal Mohomed, Michael Brudno, Alex Levinshtein, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk
机构
*
AI Center-Toronto, Samsung Electronics(三星电子多伦多AI中心)
;
University of Toronto(多伦多大学)
;
Vector Institute(向量研究所)
;
York University(约克大学)