ICAN-Deploy: Identity-Stable Canary Deployment for Safety-Critical Embodied Agents
ICAN-Deploy:面向安全关键具身智能体的身份稳定金丝雀部署
Xue Qin, Simin Luan, John See, Zeyd Boukhers, Cong Yang, Zhijun Li
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
Heriot-Watt University, Malaysia Campus(赫瑞-沃德大学马来西亚分校)
;
Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息技术研究所)
;
Soochow University(苏州大学)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
VCap: 用于弱到强视觉字幕的超几何奖励
Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang, Yankai Yang, Yancheng Long, Yiyang Fan, Xuanyu Zheng, Haonan Fan, Kaiyu Jiang, Tianke Zhang, Changyi Liu, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan
机构
*
Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校)
;
Chinese Academy of Sciences(中国科学院)
;
Kuaishou Technology(快手科技)
STAMBRIDGE: Spectral-Temporal Amplitude-aware Mid-Feature Bridge for EEG Visual Decoding
STAMBRIDGE:用于脑电视觉解码的谱时幅度感知中间特征桥
Jiahe Meng, Weiming Zeng, Yueyang Li, Bo Chai, Hongjie Yan, Zhiguo Zhang, Wai Ting Siok, Nizhuan Wang
机构
*
Lab of Digital Image and Intelligent Computation, Shanghai Maritime University(数字图像与智能计算实验室,上海 Maritime 大学)
;
Department of Language Science and Technology, The Hong Kong Polytechnic University(语言科学与技术系,香港理工大学)
;
Department of Neurology, Affiliated Lianyungang Hospital of Xuzhou Medical University(神经内科,徐州医学院附属连云港医院)
;
Institute of Computing and Intelligence, Harbin Institute of Technology Shenzhen(计算与智能研究所,哈尔滨工业大学深圳研究院)
OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning
OGER:一种用于混合强化学习的鲁棒离线引导探索奖励
Xinyu Ma, Mingzhou Xu, Xuebo Liu, Chang Jin, Qiang Wang, Derek F. Wong, Min Zhang
机构
*
Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)
;
Hithink RoyalFlush Information Network, Hangzhou, China(杭州Hithink RoyalFlush信息网络)
;
Computer and Information Science, University of Macau, Macau, China(澳门大学计算机与信息科学学院)
Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models
停止奖励幻觉步骤:面向小型推理模型的忠实感知步骤级强化学习
Shuo Nie, Hexuan Deng, Chao Wang, Ruiyu Fang, Xuebo Liu, Shuangyong Song, Yu Li, Min Zhang, Xuelong Li
机构
*
Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)
;
Institute of Artificial Intelligence (TeleAI), China Telecom Corp Ltd(中国电信人工智能研究院)
;
College of Integrated Circuits, Zhejiang University, Hangzhou, Zhejiang, China(浙江大学集成电路学院)
;
Zhongguancun Academy, Beijing, China(中关村学院)