机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Tsinghua University(清华大学)
;
Hunan Normal University(湖南师范大学)
;
City University of Hong Kong(香港城市大学)
CarbonCLIP: Enhance Carbon Prediction from Satellite Imagery via Integrated Street-View Semantics and Temporal Context Training
CarbonCLIP:通过集成街景语义和时间上下文训练增强卫星图像的碳排放预测
Zeru Yang, Fang-Ying Gong, Steve H. L. Yim, Chau Yuen
机构
*
Energy Research Institute at NTU(国立理工学院能源研究所)
;
Interdisciplinary Graduate Programme(跨学科研究生项目)
;
School of Electrical and Electronic Engineering(电气电子工程学院)
;
School of Public Administration and Policy(公共管理与政策学院)
;
Asian School of the Environment(亚洲环境学院)
;
Center for Climate Change and Environmental Health(气候变化与环境健康中心)
Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding
Reflect-R1:长视频理解中基于证据驱动的自纠正反思
Shuimu Chen, Yuteng Chen, Yuanshen Guan, Zebang Cheng, Zeyu Zhang, Shengqian Qin, Bin Xia, Jiaran Li, Wenming Yang, Fei Ma
机构
*
Tsinghua University(清华大学)
;
Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))
;
Nanyang Technological University(南洋理工大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Shenzhen University(深圳大学)
;
University of California(加利福尼亚大学)
;
Shanghai Jiao Tong University(上海交通大学)
Active Adversarial Perturbation-driven Associative Memory Retrieval for RGB-Event Visual Object Tracking
主动对抗扰动驱动的关联记忆检索用于RGB-事件视觉目标跟踪
Xiao Wang, Xufeng Lou, Zikang Yan, Lan Chen, Sibao Chen, Yaowei Wang, Yonghong Tian, Jin Tang
机构
*
School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)
;
School of Electronic and Information Engineering, Anhui University(安徽大学电子信息工程学院)
;
Peng Cheng Laboratory(鹏城实验室)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
School of Computer Science, Peking University(北京大学计算机学院)
;
School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)
Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding
金点狙击手:VLM中的自引导视觉推理用于细粒度动作理解
Haodi Liu, Xinhang Yang, Kunda Yan, Sen Cui, Zeyu Zhang, Changshui Zhang
机构
*
Beijing National Research Center for Information Science and Technology (BNRist), Department of Automation, Tsinghua University(清华大学自动化系北京信息科学与技术国家研究中心)
;
State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室)
FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation
FOCA: 面向未来的条件化用于数据高效的视觉-语言-动作适应
Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen, Trong-Bao Ho, Doanh Le, Tan Q. Nguyen, Thien-Loc Ha, Nhiem Tran, Bao Thach, Nhat X. Tran, Tuan A. Tran, Artur Habuda, Philip Lund Møller, Tran Nguyen Le, Daniel Sonntag, Matthias Niepert, Khoa D. Doan, Vu Duong, Hung Ngo, Minh N. Vu, Duy M. H. Nguyen, An Thai Le, Ngo Anh Vien
机构
*
Center for AI Research, VinUniversity, Vietnam
;
University of Utah, USA
;
German Research Center for Artificial Intelligence (DFKI)
;
Technical University of Denmark, Denmark
;
University of Oldenburg, Germany
;
University of Stuttgart, Germany
;
Max Planck Research School for Intelligent Systems (IMPRS-IS), Germany
NEST: Narrative Event Structures in Time for Long Video Understanding
NEST:面向长视频理解的时间叙事事件结构
Ali Asgarov, Kaushik Narasimhan, Najibul Haque Sarker, Hani Alomari, Chia-Wei Tang, Anushka Sivakumar, Zaber Ibn Abdul Hakim, Shaurya Mallampati, Chris Thomas
机构
*
Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)
FEMOT: Multi-Object Tracking using Frame and Event Cameras
FEMOT: 使用帧和事件摄像机的多目标跟踪
Shiao Wang, Xiao Wang, Chao Wang, Yitao Li, Menghao Liu, Bo Jiang, Yaowei Wang, Yonghong Tian, Jin Tang
机构
*
School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)
;
Peng Cheng Laboratory(鹏城实验室)
;
National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理全国重点实验室)
;
School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
CommentsAccepted for publication at the IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). 6 pages, 3 figures, 1 table