Technical Report on the CVPR 2026@AdvML Workshop Challenge
关于CVPR 2026@AdvML研讨会挑战赛的技术报告
Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao
机构
*
Beihang University(北京航空航天大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
Tongji University(同济大学)
;
iFLYTEK Co., Ltd.(科大讯飞股份有限公司)
;
Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室)
;
Wenzhou Business College(温州商学院)
;
Jiangnan University(江南大学)
;
Guangzhou City University of Technology(广州理工学院)
;
Inceptio Technology(智元机器)
;
Institute of Dataspace(数据空间研究所)
;
Zhongguancun Laboratory(中关村实验室)
;
Tsinghua University(清华大学)
;
ETH Zürich(苏黎世联邦理工学院)
;
University of Oxford(牛津大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
BAAI(北京智源人工智能研究院)
;
Meta
;
Johns Hopkins University(约翰·霍普金斯大学)
;
University of California, Berkeley(加州大学伯克利分校)
;
Nanyang Technological University(南洋理工大学)
Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory
解析、搜索与确认:基于思维链推理和结构化空间记忆的免训练空中视觉与对话导航
Yu Qi, Hongyu Li, Shaofei Huang, Tianrui Hui, Yaxiong Wang, Lechao Cheng, Zhun Zhong, Si Liu, Meng Wang
机构
*
School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)
;
Jianghuai Advance Technology Center(江淮先进技术中心)
;
Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)
;
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
;
University of Macau(澳门大学)
3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects
3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究
Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng
机构
*
Roblox Corporation(罗布乐思公司)
;
Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系)
;
Computer Science Department, Stanford University(斯坦福大学计算机科学系)
;
Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)
Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索
Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis
机构
*
Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)
;
Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所)
;
University of Konstanz(康斯坦茨大学)
Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO
作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位
Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan
机构
*
National University of Singapore(新加坡国立大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Nanyang Technological University(南洋理工大学)
;
Wuhan University(武汉大学)
专题命中
视觉定位与Grounding
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
Anomalous Frame Detection by Grouping Frame Similarities between Two Videos Computed by Vision-Language Model to Extract Expert Workers' Unique Actions
机构
*
Beihang University(北京航空航天大学)
;
State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室)
;
Nanjing University(南京大学)
;
Harbin Engineering University(哈尔滨工程大学)
;
Beijing Zhongguancun Academy(北京中关村科学城)