Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models
Circle-RoPE: 用于大视觉-语言模型的锥形解耦旋转位置嵌入
Chengcheng Wang, Jianyuan Guo, Hongguang Li, Yuchuan Tian, Ying Nie, Chang Xu, Kai Han
机构
*
Huawei Noah's Ark Lab.(华为诺亚实验室)
;
City University of Hong Kong.(香港城市大学)
;
University of Sydney.(悉尼大学)
;
State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学人工智能国家重点实验室,智能科学与技术学院)
PointLLM-R: Enhancing 3D Point Cloud Reasoning via Chain-of-Thought
PointLLM-R: 通过链式推理增强3D点云推理
Chaoqi Chen, Qile Xu, Wenjun Zhou, Hui Huang
机构
*
Visual Computing Research Center (VCC), College of Computer Science(视觉计算研究中心(VCC),计算机科学学院)
;
Software Engineering (CSSE) Shenzhen University China(软件工程(CSSE)深圳大学中国)
;
VCC, CSSE Shenzhen University China(VCC,CSSE 深圳大学中国)
;
Shenzhen University(深圳大学)
Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
Video-o3:长视频多跳推理的原生交错线索搜索
Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang
机构
*
Nanjing University(南京大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
Peking University(北京大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Zhejiang University(浙江大学)
;
SIAT, Chinese Academy of Sciences(中国科学院软件研究所)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
机构
*
AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
Nanyang Technological University(南洋理工大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
机构
*
University of California, Los Angeles(加州大学洛杉矶分校)
;
University of Pittsburgh(匹兹堡大学)
;
Fudan University(复旦大学)
;
University of California, Riverside(加州大学河滨分校)
;
Hong Kong University of Science(香港科学大学)
;
Maharishi International University(玛希拉国际大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV