IGV-RRT: Prior-Real-Time Observation Fusion for Active Object Search in Changing Environments
IGV-RRT:面向动态环境主动目标搜索的先验-实时观测融合
Wei Zhang, Ping Gong, Yujie Wang, Leilei Yao, Minghui Bai, Rongfeng Ye, Yinchuan Wang, Yachao Wang, Chen Sun, Chaoqun Wang
机构
*
The School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)
;
Department of Data and Systems Engineering, HKU(数据与系统工程系,香港大学)
专题命中
视觉推理
:VLM(abstract,abstract_cn);vision language model(abstract)
机构
*
Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所)
;
University of Chinese Academy of Sciences 3 ByteDance 4 Westlake University(中国科学院大学 3 字节跳动 4 西湖大学)
;
Key Laboratory of Computing Power Network(计算功率网络重点实验室)
;
Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超级计算中心),齐鲁工业大学(山东省科学院))
专题命中
视觉推理
:visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)
机构
*
University of Science and Technology of China(中国科学技术大学)
;
State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
;
iFLYTEK AI Research(iFLYTEK人工智能研究院)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start
Metis-SPECS: 通过基于偏好自我蒸馏的冷启动解耦多模态学习
Kun Chen, Peng Shi, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao, Lin Ma
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
;
Meituan(美团)
专题命中
视觉推理
:vision language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
基于框架的思考:视觉上下文和测试时扩展如何增强视频推理
Chengzu Li, Zanyi Wang, Jiaang Li, Yi Xu, Han Zhou, Huanyu Zhang, Ruichuan An, Dengyang Jiang, Zhaochong An, Ivan Vulić, Serge Belongie, Anna Korhonen
机构
*
University of Cambridge(剑桥大学)
;
Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学)
;
Hong Kong University of Science(香港科学大学)
;
University of California San Diego(加州大学圣地亚哥分校)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Peking University(北京大学)
KiVA: Kid-inspired Visual Analogies for Testing Large Multimodal Models
KiVA:儿童启发的视觉类比用于测试大多模态模型
Eunice Yiu, Maan Qraitem, Anisa Noor Majhi, Charlie Wong, Yutong Bai, Shiry Ginosar, Alison Gopnik, Kate Saenko
机构
*
University of California, Berkeley(加州大学伯克利分校)
;
Boston University(波士顿大学)
;
Google DeepMind(谷歌DeepMind)
;
Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
机构
*
Zhejiang University(浙江大学)
;
Nanjing University of Science and Technology(南京理工大学)
;
Huzhou University(湖州大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结
SKG2DATA通过空间知识图引导多模态合成,提升多模态大语言模型的空间感知与推理能力。
CommentsIEEE/ACM Transactions on Audio, Speech and Language Processing
机构
*
Peking University(北京大学)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
Chinese University of Hong Kong(香港中文大学)
;
University of California, Santa Barbara(加州大学圣芭芭拉分校)