GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
GeoArena:在大视觉-语言模型中评估开放世界地理推理
Pengyue Jia, Yingyi Zhang, Xiangyu Zhao, Sharon Li
机构
*
Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)
;
Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
AVRT:通过单模态教师模型实现音频-视觉推理迁移
Edson Araujo, Saurabhchand Bhati, M. Jehanzeb Mirza, Brian Kingsbury, Samuel Thomas, Rogerio Feris, James R. Glass, Hilde Kuehne
机构
*
University of Tübingen, Germany(图宾根大学)
;
MIT, Cambridge MA, USA(麻省理工学院)
;
IBM Research, USA(IBM研究院)
;
MIT-IBM Watson AI Lab, USA(麻省理工-IBM沃森人工智能实验室)
;
Tuebingen AI Center, Germany(图宾根人工智能中心)
RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding
RS-HyRe-R1: 一种混合奖励机制以克服遥感图像理解中的感知惯性
Gaozhi Zhou, Hu He, Peng Shen, Jipeng Zhang, Liujue Zhang, Linrui Xu, Zeyuan Wang, Ziyu Li, Xuezhi Cui, Wang Guo, Haifeng Li
机构
*
School of Mechanical and Electrical Engineering, Central South University(中南大学机械与电气工程学院)
;
School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)
机构
*
Sun Yat-sen University(中山大学)
;
OPPO AI Center(OPPO人工智能中心)
;
Shenzhen Loop Area Institute(深圳河套学院)
;
Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)
Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations
认知链式推理(CoCoT):关于社会情境的结构化多模态推理
Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap
机构
*
Seoul National University(首尔国立大学)
;
Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学)
;
Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang
机构
*
Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)
XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments
XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型
Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang
机构
*
Tsinghua University(清华大学)
;
Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技)
;
National University of Singapore(新加坡国立大学)
;
McGill University(麦吉尔大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
机构
*
School of Computer Science, University of Nottingham Ningbo China, China(诺丁汉大学宁波校区计算机科学学院)
;
Nottingham Ningbo China Beacons of Excellence Research and Innovation Institute, China(诺丁汉宁波中国卓越研究与创新研究所)
;
School of Artificial Intelligence, Shenzhen University, China(深圳大学人工智能学院)
SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topology
SkillGraph: 基于多模态图拓扑的自进化多智能体协作
Zheng Nie, Ruolin Shen, Xinlei Yu, Bo Yin, Jiangning Zhang, Xiaobin Hu
机构
*
National University of Singapore, Singapore(新加坡国立大学)
;
Technical University of Munich, Munich, Germany(慕尼黑技术大学)
;
Zhejiang University, China(浙江大学)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
SpatialImaginer: 向空间推理的自适应视觉想象迈进
Yian Li, Yang Jiao, Bin Zhu, Tianwen Qian, Shaoxiang Chen, Jingjing Chen, Yu-Gang Jiang
机构
*
College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)
;
School of Computing and Information Systems, Singapore Management University(新加坡管理大学 computing 与信息学院)
;
School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
;
MiniMax
;
Institute of Trustworthy Embodied Al, Fudan University(复旦大学可信具身人工智能研究院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction
PestVL-Net: 通过细粒度视觉-语言交互实现多模态害虫学习
Xueheng Li, Tao Hu, Ke Cao, Runsheng Qi, Huixin Zhang, Rui Li, Jie Zhang, Chengjun Xie
机构
*
Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Zhongke Hefei Institute of Technology Innovation Engineering(中科合肥技术创新工程研究院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
机构
*
Southeast University(东南大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
R3A: Reinforced Reasoning for Relevance Assessment for RAG in User-Generated Content Platforms
R3A:强化推理用于用户生成内容平台中的RAG相关性评估
Xiaowei Yuan, Lei Jin, Haoxin Zhang, Ziyang Huang, Yan Gao, Yi Wu, Yao Hu, Jun Zhao, Kang Liu
机构
*
The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统认知与决策智能重点实验室,自动化研究所,中国科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Xiaohongshu Inc.(小红书公司)
Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement
Q-DeepSight:利用图像激励思考用于图像质量评估与细化
Xudong Li, Jiaxi Tan, Ziyin Zhou, Yan Zhong, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Rongrong Ji
机构
*
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
;
Peking University(北京大学)
;
Beijing Institute of Technology(北京理工大学)
Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning
Omni-R1:迈向多模态推理的统一生成范式
Dongjie Cheng, Yongqi Li, Zhixin Ma, Hongru Cai, Yupeng Hu, Wenjie Wang, Liqiang Nie, Wenjie Li
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
Singapore Management University(新加坡国立大学)
;
Shandong University(山东大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.AI
Think before Go: Hierarchical Reasoning for Image-goal Navigation
先思后行:面向图像目标导航的层次推理
Pengna Li, Kangyi Wu, Shaoqing Xu, Fang Li, Lin Zhao, Long Chen, Zhi-Xin Yang, Nanning Zheng
机构
*
National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究所、西安交通大学)
;
University of Macau(澳门大学)
;
Xiaomi EV(小米电动车)
;
School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学)