Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges
大型语言模型中的数学推理:基准测试、架构、评估与开放挑战
Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad, Mehwish Fatima
机构
*
organization= School of Electrical Engineering
;
Computer Science, National University of Science
;
organization= School of Computing, Data
;
Mathematical Sciences, Western Sydney University, Indonesia
;
organization= Department of Communication, Quality Management
;
Information Systems, Mid Sweden University, Östersund Campus, Sweden
机构
*
State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室)
;
Institute of Brain-inspired Intelligence(脑启发式智能研究院)
;
Shenzhen Research Institute of Nanjing University(南京大学深圳研究院)
EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving
EgoDyn-Bench:评估面向自动驾驶的视觉中心基础模型中的自我运动理解
Finn Rasmus Schäfer, Yuan Gao, Dingrui Wang, Thomas Stauner, Stephan Günnemann, Mattia Piccinini, Sebastian Schmidt, Johannes Betz
机构
*
Professorship of Autonomous Vehicle Systems, Technical University of Munich, Munich, Germany(自动驾驶车辆系统教授职位,慕尼黑技术大学,德国慕尼黑)
;
Bayerische Motoren Werke AG, Munich, Germany(巴伐利亚发动机有限公司,德国慕尼黑)
;
Data Analytics and Machine Learning Group, Technical University of Munich, Munich, Germany(数据分析与机器学习小组,慕尼黑技术大学,德国慕尼黑)
ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models
ZeroBench:当代大型多模态模型的一个不可能的视觉基准测试
Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Florian Langer, Vyas Raina, Vatsal Raina, Hanyi Xiong, Vishaal Udandarao, Jingyi Lu, Shiyang Chen, Sam Purkis, Tianshuo Yan, Wenye Lin, Gyungin Shin, Qiaochu Yang, Anh Totti Nguyen, David I. Atkinson, Aaditya Baranwal, Alexandru Coca, Mikah Dang, Sebastian Dziadzio, Jakob D. Kunz, Kaiqu Liang, Alexander Lo, Brian Pulfer, Steven Walton, Charig Yang, Kai Han, Samuel Albanie
机构
*
University of Cambridge(剑桥大学)
;
University of Alberta(阿尔伯塔大学)
;
The University of Hong Kong(香港大学)
;
University of Oxford(牛津大学)
;
Northeastern University(东北大学)
;
Astadeus
;
College of Southern Maryland(马里兰州南部学院)
;
University of Geneva(日内瓦大学)
;
University of Oregon(俄勒冈大学)
VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs
VKnowU:评估多模态语言模型中的视觉知识理解
Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Nanjing University(南京大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
City University of Hong Kong(香港城市大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
RASR: Retrieval-Augmented Semantic Reasoning for Fake News Video Detection
RASR:基于检索的语义推理用于虚假新闻视频检测
Hui Li, Peien Ding, Jun Li, Guoqi Ma, Zhanyu Liu, Ge Xu, Junfeng Yao, Jinsong Su
机构
*
School of Informatics, Xiamen University(厦门大学信息学院)
;
School of Computer Science and Information Security, Guilin University of Electronic Technology(桂林电子科技大学计算机科学与信息安全学院)
;
School of Computer and Big Data, Minjiang University(闽江学院计算机与大数据学院)
;
Xiamen University(厦门大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
机构
*
Zhejiang University(浙江大学)
;
University of Science and Technology of China(中国科学技术大学)
;
East China Normal University(华东师范大学)
;
Zhejiang Provincial People’s Hospital(浙江省人民医院)
;
National University of Singapore(新加坡国立大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
Rheos: Modelling Continuous Motion Dynamics in Hierarchical 3D Scene Graphs
Rheos: 分层3D场景图中的连续运动动态建模
Iacopo Catalano, Francesco Verdoja, Javier Civera, Jorge Peña-Queralta, Julio A. Placed
机构
*
University of Turku(图尔库大学)
;
Centre for Artificial Intelligence, Zürich University of Applied Sciences(应用科学大学人工智能中心)
;
Instituto Tecnológico de Aragón (ITA) and the University of Zaragoza(阿拉贡理工大学和萨拉戈萨大学)
;
University of Zaragoza(萨拉戈萨大学)
;
School of Electrical Engineering, Aalto University(艾尔沃斯大学电气工程学院)
Disentangling Perception and Reasoning in Multimodal LLMs via Reward Design
通过奖励设计解耦多模态大语言模型中的感知与推理
Omar Sharif, Eftekhar Hossain, Nikhil Singh, Patrick Ng
机构
*
Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系)
;
Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系)
;
Independent Researcher(独立研究者)
GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs
GroupToM-Bench: 多模态大语言模型中群体心智理论和非线性社会涌现的基准测试
Weidong Tang, Jierui Li, Yueling Hou, Zihan Mei, Can Zhang, Xinyan Wan, Zhiyuan Liang, Pengfei Zhou, Yang You, Wangbo Zhao
机构
*
Xidian University(西安电子科技大学)
;
National University of Singapore(新加坡国立大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
University of Science and Technology of China(中国科学技术大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning
RoboGPT-R1: 通过强化学习增强机器人任务规划
Jinrui Liu, Bingyan Nie, Boyu Li, Yaran Chen, Yuze Wang, Shunsen He, Haoran Li
机构
*
Institute of Automation, CASIA(中国科学院自动化研究所)
;
School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)
;
Huawei Cloud Technology Co., Ltd(华为云技术有限公司)
专题命中
视觉推理
:vision language model(abstract);分类 cs.AI