arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10440 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10440 篇

2505.07263 2025-06-10 cs.CV 78%

Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning

Xiaokun Wang, Peiyu Wang, Jiangbo Pei, Wei Shen, Yi Peng, Yunzhuo Hao, Weijie Qiu, Ai Jian, Tianyidan Xie, Xuchen Song, Yang Liu, Yahui Zhou

机构 * Skywork AI(Skywork人工智能公司) Kunlun Inc.(昆仑公司)

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16656 2025-06-09 cs.CV 78%

Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning

Peiyu Wang, Yichen Wei, Yi Peng, Xiaokun Wang, Weijie Qiu, Wei Shen, Tianyidan Xie, Jiangbo Pei, Jianhao Zhang, Yunzhuo Hao, Xuchen Song, Yang Liu, Yahui Zhou

机构 * Skywork AI Kunlun Inc.(Kunlun公司)

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04363 2025-06-06 cs.CV 78%

WorldPrediction: A Benchmark for High-level World Modeling and Long-horizon Procedural Planning

Delong Chen, Willy Chung, Yejin Bang, Ziwei Ji, Pascale Fung

机构 * Meta FAIR Paris(Meta FAIR巴黎) The Hong Kong University of Science and Technology(香港科技大学) ISIR Sorbonne Université(索邦大学ISIR)

专题命中 推理评测 :planning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03921 2025-06-05 cs.SE 78%

Boosting Open-Source LLMs for Program Repair via Reasoning Transfer and LLM-Guided Reinforcement Learning

Xunzhu Tang, Jacques Klein, Tegawendé F. Bissyandé

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01953 2025-06-03 cs.RO 78%

Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning

Hao Chen, Jiaming Liu, Chenyang Gu, Zhuoyang Liu, Renrui Zhang, Xiaoqi Li, Xiao He, Yandong Guo, Chi-Wing Fu, Shanghang Zhang, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室) AI 2 Robotics(人工智能与机器人) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01795 2025-06-03 cs.CV 78%

R2SM: Referring and Reasoning for Selective Masks

Yu-Lin Shih, Wei-En Tai, Cheng Sun, Yu-Chiang Frank Wang, Hwann-Tzong Chen

机构 * National Tsing Hua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23727 2025-05-30 cs.CV cs.MM 78%

PixelThink: Towards Efficient Chain-of-Pixel Reasoning

Song Wang, Gongfan Fang, Lingdong Kong, Xiangtai Li, Jianyun Xu, Sheng Yang, Qiang Li, Jianke Zhu, Xinchao Wang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) AD Lab, CaiNiao Inc., Alibaba Group(阿里集团 Cainiao 事业部实验室)

专题命中 推理评测 :reasoning(title,abstract)

Comments Project Page: https://PixelThink.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23143 2025-05-30 cs.CV 78%

Interpreting Chest X-rays Like a Radiologist: A Benchmark with Clinical Reasoning

Jinquan Guan, Qi Chen, Lizhou Liang, Yuhang Liu, Vu Minh Hieu Phan, Minh-Son To, Jian Chen, Yutong Xie

专题命中 推理评测 :reasoning(title,abstract)

Comments 10 pages (main text), 18 pages (appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19696 2025-05-27 cs.CV cs.MM eess.IV 78%

Modeling Beyond MOS: Quality Assessment Models Must Integrate Context, Reasoning, and Multimodality

Mohamed Amine Kerkouri, Marouane Tliba, Aladine Chetouani, Nour Aburaed, Alessandro Bruno

机构 * R&D Lab F-Initiatives(F-Initiatives研发实验室) Université d’Orleans(奥尔良大学) Université Sorbonne Paris Nord(巴黎-索邦大学) University of Dubai(迪拜大学) IULM University(IULM大学)

专题命中 推理评测 :reasoning(title,abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18816 2025-05-27 cs.CV 78%

Reasoning Segmentation for Images and Videos: A Survey

Yiqing Shen, Chenjia Li, Fei Xiong, Jeong-O Jeong, Tianpeng Wang, Michael Latman, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04281 2025-05-27 cs.RO 78%

WOMD-Reasoning: A Large-Scale Dataset for Interaction Reasoning in Driving

Yiheng Li, Cunxin Fan, Chongjian Ge, Zhihao Zhao, Chenran Li, Chenfeng Xu, Huaxiu Yao, Masayoshi Tomizuka, Bolei Zhou, Chen Tang, Mingyu Ding, Wei Zhan

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17021 2025-05-23 cs.CV 78%

ARB: A Comprehensive Arabic Multimodal Reasoning Benchmark

Sara Ghaboura, Ketan More, Wafa Alghallabi, Omkar Thawakar, Jorma Laaksonen, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

专题命中 推理评测 :reasoning(title,abstract)

Comments Github : https://github.com/mbzuai-oryx/ARB, Huggingface: https://huggingface.co/datasets/MBZUAI/ARB

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14197 2025-05-21 cs.CV 78%

Towards Omnidirectional Reasoning with 360-R1: A Dataset, Benchmark, and GRPO-based Method

Xinshen Zhang, Zhen Ye, Xu Zheng

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州))

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13419 2025-05-20 cs.CV 78%

FEALLM: Advancing Facial Emotion Analysis in Multimodal Large Language Models with Emotional Synergy and Reasoning

Zhuozhao Hu, Kaishen Yuan, Xin Liu, Zitong Yu, Yuan Zong, Jingang Shi, Huanjing Yue, Jingyu Yang

机构 * Tianjin University(天津大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Lappeenranta-Lahti University of Technology LUT(拉佩兰塔-拉赫蒂技术大学) Great Bay University(大湾大学) Southeast University(东南大学) Xi’an Jiaotong University(西安交通大学)

专题命中 推理评测 :reasoning(title,abstract)

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10672 2025-05-19 eess.IV cs.CV 78%

MOSAIC: A Multi-View 2.5D Organ Slice Selector with Cross-Attentional Reasoning for Anatomically-Aware CT Localization in Medical Organ Segmentation

Hania Ghouse, Muzammil Behzad

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油和矿产大学)

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02018 2025-05-06 cs.CV 78%

R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation

Meng-Hao Guo, Jiajun Xu, Yi Zhang, Jiaxi Song, Haoyang Peng, Yi-Xuan Deng, Xinzhi Dong, Kiyohiro Nakayama, Zhengyang Geng, Chen Wang, Bolin Ni, Guo-Wei Yang, Yongming Rao, Houwen Peng, Han Hu, Gordon Wetzstein, Shi-min Hu

专题命中 推理评测 :reasoning(title,abstract)

Comments 18pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01490 2025-05-06 cs.CV 78%

WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation

Daoan Zhang, Che Jiang, Ruoshi Xu, Biaoxiang Chen, Zijian Jin, Yutian Lu, Jianguo Zhang, Liang Yong, Jiebo Luo, Shengda Luo

机构 * University of Rochester(罗切斯特大学) Chinese Medicine Guangdong Laboratory(广东中医实验室) Southern University of Science and Technology(南方科技大学) New York University(纽约大学) Datawhale org(Datawhale组织)

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00853 2025-05-05 cs.CY 78%

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models

Junfeng Jiao, Saleh Afroogh, Abhejay Murali, Kevin Chen, David Atkinson, Amit Dhurandhar

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12185 2025-04-29 cs.CV 78%

ChartX & ChartVLM: A Versatile Benchmark and Foundation Model for Complicated Chart Reasoning

Renqiu Xia, Bo Zhang, Hancheng Ye, Xiangchao Yan, Qi Liu, Hongbin Zhou, Zijun Chen, Peng Ye, Min Dou, Botian Shi, Junchi Yan, Yu Qiao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract)

Comments Code and dataset are available for downloading at: https://github.com/Alpha-Innovator/ChartVLM 26 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07229 2025-04-24 cs.MM 78%

MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks

Xiaocui Yang, Wenfang Wu, Shi Feng, Ming Wang, Daling Wang, Yang Li, Qi Sun, Yifei Zhang, Xiaoming Fu, Soujanya Poria

专题命中 推理评测 :reasoning(title,abstract)

Comments Accepted by the Information Fusion Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15279 2025-04-22 cs.CV 78%

VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models

Weiye Xu, Jiahao Wang, Weiyun Wang, Zhe Chen, Wengang Zhou, Aijun Yang, Lewei Lu, Houqiang Li, Xiaohua Wang, Xizhou Zhu, Wenhai Wang, Jifeng Dai, Jinguo Zhu

机构 * University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract)

Comments Code, data, and baselines are available at https://visulogic-benchmark.github.io/VisuLogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07962 2025-04-11 cs.CV 78%

GLUS: Global-Local Reasoning Unified into A Single Large Language Model for Video Segmentation

Lang Lin, Xueyang Yu, Ziqi Pang, Yu-Xiong Wang

专题命中 推理评测 :reasoning(title,abstract)

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01999 2025-04-10 cs.SE 78%

CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMs

Dung Nguyen Manh, Thang Phan Chau, Nam Le Hai, Thong T. Doan, Nam V. Nguyen, Quang Pham, Nghi D. Q. Bui

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05644 2025-04-09 cs.CV 78%

iEBAKER: Improved Remote Sensing Image-Text Retrieval Framework via Eliminate Before Align and Keyword Explicit Reasoning

Yan Zhang, Zhong Ji, Changxu Meng, Yanwei Pang, Jungong Han

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01886 2025-04-03 cs.CV 78%

GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning

Yanzhou Su, Tianbin Li, Jiyao Liu, Chenglong Ma, Junzhi Ning, Cheng Tang, Sibo Ju, Jin Ye, Pengcheng Chen, Ming Hu, Shixiang Tang, Lihao Liu, Bin Fu, Wenqi Shao, Xiaowei Hu, Xiangwen Liao, Yuanfeng Ji, Junjun He

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21054 2025-03-28 eess.IV cs.CV 78%

Operating Room Workflow Analysis via Reasoning Segmentation over Digital Twins

Yiqing Shen, Chenjia Li, Bohan Liu, Cheng-Yi Li, Tito Porras, Mathias Unberath

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16260 2025-03-21 cs.CV 78%

Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data

Zijian Li, Jingjing Fu, Lei Song, Jiang Bian, Jun Zhang, Rui Wang

专题命中 推理评测 :reasoning(title,abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13881 2025-03-19 cs.CV 78%

MMR: A Large-scale Benchmark Dataset for Multi-target and Multi-granularity Reasoning Segmentation

Donggon Jang, Yucheol Cho, Suin Lee, Taehyeon Kim, Dae-Shik Kim

专题命中 推理评测 :reasoning(title,abstract)

Comments ICLR 2025, Code and dataset are available at \url{https://github.com/jdg900/MMR}

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10615 2025-03-19 cs.CV 78%

R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization

Yi Yang, Xiaoxuan He, Hongkun Pan, Xiyan Jiang, Yan Deng, Xingtao Yang, Haoyu Lu, Dacheng Yin, Fengyun Rao, Minfeng Zhu, Bo Zhang, Wei Chen

专题命中 推理评测 :reasoning(title,abstract)

Comments Code and Model: https://github.com/Fancy-MLLM/R1-onevision

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14500 2025-03-18 cs.CV 78%

ViLLa: Video Reasoning Segmentation with Large Language Model

Rongkun Zheng, Lu Qi, Xi Chen, Yi Wang, Kun Wang, Yu Qiao, Hengshuang Zhao

专题命中 推理评测 :reasoning(title,abstract)

Comments 15 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏