arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10440 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10440 篇

2503.11557 2025-03-17 cs.CV 78%

VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity

Jing Bi, Junjia Guo, Susan Liang, Guangyu Sun, Luchuan Song, Yunlong Tang, Jinxi He, Jiarui Wu, Ali Vosoughi, Chen Chen, Chenliang Xu

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11342 2025-03-17 cs.CV 78%

Road Rage Reasoning with Vision-language Models (VLMs): Task Definition and Evaluation Dataset

Yibing Weng, Yu Gu, Fuji Ren

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01378 2025-03-04 cs.RO 78%

CognitiveDrone: A VLA Model and Evaluation Benchmark for Real-Time Cognitive Task Solving and Reasoning in UAVs

Artem Lykov, Valerii Serpiva, Muhammad Haris Khan, Oleg Sautenkov, Artyom Myshlyaev, Grik Tadevosyan, Yasheerah Yaqoot, Dzmitry Tsetserukou

专题命中 推理评测 :reasoning(title,abstract)

Comments Paper submitted to the IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06680 2025-02-28 cs.CV 78%

STUPD: A Synthetic Dataset for Spatial and Temporal Relation Reasoning

Palaash Agrawal, Haidi Azaman, Cheston Tan

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11775 2025-02-18 cs.CV 78%

video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model

Guangzhi Sun, Yudong Yang, Jimin Zhuang, Changli Tang, Yixuan Li, Wei Li, Zejun MA, Chao Zhang

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16176 2025-02-18 cs.AI cs.CL cs.LG 78%

GraphEval36K: Benchmarking Coding and Reasoning Capabilities of Large Language Models on Graph Datasets

Qiming Wu, Zichen Chen, Will Corcoran, Misha Sra, Ambuj K. Singh

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

Comments The first two authors contributed equally to this work. This paper has been accepted by NAACL 2025. GraphEval36K is available at https://grapheval36k.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03675 2025-02-18 cs.CV 78%

SMIR: Efficient Synthetic Data Pipeline To Improve Multi-Image Reasoning

Andrew Li, Rahul Thapa, Rahul Chalamala, Qingyang Wu, Kezhen Chen, James Zou

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07062 2025-02-17 cs.CV 78%

TinyEmo: Scaling down Emotional Reasoning via Metric Projection

Cristian Gutierrez

专题命中 推理评测 :reasoning(title,abstract)

Comments I am withdrawing this work in favour of the confidentiality of research ideas that are still under development.

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18482 2025-01-31 cs.SE 78%

A Tool for In-depth Analysis of Code Execution Reasoning of Large Language Models

Changshu Liu, Reyhaneh Jabbarvand

专题命中 推理评测 :reasoning(title,abstract)

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12464 2024-12-18 cs.IR 78%

LLM is Knowledge Graph Reasoner: LLM's Intuition-aware Knowledge Graph Reasoning for Cold-start Sequential Recommendation

Keigo Sakurai, Ren Togo, Takahiro Ogawa, Miki Haseyama

专题命中 推理评测 :reasoning(title,abstract)

Comments Accepted to the 47th European Conference on Information Retrieval (ECIR2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12175 2024-12-18 cs.LG cs.AI cs.CL 78%

Explore Theory of Mind: Program-guided adversarial data generation for theory of mind reasoning

Melanie Sclar, Jane Yu, Maryam Fazel-Zarandi, Yulia Tsvetkov, Yonatan Bisk, Yejin Choi, Asli Celikyilmaz

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11391 2024-12-17 cs.CV 78%

Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models

Rafael Souza, Jia-Hao Lim, Alexander Davis

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10719 2024-12-17 cs.CV cs.MM 78%

Benchmarking VLMs' Reasoning About Persuasive Atypical Images

Sina Malakouti, Aysan Aghazadeh, Ashmit Khandelwal, Adriana Kovashka

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05967 2024-12-10 cs.CL cs.AI cs.LG 78%

Language hooks: a modular framework for augmenting LLM reasoning that decouples tool usage from the model and its prompt

Damien de Mijolla, Wen Yang, Philippa Duckett, Christopher Frye, Mark Worrall

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

Comments This work was conducted during Summer 2023. Experimental results and references reflect the state of the field at that time and may not account for subsequent developments

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10252 2024-11-18 cs.CV 78%

Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning

Jingru Yang, Huan Yu, Yang Jingxin, Chentianye Xu, Yin Biao, Yu Sun, Shengfeng He

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08164 2024-11-14 cs.CV 78%

ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs

Irene Huang, Wei Lin, M. Jehanzeb Mirza, Jacob A. Hansen, Sivan Doveh, Victor Ion Butoi, Roei Herzig, Assaf Arbelle, Hilde Kuehne, Trevor Darrell, Chuang Gan, Aude Oliva, Rogerio Feris, Leonid Karlinsky

专题命中 推理评测 :reasoning(title,abstract)

Comments NeurIPS 2024 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00485 2024-10-31 cs.CV 78%

A Hitchhikers Guide to Fine-Grained Face Forgery Detection Using Common Sense Reasoning

Niki Maria Foteinopoulou, Enjie Ghorbel, Djamila Aouada

专题命中 推理评测 :reasoning(title,abstract)

Comments Accepted at NeurIPS'2024 (D&B)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06798 2024-10-16 cs.RO 78%

Reasoning Grasping via Multimodal Large Language Model

Shiyu Jin, Jinxuan Xu, Yutian Lei, Liangjun Zhang

专题命中 推理评测 :reasoning(title,abstract)

Comments CoRL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12114 2024-10-14 cs.CV 78%

SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models

Youngjoon Yu, Sangyun Chung, Byung-Kwan Lee, Yong Man Ro

专题命中 推理评测 :reasoning(title,abstract)

Comments Codes and data are available at https://github.com/top-yun/SPARK

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15468 2024-10-07 cs.CL cs.AI cs.LG 78%

MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models

Wentian Wang, Sarthak Jain, Paul Kantor, Jacob Feldman, Lazaros Gallos, Hao Wang

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12836 2024-09-20 cs.HC 78%

SituationAdapt: Contextual UI Optimization in Mixed Reality with Situation Awareness via LLM Reasoning

Zhipeng Li, Christoph Gebhardt, Yves Inglin, Nicolas Steck, Paul Streli, Christian Holz

专题命中 推理评测 :reasoning(title,abstract)

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13315 2024-08-20 cs.CV 78%

PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns

Yew Ken Chia, Vernon Toh Yan Han, Deepanway Ghosal, Lidong Bing, Soujanya Poria

专题命中 推理评测 :reasoning(title,abstract)

Comments ACL 2024 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08453 2024-08-19 cs.SE 78%

CRQBench: A Benchmark of Code Reasoning Questions

Elizabeth Dinella, Satish Chandra, Petros Maniatis

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06119 2024-07-30 cs.CV 78%

ContPhy: Continuum Physical Concept Learning and Reasoning from Videos

Zhicheng Zheng, Xin Yan, Zhenfang Chen, Jingzhou Wang, Qin Zhi Eddie Lim, Joshua B. Tenenbaum, Chuang Gan

专题命中 推理评测 :reasoning(title,abstract)

Comments The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03661 2024-07-23 cs.CV 78%

Reason2Drive: Towards Interpretable and Chain-based Reasoning for Autonomous Driving

Ming Nie, Renyuan Peng, Chunwei Wang, Xinyue Cai, Jianhua Han, Hang Xu, Li Zhang

专题命中 推理评测 :reasoning(title,abstract)

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11325 2024-07-17 cs.CV 78%

VISA: Reasoning Video Object Segmentation via Large Language Models

Cilin Yan, Haochen Wang, Shilin Yan, Xiaolong Jiang, Yao Hu, Guoliang Kang, Weidi Xie, Efstratios Gavves

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11997 2024-07-08 cs.CL cs.AI cs.LG 78%

Remember This Event That Year? Assessing Temporal Information and Reasoning in Large Language Models

Himanshu Beniwal, Dishant Patel, Kowsik Nandagopan D, Hritik Ladia, Ankit Yadav, Mayank Singh

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19392 2024-07-03 cs.CV 78%

ReXTime: A Benchmark Suite for Reasoning-Across-Time in Videos

Jr-Jen Chen, Yu-Chien Liao, Hsi-Che Lin, Yu-Chu Yu, Yen-Chun Chen, Yu-Chiang Frank Wang

专题命中 推理评测 :reasoning(title,abstract)

Comments Project page: https://rextime.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15915 2024-06-21 cs.CV 78%

ChartBench: A Benchmark for Complex Visual Reasoning in Charts

Zhengzhuo Xu, Sinan Du, Yiyan Qi, Chengjin Xu, Chun Yuan, Jian Guo

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04215 2024-06-07 cs.CL cs.AI cs.LG 78%

mCSQA: Multilingual Commonsense Reasoning Dataset with Unified Creation Strategy by Language Models and Humans

Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏