arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2510.17685 2025-10-21 cs.CV cs.AI 79%

Multilingual Text-to-Image Person Retrieval via Bidirectional Relation Reasoning and Aligning

Min Cao, Xinyu Zhou, Ding Jiang, Bo Du, Mang Ye, Min Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Key Laboratory of New Generation Artificial Intelligence Technology & Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新 generation 人工智能技术及交叉应用重点实验室(东南大学),教育部,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Final version published in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Xplore link: https://ieeexplore.ieee.org/document/11199360

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16095 2025-10-21 cs.AI 79%

Reliability of Large Language Model Generated Clinical Reasoning in Assisted Reproductive Technology: Blinded Comparative Evaluation Study

Dou Liu, Ying Long, Sophia Zuoqiu, Di Liu, Kang Li, Yiting Lin, Hanyi Liu, Rong Yin, Tian Tang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15974 2025-10-21 cs.AI 79%

Limits of Emergent Reasoning of Large Language Models in Agentic Frameworks for Deterministic Games

Chris Su, Harrison Li, Matheus Marques, George Flint, Kevin Zhu, Sunishchal Dev

机构 * Algoverse AI Research(Algoverse AI研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08750 2025-10-21 cs.CL 79%

HCR-Reasoner: Synergizing Large Language Models and Theory for Human-like Causal Reasoning

Yanxi Zhang, Xin Cong, Zhong Zhang, Xiao Liu, Dongyan Zhao, Yesai Wu

机构 * Center for Data Science, AAIS, Peking University(数据科学中心,AAIS,北京大学) Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14265 2025-10-17 cs.AI 79%

MorphoBench: A Benchmark with Difficulty Adaptive to Model Reasoning

Xukai Wang, Xuanbo Liu, Mingrui Chen, Haitian Zhong, Xuanlin Yang, Bohan Zeng, Jinbo Hu, Hao Liang, Junbo Niu, Xuchen Li, Ruitao Wu, Ruichuan An, Yang Shi, Liu Liu, Xu-Yao Zhang, Qiang Liu, Zhouchen Lin, Wentao Zhang, Bin Dong

机构 * Zhongguancun Academy(中关村学院) Peking University(北京大学) Beihang University(北航) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14014 2025-10-17 cs.CL 79%

CRaFT: An Explanation-Based Framework for Evaluating Cultural Reasoning in Multilingual Language Models

Shehenaz Hossain, Haithem Afli

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17040 2025-10-17 cs.CV cs.AI 79%

From Easy to Hard: The MIR Benchmark for Progressive Interleaved Multi-Image Reasoning

Hang Du, Jiayang Zhang, Guoshun Nan, Wendi Deng, Zhenyan Chen, Chenyang Zhang, Wang Xiao, Shan Huang, Yuqi Pan, Tao Qi, Sicong Leng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16566 2025-10-17 cs.CL 79%

ScholarBench: A Bilingual Benchmark for Abstraction, Comprehension, and Reasoning Evaluation in Academic Contexts

Dongwon Noh, Donghyeok Koh, Junghun Yuk, Gyuwan Kim, Jaeyong Lee, Kyungtae Lim, Cheoneum Park

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12470 2025-10-16 cs.CL 79%

Reasoning on a Spectrum: Aligning LLMs to System 1 and System 2 Thinking

Alireza S. Ziabari, Nona Ghazizadeh, Zhivar Sourati, Farzan Karimi-Malekabadi, Payam Piray, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11985 2025-10-15 cs.AI 79%

CGBench: Benchmarking Language Model Scientific Reasoning for Clinical Genetics Research

Owen Queen, Harrison G. Zhang, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10976 2025-10-14 cs.AI 79%

Video-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph

Wentao Wang, Heqing Zou, Tianze Luo, Rui Huang, Yutian Zhao, Zhuochen Wang, Hansheng Zhang, Chengwei Qin, Yan Wang, Lin Zhao, Huaijian Zhang

机构 * ByteDance(字节跳动) NUS(国立大学新加坡) HKUST(GZ)(香港科技大学(珠海)) THU(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10677 2025-10-14 cs.CL 79%

Unlocking LLM Safeguards for Low-Resource Languages via Reasoning and Alignment with Minimal Training Data

Zhuowei Chen, Bowei Zhang, Nankai Lin, Tian Hou, Lianxi Wang

机构 * Guangdong University of Foreign Studies(广东外语外贸大学) Guangzhou Key Laboratory of Multilingual Intelligent Processing(广州多语智能处理重点实验室) University of Pittsburgh(匹兹堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to MRL Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19073 2025-10-14 cs.CL 79%

MFTCXplain: A Multilingual Benchmark Dataset for Evaluating the Moral Reasoning of LLMs through Multi-hop Hate Speech Explanation

Jackson Trager, Francielle Vargas, Diego Alves, Matteo Guida, Mikel K. Ngueajio, Ameeta Agrawal, Yalda Daryani, Farzan Karimi-Malekabadi, Flor Miriam Plaza-del-Arco

机构 * University of Southern California(南加州大学) São Paulo State University(圣保罗州立大学) Saarland University(萨尔兰大学) University of Melbourne(墨尔本大学) Howard University(霍华德大学) Portland State University(波特兰州立大学) Leiden University(莱顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Jackson Trager and Francielle Vargas contributed equally

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10117 2025-10-14 cs.AI 79%

DixitWorld: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay

Yunxiang Mo, Tianshi Zheng, Qing Zong, Jiayu Liu, Baixuan Xu, Yauwai Yim, Chunkit Chan, Jiaxin Bai, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(计算机科学与工程系,香港科技大学,香港特别行政区,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments EMNLP 2025 Wordplay (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09682 2025-10-14 cs.CR cs.AI cs.SE 79%

Fortifying LLM-Based Code Generation with Graph-Based Reasoning on Secure Coding Practices

Rupam Patir, Keyan Guo, Haipeng Cai, Hongxin Hu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01181 2025-10-14 cs.AI cs.CV cs.MM cs.SD eess.AS 79%

Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning

Zhiyuan Han, Beier Zhu, Yanlong Xu, Peipei Song, Xun Yang

机构 * University of Science and Technology of China(科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments ACM Multimedia 2025 Oral Code: https://github.com/ZhiyuanHan-Aaron/MoSEAR Project Page: https://zhiyuanhan-aaron.github.io/MoSEAR-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06538 2025-10-14 cs.CL 79%

Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model

Xinyue Lou, You Li, Jinan Xu, Xiangyu Shi, Chi Chen, Kaiyu Huang

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能交通联合实验室(北京交通大学)) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09227 2025-10-13 cs.AI cs.FL 79%

RegexPSPACE: A Benchmark for Evaluating LLM Reasoning on PSPACE-complete Regex Problems

Hyundong Jin, Joonghyuk Hahn, Yo-Sub Han

机构 * Department of Computer Science Yonsei University(计算机科学系延世大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00529 2025-10-10 cs.CL cs.CY 79%

Modeling Motivated Reasoning in Law: Evaluating Strategic Role Conditioning in LLM Summarization

Eunjung Cho, Alexander Hoyle, Yoan Hermstrüwer

机构 * ETH Zurich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Max Planck Institute for Research on Collective Goods(集体利益研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted at NLLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06014 2025-10-08 cs.AI 79%

ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models

Zhangyue Yin, Qiushi Sun, Zhiyuan Zeng, Zhiyuan Yu, Qipeng Guo, Xuanjing Huang, Xipeng Qiu

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学) Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05335 2025-10-08 cs.AI 79%

Biomedical reasoning in action: Multi-agent System for Auditable Biomedical Evidence Synthesis

Oskar Wysocki, Magdalena Wysocka, Mauricio Jacobo, Harriet Unsworth, André Freitas

机构 * Idiap Research Institute(IDiap研究 institute) National Biomarker Centre (NBC) CRUK Manchester Institute(国家生物标记中心(NBC)CRUK曼彻斯特研究所) Department of Computer Science University of Manchester, UK(计算机科学系曼彻斯特大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03913 2025-10-07 cs.CL 79%

PsycholexTherapy: Simulating Reasoning in Psychotherapy with Small Language Models in Persian

Mohammad Amin Abbasi, Hassan Naderi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16929 2025-10-07 cs.CL 79%

K-DeCore: Facilitating Knowledge Transfer in Continual Structured Knowledge Reasoning via Knowledge Decoupling

Yongrui Chen, Yi Huang, Yunchang Liu, Shenyu Zhang, Junhao He, Tongtong Wu, Guilin Qi, Tianxing Wu

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及 interdisciplinary 应用关键实验室(东南大学)) China Mobile Research Institute(中国移动研究院) Department of Data Science & AI, Monash University, Australia(莫纳什大学数据科学与人工智能系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted in Neurips 2025 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02906 2025-10-06 q-fin.CP cs.AI 79%

FinReflectKG -- MultiHop: Financial QA Benchmark for Reasoning with Knowledge Graph Evidence

Abhinav Arun, Reetu Raj Harsh, Bhaskarjit Sarmah, Stefano Pasquali

机构 * Domyn

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01681 2025-10-03 cs.CV cs.AI 79%

Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning

Xuchen Li, Xuzhao Li, Jiahui Gao, Renjie Pi, Shiyu Hu, Wentao Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) ZGCA(北京智感科技有限公司) HKU(香港大学) HKUST(香港科技大学) NTU(国立台湾大学) PKU(北京大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01582 2025-10-03 cs.CV cs.LG 79%

ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models

Krishna Teja Chitty-Venkata, Murali Emani

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24260 2025-10-03 cs.AI 79%

Rethinking and Benchmarking Large Language Models for Graph Reasoning

Yuwei Hu, Xinyi Huang, Zhewei Wei, Yongchao Liu, Chuntao Hong

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00881 2025-10-02 cs.SE cs.AI 79%

Advancing Automated Ethical Profiling in SE: a Zero-Shot Evaluation of LLM Reasoning

Patrizio Migliarini, Mashal Afzal Memon, Marco Autili, Paola Inverardi

机构 * University of L'Aquila(拉奎拉大学) Gran Sasso Science Institute(格兰萨索科学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00880 2025-10-02 cs.CL 79%

HalluGuard: Evidence-Grounded Small Reasoning Models to Mitigate Hallucinations in Retrieval-Augmented Generation

Loris Bergeron, Ioana Buhnila, Jérôme François, Radu State

机构 * Banque de Luxembourg(卢森堡银行) Center for Data Science in Humanities, Chosun University(人文数据科学中心,全州大学) ATILF, University of Lorraine–CNRS(ATILF,洛林大学–CNRS) SnT, University of Luxembourg(SnT,卢森堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00317 2025-10-02 cs.CR cs.AI cs.SE 79%

MAVUL: Multi-Agent Vulnerability Detection via Contextual Reasoning and Interactive Refinement

Youpeng Li, Kartik Joshi, Xinda Wang, Eric Wong

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted by The 7th IEEE International Conference on Trust, Privacy and Security in Intelligent Systems, and Applications (IEEE TPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏