arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2510.13624 2025-10-16 cs.CL cs.AI cs.LG 67%

Unlocking Public Catalogues: Instruction-Tuning LLMs for ICD Coding of German Tumor Diagnoses

Stefan Lenz, Lakisha Ortiz Rosario, Georg Vollmar, Arsenij Ustjanzew, Fatma Alickovic, Thomas Kindler, Torsten Panholzer

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10845 2025-10-15 cs.CV 67%

CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving

Hidehisa Arai, Keita Miwa, Kento Sasaki, Yu Yamaguchi, Kohei Watanabe, Shunsuke Aoki, Issei Yamamoto

机构 * Turing Inc.(图灵公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

Comments WACV 2025, Project Page: https://turingmotors.github.io/covla-ad/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00975 2025-10-14 cs.AI cs.CL cs.LG 67%

Self-Exploring Language Models for Explainable Link Forecasting on Temporal Graphs via Reinforcement Learning

Zifeng Ding, Shenyang Huang, Zeyu Cao, Emma Kondrup, Zachary Yang, Xingyue Huang, Yuan Sui, Zhangdie Yuan, Yuqicheng Zhu, Xianglong Hu, Yuan He, Farimah Poursafaei, Michael Bronstein, Andreas Vlachos

机构 * University of Cambridge(剑桥大学) Mila - Quebec AI Institute(魁北克人工智能研究院) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) University of Stuttgart(斯图加特大学) Amazon(亚马逊公司) AITHYRA

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10390 2025-10-14 cs.CL cs.AI cs.LG 67%

RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models

Aashiq Muhamed, Leonardo F. R. Ribeiro, Markus Dreyer, Virginia Smith, Mona T. Diab

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08601 2025-10-13 cs.CL cs.AI cs.LG cs.MA 67%

Mnemosyne: An Unsupervised, Human-Inspired Long-Term Memory Architecture for Edge-Based LLMs

Aneesh Jonelagadda, Christina Hahn, Haoze Zheng, Salvatore Penachio

机构 * Kaliber AI, Research Division(Kaliber AI 研究部门)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07284 2025-10-13 cs.CL cs.AI cs.LG 67%

Online Rubrics Elicitation from Pairwise Comparisons

MohammadHossein Rezaei, Robert Vacareanu, Zihao Wang, Clinton Wang, Bing Liu, Yunzhong He, Afra Feyza Akyürek

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08569 2025-10-10 cs.CL cs.AI cs.LG 67%

ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation

Qin Liu, Jacob Dineen, Yuxi Huang, Sheng Zhang, Hoifung Poon, Ben Zhou, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) Arizona State University(亚利桑那州立大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08022 2025-10-10 cs.LG cs.AI cs.CL cs.CV 67%

Modality-Balancing Preference Optimization of Large Multimodal Models by Adversarial Negative Mining

Chenxi Liu, Tianyi Xiong, Yanshuo Chen, Ruibo Chen, Yihan Wu, Junfeng Guo, Tianyi Zhou, Heng Huang

机构 * University of Maryland, College Park(马里兰大学学院 park)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00269 2025-10-10 cs.LG cs.AI cs.CL cs.CY 67%

Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy

Jahan C. Penny-Dimri, Magdalena Bachmann, William R. Cooke, Sam Mathewlynn, Samuel Dockree, John Tolladay, Jannik Kossen, Lin Li, Yarin Gal, Gabriel Davis Jones

机构 * Oxford Digital Health Labs, Nuffield Department of Women’s and Reproductive Health(牛津数字健康实验室,女性与生殖健康系) University of Oxford(牛津大学) Oxford University Hospitals NHS Foundation Trust(牛津大学医院 NHS 基础信托) OATML, Department of Computer Science(OATML,计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18525 2025-10-07 cs.CL cs.AI cs.LG 67%

ClinicRealm: Re-evaluating Large Language Models with Conventional Machine Learning for Non-Generative Clinical Prediction Tasks

Yinghao Zhu, Junyi Gao, Zixiang Wang, Weibin Liao, Xiaochen Zheng, Lifang Liang, Miguel O. Bernabeu, Yasha Wang, Lequan Yu, Chengwei Pan, Ewen M. Harrison, Liantao Ma

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code: https://github.com/yhzhu99/ehr-llm-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03688 2025-10-07 cs.AI cs.CL cs.LG 67%

AgentBench: Evaluating LLMs as Agents

Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, Shudan Zhang, Xiang Deng, Aohan Zeng, Zhengxiao Du, Chenhui Zhang, Sheng Shen, Tianjun Zhang, Yu Su, Huan Sun, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Tsinghua University(清华大学) The Ohio State University(俄亥俄州立大学) UC Berkeley(加州大学伯克利分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03399 2025-10-07 cs.AI cs.CL cs.CY cs.LG 67%

Know Thyself? On the Incapability and Implications of AI Self-Recognition

Xiaoyan Bai, Aryan Shrivastava, Ari Holtzman, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Our code is available, see https://github.com/ChicagoHAI/self-recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07048 2025-10-07 cs.CV 67%

Comprehensive Evaluation of Large Multimodal Models for Nutrition Analysis: A New Benchmark Enriched with Contextual Metadata

Bruce Coburn, Jiangpeng He, Megan E. Rollo, Satvinder S. Dhaliwal, Deborah A. Kerr, Fengqing Zhu

机构 * Purdue University(普渡大学) Indiana University(印第安纳大学) Curtin University(Curtin大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

Comments The extended full version of the accepted paper in 2025 IEEE BHI conference with title: Evaluating Large Multimodal Models for Nutrition Analysis: A New Benchmark Enriched with Contextual Metadata. Dataset is available at: https://skynet.ecn.purdue.edu/~coburn6/ACETADA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00069 2025-10-02 cs.CV 67%

OIG-Bench: A Multi-Agent Annotated Benchmark for Multimodal One-Image Guides Understanding

Jiancong Xie, Wenjin Wang, Zhuomeng Zhang, Zihan Liu, Qi Liu, Ke Feng, Zixun Sun, Yuedong Yang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Interactive Entertainment Group, Tencent Inc, China(腾讯互动娱乐集团) Key Laboratory of Machine Intelligence and Advanced Computing (MOE), China(机器智能与先进计算重点实验室)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14688 2025-10-01 cs.CL cs.AI cs.LG 67%

Mind the Gap: A Review of Arabic Post-Training Datasets and Their Limitations

Mohammed Alkhowaiter, Norah Alshahrani, Saied Alshahrani, Reem I. Masoud, Alaa Alzahrani, Deema Alnuhait, Emad A. Alghamdi, Khalid Almubarak

机构 * Refine AI ASAS AI University of Bisha(比沙大学) University College London(伦敦大学学院) King Salman Global Academy for Arabic(萨勒曼全球阿拉伯学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) King Abdulaziz University(阿卜杜勒阿齐兹大学) HUMAIN

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24163 2025-09-30 cs.RO 67%

Preference-Based Long-Horizon Robotic Stacking with Multimodal Large Language Models

Wanming Yu, Adrian Röfer, Abhinav Valada, Sethu Vijayakumar

机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) University of Freiburg(弗赖堡大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15635 2025-09-30 cs.CV cs.RO 67%

FindingDory: A Benchmark to Evaluate Memory in Embodied Agents

Karmesh Yadav, Yusuf Ali, Gunshi Gupta, Yarin Gal, Zsolt Kira

机构 * Georgia Tech(佐治亚理工学院) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

Comments Our dataset and code can be found at: https://findingdory-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22853 2025-09-30 q-bio.QM cs.AI cs.CL cs.LG 67%

Patient-specific Biomolecular Instruction Tuning

Irsyad Adam, Zekai Chen, David Laub, Shaun Porwal, Arda Pekis, Kevin Brown

机构 * Standard Model Biomedicine(标准模型生物医学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04974 2025-09-25 cs.CV cs.AI cs.CL cs.LG 67%

Towards Visual Text Grounding of Multimodal Large Language Model

Ming Li, Ruiyi Zhang, Jian Chen, Chenguang Wang, Jiuxiang Gu, Yufan Zhou, Franck Dernoncourt, Wanrong Zhu, Tianyi Zhou, Tong Sun

机构 * Adobe Research(Adobe研究院) University of Maryland(马里兰大学) University at Buffalo(布法罗大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15273 2025-09-24 cs.RO 67%

Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI

Fei Ni, Min Zhang, Pengyi Li, Yifu Yuan, Lingfeng Zhang, Yuecheng Liu, Peilong Han, Longxin Kou, Shaojin Ma, Jinbin Qiao, David Gamaliel Arcos Bravo, Yuening Wang, Xiao Hu, Zhanguang Zhang, Xianze Yao, Yutong Li, Zhao Zhang, Ying Wen, Ying-Cong Chen, Xiaodan Liang, Liang Lin, Bin He, Haitham Bou-Ammar, He Wang, Huazhe Xu, Jiankang Deng, Shan Luo, Shuqiang Jiang, Wei Pan, Yang Gao, Stefanos Zafeiriou, Jan Peters, Yuzheng Zhuang, Yingxue Zhang, Yan Zheng, Hongyao Tang, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) PengCheng Laboratory(鹏城实验室) Tongji University(同济大学) University College London(伦敦大学学院) Peking University(北京大学) Tsinghua University(清华大学) Imperial College London(伦敦帝国学院) King’s College London(伦敦国王学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Manchester(曼彻斯特大学) Nanjing University(南京大学) TU Darmstadt(图宾根大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

Comments 32 pages, 5 figures, Embodied Arena Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23765 2025-09-23 cs.CL cs.AI cs.LG 67%

From Chat Logs to Collective Insights: Aggregative Question Answering

Wentao Zhang, Woojeong Kim, Yuntian Deng

机构 * University of Waterloo(滑铁卢大学) Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13388 2025-09-23 cs.CL cs.AI cs.LG 67%

R3: Robust Rubric-Agnostic Reward Models

David Anugraha, Zilu Tang, Lester James V. Miranda, Hanyang Zhao, Mohammad Rifqi Farhansyah, Garry Kuwanto, Derry Wijaya, Genta Indra Winata

机构 * Stanford University(斯坦福大学) Boston University(波士顿大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学) Institut Teknologi Bandung(Bandung 工程技术大学) Monash University Indonesia(墨尔本大学印尼分校) Capital One

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14199 2025-09-19 cs.CV cs.AI cs.CL cs.LG 67%

Dense Video Understanding with Gated Residual Tokenization

Haichao Zhang, Wenhao Chai, Shwai He, Ang Li, Yun Fu

机构 * Northeastern University(东北大学) Princeton University(普林斯顿大学) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13456 2025-09-19 cs.CL cs.AI cs.LG 67%

Unlocking Legal Knowledge: A Multilingual Dataset for Judicial Summarization in Switzerland

Luca Rolshoven, Vishvaksenan Rasiah, Srinanda Brügger Bose, Sarah Hostettler, Lara Burkhalter, Matthias Stürmer, Joel Niklaus

机构 * University of Bern(伯尔尼大学) Bern University of Applied Sciences(伯尔尼应用科学大学) Stanford University(斯坦福大学) University of Fribourg(弗里堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12866 2025-09-17 cs.CV 67%

Leveraging Large Language Models to Effectively Generate Visual Data for Canine Musculoskeletal Diagnoses

Martin Thißen, Thi Ngoc Diep Tran, Barbara Esteve Ratsch, Ben Joel Schönbein, Ute Trapp, Beate Egner, Romana Piat, Elke Hergenröther

机构 * Darmstadt University of Applied Sciences(达姆施塔特应用技术大学) Veterinary Academy of Higher Learning(兽医高等学习学院) European University of Technology(欧洲技术大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

Journal ref Computer Science Research Notes 3501(1) (2025) 27-38

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11589 2025-09-16 cs.CV 67%

MVQA-68K: A Multi-dimensional and Causally-annotated Dataset with Quality Interpretability for Video Assessment

Yanyun Pu, Kehan Li, Zeyi Huang, Zhijie Zhong, Kaixiang Yang

机构 * Huawei Technologies Co.(华为技术有限公司) South China University of Technology(南方科技大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12363 2025-09-10 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Towards Visuospatial Cognition via Hierarchical Fusion of Visual Experts

Qi Feng

机构 * Kyoto University(京都大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 26 pages, 19 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02359 2025-09-03 cs.CV 67%

Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture

Wanyue Zhang, Yibin Huang, Yangbin Xu, JingJing Huang, Helu Zhi, Shuo Ren, Wang Xu, Jiajun Zhang

专题命中 推理评测 :reasoning(abstract);planning(abstract)

Comments The benchmark MulSeT is available at https://huggingface.co/datasets/WanyueZhang/MulSeT

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20019 2025-08-28 cs.LG cs.AI cs.CL cs.MA 67%

Symphony: A Decentralized Multi-Agent Framework for Scalable Collective Intelligence

Ji Wang, Kashing Chen, Xinyuan Song, Ke Zhang, Lynn Ai, Eric Yang, Bill Shi

机构 * Gradient The Chinese University of Hong Kong(香港中文大学) Department of Computer Science and Computer Engineering, Waseda University(计算机科学与工程系,早稻田大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17334 2025-08-27 cs.CV cs.AI cs.CL cs.LG 67%

Mind the (Language) Gap: Towards Probing Numerical and Cross-Lingual Limits of LVLMs

Somraj Gautam, Abhirama Subramanyam Penamakuri, Abhishek Bhandari, Gaurav Harit

机构 * Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏