arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2305.03598 2023-10-31 cs.CL cs.AI cs.LG 67%

NLI4CT: Multi-Evidence Natural Language Inference for Clinical Trial Reports

Maël Jullien, Marco Valentino, Hannah Frost, Paul O'Regan, Donal Landers, André Freitas

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2023 Camera-ready, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13014 2023-10-23 cs.CY cs.AI cs.CL cs.LG 67%

Large Language Model Prediction Capabilities: Evidence from a Real-World Forecasting Tournament

Philipp Schoenegger, Peter S. Park

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 pages, six visualizations (four figures, two tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15343 2023-10-17 cs.CL cs.AI cs.LG stat.ML 67%

Med-HALT: Medical Domain Hallucination Test for Large Language Models

Ankit Pal, Logesh Kumar Umapathi, Malaikannan Sankarasubbu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2023(The SIGNLL Conference on Computational Natural Language Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05107 2023-10-10 cs.CV 67%

OV-PARTS: Towards Open-Vocabulary Part Segmentation

Meng Wei, Xiaoyu Yue, Wenwei Zhang, Shu Kong, Xihui Liu, Jiangmiao Pang

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract)

Comments Accepted by NeurIPS Dataset and Benchmark Track 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09110 2023-10-03 cs.CL cs.AI cs.LG 67%

Holistic Evaluation of Language Models

Percy Liang, Rishi Bommasani, Tony Lee, Dimitris Tsipras, Dilara Soylu, Michihiro Yasunaga, Yian Zhang, Deepak Narayanan, Yuhuai Wu, Ananya Kumar, Benjamin Newman, Binhang Yuan, Bobby Yan, Ce Zhang, Christian Cosgrove, Christopher D. Manning, Christopher Ré, Diana Acosta-Navas, Drew A. Hudson, Eric Zelikman, Esin Durmus, Faisal Ladhak, Frieda Rong, Hongyu Ren, Huaxiu Yao, Jue Wang, Keshav Santhanam, Laurel Orr, Lucia Zheng, Mert Yuksekgonul, Mirac Suzgun, Nathan Kim, Neel Guha, Niladri Chatterji, Omar Khattab, Peter Henderson, Qian Huang, Ryan Chi, Sang Michael Xie, Shibani Santurkar, Surya Ganguli, Tatsunori Hashimoto, Thomas Icard, Tianyi Zhang, Vishrav Chaudhary, William Wang, Xuechen Li, Yifan Mai, Yuhui Zhang, Yuta Koreeda

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Authored by the Center for Research on Foundation Models (CRFM) at the Stanford Institute for Human-Centered Artificial Intelligence (HAI). Project page: https://crfm.stanford.edu/helm/v1.0

Journal ref Published in Transactions on Machine Learning Research (TMLR), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16149 2023-10-02 cs.CL cs.AI cs.LG 67%

Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models

Neha Sengupta, Sunil Kumar Sahu, Bokang Jia, Satheesh Katipomu, Haonan Li, Fajri Koto, William Marshall, Gurpreet Gosal, Cynthia Liu, Zhiming Chen, Osama Mohammed Afzal, Samta Kamboj, Onkar Pandit, Rahul Pal, Lalit Pradhan, Zain Muhammad Mujahid, Massa Baali, Xudong Han, Sondos Mahmoud Bsharat, Alham Fikri Aji, Zhiqiang Shen, Zhengzhong Liu, Natalia Vassilieva, Joel Hestness, Andy Hock, Andrew Feldman, Jonathan Lee, Andrew Jackson, Hector Xuguang Ren, Preslav Nakov, Timothy Baldwin, Eric Xing

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Arabic-centric, foundation model, large-language model, LLM, generative model, instruction-tuned, Jais, Jais-chat

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16289 2023-09-29 cs.CL cs.AI cs.LG 67%

LawBench: Benchmarking Legal Knowledge of Large Language Models

Zhiwei Fei, Xiaoyu Shen, Dawei Zhu, Fengzhe Zhou, Zhuo Han, Songyang Zhang, Kai Chen, Zongwen Shen, Jidong Ge

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10015 2023-09-20 cs.CL cs.AI cs.LG 67%

SYNDICOM: Improving Conversational Commonsense with Error-Injection and Natural Language Feedback

Christopher Richardson, Anirudh Sundar, Larry Heck

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published at SigDial 2023, Number 129

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18486 2023-07-07 cs.CL cs.AI cs.LG 67%

A Systematic Study and Comprehensive Evaluation of ChatGPT on Benchmark Datasets

Md Tahmid Rahman Laskar, M Saiful Bari, Mizanur Rahman, Md Amran Hossen Bhuiyan, Shafiq Joty, Jimmy Xiangji Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ACL 2023 Findings. The first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14924 2023-06-28 cs.CL cs.AI cs.LG stat.AP 67%

LLM-Assisted Content Analysis: Using Large Language Models to Support Deductive Coding

Robert Chew, John Bollenbacher, Michael Wenger, Jessica Speer, Annice Kim

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10724 2023-06-13 cs.CL cs.AI cs.CY cs.LG 67%

ChatGPT: Jack of all trades, master of none

Jan Kocoń, Igor Cichecki, Oliwier Kaszyca, Mateusz Kochanek, Dominika Szydło, Joanna Baran, Julita Bielaniewicz, Marcin Gruza, Arkadiusz Janz, Kamil Kanclerz, Anna Kocoń, Bartłomiej Koptyra, Wiktoria Mieleszczenko-Kowszewicz, Piotr Miłkowski, Marcin Oleksy, Maciej Piasecki, Łukasz Radliński, Konrad Wojtasik, Stanisław Woźniak, Przemysław Kazienko

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments preprint

Journal ref Information Fusion 101861 (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00924 2023-06-02 cs.CL cs.AI cs.LG 67%

Minding Language Models' (Lack of) Theory of Mind: A Plug-and-Play Multi-Character Belief Tracker

Melanie Sclar, Sachin Kumar, Peter West, Alane Suhr, Yejin Choi, Yulia Tsvetkov

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07759 2023-05-26 cs.CL cs.AI cs.LG 67%

TinyStories: How Small Can Language Models Be and Still Speak Coherent English?

Ronen Eldan, Yuanzhi Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.15010 2023-05-01 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model

Peng Gao, Jiaming Han, Renrui Zhang, Ziyi Lin, Shijie Geng, Aojun Zhou, Wei Zhang, Pan Lu, Conghui He, Xiangyu Yue, Hongsheng Li, Yu Qiao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code and models are available at https://github.com/ZrrSkywalker/LLaMA-Adapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03238 2023-01-10 cs.CL cs.AI cs.LG cs.SD eess.AS 67%

MAQA: A Multimodal QA Benchmark for Negation

Judith Yue Li, Aren Jansen, Qingqing Huang, Joonseok Lee, Ravi Ganti, Dima Kuzmin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2022 SyntheticData4ML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03929 2022-10-11 cs.CV cs.AI cs.CL cs.LG 67%

EgoTaskQA: Understanding Human Tasks in Egocentric Videos

Baoxiong Jia, Ting Lei, Song-Chun Zhu, Siyuan Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published at NeurIPS Track on Datasets and Benchmarks 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.06499 2022-07-14 cs.CL cs.AI cs.LG 67%

RuMedBench: A Russian Medical Language Understanding Benchmark

Pavel Blinov, Arina Reshetnikova, Aleksandr Nesterov, Galina Zubkova, Vladimir Kokh

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages, code available at this https URL; Published in the proceedings of 20th International Conference on Artificial Intelligence in Medicine, Halifax, Canada; code available at https://github.com/pavel-blinov/RuMedBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.12323 2022-05-19 cs.CL cs.AI cs.LG 67%

Describing Differences between Text Distributions with Natural Language

Ruiqi Zhong, Charlie Snell, Dan Klein, Jacob Steinhardt

专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments International Conference on Machine Learning, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.03254 2022-05-06 cs.CL cs.AI cs.LG 67%

Human Parity on CommonsenseQA: Augmenting Self-Attention with External Attention

Yichong Xu, Chenguang Zhu, Shuohang Wang, Siqi Sun, Hao Cheng, Xiaodong Liu, Jianfeng Gao, Pengcheng He, Michael Zeng, Xuedong Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages, 1 figure, 7 tables

Journal ref IJCAI 2022 (Long oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.14101 2022-04-21 cs.LG cs.AI cs.CL 67%

A Roadmap for Big Model

Sha Yuan, Hanyu Zhao, Shuai Zhao, Jiahong Leng, Yangxiao Liang, Xiaozhi Wang, Jifan Yu, Xin Lv, Zhou Shao, Jiaao He, Yankai Lin, Xu Han, Zhenghao Liu, Ning Ding, Yongming Rao, Yizhao Gao, Liang Zhang, Ming Ding, Cong Fang, Yisen Wang, Mingsheng Long, Jing Zhang, Yinpeng Dong, Tianyu Pang, Peng Cui, Lingxiao Huang, Zheng Liang, Huawei Shen, Hui Zhang, Quanshi Zhang, Qingxiu Dong, Zhixing Tan, Mingxuan Wang, Shuo Wang, Long Zhou, Haoran Li, Junwei Bao, Yingwei Pan, Weinan Zhang, Zhou Yu, Rui Yan, Chence Shi, Minghao Xu, Zuobai Zhang, Guoqiang Wang, Xiang Pan, Mengjie Li, Xiaoyu Chu, Zijun Yao, Fangwei Zhu, Shulin Cao, Weicheng Xue, Zixuan Ma, Zhengyan Zhang, Shengding Hu, Yujia Qin, Chaojun Xiao, Zheni Zeng, Ganqu Cui, Weize Chen, Weilin Zhao, Yuan Yao, Peng Li, Wenzhao Zheng, Wenliang Zhao, Ziyi Wang, Borui Zhang, Nanyi Fei, Anwen Hu, Zenan Ling, Haoyang Li, Boxi Cao, Xianpei Han, Weidong Zhan, Baobao Chang, Hao Sun, Jiawen Deng, Chujie Zheng, Juanzi Li, Lei Hou, Xigang Cao, Jidong Zhai, Zhiyuan Liu, Maosong Sun, Jiwen Lu, Zhiwu Lu, Qin Jin, Ruihua Song, Ji-Rong Wen, Zhouchen Lin, Liwei Wang, Hang Su, Jun Zhu, Zhifang Sui, Jiajun Zhang, Yang Liu, Xiaodong He, Minlie Huang, Jian Tang, Jie Tang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This report has been withdrawn by the authors due to critical issues in Section 2.3.1 of Article 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.00590 2022-03-29 cs.CL cs.AI cs.CV cs.LG 67%

WebQA: Multihop and Multimodal QA

Yingshan Chang, Mridu Narang, Hisami Suzuki, Guihong Cao, Jianfeng Gao, Yonatan Bisk

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments CVPR Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.03892 2022-03-28 cs.CL cs.AI cs.LG 67%

Retrieve, Caption, Generate: Visual Grounding for Enhancing Commonsense in Text Generation Models

Steven Y. Feng, Kevin Lu, Zhuofu Tao, Malihe Alikhani, Teruko Mitamura, Eduard Hovy, Varun Gangal

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to AAAI 2022. Code at https://github.com/styfeng/VisCTG

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.10621 2022-03-22 cs.CL cs.AI cs.LG 67%

Immersive Text Game and Personality Classification

Wanshui Li, Yifan Bai, Jiaxuan Lu, Kexin Yi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.09377 2022-01-25 cs.CL cs.AI cs.LG 67%

An Application of Pseudo-Log-Likelihoods to Natural Language Scoring

Darren Abramson, Ali Emami

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.14076 2022-01-20 cs.CL cs.AI cs.LG 67%

RAFT: A Real-World Few-Shot Text Classification Benchmark

Neel Alex, Eli Lifland, Lewis Tunstall, Abhishek Thakur, Pegah Maham, C. Jess Riedel, Emmie Hine, Carolyn Ashurst, Paul Sedille, Alexis Carlier, Michael Noetel, Andreas Stuhlmüller

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Dataset, submission instructions, code and leaderboard available at https://raft.elicit.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.05612 2021-11-30 cs.RO cs.AI cs.CL cs.CV cs.LG 67%

A Persistent Spatial Semantic Representation for High-level Natural Language Instruction Execution

Valts Blukis, Chris Paxton, Dieter Fox, Animesh Garg, Yoav Artzi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Presented at CoRL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.05784 2021-11-09 cs.LG cs.AI cs.CL cs.PL cs.SE 67%

Programming Puzzles

Tal Schuster, Ashwin Kalyan, Oleksandr Polozov, Adam Tauman Kalai

专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2021 (Datasets and Benchmarks Track). Puzzles repository: https://github.com/microsoft/PythonProgrammingPuzzles

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.02681 2021-10-20 cs.CL cs.AI cs.CV cs.LG 67%

VidLanKD: Improving Language Understanding via Video-Distilled Knowledge Transfer

Zineng Tang, Jaemin Cho, Hao Tan, Mohit Bansal

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2021 (19 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.04912 2021-09-13 cs.CL cs.AI cs.LG 67%

ReasonBERT: Pre-trained to Reason with Distant Supervision

Xiang Deng, Yu Su, Alyssa Lees, You Wu, Cong Yu, Huan Sun

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP'2021. Our code and pre-trained models are available at https://github.com/sunlab-osu/ReasonBERT

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.04312 2021-09-10 cs.CL cs.AI cs.IR cs.LG 67%

MATE: Multi-view Attention for Table Transformer Efficiency

Julian Martin Eisenschlos, Maharshi Gor, Thomas Müller, William W. Cohen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏