arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2505.22010 2025-05-29 cs.CR 67%

VulBinLLM: LLM-powered Vulnerability Detection for Stripped Binaries

Nasir Hussain, Haohan Chen, Chanh Tran, Philip Huang, Zhuohao Li, Pravir Chugh, William Chen, Ashish Kundu, Yuan Tian

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15435 2025-05-27 cs.CV 67%

What Makes a Scene ? Scene Graph-based Evaluation and Feedback for Controllable Generation

Zuyao Chen, Jinlin Wu, Zhen Lei, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Institute of Automation, CAS(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19714 2025-05-27 cs.CL cs.AI cs.LG 67%

MT$^{3}$: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning

Zhaopeng Feng, Yupu Liang, Shaosheng Cao, Jiayuan Su, Jiahan Ren, Zhe Xu, Yao Hu, Wenxuan Huang, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Xiaohongshu Inc.(小红书公司) East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19091 2025-05-27 cs.CL cs.AI cs.CV cs.LG 67%

ReadBench: Measuring the Dense Text Visual Reading Ability of Vision-Language Models

Benjamin Clavié, Florian Brand

机构 * Artificial Intelligence and Intelligent Information Systems, University of Trier(人工智能与智能信息系统,特里尔大学) German Research Center for Artificial Intelligence (DFKI), Trier(德国人工智能研究中心(DFKI),特里尔)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11435 2025-05-27 cs.AI cs.CL cs.LG 67%

SMART: Self-Aware Agent for Tool Overuse Mitigation

Cheng Qian, Emre Can Acikgoz, Hongru Wang, Xiusi Chen, Avirup Sil, Dilek Hakkani-Tür, Gokhan Tur, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research AI(IBM人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 18 pages, 11 tables, 7 figures, ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16410 2025-05-23 cs.CL cs.AI cs.LG 67%

Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning

Guanting Dong, Yifei Chen, Xiaoxi Li, Jiajie Jin, Hongjin Qian, Yutao Zhu, Hangyu Mao, Guorui Zhou, Zhicheng Dou, Ji-Rong Wen

机构 * Renmin University of China(中国人民大学) BAAI(北京人工智能研究院) Kuaishou Technology(快手科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16366 2025-05-23 cs.CR 67%

ReCopilot: Reverse Engineering Copilot in Binary Analysis

Guoqiang Chen, Huiqi Sun, Daguang Liu, Zhiqi Wang, Qiang Wang, Bin Yin, Lu Liu, Lingyun Ying

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12938 2025-05-21 cs.LG cs.AI cs.CL 67%

Leveraging LLM Inconsistency to Boost Pass@k Performance

Uri Dalal, Meirav Segal, Zvika Ben-Haim, Dan Lahav, Omer Nevo

机构 * Pattern Labs

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14150 2025-05-21 cs.CL cs.AI cs.LG stat.ML 67%

Walk the Talk? Measuring the Faithfulness of Large Language Model Explanations

Katie Matton, Robert Osazuwa Ness, John Guttag, Emre Kıcıman

机构 * MIT(麻省理工学院) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 66 pages, 14 figures, 40 tables; ICLR 2025 (spotlight) camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15522 2025-05-21 cs.CL cs.AI cs.LG 67%

M-RewardBench: Evaluating Reward Models in Multilingual Settings

Srishti Gureja, Lester James V. Miranda, Shayekh Bin Islam, Rishabh Maheshwary, Drishti Sharma, Gusti Winata, Nathan Lambert, Sebastian Ruder, Sara Hooker, Marzieh Fadaee

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 16 pages, 6 figures, 10 tables. Website: https://m-rewardbench.github.io/ , Updated results with latest models. Added more author information

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12236 2025-05-20 cs.CL cs.AI cs.LG 67%

Bridging Generative and Discriminative Learning: Few-Shot Relation Extraction via Two-Stage Knowledge-Guided Pre-training

Quanjiang Guo, Jinchuan Zhang, Sijie Wang, Ling Tian, Zhao Kang, Bin Yan, Weidong Xiao

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Information Engineering University(信息工程大学) National University of Defense Technology(国防科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 pages, 6 figures, Appear on IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01533 2025-05-20 cs.CL cs.AI cs.LG 67%

Enhancing LLM Evaluations: The Garbling Trick

William F. Bradley

机构 * Mirabolic Consulting(Mirabolic咨询公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07995 2025-05-16 cs.AR 67%

Spec2Assertion: Automatic Pre-RTL Assertion Generation using Large Language Models with Progressive Regularization

Fenghua Wu, Evan Pan, Rahul Kande, Michael Quinn, Aakash Tyagi, David Kebo Houngninou, Jeyavijayan Rajendran, Jiang Hu

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07637 2025-05-13 cs.CL cs.AI cs.LG 67%

Chronocept: Instilling a Sense of Time in Machines

Krish Goel, Sanskar Pandey, KS Mahadevan, Harsh Kumar, Vishesh Khadaria

机构 * ProjectEndgame

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 20 pages, 8 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04869 2025-05-09 cs.HC 67%

From First Draft to Final Insight: A Multi-Agent Approach for Feedback Generation

Jie Cao, Chloe Qianhui Zhao, Xian Chen, Shuman Wang, Christian Schunn, Kenneth R. Koedinger, Jionghao Lin

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

Comments 14 pages, to be published at the 26th International Conference on Artificial Intelligence in Education (AIED '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14082 2025-05-09 cs.CL cs.AI cs.LG 67%

Communicating Activations Between Language Model Agents

Vignav Ramesh, Kenneth Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02867 2025-05-07 cs.CV 67%

RESAnything: Attribute Prompting for Arbitrary Referring Segmentation

Ruiqi Wang, Hao Zhang

专题命中 推理评测 :reasoning(abstract);CoT(abstract)

Comments 42 pages, 31 figures. For more details: https://suikei-wang.github.io/RESAnything/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00358 2025-05-02 cs.LG cs.AI cs.CL 67%

R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training

Albert Ge, Tzu-Heng Huang, John Cooper, Avi Trost, Ziyi Chu, Satya Sai Srinath Namburi GNVV, Ziyang Cai, Kendall Park, Nicholas Roberts, Frederic Sala

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00060 2025-05-02 cs.CL cs.AI cs.LG 67%

Fact-Consistency Evaluation of Text-to-SQL Generation for Business Intelligence Using Exaone 3.5

Jeho Choi

机构 * LG Electronics(LG电子)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 6 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20896 2025-04-30 cs.SE 67%

LELANTE: LEveraging LLM for Automated ANdroid TEsting

Shamit Fatin, Mehbubul Hasan Al-Quvi, Haz Sameen Shahgir, Sukarna Barua, Anindya Iqbal, Sadia Sharmin, Md. Mostofa Akbar, Kallol Kumar Pal, A. Asif Al Rashid

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

Comments 6 pages, 4 figures, 29th International Conference on Evaluation and Assessment in Software Engineering (EASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16326 2025-04-29 cs.CL cs.AI cs.IR cs.LG 67%

Benchmarking large language models for biomedical natural language processing applications and recommendations

Qingyu Chen, Yan Hu, Xueqing Peng, Qianqian Xie, Qiao Jin, Aidan Gilson, Maxwell B. Singer, Xuguang Ai, Po-Ting Lai, Zhizheng Wang, Vipina Kuttichi Keloth, Kalpana Raja, Jiming Huang, Huan He, Fongci Lin, Jingcheng Du, Rui Zhang, W. Jim Zheng, Ron A. Adelman, Zhiyong Lu, Hua Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref Nature Communications; 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16188 2025-04-24 cs.CL cs.AI cs.LG 67%

FinNLI: Novel Dataset for Multi-Genre Financial Natural Language Inference Benchmarking

Jabez Magomere, Elena Kochkina, Samuel Mensah, Simerjot Kaur, Charese H. Smiley

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14530 2025-04-22 cs.CL cs.AI cs.CY cs.LG 67%

Causality for Natural Language Processing

Zhijing Jin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments PhD Thesis 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14331 2025-04-22 cs.SE 67%

Code2API: A Tool for Generating Reusable APIs from Stack Overflow Code Snippets

Yubo Mai, Zhipeng Gao, Xing Hu, Lingfeng Bao, Jingyuan Chen, Jianling Sun

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19314 2025-04-22 cs.CL cs.AI cs.LG 67%

LiveBench: A Challenging, Contamination-Limited LLM Benchmark

Colin White, Samuel Dooley, Manley Roberts, Arka Pal, Ben Feuer, Siddhartha Jain, Ravid Shwartz-Ziv, Neel Jain, Khalid Saifullah, Sreemanti Dey, Shubh-Agrawal, Sandeep Singh Sandha, Siddartha Naidu, Chinmay Hegde, Yann LeCun, Tom Goldstein, Willie Neiswanger, Micah Goldblum

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04178 2025-04-22 cs.CV 67%

SHIELD : An Evaluation Benchmark for Face Spoofing and Forgery Detection with Multimodal Large Language Models

Yichen Shi, Yuhao Gao, Yingxin Lai, Hongyang Wang, Jun Feng, Lei He, Jun Wan, Changsheng Chen, Zitong Yu, Xiaochun Cao

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) Department of Artificial Intelligence, Xiamen University(厦门大学人工智能系) School of Information Science and Technology, Shijiazhuang Tiedao University(石家庄铁道大学信息科学与技术学院) Electrical Engineering Department, UCLA(加州大学洛杉矶分校电子工程系) New Laboratory of Pattern Recognition(NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) School of Computing and Information Technology, Great Bay University(广东东莞Great Bay大学计算与信息科技学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 推理评测 :reasoning(abstract);CoT(abstract)

Comments Accepted by Visual Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13216 2025-04-21 cs.CL cs.AI cs.LG 67%

KFinEval-Pilot: A Comprehensive Benchmark Suite for Korean Financial Language Understanding

Bokwang Hwang, Seonkyu Lim, Taewoong Kim, Yongjae Geun, Sunghyun Bang, Sohyun Park, Jihyun Park, Myeonggyu Lee, Jinwoo Lee, Yerin Kim, Jinsun Yoo, Jingyeong Hong, Jina Park, Yongchan Kim, Suhyun Kim, Younggyun Hahm, Yiseul Lee, Yejee Kang, Chanhyuk Yoon, Chansu Lee, Heeyewon Jeong, Jiyeon Lee, Seonhye Gu, Hyebin Kang, Yousang Cho, Hangyeol Yoo, KyungTae Lim

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10160 2025-04-15 cs.CL cs.AI cs.LG 67%

MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning

Zhaopeng Feng, Shaosheng Cao, Jiahan Ren, Jiayuan Su, Ruizhe Chen, Yan Zhang, Zhe Xu, Yao Hu, Jian Wu, Zuozhu Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress. Our code is available at https://github.com/fzp0424/MT-R1-Zero

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07174 2025-04-11 cs.CL cs.AI cs.LG 67%

HypoEval: Hypothesis-Guided Evaluation for Natural Language Generation

Mingxuan Li, Hanchen Li, Chenhao Tan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages, 3 figures, code link: https://github.com/ChicagoHAI/HypoEval-Gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06196 2025-04-09 cs.AI cs.CL cs.LG 67%

TxGemma: Efficient and Agentic LLMs for Therapeutics

Eric Wang, Samuel Schmidgall, Paul F. Jaeger, Fan Zhang, Rory Pilgrim, Yossi Matias, Joelle Barral, David Fleet, Shekoofeh Azizi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏