arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1997 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1997 篇

2501.12372 2025-06-12 cs.DB cs.AI 57%

Is Long Context All You Need? Leveraging LLM's Extended Context for NL2SQL

Yeounoh Chung, Gaurav T. Kakkar, Yu Gan, Brenton Milne, Fatma Ozcan

机构 * Google(谷歌)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 13 pages, 6 figures, VLDB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06982 2025-06-10 cs.CL 57%

Chain of Methodologies: Scaling Test Time Computation without Training

Cong Liu, Jie Wu, Weigang Wu, Xu Chen, Liang Lin, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Temple University

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Journal ref ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20380 2025-05-28 cs.LG 57%

GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining

Simin Fan, Maria Ios Glarou, Martin Jaggi

机构 * EPFL(瑞士联邦理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15508 2025-05-22 cs.CL 57%

Multilingual Test-Time Scaling via Initial Thought Transfer

Prasoon Bajpai, Tanmoy Chakraborty

机构 * IIT Delhi(德里印度理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments 14 pages, 9 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13672 2025-05-21 cs.AI 57%

A*-Decoding: Token-Efficient Inference Scaling

Giannis Chatziveroglou

机构 * MIT(麻省理工学院) Cohere

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13403 2025-05-20 cs.CL 57%

MR. Judge: Multimodal Reasoner as a Judge

Renjie Pi, Felix Bai, Qibin Chen, Simon Wang, Jiulong Shan, Kieran Liu, Meng Cao

机构 * HKUST(香港科技大学) Apple(苹果公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08507 2025-05-14 cs.LG 57%

InfoPO: On Mutual Information Maximization for Large Language Model Alignment

Teng Xiao, Zhen Ge, Sujay Sanghavi, Tian Wang, Julian Katz-Samuels, Marc Versage, Qingjun Cui, Trishul Chilimbi

机构 * Amazon(亚马逊)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07680 2025-05-13 cs.LG cs.DC 57%

SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models

Hang Wu, Jianian Zhu, Yinghui Li, Haojie Wang, Biao Hou, Jidong Zhai

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01954 2025-05-06 cs.LG 57%

Semantic Probabilistic Control of Language Models

Kareem Ahmed, Catarina G Belem, Padhraic Smyth, Sameer Singh

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19898 2025-04-29 cs.CL 57%

GenCLS++: Pushing the Boundaries of Generative Classification in LLMs Through Comprehensive SFT and RL Studies Across Diverse Datasets

Mingqian He, Fei Zhao, Chonggang Lu, Ziyan Liu, Yue Wang, Haofu Qian

机构 * Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司) Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01840 2025-04-24 cs.CL 57%

EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test

Yuhui Li, Fangyun Wei, Chao Zhang, Hongyang Zhang

机构 * Peking University(北京大学) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14148 2025-04-22 cs.CV cs.CL 57%

Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment

Chenhang Cui, An Zhang, Yiyang Zhou, Zhaorun Chen, Gelei Deng, Huaxiu Yao, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of Chicago(芝加哥大学) Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

Comments 23 pages; Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13145 2025-04-22 cs.AI 57%

Exploring Expert Failures Improves LLM Agent Tuning

Li-Cheng Lan, Andrew Bai, Minhao Cheng, Cho-Jui Hsieh, Tianyi Zhou

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07958 2025-04-07 cs.AI 57%

PAFFA: Premeditated Actions For Fast Agents

Shambhavi Krishna, Zheng Chen, Yuan Ling, Xiaojiang Huang, Yingjie Li, Fan Yang, Xiang Li

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18942 2025-04-02 cs.CV cs.AI 57%

Video-T1: Test-Time Scaling for Video Generation

Fangfu Liu, Hanyang Wang, Yimo Cai, Kaiyan Zhang, Xiaohang Zhan, Yueqi Duan

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI

Comments Project page: https://liuff19.github.io/Video-T1

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22731 2025-04-01 cs.LG 57%

MoRE-LLM: Mixture of Rule Experts Guided by a Large Language Model

Alexander Koebler, Ingo Thon, Florian Buettner

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments 2024 IEEE International Conference on Data Mining (ICDM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16893 2025-03-24 cs.DC cs.LG 57%

Improving the End-to-End Efficiency of Offline Inference for Multi-LLM Applications Based on Sampling and Simulation

Jingzhi Fang, Yanyan Shen, Yue Wang, Lei Chen

专题命中 测试时计算 :planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15886 2025-03-24 cs.CV cs.LG 57%

Enhancing Zero-Shot Image Recognition in Vision-Language Models through Human-like Concept Guidance

Hui Liu, Wenya Wang, Kecheng Chen, Jie Liu, Yibing Liu, Tiexin Qin, Peisong He, Xinghao Jiang, Haoliang Li

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments 21 pages, 7 figures 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04618 2025-03-07 cs.CL 57%

Better Process Supervision with Bi-directional Rewarding Signals

Wenxiang Chen, Wei He, Zhiheng Xi, Honglin Guo, Boyang Hong, Jiazheng Zhang, Rui Zheng, Nijun Li, Tao Gui, Yun Li, Qi Zhang, Xuanjing Huang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04343 2025-03-04 cs.CL 57%

Inference Scaling for Long-Context Retrieval Augmented Generation

Zhenrui Yue, Honglei Zhuang, Aijun Bai, Kai Hui, Rolf Jagerman, Hansi Zeng, Zhen Qin, Dong Wang, Xuanhui Wang, Michael Bendersky

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17172 2025-02-26 cs.HC cs.AI cs.CY q-bio.NC 57%

Teleology-Driven Affective Computing: A Causal Framework for Sustained Well-Being

Bin Yin, Chong-Yi Liu, Liya Fu, Jinkun Zhang

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15719 2025-02-25 cs.CY cs.AI 57%

Governing AI Beyond the Pretraining Frontier

Nicholas A. Caputo

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12700 2025-02-19 cs.CL 57%

Multi-Novelty: Improve the Diversity and Novelty of Contents Generated by Large Language Models via inference-time Multi-Views Brainstorming

Arash Lagzian, Srinivas Anumasa, Dianbo Liu

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10851 2025-02-18 cs.LG physics.chem-ph q-bio.QM 57%

To Bin or not to Bin: Alternative Representations of Mass Spectra

Niek de Jonge, Justin J. J. van der Hooft, Daniel Probst

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments This manuscript has been submitted to the tiny paper track at the LMRL workshop at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15847 2025-02-12 cs.CR cs.AI 57%

LLMmap: Fingerprinting For Large Language Models

Dario Pasquini, Evgenios M. Kornaropoulos, Giuseppe Ateniese

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.AI

Comments Appearing in the proceedings of the 34th USENIX Security Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01126 2025-02-04 cs.CL 57%

Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences

Vaishnavi Shrivastava, Ananya Kumar, Percy Liang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12853 2025-01-23 cs.LG 57%

Data-and-Semantic Dual-Driven Spectrum Map Construction for 6G Spectrum Management

Jiayu Liu, Fuhui Zhou, Xiaodong Liu, Rui Ding, Lu Yuan, Qihui Wu

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments This paper has been accepted for presentation at the IEEE Global Communications Conference (GLOBECOM), Cape Town, South Africa, December 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14335 2024-12-17 cs.CL 57%

MQM-APE: Toward High-Quality Error Annotation Predictors with Automatic Post-Editing in LLM Translation Evaluators

Qingyu Lu, Liang Ding, Kanjian Zhang, Jinxia Zhang, Dacheng Tao

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

Comments COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09240 2024-12-13 cs.CV cs.AI 57%

VLMs meet UDA: Boosting Transferability of Open Vocabulary Segmentation with Unsupervised Domain Adaptation

Roberto Alcover-Couso, Marcos Escudero-Viñolo, Juan C. SanMiguel, Jesus Bescos

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08393 2024-12-12 cs.CL 57%

Learning to Reason via Self-Iterative Process Feedback for Small Language Models

Kaiyuan Chen, Jin Wang, Xuejie Zhang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments Accepted by COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏