arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2507.00033 2025-07-02 cs.CV cs.AI cs.CL 62%

Moment Sampling in Video LLMs for Long-Form Video QA

Mustafa Chasmai, Gauri Jagatap, Gouthaman KV, Grant Van Horn, Subhransu Maji, Andrea Fanelli

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Workshop on Video Large Language Models (VidLLMs) at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20342 2025-06-26 cs.CV cs.AI cs.LG 62%

Feature Hallucination for Self-supervised Action Recognition

Lei Wang, Piotr Koniusz

机构 * Griffith University(格里菲斯大学) Data61/CSIRO(Data61/澳大利亚联邦科学与工业研究组织) University of New South Wales(新南威尔士大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication in International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05333 2025-06-23 cs.LG cs.CL 62%

Kinetics: Rethinking Test-Time Scaling Laws

Ranajoy Sadhukhan, Zhuoming Chen, Haizhong Zheng, Yang Zhou, Emma Strubell, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14158 2025-06-18 cs.CL cs.AI 62%

S$^4$C: Speculative Sampling with Syntactic and Semantic Coherence for Efficient Inference of Large Language Models

Tao He, Guang Huang, Yu Yang, Tianshi Xu, Sicheng Zhao, Guiguang Ding, Pengyang Wang, Feng Tian

机构 * GRG Banking Equipment Co., Ltd(GRG银行设备有限公司) South China University of Technology(华南理工大学) University of Macau(澳门大学) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14735 2025-06-18 cs.CL cs.AI 62%

Unleashing the potential of prompt engineering for large language models

Banghao Chen, Zhaofeng Zhang, Nicolas Langrené, Shengxin Zhu

机构 * Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science(interdisciplinary Research and Application for Data Science省重点实验室) BNU-HKBU United International College(北京师范大学-香港浸会大学联合国际学院) Research Center for Mathematics, Beijing Normal University(北京师范大学数学研究中心)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments v6 - Metadata updated (title, journal ref, DOI). PDF identical to v5 (original submission). Please cite the peer-reviewed Version of Record in "Patterns" (DOI: 10.1016/j.patter.2025.101260)

Journal ref Patterns 6(6) 101260 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13746 2025-06-17 cs.CR cs.AI cs.LG 62%

Evaluating Large Language Models for Phishing Detection, Self-Consistency, Faithfulness, and Explainability

Shova Kuikel, Aritran Piplai, Palvi Aggarwal

机构 * University of Texas at El Paso(德克萨斯理工大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18688 2025-06-17 cs.CR cs.AI cs.LG 62%

Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment

Soumya Suvra Ghosal, Souradip Chakraborty, Vaibhav Singh, Tianrui Guan, Mengdi Wang, Alvaro Velasquez, Ahmad Beirami, Furong Huang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland(马里兰大学) Indian Institute of Technology Bombay(印度班加罗尔理工学院) Princeton University(普林斯顿大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Capital One(Capital One公司) University of Central Florida(佛罗里达中央大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01567 2025-06-10 cs.CL cs.LG stat.ML 62%

Latent Thought Models with Variational Bayes Inference-Time Computation

Deqian Kong, Minglu Zhao, Dehong Xu, Bo Pang, Shu Wang, Edouardo Honig, Zhangzhang Si, Chuan Li, Jianwen Xie, Sirui Xie, Ying Nian Wu

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06215 2025-06-09 cs.LG cs.CL 62%

Corrector Sampling in Language Models

Itai Gat, Neta Shaul, Uriel Singer, Yaron Lipman

机构 * FAIR at Meta(Meta FAIR)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03143 2025-06-04 cs.CL cs.AI cs.CV 62%

GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents

Qianhui Wu, Kanzhi Cheng, Rui Yang, Chaoyun Zhang, Jianwei Yang, Huiqiang Jiang, Jian Mu, Baolin Peng, Bo Qiao, Reuben Tan, Si Qin, Lars Liden, Qingwei Lin, Huan Zhang, Tong Zhang, Jianbing Zhang, Dongmei Zhang, Jianfeng Gao

机构 * Microsoft(微软公司) Nanjing University(南京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01104 2025-06-03 cs.LG cs.AI cs.IT math.IT 62%

Softmax is not Enough (for Sharp Size Generalisation)

Petar Veličković, Christos Perivolaropoulos, Federico Barbero, Razvan Pascanu

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments To appear at ICML 2025. 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23735 2025-05-30 cs.CL cs.AI 62%

ATLAS: Learning to Optimally Memorize the Context at Test Time

Ali Behrouz, Zeman Li, Praneeth Kacham, Majid Daliri, Yuan Deng, Peilin Zhong, Meisam Razaviyayn, Vahab Mirrokni

机构 * Google(谷歌)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23604 2025-05-30 cs.CL cs.AI cs.SE 62%

Satori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software Engineering

Guangtao Zeng, Maohao Shen, Delin Chen, Zhenting Qi, Subhro Das, Dan Gutfreund, David Cox, Gregory Wornell, Wei Lu, Zhang-Wei Hong, Chuang Gan

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20660 2025-05-28 cs.CL cs.AI 62%

BacktrackAgent: Enhancing GUI Agent with Error Detection and Backtracking Mechanism

Qinzhuo Wu, Pengzhi Gao, Wei Liu, Jian Luan

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19706 2025-05-27 cs.CL cs.AI 62%

Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision

Tej Deep Pala, Panshul Sharma, Amir Zadeh, Chuan Li, Soujanya Poria

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments https://github.com/declare-lab/PathFinder-PRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13828 2025-04-29 cs.CL cs.AI 62%

Generative AI Act II: Test Time Scaling Drives Cognition Engineering

Shijie Xia, Yiwei Qin, Xuefeng Li, Yan Ma, Run-Ze Fan, Steffi Chern, Haoyang Zou, Fan Zhou, Xiangkun Hu, Jiahe Jin, Yanheng He, Yixin Ye, Yixiu Liu, Pengfei Liu

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments v3: add the comparison to existing work part; fix some errors

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16574 2025-04-24 cs.CL cs.AI 62%

PIS: Linking Importance Sampling and Attention Mechanisms for Efficient Prompt Compression

Lizhe Chen, Binjia Zhou, Yuyao Ge, Jiayi Chen, Shiguang NI

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Zhejiang University(浙江大学) CAS Key Laboratory of AI Security, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室) Fudan University(复旦大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13950 2025-04-22 cs.LG cs.AI 62%

Open-Medical-R1: How to Choose Data for RLVR Training at Medicine Domain

Zhongxi Qiu, Zhang Zhang, Yan Hu, Heng Li, Jiang Liu

机构 * Research Institute of Trustworthy Autonomous Systems(可信自主系统研究 institute)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09303 2025-04-15 cs.CL cs.LG 62%

Exact Byte-Level Probabilities from Tokenized Language Models for FIM-Tasks and Model Ensembles

Buu Phan, Brandon Amos, Itai Gat, Marton Havasi, Matthew Muckley, Karen Ullrich

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07164 2025-04-11 cs.SE cs.CL cs.LG 62%

R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents

Naman Jain, Jaskirat Singh, Manish Shetty, Liang Zheng, Koushik Sen, Ion Stoica

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.LG

Comments Website: https://r2e-gym.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07104 2025-04-11 cs.IR cs.CL cs.LG 62%

Relevance Isn't All You Need: Scaling RAG Systems With Inference-Time Compute Via Multi-Criteria Reranking

Will LeVine, Bijan Varjavand

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16673 2025-04-08 cs.LG cs.AI 62%

Preserving Diversity in Supervised Fine-Tuning of Large Language Models

Ziniu Li, Congliang Chen, Tian Xu, Zeyu Qin, Jiancong Xiao, Zhi-Quan Luo, Ruoyu Sun

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI、cs.LG

Comments accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00938 2025-04-02 cs.AI cs.LG 62%

AI Judges in Design: Statistical Perspectives on Achieving Human Expert Equivalence With Vision-Language Models

Kristen M. Edwards, Farnaz Tehranchi, Scarlett R. Miller, Faez Ahmed

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 21 pages, 8 tables, 6 figures, 8 tables in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23205 2025-04-01 cs.CL cs.AI cs.DB 62%

Enhancing Knowledge Graph Completion with Entity Neighborhood and Relation Context

Jianfang Chen, Kai Zhang, Aoran Gan, Shiwei Tong, Shuanghong Shen, Qi Liu

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08897 2025-03-19 cs.AI cs.LG 62%

Neural Interactive Proofs

Lewis Hammond, Sam Adam-Day

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

Comments ICLR'25 camera-ready version; 51 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00691 2025-03-10 cs.SE cs.AI cs.CL 62%

How Diversely Can Language Models Solve Problems? Exploring the Algorithmic Diversity of Model-Generated Code

Seonghyeon Lee, Heejae Chon, Joonwon Jang, Dongha Lee, Hwanjo Yu

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15077 2025-03-05 cs.LG cs.CL 62%

EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty

Yuhui Li, Fangyun Wei, Chao Zhang, Hongyang Zhang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12197 2025-02-19 cs.CL cs.AI 62%

A Closer Look at System Prompt Robustness

Norman Mu, Jonathan Lu, Michael Lavery, David Wagner

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Artifacts: https://github.com/normster/RealGuardrails

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10993 2025-02-18 cs.CL cs.LG 62%

RoseRAG: Robust Retrieval-augmented Generation with Small-scale LLMs via Margin-aware Preference Optimization

Tianci Liu, Haoxiang Jiang, Tianze Wang, Ran Xu, Yue Yu, Linjun Zhang, Tuo Zhao, Haoyu Wang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08661 2025-02-18 cs.CL cs.AI 62%

Few-shot LLM Synthetic Data with Distribution Matching

Jiyuan Ren, Zhaocheng Du, Zhihao Wen, Qinglin Jia, Sunhao Dai, Chuhan Wu, Zhenhua Dong

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 5 figures, accepted at www 2025

详情

展开后加载摘要…

URL PDF HTML 收藏