arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2510.10201 2025-10-14 cs.LG cs.AI cs.CL 67%

RLFR: Extending Reinforcement Learning for LLMs with Flow Environment

Jinghao Zhang, Naishan Zheng, Ruilin Li, Dongzhou Cheng, Zheming Liang, Feng Zhao, Jiaqi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) ByteDance(字节跳动) Wuhan University(武汉大学) Southeast University(东南大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project Website: https://jinghaoleven.github.io/RLFR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08245 2025-10-10 cs.CL cs.AI cs.LG 67%

Contrastive Decoding for Synthetic Data Generation in Low-Resource Language Modeling

Jannek Ulm, Kevin Du, Vésteinn Snæbjarnarson

机构 * ETH Zürich(苏黎世联邦理工学院) University of Copenhagen(哥本哈根大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16322 2025-10-07 cs.LG cs.AI cs.CL 67%

AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners

Woosung Koh, Wonbeen Oh, Jaein Jang, MinHyung Lee, Hyeongjin Kim, Ah Yeon Kim, Joonkee Kim, Junghyun Lee, Taehyeon Kim, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能研究所) LG AI Research(LG人工智能研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02611 2025-10-06 cs.AI cs.CL cs.LG 67%

On the Role of Temperature Sampling in Test-Time Scaling

Yuheng Wu, Azalia Mirhoseini, Thierry Tambe

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01670 2025-10-03 cs.AI cs.CL cs.CR cs.CY cs.LG 67%

Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness

Erfan Shayegani, Keegan Hines, Yue Dong, Nael Abu-Ghazaleh, Roman Lutz, Spencer Whitehead, Vidhisha Balachandran, Besmira Nushi, Vibhav Vineet

机构 * Microsoft Research AI Frontiers(微软研究院人工智能前沿) Microsoft AI Red Team(微软AI红色团队) University of California, Riverside(加州大学河滨分校) NVIDIA(英伟达)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01218 2025-10-03 cs.LG cs.AI cs.CL 67%

Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs

Sergey Troshin, Wafaa Mohammed, Yan Meng, Christof Monz, Antske Fokkens, Vlad Niculae

机构 * Language Technology Lab, University of Amsterdam(阿姆斯特丹大学语言技术实验室) Computational Linguistics and Text Mining Lab, Vrije Universiteit Amsterdam(阿姆斯特丹自由大学计算语言学与文本挖掘实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Second Conference on Language Modeling, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24678 2025-09-30 cs.CL cs.AI cs.LG 67%

Reference-Free Rating of LLM Responses via Latent Information

Leander Girrbach, Chi-Ping Su, Tankred Saanum, Richard Socher, Eric Schulz, Zeynep Akata

机构 * Technical University of Munich, Munich Center for Machine Learning, MDSI(慕尼黑技术大学,慕尼黑机器学习中心,MDSI) National Yang Ming Chiao Tung University(阳明交通大学) Helmholtz Munich(海德堡慕尼黑研究所) Harvard University(哈佛大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19866 2025-09-30 cs.AI cs.CL cs.LG 67%

HS-STaR: Hierarchical Sampling for Self-Taught Reasoners via Difficulty Estimation and Budget Reallocation

Feng Xiong, Hongling Xu, Yifei Wang, Runxi Cheng, Yong Wang, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01456 2025-09-29 cs.LG cs.AI cs.CL 67%

Process Reinforcement through Implicit Rewards

Ganqu Cui, Lifan Yuan, Zefan Wang, Hanbin Wang, Yuchen Zhang, Jiacheng Chen, Wendi Li, Bingxiang He, Yuchen Fan, Tianyu Yu, Qixin Xu, Weize Chen, Jiarui Yuan, Huayu Chen, Kaiyan Zhang, Xingtai Lv, Shuo Wang, Yuan Yao, Xu Han, Hao Peng, Yu Cheng, Zhiyuan Liu, Maosong Sun, Bowen Zhou, Ning Ding

机构 * Shanghai AI Lab(上海人工智能实验室) Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) CUHK(香港中文大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 24 pages. Model&Code&Data available at https://github.com/PRIME-RL/PRIME

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02495 2025-09-26 cs.CL cs.AI cs.LG 67%

Inference-Time Scaling for Generalist Reward Modeling

Zijun Liu, Peiyi Wang, Runxin Xu, Shirong Ma, Chong Ruan, Peng Li, Yang Liu, Yu Wu

机构 * DeepSeek-AI Dept. of Computer Sci. & Tech., Tsinghua University(计算机科学与技术系,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint, under review. 44 pages. Models are available at https://huggingface.co/collections/BBQGOD/deepseek-grm-68b4681169dbb97fd30614b5 and https://www.modelscope.cn/collections/DeepSeek-GRM-ff6a2d8babdd4a

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13255 2025-09-24 cs.CL cs.AI cs.IR cs.LG cs.MM 67%

Automating Steering for Safe Multimodal Large Language Models

Lyucheng Wu, Mengru Wang, Ziwen Xu, Tri Cao, Nay Oo, Bryan Hooi, Shumin Deng

机构 * Zhejiang University(浙江大学) Zhejiang University - Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室) National University of Singapore, NUS-NCS Joint Lab(新加坡国立大学NUS-NCS联合实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 Main Conference. 23 pages (8+ for main); 25 figures; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13990 2025-09-18 cs.CL cs.AI cs.LG 67%

Slim-SC: Thought Pruning for Efficient Scaling with Self-Consistency

Colin Hong, Xu Guo, Anand Chaanan Singh, Esha Choukse, Dmitrii Ustiugov

机构 * NTU Singapore(新加坡国立大学) KTH Royal Institute of Technology(皇家理工学院) Microsoft(微软公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by EMNLP 2025 (Oral), 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03624 2025-09-09 cs.CL cs.AI cs.LG 67%

Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models

NVIDIA, :, Aaron Blakeman, Aarti Basant, Abhinav Khattar, Adithya Renduchintala, Akhiad Bercovich, Aleksander Ficek, Alexis Bjorlin, Ali Taghibakhshi, Amala Sanjay Deshmukh, Ameya Sunil Mahabaleshwarkar, Andrew Tao, Anna Shors, Ashwath Aithal, Ashwin Poojary, Ayush Dattagupta, Balaram Buddharaju, Bobby Chen, Boris Ginsburg, Boxin Wang, Brandon Norick, Brian Butterfield, Bryan Catanzaro, Carlo del Mundo, Chengyu Dong, Christine Harvey, Christopher Parisien, Dan Su, Daniel Korzekwa, Danny Yin, Daria Gitman, David Mosallanezhad, Deepak Narayanan, Denys Fridman, Dima Rekesh, Ding Ma, Dmytro Pykhtar, Dong Ahn, Duncan Riach, Dusan Stosic, Eileen Long, Elad Segal, Ellie Evans, Eric Chung, Erick Galinkin, Evelina Bakhturina, Ewa Dobrowolska, Fei Jia, Fuxiao Liu, Gargi Prasad, Gerald Shen, Guilin Liu, Guo Chen, Haifeng Qian, Helen Ngo, Hongbin Liu, Hui Li, Igor Gitman, Ilia Karmanov, Ivan Moshkov, Izik Golan, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jarno Seppanen, Jason Lu, Jason Sewall, Jiaqi Zeng, Jiaxuan You, Jimmy Zhang, Jing Zhang, Jining Huang, Jinze Xue, Jocelyn Huang, Joey Conway, John Kamalu, Jon Barker, Jonathan Cohen, Joseph Jennings, Jupinder Parmar, Karan Sapra, Kari Briski, Kateryna Chumachenko, Katherine Luna, Keshav Santhanam, Kezhi Kong, Kirthi Sivamani, Krzysztof Pawelec, Kumar Anik, Kunlun Li, Lawrence McAfee, Leon Derczynski, Lindsey Pavao, Luis Vega, Lukas Voegtle, Maciej Bala, Maer Rodrigues de Melo, Makesh Narsimhan Sreedhar, Marcin Chochowski, Markus Kliegl, Marta Stepniewska-Dziubinska, Matthieu Le, Matvei Novikov, Mehrzad Samadi, Michael Andersch, Michael Evans, Miguel Martinez, Mike Chrzanowski, Mike Ranzinger, Mikolaj Blaz, Misha Smelyanskiy, Mohamed Fawzy, Mohammad Shoeybi, Mostofa Patwary, Nayeon Lee, Nima Tajbakhsh, Ning Xu, Oleg Rybakov, Oleksii Kuchaiev, Olivier Delalleau, Osvald Nitski, Parth Chadha, Pasha Shamis, Paulius Micikevicius, Pavlo Molchanov, Peter Dykas, Philipp Fischer, Pierre-Yves Aquilanti, Piotr Bialecki, Prasoon Varshney, Pritam Gundecha, Przemek Tredak, Rabeeh Karimi, Rahul Kandu, Ran El-Yaniv, Raviraj Joshi, Roger Waleffe, Ruoxi Zhang, Sabrina Kavanaugh, Sahil Jain, Samuel Kriman, Sangkug Lym, Sanjeev Satheesh, Saurav Muralidharan, Sean Narenthiran, Selvaraj Anandaraj, Seonmyeong Bak, Sergey Kashirsky, Seungju Han, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Sharon Clay, Shelby Thomas, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shyamala Prayaga, Siddhartha Jain, Sirshak Das, Slawek Kierat, Somshubra Majumdar, Song Han, Soumye Singhal, Sriharsha Niverty, Stefania Alborghetti, Suseella Panguluri, Swetha Bhendigeri, Syeda Nahida Akter, Szymon Migacz, Tal Shiri, Terry Kong, Timo Roman, Tomer Ronen, Trisha Saar, Tugrul Konuk, Tuomas Rintamaki, Tyler Poon, Ushnish De, Vahid Noroozi, Varun Singh, Vijay Korthikanti, Vitaly Kurin, Wasi Uddin Ahmad, Wei Du, Wei Ping, Wenliang Dai, Wonmin Byeon, Xiaowei Ren, Yao Xu, Yejin Choi, Yian Zhang, Ying Lin, Yoshi Suhara, Zhiding Yu, Zhiqi Li, Zhiyu Li, Zhongbo Zhu, Zhuolin Yang, Zijia Chen

机构 * NVIDIA

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16697 2025-08-26 cs.CL cs.AI cs.LG 67%

QueryBandits for Hallucination Mitigation: Exploiting Semantic Features for No-Regret Rewriting

Nicole Cho, William Watson, Alec Koppel, Sumitra Ganesh, Manuela Veloso

机构 * JP Morgan AI Research(摩根大通人工智能研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01619 2025-08-22 cs.SE cs.AI cs.CL cs.LG 67%

Learning to Generate Unit Tests for Automated Debugging

Archiki Prasad, Elias Stengel-Eskin, Justin Chih-Yao Chen, Zaid Khan, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to COLM 2025. Dataset and Code: https://github.com/archiki/UTGenDebug

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20840 2025-08-07 cs.AI cs.CL cs.LG cs.SE 67%

CodeTool: Enhancing Programmatic Tool Invocation of LLMs via Process Supervision

Yifei Lu, Fanghua Ye, Jian Li, Qiang Gao, Cheng Liu, Haibo Luo, Nan Du, Xiaolong Li, Feiliang Ren

机构 * Northeastern University(东北大学) Hunyuan AI Digital Human(文英AI数字人)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08088 2025-07-28 cs.CR cs.IR 67%

KGV: Integrating Large Language Models with Knowledge Graphs for Cyber Threat Intelligence Credibility Assessment

Zongzong Wu, Fengxiao Tang, Ming Zhao, Yufeng Li

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02092 2025-07-04 cs.LG cs.AI cs.CL cs.CV 67%

Energy-Based Transformers are Scalable Learners and Thinkers

Alexi Gladstone, Ganesh Nanduru, Md Mofijul Islam, Peixuan Han, Hyeonjeong Ha, Aman Chadha, Yilun Du, Heng Ji, Jundong Li, Tariq Iqbal

机构 * UVA(弗吉尼亚大学) UIUC(伊利诺伊大学香槟分校) Amazon GenAI(亚马逊人工智能) Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14557 2025-07-04 quant-ph cs.MA 67%

Enhancing LLM-based Quantum Code Generation with Multi-Agent Optimization and Quantum Error Correction

Charlie Campbell, Hao Mark Chen, Wayne Luk, Hongxiang Fan

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract)

Comments Paper accepted by DAC'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15254 2025-06-12 cs.LG cs.AI cs.CL 67%

Archon: An Architecture Search Framework for Inference-Time Techniques

Jon Saad-Falcon, Adrian Gamarra Lafuente, Shlok Natarajan, Nahum Maru, Hristo Todorov, Etash Guha, E. Kelly Buchanan, Mayee Chen, Neel Guha, Christopher Ré, Azalia Mirhoseini

机构 * Stanford University, Stanford, CA, USA(斯坦福大学) University of Washington, Seattle, WA, USA(华盛顿大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments International Conference on Machine Learning (ICML) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18380 2025-06-10 cs.LG cs.AI cs.CL 67%

Outlier-weighed Layerwise Sampling for LLM Fine-tuning

Pengxiang Li, Lu Yin, Xiaowei Gao, Shiwei Liu

机构 * Dalian University of Technology(大连理工大学) University of Surrey(Surrey大学) Eindhoven University of Technology(埃因霍温理工大学) University College London(伦敦大学学院) University of Oxford(牛津大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15781 2025-06-04 cs.CL cs.AI cs.LG 67%

Large Language Models to Diffusion Finetuning

Edoardo Cetin, Tianyu Zhao, Yujin Tang

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Camera-ready version, presented at ICML 2025. Code available at: https://github.com/SakanaAI/L2D

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15771 2025-05-30 cs.LG cs.AI cs.CL 67%

Learning to Reason from Feedback at Test-Time

Yanyang Li, Michael Lyu, Liwei Wang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2025 Main; Project Page: https://github.com/LaVi-Lab/FTTT

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01662 2025-05-30 cs.CL cs.AI cs.LG 67%

Fast Large Language Model Collaborative Decoding via Speculation

Jiale Fu, Yuchu Jiang, Junkai Chen, Jiaming Fan, Xin Geng, Xu Yang

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05522 2025-05-29 cs.IR 67%

User Feedback Alignment for LLM-powered Exploration in Large-scale Recommendation Systems

Jianling Wang, Yifan Liu, Yinghao Sun, Xuejian Ma, Yueqi Wang, He Ma, Zhengyang Su, Minmin Chen, Mingyan Gao, Onkar Dalal, Ed H. Chi, Lichan Hong, Ningren Han, Haokai Lu

专题命中 测试时计算 :reasoning(abstract);planning(abstract)

Comments ACL'25 (Industry) Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08725 2025-05-27 cs.SE cs.AI cs.CL cs.LG 67%

DocAgent: A Multi-Agent System for Automated Code Documentation Generation

Dayu Yang, Antoine Simoulin, Xin Qian, Xiaoyi Liu, Yuwei Cao, Zhaopu Teng, Grey Yang

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ACL 2025. Code: github.com/facebookresearch/DocAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03799 2025-05-08 cs.LG cs.AI cs.CL 67%

Scalability Matters: Overcoming Challenges in InstructGLM with Similarity-Degree-Based Sampling

Hyun Lee, Chris Yi, Maminur Islam, B. D. S. Aritra

机构 * Dept. of Computer Science, Trinity College, Hartford, Connecticut, USA(计算机科学系,特里尼蒂学院,哈特福德,康涅狄格州,美国)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To be published in International Joint Conference on Neural Networks (IJCNN), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18624 2025-05-05 cs.CL cs.AI cs.CV cs.LG 67%

Do Vision & Language Decoders use Images and Text equally? How Self-consistent are their Explanations?

Letitia Parcalabescu, Anette Frank

机构 * Computational Linguistics Department(计算语言学系) Heidelberg University(海德堡大学)

专题命中 测试时计算 :CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 30 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06214 2025-04-09 cs.CL cs.AI cs.LG 67%

From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models

Chejian Xu, Wei Ping, Peng Xu, Zihan Liu, Boxin Wang, Mohammad Shoeybi, Bo Li, Bryan Catanzaro

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13447 2025-03-18 cs.CL cs.AI cs.LG 67%

MetaScale: Test-Time Scaling with Evolving Meta-Thoughts

Qin Liu, Wenxuan Zhou, Nan Xu, James Y. Huang, Fei Wang, Sheng Zhang, Hoifung Poon, Muhao Chen

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏