arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1997 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1997 篇

2509.08721 2025-09-11 cs.LG cs.MA 57%

Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing

Jeffrey Amico, Gabriel Passamani Andrade, John Donaghy, Ben Fielding, Tristin Forbus, Harry Grieve, Semih Kara, Jari Kolehmainen, Yihua Lou, Christopher Nies, Edward Phillip Flores Nuño, Diogo Ortega, Shikhar Rastogi, Austin Virts, Matthew J. Wright

机构 * Gensyn AI Team(Gensyn AI团队)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17656 2025-09-09 cs.CL 57%

Too Consistent to Detect: A Study of Self-Consistent Errors in LLMs

Hexiang Tan, Fei Sun, Sha Liu, Du Su, Qi Cao, Xin Chen, Jingang Wang, Xunliang Cai, Yuanzhuo Wang, Huawei Shen, Xueqi Cheng

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12583 2025-09-09 cs.CL 57%

Process-Supervised Reward Models for Verifying Clinical Note Generation: A Scalable Approach Guided by Domain Expertise

Hanyin Wang, Chufan Gao, Qiping Xu, Bolun Liu, Guleid Hussein, Hariprasad Korsapati, Mohamad El Labban, Kingsley Iheasirim, Mohamed Hassan, Gokhan Anil, Brian Bartlett, Jimeng Sun

机构 * Mayo Clinic Health System(梅奥诊所健康系统) School of Computing and Data Science, UIUC(UIUC计算与数据科学学院) Carle Illinois College of Medicine, UIUC(UIUC卡勒医学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02133 2025-09-03 cs.CL 57%

AMBEDKAR-A Multi-level Bias Elimination through a Decoding Approach with Knowledge Augmentation for Robust Constitutional Alignment of Language Models

Snehasis Mukhopadhyay, Aryan Kasat, Shivam Dubey, Rahul Karthikeyan, Dhruv Sood, Vinija Jain, Aman Chadha, Amitava Das

机构 * Indian Institute of Information Technology, Kalyani(印度信息技术学院,卡里尼) BITS Pilani Goa(比尔·斯图尔特学院,果阿) IIT Madras(马德拉斯理工学院) DTU(达丁理工大学) Artificial Intelligence Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) Meta AI Amazon GenAI(亚马逊生成人工智能)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02033 2025-09-03 cs.CL 57%

StructCoh: Structured Contrastive Learning for Context-Aware Text Semantic Matching

Chao Xue, Ziyuan Gao

机构 * Beihang University, Beijing, China(北京航空航天大学) University College London, London, UK(伦敦大学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments Accepted by PRICAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20587 2025-08-29 cs.IR cs.LG 57%

SemSR: Semantics aware robust Session-based Recommendations

Jyoti Narwariya, Priyanka Gupta, Muskan Gupta, Jyotsana Khatri, Lovekesh Vig

机构 * TCS Research(TCS研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments Accepted at EARL workshop @RecSys'25, Prague, Czech Republic

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17250 2025-08-26 cs.CL cs.IR 57%

Routing Distilled Knowledge via Mixture of LoRA Experts for Large Language Model based Bundle Generation

Kaidong Feng, Zhu Sun, Hui Fang, Jie Yang, Wenyuan Liu, Yew-Soon Ong

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15260 2025-08-22 cs.LG 57%

Deep Think with Confidence

Yichao Fu, Xuewei Wang, Yuandong Tian, Jiawei Zhao

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07441 2025-08-22 cs.CL 57%

SAND: Boosting LLM Agents with Self-Taught Action Deliberation

Yu Xia, Yiran Shen, Junda Wu, Tong Yu, Sungchul Kim, Ryan A. Rossi, Lina Yao, Julian McAuley

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14784 2025-08-19 cs.CV cs.AI 57%

LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering

Xinxin Dong, Baoyun Peng, Haokai Ma, Yufei Wang, Zixuan Dong, Fei Hu, Xiaodong Wang

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22648 2025-08-12 cs.CL 57%

WebDancer: Towards Autonomous Information Seeking Agency

Jialong Wu, Baixuan Li, Runnan Fang, Wenbiao Yin, Liwen Zhang, Zhengwei Tao, Dingchu Zhang, Zekun Xi, Gang Fu, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

机构 * Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06124 2025-08-11 cs.CL 57%

AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models

Sayantan Adak, Pratyush Chatterjee, Somnath Banerjee, Rima Hazra, Somak Aditya, Animesh Mukherjee

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08567 2025-08-08 cs.LG 57%

AbbIE: Autoregressive Block-Based Iterative Encoder for Efficient Sequence Modeling

Preslav Aleksandrov, Meghdad Kurmanji, Fernando Garcia Redondo, David O'Shea, William Shen, Alex Iacob, Lorenzo Sani, Xinchi Qiu, Nicola Cancedda, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) Meta

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments 14 pages and 6 figures. Submitted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14448 2025-08-07 cs.CL 57%

How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison

Jiayin Wang, Zhiquang Guo, Weizhi Ma, Min Zhang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15299 2025-08-07 cs.CL 57%

Inside-Out: Hidden Factual Knowledge in LLMs

Zorik Gekhman, Eyal Ben David, Hadas Orgad, Eran Ofek, Yonatan Belinkov, Idan Szpektor, Jonathan Herzig, Roi Reichart

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19679 2025-07-29 cs.CV cs.AI 57%

Efficient Learning for Product Attributes with Compact Multimodal Models

Mandar Kulkarni

机构 * Flipkart Data Science(Flipkart数据科学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15974 2025-07-23 cs.AI 57%

Does More Inference-Time Compute Really Help Robustness?

Tong Wu, Chong Xiang, Jiachen T. Wang, Weichen Yu, Chawin Sitawarin, Vikash Sehwag, Prateek Mittal

机构 * Princeton University(普林斯顿大学) NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11476 2025-07-22 cs.CL 57%

FastMCTS: A Simple Sampling Strategy for Data Synthesis

Peiji Li, Kai Lv, Yunfan Shao, Yichuan Ma, Linyang Li, Xiaoqing Zheng, Xipeng Qiu, Qipeng Guo

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14202 2025-07-22 cs.CR cs.AI 57%

PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training

Pengfei Du

机构 * Pengfei Du(独立研究者)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18439 2025-07-15 cs.AI 57%

MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning

Chanwoo Park, Seungju Han, Xingzhi Guo, Asuman Ozdaglar, Kaiqing Zhang, Joo-Kyung Kim

机构 * MIT(麻省理工学院) Stanford(斯坦福大学) Amazon(亚马逊) UMD(大学公园大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

Comments version for ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04557 2025-07-09 cs.LG cs.IT math.IT 57%

Speeding up Speculative Decoding via Sequential Approximate Verification

Meiyu Zhong, Noel Teku, Ravi Tandon

机构 * Department of Electrical and Computer Engineering, University of Arizona, Tucson, US(电气与计算机工程系,亚利桑那大学,图森,美国)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

Comments ICML 2025, Workshop on Efficient Systems for Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17811 2025-07-08 cs.RO cs.AI cs.SY eess.SY 57%

RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models

Jacky Kwok, Christopher Agia, Rohan Sinha, Matt Foutter, Shulu Li, Ion Stoica, Azalia Mirhoseini, Marco Pavone

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA Research(NVIDIA研究)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12446 2025-07-01 cs.CL 57%

From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment

Bin Xie, Bingbing Xu, Yige Yuan, Shengmao Zhu, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室、计算技术研究所、中国科学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13271 2025-07-01 cs.CL 57%

CSC-SQL: Corrective Self-Consistency in Text-to-SQL via Reinforcement Learning

Lei Sheng, Shuai-Shuai Xu

机构 * Wuhan University of Technology(武汉理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :self-correction(abstract);分类 cs.CL

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20112 2025-06-26 cs.CL 57%

A Multi-Pass Large Language Model Framework for Precise and Efficient Radiology Report Error Detection

Songsoo Kim, Seungtae Lee, See Young Lee, Joonho Kim, Keechan Kan, Dukyong Yoon

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

Comments 29 pages, 5 figures, 4 tables. Code available at https://github.com/radssk/mp-rred

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19724 2025-06-25 cs.AI 57%

From Reproduction to Replication: Evaluating Research Agents with Progressive Code Masking

Gyeongwon James Kim, Alex Wilf, Louis-Philippe Morency, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18781 2025-06-24 cs.CL 57%

Existing LLMs Are Not Self-Consistent For Simple Tasks

Zhenru Lin, Jiawen Tao, Yang Yuan, Andrew Chi-Chih Yao

机构 * IIIS, Tsinghua University(清华大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Qizhi Institute(上海启智研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16507 2025-06-23 cs.LG 57%

Robust Reward Modeling via Causal Rubrics

Pragya Srivastava, Harman Singh, Rahul Madhavan, Gandharv Patil, Sravanti Addepalli, Arun Suggala, Rengarajan Aravamudhan, Soumya Sharma, Anirban Laha, Aravindan Raghuveer, Karthikeyan Shanmugam, Doina Precup

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13363 2025-06-17 cs.CL 57%

Efficient Medical VIE via Reinforcement Learning

Lijun Liu, Ruiyang Li, Zhaocheng Liu, Chenglin Zhu, Chong Li, Jiehan Cheng, Qiang Ju, Jian Xie

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11021 2025-06-16 cs.SE cs.AI 57%

Eliminating Hallucination-Induced Errors in LLM Code Generation with Functional Clustering

Chaitanya Ravuri, Saman Amarasinghe

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏