arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2305.09781 2024-04-02 cs.CL cs.DC cs.LG 62%

SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification

Xupeng Miao, Gabriele Oliaro, Zhihao Zhang, Xinhao Cheng, Zeyu Wang, Zhengxin Zhang, Rae Ying Yee Wong, Alan Zhu, Lijie Yang, Xiaoxiang Shi, Chunan Shi, Zhuoming Chen, Daiyaan Arfeen, Reyna Abhyankar, Zhihao Jia

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

Comments ASPLOS'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18284 2024-03-05 cs.CL cs.AI 62%

Is Crowdsourcing Breaking Your Bank? Cost-Effective Fine-Tuning of Pre-trained Language Models with Proximal Policy Optimization

Shuo Yang, Gjergji Kasneci

专题命中 测试时计算 :self-correction(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19475 2024-03-01 cs.SE cs.AI cs.LG 62%

The Counterfeit Conundrum: Can Code Language Models Grasp the Nuances of Their Incorrect Generations?

Alex Gu, Wen-Ding Li, Naman Jain, Theo X. Olausson, Celine Lee, Koushik Sen, Armando Solar-Lezama

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 54 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19371 2024-03-01 cs.CL cs.AI cs.IR 62%

OpenMedLM: Prompt engineering can out-perform fine-tuning in medical question-answering with open-source large language models

Jenish Maharjan, Anurag Garikipati, Navan Preet Singh, Leo Cyrus, Mayank Sharma, Madalina Ciobanu, Gina Barnes, Rahul Thapa, Qingqing Mao, Ritankar Das

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09342 2024-02-14 cs.PL cs.AI cs.CL cs.SE 62%

Ranking LLM-Generated Loop Invariants for Program Verification

Saikat Chakraborty, Shuvendu K. Lahiri, Sarah Fakhoury, Madanlal Musuvathi, Akash Lal, Aseem Rastogi, Aditya Senthilnathan, Rahul Sharma, Nikhil Swamy

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

Comments Findings of The 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP-findings 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13426 2024-01-18 cs.CL cs.AI 62%

A Chat About Boring Problems: Studying GPT-based text normalization

Yang Zhang, Travis M. Bartley, Mariana Graterol-Fuenmayor, Vitaly Lavrukhin, Evelina Bakhturina, Boris Ginsburg

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08398 2023-11-17 cs.CL cs.AI 62%

Are Large Language Models Temporally Grounded?

Yifu Qiu, Zheng Zhao, Yftah Ziser, Anna Korhonen, Edoardo M. Ponti, Shay B. Cohen

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12836 2023-10-20 cs.CL cs.LG 62%

Knowledge-Augmented Language Model Verification

Jinheon Baek, Soyeong Jeong, Minki Kang, Jong C. Park, Sung Ju Hwang

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10403 2023-09-15 cs.CL cs.AI 62%

PaLM 2 Technical Report

Rohan Anil, Andrew M. Dai, Orhan Firat, Melvin Johnson, Dmitry Lepikhin, Alexandre Passos, Siamak Shakeri, Emanuel Taropa, Paige Bailey, Zhifeng Chen, Eric Chu, Jonathan H. Clark, Laurent El Shafey, Yanping Huang, Kathy Meier-Hellstern, Gaurav Mishra, Erica Moreira, Mark Omernick, Kevin Robinson, Sebastian Ruder, Yi Tay, Kefan Xiao, Yuanzhong Xu, Yujing Zhang, Gustavo Hernandez Abrego, Junwhan Ahn, Jacob Austin, Paul Barham, Jan Botha, James Bradbury, Siddhartha Brahma, Kevin Brooks, Michele Catasta, Yong Cheng, Colin Cherry, Christopher A. Choquette-Choo, Aakanksha Chowdhery, Clément Crepy, Shachi Dave, Mostafa Dehghani, Sunipa Dev, Jacob Devlin, Mark Díaz, Nan Du, Ethan Dyer, Vlad Feinberg, Fangxiaoyu Feng, Vlad Fienber, Markus Freitag, Xavier Garcia, Sebastian Gehrmann, Lucas Gonzalez, Guy Gur-Ari, Steven Hand, Hadi Hashemi, Le Hou, Joshua Howland, Andrea Hu, Jeffrey Hui, Jeremy Hurwitz, Michael Isard, Abe Ittycheriah, Matthew Jagielski, Wenhao Jia, Kathleen Kenealy, Maxim Krikun, Sneha Kudugunta, Chang Lan, Katherine Lee, Benjamin Lee, Eric Li, Music Li, Wei Li, YaGuang Li, Jian Li, Hyeontaek Lim, Hanzhao Lin, Zhongtao Liu, Frederick Liu, Marcello Maggioni, Aroma Mahendru, Joshua Maynez, Vedant Misra, Maysam Moussalem, Zachary Nado, John Nham, Eric Ni, Andrew Nystrom, Alicia Parrish, Marie Pellat, Martin Polacek, Alex Polozov, Reiner Pope, Siyuan Qiao, Emily Reif, Bryan Richter, Parker Riley, Alex Castro Ros, Aurko Roy, Brennan Saeta, Rajkumar Samuel, Renee Shelby, Ambrose Slone, Daniel Smilkov, David R. So, Daniel Sohn, Simon Tokumine, Dasha Valter, Vijay Vasudevan, Kiran Vodrahalli, Xuezhi Wang, Pidong Wang, Zirui Wang, Tao Wang, John Wieting, Yuhuai Wu, Kelvin Xu, Yunhan Xu, Linting Xue, Pengcheng Yin, Jiahui Yu, Qiao Zhang, Steven Zheng, Ce Zheng, Weikang Zhou, Denny Zhou, Slav Petrov, Yonghui Wu

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00667 2023-09-06 cs.CL cs.LG 62%

Taken out of context: On measuring situational awareness in LLMs

Lukas Berglund, Asa Cooper Stickland, Mikita Balesni, Max Kaufmann, Meg Tong, Tomasz Korbak, Daniel Kokotajlo, Owain Evans

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07968 2023-06-14 cs.CL cs.AI 62%

arXiVeri: Automatic table verification with GPT

Gyungin Shin, Weidi Xie, Samuel Albanie

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01447 2023-04-05 cs.MA cs.AI cs.LG 62%

Off-Policy Action Anticipation in Multi-Agent Reinforcement Learning

Ariyan Bighashdel, Daan de Geus, Pavol Jancura, Gijs Dubbelman

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.10661 2022-05-24 cs.CL cs.AI 62%

An Empirical Investigation of Commonsense Self-Supervision with Knowledge Graphs

Jiarui Zhang, Filip Ilievski, Kaixin Ma, Jonathan Francis, Alessandro Oltramari

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.04000 2021-08-19 cs.AI cs.LG 62%

Off-Belief Learning

Hengyuan Hu, Adam Lerer, Brandon Cui, David Wu, Luis Pineda, Noam Brown, Jakob Foerster

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.09694 2020-12-14 cs.CL cs.AI cs.IR 62%

Retrospective Reader for Machine Reading Comprehension

Zhuosheng Zhang, Junjie Yang, Hai Zhao

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

Comments Accepted by AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.09443 2020-04-20 cs.LG cs.AI stat.ML 62%

Deep Sets for Generalization in RL

Tristan Karch, Cédric Colas, Laetitia Teodorescu, Clément Moulin-Frier, Pierre-Yves Oudeyer

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 10 figures, published as a workshop Paper at ICLR: Beyond tabula rasa in RL (BeTR-RL). arXiv admin note: substantial text overlap with arXiv:2002.09253

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.03911 2018-02-13 cs.CL cs.IR cs.LG stat.ML 62%

Stochastic Learning of Nonstationary Kernels for Natural Language Modeling

Sahil Garg, Greg Ver Steeg, Aram Galstyan

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10827 2026-06-17 cs.AI 版本更新 61%

Know Thy Reasoner: Not All Language Models Explore Alike

你的模型多样性,而非方法,决定推理策略

Moulik Choraria, Argyrios Gerogiannis, Anirban Das, Supriyo Chakraborty, Sourya Basu, Sambit Sahu, Lav R. Varshney

机构 * UIUC(伊利诺伊大学香槟分校) Capital One

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.AI

AI总结 本文提出模型多样性影响推理策略,通过理论框架分析推理不确定性,验证了不同模型在深度精炼和并行采样中的表现差异。

Comments This is a full-length extension of the workshop paper that appeared in the ICLR 2026 Workshop on LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02603 2026-06-10 cs.CL 版本更新 61%

CGES: Confidence-Guided Early Stopping for Efficient and Accurate Self-Consistency

CGES:面向高效准确自一致性的置信引导早停方法

Ehsan Aghazadeh, Ahmad Ghasemi, Hedyeh Beyhaghi, Hossein Pishro-Nik

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.CL

AI总结 提出贝叶斯框架CGES,通过自适应停止采样减少自一致性推理调用次数,在5个推理基准上平均减少58%调用且精度损失仅0.4个百分点。

Comments Extended version. A preliminary version was accepted at the Efficient Reasoning Workshop @ NeurIPS 2025. Code: https://github.com/EhsanAghazadeh/cges

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17417 2026-01-07 cs.LG 61%

Aha Moment Revisited: Are VLMs Truly Capable of Self Verification in Inference-time Scaling?

顿悟时刻再审视:VLMs在推理时间缩放中真的能自我验证吗?

Mingyuan Wu, Meitang Li, Jingcheng Yang, Jize Jiang, Kaizhuo Yan, Zhaoheng Li, Hanchao Yu, Minjia Zhang, Klara Nahrstedt

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Meta

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.LG

AI总结 本研究发现VLMs在推理时间缩放中自我验证效果有限,生成能力优于验证策略,且视觉信息整合不足。

Comments Neurips 2025 Multimodal Algorithmic Reasoning Workshop Oral. In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15986 2025-11-25 cs.CV cs.CY cs.LG 61%

Fairness in Multi-modal Medical Diagnosis with Demonstration Selection

多模态医学诊断中的公平性与演示选择

Dawei Li, Zijian Gu, Peng Wang, Chuhan Song, Zhen Tan, Mohan Zhang, Tianlong Chen, Yu Tian, Song Wang

机构 * Arizona State University(亚利桑那州立大学) University of Rochester(罗切斯特大学) University of Virginia(弗吉尼亚大学) UCL(伦敦大学学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Central Florida(佛罗里达中央大学)

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.LG

AI总结 本文提出FADS方法,通过基于聚类的采样提升多模态医学影像诊断的公平性,减少性别、种族和族裔相关差异,同时保持高准确性。

Comments 10 pages (including 2 pages of references), 4 figures. This work explores fairness in multi-modal medical image reasoning using in-context learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16889 2026-08-18 cs.RO cs.AI cs.CV 新提交 57%

Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory

不要放弃BATON:通过智能体子任务探索和感知转换的记忆实现长程机器人操作

Bingxin Xu, Yuzhang Shang, Emilio Ferrara

机构 * University of Southern California(南加州大学) University of Central Florida(中佛罗里达大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究针对长程机器人操作的误差累积与子任务转换问题,提出BATON方法,通过子任务探索与感知转换记忆,在RoboMemArena基准上提升任务成功率11.6%、累计成功率14.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16739 2026-08-18 cs.LG 新提交 57%

Le Critique: Privileged Value Functions for LLM Reinforcement Learning

Le Critique:用于大语言模型强化学习的特权值函数

Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison

机构 * Mistral AI(米斯特拉尔人工智能公司) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对 LLM 强化学习的值函数应用难题,提出特权值函数(PVF)与自适应插值基线 TETHER,在多推理任务中提升了值函数基线性能,表现优于或媲美 GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15354 2026-08-18 cs.AI 新提交 57%

Incoherent by Design? On the Moral Self-Consistency of LLMs

天生不连贯?大型语言模型的道德自我一致性研究

Pegah Nokhiz, Aravinda Kanchana Ruwanpathirana, Helen Nissenbaum

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技学院) Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对GPT、Mistral、Llama等LLM,在义务论等三大伦理框架下,发现其道德推理存在最高78%的矛盾率,内部不连贯是AI对齐的必要前提。

Comments 88 pages; pages 16 to 88 are the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15065 2026-08-18 cs.AI 新提交 57%

Funnel of Thoughts: Efficient Test-Time Scaling via Early Voting and Rollout Pruning

思维漏斗:通过提前投票和展开剪枝实现高效测试时缩放

Chanhee Park, Sungbin Han, Jeongho Yoon, Seongtae Hong, Heuiseok Lim

机构 * Korea University(高丽大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 针对大型推理模型多样本推理成本过高的问题,提出FoT方法,通过识别犹豫信号剪枝无产出轨迹,在保持准确率的同时大幅降低推理成本且可跨架构和任务迁移。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14825 2026-08-18 cs.MA cs.AI 新提交 57%

Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce

长视野多智能体大语言模型商业环境中涌现的对齐失效通信

Zeyuan Li, Lukas Petersson, Alessandro Acquisti, Michiel A. Bakker

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08802 2026-08-17 cs.AI 版本更新 57%

Improving Generalization Robustness of Multimodal RLVR

提升多模态RLVR的泛化鲁棒性

Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) University of California Berkeley(加州大学伯克利分校) Rochester Institute of Technology(罗切斯特理工学院) Georgia Institute of Technology(佐治亚理工学院) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13076 2026-08-14 cs.AI 新提交 57%

SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference

SPADE:用于精确且低成本分布式边缘云推理的推测解码

Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar Hanawal

机构 * IIT Bombay(印度理工学院孟买分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 SPADE是一种集成推测解码的分布式边缘云推理框架,通过边缘草稿模型与云端验证模型的协作,减少76%云端模型调用且不损失准确率,降低了LLM部署的成本与推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12898 2026-08-14 cs.CV cs.AI 新提交 57%

NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航

Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang, Meng Tong, Zhongjiang He, Hao Sun

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12679 2026-08-14 cs.AI cs.NE 新提交 57%

Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies

超越最佳猜测:用进化策略提升大语言模型的解决方案覆盖率

Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cognizant AI Lab(高知特人工智能实验室)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI

AI总结 该研究针对LLM后训练中RL导致pass@k受限、解决方案覆盖率不足的问题,采用进化策略(ES)方法,提升了pass@k与解决方案覆盖率,在数学基准上取得更好结果,为相关领域后训练提供了更好基础。

详情

展开后加载摘要…

URL PDF HTML 收藏