arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2601.06122 2026-01-13 cs.CV cs.AI cs.LG 62%

COVR:Collaborative Optimization of VLMs and RL Agent for Visual-Based Control

COVR:视觉控制中视觉语言模型与强化学习代理的协同优化

Canming Xia, Peixi Peng, Guang Tan, Zhan Su, Haoran Xu, Zhenxian Liu, Luntong Li

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 COVR通过协同优化视觉语言模型与强化学习代理,利用RL生成数据提升VLM语义推理能力,并通过动作先验引导策略学习,实现视觉控制任务中的高效优化。

Comments The paper was accepted by the Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02212 2026-01-13 cs.LG cs.AI 62%

DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement Learning

DiFFPO:通过强化学习训练扩散大语言模型以快速且高效地推理

Hanyang Zhao, Dawen Liang, Wenpin Tang, David Yao, Nathan Kallus

机构 * Columbia University(哥伦比亚大学) Netflix

专题命中 测试时计算 :planning(abstract);分类 cs.AI、cs.LG

AI总结 DiFFPO通过强化学习训练扩散大语言模型,使其在推理速度和准确性上取得平衡,提升推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12704 2026-01-13 cs.CL cs.AI 62%

Flexible Realignment of Language Models

语言模型的灵活重校准

Wenhong Zhu, Ruobing Xie, Weinan Zhang, Rui Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出灵活的重校准框架,通过训练和推理时的可控对齐方法,提升语言模型的性能和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23852 2026-01-01 cs.LG cs.CL 62%

Trellis: Learning to Compress Key-Value Memory in Attention Models

Trellis: 在注意力模型中学习压缩键值记忆

Mahdi Karami, Ali Behrouz, Praneeth Kacham, Vahab Mirrokni

机构 * Google Research(谷歌研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Trellis通过动态压缩键值内存提升注意力模型的效率与长上下文处理能力

Comments In Second Conference on Language Modeling (COLM) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23707 2025-12-30 cs.LG cs.CL cs.HC 62%

Training AI Co-Scientists Using Rubric Rewards

利用评分奖励训练AI合作者

Shashwat Goel, Rishi Hazra, Dulhan Jayalath, Timon Willi, Parag Jain, William F. Shen, Ilias Leontiadis, Francesco Barbieri, Yoram Bachrach, Jonas Geiping, Chenxi Whitehouse

机构 * Meta Superintelligence Labs(Meta超智能实验室) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Oxford(牛津大学) University of Cambridge(剑桥大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用评分奖励训练AI合作者,通过自动生成研究计划并改进模型性能,实现跨领域泛化和高效训练。

Comments 11 pages in the main paper, total 119 including sample outputs in the Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24511 2025-12-23 cs.LG cs.AI 62%

Can Slow-thinking LLMs Reason Over Time? Empirical Studies in Time Series Forecasting

慢思考LLM能否在时间上进行推理?时间序列预测的实证研究

Mingyue Cheng, Jiahao Wang, Daoyu Wang, Xiaoyu Tao, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨慢思考LLM能否在时间序列预测中进行推理,通过实验证明其零样本预测能力,揭示LLM在时间动态上的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07710 2025-12-09 cs.AI cs.LG 62%

Each Prompt Matters: Scaling Reinforcement Learning Without Wasting Rollouts on Hundred-Billion-Scale MoE

每个提示都重要:在百亿规模MoE上扩展强化学习而不浪费回放

Anxiang Zeng, Haibo Zhang, Hailing Zhang, Kaixiang Mo, Liang Yao, Ling Hu, Long Zhang, Shuman Liu, Shuyi Xie, Yanshi Li, Yizhang Chen, Yuepeng Sheng, Yuwei Huang, Zhaochen Xu, Zhiqiang Zhou, Ziqin Liew

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种百亿规模MoE模型的强化学习方法,通过消除无效提示、优化重要性采样和提升回放效率,实现了高效稳定的训练流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03099 2025-12-04 quant-ph cs.AI cs.LG 62%

QGShap: Quantum Acceleration for Faithful GNN Explanations

QGShap:用于忠实图神经网络解释的量子加速

Haribandhu Jena, Jyotirmaya Shivottam, Subhankar Mishra

机构 * School of Computer Sciences(计算机科学学院) National Institute of Science Education and Research(国家科学教育与研究 institute) An OCC of Homi Bhabha National Institute, India(印度霍米·巴哈瓦国家研究所的分支)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 QGShap通过量子计算实现图神经网络解释的加速,提供精确且高效的Shapley值计算,提升解释的保真度和准确性。

Comments Accepted in the QC+AI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12482 2025-12-04 cs.SE cs.AI cs.CE cs.LG 62%

Kodezi Chronos: A Debugging-First Language Model for Repository-Scale Code Understanding

Kodezi Chronos:面向仓库级代码理解的调试优先语言模型

Ishraq Khan, Assad Chowdary, Sharoz Haseeb, Urvish Patel, Yousuf Zaii

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Kodezi Chronos-1是一种专为调试设计的语言模型,通过自适应图引导检索、持久调试内存和七层架构,在多文件调试任务中达到67.3%的修复准确率,超越现有模型并实现仓库特定的高解决率。

Comments 24 figures, 43 tables, 2 algorithms. Extended technical report introducing Chronos-1, a debugging-specific language model. Information available at https://github.com/Kodezi/chronos

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17989 2025-12-02 cs.LG cs.AI 62%

Outcome-based Reinforcement Learning to Predict the Future

基于结果的强化学习用于预测未来

Benjamin Turtel, Danny Franklin, Kris Skotheim, Luke Hewitt, Philipp Schoenegger

机构 * Lightning Rod Labs Stanford University(斯坦福大学) London School of Economics and Political Science(伦敦政治经济学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于结果的强化学习方法,通过训练紧凑模型提升预测准确性并增强概率校准,实验证明其在预测市场中的实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01187 2025-12-02 cs.LG cs.AI 62%

Teaching by Failure: Counter-Example-Driven Curricula for Transformer Self-Improvement

通过失败教学:基于反例的课程学习以提升Transformer自改进能力

Harshil Vejendla

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于反例的课程学习方法CEDC,通过迭代聚焦模型自身失败来提升Transformer模型在复杂输入下的鲁棒性和外推能力。

Comments AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18477 2025-11-27 cs.IR cs.AI cs.LG 62%

Personalized Image Generation for Recommendations Beyond Catalogs

推荐超越目录的个性化图像生成

Gabriel Patron, Zhiwei Xu, Ishan Kapnadak, Felipe Maia Polo

机构 * University of Michigan(密歇根大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 REBECA通过直接学习隐含反馈信号实现高效个性化图像生成,无需微调扩散模型,提升大规模用户群体的个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13640 2025-11-18 cs.LG cs.AI 62%

Data Value in the Age of Scaling: Understanding LLM Scaling Dynamics Under Real-Synthetic Data Mixtures

Haohui Wang, Jingyuan Qi, Jianpeng Chen, Jun Wu, Lifu Huang, Lecheng Zheng, Kevin Choi, Balaji Veeramani, Edward Bowen, Alison Hu, Tyler Cody, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) Michigan State University(密歇根州立大学) University of California, Davis(加州大学戴维斯分校) Deloitte(德勤)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10658 2025-11-17 cs.CL cs.AI 62%

Evaluating Open-Weight Large Language Models for Structured Data Extraction from Narrative Medical Reports Across Multiple Use Cases and Languages

Douwe J. Spaanderman, Karthik Prathaban, Petr Zelina, Kaouther Mouheb, Lukáš Hejtmánek, Matthew Marzetti, Antonius W. Schurink, Damian Chan, Ruben Niemantsverdriet, Frederik Hartmann, Zhen Qian, Maarten G. J. Thomeer, Petr Holub, Farhan Akram, Frank J. Wolters, Meike W. Vernooij, Cornelis Verhoef, Esther E. Bron, Vít Nováček, Dirk J. Grünhagen, Wiro J. Niessen, Martijn P. A. Starmans, Stefan Klein

机构 * Department of Radiology and Nuclear Medicine, Erasmus MC Cancer Institute, University Medical Center Rotterdam, the Netherlands(荷兰埃因霍温麦斯特大学医学中心放射科和核医学科,埃因霍温麦斯特癌症研究所) Department of Pathology and Clinical Bioinformatics, Erasmus MC Cancer Institute, University Medical Center Rotterdam, the Netherlands(荷兰埃因霍温麦斯特大学医学中心病理学与临床生物信息学科,埃因霍温麦斯特癌症研究所) Faculty of Informatics, Masaryk University(马萨里克大学信息学院) Institute of Computer Science, Masaryk University(马萨里克大学计算机科学研究所) Department of Medical Physics, Leeds Teaching Hospitals NHS Trust, UK(英国利兹教学医院国家卫生服务信托基金,利兹大学生物医学研究中心) Leeds Biomedical Research Centre, University of Leeds, UK(利兹大学生物医学成像科,利兹,英国) Biomedical Imaging, University of Leeds, Leeds, United Kingdom(荷兰埃因霍温麦斯特大学医学中心外科肿瘤学和胃肠外科科,埃因霍温麦斯特癌症研究所) Department of Surgical Oncology and Gastrointestinal Surgery, Erasmus MC Cancer Institute, University Medical Center Rotterdam, the Netherlands(奥地利格拉茨BBMRI-ERIC机构) BBMRI-ERIC, Graz, Austria(荷兰埃因霍温麦斯特大学医学中心流行病学系,罗特万,荷兰) Department of Epidemiology, Erasmus MC University Medical Center, Rotterdam, the Netherlands(马萨里克纪念癌症研究所生物信息学研究组) Bioinformatics Research Group, Masaryk Memorial Cancer Institute

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03262 2025-11-11 cs.CL cs.LG 62%

REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization

Jian Hu, Jason Klein Liu, Haotian Xu, Wei Shen

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Comments refactor

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05589 2025-11-11 cs.LG cs.AI 62%

CoPRIS: Efficient and Stable Reinforcement Learning via Concurrency-Controlled Partial Rollout with Importance Sampling

Zekai Qu, Yinxu Pan, Ao Sun, Chaojun Xiao, Xu Han

机构 * OpenBMB(开放智能实验室) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05345 2025-11-10 cs.LG cs.CL 62%

Inference-Time Hyper-Scaling with KV Cache Compression

Adrian Łańcucki, Konrad Staniszewski, Piotr Nawrot, Edoardo M. Ponti

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09338 2025-11-10 stat.ML cs.AI cs.LG 62%

Know What You Don't Know: Uncertainty Calibration of Process Reward Models

Young-Jin Park, Kristjan Greenewald, Kaveh Alim, Hao Wang, Navid Azizan

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Red Hat AI Innovation(红帽人工智能创新)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04825 2025-11-06 cs.GR cs.AI cs.CV cs.LG 62%

Voost: A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off

Seungyong Lee, Jeong-gi Kwak

机构 * NXN Labs(NXN实验室) University of British Columbia(不列颠哥伦比亚大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted to SIGGRAPH Asia 2025, project page: https://nxnai.github.io/Voost/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02309 2025-11-05 cs.LG cs.AI 62%

The Sequential Edge: Inverse-Entropy Voting Beats Parallel Self-Consistency at Matched Compute

Aman Sharma, Paras Chopra

机构 * Lossfunk

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01281 2025-11-05 cs.CL cs.AI 62%

Path-Consistency with Prefix Enhancement for Efficient Inference in LLMs

Jiace Zhu, Yuanzhe Huang, Yingtao Shen, Jie Zhao, An Zou

机构 * Shanghai Jiao Tong University(上海交通大学) Microsoft Corporation(微软公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04463 2025-11-05 cs.LG cs.CL 62%

Training Language Models to Reason Efficiently

Daman Arora, Andrea Zanette

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21590 2025-11-04 cs.CL cs.LG 62%

Representation Consistency for Accurate and Coherent LLM Answer Aggregation

Junqi Jiang, Tom Bewley, Salim I. Amoukou, Francesco Leofante, Antonio Rago, Saumitra Mishra, Francesca Toni

机构 * Imperial College London(帝国理工学院伦敦分校) J.P. Morgan AI Research(摩根大通人工智能研究) King’s College London(国王学院伦敦分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted at NeurIPS 2025. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01093 2025-11-04 cs.LG cs.AI 62%

Continual Learning, Not Training: Online Adaptation For Agents

Aman Jaglan, Jarrod Barnes

机构 * Arc Intelligence

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01082 2025-11-04 cs.CV cs.AI cs.LG 62%

GeoToken: Hierarchical Geolocalization of Images via Next Token Prediction

Narges Ghasemi, Amir Ziashahabi, Salman Avestimehr, Cyrus Shahabi

机构 * of Computer Science, University of Southern California, Los Angeles, CA, USA Computer Engineering, University of Southern California, Los Angeles, CA, USA

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI、cs.LG

Comments Accepted to IEEE International Conference on Data Mining (ICDM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00711 2025-11-04 cs.LG cs.AI 62%

TRISKELION-1: Unified Descriptive-Predictive-Generative AI

Nardeep Kumar, Arun Kanwar

机构 * Independent Machine Learning Researcher(独立研究者)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 18 figures, submitted to arXiv (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26995 2025-11-03 stat.ME cs.AI cs.LG 62%

LLMs are Overconfident: Evaluating Confidence Interval Calibration with FermiEval

Elliot L. Epstein, John Winnicki, Thanawat Sornwanee, Rajat Dwaraknath

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14276 2025-11-03 cs.AI cs.LG 62%

Don't throw the baby out with the bathwater: How and why deep learning for ARC

Jack Cole, Mohamed Osman

机构 * Mindware Consulting, Inc.(Mindware咨询公司) MindsAI Tufa Labs(Tufa实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11261 2025-10-24 cs.AI cs.CL 62%

Sycophancy in Vision-Language Models: A Systematic Analysis and an Inference-Time Mitigation Framework

Yunpu Zhao, Rui Zhang, Junbin Xiao, Changxin Ke, Ruibo Hou, Yifan Hao, Ling Li

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(处理器国家重点实验室,中国科学院计算技术研究所) Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Intelligent Software Research Center, Institute of Software, Chinese Academy of Sciences(软件智能研究中心,中国科学院软件研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Journal ref Neurocomputing, Volume 659, 2026, 131217

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14827 2025-10-24 cs.CL cs.AI 62%

Text Generation Beyond Discrete Token Sampling

Yufan Zhuang, Liyuan Liu, Chandan Singh, Jingbo Shang, Jianfeng Gao

机构 * UC San Diego(加州大学圣地亚哥分校) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏