arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2510.05379 2025-10-09 cs.CR cs.AI 76%

AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling

Xiaogeng Liu, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 测试时计算 :reasoning(title,comments);分类 cs.AI

Comments Technical report. Code is available at https://github.com/SaFoLab-WISC/AutoDAN-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24937 2026-07-28 cs.AI cs.CL cs.IR cs.LG 版本更新 75%

The Hitchhiker's Guide to Agentic AI: From Foundations to Systems

《智能体AI的搭车指南:从基础到系统》

Haggai Roitman

机构 * Haggai Roitman

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。

Comments version 1.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12634 2026-07-15 cs.LG cs.AI cs.CL 版本更新 75%

Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents

保持策略梯度主导:面向长程工具使用智能体的兄弟引导信用蒸馏

Tianyu Ding, Jianhong Xin, Juan Pablo De la Cruz Weinstein

机构 * Amazon Web Services(亚马逊云服务)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长程工具使用强化学习中轨迹级优势信号稀疏的问题,提出兄弟引导信用蒸馏(SGCD),通过动态采样成功与失败轨迹、外部LLM对比生成逐步信用参考,实现密集信用分配,在AppWorld和τ³-airline任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26377 2026-06-26 cs.CR 新提交 75%

Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats

验证意图与危害:针对LLM生成威胁的统一防御

Poojitha Thota, Yun Lei, Santhosh Thangaraj, Siddhartha Reddy Jonnalagadda, Shirin Nilizadeh

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);verifier(abstract)

AI总结 提出一种联合验证用户提示意图和模型响应危害的防御框架,通过专门分析器与裁决器协同工作,在五个威胁类别上平均F1提升至0.95,攻击成功率降至4.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24198 2026-06-23 cs.CL cs.AI cs.CE cs.LG cs.MA 版本更新 75%

Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis

奖励科学过程:面向代理数据分析的过程级奖励建模

Zhisong Qiu, Shuofei Qiao, Kewei Xu, Yuqi Zhu, Lun Du, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DataPRM,一种环境感知的生成过程奖励模型,通过主动验证和反思意识的三元奖励策略,提升动态数据分析任务中代理的性能,实验表明其在多个基准测试中表现优异。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06416 2026-06-05 cs.AI cs.CL cs.LG cs.MA 75%

Unsupervised Skill Discovery for Agentic Data Analysis

面向智能体数据分析的无监督技能发现

Zhisong Qiu, Kangqi Song, Shengwei Tang, Shuofei Qiao, Lei Liang, Huajun Chen, Shumin Deng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DataCOPE框架,通过无监督验证器引导从探索轨迹中发现可复用的数据分析技能,在报告式和推理式分析任务上分别提升平均得分9.71%和32.30%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30290 2026-06-02 cs.LG cs.AI cs.CL 75%

Self-Trained Verification for Training- and Test-Time Self-Improvement

自训练验证用于训练和测试时的自我改进

Chen Henry Wu, Aditi Raghunathan

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出自训练验证(STV)方法,通过让验证器模仿参考解决方案下的自身版本,解决自我改进中验证器瓶颈问题,在测试时显著提升验证-细化循环,在训练时通过验证器在环训练(ViL)进一步提升生成器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25098 2026-05-29 cs.AI cs.CL cs.LG 75%

Revisiting the Effectiveness of LLM Pruning for Test-Time Scaling

重新审视LLM剪枝对测试时缩放的有效性

Ocean Monjur, Shahriar Kabir Nahin, Anshuman Chhabra

机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究非结构化剪枝对推理型大语言模型测试时缩放性能的影响,发现其优于结构化剪枝甚至有时超过未剪枝模型,并探讨了层间稀疏分配策略的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28295 2026-05-28 cs.AI cs.CL cs.LG 75%

Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR

Rollouts 的起点:面向 RLVR 的低负载、高杠杆的首 token 多样化

Soeun Kim, Albert No

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 REFT 方法,通过在推理标记后的第一个 token 处进行均匀采样多样化,以低开销显著提升 RLVR 中 rollout 的多样性,从而改善推理模型的 Pass@k 性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18663 2026-05-19 cs.AI cs.CL cs.LG 75%

GIM: Evaluating models via tasks that integrate multiple cognitive domains

GIM:通过整合多个认知领域的任务评估模型

Rohit Patel, Alexandre Rezende, Steven McClain

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GIM基准测试,通过整合多个认知领域的任务来评估模型,其核心方法是设计820个原创问题,结合广泛的知识和多种认知操作,从而保持推理在现实任务中的基础性,同时通过2PL IRT模型校准能力估计,发布涵盖22个模型和47种测试配置的综合排行榜,并深入研究了测试时计算与模型能力之间的权衡。

Comments 56 pages, 27 figures, 4 tables. Code: https://github.com/facebookresearch/gim ; Dataset: https://huggingface.co/datasets/facebook/gim

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02218 2026-05-19 cs.LG cs.AI cs.CL cs.IT math.IT 75%

Self-Play Only Evolves When Self-Synthetic Pipeline Ensures Learnable Information Gain

仅在自我合成管道确保可学习信息增益时,自我博弈才会进化

Wei Liu, Siya Qi, Yali Du, Yulan He

机构 * King's College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 测试时计算 :verifier(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过实验揭示可持续自我进化需要可学习信息递增的自我合成数据管道,提出自我进化LLM的三重角色及系统设计,解决自我博弈停滞问题。

Comments 10 pages, 6 figures, 7 formulas, accepted by ICML 2026 position paper track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16027 2026-04-20 cs.CL cs.AI cs.LG 75%

Where does output diversity collapse in post-training?

在微调后输出多样性为何会崩溃?

Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

机构 * School of Computer Science University of Sheffield(计算机科学学院 伦敦大学谢菲尔德分校)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了微调后输出多样性的崩溃原因,发现数据组成和训练方法共同影响多样性,揭示多样性崩溃发生在训练阶段而非推理阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07941 2026-04-17 cs.CL cs.AI cs.LG 75%

Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning

大语言模型后训练:一种统一的偏置学习与在线学习视角

Shiwan Zhao, Zhihu Wang, Xuyang Zhao, Jiaming Zhou, Caiyue Xu, Chenfei Liu, Liting Zhang, Yuhang Jia, Yanzhe Zhang, Hualong Yu, Zichen Xu, Qicheng Li, Yong Qin

机构 * Nankai University(南开大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了大语言模型后训练的统一框架,通过轨迹溯源划分偏置学习与在线学习两种模式,分析了支持扩展、策略重塑和行为固化等核心方法,强调系统设计协调性对进展的重要性。

Comments 38 pages, 1 figure, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04977 2026-03-06 cs.CV 75%

Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding

思考,然后验证:一种用于长视频理解的假设-验证多智能体框架

Zheng Wang, Haoran Chen, Haoxuan Qin, Zhipeng Wei, Tianwen Qian, Cong Bai

机构 * College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机科学学院) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江视觉信息智能处理重点实验室) UC Berkeley(伯克利大学) College of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 VideoHV-Agent通过结构化假设-验证流程提升长视频理解的准确性、可解释性和效率。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13342 2026-02-06 cs.AI cs.CL cs.LG 75%

Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact Verifiers

验证验证者:揭示事实验证器中的陷阱与潜力

Wooseok Seo, Seungju Han, Jaehun Jung, Benjamin Newman, Seungwon Lim, Seungbeen Lee, Ximing Lu, Yejin Choi, Youngjae Yu

机构 * Yonsei University(延世大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Seoul National University(首尔国立大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估了多种大语言模型和事实验证器,揭示了数据标注问题、前沿模型性能及小型验证器的改进潜力。

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02143 2026-02-03 cs.LG cs.AI cs.CL 75%

Learning Generative Selection for Best-of-N

学习最佳N的生成选择

Shubham Toshniwal, Aleksander Ficek, Siddhartha Jain, Wei Du, Vahid Noroozi, Sadegh Mahdavi, Somshubra Majumdar, Igor Gitman

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过强化学习,小模型可获得强大的生成选择能力,从而在推理任务中超越基线方法并接近大模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04411 2026-01-09 cs.LG cs.AI cs.CL 75%

Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards

速率还是命运?RLV$^\varepsilon$R:具有可验证噪声奖励的强化学习

Ali Rad, Khashayar Filom, Darioush Keivan, Peyman Mohajerin Esfahani, Ehsan Kamalinejad

机构 * Cognichip AI University of Toronto(多伦多大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLV$^\varepsilon$R框架,通过分析验证噪声对强化学习的影响,揭示了噪声如何影响学习速率与命运,并通过实验验证了在不同Youden指数下动态变化的相变特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18581 2025-12-15 cs.CL cs.AI cs.LG 75%

Scalable Best-of-N Selection for Large Language Models via Self-Certainty

通过自我确定性实现大规模语言模型的可扩展最佳-N选择

Zhewei Kang, Xuandong Zhao, Dawn Song

机构 * UC Berkeley(伯克利大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出自我确定性方法,通过利用LLM输出的概率分布,高效提升大规模语言模型的推理能力,适用于多种推理任务和开放性生成场景。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14943 2025-10-17 cs.CL cs.AI cs.LG 75%

LaSeR: Reinforcement Learning with Last-Token Self-Rewarding

Wenkai Yang, Weijie Liu, Ruobing Xie, Yiju Guo, Lulu Wu, Saiyong Yang, Yankai Lin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) LLM Department, Tencent(腾讯机器学习部)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress. Github repo: https://github.com/RUCBM/LaSeR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18056 2025-09-26 cs.CV 75%

TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs

Yunheng Li, Jing Cheng, Shaoyong Jia, Hangyi Kuang, Shaohui Jiao, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ByteDance Inc.(字节跳动公司)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08589 2025-08-13 cs.CV 75%

DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding

Wenwen Yu, Zhibo Yang, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20227 2025-08-05 cs.IR 75%

CTR-Driven Ad Text Generation via Online Feedback Preference Optimization

Yanda Chen, Zihui Ren, Qixiang Gao, Jiale Chen, Si Chen, Xubin Li, Tiezheng Ge, Bo Zheng

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments 13 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05563 2025-06-25 cs.CL cs.AI cs.LG 75%

Rational Metareasoning for Large Language Models

C. Nicolò De Sabbata, Theodore R. Sumers, Badr AlKhamissi, Antoine Bosselut, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) EPFL(洛桑联邦理工学院) Anthropic(Anthropic公司)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12303 2025-06-17 cs.CV 75%

Will Pre-Training Ever End? A First Step Toward Next-Generation Foundation MLLMs via Self-Improving Systematic Cognition

Xiaoying Zhang, Da Peng, Yipeng Zhang, Zonghao Guo, Chengyue Wu, Jen-Tse Huang, Chi Chen, Wei Ke, Helen Meng, Maosong Sun

机构 * The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments 43 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23743 2025-06-06 cs.CL cs.AI cs.LG 75%

What Happened in LLMs Layers when Trained for Fast vs. Slow Thinking: A Gradient Perspective

Ming Li, Yanhong Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) University of Chicago(芝加哥大学)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL2025 main, Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04378 2025-06-02 cs.CL cs.AI cs.LG 75%

HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks

Zhilin Wang, Jiaqi Zeng, Olivier Delalleau, Daniel Egert, Ellie Evans, Hoo-Chang Shin, Felipe Soares, Yi Dong, Oleksii Kuchaiev

机构 * NVIDIA

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 23 pages, 2 figures, Accepted to ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14682 2025-05-21 cs.CV 75%

UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation

Rui Tian, Mingfei Gao, Mingze Xu, Jiaming Hu, Jiasen Lu, Zuxuan Wu, Yinfei Yang, Afshin Dehghan

机构 * Apple(苹果公司) Fudan University(复旦大学)

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);verifier(abstract)

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12249 2025-05-20 cs.CL cs.AI cs.LG 75%

LLMs are not Zero-Shot Reasoners for Biomedical Information Extraction

Aishik Nagar, Viktor Schlegel, Thanh-Tung Nguyen, Hao Li, Yuping Wu, Kuluhan Binici, Stefan Winkler

机构 * ASUS Intelligent Cloud Services (AICS)(ASUS智能云服务) Imperial College London(伦敦帝国学院) University of Manchester(曼彻斯特大学) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18494 2025-03-25 cs.AI cs.CL cs.LG 75%

Verbal Process Supervision Elicits Better Coding Agents

Hao-Yuan Chen, Cheng-Pong Huang, Jui-Ming Yao

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13161 2024-06-21 cs.AI cs.CL cs.LG cs.PL 75%

APPL: A Prompt Programming Language for Harmonious Integration of Programs and Large Language Model Prompts

Honghua Dong, Qidong Su, Yubo Gao, Zhaoyu Li, Yangjun Ruan, Gennady Pekhimenko, Chris J. Maddison, Xujie Si

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏