arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-14 至 2026-04-14 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 17 篇

2604.00013 2026-04-14 cs.CL cs.AI 86%

C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis

C2F-Thinker:基于提示引导强化学习的粗到细推理用于多模态情感分析

Miaosen Luo, Zhenhao Yang, Jieshen Long, Jinghu Sun, Yichu Liu, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出C2F-Thinker框架,通过粗到细结构推理与提示引导强化学习,提升多模态情感分析的可解释性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10335 2026-04-14 cs.CL cs.LG 86%

Adaptive Multi-Expert Reasoning via Difficulty-Aware Routing and Uncertainty-Guided Aggregation

基于难度感知路由和不确定性引导聚合的自适应多专家推理

Mohamed Ehab, Ali Hamdi

机构 * Faculty of Computer Science October University for Modern Science \& Arts Giza, Egypt

专题命中 测试时计算 :reasoning(title,abstract);math reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AMR框架,通过动态适应策略提升数学推理鲁棒性,利用难度感知路由和不确定性引导聚合在GSM8K数据集上取得75.28%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00748 2026-04-14 cs.CV 85%

Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning

通过强化学习提升多图像接地在MLLMs中的推理能力

Bob Zhang, Haoran Li, Tao Zhang, Jianan Li, Cilin Yan, Xikai Liu, Jiayin Cai, Yanbin Hao

机构 * Xiaohongshu Inc.(小红书公司) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Technical University of Munich(慕尼黑工业大学) Hefei University of Technology(合肥工业大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文通过强化学习策略提升多图像接地任务中MLLMs的推理能力,采用合成CoT数据、LoRA微调和规则引导的RL方法,实验表明在MIG-Bench和多个领域外基准上效果显著。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10660 2026-04-14 cs.CL cs.AI cs.LG 83%

Efficient Process Reward Modeling via Contrastive Mutual Information

通过对比互信息实现高效的进程奖励建模

Nakyung Lee, Sangwoo Hong, Jungwoo Lee

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔大学电气与计算机工程系) Department of Computer Science and Engineering, Konkuk University(建国大学计算机科学与工程系)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 本文提出CPMI方法,通过模型内部概率推断步骤监督,减少标注计算负担,提升过程级评估和数学推理准确性。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10739 2026-04-14 cs.AI 83%

When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling

更多思考反而有害:在LLM测试时间计算扩展中的过度思考

Shu Zhou, Rui Ling, Junan Chen, Xin Wang, Tao Fan, Hao Wang

机构 * Nanjing University(南京大学) Baidu(百度) Nanjing University of Finance & Economics(南京财经大学)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究探讨了在LLM测试时间计算扩展中,增加推理token的边际效用随计算预算增加而下降的现象,发现模型存在过度思考问题,且最优思考长度因问题难度而异。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13755 2026-04-14 cs.LG cs.AI 81%

Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration

在RLVR中深度与广度的协同作用:通过自适应探索解锁LLM推理增益

Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Dongchun Xie, Hanhui Li, Yiwei Wang, Xiaodan Liang, Jing Tang

机构 * Sun Yat-Sen University(中山大学) ETH AI Center, ETH Zurich(苏黎世联邦理工学院ETH人工智能中心) University of California, Merced(加州大学默塞德分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DARS方法,通过自适应探索提升LLM推理能力,发现扩大批量大小能显著提升Pass@1指标,同时结合DARS-Breadth方法实现深度与广度的协同增益。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01544 2026-04-14 cs.AI 79%

Advancing Reasoning in Diffusion Language Models with Denoising Process Rewards

通过去噪过程奖励推进扩散语言模型的推理能力

Shaoan Xie, Lingjing Kong, Xiangchen Song, Xinshuai Dong, Guangyi Chen, Eric P. Xing, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出去噪过程奖励,通过优化去噪轨迹提升扩散语言模型的推理稳定性与可解释性,实验显示在推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04842 2026-04-14 cs.LG cs.AI 79%

Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers

为RL重新注入价值:通过统一LLM推理器与验证器实现更好的测试时间扩展

Kusha Sareen, Morgane M Moss, Alessandro Sordoni, Rishabh Agarwal, Arian Hosseini

机构 * Mila, McGill University(Mila,麦吉尔大学) Mila, Université de Montréal(Mila,蒙特利尔大学) Microsoft Research, Mila(微软研究院,Mila) Google DeepMind, Mila(谷歌DeepMind,Mila)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RL$^V$方法,通过联合训练LLM作为推理器和生成验证器,提升测试时间计算效率和任务准确性,实现20%以上的MATH准确率提升和8-32倍的计算效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10034 2026-04-14 cs.AI 70%

AI Achieves a Perfect LSAT Score

人工智能实现完美LSAT分数

Bonmu Ku

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文首次展示语言模型在公开LSAT考试中取得满分,通过QLoRA微调的奖励模型提升逻辑推理能力,证明机器可超越人类认知极限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09748 2026-04-14 cs.CR cs.AI 70%

Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward

在RLVR中存在后门:从可验证奖励中对LLM的后门攻击

Weiyang Guo, Zesheng Shi, Zeen Zhu, Yuan Zhou, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出了一种在RLVR框架中通过注入污染数据植入后门的新方法,展示了该攻击在不同模型规模上高效且具有泛化能力,导致安全性能下降73%。

Comments 20 pages,8 figures, publish in acl2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11012 2026-04-14 cs.AI cs.CL cs.LG 67%

Min-$k$ Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics

Min-k Sampling: 通过相对Logit动态解耦截断与温度缩放

Yuanhao Ding, Meimingwei Li, Esteban Garces Arias, Matthias Aßenmacher, Christian Heumann, Chongsheng Zhang

机构 * School of Computer and Information Engineering, Henan University(河南大学计算机与信息工程学院) Department of Statistics, LMU Munich(慕尼黑大学统计系) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Min-k采样,通过分析排序后的Logit分布局部形状,识别语义悬崖,动态确定截断边界,实现严格温度不变性,并在多个任务中提升文本质量。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07794 2026-04-14 cs.CL cs.AI cs.LG 67%

HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation

HiPRAG:分层过程奖励用于高效代理检索增强生成

Peilin Wu, Mian Zhang, Kun Wan, Wentian Zhao, Kaiyu He, Xinya Du, Zhiyu Chen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe Inc.(Adobe公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HiPRAG通过引入细粒度的知识引导过程奖励,优化代理检索增强生成的推理过程,提升搜索效率并减少无效搜索。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11104 2026-04-14 cs.AI cs.IR cs.LG cs.NE 62%

Frugal Knowledge Graph Construction with Local LLMs: A Zero-Shot Pipeline, Self-Consistency and Wisdom of Artificial Crowds

基于本地LLM的节约知识图谱构建:零样本流水线、自一致性与人工群体智慧

Pierre Jourlin

机构 * Avignon Université, Laboratoire d’Informatique d’Avignon (LIA)(阿维尼翁大学,阿维尼翁计算机科学实验室(LIA))

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多模型零样本流水线,用于知识图谱构建与利用,通过本地推理在消费级硬件上执行。研究了自一致性与人工群体智慧在多跳推理中的应用,展示了系统在零样本条件下的性能提升及碳足迹。

Comments Source code and raw results available: https://github.com/jourlin/synsynth (licence Hypocratic)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05837 2026-04-14 cs.CL 57%

EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget

EEPO:通过采样后遗忘的探索增强策略优化

Liang Chen, Xueting Han, Qizhou Wang, Bo Han, Jing Bai, Hinrich Schutze, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong Baptist University(香港浸会大学) LMU Munich(慕尼黑大学) MoE Key Laboratory of High Confidence Software Technologies(教育部高可信软件技术重点实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 EEPO通过两阶段 rollout 和自适应遗忘机制提升探索能力,在五个推理基准中超越 GRPO,取得显著性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07153 2026-04-14 cs.AI 57%

ANCHOR: Branch-Point Data Generation for GUI Agents

ANCHOR:用于GUI代理的分支点数据生成

Jinbiao Wei, Yilun Zhao, Kangqi Ni, Arman Cohan

机构 * Yale University(耶鲁大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 ANCHOR通过分支点生成高质量交互数据,提升桌面环境GUI代理的训练效果和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20567 2026-04-14 cs.CL 57%

KCS: Diversify Multi-hop Question Generation with Knowledge Composition Sampling

KCS: 通过知识组合采样多样化多跳问题生成

Yangfan Wang, Jie Liu, Chen Tang, Lian Yan, Jingchi Jiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室)

专题命中 测试时计算 :planning(abstract);分类 cs.CL

AI总结 本文提出KCS框架,通过采样不同知识组合提升多跳问题生成的多样性,改进知识组合选择的准确率,并在HotpotQA和2WikiMultihopQA数据集上提升数据增强效果。

Comments Accept by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07251 2026-04-14 cs.HC 50%

MeepleLM: A Virtual Playtester Simulating Diverse Subjective Experiences

MeepleLM:一种模拟多样化主观体验的虚拟玩家测试者

Zizhen Li, Chuanhao Li, Yibin Wang, Yukang Feng, Jianwen Sun, Jiaxin Ai, Fanrui Zhang, Mingzhu Sun, Yifei Huang, Kaipeng Zhang

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出MeepleLM,通过整合规则书和玩家反馈数据,模拟多样化玩家体验,提升棋盘游戏设计的协作效率与批判性。

Comments ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏