arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4991 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4991 篇

2604.06685 2026-04-09 cs.CL cs.AI 81%

ChemVLR: Prioritizing Reasoning in Perception for Chemical Vision-Language Understanding

ChemVLR:在化学视觉语言理解中优先考虑推理

Xuanle Zhao, Xinyuan Cai, Xiang Cheng, Xiuyi Chen, Bo Xu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ChemVLR通过细化化学描述符识别,提升化学视觉语言模型的推理能力,实现更清晰的推理路径,实验显示其在分子和反应任务中达到SOTA性能。

Comments Accepted by ACL 2026 Findings, Preprint Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03223 2026-03-30 cs.CL cs.AI 81%

Attention-Aligned Reasoning for Large Language Models

面向大语言模型的注意力对齐推理

Hongxiang Zhang, Yuan Tian, Tianyi Zhang

机构 * Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ATAR方法,通过利用推理结构引导LLM注意力,提升复杂任务处理性能,实验显示在六个基准上表现优于现有方法,且非推理模型性能可与推理模型媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21732 2026-03-25 cs.CL cs.AI 81%

HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation

HUMORCHAIN: 基于理论的多阶段推理用于可解释的多模态幽默生成

Jiajun Zhang, Shijia Luo, Ruikang Zhang, Qi Su

机构 * Peking University(北京大学) Ocean University of China(海洋大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出HUMORCHAIN框架,通过整合视觉语义解析、基于幽默和心理学的推理及细调判别器,实现可解释的多模态幽默生成,实验表明其在人类幽默偏好、Elo/BT评分和语义多样性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18533 2026-03-23 cs.LG cs.CL 81%

Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning

平衡推理负担:基于长度再分配的难度差异化策略优化用于高效且鲁棒的强化学习

Yinan Xia, Haotian Zhang, Huiming Wang

机构 * Tianjin University(天津大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出DDPO算法,通过区分任务难度优化输出长度,提升强化学习的效率与鲁棒性,实验表明在多个基准上准确率提升1.85%的同时平均回答长度减少12%。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16665 2026-03-23 cs.LG cs.AI cs.DC 81%

Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter

驯服长尾:通过自适应草案器实现高效的推理强化学习训练

Qinghao Hu, Shang Yang, Junxian Guo, Xiaozhe Yao, Yujun Lin, Yuxian Gu, Han Cai, Chuang Gan, Ana Klimovic, Song Han

机构 * MIT(麻省理工学院) ETH Zurich(苏黎世联邦理工学院) NVIDIA(英伟达) MIT-IBM AI Lab(麻省理工-IBM人工智能实验室) MIT, NVIDIA(麻省理工学院、英伟达)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TLT系统,通过自适应草案器和自适应回放引擎,解决强化学习训练中响应生成的长尾分布问题,实现1.7倍的训练加速并保持模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19293 2026-03-23 cs.CL cs.AI 81%

LLM-MRD: LLM-Guided Multi-View Reasoning Distillation for Fake News Detection

LLM-MRD: 基于大语言模型的多视角推理蒸馏用于虚假新闻检测

Weilin Zhou, Shanwen Tan, Enhao Gu, Yurong Qian

机构 * Xinjiang University, Urumqi, China(新疆大学) Sichuan University, Chengdu, China(四川大学) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University, Urumqi, China(丝绸之路多语种认知计算国际联合实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM-MRD框架,通过多视角推理蒸馏提升虚假新闻检测性能,实验显示在准确率和F1-Fake指标上均优于现有方法。

Comments Accepted at DASFAA 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17169 2026-03-19 cs.AI cs.CL 81%

How Clued up are LLMs? Evaluating Multi-Step Deductive Reasoning in a Text-Based Game Environment

LLMs有多好?在文本基于的游戏环境中评估多步骤演绎推理

Rebecca Ansell, Autumn Toney-Wails

机构 * Georgetown University(乔治城大学) Syntheos, Corp(Syntheos公司) UNU-Merit

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过文本多智能体版经典棋盘游戏Clue评估LLM的多步骤演绎推理能力,发现即使在结构化逻辑谜题微调后,推理一致性仍难以维持,且推理精度未显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16415 2026-03-18 cs.CL cs.AI cs.IR 81%

IndexRAG: Bridging Facts for Cross-Document Reasoning at Index Time

IndexRAG:在索引时间进行跨文档推理的桥梁

Zhenghua Bao, Yi Shi

机构 * Continuum AI

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 IndexRAG通过在索引阶段进行跨文档推理,提升多跳问答的F1得分,无需额外训练,仅需单次检索和一次LLM调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18933 2026-03-17 cs.CL cs.AI 81%

BabyReasoningBench: Generating Developmentally-Inspired Reasoning Tasks for Evaluating Baby Language Models

BabyReasoningBench: 生成发育启发式的推理任务以评估婴儿语言模型

Kaustubh D. Dhole

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BabyReasoningBench,基于发展心理学经典范式,设计19个推理任务,评估婴儿语言模型在因果推理、信念归因等任务上的表现,揭示不同任务对模型能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03366 2026-03-16 cs.LG cs.AI 81%

Disentangling Recall and Reasoning in Transformer Models through Layer-wise Attention and Activation Analysis

通过分层注意力和激活分析解构Transformer模型中的回忆与推理

Harshwardhan Fartale, Ashish Kattamuri, Rahul Raja, Arpita Vats, Ishita Prasad, Akshata Kishore Moharir

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过可控数据集和激活分析,揭示Transformer模型中回忆与推理的分离电路,为模型泛化和安全部署提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13093 2026-03-13 cs.AI cs.CL 81%

Consistency of Large Reasoning Models Under Multi-Turn Attacks

多轮攻击下大推理模型的一致性

Yubo Li, Ramayya Krishnan, Rema Padman

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究评估了多轮对抗攻击下九种前沿推理模型的鲁棒性,发现推理虽提供部分鲁棒性,但存在显著脆弱性,指出基于自信的防御需重新设计以适应推理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18485 2026-03-10 cs.CL cs.AI 81%

A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models

一个简单的‘动机’可以增强大推理模型的强化微调

Junjie Zhang, Guozheng Ma, Shunyu Liu, Haoyu Wang, Jiaxing Huang, Ting-En Lin, Fei Huang, Yongbin Li, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University, Singapore(生成式人工智能实验室,计算与数据科学学院,南洋理工大学,新加坡) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MeRF,通过在强化微调中引入任务动机,提升大模型在复杂任务中的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15160 2026-03-09 cs.AI cs.CL 81%

Knowledge Graphs are Implicit Reward Models: Path-Derived Signals Enable Compositional Reasoning

知识图谱是隐式奖励模型:路径衍生信号促进组合推理

Yuval Kansal, Niraj K. Jha

机构 * Department of Electrical and Computer Engineering, Princeton University, New Jersey, USA(电气与计算机工程系,普林斯顿大学,新泽西州,美国)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用知识图谱作为隐式奖励模型,通过路径衍生信号提升模型在复杂推理任务中的组合推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02193 2026-03-03 cs.LG cs.AI stat.ML 81%

Symbol-Equivariant Recurrent Reasoning Models

符号等变递归推理模型

Richard Freinschlag, Timo Bertram, Erich Kobler, Andreas Mayr, Günter Klambauer

机构 * ELLIS Unit Linz, LIT AI Lab \& Institute for Machine Learning, Johannes Kepler University Linz, Austria Clinical Research Institute for Medical AI, Johannes Kepler University Linz, Austria

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 SE-RRMs通过显式编码符号对称性,提升了神经推理的鲁棒性和可扩展性,在数独和ARC-AGI任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01025 2026-03-03 cs.LG cs.AI 81%

One-Token Verification for Reasoning Correctness Estimation

单token验证用于推理正确性估计

Zhan Zhuang, Xiequn Wang, Zebin Chen, Feiyang Ye, Ying Wei, Kede Ma, Yu Zhang

机构 * Southern University of Science(南方科技大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出单token验证方法,用于高效估计推理正确性,通过低秩适应集成到LLM中,减少token使用并提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22603 2026-03-03 cs.AI cs.LG 81%

SideQuest: Model-Driven KV Cache Management for Long-Horizon Agentic Reasoning

SideQuest: 为长时间范围代理推理的模型驱动KV缓存管理

Sanjay Kariyappa, G. Edward Suh

机构 * NVIDIA

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 SideQuest通过利用大型推理模型自身进行KV缓存压缩,有效减少代理任务中的内存使用,同时保持较高的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12113 2026-03-02 cs.AI cs.CL 81%

Stop Unnecessary Reflection: Training LRMs for Efficient Reasoning with Adaptive Reflection and Length Coordinated Penalty

停止不必要的反思:通过自适应反思和长度协调惩罚训练高效的推理模型

Zewei Yu, Lirong Gao, Yuke Zhu, Bo Zheng, Junbo Zhao, Sheng Guo, Haobo Wang

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) MYbank, Ant Group(蚂蚁集团MYbank) Innovation and Management Center, School of Software Technology (Ningbo), Zhejiang University(浙江大学软件学院(宁波)创新与管理中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过自适应反思和长度协调惩罚方法,提升推理效率和准确性,减少响应长度并提高性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19862 2026-03-02 cs.CL cs.LG 81%

REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning

REA-RL:面向高效推理的反思意识在线强化学习

Hexuan Deng, Wenxiang Jiao, Xuebo Liu, Jun Rao, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(计算与智能学院,哈尔滨工业大学深圳学院) Zhongguancun Academy, Beijing, China(中关村学院,北京) Xiaohongshu Inc.(小红书公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 REA-RL通过引入反思模型和反思奖励,提升在线强化学习中推理效率和性能平衡。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05705 2026-02-18 cs.CV cs.AI cs.CL 81%

Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale

长 grounded 思考:大规模合成视觉问题和推理链

David Acuna, Chao-Han Huck Yang, Yuntian Deng, Jaehun Jung, Ximing Lu, Prithviraj Ammanabrolu, Hyunwoo Kim, Yuan-Hong Liao, Yejin Choi

机构 * nvidia(NVIDIA公司) uoft(多伦多大学) uwaterloo(滑铁卢大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种大规模合成视觉问题和推理链的框架,通过生成高质量数据集提升多模态推理性能,验证了其在视觉、文本和音频任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14216 2026-02-17 cs.CY cs.AI cs.CL 81%

Reasoning Language Models for complex assessments tasks: Evaluating parental cooperation from child protection case reports

用于复杂评估任务的推理语言模型:从儿童保护案件报告中评估父母合作

Dragan Stoll, Brian E. Perron, Zia Qi, Selina Steinmann, Nicole F. Eicher, Andreas Jud

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理语言模型在评估儿童保护案件中父母合作方面的有效性,发现模型在母亲合作评估上表现更佳,但对父亲合作的评估准确性较低,提示需关注性别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14625 2026-02-09 cs.CL cs.AI 81%

Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Models

概率聚合与定向嵌入优化用于大语言模型中的集体道德推理

Chenchen Yuan, Zheyu Zhang, Shuo Yang, Bardh Prenkaj, Gjergji Kasneci

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) School of Social Sciences and Technology, Technical University of Munich(社会科学与技术学院,慕尼黑技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种概率聚合与定向嵌入优化方法,通过融合多个大语言模型的道德判断,提升集体道德推理的一致性和准确性。

Comments Accepted to ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03279 2026-02-04 cs.AI cs.LG 81%

Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis

代理提案:通过组合技能合成增强大语言模型推理

Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Xuan Ren, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Shanghai University of Finance(上海财经大学) Wuhan University(武汉大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Agentic Proposing通过组合技能合成生成高质量训练数据,使大语言模型在数学、编程和科学领域实现更高效的推理和泛化能力。

Comments 23page4

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01884 2026-02-03 cs.AI cs.LG 81%

Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models

熵引导的数据高效训练用于多模态推理奖励模型

Shidong Yang, Tongwen Huang, Hao Wen, Yong Wang, Li Chen, Xiangxiang Chu

机构 * School of Software, Tsinghua University(清华大学软件学院) AMAP, Alibaba Group(阿里巴巴集团AMAP)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出熵引导训练方法,通过熵指导数据筛选和训练策略提升多模态推理奖励模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00759 2026-02-03 cs.CL cs.AI 81%

Adaptive Ability Decomposing for Unlocking Large Reasoning Model Effective Reinforcement Learning

适应性能力分解用于解锁大型推理模型有效强化学习

Zhipeng Chen, Xiaobo Qin, Wayne Xin Zhao, Youbin Wu, Ji-Rong Wen

机构 * Renmin University of China(中国人民大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出A$^2$D方法,通过分解复杂问题提升RLVR效果,适用于多种强化学习算法。

Comments 21 pages, Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08040 2026-02-03 cs.CL cs.AI 81%

Can Reasoning LLMs Enhance Clinical Document Classification?

推理大语言模型能否增强临床文档分类?

Akram Mustafa, Usman Naseem, Mostafa Rahimi Azghadi

机构 * College of Science and Engineering, James Cook University(科学与工程学院,詹姆斯库克大学) School of Computing, Macquarie University(计算学院,麦考瑞大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究推理大语言模型在临床文档分类中的性能,发现其在准确率上优于非推理模型,但一致性较低,建议采用混合方法提升临床编码效率。

Comments 27 pages

Journal ref Health and Technology (2026): 1-14

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09133 2026-02-02 cs.AI cs.LG math.ST stat.TH 81%

On the Provable Performance Guarantee of Efficient Reasoning Models

关于高效推理模型的可证明性能保证

Hao Zeng, Jianguo Huang, Bingyi Jing, Hongxin Wei, Bo An

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Southern University of Science(南方科技大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出PAC推理方法,通过动态切换思考与非思考模式,在用户指定容忍度下控制性能损失,实现高效推理与性能保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17982 2026-01-27 cs.CL cs.AI 81%

SD-E$^2$: Semantic Exploration for Reasoning Under Token Budgets

SD-E$^2$: 语义探索用于受限令牌预算下的推理

Kshitij Mishra, Nils Lukas, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 SD-E$^2$通过语义多样性奖励提升小型语言模型在受限令牌预算下的推理能力,实现对复杂问题的高效探索与利用。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17275 2026-01-27 cs.LG cs.AI 81%

Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning

潜在空间对比强化学习用于稳定高效的LLM推理

Lianlei Shan, Han Chen, Yixuan Wang, Zhenjie Liu, Wei Li

机构 * University of Chinese Academy of Sciences(中国科学院大学) EvolutionLeap(进化跃迁) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出深度潜在推理(DLR),通过潜在空间对比强化学习提升LLM在复杂推理任务中的稳定性与效率。

Comments 12 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15495 2026-01-23 cs.AI cs.CL 81%

Tracking the Limits of Knowledge Propagation: How LLMs Fail at Multi-Step Reasoning with Conflicting Knowledge

追踪知识传播的极限:LLMs在存在冲突知识的多步骤推理中的失败

Yiyang Feng, Zeming Chen, Haotian Wu, Jiawei Zhou, Antoine Bosselut

机构 * EPFL(苏黎世联邦理工学院) Stony Brook University(石溪大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 TRACK基准测试揭示了LLMs在存在冲突知识的多步骤推理中因无法有效整合更新信息而性能下降的问题。

Comments Accepted to EACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14270 2026-01-22 cs.CL cs.AI 81%

Opening the Black Box: A Survey on the Mechanisms of Multi-Step Reasoning in Large Language Models

揭开黑箱:关于大语言模型多步推理机制的综述

Liangming Pan, Jason Liang, Jiaran Ye, Minglai Yang, Xinyuan Lu, Fengbin Zhu

机构 * Peking University(北京大学) Stanford University(斯坦福大学) Tsinghua University(清华大学) University of Arizona(亚利桑那大学) National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型多步推理机制,探讨了隐式和显式推理过程,并提出了未来研究方向。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏