arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-17 至 2026-04-17 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 21 篇

2604.14847 2026-04-17 cs.AI 83%

TrigReason: Trigger-Based Collaboration between Small and Large Reasoning Models

TrigReason:基于触发的大小推理模型协作

Yi Zhao, Yajuan Peng, Cam-Tu Nguyen, Zuchao Li, Xiaoliang Wang, Xiaoming Fu, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(AGI研究院,计算机科学学院,上海交通大学,上海,中国) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University, Shanghai, China(上海市教育委员会智能交互与认知工程重点实验室,上海交通大学,上海,中国) Shanghai Key Laboratory for Intelligent Information Processing, Fudan University(上海市智能信息处理重点实验室,复旦大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Wuhan University(人工智能学院,武汉大学) Institute of Computer Science, University of Göttingen, Göttingen, Germany(计算机科学研究所,哥廷根大学,哥廷根,德国)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出TrigReason框架,通过触发机制将大部分推理任务交给小型模型,仅在必要时调用大模型,提升推理效率与准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14214 2026-04-17 cs.CL cs.AI 82%

CROP: Token-Efficient Reasoning in Large Language Models via Regularized Prompt Optimization

CROP:通过正则化提示优化实现大语言模型的token高效推理

Deep Shah, Sanket Badhe, Nehal Kathrotia, Priyanka Tiwari

机构 * Google LLC(谷歌公司) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI;logical reasoning(comments)

AI总结 CROP通过正则化提示优化,在保持准确性的同时显著降低token消耗,适用于复杂推理任务。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14170 2026-04-17 cs.CL cs.AI 81%

Stateful Evidence-Driven Retrieval-Augmented Generation with Iterative Reasoning

具有迭代推理的有状态证据驱动检索增强生成

Qi Dong, Ziheng Lin, Ning Ding

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种具有迭代推理的有状态证据驱动检索增强生成框架,通过逐步积累证据提升问答稳定性与鲁棒性,在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15244 2026-04-17 cs.CL 79%

From Tokens to Steps: Verification-Aware Speculative Decoding for Efficient Multi-Step Reasoning

从标记到步骤:面向验证的推测解码用于高效多步推理

Kiran Purohit, Ramasuri Narayanam, Soumyabrata Pal

机构 * IIT Kharagpur(印度克哈格普尔理工学院) Adobe Research(Adobe研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SpecGuard框架,通过模型内部信号进行步骤级验证,提升多步推理的准确性和效率,实验显示在多个推理基准上准确率提升3.6%且延迟降低11%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14898 2026-04-17 cs.AI cs.CY cs.HC 79%

Governing Reflective Human-AI Collaboration: A Framework for Epistemic Scaffolding and Traceable Reasoning

引导反思的人工智能协作:一种知识支架和可追溯推理的框架

Rikard Rosenbacke, Carl Rosenbacke, Victor Rosenbacke, Martin McKee

机构 * Faculty of Medicine, Lund University(Lund大学医学院) Department of Economics, Lund University School of Economics and Management(Lund大学经济学与管理学院经济系) Department of Health Services Research and Policy, London School of Hygiene & Tropical Medicine(伦敦卫生与热带医学学院健康服务研究与政策系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种人机协作的推理框架,通过知识支架和可追溯推理提升AI透明度与可控性,不依赖新模型架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07529 2026-04-17 cs.LG 79%

MedVerse: Efficient and Reliable Medical Reasoning via DAG-Structured Parallel Execution

MedVerse: 通过DAG结构并行执行实现高效可靠的医学推理

Jianwen Chen, Xinyu Yang, Peng Xia, Arian Azarang, Yueh Z Lee, Gang Li, Hongtu Zhu, Yun Li, Beidi Chen, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 MedVerse通过将医学推理转化为可并行的有向无环图过程,提升复杂医疗问题的效率和可靠性,实验表明其在通用大语言模型上提升了8.9%的性能,同时减少推理延迟并提高生成吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02010 2026-04-17 cs.CL 79%

NEAT: Neuron-Based Early Exit for Large Reasoning Models

NEAT:基于神经元的早期退出用于大规模推理模型

Kang Liu, Yongkang Liu, Xiaocui Yang, Peidong Wang, Wen Zhang, Shi Feng, Yifei Zhang, Daling Wang

机构 * Northeastern University(东北大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 NEAT通过监控神经元激活动态实现免训练早期退出,减少冗余推理步骤,提升推理效率同时保持解的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03851 2026-04-17 cs.AI 70%

MetaMuse: Algorithm Generation via Creative Ideation

MetaMuse:通过创造性构思生成算法

Ruiying Ma, Chieh-Jan Mike Liang, Yanjie Gao, Francis Y. Yan

机构 * University of California, Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文研究LLM在算法生成中的应用,提出MetaMuse框架,通过三个自反思原则提升创造性构思,实验显示其在缓存替换和在线装箱问题中性能提升显著。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19807 2026-04-17 cs.AI cs.CL cs.CV cs.LG cs.MA 67%

KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality

KnowRL: 探索知识增强型强化学习以提升事实性

Baochang Ren, Shuofei Qiao, Da Zheng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KnowRL通过整合事实性奖励提升慢思考模型的事实准确性,实验表明其有效缓解了幻觉问题并保持推理能力。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15306 2026-04-17 cs.AI cs.LG 62%

Generalization in LLM Problem Solving: The Case of the Shortest Path

大模型问题解决中的泛化能力:最短路径问题的案例

Yao Tong, Jiayuan Ye, Anastasia Borovykh, Reza Shokri

机构 * National University of Singapore(新加坡国立大学) Capital Fund Management(资本基金管理公司) Google Research(谷歌研究)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了大模型在最短路径问题中的泛化能力,发现模型在空间迁移表现良好,但在长度扩展上因递归不稳定性而失败,分析了不同学习阶段对系统性问题解决的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14856 2026-04-17 cs.CL cs.AI 62%

ClimateCause: Complex and Implicit Causal Structures in Climate Reports

气候原因:气候报告中的复杂和隐含因果结构

Liesbeth Allein, Nataly Pineda-Castañeda, Andrea Rocci, Marie-Francine Moens

机构 * Department of Computer Science, KU Leuven, Belgium(比利时库勒芬大学计算机科学系) Department of Electronics and Information Systems, Ghent University, Belgium(比利时根特大学电子与信息系统系) Institute of Argumentation, Linguistics, and Semiotics (IALS), Università della Svizzera italiana, Switzerland(瑞士意大利大学论证、语言学与象征学研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ClimateCause数据集,通过专家标注揭示气候报告中的高阶因果结构,包括隐含和嵌套因果关系,用于提升因果推理和可读性量化。

Comments Accepted to ACL 2026 [Findings]

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15233 2026-04-17 cs.AI cs.DB 57%

Blue Data Intelligence Layer: Streaming Data and Agents for Multi-source Multi-modal Data-Centric Applications

蓝色数据智能层:面向多源多模态数据导向应用的流数据与智能体

Moin Aminnaseri, Farima Fatahi Bayat, Nikita Bhutani, Jean-Flavien Bussotti, Kevin Chan, Rafael Li Chen, Yanlin Feng, Jackson Hassell, Estevam Hruschka, Eser Kandogan, Hannah Kim, James Levine, Seiji Maekawa, Jalal Mahmud, Kushan Mitra, Naoki Otani, Pouya Pezeshkpour, Nima Shahbazi, Chen Shen, Dan Zhang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Blue数据智能层,通过整合异构数据源、多模态信息及上下文数据,解决多源多模态数据导向应用中的复杂查询需求,结合智能体与数据处理实现自然语言到SQL的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14779 2026-04-17 cs.CV cs.CL 57%

AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning

AIM:面向视觉问答持续学习的非对称信息掩码

Peifeng Zhang, Zice Qiu, Donghua Yu, Shilei Cao, Juepeng Zheng, Yutong Lu, Haohuan Fu

机构 * Sun Yat-Sen University(中山大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对视觉问答持续学习中因模型结构不对称导致的灾难性遗忘问题,提出AIM方法,通过模态特定敏感性指导的针对性掩码平衡稳定性与可塑性,提升在VQA v2和GQA任务中的平均性能和平均遗忘度。

Comments 18 pages, 9 figures. Submitted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14477 2026-04-17 cs.AI 57%

Seeing Through Circuits: Faithful Mechanistic Interpretability for Vision Transformers

通过电路看见:面向视觉变换器的忠实机制可解释性

Nina Żukowska, Wolfgang Stammer, Bernt Schiele, Jonas Fischer

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了通过计算图在视觉变换器中识别有用机制电路的可能性,提出自动视觉电路发现方法,发现分类特定电路、CLIP中的文字攻击电路以及可引导纠正有害行为的电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14437 2026-04-17 cs.SE cs.AI 57%

LLMs taking shortcuts in test generation: A study with SAP HANA and LevelDB

大语言模型在测试生成中的捷径行为:SAP HANA与LevelDB的实证研究

Vekil Bekmyradov, Noah C. Pütz, Thomas Bartz-Beielstein

机构 * THK-AI Research Cluster(THK人工智能研究集群) TH Köln(TH科伦大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究大语言模型在软件自动化测试生成中的行为,通过对比开源系统LevelDB与商用数据库SAP HANA的测试表现,揭示LLMs在熟悉领域表现优异但面对新复杂领域时依赖编译性而非语义有效性,强调需建立惩罚捷径、奖励泛化的能力评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14419 2026-04-17 cs.AI 57%

Equifinality in Mixture of Experts: Routing Topology Does Not Determine Language Modeling Quality

专家混合中的等效性:路由拓扑不决定语言建模质量

Ivan Ternovtsii, Yurii Bilak

机构 * Department of Software Systems, Uzhhorod National University(软件系统系,乌日霍罗德国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究路由拓扑对语言建模质量的影响,通过62次实验发现不同路由方法在渐近困惑度上无显著差异,且通过简化路由机制提升了效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03307 2026-04-17 cs.CV cs.AI 57%

V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators

V-Reflection:将多模态大语言模型从被动观察者转变为主动提问者

Jiazhou Zhou, Yucheng Chen, Hongyang Li, Qing Jiang, Hu Zhou, Ying-Cong Chen, Lei Zhang

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向) International Digital Economy Academy(国际数字经济学院) MedVisAI Lab, Lee Kong Chian School of Medicine, Nanyang Technological University, and Centre of AI in Medicine(医学视觉人工智能实验室,南洋理工大学Lee Kong Chian医学院,以及人工智能在医学中的中心) South China University of Technology(华南理工大学) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出V-Reflection框架,通过'思考后再观察'的视觉反思机制,使多模态大语言模型能主动提问视觉特征空间,提升细粒度任务的感知能力。

Comments Main paper 14 pages with supplementary 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17512 2026-04-17 cs.CL 57%

Language on Demand, Knowledge at Core: Composing LLMs with Encoder-Decoder Translation Models for Extensible Multilinguality

按需语言,知识为核心:通过编码器-解码器翻译模型组成LLM以实现可扩展的多语言性

Mengyu Bu, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所,中国科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出XBridge架构,利用预训练翻译模型实现多语言理解和生成,同时保留LLM作为英语核心处理通用知识,通过轻量级跨模型映射层和最优传输对齐目标,提升多语言生成性能。

Comments ACL 2026 Main Conference. Code: https://github.com/ictnlp/XBridge | Models: https://huggingface.co/collections/ICTNLP/xbridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10159 2026-04-17 cs.CY cs.AI cs.HC 57%

Enhancing Large Language Model-Based Systems for End-to-End Circuit Analysis Problem Solving

增强基于大语言模型的系统以实现端到端电路分析问题求解

Liangliang Chen, Weiyu Sun, Huiru Xie, Yongnuo Cai, Ying Zhang

机构 * School of Electrical Computer Engineering, Georgia Institute of Technology, Atlanta, GA 30332 USA

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种改进的端到端电路问题求解框架,通过整合YOLO检测器和OpenCV处理提升电路识别精度,并引入ngspice验证循环以减少推理错误,实验结果表明准确率显著提升。

Comments Liangliang Chen and Weiyu Sun contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01016 2026-04-17 cs.CL 57%

Prompt-R1: Collaborative Automatic Prompting Framework via End-to-end Reinforcement Learning

Prompt-R1: 通过端到端强化学习实现的协作自动提示框架

Wenjin Liu, Haoran Luo, Xueyuan Lin, Haoming Liu, Tiesunlong Shen, Jiapu Wang, Rui Mao, Erik Cambria

机构 * Hainan University(海南大学) Nanyang Technological University(南洋理工大学) Hithink Research(慧思研究) HKUST (Guangzhou)(香港科技大学(广州)) IDEA Research(IDEA研究院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Prompt-R1框架,通过小规模LLM与大规模LLM协作,利用强化学习提升复杂问题解决能力,实验表明其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15136 2026-04-17 cs.CR 50%

Feedback-Driven Execution for LLM-Based Binary Analysis

基于反馈的LLM二进制分析执行

XiangRui Zhang, Qiang Li, Haining Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出FORGE系统,通过反馈驱动执行框架提升LLM在二进制分析中的表现,实现长周期多路径分析与高精度漏洞检测。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏