arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-20 至 2026-04-20 共收录 57 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 57 篇

2604.12390 2026-04-20 cs.AI 93%

Heuristic Classification of Thoughts Prompting (HCoT): Integrating Expert System Heuristics for Structured Reasoning into Large Language Models

思维提示的启发式分类(HCoT):将专家系统启发式方法整合到大型语言模型中的结构化推理

Lei Lin, Jizhao Zhu, Yong Liu, Donghong Sun, Hongbo He, Yihua Du

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Shenyang Aerospace University(沈阳航空航天大学) ZGC LAB, Beijing,China(北京ZGC实验室) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出HCoT方法,通过启发式分类模型整合专家系统启发式方法,提升大型语言模型在复杂问题中的推理能力,实现更高效的决策和更稳定的推理链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15344 2026-04-20 cs.HC cs.AI cs.IR cs.LG 92%

To LLM, or Not to LLM: How Designers and Developers Navigate LLMs as Tools or Teammates

对LLM而言,是使用还是不使用:设计师和开发者如何将LLM视为工具或队友

Varad Vishwarupe, Ivan Flechais, Nigel Shadbolt, Marina Jirotka

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了设计师和开发者在系统设计过程中如何将LLM视为工具或队友,分析了角色框架对决策权、问责制、监督策略和组织接受度的影响。

Comments 6 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08125 2026-04-20 cs.LG cs.CL 92%

Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning

并非所有标记都重要:通过强化学习中的标记重要性实现高效的LLM推理

Hanbing Liu, Lang Cao, Yuanyi Ren, Mengyu Zhou, Haoyu Dong, Xiaojun Ma, Shi Han, Dongmei Zhang

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Qwen Large Model Application Team, Alibaba(阿里云文大模型应用团队) Microsoft(微软) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院 ubiquitous 数据赋能重点实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过标记重要性优化强化学习,减少冗余并提升LLM推理效率和准确性,实验显示响应长度显著缩短且正确性保持或提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10198 2026-04-20 cs.CL 92%

HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns

HumanLLM:通过人类认知模式基准测试和改进LLM拟人化

Xintao Wang, Jian Yang, Weiyuan Li, Rui Xie, Jen-tse Huang, Jun Gao, Shuai Huang, Yueping Kang, Yuanli Gou, Hongwei Feng, Yanghua Xiao

机构 * Fudan University(复旦大学) Hello Group(Hello集团) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 HumanLLM通过构建244种心理模式和11359种场景,评估LLM拟人化的有效性,发现认知建模比单纯模拟行为更重要,其8B模型在参数更少的情况下优于Qwen3-32B。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19563 2026-04-20 cs.AI cs.CL 91%

TabularMath: Understanding Math Reasoning over Tables with Large Language Models

TabularMath: 通过大规模语言模型理解表格上的数学推理

Shi-Yu Tian, Zhi Zhou, Wei Dong, Kun-Yang Yu, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出TabularMath基准,通过神经符号框架将数学问题转化为可扩展的表格推理任务,揭示表格复杂度、质量及表征对推理性能的影响,发现低质量表格对当前LLM的可靠性构成严重风险。

Comments Accepted by ACL 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03332 2026-04-20 cs.CL cs.AI cs.LG 91%

Fragile Thoughts: How Large Language Models Handle Chain-of-Thought Perturbations

脆弱的思考:大型语言模型如何处理推理链扰动

Ashwath Vaithinathan Aravindan, Mayank Kejriwal

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究了大型语言模型在推理链扰动下的鲁棒性,通过五种扰动类型评估13种模型,发现不同扰动对模型的影响各异,模型规模在某些扰动中起到保护作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14334 2026-04-20 q-bio.QM cs.AI 90%

Mamba-SSM with LLM Reasoning for Feature Selection: Faithfulness-Aware Biomarker Discovery

Mamba-SSM结合LLM推理进行特征选择:面向生物标志物发现的可信度意识方法

Pushpa Kumar Balan, Aijing Feng

机构 * Department of Computer Science and Cybersecurity(计算机科学与网络安全系)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI;large language model(comments);language model(comments)

AI总结 本文研究LLM推理在过滤特征选择中的作用,通过Mamba-SSM提取基因并结合CoT提升预测性能,发现特征筛选能提高AUC并验证部分已知生物标志物。

Comments 9 pages, 4 figures. Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22977 2026-04-20 cs.LG cs.AI 90%

The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination

推理陷阱:增强大语言模型推理能力如何放大工具幻觉

Chenlong Yin, Zeyang Sha, Shiwen Cui, Changhua Meng, Zechao Li

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Nanjing University of Science and Technology(南京理工大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究探讨增强LLM推理能力是否导致工具幻觉增加,通过SimpleToolHalluBench验证因果关系,发现推理增强与幻觉成正比,且不受过拟合影响,揭示需新的训练目标平衡能力和可靠性。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06094 2026-04-20 cs.CL 90%

ConlangCrafter: Constructing Languages with a Multi-Hop LLM Pipeline

ConlangCrafter:基于多跳LLM流水线的语言构建

Morris Alper, Moran Yanuka, Raja Giryes, Gašper Beguš

机构 * Tel Aviv University(特拉维夫大学) Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(伯克利大学)

专题命中 推理与问题求解 :LLM(title,title_cn);foundation model(abstract);分类 cs.CL

AI总结 本文提出ConlangCrafter,通过多阶段流水线实现语言构建,利用LLM的元语言能力生成一致且多样化的构想语言。

Comments Accepted to ACL 2026. Project page: https://conlangcrafter.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07043 2026-04-20 cs.LG 90%

COMPASS: Benchmarking Constrained Optimization in LLM Agents

COMPASS:评估LLM代理在约束优化中的表现

Tian Qin, Felix Bai, Ting-Yao Hu, Raviteja Vemulapalli, Hema Swetha Koppula, Zhiyang Xu, Bowen Jin, Mert Cemri, Jiarui Lu, Zirui Wang, Meng Cao

机构 * Harvard University(哈佛大学) Apple(苹果公司) Virginia Tech(弗吉尼亚理工学院) UIUC(伊利诺伊大学香槟分校) UC Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 COMPASS基准测试评估LLM代理在真实旅行规划中的约束优化能力,揭示当前模型在可行性与最优性之间存在显著差距,表明搜索空间探索不足是核心限制,编码代理提供潜在解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14554 2026-04-20 cs.CL cs.AI 90%

VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models

VLegal-Bench: 用于大型语言模型越南法律推理的认知导向基准

Nguyen Tien Dong, Minh-Anh Nguyen, Thanh Dat Hoang, Nguyen Tuan Ngoc, Dao Xuan Quang Minh, Phan Phi Hai, Nguyen Thi Ngoc Anh, Dang Van Tu, Binh Vu

机构 * CMC OpenAI VinUniversity HUST SRH University Heidelberg

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 VLegal-Bench是首个系统评估大型语言模型在越南法律任务上的基准,包含10450个样本,通过严格标注流程确保样本基于权威法律文件,涵盖法律问题解答、检索增强生成、多步推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14517 2026-04-20 cs.CL cs.LG 88%

Large Language Models for Math Education in Low-Resource Languages: A Study in Sinhala and Tamil

大型语言模型在低资源语言中的数学教育应用:斯里兰卡语和泰米尔语的研究

Sukumar Kishanthan, Kumar Thushalika, Buddhi Jayasekara, Asela Hevapathige

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Moratuwa(穆拉图瓦大学) Department of Electrical and Information Engineering(电气与信息工程系) University of Ruhuna(鲁胡纳大学) Faculty of Information Technology and Communication Sciences(信息科技与通讯科学学院) Tampere University(塔尔皮奥大学) School of Computing(计算学院) Australian National University(澳大利亚国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了大型语言模型在斯里兰卡语和泰米尔语中的数学推理能力,发现基础算术推理在不同语言间表现稳定,但复杂问题在两种语言中均有显著下降,表明英语表现佳不等于多语言可靠。

Comments Accepted to ITHET 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20020 2026-04-20 cs.AI cs.CL 88%

Persona-Assigned Large Language Models Exhibit Human-Like Motivated Reasoning

具有人格分配的大型语言模型表现出类似人类的动机推理

Saloni Dash, Amélie Reymond, Emma S. Spiro, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了分配不同政治和社会人口属性的人格对大型语言模型动机推理的影响,发现人格分配的模型在评估信息真实性时表现下降,且政治人格在科学证据评估中更倾向于与自身身份一致的结论,传统去偏方法效果有限。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07160 2026-04-20 cs.AI cs.LG 88%

AscendKernelGen: A Systematic Study of LLM-Based Kernel Generation for Neural Processing Units

AscendKernelGen: 一种针对神经处理单元的LLM基内核生成系统研究

Xinzi Cao, Jianyang Zhai, Pengfei Li, Zhiheng Hu, Cen Yan, Bingxu Mu, Guanghuan Fang, Bin She, Jiayu Li, Yihan Su, Dongyang Tao, Xiansong Huang, Fan Xu, Feidiao Yang, Yao Lu, Chang-Dong Wang, Yutong Lu, Weicheng Xue, Bin Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Huawei(华为) Sun Yat-sen University(中山大学) Peking University(北京大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AscendKernelGen框架,通过引入Ascend-CoT数据集和KernelGen-LM模型,提升NPU内核生成效率与正确性,实验显示复杂内核编译成功率从0%提升至95.5%。

Comments 33 pages,7 figures,16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06953 2026-04-20 cs.AI cs.CL 88%

Revisiting the Uniform Information Density Hypothesis in LLM Reasoning

重新审视大语言模型推理中的均匀信息密度假说

Minju Gwak, Guijin Son, Jaehyung Kim

机构 * Yonsei University(延世大学) OneLine AI

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型推理中均匀信息密度假说的有效性,提出新框架量化局部和全局信息流均匀性,发现高质量推理在局部均匀但全局非均匀,证明均匀性优于其他内部信号预测推理质量。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17292 2026-04-20 cs.CL cs.AI 88%

Multi-View Attention Multiple-Instance Learning Enhanced by LLM Reasoning for Cognitive Distortion Detection

多视角注意力多实例学习增强的认知扭曲检测

Jun Seo Kim, Hyemi Kim, Woo Joo Oh, Hongjin Cho, Hochul Lee, Hye Hyeon Kim

机构 * Gachon University(加成大学) Korea Telecom Research(韩国电信研究所) Yonsei University(延世大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合大语言模型与多实例学习架构的方法,通过分解情绪、逻辑和行为成分提升认知扭曲检测的可解释性和推理能力。

Comments Accepted to the main conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15726 2026-04-20 cs.AI 87%

LLM Reasoning Is Latent, Not the Chain of Thought

大语言模型的推理是潜在的,而非思维链

Wenshuo Wang

机构 * School of Future Technology, South China University of Technology, China(未来技术学院,华南理工大学,中国)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出大语言模型推理应研究为潜在状态轨迹形成而非表面思维链。研究指出,推理对象的定义影响了忠实性、可解释性、推理基准和推理时干预的主张。通过分离三个混淆因素,提出三种假设,发现当前证据更支持潜在状态轨迹作为默认假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16022 2026-04-20 cs.AI cs.LG cs.MA 87%

SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems

SocialGrid:一种用于具身多智能体系统规划与社交推理的基准测试

Hikaru Shindo, Hanzhao Lin, Lukas Helff, Patrick Schramowski, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) Lab1141(Lab1141实验室) Centre for Cognitive Science, Darmstadt(达姆施塔特认知科学中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SocialGrid通过评估LLM在具身多智能体环境中的规划、任务执行与社交推理能力,揭示了现有模型在任务完成和社交推理上的不足,并提供规划 oracle 和竞争排行榜以促进改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16198 2026-04-20 cs.SE 87%

Bridging the Gap between User Intent and LLM: A Requirement Alignment Approach for Code Generation

弥合用户意图与大语言模型之间的鸿沟:一种用于代码生成的需求对齐方法

Jia Li, Ruiqi Bai, Yangkang Luo, Yiran Zhang, Wentao Yang, Zeyu Sun, Tiankuo Zhao, Dongming Jin, Lei Li, Zhi Jin

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出REA-Coder方法,通过需求对齐提升大语言模型的代码生成性能,实验表明其在多个编程基准测试中表现优异,平均提升率达7.93%至30.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15847 2026-04-20 cs.CL 85%

CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization

CiPO:通过迭代偏好优化实现大型推理模型的反事实去学习

Junyi Li, Yongqiang Chen, Ningning Ding

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大型推理模型去学习难题,CiPO通过迭代偏好优化重新定义去学习为对推理过程的针对性干预,有效去除中间推理步骤和最终答案的知识,同时保持推理能力。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10959 2026-04-20 cs.LG cs.AI cs.CL stat.ML 85%

Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning

重新审视熵正则化:自适应系数解锁其在大语言模型强化学习中的潜力

Xiaoyun Zhang, Xiaojian Yuan, Di Huang, Wang You, Chen Hu, Jingqing Ruan, Ai Jian, Kejiang Chen, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) StepFun Inc(StepFun公司)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文重新审视熵正则化在强化学习中的应用,提出自适应熵正则化框架,通过动态平衡探索与利用提升数学推理性能。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15385 2026-04-20 cs.SE cs.LG 84%

Prompt-Driven Code Summarization: A Systematic Literature Review

基于提示的代码摘要:系统文献综述

Afia Farjana, Zaiyu Cheng, Antonio Mastropaolo

机构 * William & Mary(威廉玛丽学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文综述了基于提示的代码摘要方法,分析了不同提示策略的有效性及评估挑战,旨在为未来研究和实际应用提供指导。

Comments 42 pages, 9 figures, 10 tables. Systematic Literature Review. This work is currently under review at ACM TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15727 2026-04-20 cs.AI cs.LG cs.LO 83%

Structured Abductive-Deductive-Inductive Reasoning for LLMs via Algebraic Invariants

通过代数不变量实现LLMs的结构归纳-演绎-演绎推理

Sankalp Gilda, Shlok Gilda

机构 * DeepThought Solutions(深思科技) Department of Computer Science University of Florida(佛罗里达大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过代数不变量实现LLMs的结构归纳-演绎-演绎推理框架,通过五种代数不变量确保推理链中结论的可靠性,防止逻辑不一致的累积。

Comments 10 pages + 3 pages references. Accepted as a poster at the ICLR 2026 Workshop for LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02935 2026-04-20 cs.CL cs.AI cs.MA 83%

Theory of Mind in Action: The Instruction Inference Task in Dynamic Human-Agent Collaboration

行动中的理论思维:动态人机协作中的指令推断任务

Fardin Saad, Pradeep K. Murukannaiah, Munindar P. Singh

机构 * North Carolina State University(北卡罗来纳州立大学) Delft University of Technology(代尔夫特理工大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出指令推断任务,通过Tomcat模型评估人机协作中理论思维能力,实验表明Fs-CoT在GPT-4o和DeepSeek-R1上表现接近人类参与者。

Comments 66 pages with appendix, 10 figures (Appendix: 26 Figures), 11 tables. Code available at: https://github.com/fardinsaad/Tomcat-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16264 2026-04-20 cs.CV cs.LG 83%

Information Router for Mitigating Modality Dominance in Vision-Language Models

信息路由器用于缓解视觉-语言模型中的模态主导问题

Seulgi Kim, Mohit Prabhushankar, Ghassan AlRegib

机构 * OLIVES at the Center for Signal Information Processing CSIP, School of Electrical

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出MoIR信息路由器,通过在融合前减少信息差异,缓解视觉-语言模型中模态主导问题,提升鲁棒性和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15839 2026-04-20 cs.AI cs.CL cs.LO 82%

Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4

发现与证明:一个开源代理框架用于Lean 4中的硬模式自动定理 proving

Chengwu Liu, Yichun Yin, Ye Yuan, Jiaxuan Xie, Botao Li, Siqi Li, Jianhao Shen, Yan Xu, Lifeng Shang, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(信息处理国家重点实验室,计算机科学学院,PKU-Anker LLM实验室,北京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DAP框架,通过LLM自然语言推理与自我反思发现答案,并将硬模式问题转换为易模式问题以提升自动定理证明性能,实现了CombiBench和PutnamBench上的显著提升。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15842 2026-04-20 cs.CL 81%

Disentangling Mathematical Reasoning in LLMs: A Methodological Investigation of Internal Mechanisms

解构大语言模型中的数学推理:对内部机制的调查

Tanja Baeumel, Josef van Genabith, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Saarland University(萨尔兰大学) Center for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过分析LLM执行算术任务时的内部机制,揭示模型在早期层识别算术任务,但正确结果生成仅在最终层完成,并发现擅长算术的模型在注意力与MLP模块间有明确分工。

Comments MathNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15705 2026-04-20 cs.LG 81%

Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning

迈向稳健的内生推理:统一非平稳调谐中的漂移适应

Xiaoyu Yang, En Yu, Wei Duan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faculty of Engineering and Information Technology(工程与信息技术学院)

专题命中 推理与问题求解 :preference optimization(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出CPO++框架,解决多模态大语言模型在内生推理中的漂移问题,通过反事实推理与领域知识结合,提升推理连贯性和决策精度,适用于医疗诊断和自动驾驶等安全关键领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16263 2026-04-20 cs.RO 80%

Semantic Area Graph Reasoning for Multi-Robot Language-Guided Search

语义区域图推理用于多机器人语言引导搜索

Ruiyang Wang, Hao-Lun Hsu, Jiwoo Kim, Miroslav Pajic

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出语义区域图推理框架,通过结构化语义拓扑抽象实现多机器人语义搜索,提升复杂室内环境中的目标搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15369 2026-04-20 cs.CR 80%

An Agentic Workflow for Detecting Personally Identifiable Information in Crash Narratives

一种用于检测事故叙述中个人可识别信息的代理工作流

Junyi Ma, Pei Li, Rui Gan, Kai Cheng, Steven T. Parker, Bin Ran

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种本地部署的代理工作流,利用大语言模型检测事故叙述中的个人可识别信息,通过混合提取器和验证器提升检测精度与召回率,实现隐私保护的可扩展数据处理。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏