arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18837 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18837 篇

2604.26954 2026-05-01 cs.CY cs.AI 89%

The Impact of LLM Self-Consistency and Reasoning Effort on Automated Scoring Accuracy and Cost

大型语言模型自我一致性与推理努力对自动化评分准确性和成本的影响

Scott Frohn

机构 * Khan Academy(可汗学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了LLM自我一致性和推理努力对自动化评分准确性和成本的影响,发现策略性模型选择和推理设置比集成更有效,且推理努力与评分准确性呈正相关。

Comments 14 pages, 10 tables, 2 figures. Presented at the 2026 National Council on Measurement in Education (NCME) Annual Meeting, April 11, 2026, Los Angeles, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11908 2026-05-01 cs.CL 89%

PPA-Plan: Proactive Pitfall Avoidance for Reliable Planning in Long-Context LLM Reasoning

PPA-Plan: 长上下文LLM推理中的前瞻性坑洞避免规划

Byeongjin Kim, Gyuwan Kim, Seo Yeon Park

机构 * Hanyang University(翰阳大学) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对长上下文推理中计划生成不可靠的问题,PPA-Plan通过前瞻性策略预防逻辑错误,提升计划执行效果。

Comments Accepted to the Main Conference of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026). 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04177 2026-04-28 cs.CL 89%

Position: Logical Soundness is not a Reliable Criterion for Neurosymbolic Fact-Checking with LLMs

位置:逻辑正确性不是LLM神经符号事实核查中的可靠标准

Jason Chan, Robert Gaizauskas, Zhixue Zhao

机构 * School of Computer Science University of Sheffield(计算机科学学院 伦敦大学谢菲尔德分校)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL

AI总结 本文指出,逻辑正确性无法有效检测误导性声明,提出利用LLM的人类推理倾向来验证神经符号系统中的正式组件输出。

Comments ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17501 2026-04-21 cs.CL 89%

CoAct: Co-Active LLM Preference Learning with Human-AI Synergy

CoAct:基于人机协同的LLM偏好学习

Ruiyao Xu, Mihir Parmar, Tiankai Yang, Zhengyu Hu, Yue Zhao, Kaize Ding

机构 * Northwestern University(西北大学) Google(谷歌) University of Southern California(南加州大学) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出CoAct框架,通过策略性的人机协作结合自奖励与主动学习,提升LLM在不同任务中的对齐效果,在三个推理基准测试中取得显著提升。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24235 2026-03-11 cs.RO cs.AI 89%

SafeGen-LLM: Enhancing Safety Generalization in Task Planning for Robotic Systems

SafeGen-LLM: 提高机器人系统任务规划中的安全性泛化能力

Jialiang Fan, Weizhe Xu, Mengyu Liu, Oleg Sokolsky, Insup Lee, Fanxin Kong

机构 * University of Notre Dame(诺丁汉大学) Washington State University(华盛顿州立大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SafeGen-LLM通过两阶段框架提升机器人任务规划的安全性泛化能力,优于现有基线。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03346 2026-02-17 cs.AI 89%

Making Slow Thinking Faster: Compressing LLM Chain-of-Thought via Step Entropy

让慢思考更快:通过步骤熵压缩LLM的链式思考

Zeju Li, Jianyuan Zhong, Ziyang Zheng, Xiangyu Wen, Zhijian Xu, Yingying Cheng, Fan Zhang, Qiang Xu

机构 * The Chinese University of Hong Kong(中国香港大学) Huawei Technologies Co., Ltd(华为技术有限公司) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 通过步骤熵压缩LLM的链式思考,提升推理效率并保持准确性。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14656 2026-01-13 cs.AI 89%

Cost-Awareness in Tree-Search LLM Planning: A Systematic Study

树搜索LLM规划中的成本意识:系统研究

Zihao Zhang, Hui Wei, Kenan Jiang, Shijia Pan, Shu Kai, Fei Liu

机构 * Emory University(埃默里大学) University of California, Merced(加州大学默塞德分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了树搜索LLM规划器在资源受限下的成本意识问题,发现现有方法难以找到最优计划,双向搜索表现最佳,MCTS在短时间任务中最优,表明需新算法而非单纯增加计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27072 2025-11-03 cs.LG 89%

Towards Understanding Self-play for LLM Reasoning

Justin Yang Chae, Md Tanvirul Alam, Nidhi Rastogi

机构 * University of Washington(华盛顿大学) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26041 2025-10-15 cs.CL 89%

Unspoken Hints: Accuracy Without Acknowledgement in LLM Reasoning

Arash Marioriyad, Shaygan Adim, Nima Alighardashi, Mahdieh Soleymani Banghshah, Mohammad Hossein Rohban

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments 5 Pages, 4 Figures, 4 Tables

Journal ref 39th Conference on Neural Information Processing Systems, 2025, Workshop: Reliable ML from Unreliable Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23459 2025-10-01 cs.CR cs.CL 89%

MaskSQL: Safeguarding Privacy for LLM-Based Text-to-SQL via Abstraction

Sepideh Abedini, Shubhankar Mohapatra, D. B. Emerson, Masoumeh Shafieinejad, Jesse C. Cresswell, Xi He

机构 * University of Waterloo(多伦多大学) Vector Institute(向量研究所) Layer 6 AI

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments Accepted to the 3rd Workshop on Regulatable ML at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08665 2025-08-14 cs.AI 89%

Aryabhata: An exam-focused language model for JEE Math

Ritvik Rastogi, Sachin Dharashivkar, Sandeep Varma

机构 * PhysicsWallah(物理墙)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);foundation model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17419 2025-06-26 cs.AI 89%

From System 1 to System 2: A Survey of Reasoning Large Language Models

Zhong-Zhi Li, Duzhen Zhang, Ming-Liang Zhang, Jiaxin Zhang, Zengyan Liu, Yuxuan Yao, Haotian Xu, Junhao Zheng, Pei-Jie Wang, Xiuyi Chen, Yingying Zhang, Fei Yin, Jiahua Dong, Zhiwei Li, Bao-Long Bi, Ling-Rui Mei, Junfeng Fang, Xiao Liang, Zhijiang Guo, Le Song, Cheng-Lin Liu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Slow-thinking, Large Language Models, Human-like Reasoning, Decision Making in AI, AGI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18642 2025-05-27 cs.CL 89%

Skip-Thinking: Chunk-wise Chain-of-Thought Distillation Enable Smaller Language Models to Reason Better and Faster

Xiao Chen, Sihang Zhou, Ke Liang, Xiaoyu Sun, Xinwang Liu

机构 * National University of Defense Technology(国防科技大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21233 2025-05-01 cs.CL 89%

Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math

Haoran Xu, Baolin Peng, Hany Awadalla, Dongdong Chen, Yen-Chun Chen, Mei Gao, Young Jin Kim, Yunsheng Li, Liliang Ren, Yelong Shen, Shuohang Wang, Weijian Xu, Jianfeng Gao, Weizhu Chen

机构 * Microsoft(微软)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00402 2025-01-28 cs.CL 89%

Self-Refine Instruction-Tuning for Aligning Reasoning in Language Models

Leonardo Ranaldi, Andrè Freitas

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);small language model(abstract);SFT(abstract)

Journal ref Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15992 2024-10-14 cs.CL 89%

Can LLM Graph Reasoning Generalize beyond Pattern Memorization?

Yizhuo Zhang, Heng Wang, Shangbin Feng, Zhaoxuan Tan, Xiaochuang Han, Tianxing He, Yulia Tsvetkov

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments 17 pages, 6 figures. EMNLP 2024 Findings. Code and data is publicly available at https://github.com/MatthewYZhang/NLGift

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01337 2024-07-01 cs.CL stat.ML 89%

MathChat: Converse to Tackle Challenging Math Problems with LLM Agents

Yiran Wu, Feiran Jia, Shaokun Zhang, Hangyu Li, Erkang Zhu, Yue Wang, Yin Tat Lee, Richard Peng, Qingyun Wu, Chi Wang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Update version

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05434 2023-12-12 cs.CL 89%

Beneath the Surface: Unveiling Harmful Memes with Multimodal Reasoning Distilled from Large Language Models

Hongzhan Lin, Ziyang Luo, Jing Ma, Long Chen

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments The first work to alleviate the issue of superficial understanding for harmful meme detection by explicitly utilizing commonsense knowledge, from a fresh perspective on harnessing advanced Large Language Models

Journal ref The 2023 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03262 2023-04-19 cs.AI 89%

When do you need Chain-of-Thought Prompting for ChatGPT?

Jiuhai Chen, Lichang Chen, Heng Huang, Tianyi Zhou

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14992 2023-10-24 cs.CL cs.AI cs.LG 89%

Reasoning with Language Model is Planning with World Model

Shibo Hao, Yi Gu, Haodi Ma, Joshua Jiahua Hong, Zhen Wang, Daisy Zhe Wang, Zhiting Hu

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,comments);large language model(abstract);prompting(abstract)

Comments EMNLP 2023. Code is available at https://github.com/Ber666/llm-reasoners

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18631 2026-08-20 cs.AI cs.GT cs.LG 新提交 88%

Preference Reasoning under Indeterminacy in Large Language Models

大语言模型在不确定性下的偏好推理

Hadi Hosseini, Samarth Khanna, Xiyuan Wang

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文聚焦大语言模型决策智能体的偏好推理问题,将不确定性挑战形式化为认知与结构两类,发现当前模型无法区分确定与不确定实例,推理校准不当。

Comments 55 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18103 2026-08-20 cs.CL cs.AI 新提交 88%

DeepTCM1.0: A Multi-Expert AI Agent for Deciphering Mechanisms of Chinese Herbal Formulae Based on General Large Language Models

DeepTCM1.0:基于通用大语言模型的用于解析中药复方机制的多专家智能体

Wenxin Duan, Hanwei Wang, Zhongying Peng, Zhonghua Lu, Jiayi An, Fan Song, Yong Liang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究构建基于DeepSeek V3.2的多专家智能体框架DeepTCM1.0,以桂枝汤为案例,结合中医理论与现代科学解析中药复方机制,通过多维度评估验证框架性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15673 2026-08-18 cs.LG cs.AI 新提交 88%

PL-Guard: Probabilistic Logic Reasoning for LLM Guardrails

PL-Guard:面向大语言模型安全护栏的概率逻辑推理

Satchit Chatterji, Shihan Wang, Giovanni Sileno, Erman Acar

机构 * University of Amsterdam(阿姆斯特丹大学) Utrecht University(乌得勒支大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);prompting(abstract)

AI总结 该研究提出神经符号安全护栏架构PL-Guard,通过分离神经落地与概率符号推理,在XSTest基准上大幅降低大语言模型的不安全依从率,虽过度拒绝率略高,但提升了推理可审计性。

Comments Preliminary version of this paper was presented at the IJCAI 2026 Workshop on Logical and Symbolic Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13221 2026-08-18 cs.AI cs.LG 版本更新 88%

An Agentic AI Framework with Large Language Models and Chain-of-Thought for UAV-Assisted Logistics Scheduling with Mobile Edge Computing

基于大语言模型和链式推理的智能AI框架用于无人机辅助物流调度与移动边缘计算

Hanwen Zhang, Dusit Niyato, Wei Zhang, Xin Lou, Malcolm Yoke Hean Low

机构 * Nanyang Technological University(南洋理工大学) Singapore Institute of Technology(新加坡理工学院) Seatrium New Energy Laboratory(Seatrium 新能源实验室) Ministry of Education (MOE) Tier 1(教育部 Tier 1) Research Innovation and Enterprise (RIE) 2025 Industry Alignment Fund-Industry Collaboration Projects (IAF-ICP)(研究创新与企业 (RIE) 2025 行业对齐基金-行业合作项目 (IAF-ICP))

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出结合大语言模型和链式推理的智能AI框架,用于解决无人机辅助物流调度中的混合调度问题,通过分层深度强化学习实现无人机路由和任务执行优化,提升物流效率与任务完成率。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08879 2026-08-18 cs.CL cs.AI 版本更新 88%

CulTrace: Tracing Internal Cultural Reasoning in Large Language Models

纠缠于表征:大型语言模型中文化偏见的机制性探究

Haeun Yu, Arnav Arora Seogyeong Jeong, Nadav Borenstein, Siddhesh Pawar, Jisu Shin, Jiho Jin, Junho Myung, Alice Oh, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学) KAIST(韩国科学技术院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Culturescope方法,通过机制性可解释性探讨LLMs中文化偏见的来源,揭示低资源文化对文化偏见的抗性及模型参数知识的限制。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14252 2026-08-17 cs.AI cs.CL 新提交 88%

Grounding Without Corrective Control: Truth-Tracking Profiles for Large Language Models

无校正控制的基础:大语言模型的真值追踪剖面

Brett Reynolds

机构 * Humber Polytechnic(亨伯理工学院) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型中无校正控制的基础问题,提出路径剖面概念以分析真值追踪,指出纯文本模型继承的模式可提供衍生可应答性,不同方法对任务的真值追踪改进可能与表面改进不一致。

Comments 24 pages, 1 figure, 1 table. A six-page methodological supplement, reproducible R script, and constructed data are included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13325 2026-08-14 cs.CR cs.AI cs.LG 版本更新 88%

Security and Detectability Analysis of Unicode Text Watermarking Methods against Large Language Models

Unicode文本水印方法对抗大语言模型的安全性与可检测性分析

Malte Hellmeier

机构 * Fraunhofer ISST(弗劳恩霍夫研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文分析了Unicode文本水印方法在大语言模型下的安全性和可检测性,发现最新模型能检测水印但无法提取。

Comments Author's version of a paper, accepted and presented at the ICISSP 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14390 2026-08-14 cs.CL cs.AI 版本更新 88%

REHEARSE: Experiential Rehearsal for Verbal Confidence Calibration in Large Language Models

REHEARSE:大语言模型中用于语言置信度校准的经验式排练

Ke Fang, Tianyi Zhao, Qianwen Wang, Lu Cheng

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型置信度与实际正确性不匹配的问题,提出无训练的Rehearse方法,通过置信度校准博弈的反馈生成校准信号,在多模型多基准实验中显著降低了预期校准误差并提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11244 2026-08-13 cs.AI cs.CL 新提交 88%

BEST-KAG: Enhancing Question Answering of Building Engineering Standards with Multimodal Knowledge Graph Modeling and Large Language Model

BEST-KAG:通过多模态知识图谱建模与大语言模型增强建筑工程标准的问答能力

Jia-Rui Lin, Junxi Guo, Keyin Chen, Peng Pan

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出BEST-KAG框架,通过多模态知识图谱建模与大语言模型,解决建筑工程标准问答的现有局限,在相关评估指标上优于主流大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10444 2026-08-13 cs.CL cs.AI 版本更新 88%

From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

从推理深度到推理广度:评估大型语言模型中的多点关联推理

Si'an Xie, Jiaxun Liu, Biao Yang, Wei Yuan, Fan Yang, Tingting Gao, Ming Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究构建了中英双语多点关联推理基准MPAR-Bench,发现大型语言模型的推理深度未自动带来稳健的推理广度,当前基准未充分覆盖推理广度。

详情

展开后加载摘要…

URL PDF HTML 收藏