arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2410.23703 2024-11-01 cs.LG cs.CL 87%

OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models

Junda Wu, Xintong Li, Ruoyu Wang, Yu Xia, Yuxin Xiong, Jianing Wang, Tong Yu, Xiang Chen, Branislav Kveton, Lina Yao, Jingbo Shang, Julian McAuley

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12034 2024-10-08 cs.CL cs.LG 87%

Self-MoE: Towards Compositional Large Language Models with Self-Specialized Experts

Junmo Kang, Leonid Karlinsky, Hongyin Luo, Zhen Wang, Jacob Hansen, James Glass, David Cox, Rameswar Panda, Rogerio Feris, Alan Ritter

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13994 2024-09-30 cs.CL cs.AI 87%

Contrastive Learning for Knowledge-Based Question Generation in Large Language Models

Zhenhong Zhang, Jiajing Chen, Weiyan Shi, Lingjie Yi, Chihang Wang, Qian Yu

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01290 2024-06-26 cs.CL cs.AI 87%

Knowledge Crosswords: Geometric Knowledge Reasoning with Large Language Models

Wenxuan Ding, Shangbin Feng, Yuhan Liu, Zhaoxuan Tan, Vidhisha Balachandran, Tianxing He, Yulia Tsvetkov

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02795 2024-05-07 cs.AI cs.CL 87%

Evaluating and Optimizing Educational Content with Large Language Model Judgments

Joy He-Yueya, Noah D. Goodman, Emma Brunskill

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00994 2024-03-05 cs.HC cs.AI cs.CL cs.SI 87%

Leveraging Prompt-Based Large Language Models: Predicting Pandemic Health Decisions and Outcomes Through Social Media Language

Xiaohan Ding, Buse Carik, Uma Sushmitha Gunturi, Valerie Reyna, Eugenia H. Rho

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03620 2024-02-07 cs.AI cs.CL 87%

Self-Discover: Large Language Models Self-Compose Reasoning Structures

Pei Zhou, Jay Pujara, Xiang Ren, Xinyun Chen, Heng-Tze Cheng, Quoc V. Le, Ed H. Chi, Denny Zhou, Swaroop Mishra, Huaixiu Steven Zheng

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

Comments 17 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00290 2024-01-02 cs.CL cs.AI 87%

Red Teaming for Large Language Models At Scale: Tackling Hallucinations on Mathematics Tasks

Aleksander Buszydlik, Karol Dobiczek, Michał Teodor Okoń, Konrad Skublicki, Philip Lippmann, Jie Yang

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

Comments Accepted to The ART of Safety: Workshop on Adversarial testing and Red-Teaming for generative AI (IJCNLP-AACL 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15930 2023-11-28 cs.CL cs.AI 87%

WorldSense: A Synthetic Benchmark for Grounded Reasoning in Large Language Models

Youssef Benchekroun, Megi Dervishi, Mark Ibrahim, Jean-Baptiste Gaya, Xavier Martinet, Grégoire Mialon, Thomas Scialom, Emmanuel Dupoux, Dieuwke Hupkes, Pascal Vincent

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12426 2023-10-20 cs.CL cs.AI 87%

MAF: Multi-Aspect Feedback for Improving Reasoning in Large Language Models

Deepak Nathani, David Wang, Liangming Pan, William Yang Wang

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2023 Main Conference, Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01074 2023-10-10 cs.CL cs.AI 87%

Back to the Future: Towards Explainable Temporal Reasoning with Large Language Models

Chenhan Yuan, Qianqian Xie, Jimin Huang, Sophia Ananiadou

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 5 figures, code and dataset: https://github.com/chenhan97/TimeLlama

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09117 2023-10-02 cs.CL cs.AI 87%

Contrastive Decoding Improves Reasoning in Large Language Models

Sean O'Brien, Mike Lewis

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13230 2023-06-28 cs.CL cs.AI 87%

DiversiGATE: A Comprehensive Framework for Reliable Large Language Models

Shima Imani, Ali Beyram, Harsh Shrivastava

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.00445 2022-05-03 cs.CL cs.AI 87%

MRKL Systems: A modular, neuro-symbolic architecture that combines large language models, external knowledge sources and discrete reasoning

Ehud Karpas, Omri Abend, Yonatan Belinkov, Barak Lenz, Opher Lieber, Nir Ratner, Yoav Shoham, Hofit Bata, Yoav Levine, Kevin Leyton-Brown, Dor Muhlgay, Noam Rozen, Erez Schwartz, Gal Shachaf, Shai Shalev-Shwartz, Amnon Shashua, Moshe Tenenholtz

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.02370 2021-10-07 cs.CL cs.AI 87%

Leveraging the Inductive Bias of Large Language Models for Abstract Textual Reasoning

Christopher Michael Rytting, David Wingate

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.08634 2021-09-20 cs.CL cs.AI 87%

Grounding Natural Language Instructions: Can Large Language Models Capture Spatial Information?

Julia Rozanova, Deborah Ferreira, Krishna Dubba, Weiwei Cheng, Dell Zhang, Andre Freitas

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments *Equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.05783 2021-01-19 cs.CL cs.LG 87%

Persistent Anti-Muslim Bias in Large Language Models

Abubakar Abid, Maheen Farooqi, James Zou

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13902 2026-04-16 cs.LG 87%

DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off

DiPO:解耦 perplexity 的策略优化用于细粒度探索-利用平衡

Xiaofan Li, Ming Yang, Zhiyuan Ma, Shichao Ma, Jintao Du, Yu Cheng, Weiqiang Wang, Zhizhong Zhang, Xin Tan, Yanyun Qu, Lizhuang Ma, Yuan Xie

机构 * East China Normal University(东华师范大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Xiamen University(厦门大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出 DiPO 方法,通过解耦 perplexity 空间来优化探索与利用的平衡,提升 LLM 在数学推理和函数调用任务中的性能。

Comments LLM Reinforce Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13607 2026-08-17 cs.AI cs.CL cs.LG 新提交 87%

No Universal Signal Predicts Sample-Level LLM Regression under Version Updates

没有通用信号可预测版本更新下的样本级大语言模型退化

Jia Sheng, Yiwei Lu

机构 * University of Ottawa(渥太华大学) Vector Institute(向量研究所)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究如何用推理时信号预测LLM版本更新导致的样本级退化,对比单模型与跨版本信号,发现信号有效性具任务依赖性且无通用最优信号,部分跨版本信号可支持选择性回退,从业者可据此选择信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09942 2026-08-12 cs.CL cs.AI cs.LG 新提交 87%

When Chain-of-Thought Helps and When It Hurts: An Empirical Investigation of the Serial-Depth Bottleneck in LLM Reasoning

思维链(CoT)何时有助、何时有害:大语言模型推理中序列深度瓶颈的实证研究

Tughanbulut Kurtulush

机构 * Vistula University(维斯图拉大学)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过实证发现,思维链(CoT)是带宽旁路而非通用推理增强器,在高深度推理任务中可提升大语言模型准确率,在浅层任务中冗余,其效果与任务序列深度、模型规模相关。

Comments 15 pages, 3 figures, 5 tables. Pre-registered study (OSF: https://osf.io/92jdk). Data and code: https://osf.io/hteuj

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04309 2026-08-06 cs.RO cs.SY eess.SY 新提交 87%

Structured LLM Reasoning for Zero-Shot Human--Robot Coordination Under Hidden Goals

面向隐藏目标下零样本人机协作的结构化大语言模型推理

Dong Hae Mangalindan, Anand Gokhale, Francesco Bullo, Vaibhav Srivastava

机构 * Michigan State University(密歇根州立大学) UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :LLM(title,summary_cn)

AI总结 该研究针对隐藏目标下的零样本人机协作,提出结构化LLM架构,通过Dec-POMDP分解决策,实验显示其交互步骤更少、人类信任度更高,优于无ToM推理的变体和离线训练的多智能体强化学习策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02974 2026-08-05 cs.SE 新提交 87%

ConFL: Explainable Concurrent Fault Localization via Hierarchy-Guided LLM Reasoning

ConFL:基于层次引导大语言模型推理的可解释并发故障定位框架

Shuai Shao, Dingbang Wang, Yiming Zeng, Tingting Yu

专题命中 推理与问题求解 :LLM(title,summary_cn)

AI总结 ConFL是一种可解释的并发故障定位框架,通过构建并发知识库与LLM引导的层次检索,在8个Java项目的并发漏洞实验中,其MRR达0.503、MAP达0.486,性能优于同类基线方法且鲁棒性良好。

Comments Accepted at ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26553 2026-07-30 cs.SD 新提交 87%

ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

ThinkOmni:用于音频伪造检测与定位的推理驱动全模态大语言模型框架

Yuxiong Xu, Kaiqing Lin, Bin Li, Haodong Li, Sheng Li

机构 * Shenzhen University(深圳大学) Afirstsoft Technology Group Co., Ltd.(安福软件科技集团有限公司)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有AFDL方法泛化能力不足的问题,提出推理驱动的全模态大语言模型ThinkOmni,构建FACoT数据集,引入FMIL与FCML,实现了跨数据集的音频伪造检测与定位。

Comments Accepted by ACM MM 2026, 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25996 2026-07-29 cs.SE 新提交 87%

RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models

RepoReasoner:评估长上下文语言模型的仓库级代码推理能力

Yanlin Wang, Suiquan Wang, Yanli Wang, Bowen Zhang, Daya Guo, Jiachi Chen, Zibin Zheng

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 研究针对现有代码推理基准测试局限,引入RepoReasoner评估仓库级代码推理,通过多阶段管道构建基准,评估输出预测和调用链预测能力,发现当前LLMs在仓库级推理存在局限,为未来相关研究提供方向。

Comments Published in FSE'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22554 2026-07-28 cs.AI cs.CL cs.LG 新提交 87%

Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy

相同问题,不同答案:超越准确率评估大语言模型的可靠性

Kazem Faghih, Yize Cheng, Shoumik Saha, Mobina Pournemat, Armin Gerami, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型在不同等效表述问题下的答案变化,发现其输出依赖措辞,准确率指标掩盖不稳定性,实例级行为不稳定,提出自释义策略可恢复潜在知识提升性能,强调评估一致性对展现模型可靠性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08728 2026-07-28 cs.AI cs.CL cs.CV cs.LG 版本更新 87%

Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery

人工智能数学推理:语言模型、神经符号系统与验证发现的综合综述

Syed Rifat Raiyan, Mohsinul Kabir, Hasan Mahmud, Md Kamrul Hasan, Sophia Ananiadou

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了数学推理领域从早期规则系统到当代推理模型、多智能体系统及验证发现工作流的演变,沿非正式推理、形式推理、数学发现及推理技术四轴组织,并评估了基准测试、失败模式及未来方向。

Comments Under review, 47 pages, 14 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15097 2026-07-21 cs.SE cs.CR 版本更新 87%

Veritas: Grounding LLM Agents for Reliable Vulnerability Reasoning over Stripped Binaries

Veritas:一种语义导向的代理框架,用于二进制中的内存破坏漏洞检测

Xinran Zheng, Alfredo Pesoli, Marco Valleri, Suman Jana, Lorenzo Cavallaro

专题命中 推理与问题求解 :LLM(title,summary_cn)

AI总结 Veritas通过结合静态切片、双视角LLM检测器和多代理验证器,利用语义基础和运行时证据检测二进制中的内存破坏漏洞,实现了90%的召回率,并在实际应用中发现了一个未知的Apple漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12490 2026-07-15 cs.PL 新提交 87%

When is LLM-Based Program Reasoning Correct? A Completion Semantics for LLM-Based Code Inference

基于大语言模型的程序推理何时正确?基于大语言模型的代码推理的补全语义

Zhiyuan Liu, Yihe Li, Trevor E. Carlson, Huiyan Wang, Ruijie Meng, Gregory J. Duck

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的程序推理何时正确,引入补全语义,将不完整程序形式化,定义存在性推理正确性。以见证生成工作流程实例化方法,在真实任务上评估,能区分合理与不合理推理,为验证不完整程序推理提供实用机制。

Comments 28 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10340 2026-07-14 cs.AR 新提交 87%

When Fuzzing Meets Understanding: LLM-Driven Semantic Test Generation for RTL Verification

当模糊测试与理解相遇:用于RTL验证的大语言模型驱动的语义测试生成

Kun Wang, Cangyuan Li, Kaiyan Chang, Siyang Cai, Yinhe Han, Ying Wang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对硬件验证难题,提出ChipFuzzer框架,利用大语言模型语义推理能力。采用双阶段工作流程,覆盖引导阶段结合控制流分析提升覆盖率,错误引导阶段借助历史数据提高错误发现率,实验显示其显著提升验证效果。

Comments 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17889 2026-07-14 cs.CV 版本更新 87%

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理

Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin, Yunyun Shi, Xuecheng Wu

机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏