arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18731 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18731 篇

2608.06819 2026-08-10 cs.CL cs.AI 新提交 92%

FutureBridge: Token Selection Beyond Local Preference in Collaborative Decoding

FutureBridge:协作解码中超越局部偏好的令牌选择

Quanquan Li, Hongbo Zhang, Yihe Chi, Jingyu Li, Xidong Xi, Liuyang Song, Hongzhen Zhang, Yuxiang Huang, Jing Ke, Siyuan Ma, Junyi Lin, Guitao Cao

专题命中 推理与问题求解 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 FutureBridge通过联合LLM-SLM令牌对SLM后续推理的支持度排序,在5个数学推理基准上使Qwen3-1.7B SLM的数学平均得分较贪心解码提升35.1%,超越了仅依赖LLM局部偏好的现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05152 2026-08-07 cs.CL cs.AI 新提交 92%

Mean-Field Dynamics of Chain-of-Thought Reasoning in Large Language Models

大型语言模型中思维链推理的平均场动力学

Hao Ai

机构 * Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出框架,将LLM推理建模为线索图引导式发现过程,用平均场近似推导线索占比的常微分方程,实验验证所得统计规律可复现且能被该方程拟合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03519 2026-08-04 cs.CL cs.AI 版本更新 92%

TS-Reasoner: Aligning Time Series Foundation Models with LLM Reasoning

TS-Reasoner:将时间序列基础模型与大语言模型推理能力对齐

Fangxu Yu, Hongyu Zhao, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 推理与问题求解 :LLM(title,abstract);foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 TS-Reasoner通过两阶段训练将时间序列基础模型与大语言模型对齐,在多个基准上性能优于同类模型且数据效率更高,解决了时间序列模型推理能力不足的问题。

Comments Accepted to Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19404 2026-06-19 cs.LG cs.CL 新提交 92%

Thermodynamic Signatures of Reasoning: Free-Energy and Spectral-Form-Factor Diagnostics for Hallucination Detection in Large Language Models

推理的热力学特征:用于大型语言模型幻觉检测的自由能和谱形因子诊断

Salim Khazem

机构 * Talan Research & Innovation Center(Talan研究与创新中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出自由能签名(Fes)作为谱描述符,将注意力拉普拉斯视为哈密顿量并提取热力学势和随机矩阵理论谱形因子,用于检测LLM幻觉,无需训练即可实现高AUROC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19351 2026-06-19 cs.CL cs.AI 新提交 92%

Detecting Hallucinations for Large Language Model-based Knowledge Graph Reasoning

基于大语言模型的知识图谱推理中的幻觉检测

Xinyan Zhu, Yaoqi Liu, Yue Gao, Huadong Ma, Cheng Yang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出LUCID方法,结合LLM注意力分数、知识图谱语义和结构信息,利用图神经网络检测LLM在知识图谱推理中的幻觉,在九个数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05568 2026-06-16 cs.AI cs.CL cs.CY stat.AP 版本更新 92%

Metacognitive Myopia in Large Language Models

大型语言模型中的元认知近视

Florian Scholten, Tobias R. Rebholz, Mandy Hütter

机构 * Psychology Department, University of Tübingen(图宾根大学心理学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出元认知近视框架解释LLM偏见,认为信息环境中的有偏样本导致五种症状,并通过监控与控制机制近似技术缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31404 2026-06-01 cs.CL cs.AI 92%

The Sword, Shield, and Achilles' Heel: Characterizing the Linguistic Inductive Bias of Large Language Models for Spatial Reasoning in Navigation Planning

剑、盾与阿喀琉斯之踵:大型语言模型在导航规划中空间推理的语言归纳偏置特征化

Xudong Zhang, Jian Yang, Shengkai Wang, Jiangpeng Tian, Shaowen Chen, Xian Wei, Ke Li, Xiong You

机构 * East China Normal University(东华大学) Information Engineering University(信息工程大学) Zhengzhou University(郑州大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出双干预框架,通过表示干预和上下文干预分离语言结构与上下文线索,揭示LLM在导航规划中语言归纳偏置的规律:拓扑信息是稳健规划的支柱,语言格式是双刃剑,语义信息是致命弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09678 2026-05-13 cs.AI cs.LG cs.SE 92%

EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages

EsoLang-Bench: 通过奇特编程语言评估大语言模型的真实推理能力

Aman Sharma, Paras Chopra

机构 * Lossfunk

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 EsoLang-Bench通过五种奇特编程语言评估大语言模型在分布外编程语言上的推理能力,发现前沿模型在处理陌生语言时存在显著能力差距。

Comments 45 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19918 2026-05-08 cs.AI cs.LG 92%

Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models

Meta-Reasoner:用于大型语言模型推理时间优化的动态指导

Yuan Sui, Yufei He, Tri Cao, Simeng Han, Yulin Chen, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Yale University(耶鲁大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出Meta-Reasoner框架,通过动态调整推理策略提升大语言模型的推理效率,实验显示在数学和科学任务中准确率提升9-12%,推理时间减少28-35%。

Comments Accepted by ACL'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22937 2026-04-28 cs.CL cs.LG cs.PL 92%

AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs

AutoPyVerifier: 为大语言模型输出学习紧凑的可执行验证器

Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(梅加戈恩实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出AutoPyVerifier框架,通过LLM生成候选验证器并利用DAG搜索优化,提升验证器集对目标任务的预测精度,实验表明在多个基准测试中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17819 2026-04-21 cs.CL cs.AI 92%

PDDL-Mind: Large Language Models are Capable on Belief Reasoning with Reliable State Tracking

PDDL-Mind:大型语言模型在具有可靠状态跟踪的信念推理中表现出色

Wang Bill Zhu, Qiutong Tony Yi, Robin Jia, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 PDDL-Mind通过将叙述描述转换为显式状态和动作,为LLM提供了一致的世界状态表示,从而在信念推理任务中提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12379 2026-04-15 cs.SE cs.AI cs.LG 92%

Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks

超越输出正确性:评估大型语言模型在编码任务中的推理能力

Yuangang Li, Justin Tian Jin Chen, Ethan Yu, David Hong, Iftekhar Ahmed

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CodeRQ-Bench,首个评估LLM在生成、摘要和分类等编码任务中推理质量的基准,通过分析现有评估器的1069个不匹配案例,提出VERA评估器,实验表明其在四个数据集上均优于基线,提升AUCROC和AUPRC最高达0.26和0.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04355 2026-03-03 cs.CL cs.AI 92%

LLM-ProS: Analyzing Large Language Models' Performance in Competitive Problem Solving

LLM-ProS: 分析大语言模型在竞争性问题解决中的性能

Md Sifat Hossain, Anika Tabassum, Md. Fahim Arefin, Tarannum Shaila Zaman

机构 * Department of Information Systems, University of Maryland, Baltimore County, Maryland, USA(信息系统系,马里兰大学巴尔的摩县分校,马里兰州,美国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 LLM-ProS评估了多种大语言模型在ICPC问题中的性能,揭示了模型在泛化、适应和解决新问题方面的差异,并探讨了训练方法和数据集对性能的影响。

Comments To be published in LLM4Code 2025 workshop proceedings

Journal ref 2025 IEEE/ACM International Workshop on Large Language Models for Code (LLM4Code)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01972 2026-07-03 cs.CL cs.AI cs.LG 新提交 92%

Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization

Object Aligner: 一种可配置的图结构JSON模式相似度评分,应用于LLM提示优化

Jan Drchal

机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院人工智能中心)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Object Aligner,一种基于递归树对齐和引用对齐的JSON相似度评分方法,通过Weisfeiler-Leman颜色细化近似图同构,用于LLM输出评估和提示优化。

Comments 28 pages, This is a submitted version of a manuscript under review at IEEE Access; it has not been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11863 2026-06-11 cs.SE 新提交 92%

Enhancing LLM-Based Code Translation with Verified Multi-Semantic Representations

增强基于LLM的代码翻译:利用验证过的多语义表示

Yufu Wang, He Jiang, Hao Lin, Peiyu Zou, Ang Jia, Xiaochen Li, Zhilei Ren

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Multisage框架,通过提取和验证多语义表示(数据流图、类型约束等)来提升LLM代码翻译的准确性和可靠性,在HumanEval-X上翻译成功率提升至2.22倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06915 2026-06-09 cs.CL cs.AI cs.LG 版本更新 92%

ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning

ThinkBooster: 一种用于LLM推理无缝测试时扩展的统一框架

Vladislav Smirnov, Chieu Nguyen, Sergey Senichev, Minh Ngoc Ta, Ekaterina Fadeeva, Artem Vazhentsev, Daria Galimzianova, Nikolai Rozanov, Viktor Mazanov, Jingwei Ni, Tianyi Wu, Igor Kiselev, Mrinmaya Sachan, Iryna Gurevych, Preslav Nakov, Timothy Baldwin, Artem Shelmanov

机构 * MBZUAI ETH Zürich(苏黎世联邦理工学院) Imperial College London(伦敦帝国理工学院) NUS(国立大学新加坡) Accenture(埃森哲) Innopolis University(因诺普里斯大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ThinkBooster框架,通过模块化库、联合评估基准和可部署代理服务,实现LLM推理的测试时计算扩展,在数学和编码任务上验证了性能-计算权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07314 2026-06-08 cs.SE cs.ET quant-ph 新提交 92%

QBugLM: An Agentic Benchmarking Framework for LLM-based Quantum Software Debugging

QBugLM:基于LLM的量子软件调试的智能基准测试框架

An B. B. Pham, Hoa T. Nguyen, Muhammad Usman

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出QBugLM多智能体框架,自动化量子软件调试流程,通过案例研究评估LLM调试能力,发现迭代反馈显著提升修复成功率。

Comments This paper was accepted at IEEE QSW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24216 2026-05-26 cs.LG cs.AI cs.CL cs.CR 92%

Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning

Agent-ToM: 通过心智理论推理学习监控自主LLM智能体

Nesreen K. Ahmed, Nima Nafisi

机构 * Cisco Outshift(思科Outshift)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对自主LLM智能体的隐蔽恶意行为监控难题,提出基于心智理论推理的Agent-ToM框架,通过信念推断、意图假设与验证实现结构化轨迹分析,在监控基准上取得优于集成方法的性能。

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12773 2026-05-20 cs.CL cs.AI cs.LG 92%

Dr.LLM: Dynamic Layer Routing in LLMs

Dr.LLM:大语言模型中的动态层路由

Ahmed Heakl, Martin Gubri, Salman Khan, Sangdoo Yun, Seong Joon Oh

机构 * Parameter Lab(参数实验室) MBZUAI(穆扎夫法尔国际人工智能研究院) NAVER AI Lab(NAVER人工智能实验室) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Dr.LLM,一种通过在预训练模型中加入轻量级每层路由器来实现动态层路由的框架,该方法在不改变基础权重的情况下,通过显式监督训练路由器,提高推理的计算效率和准确性。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11518 2026-05-19 cs.AI cs.CL cs.LG 92%

AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive

AutoLLMResearch: 训练研究代理以自动化LLM实验配置 - 从低成本学习,优化高成本

Taicheng Guo, Nitesh V. Chawla, Olaf Wiest, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AutoLLMResearch框架,通过多保真度实验环境学习LLM配置原则,解决高成本实验自动化问题,展示其在大规模LLM实验中的有效性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09260 2026-05-12 cs.NI 92%

Chain-of-Thought Reasoning Enhances In-Context Learning for LLM-Based Mobile Traffic Prediction

基于链式推理的LLM移动交通预测增强情境学习

MohammadMahdi Ghadaksaz, Mohammad Farzanullah, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种基于链式推理的LLM移动交通预测框架,通过离线阶段生成结构化推理示例和在线阶段实时预测,提升交通预测精度,实验表明其在MAE、RMSE和R2-score上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09121 2026-05-12 cs.LG cs.AI cs.CL cs.IT math.IT 92%

A Communication-Theoretic Framework for LLM Agents: Cost-Aware Adaptive Reliability

基于LLM代理的通信理论框架:成本感知的自适应可靠性

Hamed Omidvar, Vahideh Akhlaghi

机构 * INTELLERCE LLC(INTELLERCE公司)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于通信理论的LLM代理框架,将可靠性技术统一为六种经典运算,通过成本感知路由器实现任务级优化,展示在不同任务中动态分配资源的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17807 2026-04-21 cs.CV cs.RO 92%

Re$^2$MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement

Re²MoGen:通过LLM推理和物理感知细化的开放词汇运动生成

Jiakun Zheng, Ting Xiao, Shiqin Cao, Xinran Li, Zhe Wang, Chenjia Bai

机构 * East China University of Science and Technology(东华大学) Hong Kong University of Science and Technology(香港科技大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 Re²MoGen通过LLM推理生成初始运动计划,并利用强化学习细化物理合理性,实现开放词汇运动生成的高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21486 2025-11-12 cs.CV 92%

Reasoning-Enhanced Domain-Adaptive Pretraining of Multimodal Large Language Models for Short Video Content Governance

Zixuan Wang, Yu Sun, Hongwei Wang, Baoyu Jing, Xiang Shen, Xin Dong, Zhuolin Hao, Hongyu Xiong, Yang Song

机构 * TikTok Inc.(字节跳动公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);SFT(abstract)

Comments Camera Ready for EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08648 2025-06-11 cs.RO 92%

LLM-Craft: Robotic Crafting of Elasto-Plastic Objects with Large Language Models

Alison Bartsch, Amir Barati Farimani

机构 * With the Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04813 2025-03-10 cs.LG cs.AI cs.CL 92%

Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models

Joykirat Singh, Tanmoy Chakraborty, Akshay Nambi

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);preference optimization(title);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14744 2024-10-29 cs.AI cs.CL cs.CY cs.LG 92%

Large Language Models as Urban Residents: An LLM Agent Framework for Personal Mobility Generation

Jiawei Wang, Renhe Jiang, Chuang Yang, Zengqing Wu, Makoto Onizuka, Ryosuke Shibasaki, Noboru Koshizuka, Chuan Xiao

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2024. Source codes are available at https://github.com/Wangjw6/LLMob/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04501 2024-06-10 cs.LG cs.AI cs.CL stat.ML 92%

FLUID-LLM: Learning Computational Fluid Dynamics with Spatiotemporal-aware Large Language Models

Max Zhu, Adrián Bazaga, Pietro Liò

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10062 2024-03-26 cs.RO 92%

SMART-LLM: Smart Multi-Agent Robot Task Planning using Large Language Models

Shyam Sundar Kannan, Vishnunandan L. N. Venkatesh, Byung-Cheol Min

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments Submitted to IROS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17230 2024-02-28 cs.CR 92%

Chain-of-Thought Prompting of Large Language Models for Discovering and Fixing Software Vulnerabilities

Yu Nong, Mohammed Aldeen, Long Cheng, Hongxin Hu, Feng Chen, Haipeng Cai

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏