arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18731 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18731 篇

2308.13724 2023-08-29 cs.RO cs.AI 92%

ISR-LLM: Iterative Self-Refined Large Language Model for Long-Horizon Sequential Task Planning

Zhehua Zhou, Jiayang Song, Kunpeng Yao, Zhan Shu, Lei Ma

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04091 2023-05-29 cs.CL 92%

Plan-and-Solve Prompting: Improving Zero-Shot Chain-of-Thought Reasoning by Large Language Models

Lei Wang, Wanyu Xu, Yihuai Lan, Zhiqiang Hu, Yunshi Lan, Roy Ka-Wei Lee, Ee-Peng Lim

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.00618 2023-02-02 cs.CL 92%

Synthetic Prompting: Generating Chain-of-Thought Demonstrations for Large Language Models

Zhihong Shao, Yeyun Gong, Yelong Shen, Minlie Huang, Nan Duan, Weizhu Chen

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05391 2026-07-08 cs.AI cs.CL cs.LG cs.MA cs.RO 新提交 91%

LLM-as-a-Verifier: A General-Purpose Verification Framework

LLM-as-a-Verifier:一种通用验证框架

Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA Research(英伟达研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该工作将验证确定方案正确性的能力作为大模型新扩展轴,提出无需额外训练的通用LLM验证框架,生成连续评分,在多基准上取得SOTA性能,还可用于强化学习等场景。

Comments Code: https://github.com/llm-as-a-verifier/llm-as-a-verifier Website: https://llm-as-a-verifier.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14142 2026-08-03 cs.CL cs.AI 版本更新 91%

Implicit Reasoning for Large Language Model-based Generative Recommendation

基于大语言模型的生成式推荐的隐式推理

Yinhan He, Liam Collins, Bhuvesh Kumar, Jundong Li, Neil Shah, Donald Loveland

机构 * University of Virginia(弗吉尼亚大学) Snap Inc.(Snap公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 针对大语言模型用于生成式推荐时显式推理的三大局限(世界知识表达弱化、语义ID与自然语言嵌入空间不对齐、推理质量敏感),提出轻量级隐式推理范式PauseRec,在性能、训练成本和推理速度上均优于显式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10788 2026-06-02 cs.CL cs.AI 91%

TInR: Exploring Tool-Internalized Reasoning in Large Language Models

TInR:探索大语言模型中的工具内化推理

Qiancheng Xu, Yongqi Li, Fan Liu, Hongru Wang, Min Yang, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Southeast University(东南大学) University of Edinburgh(爱丁堡大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出TInR-U框架,通过工具内化、监督微调和强化学习三阶段训练,使LLM无需外部文档即可进行工具集成推理,在域内和域外设置中均取得优越性能。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22139 2026-05-29 cs.CL cs.AI 91%

Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers

边推理边提问:将推理型大语言模型从被动求解者转变为主动询问者

Xin Chen, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Artificial Intelligence Research Institute(人工智能研究院) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Texas, Dallas(德克萨斯大学达拉斯分校) University of Minnesota(明尼苏达大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);prompting(abstract)

AI总结 提出主动交互推理(PIR)范式,通过不确定性感知微调和用户模拟器策略优化,使LLM在推理中主动提问以澄清前提和意图不确定性,在数学推理、代码生成和文档编辑任务上显著提升准确率、通过率和BLEU值,同时减少近半推理计算和不必要交互。

Comments ACL Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20743 2026-05-29 cs.HC cs.AI cs.CL 91%

Empathic Prompting: Non-Verbal Context Integration for Multimodal LLM Conversations

共情提示:多模态大语言模型对话中的非语言上下文整合

Lorenzo Stacchio, Andrea Ubaldi, Alessandro Galdelli, Maurizio Mauri, Emanuele Frontoni, Andrea Gaggioli

机构 * University of Macerata(马切拉塔大学)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出共情提示框架,通过集成面部表情识别服务将非语言情感线索隐式融入大语言模型对话,实现无需用户显式控制的流畅多模态交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11956 2026-05-19 cs.CL cs.AI 91%

Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence

双重校准:通过校准知识和推理置信度实现可靠的LLM

Yuyin Lu, Ziran Liang, Yanghui Rao, Wenqi Fan, Fu Lee Wang, Qing Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(中山大学计算机科学与工程学院,广州,中国) Department of Computing, The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学计算机系,香港特别行政区) School of Science and Technology, Hong Kong Metropolitan University, Hong Kong SAR(香港 Metropolitan 大学科技学院,香港特别行政区)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出双重校准框架,通过校准知识和推理置信度提升LLM的可靠性,实验表明其在保持低token成本的同时显著提高准确性和置信度校准。

Comments This work is to appear in the Proceedings of the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18612 2026-04-22 cs.NE cs.AI cs.LG 91%

Agent-GWO: Collaborative Agents for Dynamic Prompt Optimization in Large Language Models

Agent-GWO: 为大型语言模型的动态提示优化设计的协作代理

Xudong Wang, Chaoning Zhang, Chenghao Li, Shuxu Chen, Qigan Sun, Jiaquan Zhang, Fachrina Dewi Puspitasari, Tae-Ho Kim, Jiwei Wei, Malu Zhang, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * Kyung Hee University(韩国庆熙大学) University of Electronic Science and Technology of China(电子科技大学) Nota Inc.(Nota公司) Tongji University(同济大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出Agent-GWO框架,通过统一提示模板和解码超参数作为可继承的代理配置,利用灰狼优化器的领导者-追随者机制,自动选择领导者代理以指导协作更新,提升复杂推理的准确性和稳定性。

Comments Accepted to ACL 2026. 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19563 2026-04-20 cs.AI cs.CL 91%

TabularMath: Understanding Math Reasoning over Tables with Large Language Models

TabularMath: 通过大规模语言模型理解表格上的数学推理

Shi-Yu Tian, Zhi Zhou, Wei Dong, Kun-Yang Yu, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出TabularMath基准,通过神经符号框架将数学问题转化为可扩展的表格推理任务,揭示表格复杂度、质量及表征对推理性能的影响,发现低质量表格对当前LLM的可靠性构成严重风险。

Comments Accepted by ACL 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12229 2026-04-15 cs.AI cs.CL 91%

HintMR: Eliciting Stronger Mathematical Reasoning in Small Language Models

HintMR:在小型语言模型中激发更强的数学推理

Jawad Hossain, Xiangyu Guo, Jiawei Zhou, Chong Liu

机构 * University at Albany(阿尔巴尼大学) University at Buffalo(布法罗大学) Stony Brook University(石溪大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 本文提出HintMR框架,通过提示辅助引导小型语言模型进行多步数学问题解决,通过协作的双模型系统提升推理准确性,实验表明在多种数学基准上显著提升性能。

Comments 15 pages, 5 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03752 2026-03-05 cs.CL cs.AI 91%

Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning

置信度校准的小-大语言模型协作用于成本有效的推理

Chuang Zhang, Zizhen Zhu, Yihao Wei, Bing Tian, Junyi Liu, Henan Wang, Xavier Wang, Yaxiao Liu

机构 * Amazon Web Services(亚马逊网络服务) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

AI总结 COREA通过结合小型和大型语言模型,利用置信度校准提升推理效率,降低21.5%-16.8%成本,同时保持高准确率。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17880 2025-10-22 cs.CL cs.AI 91%

Outraged AI: Large language models prioritise emotion over cost in fairness enforcement

Hao Liu, Yiqing Dai, Haotian Tan, Yu Lei, Yujia Zhou, Zhen Wu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23368 2025-09-30 cs.CL cs.AI 91%

MedCritical: Enhancing Medical Reasoning in Small Language Models via Self-Collaborative Correction

Xinchun Su, Chunxu Luo, Yixuan Li, Weidong Yang, Lipeng Ma

机构 * School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19954 2025-08-25 cs.CL cs.AI 91%

Collaborative Stance Detection via Small-Large Language Model Consistency Verification

Yu Yan, Sheng Sun, Zixiang Tang, Teli Liu, Min Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) People Public Security University of China(中国人民公安大学) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Laboratory(中关村实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08669 2025-06-11 cs.LG cs.AI 91%

Enhancing Reasoning Capabilities of Small Language Models with Blueprints and Prompt Template Search

Dongge Han, Menglin Xia, Daniel Madrigal Diaz, Samuel Kessler, Ankur Mallick, Xuchao Zhang, Mirian Del Carmen Hipolito Garcia, Jin Xu, Victor Rühle, Saravan Rajmohan

机构 * Microsoft(微软)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

Comments TTODLer-FM Workshop@ICML'25 (Tiny Titans: The next wave of On-Device Learning for Foundational Models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12216 2025-06-04 cs.CL cs.LG 91%

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Siyan Zhao, Devaansh Gupta, Qinqing Zheng, Aditya Grover

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

Comments 27 pages, project page at https://dllm-reasoning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17119 2025-05-26 cs.CL cs.LG 91%

Systematic Evaluation of Machine-Generated Reasoning and PHQ-9 Labeling for Depression Detection Using Large Language Models

Zongru Shao, Xin Wang, Zhanyang Liu, Chenhan Wang, K. P. Subbalakshmi

机构 * Silicon Austria Labs(硅 Austria 实验室) Jiangnan University(江南大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

Comments 8 pages without references

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00379 2025-02-18 cs.AI cs.CL 91%

GraphArena: Evaluating and Exploring Large Language Models on Graph Computation

Jianheng Tang, Qifan Zhang, Yuhan Li, Nuo Chen, Jia Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments ICLR 2025 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08398 2023-11-17 cs.CL cs.AI 91%

Are Large Language Models Temporally Grounded?

Yifu Qiu, Zheng Zhao, Yftah Ziser, Anna Korhonen, Edoardo M. Ponti, Shay B. Cohen

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13791 2026-08-17 eess.IV cs.CV 新提交 91%

VLM- and LLM-Driven Multi-Agent System for PET Image Denoising

基于视觉语言模型(VLM)与大语言模型(LLM)驱动的多智能体正电子发射断层扫描(PET)图像去噪系统

Boxiao Yu, Savas Ozdemir, Yang Xing, Fumio Hashimoto, Jiong Wu, Yizhou Chen, Axel Rominger, Ruogu Fang, Kuangyu Shi, Tinsu Pan, Kuang Gong

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对PET图像分辨率低、信噪比差及深度学习去噪部署需多模型与专家干预的问题,本文提出VLM与LLM驱动的多智能体闭环PET去噪框架,自主选最优模型参数,在低剂量数据上优于UNet等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06760 2026-08-10 cs.NI 新提交 91%

A Parameter-Specific Retrieval and Knowledge-Guided Reasoning Framework for LLM-Based GPSR Optimization in FANETs

面向FANET中基于LLM的GPSR优化的参数特定检索与知识引导推理框架

Zhipeng Lin, Bin Duo, Tong Liu, Jie Lin, Jianting Yuan, Xiaojun Yuan

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对FANET中现有GPSR协议难以适配动态环境的问题,提出基于LLM的PMKR-GPSR框架,通过参数特定多索引检索和知识引导约束图实现协议一致的路由参数适配,在高移动性场景下提升了数据包投递率并降低了端到端时延。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07850 2026-08-05 physics.comp-ph math-ph math.MP 版本更新 91%

PDE-Agents: An LLM-Orchestrated Multi-Agent Framework for Automated Finite Element Simulations with Knowledge Graph-Augmented Reasoning

PDE-Agents: 一种基于知识图谱增强推理的LLM编排多智能体框架,用于自动化有限元模拟

Sayan Adhikari, Gulshan Noorsumar, Øyvind Jensen

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出PDE-Agents多智能体系统,通过LLM编排实现偏微分方程/有限元模拟全流程自动化,采用GraphRAG知识图谱增强,在50个任务消融实验中KG Smart模式达100%成功率,并验证了二阶空间收敛性。

Comments 19 pages, 9 figures, 10 tables, 1 algorithm. Code and evaluation artifacts: https://github.com/MatPro-IFE/pde-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12088 2026-08-03 cs.SE 版本更新 91%

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation

结构化安全审计:在LLM生成代码的正确性与内容安全之间平衡

Honghao Tan, Haibo Wang, Shin Hwei Tan

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出NLSafety-Utility Duality Score和Dual Reasoning,通过结构化安全审计和任务导向的代码审查,提升LLM生成代码的安全性和正确性,实验显示其在多个模型上显著提升SUDS评分。

Comments 13 pages. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Artifact: https://doi.org/10.5281/zenodo.19245736

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30119 2026-06-30 cs.CR 91%

On the Internet, Nobody Knows You're an LLM Bot: Unmasking Web Agents with Multi-Layer Fingerprinting

在互联网上,没人知道你是一个LLM机器人:使用多层指纹识别揭露网络代理

Iliana Fayolle, Sihem Bouhenniche, Samuel Pélissier, Pierre Laperdrix, Clémentine Maurice, Walter Rudametkin

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文部署蜜罐站点,结合网络、HTTP和浏览器层指纹识别技术,评估六种基于LLM的网络代理绕过反机器人机制的能力,发现多层指纹可区分代理与人类及代理之间,且隐身机制反而增加可检测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27684 2026-06-29 cs.IR 新提交 91%

Intuition-Guided Latent Reasoning for LLM-Based Recommendation

直觉引导的潜在推理用于基于LLM的推荐

Chang Liu, Yimeng Bai, Xiaoyan Zhao, Yang Zhang, Qifan Wang, Fuli Feng, Wenge Rong

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出IntuRec框架,通过提取用户历史生成候选集作为直觉,注入偏好对齐的直觉嵌入初始化潜在推理起点,提升LLM推荐推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25489 2026-06-25 cs.HC 新提交 91%

When LLM Rationales Become User-Facing: Effects on Trust Perception, Decision-Making, and Gaze Behaviors

当LLM推理理由面向用户时:对信任感知、决策和注视行为的影响

Xin Sun, Ting Pan, Yajing Wang, Shu Wei, Jos A. Bosch, Isao Echizen, Abdallah El Ali, Saku Sugawara

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究通过两项实验(在线和眼动追踪)探讨LLM推理理由的呈现方式、正确性和确定性框架对用户信任、决策和注视行为的影响,发现不正确理由降低信任并增加认知负荷,挑战了“更多推理更好”的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07306 2026-06-25 cs.HC 版本更新 91%

Seeing the Reasoning: How LLM Rationales Influence User Trust and Decision-Making in Factual Verification Tasks

看见推理:LLM 推理如何影响用户在事实核查任务中的信任与决策

Xin Sun, Shu Wei, Jos A Bosch, Isao Echizen, Saku Sugawara, Abdallah El Ali

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过在线实验(N=68)操纵LLM推理的呈现格式、正确性和确定性框架,发现正确推理和确定性线索提升信任与决策采纳,不确定性线索降低,而呈现格式无显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21543 2026-06-24 cs.RO 版本更新 91%

Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation

Self-CriTeach: LLM 自我教学与自我批评用于通过自动领域生成提升机器人规划

Jinbang Huang, Zhiyuan Li, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Self-CriTeach框架,通过LLM自动生成符号规划领域,用于自我教学生成规划问题-计划对及自我批评生成结构化奖励信号,提升机器人规划性能与泛化能力。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏