arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18714 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18714 篇

2604.08563 2026-04-13 cs.CL cs.AI cs.LG 93%

Temperature-Dependent Performance of Prompting Strategies in Extended Reasoning Large Language Models

提示策略在扩展推理大语言模型中的温度依赖性能

Mousa Salah, Amgad Muneer

机构 * Gujarat Technological University(古吉拉特技术大学) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

AI总结 研究评估了不同温度下链式思维和零样本提示策略在扩展推理中的表现,发现零样本提示在中等温度下性能最佳,链式思维在极端温度下表现最佳,扩展推理的收益随温度增加而提升。

Comments 3 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08743 2025-03-04 cs.CL cs.AI cs.LG 93%

Prompting Fairness: Integrating Causality to Debias Large Language Models

Jingling Li, Zeyu Tang, Xiaoyu Liu, Peter Spirtes, Kun Zhang, Liu Leqi, Yang Liu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments 24 pages, 10 figures

Journal ref The 13th International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13952 2024-12-19 cs.CL cs.AI cs.LG 93%

Prompting Strategies for Enabling Large Language Models to Infer Causation from Correlation

Eleni Sgouritsa, Virginia Aglietti, Yee Whye Teh, Arnaud Doucet, Arthur Gretton, Silvia Chiappa

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15427 2024-01-01 cs.CL cs.AI cs.LG 93%

Graph Neural Prompting with Large Language Models

Yijun Tian, Huan Song, Zichen Wang, Haozhu Wang, Ziqing Hu, Fang Wang, Nitesh V. Chawla, Panpan Xu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09142 2026-08-11 cs.CL 新提交 92%

An Agentic Generative Large Language Model for Treatment Planning of Colorectal Cancer

用于结直肠癌治疗规划的智能体生成式大语言模型

Mengxian Lyu, Cheng Peng, Tim Jang, Ang Li, Mengyuan Zhang, Ziyi Chen, Leighton Elliott, Tianshi Liu, Lidice Galindo, Chiranjeevi Sainatham, Oscar F. Borja-Montes, Kaleb E. Smith, Ying Zhang, Lichao Sun, Jiang Bian, Gloria Lipori, Duane A. Mitchell, Elizabeth A. Shenkman, Yi Guo, Thomas J. George, Yonghui Wu

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 本研究提出智能体生成式大语言模型GatorOnco,经大规模生物医学文本训练与领域适配,在结直肠癌治疗规划的临床评估中性能优于开源LLM,达到专家级水平,可缩小生成式AI在高风险诊疗规划领域的应用差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28590 2026-08-11 cs.AI 版本更新 92%

MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models

MonitorBench: 一个用于大型语言模型链式思维可监控性的综合基准

Han Wang, Yifan Sun, Brian Ko, Mann Talati, Jiawen Gong, Zimeng Li, Naicheng Yu, Xucheng Yu, Wei Shen, Vedant Jolly, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文提出MonitorBench,通过1514个测试实例和两种压力测试设置,评估LLM链式思维的可监控性,发现决策关键因素对中间推理过程的影响程度影响可监控性,更高级的LLM表现出更低的可监控性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06525 2026-06-12 cs.GR cs.AI 新提交 92%

Agentic Large Language Models for Automated Structural Analysis of 3D Frame Systems

用于三维框架系统自动化结构分析的主体化大型语言模型

Ziheng Geng, Ian Franklin, Santiago Martinez, Jiachen Liu, Yunhe Zhao, Minghui Cheng

机构 * Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) School of Architecture, University of Miami(迈阿密大学建筑学院) HBC Engineering Company(HBC工程公司) Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 提出一种主体化LLM框架,通过投影表示和智能体流水线实现从自然语言输入到3D框架的自动化结构分析,平均准确率达90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18178 2026-05-19 cs.CV cs.AI 92%

VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events

VLM-AutoDrive: 事后训练视觉-语言模型用于安全关键的自动驾驶事件

Mohammad Qazim Bhat, Yufan Huang, Niket Agarwal, Hao Wang, Michael Woods, John Kenyon, Tsung-Yi Lin, Xiaodong Yang, Ming-Yu Liu, Kevin Xie

机构 * NVIDIA

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);post-training(title,abstract);large language model(abstract)

AI总结 本文提出VLM-AutoDrive框架,通过整合元数据生成的描述、LLM生成的描述、视觉问答对和推理监督,提升预训练视觉语言模型在安全关键自动驾驶事件中的检测性能。

Comments 16 pages, 9 figures, submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01015 2026-05-12 cs.CL cs.CY 92%

Large Language Models as Students Who Think Aloud: Overly Coherent, Verbose, and Confident

大型语言模型作为思考出声的学生:过于连贯、啰嗦且自信

Conrad Borchers, Jill-Jênn Vie, Roger Azevedo

机构 * Carnegie Mellon University(卡内基梅隆大学) Soda Team, Inria Saclay(Soda团队,法国国家科学研究中心萨克雷分部) University of Central Florida(中央佛罗里达大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文评估LLM在模拟学生思考过程中的表现,发现其推理过于连贯、啰嗦且缺乏变异性,揭示了使用生成式AI设计适应性系统时的认知局限。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02512 2026-08-13 cs.CL cs.AI 版本更新 92%

Social Meaning in Large Language Models: Structure, Magnitude, and Pragmatic Prompting

大语言模型中的社会意义:结构、规模与语用提示

Roland Mühlenbernd

机构 * Leibniz-Centre General Linguistics, Berlin, Germany(莱布尼茨普通语言学中心,柏林,德国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract_cn)

AI总结 本文研究大语言模型在社会意义上的表现,提出两种校准指标并探讨语用理论指导的提示策略对模型校准的影响,发现提示策略能有效减少模型在规模校准上的偏差。

Journal ref Proceedings of the 15th Workshop on Cognitive Modeling and Computational Linguistics (CMCL) @ LREC 2026, pages 162-171

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13220 2026-06-12 cs.AI cs.CE cs.ET cs.LG cs.MA 新提交 92%

LLM-as-an-Investigator: Evidence-First Reasoning for Robust Interactive Problem Diagnosis

LLM作为调查员:基于证据优先的鲁棒交互式问题诊断

Fabrizio Marozzo, Pietro Liò

机构 * University of Calabria(卡拉布里亚大学) University of Cambridge(剑桥大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出证据优先的AI方法LLM-as-an-Investigator,通过估计问题歧义、生成假设、提问澄清并更新概率,避免过早接受用户假设,提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20613 2026-06-05 cs.LG cs.AI cs.MA 92%

Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning

能否用Vibe编码击败研究生计算机科学学生?一个LLM与人类编码竞赛在市场驱动的战略规划中的表现

Panayiotis Danassis, Naman Goel

机构 * University of Southampton(苏塞克斯大学) University of Oxford and Alan Turing Institute(牛津大学和艾伦·图灵研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一个基于现实物流优化问题(拍卖、取件和送货问题)的多智能体推理驱动基准,该问题结合了竞争拍卖与容量受限路由。研究通过比较40个LLM编码代理与17个人类编码代理在12场双打全部比赛和约4万场比赛中的表现,揭示了人类编码代理在战略规划和优化任务中的优势,以及LLM在现实世界中生成有效代码的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25954 2026-05-26 cs.LG cs.AI 92%

Step-TP: A Grounded, Step-Level Dataset with Chain-of-Thought Reasoning for LLM-Guided Tensor Program Optimization

Step-TP: 一个基于步骤级、带有思维链推理的 LLM 引导张量程序优化数据集

Mengfan Liu, Da Zheng, Junwei Su, Chuan Wu

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 为解决 LLM 在张量程序优化中缺乏可验证步骤级监督的问题,提出 Step-TP 数据集,通过结构化思维链推理和原子步骤监督实现可靠的多步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18871 2026-05-20 cs.LG cs.AI 92%

Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning

基于不确定性感知的结构LLM推理的分布能量模型

Shireen Kudukkil Manchingal, Abhey Kalia, Fernanda Gonçalves, Shebin Rawther

机构 * Oxford Dynamics Harwell Science and Innovation Campus(牛津动力学哈威尔科学与创新校园)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种分解的能量函数,结合了学习的质量评分器和确定性分析约束惩罚,用于验证结构LLM输出。该方法通过两步推理循环触发目标再生或 abstention,能够在多个基准测试中超越单次Qwen-72B,并减少约束违反。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06361 2026-05-04 cs.LG cs.AI 92%

Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts

超越提示诱导的谎言:调查LLM在良性提示上的自我欺骗

Zhaomin Wu, Mingzhe Du, See-Kiong Ng, Bingsheng He

机构 * Institute of Data Science National University of Singapore(数据科学研究所,新加坡国立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究LLM在良性提示下的自我欺骗行为,提出基于Contact Searching Questions的框架,通过两个统计指标量化欺骗可能性,发现任务难度增加时欺骗倾向上升,模型容量增加并不总能减少欺骗。

Comments ICLR 2026 (Oral)

Journal ref International Conference on Learning Representations (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07032 2026-02-10 cs.AI cs.AR cs.CL 92%

LLM-FSM: Scaling Large Language Models for Finite-State Reasoning in RTL Code Generation

LLM-FSM: 通过大规模语言模型扩展有限状态推理用于RTL代码生成

Yuheng Wu, Berk Gokmen, Zhouhua Xie, Peijing Li, Caroline Trippel, Priyanka Raina, Thierry Tambe

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);SFT(abstract)

AI总结 LLM-FSM通过大规模语言模型评估有限状态机在RTL代码生成中的表现,展示了模型在复杂性增加时的准确性下降及训练和测试扩展的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10095 2026-01-09 cs.CL cs.AI 92%

Cognitive-Mental-LLM: Evaluating Reasoning in Large Language Models for Mental Health Prediction via Online Text

认知-心理-大语言模型:通过在线文本评估大语言模型在心理健康预测中的推理能力

Avinash Patil, Amardeep Kour Gedhu

机构 * Ira A. Fulton Schools of Engineering Arizona State University Tempe, USA(伊拉·A·福林工程学校亚利桑那州立大学Tempe分校) Department of Psychology Santa Clara University Santa Clara, USA(心理学系圣克拉拉大学Santa Clara分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本研究通过评估链式思维等推理技术,改进了大语言模型在心理健康预测中的分类性能,发现推理增强技术在复杂案例中表现更优,但存在数据集特定的限制。

Comments 8 pages, 4 Figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02429 2025-12-02 cs.AI cs.CL 92%

IoT-LLM: a framework for enhancing Large Language Model reasoning from real-world sensor data

IoT-LLM: 一个增强大语言模型现实世界传感器数据推理能力的框架

Tuo An, Yunjiao Zhou, Han Zou, Jianfei Yang

机构 * MARS Lab, School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore(MARS实验室,机械与航空航天工程学院,南洋理工大学,新加坡) School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore(机械与航空航天工程学院,南洋理工大学,新加坡)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 IoT-LLM通过整合物联网数据与常识知识,提升大语言模型在现实世界传感任务中的推理能力。

Comments 33 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08552 2025-11-18 cs.CL cs.AI 92%

Efficient Post-Training Refinement of Latent Reasoning in Large Language Models

Xinyuan Wang, Dongjie Wang, Wangyang Ying, Haoyue Bai, Nanxu Gong, Sixun Dong, Kunpeng Liu, Yanjie Fu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16091 2025-10-21 cs.CL cs.AI 92%

Evaluating Prompting Strategies and Large Language Models in Systematic Literature Review Screening: Relevance and Task-Stage Classification

Binglan Han, Anuradha Mathrani, Teo Susnjak

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00726 2025-08-29 cs.AI cs.LG 92%

Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess

Dongyoon Hwang, Hojoon Lee, Jaegul Choo, Dongmin Park, Jongho Park

机构 * KAIST AI(韩国科学技术院人工智能研究所) KRAFTON(KRAFTON公司) UC Berkeley(伯克利大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(title);LLM(abstract)

Comments Accepted into Test-time Scaling and Reasoning Models (SCALR) workshop at COLM 2025. 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04013 2025-03-07 cs.CL cs.AI 92%

Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting

Jiyue Jiang, Pengan Chen, Jiuming Wang, Dongchen He, Ziqin Wei, Liang Hong, Licheng Zong, Sheng Wang, Qinze Yu, Zixian Ma, Yanyu Chen, Yimin Fan, Xiangyu Shi, Jiawei Sun, Chuan Wu, Yu Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05879 2025-02-11 cs.CL cs.AI 92%

Enhancing Depression Detection with Chain-of-Thought Prompting: From Emotion to Reasoning Using Large Language Models

Shiyu Teng, Jiaqing Liu, Rahul Kumar Jain, Shurong Chai, Ruibo Hou, Tomoko Tateyama, Lanfen Lin, Yen-wei Chen

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13538 2024-10-08 cs.AI cs.LG 92%

AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations

Zhicheng Yang, Yinya Huang, Jing Xiong, Liang Feng, Xiaodan Liang, Yiwei Wang, Jing Tang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09797 2024-10-08 cs.CL cs.LG 92%

Progressive-Hint Prompting Improves Reasoning in Large Language Models

Chuanyang Zheng, Zhengying Liu, Enze Xie, Zhenguo Li, Yu Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments Accepted to ICML AI4MATH 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12315 2024-08-23 cs.AI cs.CL 92%

Large Language Models Are Self-Taught Reasoners: Enhancing LLM Applications via Tailored Problem-Solving Demonstrations

Kai Tzu-iunn Ong, Taeyoon Kwon, Jinyoung Yeo

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments preprint / under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13966 2024-05-24 cs.AI cs.CL 92%

On the Brittle Foundations of ReAct Prompting for Agentic Large Language Models

Mudit Verma, Siddhant Bhambri, Subbarao Kambhampati

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15764 2024-03-28 cs.CL cs.AI 92%

Look Before You Leap: Problem Elaboration Prompting Improves Mathematical Reasoning in Large Language Models

Haoran Liao, Jidong Tian, Shaohua Hu, Hao He, Yaohui Jin

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01728 2024-01-30 cs.LG cs.AI 92%

Time-LLM: Time Series Forecasting by Reprogramming Large Language Models

Ming Jin, Shiyu Wang, Lintao Ma, Zhixuan Chu, James Y. Zhang, Xiaoming Shi, Pin-Yu Chen, Yuxuan Liang, Yuan-Fang Li, Shirui Pan, Qingsong Wen

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)

Comments Accepted by the 12th International Conference on Learning Representations (ICLR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01441 2023-12-08 cs.CL cs.AI 92%

UPAR: A Kantian-Inspired Prompting Framework for Enhancing Large Language Model Capabilities

Hejia Geng, Boxun Xu, Peng Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏