arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18714 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18714 篇

2604.10929 2026-04-15 cs.RO 95%

Ro-SLM: Onboard Small Language Models for Robot Task Planning and Operation Code Generation

Ro-SLM:机器人任务规划与操作代码生成的 onboard 小语言模型

Wenhao Wang, Yanyan Li, Long Jiao, Jiawei Yuan

机构 * Department of Computer & Information Science, University of Massachusetts Dartmouth(达特茅斯大学计算机与信息科学系) Department of Computer Science & Engineering, California State University San Marcos(加州州立大学桑马克斯分校计算机科学与工程系)

专题命中 推理与问题求解 :SLM(title,title_cn);language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出Ro-SLM框架,通过蒸馏大语言模型知识提升机器人任务规划与代码生成能力,实验证明其性能接近大语言模型。

Comments 25 pages, 2 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08501 2026-05-19 cs.AI 94%

GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games

GVGAI-LLM:通过无限游戏评估大语言模型代理

Yuchen Li, Cong Lin, Muhammad Umair Nasir, Philip Bontrager, Jialin Liu, Julian Togelius

机构 * New York University(纽约大学) University of the Witwatersrand(沃尔特·斯通大学) Meta Lingnan University(岭南大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 GVGAI-LLM通过 arcade 式游戏测试大语言模型的推理与问题解决能力,定义了可解释的评估指标,揭示了模型在空间推理和基本规划中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28008 2026-05-28 cs.AI cs.LG 94%

Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training

压缩思维:压缩推理数据在LLM后训练中何时以及如何发挥作用

Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 推理与问题求解 :LLM(title,title_cn);SFT(summary_cn,abstract);post-training(title,abstract);large language model(abstract)

AI总结 本文通过分类显式、组合和隐式思维链,在合成组合推理任务上实验,发现粗粒度CoT需要更多SFT数据,组合和隐式CoT从数据缩放中获益更多但隐式CoT易导致记忆,后续RLVR会分解压缩步骤,且单向CoT顺序在长序列任务上泛化更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20216 2026-07-23 cs.CR cs.AI 新提交 94%

Small, Free, and Effective: Orchestrating Open-Weight Small Language Models to Outperform Single LLM for Malware Analysis

小巧、免费且高效:编排开放权重的小型语言模型以在恶意软件分析中超越单个大语言模型

Adel ElZemity, Shujun Li, Budi Arief

专题命中 推理与问题求解 :SLM(summary_cn,abstract);LLM(title,abstract);language model(title,abstract);small language model(title,abstract)

AI总结 研究恶意软件分析中,小型语言模型编排集成能否超越单个大语言模型。通过测试多种模型建立基线,设计评估四种编排架构,其中混合系统表现出色,总体准确率超专业和前沿基线,证明基于证据的编排可提升SLM性能。

Comments To appear in Proceedings of the 29th International Symposium on Research in Attacks, Intrusions, and Defenses (RAID)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12641 2026-06-17 cs.AI 94%

STEP-LLM: Generating CAD STEP Models from Natural Language with Large Language Models

STEP-LLM: 通过大型语言模型生成CAD STEP模型

Xiangyu Shi, Junyang Ding, Xu Zhao, Sinong Zhan, Payal Mohapatra, Daniel Quispe, Kojo Welbeck, Jian Cao, Wei Chen, Ping Guo, Qi Zhu

机构 * Northwestern University(西北大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出STEP-LLM,通过大型语言模型将自然语言转化为CAD STEP模型,采用图结构预处理和强化学习提升几何精度,验证了LLM驱动的STEP模型生成可行性。

Comments Accepted to the Design, Automation & Test in Europe Conference (DATE) 2026

Journal ref In Proceedings of the 2026 Design, Automation & Test in Europe Conference (DATE 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03627 2026-05-27 cs.CL cs.AI 94%

Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks

提示的鲁棒性:增强大型语言模型对抗提示攻击的鲁棒性

Lin Mu, Guowei Chu, Li Ni, Lei Sang, Yiwen Zhang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

AI总结 提出RoP(提示鲁棒性)策略,通过错误校正和引导两个阶段,增强LLM对输入扰动的鲁棒性,在算术、常识和逻辑推理任务上显著提升性能。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26569 2026-04-30 cs.RO 94%

LLM-Flax : Generalizable Robotic Task Planning via Neuro-Symbolic Approaches with Large Language Models

LLM-Flax:通过大规模语言模型的神经符号方法实现通用机器人任务规划

Seongmin Kim, Daegyu Lee

机构 * Department of Physical AI Engineering(物理人工智能工程系) Faculty of Department of Advanced Defense Technology and Industry(高级国防技术与产业学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(title);language model(title);prompting(abstract)

AI总结 LLM-Flax通过神经符号方法实现通用机器人任务规划,利用本地部署的大语言模型,无需手动编写规则或训练数据,三个阶段框架显著提升了任务规划效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26489 2026-06-26 cs.CL 新提交 93%

Comparing BERT Sentence-Pair Classification and Few-Shot LLM Prompting for Detecting Threat and Solution Framing in German Climate News

比较BERT句子对分类与少样本LLM提示在检测德国气候新闻中的威胁和解决方案框架

Raven Adam, David Maier, Marie Kogler

机构 * University of Graz(格拉茨大学) Technical University of Graz(格拉茨技术大学)

专题命中 推理与问题求解 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对德语气候新闻句子级框架检测,比较了微调BERT(句子对分类)与少样本LLM提示(Llama 4)方法,BERT在F1上达到0.83,优于LLM的0.78。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24391 2026-06-24 cs.AI cs.CL cs.GT cs.MA 新提交 93%

Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War

LLM时代:战争迷雾下大型语言模型的推理、外交与可靠性的战略1v1基准测试

Arnaud Ricci

机构 * Independent researcher, Switzerland(瑞士独立研究员)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 提出Age of LLM基准,在13x7网格上让两个LLM进行1v1对战,包含战争迷雾、完全外交和严格JSON格式可靠性维度,通过54场比赛评估15个推理模型,发现核冲刺主导、外交频繁但极少达成、非法动作反映信念追踪,并初步关联可靠性与获胜。

Comments 25 pages including appendices, 8 figures, 4 tables; appendices include verbatim system prompt and engine resolution pseudocode. All correlations reported with p-values, 95% bootstrap confidence intervals and Spearman's rho; includes a Steiger test and Bradley-Terry fit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08330 2026-06-30 cs.RO 93%

Hierarchical Prompting with Dual LLM Modules for Robotic Task and Motion Planning

具有双LLM模块的分层提示用于机器人任务和运动规划

Karolina Źróbek, Tessa Pulli, Paweł Gajewski, Antonio Galiza Cerdeira Gonzalez, Bipin Indurkhya

机构 * IBM, Krakow, Poland(IBM公司,波兰克拉科夫) Jagiellonian University, Krakow, Poland(雅盖隆大学,波兰克拉科夫) AGH University, Krakow, Poland(AGH大学,波兰克拉科夫)

专题命中 推理与问题求解 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一个分层语言驱动框架,通过双LLM模块提升服务和协助场景中人机交互的自然性和直观性,结合目标检测与运动执行实现高成功率的任务规划。

Journal ref Proc. IEEE International Conference on Advanced Robotics and its Social Impacts (ARSO), 2026, pp. 245-250

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02849 2026-05-29 cs.AI 93%

AutoSizer: Automatic Sizing of Analog and Mixed-Signal Circuits via Large Language Model (LLM) Agents

AutoSizer: 通过大语言模型代理自动调整模拟和混合信号电路的尺寸

Xi Yu, Dmitrii Torbunov, Soumyajit Mandal, Yihui Ren

机构 * Artificial Intelligence Department, Brookhaven National Laboratory, Upton, NY(布鲁赫斯国家实验室人工智能部) Instrumentation Department, Brookhaven National Laboratory, Upton, NY 11973(布鲁赫斯国家实验室仪器部)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出AutoSizer,一种反射式LLM驱动的元优化框架,通过双循环结构统一电路理解、自适应搜索空间构建和优化编排,在模拟和混合信号电路尺寸调整中实现更优解质量、更快收敛和更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04381 2026-06-04 cs.LG cs.AI 93%

From Symbolic to Geometric: Enabling Spatial Reasoning in Large Language Models

从符号到几何:在大语言模型中实现空间推理

Chen Chu, Bita Azarijoo, Li Xiong, Khurram Shafique, Cyrus Shahabi

机构 * University of Southern California(南加州大学) Emory University(埃默里大学) Novateur Research Solutions(Novateur研究解决方案)

专题命中 推理与问题求解 :SLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出空间语言模型(SLM),通过将位置信息作为一等模态并学习空间表示,在推理过程中实现几何空间推理,显著优于基于符号推理的现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07960 2026-04-21 cs.CV cs.AI cs.CL 93%

TOOLCAD: Exploring Tool-Using Large Language Models in Text-to-CAD Generation with Reinforcement Learning

TOOLCAD: 探索用于文本到CAD生成的工具使用大型语言模型与强化学习

Yifei Gong, Xing Wu, Wenda Liu, Kang Tu

机构 * School of Computer Engineering & Science, Shanghai University(上海大学计算机工程与科学学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 本文提出TOOLCAD框架,利用LLM作为工具使用代理进行文本到CAD生成,并通过交互式CAD建模环境和强化学习提升模型性能。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14197 2026-04-17 cs.CL cs.AI 93%

The PICCO Framework for Large Language Model Prompting: A Taxonomy and Reference Architecture for Prompt Structure

为大型语言模型提示设计的PICCO框架:提示结构的分类与参考架构

David A. Cook

机构 * Mayo Clinic College of Medicine and Science(梅奥诊所医学院和科学学院) Mayo Clinic Division of General Internal Medicine(梅奥诊所内科医学部)

专题命中 推理与问题求解 :prompting(title,abstract);large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出PICCO框架,通过综合11种现有提示框架,定义提示结构的分类和五要素参考架构,旨在提升提示设计的系统性和清晰度。

Comments Presents the novel PICCO framework for LLM prompting, derived through a structured multi-database search and rigorous comparative synthesis of 11 published prompting frameworks. Submitted in PDF/A format to preserve the structure and readability of several multi-page tables central to the framework and methodology; these contain dense structured information that is best preserved in PDF form

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18645 2025-02-05 cs.CL cs.AI cs.MA 93%

Layered Chain-of-Thought Prompting for Multi-Agent LLM Systems: A Comprehensive Approach to Explainable Large Language Models

Manish Sanwal

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17136 2025-05-26 cs.CL cs.AI 93%

Foundation Models for Geospatial Reasoning: Assessing Capabilities of Large Language Models in Understanding Geometries and Topological Spatial Relations

Yuhan Ji, Song Gao, Ying Nie, Ivan Majić, Krzysztof Janowicz

机构 * GeoDS Lab, Department of Geography, University of Wisconsin-Madison, USA(威斯康星大学麦迪逊分校地理系GeoDS实验室) Department of Geography and Regional Research, University of Vienna, Austria(维也纳大学地理与区域研究系) Department of Geography, University of California-Santa Barbara, USA(加州大学圣塔芭芭拉分校地理系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(title,abstract);LLM(abstract)

Comments 33 pages, 13 figures, IJGIS GeoFM Special Issue

Journal ref International Journal of Geographical Information Science, 2025 International Journal of Geographical Information Science International Journal of Geographical Information Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10231 2026-07-03 eess.AS cs.SD 新提交 93%

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling

LLM 能读频谱图:无编码器的语音语言建模

Ruchao Fan, Yiming Wang, Yuxuan Hu, Bo Ren, Yufei Xia, Xiaofei Wang, Yao Qian, Shujie Liu, Jinyu Li

机构 * Microsoft, USA(微软公司,美国)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(title,abstract);large language model(abstract)

AI总结 提出 Mel-LLM,一种无需专用语音编码器、直接将梅尔频谱图补丁通过线性投影输入 LLM 的架构,在 ASR 和 TTS 任务上验证了其可行性,ASR 性能与有编码器方案相当,TTS 初步可行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09856 2026-06-10 cs.CL cs.AI cs.LG stat.ML 新提交 93%

Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

使用概率程序训练大型语言模型的归纳推理

Liyi Zhang, Akshay K. Jagadish, Brenden M. Lake, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 提出基于程序的后验训练(PPT)方法,利用LLM生成概率程序场景,通过推理产生分布目标,微调模型以提升归纳推理准确性、与人类判断的一致性及校准能力。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19173 2026-05-20 cs.CL 93%

Prompting language influences diagnostic reasoning and accuracy of large language models

提示语言影响大型语言模型的诊断推理和准确性

Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud

机构 * Data Clinic, Nantes University Hospital(数据诊所,南特大学医院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract,abstract_cn)

AI总结 本研究探讨了提示语言对大型语言模型在临床诊断推理和准确性上的影响,通过比较英语和法语性能,发现四种模型在英语环境下表现更优,而o3模型未表现出语言效应,表明提示语言是影响模型临床性能的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12177 2026-05-13 cs.AI 93%

Floorplan2Guide: LLM-Guided Floorplan Parsing for BLV Indoor Navigation

Floorplan2Guide: 基于LLM的BLV室内导航floorplan解析

Aydin Ayanzadeh, Tim Oates

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出利用基础模型将floor plan转化为可导航的知识图谱,并生成可读的导航指令,通过LLM提取空间信息,提升BLV用户室内导航的精度与安全性。

Comments Accepted for publication in the proceedings of the IEEE International Conference on Big Data (IEEE BigData 2025)

Journal ref IEEE International Conference on Big Data (IEEE BigData 2025), pp. 7477-7485

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21164 2026-05-12 cs.AI 93%

Concise Geometric Description as a Bridge: Unleashing the Potential of LLM for Plane Geometry Problem Solving

简洁几何描述作为桥梁:释放LLM在平面几何问题求解中的潜力

Jingyun Wang, Dian Li, Xiaohan Wang, Gang Liu, Jiahong Yan, Guoliang Kang

机构 * Beihang University(北航大学)

专题命中 推理与问题求解 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出通过训练多模态大语言模型解释器生成几何描述,再利用通用LLM进行推理,以解决平面几何问题。通过设计CDL匹配奖励机制,提升生成几何描述的效率,并在新构建的Formalgeo7k-Rec-CoT数据集上验证了方法的有效性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12390 2026-04-20 cs.AI 93%

Heuristic Classification of Thoughts Prompting (HCoT): Integrating Expert System Heuristics for Structured Reasoning into Large Language Models

思维提示的启发式分类(HCoT):将专家系统启发式方法整合到大型语言模型中的结构化推理

Lei Lin, Jizhao Zhu, Yong Liu, Donghong Sun, Hongbo He, Yihua Du

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Shenyang Aerospace University(沈阳航空航天大学) ZGC LAB, Beijing,China(北京ZGC实验室) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出HCoT方法,通过启发式分类模型整合专家系统启发式方法,提升大型语言模型在复杂问题中的推理能力,实现更高效的决策和更稳定的推理链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09923 2025-06-03 cs.CL 93%

Guiding Reasoning in Small Language Models with LLM Assistance

Yujin Kim, Euiin Yi, Minu Kim, Se-Young Yun, Taehyeon Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) LG AI Research(LG人工智能研究院)

专题命中 推理与问题求解 :LLM(title,abstract);language model(title,abstract);small language model(title,abstract);large language model(abstract)

Comments 20 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22207 2026-08-05 cs.SE cs.AI cs.CL 版本更新 93%

Evaluating LLM-Based Goal Extraction in Requirements Engineering: Prompting Strategies and Their Limitations

评估基于大语言模型的目标提取在需求工程中的应用:提示策略及其局限性

Anna Arnaudo, Riccardo Coppola, Maurizio Morisio, Flavio Giobergia, Andrea Bioddo, Angelo Bongiorno, Luca Dadone

机构 * Department of Control and Computer Engineering(控制与计算机工程系)

专题命中 推理与问题求解 :LLM(title,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了通过三个阶段自动提取功能目标以实现目标导向的需求工程,提出基于工程提示的LLM链,实验表明反馈循环机制在零样本学习中表现更优,但提示策略仍是性能限制因素。

Comments 11 pages, 1 figure. This contribution will be published in the conference proceedings of EASE 2026 Conference (https://conf.researchr.org/home/ease-2026/prompt-se-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24892 2026-07-29 cs.LG cs.AI 新提交 93%

LLM as Forecasting Planner: Training-Free Text Conditioning for Time-Series Foundation Models

大语言模型作为预测规划器:时间序列基础模型的免训练文本条件设定

Huu Hiep Nguyen, Dung Nguyen, Minh Hoang Nguyen, Dai Do, Hung Le

机构 * Deakin University(迪肯大学) Applied Artificial Intelligence Initiative(应用人工智能倡议)

专题命中 推理与问题求解 :LLM(title,summary_cn);foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究文本条件时间序列预测问题,核心方法是将预测设为TSFM生成轨迹上的规划问题,以冻结TSFM为模拟器、LLM为策略和价值函数,实例化\rc{}框架,主要贡献是通过实验证明该框架能带来持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08633 2026-06-09 cs.AI cs.LG 新提交 93%

Towards Long-Horizon Vessel Trajectory and Destination Forecasting with Reasoning Large Language Models

面向长时域船舶轨迹与目的地预测的推理型大语言模型

Hongwei Wang, Miao Zhou, Fengde Wang, Yuting Wang, Jiewen Yu, Jun-Yan He, Bohao Qu, Wanbing Zhang, Xiuju Fu, Qing Guo, Zipei Fan, Yingying Xing, Yi Yuan

机构 * Institute of High Performance Computing (IHPC), A*STAR, Singapore(新加坡科技研究局高性能计算研究所) The Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(同济大学道路与交通工程教育部重点实验室) Meituan Inc., Shenzhen, China(美团(深圳)) Centre for Frontier AI Research (CFAR), A*STAR, Singapore(新加坡科技研究局前沿人工智能研究中心) Nankai University(南开大学) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 提出基于可验证奖励强化学习(RLVR)的Maritime LLM后训练框架,将轨迹转化为语义文本,通过物理有效性约束和层次匹配提升长时域(30天)预测精度,4B模型表现最优。

Comments The IEEE International Conference on Intelligent Transportation Systems (ITSC) 2026, Naples, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04937 2026-06-02 cs.AI cs.CL 93%

Pramana: Fine-Tuning Large Language Models for Epistemic Reasoning through Navya-Nyaya

Pramana: 通过 Navya-Nyaya 微调大型语言模型进行认知推理

Sharath Sathish

机构 * University of York(约克大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出 Pramana 方法,利用 2500 年历史的印度 Navya-Nyaya 逻辑框架微调 LLM,通过结构化六阶段推理解决认知差距,提升可溯源性。

Comments 52 pages + appendices, comprehensive treatment of Navya-Nyaya computational formalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05921 2026-05-19 cs.CL cs.LG 93%

Prompt reinforcing for long-term planning of large language models

通过提示强化实现大语言模型的长期规划

Hsien-Chin Lin, Benjamin Matthias Ruppik, Carel van Niekerk, Chia-Hao Shen, Michael Heck, Nurul Lubis, Renato Vukovic, Shutong Feng, Milica Gašić

机构 * Heinrich-Heine-Universität Düsseldorf(杜伊斯堡-埃森大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文提出了一种基于强化学习的提示优化框架,通过修改LLM代理的任务指令提示来实现长期规划,提升了多轮交互任务如文本到SQL和任务导向对话的表现,并能泛化到不同LLM代理和多种LLM作为元提示代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17794 2026-04-21 cs.CL cs.AI 93%

Bridging the Reasoning Gap in Vietnamese with Small Language Models via Test-Time Scaling

通过测试时间扩展弥合越南语中的推理差距

Bui The Trung, Do Minh Duc, Nguyen Van Vinh, Bui Nguyen Quoc Trinh

机构 * Computer Science and Engineering(计算机科学与工程) Information Science Faculty(信息科学系) Faculty of Information(信息学院) Faculty of Advanced Technologies and Engineering(先进技术和工程学院) VNU Vietnam(越南VNU) Japan University(日本大学) JAIST VNU University of Engineering and Technology(VNU工程大学) VNU Vietnam Japan University(越南日本大学) Hanoi, Vietnam(越南河内) Ishikawa, Japan(日本石川)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);SFT(summary_cn,abstract);LLM(abstract)

AI总结 本文研究了在越南小学数学中通过测试时间扩展策略提升小语言模型推理能力,提出Vi-S1K和Vi-Elementary-Bench基准,发现SFT显著提升解释质量,证明简化测试时间扩展优于复杂代理流程。

Comments FJICAI conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14434 2026-05-12 cs.LG cs.AI cs.CL cs.NE 93%

LLM-FE: Automated Feature Engineering for Tabular Data with LLMs as Evolutionary Optimizers

LLM-FE:基于LLM的进化优化器用于表格数据的自动化特征工程

Nikhil Abhyankar, Parshin Shojaee, Chandan K. Reddy

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出LLM-FE框架,结合LLM的领域知识和推理能力,通过进化搜索自动发现表格学习任务中的有效特征,优于现有方法。

Comments Accepted in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏