arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11496 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1648 篇

2608.18631 2026-08-20 cs.AI cs.GT cs.LG 新提交 88%

Preference Reasoning under Indeterminacy in Large Language Models

大语言模型在不确定性下的偏好推理

Hadi Hosseini, Samarth Khanna, Xiyuan Wang

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文聚焦大语言模型决策智能体的偏好推理问题,将不确定性挑战形式化为认知与结构两类,发现当前模型无法区分确定与不确定实例,推理校准不当。

Comments 55 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18103 2026-08-20 cs.CL cs.AI 新提交 88%

DeepTCM1.0: A Multi-Expert AI Agent for Deciphering Mechanisms of Chinese Herbal Formulae Based on General Large Language Models

DeepTCM1.0:基于通用大语言模型的用于解析中药复方机制的多专家智能体

Wenxin Duan, Hanwei Wang, Zhongying Peng, Zhonghua Lu, Jiayi An, Fan Song, Yong Liang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究构建基于DeepSeek V3.2的多专家智能体框架DeepTCM1.0,以桂枝汤为案例,结合中医理论与现代科学解析中药复方机制,通过多维度评估验证框架性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15673 2026-08-18 cs.LG cs.AI 新提交 88%

PL-Guard: Probabilistic Logic Reasoning for LLM Guardrails

PL-Guard:面向大语言模型安全护栏的概率逻辑推理

Satchit Chatterji, Shihan Wang, Giovanni Sileno, Erman Acar

机构 * University of Amsterdam(阿姆斯特丹大学) Utrecht University(乌得勒支大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);prompting(abstract)

AI总结 该研究提出神经符号安全护栏架构PL-Guard,通过分离神经落地与概率符号推理,在XSTest基准上大幅降低大语言模型的不安全依从率,虽过度拒绝率略高,但提升了推理可审计性。

Comments Preliminary version of this paper was presented at the IJCAI 2026 Workshop on Logical and Symbolic Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14252 2026-08-17 cs.AI cs.CL 新提交 88%

Grounding Without Corrective Control: Truth-Tracking Profiles for Large Language Models

无校正控制的基础:大语言模型的真值追踪剖面

Brett Reynolds

机构 * Humber Polytechnic(亨伯理工学院) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型中无校正控制的基础问题,提出路径剖面概念以分析真值追踪,指出纯文本模型继承的模式可提供衍生可应答性,不同方法对任务的真值追踪改进可能与表面改进不一致。

Comments 24 pages, 1 figure, 1 table. A six-page methodological supplement, reproducible R script, and constructed data are included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11244 2026-08-13 cs.AI cs.CL 新提交 88%

BEST-KAG: Enhancing Question Answering of Building Engineering Standards with Multimodal Knowledge Graph Modeling and Large Language Model

BEST-KAG:通过多模态知识图谱建模与大语言模型增强建筑工程标准的问答能力

Jia-Rui Lin, Junxi Guo, Keyin Chen, Peng Pan

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出BEST-KAG框架,通过多模态知识图谱建模与大语言模型,解决建筑工程标准问答的现有局限,在相关评估指标上优于主流大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09893 2026-08-11 cs.CL cs.AI 新提交 88%

Fusion Training for Mathematical Generalization in Large Language Models

大型语言模型中数学泛化的融合训练

Congfeng Cao, Pengyu Zhang, Jelke Bloem

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究针对思维模式融合(TMF)训练动态开展系统性研究,揭示两种模式间的非对称相互作用与负相关关系,为设计TMF训练设置提供指导。

Comments ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02089 2026-08-04 cs.LG cs.AI 新提交 88%

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models

推理摘要能透露多少信息?大语言模型的可观测性阶梯

Andres Algaba, Francesca Carlon, Lynn Delcon, Marthe Ballon, Bert Verbruggen, Vincent Ginis

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出大语言模型的可观测性阶梯,通过实验发现有提示时摘要对正确性监测的帮助远小于完整轨迹,可监测性由显示内容和读者共同决定。

Comments 71 pages, 13 figures, 65 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24765 2026-07-29 cs.CL cs.AI cs.HC 新提交 88%

Measuring and Improving Behavioral Consistency in Large Language Models through Fact-Heuristic-Emotion State Enforcement

通过事实-启发式-情感状态强制来测量和提高大语言模型中的行为一致性

Gi-Hun Lee, Joong Yull Park

机构 * School of Mechanical Engineering, Chung-Ang University(韩国中央大学机械工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型行为一致性,通过认知内核模型CKM强制模型在决策前区分事实、假设和评估信号,经多实验评估发现其可降低输出变异性、减少决策翻转率,证明行为一致性可测且能部分改善。

Comments 40 pages, 6 figures; 54-page supplementary material included as an ancillary file. Code, prompts, and data: https://github.com/TeenyToolSoftware/cogos-behavioral-consistency

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23513 2026-07-28 cs.CL cs.AI 新提交 88%

Do Diagrams Help Large Language Models Reason? Evidence from Syllogistic Reasoning

图表有助于大语言模型推理吗?来自三段论推理的证据

Risako Ando, Koji Mineshima

机构 * Keio University(庆应义塾大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究三段论推理中图表对大语言模型的影响,比较自然语言、逻辑符号、线性图表和欧拉图四种表示条件,利用285个问题评估两个模型,发现图表不能始终提升性能,模型在中性问题上表现不佳,从图表中获益有限。

Comments To appear in the Proceedings of the 15th International Conference on the Theory and Application of Diagrams (Diagrams 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14552 2026-07-17 cs.CL cs.AI 新提交 88%

Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models

答案条件思维链降低大语言模型中的可验证推理蒸馏

Jungseob Lee, Seungyoon Lee, Suhyune Son, Dongyub Jude Lee, Sungbin Han, Sugyeong Eo, Heuiseok Lim

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型推理能力蒸馏中,答案条件思维链会降低训练数据质量,导致可验证推理准确性下降,损失随难度增加,机制是从答案反向合理化,危害是数据属性,建议盲目生成答案。

Comments 13 pages, 4 figures, 14 tables. Code: https://github.com/js-lee-AI/answer-leakage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14528 2026-07-17 cs.CL cs.AI 新提交 88%

Controlled Reformulation Testing for Logical Consistency in Large Language Models

大语言模型中逻辑一致性的可控重新表述测试

Alexander Gu, Alan Chen

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在逻辑等价问题表面形式改变时的逻辑一致性,提出CRTBench基准,评估多个前沿LLMs,发现存在准确率 - 一致性差距,揭示失败集中在逻辑非平凡变换,表明仅靠准确率无法评估LLMs的逻辑推理。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08894 2026-07-13 cs.AI cs.LG 新提交 88%

GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning

GATS:用于高效智能体规划的具有分层世界模型的图增强树搜索

Maureese Williams, Dymitr Nowicki

机构 * Institute for Cybernetics of NAS of Ukraine(乌克兰国家科学院控制论研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 研究针对LLM智能体规划计算成本高和行为随机的问题,提出GATS框架,结合系统树搜索与分层世界模型,在合成任务和综合测试中表现优异,规划时无需LLM调用,生成确定性计划,优于LLM引导探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26530 2026-06-29 cs.CL cs.AI 新提交 88%

DiARC: Distinguishing Positive and Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models

DiARC:区分正负样本有助于提升大型语言模型的类ARC推理能力

Yuxuan Yang, Feiyang Li, Yile Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DiARC方法,通过构建偏好对(正负样本)来提升大型语言模型在类ARC任务上的推理能力,实验表明该方法在多个基准上持续改进基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26079 2026-06-25 cs.CL cs.CV cs.LG 新提交 88%

Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models

相同证据,不同答案:多模态大语言模型中的顺序敏感性审计

Akshay Paruchuri, Sanmi Koyejo, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出Facet-Probe审计框架,评估18个多模态大语言模型在五种顺序扰动下的答案翻转率,发现所有模型均非顺序不变,最佳模型仍有13.4%翻转率,提示仅靠提示级缓解难以实现通用顺序鲁棒性。

Comments 22 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21121 2026-06-23 cs.AI cs.CL 新提交 88%

Answer Engineering: Local Trajectory Editing for Protocol-Constrained Decision Making in Large Language Models

答案工程:面向大语言模型中协议约束决策的局部轨迹编辑

Victor Lavrenko, Anastasiia Molodnitskaia

机构 * PeaceTech VC Rambam Health Care Campus(拉姆巴姆医疗中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出答案工程方法,通过在自回归生成时对推理轨迹进行局部规则引导编辑,无需重训练或全局搜索,在突发性感觉神经性听力损失临床基准上将平衡准确率从42.0%提升至80.7%。

Comments 31 pages, 6 figures. Code and data: https://github.com/victorlavrenko/answer-engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16222 2026-06-16 cs.AI cs.LG 新提交 88%

Latent Thought Flow: Efficient Latent Reasoning in Large Language Models

潜在思维流:大型语言模型中的高效潜在推理

Xiandong Zou, Jing Huang, Jianshu Li, Pan Zhou

机构 * Singapore Management University(新加坡管理大学) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Latent Thought Flow (LTF)方法,将推理建模为可变长度连续轨迹,通过连续GFlowNet训练采样器匹配奖励后验,在提升准确率9.5%的同时平均减少推理长度27.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13441 2026-06-16 cs.AI cs.CL 新提交 88%

Why Sampling Is Not Choosing: Intentionality, Agency, and Moral Responsibility in Large Language Models

为什么采样不是选择:大语言模型中的意向性、能动性与道德责任

Joseph Keshet

机构 * Joseph Keshet(约瑟夫·凯舍特)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文论证大语言模型不具备道德责任所需的承诺性能动性,其输出源于概率映射而非内在意向性,随机采样不等于选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13683 2026-06-15 cs.AI cs.CL 新提交 88%

UP-NRPA: User Portrait based Nested Rollout Policy Adaptation for Planning with Large Language Models in Goal-oriented Dialogue Systems

UP-NRPA:基于用户画像的嵌套 rollout 策略自适应,用于目标导向对话系统中与大语言模型的规划

Hui Wang, Fafa Zhang, Meng Liu, Xiangyu Chen, Chaoxu Mu

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) Anhui Provincial Key Laboratory of Security Artificial Intelligence, Anhui University(安徽大学安徽省安全人工智能重点实验室) Pengcheng Laboratory(鹏城实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出 UP-NRPA 在线框架,利用大语言模型和用户画像实时自适应调整对话策略,无需离线强化学习,在协作与非协作对话基准中实现 100% 任务成功率,谈判任务销售列表比提升 56.41%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10646 2026-06-10 cs.LG cs.CL 新提交 88%

How Does Reasoning Flow? Tracing Attention-Induced Information Flow for Targeted RL in LLMs

推理流如何流动?追踪注意力诱导的信息流以实现LLM中的目标RL

Zhichen Dong, Yang Li, Yuhan Sun, Weixun Wang, Yijia Luo, Zinian Peng, Taiheng Ye, Chao Yang, Wenbo Su, Yu Cheng, Bo Zheng, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出FlowTracer框架,通过注意力诱导的有向无环图追踪答案导向的推理流,基于全局信息流结构分配token级信用,从而提升LLM在推理任务中的强化学习效果。

Comments 25 pages, 7 figures, 11 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05139 2026-07-07 cs.SE 新提交 88%

On the risk of coding before testing: An empirical study on LLM-based test generation workflow

关于测试前编码风险:基于大语言模型的测试生成工作流程的实证研究

Michael Konstantinou, Florian Tambon, Mike Papadakis

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型在软件工程工作流程中生成代码和测试套件时,生成的代码是否会使后续测试产生偏差,通过实证研究错误传播现象,评估其在多种编程任务和工作流程中的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23312 2026-06-23 cs.RO 新提交 88%

From Pixels to Concepts: Growing Rich 3D Semantic Scene Graph Forests utilizing Foundation Models

从像素到概念:利用基础模型构建丰富的3D语义场景图森林

David Oberacker, Meike Deitersen, Niklas Spielbauer, Tristan Schnell, Georg Heppner, Arne Roennau

机构 * FZI Research Center for Information Technology(FZI信息技术研究中心) Machine Intelligence and Robotics Lab (MaiRo), Karlsruhe Institute for Technology (KIT)(卡尔斯鲁厄理工学院机器智能与机器人实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);foundation model(title,abstract)

AI总结 提出利用基础模型构建具有开放语义关系的3D场景图森林,通过VLM和LLM推理抽象概念节点与关系,提升机器人场景理解与任务执行能力。

Comments To be published in the Proceedings of the IEEE/RSJ International Conference on Intelligent Robots & Systems (IEEE IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11893 2026-06-11 cs.LG cs.AI cs.CL q-bio.NC 新提交 88%

Beyond representational alignment with brain-guided language models for robust reasoning

超越表征对齐:基于大脑引导的语言模型实现稳健推理

Mingqing Xiao, Kai Du, Zhouchen Lin

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室、智能科学与技术学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过fMRI信号增强大型语言模型推理能力,提出脑引导框架,在10个模型上实现最高13%的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11209 2026-06-11 cs.CL cs.AI cs.LG 新提交 88%

ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

ProcessThinker: 通过基于展开的过程奖励增强多模态大语言模型推理

Jingpei Wu, Xiao Han, Weixiang Shen, Boer Zhang, Zifeng Ding, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Harvard University(哈佛大学) University of Cambridge(剑桥大学) Mina AI Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠人工智能卓越学校(relAI))

专题命中 推理与问题求解 :large language model(title,comments);language model(title,comments);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ProcessThinker,一种无需显式过程奖励模型的后训练方法,通过步骤标记格式和基于展开的过程奖励,为多步推理提供密集的步骤级奖励,提升多模态推理一致性。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19009 2026-08-20 cs.CL 新提交 88%

Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning

评估评估者:面向大语言模型推理的验证自主等级(L0-L5)

Yajie Yin

专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract,comments);large language model(abstract);分类 cs.CL

AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。

Comments Code and data: https://github.com/1549080929-debug/math_agent Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16927 2026-08-19 cs.LG cs.CV 新提交 88%

Hierarchical Data Selection via Manifold Coverage and Sparse Feature Coverage in LLM Post-training

大语言模型后训练中基于流形覆盖与稀疏特征覆盖的分层数据选择

Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu

专题命中 推理与问题求解 :LLM(title,summary_cn);post-training(title);分类 cs.LG

AI总结 本文提出MASS算法,将LLM后训练的数据选择建模为分层覆盖问题,在Vision Flan与LLaVA-CoT上仅用少量数据即可达到或超过全量训练效果,且优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15979 2026-08-18 cs.AI 新提交 88%

ALPS: Measuring Valid Creativity in Large Language Models with Mathematical Construction

ALPS:通过数学构造衡量大语言模型的有效创造力

Eric Xie, Wenqian Ye, Aidong Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出ALPS基准,通过要求生成可证正确的原创数学结构或证明其不存在的任务,评估大语言模型的有效创造力,测试发现现有推理模型在证明侧成功率14%、构造侧为0,多数实例未被解决并发布完整ALPS资源。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07581 2026-08-11 cs.CV cs.AI 新提交 88%

Multi-Branch Policy Optimization for Multimodal Large Language Models

面向多模态大语言模型的多分支策略优化

Shuai Lyu, Yuning Gong, Ruiling Gao, Xiaoran Shang, Zhonghong Ou, Ping Zong, Yifan Zhu, Yuan Sun, Yang Qin, Peng Hu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Sichuan University(四川大学) Shanghai University(上海大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型统一信用分配的缺陷,提出MBPO框架,通过树结构与分支相对优势分配信用,结合时间回放缓冲区提升性能,在多模态推理基准上优于基线。

Comments 10 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06699 2026-08-10 cs.AI cs.CV 新提交 88%

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

AgentPatch:用于合并智能体多模态大语言模型的由粗到细弱任务修复

Zibo Shao, Baochen Xiong, Chengdong Xu, Linhui Xiao, Kaichen Li, Haoran Gong, Yan Li, Yaguang Song, Xiaoshan Yang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对智能体多模态大语言模型合并时的弱任务退化与关键行为遗忘问题,提出无需训练的AgentPatch框架,通过由粗到细修复实现能力平衡,提升合并模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05367 2026-08-07 cs.AI q-fin.GN 新提交 88%

Counterfactual Analysis via Large Language Models

基于大语言模型的反事实分析

Zonghao Yang

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究用GPT-3.5模型开展在线借贷反事实分析,经提示工程优化后其预测性能接近梯度提升回归,验证了LLMs用于反事实分析的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03038 2026-08-05 cs.CL stat.AP 新提交 88%

Beyond Accuracy: A Multidimensional Evaluation of Statistical Reasoning in Large Language Models

超越准确率:大型语言模型统计推理的多维度评估

Monnie McGee, Mateo Langston Smith, Julian Cabrera

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究结合多维度分析框架评估15款LLMs的统计推理,发现仅用准确率无法全面描述其统计推理能力,且存在厂商专属解释风格差异。

Comments 15 pages, 5 tables, 2 figures, presented at JSM 2026 and submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏