arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 819 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 819 篇

2604.22207 2026-08-05 cs.SE cs.AI cs.CL 版本更新 93%

Evaluating LLM-Based Goal Extraction in Requirements Engineering: Prompting Strategies and Their Limitations

评估基于大语言模型的目标提取在需求工程中的应用:提示策略及其局限性

Anna Arnaudo, Riccardo Coppola, Maurizio Morisio, Flavio Giobergia, Andrea Bioddo, Angelo Bongiorno, Luca Dadone

机构 * Department of Control and Computer Engineering(控制与计算机工程系)

专题命中 推理与问题求解 :LLM(title,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了通过三个阶段自动提取功能目标以实现目标导向的需求工程,提出基于工程提示的LLM链,实验表明反馈循环机制在零样本学习中表现更优,但提示策略仍是性能限制因素。

Comments 11 pages, 1 figure. This contribution will be published in the conference proceedings of EASE 2026 Conference (https://conf.researchr.org/home/ease-2026/prompt-se-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28590 2026-08-11 cs.AI 版本更新 92%

MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models

MonitorBench: 一个用于大型语言模型链式思维可监控性的综合基准

Han Wang, Yifan Sun, Brian Ko, Mann Talati, Jiawen Gong, Zimeng Li, Naicheng Yu, Xucheng Yu, Wei Shen, Vedant Jolly, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文提出MonitorBench,通过1514个测试实例和两种压力测试设置,评估LLM链式思维的可监控性,发现决策关键因素对中间推理过程的影响程度影响可监控性,更高级的LLM表现出更低的可监控性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02512 2026-08-13 cs.CL cs.AI 版本更新 92%

Social Meaning in Large Language Models: Structure, Magnitude, and Pragmatic Prompting

大语言模型中的社会意义:结构、规模与语用提示

Roland Mühlenbernd

机构 * Leibniz-Centre General Linguistics, Berlin, Germany(莱布尼茨普通语言学中心,柏林,德国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract_cn)

AI总结 本文研究大语言模型在社会意义上的表现,提出两种校准指标并探讨语用理论指导的提示策略对模型校准的影响,发现提示策略能有效减少模型在规模校准上的偏差。

Journal ref Proceedings of the 15th Workshop on Cognitive Modeling and Computational Linguistics (CMCL) @ LREC 2026, pages 162-171

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18905 2026-06-08 cs.LG cs.AI cs.CL 版本更新 92%

TRUE: A Trustworthy Unified Explanation Framework for Large Language Model Reasoning

TRUE:一种用于大语言模型推理的可信统一解释框架

Yujiao Yang

机构 * Dalian University of Technology(大连理工大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TRUE框架,通过可执行推理验证、可行域DAG建模和因果故障模式分析,为LLM推理提供实例级、局部结构级和类别级的多层次可验证解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11470 2026-08-12 cs.CL 版本更新 92%

The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes

LLM推理的周期表:推理范式、方法与失败模式的结构化综述

Avinash Anand, Mahisha Ramesh, Avni Mittal, Ashutosh Kumar, Rishitej Reddy Vyalla, Erik Cambria, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工大学) Nvidia AI Center (SNAIC)(英伟达人工智能中心(SNAIC)) MIDAS Lab, IIIT Delhi(IIIT德里MIDAS实验室) MIDAS Lab, IIT Mandi(IIT曼迪MIDAS实验室) Owl Autonomous Imaging, Inc.(Owl自主成像公司) College of Computing & Data Science, NTU Singapore(新加坡南洋理工大学计算与数据科学学院) NVIDIA AI Technology Centre, Singapore(英伟达新加坡人工智能技术中心) Department of Computer Science and Engineering, IIT Kanpur(IIT坎普尔计算机科学与工程系)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文系统综述了300多篇论文,提出LLM推理研究的结构化分类法,涵盖多种推理范式,分析方法论趋势,并总结常见限制与失败模式,旨在为开发更鲁棒、可解释和可泛化的推理系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07121 2026-08-11 cs.CL cs.AI 版本更新 92%

ReMIND: Orchestrating Modular Large Language Models for Controllable Serendipity A REM-Inspired System Design for Emergent Creative Ideation

ReMIND:编排模块化大语言模型以实现可控的意外发现 一种受REM启发的突发创意构思系统设计

Makoto Sato

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究旨在解决大语言模型生成新颖连贯想法的挑战,提出ReMIND四阶段框架,通过独立LLM模块区分探索与稳定。经多任务评估,发现新颖性增强分两阶段,不同LLM家族有不同倾向,为计算创造力研究提供通用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03519 2026-08-04 cs.CL cs.AI 版本更新 92%

TS-Reasoner: Aligning Time Series Foundation Models with LLM Reasoning

TS-Reasoner:将时间序列基础模型与大语言模型推理能力对齐

Fangxu Yu, Hongyu Zhao, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 推理与问题求解 :LLM(title,abstract);foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 TS-Reasoner通过两阶段训练将时间序列基础模型与大语言模型对齐,在多个基准上性能优于同类模型且数据效率更高,解决了时间序列模型推理能力不足的问题。

Comments Accepted to Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05568 2026-06-16 cs.AI cs.CL cs.CY stat.AP 版本更新 92%

Metacognitive Myopia in Large Language Models

大型语言模型中的元认知近视

Florian Scholten, Tobias R. Rebholz, Mandy Hütter

机构 * Psychology Department, University of Tübingen(图宾根大学心理学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出元认知近视框架解释LLM偏见,认为信息环境中的有偏样本导致五种症状,并通过监控与控制机制近似技术缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06915 2026-06-09 cs.CL cs.AI cs.LG 版本更新 92%

ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning

ThinkBooster: 一种用于LLM推理无缝测试时扩展的统一框架

Vladislav Smirnov, Chieu Nguyen, Sergey Senichev, Minh Ngoc Ta, Ekaterina Fadeeva, Artem Vazhentsev, Daria Galimzianova, Nikolai Rozanov, Viktor Mazanov, Jingwei Ni, Tianyi Wu, Igor Kiselev, Mrinmaya Sachan, Iryna Gurevych, Preslav Nakov, Timothy Baldwin, Artem Shelmanov

机构 * MBZUAI ETH Zürich(苏黎世联邦理工学院) Imperial College London(伦敦帝国理工学院) NUS(国立大学新加坡) Accenture(埃森哲) Innopolis University(因诺普里斯大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ThinkBooster框架,通过模块化库、联合评估基准和可部署代理服务,实现LLM推理的测试时计算扩展,在数学和编码任务上验证了性能-计算权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19135 2026-08-03 cs.AI cs.HC cs.RO 版本更新 92%

Combining Large Language Models and Symbolic Reasoning for Multi-Robot Temporal Planning through Explainable Knowledge Bases

结合大语言模型与符号推理,通过可解释知识库实现多机器人时序规划

Enrico Saccon, Matteo Saveriano, Edoardo Lamon, Luigi Palopoli, Marco Roveri

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出PLANTOR框架,结合LLM与符号推理,通过可解释知识库实现多机器人时序规划,在基准场景及多臂装配场景验证,可减少手动建模但需人工修正,主张混合工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20170 2026-07-23 cs.CL 版本更新 92%

KoRe: Compact Knowledge Representations for Large Language Models

KoRe: 为大型语言模型设计的紧凑知识表示

Davide Cavicchini, Fausto Giunchiglia, Jacopo Staiano

机构 * University of Trento(特伦托大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出KoRe方法,通过将知识图谱的1跳子图编码为紧凑离散知识标记,并注入到LLM中,从而提升模型的知识推理能力并减少token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00182 2026-07-20 cs.RO cs.AI 版本更新 92%

A Systematic Study of Large Language Models for Task and Motion Planning With PDDLStream

基于PDDLStream的任务与运动规划大语言模型的系统研究

Jorge Mendez-Mendez

机构 * Stony Brook University(石溪大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究大语言模型在机器人任务与运动规划中的应用,开发16种用LLMs替代关键TAMP组件的算法,通过实验发现基于LLM的规划器成功率低、规划时间长,提供几何细节会增加任务规划错误,多数情况下直接LLM变体表现更好。

Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11678 2026-07-14 cs.CL 版本更新 92%

Can AI Reason Like an Urban Planner? Benchmarking Large Language Models Against Professional Judgment

AI能像城市规划师一样推理吗?基于专业判断的大语言模型基准测试

Yijie Deng, He Zhu, Wen Wang, Junyou Su, Minxin Chen, Wenjia Zhang

机构 * School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院) Shenzhen Key Laboratory of Urban Spatial Information and Intelligent Modeling(深圳市城市空间信息与智能建模重点实验室) Department of Urban Planning and Design, The University of Hong Kong(香港大学城市规划与设计系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出UPBench框架,通过4×5知识支柱与认知水平矩阵评估25个LLM,发现模型在分析任务上优于事实回忆和综合判断,揭示了规划知识的制度依赖性。

Comments This paper has been withdrawn by the authors because the current version requires substantial revision and further validation before it can be considered a reliable representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05622 2026-07-10 cs.CL 版本更新 92%

AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints

AdaPlanBench: 在世界约束和用户约束下评估大语言模型智能体的自适应规划能力

Jiayu Liu, Cheng Qian, Zhenhailong Wang, Bingxuan Li, Jiateng Liu, Qing Zong, Heng Wang, Jeonghwan Kim, Yumeng Wang, Bingxiang He, Xiusi Chen, Yi R. Fung, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对现有基准未充分探索渐进揭示的双重约束下的自适应规划问题,提出动态交互基准AdaPlanBench,通过307个家务任务和可扩展的约束构建流程,评估LLM智能体在交互中根据反馈迭代调整计划的能力。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11874 2026-06-09 cs.GT cs.AI cs.DS cs.LO cs.PL 版本更新 92%

Discovering Expert-Level Nash Equilibrium Algorithms with Large Language Models

利用大型语言模型发现专家级纳什均衡算法

Hanyu Li, Dongchen Li, Xiaotie Deng

机构 * CFCS, School of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学,北京,中国) School of Computing and Data Science, The University of Hong Kong, Pokfulam, Hong Kong(计算与数据科学学院,香港大学,薄扶林,香港)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出LegoNE框架,将专家证明策略编码为符号语言,自动验证算法的最坏情况保证,结合推理型LLM重新发现并改进了多人博弈的近似纳什均衡算法。

Comments accepted by Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14574 2026-08-11 cs.CL cs.AI 版本更新 92%

SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

SIMMER: 基于世界模型评估LLM可执行规划中的潜在故障

Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SIMMER基准,通过人工策划的厨房领域符号世界模型,评估LLM规划中的潜在故障;实验发现前沿模型最多17%无错误计划,56%含潜在故障,多数不可逆;反事实预演可减少72%潜在故障和75%不可逆案例。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28335 2026-07-28 cs.CY cs.AI cs.CL 版本更新 92%

LLM-Ideoplasticity: Measuring Ideological Plasticity in the Political Behavior of LLMs as a Context-Conditioned Distribution

LLM-意识形态可塑性:将LLM的政治行为测量为上下文条件分布

Adib Sakhawat, Syed Rifat Raiyan, Tahsin Islam, Takia Farhin, Hasan Mahmud, Md Kamrul Hasan

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过系统实证,证明LLM的政治意识形态是上下文条件分布而非固定点,使用VAA-CHES投影模型在六个上下文轴上评估九个LLM,发现其对上下文高度敏感,但整体占据狭窄的Overton窗口。

Comments Under review, 40 pages, 18 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02080 2026-06-25 cs.AI cs.FL cs.LG cs.SE 版本更新 92%

The 4/$δ$ Bound: Designing Predictable LLM-Verifier Systems for Formal Method Guarantee

4/δ 界:设计具有形式方法保证的可预测 LLM-验证器系统

Pierre Dantas, Lucas Cordeiro, Youcheng Sun, Waldir Junior

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出 LLM-验证器收敛定理,将多阶段验证建模为顺序吸收马尔可夫链,证明成功概率 δ>0 时系统几乎必然验证,并导出精确延迟上界 4/δ,经 90000+ 试验验证。

Comments 36 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22495 2026-06-19 cs.LG cs.AI 版本更新 92%

Reinforcement-aware Knowledge Distillation for LLM Reasoning

面向LLM推理的强化学习感知知识蒸馏

Zhaoyang Zhang, Shuli Jiang, Yantao Shen, Yuting Zhang, Dhananjay Ram, Shuo Yang, Zhuowen Tu, Wei Xia, Stefano Soatto

机构 * Meta Guo et al. Lin et al. Xu et al. Shao et al. Schulman et al. Xie et al.

专题命中 推理与问题求解 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出RL感知蒸馏(RLAD),通过信任区域比率蒸馏(TRRD)在强化学习后训练中实现选择性模仿,解决分布不匹配和目标干扰问题,在逻辑推理和数学基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21027 2026-06-16 cs.CL cs.AI 版本更新 92%

Beyond Text-to-SQL: An Agentic LLM System for Governed Enterprise Analytics APIs

超越文本到SQL:一个面向受控企业分析API的代理LLM系统

Gundeep Singh, Parsa Kavehzadeh, Jing Xia, Xue-Yong Fu, Julien Bouvier Tremblay, Md Tahmid Rahman Laskar, Vincent Lum, Shashi Bhushan TN

机构 * Dialpad Inc.(Dialpad公司)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Analytic Agent,一个基于LLM的代理系统,能够将自然语言意图安全地转换为与企业分析API的交互,解决传统文本到SQL系统在企业环境中面临的可靠性与合规性问题。

Comments Accepted to the Enterprise AI Agents Workshop @ KDD 2026. The first four authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05167 2026-06-15 cs.CL cs.AI 版本更新 92%

C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning

C2-Faith: 为思维链推理中的因果和覆盖忠实性基准测试LLM评判者

Avni Mittal, Rauno Arike

机构 * SPARAI

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出C2-Faith基准,通过因果和覆盖两个维度评估LLM评判者对思维链推理过程忠实性的判断能力,发现模型在错误定位和覆盖评分上存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09751 2026-06-09 cs.AI cs.CL cs.LO 版本更新 92%

Sound and Complete Neurosymbolic Reasoning with LLM-Grounded Interpretations

基于LLM解释的完备且可靠的神经常识推理

Bradley P. Allen, Prateek Chhikara, Thomas Macaulay Ferguson, Filip Ilievski, Paul Groth

机构 * University of Amsterdam(阿姆斯特丹大学) University of Southern California(南加州大学) Rensselaer Polytechnic Institute(拉特格斯理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出将LLM直接集成到次协调逻辑的语义解释函数中,实现可靠且完备的神经常识推理,在GPQA和SimpleQA基准上宏F1提升约6个百分点,并成功检测药物安全知识库中的矛盾。

Comments 43 pages, 14 tables, 4 figures. Accepted to the 19th Conference on Neurosymbolic Learning and Reasoning (NeSy 2025); to appear Neurosymbolic Artifical Intelligence Special Issue on NeSy 2025 Extended Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01039 2026-08-13 cs.CR cs.AI 版本更新 92%

Evaluation and Hardening of LLM System Instructions Against Extraction via Encoding Attacks

用于评估和加固LLM系统指令对抗编码攻击的自动化框架

Anubhab Sahu, Diptisha Samanta, Reza Soosahabi

机构 * Keysight Technologies

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出自动化框架评估LLM系统指令在对抗编码攻击时的保密性,通过四个模型和46条指令测试发现结构化序列化攻击成功率高,提出基于Chain-of-Thought的缓解策略。

Comments An earlier version of this manuscript will appear in the proceedings of IEEE Cyber-AI 2026 Conference. Project source code is available at https://github.com/Keysight/LLM-EncodeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26306 2026-07-07 cs.AI 版本更新 92%

Interactive Learning for LLM Reasoning

为LLM推理设计的交互学习

Hehai Lin, Shilei Cao, Sudong Wang, Haotian Wu, Minzhi Li, Linyi Yang, Juepeng Zheng, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ILR框架,通过动态交互和感知校准提升LLM独立问题解决能力,实验表明其在多个基准测试中优于单agent学习。

Comments The code is available at https://github.com/linhh29/Interactive-Learning-for-LLM-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26368 2026-08-06 cs.NI 版本更新 92%

Introducing Large Language Models into the Design Flow of Time-Sensitive Networking

将大语言模型引入时间敏感网络的设计流程

Rubi Debnath, Luxi Zhao, Mohammadreza Barzegaran, Paul Pop, Sebastian Steinhorst

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 针对配置优化TSN网络的挑战,通过跨模型案例研究评估现有大语言模型能力,提出LLM辅助编排框架,介绍构建模块与管道,分析实际部署机会与局限,为评估LLM辅助TSN编排可行性提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28942 2026-08-05 cs.AI 版本更新 92%

NeSyFS: A Neuro-symbolic Fast-Slow Thinking Framework for LLM Agent under Partial Observability

NeSyFS:部分可观测场景下LLM智能体的神经符号快慢思考框架

Duo Xu, Faramarz Fekri

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对部分可观测场景下LLM智能体的决策挑战,提出NeSyFS神经符号快慢思考框架,结合知识图谱、TSMC算法与反思模块,在三个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10282 2026-07-29 cs.LG 版本更新 92%

Linear-LLM-SCM: Benchmarking LLMs for Coefficient Elicitation in Linear-Gaussian Causal Models

线性-LLM-SCM:用于线性高斯因果模型系数提取的LLM基准测试

Kanta Yamaoka, Sumantrak Mukherjee, Thomas Gärtner, David Antony Selby, Stefan Konigorski, Eyke Hüllermeier, Viktor Bengs, Sebastian Josef Vollmer

机构 * Data Science and its Applications, German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心数据科学与应用部门) Dept. of Computer Science, University of Kaiserslautern–Landau (RPTU)(科隆-兰道大学计算机科学系) Digital Health - Machine Learning Research Group, Hasso Plattner Institute for Digital Engineering(哈索·普朗纳研究所数字工程学院数字健康-机器学习研究组) Institute of Informatics, University of Munich (LMU)(慕尼黑大学信息学院) Hasso Plattner Institute for Digital Health at Mount Sinai, Icahn School of Medicine at Mount Sinai(西奈山医学院哈索·普朗纳研究所数字健康中心) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出线性-LLM-SCM框架,用于评估LLM在连续域中对线性高斯因果模型参数化的表现,揭示了LLM在定量因果推理中的局限性。

Comments [v2] Accepted at Workshop on Structured Data for Health@ICML 2026 Seoul,South Korea. 19 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05598 2026-07-23 cs.AI cs.HC 版本更新 92%

Prober.ai: Gated Inquiry-Based Feedback via LLM-Constrained Personas for Argumentative Writing Development

Prober.ai:基于LLM约束人设的门控探究式反馈用于论辩写作发展

Ran Bi, Shiyao Wei, Yuanyiyi Zhou

机构 * Florida State University(佛罗里达州立大学) New York University(纽约大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Prober.ai通过约束LLM生成结构化JSON输出,提供探究式问题反馈,帮助学生提升论辩写作能力,其双阶段交互架构通过强制反思提升认知能力。

Comments Prototype awarded second place at the NYEdTech Hackathon (March 2026) https://www.nyedtechhackathon.com/2026-submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17612 2026-07-17 cs.PL cs.AI 版本更新 92%

Provable Coordination for LLM Agents via Message Sequence Charts

通过消息序列图实现LLM代理的可证明协调

Benedikt Bollig, Matthias Függer, Thomas Nowak

机构 * Université Paris-Saclay, CNRS, ENS Paris-Saclay, LMF, Gif-sur-Yvette, France(巴黎萨克雷大学、法国国家科学研究中心、巴黎萨克雷高等师范学院、LMF、法国吉夫-sur-耶vette) Institut Universitaire de France, Paris, France(法国国家科学院、巴黎,法国)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于消息序列图的领域特定语言,用于规范LLM代理协调,解决死锁和消息类型不匹配等问题,通过语法引导投影生成无死锁的局部代理程序,并展示如何在LLM非确定性基础上建立协调属性。

Comments 42 pages; accepted at ISoLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18850 2026-07-14 cs.CL 版本更新 92%

Cognitive Alpha Mining via LLM-Driven Code-Based Evolution

通过LLM驱动的代码基于进化进行认知Alpha挖掘

Fengyuan Liu, Yi Huang, Sichun Luo, Yuqi Wang, Yazheng Yang, Xinye Li, Zefa Hu, Junlan Feng, Qi Liu

机构 * Jiutian Research, China Mobile(九天研究,中国移动) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CogAlpha框架,结合代码级Alpha表示与LLM驱动的推理和进化搜索,以实现更广泛、结构化且人似的探索,提升Alpha发现的预测准确性与经济解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏