arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-09 至 2026-06-09 共收录 161 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 12 篇

2606.07720 2026-06-09 cs.AI cs.CL cs.LG 新提交 88%

Why Limit the Residual Stream to Layers and Not Tokens? Persistent Memory for Continuous Latent Reasoning

为什么将残差流限制在层而不是令牌?用于连续潜在推理的持久记忆

Mujtaba Farhan, Maheep Chaudhary

机构 * University of Cambridge(剑桥大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对CoCoNuT在潜在空间推理中因中间隐藏状态被覆盖导致概念瓶颈的问题,提出AGCLR模型,通过门控概念流持久记忆机制,在GSM8K、HotpotQA和ProsQA上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09585 2026-06-09 cs.AI 新提交 87%

Optical Reasoning: Rethinking Images as an Expressive Reasoning Medium Beyond Text

光学推理:重新思考图像作为超越文本的表达性推理媒介

Yutong Bian, Dongjie Cheng, Heming Xia, Yongqi Li, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 提出光学推理概念,将图像作为独立推理媒介,通过排版和图形两种变体实现,在语言和多模态任务中匹配或超越文本推理,同时减少推理令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09410 2026-06-09 cs.AI cs.CL 新提交 86%

Capacity, Not Format: Rethinking Structured Reasoning Failures

容量而非格式:重新思考结构化推理失败

Hengxin Fan

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究发现结构化格式对模型性能的影响取决于其空闲容量,容量不足时通过截断和纯容量竞争两种机制导致性能下降,建议先思考后格式化。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09380 2026-06-09 cs.LG cs.AI cs.CL 新提交 82%

Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

推理竞技场:当可验证奖励不足时的轨迹锦标赛

Han Zhou, Adam X. Yang, Laurence Aitchison, Anna Korhonen, Albert Q. Jiang

机构 * University of Cambridge(剑桥大学) Mistral AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出推理竞技场框架,通过轨迹锦标赛将无梯度信号的非多样奖励组转化为相对奖励信号,结合Bradley-Terry模型高效整合强化学习,在数学和编码基准上平均提升7.6%,加速训练27%-41%。

Comments 9 pages, 6 figures, 2 tables (17 pages including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08815 2026-06-09 cs.AI cs.CL cs.LG 新提交 82%

Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization

推理的动量:策略优化中的密集内在信号

Hao Chen, Zhanming Shen, Liyao Li, Yanyu Chen, Xuhang Zhu, Xiaomeng Hu, Qi Zhang, Ru Peng, Xiaoyu Shen, Haobo Wang, Junbo Zhao

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Eastern Institute of Technology(东方理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对GRPO在长链推理中因二元奖励导致的零优势崩溃和幻觉确定性失败模式,提出ISPO方法,通过内在信号密集化奖励,在三个基模型和五个数学推理基准上持续优于基线。

Comments 14 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08974 2026-06-09 cs.AI 新提交 79%

Diverse Thinking Schemata Elicit Better Reasoning in Large Language Models

多样思维图式激发大型语言模型更优推理

Xinyue Liang, Yizhe Yang, Yu Bai, Bin Xu, Jiawei Li, Yang Gao

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出多样图式策略优化(DiScO),通过增强推理步骤转换和答案候选的多样性,提升大型语言模型在数学推理任务中的表现和错误恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08543 2026-06-09 cs.AI 新提交 79%

PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR

PAEC:面向RLVR中LLM推理的位置感知熵校准

Shumeng Yang, Yisu Liu, Jiayi Zheng, Zhaohui Yang, Linjing Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出位置感知熵校准(PAEC),通过局部top-p熵和top-2候选竞争构建软掩码,并施加基于锚点的下界惩罚,防止决策相关位置熵崩溃,提升数学推理性能。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07810 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

SLMJury: Can Small Language Models Judge as Well as Large Ones?

SLMJury:小型语言模型能否像大型模型一样进行评判?

Anish Laddha, Nitesh Pradhan, Gaurav Srivastava

机构 * LNMIIT Virginia Tech(弗吉尼亚理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SLMJury框架,评估小型语言模型作为评判者的能力,发现领域依赖的过度思考效应、领域泛化差异、闭端与开端评判能力分离,以及多智能体辩论降低准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07527 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

Post-training is (Massive) Supervised Learning

后训练是(大规模)监督学习

Michael Hassid, Yossi Adi, Roy Schwartz

机构 * FAIR, Meta AI(Meta AI 基础人工智能研究团队) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文论证当前LLM后训练阶段(SFT+RL)实质是回归到BERT时代的“预训练-微调”范式,通过实验表明从零开始后训练的模型也能取得显著性能,并提出应转向“学会学习”的训练方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08346 2026-06-09 cs.CL cs.LG 新提交 62%

CATPO: Critique-Augmented Tree Policy Optimization

CATPO: 批评增强的树策略优化

Ayush Singh, Umang Goyal, Ankur Dahiya

机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Vision and Language Group(视觉与语言组)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出CATPO方法,通过树信息性评分和批评引导修复,解决树结构强化学习中低效树浪费计算的问题,在数学推理任务上提升准确率。

Comments 14 pages, 1 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09124 2026-06-09 cs.AI 新提交 57%

A Regret Minimization Framework on Preference Learning in Large Language Models

大语言模型中偏好学习的遗憾最小化框架

Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee

机构 * KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出基于遗憾的偏好优化方法RePO,通过遗憾最小化而非奖励最大化来建模人类偏好,在数学推理和人类偏好数据集上取得一致性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08411 2026-06-09 cs.CL 新提交 57%

AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

AsyncLane: 扩散语言模型解码中精炼与推进的解耦

Yingxuan Ren, Yuxuan Lou, Yong Liu, Pengcheng Fang, Ziming Wang, Pengfei Zhou, Yang You

机构 * National University of Singapore(新加坡国立大学) University of Southampton(南安普顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出AsyncLane,一种无需训练的解码调度器,通过将生成过程分叉为精炼和推进两个通道,解耦块间依赖,在保持质量的同时显著提升扩散语言模型的解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2606.08458 2026-06-09 cs.RO 新提交 78%

Personalized and Robust Proactive Robot Assistance with Uncertainty-Guided LLM Reasoning

个性化且鲁棒的主动机器人辅助:基于不确定性引导的大语言模型推理

Alvaro Gonzalez, M. H. Hasan Shovo, Ali Ayub

机构 * Concordia University(康考迪亚大学)

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 提出GLOBE框架,结合n-gram马尔可夫模型与不确定性引导的大语言模型推理,在家庭环境中实现高效鲁棒的主动机器人辅助,并在HOMER-Noise数据集上验证了其性能与效率。

Comments Accepted to the 2026 IEEE 35th International Conference on Robot and Human Interactive Communication (RO-MAN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09032 2026-06-09 cs.CL 新提交 57%

Bridging the Agent-World Gap: Text World Models for LLM-based Agents

弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型

Yixia Li, Hongru Wang, Peng Lai, Zhiwen Ruan, He Zhu, Youxin Zhu, Ganlong Zhao, Minda Hu, Yun Chen, Sibei Yang, Peng Li, Jeff Z. Pan, Jia Pan, Guanhua Chen, Yang Liu, Guanbin Li

机构 * Southern University of Science and Technology(南方科技大学) University of Edinburgh(爱丁堡大学) Peking University(北京大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 代码与定理证明 :planning(abstract);分类 cs.CL

AI总结 本文系统综述了面向基于LLM的智能体的文本世界模型,围绕形式化框架和智能体生命周期,涵盖基础定义、构建范式、应用(训练时经验合成与推理时规划、验证、适应)及评估,旨在整合该领域并明确设计空间与开放挑战。

Comments Code: https://github.com/sustech-nlp/awesome-text-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08256 2026-06-09 cs.AI cs.DL 新提交 57%

Traxia: A Framework for Verifiable, Agent-Native Scientific Publishing

Traxia:一个可验证的、智能体原生的科学出版框架

Wisdom Dogah

机构 * Faculty of Computing and Mathematical Sciences, University of Mines and Technology (UMaT), Tarkwa, Ghana(加纳塔夸矿业与技术大学计算与数学科学学院) BlackMatrix AI Research, Accra, Ghana(加纳阿克拉BlackMatrix AI研究院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出Traxia框架,通过智能体身份、可验证出版、四层同行评审、声誉机制和知识图谱,解决科学出版中可验证性、归属和可重复性问题。

Comments 22 pages, 3 figures, 3 tables. Preprint. Under active development. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 10 篇

2606.08147 2026-06-09 q-bio.GN cs.LG 新提交 86%

Biological Reasoning-Informed Regression for Interpretable Regulatory DNA Activity Prediction

面向可解释调控DNA活性预测的生物学推理引导回归

Yi Duan, Zhao Yang, Jiwei Zhu, Ying Ba, Chuan Cao, Bing Su

机构 * Gaoling School of Artificial Intelligence(甘岭人工智能学院) Renmin University of China(中国人民大学) Zhongguancun Academy(中关村学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title);分类 cs.LG

AI总结 提出R3LM框架,通过结构化生物学知识教LLM进行推理引导回归,在增强子预测上达到最优性能并提供可解释机制。

Comments Accepted at KDD 2026 AI4Sciences Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09195 2026-06-09 cs.CL 新提交 79%

Symbolic and Abstractive Reasoning with Complex Visual Queries

复杂视觉查询的符号与抽象推理

Yichi Zhang, Jingdian Lu, Zhuo Chen, Lingbing Guo, Jun Xu, Wen Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Nanjing University(南京大学) Ant Group(蚂蚁集团)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出复杂视觉查询(CVQ)概念,通过多模态知识图谱合成数据集,并设计两阶段训练框架,提升多模态大语言模型的符号与抽象推理能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08471 2026-06-09 cs.CL cs.AI 新提交 79%

More Yap Less Meaning: Uncovering Self-Improvement Behavior in SLMs

更多废话,更少意义:揭示小语言模型中的自我改进行为

Marina Igitkhanian, Erik Arakelyan

机构 * American University of Armenia(亚美尼亚美国大学) NVIDIA(英伟达)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建充分性测试,发现小语言模型在自我纠正中仅获得4.4%的准确率提升,且较长的提示反而与错误答案正相关,表明其推理能力有限。

Comments GEM Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08442 2026-06-09 cs.CY 新提交 78%

Clinical Reasoning in the Age of AI: Longitudinal Cognition and Human-AI Collaboration

人工智能时代的临床推理:纵向认知与人机协作

Irene Yi, Grace Brown, Sufian Aldogom, Nathan Roll, Eric J. Basile, Pamela M. Resnikoff, Bianca Sanchez, Chirag Lodha, Isaac Gutterman, Oscar Schiff, Keira Salata, Benjamin Mujkic, Ammar Ahmed

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本研究通过混合方法揭示临床推理的纵向结构,发现当前AI系统主要支持单次就诊任务,与医生多就诊的推理过程存在关键不匹配,为设计更符合真实临床推理的AI系统提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07872 2026-06-09 cs.CV 新提交 78%

VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?

VisualFLIP: 在多模态推理中,预测是否依赖于任务关键的视觉证据?

Didi Zhu, Changrui Chen, Stefanos Zafeiriou, Jiankang Deng

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出VisualFLIP基准,通过成对图像扰动测试多模态大模型是否真正依赖关键视觉证据,发现正确预测与证据依赖存在分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07924 2026-06-09 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 75%

Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation

解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线

Jiaxin Dai, Zehang Wei, Jiamin Yan, Xiang Xiang

机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种无需训练的两阶段级联视频RAG流水线,通过解耦语义检索与逻辑推理,实现跨语言长视频理解、严格角色遵循和零幻觉时间定位。

Comments To be presented at ACL 2026 MAGMAR Workshop (Oral; Retrieval leaderboard No.1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09662 2026-06-09 cs.CL 新提交 70%

When Built-in Thinking Helps and Hurts: Constraint-Level Error Shifts in Instruction Following

当内置思考既有帮助又有害:指令遵循中的约束级错误转移

Sai Adith Senthil Kumar

机构 * George Mason University(乔治梅森大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 研究大型推理模型(LRM)的思考模式对指令遵循的影响,发现思考会改变错误模式而非统一降低性能,其中规划类约束改善而精确类约束恶化,并通过分析思考轨迹和激活修补揭示了机制。

Comments 16 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09278 2026-06-09 cs.LG cs.AI 新提交 62%

Internalizing Geometric Law: Learning from Solver Residuals for Precision-Critical Generation

内化几何法则:从求解器残差中学习以实现精度关键生成

Rafael Cabral, Pang Zixi, Ziyi Shou, Shen Xin

机构 * Huawei Celia Team(华为Celia团队)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型在精度关键领域(如技术图表和机械设计)中的幻觉问题,提出可编程几何DSL PyGeoX及分层基准PyGeoX-Bench,并设计饱和加性奖励(SAR)方法,将奖励分解为有界逐约束项,解决异常梯度掩盖问题,使8B模型在基准上达到与更大前沿系统竞争的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09157 2026-06-09 cs.CL cs.AI 新提交 62%

SEF-CLGC at SemEval-2026 Task 11: Logical Notation Impact on Language Model Performance

SEF-CLGC在SemEval-2026任务11中的应用:逻辑符号对语言模型性能的影响

Hanna Abi Akl, Fabien Gandon, Catherine Faron, Pierre Monnin

机构 * Université Côte d’Azur, Inria, CNRS, I3S, Sophia Antipolis, France(蔚蓝海岸大学, 法国国家信息与自动化研究所, 法国国家科学研究中心, 信息与系统科学实验室, 索菲亚安蒂波利斯, 法国) Data ScienceTech Institute, Paris, France(数据科学技术学院, 巴黎, 法国)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SEF-CLGC管道,结合形式逻辑符号与小语言模型,在SemEval-2026任务11中评估推理性能,最佳模型在降低内容偏差的同时达到27.80%的内容分数。

Comments Accepted to SemEval-2026 co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09366 2026-06-09 cs.CL eess.AS 新提交 57%

Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs

文本就是一切?文本作为语音大语言模型的通用信息瓶颈

Ming-Hao Hsu, Yuxuan Hu, Shujie Liu, Jinyu Li, Yan Lu, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Corporation(微软公司) Microsoft Research Asia(微软亚洲研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Convex Gate(C-Gate)桥接语音与LLM,通过凸包约束将语音表示限制在LLM输入嵌入流形内,在ASR和情感识别上取得联合最优性能,并揭示几何结构而非离散性是关键设计因素。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 27 篇

2606.08633 2026-06-09 cs.AI cs.LG 新提交 86%

Towards Long-Horizon Vessel Trajectory and Destination Forecasting with Reasoning Large Language Models

面向长时域船舶轨迹与目的地预测的推理型大语言模型

Hongwei Wang, Miao Zhou, Fengde Wang, Yuting Wang, Jiewen Yu, Jun-Yan He, Bohao Qu, Wanbing Zhang, Xiuju Fu, Qing Guo, Zipei Fan, Yingying Xing, Yi Yuan

机构 * Institute of High Performance Computing (IHPC), A*STAR, Singapore(新加坡科技研究局高性能计算研究所) The Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(同济大学道路与交通工程教育部重点实验室) Meituan Inc., Shenzhen, China(美团(深圳)) Centre for Frontier AI Research (CFAR), A*STAR, Singapore(新加坡科技研究局前沿人工智能研究中心) Nankai University(南开大学) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出基于可验证奖励强化学习(RLVR)的Maritime LLM后训练框架,将轨迹转化为语义文本,通过物理有效性约束和层次匹配提升长时域(30天)预测精度,4B模型表现最优。

Comments The IEEE International Conference on Intelligent Transportation Systems (ITSC) 2026, Naples, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08300 2026-06-09 cs.LG 新提交 83%

QueryWeaver: Reliable Multi-Tool Query Execution Planning via LLM-Based Graph Generation

QueryWeaver: 基于LLM图生成的可靠多工具查询执行规划

Aishwarya Chakravarthy, Vidhi Kulkarni, Duen Horng Chau

机构 * School of Computational Science and Engineering, Georgia Institute of Technology, Atlanta, GA, USA(计算科学与工程学院,佐治亚理工学院,亚特兰大,GA,美国)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 提出将自然语言查询转换为结构化图并通过确定性规划器执行的系统,利用深度优先搜索解决跨工具依赖,实现高可靠性查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08214 2026-06-09 cs.RO 新提交 82%

Agentic Neuro-Symbolic Planning and Commissioning for Human-in-the-Loop Industrial Robotics with Digital Twins

面向人机协同工业机器人的智能神经符号规划与调试:基于数字孪生

Zhihao Liu, Victor Nan Fernandez-Ayala, Tianyu Wang, Qiang Qin, Xi Vincent Wang, Dimos V. Dimarogonas, Lihui Wang

机构 * Royal Institute of Technology (KTH)(皇家理工学院(KTH))

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出一种结合LLM语言理解与确定性验证执行的神经符号框架,采用SDI架构和两级恢复机制,在数字孪生中验证后执行,显著提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09027 2026-06-09 cs.CL cs.AI 新提交 82%

SafeRun: Enabling Determinism in LLM Planning for Running

SafeRun:在跑步规划中实现LLM的确定性

Meilin Chen, Zepeng Zhai, Jiaxuan Zhao, Yuan Lu

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对LLM在跑步规划中因概率性导致安全违规的问题,提出SafeRun框架,通过解耦架构将LLM的软解释与确定性求解器的硬约束分离,实现100%安全评分。

Comments Workshop on Planning in the Era of LLMs (LM4Plan) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09251 2026-06-09 cs.CL 新提交 79%

TruthSplit: Operationalizing Conditional Validity in Arguments Through Multi-Perspective Reasoning

TruthSplit:通过多视角推理实现论证中的条件有效性操作化

Benjamin Stieger, Maximilian Terberger, Thomas Huber, Christina Niklaus

机构 * University of St. Gallen(圣加仑大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出TruthSplit系统,通过三层自然语言推理和结构化世界观档案,实现基于不同视角的论证条件有效性分析,识别价值冲突与假设差异。

Comments Demo paper. To appear at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏