Agentic Planning for Symbolic Execution
符号执行的智能体规划
专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 该研究提出智能体规划系统Agolic,利用早期符号执行运行的证据配置后续有界符号执行,在C/C++程序上平均覆盖3倍以上分支,覆盖更多分支及对比语料库未覆盖的分支,扩展了符号执行的实际覆盖范围。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
符号执行的智能体规划
专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 该研究提出智能体规划系统Agolic,利用早期符号执行运行的证据配置后续有界符号执行,在C/C++程序上平均覆盖3倍以上分支,覆盖更多分支及对比语料库未覆盖的分支,扩展了符号执行的实际覆盖范围。
当存在多个有效答案时,投票会失效:针对大语言模型中K选1最佳因果推理的符号验证
专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 针对大语言模型因果推理中多有效答案下投票失效的问题,提出无需训练的符号验证器CALVER,在CLEAR数据集等场景下显著提升了推理选择准确率。
Comments 28 pages, 5 figures, 28 tables
SCAIR:用于企业知识图谱的模式条件代理迭代推理
机构 * University of Stuttgart(斯图加特大学) ; Bosch Center for AI(博世人工智能中心) ; University of Oslo(奥斯陆大学) ; University of Southampton(南安普顿大学) ; BSH Home Applications Holding (China) Co., Ltd(博西华家用电器有限公司(中国)) ; Tsinghua University(清华大学)
专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 针对现有方法在企业知识图谱应用的局限,提出SCAIR无训练框架,集成结构化规划与受控迭代推理,通过模式条件结构先验等提升性能,强调企业图推理要结合领域约束,与业务逻辑对齐可增效。
Comments Accepted at ACL 2026 Industry Track
约束锚定推理轨迹
机构 * University of Oxford(牛津大学)
专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI
AI总结 研究自回归多模态大语言模型错误滚雪球问题,提出神经符号框架CART,将自然语言推理与符号约束断言交织,经双管齐下的模块验证约束,防止错误传播,在多基准测试中降低滚雪球率、提高准确率并控制推理开销。
Comments 15 pages, ACM MM 2026
化学与材料推理的有根据验证:检测是瓶颈
专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.LG
AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。
CARL:用于大语言模型规划的约束感知强化学习
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; City University of Hong Kong(香港城市大学) ; College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) ; School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)
专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 研究大语言模型生成违反任务约束计划的问题,提出约束感知强化学习框架CARL,通过比较不同输入下模型输出分布引入奖励,提升模型约束意识,实验证明其优于基线和现有模型。
Comments ACL 2026 Findings
ReQAT: 实现全精度推理精度的4位浮点量化感知训练
机构 * Hanyang University(汉阳大学) ; Samsung Advanced Institute of Technology(三星综合技术院)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 针对大推理模型在低比特量化(W4A4KV4)下推理精度严重下降的问题,提出ReQAT框架,通过迹对齐QAT、选择性熵最小化和量化友好初始化,恢复并超越BF16微调精度,实现最高3.9倍吞吐加速。
Comments ICML 2026
边界框作为目标:通过神经符号规划实现语言条件抓取
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 提出GRASP框架,利用预训练VLM将自然语言查询转化为神经符号目标状态,通过边界框检测实现零样本桌面操作,无需任务特定训练。
Comments Project website: https://allisonandreyev.github.io/grasp.github.io/
MARD: 镜像增强推理蒸馏用于机制级药物-药物相互作用预测
机构 * University of Guelph(圭尔夫大学) ; York University(约克大学) ; Vector Institute(向量研究所)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL
AI总结 提出MARD-7B模型,通过镜像增强推理蒸馏、单token KL散度、PRM加权DPO和机制感知检索通道,在机制级DDI预测中准确率超越GPT-4o 6.7个百分点,且成本仅为1%。
Comments 29 pages, 9 figures. Preprint
平衡效率与效能:面向多模态大语言模型(MLLM)的无训练注意力引导式显式与隐式思维切换
专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 针对MLLM推理中感知与逻辑混淆的问题,提出无训练的注意力引导式切换框架,通过视觉-文本注意力比率自适应切换显式与隐式推理,实现性能与效率的双重提升。
Comments Accepted by ACM MM 2026. 10 pages, 6 figures, 5 tables
立场:推理是一个可学习的基于规则的过程
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出推理是可学习的基于规则的过程,针对生成式AI社区推理定义模糊问题,给出操作定义与研究交流最佳实践清单,以保障推理评估的结构效度。
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
先规划正确,再规划紧凑:面向高效具身推理的符号强化学习
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Tencent(腾讯) ; University of London(伦敦大学)
专题命中 逻辑推理 :reasoning(title);planning(abstract);verifier(abstract)
AI总结 针对具身任务规划中缺乏低成本确定性验证的问题,提出基于BDDL规范的符号强化学习框架,通过视频解析、LLM验证和轻量符号引擎提供毫秒级密集反馈,并引入难度感知长度调度GroupAdapt,在BEHAVIOR-1000上实现97.3的严格通过率,相对Qwen3-8B提升25.9%。
Comments 18 pages, 10 figures, 14 tables; includes appendix
资源感知的神经符号推理用于本地小型语言模型
专题命中 逻辑推理 :reasoning(title,abstract)
AI总结 提出VFR-LLM管道,将问题翻译为类型化有限域规则和约束,通过符号层验证一致性,用确定性求解器推理,在本地小模型上以单次调用达到高精度,替代重复采样。
神经符号软件验证:通过符号推理在规模上增强本地语言模型
专题命中 逻辑推理 :reasoning(title);chain-of-thought(abstract);verifier(abstract)
AI总结 提出VerIbmc管道,结合符号不变量生成与本地开源语言模型及ESBMC验证工具,通过结构化的验证器反馈迭代优化,实现隐私保护且高效的循环不变量合成,在520个问题上达到86.4%的解决率。
你在跟我讲逻辑吗?评估语言模型的三段论推理能力
机构 * Université Côte d’Azur(科特阿祖尔大学) ; Inria(法国国家信息与自动化研究所) ; CNRS(法国国家科学研究中心) ; I3S(信息科学与系统实验室) ; Data ScienceTech Institute(数据科学技术学院)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究通过扩展FOLIO和P-FOLIO数据集,探究不同KR符号对SLMs三段论推理的影响,提出SEF分类法并开源CLGC框架,为提升小型模型推理能力提供了新方法。
Comments Accepted to the International Joint Conference on Rules and Reasoning (RuleML+RR) 2026
通过知识图谱基础增强小型语言模型推理
机构 * Institute of Informatics and Telecommunications, National Center for Scientific Research “Demokritos(信息与电信研究所,国家科学研究中心“德谟克利特”)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究利用神经符号智能框架增强小型语言模型推理能力,通过特定工具调用转变模型,在两种场景下评估,发现虽提示提升性能,但受提取瓶颈等限制,还存在“干扰效应”,刻画了挑战并提供迭代验证路线图。
Comments Presented at the 2nd Causal Neuro-symbolic Artificial Intelligence (Causal NeSy): Toward Agentic LLMs with Neuro-Symbolic and Graph Based Reasoning Workshop @ ESWC2026
作为逻辑的策略:针对规则的鲁棒推理
机构 * IBM Research(IBM研究院) ; IBM(国际商业机器公司)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出混合符号方法,将策略表示为形式逻辑,结合语言模型事实提取与答案集求解器推理,性能优于策略作为提示、策略作为代码方法,令牌用量减少约10倍,助力生成式AI系统做出鲁棒决策。
Comments RobustifAI Workshop at IJCAI-ECAI '26
基于预训练符号 Transformer 的物理动力系统验证器引导式模型发现
机构 * Imperial College London(伦敦帝国学院)
专题命中 逻辑推理 :verifier(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出了一种验证器引导式(VG)工作流程,基于预训练符号 Transformer ODEFormer 实现物理动力系统的可解释预测,在范德波尔振荡器和涡旋脱落场景中展现出优于原方法的性能与泛化能力。
Comments 33 pages, 13 figures, 10 tables
智能体能够欺骗吗?使用社交推理游戏评估ParliamentBench中的推理与欺骗能力
机构 * University of Göttingen(哥廷根大学) ; National Institute of Informatics(信息学研究所) ; University of Tokyo(东京大学)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究基于《Secret Hitler》游戏构建ParliamentBench基准,评估16个LLM的欺骗与推理能力,发现前沿模型表现优异,多数LLM难以维持一致的欺骗人设。
求解器困难并非模型困难:一种用于大语言模型约束推理的硬度控制诊断方法
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型约束推理,在接近匹配子句密度时测试实例级转移,比较不同公式和锚点,发现求解器与模型硬度差异,以及模型对证明保留重新标记敏感,还研究了完成令牌花费与代理的关系。
Comments 13 pages, 2 figures, 5 tables. Code and aggregate reproduction data: https://github.com/lucky-verma/solver-hard-is-not-model-hard
Agora:通过基于拍卖的任务分配增强大语言模型智能体推理
机构 * University of Birmingham(伯明翰大学)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究旨在增强LLM智能体推理能力,提出Agora框架,通过基于拍卖的机制动态分配任务,将推理步骤视为可交易项目让智能体依纠正能力投标,实验表明该框架在多基准测试中表现优且能实现成本-质量权衡。
Comments Preprint. 12 pages, 4 figures
从判决到问题:具有引用幻觉控制的法律推理结构化提取
机构 * Quantitative and Digital Law Laboratory(量化与数字法律实验室) ; CIRSFID - Alma AI, Faculty of Law University of Bologna(CIRSFID - 阿尔玛AI,博洛尼亚大学法学院) ; Robert Schuman Centre European University Institute(罗伯特·施曼中心欧洲大学研究所)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出自动化流程,将意大利税务法庭判决分解为法律问题,基于IRAC框架和法律三段论提取结构化XML表示,用通用模型并结合幻觉检测过滤器处理大量判决,经专家验证,为下游应用提供起点。
Comments 33 pages, 2 figures
符号推理框架在多智能体战略环境中调节大语言模型的风险规避
机构 * iterative.day
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究通过注入符号推理框架(如易经、塔罗牌)作为反思提示,发现其能差异化调节LLM的风险规避倾向,并在多智能体博弈中产生框架特定的胜者分布,且该效应源于反思过程而非内容遵循。
Comments 28 pages, 4 figures, 9 tables, 6 listings. Code and data: https://doi.org/10.5281/zenodo.20338937
VADAOrchestra:自适应推理工作流的神经符号编排
机构 * TU Wien(维也纳工业大学) ; Banca d’Italia(意大利央行) ; University of Warwick(华威大学)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出VADAOrchestra框架,结合LLM灵活性与Datalog+/-符号推理,实现可审计、可扩展的自适应工作流编排,在金融场景中验证了忠实性、可扩展性和可解释性。
Comments Accepted at KR 2026
MemDreamer: 通过分层图记忆和智能体检索机制解耦感知与推理以实现长视频理解
机构 * Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; Central South University(中南大学) ; HKUST(GZ)(香港科技大学(广州))
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出MemDreamer框架,通过分层图记忆和智能体检索机制解耦感知与推理,将长视频理解转化为智能体探索过程,在四个基准上达到SOTA,推理上下文窗口仅占全量2%且准确率提升12.5点。
了解你的局限:LLM在法律推理中作为求解器和自动形式化工具的忠实性
机构 * UC Santa Cruz(加州大学圣克鲁兹分校) ; Univ. Helsinki(赫尔辛基大学) ; CodeX, Stanford(斯坦福大学CodeX中心) ; Stanford University(斯坦福大学) ; Canyon Crest Academy(峡谷峰学院) ; Monta Vista High School(蒙塔维斯塔高中) ; Los Altos High School(洛斯阿尔托斯高中)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究LLM在法律推理中是否忠实执行逻辑推理,发现LLM基于形式推理的高性能掩盖了范围清洗等不忠实模式,揭示基准准确性与逻辑忠实性之间的根本差距。
Comments 10 pages, submitted to COLM 2026 (under review, average score of 6.25 across 4 reviewers) and accepted by the AI4Law and AI4Math workshops at ICML. This is the version where we already addressed most of the reviews from the COLM & AI4Law & AI4Math reviewers
基于序列模型的符号谜题循环推理
机构 * Algoverse AI Research ; Cornell University(康奈尔大学)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出 RecurrReason 基准,包含四个递归逻辑谜题,通过控制难度参数 N 评估序列模型,发现架构比规模更重要,预训练仅对局部结构转移函数的谜题有效。
将时间序列表示为结构化程序以进行LLM推理
机构 * Korea University(高丽大学) ; Mila, University of Montreal(蒙特利尔大学米拉研究所)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出T2SP方法,将时间序列分解为趋势、周期和显著事件并表示为结构化符号程序,使LLM无需微调即可高效推理,在编辑、描述和问答任务上优于原始序列表示。
Comments Preprint
MonitorVLM-v2:用于实时安全违规检测的已部署视觉-语言框架
机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) ; The Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室)
专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出MonitorVLM-v2框架,将VLM安全评估转化为有限符号空间概率推理,结合SymPO算法与熵驱动分类机制,在地下矿部署中实现19.45倍提速,确认违规量达人工检查的2.78倍,满足实时可审计工业监控需求。
CircuitReason-1k:电路中的长程视觉到符号推理基准测试
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI
AI总结 CircuitReason-1k是含1000个真实教材电路问题的基准,用于评估多模态模型的长程视觉到符号推理,现有模型在长程问题上表现差,该基准为相关测试提供了聚焦平台。