Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs
三狼人杀:大型语言模型中多跳心智理论的丑角角色
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 通过引入第三阵营“丑角”(Jester),将狼人杀游戏扩展为三方博弈,测试LLM的多跳心智理论能力。实验表明,模型常做出自毁行为,而自我学习能帮助部分模型学会微妙策略。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
三狼人杀:大型语言模型中多跳心智理论的丑角角色
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 通过引入第三阵营“丑角”(Jester),将狼人杀游戏扩展为三方博弈,测试LLM的多跳心智理论能力。实验表明,模型常做出自毁行为,而自我学习能帮助部分模型学会微妙策略。
保持VIGILant:通过多模态大语言模型中的反事实视觉对齐缓解视觉懒惰
机构 * UAB(阿拉巴马大学伯明翰分校) ; Yale(耶鲁大学) ; UNSW(新南威尔士大学) ; Tulane(杜兰大学) ; Georgia Tech(佐治亚理工学院) ; NEU(东北大学) ; OSU(俄亥俄州立大学) ; UIowa(爱荷华大学) ; Harvard(哈佛大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出VIGIL框架,通过强化学习后训练最大化视觉输入与生成响应间的互信息,惩罚“盲目自信”实例,有效缓解MLLMs的视觉懒惰问题,在幻觉和推理基准上优于现有方法。
Comments ECCV 2026
VeriGraph: 迈向可验证的数据分析智能体
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出VeriGraph框架,通过构建显式异质证据有向无环图(DAG)实现数据分析智能体的可验证性,并设计基于图的策略优化提升正确性与可审计性。
Comments 10 pages
枢纽或边缘:基于网页图中心性的预训练数据选择
机构 * Princeton Language and Intelligence(普林斯顿语言与智能) ; Princeton University(普林斯顿大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出WebGraphMix框架,利用Common Crawl主机级网页图的结构中心性得分调整预训练数据中中心与边缘文档的比例,无需模型训练或标注数据,在400M和1B参数模型上平均性能提升至41.4%。
Comments 10 pages
内化几何法则:从求解器残差中学习以实现精度关键生成
机构 * Huawei Celia Team(华为Celia团队)
专题命中 逻辑推理 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型在精度关键领域(如技术图表和机械设计)中的幻觉问题,提出可编程几何DSL PyGeoX及分层基准PyGeoX-Bench,并设计饱和加性奖励(SAR)方法,将奖励分解为有界逐约束项,解决异常梯度掩盖问题,使8B模型在基准上达到与更大前沿系统竞争的水平。
SEF-CLGC在SemEval-2026任务11中的应用:逻辑符号对语言模型性能的影响
机构 * Université Côte d’Azur, Inria, CNRS, I3S, Sophia Antipolis, France(蔚蓝海岸大学, 法国国家信息与自动化研究所, 法国国家科学研究中心, 信息与系统科学实验室, 索菲亚安蒂波利斯, 法国) ; Data ScienceTech Institute, Paris, France(数据科学技术学院, 巴黎, 法国)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出SEF-CLGC管道,结合形式逻辑符号与小语言模型,在SemEval-2026任务11中评估推理性能,最佳模型在降低内容偏差的同时达到27.80%的内容分数。
Comments Accepted to SemEval-2026 co-located with ACL 2026
PandaAI: 一种用于量化金融中神经符号数据分析与集成决策的实用智能体CQ2
机构 * Panda AI
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对金融数据低信噪比和非平稳性,提出PandaAI,一种结合市场状态建模与约束alpha生成的闭环神经符号LLM智能体,通过领域微调和模块化架构实现风险感知决策,在沪深300数据上Rank IC提升18.2%,最大回撤降低25.7%。
相同公式,不同语义:语言模型是否遵循模态逻辑规范?
机构 * Univ. Lille(里尔大学) ; Inria(法国国家信息与自动化研究所) ; CNRS(法国国家科学研究中心) ; Centrale Lille(里尔中央理工学院) ; UMR 9189 - CRIStAL(UMR 9189 - CRIStAL(法国国家科研中心联合研究机构))
专题命中 逻辑推理 :reasoning(abstract,comments);分类 cs.CL
AI总结 该研究探究语言模型是否遵循模态逻辑规范,构建成对模态问题测试五款模型,发现遵循规定模态语义依赖推理模式与模型身份,发布相关产物。
Comments 9 pages. Code: https://github.com/sileod/modal-semantics-reasoning. Data and artifacts: https://huggingface.co/datasets/sileod/modal-semantics-reasoning
用Wolfram语言实现计算法以用于人工智能治理
机构 * Wolfram Institute for Computational Foundations of Science(沃尔夫勒姆计算基础科学研究所)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本文在Wolfram语言中实现Reified Input/Output Logic,测试GPT-4转换英文法律陈述的情况,通过AI看门狗案例展示计算法可作为AI治理工具,理想目标是形式化可编程执行的法律。
Comments 25 pages, 1 figure, 2 tables, 12 code listings. Wolfram Language implementation and verification script (31 assertions) available at this https URL (https://github.com/Zaffer/research-computational-law)
大语言模型辅助的自动驾驶车辆中攻击者可及软件弱点的动态威胁分析
专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对自动驾驶车辆软件弱点的动态威胁分析难题,探究LLM辅助Autoware的自动化测试工件生成,发现构建集成是核心障碍,推理模型编译测试用例的表现优于代码专用模型。
Comments 17 pages, 8 figures, 8 tables
构建动态主逻辑模型作为知识图谱,用于使用检索增强大语言模型的复杂系统诊断
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出基于检索增强大语言模型的KG-DML框架,实现了复杂系统动态主逻辑模型的自动化构建,经低压冷却剂注入系统验证,可转化技术文档为可执行功能模型用于诊断分析。
Comments 36 Pages, 8 Figures
自演进网络验证器
专题命中 逻辑推理 :verifier(abstract);分类 cs.AI
AI总结 该研究提出一种自动演进的网络验证器,通过编码智能体与可信预言机的反例引导循环,让基于SMT的验证器自主学习新网络功能,解决手动维护模型的难题。
Comments 8 pages, 5 figures
CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制
机构 * Arizona State University(亚利桑那州立大学) ; Amazon AGI(亚马逊AGI)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。
仅知道两跳信息是不够:理解语言模型中的两跳泛化
机构 * Xi’an Jiaotong University(西安交通大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。
Comments 24 pages, 20 figures
NeSy-RAG:用于可解释问答的神经符号检索增强生成框架
机构 * Heidelberg University(海德堡大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL
AI总结 NeSy-RAG是一种模块化神经符号RAG框架,可生成透明推理轨迹,在ShARC基准上以61.1%的准确率优于同模型RAG基线,实现可解释问答。
视觉感知不等于决策:多模态大语言模型能成为有效的首席执行官吗?
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究构建C-SUITEBENCH多模态基准,评估9个前沿模型作为CEO的决策能力,发现多模态输入可提升证据推理但会损害受限资源分配,揭示多模态智能体的视觉感知与受限行动是可分离瓶颈。
Comments 25 pages
Vibe Compiler:无需提示工程即可运行的研究逻辑综合工具——迈向生成式AI时代维持智能体的元认知
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 针对生成式AI可能侵蚀人类认知智能体的问题,提出基于综合-分析互惠模型的Vibe Compiler工具,通过16个学术参数的本体编译研究想法,以反思性问题引导研究人员,减少对复杂提示的依赖,提升AI辅助推理效果。
抽象事件因果规则:归纳与应用
机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究针对现有实例级因果对泛化缺陷,提出抽象事件因果规则(AECR)及相关归纳系统,构建知识库并设计 AR-GCAE 模型注入 AECR,在 CGEP 任务中提升了事件因果推理与预测性能,尤其对稀有未见样本效果显著。
ConWriter:基于轻量级神经符号一致性控制的带状态长文本故事生成,受过渡约束
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL
AI总结 针对现有长故事生成方法易累积各类错误的问题,提出无训练框架ConWriter,通过维护故事状态、验证叙事过渡并结合风险信号实现一致性控制,在ConStory-Bench上完成多模型多任务评估。
ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL
AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。
Comments Submitted to Journal of Biomedical Informatics (under review)
可验证记忆:为大语言模型智能体学习结合局部与全局验证器的统一记忆管理
专题命中 逻辑推理 :verifier(abstract);分类 cs.AI
AI总结 提出VerMem框架,用含七个原子操作的统一策略管理LTM等状态,结合局部与全局验证器训练,在多基准测试中性能与效率均优于基线。
EntailLLM:通过逻辑编程结合领域知识验证大语言模型生成的漏洞发现路径
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 EntailLLM通过逻辑编程结合领域知识验证LLM生成的漏洞发现路径,在三类CWE、四个LLM等多组实验中,将合并蕴含率从78%提升至98%,可端到端部署且无需逐设备调优。
Gram-Space:面向内存高效神经符号AI的结构保持码本压缩
机构 * University of California Riverside(加州大学河滨分校)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出Gram-Space压缩框架,通过格拉姆-施密特正交化保留VSA所需点积结构,可降低神经符号AI模型GPU内存使用与推理延迟,提升硬件利用率。
Comments International Conference on Neuro-symbolic Systems (NeuS) 2026
开放数字孪生生态中可验证AI智能体的神经符号参与治理
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对开放数字孪生生态中AI智能体的验证需求,提出神经符号去中心化治理框架,结合神经推理与制度治理,通过区块链智能合约实现可审计参与,经原型验证可管控开销下保障合规协作。
Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026), Bellevue, WA, USA, October 4-7, 2026. 7 pages, 1 figure, 5 tables. Code: https://github.com/weicaiuw/verigov-ai (DOI: 10.5281/zenodo.21706699)
用于污水管网管道严重程度预测的基于模糊规则的神经符号方法
机构 * Can Tho University(芹苴大学) ; Istituto di Scienza e Tecnologie dell’Informazione, CNR - ISTI(意大利国家研究委员会信息科学与技术研究所)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出一种基于模糊规则的神经符号框架,将神经感知与符号推理解耦,结合Swin Transformer、Weka J48算法和模糊逻辑,在污水管网管道严重程度预测任务中,较仅图像分类提升了多项关键指标。
利用大语言模型实现万物互联环境下的智能资源分配
专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对万物互联的动态资源调度挑战,提出大语言模型驱动的资源分配方案,构建多维调度决策模型并引入反馈模块,仿真显示其在收敛速度等指标上表现优异。
CaM-Wolf:面向社交推理游戏的因果感知多模态智能体
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。
Comments Accepted by ACMMM 2026
更严重的欺骗:混合动机大型语言模型多智能体系统中的目标不一致
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究以《狼人杀》为框架,分析LLM多智能体的目标不一致问题,发现其会破坏对抗环境结果且在公开行为中难察觉,凸显需缓解策略。
Comments Accepted at AIWILD@ICLR 2026
ProcAgent:一种用于边缘端人机协作的过程性任务指导的智能体框架
机构 * University of Tennessee Knoxville(田纳西大学诺克斯维尔分校) ; Worcester Polytechnic Institute(伍斯特理工学院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 研究针对家具组装等过程性任务,提出ProcAgent框架,利用提议与验证架构,结合多种技术,在边缘设备上实现实时自适应指导,经多维度评估及用户研究,证明能在不牺牲可用性的情况下于边缘硬件达成自适应过程性辅助。
KANEx:将柯尔莫哥洛夫-阿诺德网络的可解释性转化为医学可解释性
机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) ; Vanderbilt University School of Medicine(范德堡大学医学院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 研究针对医学应用中视觉模型黑箱问题,提出KANEx框架,利用柯尔莫哥洛夫-阿诺德网络的符号透明度为VLM推理奠基,设计KAN-Map热图生成方法,经实验验证该方法能提升语义相似度、视觉定位及推理质量,为可信医学人工智能发展助力。
Comments MICCAI 2026