A Logic of Knowing How
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments 14 pages, a 12-page version accepted by LORI V
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments 14 pages, a 12-page version accepted by LORI V
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments 16 pages, 1 figure, International Conference on Logic Programming 2010
Journal ref Theory and Practice of Logic Programming, Volume 10, Special Issue 4-6, July 2010, pages 675-690
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments 66 pages, 1 figure, to be published in "Theory and Practice of Logic Programming"
从错误到证明:最小核心引导的神经符号约束求解修复
专题命中 逻辑推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG;reasoning(comments)
AI总结 该研究提出最小核心引导的修复方法,将语言模型生成的不可满足程序的错误消息替换为最小不可满足核心,在77个问题的基准上使弱模型编造不可行问题解的比例从79%降至7%,核心价值是提供证书并拒绝编造解。
Comments 7 pages, 2 figures. Accepted at the IJCAI-ECAI 2026 Workshop on Logic and Symbolic Reasoning (LogiSymb), poster
错误但有用:多智能体消息中超越答案正确性的轨迹价值
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出DHD协议,发现多智能体错误消息含有用信息,错误但有帮助的消息普遍存在,其轨迹价值可辅助决策,答案正确性不决定轨迹价值。
Comments 24 pages, 9 figures. Includes an appendix and an ancillary reproducibility artifact
监督之前的感知:来自反事实盲区的自包含视觉蒸馏
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Aalto University(阿尔托大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。
Comments BMVC 2026
ACEM:面向智能体软件工程的成本估算模型
专题命中 逻辑推理 :reasoning(abstract);planning(abstract)
AI总结 针对智能体软件工程成本估算问题,本文提出ACEM模型,分解成本为LLM、HITL、基础设施三类,引入RF、CF、HIS构念并映射传统度量,为智能体开发成本估算提供早期方案。
Comments 27 pages, under journal publication
AgentModernize: 通过多智能体LLM和行为规范图在遗留系统现代化中保留业务逻辑
专题命中 逻辑推理 :CoT(abstract,abstract_cn)
AI总结 本文提出AgentModernize框架,通过多智能体系统和行为规范图来保留业务逻辑,解决传统方法在遗留系统现代化中丢失隐含规则和交叉模块约束的问题,实验表明该方法在多个场景中表现优异。
Comments 10 pages, 8 tables, 1 figure
冲突感知融合:通过结构化认知先验缓解大语言模型中的逻辑惯性
机构 * Xtracta & Strong AI Lab, University of Auckland(Xtracta与强人工智能实验室,奥克兰大学) ; School of Humanities, China University of Political Science and Law(人文学院,中国政法大学) ; Strong AI Lab, University of Auckland(强人工智能实验室,奥克兰大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对大语言模型在规则系统结构扰动下表现脆弱的问题,提出冲突感知融合训练流程,通过验证-演绎结构先验和符号推理奖励,在多个压力测试中实现鲁棒性饱和。
认知YOLO:基于数据第一性原理的大语言模型驱动的架构合成用于目标检测
机构 * Xi’an University of Posts and Telecommunications(西安邮电大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 针对通用目标检测算法在垂直场景的问题,认知YOLO利用大语言模型与自主智能体协作,构建“分析-合成-编译”管道,合成轻量级模型,显著压缩参数数量,在mAP@0.5:0.95上表现良好,平衡了模型紧凑性和特征表示能力。
Comments 11 pages, 3 figures, 6 tables
自动化即时Python类型注释更新
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 研究Python项目中类型注释易过时问题,提出基于大语言模型的TypeUp方法自动更新类型注释,能依据旧注释和代码更改生成新注释,性能优于现有方法,在实际项目评估中展现实用价值。
Comments 12 pages, accepted by ICSE 2026
图原生强化学习通过概念重组实现可追溯的科学假设生成
机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出图原生推理模型Graph-PRefLexOR,结合GRPO强化学习将推理组织为显式阶段,在材料科学100个开放问题上推理可追溯性提升40-65%,语义多样性增加2-3倍。
注意力-only变换器中间接对象识别最小电路的涌现
机构 * Saarland University(萨尔大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过从头训练小型注意力-only变换器,在符号化的间接对象识别任务中发现,单层模型仅需两个注意力头即可实现完美准确率,揭示了任务特定训练如何诱导可解释的最小电路。
Comments Published at ACL (Volume 4: Student Research Workshop) ISBN: 979-8-89176-393-7 URL: https://aclanthology.org/2026.acl-srw.4
VDAWorld: 通过VLM导向的抽象与模拟进行世界建模
机构 * University of Cambridge(剑桥大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 提出VDAWorld框架,利用视觉语言模型自主构建场景表示并选择物理模拟器,通过抽象与自适应模拟实现高质量世界建模,在交互控制、反事实生成和物理逻辑推理任务上取得最优结果。
Comments Website: https://felixomahony.github.io/vdaworld/
视觉会撒谎,一致性说话:在视觉-语言模型中解耦空间注意力与可靠性
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; Algoverse AI Research(Algoverse AI研究) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出VLM可靠性探针(VRP),通过结构注意力指标和生成动态分析,发现空间注意力与准确性几乎无关(R≈0.001),而自一致性是可靠性的主要预测因子(R=0.429),揭示了视觉特征与最终生成之间的符号脱离现象。
Comments 16 pages. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence. Code: https://github.com/itsloganmann/VLM-Reliability-Probe
零源大语言模型幻觉检测:类人类标准探测
机构 * South China University of Technology(华南理工大学) ; The University of Melbourne(墨尔本大学) ; Pazhou Laboratory(帕乔实验室) ; Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出HCPD范式,通过类人类标准探测机制模拟人类评估者的多面推理,结合奖励对齐和多样本聚合,实现零源条件下的有效可解释幻觉检测。
Comments Accepted at ICML 2026
灵活性陷阱:重新思考扩散语言模型中任意顺序的价值
机构 * LeapLab, Tsinghua University(清华大学Leap实验室) ; NLPLab, Tsinghua University(清华大学自然语言处理实验室) ; Tsinghua University(清华大学) ; Alibaba Group(阿里巴巴集团) ; BNRist, Tsinghua University(清华大学北京研究院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文发现,尽管扩散语言模型(dLLMs)允许任意生成顺序,但这种灵活性可能限制其推理能力,通过采用标准的Group Relative Policy Optimization(GRPO)方法,即JustGRPO,在保持并行解码能力的同时提升了推理性能。
Comments Code and pre-trained models: https://github.com/LeapLabTHU/JustGRPO
OpenSkill: 面向LLM智能体的开放世界自我进化
机构 * Lehigh University(莱维大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Salesforce AI Research(Salesforce人工智能研究) ; Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)
专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出OpenSkill框架,使智能体在无目标任务监督下,利用开放世界资源自举构建技能和验证信号,实现自我进化,在多个基准上取得最佳自动通过率。
Comments 20 pages, 4 figures and 8 tables. Code is avalable at https://github.com/OpenLAIR/OpenSkill
保护沙箱:计算机图形学教育中面向过程监控的无根容器化框架
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 提出VISMATIC框架,通过无根容器隔离和API级用户交互追踪,在计算机科学教育中实现过程监控的同时保障基础设施安全。
Comments 13 pages, 7 figures. Source code: https://github.com/german-arroyo-moreno/VISMATIC
Cartan-Topos协议:弹性多智能体协调的统一几何与范畴框架
专题命中 逻辑推理 :reasoning(abstract);planning(abstract)
AI总结 针对连续欧几里得共识在非完整约束下失效、离散符号逻辑在开放世界假设下崩溃的问题,提出一种统一几何与范畴框架,通过黎曼质心流、克利福德代数表示、细胞层和Cartan连接实现弹性多智能体协调,并利用层论规划进行弹性时间推理。
使用大型语言模型进行社会科学和人文学科可重复文本注释的方法论指南:基于Python和R
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 本文提供了一步一步的方法论指南,指导社会科学和人文学科研究者使用大型语言模型进行文本注释,包括设置项目、编程交互、提示设计、统计整合和可重复性管理,并附有Python和R代码示例。
Comments Accompanying Python and R notebooks are available at https://github.com/sodascience/workshop_llm_data_collection or https://zenodo.org/records/20073016
迈向通用因果推理器
机构 * The University of Chicago(芝加哥大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出UniCo数据生成框架,覆盖Pearl因果阶梯的18种查询类型,将符号示例转化为代码和自然语言,通过监督微调显著提升LLM的因果推理能力和推理忠实度。
通用危险检测
机构 * Swinburne University of Technology(斯winburne大学) ; National Transport Research Organisation(国家交通运输研究组织) ; Google Cloud(谷歌云) ; Deakin University(德金大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 针对现有危险检测系统在抽象安全概念上的局限性,提出基于规则合规评估的CompliVision数据集和结合LLaVA视觉推理与人在回路反馈的通用危险检测框架。
Comments 20 pages, 7 figures and 4 tables
确定性视界:作为可信AI系统设计规范的不可行性结果
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过证明架构决定的准确率上限、偏好学习的样本复杂度跳跃、多阶段检索的指标数量要求等16个不可行性结果,将计算极限转化为可信AI系统的设计规范。
Comments PhD thesis, Department of Computer Science, The University of Hong Kong, 2026. 271 pages, 18 figures, 15 tables, 5 algorithms
将大语言模型与时序逻辑融合以实现复杂场景中可靠的人-群智协作
机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) ; Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然与应用科学学院) ; School of Automaton, Southeast University(东南大学自动化学院) ; School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院)
专题命中 逻辑推理 :reasoning(abstract);planning(abstract)
AI总结 本文提出一种神经符号框架,结合时序逻辑与大语言模型,实现长周期人-群智协作,通过形式化任务规划与上下文感知推理,提升动态环境中任务规划的可靠性与效率。
MARD:一种用于鲁棒Android恶意软件检测的多智能体框架
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 MARD通过结合LLM的语义理解和传统静态分析,提出多智能体框架,有效降低APK深度分析成本,实现高可解释性检测,F1得分达93.46%。
SAGER:面向推荐代理的自进化用户策略技能
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 SAGER通过为每个用户分配专用策略技能,实现个性化推荐代理的自进化推理,实验表明其在四个公开基准上达到最优性能,证明个性化推理过程是推荐改进的新来源。
觉醒失明:为基于视觉感知的代理轨迹进行无监督的冷启动优化
机构 * Indian Institute of Technology Delhi(印度理工学院德里) ; Indian Institute of Technology Abu Dhabi(印度理工学院阿布扎比) ; Microsoft Research(微软研究院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出SPECTRA框架,通过冷启动强化学习提升小视觉语言模型的视觉鲁棒性和工具协调能力,无需监督即可提高任务准确性和工具效率。
Comments ACL 2026 Findings
Legal2LogicICL: 通过多样少量样本学习提升将法律案例转换为逻辑公式的一般化能力
机构 * Center for Juris-Informatics, ROIS-DS(法信息学中心,ROIS-DS) ; Japan Advanced Institute of Science and Technology(日本先端科学技术大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Legal2LogicICL框架,通过检索增强生成实现有效上下文学习,构建信息丰富且稳定的少量样本演示,提升法律案例转逻辑表示的准确性与稳定性。
Comments Accepted at ICAIL 2026
CLASP: 闭环异步空间感知用于开放词汇桌面物体抓取
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室) ; Peng Cheng Laboratory(鹏城实验室) ; Northeastern University(东北大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 本文提出CLASP框架,通过异步闭环机制整合多模态感知、逻辑推理与状态反馈,解决低级抓取中多模态演示不足、空间幻觉和开放环执行脆弱性问题,实现87%的成功率和强泛化能力。