arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-22 至 2026-04-22 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 14 篇

2604.19459 2026-04-22 cs.AI cs.CL cs.LO 88%

Do LLMs Game Formalization? Evaluating Faithfulness in Logical Reasoning

大语言模型是否在形式化中作弊?评估逻辑推理中的忠实性

Kyuhee Kim, Auguste Poiroux, Antoine Bosselut

机构 * EPFL(苏黎世联邦理工学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估了大语言模型在逻辑推理中的忠实性,发现统一生成方法在形式化过程中未表现出系统性作弊行为,但两种阶段流程揭示了两种不同的不忠实性模式。

Comments 25 pages, 4 figures, 22 tables. Published at the VerifAI-2 Workshop, ICLR 2026 (non-archival). Code and data: https://github.com/koreankiwi99/formalization-gaming

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19716 2026-04-22 cs.CL 88%

Discovering a Shared Logical Subspace: Steering LLM Logical Reasoning via Alignment of Natural-Language and Symbolic Views

发现共享的逻辑子空间:通过自然语言和符号视角的对齐来引导LLM逻辑推理

Feihao Fang, My T. Thai, Yuanyuan Lei

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Computer & Information Science and Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL

AI总结 本文提出通过对齐自然语言和符号视角的逻辑子空间来提升LLM的多步逻辑推理能力,通过实验验证该方法在四个基准测试中提升了准确率并具备良好的泛化能力。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18873 2026-04-22 cs.AI 87%

From Natural Language to Executable Narsese: A Neuro-Symbolic Benchmark and Pipeline for Reasoning with NARS

从自然语言到可执行的Narsese:一种神经符号基准和管道用于基于NARS的推理

Mina Gabriel, Pei Wang

机构 * Temple University(特拉华大学)

专题命中 逻辑推理 :reasoning(title,summary_cn);分类 cs.AI

AI总结 本文提出神经符号框架,将自然语言推理问题转换为可执行的形式化表示,结合FOL和Narsese,并引入NARS-Reasoning-v0.1基准,支持符号生成与执行验证,展示可监督适应的潜力。

Comments 14 pages. Submitted to AGI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19488 2026-04-22 cs.AI 85%

CoDA: Towards Effective Cross-domain Knowledge Transfer via CoT-guided Domain Adaptation

CoDA:通过引导式推理的领域适应实现有效的跨领域知识迁移

Jianzhi Yan, Le Liu, Buzhou Tang, Yang Xiang, Dongning Sun, Zhiming Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室)

专题命中 逻辑推理 :CoT(title,abstract);reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 针对跨领域知识迁移中领域分布偏移问题,CoDA通过轻量适配器和基于特征的知识蒸馏结合MMD分布匹配,有效对齐源域与目标域的潜在推理表示,提升逻辑推理任务性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19464 2026-04-22 cs.CL cs.AI 81%

LePREC: Reasoning as Classification over Structured Factors for Assessing Relevance of Legal Issues

LePREC:基于结构因素的推理作为分类,以评估法律问题的相关性

Fanyu Wang, Xiaoxi Kang, Paul Burgess, Aashish Srivastava, Chetan Arora, Adnan Trakic, Lay-Ki Soon, Md Khalid Hossain, Lizhen Qu

机构 * Faculty of Information Technology, Monash University, Australia(墨尔本大学信息技术学院,澳大利亚) School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息学院) School of Business, Monash University Malaysia(墨尔本大学马来西亚分校商学院) Faculty of Law, Monash University, Australia(墨尔本大学法学院,澳大利亚)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LePREC框架,结合神经生成与结构统计推理,提升法律问题识别的精度,实验表明其比先进LLM基线提升30-40%。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19523 2026-04-22 cs.AI 79%

Revac: A Social Deduction Reasoning Agent

Revac:一个社交推理解谜代理

Mihir Shriniwas Arya, Avinash Anish, Aditya Ranjan

机构 * Department of Computer Science and Engineering(计算机科学与工程系) RV College of Engineering(RV 工程学院) Department of Information Science and Engineering(信息科学与工程系) Department of Artificial Intelligence and Machine Learning(人工智能与机器学习系)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Revac-8通过整合记忆玩家分析、社交图分析和动态语气选择,解决了社交推理解谜中的不确定性推理与欺骗适应问题,实现了在高风险社交环境中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02304 2026-04-22 cs.CL 77%

When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers

验证何时有效?对LLM作为解决方案验证器的深入探讨

Jack Lu, Ryan Teehan, Jinran Jin, Mengye Ren

机构 * Agentic Learning AI Lab, New York University(代理学习人工智能实验室,纽约大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 研究探讨了在何种条件下验证有效,通过分析37个模型在9个基准测试中的表现,发现跨模型家族验证效果优于自验证,且验证收益随模型相似性增加而降低。

Comments Accepted at ICLR 2026 AI with Recursive Self-Improvement workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14972 2026-04-22 cs.IR 67%

SAGER: Self-Evolving User Policy Skills for Recommendation Agent

SAGER:面向推荐代理的自进化用户策略技能

Zhen Tao, Riwei Lai, Chenyun Yu, Weixin Chen, Li Chen, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Qingqiang Sun

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 SAGER通过为每个用户分配专用策略技能,实现个性化推荐代理的自进化推理,实验表明其在四个公开基准上达到最优性能,证明个性化推理过程是推荐改进的新来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19147 2026-04-22 cs.LG cs.AI 62%

Nexusformer: Nonlinear Attention Expansion for Stable and Inheritable Transformer Scaling

Nexusformer:非线性注意力扩展用于稳定且可继承的Transformer扩展

Weijie Zhao, Mingquan Liu, Bolun Wang, Simo Wu, Nuobei Xie, Rui-Jie Zhu, Peng Zhou

机构 * The School of Computer Science, China University of Geosciences, 388 Lumo Road, Wuhan, 430074, Hubei, China(中国地质大学(北京)计算机科学学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Nexusformer通过非线性映射解决传统Transformer扩展中的线性瓶颈,实现无损结构扩展,实验表明其在语言模型和推理任务中以更低的计算成本达到与Tokenformer相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18658 2026-04-22 cs.CR cs.AI cs.CL 62%

Owner-Harm: A Missing Threat Model for AI Agent Safety

所有权危害:AI代理安全的缺失威胁模型

Dongcheng Zhang, Yiqing Jiang

机构 * BlueFocus Communication Group(蓝ocus通信集团) Tongji University(同济大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Owner-Harm威胁模型,旨在解决AI代理对部署者造成伤害的问题,通过实验验证了现有防御体系的不足,并引入SSDG框架提升检测效果。

Comments 15 pages. Companion manuscript on per-decision proof-obligation synthesis (LSVJ-S) in preparation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01455 2026-04-22 cs.CV cs.AI cs.CL cs.IR cs.MM 62%

From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents

从逐字到概要:基于语义信息瓶颈的金字塔多模态记忆压缩用于长视界视频智能体

Niu Lian, Yuting Wang, Hanshu Yao, Jinpeng Wang, Bin Chen, Yaowei Wang, Min Zhang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peng Cheng Laboratory(鹏城实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MM-Mem架构,通过金字塔多模态记忆压缩,结合语义信息瓶颈目标,实现长视界视频理解中的高效记忆组织与任务相关信息保留。

Comments Accepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18913 2026-04-22 cs.CL 57%

LogosKG: Hardware-Optimized Scalable and Interpretable Knowledge Graph Retrieval

LogosKG:硬件优化的可扩展且可解释的知识图谱检索

He Cheng, Yifu Wu, Saksham Khatwani, Maya Kruse, Dmitriy Dligach, Timothy A. Miller, Majid Afshar, Yanjun Gao

机构 * LARK Lab, University of Colorado Anschutz(洛克拉克实验室,科罗拉多大学安施图茨分校) University of Colorado Boulder(科罗拉多大学波德分校) Loyola University Chicago(芝加哥洛克拉克大学) Harvard Medical School(哈佛医学院) Boston Children’s Hospital(波士顿儿童医院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 LogosKG通过符号知识图谱和硬件高效操作实现大规模知识图谱的多跳检索,提升效率与可解释性,展示出在生物医学知识与大语言模型推理对齐分析中的应用价值。

Comments Accepted to the ACL 2026 Main Conference. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18616 2026-04-22 cs.DC cs.AI cs.PL 57%

ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants

ARGUS:通过数据流不变量指导的代理GPU优化

Haohui Mai, Xiaoyan Guo, Xiangyun Ding, Daifeng Li, Qiuchu Yu, Chenzhun Guo, Cong Wang, Jiacheng Zhao, Christos Kozyrakis, Binhang Yuan

机构 * CausalFlow Inc.(CausalFlow公司) HKUST(香港科技大学) Tsinghua University(清华大学) Stanford University(斯坦福大学) UCAS UC Riverside(UC河滨分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 ARGUS通过数据流不变量指导代理生成高效GPU内核,解决传统代理在关键计算任务中的性能不足问题,实现接近人工优化的性能和广泛的任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18590 2026-04-22 cs.HC cs.CY 50%

Critical Thinking in the Age of Artificial Intelligence: A Survey-Based Study with Machine Learning Insights

人工智能时代的关键思维:基于调查的综述与机器学习洞察

M Murshidul Bari, Akif Islam, Mohd Ruhul Ameen, Abu Saleh Musa Miah, Jungpil Shin

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文通过访谈和逻辑推理任务探讨人工智能使用行为与批判性思维表现的关系,发现用户对AI的依赖程度和耐心影响推理能力,表明AI影响因使用方式而异。

Comments 5 Figures, 2 Tables, Submitted to International Conference On Power, Electronics, Communications, Computing, and Intelligent Infrastructure 2026

详情

展开后加载摘要…

URL PDF HTML 收藏