arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-23 至 2026-03-23 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 12 篇

2603.19639 2026-03-23 cs.AI 79%

HyEvo: Self-Evolving Hybrid Agentic Workflows for Efficient Reasoning

HyEvo:自演化混合代理工作流用于高效推理

Beibei Xu, Yutong Ye, Chuyun Shen, Yingbo Zhou, Cheng Chen, Mingsong Chen

机构 * East China Normal University(华东师范大学) Beihang University(北京航空航天大学) Shanghai University of International Business and Economics(上海对外经贸大学) Fudan University(复旦大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 HyEvo通过混合原子合成方法,结合概率LLM节点和确定性代码节点,提升推理效率,减少计算成本和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12781 2026-03-23 cs.AI cs.CV 79%

VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension

VIRO:用于指代表达理解的鲁棒且高效的神经符号推理与验证

Hyejin Park, Junhyuk Kwon, Suha Kwak, Jungseul Ok

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学(POSTECH))

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 VIRO通过在推理步骤中嵌入轻量级操作符验证器,提升指代表达理解的鲁棒性和效率,达到61.1%的平衡准确率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19276 2026-03-23 cs.CL cs.AI 73%

From Flat to Structural: Enhancing Automated Short Answer Grading with GraphRAG

从平面到结构:利用GraphRAG增强自动简答评分

Yucheng Chu, Haoyu Han, Shen Dong, Hang Li, Kaiqi Yang, Yasemin Copur-Gencturk, Joseph Krajcik, Namsoo Shin, Hui Liu

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GraphRAG框架,通过构建结构化知识图谱解决传统RAG在复杂教育内容中的不足,实验表明其在评估科学与工程实践方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19687 2026-03-23 cs.LO cs.LG 70%

Diminishing Returns in Expanding Generative Models and Godel-Tarski-Lob Limits

扩展生成模型中的边际收益递减与哥德尔-塔斯基-洛布限制

Angshul Majumdar

机构 * Indraprastha Institute of Information Technology(印度理工信息科技学院)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.LG

AI总结 本文提出一个任务空间框架,分析扩展生成系统的能力增长,证明随着系统容量增加,任务覆盖的边际改进趋于零,并结合逻辑理论揭示内在推理的根本限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19987 2026-03-23 cs.LG cs.AI cs.CL 67%

Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States

突破大语言模型微调的性能上限:重新引入马尔可夫状态

Yurun Yuan, Tengyang Xie

机构 * UW-Madison(威斯康星大学麦迪逊分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过引入马尔可夫状态突破大语言模型微调的性能上限,理论和实验均表明该方法能显著降低样本复杂度并提升复杂逻辑谜题的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19266 2026-03-23 cs.CL cs.AI cs.LG 67%

Probing to Refine: Reinforcement Distillation of LLMs via Explanatory Inversion

探测以精炼:通过解释性反向实现大语言模型的强化蒸馏

Zhen Tan, Chengshuai Zhao, Song Wang, Jundong Li, Tianlong Chen, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) University of Virginia(弗吉尼亚大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ExGRPO框架,通过生成解释性探测和强化学习提升蒸馏模型的推理能力和泛化能力,实验显示在12个数据集上显著提升性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20185 2026-03-23 cs.CV cs.AI cs.CL 62%

VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking

VideoSeek: 长时程视频代理与工具引导的搜索

Jingyang Lin, Jialian Wu, Jiang Liu, Ximeng Sun, Ze Wang, Xiaodong Yu, Jiebo Luo, Zicheng Liu, Emad Barsoum

机构 * AMD(AMD公司) University of Rochester(罗切斯特大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 VideoSeek通过视频逻辑流程主动寻找关键证据,减少帧数使用,提升视频理解能力,实验显示其在视频理解和推理任务中表现优异。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20017 2026-03-23 cs.CL cs.DB cs.IR 57%

RouterKGQA: Specialized--General Model Routing for Constraint-Aware Knowledge Graph Question Answering

RouterKGQA: 专用-通用模型路由用于约束感知的知识图谱问答

Bo Yuan, Hexuan Deng, Xuebo Liu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 RouterKGQA提出专用-通用模型协作框架,通过专用模型生成推理路径,通用模型在必要时进行知识图谱引导修复,提升性能并降低成本,实验显示在多个基准上F1和Hits@1均优于现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19584 2026-03-23 cs.AI cs.SY eess.SY 57%

PowerLens: Taming LLM Agents for Safe and Personalized Mobile Power Management

PowerLens:利用大语言模型安全且个性化地管理移动设备电源

Xingyu Feng, Chang Sun, Yuzhu Wang, Zhangbing Zhou, Chengwen Luo, Zhuangzhuang Chen, Xiaomin Ouyang, Huanqi Yang

机构 * China University of Geosciences (Beijing)(中国地质大学(北京)) Shenzhen University(深圳大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 PowerLens通过利用大语言模型的常识推理,实现安全且个性化的移动电源管理。系统通过用户活动与系统参数之间的语义桥梁,生成适应个人偏好的零样本策略,通过隐式反馈学习用户偏好,无需显式配置,3-5天内收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19267 2026-03-23 cs.CL cs.IR 57%

Reviewing the Reviewer: Graph-Enhanced LLMs for E-commerce Appeal Adjudication

审查审查者:图增强的大语言模型用于电商争议裁决

Yuchen Du, Ashley Li, Zixi Huang

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出图增强的大语言模型,通过显式动作建模和冲突建模解决电商争议裁决中的信息不对称问题,提升裁决一致性。

Comments 10 pages, 3 figures, KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19909 2026-03-23 cs.IR 50%

DALI: LLM-Agent Enhanced Dual-Stream Adaptive Leadership Identification for Group Recommendations

DALI:LLM-Agent增强的双流自适应领导力识别用于群体推荐

Boxun Song, Min Gao, Jiawei Cheng

专题命中 逻辑推理 :reasoning(abstract)

AI总结 DALI通过结合大语言模型的符号推理能力与神经网络表示学习,解决群体推荐中区分领导主导与协作群体的问题,提升推荐准确性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19239 2026-03-23 cs.PL cs.SE 50%

Defusing Logic Bombs in Symbolic Execution with LLM-Generated Ghost Code

用LLM生成的鬼代码解构符号执行中的逻辑炸弹

Dimitrios Stamatios Bouras, Sergey Mechtaev

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出Gordian框架,通过LLM生成轻量级鬼代码辅助SMT求解器处理对抗性代码,提升覆盖率和效率,减少LLM使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏