arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-15 至 2026-04-15 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 8 篇

2604.12214 2026-04-15 cs.SE 93%

Structural Anchors and Reasoning Fragility:Understanding CoT Robustness in LLM4Code

结构锚点与推理脆弱性:理解LLM4Code中的CoT鲁棒性

Yang Liu, Da Song, Armstrong Foundjem, Heng Li, Foutse Khomh

专题命中 逻辑推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文研究了CoT提示在LLM4Code中的鲁棒性,通过系统扰动分析发现其性能依赖于模型家族、任务结构和提示明确性,并识别出三种轨迹变形模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10026 2026-04-15 cs.CV 92%

LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA

LaV-CoT:具有多方面奖励优化的语言感知视觉CoT

Jing Huang, Zhiya Tan, Shutao Gong, Fanwei Zeng, Joey Tianyi Zhou, Changtao Miao, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) CFAR, Agency for Science, Technology and Research(科技研究局CFAR)

专题命中 逻辑推理 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)

AI总结 LaV-CoT通过多阶段推理流程和多方面奖励优化,提升多语言视觉问答的准确性和泛化能力,实现在公开数据集上的9.5%准确率提升。

Comments Accepted by WWW 2026 Industry Track - Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12184 2026-04-15 cs.AI 83%

TRUST Agents: A Collaborative Multi-Agent Framework for Fake News Detection, Explainable Verification, and Logic-Aware Claim Reasoning

TRUST代理:一种用于虚假新闻检测、可解释验证和逻辑感知声明推理的协作多智能体框架

Gautama Shastry Bulusu Venkata, Santhosh Kakarla, Maheedhar Omtri Mohan, Aishwarya Gaddam

机构 * George Mason University(乔治·马歇尔大学)

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 TRUST代理通过协作多智能体框架提升虚假新闻检测的可解释性和逻辑推理能力,引入分解器、陪审团和逻辑聚合器提升复杂声明的验证效果。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12426 2026-04-15 cs.LG cs.CL 82%

Do Transformers Use their Depth Adaptively? Evidence from a Relational Reasoning Task

Transformer 是否会根据深度进行自适应使用?来自关系推理任务的证据

Alicia Curth, Rachel Lawrence, Sushrut Karmalkar, Niranjani Prasad

机构 * Microsoft Research Cambridge(微软研究院剑桥分部)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.LG;logical reasoning(comments)

AI总结 本文通过控制多跳关系推理任务研究Transformer是否自适应使用深度,发现预训练模型在简单任务中使用较少层,而微调模型在更复杂的任务中更一致地自适应调整深度。

Comments Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21990 2026-04-15 cs.CE cs.AI 79%

ChemDFM-R: A Chemical Reasoning LLM Enhanced with Atomized Chemical Knowledge

ChemDFM-R: 一种增强原子化化学知识的化学推理大语言模型

Zihan Zhao, Ziping Wan, Lu Chen, Xuanze Lin, Shiyang Yu, Situo Zhang, Da Ma, Zichen Zhu, Danyang Zhang, Huayang Wang, Zhongyang Dai, Liyang Wen, Bo Chen, Xin Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室、计算机科学学院、上海交通大学、上海、中国) Suzhou Laboratory, Suzhou, China(苏州实验室、苏州、中国) Shanghai Innovation Institution, Shanghai, China(上海创新研究院、上海、中国) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室、苏州、中国) School of Chemistry and Chemical Engineering, Shanghai Jiao Tong University, Shanghai, China(化学与化工学院、上海交通大学、上海、中国)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ChemDFM-R,通过构建原子化化学知识库ChemFG并采用混合源蒸馏方法,提升模型对化学原理和反应逻辑的理解,实现优于通用和领域大模型的化学推理能力。

Comments 20 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12227 2026-04-15 cs.AI cs.CL 62%

Designing Reliable LLM-Assisted Rubric Scoring for Constructed Responses: Evidence from Physics Exams

设计可靠的LLM辅助评分系统用于构造响应:来自物理考试的证据

Xiuxiu Tang, G. Alex Ambrose, Ying Cheng

机构 * Department of Psychology, University of Notre Dame(诺特大学心理学系) Notre Dame Learning, University of Notre Dame(诺特大学学习中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了GPT-4o在物理考试构造响应评分中的可靠性,发现细粒度检查清单式评分优于整体评分,提示清晰的评分标准对AI辅助评分至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04850 2026-04-15 physics.chem-ph cs.AI cs.MA 57%

El Agente Quntur: A research collaborator agent for quantum chemistry

El Agente Quntur:一种用于量子化学研究的协作代理

Juan B. Pérez-Sánchez, Yunheng Zou, Jorge A. Campos-Gonzalez-Angulo, Marcel Müller, Ignacio Gustin, Andrew Wang, Han Hao, Tsz Wai Ko, Changhyeok Choi, Eric S. Isbrandt, Mohammad Ghazi Vakili, Hanyong Xu, Chris Crebolder, Varinia Bernales, Alán Aspuru-Guzik

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute) NVIDIA Institute of Medical Science(医学科学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出El Agente Quntur,一种多代理AI系统,旨在通过推理驱动决策和指导深度研究,提升量子化学计算工具的可访问性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06846 2026-04-15 cs.CR 50%

CKG-LLM: LLM-Assisted Detection of Smart Contract Access Control Vulnerabilities Based on Knowledge Graphs

CKG-LLM:基于知识图谱的智能合约访问控制漏洞检测框架

Xiaoqi Li, Hailu Kuang, Wenkai Li, Zongwei Li, Shipeng Ye

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出CKG-LLM框架,利用大语言模型能力将自然语言漏洞模式转化为知识图谱查询,提升智能合约访问控制漏洞检测性能。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏