arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-10 至 2026-03-10 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 12 篇

2603.04663 2026-03-10 cs.LG cs.AI cs.CE 84%

Neuro-Symbolic Financial Reasoning via Deterministic Fact Ledgers and Adversarial Low-Latency Hallucination Detector

通过确定性事实账本和对抗性低延迟幻觉检测器实现神经符号金融推理

Pedram Agand

机构 * FactAI Lab(FactAI实验室)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VeNRA,通过确定性事实账本和对抗性检测器实现零幻觉金融推理,结合确定性执行和高效检测机制,显著降低幻觉率并提升推理可靠性。

Comments 21 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06923 2026-03-10 cs.CL 79%

Reforming the Mechanism: Editing Reasoning Patterns in LLMs with Circuit Reshaping

机制改革:通过电路重塑编辑大语言模型的推理模式

Zhenyu Lei, Qiong Wu, Jianxiong Dong, Yinhan He, Emily Dodwell, Yushun Dong, Jundong Li

机构 * University of Virginia(弗吉尼亚大学) AT&T Chief Data Office(AT&T首席数据办公室) Florida State University(佛罗里达州立大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 REdit通过电路重塑技术改进大语言模型的推理能力,解决通用性与局部性的权衡问题,提升推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06617 2026-03-10 cs.LG cs.AI 73%

Evo: Autoregressive-Diffusion Large Language Models with Evolving Balance

Evo:具有进化平衡的自回归-扩散大语言模型

Junde Wu, Minhao Hu, Jiayuan Zhu, Yuyuan Liu, Tianyi Zhang, Kang Li, Jingkun Chen, Jiazhen Pan, Min Xu, Yueming Jin

机构 * University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Technical University of Munich(慕尼黑技术大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 Evo通过进化平衡机制,结合自回归和扩散模型,实现高效且高质量的语言生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07375 2026-03-10 eess.SY cs.SY 67%

Multi-Agentic AI for Conflict-Aware rApp Policy Orchestration in Open RAN

多智能体AI用于冲突感知的rApp策略编排在开放RAN中

Haiyuan Li, Yulei Wu, Dimitra Simeonidou

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 本文提出多智能体AI框架,用于实现开放RAN中冲突感知的rApp策略自动生成与编排,实验表明其在部署准确性和推理成本上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00296 2026-03-10 cs.RO cs.AI cs.CV cs.LG 62%

From Pixels to Predicates: Learning Symbolic World Models via Pretrained Vision-Language Models

从像素到谓词:通过预训练视觉-语言模型学习符号世界模型

Ashay Athalye, Nishanth Kumar, Tom Silver, Yichao Liang, Jiuguang Wang, Tomás Lozano-Pérez, Leslie Pack Kaelbling

机构 * MIT(麻省理工学院) Princeton University(普林斯顿大学) University of Cambridge(剑桥大学) RAI Institute(RAI研究院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 通过预训练视觉-语言模型学习符号世界模型,以实现复杂机器人领域中长周期决策制定的零样本泛化。

Comments A version of this paper appears in the official proceedings of RA-L, Volume 11, Issue 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00312 2026-03-10 cs.AI cs.LG 62%

How Well Do Multimodal Models Reason on ECG Signals?

多模态模型在心电图信号上的推理能力如何?

Maxwell A. Xu, Harish Haresamudram, Catherine W. Liu, Patrick Langer, Jathurshan Pradeepkumar, Wanting Mao, Sunita J. Ferns, Aradhana Verma, Jimeng Sun, Paul Schmiedmayer, Xin Liu, Daniel McDuff, Emily B. Fox, James M. Rehg

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Rush University(拉什大学) ETH Zurich(苏黎世联邦理工学院) St. Christopher's Hospital for Children(圣克里斯opher儿童医院) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Google Inc(谷歌公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种评估多模态模型在ECG信号上推理能力的框架,通过感知和演绎两个方面验证模型的逻辑和模式识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07329 2026-03-10 cs.AI cs.CL cs.CY 62%

The Third Ambition: Artificial Intelligence and the Science of Human Behavior

第三项雄心:人工智能与人类行为的科学

W. Russell Neuman, Chad Coleman

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大型语言模型作为研究人类行为、文化及道德推理的科学工具,探讨其在社会科学中的应用与方法论创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06590 2026-03-10 cs.CL cs.AI 62%

ARC-AGI-2 Technical Report

ARC-AGI-2技术报告

Wallyson Lemes de Oliveira, Mekhron Bobokhonov, Matteo Caorsi, Aldo Podestà, Gabriele Beltramo, Luca Crosato, Matteo Bonotto, Federica Cecchetto, Hadrien Espic, Dan Titus Salajan, Stefan Taga, Luca Pana, Joe Carthy

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于变压器的ARC求解系统,结合神经推理、结构感知先验和在线任务适应,通过多视角推理提升模型一般化能力,显著超越现有基线和神经求解器。

Comments 59 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10480 2026-03-10 cs.CL 57%

Neuro-Symbolic Synergy for Interactive World Modeling

神经符号协同用于交互世界建模

Hongyu Zhao, Siyu Zhou, Haolin Yang, Zengyi Qin, Tianyi Zhou

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 NeSyS通过结合LLMs的概率语义先验与可执行符号规则,实现交互世界建模的表达力与鲁棒性,提升预测准确性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01488 2026-03-10 cs.AI 57%

LLM-assisted Semantic Option Discovery for Facilitating Adaptive Deep Reinforcement Learning

基于大语言模型的语义选项发现用于促进自适应深度强化学习

Chang Yao, Jinghui Qin, Kebing Jin, Hankz Hankui Zhuo

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的闭环框架,通过语义驱动技能重用和实时约束监控,提升深度强化学习在数据效率、约束合规性和跨任务迁移能力方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08633 2026-03-10 eess.SY cs.SY 50%

Reachability-based Temporal Logic Verification for Reliable LLM-guided Human-Autonomy Teaming

基于可达性的时序逻辑验证用于可靠的大语言模型引导的人-自主系统协同

Joonwon Choi, Kartik Anand Pant, Karthik Nune, Inseok Hwang

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出基于可达性的时序逻辑验证框架,利用LLM将自然语言指令转换为STL规范,通过可行性过滤器确保任务规划的安全性和信息反馈的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18606 2026-03-10 cs.RO cs.CV 50%

OVerSeeC: Open-Vocabulary Costmap Generation from Satellite Images and Natural Language

OVerSeeC: 从卫星图像和自然语言生成开放词汇成本图

Rwik Rana, Jesse Quattrociocchi, Dongmyeong Lee, Christian Ellis, Amanda Adkins, Adam Uccello, Garrett Warnell, Joydeep Biswas

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 逻辑推理 :planning(abstract)

AI总结 OVerSeeC通过模块化基础模型实现从卫星图像和自然语言生成开放词汇成本图,支持任务自适应的全球规划。

Comments Website : https://amrl.cs.utexas.edu/overseec/

详情

展开后加载摘要…

URL PDF HTML 收藏