arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-13 至 2026-03-13 共收录 85 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2603.01214 2026-03-13 cs.CL cs.LG 81%

Reasoning Boosts Opinion Alignment in LLMs

推理提升大语言模型中的观点一致性

Frédéric Berdoz, Yann Billeter, Yann Vonlanthen, Roger Wattenhofer

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过结构化推理提升大语言模型的观点一致性,验证了推理在改善观点建模中的有效性,但指出仍需进一步机制以减少偏见。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11193 2026-03-13 cs.CL 79%

DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning

DeReason: 一种考虑难度的课程改进了解耦的SFT-然后-RL训练以促进一般推理

Hanxu Hu, Yuxuan Wang, Maggie Huan, Jannis Vamvas, Yinya Huang, Zhijiang Guo, Rico Sennrich

机构 * University of Zurich(苏黎世大学) University of Pennsylvania(宾夕法尼亚大学) ETH Zurich(苏黎世联邦理工学院) HKUST (GZ)(香港科技大学(广州))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 DeReason通过基于难度的数据解耦策略,优化SFT与RL的训练分配,提升一般推理能力。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06214 2026-03-13 cs.CL cs.AI math-ph math.MP quant-ph 62%

Can Theoretical Physics Research Benefit from Language Agents?

理论物理研究能否从语言代理中受益?

Sirui Lu, Zhijing Jin, Terry Jingchen Zhang, Pavel Kos, J. Ignacio Cirac, Bernhard Schölkopf

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了语言代理在理论物理研究中的潜力,指出需专门训练和工具支持,以实现多模态数据处理、物理假设提出和理论验证的AI代理。

Comments 8+2 pages + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13903 2026-03-13 cs.CL cs.AI 62%

Let's Verify Math Questions Step by Step

逐步验证数学问题

Chengyu Shen, Zhen Hao Wong, Runming He, Hao Liang, Meiyi Qiang, Zimo Meng, Zhengyang Zhao, Bohan Zeng, Zhengzhou Zhu, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ValiMath是一个包含2147个经过人类验证的数学问题的基准测试集,MathQ-Verify是用于验证数学问题正确性的流程,能有效提升数学数据集的质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2512.17053 2026-03-13 cs.CL cs.AI cs.DB 86%

Knowledge Distillation with Structured Chain-of-Thought for Text-to-SQL

基于结构化思维链的知识蒸馏用于文本到SQL

Khushboo Thaker, Yony Bresler

专题命中 代码与定理证明 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Struct-SQL框架,通过结构化思维链知识蒸馏提升小型语言模型在文本到SQL任务中的性能,实现8.1%的准确率提升。

Comments Accepted at the 39th Canadian Conference on Artificial Intelligence (Canadian AI 2026). This is the extended version containing additional details and appendices omitted from the camera-ready proceedings due to space constraints

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 11 篇

2603.12133 2026-03-13 cs.AI cs.CL 88%

TopoBench: Benchmarking LLMs on Hard Topological Reasoning

TopoBench:在复杂拓扑推理上对LLM进行基准测试

Mayug Maniparambil, Nils Hoehing, Janak Kapuriya, Arjun Karuvally, Ellen Rushe, Anthony Ventresque, Noel O'Connor, Fergal Reid

机构 * Intercom Research(Intercom研究院) University College Dublin(都柏林大学) University of Galway(Galway大学) Salk Institute(Salk研究所) Dublin City University(都柏林城市大学) Trinity College Dublin(都柏林三一学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,comments);分类 cs.CL、cs.AI

AI总结 TopoBench通过测试LLM在复杂拓扑推理任务上的表现,揭示了模型在提取空间约束方面的瓶颈,并提出缓解策略。

Comments Accepted, Workshop on Logical Reasoning of Large Language Models at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01928 2026-03-13 cs.CV 80%

LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving

LaST-VLA: 在自动驾驶的视觉-语言-动作中思考于潜在的空间-时间空间

Yuechen Luo, Fang Li, Shaoqing Xu, Yang Ji, Zehan Zhang, Bing Wang, Yuannan Shen, Jianwei Cui, Long Chen, Guang Chen, Hangjun Ye, Zhi-Xin Yang, Fuxi Wen

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 LaST-VLA通过潜在空间-时间推理框架,结合双特征对齐机制和渐进式SFT训练策略,提升自动驾驶中的视觉-语言-动作处理能力,实现更安全的物理基础推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11093 2026-03-13 cs.AI cs.RO 79%

A Survey of Reasoning in Autonomous Driving Systems: Open Challenges and Emerging Paradigms

自动驾驶系统推理的综述:开放挑战与新兴范式

Kejin Yu, Yuhan Sun, Taiqiang Wu, Ruixu Zhang, Zhiqiang Lin, Yuxin Meng, Junjie Wang, Yujiu Yang

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文综述了自动驾驶系统推理的挑战与新兴范式,提出认知层次分解驾驶任务,并系统化七个核心推理挑战,强调发展可验证的神经符号架构以解决高延迟推理与安全需求的矛盾。

Comments Published in TMLR (March 2026) | OpenReview: https://openreview.net/forum?id=XwQ7dc4bqn

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18463 2026-03-13 cs.CV 78%

Decoupling Perception from Reasoning for Hallucination-Resistant Video Understanding

解耦感知与推理以实现抗幻觉的视频理解

Bowei Pu, Chuanbin Liu, Yifan Ge, Peicheng Zhou, Yiwei Sun, Zhiying Lu, Zhangchi Hu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出DPL模型,通过解耦感知与推理以提升视频理解的抗幻觉能力,引入感知奖励和FAE评估器,有效提高训练后性能和数据效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11798 2026-03-13 cs.AI 57%

DocSage: An Information Structuring Agent for Multi-Doc Multi-Entity Question Answering

DocSage:一个多文档多实体问答的信息结构代理

Teng Lin, Yizhang Zhu, Zhengxuan Zhang, Yuyu Luo, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 DocSage通过动态模式发现、结构化信息提取和模式感知推理,解决多文档多实体问答中的跨文档证据链构建和实体关系推断问题,实现超过27%的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03668 2026-03-13 cs.LO cs.AI 57%

Can LLM Aid in Solving Constraints with Inductive Definitions?

大语言模型能否帮助解决带有归纳定义的约束?

Weizhi Feng, Shidong Shen, Jiaxiang Liu, Taolue Chen, Fu Song, Zhilin Wu

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种神经符号方法,利用大语言模型生成辅助引理,提升求解涉及归纳定义的约束的能力,实验表明其在证明任务上的有效性。

Comments Accepted by the 27th Symposium on Formal Methods (FM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22824 2026-03-13 cs.CL 57%

Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning

Critique-Coder: 通过批判强化学习增强Coder模型

Chi Ruan, Dongfu Jiang, Yubo Wang, Wenhu Chen

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 Critique-Coder通过批判强化学习提升Coder模型性能,优于传统强化学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11622 2026-03-13 cs.DB 50%

Sema: A High-performance System for LLM-based Semantic Query Processing

Sema: 一种高性能的基于大语言模型的语义查询处理系统

Kangkang Qi, Dongyang Xie, Wenbo Li, Hao Zhang, Yuanyuan Zhu, Jeffrey Xu Yu, Kangfei Zhao

专题命中 逻辑推理 :reasoning(abstract)

AI总结 Sema 是一种基于 DuckDB 构建的高性能语义查询引擎,通过 SemaSQL 实现自然语言表达与 SQL 的无缝集成,提升语义查询的性能和结果质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11605 2026-03-13 cs.CV 50%

LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference

LaMoGen:通过LLM引导的符号推理实现语言到动作生成

Junkun Jiang, Ho Yin Au, Jingyu Xiang, Jie Chen

机构 * Department of Computer Science, Hong Kong Baptist University, HKSAR(香港 Baptist 大学计算机科学系)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 LaMoGen通过LLM引导的符号推理实现语言到动作的生成,利用LabanLite动作表示提升动作的可解释性和可控性。

Comments Accepted by CVPR 2026. Supplementary material included. Project page: https://jjkislele.github.io/LaMoGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11489 2026-03-13 cs.PL cs.AR 50%

AutoVeriFix+: High-Correctness RTL Generation via Trace-Aware Causal Fix and Semantic Redundancy Pruning

AutoVeriFix+: 通过轨迹感知因果修复和语义冗余剪枝实现高正确性的RTL生成

Yan Tan, Xiangchen Meng, Zijun Jiang, Yangdi Lyu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 AutoVeriFix+通过轨迹感知因果修复和语义冗余剪枝,提升Verilog代码生成的功能正确性与设计效率。

Comments arXiv admin note: text overlap with arXiv:2509.08416

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06315 2026-03-13 cs.CV 50%

PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models

PuzLM:利用序列到序列语言模型解决拼图问题

Gur Elkin, Ofir Itzhak Shahar, Ohad Ben-Shahar

机构 * Ben-Gurion University of the Negev(贝内-加里翁内盖夫大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 PuzLM通过将拼图重组视为序列到序列问题,利用离散符号推理实现高效拼图求解,提升了复杂拼图的重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 18 篇

2603.11351 2026-03-13 cs.RO cs.AI 83%

Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning

通过混合大语言模型(LLM)符号规划和LLM引导的强化学习实现新颖性适应

Hong Lu, Pierrick Lorang, Timothy R. Duggan, Jivko Sinapov, Matthias Scheutz

机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) Austrian Institute of Technology GmbH(奥地利技术研究所)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出一种融合大语言模型、符号规划和强化学习的神经符号架构,用于在动态开放环境中处理新颖物体,通过LLM识别缺失操作符并生成计划,提升机器人在连续领域中的操作符学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11563 2026-03-13 cs.CV cs.RO 82%

SVLL: Staged Vision-Language Learning for Physically Grounded Embodied Task Planning

SVLL:分阶段视觉-语言学习用于物理基础的具身任务规划

Yuyuan Yang, Junkun Hong, Hongrong Wang, Honghao Cai, Xunpeng Ren, Ge Wang, Mingcong Lei, Shenhao Yan, Jiahao Yang, Chengsi Yao, Xi Li, Yiming Zhao, Yatong Han, Jinke Ren

机构 * FNii-Shenzhen, CUHKSZ(FNii深圳,CUHKSZ) SSE, CUHKSZ(SSE,CUHKSZ) SAI, CUHKSZ(SAI,CUHKSZ) Shenzhen University(深圳大学) University of Sydney(悉尼大学) Harbin Engineering University(哈尔滨工程大学) Ising AI

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 SVLL 通过分阶段学习和 Bias-DPO 对齐目标,实现稳健的物理基础具身任务规划,提升任务成功率并减少物理约束违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11219 2026-03-13 cs.CV 82%

Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making and Planning

Senna-2:对齐视觉语言模型与端到端驾驶策略以实现一致的决策与规划

Yuehao Song, Shaoyu Chen, Hao Gao, Yifan Zhu, Weixiang Yue, Jialv Zou, Bo Jiang, Zihao Lu, Yu Wang, Qian Zhang, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 Senna-2通过三阶段训练范式对齐视觉语言模型与端到端驾驶策略,提升决策与规划的一致性,增强驾驶安全性和效率。

Comments 15 pages, 8 figures. Project page: https://ambitious-idiot.github.io/senna2-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11781 2026-03-13 cs.AI cs.CL cs.MA 81%

From Debate to Deliberation: Structured Collective Reasoning with Typed Epistemic Acts

从辩论到 deliberation:基于类型化认知行为的结构化集体推理

Sunil Prakash

机构 * Indian School of Business(印度管理学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DCI框架,通过结构化集体推理提升复杂任务决策质量,但指出其成本较高,需在过程问责性与效率间权衡。

Comments 26 pages, 6 tables, 2 figures, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22018 2026-03-13 cs.CV cs.AI 80%

MedEyes: Learning Dynamic Visual Focus for Medical Progressive Diagnosis

MedEyes: 学习动态视觉聚焦以进行医学逐步诊断

Chunzheng Zhu, Yangfang Lin, Shen Chen, Yijun Wang, Jianxin Lin

专题命中 规划推理 :reasoning(abstract,comments);chain-of-thought(abstract,comments);CoT(abstract,comments);分类 cs.AI

AI总结 MedEyes通过动态视觉聚焦和双模式探索策略,提升医学逐步诊断的准确性与临床相关性。

Comments AAAI 2026, Medical Chain-of-Thought (CoT), Reinforcement Learning with Verifiable Rewards (RLVR), Multimodal Grounded Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04329 2026-03-13 cs.RO 78%

Safe and Stylized Trajectory Planning for Autonomous Driving via Diffusion Model

通过扩散模型实现自动驾驶的安全且风格化的轨迹规划

Shuo Pei, Yong Wang, Yuanchen Zhu, Chen Sun, Qin Li, Yanan Zhao, Huachun Tan

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出SDD Planner,通过结合多源风格感知编码器和风格引导动态轨迹生成器,实现自动驾驶中安全与风格化轨迹规划的平衡,实验表明其在多个基准测试中表现优异。

Comments 12 pages, 7 figures, submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11392 2026-03-13 cs.NI cs.AI 70%

Agentic AI for Embodied-enhanced Beam Prediction in Low-Altitude Economy Networks

面向低空经济网络的具身增强型波束预测的代理AI

Min Hao, Zhizhuo Li, Zirui Zhang, Maoqiang Wu, Han Zhang, Rong Yu

机构 * School of Electronic Science and Engineering, South China Normal University(南方科技大学电子科学与工程学院) School of Intelligent Engineering, Shaoguan university(韶关大学智能工程学院) School of Automation, Guangdong University of Technology(广东工业大学自动化学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于多代理协作推理的混合波束预测模型,通过整合时序建模、视觉编码和多模态融合,提升低空经济网络中UAV通信的波束预测精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09151 2026-03-13 cs.AI 70%

Deep Tabular Research via Continual Experience-Driven Execution

通过持续经验驱动执行进行深度表格研究

Junnan Dong, Chuang Zhou, Zheng Yuan, Yifei Yu, Qiufeng Wang, Yinghui Li, Siyu An, Di Yin, Xing Sun, Feiyue Huang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出深度表格研究(DTR)框架,通过闭环决策过程解决复杂表格分析问题,利用分层元图和期望感知策略实现持续优化,验证了战略规划与低层执行分离的重要性。

Comments 23 pages, 6 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20299 2026-03-13 cs.RO cs.AI cs.CV 70%

KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System

KnowVal: 一种知识增强且价值引导的自动驾驶系统

Zhongyu Xia, Wenhao Chen, Yongtao Wang, Ming-Hsuan Yang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) University of California, Merced(加州大学默塞德分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 KnowVal通过整合开放世界感知与知识检索,构建驾驶知识图谱并训练价值模型,实现价值对齐的自动驾驶系统,提升了规划性能并降低了碰撞率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12091 2026-03-13 cs.LG cs.AI 62%

Resource-Efficient Iterative LLM-Based NAS with Feedback Memory

高效迭代基于大语言模型的神经架构搜索与反馈记忆

Xiaojie Gu, Dmitry Ignatov, Radu Timofte

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于大语言模型的高效迭代神经架构搜索方法,通过反馈记忆机制和双LLM专业化,在单块消费级GPU上实现高效模型搜索,提升图像分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05514 2026-03-13 cs.HC cs.AI 57%

From Toil to Thought: Designing for Strategic Exploration and Responsible AI in Systematic Literature Reviews

从劳作到思考:在系统文献综述中设计战略探索和负责任的AI

Runlong Ye, Naaz Sibia, Angela Zavaleta Bernuy, Tingting Zhu, Carolina Nobre, Viktoria Pammer-Schindler, Michael Liut

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ARC系统,通过多数据库整合、透明搜索和可验证AI辅助筛选,帮助学者从管理行政负担转向战略探索,提升知识综合的透明度和可验证性。

Comments Accepted at IUI 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11068 2026-03-13 cond-mat.mtrl-sci cs.AI 57%

From Phase Prediction to Phase Design: A ReAct Agent Framework for High-Entropy Alloy Discovery

从相预测到相设计:一种用于高熵合金发现的ReAct代理框架

Iman Peivaste, Salim Belouettar

机构 * Luxembourg Institute of Science and Technology (LIST)(卢森堡科学与技术研究院) Department of Physics and Materials Science, University of Luxembourg(卢森堡大学物理与材料科学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ReAct代理框架,通过推理与行动实现高熵合金设计,显著提升相发现效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12254 2026-03-13 cs.AI cs.IR 57%

Mobile-Agent-RAG: Driving Smart Multi-Agent Coordination with Contextual Knowledge Empowerment for Long-Horizon Mobile Automation

移动代理-RAG:通过上下文知识增强驱动智能多代理协调以实现长周期移动自动化

Yuxiang Zhou, Jichang Li, Yanhao Zhang, Haonan Lu, Guanbin Li

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出Mobile-Agent-RAG框架,通过双层检索增强实现智能多代理协调,提升长周期移动自动化任务的完成率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20681 2026-03-13 cs.RO cs.AI cs.CV 57%

Efficient Construction of Implicit Surface Models From a Single Image for Motion Generation

从单张图像高效构建隐式表面模型用于运动生成

Wei-Teng Chu, Tianyi Zhang, Matthew Johnson-Roberson, Weiming Zhi

机构 * Department of Electrical Engineering, Stanford University, USA(美国斯坦福大学电气工程系) Aurora Innovation, USA(美国Aurora Innovation公司) School of Computer Science, The University of Sydney, Australia(澳大利亚悉尼大学计算机科学学院) Australian Centre for Robotics, The University of Sydney, Australia(澳大利亚悉尼大学机器人中心) College of Connected Computing, Vanderbilt University, USA(美国范德比尔特大学连接计算学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出FINS框架,通过单张图像高效重建高保真表面和SDF场,提升机器人运动生成的效率和精度。

Comments 9 pages, 6 figures, 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏