arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-12 至 2026-03-12 共收录 85 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 9 篇

2603.10588 2026-03-12 cs.AI cs.CL cs.LG 85%

Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning

LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究

Zhaowei Zhang, Xiaohan Liu, Xuekai Zhu, Junchao Huang, Ceyao Zhang, Zhiyuan Feng, Yaodong Yang, Xiaoyuan Yi, Xing Xie

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Microsoft Research(微软研究院) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) CUHKSZ(香港中文大学(深圳)) THU(清华大学)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00997 2026-03-12 cs.AI 79%

IndiMathBench: Autoformalizing Mathematical Reasoning Problems with a Human Touch

IndiMathBench: 用人类触感实现数学推理问题的自动形式化

Param Biyani, Shashank Kirtania, Yasharth Bajpai, Sumit Gulwani, Ashish Tiwari

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 IndiMathBench通过人机协作管道形式化数学问题,提供具有挑战性的数学推理测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08391 2026-03-12 cs.CL 77%

Adaptive Loops and Memory in Transformers: Think Harder or Know More?

变换器中的自适应循环与记忆:更努力思考还是更了解更多?

Markus Frey, Behzad Shomali, Ali Hamza Bashir, David Berghaus, Joachim Koehler, Mehdi Ali

机构 * Lamarr Institute(拉马尔研究所) Fraunhofer IAIS(弗劳恩霍夫 IAIS 研究所) University of Bonn(波恩大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本研究提出结合自适应循环和门控记忆的变换器模型,提升数学推理和常识任务性能。

Comments Published at Latent & Implicit Thinking Workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10624 2026-03-12 cs.LG cs.AI cs.CL 75%

Reinforcement Learning with Conditional Expectation Reward

基于条件期望奖励的强化学习

Changyi Xiao, Caijun Xu, Yixin Cao

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于大语言模型自身作为隐式验证器的条件期望奖励方法,用于提升一般领域推理任务的准确性与适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10357 2026-03-12 cs.NI cs.AI 70%

Utility Function is All You Need: LLM-based Congestion Control

效用函数就是一切:基于LLM的拥塞控制

Neta Rozen-Schiff, Liron Schiff, Stefan Schmid

专题命中 数学推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出GenCC框架,利用LLM生成代码能力设计拥塞控制效用函数,实验表明其在不同场景下可提升拥塞控制协议性能37%-142%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10055 2026-03-12 cs.LG cs.AI cs.CL 67%

Training Language Models via Neural Cellular Automata

通过神经细胞自动机训练语言模型

Dan Lee, Seungwook Han, Akarsh Kumar, Pulkit Agrawal

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过神经细胞自动机生成合成非语言数据,提升语言模型的预训练效果和推理能力。

Comments Website: https://hanseungwook.github.io/blog/nca-pre-pre-training/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01815 2026-03-12 cs.CL cs.AI cs.LG 67%

KV Cache Transform Coding for Compact Storage in LLM Inference

KV缓存变换编码用于LLM推理中的紧凑存储

Konrad Staniszewski, Adrian Łańcucki

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KVTC通过变换编码实现LLM推理中的高效缓存压缩,保持推理和长上下文准确性,压缩率可达20倍或更高。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18011 2026-03-12 cs.CL cs.AI 62%

Training with Pseudo-Code for Instruction Following

通过伪代码训练指令跟随

Prince Kumar, Rudra Murthy, Riyaz Bhat, Danish Contractor

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过伪代码训练提升LLM指令跟随能力,实现8-21%的提升并在数学和常识推理中取得平均30%的提升。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12566 2026-03-12 cs.AI 57%

To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models

混合还是合并:为大语言模型的多领域强化学习而努力

Haoqing Wang, Xiang Long, Ziheng Li, Yilong Xu, Tingguang Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出M2RL框架,通过混合多任务训练或模型合并策略,提升大语言模型在多领域任务中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2504.07997 2026-03-12 cs.CL 79%

BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models

BiasCause: 评估大型语言模型的社会偏见因果推理

Tian Xie, Tongxin Yin, Vaishakh Keshava, Xueru Zhang, Siddhartha Reddy Jonnalagadda

机构 * Google(谷歌) The Ohio State University(俄亥俄州立大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出BiasCause框架,评估LLMs在回答社会偏见问题时的因果推理,揭示其偏见产生机制及去偏策略。

Comments This work has been done when the first author is at Google. The first author is a student at the Ohio State University

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 3 篇

2603.10891 2026-03-12 cs.AI cs.IR 72%

A Hybrid Knowledge-Grounded Framework for Safety and Traceability in Prescription Verification

一种混合知识引导的框架用于处方验证中的安全性和可追溯性

Yichi Zhu, Kan Ling, Xu Liu, Hengrun Zhang, Huiqun Yu, Guisheng Fan

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 逻辑推理 :reasoning(abstract,comments);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出PharmGraph-Auditor框架,通过混合制药知识库和知识引导的验证链,提升处方验证的安全性和可追溯性。

Comments 11 pages, 7 figures.Framework for safe prescription auditing and hybrid knowledge-grounded reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17066 2026-03-12 cs.AI cs.CL cs.CV cs.LG cs.MA 67%

Mindstorms in Natural Language-Based Societies of Mind

自然语言基础的思维社会中的风暴

Mingchen Zhuge, Haozhe Liu, Francesco Faccio, Dylan R. Ashley, Róbert Csordás, Anand Gopalakrishnan, Abdullah Hamdi, Hasan Abed Al Kader Hammoud, Vincent Herrmann, Kazuki Irie, Louis Kirsch, Bing Li, Guohao Li, Shuming Liu, Jinjie Mai, Piotr Piękos, Aditya Ramesh, Imanol Schlag, Weimin Shi, Aleksandar Stanić, Wenyi Wang, Yuhui Wang, Mengmeng Xu, Deng-Ping Fan, Bernard Ghanem, Jürgen Schmidhuber

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了基于自然语言的思维社会(NLSOMs)的结构和应用,通过多代理系统解决多种AI任务,并提出未来研究方向。

Comments published in Computational Visual Media Journal (CVMJ); 9 pages in main text + 7 pages of references + 38 pages of appendices, 14 figures in main text + 13 in appendices, 7 tables in appendices

Journal ref (2025). Computational Visual Media, 11(1), 29-81

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10978 2026-03-12 cs.CV cs.AI 57%

GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations

GroundCount: 通过目标检测对视觉语言模型进行接地以缓解计数幻觉

Boyuan Chen, Minghao Shao, Siddharth Garg, Ramesh Karri, Muhammad Shafique

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 GroundCount通过目标检测提供空间接地,缓解视觉语言模型计数幻觉,提升准确率并减少推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 17 篇

2603.01607 2026-03-12 cs.AI cs.LG 84%

CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework

CARE:迈向多模态医学推理中的临床问责的证据基础代理框架

Yuexi Du, Jinglu Wang, Shujie Liu, Nicha C. Dvornek, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) Department of Biomedical Engineering, Yale University(耶鲁大学生物医学工程系) Department of Radiology & Biomedical Imaging, Yale University(耶鲁大学放射学与生物医学成像系)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 CARE通过证据基础的代理框架提升多模态医学推理的准确性与问责性,结合解耦的专业模型和明确证据,实现更可靠的医学AI。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09987 2026-03-12 cs.CL cs.AI cs.LG 82%

Evolving Demonstration Optimization for Chain-of-Thought Feature Transformation

链式推理特征转换的进化演示优化

Xinyuan Wang, Kunpeng Liu, Arun Vignesh Malarkkan, Yanjie Fu

专题命中 规划推理 :chain-of-thought(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种通过进化轨迹经验优化LLM驱动的特征转换方法,提升转换多样性与下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08253 2026-03-12 cs.RO 82%

Open-World Task and Motion Planning via Vision-Language Model Generated Constraints

开放世界任务与运动规划 via 视觉-语言模型生成的约束

Nishanth Kumar, William Shen, Fabio Ramos, Dieter Fox, Tomás Lozano-Pérez, Leslie Pack Kaelbling, Caelan Reed Garrett

机构 * NVIDIA Research(NVIDIA研究) MIT CSAIL

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出OWL-TAMP方法,通过整合视觉-语言模型生成的约束,提升开放世界任务与运动规划的性能,实现对自然语言目标的处理能力。

Comments A version of this paper appears in IEEE Robotics and Automation Letters (RA-L) Volume 11, Issue 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10800 2026-03-12 cs.LG cs.AI cs.SY eess.SY 81%

AI-Enhanced Spatial Cellular Traffic Demand Prediction with Contextual Clustering and Error Correction for 5G/6G Planning

基于上下文聚类和误差校正的AI增强型空间蜂窝交通需求预测用于5G/6G规划

Mohamad Alkadamani, Colin Brown, Halim Yanikomeroglu

机构 * Innovation, Science and Economic Development Canada (ISED) and Carleton University(创新、科学与经济发展的加拿大(ISED)和卡尔顿大学) Communications Research Centre (CRC)(通讯研究中心(CRC)) Carleton University(卡尔顿大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于上下文聚类和误差校正的AI框架,用于提高5G/6G规划中空间蜂窝交通需求预测的准确性与可靠性。

Comments 5 pages, 8 figures. Submitted to IEEE Wireless Communications Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10332 2026-03-12 cs.IR cs.AI 79%

Does Reasoning Make Search More Fair? Comparing Fairness in Reasoning and Non-Reasoning Rerankers

推理是否使搜索更公平?比较推理与非推理重排序器的公平性

Saron Samuel, Benjamin Van Durme, Eugene Yang

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(语言技术卓越中心)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究比较了推理与非推理重排序器的公平性,发现推理模型对公平性无显著影响,需进一步优化以提升公平性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07527 2026-03-12 cs.AI cs.LG 73%

Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions

学习强化学习无法做到的:用于最难问题的交错在线微调

Lu Ma, Hao Liang, Meiyi Qiang, Lexiang Tang, Xiaochen Ma, Zhen Hao Wong, Junbo Niu, Chengyu Shen, Runming He, Yanhao Li, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京软件与硬件协同人工智能系统重点实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 ReLIFT通过结合强化学习和在线微调,提升模型在复杂问题上的推理能力,实现超过5.2分的性能提升。

Comments 12 pages, 5 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00819 2026-03-12 cs.LG cs.AI cs.CL 67%

Large Language Models for Travel Behavior Prediction

基于大语言模型的出行行为预测

Baichuan Mo, Hanyong Xu, Ruoyun Ma, Jung-Hoon Cho, Dingyi Zhuang, Xiaotong Guo, Jinhua Zhao

机构 * Department of Civil Engineering, Tsinghua University, Beijing, China(清华大学土木工程系) Department of Civil and Environmental Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139(麻省理工学院土木与环境工程系) Department of Urban Studies and Planning, Massachusetts Institute of Technology, Cambridge, MA 20139(麻省理工学院城市研究与规划系) Department of Management Science and Engineering, Stanford University, Stanford, CA 94305(斯坦福大学管理科学与工程系)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用大语言模型进行出行行为预测,通过零样本提示和文本嵌入两种方法,实现了与传统模型相当的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05503 2026-03-12 cs.LG cs.AI 62%

Over-Searching in Search-Augmented Large Language Models

搜索增强型大语言模型中的过度搜索

Roy Xie, Deepak Gopinath, David Qiu, Dong Lin, Haitian Sun, Saloni Potdar, Bhuwan Dhingra

机构 * Apple(苹果公司) Duke University(杜克大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了搜索增强型大语言模型中的过度搜索问题,提出TPC指标量化其性能与成本的权衡,并探讨了缓解方法。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10180 2026-03-12 cs.LG 57%

DT-BEHRT: Disease Trajectory-aware Transformer for Interpretable Patient Representation Learning

DT-BEHRT:面向疾病轨迹的Transformer用于可解释的患者表示学习

Deyi Li, Zijun Yao, Qi Xu, Muxuan Liang, Lingyao Li, Zijian Xu, Mei Liu

机构 * University of Florida(佛罗里达大学) University of Kansas(堪萨斯大学) MD Anderson Cancer Center(MD安德森癌症中心) University of South Florida(佛罗里达州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 DT-BEHRT通过建模疾病轨迹和异步进展模式,提升EHR中患者表示的可解释性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10747 2026-03-12 cs.DB 50%

Pneuma-Seeker: A Relational Reification Mechanism to Align AI Agents with Human Work over Relational Data

Pneuma-Seeker: 一种关系重构机制,用于将AI代理与关系数据上的人类工作对齐

Muhammad Imam Luthfi Balaka, John Hillesland, Kemal Badur, Raul Castro Fernandez

专题命中 规划推理 :planning(abstract)

AI总结 Pneuma-Seeker通过关系重构机制,将AI代理与人类工作对齐,提升数据处理的准确性和可信赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10616 2026-03-12 cs.RO 50%

AdaClearGrasp: Learning Adaptive Clearing for Zero-Shot Robust Dexterous Grasping in Densely Cluttered Environments

AdaClearGrasp: 学习自适应清除以实现零样本鲁棒灵巧抓取在密集障碍环境中

Zixuan Chen, Wenquan Zhang, Jing Fang, Ruiming Zeng, Zhixuan Xu, Yiwen Hou, Xinke Wang, Jieqi Shi, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学) Nanjing University of Posts and Telecommunications(南京邮电大学) National University of Singapore(新加坡国立大学)

专题命中 规划推理 :planning(abstract)

AI总结 AdaClearGrasp通过自适应清除与零样本灵巧抓取技术,提升机器人在密集障碍环境中的抓取成功率。

Comments 12 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10268 2026-03-12 cs.SE 50%

SpecOps: A Fully Automated AI Agent Testing Framework in Real-World GUI Environments

SpecOps:一种在真实GUI环境中完全自动化的AI代理测试框架

Syed Yusuf Ahmed, Shiwei Feng, Chanwoo Bae, Calix Barrus Xiangyu Zhang

专题命中 规划推理 :planning(abstract)

AI总结 SpecOps是一种全新的自动化AI代理测试框架,通过专门设计的LLM代理处理四个阶段,实现对真实GUI环境中复杂代理的高效测试与验证。

Comments Accepted to ICSE 2026

Journal ref Proceedings of the IEEE/ACM International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09141 2026-03-12 cs.CV 50%

Agentic AI as a Network Control-Plane Intelligence Layer for Federated Learning over 6G

代理AI作为6G联邦学习的网络控制平面智能层

Loc X. Nguyen, Ji Su Yoon, Huy Q. Le, Yu Qiao, Avi Deb Raha, Eui-Nam Huh, Nguyen H. Tran, Zhu Han, Choong Seon Hong

机构 * Department of Computer Science and Engineering, Kyung Hee University(韩国庆熙大学计算机科学与工程系) Department of Artificial Intelligence, Kyung Hee University(韩国庆熙大学人工智能系) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Electrical and Computer Engineering Department, University of Houston(德克萨斯大学休斯顿分校电子与计算机工程系)

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出一种基于代理AI的网络控制平面智能层,用于6G网络中的联邦学习,通过整合学习与网络管理任务,提升系统在多样化数据训练和严格约束下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09394 2026-03-12 cs.HC 50%

EyeAgent: An Agentic AI System for Multimodal Clinical Decision Support in Ophthalmology

EyeAgent:一种用于眼科多模态临床决策支持的智能AI系统

Danli Shi, Xiaolan Chen, Bingjie Yan, Weiyi Zhang, Pusheng Xu, Jiancheng Yang, Ruoyu Chen, Siyu Huang, Bowen Liu, Xinyuan Wu, Meng Xie, Ziyu Gao, Yue Wu, Senlin Lin, Kai Jin, Xia Gong, Yih Chung Tham, Xiujuan Zhang, Li Dong, Yuzhou Zhang, Jason Yam, Guangming Jin, Xiaohu Ding, Haidong Zou, Yalin Zheng, Zongyuan Ge, Mingguang He

专题命中 规划推理 :reasoning(abstract)

AI总结 EyeAgent通过整合53种眼科工具提升诊断准确率,实现多模态临床决策支持,为眼科AI系统提供新范式。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06934 2026-03-12 cs.GT cs.MA stat.ME stat.OT 50%

Sequential Causal Normal Form Games: Theory, Computation, and Strategic Signaling

顺序因果正常形式游戏:理论、计算与战略信号

Dennis Thumm

专题命中 规划推理 :reasoning(abstract)

AI总结 本文探讨了经典博弈论框架能否扩展以捕捉AI代理的有限理性与因果推理,通过引入顺序因果多智能体系统(S-CMAS),发现其在所有测试场景中无法提供福利改进,揭示了理性选择与因果推理的不兼容性。

Comments AAAI 2026 Workshop on Foundations of Agentic Systems Theory

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00456 2026-03-12 cs.CY cs.HC 50%

Shiksha Copilot: Teacher-AI Collaboration for Curating and Customizing Lesson Plans in Low-Resource Schools

Shiksha Copilot:教师与AI协作在低资源学校中编纂和定制课程计划

Deepak Varuvel Dennison, Bakhtawar Ahtisham, Kavyansh Chourasia, Nirmit Arora, Rahul Singh, Rene F. Kizilcec, Akshay Nambi, Tanuja Ganu, Aditya Vashistha

专题命中 规划推理 :planning(abstract)

AI总结 Shiksha Copilot通过教师与AI协作,帮助低资源学校更高效地定制课程计划,同时减轻教师负担并促进基于活动的教学法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13302 2026-03-12 cs.CV 50%

An Overview about Emerging Technologies of Autonomous Driving

自动驾驶新兴技术概述

Yu Huang, Yue Chen, Zijiang Yang

专题命中 规划推理 :planning(abstract)

AI总结 本文概述了自动驾驶新兴技术,重点探讨了数据闭环框架下的关键技术和开放性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏