arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-12 至 2026-03-12 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 17 篇

2603.01607 2026-03-12 cs.AI cs.LG 84%

CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework

CARE:迈向多模态医学推理中的临床问责的证据基础代理框架

Yuexi Du, Jinglu Wang, Shujie Liu, Nicha C. Dvornek, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) Department of Biomedical Engineering, Yale University(耶鲁大学生物医学工程系) Department of Radiology & Biomedical Imaging, Yale University(耶鲁大学放射学与生物医学成像系)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 CARE通过证据基础的代理框架提升多模态医学推理的准确性与问责性,结合解耦的专业模型和明确证据,实现更可靠的医学AI。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09987 2026-03-12 cs.CL cs.AI cs.LG 82%

Evolving Demonstration Optimization for Chain-of-Thought Feature Transformation

链式推理特征转换的进化演示优化

Xinyuan Wang, Kunpeng Liu, Arun Vignesh Malarkkan, Yanjie Fu

专题命中 规划推理 :chain-of-thought(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种通过进化轨迹经验优化LLM驱动的特征转换方法,提升转换多样性与下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08253 2026-03-12 cs.RO 82%

Open-World Task and Motion Planning via Vision-Language Model Generated Constraints

开放世界任务与运动规划 via 视觉-语言模型生成的约束

Nishanth Kumar, William Shen, Fabio Ramos, Dieter Fox, Tomás Lozano-Pérez, Leslie Pack Kaelbling, Caelan Reed Garrett

机构 * NVIDIA Research(NVIDIA研究) MIT CSAIL

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出OWL-TAMP方法,通过整合视觉-语言模型生成的约束,提升开放世界任务与运动规划的性能,实现对自然语言目标的处理能力。

Comments A version of this paper appears in IEEE Robotics and Automation Letters (RA-L) Volume 11, Issue 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10800 2026-03-12 cs.LG cs.AI cs.SY eess.SY 81%

AI-Enhanced Spatial Cellular Traffic Demand Prediction with Contextual Clustering and Error Correction for 5G/6G Planning

基于上下文聚类和误差校正的AI增强型空间蜂窝交通需求预测用于5G/6G规划

Mohamad Alkadamani, Colin Brown, Halim Yanikomeroglu

机构 * Innovation, Science and Economic Development Canada (ISED) and Carleton University(创新、科学与经济发展的加拿大(ISED)和卡尔顿大学) Communications Research Centre (CRC)(通讯研究中心(CRC)) Carleton University(卡尔顿大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于上下文聚类和误差校正的AI框架,用于提高5G/6G规划中空间蜂窝交通需求预测的准确性与可靠性。

Comments 5 pages, 8 figures. Submitted to IEEE Wireless Communications Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10332 2026-03-12 cs.IR cs.AI 79%

Does Reasoning Make Search More Fair? Comparing Fairness in Reasoning and Non-Reasoning Rerankers

推理是否使搜索更公平?比较推理与非推理重排序器的公平性

Saron Samuel, Benjamin Van Durme, Eugene Yang

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(语言技术卓越中心)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究比较了推理与非推理重排序器的公平性,发现推理模型对公平性无显著影响,需进一步优化以提升公平性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07527 2026-03-12 cs.AI cs.LG 73%

Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions

学习强化学习无法做到的:用于最难问题的交错在线微调

Lu Ma, Hao Liang, Meiyi Qiang, Lexiang Tang, Xiaochen Ma, Zhen Hao Wong, Junbo Niu, Chengyu Shen, Runming He, Yanhao Li, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京软件与硬件协同人工智能系统重点实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 ReLIFT通过结合强化学习和在线微调,提升模型在复杂问题上的推理能力,实现超过5.2分的性能提升。

Comments 12 pages, 5 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00819 2026-03-12 cs.LG cs.AI cs.CL 67%

Large Language Models for Travel Behavior Prediction

基于大语言模型的出行行为预测

Baichuan Mo, Hanyong Xu, Ruoyun Ma, Jung-Hoon Cho, Dingyi Zhuang, Xiaotong Guo, Jinhua Zhao

机构 * Department of Civil Engineering, Tsinghua University, Beijing, China(清华大学土木工程系) Department of Civil and Environmental Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139(麻省理工学院土木与环境工程系) Department of Urban Studies and Planning, Massachusetts Institute of Technology, Cambridge, MA 20139(麻省理工学院城市研究与规划系) Department of Management Science and Engineering, Stanford University, Stanford, CA 94305(斯坦福大学管理科学与工程系)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用大语言模型进行出行行为预测,通过零样本提示和文本嵌入两种方法,实现了与传统模型相当的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05503 2026-03-12 cs.LG cs.AI 62%

Over-Searching in Search-Augmented Large Language Models

搜索增强型大语言模型中的过度搜索

Roy Xie, Deepak Gopinath, David Qiu, Dong Lin, Haitian Sun, Saloni Potdar, Bhuwan Dhingra

机构 * Apple(苹果公司) Duke University(杜克大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了搜索增强型大语言模型中的过度搜索问题,提出TPC指标量化其性能与成本的权衡,并探讨了缓解方法。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10180 2026-03-12 cs.LG 57%

DT-BEHRT: Disease Trajectory-aware Transformer for Interpretable Patient Representation Learning

DT-BEHRT:面向疾病轨迹的Transformer用于可解释的患者表示学习

Deyi Li, Zijun Yao, Qi Xu, Muxuan Liang, Lingyao Li, Zijian Xu, Mei Liu

机构 * University of Florida(佛罗里达大学) University of Kansas(堪萨斯大学) MD Anderson Cancer Center(MD安德森癌症中心) University of South Florida(佛罗里达州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 DT-BEHRT通过建模疾病轨迹和异步进展模式,提升EHR中患者表示的可解释性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10747 2026-03-12 cs.DB 50%

Pneuma-Seeker: A Relational Reification Mechanism to Align AI Agents with Human Work over Relational Data

Pneuma-Seeker: 一种关系重构机制,用于将AI代理与关系数据上的人类工作对齐

Muhammad Imam Luthfi Balaka, John Hillesland, Kemal Badur, Raul Castro Fernandez

专题命中 规划推理 :planning(abstract)

AI总结 Pneuma-Seeker通过关系重构机制,将AI代理与人类工作对齐,提升数据处理的准确性和可信赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10616 2026-03-12 cs.RO 50%

AdaClearGrasp: Learning Adaptive Clearing for Zero-Shot Robust Dexterous Grasping in Densely Cluttered Environments

AdaClearGrasp: 学习自适应清除以实现零样本鲁棒灵巧抓取在密集障碍环境中

Zixuan Chen, Wenquan Zhang, Jing Fang, Ruiming Zeng, Zhixuan Xu, Yiwen Hou, Xinke Wang, Jieqi Shi, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学) Nanjing University of Posts and Telecommunications(南京邮电大学) National University of Singapore(新加坡国立大学)

专题命中 规划推理 :planning(abstract)

AI总结 AdaClearGrasp通过自适应清除与零样本灵巧抓取技术,提升机器人在密集障碍环境中的抓取成功率。

Comments 12 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10268 2026-03-12 cs.SE 50%

SpecOps: A Fully Automated AI Agent Testing Framework in Real-World GUI Environments

SpecOps:一种在真实GUI环境中完全自动化的AI代理测试框架

Syed Yusuf Ahmed, Shiwei Feng, Chanwoo Bae, Calix Barrus Xiangyu Zhang

专题命中 规划推理 :planning(abstract)

AI总结 SpecOps是一种全新的自动化AI代理测试框架,通过专门设计的LLM代理处理四个阶段,实现对真实GUI环境中复杂代理的高效测试与验证。

Comments Accepted to ICSE 2026

Journal ref Proceedings of the IEEE/ACM International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09141 2026-03-12 cs.CV 50%

Agentic AI as a Network Control-Plane Intelligence Layer for Federated Learning over 6G

代理AI作为6G联邦学习的网络控制平面智能层

Loc X. Nguyen, Ji Su Yoon, Huy Q. Le, Yu Qiao, Avi Deb Raha, Eui-Nam Huh, Nguyen H. Tran, Zhu Han, Choong Seon Hong

机构 * Department of Computer Science and Engineering, Kyung Hee University(韩国庆熙大学计算机科学与工程系) Department of Artificial Intelligence, Kyung Hee University(韩国庆熙大学人工智能系) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Electrical and Computer Engineering Department, University of Houston(德克萨斯大学休斯顿分校电子与计算机工程系)

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出一种基于代理AI的网络控制平面智能层,用于6G网络中的联邦学习,通过整合学习与网络管理任务,提升系统在多样化数据训练和严格约束下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09394 2026-03-12 cs.HC 50%

EyeAgent: An Agentic AI System for Multimodal Clinical Decision Support in Ophthalmology

EyeAgent:一种用于眼科多模态临床决策支持的智能AI系统

Danli Shi, Xiaolan Chen, Bingjie Yan, Weiyi Zhang, Pusheng Xu, Jiancheng Yang, Ruoyu Chen, Siyu Huang, Bowen Liu, Xinyuan Wu, Meng Xie, Ziyu Gao, Yue Wu, Senlin Lin, Kai Jin, Xia Gong, Yih Chung Tham, Xiujuan Zhang, Li Dong, Yuzhou Zhang, Jason Yam, Guangming Jin, Xiaohu Ding, Haidong Zou, Yalin Zheng, Zongyuan Ge, Mingguang He

专题命中 规划推理 :reasoning(abstract)

AI总结 EyeAgent通过整合53种眼科工具提升诊断准确率,实现多模态临床决策支持,为眼科AI系统提供新范式。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06934 2026-03-12 cs.GT cs.MA stat.ME stat.OT 50%

Sequential Causal Normal Form Games: Theory, Computation, and Strategic Signaling

顺序因果正常形式游戏:理论、计算与战略信号

Dennis Thumm

专题命中 规划推理 :reasoning(abstract)

AI总结 本文探讨了经典博弈论框架能否扩展以捕捉AI代理的有限理性与因果推理,通过引入顺序因果多智能体系统(S-CMAS),发现其在所有测试场景中无法提供福利改进,揭示了理性选择与因果推理的不兼容性。

Comments AAAI 2026 Workshop on Foundations of Agentic Systems Theory

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00456 2026-03-12 cs.CY cs.HC 50%

Shiksha Copilot: Teacher-AI Collaboration for Curating and Customizing Lesson Plans in Low-Resource Schools

Shiksha Copilot:教师与AI协作在低资源学校中编纂和定制课程计划

Deepak Varuvel Dennison, Bakhtawar Ahtisham, Kavyansh Chourasia, Nirmit Arora, Rahul Singh, Rene F. Kizilcec, Akshay Nambi, Tanuja Ganu, Aditya Vashistha

专题命中 规划推理 :planning(abstract)

AI总结 Shiksha Copilot通过教师与AI协作,帮助低资源学校更高效地定制课程计划,同时减轻教师负担并促进基于活动的教学法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13302 2026-03-12 cs.CV 50%

An Overview about Emerging Technologies of Autonomous Driving

自动驾驶新兴技术概述

Yu Huang, Yue Chen, Zijiang Yang

专题命中 规划推理 :planning(abstract)

AI总结 本文概述了自动驾驶新兴技术,重点探讨了数据闭环框架下的关键技术和开放性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏