arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11017 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11017 篇

2602.10439 2026-02-12 cs.SD cs.AI eess.AS 79%

AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning

AudioRouter: 通过基于强化学习的双推理实现数据高效的音频理解

Liyang Chen, Hongkai Chen, Yujun Cai, Sifan Li, Qingwen Ye, Yiwei Wang

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 AudioRouter通过强化学习双推理机制,以更少的数据训练实现LALMs在音频理解上的高效提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09517 2026-02-11 cs.CL 79%

Knowledge Integration Decay in Search-Augmented Reasoning of Large Language Models

在大语言模型的搜索增强推理中知识整合衰减

Sangwon Yu, Ik-hwan Kim, Donghun Kang, Bongkyu Hwang, Junhwa Choi, Suk-hoon Jung, Seungki Hong, Taehee Lee, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, Korea(电气与计算机工程系,首尔国立大学,韩国首尔) Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, Korea(人工智能交叉学科项目,首尔国立大学,韩国首尔)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出SAKE方法,通过在推理过程前后锚定检索知识,缓解大语言模型在搜索增强推理中的知识整合衰减问题,提升多跳问答和复杂推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09341 2026-02-11 cs.AI 79%

Auditing Multi-Agent LLM Reasoning Trees Outperforms Majority Vote and LLM-as-Judge

对多智能体大语言模型推理树进行审计优于多数投票和LLM作为裁判

Wei Yang, Shixuan Li, Heng Ping, Peiyu Zhang, Paul Bogdan, Jesse Thomason

机构 * University of Southern California, Los Angeles, CA, USA(美国南加州大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 通过构建推理树路径搜索机制,AgentAuditor在多智能体系统中实现了优于多数投票和LLM作为裁判的推理准确性提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11276 2026-02-11 cs.HC cs.AI 79%

Words to Describe What I'm Feeling: Exploring the Potential of AI Agents for High Subjectivity Decisions in Advance Care Planning

描述我感受的词语:探索AI代理在前瞻性医疗计划中的潜在作用

Kellie Yu Hui Sim, Pin Sym Foong, Chenyu Zhao, Melanie Yi Ning Quek, Swarangi Subodh Mehta, Kenny Tsu Wei Choo

机构 * Singapore University of Technology and Design(新加坡科技设计大学) National University of Singapore(国立新加坡大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文探讨了AI代理在前瞻性医疗计划中的应用,通过实验发现AI可作为个人倡导者,提升个体与代理之间的相互理解。

Comments Accepted at CHI 2026. 34 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15305 2026-02-10 cs.AI 79%

Coarse-to-Fine Grounded Memory for LLM Agent Planning

粗到细的 grounded memory 用于 LLM agent 计划

Wei Yang, Jinwei Xiao, Hongming Zhang, Qingyang Zhang, Yanna Wang, Bo Xu

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统国家重点实验室,自动化研究所,中国科学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出 Coarse-to-Fine Grounded Memory,通过 LLM 实现粗到细的记忆 grounding,以提升代理在复杂规划任务中的灵活性和适应性。

Comments Accepted to EMNLP 2025 Main Conference;27 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15782 2026-02-10 cs.LG 79%

Solving General-Utility Markov Decision Processes in the Single-Trial Regime with Online Planning

在单次试验范式中求解一般效用马尔可夫决策过程的在线规划方法

Pedro P. Santos, Alberto Sardinha, Francisco S. Melo

机构 * INESC-ID & Instituto Superior Técnico(INESC-ID与理工学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 本文提出了一种在单次试验范式中求解一般效用马尔可夫决策过程的方法,通过在线规划技术提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06493 2026-02-09 cs.LG 79%

Adaptive Uncertainty-Aware Tree Search for Robust Reasoning

自适应不确定性感知树搜索用于鲁棒推理

Zeen Song, Zihao Ma, Wenwen Qiang, Changwen Zheng, Gang Hua

机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) University of the Chinese Academy of Sciences(中国科学院大学) Multimodal Experiences Lab, Dolby Laboratories Inc(多模态体验实验室,Dolby Laboratories Inc) Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人工智能与机器人研究所,西安交通大学) Electronic Information Science and Technology, Central South University(电子信息科学与技术,中南大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出UATS方法,通过蒙特卡洛Dropout估计不确定性并结合强化学习控制器,以缓解外部搜索中分布外样本的不确定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06449 2026-02-09 cs.CL 79%

Evaluating an evidence-guided reinforcement learning framework in aligning light-parameter large language models with decision-making cognition in psychiatric clinical reasoning

评估一种证据引导的强化学习框架在对齐光参数大语言模型与精神科临床推理决策认知中的作用

Xinxin Lin, Guangxin Dai, Yi Zhong, Xiang Li, Xue Xiao, Yixin Zhang, Zhengdong Wu, Yongbo Zheng, Runchuan Zhu, Ming Zhao, Huizi Yu, Shuo Wu, Jun Zhao, Lingming Hu, Yumei Wang, Ping Yin, Joey W. Y. Chan, Ngan Yin Chan, Sijing Chen, Yun Kwok Wing, Lin Lu, Xin Ma, Lizhou Fan

机构 * The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(香港中文大学) Shandong University, Jinan, China(山东大学) Peking University Sixth Hospital, Beijing, China(北京大学第六医院) Inspur Cloud Information Technology Co., Ltd., Jinan, China(Inspur 云技术有限公司) Fudan University, Shanghai, China(复旦大学) Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, China(山东第一医科大学附属山东省人民医院) Jilin University, Changchun, China(吉林大学) Hong Kong ICI Cloud Service Limited, Hong Kong SAR, China(香港ICI云服务有限公司) Shandong First Medical University, Jinan, China(山东第一医科大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出ClinMPO框架,通过证据引导的强化学习使轻量LLM在复杂精神病学推理任务中达到超越人类的准确率。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07210 2026-02-09 cs.RO cs.AI 79%

HyPlan: Hybrid Learning-Assisted Planning Under Uncertainty for Safe Autonomous Driving

HyPlan:在不确定环境下通过混合学习辅助规划实现安全自动驾驶

Donald Pfaffmann, Matthias Klusch, Marcel Steinmetz

机构 * Saarland University, Computer Science Dept.(萨尔兰大学计算机科学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) French National Centre for Scientific Research (CNRS)(法国国家科学研究中心)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 HyPlan通过结合多智能体行为预测、深度强化学习和POMDP规划,实现安全且高效的自动驾驶导航

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05385 2026-02-06 cs.CL 79%

IESR:Efficient MCTS-Based Modular Reasoning for Text-to-SQL with Large Language Models

IESR:基于MCTS的高效模块化推理用于文本到SQL with大型语言模型

Tao Liu, Jiafan Lu, Bohan Yu, Pengcheng Wu, Liu Haixin, Guoyu Xu, Li Xiangheng, Lixiao Li, Jiaming Hou, Zhao Shijun, Xinglin Lyu, Kunli Zhang, Yuxiang Jia, Hongyin Zan

机构 * Zhengzhou University(郑州大学) Tianjin University(天津大学) Zhongshan University(中山大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 IESR提出一种基于MCTS的高效模块化推理框架,用于文本到SQL任务,通过信息增强和结构化推理提升复杂查询处理能力。

Comments 25 pages, 16 figures, 8 tables. Hongyin Zan is corresponding author, Jiafan Lu is first co-author

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05279 2026-02-06 cs.AI cs.CR 79%

Hallucination-Resistant Security Planning with a Large Language Model

具备抗幻觉能力的安全规划与大语言模型

Kim Hammar, Tansu Alpcan, Emil Lupu

机构 * The University of Melbourne(墨尔本大学) Imperial College London(伦敦帝国理工学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种抗幻觉的安全规划框架,通过迭代循环和上下文学习优化LLM决策,减少恢复时间30%。

Comments Accepted to IEEE/IFIP Network Operations and Management Symposium 2026. To appear in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04392 2026-02-05 cs.CL 79%

Evaluating the Presence of Sex Bias in Clinical Reasoning by Large Language Models

通过大语言模型评估临床推理中的性别偏见存在性

Isabel Tsintsiper, Sheng Wong, Beth Albert, Shaun P Brennecke, Gabriel Davis Jones

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究发现大语言模型在临床推理中存在性别偏见,不同模型表现不同,需谨慎配置与监督以确保医疗应用的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02542 2026-02-05 cs.LG cs.CR 79%

OverThink: Slowdown Attacks on Reasoning LLMs

OverThink: 对推理大语言模型的减速攻击

Abhinav Kumar, Jaechul Roh, Ali Naseh, Marzena Karpinska, Mohit Iyyer, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Simon Fraser University(西蒙弗雷泽大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 OverThink攻击通过注入伪装推理问题,迫使推理大语言模型消耗更多token,从而增加延迟和成本,同时探讨了其防御和影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04129 2026-02-05 cs.RO cs.AI cs.ET cs.MA 79%

KGLAMP: Knowledge Graph-guided Language model for Adaptive Multi-robot Planning and Replanning

KGLAMP:基于知识图谱的自适应多机器人规划与再规划语言模型

Chak Lam Shek, Faizan M. Tariq, Sangjae Bae, David Isele, Piyush Gupta

机构 * Honda Research Institute, USA(本田研究院) University of Maryland, College Park(马里兰大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 KGLAMP通过知识图谱引导LLM实现异构多机器人系统的自适应规划与再规划,提升动态环境下的规划效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04085 2026-02-05 cs.SD cs.CL 79%

BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning

BASS:用于音乐结构和语义推理的音频语言模型基准测试

Min Jang, Orevaoghene Ahia, Nazif Tamer, Sachin Kumar, Yulia Tsvetkov, Noah A. Smith

机构 * University of Washington(华盛顿大学) The Ohio State University(俄亥俄州立大学) Allen Institute for AI(人工智能研究所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 BASS通过评估音频语言模型在音乐结构和语义推理方面的性能,揭示了现有模型在高层次推理任务上的局限性,并为音乐推荐和搜索提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03974 2026-02-05 cs.AI 79%

Active Epistemic Control for Query-Efficient Verified Planning

主动认知控制用于查询高效的验证规划

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 主动认知控制通过结合基于模型的信念管理和范畴可行性检查,实现查询高效的验证规划,在交互环境中减少重新规划轮次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03255 2026-02-04 cs.AI 79%

LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios

LPS-Bench: 在长周期规划中评估计算机使用代理的安全意识基准测试

Tianyu Chen, Chujia Hu, Ge Gao, Dongrui Liu, Xia Hu, Wenjie Wang

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 LPS-Bench通过评估长周期规划中计算机使用代理的安全意识,揭示现有系统在安全行为维持方面的不足,并提出缓解策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03097 2026-02-04 cs.AI 79%

De-conflating Preference and Qualification: Constrained Dual-Perspective Reasoning for Job Recommendation with Large Language Models

解构偏好与资格:基于大语言模型的约束双视角推理 job 推荐

Bryce Kan, Wei Yang, Emily Nguyen, Ganghui Yi, Bowen Yi, Chenxiao Yu, Yan Liu

机构 * University of Southern California(南加州大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 JobRec通过约束双视角推理解构偏好与资格,提升职位推荐的可控性和匹配质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02991 2026-02-04 cs.AI 79%

Large Language Models Can Take False First Steps at Inference-time Planning

大语言模型在推理时间规划中可能采取错误的初始步骤

Haijiang Yan, Jian-Qiao Zhu, Adam Sanborn

机构 * Department of Psychology, The University of Warwick(沃里克大学心理学系) Department of Psychology, The University of Hong Kong(香港大学心理学系)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 研究揭示了大语言模型在推理过程中因自我生成上下文积累导致的规划行为偏差,并通过实验验证了规划能力随上下文变化而变化的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15113 2026-02-04 cs.CL 79%

Inferring Scientific Cross-Document Coreference and Hierarchy with Definition-Augmented Relational Reasoning

基于定义增强的 relational 推理进行科学跨文档指代与层次推断

Lior Forer, Tom Hope

机构 * The Hebrew University of Jerusalem(希伯来大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出基于定义增强的relational推理方法,用于科学文本中的跨文档指代和层次推断,通过生成上下文依赖的概念定义和关系定义,提升模型对复杂科学概念的推理能力。

Comments Accepted to TACL. Pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01797 2026-02-03 cs.AI 79%

ORCH: many analyses, one merge-a deterministic multi-agent orchestrator for discrete-choice reasoning with EMA-guided routing

ORCH: 多种分析,一个合并——一种确定性多智能体协调器,用于离散选择推理的EMA引导路由

Hanlin Zhou, Huah Yong Chan

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ORCH是一种确定性多智能体协调器,通过EMA引导路由实现离散选择推理的可控、可解释和部署就绪的智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00951 2026-02-03 cs.AI 79%

R-HTN: Rebellious Online HTN Planning for Safety and Game AI

R-HTN:安全与游戏AI中的反叛在线HTN规划

Hector Munoz-Avila, David W. Aha, Paola Rizzo

机构 * Computer Science \& Engineering, Lehigh University Bethlehem, PA 18015-3084 USA Navy Center for Applied Research in AI Naval Research Laboratory

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 R-HTN是一种用于安全与游戏AI的在线HTN规划算法,通过反叛机制在遵循指令的情况下实现任务目标。

Journal ref The Annual Conference on Advances in Cognitive Systems (ACS-2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00195 2026-02-03 cs.LG 79%

FastTTS: Accelerating Test-Time Scaling for Edge LLM Reasoning

FastTTS: 加速边缘LLM推理的测试时扩展

Hao Mark Chen, Zhiwen Mo, Guanxi Lu, Shuang Liang, Lingxiao Ma, Wayne Luk, Hongxiang Fan

机构 * Imperial College London(帝国学院伦敦) Microsoft Research(微软研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 FastTTS通过三种新方法提升边缘LLM推理效率,实现与云模型相当的准确性和延迟,减少38%-68%的延迟。

Comments Accepted at ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00357 2026-02-03 cs.LG 79%

Planning with Language and Generative Models: Toward General Reward-Guided Wireless Network Design

基于语言和生成模型的规划:迈向通用奖励引导的无线网络设计

Chenyang Yuan, Xiaoyuan Cheng

机构 * University of Sheffield(谢菲尔德大学) University College London(伦敦大学学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 本文提出基于统一奖励函数的扩散生成模型,用于高效解决室内无线网络接入点部署问题,通过大规模数据训练提升泛化能力与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22545 2026-02-02 cs.RO cs.AI 79%

Adapting Reinforcement Learning for Path Planning in Constrained Parking Scenarios

在受限停车场景中适应强化学习用于路径规划

Feng Tao, Luca Paparusso, Chenyi Gu, Robin Koehler, Chenxu Wu, Xinyu Huang, Christian Juette, David Paz, Ren Liu

机构 * Bosch Research(博世研究)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本研究提出了一种深度强化学习框架,用于在受限停车场景中实现高效的实时路径规划,通过序列决策问题建模和新基准的开发,实现了更高的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22329 2026-02-02 cs.AI cs.CY 79%

Sparks of Rationality: Do Reasoning LLMs Align with Human Judgment and Choice?

理性之光:推理大语言模型是否与人类判断和选择一致?

Ala N. Tak, Amin Banayeeanzade, Anahita Bolourani, Fatemeh Bahrani, Ashutosh Chaubey, Sai Praneeth Karimireddy, Norbert Schwarz, Jonathan Gratch

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究评估了LLMs在理性选择和情感影响下的表现,发现有意识思考能提升理性,但情感引导方法在可控性与人类行为对齐间存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11352 2026-02-02 cs.AI cs.FL 79%

Foundation Models for Logistics: Toward Certifiable, Conversational Planning Interfaces

物流领域的基础模型:迈向可验证、对话式规划界面

Yunhao Yang, Neel P. Bhatt, Christian Ellis, Samuel Li, Alvaro Velasquez, Zhangyang Wang, Ufuk Topcu

机构 * Neurosymbolic Intelligence(神经符号智能) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学波德分校)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于神经符号框架的视觉-语言物流代理,通过自然语言对话和可验证保证实现可信赖的物流规划决策,模型在少量训练样本下实现了高效且准确的物流规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21967 2026-01-30 cs.AI cs.SE 79%

The Energy Impact of Domain Model Design in Classical Planning

经典规划中领域模型设计的能量影响

Ilche Georgievski, Serhat Tekin, Marco Aiello

机构 * University of Stuttgart(斯图加特大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文研究了领域模型设计对经典规划器能耗的影响,通过配置框架分析不同领域特征对能量消耗和运行时间的影响。

Comments 2026 IEEE/ACM 5th International Conference on AI Engineering - Software Engineering for AI (CAIN '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11479 2026-01-30 cs.AI 79%

Health Facility Location in Ethiopia: Leveraging LLMs to Integrate Expert Knowledge into Algorithmic Planning

埃塞俄比亚卫生设施选址:利用大语言模型整合专家知识到算法规划中

Yohai Trabelsi, Guojun Xiong, Fentabil Getnet, Stéphane Verguet, Milind Tambe

机构 * John A. Paulson School of Engineering and Applied Sciences, Harvard University(工程与应用科学学院,哈佛大学) National Data Management and Analytics Center for Health, Ethiopian Public Health Institute(健康数据管理与分析中心,埃塞俄比亚公共卫生研究所) Department of Global Health and Population, Harvard T.H. Chan School of Public Health(全球卫生与人口学院,哈佛T.H. Chan公共卫生学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种结合大语言模型和优化技术的混合框架,用于埃塞俄比亚卫生设施选址,以整合专家知识并提升规划的公平性和数据驱动性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21533 2026-01-30 cs.AI 79%

ARGORA: Orchestrated Argumentation for Causally Grounded LLM Reasoning and Decision Making

ARGORA:用于因果基础的大语言模型推理和决策的协同论证

Youngjin Jin, Hanna Kim, Kwanwoo Kim, Chanhee Lee, Seungwon Shin

机构 * School of EE, KAIST, Daejeon, South Korea(韩国科学技术院电子工程学院) S2W Inc., Pangyo, South Korea(S2W公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ARGORA通过构建因果论证图,提升大语言模型在因果推理和决策中的准确性与修正能力。

Comments 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏