arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11004 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11004 篇

2601.06102 2026-01-13 cs.AI cs.LG 82%

Dynamic Intelligence Ceilings: Measuring Long-Horizon Limits of Planning and Creativity in Artificial Systems

动态智能上限:测量人工智能系统长期规划和创造力的长期限制

Truong Xuan Khanh, Truong Quynh Hoa

机构 * H&K Research Studio, Clevix LLC(Clevix LLC 研究室)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态智能上限概念,通过轨迹导向评估框架量化人工智能系统长期规划与创造力的限制,揭示智能上限的动态性与轨迹依赖性。

Comments This paper introduces a trajectory-centric evaluation framework for analyzing long-horizon intelligence limits in artificial systems, focusing on developmental behavior, planning, and structural creativity rather than proposing new learning algorithms. 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08595 2025-12-09 cs.CL cs.AI 82%

Chopping Trees: Semantic Similarity Based Dynamic Pruning for Tree-of-Thought Reasoning

砍树:基于语义相似性的动态剪枝用于树状思维推理

Joongho Kim, Xirui Huang, Zarreen Reza, Gabriel Grand

机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 SSDP通过动态剪枝技术提升树状思维推理效率,实现2.3倍速度提升且保持高准确性。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17337 2025-09-23 cs.AI cs.CL 82%

LLaVul: A Multimodal LLM for Interpretable Vulnerability Reasoning about Source Code

Ala Jararweh, Michael Adams, Avinash Sahu, Abdullah Mueen, Afsah Anwar

机构 * Department of Computer Science, The University of New Mexico(计算机科学系,新墨西哥大学) Comprehensive Cancer Center, The University of New Mexico(综合癌症中心,新墨西哥大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Journal ref A. Jararweh, M. Adams, A. Sahu, A. Mueen and A. Anwar, "LLaVul: A Multimodal LLM for Interpretable Vulnerability Reasoning about Source Code," 2025 5th Intelligent Cybersecurity Conference (ICSC), Tampa, FL, USA, 2025, pp. 232-241

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01639 2025-04-18 cs.RO cs.AI cs.CV cs.LG 82%

Know Where You're Uncertain When Planning with Multimodal Foundation Models: A Formal Framework

Neel P. Bhatt, Yunhao Yang, Rohan Siva, Daniel Milan, Ufuk Topcu, Zhangyang Wang

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

Comments Fine-tuned models, code, and datasets are available at https://uncertainty-in-planning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10625 2023-10-17 cs.CV cs.AI cs.LG cs.RO 82%

Video Language Planning

Yilun Du, Mengjiao Yang, Pete Florence, Fei Xia, Ayzaan Wahid, Brian Ichter, Pierre Sermanet, Tianhe Yu, Pieter Abbeel, Joshua B. Tenenbaum, Leslie Kaelbling, Andy Zeng, Jonathan Tompson

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

Comments https://video-language-planning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11940 2022-06-27 cs.AI cs.LG 82%

World Value Functions: Knowledge Representation for Learning and Planning

Geraud Nangue Tasse, Benjamin Rosman, Steven James

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at the Planning and Reinforcement Learning Workshop at ICAPS 2022. arXiv admin note: text overlap with arXiv:2205.08827

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.14830 2022-03-08 cs.AI cs.LG 82%

Reinforcement Learning for Classical Planning: Viewing Heuristics as Dense Reward Generators

Clement Gehring, Masataro Asai, Rohan Chitnis, Tom Silver, Leslie Pack Kaelbling, Shirin Sohrabi, Michael Katz

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

Comments Equal contributions by the first two authors. This manuscript is a camera-ready version accepted in ICAPS-2022. It is significantly updated from past versions (e.g., in the ICAPS PRL (Planning and RL) workshop) with additional experiments comparing existing work (STRIPS-HGN (Shen, Trevizan, and Thiebaux 2020) and GBFS-GNN (Rivlin, Hazan, and Karpas 2019))

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.01010 2021-12-03 cs.LG cs.AI cs.CV cs.RO 82%

Differentiable Spatial Planning using Transformers

Devendra Singh Chaplot, Deepak Pathak, Jitendra Malik

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

Comments Published at ICML 2021. See project webpage at https://devendrachaplot.github.io/projects/spatial-planning-transformers

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.01080 2021-08-04 cs.AI cs.LG cs.RO 82%

Learning-based Preference Prediction for Constrained Multi-Criteria Path-Planning

Kevin Osanlou, Christophe Guettier, Andrei Bursuc, Tristan Cazenave, Eric Jacopin

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

Comments arXiv admin note: text overlap with arXiv:2108.00978

Journal ref International Conference on Automated Planning and Scheduling 2019, Workshop SPARK

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.08739 2021-07-20 cs.AI cs.CL 82%

E-PDDL: A Standardized Way of Defining Epistemic Planning Problems

Francesco Fabiano, Biplav Srivastava, Jonathan Lenchner, Lior Horesh, Francesca Rossi, Marianna Bergamaschi Ganapini

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

Comments 9 pages, Knowledge Engineering for Planning and Scheduling - ICAPS 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.03920 2019-02-08 cs.CV cs.AI cs.LG cs.RO 82%

Cognitive Mapping and Planning for Visual Navigation

Saurabh Gupta, Varun Tolani, James Davidson, Sergey Levine, Rahul Sukthankar, Jitendra Malik

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

Comments Extended IJCV Version of the original paper at CVPR17. Project website with code, models, simulation environment and videos: https://sites.google.com/view/cognitive-mapping-and-planning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28850 2026-08-18 cs.LG q-fin.CP 版本更新 81%

Representation Signatures and Risk-Feedback Alignment in LLM Trading Agents

表示签名与LLM交易智能体中的风险反馈对齐

Weicheng Xue

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 通过TradeArena测试平台研究LLM交易智能体在金融决策中的行为对齐与表示动态,发现故障前表示签名(规划嵌入漂移、流形有效秩收缩)并验证风险反馈作为外部对齐信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00805 2026-08-04 cs.AI 新提交 81%

AgentSLABench: Evaluating and Benchmarking Agentic Systems Under Resource Constraints

AgentSLABench:资源约束下智能体系统的评估与基准测试

Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju

专题命中 规划推理 :CoT(abstract,abstract_cn);planning(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出AgentSLABench框架,在资源约束下评估自主AI智能体,通过多维度指标分析发现专用智能体表现优于通用基线,验证了效率调整成功率的重要性并开放相关资源。

Comments 7 pages, 2 figures, 9 tables. Code, sealed test sets, and profiling artifacts available at: https://github.com/MeherBhaskar/agentslabench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00546 2026-07-16 cs.AI cs.CV 版本更新 81%

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation

通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型

Zeyu Chen, Huanjin Yao, Ziwang Zhao, Min Yang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00826 2026-06-17 q-fin.TR cs.AI 版本更新 81%

LLM-Powered Multi-Agent System for Automated Crypto Portfolio Management

基于LLM的多智能体系统实现自动化加密货币投资组合管理

Yichen Luo, Yebo Feng, Jiahua Xu, Paolo Tasca, Yang Liu

机构 * University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) Exponential Science(指数科学)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出一个三智能体系统(市场、新闻、交易),通过分层、协作和辩论架构融合多模态信号,在2025年回测中实现133.52%累计收益和1.502夏普比率,优于单智能体和深度学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01304 2026-06-09 cs.LG 版本更新 81%

When Hard Negatives Hurt: Bridging the Generative-Discriminative Gap in Hard Negative Synthesis for Retrieval

当硬负例有害时:弥合检索中硬负例生成的生成-判别鸿沟

Zhicheng Zhang, Jiwei Tang, Kuicai Dong, Xiaopeng Li, Jieming Zhu, Jingyu Li, Qianhui Zhu, Fengyuan Lu, Wang Jiaheng, Gang Wang, Hai-Tao Zheng, Zhaocheng Du

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Huawei Technologies Co., Ltd.(华为技术有限公司) City University of Hong Kong(香港城市大学) School of Cyber Science and Technology, Sun Yat-sen University(中山大学信息科学与技术学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) The Hong Kong University of Science and Technology(香港科学与技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 规划推理 :CoT(summary_cn,abstract);分类 cs.LG

AI总结 针对检索中硬负例生成存在的生成-判别鸿沟问题,提出CausalNeg方法,通过CoT引导的反事实扰动和查询视角熵最大化来提升检索性能。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04310 2026-05-27 cs.AI 81%

EvoEmo: Towards Evolved Emotional Policies for Adversarial LLM Agents in Multi-Turn Price Negotiation

EvoEmo:面向多轮价格谈判中对抗性LLM智能体的进化情感策略

Yunbo Long, Liming Xu, Lukas Beckenbauer, Yuhan Liu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院) TUM School of Management, Technical University of Munich(慕尼黑技术大学管理学院) The Alan Turing Institute, London, UK(伦敦阿尔安·图灵研究院)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出EvoEmo进化强化学习框架,通过将情感状态转移建模为马尔可夫决策过程并采用种群遗传优化,动态优化多轮谈判中的情感表达,显著提升LLM智能体的谈判成功率、效率和买家节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24812 2026-05-26 cs.AI 81%

CoRe-Code: Collaborative Reinforcement Learning for Code Generation

CoRe-Code:面向代码生成的协作式强化学习

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Xiaoyu Xia, Sumon Biswas

机构 * The Ohio State University(俄亥俄州立大学) Royal Melbourne Institute of Technology(皇家墨尔本理工学院)

专题命中 规划推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 提出CoRe-Code框架,通过规划器-编码器范式和基于GRPO的协作感知强化学习,增强多智能体间的协调与专业化,提升代码生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17228 2026-05-19 cs.CL 81%

Artificial Intolerance: Stigmatizing Language in Clinical Documentation Skews Large Language Model Decision-Making

人工不耐受:临床文档中的污名化语言扭曲大型语言模型决策

Jen-tse Huang, Didi Zhou, Faith Kamau, Amy Oh, Anne R. Links, Mark Dredze, Mary Catherine Beach, Somnath Saha

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在处理包含污名化语言的临床文档时是否继承并传播人类偏见,发现所有模型在决策上都存在显著偏见,且对语言框架敏感,需加强算法防护以确保公平性和鲁棒性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18178 2026-05-19 cs.CV cs.AI 81%

VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events

VLM-AutoDrive: 事后训练视觉-语言模型用于安全关键的自动驾驶事件

Mohammad Qazim Bhat, Yufan Huang, Niket Agarwal, Hao Wang, Michael Woods, John Kenyon, Tsung-Yi Lin, Xiaodong Yang, Ming-Yu Liu, Kevin Xie

机构 * NVIDIA

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出VLM-AutoDrive框架,通过整合元数据生成的描述、LLM生成的描述、视觉问答对和推理监督,提升预训练视觉语言模型在安全关键自动驾驶事件中的检测性能。

Comments 16 pages, 9 figures, submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22560 2026-04-27 cs.CV cs.AI 81%

Cross-Stage Coherence in Hierarchical Driving VQA: Explicit Baselines and Learned Gated Context Projectors

层次驾驶视觉问答中的跨阶段一致性:显式基线与学习门控上下文投影

Gautam Kumar Jain, Carsten Markgraf, Julian Stähler

机构 * Technische Hochschule Augsburg(亚琛工业大学)

专题命中 规划推理 :reasoning(abstract,abstract_cn);planning(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了驾驶场景中跨阶段上下文传递的两种方法,显式基线通过无额外训练的4B VLM减少矛盾,隐式基线通过门控投影提升规划阶段语义一致性,两者共同探讨了领域适应在全谱改进中的潜力。

Comments 16 pages, 8 figures, 8 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07422 2026-04-10 cs.LG 81%

Multimodal Large Language Models for Multi-Subject In-Context Image Generation

多模态大语言模型用于多主体上下文图像生成

Yucheng Zhou, Dubing Chen, Huan Zheng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学,科技学院,计算机与信息科学系,智慧城市物联网国家重点实验室)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 本文提出MUSIC模型,通过视觉链式思维机制和空间布局规划方法,解决多主体上下文图像生成中的主体缺失和语义漂移问题,并在多主体场景中取得显著优势。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09036 2026-03-11 cs.LG 81%

SCALAR: Learning and Composing Skills through LLM Guided Symbolic Planning and Deep RL Grounding

SCALAR:通过LLM引导的符号规划和深度RL接地学习与组合技能

Renos Zabounidis, Yue Wu, Simon Stepputtis, Woojun Kim, Yuanzhi Li, Tom Mitchell, Katia Sycara

专题命中 规划推理 :planning(title,abstract);分类 cs.LG;reasoning(comments)

AI总结 SCALAR通过结合LLM引导的符号规划与深度RL,实现技能学习与组合,显著提升任务完成效率和鲁棒性。

Comments Best Paper Award Honorable Mention at NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19534 2026-03-03 cs.RO cs.AI 81%

Large Language Model-Assisted UAV Operations and Communications: A Multifaceted Survey and Tutorial

大型语言模型辅助的无人机操作与通信:多方面的综述与教程

Yousef Emami, Hao Zhou, Radha Reddy, Atefeh Hajijamali Arani, Biliang Wang, Kai Li, Luis Almeida, Zhu Han

机构 * IEEE

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 本文综述了大型语言模型在无人机操作与通信中的应用,探讨了LLMs在提升UAV智能方面的多方面技术与未来研究方向。

Comments 40 pages, 10 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06413 2026-02-09 cs.AI 81%

Intrinsic Stability Limits of Autoregressive Reasoning: Structural Consequences for Long-Horizon Execution

自回归推理的内在稳定性极限:长视界执行的结构后果

Hsien-Jyh Liao

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI;chain-of-thought(comments)

AI总结 本文研究了自回归推理的内在稳定性限制,发现长视界执行受限于过程级不稳定性,提出结构治理是解决长视界推理问题的关键。

Comments 16 Pages, 7 figures, Keyworda: Autoregressive Reasoning, Long-Horizon Stability, Chain-of-Thought Reasoning, Information-Theoretic Analysis, Structured Reasoning, Inference Dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10428 2025-08-15 cs.LG 81%

SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks

Pengbo Shen, Yaqing Wang, Ni Mu, Yao Luan, Runpeng Xie, Senhao Yang, Lexiang Wang, Hao Hu, Shuang Xu, Yiqin Yang, Bo Xu

专题命中 规划推理 :reasoning(abstract);planning(abstract);verifier(abstract);self-correction(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16021 2025-04-23 cs.HC cs.AI 81%

Navigating the State of Cognitive Flow: Context-Aware AI Interventions for Effective Reasoning Support

Dinithi Dissanayake, Suranga Nanayakkara

机构 * Augmented Human Lab, National University of Singapore(增强人类实验室,新加坡国立大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

Comments Presented at the 2025 ACM Workshop on Human-AI Interaction for Augmented Reasoning, Report Number: CHI25-WS-AUGMENTED-REASONING

Journal ref Proceedings of the 2025 ACM CHI Workshop on Human-AI Interaction for Augmented Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09241 2025-03-13 cs.AI 81%

In-Context Defense in Computer Agents: An Empirical Study

Pei Yang, Hai Ci, Mike Zheng Shou

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04645 2024-12-09 cs.AI 81%

REL: Working out is all you need

Toby Simonds, Jey Han Lau, Chaithanya Bandi

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05449 2024-07-19 cs.CL 81%

RoT: Enhancing Large Language Models with Reflection on Search Trees

Wenyang Hui, Kewei Tu

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

Comments 9 pages main

详情

展开后加载摘要…

URL PDF HTML 收藏