arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10960 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 10960 篇

2602.23148 2026-07-07 cs.AI 83%

On Sample-Efficient Generalized Planning via Learned Transition Models

基于学习转移模型的高效通用规划

Nitin Gupta, Vishal Pallagani, John A. Aydin, Biplav Srivastava

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出通过学习转移模型实现高效通用规划,通过显式建模领域动态,相比直接预测动作序列,在多个领域中以更少样本和更小模型获得更高的离分布满足计划成功率。

Comments 14 pages; Extended version of short paper accepted at ICAPS 2026; updated with results and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28589 2026-07-03 cs.AI 版本更新 83%

Search for Truth from Reasoning: A Dynamic Representation Editing Framework for Steering LLM Trajectories

从推理中寻找真理:一种用于引导LLM轨迹的动态表示编辑框架

Tianlong Wang, Yuhang Wang, Weibin Liao, Xin Gao, Xinyu Ma, Yang Lin, Yasha Wang, Liantao Ma

机构 * ByteDance Inc.(字节跳动公司) Huawei Technologies Co., Ltd(华为技术有限公司) Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海))

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出DynaSteer动态表示编辑框架,通过模式聚类和Fisher-LDA提取纯净真理,并基于前瞻熵选择性引导轨迹,提升LLM推理真实性。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00283 2026-07-02 cs.RO cs.AI cs.CV 新提交 83%

What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models

隐藏之物至关重要:使用视觉语言模型识别规划关键性的被遮挡智能体

Amirhosein Chahe, Tyler Naes, Jovin D'sa, Faizan M. Tariq, Sangjae Bae, Lifeng Zhou, David Isele

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出利用视觉语言模型(VLM)识别对自车轨迹影响最大的被遮挡智能体,通过规划KL散度(PKL)度量进行排序,并微调VLM以提升性能,实验表明该方法比随机采样提升约30%。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23405 2026-07-02 cs.MA cs.AI cs.RO 版本更新 83%

Planning over MAPF Agent Dependencies via Multi-Dependency PIBT

通过多依赖PIBT规划MAPF智能体依赖关系

Zixiang Jiang, Yulun Zhang, Rishi Veerapaneni, Jiaoyang Li

机构 * University Of Melbourne(墨尔本大学) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出多依赖PIBT(MD-PIBT)框架,通过搜索智能体依赖关系来规划多智能体路径,在拥挤环境中高效处理多达10000个智能体,支持多种运动学约束。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29879 2026-07-01 cs.CV cs.AI 版本更新 83%

LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving

LWDrive: 基于逐层世界模型的视觉-语言模型自动驾驶规划

Chen Yang, Yuhao Wei, Ze Xu, Ziheng Zou, Shuang Liang, Delin Ouyang, Lingfeng Qi, Jie Li, Guofa Li

机构 * Chongqing University(重庆大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出LWDrive框架,通过逐层世界模型引导,将VLM输出的粗轨迹逐步细化为几何精确、多视角感知的规划轨迹,在NAVSIM基准上取得92.0分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31916 2026-07-01 cs.CL 新提交 83%

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

超越对话的心智理论与说服:通过规划与行动评估LLMs诱导信念状态的能力

Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

机构 * Leverhulme Centre for the Future of Intelligence(勒沃霍姆未来智能中心) Prolific Google, Paradigms of Intelligence Team(谷歌智能范式团队)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 提出非对话式规划心智理论(NCP-ToM)框架,评估LLMs通过行动而非对话诱导他人信念状态的能力,发现GPT-5在80%任务中优于人类,但鲁棒性不足。

Comments 29 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31200 2026-07-01 cs.AI 新提交 83%

Agentic RAG-VLM: Affordance-Aware Retrieval-Augmented Generation with Self-Reflective Planning for Robotic Grasping

Agentic RAG-VLM:基于自反规划与可操作性感知的检索增强生成在机器人抓取中的应用

Tao Chen, Lizheng Liu, Jiaxu Wang, Ziyue Jiang, Ruiqi Tian, JiGuang Huo, Zhongxue Gan

机构 * Fudan University(复旦大学) Kean University(肯恩大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出Agentic RAG-VLM框架,通过可操作性感知检索、场景图推理和自反规划,在杂乱环境中实现鲁棒抓取,成功率78.3%,比纯VLM基线提升53.3个百分点。

Comments 8 pages,5 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27757 2026-06-29 cs.AI 新提交 83%

Towards Reliable and Robust LLM Planning: Symbolic Feedback-Driven Iterative Self-Refinement Framework

迈向可靠稳健的LLM规划:符号反馈驱动的迭代自我精炼框架

Jiajing Zhang, Jiamei Jiang, Chenyang Zhang, Feifei Mo, Linjing Li, Daniel Zeng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划推理 :planning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 提出符号反馈驱动的迭代自我精炼框架,通过自然语言提示、符号验证器和计划识别器增强LLM在长时域规划中的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27483 2026-06-29 cs.AI 新提交 83%

Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning

内化未来:一种统一的世界模型规划智能体训练范式

Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出一种三阶段训练范式(WM-AMT、FE-SFT、FC-RL),使LLM智能体内化世界模型以进行前瞻性规划,在搜索和数学推理任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21740 2026-06-23 cs.AI 新提交 83%

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents

训练编排器:一种基于监督学习的端到端PDDL规划方法,使用LLM智能体

Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli

机构 * Oregon State University(俄勒冈州立大学)

专题命中 规划推理 :planning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 提出HALO框架,通过监督学习训练编排器,利用验证器提供的轨迹作为监督信号,在11个PDDL领域上以极低成本实现与前沿LLM相当的成功率。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29649 2026-06-18 cs.AI 版本更新 83%

LLM-Evolved Domain-Independent Heuristics for Symbolic AI Planning

LLM进化的符号AI规划领域无关启发式

Elliot Gestrin, Jendrik Seipp

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文使用进化搜索让大语言模型生成领域无关的启发式函数,在未见测试域上超越手工最优启发式,并首次系统评估了启发式的信息性-速度权衡。

Comments Accepted at the LM4Plan workshop at ICAPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15872 2026-06-16 cs.CL 新提交 83%

SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

SciOrch: 学习编排专家大语言模型以解决前沿多模态科学推理任务

Jingru Guo, Xiangyuan Xue, Lian Zhang, Wanghan Xu, Siki Chen, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * Imperial College London(伦敦帝国学院) The Chinese University of Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出SciOrch框架,训练轻量级8B模型编排多个前沿大语言模型,通过MCTS和GRPO优化,在科学推理任务上超越最强单模型和多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15160 2026-06-16 cs.CV cs.LG 新提交 83%

DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning

DLWM: 多样化潜在世界模型用于高效多模态推理

David Huang, Lianlei Shan

机构 * University of Toronto(多伦多大学) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 提出DLWM框架,结合潜在空间推理与强化学习,通过多样化潜在假设和资源感知策略提升多模态推理效率,准确率提升2-5%,内存减少24%。

Comments Preprint. 9 pages main text, 15 pages total including appendix, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15141 2026-06-16 eess.AS cs.AI cs.SD 新提交 83%

EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning

EChO-Agent: 用于音频推理的证据链编排智能体

Siyuan Zhang, Jian Zong, Junyu Wang, Peiyuan Jiang, Jiahao Yan, Jingyu Zhang, Tianrui Wang, Xiaobao Wang, Longbiao Wang, Jianwu Dang

机构 * School of Artificial Intelligence, Tianjin University(天津大学人工智能学院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出EChO-Agent模块化框架,将复杂音频问答转化为规划、工具执行、证据整合和答案验证流程,在MMAR基准上提升准确率和评分。

Comments 5 pages, 2 figures. Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14828 2026-06-11 cs.AI cs.RO 版本更新 83%

RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning

RoboGPT-R1: 通过强化学习增强机器人任务规划

Jinrui Liu, Bingyan Nie, Boyu Li, Yaran Chen, Yuze Wang, Shunsen He, Haoran Li

机构 * Institute of Automation, CASIA(中国科学院自动化研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) Huawei Cloud Technology Co., Ltd(华为云技术有限公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出RoboGPT-R1两阶段微调框架,先监督学习获取基础知识,再通过强化学习提升视觉空间理解和推理能力,在EmbodiedBench上超越GPT-4o-mini 21.33%。

Journal ref Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), pp. 2827-2837, IFAAMAS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10507 2026-06-10 cs.AI 新提交 83%

HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning

HIPIF: 面向长视界LLM智能体学习的层次化规划与信息折叠

Juncheng Diao, Zhicong Lu, Peiguang Li, Yongwei Zhou, Changyuan Tian, Qingbin Li, Rongxiang Weng, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出层次化规划与信息折叠方法,通过子目标分解和历史折叠减少长上下文干扰,结合层次化反思和子目标过程奖励,提升LLM在多轮长视界任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08300 2026-06-09 cs.LG 新提交 83%

QueryWeaver: Reliable Multi-Tool Query Execution Planning via LLM-Based Graph Generation

QueryWeaver: 基于LLM图生成的可靠多工具查询执行规划

Aishwarya Chakravarthy, Vidhi Kulkarni, Duen Horng Chau

机构 * School of Computational Science and Engineering, Georgia Institute of Technology, Atlanta, GA, USA(计算科学与工程学院,佐治亚理工学院,亚特兰大,GA,美国)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 提出将自然语言查询转换为结构化图并通过确定性规划器执行的系统,利用深度优先搜索解决跨工具依赖,实现高可靠性查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10448 2026-06-09 cs.CL 版本更新 83%

RECON: Reasoning with Condensation for Efficient Retrieval-Augmented Generation

RECON:基于压缩的推理用于高效检索增强生成

Zhichao Xu, Minheng Wang, Yawei Wang, Wenqian Ye, Yuntao Du, Yunpu Ma, Yijun Tian

机构 * University of Utah(犹他大学) University of Washington(华盛顿大学) George Washington University(乔治·华盛顿大学) University of Virginia(弗吉尼亚大学) Shandong University(山东大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) University of Notre Dame(诺特丹大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出RECON框架,在强化学习搜索代理的多轮推理中插入观察压缩器,通过两阶段课程训练实现上下文压缩,提升训练和推理效率并增强问答性能。

Comments Techinical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07299 2026-06-08 cs.AI 新提交 83%

DuMate-DeepResearch: An Auditable Multi-Agent System with Recursive Search and Rubric-Grounded Reasoning

DuMate-DeepResearch:一种具有递归搜索和基于评分准则推理的可审计多智能体系统

Lingyong Yan, Can Xu, Yukun Zhao, Wenxuan Li, Qingyang Chen, Jiulong Wu, Wenli Song, Xiangnan Li, Weixian Shi, Yiqun Chen, Xuchen Ma, Yuchen Li, Jiashu Zhao, Shuaiqiang Wang, Jianmin Wu, Dawei Yin

机构 * Baidu AI Cloud(百度AI云)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出DuMate-DeepResearch多智能体框架,通过解耦智能体核心与工具生态、引入图动态规划、递归双层执行和基于评分准则的测试时优化,在深度研究基准上取得最优结果。

Comments Technical report by the DuMate Team. 26 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04494 2026-06-04 cs.AI 83%

Beyond Prompt-Based Planning: MCP-Native Graph Planning-based Biomedical Agent System

超越基于提示的规划:基于MCP原生图规划的生物医学智能体系统

Zhangtianyi Chen, Florensia Widjaja, Wufei Dai, Xiangjun Zhang, Yuhao Shen, Juexiao Zhou

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出BioManus系统,通过将异构生物信息学工具编译为标准MCP服务器并构建类型化异构图,实现基于图结构的规划,解决工具混淆和上下文效率问题,在BioAgentBench和LAB-Bench上提升执行准确性和工作流有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25200 2026-06-04 cs.CL 83%

GroupTravelBench: Benchmarking LLM Agents on Multi-Person Travel Planning

GroupTravelBench: 多人群组旅行规划中LLM智能体的基准测试

Xiang Cheng, Yulan Hu, Lulu Zheng, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) AMAP, Alibaba Group(阿里集团AMAP)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 提出GroupTravelBench基准,通过多用户多轮对话任务评估LLM智能体在偏好获取、冲突协调和公平规划三方面的能力。

Comments work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13272 2026-06-04 cs.CL 83%

Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation

超越正确性:在检索增强生成中奖励忠实推理

Zhichao Xu, Zongyu Wu, Yun Zhou, Aosong Feng, Kang Zhou, Sangmin Woo, Kiran Ramnath, Yijun Tian, Xuan Qi, Weikang Qiu, Lin Lee Cheong, Haibo Ding

机构 * AWS AI Fundamental Research(AWS人工智能基础研究) The Pennsylvania State University(宾夕法尼亚州立大学) Yale University(耶鲁大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出VERITAS框架,通过细粒度轮次级忠实性奖励强化学习,提升检索增强生成中推理步骤的忠实性,同时改善任务性能。

Comments TMLR Camera Ready Update

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01046 2026-06-02 cs.AI 83%

TravelEval: A Comprehensive Benchmarking Framework for Evaluating LLM-Powered Travel Planning Agents

TravelEval:评估基于LLM的旅行规划代理的综合基准框架

Weiyi Chen, Shuaixiong Wang, Ziyun Gao, Kaichun Hu, Wangze Ni, Shimin Di, Chen Jason Zhang, Lei Chen

机构 * Zhejiang University(浙江大学) Hong Kong Polytechnic University(香港理工大学) Southeast University(东南大学) HKUST (GZ) & HKUST Guangzhou(香港科技大学(广州)& 香港科技大学(广州))

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 针对现有基准过度关注约束合规、缺乏真实性和多维评估的问题,提出TravelEval,通过六维评估框架、真实数据沙盒和模拟全局评估方法,全面评估LLM在旅行规划中的表现。

Comments 31pages, 8 figures, accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30924 2026-06-01 cs.CL 83%

EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents

EMBGuard:为具身智能体安全规划构建危险感知护栏

Dongwook Choi, Taeyoon Kwon, Bogyung Jeong, Minju Kim, Yeonjun Hwang, Hyojun Kim, Byungchul Kim, Young Kyun Jang, Jinyoung Yeo

机构 * Independent Researcher(独立研究者) Department of Biomedical Engineering(生物医学工程系) the Department of Intelligent Precision Healthcare Convergence, Sungkyunkwan University(智能精准医疗融合系,全州大学) Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 提出首个基于MLLM的具身安全护栏EMBGuard,通过解耦物理风险推理与智能体策略,评估(视觉观察,动作)对来识别危险配置并提供自然语言解释,同时构建训练数据集EMBHazard和基准测试EMBGuardTest,在紧凑模型尺寸下达到与专有MLLM竞争的性能并降低误报率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28144 2026-05-28 cs.AI 83%

Deconstructing Spatial Complexity: Hierarchical Decomposition for LLM Spatial Reasoning

解构空间复杂性:用于LLM空间推理的层次分解

Yi Wang, Haojie Lu, Zhaofan Zhang, Li Chen, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出一种层次任务分解方法,结合MCTS引导的组相对策略优化(M-GRPO),通过改进中间状态选择和规划能力,显著提升LLM在导航、规划和策略游戏等空间任务中的表现。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27957 2026-05-28 cs.CL 83%

DisasterBench: Benchmarking LLM Planning under Typed Tool Interface Constraints

DisasterBench: 在类型化工具接口约束下基准测试LLM规划

Zhitong Chen, Kai Yin, Weifeng Zhang, Zhiyuan Wang, Xiangjue Dong, Chengkai Liu, Zhewei Liu, Yiming Xiao, Ali Mostafavi, James Caverlee

机构 * Texas A&M University(德克萨斯A&M大学) University of Toronto(多伦多大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 提出DisasterBench基准,通过类型化工具接口评估LLM在灾害响应中的结构化多智能体规划能力,并引入首次故障点(FPoF)方法进行步骤级故障归因,揭示语义推理与执行约束之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27935 2026-05-28 cs.AI 83%

Do Agents Think Deeper? A Mechanistic Investigation of Layer-Wise Dynamics in Sequential Planning

智能体思考得更深吗?顺序规划中层间动力学的机制研究

Zhenyu Cui, Xiangzhong Luo

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 通过残差流探针、因果层跳跃干预和有效深度测量,研究了大型语言模型在自主智能体任务(多轮规划、工具使用、迭代状态更新)中层间动态的差异,发现智能体推理表现出与静态任务不同的深度分布,随着轨迹展开,模型逐步招募更多更深层,且后期出现更强的长距离层间依赖,同时残差更新从稳定特征积累转向重复校准,有效深度分析揭示了语义方向形成较早而深层对稳定最终输出仍必要的构建-精炼差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27896 2026-05-28 cs.CL cs.CE 83%

FinBoardBench: Benchmarking Dynamic Wealth Management and Strategic Financial Reasoning of LLMs via Board Game Simulations

FinBoardBench: 通过棋盘游戏模拟基准测试大语言模型的动态财富管理和战略金融推理

Xuesi Hu, Peng Wang, Jinpeng Miao, Xilin Tao, Caiwei Li, Yue Ma, Jie He, Qiancheng Zhang, Yuntao Zou, Dagang Li

机构 * School of Computer Science and Engineering, Macau University of Science and Technology, Macau, China(1 计算机科学与工程学院,澳门科技大学,澳门,中国) School of Economics, Anhui University, Anhui, China(2 经济学院,安徽大学,安徽,中国) SKLPlanets, Macau University of Science and Technology, Macau, China(3 SKLPlanets,澳门科技大学,澳门,中国) Department of Computer and Information Science, University of Macau, Macau, China(4 计算机与信息科学系,澳门大学,澳门,中国) School of Energy and Power Engineering, Huazhong University of Science and Technology, Hubei, China(5 能源与动力工程学院,华中科技大学,湖北,中国)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 提出基于三款经典金融棋盘游戏的评估套件FinBoardBench,测试大语言模型在动态财富管理、企业投资收购和竞争谈判等综合金融技能,发现模型虽具备基本规划能力但无法将静态推理转化为成功动态决策。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27378 2026-05-28 cs.CL cs.CV cs.MA 83%

OralAgent: Integrating Reasoning, Tools, and Knowledge for Interactive Dental Image Analysis

OralAgent: 融合推理、工具与知识的交互式牙科影像分析

Jing Hao, Siyuan Dai, Yongxin Zhang, Yuci Liang, Jiamin Wu, Jiahao Bao, Yuxuan Fan, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Ming Hu, Liang Zhan, James Kit Hon Tsoi, Linlin Shen, Junjun He, Kuo Feng Hung

机构 * Faculty of Dentistry, the University of Hongkong, Hong Kong SAR, China(香港大学牙科学院,中国香港特别行政区) Department of Electrical and Computer Engineering, University of Pittsburgh, Pittsburgh, PA, USA(匹兹堡大学电气与计算机工程系,美国宾夕法尼亚州匹兹堡) Shenzhen University, China(深圳大学,中国) Department of Craniomaxillofacial Surgery, Shanghai Ninth People’s Hospital, China(上海第九人民医院口腔颌面外科部,中国) Nanyang technological University, Singapore(南洋理工大学,新加坡) School of Biomedical Engineering, Southern Medical University, China(南方医科大学生物医学工程学院,中国) Singapore University of Technology and Design, Singapore(新加坡科技设计大学,新加坡) University of Auckland, new zealand(奥克兰大学,新西兰) Shanghai Artificial Intelligence Laboratory , China(上海人工智能实验室,中国)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 提出首个牙科专用AI智能体OralAgent,通过集成22种视觉分析工具和368本经典牙科教科书,实现多模态推理、工具决策与知识检索的自动化框架,在多个基准上达到最优性能。

Comments 14 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25480 2026-05-27 cs.CL 83%

Retrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki

检索即推理:通过LLM-Wiki实现自我进化的智能体原生检索

Haoliang Ming, Feifei Li, Xiaoqing Wu, Wenhui Que

机构 * Tencent Inc.(腾讯公司)

专题命中 规划推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL

AI总结 提出LLM-Wiki系统,将外部知识组织为可编译、可组合、自进化的Wiki页面,通过工具调用接口实现搜索、阅读和链接跟踪操作,并引入错误簿进行持续自纠正,在多项多跳问答基准上取得最优结果。

Comments 15 pages, 3 figures, 10 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏