arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-10 至 2026-08-10 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 32 篇

2608.06811 2026-08-10 cs.SE cs.AI 新提交 83%

Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution

在软件问题解决的大语言模型智能体中耦合规划与情景记忆

Jiahao Zhang, Yifan Zhang, Yu Huang

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出PMCoder智能体,通过双向耦合分层阶段规划器与情景记忆解决软件问题,在SWE-bench Verified等数据集上显著提升问题解决能力,且性能可迁移至其他场景。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06702 2026-08-10 cs.MA cs.AI cs.RO 新提交 83%

Scalable Long-Horizon Planning with Staggered Updates for Lifelong MAPF

面向终身多智能体路径发现(LMAPF)的、采用交错更新机制的可扩展长时程规划

Vaibhav Sanjay, Jiaoyang Li

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 该研究针对通用地图的终身多智能体路径发现问题,提出PUSH规划器,结合多种框架优势实现可扩展长时程规划,在10k智能体场景下吞吐量优于基线方法

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06751 2026-08-10 cs.CV cs.AI 新提交 79%

Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation

超越《星夜》:面向艺术家基础的文本到图像生成的捷径感知控制状态规划

Kuan Xing, Ye Wang, Changyi Gan, Yuheng Li, Thao Nguyen, Yi Chang, Yilin Wang

机构 * Jilin University(吉林大学) Adobe(奥多比公司) University of Wisconsin(威斯康星大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对艺术家基础的文本到图像生成存在的捷径偏差问题,提出 Atelier 框架,结合 ArtIntentBench 基准测试,提升了风格保真度与结构保留度,减少了捷径替换。

Comments 47 pages, 13 figures, including appendices. Kuan Xing and Ye Wang contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06741 2026-08-10 cs.LG cs.GT 新提交 79%

Solver-Guided Reasoning for Mixed-Equilibrium Strategies

求解器引导的混合策略均衡推理

Han Wang, Philippe Beardsell, Boning Li, Aaron Sasmita, Shuai Li, Hongyuan Zha, Baoxiang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) GTO Wizard Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Vector Institute(向量研究所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本研究提出混合策略决策树(MDT),用求解器输出引导LLM在博弈中的均衡推理,在无限制德州扑克8种LLM配置下,将与均衡的L1距离降低52.6%,且策略可移植性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06714 2026-08-10 cs.AI 新提交 79%

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

优化器即智能体:跨提示、程序与机器学习工作流的推理驱动搜索

Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Snowflake(思诺飞克公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出ReASearch统一框架,让智能体自主优化提示、程序与ML工作流,在14项任务中优于专用系统,部分发现超人类最佳结果的方案。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06530 2026-08-10 cs.AI 新提交 79%

KNOWPLAN: Knowledge-Driven AI Agents for Smart Degree Pathway Planning

KNOWPLAN:用于智能学位路径规划的知识驱动型AI智能体

Shuheng Cao, Weijia Zhang, Jiaqi Wu, Xiyun Hu, Yat Yang, Juqy Chen, Zhaoxiang Feng

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 KnowPlan将学位路径规划拆分为提取与优化阶段,CatalogBrowse负责课程爬取解析,DegreeMap基于超图优化,在多赛道实验中实现了高召回率、可行性与效用提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19592 2026-08-10 cs.AI cs.RO 79%

Adaptive Domain Modeling with Language Models: A Multi-Agent Approach to Task Planning

Harisankar Babu, Philipp Schillinger, Tamim Asfour

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

Comments Accepted at IEEE CASE 2025, 8 pages, 8 figures

Journal ref 2025 IEEE 21st International Conference on Automation Science and Engineering (CASE), 2025, pp. 1701-1708

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07077 2026-08-10 cs.AI cs.LG 新提交 79%

Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking

Transformer难以利用其涌现的世界模型:重新审视汉诺塔与思维的错觉

Devin Pereira, Willem Zuidema

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究发现,Qwen3.6-27B等大型推理模型虽能编码汉诺塔的谢尔宾斯基世界模型,但因表示衰减导致圆环数超3时失败,注入提示词时间表示可部分恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07361 2026-08-10 cs.RO cs.CV 新提交 78%

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model

驾驶视觉-语言-动作模型中规划 token 的深度探测与剪枝

Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell

机构 * Robert Bosch GmbH(罗伯特·博世有限公司) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文针对驾驶 VLA 模型的规划 token,通过探测其 32 个解码器层的信号并剪枝部分层,在误差小幅增加下实现 1.33 倍解码器加速,验证了规划信息早期存在但格式适配问题。

Comments Accepted at the 6th DriveX Workshop (Foundation Models for Autonomous Driving), ECCV 2026. 14 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06829 2026-08-10 cs.SE 新提交 78%

How Reasoning Shapes Social Bias in LLM-Generated Code?

推理如何塑造大语言模型生成代码中的社会偏见?

Weifeng Sun, Jieke Shi, Zhou Yang, Yuchen Chen, Hongyan Li, Meng Yan, David Lo

专题命中 规划推理 :reasoning(title,abstract)

AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00829 2026-08-10 cs.RO 版本更新 78%

GeminiPainter's sequence-formed pipeline comprised of perception, cognition, planning, and action stages

GeminiPainter的序列式流程由感知、认知、规划和行动阶段组成

Miguel Altamirano Cabrera, Aleksey Fedoseev, Iana Zhura, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯科尔科沃科学技术学院)

专题命中 规划推理 :planning(title,abstract)

AI总结 该研究提出自主机器人肖像生成系统,整合多技术实现绘画,经实验获用户高分评价,产出可识别且具吸引力的机器人肖像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19491 2026-08-10 cs.CV 版本更新 78%

Thinking in Scales: Accelerating Gigapixel Pathology Image Analysis via Adaptive Continuous Reasoning

尺度思考:通过自适应连续推理加速千兆像素病理图像分析

Jiusong Ge, Yingkang Zhan, Wenjie Zhao, Di Zhang, Ke Wang, Jiashuai Liu, Chunze Yang, Chengzu Li, Jian Zhang, Yuxin Dong, Ni Zhang, Qidong Liu, Mireia Crispin-Ortuzar, Huazhu Fu, Chen Li, Zeyu Gao

机构 * School of Computer Science(计算机科学学院) Technology, Xi’an Jiaotong University, Xi’an, China(技术学院,西安交通大学,西安,中国) Department of Transmedia Art, Xi’an Academy of Fine Arts, Xi’an, China(多媒体艺术系,西安美术学院,西安,中国) Department of Oncology, University of Cambridge, Cambridge, U.K.(肿瘤学系,剑桥大学,剑桥,英国) Language Technology Lab, University of Cambridge, Cambridge, U.K.(语言技术实验室,剑桥大学,剑桥,英国) Institute of High Performance Computing, Agency for Science, Technology(高性能计算研究所,科技研究局)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 提出PathCTM模型,通过动态尺度切换和注意力引导的区域剪枝实现高效连续推理,大幅减少计算开销并保持诊断性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06668 2026-08-10 cs.AI 新提交 74%

Vehicle routing problem using deep reinforcement learning - A case study about truck planning in the industry

基于深度强化学习的车辆路径问题——工业中卡车规划的案例研究

Siliang Lu, Dan Hu, Lili Wu

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) School of Electronic Information and Electrical Engineering(电子信息与电气工程学院) School of Computer Science, Macau University of Science and Technology(澳门科技大学计算机学院)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 本文以工业卡车规划为案例,针对三个物流场景,提出基于深度强化学习的车辆路径优化方法,其优化后路径总成本较基线降低10%以上,还提出可将该算法推广至更多VRP变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07148 2026-08-10 cs.AI 新提交 70%

A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing

面向智能制造中大型语言模型增强的多智能体强化学习(MARL)中心参考架构

Fouad Bahrpeyma, Dirk Reichelt

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文针对智能制造自适应控制的耦合需求,提出以MARL为中心的三层参考架构,探讨LLM在MARL中的附着点,明确传统MARL与LLM组件的适配场景,为相关研究提供结构化框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06699 2026-08-10 cs.AI cs.CV 新提交 70%

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

AgentPatch:用于合并智能体多模态大语言模型的由粗到细弱任务修复

Zibo Shao, Baochen Xiong, Chengdong Xu, Linhui Xiao, Kaichen Li, Haoran Gong, Yan Li, Yaguang Song, Xiaoshan Yang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对智能体多模态大语言模型合并时的弱任务退化与关键行为遗忘问题,提出无需训练的AgentPatch框架,通过由粗到细修复实现能力平衡,提升合并模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06474 2026-08-10 cs.AI 新提交 70%

WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader

WebGrader:利用自演化程序化评分器训练用于网页开发的大语言模型

Boshui Chen, Huiping Liu, Shaolei Zhang

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 本研究提出自演化程序化评分器WebGrader,通过分离测试规划等环节生成准确奖励,训练8B策略在WebGen-Bench、WG-core-250数据集上的功能成功率及得分优于多款大语言模型。

Comments 17 pages, 3 figures. Supplementary material is included in the main PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06701 2026-08-10 cs.SE cs.AI cs.CL cs.LG 新提交 67%

Online Monitoring and Corrective Steering of Programming Agents

编程智能体的在线监控与纠正引导

Shuyang Liu, Saman Dehghan, Ji Young Kim, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LivePlan,通过解耦判断与建议的设计,在SWE-agent基础上实现编程智能体的在线监控与纠正,在SWE-bench数据集上显著提升问题解决率,且成本增量极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06651 2026-08-10 cs.CR cs.SE 新提交 67%

CyberLLM: A Multi-Agent LLM Framework for Autonomous Detection and Guarded Response in Automotive Cybersecurity

CyberLLM:面向汽车网络安全的多智能体大语言模型框架,用于自主检测与受管控响应

Nenad Petrovic, Oussama Jeddou, Feres Ben Fraj, Vahid Zolfaghari, Fengjunjie Pan, Andre Schamschurko, Alois Knoll

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 CyberLLM是由大语言模型编排的多智能体框架,结合确定性检测层与大语言模型精化,在安全防护下实现汽车漏洞自主检测与修复,在基准测试中覆盖约70%漏洞且零误报,验证了LLM智能体自主防御的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00028 2026-08-10 cs.CL cs.AI cs.LG cs.SI 版本更新 67%

Harnessing the Synergy between LLM Agents and Knowledge Graphs for Urban Socioeconomic Prediction

利用大语言模型智能体与知识图谱的协同作用进行城市社会经济预测

Zhilun Zhou, Jingyang Fan, Yu Liu, Fengli Xu, Depeng Jin, Yong Li

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出LLM智能体与知识图谱的协同框架,结合二者优势完成城市社会经济预测,经实验验证该协同设计可提升预测效果,为跨任务信息共享提供思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07037 2026-08-10 cs.LG cs.AI 新提交 62%

Accounting Graph Transformer for Short-History Multi-KPI Forecasting in Small Businesses

用于小企业短历史多KPI预测的会计图变换器

Shrutendra Harsola, Vignesh Subrahmaniam

机构 * Foresight-AI, Intuit(富睿特远见人工智能实验室,Intuit公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出Accounting Graph Transformer模型,针对小企业短历史数据完成13项财务KPI的12个月联合预测,在多组测试集上均优于LightGBM等基准模型,为企业财务分析提供集成预测层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07214 2026-08-10 cs.DB cs.AI cs.SY eess.SY 新提交 57%

Toward a Causal Data Management Ecosystem for Decision Making and Agentic AI

面向决策与智能体AI的因果数据管理生态系统

Dazhuo Qiu, Yingli Zhou, Amedeo Pachera, Angela Bonifati, Andrea Mauri

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对AI生态系统决策混杂问题,提出构建共享可查询的因果世界系统(CWS),为面向决策与智能体AI的因果数据管理生态系统提供支持。

Comments Accepted at ACM AI Leadership Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07193 2026-08-10 cs.LG cs.CV 新提交 57%

An AI4AI Framework for Visual Token Pruning

用于视觉令牌剪枝的AI4AI框架

Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07107 2026-08-10 cs.AI 新提交 57%

MemWM: Memory-Augmented Text-Based World Model

MemWM:记忆增强的基于文本的世界模型

Yujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye, Boliang Liu, Sikuan Yan, Shuning Wang, Xuebing Zhou, Sören Pirk, Hinrich Schütze, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Huawei Heisenberg Research Center(华为海森堡研究中心) Zhejiang University(浙江大学) Technical University of Munich (TUM)(慕尼黑工业大学) TU Berlin(柏林工业大学) Kiel University(基尔大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出记忆增强的基于文本的世界模型MemWM,通过引入世界记忆解决世界模型的系统性预测错误,在ALFWorld等基准上提升智能体规划成功率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11953 2026-08-10 cs.LG 版本更新 57%

When Does Reward Teach State? A Hidden-Automaton Instrument and a Group-Language Warning Signal

奖励何时能引导对状态的理解?一种隐藏自动机工具与群语言边界

James E. Allchin

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 研究强化学习中高奖励与潜在状态理解的关系,通过将任务表示为隐藏自动机,利用三个可控轴(优化器强度、任务结构、观察信息量)来分别测量奖励成功和潜在状态学习,区分感知差距和规划差距,得出高奖励非任务理解证据且智能体恢复潜在状态可预测的结论。

Comments 17 pages, 3 figures, 6 tables (9-page main text). Ancillary file hidden-automata-rl-code.zip contains reproduction code and the complete per-run data behind every table and figure. v3: author name corrected, title revised, text rewritten for clarity, new robustness checks (nonlinear and off-policy probes) added; results and conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25220 2026-08-10 cs.AI 版本更新 57%

DATAREEL: Automated Data-Driven Video Story Generation with Animations

DATAREEL:基于动画的自动化数据驱动视频故事生成

Ridwan Mahbub, Syem Aziz, Mizanur Rahman, Mahir Ahmed, Shadikur Rahman, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Bangladesh University of Business and Technology(孟加拉国商业与技术大学) RBC, Canada(加拿大RBC) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出DataReel基准,通过328个真实故事评估模型生成动画数据视频故事的能力,采用多智能体框架提升自动化生成效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07051 2026-08-10 cs.CV 新提交 50%

YOLO-PEFT: Parameter-Efficient Fine-Tuning on YOLO Family

YOLO-PEFT:针对YOLO系列的参数高效微调

Xu Lin, WenJie Nie, Jinlong Peng, Weifu Fu, YueXiao Ma, Xiawu Zheng, Yong Liu

专题命中 规划推理 :planning(abstract)

AI总结 YOLO-PEFT是一种针对YOLO系列的结构感知参数高效微调框架,将适配器部署建模为约束规划问题,在VOC数据集上的实验显示其检测精度优于全微调,且能减少训练内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06789 2026-08-10 cs.NI 新提交 50%

EvoRIC: Reinforcement Learning Fine-Tuned LLM-empowered RAN Intelligent Control Toward Autonomous O-RAN

EvoRIC:面向自主O-RAN的、由强化学习微调大语言模型赋能的RAN智能控制器

Lingyan Bao, Jemin Lee, Tony Q. S. Quek

专题命中 规划推理 :reasoning(abstract)

AI总结 针对传统RAN智能算法泛化差、通用LLM算力高且缺领域知识的问题,提出EvoRIC分层框架,结合RLFT与PPO优化LLM,在IAB网络中验证其泛化性与效能,为自主O-RAN提供新方案。

Comments Manuscript submitted 23 April 2026; revised 7 August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06648 2026-08-10 cs.RO 新提交 50%

Plan-and-Avoid: Real-Time Aircraft Trajectory Coordination in a Multi-Agent Environment

规划与避让:多智能体环境下的实时飞行器轨迹协调

Huseyin Emre Tekaslan, Ella M. Atkins, Natasha Neogi

机构 * Virginia Polytechnic Institute and State University(弗吉尼亚理工学院暨州立大学) NASA Langley Research Center(NASA兰利研究中心)

专题命中 规划推理 :planning(abstract)

AI总结 该研究提出Plan-and-Avoid框架,针对多智能体空域环境,通过实时生成协作建议,在900余起强制着陆案例测试中,以5.7秒最坏响应时间实现优先级轨迹的低延迟安全间隔协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06525 2026-08-10 math.GN 新提交 50%

A Precise Treatment of Soft Quotient Topology and Soft Covering Maps

软商拓扑与软覆盖映射的精确处理

Souvik Mandal, Ankur Sarkar

专题命中 规划推理 :planning(abstract)

AI总结 该研究建立软商拓扑基础理论,提出软覆盖映射精确定义,将其应用于多智能体运动规划以降低组合复杂性。

Comments 18 Pages. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06771 2026-08-10 physics.soc-ph 新提交 50%

Agentic Artificial Intelligence for Reproducible Human-in-the-Loop Environmental Health Research

用于可复现人在环环境健康研究的智能体式人工智能

Edmund Seto

专题命中 规划推理 :planning(abstract)

AI总结 本文提出人在环智能体框架,结合领域知识与编码素养,利用智能体式大语言模型生成R代码,通过美国超级基金场地案例验证其可提升环境健康研究结果的严谨性与可复现性。

Comments 41 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏