arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-05 至 2026-03-05 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2603.04158 2026-03-05 cs.RO cs.AI 83%

GarmentPile++: Affordance-Driven Cluttered Garments Retrieval with Vision-Language Reasoning

GarmentPile++: 基于视觉-语言推理的基于 affordance 的杂乱衣物检索

Mingleyang Li, Yuran Wang, Yue Chen, Tianxing Chen, Jiaqi Liang, Zishun Shen, Haoran Lu, Ruihai Wu, Hao Dong

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 GarmentPile++通过结合视觉-语言推理和视觉affordance感知,实现基于语言指令的杂乱衣物安全检索,确保每次检索一件衣物,提升家庭助理机器人任务执行能力。

Comments ICRA2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19524 2026-03-05 cs.CV cs.MA 82%

VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning

VideoChat-M1: 通过多智能体强化学习实现视频理解的协作策略规划

Boyu Chen, Zikang Wang, Zhengrong Yue, Kainan Yan, Chenyun Yu, Yi Huang, Zijun Liu, Yafei Wen, Xiaoxin Chen, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VIVO AI Lab(VIVO人工智能实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Campus of Sun Yat-sen University(孙逸仙大学深圳校区) Shanghai Jiao Tong University(上海交通大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 VideoChat-M1通过多智能体强化学习实现视频理解的协作策略规划,显著提升复杂视频任务的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04289 2026-03-05 cs.LG cs.AI 81%

IPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement Learning

IPD: 通过离线规划蒸馏提升序列策略

Yihao Qin, Yuanfei Wang, Hang Zhou, Peiran Liu, Hao Dong, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 IPD通过引入离线规划蒸馏技术,提升离线强化学习中序列策略的决策稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03406 2026-03-05 cs.SE 79%

Review Beats Planning: Dual-Model Interaction Patterns for Code Synthesis

Review Beats Planning: 双模型交互模式用于代码合成

Jan Miller

专题命中 规划推理 :planning(title,comments);reasoning(abstract)

AI总结 通过双模型交互模式提升代码生成性能,审查优于规划,增强规范质量可进一步提高效果。

Comments 10 pages, 5 figures, 4 tables. Code and results: https://github.com/miller-itsec/review-beats-planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04265 2026-03-05 cs.CV 78%

ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning in Instructional Videos

ViterbiPlanNet: 通过可微Viterbi注入过程性知识以在教学视频中进行规划

Luigi Seminara, Davide Moltisanti, Antonino Furnari

机构 * University of Catania(卡塔尼亚大学) University of Bath(巴斯大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 ViterbiPlanNet通过可微Viterbi层整合过程性知识,实现高效的教学视频规划,提升样本效率和鲁棒性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03290 2026-03-05 cs.CL cs.AI cs.IR cs.LG 75%

AriadneMem: Threading the Maze of Lifelong Memory for LLM Agents

AriadneMem: 为LLM代理梳理终身记忆的迷宫

Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Jingjing Wang, Xuanzhao Dong, Minzhou Huang, Rui Cai, Hejian Sang, Hao Wang, Peijie Qiu, Yueyue Deng, Prayag Tiwari, Brendan Hogan Rappazzo, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Morgan Stanley(摩根大通) Rice University(里奇大学) Clemson University(克莱姆森大学) Northwestern University(西北大学) UC Davis(加州大学戴维斯分校) Iowa State University(爱荷华州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) Columbia University(哥伦比亚大学) Halmstad University(哈马格大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AriadneMem通过解耦的两阶段流程提升LLM代理在长期对话中的多跳和平均F1表现,同时减少运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26905 2026-03-05 cs.AI 70%

Cognition Envelopes for Bounded Decision Making in Autonomous UAS Operations

认知边界用于自主无人机操作中的有限决策

Pedro Antonio Alarcon Granadeno, Arturo Miguel Bernal Russell, Sofia Nelson, Demetrius Hernandez, Maureen Petterson, Michael Murphy, Walter J. Scheirer, Jane Cleland-Huang

机构 * University of Notre Dame(诺特大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出认知边界概念,用于约束自主无人机在搜索救援任务中的决策,结合概率推理和资源分析,以减少 AI 生成决策中的错误。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00225 2026-03-05 cs.SE 67%

Large-scale, Independent and Comprehensive study of the power of LLMs for test case generation

大规模、独立和全面的LLM生成测试用例能力研究

Wendkûuni C. Ouédraogo, Kader Kaboré, Yinghua Li, Haoye Tian, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 规划推理 :reasoning(abstract);CoT(abstract)

AI总结 本研究评估了LLM生成单元测试的可靠性与可维护性,发现基于推理的提示技术提升性能,但幻觉驱动的故障仍需混合方法解决。

Comments Accepted at Empirical Software Engineering (EMSE) journal on 3 March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04257 2026-03-05 cs.CL cs.LG 62%

Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory

Memex(RL): 通过索引经验记忆扩展长周期LLM代理

Zhenting Wang, Huancheng Chen, Jiayun Wang, Wei Wei

机构 * Center for Advanced AI, Accenture(先进人工智能中心,埃森哲)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Memex(RL)通过索引经验记忆机制,实现长周期LLM代理的高效记忆管理,减少信息损失并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03677 2026-03-05 cs.CL cs.AI 62%

MIND: Unified Inquiry and Diagnosis RL with Criteria Grounded Clinical Supports for Psychiatric Consultation

MIND: 一种基于临床标准的统一探究与诊断强化学习框架用于精神病咨询

Guoyi Li, Shihao Xu, Jiatong Ma, Yunyun Han, Jianhua Chen, Yafeng Deng

机构 * EverMind AI Inc.(EverMind AI公司) EverMind AI Inc., Tianqiao and Chrissy Chen Institute(EverMind AI公司、田桥与克里斯西·陈研究所) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心、上海交通大学医学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MIND通过基于临床标准的推理框架提升精神病咨询的诊断准确性和互动质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03296 2026-03-05 cs.CL cs.AI cs.IR 62%

PlugMem: A Task-Agnostic Plugin Memory Module for LLM Agents

PlugMem: 一种通用插件记忆模块用于LLM代理

Ke Yang, Zixi Chen, Xuan He, Jize Jiang, Michel Galley, Chenglong Wang, Jianfeng Gao, Jiawei Han, ChengXiang Zhai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PlugMem是一种通用记忆模块,通过知识中心的记忆图结构提升LLM代理在复杂任务中的记忆检索与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03655 2026-03-05 cs.AI 57%

Mozi: Governed Autonomy for Drug Discovery LLM Agents

Mozi:用于药物发现LLM代理的受控自主性

He Cao, Siyu Liu, Fan Zhang, Zijing Liu, Hao Li, Bin Feng, Shengyuan Bai, Leqing Chen, Kai Xie, Yu Li

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Mozi通过双层架构实现药物发现LLM代理的受控自主性,提升科学推理的可靠性与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22235 2026-03-05 cs.AI 57%

Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation

通过执行反馈强化学习训练高阶调度器以实现长周期GUI自动化

Zehao Deng, Tianjie Ju, Zheng Wu, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出CES多代理框架,通过训练高阶调度器解决GUI代理在长周期任务中的责任耦合和状态管理问题,提升任务规划与执行效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06427 2026-03-05 cs.CL cs.CY 57%

Dutch Metaphor Extraction from Cancer Patients' Interviews and Forum Data using LLMs and Human in the Loop

利用LLM和人机协同从癌症患者访谈和论坛数据中提取荷兰语隐喻

Lifeng Han, David Lindevelt, Sander Puts, Erik van Mulligen, Suzan Verberne

机构 * Biomedical Data Sciences, Leiden University Medical Center(莱顿大学医学中心生物医学数据科学) Leiden Institute of Advanced Computer Science (LIACS), Leiden University(莱顿大学先进计算机科学研究所) Department of Radiation Oncology (MAASTRO), GROW Research Institute for Oncology(肿瘤学研究与生殖学研究所放射肿瘤科)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究利用LLM和人机协同方法,从癌症患者访谈和论坛数据中提取荷兰语隐喻,构建HealthQuote.NL语料库,以支持患者护理和个性化医疗路径设计

Comments Ongoing project report, on behalf of 4D PICTURE https://4dpicture.eu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05854 2026-03-05 cs.AI 57%

Can a Small Model Learn to Look Before It Leaps? Dynamic Learning and Proactive Correction for Hallucination Detection

小模型能否在行动前先观察?动态学习与主动纠正用于幻觉检测

Zepeng Bao, Shen Zhou, Qiankun Pi, Jianhao Chen, Mayi Xu, Ming Zhong, Yuanyuan Zhu, Tieyun Qian

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 LEAP框架通过动态学习和主动纠正机制,提升小模型在幻觉检测中的适应性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03595 2026-03-05 cs.LG 57%

Hybrid Belief Reinforcement Learning for Efficient Coordinated Spatial Exploration

混合信念强化学习用于高效协调空间探索

Danish Rizvi, David Boyle

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出混合信念-强化学习框架,通过双通道知识转移提升多代理空间探索效率,实验显示在无线服务任务中累计奖励和收敛速度均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03390 2026-03-05 cs.RO cs.AI 57%

Multi-Agent-Based Simulation of Archaeological Mobility in Uneven Landscapes

基于多智能体的考古移动性在不规则地形中的模拟

Chairi Kiourt, Vassilis Evangelidis, Dimitris Grigoropoulos

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种多智能体建模框架,用于模拟不规则地形中的考古移动性,通过强化学习实现高效动态适应,展示了地形感知追捕和运输分析的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03617 2026-03-05 cs.CV 50%

RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation

RAGTrack: 基于检索增强生成的语言感知RGBT跟踪

Hao Li, Yuhao Wang, Wenning Hao, Pingping Zhang, Dong Wang, Huchuan Lu

机构 * College of Command and Control Engineering, Army Engineering University of PLA(中国人民解放军陆军工程大学指挥控制工程学院) School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院)

专题命中 规划推理 :reasoning(abstract)

AI总结 RAGTrack通过引入语言指导的检索增强生成框架,解决RGBT跟踪中外观变化和模态间隙问题,实现稳健的目标定位。

Comments This work is accepted by CVPR2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏