arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-03 至 2026-04-03 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 19 篇

2604.01681 2026-04-03 cs.RO cs.AI 88%

Bridging Large-Model Reasoning and Real-Time Control via Agentic Fast-Slow Planning

通过代理快慢规划弥合大模型推理与实时控制

Jiayi Chen, Shuai Wang, Guangxu Zhu, Chengzhong Xu

机构 * Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong (Shenzhen)(深圳市大数据研究院,香港中文大学(深圳)) Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究院) State Key Laboratory of Internet of Things for Smart City (SKL-IOTSC), University of Macau(澳门大学智慧城市物联网国家重点实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 本文提出一种分层框架,通过感知-决策-轨迹-控制的分离,提升自动驾驶系统在扰动下的鲁棒性,减少侧向偏移和完成时间。

Comments 8 pages, 12figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01765 2026-04-03 cs.CV cs.AI cs.RO 83%

DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning

DriveDreamer-Policy: 一种基于几何的世界-动作模型用于统一生成与规划

Yang Zhou, Xiaofeng Wang, Hao Shao, Letian Wang, Guosheng Zhao, Jiangnan Shao, Jiagang Zhu, Tingdong Yu, Zheng Zhu, Guan Huang, Steven L. Waslander

机构 * GigaAI University of Toronto(多伦多大学) CUHK MMLab(香港中文大学多媒体实验室)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出DriveDreamer-Policy,结合深度生成、未来视频生成与运动规划,通过几何感知的世界表示提升生成与规划的连贯性与准确性。

Comments 11 pages, 4 figures; Project Website: https://drivedreamer-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02190 2026-04-03 cs.CV cs.RO 82%

UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving

UniDriveVLA: 联合理解、感知与行动规划以实现自动驾驶

Yongkang Li, Lijun Zhou, Sixu Yan, Bencheng Liao, Tianyi Yan, Kaixin Xiong, Long Chen, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) SKL-IOTSC, University of Macau(澳门大学智慧城市物联网国家重点实验室)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 UniDriveVLA通过专家解耦和三阶段训练策略,解决自动驾驶中感知与推理的冲突,实现空间感知与语义推理的统一,取得nuScenes和Bench2Drive的优异性能。

Comments code has been released at https://github.com/xiaomi-research/unidrivevla

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02006 2026-04-03 cs.AI 79%

ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic Reasoning

ProCeedRL: 带探索演示的强化学习过程批评用于LLM代理推理

Jingyue Gao, Yanjiang Guo, Xiaoshuai Chen, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Independent Researcher(独立研究者) Shanghai Qizhi Institute(上海期智研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ProCeedRL,通过过程批评和探索性演示提升LLM在多轮代理任务中的推理能力,解决探索过程中错误累积问题,提高探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01896 2026-04-03 cs.AI 79%

Bayesian Elicitation with LLMs: Model Size Helps, Extra "Reasoning" Doesn't Always

基于LLM的贝叶斯 elicitation:模型大小有帮助,额外“推理”并不总有效

Luka Hobor, Mario Brcic, Mihael Kovac, Kristijan Poje

机构 * University of Zagreb Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了LLM在贝叶斯 elicitation中的表现,发现更大模型更准确,但增加推理不总是有帮助。所有模型严重过度自信,95%置信区间覆盖真实值比例远低于预期,统计校准技术可修正此问题。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18649 2026-04-03 cs.CR cs.AI 79%

PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality

PRISM:面向多模态集成安全的原理化推理对齐

Nanxi Li, Zhengyue Zhao, G. Edward Suh, Marco Pavone, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 PRISM通过结构化四阶段推理过程,有效应对多模态安全违规,提升VLM的鲁棒性与安全性,同时保持模型实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09219 2026-04-03 cs.LG 74%

Planning in Branch-and-Bound: Model-Based Reinforcement Learning for Exact Combinatorial Optimization

在分支定界中的规划:基于模型的强化学习用于精确组合优化

Paul Strang, Zacharie Alès, Côme Bissuel, Olivier Juan, Safia Kedad-Sidhoum, Emmanuel Rachelson

专题命中 规划推理 :planning(title);分类 cs.LG

AI总结 本文提出PlanB&B,一种基于模型的强化学习方法,用于改进分支定界中的分支策略,通过在四个标准MILP基准上优于现有方法的实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02226 2026-04-03 cs.AI cs.LG 73%

When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learning

何时提问:用于强化学习的不确定性门控语言帮助

Juarez Monteiro, Nathan Gavenski, Gianlucca Zuin, Adriano Veloso

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ASK方法,通过结合小型语言模型和训练好的RL策略,提升模型在分布外任务中的泛化能力,通过不确定性门控机制选择性利用语言模型进行决策,实验显示其在迁移任务中表现稳健。

Comments In Proceedings of International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09724 2026-04-03 cs.CL cs.AI 73%

Syntactic Framing Fragility: An Audit of Robustness in LLM Ethical Decisions

句法框架脆弱性:LLM伦理决策稳健性审计

Katherine Elkins, Jon Chun

机构 * Integrated Program in Humane Studies / AIColab(人文研究综合项目 / AIColab) Computing, Kenyon College(凯尼恩学院计算系)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Syntactic Framing Fragility框架,用于量化LLM在逻辑等价句法变换下的决策一致性,发现开源模型在高风险决策中表现更脆弱,且否定性语法是主要失效模式。

Comments 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01594 2026-04-03 cs.AI 70%

Do Large Language Models Mentalize When They Teach?

大型语言模型在教学时是否具备心智化能力?

Sevan K. Harootonian, Mark K. Ho, Thomas L. Griffiths, Yael Niv, Ilia Sucholutsky

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究通过控制任务探讨LLM教学决策机制,发现LLM在教学策略上与人类相似,但Bayes-Optimal模型最佳解释其选择,提示提示合规性不等于教学效果提升。

Comments 9 pages, 5 figures. Workshop paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01195 2026-04-03 cs.CL cs.AI cs.IR 62%

ORBIT: Scalable and Verifiable Data Generation for Search Agents on a Tight Budget

ORBIT:在有限预算下为搜索代理可扩展且可验证的数据生成

Nandan Thakur, Zijian Chen, Xueguang Ma, Jimmy Lin

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ORBIT数据集,通过低成本框架生成20000个需多步推理的查询,用于训练搜索代理,实验表明其在维基百科问答中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02211 2026-04-03 cs.IR cs.AI cs.MA 57%

Multi-Agent Video Recommenders: Evolution, Patterns, and Open Challenges

多智能体视频推荐系统:演进、模式与开放挑战

Srivaths Ranganathan, Abhishek Dharmaratnakar, Anushree Sinha, Debanshu Das

机构 * Google LLC(谷歌公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨多智能体视频推荐系统的演进、协作模式及挑战,分析了从早期MARL到LLM驱动架构的发展,并提出可扩展性、多模态理解等开放问题。

Comments Accepted for publication in The Nineteenth ACM International Conference on Web Search and Data Mining (WSDM Companion 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01664 2026-04-03 cs.AI 57%

ContextBudget: Budget-Aware Context Management for Long-Horizon Search Agents

ContextBudget: 长时间 horizon 搜索代理的预算感知上下文管理

Yong Wu, YanZhao Zheng, TianZe Xu, ZhenTao Zhang, YuanQiang Yu, JiHuai Zhu, Chao Ma, BinBin Lin, BaoHua Dong, HangCheng Zhu, RuoHui Huang, Gang Yu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BACM方法,通过预算约束的序列决策问题管理上下文,结合BACM-RL强化学习方法,在多目标问答和长时间网页浏览任务中优于现有方法,尤其在高复杂度场景下表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01630 2026-04-03 cs.CL 57%

Grounding AI-in-Education Development in Teachers' Voices: Findings from a National Survey in Indonesia

将教育中的AI发展扎根于教师的声音:来自印度尼西亚全国调查的结果

Nurul Aisyah, Muhammad Dehan Al Kautsar, Arif Hidayat, Fajri Koto

机构 * Quantic School of Business and Technology(昆蒂克商业与技术学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Indonesia University of Education(印度尼西亚教育大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 研究通过全国性调查揭示印尼教师对AI在教育中的应用现状,发现AI在教学、内容开发和教学媒体中日益普及,但应用不均,教师更倾向于利用AI减轻教学准备负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01535 2026-04-03 cs.CL 57%

Read More, Think More: Revisiting Observation Reduction for Web Agents

多读多想:重新审视网络代理中的观察缩减

Masafumi Enomoto, Ryoma Obara, Haochen Zhang, Masafumi Oyamada

机构 * NEC Corporation(日本电气股份有限公司)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文研究网络代理中观察缩减的优化问题,发现模型能力和思考token预算影响观察表示选择,高能力模型适合详细HTML观察,低能力模型适合紧凑的访问树观察,同时引入diff-based表示提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29353 2026-04-03 cs.AI 57%

Nomad: Autonomous Exploration and Discovery

Nomad:自主探索与发现

Bokang Jia, Samta Kamboj, Satheesh Katipomu, Seung Hun Han, Neha Sengupta, Andrew Jackson

机构 * Inception, G42(G42 的 Inception) G42 MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划推理 :verifier(abstract);分类 cs.AI

AI总结 Nomad通过探索优先架构,构建领域探索地图,系统遍历以平衡广度与深度,生成并验证假设,最终生成可信报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01915 2026-04-03 cs.CV 50%

Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts

通过知识引导的空间提示增强医学视觉 grounding

Yifan Gao, Tao Zhou, Yi Zhou, Ke Zou, Yizhe Zhang, Huazhu Fu

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Yong Yoo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出KnowMVG框架,通过知识增强提示和全局局部注意力机制提升医学视觉 grounding的精度,实验显示在四个基准上优于现有方法。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02289 2026-04-03 cs.DB 50%

Multi-Objective Agentic Rewrites for Unstructured Data Processing

多目标代理重写用于无结构数据处理

Lindsey Linxi Wei, Shreya Shankar, Sepanta Zeighami, Yeounoh Chung, Fatma Ozcan, Aditya G. Parameswaran

专题命中 规划推理 :planning(abstract)

AI总结 MOAR通过引入新的指令类别和全局搜索算法,提升DocETL在准确性和成本上的优化能力,实现更高的准确性并匹配最佳成本。

Comments 24 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00911 2026-04-03 cs.SE 50%

Foundation Models for Autonomous Driving System: An Initial Roadmap

自动驾驶系统中的基础模型:初步路线图

Xiongfei Wu, Mingfei Cheng, Xiaoning Ren, Qiang Hu, Jianlang Chen, Yuheng Huang, Maxime Cordy, Yao Zhang, Xiaofei Xie, Lei Ma, Yves Le Traon

专题命中 规划推理 :reasoning(abstract)

AI总结 本文探讨了基础模型在自动驾驶系统中的应用,分析了在基础设施、车载集成和实际部署三个维度中的现状、挑战和研究方向,旨在为构建安全可靠的自动驾驶系统提供指导。

Comments To appear in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏