arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-11 至 2026-08-11 共收录 69 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 69 篇

2608.09591 2026-08-11 cs.RO cs.CV 新提交 92%

FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving

FactorDrive:面向端到端自动驾驶的、由规划关键因素驱动的自适应多步推理

Guolei Huang, Tengfei She, Yuxuan Lu, Yao Huang, Yuqi Ye, Yongjun Shen

机构 * Southeast University(东南大学) Universiti Malay(马来亚大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 规划推理 :CoT(summary_cn,abstract);reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract)

AI总结 该研究针对现有端到端自动驾驶方法在空间物理证据融合、推理适应及推理路径优化上的不足,提出FactorDrive框架,通过PCF-CoT数据集与QS-GRPO算法优化推理,在两类基准上取得最优规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03538 2026-08-11 cs.LG 版本更新 87%

Online Learnability of Chain-of-Thought Verifiers: Soundness and Completeness Trade-offs

链式思维验证器的在线可学习性:正确性与完备性的权衡

Maria-Florina Balcan, Avrim Blum, Kiriaki Fragkia, Zhiyuan Li, Dravyansh Sharma

机构 * Carnegie Mellon University(卡内基梅隆大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Northwestern University(西北大学)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);planning(abstract);verifier(abstract)

AI总结 本文提出一种在线学习框架,用于学习链式思维验证器,通过检查解决方案的正确性,解决生成器与验证器之间的反馈循环导致的分布偏移问题,并引入新的Littlestone维度扩展以优化验证器的学习。

Comments The abstract has been abridged due to arXiv length constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07954 2026-08-11 cs.AI 新提交 85%

KGCache: Amortized Subgraph Retrieval for KG Reasoning with LLMs

KGCache:基于大型语言模型的知识图谱推理的摊销子图检索

Uros Stanic, Changcheng Yuan, Sabuj Laskar, Ariful Azad

机构 * Texas A&M University(得克萨斯农工大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本研究针对KGQA中重复检索知识图谱邻域的问题,提出兼容ToG与RoG范式的KGCache,经在WebQSP和CWQ上评估,可显著加速知识图谱检索。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14574 2026-08-11 cs.CL cs.AI 版本更新 84%

SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

SIMMER: 基于世界模型评估LLM可执行规划中的潜在故障

Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SIMMER基准,通过人工策划的厨房领域符号世界模型,评估LLM规划中的潜在故障;实验发现前沿模型最多17%无错误计划,56%含潜在故障,多数不可逆;反事实预演可减少72%潜在故障和75%不可逆案例。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09142 2026-08-11 cs.CL 新提交 83%

An Agentic Generative Large Language Model for Treatment Planning of Colorectal Cancer

用于结直肠癌治疗规划的智能体生成式大语言模型

Mengxian Lyu, Cheng Peng, Tim Jang, Ang Li, Mengyuan Zhang, Ziyi Chen, Leighton Elliott, Tianshi Liu, Lidice Galindo, Chiranjeevi Sainatham, Oscar F. Borja-Montes, Kaleb E. Smith, Ying Zhang, Lichao Sun, Jiang Bian, Gloria Lipori, Duane A. Mitchell, Elizabeth A. Shenkman, Yi Guo, Thomas J. George, Yonghui Wu

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 本研究提出智能体生成式大语言模型GatorOnco,经大规模生物医学文本训练与领域适配,在结直肠癌治疗规划的临床评估中性能优于开源LLM,达到专家级水平,可缩小生成式AI在高风险诊疗规划领域的应用差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07585 2026-08-11 cs.CV cs.LG cs.MA 新提交 83%

LAVE: Latent Visual Evidence-Enhanced Planning for Video Tool-use Agents

LAVE:面向视频工具使用智能体的隐式视觉证据增强规划

Zijian Wang, Junnan Zhu, Rongzhen Li, Xiao Liu, Guohui Xiang, Quan Lu, Lijia Liu, Yining Wang, Jiang Zhong, Kaiwen Wei

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 针对视频工具使用智能体的工具观测瓶颈,提出无训练框架LAVE,通过双通道观测接口复用隐式视觉证据,在三个基准数据集上提升了智能体性能,Video-MME得分较最强基线提高3.76分。

Comments 16 pages, 6 figures, 9 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05144 2026-08-11 cs.AI 版本更新 83%

Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks

Argus:面向长程推理的通用智能体运行时

Boxiu Li, Zimo Wen, Yijia Fan, Chuan Wen, Fan Yang, Hangxi Guo, Jiaao Wu, Jiachen Zhang, Junxiang Lei, Mukai Li, Ruize Tang, Runjing Gu, Shibo Hu, Sihan Chen, Sufeng Guo, Wanbo Zhang, Xian Zhang, Xiaoyu Chen, Xuanhe Zhou, Xuyao Huang, Yifei Gao, Yifei Shen, Yilin Chen, Yuheng Wu, Yuzhe Zhang, Zelong Zhao, Zhijie Deng

机构 * Microsoft(微软公司) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Nanjing University(南京大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Donghua University(东华大学)

专题命中 规划推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 Argus是面向长程推理的通用智能体运行时,通过多角色协作与自进化,在多个基准测试中表现优于同类方法,还完成了实际应用任务并产出结构化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23290 2026-08-11 cs.AI 版本更新 83%

RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning

RareLens:通过对齐不同的大语言模型推理实现端到端罕见病护理

Xi Chen, Hongru Zhou, Shiyu Feng, Hanyu Zhou, Huahui Yi, Rongsheng Wang, Tiancheng He, Kun Wang, Pingping Liu, Qiankun Li, Sicheng Lin, Huiying Ou, Xiaohong Zheng, Tianying Zang, Zhuohang Wu, Leheng Jiang, Kexin Cao, Wenhan Zhang, ChengYi Li, Zhiyang Wang, Songlin Li, Benyou Wang, Ningbei Yin, Shaoting Zhang, Weili Fu, Jian Li, Kang Li

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 针对罕见病诊断难题,RareLens系统利用不同大语言模型推理的差异,通过四个协同模块实现全病程临床决策支持,在真实数据集和外部研究中表现出色,证明对齐模型推理是高不确定性临床决策的有效策略。

Comments 100 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27544 2026-08-11 cs.AI cs.FL 版本更新 83%

TempoBench: Reasoning Execution Without Causal Attribution Is Just Simulation

TempoBench:评估大语言模型中的时间因果推理

Nikolaus Holzer, William Fishell, Baishakhi Ray, Mark Santolucito

机构 * Columbia University(哥伦比亚大学) Columbia University, Barnard College(哥伦比亚大学、巴纳德学院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出TempoBench基准,通过合成Mealy机生成可验证的因果标签,评估LLM在时间因果推理中的表现,发现模型在最小因果归因任务上准确率低于25%,主要错误是过度指定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09333 2026-08-11 cs.RO 新提交 82%

DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving

DH-VLM:面向自动驾驶的双时域协同隐层推理框架

Ziyi Song, Chen Xia, Hang Yu, Sheng Zhou, Zhisheng Niu

机构 * Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出DH-VLM双时域协同隐层推理框架,结合基础设施与自车实现非对称语义协同,构建协同QA数据集支撑推理,在规划性能、通信成本等指标上优于现有方法,为协同自动驾驶提供实用鲁棒范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28385 2026-08-11 cs.LG cs.AI cs.NE cs.RO 版本更新 81%

Critic-Free Deep Reinforcement Learning for Maritime Coverage Path Planning on Irregular Hexagonal Grids

无评价深度强化学习用于不规则六边形网格上的海上覆盖路径规划

Carlos S. Sepúlveda, Gonzalo A. Ruz

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种深度强化学习框架,用于在不规则海域的六边形网格上解决覆盖路径规划问题,通过Transformer指针策略自回归构造覆盖路径,并采用无评价组相对策略优化方法,实现高效路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07885 2026-08-11 cs.AI 新提交 80%

Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills

广泛推理,而非深度推理:将推理溢价分摊到提炼技能中

Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi, Sumit Gulwani

机构 * Microsoft(微软公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出将推理模式的重复分摊为跨任务提炼的技能,在四个智能体基准上大幅降低代币量的同时恢复多数推理性能,部分场景下优于推理模式。

Comments COLM 2026 Efficient Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09876 2026-08-11 cs.RO cs.AI 新提交 79%

Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion Planning

用于物理一致性开放世界运动规划的能量结构化潜在世界模型与神经时间场

Yapeng Liu, Yuanzhao Zhai, Bo Ding, Huaimin Wang, Lin Wang

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对开放世界运动规划的物理一致性挑战,提出能量结构化潜在世界模型ELWM,结合物理条件神经时间场PC-NTF,显著提升了运动预测精度与导航成功率,降低了碰撞率与残差。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09524 2026-08-11 cs.CR cs.AI 新提交 79%

STAIR: Effective Incident Response Using an End-to-End Agentic Planning Framework

STAIR:使用端到端智能体规划框架的有效事件响应

Hanlin Jiang, Jionghao Huang, Shaofei Li, Bojia Yu, Peng Jiang, Yuxin Ren, Ning Jia, Yao Guo, Ding Li

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对事件响应规划的静态工作流和现有LLM智能体的不足,提出端到端智能体规划框架STAIR,在100个Docker网络靶场中实现0.94标准化防御得分,较最强基线提升9.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08677 2026-08-11 cs.AI 新提交 79%

Branch2Skill: Efficient Skill Evolution Through Reasoning Trees

Branch2Skill:基于推理树的高效技能演化方法

Yanwei Ren, Haotian Zhang, Likang Xiao, Jiaxing Huang, Jiayan Qiu, Baosheng Yu, Quan Chen, Liu Liu

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Branch2Skill是将推理树转化为密集监督信号的框架,通过蒙特卡洛树搜索提取推理证据并提炼更新,在六个基准测试中提升了任务性能与技能演化效率,以GPT 5.5为目标模型时token用量比SkillOpt少73.2%

Comments 9 pages, 6 figures, 3 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08523 2026-08-11 cs.AI 新提交 79%

Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization

用质量多样性优化发现多模态具身智能体的多样化规划策略

Pengfei Xu, Yong Liu, Xiaoya Nan, Qiang Yang, Peilan Xu

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对多模态具身智能体现有规划器易因单一规划风格失效导致停滞的问题,提出质量多样性框架,通过进化策略模板构建多样化策略库,实现自适应规划与故障恢复,在ThreeDWorld基准上提升了任务成功率与交互效率。

Comments To appear in ACM MM (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08009 2026-08-11 cs.CV cs.AI 新提交 79%

Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation

基于证据的取证推理:检测与定位多模态媒体篡改

Yichun Yeh, Yiheng Li, Xiaobo Hu, Zhen Lei, Yang Yang

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对多模态媒体篡改检测与定位问题,提出基于证据的取证推理框架,结合锚定-验证推理链、可验证奖励系统与模态解耦优势路由机制,实现最优性能与可解释性的统一。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07959 2026-08-11 cs.AI 新提交 79%

SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

SCOUT:面向超长时长自我中心视频推理的自检查与恢复感知工具思维智能体

Keyang Zhong, Kuo Wang, Peng Liu, Quanlong Zheng, Junlin Xie, Zhijia Liang, Yanhao Zhang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Guangdong OPPO Mobile Telecommunications Corp., Ltd.(广东欧珀移动通信有限公司) OPPO AI Center(OPPO人工智能中心) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出SCOUT智能体框架,结合自适应策略与UPS-GRPO方法,解决超长自我中心视频推理的错误传播及信用分配问题,在对应基准上达最优性能且短时长场景仍具竞争力。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07905 2026-08-11 cs.AI cs.RO 新提交 79%

GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning

GraphThink:用于长视距具身任务规划的图增强大语言模型思维

Chen Li, Sijie Cheng, Yuelin Zhang, Junxi Li, Maozhi Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 GraphThink框架结合任务图与场景图,通过上下文提示、迭代优化、GRPO奖励设计及事件驱动重规划,在ALFRED基准上实现最优性能,具强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07813 2026-08-11 cs.AI 新提交 79%

When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines

当评判者不应做决定时:证据锁定的非补偿选择界限在推理流程中限制大语言模型评判者的失效

Yiyao Zhang, Diksha Goel, Hussain Ahmad, Shixun Huang, Jun Shen

机构 * School of Computing and Information Technology, University of Wollongong(伍伦贡大学计算与信息技术学院) CSIRO’s Data61(联邦科学与工业研究组织Data61研究院) School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息技术学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对推理流程中的LLM评判者,提出证据锁定的非补偿规则EL-DGR,在不改变评判者等条件下提升了GSM8K和HotpotQA任务性能,发现应限制评判者影响范围而非提升其准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27826 2026-08-11 cs.AI 版本更新 79%

NormAct: Benchmarking Embodied Agents' Proactive Compliance with Unspoken Social Norms

NormAct:具身规划中隐藏社会规范遵守的基准

Shiyun Zhao, Xinwei Song, Tianyu Guo, Xiaomeng Gao, Mingyuan Liu, Xu Han, Yuanyuan Zhang, Zhenliang Zhang, Xue Feng, Bo Dai

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院) China Academy of Information and Communications Technology(中国信息通信研究院) ShanghaiTech University(上海科技大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 提出NormAct基准,评估多模态大语言模型在具身规划中遵守隐藏社会规范的能力,发现模型在67.3%情况下达成显式目标,但仅26.4%遵守隐藏规范;提出NormPerceptor方法将任务成功率从24.2%提升至46.7%。

Comments This version revises the paper content and adds substantial details on the benchmark design and experimental setup

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09642 2026-08-11 econ.GN cs.CY q-fin.EC 新提交 78%

Beyond headcount and human capital: The Effective Cognitive Population as a decomposable capacity unit for AI-era planning

超越人口数量与人力资本:有效认知人口作为AI时代规划的可分解容量单位

Kwan Soo Shin

专题命中 规划推理 :planning(title,abstract)

AI总结 该研究提出有效认知人口(ECP)这一可分解容量单位,结合HCI+与IMF AI准备度指数,能提升对144国总产出的解释力,为AI时代国家规划提供新工具。

Comments 63 pages, 3 figures, 3 main tables, 14 supplementary tables. Reproducibility archive: https://doi.org/10.5281/zenodo.21871061. Third paper in a series on productive capacity in the AI era, after arXiv:2606.19794 (production function) and arXiv:2606.19846 (labor and capital transition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08035 2026-08-11 cs.MA cs.NI 新提交 78%

Decentralized Multi-Agent Urban Traffic Management via Spatio-Temporal Mobility Profile Planning

基于时空出行剖面规划的去中心化多智能体城市交通管理

Lorenzo Mario Amorosa, Lorenzo Farina, Vittorio Todisco, Alessandro Bazzi

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出VeloCity框架,通过去中心化多智能体时空出行剖面规划,在四张真实城市地图上实现CAVs的高效无冲突交通管理,显著降低通行时间、约束延迟方差并避免拥堵死锁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07822 2026-08-11 cs.RO cs.HC 版本更新 78%

Knowing When to Ask: Resolving Uncertainty in Human-Robot Joint Planning via Explicit Dialogue and Implicit Intent Cues

不确定性缓解与意图推断:一种双模式人机联合规划系统

Zeyu Fang, Yuxin Lin, Cheng Liu, Beomyeol Yu, Zeyuan Yang, Rongqian Chen, Taeyoung Lee, Mahdi Imani, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(电气与计算机工程系,乔治华盛顿大学) Department of Mechanical and Aerospace Engineering, George Washington University(机械与航空航天工程系,乔治华盛顿大学) Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出一种双模式人机联合规划系统,通过缓解不确定性与推断意图,提升人机协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14665 2026-08-11 eess.SY cs.SY 版本更新 78%

Risk-Averse Power System Resilience Planning Under AI Data Center Demand Growth Using a Two-Stage DRO-CVaR MILP Optimization

一种用于管理AI/数据中心需求冲击的双阶段风险厌恶DRO-MILP方法论框架

Sharaf K. Magableh, Caisheng Wang, Oraib Dawaghreh, Xuesong Wang

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出一种双阶段风险厌恶DRO-MILP框架,用于管理AI驱动数据中心需求冲击,通过优化柔性容量模块的预分配和事后调度,提升电力系统韧性。

Comments Accepted for publication in the proceedings of the 58th North American Power Symposium (NAPS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09857 2026-08-11 cs.RO cs.AI 新提交 77%

Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

智能体 harness:面向机器人自主的大语言模型驱动验证层

Rohan Bhagra, Mahantesh Halapannavar, Uddhav Bhattarai

机构 * Carnegie Mellon University(卡内基梅隆大学) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 针对机器人规划模型的安全与伦理风险,提出LLM驱动的验证层作为中间件管控计划,实现近85%的类别准确率、97%的对抗性攻击遏制率,为机器人自主提供可靠保障。

Comments 7 pages. Not yet finalized for conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02411 2026-08-11 cs.AI cs.IR cs.LG cs.MA 版本更新 74%

FitText: Evolving Agent Tool Ecologies via Memetic Retrieval

FitText: 通过模因检索演化智能体工具生态

Kyle Zheng, Han Zhang, Renliang Sun, Chenchen Ye, Wei Wang

机构 * UCLA(加州大学洛杉矶分校)

专题命中 规划推理 :reasoning(abstract,comments);planning(abstract);分类 cs.AI、cs.LG

AI总结 针对用户任务描述与工具文档间的语义鸿沟,提出FitText框架,将检索嵌入推理循环,通过自然语言伪工具描述迭代优化和模因进化选择,显著提升工具检索性能。

Comments 30 pages, including appendices. Accepted at COLM 2026 (main conference) and the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09281 2026-08-11 cs.AI 新提交 74%

MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

MMArch:基于建筑证据的多模态推理基准测试

Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

专题命中 规划推理 :reasoning(title);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLM)在工程多模态推理基准上的表现,构建MMArch基准,发现现有MLLM与人类专家存在差距,为相关研究提供评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07734 2026-08-11 cs.RO cs.AI cs.MA 新提交 74%

Complete, Scalable, and Robust Prioritized Planning for Multi-Robot Ordered Storage and Retrieval at Maximum Capacity

面向最大容量下多机器人有序存取任务的完备、可扩展且鲁棒的优先规划

William Zhang, Tzvika Geft, Jingjin Yu, Kostas Bekris

机构 * Rutgers University(罗格斯大学)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 该研究针对最大容量下多机器人有序存取问题,提出利用无重排布局特性的在线优先多智能体路径规划算法,实现可扩展且鲁棒的规划,完工时间随机器人数量近线性提升,处理不确定性时执行速度无显著损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07223 2026-08-11 cs.AI 版本更新 70%

Reflex First, Reflect Later: Latency-Aware Embodied LLM Agents for Dynamic Response

先反射,后反思:面向动态响应的延迟感知具身大语言模型智能体

Yangqing Zheng, Shunqi Mao, Dingxin Zhang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对动态环境中具身LLM智能体的推理延迟问题,提出RRARA智能体及相关评估指标,通过时间转换机制与预规划器实现决策质量与响应能力的平衡。

Comments Accepted by the CVPR 2025 Embodied AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏