arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-03 至 2026-08-03 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 21 篇

2607.29374 2026-08-03 cs.RO 新提交 88%

SAGP: Semantic Affordance-Guided Grasp Planning via Coarse-Zone VLM Reasoning

SAGP:基于粗区域VLM推理的语义 affordance 引导抓取规划

Muhayy Ud Din, Irfan Hussain

机构 * Khalifa University(哈利法大学) KU Center for Autonomous Robotic Systems (KUCARS)(KU自主机器人系统中心(KUCARS))

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract)

AI总结 SAGP是一种无训练的抓取规划框架,通过粗区域抽象层结合VLM推理与几何规划,在保持纯几何抓取高成功率的同时,提升了抓取的功能适用性,尤其适用于非对称带把手物体。

Comments Accepted in ICAME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28679 2026-08-03 cs.AI cs.MA 新提交 83%

Multi-Agent Planning with Spatio-Temporal and Topological Constraints using STL-GO

基于STL-GO的时空与拓扑约束下的多智能体规划

Sheryl Paul, Vidisha Kudalkar, Anand Balakrishnan, Lars Lindemann, Alberto Speranzon, Jyotirmoy V. Deshmukh

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 针对多智能体规划中的时空与拓扑约束难题,提出基于STL-GO的混合整数规划与可满足性模理论两种编码方案,在多无人机搜索与救援基准上验证了其表达能力。

Comments Accepted at Formal Methods for Computer-Aided Design 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29243 2026-08-03 cs.CV cs.AI cs.LG 新提交 81%

TAVI-TEC: An AI-Based Tool for Procedural Planning of Transcatheter Aortic Valve Implantation

TAVI-TEC:一种基于AI的经导管主动脉瓣植入术手术规划工具

Alessandra Zerillo, Stefano Cannata, Diego Bellavia, Daniele Ciriello, Simone Manini, Salvatore Pasta, Caterina Gandolfo

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于AI的TAVI-TEC框架,可自动完成TAVI术前关键测量与假体尺寸预测,耗时短、测量一致性强,准确率达82%,或能减少操作者差异、简化术前流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28677 2026-08-03 cs.AI 新提交 79%

Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support

现实世界临床护理中的推理:为何大型语言模型(LLM)尚不适合自主临床决策支持

Shayndhan Sivanathan, Shravan Nageswaran, Mehdi Zadem, Ryaan Sultan, Nicolas von Mallinckrodt, Max Solovyev, Alexey Matyushkin, Sumon Sadhu, Gabriele C DeLuca, Sanjeeva Jeyaretna, James Hillis, Manoj Ramachandran, Prakash Jayakumar

机构 * Atman Labs(阿特曼实验室) Oxford University Hospitals(牛津大学医院) University of Oxford(牛津大学) NIHR Oxford Biomedical Research Centre(英国国立卫生研究院牛津生物医学研究中心) Imperial College London(伦敦帝国理工学院) Technical University of Munich(慕尼黑工业大学) Massachusetts General Hospital(麻省总医院) Mass General Brigham(麻省总医院布里格姆医疗系统) Harvard Medical School(哈佛医学院) Barts Health NHS Trust(巴特保健国民保健信托基金会) the University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文指出,尽管LLM在医学考试和部分病例推理上表现出色,但因存在信息收集缺陷等问题,尚不适合用于无医生参与的自主临床分诊。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29301 2026-08-03 cs.RO 版本更新 78%

The Open Motion Planning Library 2.0

开放运动规划库2.0

Weihang Guo, Theodoros Tyrovouzis, Emiliano Flores, Clayton W. Ramsey, Zachary K. Kingston, Ioan A. Şucan, Mark Moll, Lydia E. Kavraki

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学) Department of Computer Science, Purdue University(计算机科学系,普渡大学) Waymo, LLC(Waymo公司) Metron, Inc.(Metron公司) Ken Kennedy Institute at Rice University(里士大学肯尼迪研究所)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文介绍OMPL 2.0,通过硬件加速实现实时运动规划,并集成现代AI研究流程,总结了库与运动规划领域的共同发展及其对研究社区的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28647 2026-08-03 cs.HC cs.AI 新提交 74%

ConnectED: A Curriculum-Aligned AI System for Vietnamese Instructional Lesson Planning and Student Learning

ConnectED:面向越南教学课程规划与学生学习的课程对齐AI系统

Thang Doan Viet, Anh Nguyen Hoang, Tinh Luong Son, Anh Hoang Thi Ngoc, Huyen Giang Thi Thu, Tai Le Quy

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 该研究提出以人为本的AI系统ConnectED,基于VietEduQwen构建,支持越南教育完整教学生命周期,经评估其准确率优于基准模型,可缩短教师备课时间且获师生高满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28629 2026-08-03 cs.AI 新提交 70%

OpenClaw and Ollama in Agentic AI: Toward Fully Autonomous and Scalable AI Agent Systems

智能体AI中的OpenClaw与Ollama:迈向完全自主且可扩展的AI智能体系统

Konstantinos I. Roumeliotis, Ranjan Sapkota

机构 * University of the Peloponnese(伯罗奔尼撒大学) Cornell University(康奈尔大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出智能体AI的分层架构,分析OpenClaw与Ollama组成的全栈系统,验证系统集成可提升智能体能力,指出相关挑战并提供路线图,所有资源公开以支持研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29241 2026-08-03 cs.IR cs.AI cs.CL 新提交 62%

RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems

RecHarness:用于自进化推荐系统的多臂老虎机路由智能体框架

Haoran Ling, Yuecheng Li, Zeyu Song, Jing Yao, Shuwen Kang, Chi Lu, Wenjin Wu, Peng Jiang

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RecHarness是一种多臂老虎机路由智能体框架,用于自动化优化推荐系统模型,通过分离方向选择与假设生成、引入跳盆机制提升稳定性,在多任务测试及在线A/B测试中均实现性能提升。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28648 2026-08-03 cs.HC cs.AI cs.CL 新提交 62%

Why It Hurts: Identifying the Drivers of Negative Thoughts in Emotional Support Conversations

为何会痛苦:识别情感支持对话中消极想法的驱动因素

Hainiu Xu, Zhaoyue Sun, Hanqi Yan, Jinhua Du, Caroline Catmur, Yulan He

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM情感支持任务中认知评估维度显著性被忽视的问题,推出AppraiSal基准并提出基于贝叶斯逆规划的多智能体概率框架PRISM,提升了LLMs识别情境特定显著评估维度的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29405 2026-08-03 cs.AI cs.MA cs.SE 新提交 57%

Beyond Component Testing: Validating Agentic AI Systems

超越组件测试:验证智能体AI系统

Fabio Orazio Mirto, Luca D'Agati, Giuseppe Tricomi, Stefano Silvestri, Francesco Longo, Antonio Puliafito, Giovanni Merlino

机构 * University of Messina(墨西拿大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该综述综合257篇相关文献,构建五维分类法分析智能体AI系统验证问题,指出现有方法的缺口,提出面向生命周期的研究议程,主张需在上下文中验证智能体轨迹以实现可信部署。

Comments 61 pages, 3 figures, to be submitted to Springer Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29347 2026-08-03 cs.MA cs.AI 新提交 57%

SeekBrain: An Autonomous Multi-Agent System for Accelerating Neuroscience Discovery

SeekBrain:用于加速神经科学发现的自主多智能体系统

Jiamin Wu, Peishan Xiang, Jingyang Chen, Yuqing Zhu, Yuxi Li, Ling Luo, Qihao Zheng, Jialiang Zu, Yongchao Wu, Mindong Liu, Haitao Wu, Chaofan Hu, Yijie Sun, Yuqi Hang, Yu Zhu, Shuo Li, Yue Fan, Shiyang Feng, Wanghan Xu, Tianlei Zhang, Jie Zhang, Wenlong Zhang, Bo Zhang, Kai Wang, Lei Bai, Mianxin Liu, Wanli Ouyang, Jiulin Du, Chunfeng Song

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 SeekBrain是用于加速神经科学发现的自主多智能体框架,通过分层规划与跨模态分析生成分析流程,在BrainArena基准上优于现有智能体,实际研究中成功揭示了斑马鱼与小鼠的神经表征规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28947 2026-08-03 cs.LG 新提交 57%

Overcoming the Weakest-Link Effect in LLM-Driven Program Optimization via Heterogeneous Edit Recombination

通过异构编辑重组克服大语言模型驱动的程序优化中的最弱链效应

Jingwen Fu, Zhen Liu, Yuhan Liu, He Zhang, Nanning Zheng

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本研究针对LLM程序优化的最弱链效应,提出HERO异构编辑重组优化器,可生成多样非重叠原子编辑并结合评估器分数组合改进,在多领域实现更高分数、更快收敛与更少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28630 2026-08-03 cs.CY cs.AI 新提交 57%

Scaffolding Critical Engagement with GenAI: Transforming Ethnic Minority Preparatory Students' Collaborative Discourse in Prompt Engineering Tasks

为生成式AI(GenAI)搭建批判性参与支架:在提示工程任务中转变少数民族预科生的协作话语

Deliang Wang, Cunling Bian

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对中国78名少数民族预科生,通过整合人在回路工作流等的GenAI课程,帮助学生转变对GenAI的依赖,提升提示自我效能,培养其人机协作的批判性认知能动性。

Comments Accepted as a full paper by the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26497 2026-08-03 cs.CL 版本更新 57%

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

哪种RAG范式在规模化场景下表现最优?检索增强生成范式的规模化研究

Pengyu Wang, Benfeng Xu, Shaohan Wang, Mingxuan Du, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(Metastone科技) Information Technology Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京农林科学院信息技术研究中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文通过28个嵌套语料层级的受控研究,对比四类RAG范式的规模化表现,发现BM25综合性能最优,Agent+BM25全规模准确率达69.4,图基RAG存在构建瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09037 2026-08-03 cs.AI cs.MA 版本更新 57%

A Multi-Agent System for Motor Design Optimization via an FEA-AI Hybrid Approach

基于FEA-AI混合方法的IPMSM设计优化多智能体系统

Jinseong Han, Sunwoong Yang, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, KAIST(KAIST Cho Chun Shik 移动研究生院) Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) Narnia Labs

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种端到端自动化IPMSM设计优化框架,通过RAG结构化问题定义与不确定性感知的FEA-AI混合优化流水线,平衡计算成本与预测可靠性,在同等FEA预算下优于纯FEA或纯AI方法。

Comments 37 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10475 2026-08-03 cs.AI 版本更新 57%

PEMAND: Persona-Enriched Multi-Agent Negotiation for Household Decision-Making

PEMANT:面向旅行的个性化多智能体谈判

Yuran Sun, Mustafa Sameen, Yaotian Zhang, Rongguan Gu, Mrunal Vibhute, Chia-yu Wu, Yuanyuan Lei, Xilei Zhao

机构 * Department of Civil and Costal Engineering, University of Florida(佛罗里达大学土木与海岸工程系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出PEMANT框架,结合行为理论与多智能体谈判,改进家庭旅行决策建模,提升预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10429 2026-08-03 cs.MA cs.AI 版本更新 57%

AIvilization v0: Toward Large-Scale Artificial Social Simulation with a Unified Agent Architecture and Adaptive Agent Profiles

AIvilization v0:迈向大规模人工社会模拟的统一代理架构与自适应代理档案

Wenkai Fan, Shurui Zhang, Xiaolong Wang, Haowei Yang, Tsz Wai Chan, Xingyan Chen, Junquan Bi, Zirui Zhou, Jia Liu, Kani Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Bauhinia AI

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 AIvilization v0通过统一代理架构和自适应代理档案,实现大规模人工社会模拟,解决目标稳定性与反应正确性矛盾,支持长周期自主性和多目标环境下的稳健性。

Comments v2: major revision. Agent architecture and environment consolidated into self-contained sections; new problem-setting section formalizing the asynchronous event model; evaluation reorganized by experiment with results reported alongside each protocol; added action-simulator audit, and human-steering analyses; other sections rewritten

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17192 2026-08-03 cs.AI 版本更新 57%

Shall We Play a Game? Language Models for Open-ended Wargames

我们要玩一场游戏吗?用于开放式兵棋推演的语言模型

Glenn Matlin, Isaac Song, Yixiong Hao, Parv Mahajan, Evan Montoya, Ryan Bard, Stuart R. Topp, Anthony Wen-Ming Zang, Mohammed Rehan Parwani, Soham Shetty, Mark Riedl

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究通过对223篇相关论文的范围综述,明确了兵棋推演中语言模型的控制角色现状,指出需关注模型对行动与后果的控制程度以保障模拟保真度。

Comments 49 pages (9-page body), 3 figures. Published at the Social Sim'26 Workshop at COLM 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29310 2026-08-03 cs.CV 新提交 50%

CALM-AH: An ABAW11-Calibrated Multimodal Ensemble with Reliability-Gated Multi-Expert Consensus for Video-Level Ambivalence and Hesitancy Recognition

CALM-AH:面向视频层面矛盾与犹豫识别的ABAW11校准多模态集成模型,采用可靠性门控多专家共识机制

Wenzhuo Sun, Mingjian Liang, Richard Attfield, Zongyuan Ge, Xuelian Cheng, Pamela Carreno-Medrano

机构 * Monash University(莫纳什大学) Monash Suzhou Research Institute(莫纳什苏州研究院)

专题命中 规划推理 :verifier(abstract)

AI总结 针对ABAW11视频层面矛盾与犹豫识别任务,提出CALM-AH多模态集成模型及RG-MEC门控多专家共识机制,在ABAW11数据集上分别取得0.7525与0.7771的Macro-F1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29175 2026-08-03 cs.SE 新提交 50%

Execution-First Synthetic Tool-Use Trace Generation for LLM Agents

面向LLM智能体的优先执行式合成工具使用轨迹生成

Hafsa Ouajdi, Francesco Giannuzzo, Alaa Boukhary, Paolo Papotti, Gerard Conangla, Adam Elwood

专题命中 规划推理 :reasoning(abstract)

AI总结 针对传统数据合成的局限,提出优先执行式框架SyntheticAgentTraceQA生成工具增强型智能体的监督数据,经四工具生态系统及Qwen模型验证,该框架可提升工具执行等性能,且揭示了掩码与全监督的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28822 2026-08-03 eess.SY cs.SY 新提交 50%

Agentic Artificial Intelligence for Power Systems: Strategies to Identify and Close Capability Gaps

面向电力系统的智能体人工智能:识别与缩小能力差距的策略

Eve Tsybina, Samim Konjicija, Slaven Peles

专题命中 规划推理 :planning(abstract)

AI总结 该研究针对电力系统规划任务,复现当前最优Agentic AI并评估其能力,发现其仅能解决部分低复杂度问题,明确了能力升级需求,强调需采用严格测试与可复现基准评估Agentic AI进展。

Comments 5 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏