arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-21 至 2026-07-21 共收录 211 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 46 篇

2607.16636 2026-07-21 cs.RO 新提交 78%

PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution

PhyAgentOS:一种用于具身智能体的自进化操作系统,具有解耦的认知规划和物理执行

Yang Liu, Weixing Chen, Xinshuai Song, Tao Pu, Siwen Mo, Yongjie Bai, Zihao Chen, Qianran Sun, Liruo Zhong, Ying Shen, Liang Lin

机构 * X-Era Lab(X-Era实验室) HCP Lab, Sun Yat-sen University(中山大学HCP实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 规划推理 :planning(title,abstract)

AI总结 研究为具身智能体提出PhyAgentOS操作系统,其以会话为最小调度单位,用文件系统解耦认知与物理执行,通过会话验证器区分执行与任务完成,经认知记忆整合结果,有分层安全约束,在多模型和实体上验证并优于其他系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16565 2026-07-21 cs.HC 新提交 78%

AlterAtlas: Shifting Travel Planning from AI Generation to Validation via Persona-Driven Simulations

AlterAtlas:通过基于角色的模拟将旅行规划从人工智能生成转变为验证

William Huang, Ruofei Du, Yang Zhang

专题命中 规划推理 :planning(title,abstract)

AI总结 研究针对旅行规划需平衡多目标约束,当前AI工具支持有限问题,提出AlterAtlas系统,通过基于角色模拟实现行程验证与修订,经实验证明可提高计划与角色匹配度,增强用户对最终计划的信任。

Comments 11 pages, 8 figures. For associated codebase, see https://github.com/hilab-open-source/alteratlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14247 2026-07-21 cs.RO cs.SY eess.SY 版本更新 78%

Path Planning Optimisation for SParse, AwaRe and Cooperative Networked Aerial Robot Teams (SpArC-NARTs): Optimisation Tool and Ground Sensing Coverage Use Cases

稀疏、感知与协作网络化空中机器人团队(SpArC-NARTs)的路径规划优化:优化工具与地面传感覆盖应用案例

Maria Conceição, António Grilo, Meysam Basiri

机构 * Institute for Systems and Robotics(系统与机器人研究所)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出了一种用于稀疏、感知和协作网络化空中机器人团队的路径规划工具,通过考虑环境信息、能量限制和通信约束,优化任务目标并提升群体协作效率。

Comments 28 pages, published in Robotics and Autonomous Systems (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17935 2026-07-21 cs.CL cs.AI 新提交 73%

DeLIVeR: Decomposed Learning for Information-grounded Veracity Recognition via Reinforced Knowledge Graph Exploration

DeLIVeR:通过强化知识图谱探索进行基于信息的真实性识别的分解学习

Cong Hoan Nguyen, Thomas Hoang, Hieu Minh Duong, Long Nguyen

机构 * University of Louisville(路易斯维尔大学) Denison University(丹尼森大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型自动事实核查难题,DeLIVeR框架将证据检索设为强化探索任务,利用规划器大语言模型分解声明获问题集遍历知识图谱找证据,经GRPO优化策略,实验表明其显著优于基线,有效弥合推理差距,提供检测路径。

Comments Accepted to 7th International Conference on Deep Learning Theory and Applications (DeLTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17281 2026-07-21 cs.LG cs.AI 新提交 73%

AIGB-R1: Self-Evolving Generative Auto-Bidding via Hierarchical Planner-Executor Optimization

AIGB-R1:通过分层规划器-执行器优化实现自我进化的生成式自动出价

Yuejia Dou, Hesong Wang, Xinyu Zhang, Tianyu Wang, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng, Qi Qi

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对AIGB范式在自动出价中存在的问题,提出AIGB-R1框架,利用大语言模型推理能力,通过分层规划器与执行器模块、经验驱动循环、两阶段训练及新优化方法,经实验验证该框架在自动出价任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16591 2026-07-21 cs.LG cs.AI 新提交 73%

Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL

从世界反馈中学习:为何模型不确定性在基于模型的强化学习中无法作为风险信号

Zhaohui Wang

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨 RLxF 中学习信号应源于世界反馈,在安全模型控制中实例化并提炼原则。通过实验表明基于动力学的不确定性惩罚会增加碰撞率,用世界反馈信号可降低碰撞率,提取原则并指出其适用于多种相关方法。

Comments Accepted at the ICML 2026 Workshop on Reinforcement Learning from X Feedback (RLxF). 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17560 2026-07-21 cs.AI 新提交 70%

Reinforcement Learning: From Algorithms To Foundation Models

强化学习:从算法到基础模型

Zihan Ding

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文从游戏算法和基础模型时代的RL两个视角展开研究,前者聚焦多智能体RL中相关概念的相互作用,后者利用生成和基础模型丰富序列决策,开发多种模型并进行相关研究,呈现RL在复杂序列域的统一视图,突出其连接多方面的作用。

Comments Princeton University PhD Thesis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17437 2026-07-21 cs.AI 新提交 70%

Empirical Grounding Improves the Realism of LLM Agents Simulating Human Behavior During Disruptions

经验基础提升了在干扰期间模拟人类行为的大语言模型智能体的现实性

Chen Xia, Zexi Kuang, Yuqing Hu

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究探讨经验基础对提升LLM智能体模拟人类行为现实性的作用,开发基于经验的框架,将多项调查数据嵌入其中,通过实验验证该框架能显著提升模拟效果,使LLM智能体成为更具统计可信度的人口行为模拟器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14661 2026-07-21 cs.AI 版本更新 70%

SmartRAG: Native Graph-Based RAG for Mobile Device

SmartRAG:用于移动设备的基于原生图的RAG

Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Wei Wang, Xianjun Deng, Shuai Wang, Haipeng Dai

机构 * Nanjing University(南京大学) HUST(华中科技大学) Southeast University(东南大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对移动设备部署大语言模型的问题,提出SmartRAG框架,围绕四个模块组织智能助手,核心是可持续学习的EvoNER,知识存于MRGraph,通过混合管道检索,实验表明其在多跳推理性能上有竞争力且能在普通智能手机上运行。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15830 2026-07-21 cs.AI 版本更新 70%

Mini Amusement Parks (MAPs): A Testbed for Modelling Business Decisions

迷你游乐园(MAPs):一个用于模拟商业决策的测试平台

Stéphane Aroca-Ouellette, Ian Berlot-Attwell, Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Tongqi Zhu, Herin Kang, Kaheer Suleman, Sam Pasupalak

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 介绍用于评估智能体决策能力的游乐园模拟器Mini Amusement Parks (MAPs),统一现实决策多方面挑战,提供人类基线和对先进语言模型智能体的评估,发现人类表现更优并揭示智能体在多方面的弱点,为基准测试适应性决策智能体提供新基础。

Comments 9 pages (main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00446 2026-07-21 cs.AI 版本更新 70%

Benchmarking Agentic Newswriting via Journalistic Workflows

通过新闻工作流程对智能新闻写作进行基准测试

Yen-Che Chien, Kuang-Da Wang, Wei-Yao Wang, Wen-Chih Peng

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Sony Group Corporation(索尼集团)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究智能体在新闻写作工作流程中的表现,引入NEWSAGENT基准,给定写作指令和部分材料,评估智能体搜索、选信息及改草稿能力,发现其检索事实尚可,但规划和叙事整合有困难,为评估智能体能力提供现实测试平台。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09249 2026-07-21 cs.CV 版本更新 67%

DECIS: Dual-Evidence Corrective Verification for Interpretable Strabismus Diagnostic Decision-Making

MAGIS:基于证据的多智能体推理用于可解释的斜视临床决策

Xikai Tang, Yifan Wang, Jiafan Zhuang, Li Luo, Jinming Guo, Xiaoling Xie, Jiacheng Liu, Peiwei Wei, Lihao Zhong, Xiaoli Kang, Jie Cen, Guangqiang Yin, Kunliang Qiu, Ce Zheng, Zhun Fan

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院) Joint Shantou International Eye Center of Shantou University and The Chinese University of Hong Kong(汕头大学·香港中文大学联合汕头国际眼科中心) School of Artificial Intelligence, Guangzhou City Polytechnic(广州城市职业学院人工智能学院) Medical College, Shantou University(汕头大学医学院) College of Engineering, Shantou University(汕头大学工学院) Department of Ophthalmology, Xinhua Hospital Affiliated to Shanghai Jiaotong University School of Medicine(上海交通大学医学院附属新华医院眼科) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出MAGIS框架,通过多智能体协作、双重证据约束上下文和基于证据的纠正验证机制,将斜视诊断从黑箱生成转变为结构化推理,在细粒度斜视基准上将加权F1分数从72.0%提升至91.3%,并显著提高诊断报告的临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15867 2026-07-21 hep-ph hep-ex 版本更新 67%

HEPTAPOD: Orchestrating High Energy Physics Workflows Towards Autonomous Agency

HEPTAPOD:编排高能物理工作流程以实现自主智能体

Tony Menzo, Alexander Roman, Sergei Gleyzer, Konstantin Matchev, George T. Fleming, Stefan Höche, Stephen Mrenna, Prasanth Shyamsundar

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 研究针对高能物理工作流程,介绍HEPTAPOD编排框架,能集成外部大语言模型,使其与特定领域工具交互构建管理HEP管道,通过案例展示其能力,为高能物理中人工参与及智能体辅助工作流程奠定基础。

Comments 47 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14169 2026-07-21 cs.AI cs.LG 版本更新 62%

When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models

当经过验证的世界模型仍然失败时:大语言模型合成代码世界模型中的游戏充分性与预测准确性

Javier Aguilar Martín

机构 * AGILabs(AGILabs实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型合成的代码世界模型,发现其虽预测准确率高,但在游戏中仍失败,存在验证与正确的差距,揭示危害规律,指出更多数据无法修复,相同机制在信念推理函数上重现,表明规划世界模型充分性应基于搜索分布或游戏衡量。

Comments 41 pages, 4 figures. Code and reproduction log: https://github.com/JaviMaligno/code-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10203 2026-07-21 cs.LG cs.AI 版本更新 62%

Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter

深度在组合中何时得以保留?潜在世界模型中的计算-质量机制

Achyuthan Sivasankar

机构 * New York University(纽约大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨潜在世界模型中深度在组合时的情况,用浅度惩罚ρ测试九个深度思维控制任务,发现三种机制,揭示反转机制由训练产生,其与观察/动作维度等相关,还指出任务机制受多种因素影响及相关注意事项。

Comments 15 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17951 2026-07-21 cs.CR cs.AI cs.RO cs.SY eess.SY 新提交 57%

RT-SHCUA: Real-Time Self-Hosted Computer-Use Agent for UAV Control

RT-SHCUA:用于无人机控制的实时自托管计算机使用代理

Di Lu, Bo Zhang, Xiyuan Li, Yongzhi Liao, Xuewen Dong, Yulong Shen, Zhiquan Liu, Jianfeng Ma

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Shaanxi Key Laboratory of Network and System Security(陕西省网络与系统安全重点实验室) College of Cyber Security, Jinan University(广州大学网络安全学院) School of Cyber Engineering, Shaanxi Key Lab of Network and System Security(陕西省网络与系统安全重点实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对将SHCUA用于无人机控制的结构不匹配问题,提出实时安全导向的重组方法,把SHCUA输出转换为合同约束的无人机技能调用,设计分离架构,原型评估显示RT-SHCUA能保持响应能力并支持相关特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17724 2026-07-21 cs.RO cs.AI cs.MA 新提交 57%

Lifelong Multi-Subsystem Pickup and Delivery with Buffer-Limited Handover Stations

具有缓冲区受限交接站的终身多子系统取货与送货

Chuanlong Zang, Isabelle Barz, Anna Mannucci, Philipp Schillinger, Florian Lier, Wolfgang Hönig

机构 * Robert Bosch GmbH(罗伯特·博世有限公司) Technical University of Berlin(柏林工业大学) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究终身多子系统取货与送货中协调子系统载荷转移的问题,提出交接感知预留与路由(HARR)方法,通过共享日历和缓冲区预测协调行动,模拟显示该方法能显著提高吞吐量、减少积压并降低规划时间,提升运输稳定性。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17694 2026-07-21 cs.AI 新提交 57%

Artificial Intelligence for Understanding and Managing Transportation Behavior in Sustainable Smart Cities

可持续智慧城市中用于理解和管理交通行为的人工智能

Junbiao Pang, Muhammad Ayub Sabir, Fatima Ashraf

机构 * Beijing University of Technology(北京工业大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究如何利用人工智能理解和管理可持续智慧城市中的交通行为,通过以行为为中心的视角,研究公交到站预测等四个方向,经闭环框架整合,确定部署条件,建立从行为证据到各类交通决策的统一路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17558 2026-07-21 cs.AI 新提交 57%

Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?

为什么反馈增强的自蒸馏不能改进检索交织搜索智能体?

Fan Yang, Rui Meng, Yuxin Wen

机构 * Chapman University(查普曼大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究反馈增强的自蒸馏在智能体搜索中失效的原因,发现模型存在解码崩溃现象,因监督信号不一致致学习不稳定,将其分解为模型和提示不一致,引入EMA教师减轻不一致,最终提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17499 2026-07-21 cs.AI 新提交 57%

Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation

派利淘-多模态搜索:构建原生电子商务多模态搜索基础

Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝及天猫集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对电子商务多模态搜索问题,提出派利淘-多模态搜索基础模型,通过混合语义ID、两阶段持续预训练策略和混合推理后训练管道,在淘宝派利淘平台实现显著改进,提升了商品交易总额和交易量。

Comments Technical Report: Pailitao-MMSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16981 2026-07-21 cs.AI 新提交 57%

Expected Free Energy as Belief-Dependent Utility for rho-POMDPs

作为rho-POMDPs中信念依赖效用的期望自由能

Patrick Cooper, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究在部分可观测性下智能体信息收集决策问题,核心方法是用主动推理最小化期望自由能,此方法被证明等同于求解特定rho-POMDP,实验表明该方法在多种环境中表现良好,能提供基于信念的效用,避免过度探索。

Comments 41 pages, 12 figures. Paper accepted as a spotlight at the 2026 International Workshop on Active Inference (IWAI); the workshop version will appear in the Springer Communications in Computer and Information Science (CCIS) series. Code and experiment data at https://github.com/PatrickAllenCooper/rho_aif

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16916 2026-07-21 cs.LG 新提交 57%

Enhancing Personalized Bladder Cancer Treatment Through Reinforcement Learning: A Recurrent Patient State Transition Decision Support Framework

通过强化学习增强个性化膀胱癌治疗:一种循环患者状态转换决策支持框架

Divyansh Chawla, Anshu Garg, Isshaan Singh

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 研究针对膀胱癌复发性疾病治疗需个性化决策的问题,提出集成预测状态转换建模、马尔可夫决策过程和深度Q网络强化学习环境的框架,能动态制定治疗计划,经评估效果良好,凸显其作为个性化膀胱癌治疗规划决策支持框架的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16211 2026-07-21 cs.AI 新提交 57%

Accurate and Efficient Long-Term Memory for LLM Agents

用于大语言模型智能体的准确高效长期记忆

Zicheng Zhao, Xinyang Guo, Luyao Lv, Menghan Wang, Ming Li, Shuaicheng Li

机构 * Central China Research Institute for AI Technology(华中人工智能技术研究院) Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science, BNU-HKBU United International College, Zhuhai(北京师范大学-香港浸会大学联合国际学院数据科学跨学科研究与应用广东省重点实验室) City University of Hong Kong(香港城市大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型智能体长时记忆问题,提出MOSAIC框架,通过实体类型图存储、哈希加速双路径检索和主动冲突检测,提升了准确性和效率,在多项测试中取得更好结果,如准确率提高、冲突检测能力增强且检索延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16597 2026-07-21 cs.AI math.OC math.PR 新提交 57%

FST.ai 2.5: Explainable and Uncertainty-Aware AI for Olympic and Para-Taekwondo Decision Support, Athlete Digital Twins, and Federation-Scale Analytics

FST.ai 2.5:用于奥运会和跆拳道决策支持、运动员数字孪生及联合会规模分析的可解释且具有不确定性感知的人工智能

Keivan Shariatmadar, Ahmad Osman, Ramin Rey

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 针对精英运动数字化中现有方案零散问题,提出FST.ai 2.5框架,通过整合多源数据,实现战术诊断、运动员监测等功能,其原型部署可行,方法广泛适用于搏击等体育环境中的可解释AI、数字孪生及可靠决策支持。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10144 2026-07-21 cs.AI 版本更新 57%

IdeaTrail: Full-Process Agent Trajectories for Scientific Ideation

IdeaTrail:用于科学构思的全流程智能体轨迹

Hengquan Guo

机构 * ShanghaiTech University(上海科技大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 介绍用于科学构思和提案生成的多轮过程轨迹数据集IdeaTrail,从高质量论文和工件出发,经生成器-顾问合成循环,产生与真实工件一致且近似研究实践的多轮数据,为科研智能体提供数据及合成过程监督数据的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22455 2026-07-21 cs.LG 版本更新 57%

SkillRouter: Skill Routing for LLM Agents at Scale

SkillRouter:大规模LLM代理中的技能路由

YanZhao Zheng, ZhenTao Zhang, Chao Ma, YuanQiang Yu, JiHuai Zhu, Yong Wu, Tianze Xu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出SkillRouter,通过全文本检索和重排序提升大规模LLM代理的技能路由性能,实验显示隐藏技能体导致路由准确率下降31-44个百分点,SkillRouter在基准测试中达到74.0%的Hit@1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08258 2026-07-21 cs.DL cs.AI cs.IR 57%

Large Language Models for Scholarly Ontology Generation: An Extensive Analysis in the Engineering Field

大型语言模型在学术本体生成中的应用:工程领域的广泛分析

Tanay Aggarwal, Angelo Salatino, Francesco Osborne, Enrico Motta

机构 * Knowledge Media Institute, The Open University(知识媒体研究所,开放大学) Department of Business and Law, University of Milano Bicocca(商业与法律系,米兰比可卡大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型在工程领域生成学术本体的能力,通过评估多种模型发现,小型量化模型在优化后可达到大型专有模型的性能,且计算资源需求更低。

Comments Now accepted to Information Processing & Management. this is the camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18082 2026-07-21 cs.CL cs.HC 版本更新 57%

Octo-planner: On-device Language Model for Planner-Action Agents

Octo-planner:用于规划-行动智能体的设备端语言模型

Wei Chen, Zhiyuan Li, Zhen Guo, Yikang Shen

机构 * Nexa AI & Stanford(Nexa AI 与 斯坦福大学) MIT EECS(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(麻省理工-IBM Watson AI 实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 研究如何让人工智能智能体有效规划行动,提出设备端规划-行动框架,分离规划与行动执行组件,用模型微调优化性能,多LoRA训练方法应对多域规划挑战,在域内测试成功率达97%,并开源模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16580 2026-07-21 stat.AP cs.CE cs.SE 新提交 50%

Automating structural reliability analysis with a multi-agent large language model framework

使用多智能体大语言模型框架实现结构可靠性分析自动化

Jaehwan Jeon, Chang Hee Lee, Taeyong Kim

专题命中 规划推理 :planning(abstract)

AI总结 研究提出多智能体大语言模型框架,通过专门智能体处理结构可靠性分析流程,用QLoRA微调方法规划器,由确定性求解器计算结果,降低专业知识壁垒,保持计算可信度,实现结构可靠性分析自动化。

Comments 41 pages, 10 figures. Submitted to Automation in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17841 2026-07-21 cs.DB 新提交 50%

From Blind Search to Memory-Aware Evolution: Efficient DBMS Tuning via Collaborative Diagnosis and Utility-Aware Retrieval

从盲目搜索到内存感知进化:通过协作诊断和效用感知检索实现高效数据库管理系统调优

Zhaoyan Hong, Yishen Sun, Xinyi Zhang, Zhentao Han, Jinhao Dong, Wei Lu, Kai Xu, Liu Tang, Qi Liu, Xiaoyong Du

专题命中 规划推理 :reasoning(abstract)

AI总结 针对多组件DBMS调优难题,EvoTune框架通过协作诊断定位高影响子空间,引入效用感知检索策略,将调优反馈组织成层次化内存,无需LLM微调,实验证明其性能优于现有基线,能快速提升查询性能。

详情

展开后加载摘要…

URL PDF HTML 收藏