arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-30 至 2026-04-30 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 21 篇

2603.15262 2026-04-30 cs.AI 83%

Probe-then-Plan: Environment-Aware Planning for Industrial E-commerce Search

探测-然后规划:面向工业电商搜索的环境感知规划

Mengxiang Chen, Zhouwei Zhai, Jin Li

机构 * JD.com Beijing China(京东北京中国)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出环境感知搜索规划(EASP),通过探测-规划机制解决电商搜索中盲点与延迟的矛盾,通过离线数据合成、规划器训练和在线服务适应性路由提升搜索相关召回率和UCVR、GMV。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26781 2026-04-30 cs.CV 78%

Virtual-reality based patient-specific simulation of spine surgical procedures: A fast, highly automated and high-fidelity system for surgical education and planning

基于虚拟现实的患者特异性脊柱手术模拟:一种快速、高度自动化和高保真的系统,用于手术教育和规划

Raj Kumar Ranabhat, Tayler D Ross, Tony Jiao, Jeremie Larouche, Joel Finkelstein, Michael Hardisty

机构 * Holland Bone and Joint Program, Sunnybrook Research Institute(霍尔德骨科与关节程序,圣布鲁诺研究学院) Division of Spine Surgery, Sunnybrook Health Sciences Centre(脊柱外科部,圣布鲁诺健康科学中心) Division of Orthopaedic Surgery, Department of Surgery, University of Toronto(骨科部,外科部,多伦多大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出利用AI和计算机视觉生成患者特异性脊柱减压模拟,通过多模态融合和分割技术提高建模精度,提升手术教育和规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26569 2026-04-30 cs.RO 78%

LLM-Flax : Generalizable Robotic Task Planning via Neuro-Symbolic Approaches with Large Language Models

LLM-Flax:通过大规模语言模型的神经符号方法实现通用机器人任务规划

Seongmin Kim, Daegyu Lee

机构 * Department of Physical AI Engineering(物理人工智能工程系) Faculty of Department of Advanced Defense Technology and Industry(高级国防技术与产业学院)

专题命中 规划推理 :planning(title);self-correction(abstract)

AI总结 LLM-Flax通过神经符号方法实现通用机器人任务规划,利用本地部署的大语言模型,无需手动编写规则或训练数据,三个阶段框架显著提升了任务规划效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25602 2026-04-30 cs.AI 70%

OxyGent: Making Multi-Agent Systems Modular, Observable, and Evolvable via Oxy Abstraction

OxyGent:通过Oxy抽象使多智能体系统模块化、可观察和可进化

Junxing Hu, Tianlong Li, Lei Yu, Ai Han

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OxyGent通过Oxy抽象和OxyBank引擎,实现多智能体系统的模块化、可观察性和可进化性,通过统一抽象和动态规划提升可扩展性和可观测性,实验证明其在复杂工业环境中的鲁棒性和可扩展性。

Comments 10 pages, 10 figures, ACL 2026 System Demonstration track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26630 2026-04-30 cs.CL 70%

SAGE: A Strategy-Aware Graph-Enhanced Generation Framework For Online Counseling

SAGE:一种面向在线咨询的策略感知图增强生成框架

Eliya Naomi Aharon, Meytal Grimland, Avi Segal, Loona Ben Dayan, Inbar Shenfeld, Yossi Levi Belz, Kobi Gal

机构 * Ben-Gurion University of the Negev(贝叶特·沙瓦大学) University of Haifa(海法大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 SAGE通过整合心理框架和实时压力信号,提升在线咨询的策略预测与响应质量,为高风险危机咨询提供决策支持工具。

Comments Full version of the work accepted as a short paper at the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26). 9 pages, 4 figures, 5 tables

Journal ref Proceedings of the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26), June 08--11, 2026, Gothenburg, Sweden

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26275 2026-04-30 cs.SE 67%

Agentic AI in the Software Development Lifecycle: Architecture, Empirical Evidence, and the Reshaping of Software Engineering

软件开发生命周期中的代理AI:架构、实证证据与软件工程的重塑

Happy Bhati

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文探讨代理AI在软件开发生命周期中的应用,提出六层参考架构,分析代理SDLC与传统SDLC的差异,并通过实证数据展示其在性能、生产力和劳动力市场的影响。

Comments 9 pages, 5 figures, 2 tables, survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22063 2026-04-30 cs.LG cs.AI 62%

Reliability Auditing for Downstream LLM tasks in Psychiatry: LLM-Generated Hospitalization Risk Scores

精神科下游LLM任务中的可靠性审计:LLM生成的住院风险评分

Shevya Panda, Shinjini Bose, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了LLM在精神科住院风险评分中的可靠性问题,通过合成患者数据评估提示设计和非临床信息对预测稳定性的影响,揭示了非临床信息对模型输出的显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23163 2026-04-30 cs.AI cs.CL cs.CR cs.IT cs.MA math.IT 62%

A Decision-Theoretic Formalisation of Steganography With Applications to LLM Monitoring

基于决策理论的隐写术形式化及其在大语言模型监控中的应用

Usman Anwar, Julianna Piskorz, David D. Baek, David Africa, Jim Weatherall, Max Tegmark, Christian Schroeder de Witt, Mihaela van der Schaar, David Krueger

机构 * University of Cambridge(剑桥大学) Massachusetts Institute of Technology(麻省理工学院) UK AI Safety Institute(英国人工智能安全研究所) University of Oxford(牛津大学) Mila, University of Montreal(蒙特利尔大学米尔人工智能实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出决策理论视角下的隐写术形式化方法,通过通用V-信息量定义隐写差距,用于检测和缓解大语言模型中的隐写推理行为。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26501 2026-04-30 cs.CL cs.AI cs.HC 62%

Tree-of-Text: A Tree-based Prompting Framework for Table-to-Text Generation in the Sports Domain

树-文本:一种基于树的提示框架,用于体育领域中的表格到文本生成

Shang-Hsuan Chiang, Tsan-Tsung Yang, An-Zi Yen, Wen-Chih Peng

机构 * National Yang Ming Chiao Tung University

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Tree-of-Text框架,通过三阶段生成过程提升表格到文本生成的精度与效率,在多个体育数据集上表现优异。

Comments Accepted by ACL SRW 2025: Long Paper (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26235 2026-04-30 cs.CR cs.AI cs.CL 62%

LATTICE: Evaluating Decision Support Utility of Crypto Agents

LATTICE:评估加密代理决策支持效用的基准

Aaron Chan, Tengfei Li, Tianyi Xiao, Angela Chen, Junyi Du, Xiang Ren

机构 * Sahara AI University of Southern California(南加州大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LATTICE基准,用于评估加密代理在真实用户场景中的决策支持能力,通过六个评估维度、16种任务类型和LLM评委,实现大规模可扩展评估,揭示不同代理在决策支持质量上的显著差异及权衡。

Comments 15 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25982 2026-04-30 cs.LG cs.AI cs.CY cs.ET 62%

Open Problems in Frontier AI Risk Management

前沿人工智能风险管理中的开放问题

Marta Ziosi, Miro Plueckebaum, Stephen Casper, Henry Papadatos, Ze Shen Chin, Peter Slattery, James Gealy, Tim G. J. Rudner, Brian Tse, Ariel Gil, Patricia Paskov, Maximilian Negele, Rokas Gipiškis, Nada Madkour, Vera Lummis, Rupal Jain, Luise Eder, Kristina Fort, Malou C. van Draanen Glismann, Inès Belhadj, Amin Oueslati, Anna K. Wisakanto, Richard Mallah, Koen Holtman, Ranj Zuhdi, Daniel S. Schiff, Jessica Newman, Malcolm Murray, Robert Trager

机构 * Oxford Martin AI Governance Initiative, University of Oxford(牛津大学人工智能治理倡议) MIT Computer Science and Artificial Intelligence Laboratory, MIT(麻省理工学院计算机科学与人工智能实验室) MIT Future Tech(麻省理工学院未来技术) Stanford University(斯坦福大学) Governance and Responsible AI Lab, Purdue University(普渡大学治理与负责任的人工智能实验室) University of Toronto(多伦多大学) Mercatus Center, George Mason University(乔治·马歇尔大学麦卡锡中心) Vilnius University(维尔纽斯大学) Vijil SaferAI AI Standards Lab(人工智能标准实验室) The Future Society(未来社会) Concordia AI(康科德人工智能) Pivotal Research Center for AI Risk Management & Alignment(人工智能风险管理和对齐中心) UC Berkeley Center for Long-Term Cybersecurity(伯克利大学长期网络安全中心) Independent(独立)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨前沿人工智能风险管理中的核心问题,通过文献综述识别未解决的挑战,并分类问题类型以指导未来研究与治理。

Comments 81 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09870 2026-04-30 cs.HC cs.AI cs.CL 62%

Vibe Check: Understanding the Effects of LLM-Based Conversational Agents' Personality and Alignment on User Perceptions in Goal-Oriented Tasks

Vibe Check: 探讨基于大语言模型的对话代理的性格和对齐对用户在目标导向任务中的感知影响

Hasibur Rahman, Smit Desai

机构 * Northeastern University(东北大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了对话代理性格表达水平和用户与代理性格对齐如何影响用户在目标导向任务中的感知,发现中等表达水平在多个维度上表现最佳,性格对齐进一步提升了结果,尤其在外向性和情绪稳定性和方面影响显著。

Comments 30 pages, CHI 2026 conference paper (article no. 371)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26615 2026-04-30 cs.SE cs.AI 57%

TDD Governance for Multi-Agent Code Generation via Prompt Engineering

通过提示工程实现多智能体代码生成的TDD治理

Tarlan Hasanli, Shahbaz Siddeeq, Bishwash Khanal, Pyry Kotilainen, Tommi Mikkonen, Pekka Abrahamsson

机构 * University of Jyväskylä(于韦斯屈莱大学) Tampere University(塔尔基尔大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种AI原生的TDD框架,通过结构化提示和工作流程治理机制将经典TDD原则形式化,提升LLM辅助开发的稳定性与可重复性。

Comments 5 pages. Submitted to the 1st International Workshop on Empirical Prompt Engineering for Software Engineering (PROMPT-SE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12019 2026-04-30 cs.AI cs.HC 57%

A Framework for Longitudinal Health AI Agents

面向长期健康AI代理的框架

Georgianna Lin, Rencong Jiang, Noémie Elhadad, Xuhai "Orson" Xu

机构 * Columbia University, Biomedical Informatics(哥伦比亚大学生物医学信息学) Columbia University, Computer Science(哥伦比亚大学计算机科学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个多层框架,用于支持长期健康交互的AI代理,强调适应性、连贯性、连续性和自主性,通过案例展示如何维持有意义的参与并支持个性化决策。

Comments 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03664 2026-04-30 eess.SY cs.LG cs.MA cs.SY math.OC 57%

Principled Learning-to-Communicate with Quasi-Classical Information Structures

基于准经典信息结构的原理化学习-通信

Xiangyu Liu, Haoyi You, Kaiqing Zhang

机构 * University of Maryland, College Park, MD, USA(马里兰大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文通过信息结构框架,探讨了在部分可观测环境中学习通信的原理,提出准经典学习-通信的条件和算法,建立了准多项式时间复杂度的规划与学习方法。

Comments Preliminary version appeared at IEEE CDC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03412 2026-04-30 cs.CL 57%

Verified Critical Step Optimization for LLM Agents

用于大语言模型代理的验证关键步骤优化

Mukai Li, Qingcheng Zeng, Tianqing Fang, Zhenwen Liang, Linfeng Song, Qi Liu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) The University of Hong Kong(香港大学) Northwestern University(西北大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出CSO方法,通过验证关键步骤进行强化学习,以提升代理在复杂任务中的表现,实验显示其在GAIA-Text-103和XBench-DeepSearch上优于SFT基线。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17617 2026-04-30 cs.IR cs.CL 57%

Agentic Search in the Wild: Intents and Trajectory Dynamics from 14M+ Real Search Requests

野外代理搜索:从1400万次真实搜索请求中获取意图和轨迹动态

Jingjie Ning, João Coelho, Yibo Kong, Yunfan Long, Bruno Martins, João Magalhães, Jamie Callan, Chenyan Xiong

机构 * Carnegie Mellon University Pittsburgh PA US INESC-ID, Carnegie Mellon University Pittsburgh PA US INESC-ID, Instituto Superior T\'ecnico, University of Lisbon Lisbon Portugal NOVA LINCS\ University Lisbon Caparica Portugal Carnegie Mellon University INESC-ID, Carnegie Mellon University INESC-ID, Instituto Superior T\'ecnico, University of Lisbon NOVA LINCS\ University Lisbon

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文分析了1400万次真实搜索请求,揭示了代理搜索会话中的行为模式,包括步骤数、时间间隔及查询重构的可追溯性,为重复敏感停止和意图适应检索预算提供信号。

Comments Accepted at SIGIR 2026. DOI: 10.1145/3805712.3809627

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12644 2026-04-30 math.OC 50%

AI-Driven Adaptive Air Transit Network with Modular Aerial Pods

基于人工智能的自适应空中交通网络与模块化空中舱

Amir Shafiee, Alireza Yazdiani, Hanieh Rastegar, Rui Li, Rayan Karim, Aolei Cao, Ziyang Li, Xieqing Yu, Charlle Sy, Zhaoyao Bao, Xi Cheng, H. Oliver Gao

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种利用模块化空中舱和人工智能的自适应空中交通网络,通过混合整数非线性规划模型动态调整舱位调度和列车长度,以应对城市交通挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01875 2026-04-30 cs.CV 50%

StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding

StreamAgent:面向流视频理解的前瞻性代理

Haolin Yang, Feilong Tang, Lingxiao Zhao, Xinlin Zhuang, Yifan Lu, Xiang An, Ming Hu, Xiaofeng Zhang, Abdalla Swikir, Junjun He, Zongyuan Ge, Muhammad Haris Khan, Imran Razzak

机构 * MBZUAI Shanghai AI Laboratory(上海人工智能实验室) DeepGlint Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出StreamAgent,通过整合问题语义和历史观测,预测关键事件的时间进展,调整感知动作,提升流视频处理的响应准确性和实时效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16961 2026-04-30 cs.MA cs.CY cs.SY eess.SY 50%

Impacts of Electric Vehicle Charging Regimes and Infrastructure Deployments on System Performance: An Agent-Based Study

电动汽车充电模式与基础设施部署对系统性能的影响:基于代理的分析

Jiahua Hu, Hai L. Vu, Wynita Griggs, Hao Wang

专题命中 规划推理 :planning(abstract)

AI总结 研究通过基于代理的模型分析不同充电模式和基础设施部署对系统性能的影响,发现优化策略能降低总成本,尤其在混合充电模式下效果显著。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05907 2026-04-30 cs.RO 50%

EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks

EvolvingAgent: 基于持续世界模型的课程自进化代理用于长周期任务

Tongtong Feng, Xin Wang, Zekai Zhou, Ren Wang, Yuwei Zhan, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Beijing National Research Center for Information Science and Technology, Tsinghua University(计算机科学与技术系,北京信息科学与技术国家研究中心,清华大学) Department of Computer Science, University of Sydney(计算机科学系,悉尼大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出EvolvingAgent,通过持续世界模型实现自主完成长周期任务,采用任务规划、动作控制和反思模块,提升Minecraft和Atari环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏