arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-02 至 2026-06-02 共收录 66 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 66 篇

2602.01662 2026-06-02 cs.RO 88%

PLanAR: Planning-Language-Grounded Agentic Reasoning for Robot Manipulation

PLanAR:面向机器人操作的规划语言基础智能推理

Pengyuan Guo, Zhonghao Mai, Zhengtong Xu, Kaidi Zhang, Quan Khanh Luu, Heng Zhang, Zichen Miao, Arash Ajoudani, Zachary Kingston, Qiang Qiu, Yu She

机构 * Purdue University(普渡大学) Istituto Italiano di Tecnologia(意大利理工研究院)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract)

AI总结 提出PLanAR框架,通过规划语言接口定义VLM推理空间,实现开放词汇的长时域机器人操作,并支持逐步验证与重规划。

Comments New version with updated framing, contributions, experiments, and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00133 2026-06-02 cs.LG cs.ET 85%

World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications

世界模型:架构、方法论、推理范式与应用的全面综述

Arif Hassan Zidan, Yi Pan, Hanqi Jiang, Ruiyu Yan, Wei Ruan, Zihao Wu, Lifeng Chen, Weihang You, Xinliang Li, Bowen Chen, Huawen Hu, Peilong Wang, Sizhuang Liu, Jing Zhang, Siyuan Li, Zhengliang Liu, Yu Bao, Lin Zhao, Lichao Sun, Dajiang Zhu, Xiang Li, Jinglei Lv, Quanzheng Li, Wei Liu, Tianming Liu, Wei Zhang

机构 * School of Computer and Cyber Sciences, Augusta University(奥古斯塔大学计算机与网络科学学院) School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) Department of Radiology, Massachusetts General Hospital, Harvard Medical School(麻省总医院放射科,哈佛医学院) Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) Department of Graduate Psychology, James Madison University(詹姆斯麦迪逊大学研究生心理学系) Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) School of Biomedical Engineering, The University of Sydney(悉尼大学生物医学工程学院) Tandon School of Engineering, New York University(纽约大学泰坦工程学院) Department of Radiation Oncology, City of Hope National Medical Center(城市希望国家医学中心放射肿瘤科) Department of Mayo Clinic Comprehensive Cancer Center, Mayo Clinics(梅奥诊所综合癌症中心,梅奥诊所) Savannah River Ecology Laboratory (SREL), University of Georgia(萨凡纳河生态实验室(SREL),佐治亚大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出一个多轴分类法,从架构、方法论、推理策略和应用领域四个维度系统综述世界模型,涵盖从早期认知科学基础到PlaNet、Dreamer系列、MuZero、Sora等里程碑系统,并指出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01281 2026-06-02 cs.LG cs.AI 84%

RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning

RLVR 无需无效样本:面向 LLM 推理的群体优先级离策略优化

Yixiu Mao, Yun Qu, Qi Wang, Heming Zou, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习中无效样本导致学习信号不足的问题,提出群体优先级离策略优化(POPO),通过优先级群体重放和解耦重要性采样,在不增加额外采样开销的情况下提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08038 2026-06-02 cs.CL cs.AI 84%

AblationBench: Evaluating Automated Planning of Ablations in Empirical AI Research

AblationBench:评估实证AI研究中消融实验的自动规划

Talor Abramovich, Gal Chechik

机构 * Google Research(谷歌研究)

专题命中 规划推理 :planning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出AblationBench基准套件,包含作者消融和审稿人消融两个任务,用于评估语言模型在AI研究中规划消融实验的能力,实验表明当前最佳模型仅能识别45%的原始消融,低于人类水平。

Comments AI4Science Workshop, ICML 2026; Project page: https://ablation-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06093 2026-06-02 cs.DB cond-mat.mtrl-sci cs.AI cs.CL 84%

Language-Native Materials Processing Design by Lightly Structured Text Database and Reasoning Large Language Model

基于轻结构化文本数据库和推理大语言模型的自然语言材料加工设计

Yuze Liu, Zhaoyuan Zhang, Xiangsheng Zeng, Yihe Zhang, Leping Yu, Liu Yang, Lejia Wang, Xi Yu

机构 * State Key Laboratory of Advanced Materials for Intelligent Sensing, Key Laboratory of Organic Integrated Circuit, Ministry of Education & Tianjin Key Laboratory of Molecular Optoelectronic Sciences, Department of Chemistry, School of Science, Tianjin University(智能传感先进材料国家重点实验室、有机集成电路重点实验室、教育部、天津分子光电子科学重点实验室、化学系、天津大学) Language Intelligence Technology Co., Ltd.(语言智能技术有限公司) College of Intelligence and Computing, Tianjin University(智能与计算学院、天津大学) School of Materials and Chemical Engineering, Ningbo University of Technology(材料与化学工程学院、宁波工业大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 将材料合成规划重构为文本推理问题,通过轻结构化知识基底结合检索增强生成与经验增强推理,在氮化硼纳米片剥离中三轮迭代获得高质量协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01046 2026-06-02 cs.AI 83%

TravelEval: A Comprehensive Benchmarking Framework for Evaluating LLM-Powered Travel Planning Agents

TravelEval:评估基于LLM的旅行规划代理的综合基准框架

Weiyi Chen, Shuaixiong Wang, Ziyun Gao, Kaichun Hu, Wangze Ni, Shimin Di, Chen Jason Zhang, Lei Chen

机构 * Zhejiang University(浙江大学) Hong Kong Polytechnic University(香港理工大学) Southeast University(东南大学) HKUST (GZ) & HKUST Guangzhou(香港科技大学(广州)& 香港科技大学(广州))

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 针对现有基准过度关注约束合规、缺乏真实性和多维评估的问题,提出TravelEval,通过六维评估框架、真实数据沙盒和模拟全局评估方法,全面评估LLM在旅行规划中的表现。

Comments 31pages, 8 figures, accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00922 2026-06-02 physics.med-ph cs.RO 82%

A Machine-to-Machine Knowledge-Guided LLM Agent for Generalizable Radiotherapy Treatment Planning

一种机器到机器知识引导的LLM智能体用于泛化放射治疗计划

Md Mainul Abrar, Xun Jia, Yujie Chi

机构 * National Institutes of Health (NIH)(国家卫生研究院) Department of Physics, The University of Texas at Arlington(德克萨斯理工大学阿灵顿分校物理系) Department of Radiation Oncology and Molecular Radiation Sciences, Johns Hopkins University(约翰霍普金斯大学放射肿瘤学与分子放射科学系)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出一种机器到机器知识引导的大语言模型框架,通过深度强化学习发现的治疗计划参数分布知识迁移至LLM智能体,实现无需人工干预的自主迭代规划,在多种病例中显著提升规划质量和泛化能力。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03203 2026-06-02 cs.CL cs.LG 81%

ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution

ForesightKV: 通过学习长期贡献优化推理模型的KV缓存驱逐

Zican Dong, Peiyu Liu, Junyi Li, Zhipeng Chen, Han Peng, Shuo Wang, Wayne Xin Zhao

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出ForesightKV框架,通过监督学习和强化学习预测KV对在长文本生成中的重要性,在仅用一半缓存预算下优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02438 2026-06-02 cs.AI 79%

LLM-Evolved Pattern Generators for Optimal Classical Planning

LLM演化模式生成器用于最优经典规划

Windy Phung, Dominik Drexler, Arnaud Lequen, Jendrik Seipp

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 提出首个通过LLM驱动的进化程序合成学习可容许启发式函数的方法,用于最优经典规划,结合饱和成本分区保证A*搜索的最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01094 2026-06-02 cs.AI 79%

CAREAgent: Clinical Agent with Structured Reasoning and Tool-Integrated for Order Generation

CAREAgent: 具有结构化推理和工具集成的临床智能体用于医嘱生成

Ruihui Hou, Ziyue Huai, Chennuo Zhang, Ziyan Liu, Siran Zhao, Yao Yu, Jie Zhai, Tong Ruan

机构 * East China University of Science and Technology, Shanghai, China(东华大学上海科学技术学院) Zhongshan Hospital, Fudan University, Shanghai, China(复旦大学中山医院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出CAREAgent,通过两阶段推理数据构建和监督微调与强化学习,生成细粒度临床医嘱,在ClinicalBench上F1提升5.05%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00240 2026-06-02 cs.AI cs.MA 79%

MindZero: Learning Online Mental Reasoning With Zero Annotations

MindZero:零标注的在线心智推理学习

Shunchi Zhang, Jin Lu, Chuanyang Jin, Yichao Zhou, Zhining Zhang, Tianmin Shu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出MindZero框架,通过自监督强化学习训练多模态大语言模型,实现高效鲁棒的在线心智推理,无需显式心智状态标注。

Comments ICML 2026. Website: https://scai.cs.jhu.edu/MindZero

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02845 2026-06-02 cs.RO cs.AI 79%

SPARC: Spatial-Aware Path Planning via Attentive Agent Communication

SPARC: 通过注意力智能体通信实现空间感知路径规划

Sayang Mu, Xiangyu Wu, Bo An

机构 * Nanyang Technological University(南洋理工大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 提出关系增强多头注意力(RMHA)机制,通过嵌入曼哈顿距离到注意力权重计算,优先处理空间邻近机器人的消息,在40x40网格上从8机器人零样本泛化到128机器人时,在30%障碍密度下实现约75%成功率,超越基线25个百分点以上。

Comments The manuscript is being withdrawn at the request of the first author for the purpose of revising content and re-uploading a revised version with updated data/figures/text . The revised manuscript will be resubmitted to arXiv promptly with the same author list and research theme

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11460 2026-06-02 cs.RO cs.LG 79%

Semantic-Geometric Task Representations for Bimanual Manipulation from Human Demonstrations to Robot Action Planning

面向双臂操作的语义-几何任务表示:从人类示范到机器人动作规划

Franziska Herbert, Vignesh Prasad, Han Liu, Dorothea Koert, Georgia Chalvatzaki

机构 * Interactive Robot Perception & Learning (PEARL) Lab, Computer Science Dept., TU Darmstadt, Germany(图腾大学达姆施塔特分校计算机科学系交互机器人感知与学习实验室) Hessian.AI, Darmstadt, Germany(黑森人工智能公司) Robotics Institute Germany (RIG)(德国机器人研究所) Interactive AI Algorithms & Cognitive Models for Human-AI Interaction (IKIDA), Computer Science Dept., TU Darmstadt, Germany(人机交互的交互人工智能算法与认知模型(IKIDA),图腾大学达姆施塔特分校计算机科学系) Center for Cognitive Science, TU Darmstadt, Germany(图腾大学达姆施塔特分校认知科学中心)

专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.LG

AI总结 提出一种语义-几何图任务表示,通过消息传递神经网络编码器和Transformer解码器联合编码对象身份、语义关系和运动历史,实现从人类示范中学习结构化任务表示,并支持跨实体迁移和双臂操作规划。

Comments 9 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09953 2026-06-02 cs.RO cs.AI 79%

DAG-Plan: Generating Directed Acyclic Dependency Graphs for Dual-Arm Cooperative Planning

DAG-Plan:生成有向无环依赖图用于双臂协作规划

Zeyu Gao, Yao Mu, Jinye Qu, Mengkang Hu, Shijia Peng, Chengkai Hou, Lingyue Guo, Ping Luo, Shanghang Zhang, Yanfeng Lu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences (CASIA)(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机科学学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) OpenGVLab, Shanghai AI Laboratory(上海人工智能实验室,OpenGVLab)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 提出DAG-Plan框架,首次使用有向无环图作为双臂协调的核心表示,通过一次LLM解析生成结构化DAG,实现自适应并行执行,在双臂厨房基准测试中成功率提升48%,执行效率提升84.1%。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02321 2026-06-02 cs.CV 78%

Training-Free Composed Video Retrieval via Visual Representation-Guided Video-LLM Reasoning

基于视觉表示引导的视频-大语言模型推理的无训练组合视频检索

Yang Liu, Qianqian Xu, Peisong Wen, Siran Dai, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 提出无训练框架,先利用冻结DINOv3模型筛选视觉相关候选,再通过大视觉语言模型评估指令匹配,最后推理精化,在CVPR 2026挑战赛中取得48.78 Recall@1和51.48 Recall@5。

Comments CVPR 2026, VidLLMs workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01616 2026-06-02 physics.optics 78%

Manifold partitioning induced sequential optical reasoning and decision framework for photonic computing

流形划分诱导的时序光学推理与决策框架用于光子计算

Zhihao Li, Jing Pan, Wei Yan, Yu Xie, Lingmei Ma, Xiaoyu Sun, Min Qiu

专题命中 规划推理 :reasoning(title,abstract)

AI总结 提出时序光学推理与决策(SORD)框架,通过几何引导的数据划分将全局任务分解为粗到细的步骤,使单层衍射光学神经网络实现100类光纤散斑分类,准确率94%,能效23.3 TOPS/W。

Comments 25 pages, 5 figures, submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00985 2026-06-02 cs.RO 78%

Make Your VLA More Robust Without More Data By Interleaving Motion Planning

通过交错运动规划使您的VLA更鲁棒而无需更多数据

Dan BW Choe, Sundhar Vinodh Sangeetha, Samuel Coogan, Shreyas Kousik

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :planning(title,abstract)

AI总结 提出MPVI框架,将基于模型的运动规划与视觉-语言-动作模型交错结合,通过VLM完成检查和本体感受触发实现可靠切换,无需额外训练即可提升长时域移动操作任务的鲁棒性,在BEHAVIOR-1K基准上任务进度提升113%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00933 2026-06-02 cs.RO 78%

Generative Multi-Robot Motion Planning via Diffusion Modeling with Multi-Agent Reinforcement Learning Guidance

基于扩散建模与多智能体强化学习引导的生成式多机器人运动规划

Suk Ki Lee, Venkata Sai Deepak Mutta, Hyunwoong Ko

机构 * School of Manufacturing Systems and Networks, Arizona State University, Mesa, AZ(1制造系统与网络学院,亚利桑那州立大学,梅萨,AZ) Michael W. Hall School of Mechanical Engineering, Mississippi State University, Starkville, MS(2迈克尔·W·霍尔机械工程学院,密西西比州立大学,斯塔克维尔,MS)

专题命中 规划推理 :planning(title,abstract)

AI总结 提出一种结合扩散模型与多智能体强化学习的框架,通过值函数引导反向扩散过程实现交互感知的轨迹生成,降低多机器人冲突率。

Comments 11 pages, 6 figures, 1 table. This paper has been accepted for publication in the proceedings of ASME IDETC-CIE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02416 2026-06-02 cs.AI 77%

Structure Enables Effective Self-Localization of Errors in LLMs

结构使语言模型能够有效自我定位错误

Ankur Samanta, Akshayaa Magesh, Ayush Jain, Kavosh Asadi, Youliang Yu, Daniel Jiang, Boris Vidolov, Kaveh Hassani, Paul Sajda, Jalaj Bhandari, Yonathan Efroni

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室) Tel Aviv University(特拉维夫大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出结构化推理方法,通过将推理分解为离散语义步骤,使语言模型能更可靠地定位错误,并基于此设计了迭代纠正采样框架Thought-ICS,实现20-40%的自我纠正提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01838 2026-06-02 cs.CL cs.AI cs.LG 75%

LayerRoute: Input-Conditioned Adaptive Layer Skipping via LoRA Fine-Tuning for Agentic Language Models

LayerRoute: 基于LoRA微调的输入条件自适应层跳过方法用于智能语言模型

Prateek Kumar Sikdar

机构 * Accenture(埃森哲)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LayerRoute,通过为每个Transformer块添加轻量级路由器和LoRA适配器,根据输入类型(工具调用或规划推理)自适应跳过层,在仅增加0.22%可训练参数下实现12.91%的跳过差异并提升质量。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00991 2026-06-02 cs.AI 74%

Large Language Models in Transportation Systems Management and Operations: From Text Reasoning to Multi-modal Decision Support

交通系统管理与运营中的大语言模型:从文本推理到多模态决策支持

Siyan Li, Zehao Wang, Jiachen Li, Kanok Boriboonsomsin, Matthew J. Barth, Guoyuan Wu

机构 * Bourns College of Engineering, Center for Environmental Research and Technology, University of California at Riverside, CA, USA(伯恩斯工程学院,环境研究与技术中心,加州大学河滨分校,美国,加利福尼亚州河滨)

专题命中 规划推理 :reasoning(title);分类 cs.AI

AI总结 本文综述了大语言模型(LLM)和多模态大语言模型(MM-LLM)在交通系统管理与运营(TSMO)中的应用,涵盖运营与服务、移动性与车队服务、数据建模与决策支持三大领域,并指出了数据异构性、实时推理、可解释性等挑战及未来方向。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01830 2026-06-02 cs.AI 70%

CAPF: Guiding Search-Agent Rollouts with Credit-Attenuated Privileged Feedback

CAPF:基于信用衰减特权反馈引导搜索智能体轨迹生成

Bin Chen, Xinye Liao, Yiming Liu, Xin Liao, Chonghan Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对结果奖励稀疏导致搜索智能体学习困难的问题,提出训练时利用验证器侧信息(CAPF)将零奖励轨迹修复为正奖励轨迹,并衰减相关信用以适配无特权反馈的部署场景,在七个开放域问答基准上将Qwen3-4B的平均精确匹配分数从44.7%提升至48.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01416 2026-06-02 cs.AI 70%

Self-Healing Agentic Orchestrators for Reliable Tool-Augmented Large Language Model Systems

用于可靠的工具增强型大语言模型系统的自愈代理编排器

Rahul Suresh Babu, Adarsh Agrawal

机构 * Independent Researcher(独立研究者) Senior Member, IEEE(IEEE高级成员)

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出一种自愈代理编排器,通过将可靠性视为有界运行时控制问题,映射故障信号、选择恢复动作并验证轨迹,在100任务故障注入基准上达到98.8%任务成功率,优于重试和完全重规划基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01041 2026-06-02 cs.CL 70%

ExpWeaver: LLM Agents Learn from Experience via Latent RAG

ExpWeaver: LLM智能体通过潜在RAG从经验中学习

Tao Feng, Tianyang Luo, Jingjun Xu, Zhigang Hua, Yan Xie, Shuang Yang, Ge Liu, Jiaxuan You

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 提出ExpWeaver框架,利用潜在检索增强生成(无独立RAG模块)使LLM智能体从经验中学习,通过隐藏状态编码经验、潜在空间检索和交叉注意力聚合,在13个任务中12个达到最优,token效率高且跨域泛化强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16720 2026-06-02 cs.DB cs.AI 70%

APEX-SQL: Talking to the data via Agentic Exploration for Text-to-SQL

APEX-SQL: 通过智能体探索与数据对话实现Text-to-SQL

Bowen Cao, Weibin Liao, Yushi Sun, Dong Fang, Haitao Li, Wai Lam

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) LIGHTSPEED

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出APEX-SQL框架,通过假设验证循环、逻辑规划、双路径剪枝、并行数据分析和确定性探索机制,解决静态模式表示在复杂企业数据库中的语义模糊和扩展性问题,在BIRD和Spider 2.0-Snow上取得领先性能。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01985 2026-06-02 cs.CV 67%

MT-EditFlow: Reinforcement Learning for Multi-Turn Image Editing with Flow Matching

MT-EditFlow:基于流匹配的多轮图像编辑强化学习

Jiahui Huang, Yasi Zhang, Tianyu Chen, Shu Wang, Jianwen Xie, Oscar Leong, Mingyuan Zhou, Nanzhu Wang, Ying Nian Wu

机构 * Apple(苹果公司) University of California, Los Angeles(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Lambda, Inc(Lambda公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出MT-EditFlow框架,通过流匹配强化学习优化多轮图像编辑的奖励信号,解决单轮编辑模型在多轮交互中的失败和误差传播问题,显著提升多轮编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01663 2026-06-02 cs.GT cs.DC cs.MA 67%

A Sheaf Framework for Strategic Multi-Agent Systems: From Consensus to Nash Equilibria

面向策略性多智能体系统的层框架:从共识到纳什均衡

Manuel Hernández, Eduardo Sánchez-Soto

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一个统一的范畴框架,通过引入博弈层概念,将事件演算、SCEL类集成形成和博弈论奖励结构整合到时空历史的格罗滕迪克拓扑中,并证明纳什均衡对应于派生最佳响应对应层的全局截面,而同调障碍分类策略一致性的失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25195 2026-06-02 cs.CV 67%

Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

Baton: 用于联合视频-音频生成的显式语义蓝图

Shuyuan Tu, Qi Tian, Zihan Yang, Yue Wu, Xintong Han, Weijie Kong, Jiangfeng Xiong, Jian-Wei Zhang, Zhao Zhong, Liefeng Bo, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯幻元)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出Baton框架,通过VA-Planner生成语义对齐的模态感知规划令牌作为蓝图,注入扩散骨干以协调视频和音频去噪,解决现有方法因缺乏共享长期规划导致的跨模态对齐脆弱问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12813 2026-06-02 cs.CL cs.AI cs.CR cs.LG 67%

REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations

REALISTA: 引发LLM幻觉的逼真潜在对抗攻击

Buyun Liang, Jinqi Luo, Liangzu Peng, Kwan Ho Ryan Chan, Darshan Thaker, Kaleab A. Kinfu, Fengrui Tian, Hamed Hassani, René Vidal

机构 * University of Waterloo(滑铁卢大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出REALISTA框架,通过潜在空间优化语义等价的对抗提示,有效引发大语言模型幻觉,优于现有方法。

Comments Accepted at ICML 2026. Code is available at https://github.com/Buyun-Liang/REALISTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02372 2026-06-02 cs.AI cs.CL 62%

COMAP: Co-Evolving World Models and Agent Policies for LLM Agents

COMAP:面向LLM智能体的世界模型与智能体策略协同进化

Youwei Liu, Jian Wang, Hanlin Wang, Wenjie Li

机构 * Central South University(中南大学) College of Computer Science, Sichuan University(四川大学计算机学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出COMAP框架,通过闭环交互协同进化文本世界模型和智能体策略,在具身任务规划、网页导航和工具使用基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏