arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-11 至 2026-05-11 共收录 35 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 35 篇

2605.07248 2026-05-11 cs.CL cs.LG 86%

PaT: Planning-after-Trial for Efficient Test-Time Code Generation

PaT:在试后进行规划以实现高效的测试时间代码生成

Youngsik Yoon, Sungjae Lee, Seockbean Song, Siwei Wang, Wei Chen, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH, South Korea(韩国POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH, South Korea(韩国POSTECH人工智能研究生院) Microsoft Research Asia, Beijing, China(中国北京微软亚洲研究院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PaT方法,通过在试后规划来提高测试时间代码生成的效率,采用异构模型配置在多个基准和模型家族中显著提升了成本性能帕累托前沿。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07776 2026-05-11 cs.LG cs.AI cs.CL 85%

Tracing Uncertainty in Language Model "Reasoning"

追踪语言模型推理中的不确定性

Nils Grünefeld, Bertram Højer, Philipp Mondorf, Barbara Plank, Anna Rogers, Christian Hardmeier, Stefan Heinrich, Jes Frellsen

机构 * Data Science Section, IT University of Copenhagen(丹麦哥本哈根技术大学数据科学部门) MaiNLP, Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心MaiNLP) Department of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Pioneer Centre for Artificial Intelligence(先锋人工智能中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过不确定性量化分析语言模型推理轨迹,发现其不确定性特征可预测最终答案正确性,且早期即可检测错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14868 2026-05-11 cs.LG cs.AI 81%

Goldilocks RL: Tuning Task Difficulty to Escape Sparse Rewards for Reasoning

Goldilocks RL: 调整任务难度以摆脱稀疏奖励进行推理

Ilia Mahrooghi, Aryo Lotfi, Emmanuel Abbe

机构 * EPFL(苏黎世联邦理工学院) Apple(苹果公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Goldilocks RL通过预测学生模型的难度来优化数据采样,利用GRPO训练提升模型性能,克服稀疏奖励带来的样本效率低问题。

Comments 28 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09629 2026-05-11 cs.AI cs.LG 81%

End-to-end PDDL Planning with Hardcoded and Dynamic Agents

端到端PDDL规划与硬编码和动态智能体

Emanuele La Malfa, Ping Zhu, Samuele Marro, Sara Bernardini, Michael Wooldridge

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Engineering, University of Oxford(牛津大学工程系)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个端到端框架,通过验证器支持规划。协调器接收自然语言规范,转换为PDDL模型,子模块(智能体)迭代优化规划需求。支持硬编码和动态智能体,最终计划转换为自然语言。

Comments Code: https://github.com/EmanueleLM/MultiAgentPlanning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07768 2026-05-11 eess.SY cs.LG cs.SY 79%

Interactive Trajectory Planning with Learning-based Distributionally Robust Model Predictive Control and Markov Systems

基于学习的分布鲁棒模型预测控制与马尔可夫系统的交互轨迹规划

Erik Börve, Nikolce Murgovski, Morteza Haghir Chehreghani, Leo Laine

机构 * Chalmers University of Technology(查尔姆斯理工大学) Volvo Group Trucks Technology(沃尔沃集团卡车技术)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 本文研究了在周围智能体决策不确定性下的交互轨迹规划问题,提出结合PAC学习与分布鲁棒优化的DR-MPC框架,通过样本数量实现鲁棒MPC与随机MPC之间的插值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02073 2026-05-11 cs.CL 79%

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

通过搜索驱动强化学习优化奖励函数以增强大语言模型推理能力

Arash Ahmadi, Sarah Sharif, Yaser, Banad

机构 * School of Electrical and Computer Engineering, University of Oklahoma(俄克拉荷马大学电气与计算机工程学院) Intelligent Neuromorphic and Quantum Understanding for Innovative Research and Engineering (INQUIRE) Laboratory, University of Oklahoma(智能神经形态与量子理解创新研究与工程实验室,俄克拉荷马大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种搜索驱动框架,通过优化奖励函数提升大语言模型推理能力,通过五轮搜索生成50个候选奖励,最终获得79.5%的F1分数,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07353 2026-05-11 cs.AI 79%

Confidence-Aware Alignment Makes Reasoning LLMs More Reliable

增强置信度的对齐使推理大语言模型更加可靠

Kejia Chen, Jiawen Zhang, Yihong Wu, Kewei Gao, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia

机构 * Zhejiang University(浙江大学) Université de Montréal(蒙特利尔大学) Sun Yat-sen University(中山大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CASPO框架,通过迭代直接偏好优化将token级置信度与逐步逻辑正确性对齐,提升推理可靠性和效率,实验表明其在多个基准和模型家族中表现优异。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07174 2026-05-11 cs.AI 79%

Repeated Deceptive Path Planning against Learnable Observer

针对可学习观察者的重复欺骗路径规划

Shiyue Cao, Pei Xu, Likun Yang, Lei Cui, Shizhao Yu, Shiyu Zhang, Yongjian Ren, Xiaotang Chen, Kaiqi Huang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(中国科学院复杂系统认知与决策智能国家重点实验室)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出DeMP框架,通过双层优化应对可学习观察者的适应性,提升欺骗持续性,实验显示其在重复欺骗路径规划中表现优异。

Comments Full version of the extended abstract accepted at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06957 2026-05-11 cs.AI 79%

Learning and Reusing Policy Decompositions for Hierarchical Generalized Planning with LLM Agents

基于LLM代理的分层通用规划中的策略分解学习与重用

Shirin Sohrabi, Haritha Ananthakrishnan, Harsha Kokel, Kavitha Srinivas, Michael Katz

机构 * IBM

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种结合通用规划与分层任务分解的动态策略学习方法,通过自动分解学习可重用的策略组件,提升任务执行效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03728 2026-05-11 cs.CV cs.AI 79%

CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval

CSMCIR: 基于记忆库的增强对称对齐用于复合图像检索

Zhipeng Qian, Zihan Liang, Yufei Ma, Ben Chen, Huangyu Dai, Yiwei Ma, Jiayi Ji, Chenyi Lei, Han Li, Xiaoshuai Sun

机构 * Kuaishou Technology(快播科技) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 规划推理 :CoT(title);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出CSMCIR,通过多级链式思维提示策略、对称双塔架构和熵基记忆库策略,实现高效查询-目标对齐,提升复合图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19788 2026-05-11 cs.AI cs.LG 73%

Benchmarking World-Model Learning with Environment-Level Queries

用环境级查询评估世界模型学习

Archana Warrier, Dat Nguyen, Michelangelo Naim, Moksh Jain, Yichao Liang, Karen Schroeder, Cambridge Yang, Joshua B. Tenenbaum, Sebastian Vollmer, Kevin Ellis, Zenna Tavares

机构 * Basis Research Institute DFKI GmbH Harvard University Universit\'e de Montr\'eal \& Mila - Quebec AI Institute University of Cambridge Massachusetts Institute of Technology Cornell University

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WorldTest协议,通过环境级查询评估智能体是否学习到支持多种环境属性的模型,通过AutumnBench验证人类在网格世界环境中的表现优于前沿模型。

Comments 34 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08019 2026-05-11 cs.AI q-bio.NC 70%

Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners

玩乐的动机:前沿LRMs与人类游戏学习者的行为与大脑对齐

Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov

机构 * University of Oxford(牛津大学) Columbia University(哥伦比亚大学) New York University(纽约大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文研究了前沿LRMs在游戏学习中的行为与大脑活动对齐情况,发现其在游戏发现阶段更接近人类行为,并能更准确预测大脑活动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00568 2026-05-11 cs.CL 70%

ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards

ReSeek:一种具有指导性奖励的自我纠正搜索代理框架

Shiyu Li, Yang Tang, Yifan Wang, Peiming Li, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent, Shenzhen, China(腾讯基本算法中心、PCG、腾讯,深圳,中国) Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生学院,清华大学,深圳,中国)

专题命中 规划推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出ReSeek框架,通过引入自我纠正机制和密集指导性奖励函数,提升搜索代理在复杂任务中的表现和路径忠实度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07677 2026-05-11 cs.IR cs.AI cs.CL 62%

TRACE: Tourism Recommendation with Accountable Citation Evidence

TRACE:基于可问责引用证据的旅游推荐

Zixu Zhao, Sijin Wang, Yu Hou, Yuanyuan Xu, Yufan Sheng, Xike Xie, Wenjie Zhang, Won-Yong Shin, Xin Cao

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Adelaide(阿德莱德大学) Yonsei University(延世大学) USTC(中国科学技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 TRACE通过多轮对话结合评论引用和显式拒绝机制,解决旅游推荐中信任、可验证性和适应性问题,提出三项能力差距并验证评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07505 2026-05-11 cs.AI cs.LG 62%

LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning

LiteGUI: 通过强化学习蒸馏紧凑的GUI代理

Yubin Wu, Zicheng Cai, Liping Ning, Hua Wang, Zhi Chen, Yaohua Tang, Hao Chen

机构 * Moore Threads AI

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需监督微调的训练方法,通过引导在线蒸馏和多解决方案双层GRPO框架,提升小规模模型在GUI任务中的性能和探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07129 2026-05-11 cs.IR cs.AI cs.LG 62%

RRCM: Ranking-Driven Retrieval over Collaborative and Meta Memories for LLM Recommendation

RRCM:基于协作和元记忆的排序驱动检索用于LLM推荐

Shijun Li, Wooseong Yang, Yu Wang, Tianxin Wei, Joydeep Ghosh

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Illinois at Chicago(伊利诺伊大学香槟分校) Capital One AI Foundations(Capital One AI基金会) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RRCM通过排序驱动的检索与推理框架,解决LLM推荐中构建相关上下文的挑战,利用自然语言表示的协作和元记忆,实现灵活的证据获取,提升推荐质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07042 2026-05-11 cs.AI cs.LG 62%

The Context Gathering Decision Process: A POMDP Framework for Agentic Search

上下文收集决策过程:一种用于代理搜索的POMDP框架

Chinmaya Kausik, Adith Swaminathan, Nathan Kallus

机构 * University of Michigan(密歇根大学) Netflix

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CGDP框架,通过将LLM行为建模为近似汤普森采样,引入谓词方法分解搜索过程,并设计两种干预措施提升多跳推理能力。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06908 2026-05-11 cs.LG cs.AI 62%

Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents

同信号,异意义:方向感知的自适应学习用于大语言模型代理

Ziming Li, Jiatan Huang, Xiaoguang Guo, Guilin Wang, Chuxu Zhang

机构 * University of Connecticut(康奈尔大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 规划推理 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DIAL方法,通过方向感知的自适应学习解决LLM代理中计算需求与计算适宜性差异问题,提升性能-成本平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06716 2026-05-11 cs.AI cs.CL 62%

From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms

从存储到经验:LLM代理记忆机制演化的综述

Jinghao Luo, Yuchen Tian, Chuxue Cao, Ziyang Luo, Hongzhan Lin, Kaixin Li, Chuyi Kong, Ruichao Yang, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) South China Normal University(南方中国师范大学) Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Science and Technology Beijing(北京科技大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了LLM代理记忆机制的发展,提出三阶段框架,分析长程一致性、动态环境挑战和持续学习目标,探讨前瞻性探索与跨轨迹抽象等前沿机制,为下一代LLM代理设计提供指导。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24372 2026-05-11 cs.CL cs.AI cs.NE 62%

SeaEvo: Advancing Algorithm Discovery with Strategy Space Evolution

SeaEvo:通过策略空间进化推进算法发现

Sichun Luo, Yi Huang, Haochen Luo, Fengyuan Liu, Guanzhi Deng, Lei Li, Qinghua Yao, Zefa Hu, Junlan Feng, Qi Liu

机构 * The University of Hong Kong(香港大学) JIUTIAN Research, China Mobile(钧天研究院,中国移动) City University of Hong Kong(城市大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SeaEvo通过策略空间进化层,将语言级策略推理转化为群体级进化状态,提升LLM引导的程序搜索效果,实现算法发现、系统优化和智能体设计任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00886 2026-05-11 cs.AI 57%

Position: Agent Should Invoke External Tools ONLY When Epistemically Necessary

位置:智能体应仅在知识上必要时调用外部工具

Hongru Wang, Cheng Qian, Manling Li, Jiahao Qiu, Boyang Xue, Mengdi Wang, Heng Ji, Amos Storkey, Kam-Fai Wong

机构 * University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学) Princeton University(普林斯顿大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨智能体在何种情况下应调用外部工具,提出应仅在内部推理无法可靠完成任务时才调用。引入了理论框架,强调决策中的不确定性管理,指出不必要的委托会降低效率并阻碍内部推理能力的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13724 2026-05-11 cs.AI 57%

Heterogeneous Graph Neural Networks with Post-hoc Explanations for Multi-modal and Explainable Land Use Inference

异构图神经网络与事后解释方法用于多模态和可解释的土地利用推断

Xuehao Zhai, Junqi Jiang, Adam Dejl, Antonio Rago, Fangce Guo, Francesca Toni, Aruna Sivakumar

机构 * Imperial College London, Department of Civil and Environmental Engineering(帝国理工学院伦敦校区土木与环境工程系) Imperial College London, Department of Computing(帝国理工学院伦敦校区计算机系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种结合异构图神经网络与可解释AI的方法,用于多模态土地利用推断,提升了准确性和可解释性,尤其在办公和生活用地方面表现突出。

Journal ref Information Fusion, Volume 120, 103057. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07301 2026-05-11 cs.AI 57%

SOM: Structured Opponent Modeling for LLM-based Agents via Structural Causal Model

基于结构因果模型的对手建模:通过结构因果模型实现基于大语言模型的智能体

Shiyue Cao, Pei Xu, Likun Yang, Lei Cui, Xiaotang Chen, Kaiqi Huang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences \& Institute of Automation, Chinese Academy of Sciences Beijing China National Key Laboratory of Cognition Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences Beijing China School of Artificial Intelligence, University of Chinese Academy of Sciences Beijing China Institute of Automation, Chinese Academy of Sciences Beijing China School of Artificial Intelligence, University of Chinese Academy of Sciences \& Institute of Automation, Chinese Academy of Sciences Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences School of Artificial Intelligence, University of Chinese Academy of Sciences Institute of Automation, Chinese Academy of Sciences

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SOM框架,通过结构因果模型明确分离对手建模与预测,提升多智能体环境中的预测准确性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07164 2026-05-11 cs.CL 57%

Rethinking Experience Utilization in Self-Evolving Language Model Agents

重新思考自演化语言模型代理中的经验利用

Weixiang Zhao, Yingshuo Wang, Yichen Zhang, Yanyan Zhao, Yu Zhang, Yang Wu, Dandan Tu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究自演化代理中经验利用的关键设计维度,提出ExpWeaver方法,通过在决策过程中交织经验使用,使代理在需要额外指导时才调用经验,提升性能。

Comments 30 pages, 20 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07110 2026-05-11 cs.CL cs.SE 57%

Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability

保障计算机使用代理:一种面向部署的架构-生命周期框架用于可靠性

Zejian Chen, Zhanyuan Liu, Chaozhuo Li, Mengxiang Han, Songyang Liu, Litian Zhang, Feng Gao, Yiming Hei, Xi Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Academy of Information and Communications Technology, Artificial Intelligence Institute(信息与通信技术研究院,人工智能研究所)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出一种面向部署的架构-生命周期框架,用于提升计算机使用代理的可靠性,通过分析感知、决策和执行层,以及创建、部署、操作和维护阶段,解决能力形成、授权暴露、故障表现和控制放置之间的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07073 2026-05-11 cs.AI 57%

TeamBench: Evaluating Agent Coordination under Enforced Role Separation

TeamBench: 在强制角色分离下评估代理协调

Yubin Kim, Chanwoo Park, Taehan Kim, Eugene Park, Samuel Schmidgall, Salman Rahman, Chunjong Park, Cynthia Breazeal, Xin Liu, Hamid Palangi, Hae Won Park, Daniel McDuff

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Independent Researcher(独立研究者)

专题命中 规划推理 :verifier(abstract);分类 cs.AI

AI总结 TeamBench通过851个任务模板和931个预设实例,评估在操作系统强制角色分离下代理协调的能力,发现提示仅和沙盒强制团队的通过率无显著差异,但提示仅团队更易出现验证者篡改执行者代码的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08256 2026-05-11 cs.CL 57%

NCL-UoR at SemEval-2026 Task 5: Embedding-Based Methods, Fine-Tuning, and LLMs for Word Sense Plausibility Rating

NCL-UoR在SemEval-2026任务5中的表现:基于嵌入的方法、微调与大语言模型用于词义可plausibility评分

Tong Wu, Thanet Markchom, Huizhi Liang

机构 * Independent Researcher(独立研究者) Department of Computer Science, University of Reading(阅读大学计算机科学系) School of Computing, Newcastle University(新castle大学计算学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文比较了三种方法:基于嵌入的方法、Transformer微调和大语言模型提示,发现结构化提示优于微调和嵌入方法,提示设计比模型规模更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12852 2026-05-11 cs.AI 57%

WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory Pruning

WebClipper: 基于图的轨迹修剪高效进化网络代理

Junjie Wang, Zequn Xie, Dan Yang, Jie Feng, Yue Shen, Duolin Sun, Meixiu Long, Yihan Jiao, Zhehao Tan, Jian Wang, Peng Wei, Jinjie Gu

机构 * Ant Group(蚂蚁集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出WebClipper框架,通过图基修剪压缩网络代理轨迹,减少20%的工具调用次数并提升准确性,引入F-AE Score指标平衡精度与效率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11162 2026-05-11 cs.CL 57%

Retrieval Heads are Dynamic

检索头是动态的

Yuping Lin, Zitao Li, Yue Xing, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Zoom Communications(Zoom公司) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文从动态视角研究LLM中的检索头,揭示其时间动态性、不可替代性及与隐藏状态的关联,通过实验验证动态检索头在生成任务中的优势。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17942 2026-05-11 cs.AI cs.DB 57%

LLM-Based SQL Generation: Prompting, Self-Refinement, and Adaptive Weighted Majority Voting

基于大型语言模型的SQL生成:提示、自我完善与自适应加权多数投票

Yu-Jie Yang, Hung-Fu Chang, Po-An Chen

机构 * Institute of Information Management(信息管理研究所) National Yang Ming Chiao Tung University(阳明交通大学) R. B. Annis School of Engineering(R. B. Annis工程学院) University of Indianapolis(印第安纳大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出SSEV管道,通过自我完善与加权多数投票提升SQL生成准确性,在多个基准测试中取得良好成绩,并进一步提出ReCAPAgent-SQL框架以应对企业数据库复杂性,提升实际应用效果。

Comments 29 pages, 22 figures

Journal ref 2026 International Conference on Information Management

详情

展开后加载摘要…

URL PDF HTML 收藏