arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5001 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5001 篇

2604.06066 2026-04-08 cs.CL 70%

From Hallucination to Structure Snowballing: The Alignment Tax of Constrained Decoding in LLM Reflection

从幻觉到结构雪球效应:约束解码在LLM反思中的对齐税

Hongxu Zhou

机构 * Saarland University(萨尔大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 研究探讨了在开放式推理任务中,约束解码通过强制结构反思是否能避免错误传播,发现反而引发结构雪球效应,并揭示了约束解码的对齐税问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04847 2026-04-07 eess.AS cs.CL 70%

Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency

全双工基准v3:在现实世界不流畅条件下评估全双工语音代理的基准工具

Guan-Ting Lin, Chen Chen, Zhehuai Chen, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出全双工基准v3,用于评估在自然语音条件下和多步骤工具使用中语言模型的性能。通过六个模型配置评估准确性、延迟和轮流交流维度,发现GPT-Realtime在Pass@1和打断避免方面表现最佳,而Gemini Live 3.1具有最短延迟但轮流率最低。

Comments Work in progress. Demo at https://daniellin94144.github.io/FDB-v3-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03266 2026-04-07 cs.MA cs.LG 70%

Emergent Compositional Communication for Latent World Properties

涌现的组合通信用于潜在世界属性

Tomek Kaszyński

机构 * Independent Researcher, Amsterdam, Netherlands(独立研究者,阿姆斯特丹,荷兰)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文研究多智能体通信能否从冻结视频特征中提取离散组合性表示,展示通过Gumbel-Softmax瓶颈和迭代学习发展出无标签的组合协议,验证了感知先验对可通信信息的影响。

Comments 24 pages, 4 figures, 12 tables. Code: https://github.com/TomekKaszynski/emergent-physics-comm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26845 2026-03-31 cs.SE cs.AI 70%

GISclaw: An Open-Source LLM-Powered Agent System for Full-Stack Geospatial Analysis

GISclaw:一个基于大语言模型的开源代理系统,用于全栈地理空间分析

Jinzhen Han, JinByeong Lee, Yuri Shim, Jisung Kim, Jae-Joon Lee

机构 * Sungkyunkwan University(成均馆大学) Ministry of the Interior and Safety(行政安全部) University of Leeds(利兹大学) Jeonju University(全州大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 GISclaw通过集成LLM推理核心、Python沙盒、开源GIS库和交互界面,实现多数据类型的全栈地理空间分析,采用双代理架构和三种创新机制,提升任务成功率至96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL 70%

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22228 2026-03-24 cs.CV cs.AI 70%

SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性

Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14724 2026-03-17 cs.AI 70%

GameUIAgent: An LLM-Powered Framework for Automated Game UI Design with Structured Intermediate Representation

GameUIAgent:一种基于大语言模型的自动化游戏UI设计框架,采用结构化中间表示

Wei Zeng, Fengwei An, Zhen Liu, Jian Zhao

专题命中 复杂问题求解 :test-time compute(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出GameUIAgent框架,通过结构化中间表示将自然语言描述转化为Figma设计,结合神经符号管道实现迭代自校正,发现质量天花板效应和渲染评估保真原则。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12290 2026-03-16 cs.IR cs.AI 70%

Detecting Miscitation on the Scholarly Web through LLM-Augmented Text-Rich Graph Learning

通过LLM增强的文本丰富图学习检测学术网络中的误引

Huidong Wu, Haojia Xiang, Jingtong Gao, Xiangyu Zhao, Dengsheng Wu, Jianping Li

机构 * Chinese Academy of Sciences & City University of Hong Kong(中国科学院与香港城市大学) City University of Hong Kong(香港城市大学) Shenzhen University & Beijing Dongbi Data Technology(深圳大学与北京东碧数据技术) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出LAGMiD框架,利用LLM进行深度语义推理,结合图神经网络实现高效误引检测,通过证据链推理和知识蒸馏降低计算成本,实验显示效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18607 2026-03-13 cs.AI 70%

From Entity-Centric to Goal-Oriented Graphs: Enhancing LLM Knowledge Retrieval in Minecraft

从以实体为中心到以目标为导向的图:增强Minecraft中的LLM知识检索

Jonathan Leung, Yongjie Wang, Zhiqi Shen

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出目标导向图(GoG)框架,通过构建目标依赖关系图提升LLM在Minecraft中的步骤推理能力,实验表明其优于GraphRAG等方法。

Comments Accepted at Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09152 2026-03-11 cs.AI cs.DB cs.IR 70%

DataFactory: Collaborative Multi-Agent Framework for Advanced Table Question Answering

DataFactory: 用于高级表格问答的协作多智能体框架

Tong Wang, Chi Jin, Yongkang Chen, Huan Deng, Xiaohui Kuang, Gang Zhao

机构 * Institute of Systems Engineering, Academy of Military Sciences(系统工程研究所,军事科学院) School of Information Resource Management, Renmin University of China(信息资源管理学院,中国人民大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 DataFactory通过多智能体协作框架提升表格问答的准确性和鲁棒性,采用ReAct范式和自动知识转换,显著提高查询精度和多跳推理能力。

Comments Published in Information Processing & Management, 2026

Journal ref Information Processing & Management, 63(6):104723, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07728 2026-03-10 cs.AI 70%

A Novel Multi-Agent Architecture to Reduce Hallucinations of Large Language Models in Multi-Step Structural Modeling

一种新型多智能体架构以减少大型语言模型在多步骤结构建模中的幻觉

Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng, Dan M. Frangopol, Minghui Cheng

机构 * Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) HBC Engineering Company(HBC工程公司) College of Civil Engineering, Hunan University(湖南大学土木学院) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系) Department of Civil and Environmental Engineering, Lehigh University(莱斯利大学土木与环境工程系) School of Architecture, University of Miami(迈阿密大学建筑学院)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种新型多智能体架构,通过并行代理协同工作,利用OpenSeesPy实现多步骤结构建模自动化,有效减少幻觉并提高计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00582 2026-03-04 cs.CL 70%

Super Research: Answering Highly Complex Questions with Large Language Models through Super Deep and Super Wide Research

超研究:通过超深和超宽研究利用大型语言模型解决高度复杂的问题

Yubo Dong, Nianhao You, Yuxuan Hou, Zixun Sun, Yue Zhang, Liang Zhang, Siyuan Zhao, Hehe Fan

机构 * College of Computer Science and Technology(计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 通过超深和超宽研究,利用大型语言模型解决高度复杂问题,提供可验证的报告和审计协议,评估模型在复杂研究任务中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10760 2026-03-03 q-bio.BM cs.AI 70%

FROGENT: An End-to-End Full-process Drug Design Multi-Agent System

FROGENT:一种端到端的全流程药物设计多智能体系统

Qihua Pan, Dong Xu, Qianwei Yang, Jenna Xinyi Yao, Sisi Yuan, Zexuan Zhu, Jianqiang Li, Junkai Ji

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 FROGENT通过多智能体系统整合药物发现全流程,利用LLM能力提升效率与准确性,减少人工干预。

Comments 37 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00846 2026-03-03 cs.IR cs.LG 70%

Tiny-Critic RAG: Empowering Agentic Fallback with Parameter-Efficient Small Language Models

Tiny-Critic RAG:赋能代理回退的参数高效小型语言模型

Yichao Wu, Penghao Liang, Yafei Xiang, Mengwei Yuan, Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan

机构 * Northeastern University(东北大学) Washington University in St. Louis(华盛顿大学圣路易斯分校) New York University(纽约大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.LG

AI总结 Tiny-Critic RAG通过参数高效的Small Language Model实现低延迟的二进制路由,有效降低代理部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00532 2026-03-03 cs.AI 70%

DenoiseFlow: Uncertainty-Aware Denoising for Reliable LLM Agentic Workflows

DenoiseFlow:面向可靠LLM代理工作流的不确定性感知去噪

Yandong Yan, Junwei Peng, Shijie Li, Chenxi Li, Yifei Shang, Can Deng, Ruiting Dai, Yongqiang Zhao, Jiaqi Zhu, Yu Huang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) SKLCCSE, School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) Key Laboratory of High Confidence Software Technologies(PKU), MOE(北京大学高可信软件技术重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心)

专题命中 复杂问题求解 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 DenoiseFlow通过闭环框架实现多步推理的不确定性感知去噪,提升LLM代理工作流的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00123 2026-03-03 cs.CV cs.AI 70%

CT-Flow: Orchestrating CT Interpretation Workflow with Model Context Protocol Servers

CT-Flow: 通过模型上下文协议服务器协调CT解释工作流

Yannian Gu, Xizhuo Zhang, Linjie Mu, Yongrui Yu, Zhongzhen Huang, Shaoting Zhang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University, Shanghai, China(清元研究院,上海交通大学,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) Sensetime Research, Shanghai, China(senseTime研究院,上海,中国)

专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 CT-Flow通过模型上下文协议实现3D CT解释工作流的动态协调,提升诊断准确性和工具调用效率。

Comments submitting to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19372 2026-02-24 cs.RO cs.CV cs.LG 70%

Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization

看得更远且更聪明:基于价值引导的多路径反射用于VLM策略优化

Yanting Yang, Shenyuan Gao, Qingwen Bu, Li Chen, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本研究提出了一种基于价值引导的多路径反射方法,用于提升VLM在机器人操作任务中的策略优化性能,通过解耦状态评估与动作生成,提高决策鲁棒性并减少推理时间。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09817 2026-02-11 cs.CL cs.DL 70%

AnalyticsGPT: An LLM Workflow for Scientometric Question Answering

AnalyticsGPT: 一个基于大语言模型的科学度量问答工作流

Khang Ly, Georgios Cheirmpos, Adrian Raudaschl, Christopher James, Seyed Amin Tabatabaei

机构 * Elsevier B.V.(埃塞尔弗斯有限公司)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 AnalyticsGPT通过LLM实现科学度量问答,结合检索增强生成和代理概念,提升科学数据分析效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10936 2026-02-11 cs.CL 70%

Cochain: Balancing Insufficient and Excessive Collaboration in LLM Agent Workflows

Cochain: 在LLM代理工作流中平衡不足与过度的合作

Jiaxing Zhao, Hongbin Xie, Yuzhen Lei, Xuan Song, Zhuoran Shi, Lianxin Li, Shuangxue Liu, Linguo Xie, Haoran Zhang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Urban Planning and Design, Peking University(北京大学城市规划与设计学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 Cochain通过整合知识图谱和提示树,有效解决业务工作流中LLM代理合作问题,优于基线模型。

Comments 35 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07749 2026-02-10 cs.AI 70%

Geo-Code: A Code Framework for Reverse Code Generation from Geometric Images Based on Two-Stage Multi-Agent Evolution

Geo-Code: 一种基于双阶段多智能体演化的几何图像反向代码生成框架

Zhenyu Wu, Yanxi Long, Jian Li, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing, China(人工智能学院,北京师范大学,北京,中国)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 Geo-Code提出一种基于双阶段多智能体演化的几何图像反向代码生成框架,通过像素级锚定和度量驱动的代码演化提升几何重建精度和视觉一致性。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25458 2026-02-05 cs.AI 70%

Plug-and-Play Emotion Graphs for Compositional Prompting in Zero-Shot Speech Emotion Recognition

即插即用的情感图谱用于零样本语音情感识别的组合提示

Jiacheng Shi, Hongfei Du, Y. Alicia Hong, Ye Gao

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出CCoT-Emo框架,通过引入结构化情感图谱提升零样本语音情感识别的性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12434 2026-02-05 cs.AI 70%

Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization

通过熵增强的多轮偏好优化构建编码代理

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

机构 * Department of Computer Science, Northwestern University, Evanston, USA(西北大学计算机科学系) Meta AI, Bellevue, USA(Meta AI)

专题命中 复杂问题求解 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出EntroPO框架,通过增强熵的方法提升多轮交互中编码代理的性能,实现更高效的测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21717 2026-02-03 cs.CL cs.CV 70%

CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution

CrossCheck-Bench:多模态冲突解决中的组成性故障诊断

Baoliang Tian, Yuxuan Si, Jilong Wang, Lingyao Li, Zhongyuan Bao, Zineng Zhou, Tao Wang, Sixu Li, Ziyao Xu, Mingze Wang, Zhouzhuo Zhang, Zhihao Wang, Yike Yun, Ke Tian, Ning Yang, Minghui Qiu

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 CrossCheck-Bench通过多阶段注释流程构建的基准测试,揭示了多模态模型在处理跨模态冲突时的瓶颈,并表明融合符号推理与视觉处理的方法能提升模型的稳健性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08477 2026-01-29 cs.CL 70%

Read as You See: Guiding Unimodal LLMs for Low-Resource Explainable Harmful Meme Detection

读取即可见:引导单模LLM进行低资源可解释有害迷因检测

Fengjun Pan, Xiaobao Wu, Tho Quan, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Ho Chi Minh City University of Technology(胡志明市技术大学) VinUniversity(文大学)

专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 U-CoT+通过轻量级单模LLM和高保真迷因到文本管道,实现低资源、可解释的有害迷因检测,有效提升模型灵活性和适应性。

Comments Accepted to ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17435 2026-01-27 cs.SE cs.AI 70%

Towards a Declarative Agentic Layer for Intelligent Agents in MCP-Based Server Ecosystems

迈向基于MCP服务器生态系统的声明性代理层

Maria Jesus Rodriguez-Sanchez, Manuel Noguera, Angel Ruiz-Zafra, Kawtar Benghazi

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种声明性代理层,旨在解决基于MCP服务器生态系统中代理工作流的可靠性问题,通过明确的架构结构提升任务执行的可验证性和可重复性。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16038 2026-01-23 cs.AI 70%

Grounding Large Language Models in Reaction Knowledge Graphs for Synthesis Retrieval

将反应知识图谱接地于大语言模型以实现合成检索

Olga Bunkova, Lorenzo Di Fruscia, Sophia Rupprecht, Artur M. Schweidtmann, Marcel J. T. Reinders, Jana M. Weber

机构 * Department of Intelligent Systems, Delft University of Technology(智能系统系,代尔夫特理工大学) Department of Chemical Engineering, Delft University of Technology(化学工程系,代尔夫特理工大学)

专题命中 复杂问题求解 :planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本研究通过将反应路径检索转化为图查询生成问题,利用对齐示例的单样本提示提升大语言模型在合成规划中的检索准确性。

Comments Accepted at ML4Molecules 2025 (ELLIS UnConference workshop), Copenhagen, Denmark, December 2, 2025. Workshop page: https://moleculediscovery.github.io/workshop2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13383 2026-01-21 cs.AI 70%

A Lightweight Modular Framework for Constructing Autonomous Agents Driven by Large Language Models: Design, Implementation, and Applications in AgentForge

基于大语言模型的轻量模块化框架:用于AgentForge中的设计、实现与应用

Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

机构 * University of Tartu(塔尔图大学) S Holding OÜ(3S控股公司)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AgentForge是一种基于大语言模型的轻量模块化框架,通过可组合的技能抽象、统一的LLM后端接口和声明性配置系统,提升自主代理的开发效率和灵活性。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12762 2026-01-21 cs.SE cs.AI 70%

Teaching LLMs to Learn Tool Trialing and Execution through Environment Interaction

通过环境交互教授LLMs学习工具尝试与执行

Xingjie Gao, Pengcheng Huang, Zhenghao Liu, Yukun Yan, Shuo Wang, Zulong Chen, Chen Qian, Ge Yu, Yu Gu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Alibaba Group(阿里巴巴集团) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 复杂问题求解 :planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 ToolMaster通过环境交互主动学习工具使用,提升LLMs在新工具上的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01724 2026-01-21 cs.AI 70%

ReflecSched: Solving Dynamic Flexible Job-Shop Scheduling via LLM-Powered Hierarchical Reflection

ReflecSched: 通过LLM赋能的分层反思解决动态灵活作业车间调度问题

Shijie Cao, Yuan Yuan

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北京航空航天大学) Qingdao Research Institute(青岛研究院) Hangzhou Innovation Institute(杭州创新研究院) Zhongguancun Laboratory(中关村实验室)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 ReflecSched通过LLM赋能的分层反思机制,有效解决动态灵活作业车间调度问题,实现优于传统和学习方法的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10318 2026-01-16 cs.CL 70%

Boundary-Aware NL2SQL: Integrating Reliability through Hybrid Reward and Data Synthesis

边界感知的NL2SQL:通过混合奖励和数据合成集成可靠性

Songsong Tian, Kongsheng Zhuo, Zhendong Wang, Rong Shen, Shengtao Zhang, Yong Wu

机构 * Li Auto Inc.(Li汽车公司) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 BAR-SQL通过混合奖励和数据合成方法,提升NL2SQL在生成准确性和边界感知回避能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏