arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2313 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 206 篇

2602.03224 2026-06-09 cs.AI cs.LG 版本更新 62%

TAME: A Trustworthy Test-Time Evolution of Agent Memory with Systematic Benchmarking

TAME: 一种可信的智能体记忆测试时演化与系统化基准测试

Yu Cheng, Yongkang Hu, Jiuan Zhou, Yushuo Zhang, Yihang Chen, Huichi Zhou, Mingang Chen, Zhizhong Zhang, Kun Shao, Yuan Xie, Zhaoxia Yin

机构 * East China Normal University(东华师范大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Computer Software Evaluating and Testing(上海计算机软件评测与测试重点实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出TAME框架,通过执行器-评估器循环实现记忆的可信演化,解决良性任务演化中智能体可信度下降问题,在GPT-5.2 AIME上准确率提升14.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10448 2026-08-19 cs.AI 版本更新 57%

Rationale-Guided Learning for Multimodal Emotion Recognition

基于理由引导学习的多模态情感识别

Sujung Oh, Jung Uk Kim, Sangmin Lee

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多模态情感识别忽略人类因果推理的问题,提出理由引导学习框架,结合双加工理论与MLLM生成的理由训练模型,在IEMOCAP和MELD基准取得最优性能,且推理无额外开销。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18046 2026-08-19 cs.LG 版本更新 57%

SEE: Structure-aware Exploring & Exploiting for Long-horizon GUI Agent Trajectory Synthesis

SEE:用于长视野GUI代理轨迹合成的结构感知探索与利用

Zhuohang Fan, Beichen Zhang, Yuanfa Li, Changqiao Wu, Wei Liu, Jian Luan, Weigang Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院)

专题命中 复杂问题求解 :planning(abstract);分类 cs.LG

AI总结 针对GUI代理轨迹合成中缺乏高覆盖率长视野轨迹的问题,提出SEE两阶段数据合成框架,通过高效探索和基于图的合成,产生可重复可解释数据,避免虚假循环,提升代理任务成功率和泛化能力,还将发布代码和数据集。

Comments Accepted (Oral) by ACM International Conference on Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06474 2026-08-19 cs.CL 版本更新 57%

DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data Storytelling

DataSTORM:利用探索性数据分析和数据叙事进行大规模数据库的深度研究

Shicheng Liu, Yucheng Jiang, Sajid Farook, Camila Nicollier Sanchez, David Fernando Castro Pena, Monica S. Lam

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 DataSTORM通过探索性数据分析和数据叙事,实现对大规模结构化数据库的深度研究,提出基于论点的分析流程,并在InsightBench上取得新的最佳成绩。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14065 2026-08-18 cs.SE cs.AI 版本更新 57%

Rethinking Automated Program Repair: The Impact of Bug Complexity, Fault Localization, and LLM Cost-efficiency

重新思考自动程序修复:缺陷复杂度、缺陷定位与大语言模型成本效率的影响

Junchi Liu, Ali Bigdeli, Roya Daneshi, Atu Ambala, Sudipto Ghosh, Fabio Santos

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过实证分析,发现中等复杂度缺陷可超50%由低成本LLM修复,不精确缺陷定位会扩大APR技术差距,高成本LLM与强推理设置并非总能提升成本效率,DeepSeek-V3.2成本效率最优。

Comments 20 pages, 6 figures, 10 tables. Accepted at ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24148 2026-08-17 cs.SE cs.AI 版本更新 57%

TENET: One Step Toward Test-Driven Development for Repository-Level Code Generation

TENET:迈向仓库级代码生成的测试驱动开发的第一步

Yiran Hu, Shanchao Liang, Nan Jiang, Yi Wu, Lin Tan

机构 * Purdue University(普渡大学) Microsoft Office AI(微软办公人工智能)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究仓库级代码生成的测试驱动开发问题,提出TENET框架,含测试harness机制、定制工具集和细化工作流程,能选简洁测试套件,实现高效检索调试与迭代改进,性能优于基线,还研究了测试套件特征对LLM代理性能的影响。

Comments Accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10840 2026-08-14 cs.LG 版本更新 57%

Training and Benchmarking Code Generation for Physics-Inspired Animations

SimuScene: 通过训练和基准测试代码生成来模拟物理场景

Yanan Wang, Renxi Wang, Yongxin Wang, Xuezhi Liang, Fajri Koto, Timothy Baldwin, Xiaodan Liang, Haonan Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02815 2026-08-12 cs.CL 版本更新 57%

FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents

FlexSQL:灵活探索与执行打造更优的文本到SQL智能体

Quang Hieu Pham, Yang He, Ping Nie, Canwen Xu, Davood Rafiei, Yuepeng Wang, Xi Ye, Jocelyn Qiaochu Chen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 FlexSQL是一种文本到SQL智能体,通过灵活的数据库交互机制,在Spider2-Snow数据集上使用gpt-oss-120b取得65.4%得分,优于相关基线,集成到Claude Code中可实现超10%的相对提升

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01687 2026-08-12 cs.AI 版本更新 57%

CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification

CoEvoSkills: 通过共进化验证实现自进化代理技能

Hanrong Zhang, Shicheng Fan, Henry Peng Zou, Yankai Chen, Zhenting Wang, Jiayu Zhou, Chengze Li, Wei-Chieh Huang, Yifei Yao, Kening Zheng, Xue, Liu, Xiaoxiao Li, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) Columbia University(哥伦比亚大学) Zhejiang University(浙江大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 复杂问题求解 :verifier(abstract);分类 cs.AI

AI总结 本文提出CoEvoSkills框架,使代理能自主生成复杂技能包,通过共进化验证提供反馈,实现在SkillsBench上最高通过率和强泛化能力。

Comments COLM accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13884 2026-08-11 cs.AI 版本更新 57%

Experience Memory Graph: One-Shot Error Correction for Agents

经验记忆图:智能体的一次性错误纠正

Wenjun Wang, Yuchen Fang, Fengrui Liu, Zibo Liang, Kai Zheng

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体在复杂任务中易出错且难恢复的问题,提出经验记忆图框架,将失败恢复转化为图匹配问题,训练时提取相关子图和路径存储,测试时指导智能体,实验证明其性能优于现有基线且无需测试时反复试验。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00959 2026-08-11 cs.AI 版本更新 57%

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

通过部分信息分解理解多模态语言模型中的模态交互

Wanlong Fang, Tianle Zhang, Wen Tao, Alvin Chan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17902 2026-08-11 cs.AI cs.MA cs.SE physics.chem-ph 版本更新 57%

El Agente Gráfico: A Semantic Execution Runtime for Scientific Agents

图形代理:用于科学代理的结构化执行图

Jiaru Bai, Abdulrahman Aldossary, Thomas Swanick, Marcel Müller, Yeonghun Kang, Changhyeok Choi, Naruki Yoshikawa, Zijian Zhang, Jin Won Lee, Tsz Wai Ko, Aiwei Yin, Mohammad Ghazi Vakili, Chris Crebolder, Varinia Bernales, Alán Aspuru-Guzik

机构 * School of Computer Science, McGill University(计算机科学学院,麦吉尔大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 El Agente Gráfico通过结构化执行图和类型安全机制,实现科学代理的高效自动化,适用于复杂计算任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19035 2026-08-10 cs.AI 版本更新 57%

Trustworthy Agent Network: Trust in Agent Networks Must Be Baked In, Not Bolted On

可信代理网络:在代理网络中,信任必须被内置,而非事后添加

Yixiang Yao, Yuhang Yao, Xinyi Fan, Jiechao Gao, Jie Wang, Minjia Zhang, Srivatsan Ravi, Carlee Joe-Wong

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了在代理网络中信任必须被内置而非事后添加的问题,提出了一个综合的概念框架,通过四个设计支柱来建立代理网络中的信任。

Comments Accepted at SIGKDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15771 2026-08-10 cs.CL 版本更新 57%

Skill-RAG: Failure-State-Aware Retrieval Augmentation via Hidden-State Probing and Skill Routing

Skill-RAG: 通过隐藏状态探测与技能路由实现故障状态感知的检索增强

Kai Wei, Raymond Li, Xi Zhu, Zhaoqian Xue, Jiaojiao Han, Jingcheng Niu, Fan Yang

机构 * University of Michigan(密歇根大学) University of British Columbia(不列颠哥伦比亚大学) Rutgers University(罗格斯大学) University of Pennsylvania(宾夕法尼亚大学) New Jersey Institute of Technology(新泽西理工学院) TU Darmstadt(图腾斯大学) Wake Forest University(威克森林大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出Skill-RAG框架,通过轻量级隐藏状态探测器和基于提示的技能路由器,在检索失败时诊断原因并选择四种技能(查询重写、问题分解、证据聚焦、退出)纠正查询-证据错位,显著提升多轮检索后困难案例的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01707 2026-08-07 cs.CL cs.DB 版本更新 57%

Memory in the LLM Era: Modular Architectures and Strategies in a Unified Framework

在大语言模型时代:在统一框架下的模块化架构与策略

Yanchen Wu, Tenghui Lin, Yingli Zhou, Fangyuan Zhang, Qintian Guo, Xun Zhou, Sibo Wang, Xilin Liu, Yuchi Ma, Yixiang Fang

机构 * Huawei Cloud(华为云)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文在统一框架下系统比较了多种记忆方法,设计出优于现有方法的新方法,并探讨了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03079 2026-08-06 cs.CL 版本更新 57%

Learning to Diagnose and Correct Moral Errors: Beyond Shallow Heuristics in Moral Alignment

学习诊断和纠正错误:大型语言模型中的道德敏感性获取

Bocheng Chen, Xi Chen, Han Zi, Haitao Mao, Zimo Qi, Xitong Zhang, Kristen Johnson, Guangliang Liu

机构 * University of Mississippi(密西根州立大学) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) AWS AI Labs(AWS AI实验室) Johns Hopkins University(约翰霍普金斯大学) Qualcomm(高通) Michigan State University(密西根州立大学) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出一种实用推理方法,通过让大型语言模型诊断和纠正道德错误来获取道德敏感性,并在多个任务上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04214 2026-08-06 cs.DB cs.AI cs.PL 版本更新 57%

On The Suitability of Differential Dataflow For Datalog Interpretation In Highly Dynamic Settings

差分数据流在高度动态场景下 Datalog 解释的适用性研究

Bruno Rucy Carneiro Alves de Lima, Merlin Kramer, Kalmer Apinis

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究差分数据流在高度动态场景下 Datalog 解释的适用性,通过对比三种 Datalog 实现的物化效率,为增强动态数据环境中 Datalog 驱动的计算提供了路线图。

Comments 8 pages, AICCC 2023

Journal ref Proceedings of the 2023 6th Artificial Intelligence and Cloud Computing Conference (AICCC 2023), Kyoto, Japan, December 2023, pp. 218-225. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27703 2026-08-05 cs.AI 版本更新 57%

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理

Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen, Caijun Yan, Jianyao Xu, Shunyu Liu, Weijie Fu, Peiliang Li, Xiaozhi Chen, Yuxiang Cai

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28978 2026-08-04 cs.AI cs.CE 版本更新 57%

VFEAgent: A Multimodal Agent Framework for End-to-End Automated Finite Element Analysis

VFEAgent: 面向端到端自动化有限元分析的多模态智能体框架

Jiachen Zhang, Junyi Lao, Chenghao Liu, Siyuan Liu, Shixin Wu, Linsen Zhang, Boyu Wang, Songfang Huang

机构 * Peking University(北京大学) China Agricultural University(中国农业大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出VFEAgent多智能体系统,通过多模态视觉-语言流水线和验证优先的代码合成框架,实现从输入图像和问题描述到有限元建模与仿真的端到端自动化。

Comments 9 pages, 3 figures, 2 tables. Equal contribution: Jiachen Zhang and Junyi Lao. Corresponding author: Songfang Huang. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05220 2026-08-04 cs.CL cs.SD 版本更新 57%

Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

Bagpiper: 通过丰富描述解决开放式音频任务

Jinchuan Tian, Haoran Wang, Bo-Hao Su, Chien-yu Huang, Qingzheng Wang, Jiatong Shi, William Chen, Xun Gong, Siddhant Arora, Chin-Jou Li, Masao Someki, Takashi Maekaku, Keita Goto, Yusuke Shinohara, Jin Sakuma, Chao-Han Huck Yang, Shinji Watanabe

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) LY Corporation(LY公司) NVIDIA Research(NVIDIA研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出Bagpiper,一个8B参数音频基础模型,通过丰富描述(自然语言描述)实现音频理解和生成的统一,在MMAU和AIRBench上超越Qwen-2.5-Omni,生成质量优于CosyVoice3和TangoFlux。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05698 2026-08-04 cs.AI 版本更新 57%

AIC-VDS: Attention-Based In-Context Learning for Joint Velocity Control and Data Collection Scheduling in Multi-UAV-Assisted Pipeline Monitoring

AIC-VDS:面向多无人机辅助管道监测的联合速度控制与数据采集调度的基于注意力的上下文学习

Yousef Emami, Miguel Gutierrez Gaitan, Atefeh Hajijamali Arani, Jingjing Zheng, Hao Zhou

机构 * IEEE

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多无人机辅助管道监测中丢包率高的问题,提出AIC-VDS框架,通过注意力模块压缩输入后利用LLM生成调度与速度决策,可将平均提示长度降50%并稳定丢包率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05950 2026-07-31 cs.CV cs.AI 版本更新 57%

Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models

基于能量驱动的自适应视觉令牌修剪以提高视觉语言模型的效率

Jialuo He, Huangxun Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 E-AdaPrune通过能量驱动的自适应修剪方法,提高视觉语言模型的效率,实现令牌预算的动态分配,减少冗余并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26172 2026-07-31 cs.HC cs.AI cs.SI 版本更新 57%

Linking Heterogeneous Data with Coordinated Agent Flows for Social Media Analysis

通过协调智能体流关联异构数据以开展社交媒体分析

Shifu Chen, Dazhen Deng, Zhihong Xu, Sijia Xu, Linyu Qin, Tai-Quan Peng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Department of Communication, Michigan State University(密歇根州立大学通讯系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出LLM智能体系统SIA,通过协调智能体流关联社交媒体异构多模态数据,采用阶段同步策略挖掘洞见,经评估可发现多样有意义的洞见,为社交媒体分析提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21174 2026-07-31 cs.LG 版本更新 57%

Efficient LLMs with AMP: Attention Heads and MLP Pruning

采用AMP的高效大语言模型:注意力头与多层感知机剪枝

Leandro Giusti Mugnaini, Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Edson Bollis, Lucas Pellicer, Anna Helena Reali Costa, Artur Jordao

机构 * Escola Politécnica(圣保罗理工大学) Instituto de Matemática e Estatística(数学与统计学研究所) Universidade de São Paulo(圣保罗大学) Instituto de Ciência e Tecnologia Itaú (ICTi)(Itaú科学与技术研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出新型结构化剪枝方法AMP,通过剪枝LLMs的注意力头与MLP结构压缩模型,在常识推理任务上超越当前最优方法,提升推理速度,适用于LLaMA、Phi等模型,支持资源受限场景部署。

Comments Published in International Joint Conference on Neural Networks (IJCNN), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10123 2026-07-29 cs.LG 版本更新 57%

Complex-Valued Phase-Coherent Transformer

复值相位相干变换器

Leona Hioki

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出相位相干变换器(PCT),通过实值平滑门保持复值查询-键相似度的相位信息,提升了复杂值变换器在多种任务中的泛化能力。

Comments 26 pages, 17 tables (no figures). Companion Lean 4 formalization of Theorems 1 and 2 at https://github.com/leohio/phase-coherent-transformer-r-d

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05618 2026-07-27 cs.CL 版本更新 57%

Learning to Reason for Factuality

学习进行事实性推理

Xilun Chen, Ilia Kulikov, Vincent-Pierre Berges, Barlas Oğuz, Rulin Shao, Gargi Ghosh, Jason Weston, Wen-tau Yih

机构 * FAIR at Meta(Meta 的 FAIR) University of Washington(华盛顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 研究推理大型语言模型在事实性推理方面的问题,提出同时考虑事实精度、响应细节和答案相关性的新型奖励函数,应用在线强化学习,使模型在长篇事实性基准测试中幻觉率降低、答案细节提升且响应帮助性无降。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05598 2026-07-23 cs.AI cs.HC 版本更新 57%

Prober.ai: Gated Inquiry-Based Feedback via LLM-Constrained Personas for Argumentative Writing Development

Prober.ai:基于LLM约束人设的门控探究式反馈用于论辩写作发展

Ran Bi, Shiyao Wei, Yuanyiyi Zhou

机构 * Florida State University(佛罗里达州立大学) New York University(纽约大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Prober.ai通过约束LLM生成结构化JSON输出,提供探究式问题反馈,帮助学生提升论辩写作能力,其双阶段交互架构通过强制反思提升认知能力。

Comments Prototype awarded second place at the NYEdTech Hackathon (March 2026) https://www.nyedtechhackathon.com/2026-submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14751 2026-07-22 cs.LG 版本更新 57%

HERAKLES: Hierarchical Skill Compilation for Open-ended LLM Agents

HERAKLES:用于开放式语言模型智能体的分层技能编译

Thomas Carta, Clément Romac, Loris Gaven, Pierre-Yves Oudeyer, Olivier Sigaud, Sylvain Lamprier

机构 * Inria(Flowers)(Inria) University of Bordeaux(波尔多大学) Sorbonne Université (ISIR)(索邦大学) Univ Angers (LERIA) SFR MATHSTIC(昂格斯大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.LG

AI总结 研究部分可观测、稀疏奖励且目标空间大的环境中目标条件强化学习,提出HERAKLES分层智能体,联合学习高级语言模型策略与低级控制器,通过同时训练实现可扩展技能组合,提升开放式组合环境下的效率和适应性。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26256 2026-07-21 cs.LG cs.DC 版本更新 57%

DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training

DORA:一种用于语言模型训练的可扩展异步强化学习系统

Tianhao Hu, Xiangcheng Liu, Yuchun Miao, Youshao Xiao, Hongyu Zang, Yang Zheng, Xuan Huang, Jinrui Ding, Yufei Zhang, Yu Yang, Yi-Kai Zhang, Yueqing Sun, Chengcheng Han, Xiandi Ma, Wei Wang, Qi Gu, Yerui Sun, Yuchen Xie, Xunliang Cai

机构 * Meituan, China(美团(中国))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 DORA通过算法-系统协同设计解决异步训练中长尾轨迹问题,提升训练效率并保持收敛性,实验表明其在开源基准和工业应用中均显著提升强化学习训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02025 2026-07-21 cs.DB cs.LG 版本更新 57%

Hippasus: Effective and Efficient Automatic Feature Augmentation for Machine Learning Tasks on Relational Data

Hippasus:用于关系数据上机器学习任务的有效且高效的自动特征增强

Serafeim Papadias, Kostas Patroumpas, Dimitrios Skoutas

机构 * Athena Research Center(阿提卡研究中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 Hippasus通过结合统计信号和语义推理,高效提升关系数据机器学习任务中的特征增强效果。

详情

展开后加载摘要…

URL PDF HTML 收藏