arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-12 至 2026-05-12 共收录 35 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 35 篇

2605.09346 2026-05-12 cs.CL cs.AI 89%

RuPLaR : Efficient Latent Compression of LLM Reasoning Chains with Rule-Based Priors From Multi-Step to One-Step

RuPLaR : 通过基于规则的先验概率实现LLM推理链的高效潜在压缩

Xiaocheng Luo, Kang Wang, Zaifu Zhan, Yuechi Zhou, Xiangyu Duan

机构 * School of Computer Science and Technology(计算机科学与技术学院) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出RuPLaR框架,通过基于规则的先验概率指导LLM生成单阶段潜在推理令牌,提升推理效率与准确性,实验表明其比现有方法提升11.1%的准确率且消耗更少token。

Comments 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09614 2026-05-12 cs.CV 87%

Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

反射锚点用于长链多模态推理中的传播感知视觉保留

Xuan Gong, Hanbo Huang, Hao Zheng, Yiran Zhang, Wenbin Dai, Weishu Zhao, Shiyu Liang

机构 * Shanghai Jiao Tong University(上海交通大学) Lanzhou University(兰州大学)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出RAPO方法,通过信息论分析优化视觉传播潜力和局部分支空间,提升长链多模态推理的视觉信息保留效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07436 2026-05-12 cs.CV cs.AI cs.ET 86%

Prompt to Protection: A Comparative Study of Multimodal LLMs in Construction Hazard Recognition

提示到保护:多模态大语言模型在建筑危险识别中的比较研究

Nishi Chaudhary, S M Jamil Uddin, Sathvik Sharath Chandra, Anto Ovid, Alex Albert

机构 * Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系) Department of Civil, Construction, and Environmental Engineering, North Carolina State University(北卡罗来纳州立大学土木、建设与环境工程系)

专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文比较了五种先进多模态大语言模型在建筑危险识别中的表现,发现提示策略显著影响性能,CoT提示效果最佳,GPT-4.5和GPT-o3表现突出,强调了提示设计在提升建筑安全应用准确性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08243 2026-05-12 cs.CL 84%

Self-Debias: Self-correcting for Debiasing Large Language Models

Self-Debias:为大型语言模型引入自我纠正的去偏方法

Xuan Feng, Shuai Zhao, Luwei Xiao, Tianlong Gu, Bo An

机构 * Jinan University, China(济南大学,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)

AI总结 本文提出Self-Debias框架,通过资源再分配策略使模型具备自我纠正能力,以解决去偏过程中持续的偏见传播问题,无需外部干预即可提升去偏效果。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08936 2026-05-12 cs.AI cs.LG 84%

Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories

Self-ReSET: 通过学习自我恢复来应对不安全推理轨迹

Dongcheng Zhang, Yi Zhang, Yuxin Chen, An Zhang, Xiang Wang, Chaochao Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Self-ReSET框架,通过纯强化学习使大推理模型具备自我恢复能力,提升对抗攻击下的鲁棒性并高效利用数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10766 2026-05-12 cs.LG cs.AI cs.CL 82%

How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients

指令和推理数据如何塑造训练后阶段:通过层梯度的视角探讨数据质量

Ming Li, Yanhong Li, Ziyue Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Allen Institute for AI(Allen人工智能研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过层梯度的谱分析,揭示了高质量指令和推理数据对大语言模型训练后阶段的影响,统一了数据评估指标,并展示了数据质量与训练稳定性之间的关系。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10268 2026-05-12 cs.CL cs.AI 81%

MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading

MemReread: 通过记忆引导重读增强代理长上下文推理

Baibei Ji, Xiaoyang Weng, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

机构 * Soochow University(苏州大学) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MemReread通过记忆引导重读机制,在线性处理文档片段时避免二次检索,实现非线性推理并保持文档理解的逻辑流,通过强化学习框架提升长上下文推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10373 2026-05-12 cs.DB cs.CL 79%

Toward Multi-Database Query Reasoning for Text2Cypher

迈向多数据库查询推理的Text2Cypher

Makbule Gulcin Ozsoy

机构 * Neo4j(Neo4j公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出多数据库查询推理方法,解决跨多个独立图数据库的查询问题,通过三阶段路线图实现数据库路由、分解和异构查询推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10247 2026-05-12 cs.LG 79%

Teaching LLMs to See Graphs: Unifying Text and Structural Reasoning

教LLM看见图:统一文本与结构推理

Dario Vajda

机构 * Faculty of Computer and Information Science University of Ljubljana(计算机与信息科学系卢布尔雅纳大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出GTLM,一种能原生处理图拓扑的新型架构,通过注入图感知注意力偏置,有效消除语义瓶颈,提升图结构数据处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09675 2026-05-12 cs.AI cs.MA 79%

CodeClinic: Evaluating Automation of Coding Skills for Clinical Reasoning Agents

CodeClinic:评估临床推理代理的编码技能自动化

Timothy Ossowski, Xinchi Liu, Danyal Maqbool, Vaibhav Dhanuka, Sheng Zhang, Hoifung Poon, Majid Afshar, Tyler Bradshaw, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 CodeClinic通过MIMIC-IV构建基准,评估LLM代理是否能合成和组合可重用的临床技能,而非依赖固定工具库,包含纵向ICU监控和组合信息检索任务,提升多步推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07357 2026-05-12 cs.AI 79%

GraphReAct: Reasoning and Acting for Multi-step Graph Inference

GraphReAct:多步图推断中的推理与行动

Xingtong Yu, Zhongwei Kuai, Chang Zhou, Xuanting Xie, Renhe Jiang, Xikun Zhang, Hong Cheng, Xinming Zhang, Yuan Fang

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) The University of Tokyo(东京大学) RMIT University(皇家墨尔本理工大学) Singapore Management University(新加坡管理学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 GraphReAct通过结合推理与行动,提升图数据的多步推断能力,通过拓扑和语义检索及上下文精炼实现信息逐步扩展与压缩,实验表明其优于现有方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02950 2026-05-12 cs.AI 79%

Batch-of-Thought: Cross-Instance Learning for Enhanced LLM Reasoning

批量思考:用于增强大语言模型推理的跨实例学习

Xuan Yang, Furong Jia, Roy Xie, Xiong Xi, Hengwei Bian, Jian Li, Monica Agrawal

机构 * Duke University(杜克大学) ByteDance Inc.(字节跳动公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Batch-of-Thought方法,通过联合处理相关查询实现跨实例学习,提升LLM推理准确性和效率,实验显示在多个基准测试中显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09079 2026-05-12 cs.AI 79%

CauSim: Scaling Causal Reasoning with Increasingly Complex Causal Simulators

CauSim:通过日益复杂的因果模拟器扩展因果推理

Nicolás Astorga, Anita Kriz, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge, Cambridge, UK(剑桥大学 DAMTP 实验室,剑桥,英国)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 CauSim通过构建日益复杂的因果模拟器,将因果推理从稀缺标签问题转化为可扩展的监督学习问题,实现跨表示的泛化和因果推理能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08741 2026-05-12 cs.CL 79%

Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning

通过Harness训练:面向复杂推理的在线策略Harness自蒸馏

Zhengyang Zhao, Lu Ma, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出OPHSD方法,通过将增强的模型作为教师进行自蒸馏,提升模型在复杂推理任务中的泛化能力和独立表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19741 2026-05-12 cs.RO cs.AI 74%

ROS-LLM: A ROS framework for embodied AI with task feedback and structured reasoning

ROS-LLM:一个用于具身AI的ROS框架,具有任务反馈和结构化推理

Christopher E. Mower, Yuhui Wan, Hongzhan Yu, Antoine Grosnit, Jonas Gonzalez-Billandon, Matthieu Zimmer, Jinlong Wang, Xinyu Zhang, Yao Zhao, Anbang Zhai, Puze Liu, Daniel Palenicek, Davide Tateo, Cesar Cadena, Marco Hutter, Jan Peters, Guangjian Tian, Yuzheng Zhuang, Kun Shao, Xingyue Quan, Jianye Hao, Jun Wang, Haitham Bou-Ammar

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Leeds(利兹大学) Technical University of Darmstadt(达姆施塔特技术大学) East China Normal University(华东师范大学) Huawei Technologies(华为技术有限公司) ETH Zurich(苏黎世联邦理工学院) University College London(伦敦大学学院)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 本文提出一种基于ROS的框架,允许非专家通过自然语言提示和上下文信息编程机器人,结合大语言模型实现任务描述和行为模式控制,实验验证了其在多样化场景中的鲁棒性和扩展性。

Comments This document contains 26 pages and 13 figures

Journal ref Nature Machine Intelligence 8, 313-325 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08346 2026-05-12 cs.CL cs.AI 73%

Sanity Checks for Long-Form Hallucination Detection

长形式幻觉检测的合理性检查

Geigh Zollicoffer, Minh Vu, Hongli Zhan, Raymond Li, Manish Bhattarai

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of British Columbia(不列颠哥伦比亚大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种控制不变性方法,通过强制和移除测试区分推理本身与最终答案的表面关联,展示轻量级评分器TRACT在未扰动轨迹上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07649 2026-05-12 cs.CV cs.AI cs.RO 70%

Operating Within the Operational Design Domain: Zero-Shot Perception with Vision-Language Models

在操作设计域内运行:基于视觉-语言模型的零样本感知

Berkehan Ünal, Hauke Dierend, Dren Fazlija, Christopher Plachetka

机构 * Volkswagen Aktiengesellschaft(大众汽车股份有限公司) L3S Research Center(莱比锡大学汉诺威研究中心) Faculty of Information Technology(信息科技学院) MOIA GmbH(MOIA公司) Motor AI GmbH(Motor AI公司)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文探讨了视觉-语言模型在无监督条件下对操作设计域的零样本感知能力,通过实验验证了基于链式推理的提示方法在OBD感知中的有效性,并提出了可重用的提示模板。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13484 2026-05-12 cs.CV cs.CY 67%

MINGLE: VLMs for Semantically Complex Region Detection in Urban Scenes

MINGLE:用于城市场景中语义复杂区域检测的视觉语言模型

Liu Liu, Alexandra Kudaeva, Marco Cipriano, Fatimeh Al Ghannam, Freya Tan, Gerard de Melo, Andres Sevtsuk

机构 * Massachusetts Institute of Technology(麻省理工学院) Hasso Plattner Institute(于尔克·平特纳研究所)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)

AI总结 本文提出MINGLE模型,通过整合人类检测、视觉语言推理和轻量级空间聚合算法,实现城市场景中社交群体区域的检测,贡献包括新数据集和语义丰富的标注方法。

Comments 13 pages, 4 figures Updated with the camera-ready version after acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10899 2026-05-12 cs.CL cs.LG 62%

RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards

RubricEM: 通过规则引导的策略分解实现超越可验证奖励的元强化学习

Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang, Jun Yan, Yanfei Chen, Chun-Liang Li, Long T. Le, Rujun Han, George Lee, Hanghang Tong, Chen-Yu Lee, Tomas Pfister

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Cloud AI Research(谷歌云人工智能研究)

专题命中 复杂问题求解 :planning(abstract);分类 cs.CL、cs.LG

AI总结 RubricEM通过规则引导的策略分解和反思元策略进化,解决深度研究代理在不可验证奖励下的训练问题,实现长周期优化和可重用经验积累。

Comments 63 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09359 2026-05-12 cs.LG cs.AI 62%

Skill-R1: Agent Skill Evolution via Reinforcement Learning

Skill-R1:通过强化学习实现智能体技能进化

Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang, Julian McAuley, Junda Wu

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI、cs.LG

AI总结 Skill-R1通过强化学习框架实现实例级递归技能优化,利用可验证奖励训练轻量级技能生成器,提升智能体在复杂多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14937 2026-05-12 cs.LG cs.CL 62%

LLM as Graph Kernel: Rethinking Message Passing on Text-Rich Graphs

LLM作为图核:重新思考文本丰富图上的消息传递

Ying Zhang, Hang Yu, Haipeng Zhang, Peng Di

机构 * Ant Group(蚂蚁集团) ShanghaiTech University(上海科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RAMP方法,将LLM作为图原生聚合算子,通过双表示方案实现文本丰富图的高效推理,解决传统方法信息瓶颈问题,提升图传播与深度文本推理的结合性能。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10754 2026-05-12 cs.AI 57%

The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents

代理行为的代理使用:代理循证学是基础代理的缺失科学

Xinrun Wang, Chang Yang, He Zhao, Zhuoyi Lin, Shuyue Hu

机构 * Singapore Management University(新加坡管理大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR)(信息通信研究院,科技研究局(A*STAR)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出代理循证学作为基础代理的理论基础,通过将经典循证学定律映射到代理设计原则,提出可靠性、持续运行和自我改进三大工程需求,以指导复杂任务中的代理设计与部署。

Comments Preliminary Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10741 2026-05-12 cs.LG 57%

AdaPaD: Adaptive Parallel Deflation for PEFT with Self-Correcting Rank Discovery

AdaPaD: 适应性并行消去用于PEFT的自校正秩发现

Barbara Su, Fangshuo Liao, Anastasios Kyrillidis

机构 * Department of Computer Science(计算机科学系) Rice University(里士满大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.LG

AI总结 AdaPaD通过自校正机制实现并行消去,使秩分布成为输出而非输入,证明误差指数衰减并提供泛化界限,实验证明其在参数预算下与自适应秩LoRA基线和固定秩LoRA竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10253 2026-05-12 cs.CR cs.AI 57%

Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation

针对医疗多模态检索增强生成的知识污染攻击

Peiru Yang, Haoran Zheng, Tong Ju, Shiting Wang, Wanchun Ni, Jiajun Liu, Shangguang Wang, Yongfeng Huang, Tao Qi

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Northwestern Polytechnical University(西北工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 本文提出M³Att框架,针对医疗多模态RAG系统,通过在文本数据中注入隐蔽虚假信息并利用配对视觉数据作为查询无关触发器,提升检索概率,从而在不依赖用户查询先验知识的情况下实现知识污染攻击。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08136 2026-05-12 cs.CL 57%

EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments

EconWebArena:在现实网络环境中评估自主代理在经济任务上的基准测试

Zefang Liu, Yinzhu Quan

机构 * Capital One Georgia Institute of Technology(佐治亚理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出EconWebArena基准,通过360个精心挑选的任务测试自主代理在经济任务中的能力,强调权威数据源和基于网络的经济推理,评估多种多模态LLM的表现,揭示性能差距和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09934 2026-05-12 cs.CL 57%

TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents

TRACER:多模态工具使用代理的可验证生成溯源

Bihui Yu, Caijun Jia, Jing Chi, Xiaohan Liu, Yining Wang, He Bai, Yuchen Liu, Jingxuan Wei, Junnan Zhu

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算电力网络与信息安全重点实验室,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东省科学院))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 TRACER通过生成带结构溯源记录的答案句子,解决多模态工具使用代理中缺乏的 claim-level 依赖结构问题,提升工具使用可验证性和优化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09429 2026-05-12 cs.CV cs.AI 57%

Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models

逃避视觉失语:面向视觉-语言模型的对比自适应语义令牌修剪

Jie Ma, Yihang Liu, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun

机构 * Xiamen University(厦门大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出COAST方法,通过对比自适应语义路由实现视觉-语言模型的高效令牌修剪,减少77.8%的视觉令牌并提升2.15倍的推理速度,同时保持98.64%的原始性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07202 2026-05-12 cs.AI 57%

Towards Autonomous Business Intelligence via Data-to-Insight Discovery Agent

通过数据到洞察发现代理实现自主商业智能

Dongming Wu, Junwen Li, Ming Lu, Gang Wang, Ting Chen

机构 * Rajax Network Technology(Taobao Shangou of Alibaba)(阿里淘宝购物网络技术)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AIDA框架,通过灵活的零售环境和定制DSL实现复杂业务环境的自主探索,实验表明其在洞察发现和分析深度上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09131 2026-05-12 cs.AI cs.MA 57%

MCP-Cosmos: World Model-Augmented Agents for Complex Task Execution in MCP Environments

MCP-Cosmos:用于MCP环境复杂任务执行的世界模型增强型智能体

Giridhar Ganapavarapu, Dhaval Patel

机构 * IBM

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 MCP-Cosmos融合世界模型与MCP框架,通过引入生成世界模型提升智能体在复杂任务中的执行能力,实验显示其在工具成功率和参数准确性等方面有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08766 2026-05-12 cs.IR cs.CL 57%

UserGPT Technical Report

UserGPT 技术报告

Yunyi Xuan, Hao Yi, Fengling Mao, Daye Cai, Leikun Liang, Xingsheng He, Jiangnan Xie, Guoshuai Wang, Yushan Han, Wenwen Guo, Xiaoxiao Xu, Lin Qu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出UserGPT框架,通过属性生成和摘要生成提升LLM的人格理解能力,结合行为模拟引擎和数据导向语义化模块,实现对长行为历史的高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏