arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-05 至 2026-06-05 共收录 145 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 14 篇

2606.05268 2026-06-05 cs.GR cs.LG 57%

Aggregating LLM-Based Weak Verifiers for Spatial Layout Generation

基于LLM的弱验证器聚合用于空间布局生成

Sharon Zhang, R. Kenny Jones, Jiajun Wu, Maneesh Agrawala

机构 * Stanford University(斯坦福大学) Roblox

专题命中 视觉空间推理 :verifier(abstract);分类 cs.LG

AI总结 提出一种通过聚合LLM生成的弱验证器来构建强验证器的流水线,用于空间布局领域,在3D房间布局和2D海报设计任务中F1分数提升高达7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03100 2026-06-05 cs.CV cs.LG 57%

Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation

零样本3D问答通过层级视图到令牌传输

Dongsheng Wang, Dawei Su, Hui Huang

机构 * Dongsheng Wang(王东生) Dawei Su(苏大卫) Hui Huang(黄慧)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 提出KeyVT方法,通过层级视图和令牌级输入上下文收集,结合像素特征与相机参数评估视图重要性,并利用最优传输识别代表性令牌,实现零样本3D问答性能提升。

Comments Accepted at ICML 2026. 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20329 2026-06-05 cs.CV cs.AI 57%

Image Generators are Generalist Vision Learners

图像生成器是通用视觉学习者

Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T. Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, Radu Soricut

机构 * Google(谷歌)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了图像生成器在视觉理解中的通用学习能力,通过引入Vision Banana模型,展示了图像生成训练如何像语言模型预训练一样,使模型在多种视觉任务中取得最佳性能,证明了图像生成预训练在构建基础视觉模型中的核心作用。

Comments Project Page: http://vision-banana.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06155 2026-06-05 cs.RO cs.CV cs.MM 50%

AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding

AffordanceVLA:一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型

Qize Yu, Jiadi You, Yuran Wang, Jiaqi Liang, Bowen Ping, Yang Tian, Yue Chen, Minghong Cai, Zeying Gong, Ruihai Wu, Yinchuan Li, Junwei Liang, Yingcong Chen

机构 * Peking University(北京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Knowin AI

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出AffordanceVLA框架,通过引入结构化可供性预测作为任务导向的中间表示,解决VLA模型中语义空间与具身控制策略的结构不匹配问题,实现精确的感知-动作映射。

Comments Preprint. Code and project page are available. Code: https://github.com/Skywalker-yqz/AffordanceVLA Project page: https://skywalker-yqz.github.io/AffordanceVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05753 2026-06-05 cs.CV 50%

Cosine Misleads: Auxiliary Losses Reshape Vision Language Models, Not Their Latents

余弦误导:辅助损失重塑视觉语言模型,而非其潜变量

XiuYu Zhang, Junfeng Fang, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文通过实验发现,在视觉语言模型的潜视觉推理中,余弦相似度等对齐损失与准确性负相关,并引入PRISM诊断工具揭示潜变量被绕过,辅助损失主要通过共享参数重塑语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30819 2026-06-05 cs.CV cs.GR 50%

Function2Scene: 3D Indoor Scene Layout from Functional Specifications

Function2Scene: 基于功能规范的3D室内场景布局

Ruiqi Wang, Qimin Chen, Daniel Ritchie, Angel X. Chang, Manolis Savva, Kai Wang, Hao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学) Brown University(布朗大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出Function2Scene框架,通过解析自然语言设计简报中的用户角色和活动,从17个功能约束准则生成布局,并利用LLM和VLM的迭代检查-修复循环优化,在30个专业案例中94.3%的成对比较优于基线方法。

Comments project page: https://function2scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03890 2026-06-05 cs.CV 50%

4DPC$^2$hat: Towards Dynamic Point Cloud Understanding with Failure-Aware Bootstrapping

4DPC$^2$hat: 面向动态点云理解的失败感知自举学习

Xindan Zhang, Weilong Yan, Yufei Shi, Xuerui Qiu, Tao He, Ying Li, Ming Li, Hehe Fan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出首个针对动态点云理解的多模态大语言模型4DPC$^2$hat,通过构建大规模跨模态数据集4DPC$^2$hat-200K和引入Mamba增强的时间推理模块及失败感知自举学习策略,显著提升了动作理解与时间推理能力。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09989 2026-06-05 cs.RO cs.CV 50%

StereoPolicy: Improving Robotic Manipulation Policies via Stereo Perception

StereoPolicy:通过立体视觉改进机器人操作策略

Evans Han, Yunfan Jiang, Yingke Wang, Haoyue Xiao, Huang Huang, Jianwen Xie, Jiajun Wu, Li Fei-Fei, Ruohan Zhang

机构 * Stanford University(斯坦福大学) Northwestern University(西北大学) Lambda, Inc(Lambda公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究提出StereoPolicy,一种利用立体视觉提升机器人操作策略的框架,通过同步立体图像对增强几何推理,无需构建显式3D表示,在多个仿真和真实机器人任务中优于RGB、RGB-D、点云等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 8 篇

2606.06447 2026-06-05 cs.CL cs.LG 90%

Latent Reasoning with Normalizing Flows

基于归一化流的潜在推理

Guancheng Tu, Xiangjun Fu, Suhao Yu, Yao Tang, Haoqiang Kang, Lianhui Qin, Yizhe Zhang, Jiatao Gu

机构 * University of Pennsylvania(宾夕法尼亚大学) UC San Diego(圣地亚哥大学) Meta

专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 提出NF-CoT框架,通过归一化流在LLM内部建模连续潜在思维,保留自回归生成、概率采样、KV缓存解码和似然估计等优势,在代码生成任务中提升通过率并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21430 2026-06-05 cs.RO 85%

EVE: A Generator-Verifier System for Generative Policies

EVE: 一种生成策略的生成-验证系统

Yusuf Ali, Gryphon Patlin, Karthik Kothuri, Jeremiah Coholich, Muhammad Zubair Irshad, Wuwei Liang, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院) Toyota Research Institute(丰田研究院) Symbotic Inc.(Symbotic公司)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);test-time compute(abstract)

AI总结 本文提出EVE系统,通过生成-验证框架在测试时提升预训练生成策略的性能,利用零样本视觉语言模型验证者进行动作优化,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21667 2026-06-05 cs.LG cs.AI 84%

Escaping the Verifier: Learning to Reason via Demonstrations

摆脱验证者:通过示范学习推理

Locke Cai, Max Ryabinin, Ivan Provilkov

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RARO方法,通过逆强化学习从专家示范中学习强大的推理能力,无需任务特定的验证者,从而在多个评估任务中实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06245 2026-06-05 cs.RO cs.AI 83%

MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action

MPCoT: 奖励引导的多路径潜在推理用于测试时可扩展的视觉-语言-动作

Boyang Zhang, Lianlei Shan

机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Department of Computer Science, Tsinghua University(清华大学计算机系)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出MPCoT框架,通过奖励引导的多路径潜在推理,在保持零推理令牌和原始动作接口的同时,提升长时域和高不确定性控制任务中的VLA策略性能。

Comments 14 pages, 5 figures, submitted to CoRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06416 2026-06-05 cs.AI cs.CL cs.LG cs.MA 75%

Unsupervised Skill Discovery for Agentic Data Analysis

面向智能体数据分析的无监督技能发现

Zhisong Qiu, Kangqi Song, Shengwei Tang, Shuofei Qiao, Lei Liang, Huajun Chen, Shumin Deng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DataCOPE框架,通过无监督验证器引导从探索轨迹中发现可复用的数据分析技能,在报告式和推理式分析任务上分别提升平均得分9.71%和32.30%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05625 2026-06-05 cs.AI cs.LG 73%

Self-Commitment Latency: A Reward-Free Probe for Prompted Implicit Hacking

自承诺延迟:一种用于提示隐式劫持的无奖励探针

Bonan Shen, Youting Wang, Dingyan Shang, Tao Ning

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出自承诺延迟指标,通过测量推理上下文对模型自身最终答案的承诺时机,无需奖励信号即可检测提示隐式劫持,在GSM8K数据集上达到AUROC 0.878-0.926。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06080 2026-06-05 cs.LG cs.AI cs.CL 67%

On Advantage Estimates for Max@K Policy Gradients

关于 Max@K 策略梯度的优势估计

Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对稀疏奖励下推理模型后训练困难,提出一种新的优势估计方法 MaxPO,通过 Leave-Two-Out 基线实现中心化优势,降低梯度方差并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06079 2026-06-05 cs.CL 57%

SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization

SkillComposer: 学习演化智能体技能以实现特化与泛化

Qi Zhang, Zhaopeng Feng, Xiaonan Shi, Xiaomeng Hu, Chu Liu, Pengjun Xie, Xiaobin Wang, Jieping Ye, Bryan Hooi, Haobo Wang, Junbo Zhao

机构 * Zhejiang University(浙江大学) Tongyi Lab(通义实验室) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出SkillComposer框架,通过创建、改进和合并三种可学习操作,使语言模型在推理时自我演化技能,支持离线、在线和混合部署模式,在多个基准上提升性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 15 篇

2606.05402 2026-06-05 cs.CL cs.AI 84%

ReasoningFlow: Discourse Structures for Understanding LLM Reasoning Traces

ReasoningFlow: 理解LLM推理轨迹的话语结构

Jinu Lee, Shivam Agarwal, Amruta Parulekar, Siddarth Madala, Dilek Hakkani-Tur, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 提出ReasoningFlow框架,将大推理模型的推理轨迹建模为细粒度有向无环图,通过人工和自动标注分析发现模型间结构相似性、多样化推理行为及错误步骤与最终答案的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08503 2026-06-05 cs.CV cs.CL cs.LG 84%

Learning Self-Correction in Vision-Language Models via Rollout Augmentation

通过回滚增强学习视觉-语言模型中的自我纠正

Yi Ding, Ziliang Qiu, Bolian Li, Ruqi Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于回滚增强的强化学习框架Octopus,通过重新组合现有回滚生成密集的自我纠正示例,提高样本效率并稳定RL优化,同时引入响应遮蔽策略以解耦自我纠正与直接推理,从而在7个基准测试中实现开源VLM的SOTA性能。

Comments 18 pages

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06044 2026-06-05 cs.CL 79%

IA-RAG: Interval-Algebra-Driven Temporal Reasoning for Dynamic Knowledge Retrieval

IA-RAG:基于区间代数的动态知识检索时间推理

Xiaoman Wang, Yaoze Zhang, Wenzhuo Fan, Hongwei Zhang, Ding Wang, Guohang Yan, Song Mao, Botian Shi, Yunshi Lan, Pinlong Cai

机构 * East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Shanghai for Science and Technology(上海科技大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出IA-RAG框架,通过区间代数建模时间约束,实现层次化时间检索与推理,在复杂时间问答任务上表现优异。

Comments 22 pages, 10 figures, 13 tables. Code available at https://github.com/xiaoAugenstern/LogicalRAG_TemporalQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05979 2026-06-05 cs.RO cs.AI 79%

World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis

世界-语言-动作模型:统一世界建模、语言推理与动作合成

Yi Yang, Zhihong Liu, Siqi Kou, Yiyang Chen, Yanzhe Hu, Jianbo Zhou, Boyuan Zhao, Zhijie Wei, Xiao Xia, Xueqi Li, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海研究院) HUST(华中科技大学) SCUT(华南理工大学) ECUST(东华大学) SHU(上海大学) NJUPT(南京工业大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出世界-语言-动作(WLA)模型,通过自回归Transformer联合预测文本子任务、子目标图像和机器人动作,融合世界建模与语言推理能力,实现多任务和长时域任务的最优性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05382 2026-06-05 cs.AI 79%

Synthetic Contrastive Reasoning for Multi-Table Q&A

合成对比推理用于多表问答

Ankit Pratap Singh, Xin Su, Phillip Howard

机构 * Iowa State University(爱荷华州立大学) Thoughtworks

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多表问答缺乏推理监督的问题,提出通过异构LLM生成合成对比推理轨迹,并利用对比偏好优化微调模型,在MMQA上提升9.7%-16.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06100 2026-06-05 cs.CV 78%

HyperVis: Continuous Latent Visual Relational Graphs on the Lorentz Hyperboloid for Compositional Reasoning

HyperVis:洛伦兹双曲面上的连续潜在视觉关系图用于组合推理

Moshiur Farazi, Sameera Ramasinghe, Mahbub Ahmed Turza, Shafin Rahman

机构 * Data Science and AI, University of Doha for Science and Technology, Qatar(数据科学与人工智能,多哈科学技术大学,卡塔尔) Pluralis Research, Australia(Pluralis研究,澳大利亚) Department of Electrical and Computer Engineering, North South University, Bangladesh(电气与计算机工程系,北南大学,孟加拉国)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 针对视觉语言模型在组合推理中理解物体间关系的困难,提出HyperVis方法,通过计算密集视觉关系张量并投影到洛伦兹双曲面,利用空间物理(IoA驱动的蕴含锥和外部角排斥)增强层次结构,在训练时作为正则化器提升生成式VQA性能,在推理时作为关系编码器提升判别式组合评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23497 2026-06-05 cs.CV 78%

VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation

VOLD:通过在线蒸馏将LLM推理能力转移到视觉语言模型

Walid Bousselham, Hilde Kuehne, Cordelia Schmid

机构 * Tuebingen AI Center(图宾根人工智能中心) University of Tuebingen(图宾根大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Inria, École Normale Supérieure, CNRS, PSL Research University(法国国家科学研究院、巴黎-萨克勒大学、École Normale Supérieure、PSL研究大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出VOLD框架,通过在线蒸馏将文本模型的推理能力转移到视觉语言模型,利用组相对策略优化与在线蒸馏结合,提升推理性能,并验证了冷启动对齐在在线训练中的重要性。

Comments www.walidbousselham.com/VOLD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05404 2026-06-05 cs.AI cs.CL cs.LG 67%

Harnessing Generalist Agents for Contextualized Time Series

利用通用智能体进行情境化时间序列分析

Zihao Li, Kaifeng Jin, Yuanchen Bei, Jiaru Zou, Avaneesh Kumar, Xuying Ning, Yanjun Zhao, Mengting Ai, Baoyu Jing, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TimeClaw框架,通过集成可执行时间工具、经验驱动能力进化和情景多模态记忆,使通用大语言模型智能体具备情境化时间推理能力,在能源、金融等多领域基准上取得性能提升。

Comments Preprint. 38 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06025 2026-06-05 cs.CL cs.AI 62%

EGTR-Review: Efficient Evidence-Grounded Scientific Peer Review Generation via Multi-Agent Teacher Distillation

EGTR-Review: 基于多智能体教师蒸馏的高效证据支撑科学同行评审生成

Xinpeng Qiu, Wang Yihu, Zhifeng Liu, Xiaochen Wang, Jimin Wang

机构 * Department of Information Management, Peking University(北京大学信息管理系) PKU-WUHAN Institute for Artificial Intelligence, Peking University(北京大学武汉人工智能研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出EGTR-Review框架,通过多智能体教师蒸馏和证据加权目标,实现轻量级学生模型的高质量、可溯源同行评审生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05843 2026-06-05 cs.CL cs.AI 62%

Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads

多模态大语言模型中通过CoRe头的功能稀疏性机制洞察

Ruoxi Sun, Quantong Qiu, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

机构 * Soochow University(苏州大学) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过识别和分析CoRe头,揭示多模态大语言模型在跨模态检索中功能稀疏的结构特性,并验证其必要性及加速推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05836 2026-06-05 cs.CL 57%

ProSPy: A Profiling-Driven SQL-Python Agentic Framework for Enterprise Text-to-SQL

ProSPy: 面向企业级Text-to-SQL的剖析驱动的SQL-Python智能体框架

Zhaorui Yang, Huawei Zheng, Sen Yang, Yuhui Zhang, Haoxuan Li, Zhizhen Yu, Xuan Yi, Chen Hou, Defeng Xie, Chao Hu, Minfeng Zhu, Dazhen Deng, Haozhe Feng, Danqing Huang, Yingcai Wu, Peng Chen, Wei Chen

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) School of Software Technology(软件技术学院) Tencent TEG(腾讯科技集团) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出ProSPy框架,通过自动剖析、模式剪枝、中间视图获取和Python分析四阶段,结合SQL高效性与Python灵活性,解决企业级数据库Text-to-SQL中的模式异构、元数据不完整和复杂分析问题。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05806 2026-06-05 cs.AI 57%

When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents

当工具失效时:LLM智能体动态重规划与异常恢复的基准测试

Dongsheng Zhu, Xuchen Ma, Yucheng Shen, Xiang Li, Yukun Zhao, Shuaiqiang Wang, Lingyong Yan, Dawei Yin

机构 * Shanghai AI Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Sochow University(苏州大学) Shandong University(山东大学) Baidu Inc.(百度公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ToolMaze基准,通过有向无环图拓扑复杂度和工具扰动分类法,评估LLM智能体在工具失效时的动态重规划与错误恢复能力,发现模型对隐式语义故障的恢复率下降约37%,且智能体容错性随模型规模增长的速度远慢于基本任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05658 2026-06-05 cs.IR cs.AI 57%

Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval

Agent编排的自适应RAG:结构化与多跳检索的比较研究

Anuj Maharjan, Devinder Kaur, Richard Molyet

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出Agent编排的自适应RAG框架,通过动态查询分解、迭代检索和自反思评估,在结构化领域(DevOps)和多跳推理基准(MuSiQue)上对比发现,查询分解在结构化领域提升性能但降低多跳排名精度,反思机制提高引用准确性但增加延迟,表明Agent增强需根据查询和领域特性选择性应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09706 2026-06-05 cs.LG 57%

Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning

通过强化学习训练一个模型以掌握跨层级的代理行为

Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

机构 * Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出CrossHA,一种统一的代理模型,能够掌握异构的动作空间并自主选择每一步轨迹中最有效的接口,通过结合冷启动监督微调和多轮组相对策略优化(GRPO)算法,实现适应性动作切换,在Minecraft开放世界中超过800个任务上展示了最先进的性能。

Comments Accepted to CVPR 2026 as a Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏