arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-18 至 2026-08-18 共收录 229 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 22 篇

2603.06697 2026-08-18 cs.CV cs.AI 版本更新 79%

Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs

通过目光思考:将眼动作为视觉推理监督用于医学视觉语言模型

Yiwei Li, Yifan Zhou, Huaqin Zhao, Zihao Wu, Zhengliang Liu, Xiang Li, Quanzheng Li, Tianming Liu, Lin Zhao

机构 * School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Computer Science and Engineering, University of Texas, Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) Massachusetts General Hospital, Harvard Medical School(麻省总医院哈佛医学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 通过引入眼动标记,利用时间有序的注视轨迹引导医学VLM的视觉推理,提升放射学任务的性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06461 2026-08-18 cs.CV cs.AI 版本更新 79%

Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning

通过对比注意力实现聚焦:增强视觉语言模型的视觉推理能力

Yuyao Ge, Shenghua Liu, Yiwei Wang, Lingrui Mei, Baolong Bi, Xuanshan Zhou, Jiayu Yao, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对VLMs在复杂环境下性能下降的问题,提出无训练方法CARVE,通过像素级注意力对比提取任务相关视觉信号,在开源模型上实现最高75%的性能提升,为提升视觉推理提供了高效路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20254 2026-08-18 cs.IR cs.AI cs.CV cs.LG 版本更新 79%

Efficient Table QA via TableGrid Navigation and Progressive Inference Prompting

通过表格网格导航和逐步推理提示实现高效的表格问答

Amritansh Maurya, Navjot Singh, Mohammed Javed, Omar Moured

机构 * Vision Intelligence Lab, IIIT Allahabad, Prayagraj, India(视觉智能实验室,印度拉贾斯坦邦阿拉哈巴德)

专题命中 视觉空间推理 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无需训练的表格问答方法,通过TableGrid导航和Progressive Inference Prompting框架,提升了表格问答的精度和效率,并在多个数据集上验证了其有效性。

Comments Accepted for Presentation in ICDAR 2026, Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14991 2026-08-18 cs.CV 新提交 78%

Risk-Adaptive Edge--Cloud Visual Reasoning for Communication-Efficient Autonomous Driving

面向通信高效自动驾驶的风险自适应边云视觉推理

Meng Ma, Shuyang Li, Naigang Wang, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本研究提出风险自适应边云视觉推理架构,通过车载交通评估触发云端VLM推理,在自动驾驶中减少54.1%云端请求量,同时保持任务成功率并降低AEB触发次数,实现通信效率与性能的平衡。

Comments 7 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25467 2026-08-18 cs.CV 版本更新 71%

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

专题命中 视觉空间推理 :reasoning(title)

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16234 2026-08-18 cs.CV 新提交 67%

GaussianDWM++: Language-Grounded 3D Gaussian Driving World Model for Unified Scene Understanding, Editing, and Multi-Modal Generation

GaussianDWM++:用于统一场景理解、编辑与多模态生成的语言接地3D高斯驾驶世界模型

Tianchen Deng, Xuefeng Chen, Shuang Wu, Qu Chen, Jiajun Zhu, Bo Dai, Jianfei Yang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Tsinghua University(清华大学) Chongqing Afari Intelligent Drive Co., Ltd.(重庆阿法瑞智能驾驶有限公司) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 该研究提出GaussianDWM++,通过基础特征高斯分词器等模块构建统一框架,在多类驾驶任务中实现场景理解、编辑与多模态生成,性能达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15710 2026-08-18 cs.CV cs.AI cs.CL 新提交 62%

Beyond Single Object: Learning 3D Relations with Large Language Models

超越单一物体:用大语言模型学习三维关系

Kohsuke Ide, Ryousuke Yamada, Yue Qiu, Xianzheng Ma, Yoshihiro Fukuhara, Hirokatsu Kataoka, Yutaka Satoh

机构 * AIST(日本国立 Advanced Industrial Science and Technology(AIST)) University of Tsukuba(筑波大学) University of Technology Nuremberg(纽伦堡工业大学) University of Oxford(牛津大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有3D-LLMs难以开展多物体间详细比较的问题,提出含MO3D数据集、Multi-3DLLM模型及Mini-apps基准的框架,该模型在MO3D任务上超越所有基线且对单物体分类有正向迁移

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16181 2026-08-18 cs.HC cs.AI 新提交 57%

MUSE: An Interactive Meta-Agent for Understanding and Steering LLM-powered Data Science Systems

MUSE:一种用于理解和操控大语言模型驱动的数据科学系统的交互式元智能体

Wei-Hao Chen, Weixi Tong, Yuan Tian, Chenglong Wang, Tianyi Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出交互式元智能体MUSE,通过重构执行轨迹、支持上下文交互与混合意图操控,提升用户对大语言模型驱动的数据科学系统的理解与控制,经15人被试间研究验证可提高任务效率与用户信心。

Comments To appear in the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), November 2-5, 2026, Detroit, MI, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15265 2026-08-18 cs.AI 新提交 57%

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯) AI Thrust TEG AIPD

专题命中 视觉空间推理 :verifier(abstract);分类 cs.AI

AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15085 2026-08-18 cs.CL 新提交 57%

Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs

为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性

Yihang Du, Juhao Liang, Zhengzhao Lai, Siyu Li, Yan Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15056 2026-08-18 cs.AI 新提交 57%

GraphLoom: Reliability-Calibrated Graph Evidence Routing for Multimodal KG-RAG

GraphLoom:面向多模态KG-RAG的可靠性校准图证据路由

Zafar Ali, Asad Khan, Aalia Malik, Pavlos Kefalas

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Aristotle University(亚里士多德大学) Dashub(达舒布)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出GraphLoom框架,通过可靠性校准的图证据路由实现多模态KG-RAG,在ScienceQA等数据集上提升了答案质量与证据忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14615 2026-08-18 cs.AI 新提交 57%

Large Language Models and their Awareness of Mechanics and Spatial Geometry

大语言模型及其对力学与空间几何的认知能力

Johannes Gerstmayr, Sebastian Weyrer, Tobias Möltner, Peter Manzl, Michael Pieber

机构 * University of Innsbruck(因斯布鲁克大学) University of Augsburg(奥格斯堡大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究构建了全自动基准MecEng,评估32个开放权重及2个专有LLMs的机械工程认知,发现其刚体任务成功率达86.0%,但柔性多体任务仍具挑战,且该能力正快速提升但仍易出错。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16174 2026-08-18 eess.SY cs.SY 新提交 50%

L-COIN: LLM-Assisted Counterfactual Inference for Game-Theoretic Distributed Computation Offloading in Sub-THz LEO Satellite Networks

L-COIN:用于亚太赫兹低轨卫星网络中博弈论分布式计算卸载的大语言模型辅助反事实推理

Jinhao Yi, Weijun Gao, Chong Han

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究针对亚太赫兹低轨卫星网络的分布式计算卸载问题,提出L-COIN框架,结合LLM与反事实推理,降低卸载成本10.9%-27.7%,提升了时变场景下的卸载性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15336 2026-08-18 cs.CV 新提交 50%

SAGE-OR: Semi-supervised Adaptive Scene Graph Generation for Operating Rooms

SAGE-OR:面向手术室的半监督自适应场景图生成

Brandon Leblanc, Charalambos Poullis

机构 * Concordia University(康考迪亚大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SAGE-OR是面向手术室的半监督自适应场景图生成框架,采用解耦范式,轻量高效,在4D-OR基准上F1达76%,经无监督手部增强后达86%,可低成本适配新手术场景。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00600 2026-08-18 cs.RO 版本更新 50%

I-Perceive: A Foundation Model for Active Perception with Language Instructions

I-Perceive:一种基于语言指令的主动感知基础模型

Yongxi Huang, Zhuohang Wang, Wenjing Tang, Xinyu He, Cewu Lu, Panpan Cai

机构 * Shanghai Innovation Institute(上海创新研究院) Beihang University(北京航空航天大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 I-Perceive是一种基于自然语言指令的主动感知基础模型,通过融合视觉-语言模型与几何基础模型,实现了对开放意图场景的有效感知与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16703 2026-08-18 cs.RO 50%

VLM-Empowered Multi-Mode System for Efficient and Safe Planetary Navigation

Sinuo Cheng, Ruyi Zhou, Wenhao Feng, Huaiguang Yang, Haibo Gao, Zongquan Deng, Liang Ding

机构 * State Key Laboratory of Robotics and System, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学)

专题命中 视觉空间推理 :planning(abstract)

Comments accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 18 篇

2608.15303 2026-08-18 cs.AI 新提交 88%

Divergent-Convergent Reasoning: Scaling Test-Time Compute through Structured Solution Synthesis

发散-收敛推理:通过结构化解决方案合成扩展测试时计算

Bo Wen, Yuhao Chen, Erhan Bilal, Carla Agurto Rios, Chen Wang, Junchen Jiang

机构 * School of Computing, Queen’s University(女王大学计算学院) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心) University of Chicago(芝加哥大学) Tensormesh Inc.(Tensormesh公司)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.AI

AI总结 该研究提出发散-收敛推理(DCR),引入递归DCR方法,利用分歧信息优化测试时计算分配,在AIME 2024、2025数据集上实现高准确率且减少计算量,揭示LLM测试时推理的扩展规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10139 2026-08-18 cs.LG cs.AI 版本更新 84%

LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning

作为陪审团的语言模型:跨模型共识在语言模型推理方面可超越过程奖励模型

Ning Liu

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究在语言模型推理中从候选推理链选正确答案的问题,提出跨模型共识方法,将其视为语言模型陪审团,通过错误去相关机制工作,在多个基准测试中表现出色,能预先表征,有定律和下限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15517 2026-08-18 cs.CV 新提交 82%

GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning

GLaQ:基于视觉证据的潜在查询定位用于多模态推理

Zesheng Yang, Lingling Zhang, Xinyu Zhang, Cheng Zhang, Pengyu Li, Heng Wang, Lin Wu

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 该研究提出GLaQ框架,用定位的上下文条件查询替代顺序潜在展开,经训练后在五个视觉理解基准上优于基础模型及其他视觉潜在方法,可高效恢复局部视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16003 2026-08-18 cs.AI cs.CL 新提交 81%

Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency

先验审计-修复上下文调整大语言模型验证器阈值以趋向宽松

Parsa Mazaheri, Kasra Mazaheri

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究发现,LLM检查器上下文中的审计→修复事件会降低误报率,调整了验证器阈值趋向宽松,且该效应与负性不对称性预测相反,不随推理启用而消失。

Comments 12 pages, 2 figures, 4 tables. Code and analysis artefacts: https://github.com/parsa-mz/crtitxer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15574 2026-08-18 cs.CV cs.AI 新提交 79%

Catching Hallucinated Citations in Video-LLM Question Answering: A Self-Verification Pipeline and Verifier Ablation Study

视频-大语言模型(Video-LLM)问答中幻觉引用的检测:自验证流水线与验证器 ablation 研究

Yogesh Kumar

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 针对视频-LLM问答中引用幻觉问题,提出自验证流水线,用小型自然语言推理模型作稳定验证器,在对抗性错误前提问题上检测率达79%,并发布相关代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12399 2026-08-18 cs.LG stat.ML 版本更新 79%

ROC-n-reroll: How verifier imperfection affects test-time scaling

ROC-n-reroll:验证器缺陷对测试时缩放的影响

Florian E. Dorner, Yatong Chen, André F. Cruz, Fanny Yang

机构 * ETH Zürich(苏黎世联邦理工学院) Max Planck ETH Center for Learning Systems(马克斯·普朗克ETH学习系统中心) Max Planck Institute for Intelligent Systems, Tübingen(图宾根马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本工作针对测试时缩放中验证器缺陷的理论空白,证明相关方法的实例级精度由验证器ROC曲线几何刻画,经Qwen、LLaMA模型在指定数据集上验证,得出RS与BoN在不同计算条件下的性能规律。

Comments 47 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14629 2026-08-18 cs.CL cs.AI 新提交 79%

Inference-Time Mitigation of Adversarial Political Bias in Large Language Models

大语言模型推理时的对抗性政治偏见缓解

Tejaswi V. Panchagnula, Bruce Coburn, Bryce J. Dietrich, Robert X. Browning, Edward J. Delp, Fengqing Zhu

专题命中 测试时计算 :CoT(abstract,abstract_cn);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型的对抗性政治偏见漏洞,提出思维链提示与直接偏好优化等策略,其中递归自校正方法可显著提升模型的政治中立性表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16259 2026-08-18 cs.CV cs.AI 新提交 77%

Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection

Defake-o3:从推测性理由到可验证证据的可解释AIGI检测

Bowen Deng, Jiahui Zhan, Yikun Ji, Haozhen Yan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 测试时计算 :verifier(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 Defake-o3是结合交互式视觉搜索与证据验证器的可解释AIGI检测器,构建了GroundFake数据集和FakeFrontier基准,在多基准上同时提升了AIGI检测准确率与解释质量。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11403 2026-08-18 cs.AI cs.CL cs.LG 版本更新 76%

When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs

当自我一致性适得其反:对于小型大型语言模型,多数投票会损害大多数硬科学问题

Utkarsh Bahuguna

机构 * Scaler School of Technology(斯凯勒科技学院)

专题命中 测试时计算 :reasoning(abstract,comments);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现,多数投票的自我一致性方法会损害小型指令微调模型在多数硬科学问题上的准确率,其核心机制是置信度与正确性不匹配,且无验证器门控方法可提升该问题下的准确率。

Comments 19 pages, 5 figures, 4 tables. v1 accepted at the COLM 2026 Workshop on Efficient Reasoning; v2 additions are not peer reviewed. v2 revises rather than extends: Section 4.4's mechanism claim is replaced and one Discussion sentence withdrawn. All v1 results, tables and pre-registered verdicts are unchanged. Adds the answer-token margin result, a serverless reasoning wall, and ten disclosures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02909 2026-08-18 cs.LG cs.AI 版本更新 74%

Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR

延迟、平台期或崩溃:评估系统性验证错误对RLVR的影响

Kazuki Egashira, Mark Vero, Jasper Dekoninck, Florian E. Dorner, Robin Staab, Martin Vechev

专题命中 测试时计算 :verifier(abstract,comments);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究探究系统性验证错误对RLVR的影响,发现系统性误报会引发次优平台期或性能崩溃,验证器质量需结合错误模式而非仅样本级错误率评估。

Comments COLM 2026. Code: https://github.com/eth-sri/llm-verifier-noise

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16417 2026-08-18 cs.CL 新提交 70%

D2-ScaleAgent: Dual-Dimensional Scaling for Long Document Understanding

D2-ScaleAgent:面向长文档理解的双维度缩放方法

Hao Zhang, Longrong Yang, Lunhao Duan, Ziyang Wang, Qing-Guo Chen, Shanshan Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 针对现有多模态RAG长文档理解方法缺乏动态计算缩放能力的问题,提出D2-ScaleAgent双维度缩放智能体框架,在相关基准上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15709 2026-08-18 cs.DB 新提交 67%

Logos: Certified Order-Sensitive SQL Rewrites with Mechanized Semantics and LLM Guidance

Logos:结合机械化语义与LLM指导的可验证顺序敏感型SQL重写

Jingyu Ke, Jingyang Li, Guoqiang Li

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

AI总结 Logos是一款结合Rocq机械化语义与LLM指导的SQL重写验证工具,解决了现有工具的不足,在389个查询对的评估中解决率达86.9%,优于基线工具SQLSolver。

Comments 13 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12485 2026-08-18 cs.LG cs.AI 版本更新 62%

Speculative Rollback Correction for Quality-Diverse Web Agent Imitation

面向质量多样性的Web智能体模仿的推测性回滚修正

Longkun Hao, Hongyu Lin, Hao Li, Zhuowen Liu, Zhichao Yang, Haojie Hao, Dongshuo Huang, Haitao Yang, Hongyu Ge, Ming jie Xie, Yanjun Wu, Zi Hao Yin, Yan Bai, Yihang Lou

机构 * Beihang University(北京航空航天大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出推测性回滚修正(SRC)框架,通过固定视野分支审查和回滚机制,在减少教师查询的同时保持轨迹多样性,在WebArena-Infinity上收集了977条通过验证的轨迹和9183个下一步动作示例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16889 2026-08-18 cs.RO cs.AI cs.CV 新提交 57%

Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory

不要放弃BATON:通过智能体子任务探索和感知转换的记忆实现长程机器人操作

Bingxin Xu, Yuzhang Shang, Emilio Ferrara

机构 * University of Southern California(南加州大学) University of Central Florida(中佛罗里达大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究针对长程机器人操作的误差累积与子任务转换问题,提出BATON方法,通过子任务探索与感知转换记忆,在RoboMemArena基准上提升任务成功率11.6%、累计成功率14.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏