arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-13 至 2026-08-13 共收录 116 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 29 篇

2608.11631 2026-08-13 cs.AI 新提交 57%

CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement

CLAIM:基于不确定性度量的大语言模型开放域主动澄清领先方案

Kuangzhao Yang, Ziliang Zhao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于不确定性度量的CLAIM框架,无需人工标注,结合监督学习与强化学习训练统一澄清决策模型,实现开放域人机交互中低成本鲁棒的主动澄清。

Comments 11 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11354 2026-08-13 cs.AI 新提交 57%

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面

Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

机构 * JPMorganChase(摩根大通)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。

Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11350 2026-08-13 cs.CL cs.RO 新提交 57%

Self-Evolving Embodied Agents via Skill-Harness Evolution

基于技能-工具链进化的自演化具身智能体

Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * Microsoft Research(微软研究院) Northeastern University(东北大学)

专题命中 规划推理 :verifier(abstract);分类 cs.CL

AI总结 提出免训练的SHAPER框架,通过演化技能与工具链实现冻结模型驱动的自演化具身智能体,在VLABench等数据集上验证其适配优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26722 2026-08-13 cs.MA cs.LG 版本更新 57%

DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution

DREvo:提炼重校准的历史经验以实现工具链自主进化

Hanghui Guo, Weijie Shi, Zhangze Chen, Shengxiang Xu, Yishu Wang, Yimei Zhang, Wangze Ni, Jia Zhu, Shimin Di

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 针对现有工具链自主进化方法的两个局限,提出DREvo方法,通过整合三项技术提升进化稳定性,在五个基准上取得最优准确率,在两类任务上较基线实现显著性能提升。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10584 2026-08-13 astro-ph.IM cs.AI gr-qc 57%

An agentic framework for gravitational-wave counterpart association in the multi-messenger era

一种用于多信使时代引力波反演关联的代理框架

Yiming Dong, Yacheng Kang, Junjie Zhao, Xinyuan Zhu, Ziming Wang, Lijing Shao

机构 * Department of Astronomy, School of Physics(天文学系,物理系) Kavli Institute for Astronomy and Astrophysics(天体物理研究所) Institute for Gravitational Wave Astronomy(引力波天文研究所) School of Information Science and Technology(信息科学与技术学院) National Astronomical Observatories(国家天文台)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GW-Eyes框架,利用大语言模型实现引力波与电磁信号的自动关联,支持自然语言交互,提升多信使天文研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04571 2026-08-13 cs.AI 版本更新 57%

OpenAg: Democratizing Agricultural Intelligence

OpenAg:推动农业智能的平民化

Srikanth Thudumu, Jason Fisher

机构 * Institute of Applied Artificial Intelligence and Robotics (IAAIR)(应用人工智能与机器人研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出OpenAg框架,结合多类技术构建农业通用人工智能系统,以解决现有农业智能系统的不足,助力符合当地实际的农业决策。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11866 2026-08-13 stat.AP 新提交 50%

Urban logistics dynamics: a user-centric approach to traffic modelling and kinetic parameter analysis

城市物流动力学:以用户为中心的交通建模与动力学参数分析方法

Emilienne Lardy, Eric Ballot, Mariam Lafkihi

专题命中 规划推理 :planning(abstract)

AI总结 本研究从用户视角出发,以城市物流交通动力学为研究对象,通过因子分析与广义线性模型,基于时间等外生因素预测车辆动力学行为,为城市物流交通建模提供了以用户为中心的方法。

Journal ref International Conference on Urban Traffic Congestion, Jul 2024, Paris, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11386 2026-08-13 cs.SE 新提交 50%

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior

关键在于接口:评估工具架构如何影响编码智能体行为

Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究通过编码智能体的对照实验,发现工具架构会显著影响智能体行为,不同工具架构在一致性、文件访问量、步骤数等方面表现出不同效果,其中Python CodeAct风格接口性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11357 2026-08-13 cs.MA 新提交 50%

When Do Institutions Beat Intelligence?

何时制度优于智能?

Zhengye Han

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究通过构建受控人工生态,实验揭示制度在修复集体构建可用公共状态的失败时优于智能,反之则不然,为智能与制度的选择提供了诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11277 2026-08-13 cs.CR cs.SE 新提交 50%

Knowledge-Graph-Guided Retrieval-Augmented LLMs for Explainable Root Cause Analysis in Automotive HiL Validation

知识图谱引导的检索增强大语言模型用于汽车在环(HiL)验证中的可解释根本原因分析

Hamza Ouarrad, Mohammad Abboush, Andreas Rausch

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究提出KG引导的RAG-LLM框架,用于汽车HiL数据的RCA与故障定位,在ASM汽油发动机和电动车系统案例中分别获90%、94% Top-1准确率,可实现可解释且泛化的故障分析。

Comments 10 pages, 3 figures, 5 tables. Accepted for publication and oral presentation at the 10th International Conference on System Reliability and Safety (ICSRS 2026), Rome, Italy, November 23--25, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13840 2026-08-13 cs.RO cs.CV 版本更新 50%

Multi-Agent Embodied Autonomous Driving: From V2X Information Exchange to Shared World Models

多智能体具身自动驾驶:从V2X信息交换到共享世界模型

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Yiqin Deng, Yuguang Fang

机构 * Lingnan University, Hong Kong(岭南大学(香港))

专题命中 规划推理 :planning(abstract)

AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23162 2026-08-13 cs.CY cs.CR cs.DC cs.ET econ.GN q-fin.EC 版本更新 50%

SolarChain: A Physics-Grounded Embodied IoT System for Verifiable Urban Solar Market Design

SolarChain:连接物理定律、可验证信任与可持续市场的城市能源韧性

Shilin Ou, Yifan Xu, Zhenshan Zhang, Luyao Zhang, Ming-Chun Huang

专题命中 规划推理 :verifier(abstract)

AI总结 提出SolarChain平台,通过基于热力学极限的物理验证和点对点市场机制,解决城市太阳能数据篡改和投机问题,实现可信交易与可持续投资。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 15 篇

2608.12220 2026-08-13 cs.CV cs.AI 新提交 90%

SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

SCOUT:通过结构化思维链与多目标过程奖励解锁增强型空间推理能力

Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping Zhang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 SCOUT是结合结构化思维链与多目标过程奖励的视觉-语言模型,通过定制数据集训练,在空间推理任务上超越基线模型与GPT-4o,且具备跨图像、视频的泛化能力。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11691 2026-08-13 cs.LG cs.CL 新提交 86%

LEMUR: Latent Entropy-aware Multimodal Unlearning via Visual-anchored Reasoning Redirection

LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘

Xinhao Zhong, Yuxia Qiao, Junhao Li, Hao Fang, Yi Sun, Bin Chen

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对原生RL训练多模态模型的隐私泄漏问题,提出基于熵动态的无训练推理时遗忘框架LEMUR,可更有效地抑制敏感信息在推理轨迹和答案中的泄漏,同时保留模型非敏感效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19824 2026-08-13 cs.AI cs.CL cs.CV cs.RO 84%

From Prompts to Pavement Through Time: Temporal Grounding in Agentic Scene-to-Plan Reasoning

从提示到路面通过时间:代理场景到计划推理中的时间定位

Ahmed Y. Gado, Omar Y. Goba, Alaa Hassanein, Catherine M. Elias, Ahmed Hussein

机构 * Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大大学(GUC)计算机科学与工程系,埃及) C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室,埃及开罗,C-DRiVeS) M.Eng. Robotics Candidate at Deggendorf Institute of Technology, Germany(德国德格多夫技术学院机器人硕士候选人) IAV GmbH, Berlin, Germany(德国柏林IAV GmbH公司)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了在代理间通信中引入时间条件是否能保持或增强推理的一致性,而不会降低语义或逻辑一致性,并通过BDD-X数据集的curated子集评估了三种具有递增时间整合的规划器架构。结果表明,时间条件改变了推理风格,但并未在标准NLP正确性指标上产生统计显著改进,但定性分析揭示了预测危险推理、稳定纠正行为和战略分歧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11655 2026-08-13 cs.CV cs.AI 新提交 79%

Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting

运动即提示:通过运动引导的跨帧视觉提示增强多模态大语言模型的运动推理能力

Xikai Sun, Kebin Liu, Haotian Wang, Li Liu, Xu Wang, Yunhao Liu

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对多模态大语言模型处理视频时丢失帧间关键运动信息的问题,提出Motion-as-Prompt框架,通过标记轨迹增强视觉提示,在CLEVRER等数据集上提升GPT-5.5的运动推理准确率且不影响非运动理解

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11150 2026-08-13 cs.CV 版本更新 78%

CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting

CausalSplat:面向3D高斯溅射的综合层级推理

Jiayu Ding, Meilu Song, Yun Chen, Wei Gao, Ge Li

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) Hunan University(湖南大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对3D高斯溅射推理局限,本文提出CausalSplat框架,结合视觉语言模型与3D场景图,构建两个推理基准,在相关任务上实现最优性能与强泛化性。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19985 2026-08-13 cs.CV 版本更新 78%

Vision-Reasoning-Guided Occlusion Removal from Light Fields

视觉推理引导的光场遮挡去除

Mohamed Youssef, Oliver Bimber

机构 * Johannes Kepler University(约翰·开普勒大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出结合光场积分与视觉语言模型的框架,通过多视图融合和语义先验恢复被遮挡场景,在合成和真实数据上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11838 2026-08-13 cs.CV 新提交 67%

GeoBridge: Decoupled Semantic Conditioning for Generative Image Geolocalization

GeoBridge:用于生成式图像地理定位的解耦语义条件机制

Zhiyang Dou, Xumeng Han, Fengde Peng, Zipeng Wang, Moxuan Zhao, Zhipei Huang, Zhenjun Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences(先进交叉科学学院) School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 GeoBridge是一种解耦语义条件机制,通过连接冻结语义MLLM与黎曼流匹配头,在IM2GPS3K数据集上25/200/750公里阈值下准确率达38.67/52.89/70.37,提升了生成式图像地理定位性能,属解码侧算法贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11674 2026-08-13 cs.LG cs.AI 新提交 62%

GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs

GCPO:针对大语言模型的rollout强化学习中子空间几何的诊断与约束

Kai Yang, Jingwei Xu, Wanyu Wang, Kai-Yuan Guo, Zhenbo Yu, Yi Wang, Yu Qiao

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GCPO通过几何约束策略优化方法,诊断rollout强化学习的子空间几何问题,在大语言模型后训练中提升了多任务性能并解决了训练不稳定等问题

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12274 2026-08-13 cs.CV cs.AI 新提交 57%

A Neighborhood Attention Transformer Network for Enhanced 3D Segmentation of the Left Anterior Descending Artery

用于增强左前降动脉三维分割的邻域注意力Transformer网络

Rafi Ibn Sultan, Chengyin Li, Yiannos Demetriou, Ahmed I. Ghanem, Joshua P. Kim, Justine Cunningham, Hassan Bagher-Ebadian, Dongxiao Zhu, Kundan S. Thind

机构 * Wayne State University(韦恩州立大学) Henry Ford Health(亨利福特医疗集团) Alexandria University(亚历山大大学) Michigan State University(密歇根州立大学) Oakland University(奥克兰大学) Institute for AI and Data Science, Wayne State University(韦恩州立大学人工智能与数据科学学院)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出NA-UNETR模型,结合邻域注意力等模块,经预训练和LoRA微调,在低对比度CT中提升左前降动脉分割精度,为放疗规划提供高效心脏亚结构分割框架。

Comments Acceteed by Medical Physics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12187 2026-08-13 cs.CV cs.AI 新提交 57%

HSTGFormer: Hyper Spatial-Temporal Graph Transformer for 3D Human Pose Estimation

HSTGFormer:用于3D人体姿态估计的超时空图变换器

Ruochen Li, Shuang Chen, Wenke E, Farshad Arvin, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HSTGFormer框架,通过超时空图与自适应双尺度时间图实现时空耦合推理,在Human3.6M等数据集上以高准确率与计算效率完成3D人体姿态估计。

Comments Accepted to BMVC 2026, full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11534 2026-08-13 cs.CL cs.CV 新提交 57%

CT-$Δ$Bench: A Benchmark for Longitudinal 3D Medical Imaging Difference Reporting with Vision-Language Models

CT-ΔBench:基于视觉语言模型的纵向3D医学影像差异报告基准

Kegeng Tang, Jingbo Wang, Shaogang Ren, Zihao Wang

机构 * University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文针对现有医学基础模型缺乏纵向影像差异处理能力的问题,构建了专用基准CT-ΔBench,开发感知变化指标与医师验证流程,对比不同推理方式并提出基线模型DeltaMed,为时间感知医学基础模型奠定基础。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03236 2026-08-13 cs.HC cs.CL 版本更新 57%

BLADE: Better Language Answers through Dialogue and Explanations

BLADE:通过对话和解释提升语言答案

Chathuri Jayaweera, Phoebe Huang, Bonnie J. Dorr

机构 * University of Florida(佛罗里达大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 BLADE通过引导学习者接触相关教学资源而非直接提供答案,提升学生对课程资源的导航能力和概念理解。

Comments Contains 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12059 2026-08-13 cs.CY 新提交 50%

Reconfiguring Geovisualization in the Age of Generative AI: Insights from Domain Experts

生成式AI时代的地理可视化重构:领域专家的见解

Mengyi Wei, Chenyu Zuo, Jiaying Xue, Nianhua Liu, Dongsheng Chen, Shengkai Wang, Yu Feng, Liqiu Meng

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究通过访谈20位地理可视化专家,探究生成式AI对地理可视化实践的影响,发现其拓展了相关能力但转移了瓶颈,提出需领域特定方法实现负责任应用,为相关实践、教育等提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11458 2026-08-13 cs.CV 新提交 50%

Multi-Agent Target-Existence Verification and Learned Mask Geometry Refinement: Winning Report of the MeViS-Text Track at the 8th LSVOS Challenge 2026

多智能体目标存在性验证与学习型掩码几何优化:2026年第8届LSVOS挑战赛MeViS-Text赛道获胜报告

Jungyoon Lee, Gyuil Lim, Doeon Kim, Seong-heum Kim

机构 * Soongsil University(崇实大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出SSUPER方案,通过多智能体审计解耦存在性验证、StyleRefiner优化掩码几何,获2026年LSVOS挑战赛MeViS-Text赛道冠军,最终得分0.9081339614。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08131 2026-08-13 cs.RO cs.CV 版本更新 50%

UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing

UniGround: 通过无训练场景解析实现通用三维视觉接地

Jiaxi Zhang, Yunheng Wang, Wei Lu, Taowen Wang, Shuning Zhang, Yixiao Feng, Junzhe Xu, Shunwang Sun, Weisheng Xu, Yuetong Fang, Renjing Xu

机构 * The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)) Shanghai Normal University(上海师范大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 UniGround通过无训练的视觉和几何推理实现通用三维视觉接地,超越训练数据限制,在ScanRefer和EmbodiedScan上取得新突破。

Comments 30 pages,9 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 8 篇

2608.11994 2026-08-13 cs.AI cs.CL 新提交 84%

Claim-Level Reliability Assessment for Efficient Test-Time Reasoning

面向高效测试时推理的声明级可靠性评估

Sen Xu, Wei Wang, Shixi Liu, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Junlin Zhang

机构 * Sina Weibo Inc.(新浪微博公司)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无需训练的CLR框架,将测试时计算从解决方案采样重分配至声明级语义证伪,在匹配预算下于四个LLM及四个推理基准上提升了推理性能,减少了标记使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11403 2026-08-13 cs.AI cs.CL cs.LG 新提交 76%

When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs

当自我一致性适得其反:对于小型大型语言模型,多数投票会损害大多数硬科学问题

Utkarsh Bahuguna

机构 * Scaler School of Technology(斯凯勒科技学院)

专题命中 测试时计算 :reasoning(abstract,comments);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现,多数投票的自我一致性方法会损害小型指令微调模型在多数硬科学问题上的准确率,其核心机制是置信度与正确性不匹配,且无验证器门控方法可提升该问题下的准确率。

Comments 9 pages, 4 figures, 3 tables. Accepted at the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12307 2026-08-13 cs.LG cs.AI cs.CL 新提交 67%

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

测试时的AI辅助AI:通过 harness 实现强模型到弱模型的能力迁移

Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang, Jielin Qiu, Heng Ji, Silvio Savarese, Huan Wang, Shelby Heinecke

机构 * Salesforce AI Research(Salesforce人工智能研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出在测试时通过构建 harness,无需重新训练即可将强模型的认知结构迁移给弱模型,使目标模型在四个心理理论基准上的平均性能从0.49提升至0.91,为模型能力迁移提供了新的思路。

Comments 23 Pages, 12 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏