arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2605.31561 2026-06-01 cs.CL 70%

What Am I Missing? Question-Answering as Hidden State Probing

我遗漏了什么?将问答作为隐藏状态探测

Chu Fei Luo, Samuel Dahan, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering & Ingenuity Labs, Queen’s University(电子与计算机工程系及Ingenuity实验室,女王大学) Conflict Analytics Lab, Queen’s University(冲突分析实验室,女王大学) Cornell Law School(康奈尔法学院) Vector Institute for AI(人工智能向量研究所)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出将问答作为推理时干预手段,通过学生-教师框架探测隐藏状态,发现提问前的隐藏状态可预测最终正确性,并设计门控策略优化提问时机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30244 2026-05-29 cs.CV cs.AI 70%

Reinforcement Learning with Robust Rubric Rewards

基于稳健评分规则的强化学习

Ya-Qi Yu, Hao Wang, Fangyu Hong, Xiangyang Qu, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对部分可验证的视觉-语言任务,提出RLR^3方法,通过双路径执行评分规则、最小暴露策略和层次聚合,实现从任务级到准则级验证的扩展,在15个基准上平均提升4.7分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22735 2026-05-28 cs.CL 70%

Explanation Generation for Contradiction Reconciliation with LLMs

面向矛盾调和的大语言模型解释生成

Jason Chan, Zhixue Zhao, Robert Gaizauskas

机构 * University of Sheffield, UK(谢菲尔德大学)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 提出矛盾调和解释生成任务,通过改造NLI数据集和设计质量指标,评估18个LLM在该任务上的表现,发现模型能力有限且增大模型规模时“思考”收益递减。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23493 2026-05-25 cs.AI 70%

EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation

EDGE-OPD:通过证据引导的在线策略蒸馏内化特权上下文

Aristotelis Lazaridis, Dylan Bates, Aman Sharma, Brian King, Vincent Lu, Jack FitzGerald

机构 * EdgeRunner AI

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对在线策略自蒸馏中特权信息导致模型行为偏移的问题,提出EDGE-OPD方法,通过引导展开和证据掩码实现目标行为的高效迁移与通用能力保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21996 2026-05-22 cs.SE cs.AI 70%

From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents

从片段到轨迹:软件工程代理的特权过程监督

Murong Ma, Tianyu Chen, Yun Lin, Shuai Lu, Qinglin Zhu, Yeyun Gong, Zhiyong Huang, Peng Cheng, Yan Lu, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) Microsoft Research Asia(微软亚洲研究院) Shanghai Jiao Tong University(上海交通大学) King’s College London(伦敦国王学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出Patches-to-Trajectories (P2T)方法,通过利用开发者撰写的参考补丁来改进软件工程代理的训练过程,提高训练效果和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21980 2026-05-22 cs.CV cs.AI 70%

Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow

通过跨模态信息流解读并增强大视觉-语言模型中的情感电路

Chengsheng Zhang, Chenghao Sun, Zhining Xie, Xinmei Tian

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception(脑启发智能感知与认知MOE实验室) Cognition, University of Science(认知,科学大学) AIPD, Tencent(AIPD,腾讯)

专题命中 测试时计算 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出了一种基于转向向量的因果归因框架,用于描述性情感推理,通过构建专用数据集揭示了三阶段'适应-聚合-执行'机制下的情感电路,发现视觉情感线索在中间层通过情感特定的注意力头进行聚合,随后在深层通过情感通用路径转换为叙述生成,并通过调控情感信息路由增强注意力流和语义激活,从而提升性能并缓解情感幻觉。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19943 2026-05-20 cs.AI 70%

Probabilistic Tiny Recursive Model

概率性微型递归模型

Amin Sghaier, Ali Parviz, Alexia Jolicoeur-Martineau

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出概率性微型递归模型(PTRM),通过在递归步骤中注入高斯噪声,使模型能够并行探索多样化的解决方案盆地,从而在不重新训练或进行任务特定增强的情况下,提升多个基准测试的准确性,包括Sudoku-Extreme和Pencil Puzzle Bench上的各种谜题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06062 2026-05-18 cs.CL 70%

When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL

重要采样误分配信用:用于结果监督强化学习的非对称比率

Jiakang Wang, Runze Liu, Qingpeng Cai, Lei Lin, Wenping Hu, Xiu Li, Fuzheng Zhang, Guorui Zhou, Kun Gai, Ling Pan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 本文揭示了在结果监督强化学习中,重要采样比率因角色转变导致正优势token与负优势token的权重失衡,提出非对称重要采样策略ASPO以纠正此问题,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22474 2026-05-14 cs.RO cs.LG 70%

When to Act, Ask, or Learn: Uncertainty-Aware Policy Steering

何时行动、提问或学习:不确定性感知的策略引导

Jessie Yuan, Yilin Wu, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 本文提出不确定性感知策略引导框架,通过联合推理任务语义不确定性和低层动作可行性,选择执行高置信度动作、通过自然语言查询澄清任务歧义或请求动作干预修正低层策略,提升机器人部署性能。

Comments To appear in Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10716 2026-05-12 cs.LG stat.ML 70%

What should post-training optimize? A test-time scaling law perspective

在测试时间视角下,后训练应优化什么?

Muheng Li, Jian Qian, Wenlong Mou

机构 * Department of Statistical Sciences, University of Toronto(多伦多大学统计科学系) Department of AI and Data Science, The University of Hong Kong(香港大学人工智能与数据科学系)

专题命中 测试时计算 :test-time compute(abstract);verifier(abstract);分类 cs.LG

AI总结 本文研究了测试时间预算不匹配场景下,基于奖励尾部统计的后训练优化方法,提出TEA和Prefix-TEA估计器提升最佳N性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10158 2026-05-12 cs.LG 70%

Unsupervised Process Reward Models

无监督过程奖励模型

Artyom Gadetsky, Maxim Kodryan, Siba Smarak Panigrahi, Hang Guo, Maria Brbic

机构 * Swiss Federal Institute of Technology(瑞士联邦理工学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 本文提出无监督过程奖励模型(uPRM),通过无需人工监督的评分函数,提升大语言模型在复杂推理任务中的鲁棒性与准确性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20860 2026-04-24 cs.IR cs.AI 70%

RealRoute: Dynamic Query Routing System via Retrieve-then-Verify Paradigm

RealRoute:通过检索-验证范式实现动态查询路由系统

Jiahe Liu, Qinkai Yu, Jingcheng Niu, Xi Zhu, Zirui He, Zhen Xiang, Fan Yang, Jinman Zhao

机构 * Technical University of Denmark(技术大学) University of Exeter(埃克塞特大学) University of Toronto(多伦多大学) Rutgers University(罗格斯大学) NJIT(新 jersey 工业技术学院) University of Georgia(佐治亚大学) Wake Forest University(威克森林大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 RealRoute引入一种鲁棒的检索-验证机制,通过并行源无关检索和动态验证器确保证据完整性,优于预测基线,在多跳RAG推理任务中表现更佳。

Comments 12 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20389 2026-04-23 cs.CR cs.AI 70%

CyberCertBench: Evaluating LLMs in Cybersecurity Certification Knowledge

CyberCertBench: 评估大语言模型在网络安全认证知识中的表现

Gustav Keppler, Ghada Elbez, Veit Hagenmeyer

专题命中 测试时计算 :verifier(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CyberCertBench,通过行业认证试题评估大语言模型的网络安全知识,验证了前沿模型在通用知识上的表现,但其在特定厂商标准问题上的准确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27844 2026-04-17 cs.CL 70%

Model Capability Dominates: Inference-Time Optimization Lessons from AIMO 3

模型能力主导:来自AIMO 3的推理时间优化启示

Natapong Nitarach

机构 * Proton

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 通过AIMO 3竞赛发现,多数投票多模型推理提升数学能力,但相关误差限制样本量。通过分配不同推理策略的Diverse Prompt Mixer方法显示,模型能力主导,优化效果有限。

Comments 18 pages, 6 figures, 10 tables. Kaggle AIMO 3 competition entry. Code and notebooks: https://github.com/nat-nischw/model-capability-dominates-lessons-aimo3

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18129 2026-04-17 cs.CV cs.CL 70%

One RL to See Them All: Visual Triple Unified Reinforcement Learning

一个RL看尽一切:视觉三合一强化学习

Yan Ma, Linge Du, Xuyang Shen, Shaoxiang Chen, Pengfei Li, Qibing Ren, Lizhuang Ma, Yuchao Dai, Pengfei Liu, Junjie Yan

机构 * Qwen Team(通义实验室)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出V-Triune方法,通过三个协调抽象提升多模态RL性能,开发Orsta模型在多个任务中表现优异,展示统一RL在视觉语言模型中的优势。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12647 2026-04-15 cs.SD cs.CL 70%

Adaptive Test-Time Scaling for Zero-Shot Respiratory Audio Classification

自适应测试时缩放用于零样本呼吸音频分类

Tsai-Ning Wang, Herman Teun den Dekker, Lin-Lin Chen, Neil Zeghidour, Aaqib Saeed

机构 * Eindhoven University of Technology The Netherlands(埃因霍温理工大学荷兰) Erasmus University Medical Center The Netherlands(埃因霍温医学院荷兰) Kyutai France(Kyutai法国) Eindhoven Artificial Intelligence Systems Institute The Netherlands(埃因霍温人工智能系统研究所荷兰)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 本文提出TRIAGE框架,通过分层零样本方法自适应调整测试时计算,提升呼吸音频分类性能,实现9项任务平均AUROC达0.744,优于现有零样本方法。

Comments Accepted at AHLI CHIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12543 2026-04-15 cs.AI 70%

A Two-Stage LLM Framework for Accessible and Verified XAI Explanations

一个两阶段LLM框架用于可访问且验证的XAI解释

Georgios Mermigkis, Dimitris Metaxakis, Marios Tyrovolas, Argiris Sofotasios, Nikolaos Avgeris, Panagiotis Hadjidoukas, Chrysostomos Stylios

机构 * Department of Computer Engineering and Informatics, University of Patras(帕特拉大学计算机工程与信息学系) Department of Informatics and Telecommunications, University of Ioannina(伊奥安尼纳大学信息与电信系) Industrial Systems Institute, Athena Research Center(雅典研究中心工业系统研究所) Archimedes Unit, Athena Research Center(雅典研究中心阿基米德单位)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出两阶段LLM框架,通过解释器和验证器LLM生成并验证XAI解释,提升解释的准确性与可访问性。

Comments 8 pages, 8 figures, Accepted for publication at the 2026 IEEE World Congress on Computational Intelligence (WCCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10034 2026-04-14 cs.AI 70%

AI Achieves a Perfect LSAT Score

人工智能实现完美LSAT分数

Bonmu Ku

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文首次展示语言模型在公开LSAT考试中取得满分,通过QLoRA微调的奖励模型提升逻辑推理能力,证明机器可超越人类认知极限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09748 2026-04-14 cs.CR cs.AI 70%

Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward

在RLVR中存在后门:从可验证奖励中对LLM的后门攻击

Weiyang Guo, Zesheng Shi, Zeen Zhu, Yuan Zhou, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出了一种在RLVR框架中通过注入污染数据植入后门的新方法,展示了该攻击在不同模型规模上高效且具有泛化能力,导致安全性能下降73%。

Comments 20 pages,8 figures, publish in acl2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06753 2026-04-09 cs.CL 70%

Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents

选择后再解决:作为大语言模型代理推理时间优化的范式路由

Heng Zhou, Zelin Tan, Zhemeng Zhang, Yutao Fan, Yibing Lin, Li Kang, Xiufeng Song, Rui Li, Songtao Huang, Ao Yu, Yuchen Fan, Yanxu Chen, Kaixin Xu, Xiaohong Liu, Yiran Qin, Philip Torr, Chen Zhang, Zhenfei Yin

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 研究通过比较六种推理范式在四个前沿LLM和十个基准上的表现,发现推理结构对任务效果有显著影响,提出选择后再解决方法通过轻量级嵌入路由提升任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05939 2026-04-08 cs.AI cs.HC 70%

Context-Value-Action Architecture for Value-Driven Large Language Model Agents

基于价值的大型语言模型代理的上下文-价值-行动架构

TianZe Zhang, Sirui Sun, Yuhang Xie, Xin Zhang, Zhiqiang Wu, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Yuanpei College, Peking University(北京大学元培学院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室(教育部)) PKU-Wuhan Institute for Artificial Intelligence(北大武汉人工智能研究院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出CVA架构,通过价值验证器缓解价值极化,提升代理行为的准确性和可解释性。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05716 2026-04-08 cs.AI 70%

Can Large Language Models Reinvent Foundational Algorithms?

大语言模型能否重新发明基础算法?

Jian Zhao, Haoren Luo, Yu Wang, Yuhan Cao, Pingyue Sheng, Tianxing He

机构 * Xiongan AI Institute(雄安人工智能研究院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文研究大语言模型能否在受控环境中重新发明基础算法,通过Unlearn-and-Reinvent流程验证模型在无提示、低提示和高提示下的表现,发现生成验证器在推理过程中起到关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14275 2026-04-02 cs.CL 70%

Let the Model Distribute Its Doubt: Confidence Estimation through Verbalized Probability Distribution

让模型分配其怀疑:通过 verbalized 概率分布进行置信度估计

Ante Wang, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过生成 verbalized 概率分布提升置信度估计,系统实验显示其在多个 LLM 和任务中表现优异,推理效率高且计算节省显著,但也揭示了特定任务的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22784 2026-03-25 cs.LG 70%

Caterpillar of Thoughts: The Optimal Test-Time Algorithm for Large Language Models

思维 caterpillar:大型语言模型的最优测试时间算法

Amir Azarmehr, Soheil Behnezhad, Alma Ghafari

机构 * Northeastern University(东北大学)

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出Caterpillar of Thoughts算法,通过理论分析证明最优算法生成caterpillar树,从而减少生成次数并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09677 2026-03-16 cs.AI 70%

The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs

持续扩展的幻觉回报:衡量LLM的长周期执行

Akshit Sinha, Arvindh Arun, Shashwat Goel, Steffen Staab, Jonas Geiping

机构 * University of Cambridge(剑桥大学) Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) University of Southampton(南安普顿大学) Tübingen AI Center(图宾根人工智能中心)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文通过分析LLM在长周期任务中的执行能力,揭示了持续扩展LLM并非必然导致回报递减,而是执行能力的提升能显著改善长周期任务表现。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12724 2026-03-16 cs.LG 70%

SciDesignBench: Benchmarking and Improving Language Models for Scientific Inverse Design

SciDesignBench: 科学逆向设计的语言模型基准测试与改进

David van Dijk, Ivan Vrkic

机构 * CellType Inc.(CellType公司)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.LG

AI总结 本文提出SciDesignBench,通过520个模拟器支撑任务评估语言模型在科学逆向设计中的表现,发现模拟反馈对不同设计周期有不同影响,并引入RLSF训练方法提升模型性能。

Comments 35 pages, 19 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23863 2026-03-16 cs.CL 70%

SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models

SPELL: 自我扮演强化学习用于进化长上下文语言模型

Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang

机构 * Sun Yat-sen University(中山大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出SPELL框架,通过自我扮演问答和验证角色实现长上下文推理的无监督优化,实验显示其在多个基准上优于传统微调方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02088 2026-02-27 cs.CV cs.AI 70%

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15156 2026-02-18 cs.AI 70%

Panini: Continual Learning in Token Space via Structured Memory

Panini:通过结构化记忆在令牌空间中实现持续学习

Shreyas Rajesh, Pavan Holur, Mehmet Yigit Turali, Chenda Duan, Vwani Roychowdhury

机构 * ucla(加州大学洛杉矶分校)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 Panini通过结构化记忆在令牌空间中实现持续学习,提升推理效率和准确性。

Comments 35 pages, code available at: https://github.com/roychowdhuryresearch/gsw-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14910 2026-02-17 cs.AI 70%

Position: Introspective Experience from Conversational Environments as a Path to Better Learning

位置:对话环境中的反思经验作为更好学习的路径

Claudiu Cristian Musat, Jackson Tolins, Diego Antognini, Jingling Li, Martin Klissarov, Tom Duerig

机构 * Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出通过对话环境中的反思经验提升学习效果,强调社会互动对推理能力的培养作用。

详情

展开后加载摘要…

URL PDF HTML 收藏