arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-20 至 2026-08-20 共收录 59 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2608.19197 2026-08-20 cs.CL cs.AI 新提交 73%

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: this https URL (https://spade-rl.github.io); Code: this https URL (https://github.com/spade-rl/spade)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19047 2026-08-20 cs.AI math.NT 新提交 57%

Eureka: Task-Conditioned Meta-Agent Orchestration for Scientific Discovery

Eureka:面向科学发现的任务条件元智能体编排框架

Alizer Wong, Heng Cui, Yi Tan, Xiongchao Zhan, Liang Lin, Yuxiang Guo, Zhaorong Dai, Zixin Zeng, Wenyuan Li

机构 * ManXis(万熙科技(ManXis)) Guangdong University of Technology(广东工业大学) South China Normal University(华南师范大学) Shanghai Jiao Tong University(上海交通大学) Duke University(杜克大学) Hokkaido University(北海道大学)

专题命中 数学推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出Eureka任务条件元智能体架构,通过动态编排完成科学发现任务,在递归任务、增量处理等实验中表现优异,还实现了数学领域的理论进展,证明科学智能体能力依赖匹配任务认知结构的架构。

Comments 62 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2608.18118 2026-08-20 math.OC eess.SY 新提交 50%

Formal Safety Verification for Nonlinear Systems with Generative Barrier Certificate

基于生成式障碍证书的非线性系统形式化安全验证

Mengxin Ren, Hanrui Zhao

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 该研究针对非线性系统安全验证中障碍证书推导计算成本高的问题,提出基于大语言模型的生成式框架,将BMI问题转化为LMI测试,实现了远超传统方法的速度与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 3 篇

2608.18105 2026-08-20 cs.CL cs.AI cs.LG 新提交 67%

StocksTalk: A Voice-Enabled Conversational Agent for Structured Query Generation over Web Data

StocksTalk:一种面向网络数据结构化查询生成的语音赋能对话智能体

Akshat Parmar, Vikranth Udandarao, Abhay Shakya, Tanmay Hire, Avinash Anand, Rajiv Ratn Shah, Daniel Wang Zhengkui

机构 * IIIT-Delhi(德里印度信息技术学院) Singapore Institute of Technology(新加坡理工学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 StocksTalk是一种语音赋能对话系统,可将口语化金融请求转为结构化查询,通过多模块提升准确性,为股票筛选决策提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18165 2026-08-20 cs.AI cs.FL cs.LO 新提交 57%

RDFdL: Integrating RDF with Differential Dynamic Logic

RDFdL:将RDF与微分动态逻辑(Differential Dynamic Logic)集成

Yuyang Li, Lukas Kubelka, Julia Butte, Tobias Käfer

机构 * Institute AIFB, Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院AIFB研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对RDF知识图谱无法推理物理系统动态行为的问题,提出将RDF与微分动态逻辑集成的RDFdL框架,实现静态与动态知识的统一表示推理,可用于制造业相关场景。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19135 2026-08-20 cs.CR cs.DC cs.MA cs.NI 新提交 50%

Autonomous Cyber Defense in Connected Vehicles: A Multi-Agent Approach to V2X Security

网联车辆中的自主网络防御:一种面向V2X安全的多智能体方法

Krishna Teja Medam

专题命中 逻辑推理 :planning(abstract)

AI总结 针对网联车辆V2X安全,提出三层多智能体架构,以SAE标准时序为硬性约束,分层处理消息分类、冲突解决与模型优化,解决现有入侵检测系统的安全-安保冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 13 篇

2608.18254 2026-08-20 cs.RO 新提交 82%

GAPL: Grounded Action-effect Policy Learning for LLM-Based Trajectory Planning

GAPL:面向基于大语言模型的轨迹规划的接地动作效果策略学习

Zhihong Cui, Hengyu Liu, Zhangkai Wu, Yushuai Li, Tianyi Li, Peiyuan Guan, Amir Taherkordi, Tor Skeie

机构 * University of Oslo(奥斯陆大学) Aalborg University(奥尔堡大学) University of Sydney(悉尼大学) Nanjing University of Information Science and Technology(南京信息工程大学) Simula Research Laboratory(西穆拉研究院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 针对LLM用于自动驾驶轨迹规划时存在的幻觉、接地不足等问题,提出GAPL框架,整合三类模块并经实验验证其性能优于基线方法

Comments 11 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18631 2026-08-20 cs.AI cs.GT cs.LG 新提交 81%

Preference Reasoning under Indeterminacy in Large Language Models

大语言模型在不确定性下的偏好推理

Hadi Hosseini, Samarth Khanna, Xiyuan Wang

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文聚焦大语言模型决策智能体的偏好推理问题,将不确定性挑战形式化为认知与结构两类,发现当前模型无法区分确定与不确定实例,推理校准不当。

Comments 55 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18855 2026-08-20 cs.IR 新提交 78%

Think-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval

思考以个性化:统一推理与检索的以用户为中心的个性化密集检索

Angqing Jiang, Gaoming Zhang, Jianchun Song, Kena Qi, Dayao Chen, Wei Lin, Defu Lian

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本文提出TTP框架,将用户意图推理与密集检索统一,经两阶段训练后在电商场景实验及在线测试中均取得优于基线的效果,提升了订单量。

Comments Accepted at CIKM 2026. 11 pages, 8 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18357 2026-08-20 cs.CY 新提交 78%

Capability-Based Planning for AI Crisis Preparedness

面向AI危机准备的基于能力的规划

Isaak Mengesha, Charlie Collins, Juan Felipe Cerón Uribe, Salvatore d'Ambrosio, Vickie Ellis

专题命中 规划推理 :planning(title,abstract)

AI总结 该研究针对AI难以预测的问题,提出三部分组成的基于能力的规划方法框架,经四类AI赋能威胁试点验证,为AI危机准备提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18921 2026-08-20 cs.CL cs.AI 新提交 76%

SMTrap: Cost-Effective DoS Attacks Against Large Reasoning Models via SMT Conflict Guidance

SMTrap:基于SMT冲突引导的针对大型推理模型的高性价比DoS攻击

Jian Yang, Zhenqi Feng, Zhaoyang Yu, Zhaoxin Fan, Kejian Wu, Xiaofeng Wang, Zheng Zhu, Jianjun Huang, Wei You, Bin Liang

专题命中 规划推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 本研究提出基于SMT冲突引导的轻量级CPU框架SMTrap,无需模型查询或GPU即可生成高影响力CSP查询,实现强于基线数倍的LRM-DoS攻击,还展示了对应的缓解工具

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18731 2026-08-20 cs.CV cs.AI 新提交 57%

A Few Cases Are All You Need: An Empirical Study of Annotation-Efficient LoRA Fine-Tuning of MedSAM3

少数案例足矣:对MedSAM3的标注高效LoRA微调的实证研究

Sachin Dudda Nagaraju, Bendik Skarre Abrahamsen, Ashkan Moradi, Mattijs Elschot

机构 * Norwegian University of Science and Technology(挪威科技大学) St. Olavs Hospital, Trondheim University Hospital(圣奥拉夫斯医院(特隆赫姆大学医院))

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对MedSAM3,用LoRA微调实现仅10个标注案例即可让医学图像分割达到临床可用性能,在腹部器官和心脏分割任务上优于部分专业工具,且训练速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18682 2026-08-20 cs.AI 新提交 57%

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

RTPO:用于稳定智能体强化学习训练的反向回合策略优化

Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

机构 * Adelaide University(阿德莱德大学) The University of Sydney(悉尼大学) Curtin University(科廷大学) School of CSIT(计算机科学与信息技术学院) ACFR(澳大利亚空间研究中心) School of EECMS(电子工程、计算机与数学科学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18613 2026-08-20 cs.AI cs.CR 新提交 57%

CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence

CTIFoundry:用于网络威胁情报的智能体原生语料库支架

Yutong Cheng, Changze Li, Qian Cui, Wei Ding, Lingzhi Wang, Yan Chen, Peng Gao

机构 * Virginia Tech(弗吉尼亚理工大学) Amazon(亚马逊公司) Northwestern University(西北大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 CTIFoundry是用于网络威胁情报的智能体原生语料库支架,在CTIConnect基准测试中可使智能体F1提升0.19至0.28,小型模型在其上表现优于旗舰模型,且无需增加搜索工作量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18282 2026-08-20 math.OC cs.LG eess.SY 新提交 57%

Self-supervised In-context Operator Learning for Stochastic Mean-Field Control

面向随机平均场控制的自监督上下文算子学习

Suyi Gao, Mo Zhou, Rongjie Lai

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本研究提出首个无网格自监督神经算子NFIST,通过结合概率流ODE与可逆归一化流Transformer解决随机平均场控制问题,可实现未见任务的一次前向求解,在多任务上展现零样本泛化并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19000 2026-08-20 cs.CV 新提交 50%

Mise-en-Scène: Implicit Layout Emergence in Diffusion Transformers for Human-AI Design Co-Creation

场景布置(Mise-en-Scène):用于人机协同设计共创的扩散Transformer中隐式布局的涌现

Zipeng Xu, Ryan Murdock, Umberto Michieli

机构 * Canva Research(Canva研究院)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出Mise-en-Scène框架,通过微调扩散Transformer实现隐式布局涌现,结合匹配放置步骤保证素材保真度,在PrismLayersPlus基准上生成的设计感知质量显著优于现有方法。

Comments Best Paper Award at ECCV Human-AI Co-Creation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18637 2026-08-20 cs.IR 新提交 50%

PILOT Technical Report

PILOT技术报告

Jiuning Lin, Ruiquan Lan, Xiaodong Zhu, Bin Zhang, Chengyu Lai, Chuxin Chen, Dimin Wang, Hongtao Cheng, Jialin Zhu, Lingqing Zhang, Shuai Zhong, Tao Wang, Weipeng Huang, Yinjiang Cai, Yinnan Song, Yuan Liu, Zhibo Xiao, Zhixin Ma, Zihong Huang

专题命中 规划推理 :planning(abstract)

AI总结 该研究针对现有推荐系统优化智能体方法的反应式缺陷,提出PILOT框架,通过三类角色构建控制循环,在淘宝平台对比ROAM验证,实现多项指标提升且搜索效率显著提高,无需人工干预。

Comments Technical Report, 42 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19091 2026-08-20 quant-ph 新提交 50%

Non-Local Search-to-Decision Reduction over F2

F2上的非局部搜索到决策归约

Prabhanjan Ananth

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究针对F₂上的非局部搜索到决策问题,证明了双方共同回答奇偶性挑战的概率上限,其结果可应用于不可克隆加密和量子拷贝保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19008 2026-08-20 physics.ao-ph 新提交 50%

Extremes on Rewind: Generating 1,000-Member Ensembles Initialized at a Final Condition

回溯极端事件:在最终状态条件下初始化生成1000成员集合

Jerry Lin, Mu-Ting Chien, Mansi Sakarvadia, Elizabeth A. Barnes

专题命中 规划推理 :planning(abstract)

AI总结 本研究使用非自回归基础模型cBottle-video生成1000成员集合,针对三个极端事件验证了终点约束集合的多样性与有效性,为罕见高影响事件的情景规划提供了高效方案。

Comments 38 pages, 21 figures; includes 17 pages of Supporting Information with 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 9 篇

2608.18574 2026-08-20 cs.LG 新提交 83%

Continual Reasoning Gym: Diagnosing and Harnessing Shared Reasoning in Continual RLVR

持续推理环境:诊断与利用持续RLVR中的共享推理

Lirui Luo, Guoxi Zhang, Hongming Xu, Rongqing Li, Cong Fang, Lifeng Fan

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室(BIGAI)) Beijing Institute of Technology(北京理工大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室、北京大学智能科学与技术学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本研究提出持续推理环境,针对持续RLVR中顺序训练性能低于MTRL的问题,提出CPR方法利用共享推理,使模型平均达到MTRL级性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18878 2026-08-20 cs.AI cs.MA 新提交 79%

DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning

DentAgent:以证据为中心的多智能体协调的多模态牙科推理框架

Zijie Meng, Xiwei Dai, Yixuan Tang, Jin Hao, Yang Feng, Fudong Zhu, Xiaoqiang Liu, Shaosheng Cao, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Angelalign Technology Inc.(时代天使科技有限公司) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对现有牙科AI系统模态或任务局限及证据不可追溯问题,提出以证据为中心的多智能体框架DentAgent,经四个基准测试,其多标签诊断性能超越资深专家17.3个百分点,可用于多模态牙科推理及人群口腔健康评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18111 2026-08-20 cs.AI 新提交 79%

Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry

求解不等于绘图:奥林匹克几何图解推理基准

Hsien Xin Peng, Anthony Kim, Alvin Li, Calvin Supasanya, Shivank Garg, Kevin Zhu

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对基础模型图解推理能力评估缺口,构建含954道奥林匹克几何题的基准,发现模型求解与绘图能力存在显著差距,绘图平均编译成功率仅36.14%。

Comments ICML 2026, AI4MATH Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-08-20 cs.CV 新提交 78%

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18647 2026-08-20 cs.RO cs.LG 新提交 57%

Progressive Experience Fusion for Multi-Task World Model Control in Endovascular Navigation

用于血管内导航多任务世界模型控制的渐进式经验融合

Harry Robertshaw, Maxence Boels, Nikola Fischer, Sebastien Ourselin, Christos Bergeles, Alejandro Granados, Thomas C Booth

机构 * School of Biomedical Engineering & Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院) Surgical & Interventional Engineering(外科与介入工程)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 本研究提出渐进式经验融合(PEF)训练多任务TD-MPC2控制器,在血管内导航任务中提升了成功率,可实现跨血管结构迁移与患者特异性微调,为临床应用提供概念验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18628 2026-08-20 cs.CV cs.CL 新提交 57%

When Safety Overrides Vision: Exploring Dynamics between Vision Influence and Safety Alignment in Vision-Language Models

当安全覆盖视觉时:探索视觉语言模型中视觉影响与安全对齐之间的动态关系

Mehak Gupta, Tanmoy Chakraborty

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究探究对齐视觉语言模型中安全诱导弃权的内部解码动态,发现安全对齐未抑制感知接地,抑制拒绝相关表征可恢复接地回答,揭示了其一种新的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19059 2026-08-20 cs.RO cs.CV 新提交 50%

LT-Mem: Volatility-Aware Spatio-Temporal Memory for Lifelong Scene Understanding

LT-Mem:面向终身场景理解的感知时间动态的时空记忆

Yumin Lee, Hyoseok Ju, Giseop Kim

机构 * DGIST(大邱庆北科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究针对机器人长期场景理解的时间遗忘问题,提出LT-Mem时空记忆框架,结合多会话SLAM与Tri-Memory结构,在LT-VQA数据集上性能优于基线且token消耗更少。

Comments 8 pages, 8 figures, 6 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18840 2026-08-20 cs.RO cs.CV 新提交 50%

Beyond Placement and Articulation: Usage-Driven Code Scenes for Embodied Interaction

超越布局与关节运动:面向具身交互的使用驱动型代码场景

Zijian Xiao, Zipeng Ye, Jinkun Hao, Xiong Yang, Yuchen Xie, Ran Yi

机构 * Meituan(美团)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对现有代码场景生成方法未建模场景功能使用的问题,提出RoomWright框架,通过使用驱动型物体推理与代码智能体实现可执行、可编辑的仿真就绪3D场景,为具身AI与策略学习提供交互式环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18498 2026-08-20 cs.CV 新提交 50%

DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer

DyG²T:基于3D高斯时空粒子图Transformer的对象动力学建模

Yansong Wang, Zhaobo Qi, Xinyan Liu, Beichen Zhang, Shuhui Wang, Weigang Zhang, Qingming Huang

机构 * School of Computer Science and Technology, Harbin Institute of Technology at Weihai(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文针对现有动力学建模方法丢失细粒度细节、轨迹漂移等问题,提出DyG²T框架,通过空间补全关键点、TDN增强时间判别性、粒子图Transformer建模交互,在合成与真实数据集上实现精准动力学建模,泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 3 篇

2608.19009 2026-08-20 cs.CL 新提交 79%

Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning

评估评估者:面向大语言模型推理的验证自主等级(L0-L5)

Yajie Yin

专题命中 测试时计算 :reasoning(title);verifier(abstract);分类 cs.CL

AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。

Comments Code and data: this https URL (https://github.com/1549080929-debug/math_agent) Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18884 2026-08-20 cs.AI 新提交 57%

Training-Free Inference-Time Self-Reflection and Cost-Bounded Early Stopping for Large Language Models

面向大语言模型的无训练推理时自我反思与成本受限早停机制

Wei Yu, Suxing Liu, Minjie Yu, Jiahao Wang, Zhijian Zheng, Haocheng Deng, Bing Li

机构 * School of Digital Arts, Jiangxi Arts & Ceramics Technology Institute(江西工艺美术职业技术学院数字艺术学院) School of Computing, Universiti Sains Malaysia(马来西亚理科大学计算机学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出无训练的推理时协议EvoResearcher,通过成本受限的自我反思实现大语言模型早停,在多个推理基准上验证其成本受限自我验证的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏