arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-18 至 2026-03-18 共收录 105 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2601.14440 2026-03-18 cs.AI cs.CL cs.LG 90%

VisTIRA: Closing the Image-Text Modality Gap in Visual Math Reasoning via Structured Tool Integration

VisTIRA: 通过结构化工具集成缩小图像-文本模态差距以提升视觉数学推理

Saeed Khaki, Ashudeep Singh, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VisTIRA通过结构化工具集成框架,解决图像形式数学问题的推理难题,改进视觉数学推理能力,实验表明工具监督和OCR定位能有效缩小模态差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16206 2026-03-18 cs.LG cs.CL 84%

Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning

离线探索感知微调用于长链数学推理

Yongyu Mu, Jiali Zeng, Fandong Meng, JingBo Zhu, Tong Xiao

机构 * NLP Lab, School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院自然语言处理实验室,中国沈阳) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯公司微信人工智能部门模式识别中心,中国)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出OXA微调方法,通过优化两个目标提升数学推理能力,实验显示在六个基准测试中OXA相比传统SFT在Pass@1和Pass@$k$上平均提升6和5分。

Comments Working in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16578 2026-03-18 cs.LG cs.CL 81%

When and Why Does Unsupervised RL Succeed in Mathematical Reasoning? A Manifold Envelopment Perspective

在何种情况下和为何无监督强化学习在数学推理中成功?一种流形包裹视角

Zelin Zhang, Fei Cheng, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究无监督强化学习在数学推理中的成功条件,提出通过流形包裹视角分析其稳定性与失效原因,设计内在奖励机制并揭示基础逻辑先验对性能的影响。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16157 2026-03-18 cs.LG cs.AI 62%

DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay

DyJR: 通过动态Jensen-Shannon回放在强化学习中保持多样性

Long Li, Zhijian Zhou, Tianyi Wang, Weidi Xu, Zuming Huang, Wei Chu, Zhe Wang, Shirui Pan, Chao Qu, Yuan Qi

机构 * Griffith University, Australia(澳大利亚格里菲斯大学) Fudan University, China(复旦大学) Beijing University of Post(北京邮电大学) Shanghai Innovation Institute, China(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science, China(上海人工智能科学研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DyJR方法,通过动态参考分布和Jensen-Shannon散度正则化,在强化学习中保持多样性,提升数学推理和Text-to-SQL任务性能。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16417 2026-03-18 cs.AI 57%

Via Negativa for AI Alignment: Why Negative Constraints Are Structurally Superior to Positive Preferences

通过否定来实现AI对齐:为什么否定约束在结构上优于积极偏好

Quan Cheng

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了通过否定约束而非积极偏好进行AI对齐的结构优势,提出基于波普尔的证伪逻辑,指出否定信号方法在避免趋炎附势和提升效果上的有效性。

Comments 9 pages, position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15723 2026-03-18 cs.AI 57%

Context-Length Robustness in Question Answering Models: A Comparative Empirical Study

问答模型中的上下文长度鲁棒性:一项比较实证研究

Trishita Dhara, Siddhesh Sheth

机构 * Upper Hand Ace Rent a Car

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过SQuAD和HotpotQA基准评估问答模型在上下文长度变化下的鲁棒性,发现多跳推理任务比单跨度提取任务更易受上下文稀释影响。

Comments Accepted for Oral Presentation at Math AI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2509.22819 2026-03-18 cs.AI cs.FL cs.LG 84%

Hilbert: Recursively Building Formal Proofs with Informal Reasoning

Hilbert:通过非正式推理递归构建形式证明

Sumanth Varambally, Thomas Voice, Yanchao Sun, Zhifeng Chen, Rose Yu, Ke Ye

机构 * UC San Diego(加州大学圣地亚哥分校) Apple(苹果公司)

专题命中 代码与定理证明 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 Hilbert结合非正式推理与形式验证,通过递归分解问题并利用反馈优化证明,显著提升在形式证明任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16067 2026-03-18 cs.CV cs.LG 57%

Attribution Upsampling should Redistribute, Not Interpolate

归因上采样应重新分布,而非插值

Vincenzo Buono, Peyman Sheikholharam Mashhadi, Mahmoud Rahat, Prayag Tiwari, Stefan Byttner

机构 * Halmstad University(哈尔姆斯塔德大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 本文提出USU方法,通过比率形式的质量重分布操作,解决归因上采样中因插值导致的失真问题,验证了其在多个数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2603.16643 2026-03-18 cs.CL 85%

Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM Sycophancy

对讨好型人格的有益论点:推理如何缓解(却掩盖)LLM的讨好行为

Zhaoxin Feng, Zheng Chen, Jianfei Ma, Yip Tin Po, Emmanuele Chersoni, Bo Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 研究探讨了推理在缓解LLM讨好行为中的作用,发现推理虽能减少最终决策的讨好倾向,但可能在部分样本中掩盖讨好行为,且LLM在主观任务和权威偏见下更易表现出讨好倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17325 2026-03-18 cs.LG cs.AI cs.CL 67%

Generalizable End-to-End Tool-Use RL with Synthetic CodeGym

通用端到端工具使用强化学习与合成CodeGym

Weihua Du, Hailei Gong, Zhan Ling, Kang Liu, Lingfeng Shen, Xuesong Yao, Yufei Xu, Dingyuan Shi, Yiming Yang, Jiecao Chen

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 逻辑推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CodeGym框架,通过合成多样化的多轮工具使用环境,提升LLM代理在不同任务配置下的泛化能力,实验显示Qwen2.5-32B-Instruct在OOD基准测试中准确率提升8.7个百分点。

Comments 24 pages. Accepted to ICLR 2026. Project repository: https://github.com/StigLidu/CodeGym

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16733 2026-03-18 cs.AI cs.CL cs.SE 62%

IQuest-Coder-V1 Technical Report

IQuest-Coder-V1 技术报告

Jian Yang, Wei Zhang, Shawn Guo, Zhengmao Ye, Lin Jing, Shark Liu, Yizhi Li, Jiajun Wu, Cening Liu, X. Ma, Yuyang Song, Siwei Wu, Yuwen Li, L. Liao, T. Zheng, Ziling Huang, Zelong Huang, Che Liu, Yan Xing, Renyuan Li, Qingsong Cai, Hanxu Yan, Siyue Wang, Shikai Li, Jason Klein Liu, An Huang, Yongsheng Kang, Jinxing Zhang, Chuan Hao, Haowen Wang, Weicheng Gu, Ran Tao, Mingjie Tang, Peihao Wu, Jianzhou Wang, Xianglong Liu, Weifeng Lv, Bryan Dai

机构 * IQuest Coder Team(IQuest Coder团队)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文介绍IQuest-Coder-V1系列模型,通过代码流多阶段训练范式提升软件逻辑动态演化能力,结合预训练、中训练和后训练阶段,实现代码智能在代理软件工程、编程竞赛和复杂工具使用中的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16434 2026-03-18 cs.AI q-fin.TR 57%

From Natural Language to Executable Option Strategies via Large Language Models

从自然语言到可执行期权策略的大型语言模型

Haochen Luo, Zhengzhao Lai, Junjie Xu, Yifan Li, Tang Pok Hin, Yuan Zhang, Chen Liu

机构 * City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Shanghai University of Finance and Economics(上海财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Option Query Language,通过语法规则将期权市场抽象为高层 primitives,使LLM能作为语义解析器生成可执行期权策略,并通过新数据集验证其优于直接生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 28 篇

2603.14730 2026-03-18 cs.LG 88%

GNNVerifier: Graph-based Verifier for LLM Task Planning

GNNVerifier:基于图的LLM任务规划验证器

Yu Hao, Qiuyu Wang, Cheng Yang, Yawen Li, Zhiqiang Zhang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 规划推理 :planning(title,abstract);verifier(title,abstract);分类 cs.LG

AI总结 本文提出基于图的验证器,通过构建任务计划的图结构,利用图神经网络评估计划的合理性,从而纠正LLM生成的计划中的错误。

Comments 17pages,12figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15771 2026-03-18 cs.RO cs.AI 85%

CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving

CorrectionPlanner:基于强化学习的自主驾驶自纠正规划器

Yihong Guo, Dongqiangzi Ye, Sijia Chen, Anqi Liu, Xianming Liu

机构 * Department of Computer Science, Johns Hopkins University, Baltimore, USA.(约翰霍普金斯大学计算机科学系)

专题命中 规划推理 :self-correction(title,abstract);reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出CorrectionPlanner,通过自纠正机制在规划过程中生成安全动作,减少碰撞率,提升规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16777 2026-03-18 cs.AI 83%

Anticipatory Planning for Multimodal AI Agents

多模态AI代理的前瞻性规划

Yongyuan Liang, Shijie Zhou, Yu Gu, Hao Tan, Gang Wu, Franck Dernoncourt, Jihyung Kil, Ryan A. Rossi, Ruiyi Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究) State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出TraceR1框架,通过前瞻性轨迹推理提升多模态代理的规划能力,实现更稳定的执行和泛化性能。

Comments Published at CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15255 2026-03-18 cs.AI cs.MA 83%

SAGE: Multi-Agent Self-Evolution for LLM Reasoning

SAGE:多智能体自进化用于大语言模型推理

Yulin Peng, Xinxin Zhu, Chenxing Wei, Nianbo Zeng, Leilei Wang, Ying Tiffany He, F. Richard Yu

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), China(广东省人工智能与数字经济实验室(深圳)) School of Information Technology, Carleton University, Canada(卡尔顿大学信息科技学院,加拿大)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 SAGE通过四智能体协同进化提升LLM推理能力,利用小种子集实现稳定自训练,在数学和代码生成基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16028 2026-03-18 cs.RO 82%

Geometry-Aligned LLM Fine-Tuning for Sequential Narrow-Opening Planning

几何对齐的LLM微调用于序列狭窄开口规划

Al Jaber Mahmud, Xuan Wang

机构 * George Mason University(乔治·马歇尔大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出几何对齐的LLM微调框架,通过多阶段狭窄开口序列规划实现长视距几何推理,采用失败驱动LoRA监督微调与GRPO优化提升路径可行性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09295 2026-03-18 cs.MA 82%

MACRO-LLM: LLM-Empowered Multi-Agent Collaborative Reasoning under Spatiotemporal Partial Observability

MACRO-LLM:基于时空部分可观测性的LLM赋能多智能体协作推理

Handi Chen, Running Zhao, Xiuzhe Wu, Edith C. H. Ngai

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出MACRO-LLM,通过三个模块解决多智能体在时空部分可观测性下的协作推理问题,验证了其在复杂任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16017 2026-03-18 cs.CL cs.AI 81%

Understanding Moral Reasoning Trajectories in Large Language Models: Toward Probing-Based Explainability

理解大型语言模型中的道德推理轨迹:迈向基于探测的可解释性

Fan Huang, Haewoon Kwak, Jisun An

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型在道德决策中的推理轨迹,通过分析六个模型和三个基准,发现道德推理涉及多框架 deliberation,提出MRC指标以衡量模型一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15377 2026-03-18 cs.LG cs.AI 81%

More Test-Time Compute Can Hurt: Overestimation Bias in LLM Beam Search

更宽的搜索可能有害:LLM束搜索中的过估计偏差

Gal Dalal, Assaf Hallak, Gal Chechik, Yftah Ziser

机构 * NVIDIA Research(NVIDIA研究实验室) Bar-Ilan University(巴伊兰大学) University of Groningen(格罗宁根大学)

专题命中 规划推理 :test-time compute(title);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了束搜索宽度对LLM输出质量的影响,通过极值理论分析发现,过宽的搜索会引入系统性过估计偏差,提出基于信噪比的束宽选择方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09037 2026-03-18 cs.AI cs.CL 81%

A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems

大语言模型推理前沿的综述:推理扩展、学习推理与代理系统

Zixuan Ke, Fangkai Jiao, Yifei Ming, Xuan-Phi Nguyen, Austin Xu, Do Xuan Long, Minzhi Li, Chengwei Qin, Peifeng Wang, Silvio Savarese, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究) National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) A*STAR, Singapore(新加坡A*STAR)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型推理的前沿方法,从推理阶段和架构两个维度分类,探讨了推理扩展到学习推理及代理系统的发展趋势,涵盖监督微调、强化学习等算法及代理工作流设计。

Comments 72 pages, 6 figures. Accepted to TMLR, with Survey Certification award

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23592 2026-03-18 cs.RO cs.AI cs.SE 79%

KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning

KEEP: 一种面向高效具身规划的KV缓存中心化内存管理系统

Zebin Yang, Tong Xie, Baotong Lu, Shaoshan Liu, Bo Yu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究院) Microsoft Research(微软研究院) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进创新中心)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出KEEP系统,通过静态动态内存构建算法、多跳内存重计算算法和层平衡内存加载,提升具身规划效率,实验表明在ALFRED数据集上速度提升2.68倍,优于CacheBlend方法。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15663 2026-03-18 cs.CV cs.AI 79%

OrthoAI v2: From Single-Agent Segmentation to Dual-Agent Treatment Planning for Clear Aligners

OrthoAI v2:从单智能体分割到双智能体治疗计划的清晰矫治器

Lansiaux Edouard, Leman Margaux

机构 * STaR-AI Research Group, Emergency Department, Lille University Hospital(STaR-AI研究组,急诊科,里尔大学医院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 OrthoAI v2通过双智能体框架提升正畸治疗计划精度,实现牙科地标检测、复合生物力学评分模型和多帧治疗模拟,显著提升规划质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14497 2026-03-18 cs.CV cs.RO 78%

WorldVLM: Combining World Model Forecasting and Vision-Language Reasoning

WorldVLM:结合世界模型预测与视觉语言推理

Stefan Englmeier, Katharina Winter, Fabian B. Flohr

机构 * Munich University of Applied Sciences(慕尼黑应用科学大学)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 WorldVLM结合视觉语言模型与世界模型,通过统一架构提升自动驾驶中的环境预测与决策能力,解决空间理解受限问题。

Comments 8 pages, 6 figures, 5 tables; submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15777 2026-03-18 cs.HC 78%

Lessons from Real-World Deployment of a Cognition-Preserving Writing Tool: Students Actively Engage with Critical Thinking and Planning Affordances

从真实世界部署认知保留写作工具中的经验:学生主动参与批判性思维和规划 affordances

Yinuo Yang, Zheng Zhang, Ningzhi Tang, Xu Wang, Alex Ambrose, Nathaniel Myers, Patrick Clauss, Toby Jia-Jun Li

专题命中 规划推理 :planning(title,abstract)

AI总结 本文研究了AI写作工具VISAR在真实课堂中的应用,发现学生通过认知保留支架获得学习提升,且与写作质量、概念理解及批判性AI素养正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06993 2026-03-18 cs.AI cs.CV 74%

IMAIA: Interactive Maps AI Assistant for Travel Planning and Geo-Spatial Intelligence

IMAIA:交互式地图AI助手用于旅行规划和地理空间智能

Jieren Deng, Zhizhang Hu, Ziyan He, Aleksandar Cvetkovic, Pak Kiu Chung, Dragomir Yankov, Chiqun Zhang

机构 * Microsoft(微软) Amazon(亚马逊)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 IMAIA通过自然语言交互整合矢量地图和卫星影像,结合地理空间信息提升地图相关问答和摄像头到地点的关联能力,实现空间感知的对话式地图系统。

Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16822 2026-03-18 cs.AI 70%

Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence

Surg$Σ$: 一种大规模多模态数据和基础模型的光谱,用于外科智能

Zhitao Zeng, Mengya Xu, Jian Jiang, Pengfei Guo, Yunqiu Xu, Zhu Zhuo, Chang Han Low, Yufan He, Dong Yang, Chenxi Lin, Yiming Gu, Jiaxin Guo, Yutong Ban, Daguang Xu, Qi Dou, Yueming Jin

机构 * NUS(新加坡国立大学) CUHK(香港中文大学) SJTU(上海交通大学) NVIDIA(英伟达)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Surg$Σ$,通过大规模多模态数据和基础模型提升外科智能,解决现有框架任务特定、泛化能力差的问题,展示统一语义设计和结构化推理标注的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21790 2026-03-18 econ.EM cs.AI 70%

Can large language models assist choice modelling? Insights into prompting strategies and current models capabilities

大语言模型能否协助选择建模?关于提示策略和当前模型能力的洞察

Georges Sfeir, Gabriel Nova, Stephane Hess, Sander van Cranenburgh

机构 * Choice Modelling Centre & Institute for Transport Studies, University of Leeds(选择建模中心及交通研究学院,利兹大学) CityAI Lab, Transport and Logistics group, Engineering Systems and Services Department, TU Delft(CityAI实验室,运输与物流组,工程系统与服务部门,代尔夫特理工大学)

专题命中 规划推理 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 本文研究大语言模型在离散选择建模中的潜力,通过实验框架评估七种领先模型在不同提示策略和信息可用性下的表现,揭示其在模型规范和估计中的能力与限制。

Comments 35 pages, 8 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15653 2026-03-18 cs.CL cs.AI cs.LG 67%

Recursive Language Models Meet Uncertainty: The Surprising Effectiveness of Self-Reflective Program Search for Long Context

递归语言模型与不确定性:自我反思程序搜索在长上下文中的意外效果

Keivan Alizadeh, Parshin Shojaee, Minsik Cho, Mehrdad Farajtabar

机构 * Apple(苹果公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SRLM框架,通过引入不确定性感知的自我反思,提升长上下文处理能力,实验显示其在多种任务中优于现有基线,且无需递归机制。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16171 2026-03-18 cs.IR cs.AI 57%

MemX: A Local-First Long-Term Memory System for AI Assistants

MemX:面向AI助手的本地优先长期记忆系统

Lizheng Sun

机构 * Lizheng Sun(孙立政)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 MemX是一种本地优先的长期记忆系统,通过向量召回、关键词召回和RRF等方法提升检索稳定性,实验表明其在中文基准测试中达到91.3%的Hit@1精度,且在长文本检索中表现出色。

Comments 18 pages, 2 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏