arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-19 至 2026-05-19 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 28 篇

2605.07501 2026-05-19 cs.LG cs.CL 88%

ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression

ExpThink:基于经验的强化学习用于自适应思路链压缩

Tingcheng Bian, Yuzhe Zhang, Jing Jin, Jinchang Luo, MingQuan Cheng, Haiwei Wang, Wenyuan Jiang, Miaohui Wang

机构 * Baidu Inc.(百度公司) Shenzhen University(深圳大学) Peking University(北京大学) Tsinghua University(清华大学) D-INFK, ETH Zürich(ETH Zürich 计算机科学与技术研究所)

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ExpThink框架,通过经验引导奖励塑造和难度自适应优势机制,实现思路链压缩的准确优先、压缩次之的训练目标,实验表明其在多个数学推理基准上显著提升压缩效率和准确性。

Comments 39 pages, 18 figures. Code and model checkpoints will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16938 2026-05-19 cs.CL cs.AI q-bio.NC 84%

Effort as Ceiling, Not Dial: Reasoning Budget Does Not Modulate Cognitive Cost Alignment Between Humans and Large Reasoning Models

努力作为上限,而非调节器:推理预算不影响人类与大推理模型之间的认知成本对齐

Yueqing Hu, Tianhong Wang

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) School of Philosophy, Anhui University(安徽大学哲学系)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究探讨了推理预算是否影响人类与大推理模型之间的认知成本对齐,发现无论推理努力如何变化,对齐情况保持不变,表明这种对齐是在训练时形成的,而非在推理时动态调整。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01705 2026-05-19 cs.LG cs.AI 84%

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

LaDi-RL:潜在扩散推理防止强化学习中的熵崩溃

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin

机构 * UC San Diego(斯克利普斯海洋研究所) Apple(苹果公司)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LaDi-RL方法,通过潜在扩散模型生成潜在推理轨迹,解决强化学习中熵崩溃问题,提升代码生成和数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17291 2026-05-19 cs.LG 83%

Step-wise Rubric Rewards for LLM Reasoning

分步评分奖励用于大语言模型推理

Weichu Xie, Haozhe Zhao, Wenpu Liu, Yongfu Zhu, Liang Chen, Minghao Ye, Zirong Chen, Yuqi Xu, Shuai Dong, Ziyue Wang, Xinbo Xu, Kean Shi, Ruoyu Wu, Xiaoying Zhang, Wenqi Shao, Baobao Chang, Nan Duan, Jiaqi Wang

机构 * Peking University(北京大学) JD Explore Academy(京东探索学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.LG

AI总结 本文提出一种分步评分奖励方法,通过引入LLM判官对每个评分项进行归因,规范化每步评分,并结合优势估计器提高推理准确性和减少自我纠正循环。

Comments Code available at https://github.com/akarinmoe/SRaR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08354 2026-05-19 cs.AI 83%

Does Your Reasoning Model Implicitly Know When to Stop Thinking?

你的推理模型是否在隐式地知道何时停止思考?

Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuanda Wang, Zhixia Zhang, Hongyan Xie, Songshi Liang, Zehao Chen, Xuefeng Xiao, Fuzhen Zhuang, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北京航空航天大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了大推理模型在复杂推理任务中停止思考的隐式能力,提出SAGE方法提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15851 2026-05-19 cs.LG cs.AI cs.CR 81%

DPrivBench: Benchmarking LLMs' Reasoning for Differential Privacy

DPrivBench:评估大语言模型在差分隐私推理中的基准测试

Erchi Wang, Pengrun Huang, Eli Chien, Om Thakkar, Kamalika Chaudhuri, Yu-Xiang Wang, Ruihan Wu

机构 * Halıcıoğlu Data Science Institute, UC San Diego(哈里奇奥格卢数据科学研究所,加州大学圣地亚哥分校) Department of Computer Science and Engineering, UC San Diego(计算机科学与工程系,加州大学圣地亚哥分校) Department of Electrical Engineering, National Taiwan University(电气工程系,国立台湾大学) OpenAI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DPrivBench基准测试,用于评估大语言模型在差分隐私推理中的能力,发现当前模型在高级算法推理上存在显著差距,并为改进自动化差分隐私推理提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10528 2026-05-19 cs.CL cs.LG 81%

Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting

Merlin's Whisper:通过黑盒说服提示增强大语言模型的高效推理

Heming Xia, Cunxiao Du, Rui Li, Chak Tou Leong, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Sea AI Lab(Sea AI实验室) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Whisper框架,通过黑盒说服提示减少大语言模型(LRM)的推理过程中的token使用量,同时保持性能,展示了在多个基准测试中显著的token减少效果。

Comments ACL 2026 (Long Paper), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19078 2026-05-19 cs.CL cs.AI 81%

GraphMind: Theorem Selection and Conclusion Generation Framework with Dynamic GNN for LLM Reasoning

GraphMind: 一种基于动态GNN的定理选择与结论生成框架用于LLM推理

Yutong Li, Yitian Zhou, Xudong Wang, GuoChen, Caiyan Qin

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 GraphMind通过动态图神经网络与LLM结合,实现多步推理中的定理选择和结论生成,提升上下文感知的推理能力。

Comments This paper has been withdrawn by the authors in order to prepare a substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01683 2026-05-19 cs.CL cs.AI 81%

Surgical Post-Training: Proximal On-Policy Distillation for Reasoning with Knowledge Retention

手术式后训练:用于知识保留的近端策略蒸馏

Wenye Lin, Kai Han

机构 * The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SPOT框架,通过近端策略蒸馏在后训练中保留知识,提升推理性能,实验表明其在少量数据下显著提升模型准确率。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18500 2026-05-19 cs.CL 79%

Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning

隐式层次GRPO:将工具调用与执行解耦以实现工具集成的数学推理

Li Wang, Xiaohan Wang, Xiaodong Lu, Zipeng Zhang, Jinyang Wu, Jiajun Chai, Wei Lin, Guojun Yin

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出了一种将工具调用与执行解耦的方法,通过引入延迟执行和显式控制来增强工具集成推理能力,并提出了一个分层控制框架和理论推导出的替代损失函数,从而得到隐式分层策略,最终提出IH-GRPO算法,在六个跨领域数学推理基准测试中,Qwen3-1.7B、Qwen3-4B和Qwen3-8B在最强基线方法上分别实现了1.87%、2.16%和2.53%的绝对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17958 2026-05-19 cs.LG cs.PL 79%

Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning

通过基于一致性的强化学习增强大语言模型的代码推理能力

Zhanyue Qin, Jia Feng, Yibo Lyu, Yun Peng, Dianbo Sui, Cuiyun Gao, Qing Liao

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CodeThinker框架,通过一致性驱动的强化学习方法提升大语言模型的代码推理能力,实验表明其在多个基准测试中表现优异,显著提升了代码生成和数学推理任务的准确性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16727 2026-05-19 cs.AI 79%

PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play

PopuLoRA: 为推理自博弈的协同进化LLM种群

Roger Creus Castanyer, Geoffrey Bradway, Lorenz Wolf, Maxwill Lin, Augustine N. Mavor-Parker, Matthew James Sargent

机构 * Absolute Zero Reasoner(绝对零理由器) LoRA adapters(LoRA适配器)

专题命中 数学推理 :reasoning(title);verifier(abstract);分类 cs.AI

AI总结 本文提出PopuLoRA,一种基于种群的非对称自博弈框架,用于强化学习中可验证奖励(RLVR)的后训练LLM。通过专门的LoRA适配器在共享冻结基座上进行教师和学生分工,教师提出问题,学生在程序验证器下解决,不同亚种群间的交叉评估取代了限制单智能体自博弈的自我校准。LoRA权重空间进化算子家族作为7B规模种群训练循环的替代步骤,实现了种群的协同进化竞赛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17831 2026-05-19 cs.AI 79%

The Token Games: Evaluating Language Model Reasoning with Puzzle Duels

令牌游戏:通过谜题对决评估语言模型推理能力

Simon Henniger, Gabriel Poesia

机构 * Harvard University(哈佛大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文设计了令牌游戏(TTG)评估框架,通过模型自创谜题进行对决,利用Elo评分比较模型能力,验证了10个前沿模型的推理能力,且无需人工参与谜题创作。

Comments Project website: https://token-games.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16826 2026-05-19 cs.LG cs.AI cs.CL 75%

Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation

解耦KL与轨迹:为LLM蒸馏中的SFT、DAgger、离线RL和OPD提供统一视角

Anhao Zhao, Haoran Xin, Yingqi Fan, Junlong Tong, Wenjie Li, Xiaoyu Shen

机构 * Eastern Institute of Technology(东技术院) The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能 thrust,香港科学与技术大学(广州))

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了知识蒸馏中KL散度与轨迹之间的耦合问题,通过解耦两个轴向,提出了四种有效的蒸馏目标,并通过实验揭示了KL方向、前缀源和训练长度之间的权衡关系,提出了KL混合和熵门长度课程等实用方法。

Comments Code available at https://github.com/EIT-NLP/Decoupled-Distill

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16342 2026-05-19 cs.LG cs.AI cs.CL 75%

DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

DACA-GRPO:去噪感知的信用分配用于扩散语言模型中的强化学习

Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Lokesh Boominathan, Manuel R. Ciosici, Yizhe Zhang, Irina Belousova

机构 * The Ohio State University(俄亥俄州立大学) Apple(苹果公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DACA-GRPO,通过引入去噪进度评分和分层掩码似然,改进扩散语言模型中强化学习的信用分配,提升数学推理、代码生成等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16675 2026-05-19 cs.AI 74%

LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning

LinAlg-Bench:一个 forensic 验证基准,揭示 LLM 数学推理中的结构失效模式

Shradha Agarwal, Deepak Rajbhar, Tariq J

机构 * Department of Nuclear Engineering and Computer Science(核工程与计算机科学系)

专题命中 数学推理 :reasoning(title);分类 cs.AI

AI总结 LinAlg-Bench 评估 10 个前沿大语言模型在结构线性代数计算中的表现,揭示 LLM 数学失败并非随机,而是受算法类型和矩阵维度约束。研究发现 4x4 尺寸存在行为阈值,低于该尺寸模型通过执行错误失败,高于则转向计算放弃,通过工具角色扮演等制造响应。

Comments 42 pages, 3 figures, 12 tables. NeurIPS 2026 Evaluations and Datasets Track submission. Dataset: https://huggingface.co/datasets/LinAlgBench/linalg-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17570 2026-05-19 cs.LG cs.CL 73%

How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning

GRPO在离线策略下的可能性:Mu-GRPO用于高效的大语言模型强化学习

Minghao Tian, Yunfei Xie, Chen Wei

机构 * Rice University(里士大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了GRPO在离线策略下的可行性,提出Mu-GRPO方法,通过减少rollout-optimization切换开销,实现高效的LLM强化学习,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13870 2026-05-19 cs.CL cs.AI 73%

Unlocking the Potential of Diffusion Language Models through Template Infilling

通过模板填充解锁扩散语言模型的潜力

Junhoo Lee, Seungyeon Kim, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种针对扩散语言模型的模板填充方法,通过在生成响应空间中建立全局蓝图,提升了数学推理、代码生成和旅行规划等任务的性能,同时在多token生成中实现了生成质量与速度的平衡。

Comments ACL 2026 Main Conference - Long Paper, Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17734 2026-05-19 cs.AI 70%

Harnessing LLM Agents with Skill Programs

通过技能程序 harnessing LLM agents

Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao

机构 * New York University(纽约大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 本文提出 HASP 框架,通过将技能转化为可执行程序函数(PFs)来提升 LLM agent 在复杂任务中的表现,其核心方法是通过 PFs 在失败状态时介入并修正行动,主要贡献是通过模块化设计实现推理、训练和自改进的多场景应用。

Comments 40 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13846 2026-05-19 cs.CL cs.AI cs.LG 67%

LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation

LightTransfer: 你的长上下文LLM实际上是一个具有轻松适应能力的混合模型

Xuan Zhang, Fengzhuo Zhang, Cunxiao Du, Chao Du, Tianyu Pang, Wei Gao, Min Lin

机构 * Singapore Management University(新加坡国立大学) National University of Singapore(新加坡国立大学) Sea AI Lab, Singapore(新加坡海智实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LightTransfer方法,通过将LLaMA等模型转换为混合架构,实现更高效的生成,实验表明在长上下文理解任务中,即使有半数层被识别为懒层,也能在性能损失小于1.5%的情况下提升2.17倍的吞吐量,并在数学基准AIME24上达到53.3%的分数。

Comments Accepted by TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17037 2026-05-19 cs.LG cs.AI cs.CL 67%

D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning

D$^2$Evo: 双重难度感知的自进化方法用于数据高效的强化学习

Ru Zhang, Renda Li, Ziyu Ma, Weijie Qiu, Chongyang Tao, Yong Wang, Xiangxiang Chu

机构 * Zhejiang University(浙江大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出D$^2$Evo方法,通过双重难度感知的自进化机制,解决强化学习中有效数据稀缺和动态难度变化的问题,从而在数学推理基准上以少于2K真实数学样本实现优于现有方法的性能。

Comments Accepted by ICML 2026. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14292 2026-05-19 cs.LG cs.CL 62%

Minimal-Intervention KV Retention via Set-Conditioned Diversity

通过集合条件多样性实现最小干预的KV保留

Libo Sun, Po-wei Harn, Peixiong He, Xiao Qin

机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系) Department of Information Management(信息管理系) Auburn University(阿伯丁大学) National Central University(国立中央大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究通过改进TriAttention保留评分器,在有限预算下提升KV缓存压缩效果,采用V空间冗余惩罚机制,验证了最小修改优于结构性重设计。

Comments 15 pages, 3 figures, 3 tables. Code and data: https://github.com/libophd/minimal-kv-retention

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19590 2026-05-19 cs.LG cs.CL 62%

Learning to Reason without External Rewards

无需外部奖励的学习推理

Xuandong Zhao, Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Intuitor方法,通过内在反馈实现无需外部奖励的自主学习,实验表明其在数学基准和代码生成等任务中表现优异,为无监督学习提供了新途径。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16470 2026-05-19 cs.LG cs.AI 62%

Strategic Over-Parameterization for Generalizable Low-Rank Adaptation

战略性过参数化以实现通用的低秩适应

Jing Gao, Zhong-Yi Lu, Pan Zhang, Ze-Feng Gao

机构 * School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS, Hangzhou 310024, China(1 基础物理与数学科学学院,杭州先进研究院,UCAS,杭州 310024,中国) School of Physical Sciences, University of Chinese Academy of Sciences, No. 19A Yuquan Road, Beijing 100049, China(2 物理科学学院,中国科学院大学,玉泉路19A号,北京 100049,中国) CAS Key Laboratory of Theoretical Physics, Institute of Theoretical Physics, Chinese Academy of Sciences, Beijing 100190, China(3 中国科学院理论物理重点实验室,理论物理研究所,中国科学院,北京 100190,中国) School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China, Beijing 100872, China(4 物理学院和量子态构造与操控(教育部)重点实验室,中国人民大学,北京 100872,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LoRA-Over框架,通过训练时丰富优化景观并推理时压缩,提升低秩适应的泛化能力,实验显示其在多个任务上优于传统LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19470 2026-05-19 cs.LG cs.AI 62%

Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL

自适应分层扰动:统一LLM RL中的非策略修正

Chenlu Ye, Xuanchang Zhang, Yifan Hao, Zhou Yu, Ziji Zhang, Abhinav Gullapalli, Hao Chen, Jing Huang, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应分层扰动(ALP),通过在更新过程中向每一层的输入隐藏状态注入可控噪声,缓解策略退化和训练-推理不匹配问题,提升训练稳定性与探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13181 2026-05-19 cs.CL 57%

AdaSwitch: Adaptive Switching between Small and Large Agents for Effective Cloud-Local Collaborative Learning

AdaSwitch: 一种在小型和大型代理之间自适应切换以实现有效的云-本地协作学习方法

Hao Sun, Jiayi Wu, Hengyi Cai, Xiaochi Wei, Yue Feng, Bo Wang, Shuaiqiang Wang, Yan Zhang, Dawei Yin

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(一般人工智能国家重点实验室,北京大学,北京,中国) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) East China Normal University(东华大学) Chinese Academy of Sciences(中国科学院) Baidu Inc(百度公司) Beijing Institute of Technology(北京理工大学) University of Birmingham(伯明翰大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种新的LLM使用范式,通过自适应机制在云端和本地部署的LLM之间切换,以提高任务完成性能和效率,通过本地代理处理简单推理步骤,云代理处理复杂推理步骤,实验表明该方法在多个基准测试中有效提升了本地代理的性能。

Comments EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06017 2026-05-19 cs.LG math.PR 57%

Matrix-Decoupled Concentration for Autoregressive Sequences: Dimension-Free Guarantees for Sparse Long-Context Rewards

自回归序列的矩阵解耦浓度:稀疏长上下文奖励的维度无关保证

Pei-Sen Li

机构 * School of Mathematics and Statistics, Beijing Institute of Technology, Beijing 100872, China(北京理工大学数学系,北京理工大学,北京100872,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出矩阵解耦浓度框架,通过严格因果依赖解析和目标敏感性向量的精确矩阵-向量乘法,解决自回归模型中依赖结构与目标敏感性分离的问题,提供维度无关的方差代理和长上下文推理的稳定性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16410 2026-05-19 cs.CV 50%

Test-Time Hinting for Black-Box Vision-Language Models

测试时提示法用于黑盒视觉-语言模型

Kaihua Hou, Abhijith Varma Mudunuri, Jiaxing Qiu, Roxana Daneshjou, Thomas Hartvigsen, Ahmed Alaa

机构 * AlaaLab(Alaa实验室)

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出测试时提示法,通过单次VLM调用提升性能,无需开放权重模型访问,适用于前沿闭源模型。方法通过轻量提示生成器预测提示,引导VLM避开常见错误模式,提升自然图像VQA基准的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏