arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-28 至 2026-05-28 共收录 525 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 29 篇

2602.01203 2026-05-28 cs.CL cs.LG 73%

Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse

注意力汇聚在注意力层中锻造原生MoE:针对头部坍塌的汇聚感知训练

Zizhuo Fu, Wenxuan Zeng, Runsheng Wang, Meng Li

机构 * Institute for Artificial Intelligence, Peking University, Beijing(人工智能研究院,北京大学,北京) School of Integrated Circuits, Peking University, Beijing(集成电路学院,北京大学,北京)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过理论和实证证明注意力汇聚自然构建了注意力层内的混合专家机制,并提出汇聚感知训练算法以缓解头部坍塌问题,提升模型性能。

Comments 2026 International Conference on Machine Learning (ICML)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28769 2026-05-28 cs.LG 70%

Multi-Mixer Models: Flexible Sequence Modeling with Shared Representations

多混合器模型:基于共享表示的灵活序列建模

Kevin Y. Li, Asher Trockman, Ananda Theertha Suresh, Ziteng Sun

机构 * Carnegie Mellon University(卡内基梅隆大学) Google Research(谷歌研究)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Oryx混合模型,通过序列轴上的灵活切换(注意力与线性递归)实现高效长上下文处理,在1.4B规模下平均语言建模任务提升0.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28640 2026-05-28 cs.LG 70%

Augmenting Attention with Exponentially Decaying Memory Improves Query-Aware KV Sparsity

用指数衰减记忆增强注意力提升查询感知的KV稀疏性

Xiuying Wei, Caglar Gulcehre

机构 * EPFL(苏黎世联邦理工学院) CLAIRE(人工智能实验室)

专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文通过引入指数衰减记忆模块增强注意力机制,在稀疏注意力推理中显著提升查询感知方法的准确性,并在多个任务上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28424 2026-05-28 cs.CL 70%

Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning

Skill0.5:面向智能体强化学习中分布外泛化的联合技能内化与利用

Jiapeng Zhu, Jianxiang Yu, Yibo Zhao, Chengcheng Han, Qi Gu, Xunliang Cai, Xiang Li, Weining Qian

机构 * East China Normal University(华东师范大学) Meituan Longcat Team(美团Longcat团队)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Skill0.5框架,通过区分通用技能内化与任务特定技能利用,结合动态难度感知路由器,在ALFWorld和WebShop上提升了分布内和分布外场景的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27760 2026-05-28 cs.AI 70%

SkillGrad: Optimizing Agent Skills Like Gradient Descent

SkillGrad: 像梯度下降一样优化智能体技能

Hanyu Wang, Yifan Lan, Bochuan Cao, Lu Lin, Jinghui Chen

机构 * College of Information Sciences and Technology(信息科学与技术学院) The Pennsylvania State University(宾夕法尼亚州立大学) University Park, PA, USA

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出SkillGrad框架,将技能包视为结构化参数,通过轨迹级损失、文本梯度诊断和动量记忆覆盖进行类梯度下降优化,在表格问答任务上平均提升6.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27531 2026-05-28 cs.PL cs.CL cs.SE 70%

Agentic Separation Logic Specification Synthesis

智能体分离逻辑规范合成

Tarun Suresh, David Korczynski, Julien Vanegue

机构 * Bloomberg(贝莱德)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出 Spec-Agent 智能体系统,通过静态分析、运行时堆追踪和反例引导迭代,为大型 C++ 代码库合成分离逻辑规范,在百万行级代码上达到 85% 有效规范合成率且无假阳性。

Comments 9 pages, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26182 2026-05-28 cs.CL 70%

ClinicalAgents: Multi-Agent Orchestration for Clinical Decision Making with Dual-Memory

ClinicalAgents:具有双记忆的临床决策多智能体编排

Zhuohan Ge, Haoyang Li, Yubo Wang, Nicole Hu, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ClinicalAgents多智能体框架,通过蒙特卡洛树搜索动态编排和双记忆架构模拟临床推理,显著提升诊断准确性和可解释性。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28544 2026-05-28 cs.CV 67%

DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving

DriveWAM: 视频生成先验实现自动驾驶的可扩展世界-动作建模

Chen Shi, Jinrui Xu, Shaoshuai Shi, Kehua Sheng, Bo Zhang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 长上下文与记忆 :language model(abstract);foundation model(abstract)

AI总结 提出DriveWAM,通过将预训练视频扩散Transformer适配为自回归视频-动作策略,并引入场景演化驾驶引导和选择性KV记忆,实现可扩展的世界-动作建模,在NAVSIM和PhysicalAI基准上取得强规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27105 2026-05-28 cs.IR 67%

Lost in the Evidence? Reproducing Document Position and Context Size Effects in RAG

迷失在证据中?重现RAG中的文档位置和上下文大小效应

Jorge Gabín, Anxo Perez, Javier Parapar

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)

AI总结 本文通过系统可重复性研究,分析了检索增强生成中文档排序和上下文大小的影响,提出了主题采样校准方法,并揭示了理想设置与现实RAG管道之间的差异。

Comments Accepted at SIGIR 2026: 49th International ACM SIGIR Conference on Research and Development in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28079 2026-05-28 cs.CL 57%

ATLAS: All-round Testing of Long-context Abilities across Scales

ATLAS: 跨尺度的长上下文能力全面测试

Deli Huang, Cunguang Wang, Hongyin Tang, Zhe Tang, Linsen Guo, Dongyu Ru, Ruoshi Yuan, Ziyue Zhu, Xiaoyu Li, Ziwen Wang, Chen Zhang, Anchun Gui, Wen Zan, Jiaqi Zhang, Xuezhi Cao, Jingang Wang, Xunliang Cai, Yixin Cao

机构 * Meituan(美团) Fudan University(复旦大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 提出ATLAS基准框架,通过分层分类、长度感知AUC评分和ATLAScore聚合指标,系统评估长上下文语言模型在不同长度和任务上的性能退化与能力分布。

Comments 29 pages, 13 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16284 2026-05-28 cs.LG 57%

Fast KV Compaction via Attention Matching

通过注意力匹配实现快速KV压缩

Adam Zweiger, Xinghong Fu, Han Guo, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 提出通过注意力匹配在潜在空间快速压缩键值缓存的方法,以保持注意力输出并实现高达50倍压缩且质量损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 92 篇

2605.28008 2026-05-28 cs.AI cs.LG 94%

Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training

压缩思维:压缩推理数据在LLM后训练中何时以及如何发挥作用

Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 推理与问题求解 :LLM(title,title_cn);SFT(summary_cn,abstract);post-training(title,abstract);large language model(abstract)

AI总结 本文通过分类显式、组合和隐式思维链,在合成组合推理任务上实验,发现粗粒度CoT需要更多SFT数据,组合和隐式CoT从数据缩放中获益更多但隐式CoT易导致记忆,后续RLVR会分解压缩步骤,且单向CoT顺序在长序列任务上泛化更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28666 2026-05-28 cs.AI 92%

An LLM-Based Assistance System for Intuitive and Flexible Capability-Based Planning

基于LLM的直观灵活能力规划辅助系统

Luis Miguel Vieira da Silva, Nicolas König, Felix Gehlhoff

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种混合辅助系统,将基于能力的形式化SMT规划与LLM自然语言交互层结合,通过人机协同实现规划解释与知识模型自适应,提升工业自动化中能力规划的可访问性和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28699 2026-05-28 cs.AI 91%

TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM Reasoning

TRACER: 基于内部强化信用与轮次级遗憾匹配的多LLM协作推理

Chusen Li, Zhou Liu, Shuigeng Zhou, Wentao Zhang

机构 * Fudan University(复旦大学) Zhongguancun Academy(中关村学院) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学先进交叉学科研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出TRACER框架,通过控制器-遗憾层和生成-信用层分别学习发言时机与内容,解决多智能体强化学习中的稀疏奖励、搭便车和固定协议振荡问题,实现数学收敛的协作推理。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28465 2026-05-28 cs.CL 91%

Beyond One Path: Evaluating and Enhancing Divergent Thinking in Interactive LLM Agents

超越单一路径:评估与增强交互式LLM代理的发散性思维

Jihyeong Park, Ingeol Baek, Jeonghyun Park, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出交互式基准MUTATE和策略ReDNA,用于评估和增强LLM代理在路径和动作层面的发散性思维,解决现有框架中即时收敛压力导致的动作固定问题。

Comments 28 pages, 16 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27251 2026-05-28 cs.CL cs.AI 91%

Compliance versus Sensibility: On the Reasoning Controllability in Large Language Models

服从与感知:大型语言模型中的推理可控性研究

Xingwei Tan, Marco Valentino, Mahmud Elahi Akhter, Yuxiang Zhou, Maria Liakata, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) School of EECS, Queen Mary University of London(伦敦女王学院电子工程与计算机科学学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过推理冲突视角,系统研究大型语言模型在诱导逻辑模式与任务预期模式冲突时,是否优先服从指令还是遵循感知合理性,并探索内部检测与激活级干预方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27596 2026-05-28 cs.CL 90%

Can Hallucinations Be Useful? Solving Multi-Hop Questions With SLMs By Chaining System-I/II Reasoning

幻觉能否有用?通过链式系统I/II推理用SLM解决多跳问题

Saptarshi Sengupta, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :SLM(title_cn,summary_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种“先回答后推理”的认知启发框架,利用SLM的初始答案(可能包含幻觉)作为假设来检索证据,再通过系统II深度推理,从而在多跳问答任务上超越传统的“先思考后检索”方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09638 2026-05-28 cs.CY 90%

A Methodological Guide on Using Large Language Models for Reproducible Text Annotation in the Social Sciences and Humanities with Python and R

使用大型语言模型进行社会科学和人文学科可重复文本注释的方法论指南:基于Python和R

Qixiang Fang, Javier Garcia Bernardo, Erik-Jan van Kesteren

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提供了一步一步的方法论指南,指导社会科学和人文学科研究者使用大型语言模型进行文本注释,包括设置项目、编程交互、提示设计、统计整合和可重复性管理,并附有Python和R代码示例。

Comments Accompanying Python and R notebooks are available at https://github.com/sodascience/workshop_llm_data_collection or https://zenodo.org/records/20073016

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28006 2026-05-28 cs.CL cs.AI 90%

Integrated and Cross-Architecture Interpretation of LLM Reasoning

LLM推理的集成与跨架构解释

Leonardo Matthew Yauw, Wei-Bin Kou, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出集成跨架构推理(IAR)框架,通过带宽校准的MIP与Tukey IQR峰值检测、重叠分析及Jaccard稳定性度量,统一解释LLM推理模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27765 2026-05-28 cs.LG cs.AI 90%

Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning

恢复甜蜜点:用于LLM推理的通过率加权自蒸馏

Zehao Liu, Yuanpu Cao, Jinghui Chen, Vasant G. Honavar

机构 * College of Information Sciences and Technology(信息科学与技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SC-SDPO方法,通过问题通过率加权自蒸馏损失,动态调整训练难度,提升LLM推理性能。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27559 2026-05-28 cs.MA cs.AI cs.LG 90%

Detection Without Correction: A Two-Parameter Decomposition of Multi-Stage LLM Pipelines

无需修正的检测:多阶段LLM流水线的双参数分解

Prashanti Nilayam, Kiran Ramanna, Prashil Tumbade

机构 * Servicenow CA, USA(Servicenow加州美国)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出检测-条件生成双参数分解框架,揭示多阶段LLM流水线中条件误修正率主导(53-94%)而检测率变化超一个数量级,统一解释准确性平台、逆转等四种现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28490 2026-05-28 cs.CV cs.AI 90%

SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs

SSR3D-LLM: 通过潜在步骤实现结构化空间推理以实现统一3D-LLM中的细粒度定位

Jiawei Li, Ziyi Liu, Weijie Shi, Long Chen, Jiajie Xu, Xiaofang Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Soochow University(苏州大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 针对统一3D-LLM中细粒度查询的脆弱性,提出SSR3D-LLM,通过潜在空间推理步骤和几何感知评分器逐步精炼候选排名,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28144 2026-05-28 cs.AI 90%

Deconstructing Spatial Complexity: Hierarchical Decomposition for LLM Spatial Reasoning

解构空间复杂性:用于LLM空间推理的层次分解

Yi Wang, Haojie Lu, Zhaofan Zhang, Li Chen, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种层次任务分解方法,结合MCTS引导的组相对策略优化(M-GRPO),通过改进中间状态选择和规划能力,显著提升LLM在导航、规划和策略游戏等空间任务中的表现。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27955 2026-05-28 cs.PL cs.CL 90%

Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents

技能即伪代码:将技能库重构为面向LLM智能体的伪代码

Xinze Li, Yuhang Zang, Yixin Cao, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出Skill-as-Pseudocode (SaP)方法,自动将Markdown技能库转换为带类型伪代码,通过确定性质量检查解决LLM智能体在检索技能时产生的混淆循环问题,在ALFWorld任务上显著优于基线。

Comments Preprint. Code: https://github.com/InternLM/Skill-as-Pseudocode

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02263 2026-05-28 cs.LG 89%

Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning

打破块限制:通过单调熵下降与强化学习为扩散大语言模型实现动态大小推理块

Yan Jiang, Ruihong Qiu, Zi Huang

机构 * School of Electrical Engineering and Computer Science, The University of Queensland, Brisbane, Queensland, Australia(电气工程与计算机科学学院,昆士兰大学,布里斯班,昆士兰,澳大利亚)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 针对扩散大语言模型中固定大小推理块导致的逻辑连贯性差和效率低问题,提出基于单调熵下降目标与强化学习的后训练框架b1,学习动态大小推理块以提升推理连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04540 2026-05-28 cs.CV cs.AI 89%

The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study

点、视觉与文本:点云能否提升大语言模型的空间推理能力?一项偏差控制研究

Weichen Zhang, Ruiying Peng, Xin Zeng, Jianjie Fang, Ziyou Wang, Kaiyuan Li, Heng Dong, Wei Li, Chen Gao, Xin Wang, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文通过引入包含文本、视觉和点云模态的3D空间推理基准ScanReQA,评估不同模态下大语言模型的空间推理能力,发现点云和视觉模态的模型表现优于纯文本模型,并揭示了3D大语言模型中的注意力下沉现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27957 2026-05-28 cs.CL 89%

DisasterBench: Benchmarking LLM Planning under Typed Tool Interface Constraints

DisasterBench: 在类型化工具接口约束下基准测试LLM规划

Zhitong Chen, Kai Yin, Weifeng Zhang, Zhiyuan Wang, Xiangjue Dong, Chengkai Liu, Zhewei Liu, Yiming Xiao, Ali Mostafavi, James Caverlee

机构 * Texas A&M University(德克萨斯A&M大学) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出DisasterBench基准,通过类型化工具接口评估LLM在灾害响应中的结构化多智能体规划能力,并引入首次故障点(FPoF)方法进行步骤级故障归因,揭示语义推理与执行约束之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27832 2026-05-28 cs.CL 89%

Playing with Words, Improving with Rewards: Training Language Models for Creative Association

玩文字游戏,用奖励改进:训练语言模型进行创意联想

Vijeta Deshpande, Namrata Shivagunde, Sherin Muckatira, Hadrien Glaude, Mikhail Gronas, Claire Stevenson, Roger Beaty, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛市分校) Dartmouth College(达特茅斯学院) University of Amsterdam(阿姆斯特丹大学) Pennsylvania State University(宾夕法尼亚州立大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本研究通过强化学习与可验证奖励(RLVR)在Codenames游戏上训练LLM,探索了规模依赖的精确度-创造力权衡,发现8B模型在保持推理能力的同时提升创造力,而小模型则牺牲创造力换取推理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28305 2026-05-28 cs.CL cs.AI 88%

Revisiting Anthropomorphic Reflection Markers in Large Language Model Reasoning

重新审视大语言模型推理中的拟人化反思标记

Yahan Yu, Noa Nakanishi, Fei Cheng

机构 * Kyoto University(京都大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过提示级和令牌级干预抑制拟人化反思标记,发现这些标记并非推理性能的必要条件,且抑制后模型仍能进行无标记验证,表明它们更多是表面线索而非可靠反思代理。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28398 2026-05-28 cs.AI 88%

HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs

HRBench:混合推理大语言模型中思维模式切换策略的基准测试与理解

Yansong Ning, Mianpeng Liu, Jingwen Ye, Weidong Zhang, Hao Liu

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出HRBench统一评估框架,系统研究混合推理LLM中基于提示、外部路由和推测执行三类切换策略在四种训练机制下的效率-效果权衡,揭示策略选择随模型规模和任务领域的变化规律。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏