arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-03 至 2026-03-03 共收录 110 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 110 篇

2502.04355 2026-03-03 cs.CL cs.AI 92%

LLM-ProS: Analyzing Large Language Models' Performance in Competitive Problem Solving

LLM-ProS: 分析大语言模型在竞争性问题解决中的性能

Md Sifat Hossain, Anika Tabassum, Md. Fahim Arefin, Tarannum Shaila Zaman

机构 * Department of Information Systems, University of Maryland, Baltimore County, Maryland, USA(信息系统系,马里兰大学巴尔的摩县分校,马里兰州,美国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 LLM-ProS评估了多种大语言模型在ICPC问题中的性能,揭示了模型在泛化、适应和解决新问题方面的差异,并探讨了训练方法和数据集对性能的影响。

Comments To be published in LLM4Code 2025 workshop proceedings

Journal ref 2025 IEEE/ACM International Workshop on Large Language Models for Code (LLM4Code)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19534 2026-03-03 cs.RO cs.AI 90%

Large Language Model-Assisted UAV Operations and Communications: A Multifaceted Survey and Tutorial

大型语言模型辅助的无人机操作与通信:多方面的综述与教程

Yousef Emami, Hao Zhou, Radha Reddy, Atefeh Hajijamali Arani, Biliang Wang, Kai Li, Luis Almeida, Zhu Han

机构 * IEEE

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 本文综述了大型语言模型在无人机操作与通信中的应用,探讨了LLMs在提升UAV智能方面的多方面技术与未来研究方向。

Comments 40 pages, 10 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07543 2026-03-03 cs.AI cond-mat.mtrl-sci 90%

MSP-LLM: A Unified Large Language Model Framework for Complete Material Synthesis Planning

MSP-LLM:一种用于完整材料合成规划的统一大语言模型框架

Heewoong Noh, Gyoung S. Na, Namkyeong Lee, Chanyoung Park

机构 * Department of Industrial \& Systems Engineering, KAIST, Daejeon, Korea Graduate School of Data Science, KAIST, Daejeon, Republic of Korea Korea Research Institute of Chemical Technology, KRICT, Daejeon, Korea

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 MSP-LLM提出一种统一的大语言模型框架,通过整合前驱材料预测和合成操作预测,有效解决材料合成规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01326 2026-03-03 cs.CL cs.LG 90%

Truth as a Trajectory: What Internal Representations Reveal About Large Language Model Reasoning

真相作为轨迹:内部表示揭示大语言模型推理的本质

Hamed Damirchi, Ignacio Meza De la Jara, Ehsan Abbasnejad, Afshar Shamsi, Zhen Zhang, Javen Shi

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Monash University(莫纳什大学) Concordia University(康科迪亚大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 TaT通过分析大语言模型推理过程中的层间几何位移,揭示有效推理与虚假行为的区别,提升模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21082 2026-03-03 cs.CL 89%

RPM: Reasoning-Level Personalization for Black-Box Large Language Models

RPM:面向黑盒大语言模型的推理层面个性化

Jieyong Kim, Tongyoung Kim, Soojin Yoon, Jaehyung Kim, Dongha Lee

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 RPM通过构建用户行为结构模型,实现黑盒大语言模型的推理层面个性化,提升个性化性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20745 2026-03-03 cs.AI cs.CL cs.LG 89%

AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent

AgentMath: 通过工具增强代理赋能大语言模型的数学推理

Haipeng Luo, Huawen Feng, Qingfeng Sun, Can Xu, Kai Zheng, Yufei Wang, Tao Yang, Han Hu, Yansong Tang

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AgentMath通过整合语言模型和代码解释器,提升大语言模型在复杂数学问题上的推理能力,实现高效训练和高准确率。

Comments This paper has been accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19551 2026-03-03 eess.SY cs.SY eess.SP 89%

Customising Electricity Contracts at Scale with Large Language Models

利用大语言模型大规模定制电力合同

Jochen L. Cremer

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文利用大语言模型大规模定制电力合同,解决电网约束下的自动化合同设计问题,提升电网规划和客户管理效率。

Comments 14 pages, 21 figures

Journal ref IEEE Transactions on Power Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00977 2026-03-03 cs.AI cs.LG 88%

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents

HiMAC:用于长视界LLM代理的分层宏微学习

Hongbo Jin, Rongpeng Zhu, Jiayu Ding, Wenhao Zhang, Ge Li

机构 * School of Electronic and Computer Engineering(电子与计算机工程学院) Peking University(北京大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 HiMAC通过分层宏微学习框架,提升LLM代理在长视界任务中的规划与执行能力,实现更高效的强化学习训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00889 2026-03-03 cs.CL cs.AI 88%

CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning

CHIMERA:紧凑的合成数据用于通用的LLM推理

Xinyu Zhu, Yihao Feng, Yanchao Sun, Xianzhi Du, Pingzhi Li, Olli Saarikivi, Yun Zhu, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) Apple(苹果公司) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 CHIMERA通过紧凑的合成数据集提升LLM跨领域推理能力,提供丰富推理轨迹和结构化覆盖,实现高效训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00819 2026-03-03 cs.LG cs.AI 88%

Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning

为LLM推理稳定化策略梯度以实现样本高效的强化学习

Luckeciano C. Melo, Alessandro Abate, Yarin Gal

机构 * OATML, University of Oxford(OATML,牛津大学) OXCAV, University of Oxford(OXCAV,牛津大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 CAPO通过曲率感知优化提升LLM推理的样本效率和稳定性

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01783 2026-03-03 cs.CV 88%

Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing

在多模态大语言模型中利用链式推理进行人脸反伪装

Honglu Zhang, Zhiqin Fang, Ningning Zhao, Saihui Hou, Long Ma, Renwang Pei, Zhaofeng He

机构 * Didi Chuxing(滴滴出行) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Normal University(北京师范大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出FaceCoT数据集和CEPL策略,通过链式推理提升多模态大语言模型在人脸反伪装中的鲁棒性和性能。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00923 2026-03-03 cs.CL 87%

Hybrid Neural-LLM Pipeline for Morphological Glossing in Endangered Language Documentation: A Case Study of Jungar Tuvan

混合神经-大语言模型管道在濒危语言文档中的形态学 glossing:朱加尔图瓦语案例研究

Siyu Liang, Talant Mawkanuli, Gina-Anne Levow

机构 * Department of Linguistics, University of Washington(语言学系,华盛顿大学) Department of Middle Eastern Languages and Cultures, University of Washington(中东语言与文化系,华盛顿大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种混合神经-大语言模型管道,用于朱加尔图瓦语的形态学 glossing,通过结合神经序列标注和 LLM 后修正,显著减少标注工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18672 2026-03-03 cs.LG cs.AI cs.CL 87%

Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks

混合专家语言模型在推理任务中的最优稀疏性

Taishi Nakamura, Satoki Ishikawa, Masaki Kawamura, Takumi Okamoto, Daisuke Nohara, Jun Suzuki, Rio Yokota

机构 * Institute of Science Tokyo(东京科学研究院) NII LLMC(国家信息研究所语言模型中心) Tohoku University(东北大学) RIKEN(日本研究机构)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过分析MoE模型的稀疏性对记忆和推理任务的影响,发现推理任务需在活跃FLOPs和TPP之间找到最优平衡。

Comments Accepted as an oral at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02209 2026-03-03 cs.LG cs.CL 86%

StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?

StockBench: LLM代理在真实市场中能否盈利地进行股票交易?

Yanxu Chen, Zijun Yao, Yantao Liu, Amy Xin, Jin Ye, Jianing Yu, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 STOCKBENCH评估LLM在真实股票市场中的交易能力,发现多数模型难以超越简单买入持有策略,部分模型展现出更高的收益和风险管理潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02881 2026-03-03 cs.LG cs.AI 86%

Rewriting Pre-Training Data Boosts LLM Performance in Math and Code

重写预训练数据提升LLM在数学和代码上的表现

Kazuki Fujii, Yukito Tajima, Sakae Mizuki, Masaki Kawamura, Hinari Shimada, Taihei Shiotani, Koshiro Saito, Masanari Oi, Taishi Nakamura, Takumi Okamoto, Shigeki Ishida, Kakeru Hattori, Youmi Ma, Hiroya Takamura, Rio Yokota, Jun Sakuma, Naoaki Okazaki

机构 * Institute of Science Tokyo, Department of Computer Science(东京科学研究所,计算机科学系) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) Institute of Science Tokyo, Institute of Integrated Research, Supercomputing Research Center(东京科学研究所,整合研究所,超级计算研究中心)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过重写预训练数据提升LLM在数学和代码任务中的表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06749 2026-03-03 cs.CV cs.AI cs.CL cs.LG 86%

Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Vision-R1: 促进多模态大语言模型推理能力的激励方法

Wenxuan Huang, Bohan Jia, Zijie Zhai, Shaosheng Cao, Zheyu Ye, Fei Zhao, Zhe Xu, Xu Tang, Yao Hu, Shaohui Lin

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 Vision-R1通过构建高质量多模态CoT数据集和渐进性思维抑制训练策略,提升多模态推理能力,在数学推理基准中取得显著成绩。

Comments Accepted to ICLR 2026. Code is available at https://github.com/Osilly/Vision-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19791 2026-03-03 cs.CL cs.IR 85%

ToolDreamer: Instilling LLM Reasoning Into Tool Retrievers

ToolDreamer: 将大语言模型推理能力注入工具检索器

Saptarshi Sengupta, Zhengyu Zhou, Jun Araki, Xingbo Wang, Bingqing Wang, Suhang Wang, Zhe Feng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Bosch Research North America(博世北美研究)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ToolDreamer通过合成工具描述来改进工具检索,提升稀疏和密集检索器性能,减少LLM上下文窗口压力。

Comments Accepted to EACL 2026 (main/oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09463 2026-03-03 cs.AI 85%

SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning

SpotAgent:通过代理推理在大视觉语言模型中实现视觉地理定位

Furong Jia, Ling Dai, Wenjin Deng, Fan Zhang, Chen Hu, Daxin Jiang, Yu Liu

机构 * Peking University(北京大学) StepFun

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);SFT(abstract);分类 cs.AI

AI总结 SpotAgent通过代理推理提升大视觉语言模型在地理定位中的表现,结合外部工具验证和强化学习优化,实现更精确和可靠的定位结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24385 2026-03-03 cs.CV cs.AI 85%

Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy

Vid-LLM:一种基于视频的紧凑型3D多模态大语言模型,具有重建-推理协同效应

Haijier Chen, Bo Xu, Shoujian Zhang, Haoze Liu, Jiaxuan Lin, Jingrong Wang

机构 * School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) Hubei Luojia Laboratory(湖北珞珈实验室) School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Vid-LLM通过基于视频的紧凑型3D多模态大语言模型,实现了重建与推理的协同效应,提升了三维场景理解的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22050 2026-03-03 cs.CL 85%

DeepSieve: Information Sieving via LLM-as-a-Knowledge-Router

DeepSieve: 通过LLM作为知识路由器实现信息筛分

Minghao Guo, Qingcheng Zeng, Xujiang Zhao, Yanchi Liu, Wenchao Yu, Mengnan Du, Haifeng Chen, Wei Cheng

机构 * Rutgers University(罗格斯大学) Northwestern University(西北大学) NEC Laboratories America(NEC美国实验室) NJIT(新泽西理工学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DeepSieve通过LLM作为知识路由器实现信息筛分,提升多跳问答任务的推理深度、检索精度和可解释性。

Comments Accepted by EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00686 2026-03-03 cs.CL 85%

RAVEL: Reasoning Agents for Validating and Evaluating LLM Text Synthesis

RAVEL: 用于验证和评估大语言模型文本合成的推理代理

Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Bosi Wen, Yidong Wang, Lin Fan, Yilin Zhou, Zikang Wang, Wenbo Yu, Lindong Wu, Hongning Wang, Minlie Huang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RAVEL通过引入智能体框架和C3EBench基准,评估LLM在文本合成中的推理能力,发现推理能力比生成能力更重要。

Comments 35 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01464 2026-03-03 cs.AI cs.CL 85%

ProtRLSearch: A Multi-Round Multimodal Protein Search Agent with Large Language Models Trained via Reinforcement Learning

ProtRLSearch: 一种基于大语言模型的多轮多模态蛋白质搜索代理,通过强化学习进行训练

Congying Liu, Taihao Li, Ming Huang, Xingyuan Wei, Peipei Liu, Yiqing Shen, Yanxu Mao, Tiehan Cui

机构 * University of Chinese Academy of Sciences(中国科学院大学) Hangzhou Institute for Advanced Study(杭州高等研究院) Shenzhen Institutes of Advanced Technology(深圳先进技术研究所) Institute of Information Engineering(信息工程研究所) Johns Hopkins University(约翰霍普金斯大学) Henan University(河南大学)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 ProtRLSearch通过强化学习训练,利用多模态输入提升蛋白质搜索的准确性和效率,解决传统方法在多模态整合和搜索过程约束上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01041 2026-03-03 cs.RO 85%

Coordinated Control of Multiple Construction Machines Using LLM-Generated Behavior Trees with Flag-Based Synchronization

利用LLM生成的行为树实现多台施工机械的协调控制

Akinosuke Tsutsumi, Tomoya Itsuka, Yuichiro Kasahara, Tomoya Kouno, Kota Akinari, Genki Yamauchi, Daisuke Endo, Taro Abe, Takeshi Hashimoto, Keiji Nagatani, Ryo Kurazume

机构 * Graduate School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电气工程研究生院) Public Works Research Institute(公共工程研究所) Institute of Systems and Information Engineering, University of Tsukuba(筑波大学系统与信息工程研究所) Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电气工程学部)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用LLM生成行为树实现施工机械协调控制,通过同步标志提升多机协作效率,实验验证其在土方自动化中的可行性。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01265 2026-03-03 cs.LG cs.AI cs.CL 85%

RLP: Reinforcement as a Pretraining Objective

RLP:将强化学习作为预训练目标

Ali Hatamizadeh, Syeda Nahida Akter, Shrimai Prabhumoye, Jan Kautz, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi

机构 * NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :pretraining(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RLP通过将强化学习的探索精神引入预训练阶段,提升模型在数学和科学任务中的推理能力。

Comments ICLR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05233 2026-03-03 cs.AI 83%

Electric Vehicle User Charging Behavior Analysis Integrating Psychological and Environmental Factors: A Statistical-Driven LLM based Agent Approach

电动汽车用户充电行为分析:整合心理和环境因素:一种基于统计驱动的LLM代理方法

Chuanlin Zhang, Junkang Feng, Chenggang Cui, Pengfeng Lin, Hui Chen, Yan Xu, A. M. Y. M. Ghias, Qianguang Ma, Pei Zhang

机构 * School of Electrical Engineering, Shanghai Jiaotong University(上海交通大学电气工程学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Psychological Consultation Center, East China University of Political Science and Law(中国政法大学政治学与法律系心理咨询中心) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于统计驱动LLM的代理方法,整合心理和环境因素分析电动汽车用户充电行为,揭示行为异质性及决策影响因素。

Comments Accepted for publication in CSEE Journal of Power and Energy Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00737 2026-03-03 cs.LO 82%

LLM-Powered Automatic Theorem Proving and Synthesis for Hybrid Systems and Game

基于大语言模型的混合系统和游戏自动定理证明与综合

Aditi Kabra, Jonathan Laurent, Ruben Martins, Stefan Mitsch, André Platzer

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文利用大语言模型扩展混合系统和游戏的自动定理证明与综合,通过混合游戏符号逻辑和微分游戏逻辑实现对复杂CPS的验证与综合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09758 2026-03-03 cs.LO 82%

Towards Language Model Guided TLA+ Proof Automation

面向语言模型引导的TLA+证明自动化

Yuhao Zhou, Stavros Tripakis

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract)

AI总结 本文提出基于语言模型的TLA+证明自动化方法,通过引导分层分解和符号证明者验证,提升证明效率并减少错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04040 2026-03-03 cs.AI 81%

FaithCoT-Bench: Benchmarking Instance-Level Faithfulness of Chain-of-Thought Reasoning

FaithCoT-Bench: 对链式推理实例级忠实度的基准测试

Xu Shen, Song Wang, Zhen Tan, Laura Yao, Xinyu Zhao, Kaidi Xu, Xin Wang, Tianlong Chen

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 FaithCoT-Bench提出了一种统一的基准,用于评估链式推理在实例级的忠实度,通过专家标注的轨迹和系统评估揭示了现有方法的优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07634 2026-03-03 cs.CL 81%

FrugalRAG: Less is More in RL Finetuning for Multi-Hop Question Answering

FrugalRAG: 在多跳问答中少即是多

Abhinav Java, Srivathsan Koundinyan, Nagarajan Natarajan, Amit Sharma

机构 * Microsoft Research India(微软印度研究院)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);SLM(abstract);prompting(abstract)

AI总结 FrugalRAG通过强化学习减少检索步骤,实现多跳问答任务的高效准确权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22611 2026-03-03 cs.LG cs.AI 81%

Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning

分位数优势估计:稳定LLM推理的RLVR

Junkang Wu, Kexin Huang, Jiancan Wu, An Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 通过分位数优势估计方法,稳定RLVR训练过程,提升LLM推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏