arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-27 至 2026-02-27 共收录 72 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 8 篇

2602.22623 2026-02-27 cs.LG cs.AI cs.CL 67%

ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL

ContextRL: 通过上下文增强强化学习提升大语言模型的知识发现效率

Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ContextRL通过上下文增强强化学习提升大语言模型的知识发现效率,有效缓解奖励黑客问题并提升性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13359 2026-02-27 cs.AI cs.CL 62%

Cost-of-Pass: An Economic Framework for Evaluating Language Models

Cost-of-Pass:语言模型生产力评估的经济框架

Mehmet Hamza Erol, Batu El, Mirac Suzgun, Mert Yuksekgonul, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种经济框架,用于评估语言模型的生产力,通过结合准确性和成本,揭示了不同模型在不同任务中的成本效益,并探讨了创新对成本效率的影响。

Comments Code is available at: https://github.com/mhamzaerol/Cost-of-Pass

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22765 2026-02-27 cs.CL 57%

Towards Better RL Training Data Utilization via Second-Order Rollout

通过二次回滚实现更好的RL训练数据利用

Zhe Yang, Yudong Wang, Rang Li, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ByteDance BandAI(字节跳动BandAI)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出通过二次回滚提升RL训练数据利用效率,联合训练生成与批判能力,实验表明在相同数据下性能更优,并揭示标签平衡与噪声问题的解决方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22242 2026-02-27 cs.CR cs.AI 57%

Analysis of LLMs Against Prompt Injection and Jailbreak Attacks

对LLMs对抗提示注入和 jailbreak攻击的分析

Piyush Jaiswal, Aaditya Pratap, Shreyansh Saraswati, Harsh Kasyap, Somanath Tripathy

机构 * Bishop Cotton Boys’ School(伯希特·康普顿男校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了LLMs对提示注入和jailbreak攻击的脆弱性,通过实验分析不同模型的行为差异,并评估了轻量级防御机制的效果。

Comments 12 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22932 2026-02-27 cs.CV 50%

MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding

MSJoE:联合进化多模态大语言模型与采样器以实现高效的长视频理解

Wenhui Tan, Xiaoyi Yu, Jiaze Li, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Tongji University(同济大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 测试时计算 :reasoning(abstract)

AI总结 MSJoE通过联合进化多模态大语言模型与轻量级采样器,提升长视频理解效率,实验表明其在多个基准测试中表现优异。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 6 篇

2601.03467 2026-02-27 cs.CV 87%

ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing

ThinkRL-Edit: 基于强化学习的图像编辑推理框架

Hengjia Li, Liming Jiang, Qing Yan, Yizhi Song, Hao Kang, Zichuan Liu, Xin Lu, Boxi Wu, Deng Cai

机构 * Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 ThinkRL-Edit通过引入链式推理和无偏奖励策略,提升图像编辑的推理能力,实现更精准和稳定的编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18897 2026-02-27 cs.CV 78%

Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs

超越标签:基于推理增强的LMMs的无词汇细粒度识别

Dmitry Demidov, Zaigham Zaheer, Zongyan Han, Omkar Thawakar, Rao Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 FiNDR通过推理增强的LMMs实现无词汇细粒度识别,提出三步流程生成候选标签、过滤排名并构建轻量级分类器,取得显著性能提升。

Journal ref CVPR 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22808 2026-02-27 cs.AI 57%

MiroFlow: Towards High-Performance and Robust Open-Source Agent Framework for General Deep Research Tasks

MiroFlow:面向通用深度研究任务的高性能和鲁棒开源代理框架

Shiqian Su, Sen Xing, Xuan Dong, Muyan Zhong, Bin Wang, Xizhou Zhu, Yuntao Chen, Wenhai Wang, Yue Deng, Pengxiang Zhu, Ziyuan Liu, Tiantong Li, Jiaheng Yu, Zhe Chen, Lidong Bing, Jifeng Dai

机构 * Tsinghua University(清华大学) MiroMind AI National University of Singapore(新加坡国立大学) Nanjing University(南京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MiroFlow是一种面向通用深度研究任务的高性能开源代理框架,通过灵活的工作流编排和深度推理模式提升性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22718 2026-02-27 cs.AI cs.DC 57%

RLHFless: Serverless Computing for Efficient RLHF

RLHFless:用于高效RLHF的无服务器计算

Rui Wei, Hanfei Yu, Shubham Jain, Yogarajan Sivakumar, Devesh Tiwari, Jian Li, Seung-Jong Park, Hao Wang

机构 * Stevens Institute of Technology Northeastern University Stony Brook University Missouri University of Science \& Technology

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 RLHFless通过无服务器计算环境实现高效同步RLHF训练,预计算共享前缀并采用成本感知的演员扩展策略,提升训练速度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27566 2026-02-27 cs.IR 50%

Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval

Interact-RAG: 基于语义交互的检索增强生成,超越黑盒检索

Yulong Hui, Chao Chen, Zhihang Fu, Yihao Liu, Jieping Ye, Huanchen Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Interact-RAG通过引入语义交互引擎,使LLM代理能够主动操控检索过程,从而提升复杂信息检索任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10585 2026-02-27 cs.GR 50%

D3MAS: Decompose, Deduce, and Distribute for Enhanced Knowledge Sharing in Multi-Agent Systems

D3MAS:分解、推断与分配以增强多智能体系统中的知识共享

Heng Zhang, Yuling Shi, Xiaodong Gu, Haochen You, Zijian Zhang, Lubin Gan, Yilei Yuan, Jin Huang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 D3MAS通过分层协调框架减少多智能体系统中的知识冗余,提升推理准确性。

Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 17 篇

2602.22828 2026-02-27 cs.CL cs.AI 84%

TCM-DiffRAG: Personalized Syndrome Differentiation Reasoning Method for Traditional Chinese Medicine based on Knowledge Graph and Chain of Thought

基于知识图谱和推理链的TCM-DiffRAG:一种用于传统中医个性化辨证的推理方法

Jianmin Li, Ying Chang, Su-Kit Tang, Yujia Liu, Yanwen Wang, Shuyuan Lin, Binkai Ou

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 TCM-DiffRAG结合知识图谱与推理链,提升中医个性化诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00564 2026-02-27 cs.AI cs.CL 81%

Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs

揭示推理过程:一种评估大语言模型结构性数学推理的过程感知基准

Xiang Zheng, Weiqi Zhai, Wei Wang, Boyu Yang, Wenbo Li, Ruixiang Luo, Haoxiang Sun, Yucheng Wang, Zhengze Li, Meng Wang, Yuetian Du, Guojie Lin, Yaxuan Wang, Xiaoxiao Xu, Yanhu Mo, Xuan Ren, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReasoningMath-Plus基准,通过过程感知评估方法揭示大语言模型在结构性数学推理中的不足,引入HCRS评分函数和过程奖励模型,发现仅答案指标可能高估推理能力。

Comments 8 pages, and 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23199 2026-02-27 cs.AI 79%

SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation

SC-Arena: 一种用于具有知识增强评估的单细胞推理的自然语言基准

Jiahao Zhao, Feng Jiang, Shaowei Qin, Zhonghui Zhang, Junhao Liu, Guibing Guo, Hamid Alinejad-Rokny, Min Yang

机构 * Software College, Northeastern University(东北大学软件学院) Shenzhen University of Advanced Technology(深圳大学先进技术学院) Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) University of California, Irvine(加州大学 Irvine 分校) School of Biomedical Engineering, UNSW Sydney(悉尼大学生物医学工程学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SC-Arena通过知识增强评估框架,为单细胞生物学中的LLM提供统一且可解释的评估方法,提升生物正确性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17072 2026-02-27 cs.CL 79%

BankMathBench: A Benchmark for Numerical Reasoning in Banking Scenarios

BankMathBench: 一个用于银行场景数值推理的基准测试

Yunseung Lee, Subin Kim, Youngjun Kwak, Jaegul Choo

机构 * KakaoBank Corp.(Kakao银行公司) Korea Advanced Institute of Science(韩国先进科学研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 BankMathBench是一个专门针对银行场景的数值推理基准测试,通过多难度层级的任务设计提升LLMs在金融计算中的准确性和推理能力。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21743 2026-02-27 cs.CV 78%

Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization

通过难度感知分组归一化增强多模态大语言模型推理

Jinghan Li, Junfeng Fang, Jinda Lu, Yuan Wang, Xiaoyan Guo, Tianyu Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出难度感知分组归一化方法,通过感知复杂度和推理不确定性表征样本,提升多模态大语言模型的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06939 2026-02-27 cs.SE 75%

FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks

FeedbackEval: 一个用于评估大型语言模型在反馈驱动的代码修复任务中的基准

Dekun Dai, MingWei Liu, Anji Li, Jialun Cao, Yanlin Wang, Chong Wang, Xin Peng, Zibin Zheng

专题命中 推理评测 :reasoning(abstract);CoT(abstract);self-correction(abstract)

AI总结 FeedbackEval通过系统性基准评估LLMs在反馈驱动的代码修复任务中的表现,揭示了不同反馈类型和提示结构对修复效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06660 2026-02-27 cs.CR cs.AI 70%

Towards Small Language Models for Security Query Generation in SOC Workflows

面向SOC工作流中安全查询生成的小语言模型

Saleha Muzammil, Rahul Reddy, Vishal Kamalakrishnan, Hadi Ahmadi, Wajih Ul Hassan

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出一个三调节框架,利用小型语言模型实现高效、低成本的安全查询生成,实验表明其在语法和语义准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22452 2026-02-27 cs.AI cs.RO 70%

CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines

CWM: 用于具身智能体流水线中动作可行性学习的对比世界模型

Chayan Banerjee

机构 * School of Electrical Engineering and Robotics, Queensland University of Technology(电气工程与机器人学学院,昆士兰理工大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 CWM通过对比训练提升动作可行性评分,优于SFT方法,提升精度并增强安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14337 2026-02-27 cs.SE cs.MA 67%

LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces

LongCLI-Bench: 一个初步的基准测试与研究,用于命令行界面中的长周期代理编程

Yukang Feng, Jianwen Sun, Zelai Yang, Jiaxin Ai, Chuanhao Li, Zizhen Li, Fanrui Zhang, Kang He, Rui Ma, Jifan Lin, Jie Sun, Yang Xiao, Sizhuo Zhou, Wenxiao Wu, Yiming Liu, Pengfei Liu, Yu Qiao, Shenglin Zhang, Kaipeng Zhang

专题命中 推理评测 :planning(abstract);self-correction(abstract)

AI总结 LongCLI-Bench通过长周期任务评估代理能力,揭示现有代理在复杂任务中的不足,强调人机协作的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22955 2026-02-27 cs.CV cs.AI 57%

MM-NeuroOnco: A Multimodal Benchmark and Instruction Dataset for MRI-Based Brain Tumor Diagnosis

MM-NeuroOnco: 一种多模态基准和指令数据集用于基于MRI的脑肿瘤诊断

Feng Guo, Jiaxiang Liu, Yang Li, Qianqian Shi, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Center for Brain-Inspired Computing Research (CBICR), Department of Precision Instrument, Tsinghua University(脑启发计算研究中心(CBICR)、精密仪器系,清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MM-NeuroOnco提出一个多模态数据集和基准,用于提升基于MRI的脑肿瘤诊断的多模态推理能力,通过生成诊断相关语义提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22865 2026-02-27 cs.CL 57%

Effective QA-driven Annotation of Predicate-Argument Relations Across Languages

跨语言有效的问题回答驱动的谓词-论元关系标注

Jonathan Davidov, Aviv Slobodkin, Shmuel Tomi Klein, Reut Tsarfaty, Ido Dagan, Ayal Klein

机构 * Bar-Ilan University(巴伊兰大学) Ariel University(阿里尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种跨语言问题回答驱动的谓词-论元关系标注方法,通过重用英语QA-SRL解析器生成多语言高质量标注数据,提升语义解析效率。

Comments Accepted to EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22703 2026-02-27 cs.LG 57%

Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning

通过翻译引导强化学习增强VLMs的几何感知

Hao Yu, Shuning Jia, Guanghao Li, Wenhao Jiang, Chun Yuan

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 通过翻译引导强化学习提升VLMs的几何感知能力,实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21294 2026-02-27 cs.CL 57%

UPDESH: Synthesizing Grounded Instruction Tuning Data for 13 Indic Languages

UPDESH: 为13种印地语系语言合成基于现实的指令微调数据

Pranjal A. Chitale, Varun Gumma, Sanchit Ahuja, Prashant Kodali, Manan Uppadhyay, Deepthi Sudharsan, Sunayana Sitaram

机构 * Microsoft Corporation(微软公司) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 UPDESH通过基于维基百科内容的自下而上方法,生成高质量的多语言指令数据,提升多语言AI系统的文化适应性与性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22402 2026-02-27 cs.SE cs.AI cs.HC cs.OS 57%

Contextual Memory Virtualisation: DAG-Based State Management and Structurally Lossless Trimming for LLM Agents

上下文记忆虚拟化:基于DAG的状态管理和结构无损修剪用于LLM代理

Cosmo Santoni

机构 * Imperial College London(伦敦帝国学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 上下文记忆虚拟化通过DAG结构管理和无损修剪技术,提升LLM代理在长期推理任务中的上下文重用效率和经济性。

Comments 11 pages. 6 figures. Introduces a DAG-based state management system for LLM agents. Evaluation on 76 coding sessions shows up to 86% token reduction (mean 20%) while remaining economically viable under prompt caching. Includes reference implementation for Claude Code

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22759 2026-02-27 cs.CV 50%

Beyond Detection: Multi-Scale Hidden-Code for Natural Image Deepfake Recovery and Factual Retrieval

超越检测:多尺度隐藏码用于自然图像深度伪造恢复与事实检索

Yuan-Chih Chen, Chun-Shien Lu

机构 * IIS, Academia Sinica(中科院研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出多尺度隐藏码框架,用于自然图像深度伪造恢复与事实检索,通过语义编码和条件Transformer模块提升检索与重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22416 2026-02-27 cs.HC 50%

Seeing Graphs Like Humans: Benchmarking Computational Measures and MLLMs for Similarity Assessment

像人类一样看图:通过计算度量和MLLMs进行相似性评估的基准测试

Seokweon Jung, Jeongmin Rhee, Seoyoung Doh, Hyeon Jeon, Ghulam Jilani Quadri, Jinwook Seo

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过实验比较了计算度量和MLLMs在图相似性评估中的表现,发现MLLMs,特别是GPT-5,在匹配人类感知方面表现优异,能提供可解释的推理理由。

Comments 21 pages including 1 page of appendix, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22374 2026-02-27 cs.HC 50%

VoiceAlign: A Shimming Layer for Enhancing the Usability of Legacy Voice User Interface Systems

VoiceAlign:一种增强传统语音用户界面系统可用性的 shim 层

Md Ehtesham-Ul-Haque, Syed Masum Billah

专题命中 推理评测 :planning(abstract)

AI总结 VoiceAlign 通过适应性 shim 层提升传统语音用户界面系统的可用性,减少命令失败并降低用户认知负担。

Comments Accepted at IUI'26

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他推理 14 篇

2506.18582 2026-02-27 cs.CL 85%

Parallel Continuous Chain-of-Thought with Jacobi Iteration

并行连续链式思维与雅可比迭代

Haoyi Wu, Zhihao Teng, Kewei Tu

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出PCCoT,通过雅可比迭代提升连续链式思维的训练和推理效率,实现更快的训练速度和更稳定的性能。

Comments Accepted to EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22538 2026-02-27 cs.LG cs.CL 81%

RAIN-Merging: A Gradient-Free Method to Enhance Instruction Following in Large Reasoning Models with Preserved Thinking Format

RAIN-Merging: 一种无梯度方法,用于在保持推理格式的前提下提升大推理模型的指令遵循能力

Zhehao Huang, Yuhang Liu, Baijiong Lin, Yixin Lou, Zhengbao He, Hanling Tian, Tao Li, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recoginition, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(图像处理与模式识别研究所,自动化与智能感知学院,上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MoE Key Laboratory of System Control and Information Processing (Shanghai)(系统控制与信息处理国家重点实验室(上海))

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 RAIN-Merging通过无梯度方法提升大推理模型的指令遵循能力,同时保持推理格式和性能。

Comments 41 pages, ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏