Yet Even Less Is Even Better For Agentic, Reasoning, and Coding LLMs
即使更少也是更好:用于代理、推理和编码LLM的更优方案
专题命中 数学推理 :reasoning(title,abstract)
AI总结 本文提出STITCH框架,通过过滤低价值噪声和保留决策关键标记,以更少但高质量的训练轨迹提升代理能力,在多个框架和语言中实现显著提升。
Comments 17 pages, 5 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
即使更少也是更好:用于代理、推理和编码LLM的更优方案
专题命中 数学推理 :reasoning(title,abstract)
AI总结 本文提出STITCH框架,通过过滤低价值噪声和保留决策关键标记,以更少但高质量的训练轨迹提升代理能力,在多个框架和语言中实现显著提升。
Comments 17 pages, 5 figures
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) ; Pengcheng Laboratory(鹏城实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 数学推理 :reasoning(title,abstract)
Comments 12pages, 11 figures
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 数学推理 :reasoning(title,abstract)
专题命中 数学推理 :reasoning(title,abstract)
专题命中 数学推理 :reasoning(title,abstract)
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(虎扑实验室) ; Zhejiang University(浙江大学) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 数学推理 :reasoning(title,abstract)
Comments Home page: https://alibaba-damo-academy.github.io/VCBench/
专题命中 数学推理 :reasoning(title,abstract)
专题命中 数学推理 :reasoning(title,abstract)
专题命中 数学推理 :reasoning(title,abstract)
StreamReason-Bench:大型语言模型能否推理事件时间流处理语义?
专题命中 数学推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 该研究构建了StreamReason-Bench基准测试,发现LLM在事件时间流处理语义推理任务上表现不佳,思维链可提升其性能,难点在于事件时间与延迟数据处理。
TCPO:回合级信用策略优化
机构 * Moore Threads AI(摩尔线程人工智能)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 该研究针对验证器引导多回合强化学习的信用分配问题,提出TCPO方法,在多类任务和模型上提升了LLM的多回合推理与智能体性能。
卡尔曼与课程学习结合:面向自适应RL微调的高效动态提示选择
机构 * Beihang University(北京航空航天大学) ; Zhongguancun Academy(中关村学院) ; Nanyang Technological University(南洋理工大学) ; Communication University of China(中国传媒大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);planning(abstract);分类 cs.LG
AI总结 本文提出KGPS方法,将提示选择转化为动态状态估计问题,适配RL训练动态,在多推理基准和RL算法上较基线提升准确率与rollout效率,在在线提示选择中达最优。
超越Token:基于LLM的多智能体系统中潜在通信的统一框架
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL
AI总结 提出一个三维统一框架(通信内容、发送-接收对齐、信息融合方式),系统分类2024-2026年间18种潜在通信方法,识别五种设计模式并揭示开放挑战。
通过有限自动机上的高效推理实现扩散语言模型的约束解码
机构 * Stanford University(斯坦福大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);planning(abstract);分类 cs.LG
AI总结 研究扩散语言模型的约束解码问题,提出基于有限自动机高效推理的算法,能保证约束满足,支持多种解码方式,经实验验证在多种任务上提升准确率且推理开销小。
通过局部分支路由实现高效且可训练的语言模型测试时扩展
机构 * Northwestern University(西北大学) ; Rutgers University(罗格斯大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Carnegie Mellon University(卡内基梅隆大学) ; LMSYS Org(LMSYS组织) ; Tilde Research(Tilde研究) ; University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; University of Toronto(多伦多大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of California, San Diego(加州大学圣迭戈分校)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL
AI总结 提出局部分支路由(LBR)框架,通过轻量级路由器选择局部前瞻树中的深度-1子路径,实现令牌级测试时扩展,在数学推理基准上优于链式思维和软令牌分支基线。
ExpRL: 用于LLM中期训练的探索性强化学习
机构 * Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; OpenAI ; Rogo
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);self-correction(abstract);分类 cs.LG
AI总结 提出ExpRL方法,利用人类编写的问答数据作为奖励支架,通过密集奖励强化推理过程中的部分进展和有用行为,在数学推理任务上优于SFT、稀疏奖励GRPO和自蒸馏,并为后续稀疏奖励RL提供更好的初始化。
相对分数策略优化用于扩散语言模型
机构 * University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; The University of Hong Kong(香港大学)
专题命中 数学推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.CL
AI总结 本文提出RSPO方法,通过可验证奖励校准扩散语言模型中的噪声似然估计,提升推理能力,在规划任务中表现优异。
教语言模型用代码思考
机构 * Korea University(韩国大学) ; AIGEN Sciences(AIGEN科技)
专题命中 数学推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.CL
AI总结 本文提出ThinC框架,通过代码自身进行推理而非依赖自然语言,提升了数学问题解决能力,其在多个基准测试中表现优异。
Comments Preprint
避免过度思考与不足思考:面向大语言模型的课程感知预算调度
机构 * University of Malaya(马来大学)
专题命中 数学推理 :reasoning(abstract,abstract_cn);test-time compute(abstract);分类 cs.CL
AI总结 本文提出BCAE框架,通过预算感知课程调度和截断感知密集奖励机制,优化LLM的推理质量和token效率,实验表明在多种数学推理基准上表现优异。
变换器中的自适应循环与记忆:更努力思考还是更了解更多?
机构 * Lamarr Institute(拉马尔研究所) ; Fraunhofer IAIS(弗劳恩霍夫 IAIS 研究所) ; University of Bonn(波恩大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 本研究提出结合自适应循环和门控记忆的变换器模型,提升数学推理和常识任务性能。
Comments Published at Latent & Implicit Thinking Workshop @ ICLR 2026
机构 * Geely AI Lab(Geely人工智能实验室) ; Beijing Institute of Technology(北京理工大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments PRICAI 2025
机构 * Zhejiang Univeristy(浙江大学) ; MAPLE Lab, Westlake University(西湖大学MAPLE实验室) ; Matterwave Intelligence ; Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所以高级技术研究所)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Accepted to NeurIPS 2025. Code link: https://github.com/maple-research-lab/LLaDOU
机构 * Peking University(北京大学) ; New York University(纽约大学) ; UC Berkeley(加州大学伯克利分校) ; National University of Singapore(新加坡国立大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.LG
Comments NeurIPS 2025 (spotlight)
机构 * Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Xidian University(西安电子科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; Nanyang Technological University(南洋理工大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
机构 * Baidu Inc(百度公司) ; College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Key Laboratory of Symbolic Computation and Knowledge Engineering of MOE, Jilin University(吉林大学教育部符号计算与知识工程重点实验室) ; State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校) ; Johns Hopkins University(约翰霍普金斯大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments 14 pages, 17 figures
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) ; Hangzhou International Innovation Institute, Beihang University(北航杭州国际创新研究院) ; Nanyang Technological University(南洋理工大学) ; University of Leicester(莱斯特大学) ; Kuaishou Technology(快手科技)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; The University of Queensland(昆士兰大学) ; National University of Singapore(新加坡国立大学) ; University of Southern California(南加州大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Accepted to ACL 2025 (Main)
专题命中 数学推理 :reasoning(abstract);CoT(abstract);math reasoning(abstract);分类 cs.CL
Comments Code and Models: https://github.com/Gen-Verse/dLLM-RL