arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4991 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4991 篇

2505.10320 2025-10-14 cs.CL cs.AI cs.LG 80%

J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning

Chenxi Whitehouse, Tianlu Wang, Ping Yu, Xian Li, Jason Weston, Ilia Kulikov, Swarnadeep Saha

机构 * FAIR at Meta(Meta 公司)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, 13 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02173 2025-10-10 cs.CL cs.AI cs.LG 80%

Learning to Reason for Hallucination Span Detection

Hsuan Su, Ting-Yao Hu, Hema Swetha Koppula, Kundan Krishna, Hadi Pouransari, Cheng-Yu Hsieh, Cem Koc, Joseph Yitan Cheng, Oncel Tuzel, Raviteja Vemulapalli

机构 * National Taiwan University(国立台湾大学) Apple(苹果公司)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18929 2025-05-27 cs.AI cs.CL 80%

Meta-aware Learning in text-to-SQL Large Language Model

Wenda Zhang

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 复杂问题求解 :chain-of-thought(abstract,comments);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Keywords: text-to-SQL LLM, fine-tuning, meta-aware leanring, metadata, chain-of-thought, BigQuery SQL, business database

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16742 2026-08-18 cs.SE cs.AI 新提交 79%

TDD-Agent: Test-Driven Reasoning for Code Generation

TDD-Agent:用于代码生成的测试驱动推理

Hongyue Yu, Kefan Li, Jiakun Li, Hongzheng Chai, Yuan Yuan, Rui He, Junyi Wei

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14804 2026-08-18 cs.AI 新提交 79%

Generated Context versus Governed State: Functional Conditions for Accountable Longitudinal Clinical Reasoning

生成式上下文与受控状态:可问责纵向临床推理的功能条件

Augusto Bernardo Pissarra, Victor Lorena de Farias Souza

机构 * MyndwareMed(迈恩德韦尔医疗)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文区分生成式上下文与受控状态,定义可问责临床AI的审计标准与信息要求,提出六级成熟度框架,将当前LLM临床实践定位于高能力低成熟度,为可问责临床AI提供概念与审计工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14452 2026-08-17 cs.AI 新提交 79%

SheetCompass: Hierarchical Relation Graphs for Agentic Spreadsheet Reasoning

SheetCompass:面向智能体电子表格推理的分层关系图

Panjing He, Mingyue Cheng, Yucong Luo, Li Li, Xiaohan Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对LLM处理电子表格时丢失多维结构语义的问题,提出SheetCompass框架,通过显式建模表内外结构关系并结合内存机制,提升智能体对复杂工作簿的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14290 2026-08-17 cs.AI 新提交 79%

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

Intern-S2-Mobius:知识与推理解耦的基础模型

Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu, Yicheng Gu, Qipeng Guo, Ermo Hua, Haian Huang, Haozheng Hou, Jie Hou, Xiangyu Hong, Che Jiang, Minxi Jin, Cheng Liang, Dahua Lin, Dawei Liu, Kuikun Liu, Chengqi Lv, Haijun Lv, Han Lv, Ningsheng Ma, Biqing Qi, Jianmin Qian, Shiya Su, Youbang Sun, Huanze Tang, Zhongbo Tian, Hanjing Wang, Rui Wang, Ting Wang, Yi Wang, Baiting Wu, Jun Xu, Bowen Yang, Hui Wang, Weida Wang, Haochen Ye, Jiashuo Yu, Shan Yu, Xiaoyi Yu, Qirui Zeng, Qi Zhang, Ming Zhang, Wenwei Zhang, Bowen Zhou, Xinyu Zhou

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出知识与推理解耦的Mobius-v0架构,基于此构建的7B模型和Intern-S2-Mobius模型,分别在减少训练数据和提升推理速度的同时保持了相近的下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11252 2026-08-13 cs.AI cs.ET cs.GT cs.MA 新提交 79%

Local verification cannot detect non-transportability: a cohomological theory of context preservation in agentic reasoning

局部验证无法检测不可迁移性:智能体推理中上下文保持的上同调理论

Suyash Mishra

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出智能体推理上下文保持的上同调理论,证明局部验证无法检测不可迁移性,提出Ksetra方法并通过外汇市场验证了所提检验的有效性。

Comments 17 pages, 10 figures. Includes an exact F-test for non-transportability with verified size and power, its precision-whitened generalisation, and a foreign-exchange case where the null hypothesis is known analytically rather than estimated

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03031 2026-08-12 cs.AI 版本更新 79%

CastFSR: A Fast--Slow--Reflect Agentic Reasoning Framework for Context-Aware Time Series Forecasting

CastFSR:用于上下文感知时间序列预测的快慢反思智能体推理框架

Xiaoyu Tao, Mingyue Cheng, Bokai Pan, Chuang Jiang, Huanjian Zhang, Tian Gao, Yaguo Liu, Qi Liu, Enhong Chen

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出CastFSR智能体框架,将上下文感知时间序列预测建模为快慢反思工作流,通过实验证明其在公共数据集上的表现优于代表性基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10129 2026-08-12 cs.CV cs.AI 版本更新 79%

LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning

LaViT:对齐潜在视觉思维以进行多模态推理

Linquan Wu, Tianxiang Jiang, Yifei Dong, Haoyu Yang, Fengji Zhang, Shichaang Meng, Ai Xuan, Linqi Song, Jacky Keung

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Utrecht University(乌特勒支大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 LaViT通过对齐潜在视觉思维提升多模态推理能力,实现视觉感知增强和模型性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07931 2026-08-11 cs.AI 新提交 79%

REIN: Bridging the Gap between Reasoning and Reliability via Reflection and Abstention Alignment

REIN:通过反思与弃权对齐缩小推理与可靠性之间的差距

Zhengze Huang, Luyang Yu, Di Hong, Xinzhe Huang, Wanyu Lin, Zhixuan Chu, Zhan Qin, Tianhang Zheng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 REIN是一个对齐框架,通过训练大型推理模型生成结构化推理序列,引入奖励机制鼓励模型在无正确推理链时弃权,在单次前向传播中减少幻觉、提升选择性准确率并保持高覆盖率。

Comments 26 pages and 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05833 2026-08-11 cs.AI 版本更新 79%

ViSR-KGC: Visual Subgraph Reasoning with Vision-Language Models for Multimodal Knowledge Graph Completion

ViSR-KGC:结合视觉语言模型的视觉子图推理用于多模态知识图谱补全

Jiafan Li, Mengxue Yang, Jiaqi Zhu, Liang Chang, Ying Li, Hongan Wang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) CITIC Securities(中信证券) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多模态知识图谱补全的痛点,提出ViSR-KGC方法,结合表示学习、视觉语言模型与预训练常识,通过提取查询感知子图并转换为可视化内容辅助VLM推理缺失实体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03972 2026-08-05 cs.AI 新提交 79%

ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

ReflectRL:通过反思到直接推理从优质负轨迹中学习

Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri, Shuo Lu, Wenke Huang, Hu Cao, Xun Xiao, Zhihong Zhu, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 ReflectRL是一种轻量即插即用框架,将专家失败的优质负轨迹作为反思对象而非丢弃,经反思推理与策略转换,在多基准、多模型及多训练方法上以极小开销提升大语言模型推理性能。

Comments Project page: https://github.com/bibisbar/ReflectRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02291 2026-08-04 cs.AI 新提交 79%

Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning

共享前缀,更优信用:面向多智能体推理的自适应路由

Yiqing Liu, Zihao Wang, Hantao Yao, Wu Liu, Yongdong Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对现有多智能体推理自适应路由方法的粗粒度监督缺陷,提出TreeCredit共享前缀信用分配框架,通过状态匹配下游比较估计算子效用,在六个推理基准上实现了准确率与推理成本的更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24140 2026-08-04 cs.AI 版本更新 79%

HyperGuide: Hyperbolic Guidance for Efficient Multi-Step Reasoning in Large Language Models

HyperGuide: 用于大型语言模型高效多步推理的双曲引导

Yuyu Liu, Haotian Xu, Yanan He, Sarang Rajendra Patil, Mengjia Xu, Tengfei Ma

机构 * Department of Computer Science(计算机科学系) Stony Brook University(石英布鲁克大学) Department of Applied Mathematics and Statistics(应用数学与统计学系) Yale University(耶鲁大学) Department of Data Science(数据科学系) New Jersey Institute of Technology(新泽西理工学院) Department of Biomedical Informatics(生物医学信息学系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多步推理中单次生成效率高但精度低、树搜索计算量大的问题,提出通过将推理进度蒸馏为双曲几何信号来引导逐步生成,利用双曲空间的距离和角度特性编码解接近度与分支区分,训练轻量头投影隐状态并微调适配器,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29185 2026-08-03 cs.CL 新提交 79%

Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

学习标量奖励模型的端到端潜在推理轨迹

Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang, Kun Liang, Weijie Liu, Yunfang Wu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19435 2026-07-31 cs.CL 79%

Route to Reason: Adaptive Routing for LLM and Reasoning Strategy Selection

Zhihong Pan, Kai Zhang, Yuze Zhao, Yupeng Han

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

Journal ref Proceedings of the ACM Web Conference 2026, pp. 5568-5578

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22713 2026-07-28 cs.AI 新提交 79%

SEGRA: Structured Experience-Guided Graph Reasoning Agent for Gremlin Based Question Answering

SEGRA:用于基于Gremlin的问答的结构化经验引导图推理代理

Saiyue Lyu, Mariam Dundua, Vishaal Kapoor, Sarthak Ahuja, Neda Kordjazi, Evren Yortucboylu, Harsh Amin, Rebecca Steinert

机构 * University of British Columbia(英属哥伦比亚大学) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(title);chain-of-thought(abstract);分类 cs.AI

AI总结 针对企业文本到Gremlin问答难题,SEGRA引入经验引导代理,集成多种技术,包括意图路由、查询生成等。在企业IT支持基准测试中成绩出色,平均评判分数大幅提高,技能库还降低了成本,提升了企业图问答的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13751 2026-07-28 cs.CL 版本更新 79%

Which Models Perform Better in Inheritance Reasoning?

哪些模型在继承推理中表现更好?

Mohammed Amine Mouhoub, Chahinez Bouchekif

机构 * Paris Dauphine University(巴黎多芬纳大学) University of Abou Bekr Belkaïd(阿布·贝克尔·贝尔卡伊德大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文比较了商业和开源大语言模型在伊斯兰继承推理任务中的表现,发现商业模型在识别继承人、应用排除规则和保持推理一致性方面更优,其中Gemini 2.5 Flash表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03021 2026-07-28 cs.CL 版本更新 79%

Hint-Guided Diversified Policy Optimization for LLM Reasoning

提示引导的多样化策略优化用于大语言模型推理

Zhiyu Cao, Kaixin Wu, Mingjie Zhong, Peifeng Li, Can Ye, Qiaoming Zhu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出提示引导的多样化策略优化(HDPO),通过“提出-选择-思考”轨迹激励模型生成多样且可靠的解决方案,提升推理能力、候选方案多样性和可靠方案识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16716 2026-07-21 cs.AI 新提交 79%

RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts

RECON:用于长上下文组合推理的智能体内存基准测试

Mihir Shriniwas Arya

机构 * RV College of Engineering(RV工程学院) Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究引入RECON基准测试,用于评估长上下文组合推理,跨越三个领域24个案例文件,测试智能体六个内存密集型任务,揭示当前架构在内存相关任务上存在重大局限,非预言机系统准确率低,检索和推理有挑战。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08940 2026-07-21 cs.LG 版本更新 79%

TSRouter: Dynamic Modality-Model Selection for Time Series Reasoning

TSRouter:用于时间序列推理的动态模态-模型选择

Fangxu Yu, Tao Feng, Dehai Min, Lu Cheng, Ge Liu, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 研究针对时间序列推理中不同模型能力互补及特性差异问题,提出基于图的TSRouter动态路由框架,通过构建异构图并将路由设为候选评分问题来选择最优模态-模型对,在多任务评估中性能显著提升,还具备零样本泛化等优势。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20083 2026-07-21 cs.CR cs.CL 版本更新 79%

DisarmRAG: Stealthy Retriever-Centric Poisoning to Disable Self-Correction in Retrieval-Augmented Generation (Extended Version)

DisarmRAG:以检索器为中心的隐秘中毒攻击,以禁用检索增强生成中的自我纠正(扩展版)

Yanbo Dai, Zhenlan Ji, Zongjie Li, Kuan Li, Shuai Wang

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL

AI总结 研究针对实际部署中LLMs自我纠正能力削弱RAG攻击效果的问题,提出DisarmRAG这一专注检索器的新型中毒范式,构建含迭代协同优化与对比学习技术的攻击框架,经多模型和基准测试验证其有效性及隐秘性。

Comments This paper is an extended version of our original paper accepted by ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20379 2026-07-16 cs.AI 版本更新 79%

Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution

思维策略:通过在线策略进化扩展大语言模型推理的测试时训练

Zhengbo Jiao, Hongyu Xian, Qinglong Wang, Yunpu Ma, Zhebo Wang, Zifan Zhang, Dezhang Kong, Meng Han

机构 * Binjiang Institute, Zhejiang University(浙江大学滨江学院) Shanghai University of Finance and Economics(上海财经大学) South China Normal University(华南师范大学) LMU Munich(慕尼黑大学) Wuhan University(武汉大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型复杂推理难题,提出思维策略(PoT)框架,通过高效探索机制生成候选解,用组相对策略优化更新LoRA适配器,实现推理策略实时进化,显著提升模型性能。

Comments Under Review, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09713 2026-07-14 cs.AI cs.MA cs.RO 新提交 79%

Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction

基于规则对齐的小语言模型和多智能体自我校正的闭环控制

Yuchen Wang, Javal Vyas, Tong Liu, Mehmet Mercangoz

专题命中 复杂问题求解 :self-correction(title);reasoning(abstract);分类 cs.AI

AI总结 研究能否对紧凑型小语言模型再训练用于控制推理并嵌入验证器引导的校正循环,通过组相对策略优化对齐模型,结合多种智能体,在随机热控模拟中取得高准确率和低延迟,支持该架构用于边缘可重构自主控制。

Comments Accepted by IEEE CCTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08758 2026-07-10 cs.AI 新提交 79%

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

思想有基因组:科学谱系推理与基于谱系的思想生成基准测试

Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出IG-Bench基准测试,用于科学谱系推理与基于谱系的思想生成。围绕IdeaGene框架构建,支持两种评估。通过对14个基于大语言模型的科学家实验,发现存在组合瓶颈,最强系统谱系推理精确准确率低,结构化谱系上下文改变系统排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08003 2026-07-10 physics.chem-ph cs.AI 新提交 79%

Reaction-network reasoning with frontier models for experimentally confirmed catalyst-selectivity hypotheses

使用前沿模型进行反应网络推理以获得实验证实的催化剂选择性假设

Sutanay Choudhury, Anwesha Banerjee, Udishnu Sanyal, Jorin Dawidowicz, Chiezugolum Ijeoma Odilinye, Jesun Firoz, Liney Arnadottir, Simone Raugei, Johannes Lercher, Arnab Dutta

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究复杂反应中催化剂选择性问题,利用前沿语言模型开发人机协同思考框架,通过识别控制途径竞争的物理杠杆发现新型催化剂,指导合成的催化剂使乙酸盐选择性提高三倍,转变计算范式,提供材料发现蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04945 2026-07-07 cs.CL 新提交 79%

You Frame It: How Conceptual Representations Shape LLM Detection and Reasoning about Antisemitism

你构建框架:概念表征如何塑造大语言模型对反犹主义的检测与推理

Katharina Soemer, Helena Mihaljević

机构 * Goethe University, Frankfurt(法兰克福歌德大学) HTW Berlin(柏林工业大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 研究不同形式概念基础对四个先进大语言模型检测反犹主义及解释行为的影响,用两个专家注释数据集比较不同表征,发现细粒度分类表征能提高召回率但降低精度,还揭示了模型解释存在的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03787 2026-07-07 cs.AI cs.CE q-bio.BM 新提交 79%

Folding, Reasoning, and Scaling with Open-source Drug Discovery Engine

使用开源药物发现引擎进行折叠、推理和扩展

Aureka AI OpenDDE project

机构 * Aureka AI(奥雷卡人工智能)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 介绍开源全原子生物分子基础模型OpenDDE,以共折叠为切入点构建可扩展AI驱动药物发现引擎,整合多方面进展实现一定精度,还指出共折叠模型扩展方向,推动药物发现发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18089 2026-07-07 cs.LG 新提交 79%

From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning

从推理轨迹到可复用模块:理解语言模型推理中的组合泛化

Lingjing Kong, Xin Liu, Guangyi Chen, Martin Q. Ma, Xiangchen Song, Yuekai Sun, Mikhail Yurochkin, Taylor W. Killian, Ruslan Salakhutdinov, Kun Zhang, Eric P. Xing, Zhengzhong Liu

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Institute of Foundation Models(基础模型研究院) University of Michigan(密歇根大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文通过层次化潜在选择模型形式化组合泛化,理论证明SFT提供原子模块,RL分解轨迹实现组合泛化,实验验证RL能从复合轨迹中提取原子模块并重组解决新配置。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏