arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-09 至 2026-06-09 共收录 81 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 15 篇

2605.03862 2026-06-09 cs.AI cs.CL 版本更新 89%

Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards

正确性不足:通过执行器导向的奖励训练推理计划器

Tianyang Han, Hengyu Shi, Junjie Hu, Xu Yang, Zhiling Wang, Junhao Su

机构 * D 4 Lab(D4实验室) Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,summary_cn);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TraceLift框架,通过执行器导向的奖励提升推理质量,利用rubric-based Reasoning Reward Model评估推理轨迹的可靠性与有效性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02880 2026-06-09 cs.AI cs.CL 版本更新 86%

ReTreVal: Reasoning Tree with Validation and Cross-Problem Memory for Large Language Models

ReTreVal:带有验证和跨问题记忆的推理树

Abhishek HS, Pavan C Shekar, Arpit Jain, Ashwanth Krishnan

机构 * QpiAI

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 ReTreVal通过自适应树探索、带工具增强的节点细化、类型化失败回溯和自修改记忆,使大语言模型在无需微调的情况下实现跨问题学习,其在MATH-500上达到85.8%的pass@1准确率,在MMLU-Pro上达到54.4%的准确率。

Comments 15 pages, 1 figure, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04805 2026-06-09 cs.AI 版本更新 85%

Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning

基于思考的非思考:通过强化学习解决混合推理模型训练中的奖励黑客问题

Siyuan Gan, Jiaheng Liu, Boyan Wang, Tianpei Yang, Runqing Miao, Yuyao Zhang, Fanyu Meng, Junlan Feng, Linjian Meng, Jing Huo, Yang Gao

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) Jiutian Research, Beijing, China(九天研究院)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 针对混合推理模型训练中的奖励黑客问题,提出Thinking-Based Non-Thinking方法,利用思考型回答的解决方案信息为非思考型回答设置差异化最大令牌数,在数学基准上减少约50%令牌使用并提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25184 2026-06-09 cs.LG cs.AI 版本更新 84%

Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model

在移动边缘训练:一种在线验证的提示选择方法用于大型推理模型的高效强化学习训练

Jiahao Wu, Ning Lu, Shengcai Liu, Kun Wang, Yanting Yang, Bailong Lin, Chen Jason Zhang, Li Qing, Ke Tang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学理工大学) Nanyang Technological University(南洋理工大学) Rutgers University(罗格斯大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学理工大学(广州))

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HIVE方法,通过历史奖励轨迹和实时提示熵实现高效RL训练,提升提示选择效率而不牺牲性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07108 2026-06-09 cs.AI 版本更新 83%

DyCon: Dynamic Reasoning Control via Evolving Difficulty Modeling

DyCon: 通过演化难度建模的动态推理控制

Tengyao Tu, Yulin Li, Hui-Ling Zhen, Libo Qin, Zhoujun Wei, Jinghua Piao, Zhuotao Tian, Yong Li, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Zhongguancun Academy(中关村学院) Huawei Noah’s Ark Lab(华为诺亚实验室) Shenzhen Loop Area Institute(深圳河套学院) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI

AI总结 提出DyCon框架,利用步骤级嵌入动态建模推理过程中的难度演化,无需训练即可控制推理深度,减少冗余步骤,提升效率且不损失准确性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25004 2026-06-09 cs.AI 版本更新 79%

CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning

CLPO:课程学习与策略优化相结合用于大语言模型推理

Shijie Zhang, Zheng Xiao, Shiyu Liu, Guohao Sun, Kevin Zhang, Xiang Guo, Rujun Guo, Shaoyu Liu, Wangxiao Zhao, Guanjun Jiang

机构 * Peking University(北京大学) Qwen Applications Business Group, Alibaba Group(通义实验室,阿里巴巴集团) Xiamen University(厦门大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出CLPO框架,通过在线策略准确率动态调整问题难度,使课程与策略共同进化,在数学和通用推理基准上显著优于GRPO和DAPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15327 2026-06-09 cs.LG cs.AI cs.CL stat.ML 版本更新 75%

Prescriptive Scaling Reveals the Evolution of Language Model Capabilities

规范性缩放揭示语言模型能力的演变

Hanlin Zhang, Jikai Jin, Vasilis Syrgkanis, Sham Kakade

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过大规模观测评估和分位数回归,提出规范性缩放定律,将预训练计算预算映射到下游准确率,并验证其时间稳定性,引入平衡I-最优采样算法降低评估成本。

Comments ICML 2026 Oral. Blog Post: https://jkjin.com/prescriptive-scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09085 2026-06-09 cs.LG cs.AI cs.CL cs.IR 版本更新 67%

MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting

MMR-GRPO:通过多样性感知奖励重加权加速GRPO风格训练

Kangda Wei, Ruihong Huang

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MMR-GRPO方法,利用最大边际相关性根据完成多样性重加权奖励,减少冗余样本,加速GRPO训练,在保持性能的同时平均减少47.9%训练步数和70.2%时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21522 2026-06-09 cs.LG cond-mat.dis-nn cs.AI stat.ML 版本更新 62%

More Bang for the Buck: Improving the Inference of Large Language Models at a Fixed Budget using Reset and Discard (ReD)

更高效利用预算:使用重置与丢弃(ReD)方法在固定预算下提升大型语言模型的推理性能

Sagi Meir, Tommer D. Keidar, Noam Levi, Shlomi Reuveni, Barak Hirshberg

机构 * School of Chemistry, Tel Aviv University(特拉维夫大学化学系) The Center for Physics and Chemistry of Living Systems, Tel Aviv University(特拉维夫大学生命系统物理与化学中心) School of Physics and Astronomy, Tel Aviv University(特拉维夫大学物理与天文学系) The Center for Computational Molecular and Materials Science, Tel Aviv University(特拉维夫大学计算分子与材料科学中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对固定预算下大型语言模型推理的收益递减问题,提出重置与丢弃(ReD)查询方法,通过优化尝试分配提升覆盖率,并在编码、数学和推理基准上验证了其成本节约效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06052 2026-06-09 cs.AI cs.CL 版本更新 62%

MixReasoning: Switching Modes to Think

MixReasoning: 切换模式以思考

Haiquan Lu, Gongfan Fang, Xinyin Ma, Qi Li, Xinchao Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MixReasoning框架,动态调整推理深度,对困难步骤详细推理、简单步骤简洁推理,在GSM8K、MATH-500和AIME上缩短推理长度并提高效率,不牺牲准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00322 2026-06-09 cs.CL cs.AI cs.SE 版本更新 62%

Failure by Interference: Language Models Make Balanced Parentheses Errors When Faulty Mechanisms Overshadow Sound Ones

干扰导致的失败:当有缺陷机制掩盖健全机制时,语言模型在平衡括号任务中出错

Daking Rai, Samuel Miller, Kevin Moran, Ziyu Yao

机构 * George Mason University(乔治·马歇尔大学) University of Central Florida(中央佛罗里达大学) Department of Computer Science(计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示语言模型在平衡括号任务中出错的原因:部分组件实现可靠机制,而其他组件引入噪声,当噪声机制主导时导致错误。提出RASteer方法,通过增强可靠组件贡献,将部分模型准确率从0%提升至近100%,并在算术推理任务中取得约20%的性能提升。

Comments 23 pages, 10 figures, accepted for NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06114 2026-06-09 cs.AI 版本更新 57%

Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction in Self-Evolving Systems

走向健康进化:探索人机交互在自我进化系统中的作用与机制

Dianxing Shi, Bowen Wang, Junqi He, Junhao Chen, Yuta Nakashima

机构 * The University of Osaka(大阪大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出ANCHOR框架,通过模拟人类监督的反馈机制,在自我进化系统中缓解能力退化与安全漂移,实验表明有限监督可显著提升安全性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15829 2026-06-09 cs.LG 版本更新 57%

Operationalising the Superficial Alignment Hypothesis via Task Complexity

通过任务复杂度操作化浅层对齐假设

Tomás Vergara-Browne, Darshan Patil, Ivan Titov, Siva Reddy, Tiago Pimentel, Marius Mosbach

机构 * University of Maryland(马里兰大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Edinburgh(爱丁堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出任务复杂度指标(达到目标性能的最短程序长度)来量化浅层对齐假设,实验表明预训练大幅降低任务复杂度,而微调可将复杂度降低数个数量级。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18428 2026-06-09 cs.AI 版本更新 57%

AlphaOPT: Formulating Optimization Programs with Self-Improving LLM Experience Library

AlphaOPT: 利用自改进LLM经验库构建优化问题

Minwei Kong, Ao Qu, Xiaotong Guo, Wenbin Ouyang, Chonghe Jiang, Han Zheng, Yining Ma, Dingyi Zhuang, Yuhan Tang, Junyi Li, Shenhao Wang, Haris Koutsopoulos, Hai Wang, Cathy Wu, Jinhua Zhao

机构 * Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) Massachusetts Institute of Technology(麻省理工学院) University of Florida(佛罗里达大学) Northeastern University(东北大学) Singapore Management University(新加坡管理学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AlphaOPT,一种自改进经验库,使LLM能从有限监督中学习优化建模知识,通过库学习和库演化两阶段循环,逐步提升性能,在多个基准上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08222 2026-06-09 cs.AI 版本更新 57%

Weak-Driven Learning: How Weak Agents make Strong Agents Stronger

弱驱动学习:弱智能体如何使强智能体更强

Zehao Chen, Gongxun Li, Tianxiang Ai, Zixuan Huang, Xiaodong Liu, Yifei Li, Wang Zhou, Fuzhen Zhuang, Xianglong Liu, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北航) China Telecom eSurfing Cloud(中国电信eSurfing云)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对大语言模型后训练中的饱和瓶颈,提出WMSS方法,利用模型历史弱检查点通过熵动力学识别可恢复学习差距并进行补偿学习,在数学推理和代码生成任务上实现有效性能提升且无额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2507.09751 2026-06-09 cs.AI cs.CL cs.LO 版本更新 82%

Sound and Complete Neurosymbolic Reasoning with LLM-Grounded Interpretations

基于LLM解释的完备且可靠的神经常识推理

Bradley P. Allen, Prateek Chhikara, Thomas Macaulay Ferguson, Filip Ilievski, Paul Groth

机构 * University of Amsterdam(阿姆斯特丹大学) University of Southern California(南加州大学) Rensselaer Polytechnic Institute(拉特格斯理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出将LLM直接集成到次协调逻辑的语义解释函数中,实现可靠且完备的神经常识推理,在GPQA和SimpleQA基准上宏F1提升约6个百分点,并成功检测药物安全知识库中的矛盾。

Comments 43 pages, 14 tables, 4 figures. Accepted to the 19th Conference on Neurosymbolic Learning and Reasoning (NeSy 2025); to appear Neurosymbolic Artifical Intelligence Special Issue on NeSy 2025 Extended Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22763 2026-06-09 cs.AI 版本更新 57%

Advancing Mathematics Research with AI-Driven Formal Proof Search

用AI驱动的形式证明搜索推进数学研究

George Tsoukalas, Anton Kovsharov, Sergey Shirobokov, Anja Surina, Moritz Firsching, Gergely Bérczi, Francisco J. R. Ruiz, Arun Suggala, Adam Zsolt Wagner, Eric Wieser, Lei Yu, Aja Huang, Miklós Z. Horváth, Andrew Ferraiuolo, Henryk Michalewski, Edward Lockhart, Codrut Grosu, Thomas Hubert, Matej Balog, Pushmeet Kohli, Swarat Chaudhuri

机构 * Google DeepMind(谷歌DeepMind) Aarhus University(奥胡斯大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了如何利用大型语言模型生成形式证明,以解决开放性数学问题,并展示了AI辅助形式证明搜索在数学研究中的应用和贡献。

Comments The first three authors and the last author have equal contributions. The first three authors are in random order

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11874 2026-06-09 cs.GT cs.AI cs.DS cs.LO cs.PL 版本更新 57%

Discovering Expert-Level Nash Equilibrium Algorithms with Large Language Models

利用大型语言模型发现专家级纳什均衡算法

Hanyu Li, Dongchen Li, Xiaotie Deng

机构 * CFCS, School of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学,北京,中国) School of Computing and Data Science, The University of Hong Kong, Pokfulam, Hong Kong(计算与数据科学学院,香港大学,薄扶林,香港)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出LegoNE框架,将专家证明策略编码为符号语言,自动验证算法的最坏情况保证,结合推理型LLM重新发现并改进了多人博弈的近似纳什均衡算法。

Comments accepted by Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 8 篇

2510.13554 2026-06-09 cs.CL cs.LG 版本更新 81%

Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization

注意力揭示大语言模型推理:预规划与锚定节奏实现细粒度策略优化

Yang Li, Zhichen Dong, Yuhan Sun, Weixun Wang, Shaopan Xiong, Yijia Luo, Jiashun Liu, Han Lu, Jiamang Wang, Wenbo Su, Bo Zheng, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Alibaba Group(阿里巴巴集团)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过注意力机制揭示大语言模型推理中的预规划与锚定节奏,并据此提出三种细粒度强化学习策略,在多种推理任务上取得一致性能提升。

Comments 31 pages, 9 figures, 20 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12213 2026-06-09 cs.AI 版本更新 79%

Goal-Oriented Reasoning for RAG-based Memory in Conversational Agentic LLM Systems

面向目标的推理用于基于RAG的记忆在对话型代理LLM系统中

Jiazhou Liang, Armin Toroghi, Yifan Simon Liu, Faeze Moradi Kalarde, Liam Gallagher, Scott Sanner

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Goal-Mem框架,通过目标导向的推理提升RAG记忆在复杂任务中的表现,尤其在多跳推理和隐含推理中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05138 2026-06-09 cs.AI 版本更新 70%

Executable World Models for ARC-AGI-3 in the Era of Coding Agents

可执行世界模型在编码智能体时代的ARC-AGI-3应用

Sergey Rodionov

机构 * SingularityNET

专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出一种编码智能体系统,通过维护可执行Python世界模型、验证观察、重构简化抽象和模型内规划,在ARC-AGI-3游戏中取得初步成果,GPT-5.5高推理下完全解决15个游戏。

Comments 13 pages. Accepted for publication at AGI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15165 2026-06-09 cs.CL cs.AI cs.LG 版本更新 67%

The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models

灵活性陷阱:重新思考扩散语言模型中任意顺序的价值

Zanlin Ni, Shenzhi Wang, Yang Yue, Tianyu Yu, Weilin Zhao, Yeguo Hua, Tianyi Chen, Jun Song, Cheng Yu, Bo Zheng, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学Leap实验室) NLPLab, Tsinghua University(清华大学自然语言处理实验室) Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) BNRist, Tsinghua University(清华大学北京研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现,尽管扩散语言模型(dLLMs)允许任意生成顺序,但这种灵活性可能限制其推理能力,通过采用标准的Group Relative Policy Optimization(GRPO)方法,即JustGRPO,在保持并行解码能力的同时提升了推理性能。

Comments Code and pre-trained models: https://github.com/LeapLabTHU/JustGRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14147 2026-06-09 cs.AI cs.LG 版本更新 62%

An Alternative Trajectory for Generative AI

生成AI的另一种轨迹

Margarita Belova, Yuval Kansal, Yihao Liang, Jiaxin Xiao, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过构建领域特定超智能(DSS)来改进生成AI,利用符号抽象提升领域推理能力,避免LLM合成数据的模型崩溃问题,实现可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19504 2026-06-09 cs.AI cs.CL cs.IR 版本更新 62%

TQA-Bench: Evaluating LLMs for Multi-Table Question Answering

TQA-Bench:评估大语言模型在多表问答中的表现

Zipeng Qiu, Chenyue Li, You Peng, Guangxin He, Binhang Yuan, Chen Wang

机构 * Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出TQA-Bench基准,通过长上下文多表问答任务评估LLM,揭示其在复杂数据驱动环境中的挑战与机遇。

Comments Accepted by IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18050 2026-06-09 cs.AI cs.LO 版本更新 57%

The Topological Dual of a Dataset: A Logic-to-Topology Encoding for AlphaGeometry-Style Data

数据集的拓扑对偶:一种逻辑到拓扑的编码用于AlphaGeometry风格的数据

Anthony Bordg

机构 * Huawei Lagrange Center(华为拉格朗日中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种逻辑到拓扑的编码方法,用于揭示模型潜在空间的结构不变性,通过逻辑观察的对偶性,为神经符号AI提供解释路径。

Comments Company decision as a precautionary measure while a third-party dispute is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22793 2026-06-09 cs.AI 版本更新 57%

Signals Are Not States: Neuro-Symbolic Safeguards for Culturally Aware Classroom AI

信号不是状态:面向文化意识课堂AI的神经符号安全机制

Sina Bagheri Nezhad

机构 * Independent Researcher(独立研究者)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出NSCR框架,通过神经符号方法处理课堂多模态信号,区分可观测证据与文化负载解读,减少文化偏见对课堂AI的负面影响。

Comments Accepted at the Workshop on Stereotypes Across Cultures in Language Technologies @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 16 篇

2603.12666 2026-06-09 cs.LG cs.AI 版本更新 84%

RetroReasoner: A Reasoning LLM for Strategic Retrosynthesis Prediction

RetroReasoner:一种用于战略 retrosynthesis 预测的推理 LLM

Hanbum Ko, Chanhui Lee, Ye Rin Kim, Rodrigo Hormazabal, Sehui Han, Sungbin Lim, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Department of Statistics, Korea University(韩国大学统计系) Materials Intelligence Lab, LG AI Research(LG人工智能研究实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 RetroReasoner 通过监督微调和强化学习,捕捉化学家基于断键策略的推理过程,提升 retrosynthesis 预测的准确性和多样性。

Comments 35 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10448 2026-06-09 cs.CL 版本更新 83%

RECON: Reasoning with Condensation for Efficient Retrieval-Augmented Generation

RECON:基于压缩的推理用于高效检索增强生成

Zhichao Xu, Minheng Wang, Yawei Wang, Wenqian Ye, Yuntao Du, Yunpu Ma, Yijun Tian

机构 * University of Utah(犹他大学) University of Washington(华盛顿大学) George Washington University(乔治·华盛顿大学) University of Virginia(弗吉尼亚大学) Shandong University(山东大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) University of Notre Dame(诺特丹大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出RECON框架,在强化学习搜索代理的多轮推理中插入观察压缩器,通过两阶段课程训练实现上下文压缩,提升训练和推理效率并增强问答性能。

Comments Techinical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01304 2026-06-09 cs.LG 版本更新 81%

When Hard Negatives Hurt: Bridging the Generative-Discriminative Gap in Hard Negative Synthesis for Retrieval

当硬负例有害时:弥合检索中硬负例生成的生成-判别鸿沟

Zhicheng Zhang, Jiwei Tang, Kuicai Dong, Xiaopeng Li, Jieming Zhu, Jingyu Li, Qianhui Zhu, Fengyuan Lu, Wang Jiaheng, Gang Wang, Hai-Tao Zheng, Zhaocheng Du

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Huawei Technologies Co., Ltd.(华为技术有限公司) City University of Hong Kong(香港城市大学) School of Cyber Science and Technology, Sun Yat-sen University(中山大学信息科学与技术学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) The Hong Kong University of Science and Technology(香港科学与技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 规划推理 :CoT(summary_cn,abstract);分类 cs.LG

AI总结 针对检索中硬负例生成存在的生成-判别鸿沟问题,提出CausalNeg方法,通过CoT引导的反事实扰动和查询视角熵最大化来提升检索性能。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02802 2026-06-09 cs.AI 版本更新 79%

ChatHealthAI: Aligning Electronic Health Record Representations with Large Language Models for Grounded Clinical Reasoning

ChatHealthAI: 将电子健康记录表示与大语言模型对齐以实现基于临床的推理

Bo-Hong Wang, Baicheng Peng, Ruilin Wang, Jun Bai, Ziyang Song, Yue Li

机构 * School of Computer Science, McGill University(麦吉尔大学计算机科学系) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ChatHealthAI框架,通过任务感知重采样器将预训练的EHR基础模型的结构化表示与冻结的大语言模型语义空间对齐,实现可解释的临床推理并保持预测性能。

Comments Main paper with appendix, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏