arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-31 至 2026-07-31 共收录 127 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 16 篇

2607.27888 2026-07-31 cs.AI 新提交 92%

Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

并非所有 token 都应获得同等权重:面向长思维链(Long-CoT)推理的反事实敏感性权重重分配

Qiangqiang He, Zhongheng Wu, ZiJian Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) Institute of Wireless Communications Technology, Shanghai Jiao Tong University(上海交通大学无线通信技术研究所)

专题命中 数学推理 :CoT(title,title_cn);reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 针对长思维链推理中均匀分配 token 权重的缺陷,提出反事实敏感性权重重分配方法,在数学推理基准上优于 GRPO,验证了特权诱导方向不可靠的诊断。

Comments 20 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27631 2026-07-31 cs.AI cs.CL 新提交 81%

ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

ReDiPPO:用于数学推理的参考引导值校准与差异感知标记重加权

Zhenrong Zhang, Fei Wu, Jun Du, Jianshu Zhang, Si Wei

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对数学推理中PPO的标记级信用分配难题,ReDiPPO引入参考引导评判器并通过值估计差异重加权标记优势,提升值估计精度且优于PPO、DAPO等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28449 2026-07-31 cs.CL 新提交 79%

Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models

Lightning OPD 2.0:缓解大型推理模型跨教师在线策略蒸馏中的风格偏差

Yecheng Wu, Song Han, Han Cai

机构 * NVIDIA(英伟达)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 Lightning OPD 2.0通过交叉拟合风格残差化缓解大型推理模型跨教师在线策略蒸馏的风格偏差,在数学推理与代码生成基准中优于原方法,实现了跨教师设置下的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27484 2026-07-31 cs.AI cs.MA 新提交 79%

Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

技能使用还是技能表演?评估技能增强型语言智能体中的推理后台

Jinwei Hu, Yi Qi, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对技能增强型语言智能体,提出BACKTRACE评估框架及BACKROOMBench测试平台,发现其存在推理后台现象,即技能使用声明与实际决策影响存在系统性差距,需通过干预进行审计。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28421 2026-07-31 cs.AI 版本更新 79%

DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

DenoiseRL:引导推理模型从噪声前缀中恢复

Caijun Xu, Changyi Xiao, Zhongyuan Peng, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出DenoiseRL框架,通过强化学习从弱模型的错误推理中学习,无需外部监督或强教师模型,提升推理性能和训练效率。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27610 2026-07-31 cs.LG 新提交 77%

Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

卡尔曼与课程学习结合:面向自适应RL微调的高效动态提示选择

Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Communication University of China(中国传媒大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出KGPS方法,将提示选择转化为动态状态估计问题,适配RL训练动态,在多推理基准和RL算法上较基线提升准确率与rollout效率,在在线提示选择中达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27705 2026-07-31 cs.AI cs.LG 新提交 73%

Albilich: Steerable Proof-State Orchestration for LLM-Based Mathematical Research with CAS Integration

Albilich:用于结合计算机代数系统(CAS)的基于大语言模型的数学研究的可操控证明状态编排工具

Ting Gong, Michael Ruofan Zeng, Yong Yang

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 Albilich是结合CAS等功能的开源数学自主研究智能体框架,在RealMath基准和Kourovka开放问题上取得优异效果,可实现AI辅助的可扩展数学研究。

Comments 7 pages, comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27787 2026-07-31 cs.LG cs.AI 新提交 62%

LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts

LoRA 支架策略优化(LSPO):零奖励悬崖提示下恢复强化学习梯度的采样时低秩支架

Ken Ding

机构 * NVIDIA(英伟达)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对数学推理 RLVR 的悬崖提示梯度丢失问题,提出 LSPO 采样时机制,通过 LoRA 适配器恢复梯度,在 DeepMath-103K 数据集上 16 项基准指标均优于 DAPO,平均提升 3.8 分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20145 2026-07-31 cs.CL cs.AI 版本更新 62%

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化

Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhicheng Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zhang, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。

Comments 73 pages, 22 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03126 2026-07-31 cs.LG cs.AI 版本更新 62%

ACPO: Asymmetric Credit Policy Optimization via Mode-Local Entropy Surrogate

ACPO:通过细粒度替代熵实现自适应信用策略优化

Zijun Xie, Yuyang You, Yongzhi Li, Enlei Gong, Quan Chen, Yanhua Cheng, Peng Jiang, Binbin Zheng, Xiaolong Liu, Zeyu Chen, Yadong Mu

机构 * Peking University(北京大学) Baidu Inc.(百度公司) Kuaishou Inc(快手公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中稀疏奖励致令牌级信用分配难的问题,提出基于模式局部替代熵的ACPO框架,通过不对称调制策略更新改进信用分配,实验表明其优于多种强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28582 2026-07-31 cs.LG 新提交 57%

$β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

β-OPSD:基于策略优化推导,采用自蒸馏训练

Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang

机构 * University of Maryland(马里兰大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 β-OPSD是将普通OPSD扩展为含可控正则化参数β的策略优化通用形式,通过蒸馏近似策略优化解,在数学推理基准上性能与稳定性均优于普通OPSD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28077 2026-07-31 cs.CL 新提交 57%

LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models

LEEPS:用于大语言模型中高效RLVR的潜在引导探索-利用提示采样

Shuang Liang, Haoyang Zhou, Yifan Gong, Guowei Wang, Xiting Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 LEEPS是一种潜在引导探索-利用提示采样器,通过自适应分配rollout预算等方式优化提示采样,在6个数学推理基准和3个OOD通用推理基准上均取得最优性能,且训练开销较小。

Comments 15pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27994 2026-07-31 cs.AI 新提交 57%

SKIMIX: Multi-Agent Harness-Time Scaling with Skill Mixture for Dynamic Harness Engineering

SKIMIX:面向动态 harness 工程的技能混合多智能体 harness 时间缩放方法

Jia Luo

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 SKIMIX 是一种多智能体框架,结合技能检索、抗稀释路由等技术,在六个推理基准上提升开放式数学推理能力,为可扩展智能体设计提供了任务特性相关的实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27709 2026-07-31 cs.AI 新提交 57%

MECA: A Mechanism-Centered Agent for Constructing Well-Specified and Valuable Mathematical Conjectures

MECA:一种以机制为中心的智能体,用于构建定义明确且有价值的数学猜想

Wentao Long, Yunfei Zhang, Chenyi Li, Zaiwen Wen

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 MECA是一种以机制为中心的多智能体框架,可联合构建候选数学命题及其支撑机制,能生成定义明确且有研究价值的猜想,相关猜想对现有自动证明器仍具挑战性。

Comments 78 pages, 5 figures. Includes appendices and the full collection of 100 generated conjectures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16140 2026-07-31 cs.LG 版本更新 57%

Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards

具有可验证奖励的强化学习中噪声数据是破坏性的

Yuxuan Zhu, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana Champaign, USA(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 研究指出,现有RLVR算法无法缓解噪声影响,噪声会破坏强化学习性能,真实世界噪声导致Text2SQL任务准确率下降5-12%。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18538 2026-07-31 cs.CR 版本更新 50%

CryptanalysisBench: Can LLMs do Cryptanalysis?

密码分析基准测试:大语言模型能进行密码分析吗?

Lukas Fluri, Avital Shafran, Nicholas Carlini, Matthew Jagielski, Milad Nasr, Orr Dunkelman, Eyal Ronen, Florian Tramèr

专题命中 数学推理 :reasoning(abstract)

AI总结 研究探讨大语言模型能否进行密码分析,引入包含六个密码原语家族191个任务的CryptanalysisBench基准测试,五个前沿模型在不同层级有一定破解率,不仅得出已知结果还产生新成果,发布该基准测试以追踪人工智能密码分析进展及压力测试候选方案。

Comments 46 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2607.27267 2026-07-31 cs.CR cs.AI 新提交 57%

FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs

FAVA:基于证据支持的权限图的经验证智能体的形式化授权

Yifan Zhang, Xinkui Zhao, Sai Liu, Hengxuan Lou, Guanjie Cheng, Chang Liu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27259 2026-07-31 cs.LO cs.AR 新提交 50%

CircuitProver: Agentic Lean 4 Theorem Proving with Reusable Circuit Proof Library for Hardware Verification

CircuitProver:基于可复用电路证明库的智能体Lean 4定理证明框架,用于硬件验证

Ziyi Yang, Wenji Fang, Chen Chen, Zhiyao Xie, Hongce Zhang

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 CircuitProver是基于Lean 4的智能体硬件验证框架,可自动转换硬件设计为Lean模型,通过积累可复用证明知识完成63项基准证明,比普通智能体更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 6 篇

2607.27783 2026-07-31 cs.CL cs.AI cs.LG 新提交 85%

Reasoning Consensus: Structural Ensembling of LLM Reasoning via Weighted DAG Aggregation

推理共识:通过加权有向无环图聚合实现大语言模型推理的结构集成

Amruta Parulekar, Jinu Lee, Dilek Hakkani-Tür, Hari Sundaram

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出通过加权DAG聚合集成LLM推理结构的框架,在六个基准上优于多数投票基线,可提供可检查的共识推理图,还能分析不同推理视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22241 2026-07-31 cs.CV 版本更新 82%

AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment

AgentHOI:通过隐式表示对齐进行人类-物体交互视频生成的多智能体推理

Ziyao Huang, Shunkai Li, Juan Cao, Chenyu Li, Youliang Zhang, Zixiang Zhou, Cong Wang, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent HunYuan(腾讯混元)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract)

AI总结 研究针对HOI视频生成中现有方法依赖显式运动控制的问题,提出AgentHOI,通过多智能体推理和隐式文本-运动对齐策略,实现文本驱动的HOI视频生成,提升了交互自然性等,改进了复杂场景下的表现。

Comments Under review. The code is available at https://github.com/bone-11/agenthoi

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28146 2026-07-31 cs.CL cs.AI 新提交 81%

Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game

智能体能够欺骗吗?使用社交推理游戏评估ParliamentBench中的推理与欺骗能力

Niklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa, Jan Philip Wahle, Bela Gipp, Terry Ruas

机构 * University of Göttingen(哥廷根大学) National Institute of Informatics(信息学研究所) University of Tokyo(东京大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究基于《Secret Hitler》游戏构建ParliamentBench基准,评估16个LLM的欺骗与推理能力,发现前沿模型表现优异,多数LLM难以维持一致的欺骗人设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27248 2026-07-31 cs.AI cs.LG 新提交 62%

Divergence Decoding: Training-Free Capability Fusion

分歧解码:无训练的能力融合

Yimi Wang, Hao Li, Shuo Yang, He Cao, Dechen Zhang, Ziang Wu, Zhiyuan Yan, Fanyang Mo, Li Yuan

机构 * Peking University(北京大学) International Digital Economy Academy (IDEA)(国际数字经济学院) The University of Hong Kong(香港大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对通用大模型缺领域知识、专家模型逻辑弱的问题,提出无训练的Divergence Decoding框架,通过Jensen-Shannon散度自适应路由,在科学基准上融合两类模型能力,性能优于单模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28481 2026-07-31 cs.AI 新提交 57%

A Fuzzy Rule-based Neuro-Symbolic Approach for Pipe Severity Prediction in Sewer Networks

用于污水管网管道严重程度预测的基于模糊规则的神经符号方法

Ngoc Thai Le, Thanh Ma, Umberto Straccia

机构 * Can Tho University(芹苴大学) Istituto di Scienza e Tecnologie dell’Informazione, CNR - ISTI(意大利国家研究委员会信息科学与技术研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出一种基于模糊规则的神经符号框架,将神经感知与符号推理解耦,结合Swin Transformer、Weka J48算法和模糊逻辑,在污水管网管道严重程度预测任务中,较仅图像分类提升了多项关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13220 2026-07-31 cs.AI cs.CE cs.HC 版本更新 57%

Networked Intelligence: Active Shared Context Graphs for Human-AI Team Science

网络智能:用于人类-人工智能团队科学的主动共享上下文图

Sutanay Choudhury, Jeffrey J. Czajka, Lummy M. O. Monteiro, Erin Bredeweg, Jason McDermott, Katherine Wolf, Alex Beliaev, Josh Elmore, Paul Piehowski, Kylee Tate, Yuqian Gao, Aivett Bilbao, Kelly Stratton, Scott Baker, Jaydeep P. Bardhan, Kristin Burnum Johnson, Chris Oehmen, Robert Rallo

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在培养人类与AI系统间的网络智能。提出Mycelium主动共享工作区,能自动连接人员与智能体,捕获并路由重要信息。通过生物多组学活动测试,验证其可将局部发现转化为实验设计,还对网络智能进行了计算解释。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 23 篇

2604.10383 2026-07-31 cs.CV 版本更新 82%

Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios

代理视频生成:通过工具约束的LLM规划从文本到可执行事件图

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) Büchi Labortechnik AG(布奇实验室技术股份公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出了一种代理系统,通过LLM生成结构化的事件图规范,并在3D引擎中确定性执行,解决了传统视频生成的语义可靠性问题,展示了在物理真实性和语义对齐上的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16745 2026-07-31 cs.AI cs.MA 版本更新 79%

RELIC: Revealed Principles for Learning Interpretable Composable Skills in Multi-Agent Planning

RELIC:多智能体规划中学习可解释可组合技能的揭示原则

Nguyen Viet Tuan Kiet, Bui Dinh Pham, Duong Quoc Chinh, Dao Van Tung, Tran Cong Dao, Huynh Thi Thanh Binh

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对多智能体规划中隐私受限合作难题,提出RELIC框架,通过揭示原则学习可解释可组合技能,各智能体私用大语言模型引导搜索优化技能,协调器依团队性能评估更新,实现跨智能体转移,引入隐私保护技能学习新范式。

Comments v1 accepted at LM4Plan Workshop @ ICML 2026; v2 is the full paper version; Kiet, Pham, and Chinh contributed equally in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28098 2026-07-31 cs.AI cs.CL 新提交 73%

SciDataSailor: Deep Scientific Data Exploring

SciDataSailor:深度科学数据探索

Jiyong Rao, Yicheng Qiu, Chi Zhang, Chunfeng Song, Runkai Zhao

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对科学数据仓库交互难题,提出SciDataSailor框架,以带特定机制的MCTS实现轨迹合成,构建了微调模型与含千余任务的评估基准,推动LLM智能体的科学数据探索能力。

Comments 63 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27599 2026-07-31 cs.AI cs.RO 新提交 70%

World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models

世界动作规划器:基于动作条件世界模型的通用决策方法

Xiangcheng Zhang, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。

Comments Project page at worldactionplanner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01427 2026-07-31 cs.AI 版本更新 70%

A Tale of LLMs and Induced Small Proxies: Scalable Small Language Models for Knowledge Mining

小型语言模型代理实现高效高质量的知识挖掘

Sipeng Zhang, Longfei Yun, Zilong Wang, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carneigie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出Falconer框架,结合大语言模型的代理推理与轻量级代理模型,通过规划与标注实现可扩展的知识挖掘,在保持指令遵循精度的同时降低90%推理成本并加速20倍以上。

Comments Code available: https://github.com/LongfeiYun17/falconer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26494 2026-07-31 cs.AI cs.CL cs.LG 版本更新 67%

The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence

MiniMax-M2系列:小激活释放最大现实智能

Aili Chen, Aonian Li, Baichuan Zhou, Bangwei Gong, Binyang Jiang, Boji Dan, Changhao Zhang, Changqing Yu, Chao Wang, Cheng Ma, Cheng Zhong, Cheng Zhu, Chengjun Xiao, Chengyi Yang, Chengyu Du, Chenyang Zhang, Chi Zhang, Chuangyi Huang, Chunhao Zhang, Chunhui Du, Chunyu Zhao, Congchao Guo, Da Chen, Deming Ding, Dianjun Sun, Dong Li, Dongyu Zhang, Enhui Yang, Fei Yu, Guang Zheng, Guodong Zheng, Guohong Li, Haichao Zhu, Haigang Zhou, Haimo Zhang, Han Ding, Hao Zhang, Haohai Sun, Haolin Lyu, Haonan Lu, Haoyu Wang, Huajie Shi, Huiyang Li, Jiacheng Chen, Jian Zhang, Jiaqi Zhuang, Jiaren Cai, Jiaxin Pan, Jiayao Li, Jiayuan Song, Jichuan Zhang, Jie Wang, Jihao Gu, Jin Zhu, Jingwei Dong, Jingyang Li, Jingyu Zhang, Jingze Zhuang, Jinhao Tian, Jinli Liu, Jinyi Hu, Jun Tao, Jun Zhang, Junbin Ruan, Junhao Xu, Junjie Yan, Junteng Liu, Junxian He, Kang Xu, Ke Ji, Ke Yang, Kecheng Xiao, Keyu Duan, Keyu Li, Le Han, Letian Ruan, Li Yuan, Lianfei Yu, Liheng Feng, Lijie Mo, Lin Li, Linge Du, Lingye Bao, Lingyu Yang, Lingyuan Zhou, Loki, Lu Chen, Lunbin Zeng, Ming Li, Ming Zhong, Mingliang Tao, Mingyuan Chi, Mujie Lin, Nan Hu, Ningxin Chen, Peiyin Zhu, Peng Gao, Pengcheng Gao, Pengfei Li, Penglin Li, Pengyu Zhao, Qibin Ren, Qibing Ren, Qidi Xu, Qihan Ren, Qile Li, Qin Wang, Quanliang Chen, Qunhong Zeng, Rong Tian, Rongxin Guo, Rui Dong, Ruitao Leng, Ruize Zhang, Shanqi Liu, Shaoxiang Chen, Shaoyu Chen, Sheng Jia, Shun Yao, Shuoran Zhao, Shuqi Yu, Sichen Li, Sicheng Pan, Songquan Zhu, Tengfei Li, Tian Xie, Tiancheng Qin, Tianle Li, Tianrun Liang, Wei Liu, Weiqi Xu, Weitao Li, Weixiang Chen, Weiyu Cheng, Weiyu Zhang, Wenhu Chen, Wenqian Zhao, Xiancai Chen, Xiangjun Song, Xiangyuan Wang, Xianzhen Luo, Xiao Luo, Xiao Su, Xiaobo Li, Xiaodong Han, Xiaojie Wu, Xihao Song, Xingyi Han, Xinyu Guan, Xuan Lu, Xun Zou, Xunhao Lai, Xutong Li, Xuyang Shen, Yan Gong, Yan Ma, Yang Jiao, Yang Wang, Yang Xu, Yangsen Wang, Ye Tang, Yicheng Chen, Yihang Wang, Yinran Qiu, Yiqi Shi, Yiting Guo, Yiwen Huang, Yixuan Wang, Yongyi Hu, Yu Gao, Yu Zhang, Yuan Li, Yuanxiang Ying, Yuanzhen Zhang, Yubo Wang, Yuchen Song, Yufeng Yang, Yuhang Meng, Yuhang Miao, Yuhao Li, Yujie Liu, Yulin Hu, Yunan Huang, Yunji Li, Yunyi Huang, Yusen Zhang, Yusu Hong, Yutao Xie, Yutong Zhang, Yuwen Liao, Yuxuan Shi, Yuze Wenren, Zebin Li, Zehan Li, Zejian Luo, Zeyu Jin, Zeyuan Sun, Zhanpeng Zhou, Zhaochen Su, Zhendong Li, Zhengmao Zhu, Zhengyuan Peng, Zhenhua Fan, Zhi Zhang, Zhichao Xu, Zhiheng Lv, Zhikang Xu, Zhitao He, Zhiwei He, Zhongyuan Li, Zibo Gao, Zijia Wu, Zijian Song, Zijian Zhou, Zijun Sun, Zishan Huang, Ziying Chen, Ziyue Ge

机构 * MiniMax

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MiniMax-M2系列混合专家语言模型,通过小激活参数实现前沿性能,核心包括智能体驱动数据管道、可扩展强化学习系统Forge及自进化检查点M2.7。

Comments Technical Report. 35 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏