arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5768 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5768 篇

1603.07704 2016-08-04 cs.AI cs.LG cs.NE 82%

Probabilistic Reasoning via Deep Learning: Neural Association Models

Quan Liu, Hui Jiang, Andrew Evdokimov, Zhen-Hua Ling, Xiaodan Zhu, Si Wei, Yu Hu

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Probabilistic reasoning, Winograd Schema Challenge, Deep learning, Neural Networks, Distributed Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12618 2026-06-18 cs.AI 新提交 81%

"Did you lie?" Evaluating Lie Detectors across Model Scale and Belief-Verified Model Organisms

“你撒谎了吗?”评估不同规模模型和信念验证模型生物体的谎言检测器

Alan Cooney, David Africa, Geoffrey Irving

机构 * AI Security Institute(AI安全研究所)

专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究通过构建13个信念可验证的推理模型生物体和多样化提示撒谎测试集,评估了四种谎言检测器在不同规模模型上的表现,发现基于激活和概率的检测器在训练模型生物体上性能显著下降,而思维链法官保持较强性能,但存在伪影。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16310 2026-05-12 cs.SE cs.AI 81%

An Insight into Security Code Review with LLMs: Capabilities, Obstacles, and Influential Factors

通过大语言模型进行安全代码审查的洞察:能力、障碍及影响因素

Jiaxin Yu, Peng Liang, Yujia Fu, Amjed Tahir, Mojtaba Shahin, Chong Wang, Yangxiao Cai

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机科学学院) School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) School of Computing Technologies, RMIT University, Australia(皇家墨尔本理工学院计算技术学院)

专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文通过实证研究探讨大语言模型在安全代码审查中的潜力,比较了七种LLM与静态分析工具的性能,发现LLM在检测安全缺陷方面表现优异,且特定提示策略对性能有显著影响。

Comments 30 pages, 13 images, 10 tables, Manuscript revision submitted to a journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00127 2026-04-28 cs.SE cs.AI cs.PL 81%

Generating Verifiable Chain of Thoughts from Exection-Traces

从执行轨迹生成可验证的推理链

Shailja Thakur, Vaibhav Saxena, Rohan Kulkarni, Shivdeep Singh, Parameswaran Selvam, Hima Patel, Hiroshi Kanayama

机构 * IBM Research, India(印度IBM研究院) IBM Research, Japan(日本IBM研究院)

专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出通过生成执行轨迹验证的推理链,提升模型在代码推理和生成中的准确性,实验显示验证质量显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08143 2023-12-27 cs.CL cs.AI cs.LG 81%

Can large language models reason about medical questions?

Valentin Liévin, Christoffer Egeberg Hother, Andreas Geert Motzfeldt, Ole Winther

专题命中 其他推理 :CoT(abstract,comments);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 37 pages, 23 figures. v1: results using InstructGPT, v2.0: added the Codex experiments, v2.1: added the missing test MedMCQA results for Codex 5-shot CoT and using k=100 samples, v3.0: added results for open source models -- ready for publication (final version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13315 2026-08-14 cs.GT cs.AI cs.LG cs.SY eess.SY 新提交 81%

Keep, Customize, or Exit: Default Design and Token Pricing in LLM Reasoning Services

保留、定制还是退出:大语言模型推理服务中的默认设计与代币定价

Ahmet Bugra Gundogan, Yigit Turkmen, Melih Bastopcu

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LLM推理服务的供需交互建立Stackelberg博弈模型,推导最优解,明确默认设置的影响条件,实验验证模型并展示均衡相关因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26502 2026-08-11 cs.AI cs.CL 版本更新 81%

Humans Disengage, Reasoning Models Persist: Separating Difficulty Registration from Deliberation Allocation

人类放弃,推理模型坚持:将难度登记与深思分配分离

Han-yu Wang

机构 * The University of Hong Kong(香港大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过分离难度登记与深思分配,发现人类与大型推理模型(LRM)在问题解决中的时间/令牌分配模式相反:人类在错误问题上用时更少,而LRM在错误问题上使用更多令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05583 2026-08-07 cs.CY cs.AI cs.LG 新提交 81%

The Judgment-Consequence Gap: LLM Moral Reasoning in Healthcare Decisions

判断-结果差距:医疗决策中的大语言模型道德推理

Hadi Hosseini, Samarth Khanna, Leona Pierce

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究发现LLMs在医疗决策中存在判断-结果差距,即虽认同患者对危害健康行为负有责任,但拒绝将该判断用于稀缺医疗资源分配,且随推理能力提升会放大与人类的道德分歧。

Comments Accepted at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03057 2026-08-07 stat.ML cs.AI cs.LG math.ST stat.TH 版本更新 81%

A note on conditional PAC-efficient reasoning in large language model routing

关于大语言模型中条件PAC有效推理不可能性的注记

Hao Zeng, Bingyi Jing

机构 * Department of Statistics and Data Science(统计与数据科学系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究证明了在无分布设定下,大语言模型无法实现条件PAC有效推理,指出任何满足此条件的算法必须依赖专家模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04160 2026-08-06 cs.CL cs.LG 新提交 81%

Mind the Cap: Output-Budget Regimes Change the Measured Multilingual Reasoning Gap

注意输出上限:输出预算机制会改变测得的多语言推理差距

Ankit Goyal, Jaideep Ray

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究发现多语言推理差距受输出token预算机制影响,通过固定Qwen模型的预算峰值等实验,提出应将输出上限作为独立变量,报告不同预算机制下的准确率。

Comments 15 pages, 2 figures, 11 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12503 2026-08-06 cs.CL cs.AI 版本更新 81%

Topology-Aware Reasoning over Incomplete Knowledge Graph with Graph-Based Soft Prompting

基于拓扑的不完整知识图谱推理与图基软提示

Shuai Wang, Xixi Wang, Yinan Yu

机构 * Chalmers University of Technology and University of Gothenburg, Sweden(楚姆勒大学技术学院和哥德堡大学,瑞典) Technical University of Denmark, Kgs. Lyngby, Denmark(丹麦技术大学,基斯勒吕辛,丹麦)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于图的软提示框架,通过图神经网络编码子图生成软提示,使LLM在更丰富的结构上下文中推理,减少缺失边的影响,提升多跳KBQA性能。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01017 2026-08-04 cs.CL cs.AI 新提交 81%

Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy

大模型为何妥协:医学谄媚背后的对话因素与推理

Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho

机构 * Virginia Tech(弗吉尼亚理工大学) Shanghai Tongren Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属同仁医院) Emory University(埃默里大学)

专题命中 其他推理 :reasoning(title);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究发现医学谄媚是对话属性而非模型属性,通过5个开放权重模型和500个MedQuAD问题的120万次试验,揭示了对话因素对医学谄媚的影响及思维链轨迹的解释。

Comments 21 pages, 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03320 2026-08-04 cs.CL cs.AI 版本更新 81%

From We to Me: Theory Informed Narrative Shift with Abductive Reasoning

从‘我们’到‘我’:基于演绎推理的理论指导叙事转变

Jaikrishna Manojkumar Patil, Divyagna Bavikadi, Kaustuv Mukherji, Ashby Steward-Nolan, Peggy-Jean Allin, Tumininu Awonuga, Joshua Garland, Paulo Shakarian

机构 * Syracuse University(苏塞克斯大学) Arizona State University(亚利桑那州立大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于演绎推理和社会科学理论的神经符号方法,用于改进大型语言模型的叙述转变能力,在多个模型上实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31413 2026-07-31 cs.AI cs.LG 版本更新 81%

Learning to Select, Not Relearn: Hard-Routed Mixtures of Reasoning LoRAs

学会选择,而非重新学习:硬路由推理LoRA混合

Seyed Alireza Molavi, Zhan Su, Yan Hu, Peyman Sheikholharam Mashhadi, Stefan Byttner, Prayag Tiwari

机构 * Halmstad University(哈尔姆斯塔德大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出硬路由MoR-LoRA框架,通过硬top-1路由组合冻结的推理LoRA专家,保留专家行为且可训练参数少于软路由方法。

Comments Code available at: https://github.com/sar-molavi/hard-routed-mor-lora

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23440 2026-07-28 cs.CL cs.AI 新提交 81%

Reasoning or Memorization: Can LLMs Understand and Generate Chinese Xiehouyu Riddles?

推理还是记忆:大语言模型能理解并生成中国歇后语谜语吗?

Hai Hu, Siyuan Song, Chongtian Shao, Kejia Zhang, Tianjian Zhu, Xiaojing Zhao

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过在新歇后语游戏中测试大语言模型,用多项选择题、自由形式解释生成和新歇后语创作评估其能力,发现前沿中文模型记忆能力较强,新歇后语创作中Gemini 3.1 Pro表现出色,但LLMs整体创造力仍落后于人类专家,凸显数据污染对评估LLMs推理能力的影响。

Comments 20 pages; exp 3 is work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20440 2026-07-24 cs.CL cs.AI 新提交 81%

Answer-then-Edit: Reasoning Skeleton Editing for Anti-Distillation with Preserved Utility

先回答再编辑:用于保留效用的反蒸馏的推理骨架编辑

Fan Li, Mengting Pan, Sijia Xu, Xiaoyang Wang, Chen Chen, Wenjie Zhang

机构 * School of Computer Science and Engineering, UNSW Sydney(新南威尔士大学计算机科学与工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对专有大语言模型易受知识蒸馏影响的问题,提出骨架引导推理编辑框架SGRE,通过先回答再编辑的方式,借鉴认知负荷理论对推理痕迹进行修改,在降低蒸馏效果的同时保持推理准确性和痕迹自然度。

Comments 21 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18142 2026-07-21 cs.CV cs.AI cs.CL cs.MA 新提交 81%

O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

O-VAD:通过以对象为中心的跟踪和推理进行工业视频异常检测

Mei Yuan, Qi Long, Qifeng Wu, Zhenyang Li, Yizhou Zhao, Lei Wang, Yang Liu, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Griffith University(格里菲斯大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对工业视频异常检测,现有基于VLM的方法在工业场景中性能不佳的问题,提出无训练的智能框架O-VAD,通过跟踪对象时空动态和推理状态轨迹来检测异常,在多数据集实验中优于多种方法且能提供可解释报告。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16451 2026-07-21 cs.CL cs.AI 新提交 81%

Committed Before Reasoning: Behavioral Reproduction and Preliminary Activation-Level Evidence of Answer Pre-Commitment in an Open-Weight LLM

推理前先承诺:开放权重语言模型中答案预承诺的行为再现及初步激活水平证据

Heejin Jo

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究聊天模型在简单问题上先承诺答案而非推导的现象,通过行为再现和初步激活水平证据揭示错误承诺情况,还指出方法学上问题措辞对结果的影响,强调阳性对照对解读阴性预言机结果的重要性。

Comments 8 pages. Code, data, and all reported statistics: https://github.com/JO-HEEJIN/interview_mate/tree/docs/car-wash-repro/car_wash/paper_4

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12267 2026-07-15 cs.LG cs.AI 新提交 81%

Track, Rank, Crack: Epistemic Working Memory Scales Multi-Hop Reasoning in Language Agents

追踪、排序、决断:认知工作记忆对语言智能体中的多跳推理进行衡量

Ning Liu

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言智能体多跳推理链变长性能下降问题,提出SLEUTH方法通过结构化认知工作记忆提升推理,经实验优势随难度增加,还发现证据充分性问题及解决办法,表明组织推理方式是扩展多跳推理关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11875 2026-07-15 cs.LG cs.AI 版本更新 81%

Invariant Learning Dynamics of Transformers in Inductive Reasoning Tasks

归纳推理任务中Transformer的不变学习动态

Tiberiu Musat, Tiago Pimentel, Nicolas Zucchet, Thomas Hofmann

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford(斯坦福大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出理论框架解释Transformer语言模型归纳推理能力,研究广义归纳任务,证明其训练动态可限制在低维不变流形,刻画数据统计对学习竞争的影响,探讨初始化作用并展示坐标框架用途,向Transformer学习预测理论迈进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24653 2026-07-14 cs.LG cs.AI 版本更新 81%

Unveiling the Mechanisms of Multi-Hop Reasoning in Transformers via Identity Bridge

通过身份桥揭示Transformer中多跳推理的机制

Pengxiao Lin, Zheng-An Chen, Zhi-Qin John Xu

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University(上海交通大学自然科学研究院) Shanghai Seres Information Technology Co., Ltd, Shanghai 200040, China(上海塞瑞斯信息技术有限公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大型语言模型多跳推理中两跳推理诅咒现象,引入身份桥进行最小监督,使单层Transformer能实现分布外两跳泛化,通过理论和实证分析揭示其机制及效果,并扩展到主流LLMs的实际设置。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09623 2026-07-13 cs.CL cs.AI 新提交 81%

Task-Specific Multimodal Question Answering Agents via Confidence Calibration and Incremental Reasoning for QANTA 2026

通过置信度校准和增量推理实现特定任务的多模态问答代理,用于QANTA 2026

Nirjhar Das, Md. Al-Mamun Provath

机构 * Department of Computer Science Engineering, Chittagong University of Engineering \& Technology, Chattogram, Bangladesh

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对QANTA 2026共享挑战,开发特定任务双代理架构,抢答代理用带置信度校准的模型及数值推理策略,加分代理用多种推理整合信息,强调仅托管环境下的高效推理与校准,系统取得高分,证明轻量级策略在资源受限问答中性能强。

Comments 10 pages, 1 figure. Accepted at the EMM-QA 2026 Workshop, ICML 2026 (Non-Archival). Rank #1 overall system in the QANTA 2026 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22294 2026-07-13 cs.CL cs.AI 版本更新 81%

SLIDERS: Systematic Reviews via Automated Evidence Synthesis and Reconciliation

上下文从不够长:用于长文档集可扩展问答的结构化推理

Harshit Joshi, Priyank Shethia, Jadelynn Dao, Monica S. Lam

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SLIDERS框架,通过结构化推理解决长文档集问答问题,利用关系数据库和SQL实现可扩展推理,优于现有基准。

Comments 53 pages (10 main), preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08059 2026-07-10 cs.LG cs.AI 新提交 81%

When Thinking Hurts: Epistemic Signals in the Reasoning Chains of Visual Language Models

当思考有害时:视觉语言模型推理链中的认知信号

Mayank Singal

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型推理链中的认知信号,通过在相同对抗样本上运行四个模型,发现不同模型的答案熵行为模式有差异,思考链熵在部分情况下优于答案熵,还发现结构化弃权及其实用弃权门可提升准确率。

Comments 7 pages, 2 figures, 5 tables. Oral paper at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML@ICML 2026), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29425 2026-06-30 cs.AI cs.CL cs.MA cs.MM 81%

Mixture of Debaters: Learn to Debate at Architectural Level in Multi-Agent Reasoning

辩论者混合:在多智能体推理中实现架构级别的辩论学习

Dayong Liang, Kaisong Gong, Yi Cai, Changmeng Zheng, Xiao-Yong Wei

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Mixture of Debaters框架,通过混合专家范式在单一模型内实现动态自我辩论,解决静态架构和高计算开销问题,在多项基准上以更低延迟和令牌消耗取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28392 2026-06-30 cs.CV cs.AI cs.LG 81%

RADIANT-PET: Reasoning-Augmented PET/CT Lesion Segmentation with Large Language Models and Reinforcement Learning

RADIANT-PET:结合大语言模型和强化学习的推理增强型PET/CT病灶分割

Jiasheng Wang, Tanun Jitwatcharakomol, Piyawadee Jongpradubgiat, Simeng Zhu

机构 * Division of Hematology, The Ohio State University Comprehensive Cancer Center(血液科,俄亥俄州立大学综合癌症中心) Department of Radiology, Mahidol University(医学放射科,玛希多大学) Department of Radiology, Mettapracharak Hospital(医学放射科,Mettapracharak医院) Department of Radiation Oncology, The Ohio State University Comprehensive Cancer Center(放射肿瘤科,俄亥俄州立大学综合癌症中心)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出RADIANT-PET框架,通过大语言模型和强化学习对候选摄取区域进行推理分类,抑制生理性假阳性,提升PET/CT病灶分割准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00305 2026-06-30 cs.CL cs.AI 81%

Bridging Reasoning Trajectories in On-Policy Distillation via Near-Future Guidance

通过近未来指导桥接在线策略蒸馏中的推理轨迹

Yuxuan Jiang, Francis Ferraro

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对在线策略蒸馏中令牌级学习信号无法有效桥接推理轨迹的问题,提出基于近未来轨迹信息的轨迹感知在线策略蒸馏方法,显著提升大语言模型推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26530 2026-06-29 cs.CL cs.AI 新提交 81%

DiARC: Distinguishing Positive and Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models

DiARC:区分正负样本有助于提升大型语言模型的类ARC推理能力

Yuxuan Yang, Feiyang Li, Yile Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DiARC方法,通过构建偏好对(正负样本)来提升大型语言模型在类ARC任务上的推理能力,实验表明该方法在多个基准上持续改进基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26986 2026-06-26 cs.CL cs.AI 新提交 81%

ReaORE: Reasoning-Guided Progressive Open Relation Extraction Empowered by Large Reasoning Models

ReaORE: 基于大推理模型的推理引导渐进式开放关系抽取

Xin Lin, Liang Zhang, Guoqi Ma, Hongyao Tu, Jinsong Su

机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康医疗大数据国家研究院) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出ReaORE框架,通过粗到细的关系推理(关系过滤与关系预测)解决开放关系抽取中关系标签生成和易混淆关系区分难题,在数据集上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25832 2026-06-26 cs.LG cs.AI 新提交 81%

MiniOpt: Reasoning to Model and Solve General Optimization Problems with Limited Resources

MiniOpt: 在有限资源下推理建模与求解通用优化问题

Ke Zhao, Zixiang Di, Hong Qian, Xiang Shu, Yaolin Wen, Qitao Shi, Bingdong Li, Xingyu Lu, Xiangfeng Wang, Jun Zhou, Ke Tang, Yang Yu

机构 * East China Normal University(华东师范大学) AntGroup(蚂蚁集团) Southern University of Science and Technology(南方科技大学) Nanjing University(南京大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出MiniOpt强化学习框架,通过“推理-建模-求解”范式,结合层次化奖励函数OptReward和优化导向策略优化,使3B参数模型在多种优化问题上达到强泛化,且训练资源需求低。

Comments 20 pages, 9 figures, 11 tables, project: https://github.com/Hsiang-1/MiniOpt

详情

展开后加载摘要…

URL PDF HTML 收藏