arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-23 至 2026-07-23 共收录 85 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2607.19358 2026-07-23 cs.AI 新提交 85%

LISA: Linear-Indexed Sparse Attention for Efficient Long-Context Reasoning

LISA:用于高效长上下文推理的线性索引稀疏注意力

Yu Zhao, Zekun Zhang, Fan Jiang, Bo Zeng, Linlong Xu, Shimin Shan, Yu Liu, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业集团) School of Software Technology, Dalian University of Technology(大连理工大学软件学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 研究针对长思维链推理模型中标准自注意力计算复杂度高的问题,提出LISA模块,它集成线性注意力模块和闪电索引器,经两阶段训练,能降低推理复杂度,在特定模型上实现推理加速并提升性能。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19962 2026-07-23 cs.AI 新提交 79%

EvoThink: Evolving Thinking in Large Reasoning Models via Self-Pruning and Aha-Moment Preference Optimization

EvoThink:通过自剪枝和顿悟时刻偏好优化在大型推理模型中进化思维

Xinbang Dai, Zheyu Xin, Huikang Hu, Lin Ren, Rihui Jin, Guohui Xiao, Guilin Qi, Kuicai Dong, Zhaocheng Du, Yuyang Zhang

机构 * Southeast University(东南大学) Noah’s Ark Lab(诺亚方舟实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对大型推理模型过度思考问题,提出EvoThink框架,含自剪枝训练和顿悟时刻偏好优化两个关键组件,能减少冗余验证、探索新推理路径,经评估可提高推理效率与能力。

Comments 9 pages, 7 figures, accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30420 2026-07-23 cs.LG 版本更新 79%

Experience Augmented Policy Optimization for LLM Reasoning

经验增强策略优化用于大语言模型推理

Jinda Lu, Kexin Huang, Junkang Wu, Shuo Yang, Jinghan Li, Chiyu Ma, Shaohang Wei, Xiang Wang, Guoyin Wang, Jingren Zhou

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出经验增强策略优化(EAPO),通过将先验RL优化策略作为动作级经验先验并在关键决策点选择性注入,配合自适应重要性采样,解决RLVR中采样成本高和经验利用不足问题,在多个基准上提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20372 2026-07-23 cs.CL 新提交 70%

Notes to Self: Can LLMs Benefit from Experiential Abstractions?

给自己的笔记:大语言模型能从经验抽象中受益吗?

Chang Liu, Xinyu Li, Artur Dubrawski

机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03472 2026-07-23 cs.CL cs.AI 版本更新 62%

Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution

词汇丢弃:LLM共同进化中的课程多样性

Jacob Dineen, Aswin RRV, Zhikun Xu, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM共同进化中问题多样性崩溃的问题,提出词汇丢弃机制,通过在策略训练和课程生成时随机掩码输出logits维持多样性,在数学推理任务上提升求解器性能平均+4.4点。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20327 2026-07-23 cs.CL 新提交 57%

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

PyroDash:具有成本效益的令牌级小语言模型与大语言模型协作推理

Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong, Sicong Xia, Jianyao Ma, Yicheng Ding

机构 * Pyromind Dynamics Inc.(Pyromind动力学公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对大语言模型推理成本高、小语言模型可靠性低的问题,提出PyroDash框架,通过令牌级协作推理,分三阶段训练小语言模型,在数学推理基准测试中能支持不同操作点,可减少大语言模型使用并保持推理性能。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2509.02124 2026-07-23 cs.NI cs.ET 版本更新 50%

FlexNGIA 2.0: Redesigning the Internet with Agentic AI -- Protocols, Services, and Traffic Engineering Designed, Deployed, and Managed by AI

FlexNGIA 2.0:利用智能AI重新设计互联网——由AI设计、部署和管理的协议、服务和流量工程

Mohamed Faten Zhani, Younes Korbi, Yamen Mkadem

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 面对沉浸式通信需求等带来的契机,FlexNGIA 2.0利用基于大语言模型的AI智能体自主编排、配置和演进网络,可动态调整多种网络方案。通过初步实验证明其能力,为新型智能AI驱动网络奠基,也指出了相关关键研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2607.20268 2026-07-23 cs.AI cs.CL 新提交 86%

PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity

PoTRE:受认知异质性启发的测试时推理

Anmol Kankariya, Sercan Ö. Arık

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型复杂推理难题,提出PoTRE异构框架,将推理解耦为四个智能体,经任务自适应聚合层协调,在三个前沿基准测试中评估,在HLE上达最优准确率,以相似或更少令牌提升推理性能。

Comments Accepted at Transactions on Machine Learning Research (TMLR 2026)

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11338 2026-07-23 cs.AI 版本更新 83%

AutoVSR: Automatic Visual-to-Symbolic Reasoning for Symbolic Expression Generation from Circuit Schematic

AutoVSR:用于从电路原理图生成符号表达式的自动视觉到符号推理

Zhe Xiao, Longfei Li, Xu He, Haoying Wu, Zixing Zhang, Mingyu Liu

机构 * Hunan University, Changsha, China(湖南大学) Wuhan University of Technology, Wuhan, China(武汉理工大学) Huazhong University of Science and Technology, Wuhan, China(华中科技大学)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 研究旨在解决从电路原理图生成符号表达式的难题,提出AutoVSR框架,利用视觉语言模型,通过重建电路图为可执行中间表示并借助符号求解器推理,引入两项创新提升准确率,在任务中表现优于其他方法,还降低了推理成本和提高了计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19365 2026-07-23 cs.AI 新提交 57%

Logic-Guided Data Extraction with Answer Set Programming and Large Language Models

使用回答集编程和大语言模型进行逻辑引导的数据提取

Mario Alviano, Lorenzo Grillo, Nicola Leone, Fabrizio Lo Scudo

机构 * University of Calabria(卡拉布里亚大学) University of Campania Luigi Vanvitelli(坎帕尼亚路易吉·万维泰利大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型用于语义数据提取时的不足,提出结合回答集编程与大语言模型的逻辑引导数据提取框架,通过交错调用与推导减少大语言模型调用次数,提高提取质量。

Comments 42nd International Conference on Logic Programming, to appear in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19827 2026-07-23 cs.RO cs.CY 新提交 50%

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

临床路径作为医院病房物理人工智能的安全规范

Gabriele Franchini, Giulio Mallardi, Michele De Carolis, Filippo Lanubile

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究针对医院病房物理人工智能系统的安全挑战,提出将临床路径作为安全规范,构建集成多种组件的概念性机器人架构,用运行时安全监视器结合多种方法识别安全违规,助力护理人员并为安全物理人工智能做贡献。

Comments 4 pages, 3 figures. Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), held in conjunction with IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 25 篇

2607.19194 2026-07-23 cs.RO cs.CV 版本更新 92%

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency

基于结构化场景知识和可验证推理-行动一致性的自动驾驶认知双过程规划

Zhongyao Yang, Haoyu Li, Yu Yan, Zhuangxuan Yu, Jiangfeng Nan, Jinrui Nan

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) National Engineering Research Center of Electric Vehicles, Beijing Institute of Technology(北京理工大学电动车辆国家工程研究中心) School of Mechanical Engineering, Southeast University(东南大学机械工程学院)

专题命中 规划推理 :CoT(summary_cn,abstract);reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract)

AI总结 研究自动驾驶高级规划问题,提出认知双过程规划框架,用S-CoT模式表示场景知识,通过自动数据引擎、视觉仲裁器及验证器实现自适应推理和规则验证,提升规划准确性、逻辑一致性并降低延迟,明确性能下降条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05592 2026-07-23 cs.AI cs.CL cs.LG cs.MA 版本更新 87%

In-the-Flow Agentic System Optimization for Effective Planning and Tool Use

用于有效规划和工具使用的流内智能体系统优化

Zhuofeng Li, Haoxiang Zhang, Seungju Han, Sheng Liu, Jianwen Xie, Yu Zhang, Yejin Choi, James Zou, Pan Lu

机构 * Stanford University(斯坦福大学) Texas A&M University(德克萨斯农工大学) UC San Diego(圣地亚哥大学) Lambda Website(Lambda网站)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型中工具增强方法的不足,提出可训练的流内智能体框架AgentFlow及Flow-GRPO训练方法,通过协调模块优化规划器,在多基准测试中表现优异,展现流内优化优势。

Comments 47 pages, 12 figures. ICLR 2026 Oral. Project website: https://agentflow.stanford.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20061 2026-07-23 cs.RO 新提交 83%

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

ReferTrack:用于具身视觉跟踪的先指认后跟踪

Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ, Yuchen Zhou, Yonggen Ling, Hong Zhang

机构 * SUSTech(南方科技大学) Tencent Robotics X(腾讯机器人X实验室) Peking University(北京大学) Futian Laboratory(福田实验室)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 研究针对具身视觉跟踪问题,提出ReferTrack先指认后跟踪范式,用单个摄像头,先选目标再解码跟踪航点,通过滑动窗口队列保留运动线索,经数据集协同训练增强识别,在EVT - Bench上达先进单视图性能并验证了迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19523 2026-07-23 cs.CL 新提交 79%

When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play

当推理缩小行动范围:大语言模型游戏中的多样性崩溃

Junyi Sha, Renfei Tan, David Simchi-Levi

机构 * Institute for Data, Systems, and Society(数据、系统与社会研究所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究大语言模型游戏中监督微调对行为多样性的影响,发现推理模式生成常抑制行动多样性,标准SFT会致过早多样性崩溃,行动增强可部分缓解,指出窄支持模仿是策略崩溃源,SFT中保持行动支持对维持探索行为很重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31119 2026-07-23 cs.RO cs.LG 版本更新 79%

Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning

不要愚弄我两次:通过经验驱动推理在野外适应逆境

Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer

机构 * Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院工程设计系,马德拉斯) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 规划推理 :reasoning(title);planning(abstract);分类 cs.LG

AI总结 提出一种持续学习框架,使移动机器人能够在线从干扰中学习,通过语义将异常行为归因于原因,从而更好地预测和规划未来。

Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19966 2026-07-23 cs.SE 新提交 78%

Towards Reliable C-to-Rust Translation with Rule-Guided Reasoning and Reinforcement Learning

通过规则引导推理和强化学习实现可靠的C到Rust翻译

Feng Luo, Jiachen Liu, Cuiyun Gao, Jia Feng, Kui Liu

专题命中 规划推理 :reasoning(title,abstract)

AI总结 研究旨在解决利用大语言模型进行C到Rust自动翻译时存在的问题,提出TRAVEL框架,通过规则引导推理和强化学习两个模块,在多个数据集上评估,该框架提升了翻译准确率、成功率并降低不安全率。

Comments Accepted to the Industry Showcase of ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19650 2026-07-23 cs.RO cs.MA 新提交 78%

Remote ID Spoofing-Aware Trajectory Planning for Small Unmanned Aerial Systems

小型无人机系统的远程ID欺骗感知轨迹规划

Jeremiah Webb, Bryce Bjorkman, Abel Diaz Gonzalez, Austin Coursey, Noah Dahle, Kailani Lemieux Mack, Filippos Fotiadis, Gautam Biswas, Bryan C. Ward, Abenezer Taye

专题命中 规划推理 :planning(title,abstract)

AI总结 针对小型无人机在RID位置欺骗攻击下的轨迹规划问题,提出分散式欺骗感知框架,利用物理层观测评估广播可信度,检测定位欺骗代理,集成到规划器中,仿真显示可减少近空中碰撞事件且保持计算效率。

Comments 9 pages, 3 figures, to be published in IEEE DASC 2026 Conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19633 2026-07-23 cs.RO 新提交 78%

LENS: LLM-guided Environment Simplification for Planning and Control in Clutter

LENS:用于杂乱环境中规划与控制的大语言模型引导的环境简化

Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 针对现实世界多物体杂乱环境处理难题,提出LENS方法,通过大语言模型引导自动生成特定场景和任务的自适应更新抽象,经实验验证其能改进多种模型在高度杂乱操纵场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18564 2026-07-23 cs.HC 版本更新 78%

HALO: Interactive Co-abductive Reasoning in Scientific Hypothesis Generation

HALO:科学假设生成中的交互式协同溯因推理

Youngseung Jeon, Kat Limqueco, JiaSyuan Chang, Xiang 'Anthony' Chen

专题命中 规划推理 :reasoning(title,abstract)

AI总结 该研究针对科学假设生成效率低的问题,提出协同溯因框架,构建HALO系统用于药物发现中的分子假设生成,经专家研究验证,此系统能促进溯因推理,帮助产生更高质量、更多样的候选分子。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20352 2026-07-23 cs.RO 新提交 71%

Distributed Motion Planning with Safety Guarantees for Self-Reconfiguring Robotic Boats

具有安全保障的自重构机器人船分布式运动规划

Alejandro Gonzalez-Garcia, Wei Wang, Wei Xiao, Wilm Decre, Jan Swevers, Carlo Ratti, Daniela Rus

机构 * KU Leuven(鲁汶大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学) SMART(新加坡制造技术研究院) SENSEable City Laboratory, Massachusetts Institute of Technology(麻省理工学院可感知城市实验室) Computer Science and Artificial Intelligence Lab (CSAIL), Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)

专题命中 规划推理 :planning(title)

AI总结 研究水生自重构机器人多智能体形状形成与重构问题,提出将分布式MPC与CBF相结合的混合框架,利用ADMM求解MPC方案,通过局部优化和信息交换计算轨迹,并应用基于CBF的滤波器保障安全,经仿真和实验验证了框架的有效性与可扩展性。

Comments Submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18034 2026-07-23 cs.AI 版本更新 70%

AdaHome: An Adaptive Smart Home Assistant using Local Small Language Models

AdaHome:一种使用本地小语言模型的自适应智能家居助手

Eu Jin Lim, Zhaoxing Li, Sebastian Stein

机构 * University of Southampton(南安普顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究旨在解决智能家居助手问题,提出AdaHome,通过意图感知规划框架、草稿链策略及偏好适应机制,在本地小语言模型上实现高效决策与个性化,实验显示其在命令准确性、延迟及多轮场景中有良好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28445 2026-07-23 cs.SD cs.AI cs.CL cs.LG 版本更新 67%

LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features

基于多视角语音特征的LoRA微调大语言模型用于痴呆检测

Jonghyeon Park, Olivier Jiyoun Jung, Myungwoo Oh

机构 * NAVER Cloud(NAVER云) Division of Communication and Media, Ewha Womans University(通信与媒体系,成均馆大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LoRA微调LLM,通过统一提示整合ASR转录、话语主题、时间流畅度和音韵序列四种语音特征,实现多视角推理,在ADReSSo上F1达90.14%。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19974 2026-07-23 cs.LG cs.AI 新提交 62%

Time Series Network Utilization KPI Forecasting Using Advanced AI/ML Models

使用先进人工智能/机器学习模型的时间序列网络利用率关键绩效指标预测

Niraj Gadhe, Kirti Bhardwaj, Moulik Jain, Shubhi Sharma, Vinay Saini

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对数据密集型应用等导致的网络性能问题,通过评估季节性分解等多种模型,利用通用接口数据集在MAPE等指标上进行基准测试,给出模型准确性与计算效率权衡的见解,助相关人员选最佳预测模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19635 2026-07-23 cs.LG cs.AI 新提交 62%

Anatomy of a Sound Neural Reasoner: One-Shot Amortization, First-Pass Poisoning, and Search Inertness in Clue-Rich Completion

一个合理的神经推理器剖析:在富含线索的填数问题中的一次性摊销、首次通过中毒和搜索惰性

Aleksey Komissarov

机构 * Neapolis University, Pafos(帕福斯新帕福斯大学)

专题命中 规划推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究富含线索填数问题中神经推理器的表现,发现LDT存在首次通过中毒等问题,添加CoLT可减少无效推导,还给出两种干预措施提升准确率,指出类似LDT系统是一次性摊销预测器,搜索主要消除计算浪费。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19598 2026-07-23 cs.CL cs.AI 62%

Cross-Model Consistency of AI-Generated Exercise Prescriptions: A Repeated Generation Study Across Three Large Language Models

跨模型一致性分析:AI生成运动处方的重复生成研究:在三个大型语言模型间

Kihyuk Lee

机构 * Data Convergence Team, Office of Hospital Information, Seoul National University Bundang Hospital(数据融合团队,医院信息办公室,首尔国立大学医院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究比较了三种大型语言模型在重复生成运动处方时的一致性,发现GPT-4.1在语义相似度上最高,而Gemini 2.5 Flash表现出重复性,揭示了生成行为的差异,强调模型选择应作为临床决策。

Comments 24 Pages, 2 Figures, 6 Tables and 2 Supplementary Materials. v2: Removed personal contact information

Journal ref International Journal of Medical Informatics, 220 (2026) 106594

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16827 2026-07-23 cs.AI cs.CL 版本更新 62%

Prompt Programming for Cultural Bias and Alignment of Large Language Models

提示编程用于大型语言模型的文化偏差与对齐

Maksim Eren, Eric Michalak, Brian Cook, Johnny Seales

机构 * Information Systems and Modeling, Los Alamos National Laboratory(信息系统与建模,洛斯阿拉莫斯国家实验室) Advanced Research in Cyber Systems, Los Alamos National Laboratory(网络安全系统高级研究,洛斯阿拉莫斯国家实验室) Center for National Security and International Studies(国家安全与国际研究中心) Analytics Division, Los Alamos National Laboratory(分析部门,洛斯阿拉莫斯国家实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过提示编程优化大型语言模型的文化对齐,利用DSPy框架系统调整治文化偏差,实验表明提示优化优于传统手动提示工程,提升模型响应的可转移性与稳定性。

Comments 10 pages, pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06487 2026-07-23 cs.LG cs.AI 版本更新 62%

ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking

ArenaRL: 通过基于比赛的相对排名扩展强化学习以应对开放性智能体

Qiang Zhang, Boli Chen, Fanrui Zhang, Ruixue Ding, Shihang Wang, Qiuchen Wang, Yinfeng Huang, Haonan Zhang, Rongxiang Zhu, Pengyong Wang, Ailin Ren, Xin Li, Pengjun Xie, Jiawei Liu, Ning Guo, Jingren Zhou, Zheng-Jun Zha

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 ArenaRL通过基于比赛的相对排名机制,提升开放性智能体在复杂任务中的表现,实现效率与精度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19935 2026-07-23 cs.AI 新提交 57%

MOF-Sleuth: Tool-Grounded Reward Alignment for Explainable Fine-Grained MOF CIF Auditing

MOF-Sleuth:用于可解释细粒度MOF CIF审核的工具基础奖励对齐

Yu Liu, Zhiwei Yang, Diandian Guo, Kun Peng, Fangfang Yuan, Cong Cao, Chaozhuo Li, Zhiyuan Ma, Yanbing Liu, Guobin Zhao

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对MOF数据库CIF输入错误影响下游结果及人工检查的问题,提出MOF-Sleuth,通过强化引导CIF审核代理的两个模块,利用奖励引导强化学习将工具测量转化为监督,提升检测、归因及解释质量,在多基准测试中性能领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19742 2026-07-23 cs.CR cs.AI 新提交 57%

An Automated Framework for Extracting Reachable Attack Chains from Cyber Threat Intelligence Reports

一种从网络威胁情报报告中提取可达攻击链的自动化框架

Wenbo Hou, Ning Hu, Xueping Wang, Jiahao Gu, Wenjian Luo

机构 * Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东新型安全情报技术重点实验室) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) New Network Research Department(新网络研究部) Peng Cheng Laboratory(鹏城实验室) Great Bay University(大湾区大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对CTI报告非结构化无法用于自动化攻击路径推理的问题,提出将攻击步骤建模为含条件和行为的单元,经多阶段管道结合大语言模型提取并规范化,编译成规则推理,在数据集上有更好表现,能有效提取可达攻击链。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏