arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-12 至 2026-05-12 共收录 384 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 38 篇

2509.20863 2026-05-12 cs.CL 57%

GIFT: Guided Importance-Aware Fine-Tuning for Diffusion Language Models

GIFT: 用于扩散语言模型的引导重要性感知微调

Guowei Xu, Wenxin Xu, Jiawang Zhao, Kaisheng Ma

机构 * Institute for Interdisciplinary Information Sciences(交叉信息科学研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出GIFT方法,通过根据熵分配不同重要性权重来优化扩散语言模型的微调,从而在多个基准测试中优于标准SFT。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10064 2026-05-12 cs.AI 57%

MAGE: Multi-Agent Self-Evolution with Co-Evolutionary Knowledge Graphs

MAGE:多智能体自进化与共进化知识图谱

Ruiyi Yang, Zechen Li, Hao Xue, Imran Razzak, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 MAGE通过共进化知识图谱实现多智能体自进化,利用冻结弱骨干模型与任务级搜索带宽及技能级路由带宽协同更新,提升冻结学习者在多个领域任务中的表现。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05946 2026-05-12 cs.LG stat.ML 57%

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment

f-GRPO 与 beyond:基于发散性的强化学习算法用于通用大语言模型对齐

Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

机构 * Department of Statistics, Purdue University(普渡大学统计学系) Department of Statistics, Michigan State University(密歇根州立大学统计学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出f-GRPO和f-HAL算法,通过发散性估计提升大语言模型对齐效果,在数学推理任务中改进GRPO并缓解奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09012 2026-05-12 cs.AI 57%

Re$^2$Math: Benchmarking Theorem Retrieval in Research-Level Mathematics

Re²Math:研究级数学中的定理检索基准测试

Zicheng Lyu, Wenjie Yang, Shengzhong Zhang, Zengfeng Huang

机构 * Fudan University(复旦大学) Fudan University Shanghai Innovation Institute(复旦大学上海创新研究院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 Re²Math基准测试旨在评估从部分数学证明中检索工具的能力,通过构建包含层级上下文和可选泄漏控制锚点提示的实例,评估系统在检索文献支持的数学工具时的准确性与适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08873 2026-05-12 cs.LG stat.AP stat.ML 57%

CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization

CoDistill-GRPO:一种高效的群体相对策略优化共蒸馏方法

Soo Min Kwon, Ziteng Sun, Ananda Theertha Suresh, Himanshu Jain, Sanjiv Kumar

机构 * University of Michigan, Ann Arbor(密歇根大学,安阿伯分校) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出CoDistill-GRPO,通过同时训练大模型和小模型,利用精心设计的GRPO目标提升小模型性能,减少计算开销,在数学基准上显著优于标准GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08472 2026-05-12 cs.AI 57%

Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

中期使用自生成数据提升语言模型中的强化学习

Aswin RRV, Jacob Dineen, Divij Handa, Mihir Parmar, Ben Zhou, Swaroop Mishra, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究在强化学习前使用多样化的自生成数据提升语言模型的强化学习效果,通过自生成数据训练后,模型在数学推理等任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08399 2026-05-12 cs.AI 57%

CoCoDA: Co-evolving Compositional DAG for Tool-Augmented Agents

CoCoDA:用于工具增强代理的共进化组合DAG

Ziyang Yu, Qiyue Li, Liang Zhao

机构 * Emory University(埃默里大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 CoCoDA通过共进化规划器和工具库,利用组合代码DAG结构提升工具库检索效率和规划效果,实现在数学推理和代码任务中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01237 2026-05-12 cs.LG 57%

The Differences Between Direct Alignment Algorithms are a Blur

直接对齐算法之间的差异变得模糊

Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daniil Gavrilov

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文系统比较了直接对齐算法,发现排名目标是影响对齐质量的主要因素,而特定的标量分数次之。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 10 篇

2603.02676 2026-05-12 cs.CL cs.AI 81%

ITLC at SemEval-2026 Task 11: Normalization and Deterministic Parsing for Formal Reasoning in LLMs

在SemEval-2026任务11中采用ITLC:为LLMs中的形式推理进行规范化和确定性解析

Wicaksono Leksono Muhamad, Joanito Agili Lopo, Tack Hwa Wong, Muhammad Ravi Shulthan Habibi, Samuel Cahyawijaya

机构 * SEACrowd Mantera Studio Universiti Teknologi PETRONAS(普特拉联合大学) Universitas Indonesia(印度尼西亚大学) Cohere

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过显式结构抽象和确定性解析减少LLMs推理中的内容偏差,方法在SemEval-2026任务11中取得前五名,有效降低偏差并提供替代复杂微调的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04910 2026-05-12 cs.SE 80%

Reducing the Costs of Proof Synthesis on Rust Systems by Scaling Up a Seed Training Set

通过扩大种子训练集来降低Rust系统证明合成的成本

Nongyu Di, Tianyu Chen, Shan Lu, Shuai Lu, Yeyun Gong, Peng Cheng, Jacob R. Lorch, Yuan Yao, Xiaoxing Ma

专题命中 代码与定理证明 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出VeruSyn数据合成管道,通过自合成和教程合成扩大Verus验证工具的数据集,生成690万Rust程序及其形式化规格证明,提升代码生成模型的性价比和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23238 2026-05-12 cs.CR cs.AI 79%

Hiding in Plain Sight: Detectability-Aware Antidistillation of Reasoning Models

明目张胆:面向可检测性的推理模型抗蒸馏

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Yash Savani, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Stony Brook University(石溪大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种面向可检测性的抗蒸馏方法,通过Stackelberg博弈框架显式编码可检测性约束,以稀疏扰动替代全迹中毒,提升教师模型性能并降低防御可见性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21619 2026-05-12 cs.LG cs.AI cs.CL 67%

On the Overscaling Curse of Parallel Thinking: System Efficacy Contradicts Sample Efficiency

关于并行思维的过度扩展诅咒:系统效能与样本效率的矛盾

Yiming Wang, Zhuosheng Zhang, Rui Wang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究并行思维中系统效能与样本效率的矛盾,提出Latent Budget Predictor提升预算利用率,并引入Pre-decoding Budget Adaptation改进解码效率。

Comments 44 pages, 66 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09184 2026-05-12 cs.AI cs.CL cs.DB 62%

Open Ontologies: Tool-Augmented Ontology Engineering with Stable Matching Alignment

开放本体:基于稳定匹配对齐的工具增强本体工程

Fabio Rovai

机构 * The Tesseract Academy, London, United Kingdom(泰斯拉学院,伦敦,英国)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Open Ontologies系统,结合LLM驱动构建与形式OWL推理及本体对齐,发现稳定1对1匹配是本体对齐质量关键,且工具增强访问优于纯LLM解析。

Comments 10 pages, 6 tables. Code: https://github.com/fabio-rovai/open-ontologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09716 2026-05-12 cs.AI 57%

Medical Model Synthesis Architectures: A Case Study

医学模型合成架构:一种案例研究

Katherine M. Collins, Marlene Berke, Ilia Sucholutsky, Ayman Ali, Adrian Weller, Timothy J. O'Donnell, Tyler Brooke-Wilson, Lionel Wong, Joshua B. Tenenbaum

机构 * MIT(麻省理工学院) University of Cambridge(剑桥大学) Princeton University(普林斯顿大学) Duke University(杜克大学) The Alan Turing Institute(艾伦·图灵研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种框架,使AI系统能在不确定性下进行实用且形式透明的临床预测。通过语言模型检索知识并构建概率模型,实现校准和可验证的推理,用于鉴别诊断并讨论未来应用方向。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16708 2026-05-12 cs.CR cs.AI cs.MA 57%

Formal Policy Enforcement for Real-World Agentic Systems

面向现实代理系统的正式政策执行

Nils Palumbo, Sarthak Choudhary, Jihye Choi, Guy Amir, Prasad Chalasani, Somesh Jha

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Langroid

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于面向切面编程的框架,通过Datalog语言实现跨代理系统的政策执行,解决传统方法无法保证正式执行的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10074 2026-05-12 cs.CR cs.SE 50%

Agentic Fuzzing: Opportunities and Challenges

代理模糊测试:机遇与挑战

Junyoung Park, Insu Yun

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出代理模糊测试方法,通过历史漏洞引导深度代理进行推理,发现逻辑漏洞变种。AFuzz在V8引擎发现40个漏洞,获35000美元奖金,并被分配两个CVE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09794 2026-05-12 cs.IR 50%

LLM Agents Enable User-Governed Personalization Beyond Platform Boundaries

LLM代理使用户主导的个性化超越平台边界

Jiacheng Lin, Kun Qian, Arvind Srinivasan, Tian Wang, Fang Han, Changran Hu, Junze Liu, Ziyi Wang, Hanwen Xu, Mengmeng Xue, Shuo Yang, Hansi Zeng, Simon Sinong Zhan, Kai Zhong, Weiqi Zhang, Dakuo Wang, Tianhao Wang, Zhiyuan Li

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出用户主导的个性化方法,利用LLM代理整合跨平台和离线数据,突破平台限制,实现更全面的个性化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08694 2026-05-12 cs.SE 50%

A Learning Method for Symbolic Systems Using Large Language Models

基于大语言模型的符号系统学习方法

Jian Fang, Yixun Yao, Yingfei Xiong

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出LLM2Ltac,利用大语言模型作为智能合成器从数据中提取纯符号战术,提升符号证明器的自动证明能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 21 篇

2506.15787 2026-05-12 cs.AI cs.CL cs.LG 89%

SLR: Automated Synthesis for Scalable Logical Reasoning

SLR:可扩展逻辑推理中的自动化合成

Lukas Helff, Ahmad Omar, Felix Friedrich, Antonia Wüst, Hikaru Shindo, Rupert Mitchell, Tim Woydt, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting

机构 * TU Darmstadt(图宾根大学) DFKI(德意志联邦防务学院) Meta FAIR CERTAIN, Germany(德国CERTAIN) Lab1141 MPI-Inf(马克斯·普朗克研究所)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SLR通过可扩展逻辑推理系统自动化生成指令提示、验证程序和潜在真实规则,创建SLR-Bench基准测试,展示LLM在逻辑推理中的表现及课程学习提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18184 2026-05-12 cs.LG cs.AI 88%

ActivationReasoning: Logical Reasoning in Latent Activation Spaces

ActivationReasoning: 在潜在激活空间中的逻辑推理

Lukas Helff, Ruben Härle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia Wüst, Hikaru Shindo, Patrick Schramowski, Kristian Kersting

机构 * TU Darmstadt(图恩-达姆施塔特大学) Lab1141(Lab1141实验室) Aleph Alpha Research(Aleph Alpha研究) MPI-Inf, SIC(马克斯·普朗克研究所(MPI-Inf)) Meta FAIR Adobe Applied Research(Adobe应用研究) DFKI(DFKI研究所) CERTAIN, Germany(德国CERTAIN)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ActivationReasoning框架,通过在LLM的潜在空间中嵌入显式逻辑推理,提升模型的推理能力、可控性和对齐性,验证了在多跳推理、抽象与鲁棒性、自然语言推理及安全任务中的有效性。

Comments Proceedings of the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09678 2026-05-12 cs.AI 83%

Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities

荒诞世界:一种简单却强大的方法,用于将现实世界扭曲以探测LLM推理能力

Ryan Albright, Golam Md Muktadir, Zarif Ikram, S M Jubaer, Mehrab Hossain, Dianbo Liu

机构 * The Nueva School(新维学校) University of Southern California(南加州大学) Notre Dame College(诺特大学) Arizona State University(亚利桑那州立大学) National University of Singapore(新加坡国立大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出Absurd World框架,通过扭曲现实世界来测试LLM的推理能力,验证其在简单逻辑任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04142 2026-05-12 cs.CV cs.AI cs.LG 81%

Turning Drift into Constraint: Robust Reasoning Alignment in Non-Stationary Multi-Stream Environments

将漂移转化为约束:非稳态多流环境中的鲁棒推理对齐

Xiaoyu Yang, En Yu, Wei Duan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faulty of Engineering and Information Technology(工程与信息技术学院) University of Technology Sydney(悉尼技术大学) Australia(澳大利亚)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出APO框架,通过约束满足问题解决多源推理对齐问题,实验表明其在胸片解读中鲁棒性优于现有模型,并发布CXR-MAX基准测试集。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09419 2026-05-12 cs.AI 79%

From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay

从被动重用来主动推理:为神经符号经验回放构建大型语言模型

Yanan Xiao, Yixiang Tang, Zechen Feng, Lu Jiang, Minghao Yin, Pengyang Wang

机构 * Affiliation(机构1)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出神经符号经验回放框架,通过将经验回放从被动样本重用机制转变为知识构建的主动引擎,解决语言推理与数值优化的不兼容问题,提升样本效率和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09387 2026-05-12 cs.AI cs.RO 79%

NEXUS: Continual Learning of Symbolic Constraints for Safe and Robust Embodied Planning

NEXUS:用于安全和稳健体素规划的符号约束连续学习

Tiehan Cui, Peipei Liu, Yanxu Mao, Congying Liu, Mingzhe Xing, Datao You

机构 * School of Artificial Intelligence and Automation(人工智能与自动化学院) Huazhong University of Science and Technology(华中科技大学) School of Software(软件学院) Henan University(河南大学) Institute of Information Engineering(信息工程研究所) Chinese Academy of Sciences(中国科学院) School of Cyberspace Security(网络空间安全学院) University of the Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 逻辑推理 :planning(title,abstract);分类 cs.AI

AI总结 NEXUS通过模块化框架实现体素代理的连续学习,将符号 artifacts 用于符号 grounding 和知识演化,将概率风险评估转化为确定性硬约束,提升任务成功率并抵御对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09168 2026-05-12 cs.AI cs.LG 73%

CIVeX: Causal Intervention Verification for Language Agents

CIVeX:语言代理的因果干预验证

Fabio Rovai

机构 * The Tesseract Academy(泰塞克特学院)

专题命中 逻辑推理 :chain-of-thought(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 CIVeX通过结构因果查询验证语言代理的干预行动,解决因果效应识别问题,实验显示其在对抗性混淆下具有高准确性和可靠性。

Comments 16 pages, 3 figures. Includes Causal-ToolBench, IHDP, ZOZO Open Bandit, and LaLonde NSW evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08416 2026-05-12 cs.AI cs.CY cs.LG 73%

Alignment as Jurisprudence

对齐作为法学

Nicholas Caputo

机构 * Oxford Martin AI Governance Initiative(牛津马丁人工智能治理研究所)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨法学与对齐的相似结构,通过法律解释主义和宪法AI等方法,揭示两者在规则与案例互动中的价值,并指出AI如何改进法律理解和应用。

Journal ref 27 Yale Journal of Law and Technology 390 (Sept. 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09487 2026-05-12 cs.LG 70%

Kintsugi: Learning Policies by Repairing Executable Knowledge Bases

Kintsugi: 通过修复可执行知识库学习策略

Teng Cao, Yu Deng, Hikaru Shindo, Quentin Delfosse, Lanxi Wen, Suli Wang, Jannis Blüml, Christopher Tauchmann, Kristian Kersting

机构 * Artificial Intelligence and Machine Learning Lab, Technical University of Darmstadt, Germany(德累斯顿技术大学人工智能与机器学习实验室) Hessian Center for Artificial Intelligence (hessian.AI), Germany(黑森人工智能中心) Department of Computer Science, Technical University of Darmstadt, Germany(德累斯顿技术大学计算机科学系) Department of Computer Science, Technical University of Munich (TUM), Germany(慕尼黑技术大学计算机科学系) German Research Center for Artificial Intelligence (DFKI), Germany(德国人工智能研究中心) Centre for Cognitive Science, Technical University of Darmstadt, Germany(德累斯顿技术大学认知科学中心)

专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 Kintsugi提出一种白盒策略学习框架,通过验证器门控构建可执行知识库,以可组合的类型条目表示任务级策略知识,并通过局部类型编辑提升知识库,实现可检查、可编辑和可部署的策略改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09347 2026-05-12 cs.AI cs.LO 70%

Dsat: A Native SAT Solver for Discrete Logic

Dsat:用于离散逻辑的原生SAT求解器

Yaofang Zhang, Ken Zhou, Adnan Darwiche

机构 * Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种用于离散逻辑的原生SAT求解器,通过扩展布尔逻辑,允许变量取任意值,并通过与CSP求解器、布尔SAT求解器等的比较验证其有效性。

Comments To Appear at The International Conferences on Theory and Applications of Satisfiability Testing (SAT), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00953 2026-05-12 cs.LG 70%

SAGE: Agentic Framework for Interpretable and Clinically Translatable Computational Pathology Biomarker Discovery

SAGE:可解释且临床可转化的计算病理学生物标志物发现代理框架

Sahar Almahfouz Nasser, Juan Francisco Pesantez Borja, Jincheng Liu, Sandeep Manandhar, Shikhar Shiromani, Mohammad Tanvir Hasan, Zenghan Wang, Suman Ghosh, Jinchu Li, Xuejian Xu, Aniket Ramkrishnan Iyer, Naoto Tokuyama, Twisha Shah, Tilak Pathak, Soundharya Kumaresan, Yohei Abe, Himanshu Maurya, Anant Madabhushi

机构 * Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(NVIDIA公司) University of Arkansas at Little Rock(阿拉伯州立大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.LG

AI总结 SAGE通过生物证据引导生物标志物发现,结合多代理系统生成和评估假设,实现结构化、可追溯的病理学研究方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14044 2026-05-12 cs.AI cs.CR 70%

Multi-Stage Retrieval for Operational Technology Cybersecurity Compliance Using Large Language Models: A Railway Casestudy

基于大语言模型的多阶段检索在运营技术网络安全合规中的应用:铁路案例研究

Regan Bolton, Mohammadreza Sheikhfathollahi, Simon Parkinson, Dan Basher, Howard Parkinson

机构 * Digital Transit Limited, 3M Buckley Innovation Centre(数字交通有限公司,3M Buckley创新中心) Department of Computer Science at University of Huddersfield(赫德瑟尔大学计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型和多阶段检索提升铁路网络安全合规性验证,通过对比不同模型展示PCA在合规性验证中的有效性,建立评估指标并指出LLM在合规性验证中的优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏