arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3024 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3024 篇

2608.03137 2026-08-05 cs.AI 新提交 57%

Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents

可验证记忆:为大语言模型智能体学习结合局部与全局验证器的统一记忆管理

Xiaolong Sun, Qichao Wang, Hangyu Li, Liang Chen

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 提出VerMem框架,用含七个原子操作的统一策略管理LTM等状态,结合局部与全局验证器训练,在多基准测试中性能与效率均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28942 2026-08-05 cs.AI 版本更新 57%

NeSyFS: A Neuro-symbolic Fast-Slow Thinking Framework for LLM Agent under Partial Observability

NeSyFS:部分可观测场景下LLM智能体的神经符号快慢思考框架

Duo Xu, Faramarz Fekri

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对部分可观测场景下LLM智能体的决策挑战,提出NeSyFS神经符号快慢思考框架,结合知识图谱、TSMC算法与反思模块,在三个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01763 2026-08-04 cs.CR cs.AI cs.LO cs.SE 新提交 57%

EntailLLM: Verifying LLM-Generated Vulnerability Discovery Paths with Domain Knowledge via Logic Programming

EntailLLM:通过逻辑编程结合领域知识验证大语言模型生成的漏洞发现路径

Kaustuv Mukherji, Jaikrishna Manojkumar Patil, Colton Payne, Paulo Shakarian, Dana Warmsley, Nigel Stepp, Evelyn Kim

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 EntailLLM通过逻辑编程结合领域知识验证LLM生成的漏洞发现路径,在三类CWE、四个LLM等多组实验中,将合并蕴含率从78%提升至98%,可端到端部署且无需逐设备调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01528 2026-08-04 cs.LG 新提交 57%

Gram-Space: Structure-Preserving Codebook Compression for Memory-Efficient Neuro-Symbolic AI

Gram-Space:面向内存高效神经符号AI的结构保持码本压缩

Weilun Wang, Wantong Li

机构 * University of California Riverside(加州大学河滨分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Gram-Space压缩框架,通过格拉姆-施密特正交化保留VSA所需点积结构,可降低神经符号AI模型GPU内存使用与推理延迟,提升硬件利用率。

Comments International Conference on Neuro-symbolic Systems (NeuS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00937 2026-08-04 cs.CR cs.AI cs.MA 新提交 57%

Neuro-Symbolic Participation Governance for Verifiable AI Agents in Open Digital Twin Ecosystems

开放数字孪生生态中可验证AI智能体的神经符号参与治理

Juan Li, Wei Cai, Yan Bai

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对开放数字孪生生态中AI智能体的验证需求,提出神经符号去中心化治理框架,结合神经推理与制度治理,通过区块链智能合约实现可审计参与,经原型验证可管控开销下保障合规协作。

Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026), Bellevue, WA, USA, October 4-7, 2026. 7 pages, 1 figure, 5 tables. Code: https://github.com/weicaiuw/verigov-ai (DOI: 10.5281/zenodo.21706699)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17999 2026-08-04 cs.AI cs.CV 版本更新 57%

Do Maps Still Matter for Machines: Revisiting the Role of Choropleth Maps in Foundation Model Spatial Understanding

地图对机器来说仍然重要吗:重新审视分级统计图在基础模型空间理解中的作用

Zhiwei Wei, Yonghe Sun, Zhenjia Liu, Wenjia Xu, Chao He, Weihua Dong, Chunbo Liu, Hua Liao

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨分级统计图对基础模型空间理解的作用,引入ChoroplethMap-Bench基准,在三种输入条件下评估22个模型,发现地图能显著提升空间推理,尤其结合符号数据及高层次空间模式理解任务时,证明地图是基础模型空间推理的重要外部表示。

Comments 34 pages, 4 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01132 2026-08-04 cs.CL 版本更新 57%

Don't Judge a Book by its Cover: Testing LLMs' Robustness Under Logical Obfuscation

不要只看封面判断一本书:测试LLMs在逻辑混淆下的鲁棒性

Abhilekh Borah, Shubhra Ghosh, Kedar Joshi, Aditya Kumar Guru, Kripabandhu Ghosh

机构 * Manipal University Jaipur(马纳普大学贾普尔分校) Indian Institute of Technology, Patna(印度理工学院帕坦分校) Indian Institute of Science Education and Research, Kolkata(印度科学教育与研究学院科钦分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出Logifus框架和LogiQAte基准,测试LLMs在逻辑混淆下的鲁棒性,发现混淆显著降低模型性能,揭示当前LLMs缺乏深度理解。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01982 2026-08-03 cs.CV cs.AI q-bio.BM 版本更新 57%

MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding

MolSight: 一种用于统一化学图像理解的图感知视觉语言模型

Wenda Wang, Yihan Tong, Yuwei Hu, Xuchen Pan, Zhewei Wei, Yaliang Li, Bolin Ding

机构 * Renmin University of China(中国人民大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出MolSight框架,通过分子拓扑模块和分子接地模块增强视觉语言模型对分子图像的结构理解,在多项化学视觉理解任务中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05150 2026-08-03 cs.SE cs.AI 版本更新 57%

Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation

编译AI:基于LLM的工作流自动化确定性代码生成

Geert Trooskens, Aaron Karlsberg, Anmol Sharma, Lamara De Brouwer, Max Van Puyvelde, Matthew Young, John Thickstun, Gil Alterovitz, Walter A. De Brouwer

机构 * XY.AI Labs, Palo Alto, CA(XY.AI实验室,帕洛阿尔托) Stanford University School of Medicine, Stanford, CA(斯坦福大学医学院,斯坦福) Cornell University, Department of Computer Science, Ithaca, NY(康奈尔大学计算机科学系,伊萨卡) Brigham and Women’s Hospital / Harvard Medical School, Boston, MA(布莱根妇女医院/哈佛医学院,波士顿)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文研究编译AI,一种大语言模型在编译阶段生成可执行代码,随后工作流确定性执行的范式。重点探讨其在高风险企业工作流中的应用,尤其在医疗领域,强调可靠性与可审计性。

Comments 14 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28481 2026-07-31 cs.AI 新提交 57%

A Fuzzy Rule-based Neuro-Symbolic Approach for Pipe Severity Prediction in Sewer Networks

用于污水管网管道严重程度预测的基于模糊规则的神经符号方法

Ngoc Thai Le, Thanh Ma, Umberto Straccia

机构 * Can Tho University(芹苴大学) Istituto di Scienza e Tecnologie dell’Informazione, CNR - ISTI(意大利国家研究委员会信息科学与技术研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出一种基于模糊规则的神经符号框架,将神经感知与符号推理解耦,结合Swin Transformer、Weka J48算法和模糊逻辑,在污水管网管道严重程度预测任务中,较仅图像分类提升了多项关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13220 2026-07-31 cs.AI cs.CE cs.HC 版本更新 57%

Networked Intelligence: Active Shared Context Graphs for Human-AI Team Science

网络智能:用于人类-人工智能团队科学的主动共享上下文图

Sutanay Choudhury, Jeffrey J. Czajka, Lummy M. O. Monteiro, Erin Bredeweg, Jason McDermott, Katherine Wolf, Alex Beliaev, Josh Elmore, Paul Piehowski, Kylee Tate, Yuqian Gao, Aivett Bilbao, Kelly Stratton, Scott Baker, Jaydeep P. Bardhan, Kristin Burnum Johnson, Chris Oehmen, Robert Rallo

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在培养人类与AI系统间的网络智能。提出Mycelium主动共享工作区,能自动连接人员与智能体,捕获并路由重要信息。通过生物多组学活动测试,验证其可将局部发现转化为实验设计,还对网络智能进行了计算解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26602 2026-07-30 cs.NI cs.LG 新提交 57%

Harnessing Large Language Models for Intelligent Resource Allocation in the Internet of Everything

利用大语言模型实现万物互联环境下的智能资源分配

Haijun Zhang, Zhuojun Duan, Zijun Wu, Xu Ma, Yuzheng Ren

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对万物互联的动态资源调度挑战,提出大语言模型驱动的资源分配方案,构建多维调度决策模型并引入反馈模块,仿真显示其在收敛速度等指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26393 2026-07-30 cs.AI 新提交 57%

CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games

CaM-Wolf:面向社交推理游戏的因果感知多模态智能体

Zheng Zhang, Nanjie Yao, Jiarui He, Deheng Ye, Peilin Zhao, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26120 2026-07-30 cs.AI 新提交 57%

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

更严重的欺骗:混合动机大型语言模型多智能体系统中的目标不一致

Marylou Fauchard, Florian Carichon, Margarida Carvalho, Golnoosh Farnadi

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究以《狼人杀》为框架,分析LLM多智能体的目标不一致问题,发现其会破坏对抗环境结果且在公开行为中难察觉,凸显需缓解策略。

Comments Accepted at AIWILD@ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24770 2026-07-29 cs.AI cs.HC 新提交 57%

ProcAgent: An Agentic Framework for Procedural Task Guidance on Edge with Human-in-the-Loop

ProcAgent:一种用于边缘端人机协作的过程性任务指导的智能体框架

Azizul Zahid, Subrata Biswas, Bashima Islam, Sai Swaminathan

机构 * University of Tennessee Knoxville(田纳西大学诺克斯维尔分校) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对家具组装等过程性任务,提出ProcAgent框架,利用提议与验证架构,结合多种技术,在边缘设备上实现实时自适应指导,经多维度评估及用户研究,证明能在不牺牲可用性的情况下于边缘硬件达成自适应过程性辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21859 2026-07-29 cs.AI 版本更新 57%

EviDAG: Auditable Causal DAG Authoring with Biomedical Literature

DAGForge:利用生物医学文献进行可审计的因果DAG创作

Yi-han Sheu, Michael R. Steigman, Yu Zhou, Bo Wang, Fan-Yu Yen, Jordan W. Smoller

机构 * Massachusetts General Hospital(麻省总医院) Harvard University(哈佛大学) Northeastern University(东北大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对生物医学因果分析中构建因果DAG多为手动过程的问题,提出DAGForge系统。它能基于研究概念描述创作可审计的因果DAG,经评估在召回率等方面表现良好,减轻了DAG策划负担,支持生物医学研究相关工作。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12366 2026-07-29 cs.SC cs.AI cs.CV 57%

FactorHD: A Hyperdimensional Computing Model for Multi-Object Multi-Class Representation and Factorization

Yifei Zhou, Xuchu Huang, Chenyu Ni, Min Zhou, Zheyu Yan, Xunzhao Yin, Cheng Zhuo

机构 * Zhejiang University(浙江大学) Key Laboratory of Collaborative Sensing and Autonomous Unmanned Systems of Zhejiang Province(浙江省协同感知与自主无人系统重点实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

Comments 7 pages, 5 figures, 2 tables, to be published in the 62nd DAC (Design Automation Conference) proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24730 2026-07-28 cs.CV cs.AI 新提交 57%

KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability

KANEx:将柯尔莫哥洛夫-阿诺德网络的可解释性转化为医学可解释性

Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V., Sowmya S. Sundaram, Gokul S. Krishnan, Aditi Anand, Balaraman Ravindran

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Vanderbilt University School of Medicine(范德堡大学医学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对医学应用中视觉模型黑箱问题,提出KANEx框架,利用柯尔莫哥洛夫-阿诺德网络的符号透明度为VLM推理奠基,设计KAN-Map热图生成方法,经实验验证该方法能提升语义相似度、视觉定位及推理质量,为可信医学人工智能发展助力。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24312 2026-07-28 cs.CL 新提交 57%

CONSISTRE: A Unified Consistency-Aware Framework for Document-Level Relation Extraction with Large Language Models

CONSISTRE:用于文档级关系抽取的统一一致性感知框架及大语言模型

Mingxuan Sun

机构 * Université de Sherbrooke(舍布鲁克大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对文档级关系抽取中,大语言模型预测易违反关系约束的问题,提出CONSISTRE统一框架。通过推理时的约束感知等及训练时的知识蒸馏强化学习两条路径解决,实验表明该框架有效提升性能,缩小开源与专有模型差距,增强可靠性。

Comments 13 pages, 2 figures. Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22948 2026-07-28 cs.NI cs.AI 新提交 57%

Building AI That Works: ESnet's Pragmatic Approach to AI-Driven Operational Excellence

构建有效的人工智能:ESnet实现人工智能驱动卓越运营的务实方法

Bin Dong, Sukhada Gholba, Brooklin Gore, Shawn Kwang, David Mitchell, Samuel Oehlert, Garrett Stewart, Brendan White, Luke Baker, Ed Balas, Britt Gathright, Chin Guok, Jon-Paul Heron, John MacAuley, Scott Richmond, Chris Robb, Chris Tracy, Kesheng Wu

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 ORBIT项目针对ESnet运营痛点,将智能人工智能集成到ServiceNow平台,采用模块化分层架构,以版本化、测试的“技能”管理工具链,完成多项任务,减少步骤、消除错误模式,获广泛应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22947 2026-07-28 cs.AI cs.MA cs.NI cs.SC 新提交 57%

Let AI Agents Translate Networks, Not Reason About Them

让人工智能代理翻译网络,而非对其进行推理

Hongyu Hè, Maria Apostolaki

机构 * Princeton University(普林斯顿大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对生产网络缺乏形式模型的问题,提出将人工智能局限于网络工件到形式逻辑规则的翻译,依靠求解器推理,构建TypoNet验证模拟广域网符号模型,能快速可靠回答操作问题及促进故障定位。

Comments 8 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22591 2026-07-28 cs.AI cs.MA 新提交 57%

Lexical discovery in unknown environments orchestrated by Large Language Models

由大语言模型编排的未知环境中的词汇发现

Rafael Sendra-Arranz, Iñaki Dellibarda Varela, Eduardo Rocon, Álvaro Gutiérrez, Manuel Cebrian

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 针对未知环境中智能体需开发共享词汇的问题,提出神经符号词汇发现框架,让基于大语言模型的智能体群体进行指称博弈自组织词汇表,通过语义锚定扩展人类词汇,模拟达成共识并表征收敛动态,为自主探索预部署规划迈出第一步。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20712 2026-07-28 cs.CR cs.AI 交叉投稿 57%

Evaluating Large Language Models for Symbolic Security Protocol Analysis

评估用于符号安全协议分析的大语言模型

Paolo Modesti, Syed Ahmed, Ioannis Sfyrakis, Derek Enodolomwanyi

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究评估大语言模型对符号安全协议的分析能力,通过在130个协议上测试GPT和DeepSeek,发现聊天与推理模型各有优劣,在认证目标上表现差,保密性较好,结果不稳定,整体LLMs无法与形式化验证相比,仅可作预筛选。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14561 2026-07-28 cs.CL 版本更新 57%

MARS: Multi-hop Adaptive Retrieval and SPARQL Generation for KGQA

MARS:用于知识图谱问答的多跳自适应检索与SPARQL生成

Nikit Srivastava, Daniel Vollmers, René Speck, Nikolaos Karalis, Hamada M. Zahera, Axel-Cyrille Ngonga Ngomo

机构 * Heinz Nixdorf Institute, Paderborn University(海因茨·尼克斯多夫研究所,帕德博恩大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对大型语言模型在知识密集型任务中可靠性受限的问题,提出MARS方法,通过结构化检索过程链接问题实体与知识图谱,迭代获取信息并决定检索深度或生成SPARQL查询,在多个基准测试中性能有竞争力且高效可扩展。

Comments EKAW 2026 (accepted-posters-and-demos" target="_blank" rel="noopener">https://ekaw2026.di.unito.it/accepted-posters-and-demos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13811 2026-07-28 quant-ph cs.AI 版本更新 57%

Aligning Quantum Operators with Large Language Models

对齐量子算子与大型语言模型

Rogerio Feris, Yunchao Liu, Pengyuan Li, Hang Hua, David Kremer

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出将酉算子映射到LLM潜空间的方法,实现量子与语言输入的联合建模,在Clifford+T电路合成任务上取得与最先进方法竞争的结果,并支持语言条件合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21438 2026-07-28 cs.AI 版本更新 57%

Evo-DKD: Dual-Knowledge Decoding for Autonomous Ontology Evolution in Large Language Models

Evo-DKD:用于大语言模型中自主本体进化的双知识解码

Vishal Raman, Vijai Aravindh R, Abhijith Ragav

机构 * Radian Group Inc.(Radian集团) Sri Sivasubramaniya Nadar College Of Engineering(纳德工程学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对本体和知识图谱进化难题,提出Evo-DKD双解码器框架,结合结构化遍历与非结构化推理,通过动态注意力机制协调,经模拟在单流模式下近似双解码,实验证明其在多领域用例中优于基线,为知识库维护提供新范式。

Comments 6 pages, 6 figures, 2 tables. Accepted for publication at IEEE ICMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21850 2026-07-27 cs.CV cs.AI 新提交 57%

SCALE: Self-Supervised Constraint-Aware Layout GEneration for Local P&R DRV Fixing at Advanced Nodes

SCALE:用于先进节点局部布局与布线设计规则违规修复的自监督约束感知布局生成

Chia-Tung Ho, Haoyu Yang, Guanglei Zhou, Yoshi Nishi, Yaguang Li, Walker Turner, Cunxi Yu, Yiran Chen, Brucek Khailany

机构 * NVIDIA(英伟达) Duke University(杜克大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对先进节点局部P&R DRV修复难题,提出SCALE框架,通过自监督布局生成、利用自然语言规则约束和高温采样等方法,生成DRC注释布局违规对微调DRC-VLM,有效提升了最先进代理的修复解决率。

Comments 8 pages, 5 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21461 2026-07-27 cs.AI 版本更新 57%

AREX: Towards a Recursively Self-Improving Agent for Deep Research

AREX:迈向深度研究的递归自我改进智能体

Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Lei Xiong, Jiahao Wang, Sen Wang, Xiyan Jiang, Wanli Li, Yuyang Hu, Hongjin Qian, Bingyu Yan, Jianlyu Chen, Ziyi Xia, Yingxia Shao, Kang Liu, Zhicheng Dou, Di He, Chaozhuo Li, Qiwei Ye, Zhongyuan Wang, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京通用人工智能研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对深度研究中发现与验证答案的不对称性,提出递归自我改进智能体AREX。它通过内部研究与外部自我改进循环交替工作,学习自主上下文更新工具,经训练后在多个基准测试中显著优于同等规模基线,与参数更多模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13731 2026-07-27 cs.SC cs.LG 版本更新 57%

Breaking the Data Barrier in Learning Symbolic Computation: A Case Study on Variable Ordering Suggestion for Cylindrical Algebraic Decomposition

突破学习符号计算的数据障碍:变量顺序建议的圆柱代数分解案例研究

Rui-Juan Jing, Yuegang Zhao, Changbo Chen

机构 * School of Mathematical Sciences, Jiangsu University(江苏大学数学科学学院) Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究通过预训练和微调Transformer模型,改进了圆柱代数分解中变量顺序建议的效率,提升了符号计算的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08951 2026-07-27 cs.AI cs.CY 版本更新 57%

Analyzing the Ethical Logic of Eight Large Language Models

分析八个大语言模型的伦理逻辑

W. Russell Neuman, Chad Coleman, Manan Shah

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究分析OpenAI等八个大语言模型的伦理逻辑,通过让模型回答伦理原则问题和道德困境,用多种理论分析其回答,发现模型伦理判断趋同但在做决定意愿等方面有差异,还能增进对人工智能工作及增强人类伦理行为的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏