arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-01 至 2026-06-01 共收录 409 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 66 篇

2605.31389 2026-06-01 cs.PL cs.CR 80%

Neuroforger: certified violation witnesses for smart contracts verification via LLMs

Neuroforger: 通过大语言模型为智能合约验证生成认证违规见证

Massimo Bartoletti, Enrico Lipparini

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 针对自然语言属性歧义和LLM回答无正确性保证的问题,提出一种结合LLM、类型检查和具体执行的工作流,通过引入扩展Solidity的抽象类型形式规范语言,生成并验证违规见证(反例)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30883 2026-06-01 cs.CR 80%

TRACE: Task-Aware Adaptive Self-Evolving Agentic Jailbreaking

TRACE: 任务感知的自适应自我进化代理越狱

Churui Zeng, Weiwei Qi, Kedong Xiu, Tianhang Zheng, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出TRACE框架,通过任务分解、场景伪装和Q学习进化,实现LLM代理的高效越狱,在AgentHarm和AdvCUA上达到最高100%绕过率。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25842 2026-06-01 cs.AI cs.CL 79%

MuCRASP: Multimodal Chain-of-thought Reasoning aware Structured Pruning

MuCRASP: 多模态思维链推理感知的结构化剪枝

Aritra Dutta, Somak Aditya

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,哈里科普尔)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对视觉语言模型在结构化剪枝后思维链推理准确性下降的问题,提出MuCRASP框架,通过识别推理关键令牌并保持跨模态对齐,在压缩下维持推理质量。

Comments Preprint ver. 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21762 2026-06-01 cs.CL cs.AI 79%

Reasoning-Intensive Regression

推理密集型回归

Diane Tchuindjo, Omar Khattab

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对推理密集型回归任务,提出MENTAT方法,结合批量反思提示优化与神经集成学习,在基准测试中相比基线提升高达65%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30587 2026-06-01 cs.CV 78%

ReGuLaR: Relation-Grounded Latent Reasoning for Large Vision-Language Models

ReGuLaR:面向大型视觉语言模型的基于关系的潜在推理

Zihu Wang, Karthik Somayaji N. S, Peng Li

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 提出ReGuLaR框架,通过训练时的ReGFormer将潜在推理显式地锚定在视觉证据中的对象和关系上,在多种基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30506 2026-06-01 cs.RO cs.CV 78%

VLM-GLoc: Vision-Language Model Enhanced Monte Carlo Localization for Robust Semantic Global Localization in Cluttered Quasi-Static Environments

VLM-GLoc:视觉语言模型增强的蒙特卡洛定位,用于杂乱准静态环境中的鲁棒语义全局定位

Shivendra Agrawal, Bradley Hayes

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 提出VLM-GLoc方法,利用开放词汇视觉语言模型作为统一语义观测前端,通过逆语义提议机制和文本到地图检索,在几何模糊和语义歧义的准静态环境中实现鲁棒全局定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16940 2026-06-01 cs.CV cs.CR 78%

MultiPriv: Benchmarking Individual-Level Privacy Reasoning in Vision-Language Models

MultiPriv: 视觉语言模型中个体级隐私推理的基准测试

Xiongtao Sun, Hui Li, Jiaming Zhang, Yujie Yang, Kaili Liu, Ruxin Feng, Wen Jun Tan, Wei Yang Bryan Lim

机构 * Xidian University(西安电子科技大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 针对视觉语言模型通过层次化链式推理关联多模态数据识别个体的隐私风险,提出首个系统评估个体级隐私推理的基准MultiPriv,包含隐私感知与推理框架、双语多模态数据集和九项挑战任务,对50多个开源和商业模型评估发现60%的模型能以高达80%的准确率进行个体级隐私推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30740 2026-06-01 cs.RO cs.AI 77%

GSAM: A Generalizable and Safe Robotic Framework for Articulated Object Manipulation

GSAM: 一种通用且安全的铰接物体操作机器人框架

Beichen Shao, Mengying Xie, Heng Su, Wanyi Zhang, Mingyan Li, Yan Ding, Fausto Giunchiglia, Chao Chen

机构 * College of Computer Science, Chongqing University, Chongqing, China(重庆大学计算机学院) Lumos Robotics, China(Lumos机器人中国) Xi'an Jiaotong-Liverpool University, China(西安交通大学利物浦大学) Fudan University, China(复旦大学) Department of Information Engineering and Computer Science, University of Trento, Trento, Italy(特伦托大学信息工程与计算机科学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出GSAM框架,通过视觉感知器生成运动学参数、基于VLM的细调器进行常识推理修正、交互约束函数生成器集成障碍物避免知识,并由运动学感知规划器验证轨迹可达性,在50个铰链任务上相比最佳基线将标准差降低3.1%、操作成功率提升36.0%。

Comments Accepted by the 19th International Conference on Parallel Problem Solving from Nature (PPSN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06235 2026-06-01 cs.IR cs.AI 77%

OBLIQ-Bench: Exposing Overlooked Bottlenecks in Modern Retrievers with Latent and Implicit Queries

OBLIQ-Bench:揭示现代检索器中被忽视的瓶颈——潜在与隐式查询

Diane Tchuindjo, Devavrat Shah, Omar Khattab

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 针对现有检索基准饱和但实际搜索问题未解决的现象,提出一类“倾斜查询”并构建OBLIQ-Bench基准,揭示检索与验证之间的不对称性,即推理LLM能可靠识别潜在相关性但检索管道无法召回多数相关文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31446 2026-06-01 cs.CL cs.AI 73%

Fine-grained Verification via Diagnostic Reasoning Supervision for Aspect Sentiment Triplet Extraction

面向方面情感三元组抽取的诊断推理监督细粒度验证

Wenna Lai, Haoran Xie, Guandong Xu, Qing Li, S. Joe Qin

机构 * The Hong Kong Polytechnic University(香港理工大学) Lingnan University(岭南大学) Education University of Hong Kong(香港教育大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出FiVeD框架,通过诊断推理监督进行细粒度验证,利用质量评分和错误分类等辅助任务提升ASTE三元组抽取的可靠性。

Comments 25 pages, 13 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18587 2026-06-01 cs.LG cs.AI cs.LO cs.PL 73%

Compile to Compress: Boosting Formal Theorem Provers by Compiler Outputs

编译以压缩:通过编译器输出提升形式定理证明器

Guchan Li, Rui Tian, Hongning Wang

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 利用编译器将大量证明尝试压缩为结构化失败模式,提出一种学习-精炼框架,通过树搜索基于验证器反馈局部修正错误,在可比测试时预算下在PutnamBench上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31365 2026-06-01 cs.AI 70%

Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration

学习适应:通过认知感知探索实现自我改进的网络智能体

Weile Chen, Bingchen Miao, Qifan Yu, Wendong Bu, Guoming Wang, Wenqiao Zhang, Shengyu Zhang, Juncheng Li, Siliang Tang

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SCALE框架,利用选择器、预测器和评判器三个对抗角色,通过环境探索自主发现智能体局限性并扩展认知边界,结合SCALE-Hop图探索策略和SCALE-20k数据集,显著提升多模态大语言模型在多种网络环境中的性能和泛化能力。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31174 2026-06-01 cs.CV cs.LG 70%

Detect in Any Scene: An Agentic Framework for Object Detection with Experience-Aware Reasoning

任意场景检测:一种具有经验感知推理的目标检测智能体框架

Wenlun Zhang, Jun Yin, Kentaro Yoshioka

机构 * Keio University(Keio大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出DetAS/DetAS-X智能体框架,利用多模态大语言模型自适应组合恢复模块和专用检测器,通过自进化经验积累实现经验感知推理,在六个基准上平均F1提升28.36%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31056 2026-06-01 cs.CL 70%

How Much Do LLMs Know About Chinese Zero Pronouns?

LLMs 对中文零代词的了解程度如何?

Yifei Li, Guanyi Chen, Tingting He

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning(湖北省人工智能与智能学习重点实验室) National Language Resources Monitoring and Research Center for Network Media(网络媒体语言资源监测与研究中心) School of Computer Science, Central China Normal University(中央财经大学计算机学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过一系列语言学动机任务(识别、指称性分类、指称类型分类、消解和翻译),系统评估了大型语言模型处理中文零代词的能力,发现当前LLMs在零代词处理上仍面临巨大挑战,尤其在识别和指称性分类等上游任务上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31010 2026-06-01 cs.CL 70%

MoG: Mixture of Experts for Graph-based Retrieval-Augmented Generation

MoG:用于基于图的检索增强生成的混合专家模型

Zheng Yuan, Chuang Zhou, Linhao Luo, Siyu An, Di Yin, Xing Sun, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Monash University(墨尔本大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MoG框架,通过组织知识为中心枢纽图和稀疏激活的专家图,利用拓扑感知路由器动态选择相关专家图,以解决检索增强生成中统一知识库引入无关信息的问题,在MuSiQue上相对提升超过20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30832 2026-06-01 cs.AI 70%

SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning

SLAT:面向高效CoT推理的段级自适应修剪

Jian Yao, Xiongcai Luo, Ran Cheng, Kay Chen Tan

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能学院,香港理工大学) The Hong Kong Polytechnic University-Daya Bay Technology and Innovation Research Institute, Huizhou,Guangdong Province, China(香港理工大学大亚湾科技与创新研究院,广东惠州市) The Hong Kong Polytechnic University Shenzhen Research Institute, Shenzhen, China(香港理工大学深圳研究院,深圳)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出段级自适应修剪框架SLAT,通过强化学习选择性抑制低边际效用的高概率冗余段,在保持准确率的同时将推理长度减少50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30400 2026-06-01 cs.CL 70%

Protocol for evaluating ChatGPT in biomedical association generation and verification using a RAG-enabled, cross-model majority voting workflow

使用RAG支持的跨模型多数投票工作流评估ChatGPT在生物医学关联生成与验证中的协议

Ahmed Abdeen Hamed, Luis M. Rocha

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一个协议,通过RAG和跨模型多数投票工作流评估ChatGPT生成疾病中心生物医学关联的能力,并验证其可靠性。

Comments Main Manuscript and Supplementary Information. Both are equally important

Journal ref STAR Protocols, 2026; 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01914 2026-06-01 cs.LG 70%

Towards Long-Horizon Interpretability: Efficient and Faithful Multi-Token Attribution for Reasoning LLMs

面向长程可解释性:高效且忠实的多Token归因用于推理大语言模型

Wenbo Pan, Zhichao Liu, Xianlong Wang, Haining Yu, Xiaohua Jia

机构 * Department of Computer Science, City University of Hong Kong, Hong Kong SAR, China(香港城市大学计算机科学系) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学)

专题命中 推理与问题求解 :LLM(abstract_cn);language model(abstract);分类 cs.LG

AI总结 提出FlashTrace方法,通过跨跨度聚合和递归归因机制,在长上下文推理中实现高效且忠实的多Token归因,速度提升超130倍。

Comments Accepted as an Oral paper at ICML 2026. Code available at https://github.com/wbopan/flashtrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31096 2026-06-01 cs.CV 67%

iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型中

Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Independent Researcher(独立研究者) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出iVGR框架,利用强化学习和双流训练策略将视觉定位能力内化到文本推理中,避免显式视觉基础在推理时的干扰,提升细粒度感知性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26396 2026-06-01 cs.AI cs.CL cs.LG 67%

Advancing Creative Physical Intelligence in Large Multimodal Models

推进大型多模态模型中的创造性物理智能

Cheng Qian, Hyeonjeong Ha, Jiayu Liu, Jeonghwan Kim, Emre Can Acikgoz, Bingxuan Li, Kunlun Zhu, Jiateng Liu, Aditi Tiwari, Zhenhailong Wang, Xiusi Chen, Mahdi Namazifar, Heng Ji

机构 * UIUC(伊利诺伊大学香槟分校) Amazon(亚马逊)

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大型多模态模型在开放式环境中缺乏基于视觉的创造性工具使用能力的问题,提出MM-CreativityBench基准和基于偏好学习的具身对齐方法,显著提升实体选择并减少幻觉。

Comments 51 Pages, 9 Figures, 7 Tables, Previous Work CreativityBench: arXiv:2605.02910

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09276 2026-06-01 cs.CL cs.AI cs.LG 67%

Effective Reasoning Chains Reduce Intrinsic Dimensionality

有效推理链降低内在维度

Archiki Prasad, Mandar Joshi, Kenton Lee, Mohit Bansal, Peter Shaw

机构 * Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过内在维度量化推理链有效性,发现有效推理策略能降低任务内在维度,并在GSM8K上验证其与泛化性能的强负相关。

Comments ICML (spotlight) camera-ready; 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31558 2026-06-01 cs.LG cs.AI 62%

Positional versus Symbolic Attention Heads: Learning Dynamics, RoPE Geometry, and Length Generalization

位置注意力头与符号注意力头:学习动态、RoPE几何和长度泛化

Felipe Urrutia, Juan José Alegría, Cinthia Sanchez Macias, Jorge Salas, Cristian B. Calderon, Cristobal Rojas

机构 * CENIA & Faculty of Mathematics UC Santiago(CENIA与圣托里尼大学数学系) IMC UC & CENIA Santiago(UC IMC与圣托里尼CENIA)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 通过控制实验研究Transformer注意力头在位置推理和符号推理任务中的学习动态,发现位置和符号注意力头的不同机制及其对长度泛化的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31148 2026-06-01 cs.CV cs.AI cs.CL 62%

SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes

SpatialAct:探测VLM智能体在3D场景中的空间推理到行动能力

Tianhui Liu, Jie Feng, Zhiheng Zheng, Shengyuan Wang, Yiming Guo, Yanxin Xi, Hangyu Fan, Yong Li, Pan Hui

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学) Helsinki University(赫尔辛基大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SpatialAct基准,通过多轮交互细化、单步错误检测与修复等任务,揭示当前视觉语言模型在3D场景中从空间推理到行动存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30632 2026-06-01 cs.HC cs.AI cs.LG 62%

Rationalize: Shared Semantic Reasoning for Human-AI Alignment

Rationalize: 人机对齐的共享语义推理

Aritra Dasgupta, Naga Datha Saikiran Battula, Avina Nakarmi, Sohom Sen, Subhodeep Ghosh, Xun Song

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出Rationalize角色对框架,通过共享推理空间中的互补角色对(如探索者-引导者)实现人类与AI在数据驱动意义建构中的语义对齐,并设计元素级和角色特定的对齐评估方法。

Comments Accepted by ACM CHI 2026 BiAlign Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30557 2026-06-01 cs.CV cs.AI cs.CL 62%

Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?

看见不等于知道:视觉语言模型是否知道何时不回答空间问题(以及为什么)?

Yue Zhang, Zun Wang, Han Lin, Yonatan Bitton, Idan Szpektor, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Google Research(谷歌研究)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对视觉语言模型在空间推理中过度自信回答的问题,提出SpatialUncertain框架,通过遮挡和视角歧义两种挑战,评估模型是否知道何时应弃权以及如何寻找可靠证据。

Comments Website: https://zhangyuejoslin.github.io/spatialuncertain/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31387 2026-06-01 cs.CL cs.RO 57%

Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely

多轮多智能体对话用于协作重建仅略微提升VLM在空间推理上的性能

Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(语言学计算系,语言学系 柏林洪堡大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究通过多轮多智能体对话框架评估视觉语言模型在协作空间推理任务中的表现,发现视觉空间理解仍是主要瓶颈,文本表示和分解图像表示可部分提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30912 2026-06-01 cs.CV cs.CL 57%

Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

关注证据:面向多模态RLVR的证据锚定空间注意力监督

Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Nankai University(南开大学) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 提出EASE方法,通过将标注证据区域转化为平滑视觉标记目标,在多模态强化学习训练中引导响应到图像的注意力,从而提升视觉语言模型在感知、幻觉、视觉数学和多模态推理基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30824 2026-06-01 cs.AI 57%

Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward

面向深度研究的规划器中心强化学习与结构感知奖励

Mustafa Anis Hussain, Xinle Wu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI

AI总结 提出DecomposeR框架,通过将研究计划表示为有向无环图(DAG)并采用两阶段强化学习(规划器RL和回答器RL),实现显式结构化规划与细粒度奖励分配,在长文本基准上提升5.1-8.0分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30757 2026-06-01 cs.LG 57%

Chain-of-Thought and Compressed Looped Transformers: A Memory-Budget Separation

思维链与压缩循环Transformer:记忆预算分离

Haozhou Zhang

机构 * Department of Mathematics and Statistics(数学与统计学系)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.LG

AI总结 本文通过比较三种记忆机制(压缩潜在循环、全序列状态循环和思维链暂存区),证明压缩循环Transformer的记忆预算限制其推理能力,而思维链通过扩展上下文实现更强的问题求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05529 2026-06-01 cs.DB cs.AI 57%

NGDBench: Towards Neural Graph Data Management

NGDBench:迈向神经图数据管理

Yufei Li, Yisen Gao, Jiaxuan Xiong, Jiaxin Bai, Shijie Zhong, Haoyu Huang, Zhongwei Xie, Hong Ting Tsang, Yangqiu Song

机构 * HKUST(香港理工大学) Beijing Institute of Technology(北京理工大学) Hong Kong Baptist University(香港 Baptist 大学) Guangdong University of Technology(广东技术大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI

AI总结 针对现有数据管理系统在噪声、不完整和动态更新下缺乏隐式结构发现和推理能力的问题,提出NGDBench基准,通过统一结构化与非结构化来源的图视图,评估神经查询方法在噪声和动态状态跟踪中的表现。

Comments https://github.com/HKUST-KnowComp/NGDBench

详情

展开后加载摘要…

URL PDF HTML 收藏