arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-22 至 2026-04-22 共收录 327 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 52 篇

2604.18612 2026-04-22 cs.NE cs.AI cs.LG 91%

Agent-GWO: Collaborative Agents for Dynamic Prompt Optimization in Large Language Models

Agent-GWO: 为大型语言模型的动态提示优化设计的协作代理

Xudong Wang, Chaoning Zhang, Chenghao Li, Shuxu Chen, Qigan Sun, Jiaquan Zhang, Fachrina Dewi Puspitasari, Tae-Ho Kim, Jiwei Wei, Malu Zhang, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * Kyung Hee University(韩国庆熙大学) University of Electronic Science and Technology of China(电子科技大学) Nota Inc.(Nota公司) Tongji University(同济大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出Agent-GWO框架,通过统一提示模板和解码超参数作为可继承的代理配置,利用灰狼优化器的领导者-追随者机制,自动选择领导者代理以指导协作更新,提升复杂推理的准确性和稳定性。

Comments Accepted to ACL 2026. 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19031 2026-04-22 cs.CR 91%

SAGE: Signal-Amplified Guided Embeddings for LLM-based Vulnerability Detection

SAGE:基于LLM的漏洞检测中的信号增强引导嵌入

Zhengyang Shan, Xu Qian, Jiayun Xin, Minghui Xu, Yue Zhang, Zhen Yang, Hao Wu, Xiuzhen Cheng

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 SAGE通过引入稀疏自编码器增强漏洞信号,提升LLM在漏洞检测中的性能,实验显示其在多个数据集上表现优异,显著提升 Matthews Correlation Coefficient。

Comments 24 pages, 6 figures, 6 tables. Accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19125 2026-04-22 cs.CL 91%

Do Emotions Influence Moral Judgment in Large Language Models?

情绪是否影响大语言模型的道德判断?

Mohammad Saim, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 研究通过情感诱导流程评估多组数据和LLM中道德可接受性变化,发现积极情绪提升道德可接受性,负面情绪降低,且部分情绪表现与预期相反,揭示了当前LLM与人类在道德判断上的差异。

Comments 18 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19716 2026-04-22 cs.CL 91%

Discovering a Shared Logical Subspace: Steering LLM Logical Reasoning via Alignment of Natural-Language and Symbolic Views

发现共享的逻辑子空间:通过自然语言和符号视角的对齐来引导LLM逻辑推理

Feihao Fang, My T. Thai, Yuanyuan Lei

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Computer & Information Science and Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过对齐自然语言和符号视角的逻辑子空间来提升LLM的多步逻辑推理能力,通过实验验证该方法在四个基准测试中提升了准确率并具备良好的泛化能力。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09953 2026-04-22 cs.CL 91%

Take Out Your Calculators: Estimating the Real Difficulty of Question Items with LLM Student Simulations

拿出计算器:利用LLM学生模拟估算问题的真实难度

Christabel Acquaye, Yi Ting Huang, Marine Carpuat, Rachel Rudinger

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文探讨利用开源大语言模型评估数学选择题难度的方法,通过模拟不同年级学生角色扮演,利用IRT模型对比预测难度与实际难度,发现模型性能受学生命名策略和数学能力影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19070 2026-04-22 cs.CL cs.LG 91%

TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only

TRN-R1-Zero:通过仅强化学习的LLM进行文本丰富网络推理

Yilun Liu, Ruihong Qiu, Zi Huang

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院) The University of Queensland(昆士兰大学) Brisbane, Queensland, Australia(昆士兰州布里斯班)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 TRN-R1-Zero通过仅强化学习训练LLM,在文本丰富网络上实现零样本推理,无需监督微调或链式思维数据,实验验证其优越性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19578 2026-04-22 cs.CL cs.AI cs.DL cs.IR 90%

Impact of large language models on peer review opinions from a fine-grained perspective: Evidence from top conference proceedings in AI

大型语言模型对同行评审意见的影响:从细粒度视角看证据:来自顶级人工智能会议论文的证据

Wenqing Wu, Chengzhi Zhang, Yi Zhao, Tong Bao

机构 * School of Management, Anhui University(安徽大学管理学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型语言模型对同行评审意见的影响,分析了评审报告在语言特征、评价重点和推荐信号方面的变化,发现评审文本变得更长、更流畅,但深入评价维度有所下降。

Comments Scientometrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19558 2026-04-22 cs.SE 89%

On Reasoning-Centric LLM-based Automated Theorem Proving

基于推理的LLM自动定理证明方法

Yican Sun, Chengwei Shi, Hangzhou Lyu, Yingfei Xiong

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ReCent-Prover,通过引入反思验证和规划检索技术,提升自动定理证明能力,在CoqStoq基准测试中实现22.58%的定理证明提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19561 2026-04-22 cs.AI 89%

Detecting Data Contamination in Large Language Models

在大型语言模型中检测数据污染

Juliusz Janicki, Savvas Chamezopoulos, Evangelos Kanoulas, Georgios Tsatsaronis

机构 * University of Amsterdam(阿姆斯特丹大学) Elsevier(埃塞克斯)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 研究评估了黑盒会员推断攻击在检测大型语言模型训练数据中的有效性,发现现有方法无法可靠检测成员身份,所有方法的AUC-ROC约为0.5,更高级的模型表现出更高的TPR和FPR,显示了检测的困难性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19638 2026-04-22 cs.AI cs.CL cs.RO 88%

SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

SafetyALFRED:评估多模态大语言模型的安全意识规划

Josue Torres-Fonseca, Naihao Deng, Yinpei Dai, Shane Storks, Yichi Zhang, Rada Mihalcea, Casey Kennington, Joyce Chai

机构 * University of Michigan(密歇根大学) Boise State University(博伊西州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SafetyALFRED,基于ALFRED基准测试,引入六类厨房真实世界危险,评估多模态大语言模型在安全意识规划中的表现,发现静态QA评估不足,需转向强调具身环境中的纠正行动的基准。

Comments Work accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06168 2026-04-22 cs.AI 88%

Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models

思维链作为镜像:评估大语言模型与人类偏好之间结构化推理的对齐

Boxuan Wang, Zhuoyun Li, Xinmiao Huang, Xiaowei Huang, Yi Dong

机构 * School of Computer Science and Informatics, University of Liverpool, United Kingdom(利物浦大学计算机科学与信息学学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出一种量化评估大语言模型多步结构化推理与人类偏好对齐的方法,引入对齐分数指标,通过构建基于语义熵的矩阵比较模型生成的思维链与人类偏好参考,发现对齐分数在2步推理时达到峰值,支持其作为诊断信号。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18829 2026-04-22 cs.CV 88%

DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

DUALVISION:用于鲁棒视觉推理的RGB-红外多模态大语言模型

Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao, Hongcheng Wang, Jianglin Lu, Yin Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon(亚马逊) Northeastern University(东北大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出DUALVISION,通过局部化交叉注意力融合IR-RGB信息,提升多模态大语言模型在视觉退化条件下的性能,并引入DV-204K和DV-500数据集进行评估。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04562 2026-04-22 cs.AI 87%

Reasoning Over Space: Enabling Geographic Reasoning for LLM-Based Generative Next POI Recommendation

空间推理:为基于大语言模型的生成下POI推荐启用地理推理

Dongyi Lv, Qiuyu Ding, Heng-Da Xu, Zhaoxu Sun, Zhi Wang, Feng Xiong, Mu Xu

机构 * School Of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Amap, Alibaba Group(阿里巴巴集团阿地图)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ROS框架,通过地理信息作为决策变量提升生成式推荐的地理推理能力,采用分层空间语义ID和三阶段移动链式推理,结合空间引导强化学习,实现跨城市迁移和命中率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19464 2026-04-22 cs.CL cs.AI 87%

LePREC: Reasoning as Classification over Structured Factors for Assessing Relevance of Legal Issues

LePREC:基于结构因素的推理作为分类,以评估法律问题的相关性

Fanyu Wang, Xiaoxi Kang, Paul Burgess, Aashish Srivastava, Chetan Arora, Adnan Trakic, Lay-Ki Soon, Md Khalid Hossain, Lizhen Qu

机构 * Faculty of Information Technology, Monash University, Australia(墨尔本大学信息技术学院,澳大利亚) School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息学院) School of Business, Monash University Malaysia(墨尔本大学马来西亚分校商学院) Faculty of Law, Monash University, Australia(墨尔本大学法学院,澳大利亚)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LePREC框架,结合神经生成与结构统计推理,提升法律问题识别的精度,实验表明其比先进LLM基线提升30-40%。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15173 2026-04-22 cs.AI 86%

Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs

注意(DH)差距!理性推理与对话LLM在风险选择中的对比

Luise Ge, Yongyan Zhang, Yevgeniy Vorobeychik

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 推理与问题求解 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过对比推理模型与对话模型在风险决策中的表现,发现前者更理性,后者更接近人类但受因素影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02304 2026-04-22 cs.CL 86%

When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers

验证何时有效?对LLM作为解决方案验证器的深入探讨

Jack Lu, Ryan Teehan, Jinran Jin, Mengye Ren

机构 * Agentic Learning AI Lab, New York University(代理学习人工智能实验室,纽约大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究探讨了在何种条件下验证有效,通过分析37个模型在9个基准测试中的表现,发现跨模型家族验证效果优于自验证,且验证收益随模型相似性增加而降低。

Comments Accepted at ICLR 2026 AI with Recursive Self-Improvement workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10899 2026-04-22 cs.CL cs.LO cs.SE 86%

From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models

从证明到程序:刻画大语言模型中的工具诱导推理幻觉

Farima Fatahi Bayat, Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 研究探讨了工具增强语言模型在使用外部工具时产生的推理幻觉问题,通过PYMATH基准测试发现,尽管工具使用提升了最终答案准确率,但推理过程却愈发不连贯,提出基于偏好优化的框架以改善工具使用下的推理深度。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05498 2026-04-22 cs.AI 86%

GRAIL:Learning to Interact with Large Knowledge Graphs for Retrieval Augmented Reasoning

GRAIL:学习与大规模知识图谱交互以实现检索增强推理

Ge Chang, Jinbo Su, Jiacheng Liu, Pengfei Yang, Yuhao Shang, Huiwen Zheng, Hongli Ma, Yan Liang, Yuanchun Li, Yunxin Liu

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GRAIL通过结合LLM引导的随机探索与路径过滤,建立数据合成管道,学习动态决策策略,提升知识图谱检索的精度与简洁性平衡,实验表明在三个知识图谱问答数据集上准确率和F1值分别提升21.01%和22.43%。

Comments This is a duplicate submission of the article "Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise Supervision" [arXiv:2510.03323]. The content is identical to the newer version. This entry is being withdrawn to avoid redundancy

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24803 2026-04-22 cs.LG cs.AI 85%

TimeOmni-1: Incentivizing Complex Reasoning with Time Series in Large Language Models

TimeOmni-1:通过时间序列激励大型语言模型的复杂推理

Tong Guan, Zijie Meng, Dianqi Li, Shiyu Wang, Chao-Han Huck Yang, Qingsong Wen, Zuozhu Liu, Sabato Marco Siniscalchi, Ming Jin, Shirui Pan

机构 * Griffith University(格里菲斯大学) Zhejiang University(浙江大学) NVIDIA(英伟达) Squirrel Ai Learning University of Palermo(帕尔米奥大学) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 本文提出TimeOmni-1,首个统一推理模型,通过时间序列推理解决多样化现实问题,提升因果发现和有效响应率。

Comments Accepted by the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19567 2026-04-22 cs.AI 84%

Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

基于LLM的多模态推理用于视觉语义算术

Chuou Xu, Liya Ji, Qifeng Chen

专题命中 推理与问题求解 :LLM(title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出两种新型任务和IRPD数据集,通过SAri-RFT方法提升大视觉语言模型的跨模态关系推理能力,实现视觉语义算术的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19656 2026-04-22 cs.CL 83%

Pause or Fabricate? Training Language Models for Grounded Reasoning

暂停或虚构?为基于事实的推理训练语言模型

Yiwen Qiu, Linjuan Wu, Yizhou Liu, Yuchen Yan, Jin Ma, Xu Tan, Yao Hu, Daoxin Zhang, Wenqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen

机构 * Zhejiang University(浙江大学) Tencent(腾讯) Xiaohongshu Inc.(小红书公司)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出GRIL框架,通过交互强化学习提升语言模型在不完整信息下的推理能力,显著提高前提检测并提升任务成功率。

Comments Code:https://github.com/ZJU-REAL/GRIL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18805 2026-04-22 cs.AI cond-mat.mtrl-sci cs.LG 82%

AI scientists produce results without reasoning scientifically

AI科学家在没有科学推理的情况下产生结果

Martiño Ríos-García, Nawaf Alampara, Chandan Gupta, Indrajeet Mandal, Sajid Mannan, Ali Asghar Aghajani, N. M. Anoop Krishnan, Kevin Maik Jablonka

机构 * Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena(有机与大分子化学实验室(IOMC),弗里德里希-席勒耶纳大学) Department of Civil Engineering, Indian Institute of Technology Delhi(土木工程系,印度理工学院德里) School of Interdisciplinary Research, Indian Institute of Technology Delhi(跨学科研究学院,印度理工学院德里) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(Yardi人工智能学院,印度理工学院德里) Center for Energy and Environmental Chemistry Jena, Friedrich Schiller University Jena(能源与环境化学中心(耶纳),弗里德里希-席勒耶纳大学) Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena), Lessingstraße 12–14(能源应用高分子研究所(耶纳,HIPOLE耶纳),Lessingstraße 12–14)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究评估了基于大语言模型的科学代理在八个领域中的表现,发现基础模型主导了性能和行为,且代理推理缺乏科学推理的 epistemic 特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07966 2026-04-22 cs.CV cs.CL 82%

Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images

视觉-表格问答:面向表格图像推理的开放领域基准

Boammani Aser Lompo, Marc Haraoui

机构 * École de Technologie Supérieure(埃克塞技术学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract,comments);prompting(abstract);分类 cs.CL

AI总结 本文提出Visual-TableQA,一个大规模开放领域多模态数据集,用于评估和提升视觉推理能力,包含2500个LaTeX渲染表格和6000对推理密集型问答对,通过多模型协作生成,验证了模型在外部基准上的鲁棒性。

Comments Accepted at the First Workshop on Foundations of Reasoning in Language Models, NeurIPS 2025. Available at: https://openreview.net/forum?id=fvJRsGwhPf

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18275 2026-04-22 cs.CV 82%

Visual Adversarial Attack on Vision-Language Models for Autonomous Driving

面向自动驾驶的视觉对抗攻击研究

Tianyuan Zhang, Lu Wang, Xinwei Zhang, Yitong Zhang, Boyi Jia, Siyuan Liang, Shengshan Hu, Qiang Fu, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航) National University of Singapore(国立新加坡大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract)

AI总结 本文提出ADvLM框架,针对自动驾驶中视觉语言模型的特殊需求,解决文本指令变异性和视觉场景时间序列性问题,实现高效对抗攻击。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19172 2026-04-22 cs.AI 81%

Reasoning-Aware AIGC Detection via Alignment and Reinforcement

基于对齐与强化的学习的推理感知AIGC检测

Zhao Wang, Max Xiong, Jianxun Lian, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Duke University(杜克大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出REVEAL框架,通过生成可解释的推理链实现AIGC检测,采用两阶段训练策略提升准确性和逻辑一致性,实验显示其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18964 2026-04-22 cs.AI cs.DB 81%

DW-Bench: Benchmarking LLMs on Data Warehouse Graph Topology Reasoning

DW-Bench:基于数据仓库图拓扑推理的大型语言模型基准测试

Ahmed G. A. H Ahmed, C. Okan Sakar

机构 * Innosol / Bahçeşehir University(Innosol / 巴赫切希尔大学) Department of Computer Engineering, Bahcesehir University, Turkey(计算机工程系,巴赫切希尔大学,土耳其)

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DW-Bench评估LLM在数据仓库模式上的图拓扑推理能力,包含1046个验证正确的问题,实验显示工具增强方法在复杂组合子类型上表现稳定。

Comments 24 pages, 6 figures. Datasets and evaluation code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18873 2026-04-22 cs.AI 81%

From Natural Language to Executable Narsese: A Neuro-Symbolic Benchmark and Pipeline for Reasoning with NARS

从自然语言到可执行的Narsese:一种神经符号基准和管道用于基于NARS的推理

Mina Gabriel, Pei Wang

机构 * Temple University(特拉华大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出神经符号框架,将自然语言推理问题转换为可执行的形式化表示,结合FOL和Narsese,并引入NARS-Reasoning-v0.1基准,支持符号生成与执行验证,展示可监督适应的潜力。

Comments 14 pages. Submitted to AGI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18897 2026-04-22 cs.CL cs.LG 81%

Less Is More: Cognitive Load and the Single-Prompt Ceiling in LLM Mathematical Reasoning

少即是多:在大语言模型数学推理中的认知负荷与单提示天花板

Manuel Israel Cazares

机构 * Bytepro AI

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了提示工程在形式数学推理中的效果,发现单提示存在性能上限,通过分析发现数学不可判定性、复杂规则系统及提示顺序影响是限制因素,最佳提交在硬性任务中达到79.25%的准确率。

Comments Companion repository: https://github.com/israelcazares/sair-prompt-engineering | Zenodo DOI: 10.5281/zenodo.19598433 | v15: final Contributor Network data (n=52, competition close April 20, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00161 2026-04-22 cs.CV 78%

Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models

Q-Mask:面向OCR的视觉语言模型中基于查询的因果遮罩用于文本锚定

Longwei Xu, Feng Feng, Shaojie Zhang, Xin Chen, Hang Li, Anan Du, Hailong Yu, Pei Fu, Zhenbo Luo, Jian Luan

机构 * MiLM Plus(小米公司)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出Q-Mask框架,通过因果查询驱动的遮罩解码器提升OCR任务中文本锚定的准确性与稳定性,结合大规模标注数据集提升视觉语言模型对文本区域的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11582 2026-04-22 cs.CL cs.AI cs.LG 76%

A Triadic Suffix Tokenization Scheme for Numerical Reasoning

三元后缀数字分词方案用于数值推理

Olga Chetverina

机构 * MIPT, Moscow, Russia(莫斯科米进大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG;SLM(comments)

AI总结 本文提出Triadic Suffix Tokenization方案,通过三元分组和明确的量级标记,解决数字分词不一致问题,提升大语言模型在算术和科学推理中的稳定性与准确性。

Comments v3: Updated to include analysis of N=1 scalability for SLM architectures

详情

展开后加载摘要…

URL PDF HTML 收藏