arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-01 至 2026-06-01 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 8 篇

2605.30415 2026-06-01 cs.CL cs.AI 84%

Domain Adaptation and Reasoning Frameworks in Language Models: A Controlled Experiment with Historical Cosmology

语言模型中的领域适应与推理框架:以历史宇宙学为受控实验

Francesco De Bernardis

机构 * Independent Researcher(独立研究者)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过历史宇宙学受控实验,研究领域适应如何重塑语言模型的解释行为,发现适应主要改变解释框架而非直接改变立场。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17607 2026-06-01 cs.AI cs.CL 84%

Symbolic Intermediaries as a Linguistic-Numerical Interface for LLM-Driven Geometric Reasoning

符号中介作为LLM驱动几何推理的语言-数值接口

João Pedro Gandarela, Thiago Rios, Stefan Menzel, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Honda Research Institute Europe(本田欧洲研究院) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标记中心)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出符号中介作为连接物理模拟器数值输出与语言模型推理的接口,通过符号回归将连续数值转化为符号表达式,并在协同优化循环中提升几何推理性能。

Comments 33 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30963 2026-06-01 q-bio.BM cs.AI 70%

AMix-2: Establishing Protein as a Native Modality in Large Language Models

AMix-2:将蛋白质确立为大语言模型的原生模态

Keyue Qiu, Yixin Wu, Lihao Wang, Yawen Ouyang, Jixiang Yu, Zihan Zhou, Changze Lv, Dongyu Xue, Yuxuan Song, Xinbo Zhang, Hao Wang, Jiangtao Feng, Zhiqiang Gao, Lijun Wu, Xiaoqing Zheng, Ka-Chun Wong, Lei Bai, Ya-Qin Zhang, Wei-Ying Ma, Dahua Lin, Bowen Zhou, Hao Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Generative Symbolic Intelligence Lab (GenSI), Tsinghua University(生成符号智能实验室(GenSI),清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出AMix-2,一种蛋白质-文本基础模型,通过统一蛋白质理解与序列设计,将蛋白质作为大语言模型的原生模态,并引入块状扩散语言建模骨干以更好地匹配蛋白质内在特性。

Comments 30 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26942 2026-06-01 cs.AI cs.LO cs.SE 70%

Neuro-Symbolic Verification of LLM Outputs for Data-Sensitive Domains (extended preprint)

面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)

Paul Sigloch, Christoph Benzmüller

机构 * University of Bamberg(巴姆堡大学) Free University of Berlin(柏林自由大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出一种结合形式符号方法与神经语义分析的混合验证架构,用于检测LLM输出中的幻觉、不一致和隐私漏洞,在医疗设备损伤评估系统中实现83%的结构化实体幻觉检测率和72%的语义虚构检测率。

Comments Extended preprint version of accepted technical communication at KI 2026. 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31558 2026-06-01 cs.LG cs.AI 62%

Positional versus Symbolic Attention Heads: Learning Dynamics, RoPE Geometry, and Length Generalization

位置注意力头与符号注意力头:学习动态、RoPE几何和长度泛化

Felipe Urrutia, Juan José Alegría, Cinthia Sanchez Macias, Jorge Salas, Cristian B. Calderon, Cristobal Rojas

机构 * CENIA & Faculty of Mathematics UC Santiago(CENIA与圣托里尼大学数学系) IMC UC & CENIA Santiago(UC IMC与圣托里尼CENIA)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过控制实验研究Transformer注意力头在位置推理和符号推理任务中的学习动态,发现位置和符号注意力头的不同机制及其对长度泛化的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31143 2026-06-01 cs.HC cs.AI 57%

Extending the UXR Point of View Pyramid: A Generative AI-Augmented Methodology for Human-Centred AI Systems

扩展UXR观点金字塔:一种面向人本AI系统的生成式AI增强方法论

Festus Fatai Adedoyin, Huseyin Dogan, Melike Akca, Abiodun Adedeji

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算机与工程学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 针对英国债务管理中的AI金融系统,通过扩展UXR观点金字塔,提出一种结合生成式AI的增强方法论,包括AI增强观点金字塔、结构化提示架构和AI驱动的Playbook卡片系统,以提升可解释性、公平性和问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31574 2026-06-01 cs.HC 50%

Can Generative AI help people navigate Radical Moral Disagreements? The CONSIDER prototype

生成式AI能否帮助人们应对根本性道德分歧?CONSIDER原型

William Hohnen-Ford, Sarah Chen, Kathryn B. Francis, Madeline G. Reinecke, Ilina Singh, David Lyreskog

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出CONSIDER原型,一种基于大型语言模型的一对一AI工具,通过结构化分歧帮助用户澄清价值观,以应对根本性道德分歧。

Comments 25 pages, 1 figure, 2 tables. Submitted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30248 2026-06-01 cs.CV 50%

GenClaw: Code-Driven Agentic Image Generation

GenClaw: 代码驱动的智能体图像生成

Junyan Ye, Jun He, Zilong Huang, Dongzhi Jiang, Xuan Yang, Rui Chen, Weijia Li

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出GenClaw,一种代码驱动的智能体图像生成范式,通过概念构思、代码草图绘制和纹理补充三个阶段,将黑盒图像生成转变为可控、可解释的分阶段过程。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏