arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2604.01634 2026-04-03 cs.LG cs.CL 81%

CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning

CRIT: 基于图的自动数据合成以增强跨模态多跳推理

Junyoung Sung, Seungwoo Lyu, Minjun Kim, Sumin An, Arsha Nagrani, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(高丽大学计算机科学与工程系) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 CRIT通过图基自动管道生成复杂跨模态推理任务,提升多跳推理能力,实验表明先进模型在该任务上表现欠佳,训练于CRIT的模型在SPIQA等基准上显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12797 2026-04-03 cs.CV cs.AI cs.CL 81%

KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding

KARL:面向知识密集型视觉定位的知识感知推理与强化学习

Xinyu Ma, Ziyang Ding, Zhicong Luo, Chi Chen, Zonghao Guo, Derek F. Wong, Zhen Zhao, Xiaoyi Feng, Maosong Sun

机构 * University of Macau(澳门大学) Shandong University(山东大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出KARL框架,通过知识引导的推理数据和强化学习方法,提升模型在知识密集型视觉定位任务中的表现,实现跨领域泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00770 2026-04-02 cs.LG cs.AI 81%

Thinking Wrong in Silence: Backdoor Attacks on Continuous Latent Reasoning

沉默中的错误思考:对连续潜在推理的后门攻击

Swapnil Parekh

机构 * Intuit

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ThoughtSteer攻击,通过扰动输入嵌入向量,在连续潜在空间中产生可靠答案,同时规避所有现有防御,揭示了神经坍缩机制在潜在空间中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00493 2026-04-02 cs.CV cs.AI cs.LG 81%

A Reasoning-Enabled Vision-Language Foundation Model for Chest X-ray Interpretation

一种用于胸部X光解读的推理增强视觉-语言基础模型

Yabin Zhang, Chong Wang, Yunhe Gao, Jiaming Liu, Maya Varma, Justin Xu, Sophie Ostmeier, Jin Long, Sergios Gatidis, Seena Dehkharghani, Arne Michalson, Eun Kyoung Hong, Christian Bluethgen, Haiwei Henry Guo, Alexander Victor Ortiz, Stephan Altmayer, Sandhya Bodapati, Joseph David Janizek, Ken Chang, Jean-Benoit Delbrouck, Akshay S. Chaudhari, Curtis P. Langlotz

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CheXOne模型通过生成诊断预测和临床依据的推理轨迹,提升胸部X光解读的可解释性与准确性,在多个评估任务中表现优异。

Comments Codes: https://github.com/YBZh/CheXOne Models: https://huggingface.co/StanfordAIMI/CheXOne

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10788 2026-04-01 cs.AI cs.CL 81%

From Efficiency to Adaptivity: A Deeper Look at Adaptive Reasoning in Large Language Models

从效率到适应性:深入探讨大语言模型中的适应性推理

Chao Wu, Baoheng Li, Mingchen Gao, Yu Tian, Zhenyi Wang

机构 * University at Buffalo(布法罗大学) University of Central Florida(中佛罗里达大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨大语言模型中适应性推理的核心方法与贡献,提出适应性推理的控制增强策略优化问题,并构建系统分类法以比较不同策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16635 2026-04-01 cs.MA cs.AI cs.CL cs.HC cs.IR 81%

MA-SAPO: Multi-Agent Reasoning for Score-Aware Prompt Optimization

MA-SAPO:多智能体推理用于评分感知提示优化

Wonduk Seo, Juhyeon Lee, Junseo Koh, Wonseok Choi, Hyunjin An, Jian Park, Seunghyun lee, Haihua Chen, Yi Bu

机构 * Enhans Peking University(北京大学) Fudan University(复旦大学) University of North Texas(北德克萨斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MA-SAPO框架,通过多智能体推理将评估结果与针对性改进联系起来,提升提示优化的可解释性和可控性,实验表明其在多个评估指标上优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12702 2026-03-31 cs.IR cs.CL cs.LG 81%

FGTR: Fine-Grained Multi-Table Retrieval via Hierarchical LLM Reasoning

FGTR: 通过层次化LLM推理实现细粒度多表检索

Chaojie Sun, Bin Cao, Tiantian Li, Chenyu Hou, Ruizhe Li, Jing Fan

机构 * Zhejiang University of Technology(浙江工业大学) University of Aberdeen(阿伯丁大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出FGTR,一种基于层次化LLM推理的细粒度多表检索方法,通过识别相关模式元素并检索对应单元格内容,构建与查询匹配的子表,提升检索精度和效率。

Comments work in process;10pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23392 2026-03-31 cs.AI cs.CL 81%

Your Models Have Thought Enough: Training Large Reasoning Models to Stop Overthinking

您的模型已经思考足够了:训练大型推理模型以停止过度思考

Jinyi Han, Ying Huang, Ying Liao, Zishang Jiang, Xikun Lu, Haiquan Zhao, Xinyi Wang, Guanghao Zhou, Sihang Jiang, Jiaqing Liang, Weikang Zhou, Zeye Sun, Fei Yu, Yanghua Xiao

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海智能教育研究院) School of Data Science, Fudan University(复旦大学数据科学学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Antgroup(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出JET方法,通过训练模型主动终止不必要的推理步骤,提升推理效率而不牺牲准确性,在奥lympiad基准测试中实现4.6%的准确率提升和46.3%的输出长度减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26332 2026-03-30 cs.CL cs.AI 81%

CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Law

CALRK-Bench:评估韩国法律中的情境感知法律推理

JiHyeok Jung, TaeYoung Yoon, HyunSouk Cho

机构 * KAIST AI(韩国科学技术院人工智能学院) Law School, Ajou University(亚洲大学法学院) Department of Artificial Intelligence, Ajou University(亚洲大学人工智能系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CALRK-Bench,一个基于韩国法律体系的情境感知法律推理基准,评估模型对法律规范时效性、案件法律信息充分性及法律判断变化原因的理解能力,实验表明大语言模型在这些任务上表现不佳。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25253 2026-03-27 cs.CL cs.AI 81%

MolQuest: A Benchmark for Agentic Evaluation of Abductive Reasoning in Chemical Structure Elucidation

MolQuest: 一个用于化学结构解析中代理评估归纳推理的基准

Taolin Han, Shuang Wu, Jinghang Wang, Yuhao Zhou, Renquan Lv, Bing Zhao, Wei Hu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MolQuest通过多轮交互任务评估LLM在复杂化学任务中的归纳推理与策略决策能力,揭示当前模型在真实科学场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03345 2026-03-27 cs.AI cs.CL 81%

Do Language Models Follow Occam's Razor? An Evaluation of Parsimony in Inductive and Abductive Reasoning

语言模型遵循奥卡姆剃刀吗?对归纳和反向推理中简约性的评估

Yunxin Sun, Abulhair Saparov

机构 * Purdue University(普渡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估大型语言模型在归纳和反向推理中是否遵循奥卡姆剃刀原则,通过生成综合推理问题测试其在简单和复杂场景中的表现,发现模型在复杂世界模型中难以生成高质量假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24846 2026-03-27 cs.CV cs.AI cs.LG 81%

NeuroVLM-Bench: Evaluation of Vision-Enabled Large Language Models for Clinical Reasoning in Neurological Disorders

NeuroVLM-Bench:评估用于神经系统疾病临床推理的视觉增强大语言模型

Katarina Trojachanec Dineva, Stefan Andonov, Ilinka Ivanoska, Ivan Kitanovski, Sasho Gramatikov, Tamara Kostova, Monika Simjanoska Misheva, Kostadin Mishev

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了视觉增强大语言模型在神经疾病临床推理中的性能,通过多模态模型在MRI和CT数据集上进行基准测试,发现影像属性基本解决,但诊断推理仍具挑战性。

Comments 53 pages, 12 figures. Manuscript submitted to the BMC Medical Informatics and Decision Making journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23518 2026-03-26 cs.CL cs.AI 81%

Cluster-R1: Large Reasoning Models Are Instruction-following Clustering Agents

Cluster-R1: 大型推理模型是遵循指令的聚类代理

Peijun Qing, Puneet Mathur, Nedim Lipka, Varun Manjunatha, Ryan Rossi, Franck Dernoncourt, Saeed Hassanpour, Soroush Vosoughi

机构 * Dartmouth College(达特茅斯学院) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Cluster-R1,通过将遵循指令的聚类任务重新定义为生成任务,训练大型推理模型作为自主聚类代理,以提升对用户指令的响应能力及聚类结构的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22318 2026-03-25 cs.CL cs.LG 81%

Flying Pigs, FaR and Beyond: Evaluating LLM Reasoning in Counterfactual Worlds

飞行猪、FaR及更广泛的领域:评估LLM在反事实世界中的推理能力

Anish R Joishy, Ishwar B Balappanawar, Vamshi Krishna Bonagiri, Manas Gaur, Krishnaprasad Thirunarayan, Ponnurangam Kumaraguru

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Wright State University(威斯汀豪斯州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM在反事实场景下的推理能力,提出FaR方法以增强模型的元认知,减少逻辑与知识冲突带来的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21720 2026-03-24 cs.CL cs.AI 81%

SemEval-2026 Task 12: Abductive Event Reasoning: Towards Real-World Event Causal Inference for Large Language Models

SemEval-2026任务12:归纳事件推理:面向大规模语言模型的现实事件因果推断

Pengfei Cao, Mingxuan Yang, Yubo Chen, Chenlong Zhang, Mingxuan Liu, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出面向现实事件因果推断的归纳事件推理任务,通过多选基准测试解决分布式证据、间接背景因素和语义相关但非因果干扰等挑战,评估了122个参与者的518份提交结果。

Comments 9 pages, 3 figures, semeval 2026 task 12 description paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01547 2026-03-24 cs.CV cs.AI cs.LG 81%

Vision-language models lag human performance on physical dynamics and intent reasoning

视觉-语言模型在物理动态和意图推理上仍逊于人类表现

Tianjun Gu, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan, Athanasios V

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Agder(阿格德大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Teleo-Spatial Intelligence(TSI)以连接时空变化与目标导向结构,通过EscherVerse大规模开放世界资源评估,发现视觉-语言模型在开放世界中仍无法达到人类水平的意图推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19539 2026-03-23 cs.CL cs.AI 81%

FDARxBench: Benchmarking Regulatory and Clinical Reasoning on FDA Generic Drug Assessment

FDARxBench:基于FDA通用药物评估的监管与临床推理基准测试

Betty Xiong, Jillian Fisher, Benjamin Newman, Meng Hu, Shivangi Gupta, Yejin Choi, Lanyan Fang, Russ B Altman

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) U.S. Food and Drug Administration(美国食品药品监督管理局)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出FDARxBench基准测试,用于评估基于文档的问答任务,通过FDA药物标签文档生成高质量问答示例,揭示语言模型在事实基础、长上下文检索和安全拒绝行为方面的差距。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19306 2026-03-23 cs.IR cs.AI cs.LG 81%

VERDICT: Verifiable Evolving Reasoning with Directive-Informed Collegial Teams for Legal Judgment Prediction

VERDICT: 可验证的演进推理与指令驱动的协作团队用于法律判断预测

Hui Liao, Chuan Qin, Yongwen Ren, Hao Li, Zhenya Huang, Yanyong Zhang, Chao Wang

机构 * University of Science and Technology of China(中国科学技术大学) Chinese Academy of Sciences(中国科学院) iFLYTEK AI Research(iFLYTEK人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 VERDICT通过模拟虚拟合议庭,提出自反思协作多智能体框架,结合混合法理记忆实现法律推理的可验证性和适应性,提升法律预测的准确性和解释性。

Comments 15 pages,3 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19252 2026-03-23 cs.CL cs.AI 81%

GeoChallenge: A Multi-Answer Multiple-Choice Benchmark for Geometric Reasoning with Diagrams

GeoChallenge: 一个用于基于图表的几何推理的多答案多选基准

Yushun Zhang, Weiping Fu, Zesheng Yang, Bo Zhao, Lingling Zhang, Jian Zhang, Yumeng Fu, Jiaxing Huang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 GeoChallenge通过9万个多步骤几何证明问题,评估大语言模型的符号推理能力,揭示模型在多选设置下的精确匹配失败、视觉依赖弱和推理扩展不足等问题。

Comments 18 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19182 2026-03-20 cs.AI cs.CL 81%

Box Maze: A Process-Control Architecture for Reliable LLM Reasoning

迷宫盒子:一种用于可靠大语言模型推理的过程控制架构

Zou Qiang

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Box Maze框架,通过内存 grounding、结构化推理和边界约束三层结构提升LLM推理可靠性,实验显示其在对抗性场景中显著降低边界失效率。

Comments 10 pages, 5 tables, 0 figures. Conceptual architecture with preliminary simulation-based validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19017 2026-03-20 cs.CL cs.AI 81%

What Really Controls Temporal Reasoning in Large Language Models: Tokenisation or Representation of Time?

真正控制大语言模型时间推理的是令牌化还是时间表示?

Gagan Bhatia, Ahmad Muhammad Isa, Maxime Peyrard, Wei Zhao

机构 * University of Aberdeen(阿伯丁大学) Université Grenoble Alpes & CNRS(格勒诺布尔阿尔卑斯大学及国家科学研究中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过MultiTempBench验证了大语言模型时间推理的核心因素,发现令牌化质量是资源依赖型瓶颈,同时时间线性度在高资源语言中是主要预测因素,而碎片化在低资源语言中更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21814 2026-03-20 cs.AI cs.CL 81%

Prompt Architecture Determines Reasoning Quality: A Variable Isolation Study on the Car Wash Problem

提示架构决定推理质量:关于汽车洗问题的变量隔离研究

Heejin Jo

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过变量隔离研究,探讨了提示架构层在汽车洗问题推理中的作用,发现STAR框架可将准确率提升至85%,结合用户资料和RAG上下文后达到100%。

Comments 9 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13417 2026-03-19 cs.AI cs.CL 81%

Assessing LLM Reasoning Through Implicit Causal Chain Discovery in Climate Discourse

通过气候 discourse 中的隐含因果链发现评估 LLM 推理

Liesbeth Allein, Nataly Pineda-Castañeda, Andrea Rocci, Marie-Francine Moens

机构 * Department of Computer Science, KU Leuven(卢森堡大学计算机科学系) Institute of Argumentation, Linguistics, and Semiotics (IALS)(论证、语言学与象征学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过隐含因果链发现任务评估 LLM 的因果推理能力,发现其生成的因果步骤数量和粒度存在差异,但主要依赖关联模式匹配而非真实因果推理。

Comments LREC 2026, appendix to be found in ACL anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16112 2026-03-18 cs.CL cs.AI cs.CE 81%

ASDA: Automated Skill Distillation and Adaptation for Financial Reasoning

ASDA:自动化技能蒸馏与适应用于金融推理

Tik Yu Yim, Wenting Tan, Sum Yee Chan, Tak-Wah Lam, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ASDA通过迭代误差纠正学习生成结构化技能 artifact,无需修改模型权重,在金融推理任务中实现显著提升,优于无训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14761 2026-03-18 cs.AI cs.CL 81%

BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models

BrainBench:揭示大型语言模型在常识推理上的差距

Yuzhe Tang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 BrainBench通过100道脑筋急转弯问题,揭示LLM在常识推理上的不足,评估八种前沿模型,发现其推理存在随机性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06955 2026-03-17 cs.CL cs.AI 81%

BIS Reasoning 1.0: The First Large-Scale Japanese Benchmark for Belief-Inconsistent Syllogistic Reasoning

BIS推理1.0:首个大规模日语信念不一致三段论基准数据集

Ha-Thanh Nguyen, Hideyuki Tachibana, Chaoran Liu, Qianying Liu, Su Myat Noe, Koichi Takeda, Sadao Kurohashi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BIS推理1.0,首个针对大语言模型信念不一致推理评估的日语三段论数据集,通过系统引入逻辑有效但信念不一致的三段论,揭示信念偏差问题,并评估多种模型在零样本下的表现。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14486 2026-03-17 cs.CL cs.AI 81%

Infinite Problem Generator: Verifiably Scaling Physics Reasoning Data with Agentic Workflows

无限问题生成器:通过代理工作流可验证地扩展物理推理数据

Aditya Sharan, Sriram Hebbale, Dhruv Kumar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出IPG框架,通过公式-as-代码方法生成可解物理问题,解决大语言模型训练中高质量数据稀缺的问题,发布包含1335个经典力学问题的ClassicalMechanicsV1数据集,展示高结构多样性及复杂度与代码长度的强相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24711 2026-03-17 cs.AI cs.CL 81%

Stop Before You Fail: Operational Capability Boundaries for Mitigating Unproductive Reasoning in Large Reasoning Models

在失败前停止:为减轻大推理模型中低效推理而设定的操作能力边界

Qingjie Zhang, Yujia Fu, Yang Wang, Liu Yan, Tao Wei, Ke Xu, Minlie Huang, Han Qiu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大推理模型在面对超出其操作能力边界的问题时,是否能通过早期信号预测并减少无效推理,提出两种监控策略提升效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12078 2026-03-16 cs.AI cs.CL 81%

Tiny Recursive Reasoning with Mamba-2 Attention Hybrid

微小递归推理与Mamba-2注意力混合

Wenlong Wang, Fergal Reid

机构 * Intercom Dublin, Ireland(Intercom都柏林,爱尔兰)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨将Mamba-2混合操作符替换TRM中的Transformer块,验证其在递归框架下保持推理能力,提升抽象推理任务表现。

Comments Published at ICLR 2026 Latent & Implicit Thinking Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12615 2026-03-16 cs.CY cs.AI cs.CL cs.HC 81%

Literary Narrative as Moral Probe : A Cross-System Framework for Evaluating AI Ethical Reasoning and Refusal Behavior

文学叙述作为道德探针:一种跨系统框架用于评估AI伦理推理与拒绝行为

David C. Flynn

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过文学叙述中的不可解道德情境,提出一种跨系统框架,评估AI的伦理推理与拒绝行为,发现系统能力与仪器复杂性相关,揭示了伦理推理与真实能力间的差距。

Comments 27 pages, 6 tables. Target: Minds and Machines (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏