arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2603.18418 2026-03-20 cs.CV cs.AI 79%

Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

注意罕见病:罕见皮肤疾病能否通过诊断推理可靠诊断?

Yang Liu, Jiyao Yang, Hongjin Zhao, Xiaoyong Li, Yanzhe Ji, Xingjian Li, Runmin Jiang, Tianyang Wang, Saeed Anwar, Dongwoo Kim, Yue Yao, Zhenyue Qin, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Australian National University(澳大利亚国立大学) University of Western Australia(西澳大学) POSTECH Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出DermCase基准,通过多模态数据评估罕见皮肤疾病诊断推理能力,揭示现有模型在诊断准确性和临床推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20579 2026-03-20 cs.CV cs.AI cs.MM 79%

Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence

Open-o3-Video: 基于显式时空证据的视频推理

Jiahao Meng, Xiangtai Li, Haochen Wang, Yue Tan, Tao Zhang, Lingdong Kong, Yunhai Tong, Anran Wang, Zhiyang Teng, Yujing Wang, Zhuochen Wang

机构 * PKU(北京大学) ByteDance(字节跳动) CASIA(CASIA研究院) WHU(武汉大学) NUS(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Open-o3-Video,通过显式时空证据提升视频推理的可追溯性与可验证性,基于STGR数据集和冷启动强化学习策略,在V-STAR基准上取得SOTA性能,并支持置信度感知的测试时扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17680 2026-03-19 cs.CV cs.AI 79%

WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models

WeatherReasonSeg:一种用于视觉语言模型中天气感知推理分割的基准测试

Wanjun Du, Zifeng Yuan, Tingting Chen, Fucai Ke, Beibei Lin, Shunli Zhang

机构 * Beijing Jiaotong University(北京交通大学) National University of Singapore(新加坡国立大学) Monash University(墨尔本大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出WeatherReasonSeg基准测试,评估视觉语言模型在恶劣天气下的推理分割能力,通过合成和真实数据集分析天气对模型性能的影响,发现天气严重程度与模型性能呈单调下降关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10492 2026-03-19 cs.CL 79%

Human-AI Co-reasoning for Clinical Diagnosis with Evidence-Integrated Language Agent

人机协同推理用于临床诊断:证据整合语言代理

Zhongzhen Huang, Yan Ling, Hong Chen, Ye Feng, Li Wu, Linjie Mu, Shaoting Zhang, Xiaofan Zhang, Kun Qian, Xiaomu Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出PULSE,结合领域调优的大语言模型与文献检索,支持复杂病例的诊断决策。实验显示PULSE在专家级准确度上表现优异,且在罕见病病例中保持稳定性能,揭示了语言模型在临床诊断中的潜力与局限。

Comments After further evaluation, we have decided to withdraw the current version of this manuscript for further revision. We plan to add new experiments, improve the writing and overall presentation for greater clarity and coherence, and re-examine the dataset and related descriptions to ensure rigor and reliability before submitting an updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15662 2026-03-19 cs.AI 79%

Stepwise Think-Critique: A Unified Framework for Robust and Interpretable LLM Reasoning

逐步思考-批判:一种用于鲁棒且可解释的大语言模型推理的统一框架

Jiaqi Xu, Cuiling Lan, Xuejin Chen, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出STC框架,通过在推理与自我批判间交替进行,提升大语言模型的鲁棒性和可解释性,实验显示其在数学推理任务中表现出色。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16463 2026-03-18 cs.AI cs.HC 79%

Follow the Clues, Frame the Truth: Hybrid-evidential Deductive Reasoning in Open-Vocabulary Multimodal Emotion Recognition

循证推断,还原真相:面向开放词汇多模态情感识别的混合证据推理

Yu Liu, Lei Zhang, Haoxun Li, Hanlei Shi, Yuxuan Ding, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China(杭州高等研究 institute,中国科学院大学,杭州,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出HyDRA架构,通过混合证据推理解决多模态情感识别中的歧义问题,通过强化学习优化推理过程,提升在复杂场景下的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16445 2026-03-18 cs.AI 79%

Visual Distraction Undermines Moral Reasoning in Vision-Language Models

视觉干扰削弱了视觉语言模型中的道德推理

Xinyi Yang, Chenheng Xu, Weijun Hong, Ce Mo, Qian Wang, Fang Fang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Yuanpei College, Peking University(北京大学元培学院) Department of Psychology, Sun Yat-sen University(中山大学心理学系) State Key Lab of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究揭示视觉输入会改变视觉语言模型的道德决策,超越文本安全机制,提出多模态基准MDS以分析视觉与上下文变量对道德决策的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18466 2026-03-18 cs.CY cs.AI cs.CV 79%

Can Multimodal LLMs See Science Instruction? Benchmarking Pedagogical Reasoning in K-12 Classroom Videos

多模态大语言模型能否看见科学教学?K-12课堂视频中教学推理的基准测试

Yixuan Shen, Peng He, Honglu Liu, Jinxuan Fan, Yuyang Ji, Tingting Li, Tianlong Chen, Kaidi Xu, Feng Liu

机构 * Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系) Department of Teaching and Learning, Washington State University(华盛顿州立大学教学与学习系) College of Chemistry, Beijing Normal University(北京师范大学化学学院) Department of Computer Science, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SciIBI视频基准,用于分析科学课堂讨论,评估多模态模型在教学推理中的表现,发现模型在区分教学实践时存在局限,需更深入的推理。

Comments 17pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10477 2026-03-18 cs.CV cs.AI cs.CY 79%

Urban Socio-Semantic Segmentation with Vision-Language Reasoning

城市社会语义分割与视觉-语言推理

Yu Wang, Yi Wang, Rui Dai, Yujie Wang, Kaikui Liu, Xiangxiang Chu, Yansheng Li

机构 * Wuhan University(武汉大学) Amap, Alibaba Group(阿里巴巴集团地图部门)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SocioReasoner框架,通过视觉-语言推理实现城市社会语义分割,引入SocioSeg数据集,实验显示优于现有方法且具备强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23252 2026-03-18 cs.LG 79%

NanoFlux: Adversarial Dual-LLM Evaluation and Distillation For Multi-Domain Reasoning

NanoFlux:对抗性双语言模型评估与蒸馏用于多领域推理

Raviteja Anantha, Soheil Hor, Teodor Nicola Antoniu, Layne C. Price

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 NanoFlux通过对抗性生成训练数据提升大语言模型推理能力,其生成数据在数学、科学和医学领域均优于传统微调方法,且计算成本降低3-14倍。

Comments Preprint version 3; Updated References

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15542 2026-03-17 cs.CY cs.AI 79%

InterveneBench: Benchmarking LLMs for Intervention Reasoning and Causal Study Design in Real Social Systems

InterveneBench:用于干预推理和真实社会系统因果研究设计的LLM基准测试

Shaojie Shi, Zhengyu Shi, Lingran Zheng, Xinyu Su, Anna Xie, Bohao Lv, Rui Xu, Zijian Chen, Zhichao Chen, Guolei Liu, Naifu Zhang, Mingjian Dong, Zhuo Quan, Bohao Chen, Teqi Hao, Yuan Qi, Yinghui Xu, Libo Wu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 InterveneBench通过真实社会科学研究评估LLM在干预推理和因果研究设计中的能力,发现现有模型表现不足,并提出STRIDES多智能体框架提升性能。

Comments 35pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04779 2026-03-17 cs.CL cs.SD eess.AS 79%

MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark

MMSU:一个大规模多任务语音语言理解与推理基准

Dingdong Wang, Junan Li, Jincenzi Wu, Dongchao Yang, Xueyuan Chen, Tianhua Zhang, Helen Meng

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MMSU基准通过整合语音的语义、语调和语音学特征,评估语音语言理解与推理能力,发现现有模型存在改进空间,为开发更高级的人机语音交互系统提供新标准。

Comments ICLR 2026. MMSU benchmark is available at https://huggingface.co/datasets/ddwang2000/MMSU. Project page https://github.com/dingdongwang/MMSU

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01450 2026-03-17 cs.CL 79%

Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data

面向最少微调数据的高效医疗推理

Xinlin Zhuang, Feilong Tang, Haolin Yang, Xiwei Liu, Ming Hu, Huifa Li, Haochen Xue, Junjun He, Zongyuan Ge, Yichen Li, Ying Qian, Imran Razzak

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出DIQ数据选择策略,通过平衡难度与梯度影响,提升医疗推理效率,实验证明仅用1%数据即可达到全数据表现,10%数据优于基线方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13628 2026-03-17 cs.CV cs.AI 79%

Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models

基于可定位性的自适应推理图像地理定位方法

Bo Yu, Fengze Yang, Yiming Liu, Chao Wang, Xuewen Luo, Taozhe Li, Ruimin Ke, Xiaofan Zhou, Chenxi Liu

机构 * The University of Utah(犹他大学) The University of Oklahoma(俄克拉荷马大学) Worcester Polytechnic Institute(沃斯特理工学院) Rensselaer Polytechnic Institute(雷士利理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Geo-ADAPT框架,通过优化可定位性评分和两阶段分组相对策略优化,提升图像地理定位的适应性和准确性,减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13033 2026-03-16 cs.CV cs.LG cs.RO 79%

ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models

ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准

Yanpeng Zhao, Wentao Ding, Hongtao Li, Baoxiong Jia, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10858 2026-03-12 cs.RO cs.AI cs.MA 79%

GRACE: A Unified 2D Multi-Robot Path Planning Simulator & Benchmark for Grid, Roadmap, And Continuous Environments

GRACE:一种统一的二维多机器人路径规划模拟器与基准,适用于网格、路网和连续环境

Chuanlong Zang, Anna Mannucci, Isabelle Barz, Philipp Schillinger, Florian Lier, Wolfgang Hönig

机构 * Robert Bosch GmbH, Corporate Research(罗伯特·博世集团,企业研究) Technical University of Berlin(柏林技术大学)

专题命中 推理评测 :planning(title,abstract);分类 cs.AI

AI总结 GRACE是一种统一的二维多机器人路径规划模拟器与基准,通过统一的抽象级别和评估协议,实现跨网格、路网和连续环境的可比性比较,以提升多机器人规划研究的可重复性和应用性。

Comments ICRA 2026, code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10793 2026-03-12 cs.CL 79%

Multilingual Reasoning Gym: Multilingual Scaling of Procedural Reasoning Environments

多语言推理健身房:多语言的程序化推理环境扩展

Konstantin Dobler, Simon Lehnerer, Federico Scozzafava, Jonathan Janke, Mohamed Ali

机构 * Apple(苹果公司) Hasso Plattner Institute & ELLIS Unit Potsdam(霍普夫研究所与波茨坦ELLIS单元)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Multilingual Reasoning Gym通过多语言程序化生成可验证推理问题,支持跨语言大规模数据生成和强化学习研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10175 2026-03-12 eess.AS cs.CL 79%

Calibration-Reasoning Framework for Descriptive Speech Quality Assessment

描述性语音质量评估的校准-推理框架

Elizaveta Kostenok, Mathieu Salzmann, Milos Cernak

机构 * EPFL(苏黎世联邦理工学院) Logitech(洛吉科技)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出校准-推理框架,通过强化学习优化提升语音质量评估的多维描述和缺陷定位精度。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09249 2026-03-11 cs.AI 79%

Social-R1: Towards Human-like Social Reasoning in LLMs

Social-R1: 向大语言模型中引入人类般的社交推理

Jincenzi Wu, Yuxuan Lei, Jianxun Lian, Yitian Huang, Lexin Zhou, Haotian Li, Xing Xie, Helen Meng

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Social-R1通过多维奖励对齐模型推理与人类认知,利用ToMBench-Hard提供困难训练案例,使大模型在社交推理任务中实现超越和稳健泛化。

Comments 27 pages. Code and dataset will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22854 2026-03-10 cs.LG cs.MA 79%

CRAwDAD: Causal Reasoning Augmentation with Dual-Agent Debate

基于双智能体辩论的因果推理增强:CRAwDAD

Finn G. Vamosi, Nils D. Forkert

机构 * Department of Computer Science, University of Calgary(卡莱尔大学计算机科学系) Department of Radiology, Hotchkiss Brain Institute, and Alberta Children’s Hospital Research Institute, University of Calgary(卡莱尔大学放射学系、霍奇基斯脑研究所及阿尔伯塔儿童医院研究所在卡莱尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 CRAwDAD通过双智能体辩论框架提升因果推理准确性,利用推理语言模型在因果推理和辩论中实现性能提升。

Comments 12 pages, 8 figures. Code available at https://github.com/finnvamosi/CRAwDAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08166 2026-03-10 cs.CL 79%

RexDrug: Reliable Multi-Drug Combination Extraction through Reasoning-Enhanced LLMs

RexDrug:通过增强推理的大型语言模型实现可靠的多药物组合提取

Zhijun Wang, Ling Luo, Dinghao Pan, Huan Zhuang, Lejing Yu, Yuanyuan Sun, Hongfei Lin

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 RexDrug通过增强推理的大型语言模型,实现了可靠的多药物组合提取,优于现有方法并在二元和n元任务中均表现优异。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07931 2026-03-10 cs.CL 79%

BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence

BRIDGE: 多跳推理长多模态文档基准测试与证据 grounded

Biao Xiang, Soyeon Caren Han, Yihao Ding

机构 * The University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 BRIDGE是一个针对长多模态文档的多跳推理基准测试,通过显式的多跳推理注释揭示证据聚合和 grounding 的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06680 2026-03-10 cs.CV cs.AI 79%

VB: Visibility Benchmark for Visibility and Perspective Reasoning in Images

VB:用于图像中可见性与视角推理的可见性基准

Neil Tripathi

机构 * New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 VB基准测试视觉-语言模型在图像可见性推理中的能力,通过可见性声明和置信度评分评估模型性能。

Comments 18 pages, 1 figure, 3 tables. Code and data: https://github.com/neilt93/Paper-with-Davis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06648 2026-03-10 cs.CV cs.AI 79%

ObjChangeVR: Object State Change Reasoning from Continuous Egocentric Views in VR Environments

ObjChangeVR: 从VR环境中连续眼动视角推断物体状态变化

Shiyi Ding, Shaoen Wu, Ying Chen

机构 * Kennesaw State University(肯纳邦大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ObjChangeVR通过结合视角感知和时间基检索,有效识别VR环境中物体状态变化,提升多模态大语言模型在复杂场景下的表现。

Comments European Chapter of the Association for Computational Linguistics (EACL) 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22364 2026-03-10 cs.DB cs.AI cs.DC 79%

Cost Trade-offs of Reasoning and Non-Reasoning Large Language Models in Text-to-SQL

文本到SQL系统中推理与非推理大语言模型的代价权衡

Saurabh Deochake, Debajyoti Mukhopadhyay

机构 * WIDiCoReL Research Lab(WIDiCoReL研究实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了推理与非推理大语言模型在文本到SQL任务中的成本权衡,发现推理模型在处理效率和成本控制上表现更优,但非推理模型存在显著的成本波动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06570 2026-03-09 cs.CV cs.AI 79%

SUREON: A Benchmark and Vision-Language-Model for Surgical Reasoning

SUREON:一个手术推理的基准和视觉-语言模型

Alejandra Perez, Anita Rau, Lee White, Busisiwe Mlambo, Chinedu Nwoye, Muhammad Abdullah Jamal, Omid Mohareri

机构 * Intuitive Surgical Inc.

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SUREON通过大规模视频问答数据集和两种模型提升手术推理能力,准确率超过84%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06416 2026-03-09 cs.CL 79%

Evaluation of Deontic Conditional Reasoning in Large Language Models: The Case of Wason's Selection Task

对大型语言模型中规范条件推理能力的评估:瓦森选择任务案例

Hirohiko Abe, Kentaro Ozeki, Risako Ando, Takanobu Morishita, Koji Mineshima, Mitsuhiro Okada

机构 * Keio University(Keio大学) University of Tokyo(东京大学) abelard.flet.keio.ac.jp(Keio大学abelard.flet实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究通过瓦森选择任务评估大型语言模型在规范规则下的条件推理能力,发现其表现与人类相似,存在匹配偏误等认知偏差。

Comments To appear in the Proceedings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01288 2026-03-09 cs.LG 79%

EDIS: Diagnosing LLM Reasoning via Entropy Dynamics

EDIS: 通过熵动力学诊断LLM推理

Chenghua Zhu, Siyan Wu, Xiangkang Zeng, Zishan Xu, Zhaolu Kang, Yifu Guo, Yuquan Lu, Junduan Huang, Guojing Zhou

机构 * South China Normal University(华南师范大学) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 EDIS通过分析LLM推理过程中的熵动态变化,识别错误推理的特征模式,提供有效的诊断信号以提升推理准确性。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05040 2026-03-06 cs.AI 79%

Enhancing Zero-shot Commonsense Reasoning by Integrating Visual Knowledge via Machine Imagination

通过机器想象力整合视觉知识以增强零样本常识推理

Hyuntae Park, Yeachan Kim, SangKeun Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Computer Science and Engineering, Korea University(计算机科学与工程系,韩国大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Imagine框架,通过整合视觉知识提升零样本常识推理性能,有效缓解人类报告偏见,增强模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04319 2026-03-05 cs.CL 79%

AILS-NTUA at SemEval-2026 Task 12: Graph-Based Retrieval and Reflective Prompting for Abductive Event Reasoning

AILS-NTUA 在 SemEval-2026 任务 12: 基于图的检索与反思提示的归纳事件推理

Nikolas Karafyllis, Maria Lymperaiou, Giorgos Filandrianos, Athanasios Voulodimos, Giorgos Stamou

机构 * School of Electrical and Computer Engineering, AILS Laboratory(电气与计算机工程学院,AILS实验室) National Technical University of Athens(雅典国家技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 AILS-NTUA 提出基于图检索与反思提示的三阶段系统,在 SemEval-2026 任务 12 中实现 0.95 准确率,揭示多标签因果推理中的系统性失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏