arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2506.07553 2026-01-14 cs.AI q-bio.QM 79%

GTR-CoT: Graph Traversal as Visual Chain of Thought for Molecular Structure Recognition

GTR-CoT:图遍历作为视觉推理链用于分子结构识别

Jingchao Wang, Yifan He, Haote Yang, Jiang Wu, Lingli Ge, Xingjian Wei, Yinfan Wang, Linye Li, Huijie Ao, Chengjin Liu, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

专题命中 推理评测 :CoT(title);reasoning(abstract);分类 cs.AI

AI总结 GTR-CoT通过图遍历机制和强化学习提升手绘分子结构识别性能,构建首个细粒度评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07790 2026-01-13 cs.AI 79%

Benchmarking Small Language Models and Small Reasoning Language Models on System Log Severity Classification

在系统日志严重性分类上评估小型语言模型和小型推理语言模型

Yahya Masri, Emily Ma, Zifu Wang, Joseph Rogers, Chaowei Yang

机构 * George Mason University(乔治·马歇尔大学) Harvard University(哈佛大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究评估了小型语言模型和小型推理语言模型在系统日志严重性分类上的性能,发现架构设计、训练目标和上下文整合能力共同影响模型表现。

Comments 28 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07342 2026-01-13 cs.AI 79%

Agentic Diagnostic Reasoning over Telecom and Datacenter Infrastructure

基于电信和数据中心基础设施的代理诊断推理

Nicolas Tacheny

机构 * Ni2 Innovation Lab(Ni2创新实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于代理的诊断框架,利用LLM通过MCP协议自主导航基础设施模型,实现故障诊断与影响发现,为自主事件解决和风险预测提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07232 2026-01-13 cs.AI 79%

Yes FLoReNce, I Will Do Better Next Time! Agentic Feedback Reasoning for Humorous Meme Detection

是的,Florne,我下次会做得更好!用于幽默表情包检测的代理反馈推理

Olivia Shanhong Liu, Pai Chet Ng, De Wen Soh, Konstantinos N. Plataniotis

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Florne通过闭环反馈机制提升表情包幽默检测的适应性和解释质量。

Comments LaMAS@AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08344 2026-01-13 cs.AI 79%

What Breaks Knowledge Graph based RAG? Benchmarking and Empirical Insights into Reasoning under Incomplete Knowledge

什么破坏了基于知识图谱的RAG?对在不完整知识下推理的基准测试和经验洞察

Dongzhuoran Zhou, Yuqicheng Zhu, Xiaxia Wang, Hongkuan Zhou, Yuan He, Jiaoyan Chen, Steffen Staab, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) Amazon(亚马逊公司) University of Oxford(牛津大学) The University of Manchester(曼彻斯特大学) University of Southampton(南安普顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出BRINK基准测试,揭示了当前KG-RAG方法在知识不完整时推理能力有限,依赖内部记忆且泛化能力各异。

Comments Accepted as a main conference paper at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14523 2026-01-13 cs.AI 79%

Learning from Reasoning Failures via Synthetic Data Generation

通过合成数据生成学习推理失败

Gabriela Ben Melech Stan, Estelle Aflalo, Avinash Madasu, Vasudev Lal, Phillip Howard

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 通过分析LMM推理失败生成针对性合成数据,提升多模态模型在多个下游任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06707 2026-01-13 cs.CL 79%

Evaluating Accounting Reasoning Capabilities of Large Language Models

评估大型语言模型的会计推理能力

Jie Zhou, Xin Chen, Jie Zhang, Hai Li, Jie Wang, Zhe Li

机构 * School of Computer Engineering, Jiangsu Ocean University(计算机工程学院,江苏海洋大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文评估了大型语言模型在会计推理任务中的能力,通过定义垂直领域会计推理标准,分析了GLM和GPT-4等模型的表现,发现提示设计对性能影响显著,但现有模型仍需优化以满足实际需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06234 2026-01-13 cs.AI 79%

PCoKG: Personality-aware Commonsense Reasoning with Debate

PCoKG:具有辩论机制的个性感知常识推理

Weijie Li, Zhongqing Wang, Guodong Zhou

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PCoKG通过引入辩论机制构建个性感知常识知识图谱,提升对话生成的一致性与个性化水平。

Comments Accept by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05693 2026-01-12 cs.AI 79%

Circular Reasoning: Understanding Self-Reinforcing Loops in Large Reasoning Models

循环推理:理解大推理模型中的自增强循环

Zenghao Duan, Liang Pang, Zihao Wei, Wenbin Duan, Yuxin Tian, Shicheng Xu, Jingcheng Deng, Zhiyi Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出LoopBench数据集和CUSUM算法,用于识别和预测大型推理模型中的自增强循环问题,揭示循环推理的机理并提升模型稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04996 2026-01-12 cs.AI 79%

AlgBench: To What Extent Do Large Reasoning Models Understand Algorithms?

AlgBench: 大型推理模型对算法的理解程度有多高?

Henan Sun, Kaichi Yu, Yuyao Wang, Bowen Liu, Xunkai Li, Rong-Hua Li, Nuo Chen, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 AlgBench通过算法为中心的基准测试揭示大型推理模型在算法理解上的性能差异和局限性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21329 2026-01-12 cs.CL 79%

Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks

你的推理基准可能并未测试推理:揭示抽象推理基准中的感知瓶颈

Xinhe Wang, Jin Huang, Xingjian Zhang, Tianhao Wang, Jiaqi W. Ma

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究发现抽象推理基准中的性能差距主要源于视觉感知限制,而非推理能力不足,需设计分离感知与推理的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09993 2026-01-12 cs.AI 79%

SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models

SPAN:大型语言模型跨日历时间推理的基准测试与改进

Zhongjian Miao, Hao Fu, Chen Wei

机构 * Li Auto(利亚特)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SPAN通过开发时间代理提升大型语言模型跨日历时间推理能力,实验显示其准确率高达95.31%

Comments Accepted at the AAAI 2026 conference. This version includes the supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05073 2026-01-09 cs.LG 79%

Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward

几何推理的里程碑:通过子目标可验证奖励解锁几何推理

Jianlong Chen, Daocheng Fu, Shengze Xu, Jiawei Chen, Yuan Feng, Yue Yang, Junchi Yan, Hongyuan Zha, Renqiu Xia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出SGVR框架,通过子目标可验证奖励提升多模态大语言模型在几何推理及泛化能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04891 2026-01-09 cs.CV cs.LG 79%

Scaling Vision Language Models for Pharmaceutical Long Form Video Reasoning on Industrial GenAI Platform

在工业生成式AI平台上扩展视觉语言模型用于制药长格式视频推理

Suyash Mishra, Qiang Li, Srikanth Patil, Satyanarayan Pati, Baddu Narendra

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出工业GenAI框架,解决制药领域长格式视频推理问题,通过多模态架构和实证分析提升效率并揭示现有VLMs的限制。

Comments Submitted to the Industry Track of Top Tier Conference; currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04086 2026-01-08 cs.CL 79%

KDCM: Reducing Hallucination in LLMs through Explicit Reasoning Structures

KDCM:通过显式推理结构减少大语言模型中的幻觉

Jinbo Hao, Kai Yang, Qingzhen Su, Yifan Li, Chao Jiang

机构 * School of Computer Engineering, Jiangsu Ocean University(江苏海洋大学计算机工程学院) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 KDCM通过显式推理结构减少大语言模型中的幻觉,提升预测可靠性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03400 2026-01-08 cs.CV cs.AI 79%

Eye-Q: A Multilingual Benchmark for Visual Word Puzzle Solving and Image-to-Phrase Reasoning

Eye-Q:一个多语言视觉词谜解决和图像到短语推理的基准

Ali Najar, Alireza Mirrokni, Arshia Izadyari, Sadegh Mohammadian, Amir Homayoon Sharifizade, Asal Meskin, Mobin Bagherian, Ehsaneddin Asgari

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Eye-Q提出一个多语言视觉词谜基准,评估模型在复杂视觉推理中的能力,发现现有模型在抽象和跨语言推理上存在显著差距。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00340 2026-01-08 cs.AI 79%

Better Call CLAUSE: A Discrepancy Benchmark for Auditing LLMs Legal Reasoning Capabilities

更好的CLAUSE:用于审计LLM法律推理能力的差异基准

Manan Roy Choudhury, Adithya Chandramouli, Mannan Anand, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CLAUSE是一个用于评估LLM法律推理能力的基准,通过生成现实扰动合同检测细微法律错误,揭示LLM在识别和解释法律缺陷方面的不足。

Comments 42 pages, 4 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21710 2026-01-07 cs.CL 79%

Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval

Think-on-Graph 3.0: 通过多智能体双进化上下文检索实现高效自适应的异构图LLM推理

Xiaojun Wu, Cehao Yang, Xueyuan Lin, Chengjin Xu, Xuhui Jiang, Yuanliang Sun, Hui Xiong, Jia Li, Jian Guo

机构 * IDEA Research, International Digital Economy Academy(IDEA研究院,国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) DataArc Tech Ltd.(数据弧科技有限公司) Hithink RoyalFlush Information Network Co., Ltd(慧思皇家Flush信息网络有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Think-on-Graph 3.0通过多智能体双进化上下文检索机制,实现高效自适应的异构图LLM推理,提升轻量级模型在复杂推理任务中的性能。

Comments add: reranker agent and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02604 2026-01-07 cs.CL 79%

Scalable Construction of a Lung Cancer Knowledge Base: Profiling Semantic Reasoning in LLMs

可扩展的肺癌知识库构建:在大语言模型中进行语义推理的 profiling

Cesar Felipe Martínez Cisneros, Jesús Ulises Quiroz Bautista, Claudia Anahí Guzmán Solano, Bogdan Kaleb García Rivera, Iván García Pacheco, Yalbi Itzel Balderas Martínez, Kolawole John Adebayoc, Ignacio Arroyo Fernández

机构 * Universidad Tecnológica de la Mixteca(拉巴斯技术大学) Instituto Nacional de Enfermedades Respiratorias (INER) Ismael Cosío Villegas(国家呼吸疾病研究所(INER)伊斯梅尔·科索·维利亚斯) Maynooth University(梅诺特大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出利用OpenIE构建肺癌知识库,通过语义推理提升生物医学NLP性能。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04141 2026-01-07 cs.AI 79%

The Artificial Intelligence Cognitive Examination: A Survey on the Evolution of Multimodal Evaluation from Recognition to Reasoning

人工智能认知测评:多模态评估从识别到推理的演变综述

Mayank Ravishankara, Varindra V. Persad Maharaj

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文综述了多模态AI评估从识别到推理的演变,探讨了测评方法的转变及当前前沿基准的发展。

Journal ref IEEE Access, vol. 14, Dec. 2025, Art. no. 3649182

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10963 2026-01-07 cs.CV cs.CL 79%

MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning

MMMG:大规模、跨学科、多层级的文本到图像推理生成基准

Yuxuan Luo, Yuhui Yuan, Junwen Chen, Haonan Cai, Ziyi Yue, Yuwei Yang, Fatima Zohra Daha, Ji Li, Zhouhui Lian

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MMMG基准,用于评估文本到图像生成模型的推理能力,揭示现有模型在知识图像生成中的不足,并发布FLUX-Reason作为开放基线。

Comments 85 pages, 70 figures, code: https://github.com/MMMGBench/MMMG, project page: https://mmmgbench.github.io/

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025) Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01341 2026-01-06 cs.CL 79%

Reasoning Over Recall: Evaluating the Efficacy of Generalist Architectures vs. Specialized Fine-Tunes in RAG-Based Mental Health Dialogue Systems

基于回忆的推理:评估基于RAG的心理健康对话系统中通用架构与专门微调的有效性

Md Abdullah Al Kafi, Raka Moni, Sumit Kumar Banshal

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过比较通用推理模型与领域特定微调模型,发现通用模型在同理心和上下文理解方面表现更优,表明强大的推理能力比专门训练更能提升心理健康对话系统的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24572 2026-01-06 cs.CL 79%

Korean Canonical Legal Benchmark: Toward Knowledge-Independent Evaluation of LLMs' Legal Reasoning Capabilities

韩国规范法律基准:迈向独立于领域知识的LLM法律推理能力评估

Hongseok Oh, Wonseok Hwang, Kyoung-Woon On

机构 * University of Seoul(首尔大学) LBOX

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 韩国规范法律基准通过问题级支持先例评估LLM法律推理能力,揭示领域知识依赖下的模型差距,展示推理专用模型的优越性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04308 2026-01-06 cs.RO cs.AI cs.CV 79%

RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics

RoboRefer: 向视觉语言模型在机器人中的空间指称推理迈进

Enshen Zhou, Jingkun An, Cheng Chi, Yi Han, Shanyu Rong, Chi Zhang, Pengwei Wang, Zhongyuan Wang, Tiejun Huang, Lu Sheng, Shanghang Zhang

机构 * School of Software, Beihang University(北京航空航天大学软件学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 RoboRefer通过整合深度编码器和强化微调方法,实现了视觉语言模型在机器人中的空间指称推理,提升了复杂场景下的交互能力。

Comments Accepted by NeurIPS 2025. Project page: https://zhoues.github.io/RoboRefer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03104 2026-01-06 cs.AI 79%

ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning

通过合成数据对齐时间序列,利用大语言模型进行增强的理解与推理

Zhe Xie, Zeyan Li, Xiao He, Longlong Xu, Xidao Wen, Tieying Zhang, Jianjun Chen, Rui Shi, Dan Pei

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ChatTS通过合成数据生成方法,首次实现了多变量时间序列的多模态大语言模型,显著提升了时间序列的理解与推理性能。

Comments accepted by VLDB' 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12692 2026-01-06 cs.CL 79%

FormulaReasoning: A Dataset for Formula-Based Numerical Reasoning

FormulaReasoning:一个用于基于公式的数值推理的数据集

Xiao Li, Bolin Zhu, Kaiwen Shi, Sichen Liu, Yin Zhu, Yiwei Liu, Gong Cheng

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 FormulaReasoning数据集通过引入基于物理原理的数值推理任务,提供细粒度注释和扩展版本,评估多种推理框架,揭示公式推理中的关键挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00029 2026-01-05 cs.AI cs.CV 79%

From Clay to Code: Typological and Material Reasoning in AI Interpretations of Iranian Pigeon Towers

从黏土到代码:AI对伊朗鸽塔的类型学与物质性解读

Abolhassan Pishahang, Maryam Badiei

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究AI对伊朗鸽塔的类型学与物质性解读,揭示AI在重建传统设计智能时的局限与创新。

Comments Proceedings of SIGraDi 2025: XXIX International Conference of the Ibero-American Society of Digital Graphics, Córdoba, Argentina, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24156 2026-01-01 cs.AI 79%

Graph-Based Exploration for ARC-AGI-3 Interactive Reasoning Tasks

基于图的探索用于ARC-AGI-3交互推理任务

Evgenii Rudakov, Jonathan Shock, Benjamin Ultan Cowley

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 基于图的探索方法在ARC-AGI-3任务中实现高效交互推理,无需训练即可解决大量级别,优于LLM方法。

Journal ref AAAI 2026 Workshop on AI for Scientific Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24063 2026-01-01 cs.LG 79%

How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns

LLMs如何泛化:从认知行为到低级模式的细粒度分析

Haoyue Bai, Yiyou Sun, Wenjie Hu, Shi Qiu, Maggie Ziyu Huan, Peiyang Song, Robert Nowak, Dawn Song

机构 * University of Wisconsin, Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学) California Institute of Technology(加州理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文通过细粒度分析揭示LLMs在SFT和RL微调下的泛化差异,提出基于核心技能的基准测试,揭示RL模型在推理稳定性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23440 2025-12-30 cs.CL 79%

ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning

ClinDEF: 一种用于大语言模型临床推理的动态评估框架

Yuqi Tang, Jing Yu, Zichang Su, Kehua Feng, Zhihui Zhu, Libin Wang, Lei Liang, Qiang Zhang, Keyan Ding, Huajun Chen

机构 * ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) AntGroup(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 ClinDEF通过模拟诊断对话评估大语言模型的临床推理能力,利用疾病知识图谱生成病例并进行多轮交互,提供细粒度效率分析和诊断质量评估,揭示LLM在临床推理中的关键不足。

Comments 23 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏