arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2602.00543 2026-02-03 cs.CL 79%

Reasoning by Commented Code for Table Question Answering

通过注释代码进行表格问题回答

Seho Pyo, Jiheon Seok, Jaejin Lee

机构 * Department of Data Science, Seoul National University, Seoul, Republic of Korea(数据科学系,首尔国立大学,首尔,大韩民国) Department of Computer Science(计算机科学系) Engineering, Seoul National University, Seoul, Republic of Korea(工程系,首尔国立大学,首尔,大韩民国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 通过注释代码生成框架提升表格问题回答的准确率,结合端到端模型实现84.3%的高精度表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16286 2026-02-03 cs.AI cs.MA 79%

SemanticALLI: Caching Reasoning, Not Just Responses, in Agentic Systems

SemanticALLI: 在智能体系统中缓存推理,而非仅响应

Varun Chillara, Dylan Kline, Christopher Alvares, Evan Wooten, Huan Yang, Shlok Khetan, Cade Bauer, Tré Guillory, Tanishka Shah, Yashodhara Dhariwal, Volodymyr Pavlov, George Popstefanov

机构 * PMG

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SemanticALLI通过分解生成过程,实现智能体系统中结构化中间表示的缓存,提升推理效率并减少LLM调用次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22742 2026-02-02 cs.CL 79%

AR-BENCH: Benchmarking Legal Reasoning with Judgment Error Detection, Classification and Correction

AR-BENCH:通过判决错误检测、分类和纠正进行法律推理基准测试

Yifei Li, Richong Zhang, Wanyu Tu, Zhijie Nie, Haokun Luo, Chuantao Yin, Pengchong Li

机构 * SKLCCSE Beihang University(北京航空航天大学软件学院) SCCE University of Science and Technology Beijing(北京科技大学计算机学院) Sino-French Engineer School Beihang University(北京航空航天大学中法工程师学院) People’s Procuratorate of Beijing Municipality(北京市人民检察院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 AR-BENCH通过构建基准数据集和评估14个大语言模型,揭示现有模型在法律判决错误识别上的局限性,旨在提升法律推理的诊断能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22735 2026-02-02 cs.CL 79%

MM-THEBench: Do Reasoning MLLMs Think Reasonably?

MM-THEBench: 多模态大语言模型是否能合理推理?

Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

机构 * KIRC, Institute for Artificial Intelligence, Tsinghua University, China(KIRC人工智能研究院,清华大学,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MM-THEBench旨在评估推理MLLMs在中间推理过程中的幻觉问题,通过细粒度分类和多层次评估框架,揭示思考对多模态任务中幻觉和推理能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21937 2026-02-02 cs.AI 79%

Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities

检索增强推理沙盒:一种解耦检索与推理能力的基准

Shuangshuang Ying, Zheyu Wang, Yunjian Peng, Jin Chen, Yuhao Wu, Hongbin Lin, Dingyu He, Siyi Liu, Gengchen Yu, YinZhu Piao, Yuchen Wu, Xin Gui, Zhongyuan Peng, Xin Li, Xeron Du, Libo Qin, YiXin Cao, Ge Zhang, Stephen Huang

机构 * Full author list in Contributions(完整作者列表)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DeR2通过解耦检索与推理能力,提供了一种评估大语言模型处理新颖科学信息能力的基准测试方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10909 2026-02-02 cs.AI 79%

PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature

PaperArena: 一个用于科学文献上工具增强代理推理的评估基准

Daoyu Wang, Mingyue Cheng, Shuo Yu, Zirui Liu, Ze Guo, Xin Li, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PaperArena提出一个评估基准,用于评估基于LLM的代理在跨多篇论文整合信息并使用外部工具进行推理的能力,实验显示现有代理在复杂任务上的表现有限。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16656 2026-01-29 cs.AI 79%

NUMINA: A Natural Understanding Benchmark for Multi-dimensional Intelligence and Numerical Reasoning Abilities

NUMINA:多维智能与数值推理能力的自然理解基准

Changyu Zeng, Yifan Wang, Zimu Wang, Wei Wang, Zhengni Yang, Muyi Bao, Jiming Xiao, Anh Nguyen, Yutao Yue

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进技术学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Deep Perception Technology, JITRI(深度感知技术研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 NUMINA是一个用于多维智能和数值推理能力的自然理解基准,通过多尺度注释和自动化注释流程提升多模态室内感知理解,揭示当前LLM在三维空间计算中的不足。

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22575--22590

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19773 2026-01-28 cs.CL 79%

Strong Reasoning Isn't Enough: Evaluating Evidence Elicitation in Interactive Diagnosis

强推理并不足够:评估交互诊断中的证据获取

Zhuohan Long, Zhijie Bao, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出REFINE策略,通过诊断验证引导代理主动解决不确定性,提升交互诊断中证据获取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19673 2026-01-28 cs.SD cs.AI 79%

A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models

多模态大语言模型音频推理能力的基准测试

Iwona Christop, Mateusz Czyżnikiewicz, Paweł Skórzewski, Łukasz Bondaruk, Jakub Kubiak, Marcin Lewandowski, Marek Kubis

机构 * Adam Mickiewicz University(亚当·密克维茨大学) Samsung R&D Institute Poland(三星波兰研发中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Audio Reasoning Tasks基准测试,用于评估多模态模型在结合不同音频任务进行推理方面的能力。

Comments 31 pages, 2 figures, accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02091 2026-01-28 cs.AI 79%

Demystifying the Roles of LLM Layers in Retrieval, Knowledge, and Reasoning

解析大语言模型中层的作用:检索、知识与推理

Xinyuan Song, Keyu Wang, PengXiang Li, Lu Yin, Shiwei Liu

机构 * Emory University(埃默里大学) University of Tuebingen(图宾根大学) University of Surrey(萨里大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究解析了大语言模型中不同深度层在检索、知识和推理中的作用,发现浅层主导知识和检索,深层影响推理,且不同评估方法下深度利用存在显著差异。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18356 2026-01-27 cs.LG 79%

Making medical vision-language models think causally across modalities with retrieval-augmented cross-modal reasoning

通过检索增强的跨模态推理使医疗视觉-语言模型在多模态中实现因果推理

Weiqin Yang, Haowen Xue, Qingyi Peng, Hexuan Hu, Qian Huang, Tingbo Zhang

机构 * University of Adelaide(阿德莱德大学) Hohai University(河海大学) Amap

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出多模态因果检索增强生成框架,通过整合因果推理原理与多模态检索,提升医疗VLMs在诊断预测和视觉问答中的事实准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18204 2026-01-27 cs.CL 79%

MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning

MemWeaver: 为可追溯的长 horizon 代理推理编织混合记忆

Juexiang Ye, Xue Li, Xinyu Yang, Chengkai Huang, Lanshun Nie, Lina Yao, Dechen Zhan

机构 * Harbin Institute of Technology(哈尔滨理工大学) The University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织Data61)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MemWeaver通过编织混合记忆系统,提升长 horizon 代理推理的准确性与可追溯性,减少输入上下文长度

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18132 2026-01-27 cs.AI 79%

RareAlert: Aligning heterogeneous large language model reasoning for early rare disease risk screening

RareAlert: 对齐异构大语言模型推理以实现早期罕见病风险筛查

Xi Chen, Hongru Zhou, Huahui Yi, Shiyu Feng, Hanyu Zhou, Tiancheng He, Mingke You, Li Wang, Qiankun Li, Kun Wang, Weili Fu, Kang Li, Jian Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 RareAlert通过整合多个LLM推理并校准后生成单一模型,实现早期罕见病风险筛查,其AUC达到0.917,优于现有方法。

Comments 28 page, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13545 2026-01-27 cs.AI cs.ET cs.MA 79%

TruthTensor: Evaluating LLMs through Human Imitation on Prediction Market under Drift and Holistic Reasoning

TruthTensor:通过人类模仿在预测市场中评估LLM的漂移和整体推理

Shirin Shahabi, Spencer Graham, Haruna Isah

机构 * Inference Labs Inc(Inference Labs公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TruthTensor通过人类模仿在预测市场中评估LLM的漂移和整体推理,提供多维度的评估方法。

Comments 16 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13095 2026-01-27 cs.CL 79%

BeDiscovER: The Benchmark of Discourse Understanding in the Era of Reasoning Language Models

BeDiscovER:推理语言模型时代 discourse 理解的基准

Chuyuan Li, Giuseppe Carenini

机构 * Department of Computer Science University of British Columbia(计算机科学系加拿大不列颠哥伦比亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 BeDiscovER是一个用于评估推理语言模型 discourse 理解能力的基准,涵盖多个 discourse 任务,评估了多个开源模型的表现。

Comments Camera-ready version of eacl 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16685 2026-01-26 cs.AI 79%

AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning

AgentsEval: 通过多智能体推理实现医学影像报告的临床可信评估

Suzhong Fu, Jingqi Dong, Xuan Ding, Rui Sun, Yiming Yang, Shuguang Cui, Zhen Li

机构 * FNii-Shenzhen, The Chinese University of Hong Kong (Shenzhen) School of Science and Engineering(深圳FNii、香港中文大学(深圳)科学与工程学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 AgentsEval通过多智能体推理框架,实现医学影像报告的临床可信评估,提供结构化反馈和稳健的评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13753 2026-01-23 cs.CL 79%

SCALAR: Scientific Citation-based Live Assessment of Long-context Academic Reasoning

SCALAR: 基于科学引用的长上下文学术推理实时评估

Renxi Wang, Honglin Mu, Liqun Ma, Lizhi Lin, Yunlong Feng, Timothy Baldwin, Xudong Han, Haonan Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 SCALAR通过基于学术引用的长上下文推理评估框架,评估模型在学术写作中的推理能力,发现多项选择任务能有效区分模型性能,而填空式引用预测任务更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08134 2026-01-22 cs.CL 79%

How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains

大型推理模型的置信度估计有多可靠?对高风险领域的系统基准测试

Reza Khanmohammadi, Erfan Miahi, Simerjot Kaur, Ivan Brugere, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过系统基准测试,评估了大型推理模型置信度估计方法的可靠性,发现基于文本的编码器在歧视方面表现最佳,而结构感知模型在校准方面表现最佳,揭示了当前方法的局限性。

Comments Accepted to the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026) main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14700 2026-01-22 cs.CL 79%

DARL: Encouraging Diverse Answers for General Reasoning without Verifiers

DARL: 促进无验证者的一般推理中的多样化答案

Chongxuan Huang, Lei Lin, Xiaodong Shi, Wenping Hu, Ruiming Tang

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Kuaishou Technology(快手科技) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),文化和旅游部)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 DARL通过鼓励在参考答案可控偏差范围内生成多样化答案,提升大语言模型在一般推理任务中的性能和输出多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14479 2026-01-22 cs.CL 79%

Can LLM Reasoning Be Trusted? A Comparative Study: Using Human Benchmarking on Statistical Tasks

大语言模型的推理能力是否可信?:通过统计任务的人类基准测试

Crish Nagarkar, Leonid Bogachev, Serge Sharoff

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过统计任务的人类基准测试,评估了大语言模型在统计推理和自我评估能力上的表现,发现微调后的模型在统计任务上表现优异,且能更有效地评估答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14349 2026-01-22 cs.MA cs.LG 79%

MARBLE: Multi-Agent Reasoning for Bioinformatics Learning and Evolution

MARBLE: 多智能体推理用于生物信息学学习与进化

Sunghyun Kim, Seokwoo Yun, Youngseo Yun, Youngrak Lee, Sangsoo Lim

机构 * Division of AI Convergence, Dongguk University, Seoul, South Korea(东国大学人工智能融合系) AI Research Team, Ar-ge Inc., Seoul, South Korea(Ar-ge公司人工智能研究团队) Department of Biomedical Engineering, Dongguk University, Goyang-si, Gyeonggi-do, South Korea(东国大学生物医学工程系) Department of Computer Science and Artificial Intelligence, Dongguk University, Seoul, South Korea(东国大学计算机科学与人工智能系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 MARBLE通过多智能体推理实现生物信息学模型的稳定优化,提升性能并保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13690 2026-01-21 cs.CL 79%

Dr. Assistant: Enhancing Clinical Diagnostic Inquiry via Structured Diagnostic Reasoning Data and Reinforcement Learning

通过结构化诊断推理数据和强化学习增强临床诊断探究

Yue Guo, Fanfu Wang, Jianwei Lv, Xincheng Shi, Yuchen Li, Youya Wang, Yunsheng Zeng, Yujing Liu, Yunhao Qiao, Gen Li, Junfeng Wang, Bo Yuan

机构 * Baidu Inc.(百度公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Dr. Assistant通过结构化诊断推理数据和强化学习提升临床诊断能力,优于开放源代码模型并接近闭源模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13546 2026-01-21 cs.AI 79%

ChatAD: Reasoning-Enhanced Time-Series Anomaly Detection with Multi-Turn Instruction Evolution

ChatAD: 基于推理增强的多轮指令演化的时序异常检测

Hui Sun, Chang Xu, Haonan Xie, Hao Li, Yuhao Huang, Chuheng Zhang, Ming Jin, Xiaoguang Liu, Gang Wang, Jiang Bian

机构 * Nankai University(南开大学) Microsoft Research Asia(微软亚洲研究院) Huanjiang Laboratory(焕江实验室) University of Manchester(曼彻斯特大学) Nanjing University(南京大学) Griffith University(格里菲斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ChatAD通过多智能体演化算法和Kahneman-Tversky优化,提升了时序异常检测的推理能力和跨任务泛化性能,实现了显著的准确率和F1值提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13183 2026-01-21 cs.CL 79%

OpenExempt: A Diagnostic Benchmark for Legal Reasoning and a Framework for Creating Custom Benchmarks on Demand

OpenExempt:法律推理的诊断基准及自定义基准框架

Sergio Servantez, Sarah B. Lawsky, Rajiv Jain, Daniel W. Linna, Kristian Hammond

机构 * Northwestern University(西北大学) Adobe Research(Adobe研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 OpenExempt通过动态生成法律推理任务和解决方案,提供一个用于诊断评估的基准和框架,揭示模型在复杂推理中的性能差异。

Comments 25 pages, 9 Figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12618 2026-01-21 cs.CL 79%

Disagreement as Data: Reasoning Trace Analytics in Multi-Agent Systems

分歧作为数据:多智能体系统中的推理轨迹分析

Elham Tajik, Conrad Borchers, Bahar Shahrokhian, Sebastian Simon, Ali Keramati, Sonika Pal, Sreecharan Sankaranarayanan

机构 * University at Albany(纽约州立大学阿尔巴尼分校) Carnegie Mellon University(卡内基梅隆大学) Arizona State University(亚利桑那州立大学) Le Mans University(勒曼大学) University of California, Irvine(加州大学尔湾分校) Indian Institute of Technology Bombay(印度班加罗尔理工学院) Extuitive Inc. (Flagship Pioneering)(Extuitive公司(Flagship Pioneering))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出利用LLM代理生成的推理轨迹分析分歧,通过余弦相似度检测和量化代理间的分歧,提升定性编码的解释实践和方法论严谨性。

Comments LAK 2026 conference paper, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11866 2026-01-21 cs.CL 79%

Advances in LLM Reasoning Enable Flexibility in Clinical Problem-Solving

大语言模型推理能力的进步促进了临床问题解决的灵活性

Kie Shidara, Preethi Prem, Jonathan Kim, Anna Podlasek, Feng Liu, Ahmed Alaa, Danilo Bernardo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 大语言模型推理能力的提升增强了其在临床问题解决中的灵活性,使其在医学推理任务中表现接近人类水平。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11831 2026-01-19 cs.AI 79%

ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems

ARC-AGI-2:前沿人工智能推理系统的全新挑战

Francois Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers, Henry Pinkard

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ARC-AGI-2通过更细致的任务设计,为评估人工智能的抽象推理和问题解决能力提供更高级的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09459 2026-01-15 cs.IR cs.CL 79%

Dissecting Judicial Reasoning in U.S. Copyright Damage Awards

解析美国版权损害赔偿判决中的司法推理

Pei-Chi Lo, Thomas Y. Lu

机构 * National Sun Yat-sen University(国立中山大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出基于修辞结构理论的LLM方法,用于解析版权损害赔偿判决中的司法推理,揭示各巡回法院因素权重差异,为法律分析提供新方法和实证洞察。

Comments Presented in SIGKDD'25 SciSoc LLM Workshop: Large Language Models for Scientific and Societal Advances

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08988 2026-01-15 cs.AI 79%

ART: Action-based Reasoning Task Benchmarking for Medical AI Agents

ART:面向医疗AI代理的基于动作的推理任务基准测试

Ananya Mantravadi, Shivali Dalmia, Abhishek Mukherji

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ART通过挖掘真实EHR数据创建挑战性任务,评估医疗AI代理在阈值评估、时间聚合和条件逻辑方面的表现,揭示其推理弱点,推动更可靠的临床决策支持系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08748 2026-01-14 cs.CV cs.AI 79%

UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images

UR-Bench:面向超高清图像的多跳推理基准

Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 UR-Bench是一个针对超高清图像多跳推理的基准,通过引入代理框架和语义工具,评估大语言模型在极端视觉信息下的推理能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏