arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2604.18805 2026-04-22 cs.AI cond-mat.mtrl-sci cs.LG 81%

AI scientists produce results without reasoning scientifically

AI科学家在没有科学推理的情况下产生结果

Martiño Ríos-García, Nawaf Alampara, Chandan Gupta, Indrajeet Mandal, Sajid Mannan, Ali Asghar Aghajani, N. M. Anoop Krishnan, Kevin Maik Jablonka

机构 * Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena(有机与大分子化学实验室(IOMC),弗里德里希-席勒耶纳大学) Department of Civil Engineering, Indian Institute of Technology Delhi(土木工程系,印度理工学院德里) School of Interdisciplinary Research, Indian Institute of Technology Delhi(跨学科研究学院,印度理工学院德里) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(Yardi人工智能学院,印度理工学院德里) Center for Energy and Environmental Chemistry Jena, Friedrich Schiller University Jena(能源与环境化学中心(耶纳),弗里德里希-席勒耶纳大学) Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena), Lessingstraße 12–14(能源应用高分子研究所(耶纳,HIPOLE耶纳),Lessingstraße 12–14)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究评估了基于大语言模型的科学代理在八个领域中的表现,发现基础模型主导了性能和行为,且代理推理缺乏科学推理的 epistemic 特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06211 2026-04-22 cs.CL cs.AI cs.CV 81%

PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts

PuzzleWorld: 一个用于谜题 hunt 中多模态、开放式推理的基准

Hengzhi Li, Justin Zhang, Brendon Jiang, Alexander Naehu, Regan Song, Megan Tjandrasuwita, Chanakya Ekbote, Steven-Shine Chen, Adithya Balachandran, Wei Dai, Rebecca Chang, Paul Pu Liang

机构 * MIT Media Lab and MIT EECS(MIT媒体实验室和MIT电子工程与计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PuzzleWorld 是一个包含667个谜题 hunt 风格问题的基准,用于评估逐步、开放式和创造性多模态推理。每个谜题都标注了最终答案、详细推理轨迹和认知技能标签,揭示了当前模型在推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03331 2026-04-21 cs.CV cs.AI cs.LG 81%

MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models

MMErroR:面向视觉-语言模型错误推理的基准测试

Yang Shi, Yifeng Xie, Minzhe Guo, Liangsi Lu, Mingxuan Huang, Jingchao Wang, Zhihong Zhu, Boyan Xu, Zhiqi Huang

机构 * Guangdong University of Technology(广东工业大学) Hong Kong Baptist University(香港 Baptist大学) Sun Yat-sen University(中山大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MMErroR基准,通过1997个包含单一推理错误的样本,评估视觉-语言模型检测错误推理的能力,发现即使最佳模型也仅能正确分类66.65%的错误。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23808 2026-04-21 cs.LG cs.CL 81%

Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning

在RLVR中对LLM推理进行语义空间探索与利用

Fanding Huang, Guanbo Huang, Xiao Fan, Yi He, Xiao Liang, Xiao Chen, Qinting Jiang, Faisal Nadeem Khan, Jingyan Jiang, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) University of California, Los Angeles(加州大学洛杉矶分校) Shenzhen Technology University(深圳技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出VERL方法,通过有效秩和其时间导数改进RLVR,实现语义空间中探索与利用的平衡,提升LLM推理性能。

Comments Accepted as an ACL 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11137 2026-04-21 cs.AI cs.LG 81%

From Answers to Arguments: Toward Trustworthy Clinical Diagnostic Reasoning with Toulmin-Guided Curriculum Goal-Conditioned Learning

从答案到论证:通过托尔金引导的课程目标条件学习实现可信的临床诊断推理

Chen Zhan, Xiaoyu Tan, Gengchen Ma, Yu-Jie Xiong, Xiaoyan Jiang, Xihe Qiu

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出托尔金引导的课程目标条件学习框架,通过逐步训练LLM生成符合托尔金结构的诊断论证,提升临床诊断的透明性和可靠性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05336 2026-04-21 cs.CL cs.AI 81%

WeatherArchive-Bench: Benchmarking Retrieval-Augmented Reasoning for Historical Weather Archives

WeatherArchive-Bench: 基于历史天气档案的检索增强推理基准测试

Yongan Yu, Xianda Du, Qingchen Hu, Jiahao Liang, Jingwei Ni, Dan Qiang, Kaiyu Huang, Grant McKenzie, Renee Sieber, Fengran Mo

机构 * McGill University(麦吉尔大学) University of Waterloo(滑铁卢大学) ETH Zurich(苏黎世联邦理工学院) Beijing Jiaotong University(北京交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出WeatherArchive-Bench,用于评估检索增强生成系统在处理历史天气档案中的能力,揭示密集检索器在历史术语上的不足及LLM对社会脆弱性与韧性概念的误判问题。

Comments accepted to the Resource Track of SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16913 2026-04-21 cs.AI cs.CL cs.CR cs.DC 81%

The Cognitive Penalty: Ablating System 1 and System 2 Reasoning in Edge-Native SLMs for Decentralized Consensus

认知惩罚:在边缘原生SLM中消融系统1和系统2推理以实现去中心化共识

Syed Muhammad Aqdas Rizvi

机构 * Independent Researcher(独立研究者) Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了边缘原生SLM中系统1和系统2推理对去中心化共识的影响,发现系统1在对抗性环境中表现更优,而系统2导致计算准确率倒置和稳定性下降。

Comments Working paper. 14 pages, 3 figures, 6 tables. Code and dataset: https://github.com/smarizvi110/sentinel-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16270 2026-04-20 cs.CL cs.AI 81%

From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text

从基准测试到推理:一个双视角、大规模评估LLMs在越南法律文本上的表现

Van-Truong Le

机构 * University of Science, VNUHCM(越南国家大学科学大学) Vietnam National University(越南国家大学) Hanoi Open University(河内开放大学) Ho Chi Minh, Vietnam(胡志明市,越南)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出双视角评估框架,评估四种LLM在越南法律文本的准确性、可读性和一致性,发现Grok-1在可读性和一致性上表现优异但法律准确性不足,而Claude 3 Opus高准确性掩盖了推理错误,揭示当前LLM在法律推理上的核心挑战。

Comments 7 pages, 2 figures. Accepted at the FISU Joint Conference on Artificial Intelligence (FJCAI 2026), Vietnam

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22977 2026-04-20 cs.LG cs.AI 81%

The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination

推理陷阱:增强大语言模型推理能力如何放大工具幻觉

Chenlong Yin, Zeyang Sha, Shiwen Cui, Changhua Meng, Zechao Li

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Nanjing University of Science and Technology(南京理工大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究探讨增强LLM推理能力是否导致工具幻觉增加,通过SimpleToolHalluBench验证因果关系,发现推理增强与幻觉成正比,且不受过拟合影响,揭示需新的训练目标平衡能力和可靠性。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14554 2026-04-20 cs.CL cs.AI 81%

VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models

VLegal-Bench: 用于大型语言模型越南法律推理的认知导向基准

Nguyen Tien Dong, Minh-Anh Nguyen, Thanh Dat Hoang, Nguyen Tuan Ngoc, Dao Xuan Quang Minh, Phan Phi Hai, Nguyen Thi Ngoc Anh, Dang Van Tu, Binh Vu

机构 * CMC OpenAI VinUniversity HUST SRH University Heidelberg

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 VLegal-Bench是首个系统评估大型语言模型在越南法律任务上的基准,包含10450个样本,通过严格标注流程确保样本基于权威法律文件,涵盖法律问题解答、检索增强生成、多步推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06953 2026-04-20 cs.AI cs.CL 81%

Revisiting the Uniform Information Density Hypothesis in LLM Reasoning

重新审视大语言模型推理中的均匀信息密度假说

Minju Gwak, Guijin Son, Jaehyung Kim

机构 * Yonsei University(延世大学) OneLine AI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型推理中均匀信息密度假说的有效性,提出新框架量化局部和全局信息流均匀性,发现高质量推理在局部均匀但全局非均匀,证明均匀性优于其他内部信号预测推理质量。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11502 2026-04-17 cs.CL cs.AI 81%

METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models

METER:评估大型语言模型中的多级上下文因果推理

Pengfeng Li, Chen Huang, Chaoqun Hao, Hongyao Chen, Xiao-Yong Wei, Wenqiang Lei, See-Kiong Ng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, China(中国教育部机器学习与产业智能工程研究中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出METER基准,系统评估大型语言模型在因果阶梯的三个层级上的表现,发现随着任务层级升高,模型能力显著下降,揭示了模型在因果推理中的两大失效模式。

Comments ACL 2026. Our code and dataset are available at https://github.com/SCUNLP/METER

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15066 2026-04-17 cs.LG cs.AI cs.MM 81%

Time-RA: Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback

Time-RA:面向时间序列推理的异常诊断方法:基于LLM反馈

Yiyuan Yang, Zichuan Liu, Lei Song, Kai Ying, Zhiguang Wang, Tom Bamford, Svitlana Vyetrenko, Jiang Bian, Qingsong Wen

机构 * University of Oxford(牛津大学) Nanjing University(南京大学) MSRA(微软研究院) SJTU(上海交通大学) Abel AI Outsampler University of Strasbourg(斯特拉斯堡大学) Squirrel Ai Learning(Squirrel AI学习)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Time-RA,通过引入RATs40K多模态数据集,改进时间序列异常检测的生成式推理方法,提升诊断准确性和解释性,实现可解释的多模态时间序列分析。

Comments ACL 2026 Findings. 27 pages, 11 figures, 15 tables. Code and dataset are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13418 2026-04-16 cs.CL cs.AI cs.CV 81%

MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments

MERRIN:一种多模态证据检索与推理的基准,用于噪声网络环境

Han Wang, David Wan, Hyunji Lee, Thinh Pham, Mikaela Cankosyan, Weiyuan Chen, Elias Stengel-Eskin, Tu Vu, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Virginia Tech(弗吉尼亚理工大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MERRIN基准评估搜索增强代理在噪声网络环境中的多模态证据检索与推理能力,通过自然语言查询和多模态证据检索测试,发现现有模型在复杂任务中表现有限,需进一步提升多模态处理能力。

Comments First three authors contributed equally. Project Page: https://merrin-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13060 2026-04-16 cs.CL cs.LG cs.MM 81%

Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage

牙科分诊基准:用于分层牙科分诊的多模态推理基准

Ziyi He, Yushi Feng, Shuangyu Yang, Yinghao Zhu, Xichen Zhang, Pak Chuen Patrick Tai, Hei Yuet Lo, Songying Wu, Weifa Yang, Lequan Yu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) The Prince Philip Dental Hospital(菲利普王子牙科医院) Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学利滋医学学院) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Dental-TriageBench,首个专家标注的多模态牙科分诊基准,通过246个脱敏案例评估19种模型在细粒度治疗层面分诊中的表现,揭示了人类与模型间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12379 2026-04-15 cs.SE cs.AI cs.LG 81%

Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks

超越输出正确性:评估大型语言模型在编码任务中的推理能力

Yuangang Li, Justin Tian Jin Chen, Ethan Yu, David Hong, Iftekhar Ahmed

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CodeRQ-Bench,首个评估LLM在生成、摘要和分类等编码任务中推理质量的基准,通过分析现有评估器的1069个不匹配案例,提出VERA评估器,实验表明其在四个数据集上均优于基线,提升AUCROC和AUPRC最高达0.26和0.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11835 2026-04-15 cs.LG cs.AI 81%

Schema-Adaptive Tabular Representation Learning with LLMs for Generalizable Multimodal Clinical Reasoning

基于LLM的Schema自适应表格表示学习用于通用多模态临床推理

Hongxi Mao, Wei Zhou, Mengting Jia, Tao Fang, Huan Gao, Bin Zhang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Boston University(波士顿大学) University of Southern California(南加州大学) GDIIST Renyixun Health Technology Co., Ltd.(仁心迅健康科技有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于LLM的Schema自适应表格表示学习方法,通过将结构化变量转换为语义自然语言并编码,实现零样本跨schema对齐,结合表格和MRI数据在多模态 dementia 诊断中取得优于临床基准的性能。

Comments 11 pages, 4 figures

Journal ref ACL 2026, Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07595 2026-04-15 cs.AI cs.CL 81%

Reasoning Graphs: Self-Improving, Deterministic RAG through Evidence-Centric Feedback

推理图:通过以证据为中心的反馈实现自我改进的确定性RAG

Matthew Penaroza

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出推理图,通过证据中心反馈提升RAG的准确性和确定性,实验显示在50%以上的证据覆盖下,错误率降低47%,在多跳问题中准确率提升11.0个百分点,实现高重用场景下的性能优势。

Comments 15 pages including appendix, 2 figures, 3 algorithms, framework paper with evaluation protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11778 2026-04-14 cs.CL cs.AI 81%

General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks

General365:在多样化和具有挑战性的任务中评估大语言模型的通用推理能力

Junlin Liu, Shengnan An, Shuang Zhou, Dan Ma, Shixiong Luo, Ying Xie, Yuan Zhang, Wenling Yuan, Yifan Zhou, Xiaoyu Li, Ziwen Wang, Xuezhi Cao, Xunliang Cai

机构 * University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出General365基准,通过限制背景知识至K-12水平,评估大语言模型在通用推理任务中的表现,揭示当前模型在非专业领域推理能力的不足。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11209 2026-04-14 cs.CL cs.AI 81%

Exploring Knowledge Conflicts for Faithful LLM Reasoning: Benchmark and Method

探索知识冲突以实现忠实的LLM推理:基准与方法

Tianzhe Zhao, Jiaoyan Chen, Shuxiu Zhang, Haiping Zhu, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Hunan University(湖南大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ConflictQA基准,揭示LLM在处理跨源知识冲突时的不足,并提出XoT框架以提升异构冲突证据推理的可靠性。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10182 2026-04-14 cs.CL cs.AI 81%

A Survey of Inductive Reasoning for Large Language Models

大型语言模型归纳推理的综述

Kedi Chen, Dezhao Ruan, Yuhao Dan, Yaoting Wang, Siyu Yan, Xuecheng Wu, Yinqi Zhang, Qin Chen, Jie Zhou, Liang He, Biqing Qi, Linyang Li, Qipeng Guo, Xiaoming Shi, Wei Zhang

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Xi’an Jiaotong University(西安交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中归纳推理的方法与评估,分为训练后改进、测试时扩展和数据增强三大类,并提出统一的评估方法,为未来研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10470 2026-04-14 cs.CL cs.AI 81%

From Query to Counsel: Structured Reasoning with a Multi-Agent Framework and Dataset for Legal Consultation

从查询到建议:基于多智能体框架和数据集的结构化推理用于法律咨询

Mingfei Lu, Yi Zhang, Mengjia Wu, Yue Feng

机构 * Australian Artificial Intelligence Institute (AAII), University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所) School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出JurisCQAD数据集和JurisMA框架,通过结构化任务分解和多智能体协作,提升法律咨询问答的准确性与解释性。

Comments Accepted by ACL 2026 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09907 2026-04-14 cs.CV cs.AI cs.CL 81%

From UAV Imagery to Agronomic Reasoning: A Multimodal LLM Benchmark for Plant Phenotyping

从无人机图像到农学推理:一种多模态大语言模型基准用于植物表型分析

Yu Wu, Guangzeng Han, Ibra Niang Niang, Francia Ravelombola, Maiara Oliveira, Jason Davis, Dong Chen, Feng Lin, Xiaolei Huang

机构 * University of Memphis(孟菲斯大学) University of Missouri(密苏里大学) University of Arkansas Division of Agriculture(阿肯色大学农业分部) Mississippi State University(密西西比州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出PlantXpert基准,用于大豆和棉花表型分析,评估多模态模型在农业领域的表现,发现任务特定微调显著提升准确率,但模型扩展和跨物种泛化仍面临挑战。

Comments In review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09890 2026-04-14 cs.CL cs.AI 81%

Should We be Pedantic About Reasoning Errors in Machine Translation?

在机器翻译中我们是否应该对推理错误过于苛刻?

Calvin Bao, Marine Carpuat

机构 * University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过多种语言对发现翻译中的推理错误,采用自动化标注协议评估错误类型,并通过干预措施发现小修正对翻译质量影响小,但强干预能提高分辨率,但翻译质量提升不一致。

Comments 17 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08559 2026-04-13 cs.CL cs.AI 81%

Medical Reasoning with Large Language Models: A Survey and MR-Bench

基于大语言模型的医学推理:综述与MR-Bench

Xiaohan Ren, Chenxiao Fan, Wenyin Ma, Hongliang He, Chongming Gao, Xiaoyan Zhao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) The First Affiliated Hospital of USTC(中国科学技术大学附属第一医院) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型在医学推理中的应用,提出MR-Bench基准测试,揭示了考试级性能与真实临床任务准确性之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08016 2026-04-10 cs.AI cs.LG 81%

Wiring the 'Why': A Unified Taxonomy and Survey of Abductive Reasoning in LLMs

阐明‘为何’:对大语言模型中演绎推理的统一分类和调查

Moein Salimi, Shaygan Adim, Danial Parnian, Nima Alighardashi, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统调研大语言模型中的演绎推理,提出统一的两阶段定义,分类现有工作,并通过基准测试和对比分析揭示当前方法的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04720 2026-04-07 cs.CL cs.AI 81%

What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features

什么使多语言推理有效?通过可测量的特征解构推理痕迹

Dayeon Ki, Kevin Duh, Marine Carpuat

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过定义可测量的推理特征,研究多语言环境下有效推理的特征,并发现这些特征在不同语言中的关联强度差异显著,挑战了以英语为中心的奖励设计。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20814 2026-04-07 cs.CV cs.AI cs.LG 81%

SPHINX: A Synthetic Environment for Visual Perception and Reasoning

SPHINX:一个用于视觉感知与推理的合成环境

Md Tanvirul Alam, Saksham Aggarwal, Justin Yang Chae, Nidhi Rastogi

机构 * Rochester Institute of Technology(罗彻斯特理工学院) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 SPHINX通过生成具有可验证解的谜题,评估视觉感知与推理能力,发现大模型表现不足,RLVR方法显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03179 2026-04-06 cs.LG cs.AI cs.CV 81%

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models

理解强化学习在多模态推理模型后训练中幻觉的作用

Gengwei Zhang, Jie Peng, Zhen Tan, Mufan Qiu, Hossein Nourkhiz Mahjoub, Vaishnav Tadiparthi, Kwonjoon Lee, Yanyong Zhang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Arizona State University(亚利桑那州立大学) Honda Research Institute, USA(本田美国研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Hallucination-as-Cue框架,通过引入模态特异性扰动分析强化学习对多模态推理模型的影响,揭示幻觉在训练中的关键作用,挑战现有假设。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16082 2026-04-03 q-bio.QM cs.AI cs.LG 81%

BIOGEN: Evidence-Grounded Multi-Agent Reasoning Framework for Transcriptomic Interpretation in Antimicrobial Resistance

BIOGEN:基于证据的多智能体推理框架用于抗菌药物耐药性中的转录组解释

Elias Hossain, Mehrdad Shoeibi, Ivan Garibay, Niloofar Yousefi

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 BIOGEN通过结合生物信息检索、结构化推理和多批评验证,生成可追溯的转录组模块解释,其在抗菌药物耐药性研究中表现出强生物学基础和零幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏