arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2601.14084 2026-01-21 cs.CV cs.AI cs.CL 81%

DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning

DermaBench:一种用于皮肤科视觉问答和推理的临床标注基准数据集

Abdurrahim Yilmaz, Ozan Erdem, Ece Gokyayla, Ayda Acar, Burc Bugra Dagtas, Dilara Ilhan Erdil, Gulsum Gencoglan, Burak Temelkuran

机构 * Imperial College London(帝国理工学院伦敦分校) Istanbul Medeniyet University(伊斯坦布尔医学大学) Usak Research and Training Hospital(Usak研究与培训医院) Istanbul Research and Training Hospital(伊斯坦布尔研究与培训医院) Ipswich Hospital(伊普斯韦奇医院) Medicana Atakoy Hospital(Medicana阿塔基医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DermaBench是首个由临床专家标注的皮肤科视觉问答基准数据集,通过精细标注和开放式描述提升多模态模型在皮肤科图像理解与临床推理中的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11625 2026-01-21 cs.AI cs.LG 81%

Reasoning Stabilization Point: A Training-Time Signal for Stable Evidence and Shortcut Reliance

推理稳定点:一种训练时的信号,用于稳定证据和捷径依赖

Sahil Rajesh Dhayalkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出推理稳定点(RSP)作为训练时的信号,用于监测微调过程中决策证据的变化,并帮助选择稳定证据区域的检查点。

Comments 8 pages, Submitted to ACL Rolling Review and is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22616 2026-01-19 cs.CL cs.AI 81%

PerCoR: Evaluating Commonsense Reasoning in Persian via Multiple-Choice Sentence Completion

PerCoR:通过多项选择句完成评估波斯语的常识推理

Morteza Alikhani, Mohammadtaha Bagherifard, Erfan Zinvandi, Mehran Sarmadi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PerCoR是首个大规模波斯语常识推理基准测试,通过多项选择句完成问题评估常识推理能力,展示了DRESS-AF方法在提升数据集难度和模型性能方面的有效性。

Comments 20 pages, 17 figures, Accepted to IJCNLP-AACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09709 2026-01-16 cs.LG cs.CL cs.CY 81%

Social Determinants of Health Prediction for ICD-9 Code with Reasoning Models

基于推理模型的ICD-9代码社会决定因素预测

Sharim Khan, Paul Landes, Adam Cross, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Illinois Chicago Peoria(伊利诺伊大学芝加哥分校皮奥里亚分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用推理模型和传统大语言模型,在MIMIC-III数据集上对医院入院的多标签社会决定因素ICD-9代码进行分类,实现了89%的F1分数,并发现139次入院中缺失的SDoH代码。

Comments Published as part of Machine Learning for Health (ML4H) 2025 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23311 2026-01-15 cs.CV cs.AI cs.CL 81%

Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning

识别符号,缺失文化:探究视觉-语言模型在火 imagery 和文化意义上的推理

Haorui Yu, Yang Zhao, Yijia Chu, Qiufeng Yi

机构 * Duncan of Jordanstone College of Art & Design (DJCAD), University of Dundee(邓迪大学邓迪艺术与设计学院(DJCAD)) Guangzhou Institute of Science and Technology (GZIST)(广州科学技术研究院) Faculty of Arts, Xiamen University(厦门大学艺术学院) University of Birmingham(伯明翰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现视觉-语言模型在处理火主题文化图像时存在系统性偏见,需通过文化评估确保公平性和可解释性。

Comments 8 pages, 5 figures, 4 tables. Submitted to WiNLP 2025 Workshop at COLING 2025

Journal ref Proceedings of the 9th Widening NLP Workshop (WiNLP 2025), pages 1-8, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07794 2026-01-13 cs.CL cs.AI 81%

Kinship Data Benchmark for Multi-hop Reasoning

多跳推理的亲属数据基准

Tianda Sun, Dimitar Kazakov

机构 * University of York(约克大学) Department of Computer Science(计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 KinshipQA通过生成文化特定的家谱数据,评估多跳推理能力,揭示模型在不同文化背景下的推理差异。

Comments 11 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07641 2026-01-13 cs.AI cs.CL cs.MA 81%

Beyond Static Tools: Test-Time Tool Evolution for Scientific Reasoning

超越静态工具:科学推理中的测试时工具进化

Jiaxuan Lu, Ziyu Kong, Yemin Wang, Rong Fu, Haiyuan Wan, Cheng Yang, Wenjie Lou, Haoran Sun, Lilong Wang, Yankai Jiang, Xiaosong Wang, Xiao Sun, Dongzhan Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Xiamen University(厦门大学) University of Macau(澳门大学) Tsinghua University(清华大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出TTE框架,通过在推理过程中动态合成和进化工具,提升科学推理任务的准确性和工具效率,同时支持跨领域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07226 2026-01-13 cs.AI cs.CL 81%

Lost in the Noise: How Reasoning Models Fail with Contextual Distractors

陷入噪声中:推理模型在上下文干扰中的失败

Seongyun Lee, Yongrae Jo, Minju Seo, Moontae Lee, Minjoon Seo

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出RARE方法,通过激励识别噪声中的有用信息,提升模型在上下文干扰下的鲁棒性,揭示增加计算量反而导致噪声环境下性能下降的反比例趋势。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06282 2026-01-13 cs.CL cs.AI 81%

Amory: Building Coherent Narrative-Driven Agent Memory through Agentic Reasoning

Amory:通过代理推理构建连贯的叙事驱动代理记忆

Yue Zhou, Xiaobo Guo, Belhassen Bayar, Srinivasan H. Sengamedu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Amory通过增强代理推理构建连贯的叙事驱动记忆,提升长期对话代理的推理性能与响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11618 2026-01-13 cs.AI cs.LG eess.SP 81%

Benchmarking Spatiotemporal Reasoning in LLMs and Reasoning Models: Capabilities and Challenges

在大语言模型和推理模型中评估时空推理:能力和挑战

Pengrui Quan, Brian Wang, Kang Yang, Liying Han, Mani Srivastava

机构 * Department of Electrical and Computer Engineering, UCLA(电气与计算机工程系,加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出STARK基准测试,评估大语言模型和推理模型在时空推理任务中的能力和挑战,发现推理模型在复杂任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05567 2026-01-12 cs.AI cs.CL 81%

WildSci: Advancing Scientific Reasoning from In-the-Wild Literature

WildSci: 从真实文献中推进科学推理

Tengxiao Liu, Deepak Nathani, Zekun Li, Kevin Yang, William Yang Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 WildSci通过自动合成领域特定科学问题数据集,提升科学推理的可扩展性和可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04758 2026-01-09 cs.CL cs.AI 81%

PILOT-Bench: A Benchmark for Legal Reasoning in the Patent Domain with IRAC-Aligned Classification Tasks

PILOT-Bench:一个以专利领域法律推理为核心的基准,包含与IRAC对齐的分类任务

Yehoon Jang, Chaewon Lee, Hyun-seok Min, Sungchul Choi

机构 * Pukyong National University(浦项国立大学) Tomocube Inc.(Tomocube公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PILOT-Bench通过IRAC对齐的分类任务评估专利领域法律推理能力,揭示闭源与开源模型在推理性能上的显著差异。

Comments Accepted at the NLLP Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04577 2026-01-09 cs.AI cs.LG 81%

Sci-Reasoning: A Dataset Decoding AI Innovation Patterns

Sci-Reasoning:一个解码AI创新模式的数据集

Jiachen Liu, Maestro Harmon, Zechen Zhang

机构 * Orchestra Research(Orchestra研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Sci-Reasoning数据集通过分析AI研究中的15种思维模式,揭示了高影响力论文的创新机制,为训练下一代AI研究代理提供结构化推理轨迹。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20707 2026-01-08 cs.CL cs.AI physics.ed-ph 81%

Dissecting Physics Reasoning in Small Language Models: A Multi-Dimensional Analysis from an Educational Perspective

解构小型语言模型中的物理推理:从教育视角的多维分析

Nicy Scaria, Silvester John Joseph Kennedy, Krishna Agarwal, Diksha Seth, Deepak Subramani

机构 * Computational and Data Sciences, Indian Institute of Science, India(计算机与数据科学,印度科学研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文从教育视角出发,通过Physbench评估了小型语言模型在物理推理中的可靠性,发现其在多步骤推理中存在显著的可靠性缺口,且失败模式随模型能力变化,强调评估需更注重推理过程而非最终答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22461 2026-01-07 cs.SD cs.AI cs.CL eess.AS 81%

CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges

CMDAR:一个包含多样挑战的中文多场景动态音频推理基准

Hui Li, Changhao Jiang, Hongyu Wang, Ming Zhang, Jiajun Sun, Zhixiong Yang, Yifei Cao, Shihan Dou, Xiaoran Fan, Baoyu Fan, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Shanghai Jiao Tong University(上海交通大学) IEIT Systems Co Ltd(IEIT系统有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CMDAR是一个中文多场景动态音频推理基准,旨在评估模型在复杂音频推理任务中的表现,通过精心设计的问题-答案对和多样化音频片段,揭示现有音频语言模型在复杂推理任务中的局限性。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25070 2026-01-06 cs.LG cs.CL 81%

Scaling Open-Ended Reasoning to Predict the Future

扩大开放性推理以预测未来

Nikhil Chandak, Shashwat Goel, Ameya Prabhu, Moritz Hardt, Jonas Geiping

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心) University of Tübingen(图宾根大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于开放性推理的预测系统,通过合成全球事件问题并训练专用模型,提升了预测的准确性、校准性和一致性,并开源所有资源促进研究。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05434 2026-01-06 cs.CL cs.AI 81%

LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models

LTLBench: 为评估大语言模型中的时间推理能力而设计的基准测试

Weizhi Tang, Kwabena Nuamah, Vaishak Belle

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LTLBench通过线性时序逻辑评估大语言模型的时间推理能力,构建包含2000个挑战的数据集并测试12个模型,揭示时间推理中的主要问题及复杂性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24052 2026-01-06 cs.SD cs.AI cs.CL cs.MM 81%

AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives

AHA: 通过反事实硬负样本对齐大音频-语言模型以缓解推理幻觉

Yanxi Chen, Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Xin Li, Peijie Qiu, Hao Wang, Xuanzhao Dong, Yujian Xiong, Anderson Schneider, Yuriy Nevmyvaka, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆斯大学) Washington University in St.Louis(圣路易斯华盛顿大学) Rice University(Rice 大学) Morgan Stanley(摩根大通)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 AHA通过反事实硬负样本对齐大音频-语言模型,有效减少推理幻觉,提升时间推理能力,并在多个基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20866 2026-01-06 cs.CL cs.LG 81%

On the Robustness of Answer Formats in Medical Reasoning Models

医学推理模型中答案格式的鲁棒性研究

Pittawat Taveekitworachai, Natpatchara Pongjirapat, Krittaphas Chaisutyakorn, Piyalitt Ittichaiwong, Tossaporn Saengja, Kunat Pipatanakul

机构 * SCB 10X R&D(SCB 10X 研发部) SCB 10X SCBX Group(SCBX 团体) Faculty of Medicine Siriraj Hospital(素里雅医院医学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了医学推理模型在不同答案格式下的鲁棒性,发现监督微调更稳定,而强化微调易出现跨格式脆性,需谨慎评估以应用于实际医疗场景。

Comments 62 pages, 47 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12880 2026-01-06 cs.CL cs.AI 81%

nvBench 2.0: Resolving Ambiguity in Text-to-Visualization through Stepwise Reasoning

nvBench 2.0:通过分步推理解决文本到可视化中的歧义

Tianqi Luo, Chuhan Huang, Leixian Shen, Boyan Li, Shuyu Shen, Wei Zeng, Nan Tang, Yuyu Luo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 nvBench 2.0通过分步推理解决文本到可视化中的歧义问题,提出Step-Text2Vis模型在模糊场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12524 2026-01-05 cs.CL cs.AI 81%

EXAONE Deep: Reasoning Enhanced Language Models

EXAONE Deep:增强推理能力的语言模型

Kyunghoon Bae, Eunbi Choi, Kibong Choi, Stanley Jungkyu Choi, Yemuk Choi, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Kijeong Jeon, Gerrard Jeongwon Jo, Hyunjik Jo, Jiyeon Jung, Hyosang Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Youchul Kim, Edward Hwayoung Lee, Haeju Lee, Honglak Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Yongmin Park, Sihoon Yang, Heuiyeen Yeen, Sihyuk Yi, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 EXAONE Deep通过训练专用推理数据集,在数学和编码任务中展现出优于同类模型的能力,并提供大模型版本供研究使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00115 2025-12-30 cs.CL cs.AI 81%

Cognitive Alignment in Personality Reasoning: Leveraging Prototype Theory for MBTI Inference

人格推理中的认知对齐:利用原型理论进行MBTI推断

Haoyuan Li, Yuanbo Tong, Yuchen Li, Zirui Wang, Chunhou Liu, Jiamou Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ProtoMBTI通过原型理论与认知对齐,提升文本人格推断的准确性和泛化能力。

Comments The authors have decided to withdraw this version to substantially revise and extend the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04826 2025-12-24 cs.CL cs.AI 81%

Persistent Instability in LLM's Personality Measurements: Effects of Scale, Reasoning, and Conversation History

大语言模型人格测量中的持久不稳定性:规模、推理和对话历史的影响

Tommaso Tosato, Saskia Helbling, Yorguin-Jose Mantilla-Ramos, Mahmood Hegazy, Alberto Tosato, David John Lemay, Irina Rish, Guillaume Dumas

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在人格测量中存在持续不稳定性,规模扩大、推理和对话历史等干预措施未能有效提升稳定性。

Comments Accepted at AAAI 2026, Track on AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17901 2025-12-22 cs.AI cs.CL 81%

When Reasoning Meets Its Laws

当推理遇见其定律

Junyu Zhang, Yifan Sun, Tianang Leng, Jingyan Shen, Liu Ziyin, Paul Pu Liang, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院) University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出推理定律(LoRe)框架,通过单调性和组合性属性评估推理模型,开发微调方法提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16795 2025-12-19 cs.CL cs.AI cs.CY cs.IR 81%

From Facts to Conclusions : Integrating Deductive Reasoning in Retrieval-Augmented LLMs

从事实到结论:在检索增强的大语言模型中整合演绎推理

Shubham Mishra, Samyek Jain, Gorang Mehrishi, Shiv Tiwari, Harsh Sharma, Pratik Narang, Dhruv Kumar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种增强RAG框架,通过结构化推理和冲突分析提升模型在冲突信息下的回答准确性与可解释性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14766 2025-12-18 cs.AI cs.LG 81%

GR-Agent: Adaptive Graph Reasoning Agent under Incomplete Knowledge

GR-Agent: 在不完整知识图谱下适应性图推理代理

Dongzhuoran Zhou, Yuqicheng Zhu, Xiaxia Wang, Hongkuan Zhou, Jiaoyan Chen, Steffen Staab, Yuan He, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) University of Oxford(牛津大学) Amazon(亚马逊) The University of Manchester(曼彻斯特大学) University of Southampton(南安普顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 GR-Agent通过构建交互环境并利用图推理工具,在不完整知识图谱中实现更有效的推理,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11830 2025-12-16 cs.LG cs.AI 81%

CR3G: Causal Reasoning for Patient-Centric Explanations in Radiology Report Generation

CR3G:用于放射学报告生成的患者导向因果推理

Satyam Kumar

机构 * IIT Bombay(博伊斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CR3G通过因果推理提升放射学报告生成的解释能力,增强AI诊断的可信度和实用性。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10080 2025-12-12 cs.CL cs.AI 81%

What Kind of Reasoning (if any) is an LLM actually doing? On the Stochastic Nature and Abductive Appearance of Large Language Models

LLM 实际上在进行何种推理(如果有的话)?关于大语言模型的随机性质及其类比于人类假设推理的性质

Luciano Floridi, Jessica Morley, Claudio Novelli, David Watson

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型的推理机制,指出其生成文本基于学习模式而非真实推理,且其看似假设推理的特性源于训练数据,而非实际推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07611 2025-12-09 cs.AI cs.LG 81%

Comparative Analysis and Parametric Tuning of PPO, GRPO, and DAPO for LLM Reasoning Enhancement

PPO、GRPO和DAPO在LLM推理增强中的比较分析与参数调优

Yongsheng Lian

机构 * Mechanical Engineering Department University of Louisville(路易斯维尔大学机械工程系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过比较PPO、GRPO和DAPO在LLM推理增强中的表现,发现GRPO和DAPO在参数调优下具有更稳定的训练动态和更高的准确性,而DAPO禁用动态采样时表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16334 2025-12-08 cs.AI cs.CL 81%

OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe

OpenMMReasoner: 推动多模态推理的前沿研究:一个开放且通用的配方

Kaichen Zhang, Keming Wu, Zuhao Yang, Bo Li, Kairui Hu, Bin Wang, Ziwei Liu, Xingxuan Li, Lidong Bing

机构 * MiroMind AI Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) LMMs-Lab Team(多模态实验室团队)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 OpenMMReasoner提出了一种开放且通用的多模态推理训练配方,通过两阶段方法提升推理性能,实现在多个基准测试中超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏