arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2508.01055 2026-02-17 cs.LG cs.AI q-bio.BM q-bio.QM 81%

FGBench: A Dataset and Benchmark for Molecular Property Reasoning at Functional Group-Level in Large Language Models

FGBench: 一个用于大语言模型中功能基团级分子属性推理的数据集和基准

Xuan Liu, Siru Ouyang, Xianrui Zhong, Jiawei Han, Huimin Zhao

机构 * Department of Chemical and Biomolecular Engineering, University of Illinois Urbana-Champaign(化学与生物分子工程系,伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science, University of Illinois Urbana-Champaign(计算机科学系,伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 FGBench通过构建包含功能基团级信息的数据集,提升大语言模型在分子属性推理任务中的能力。

Comments NeurIPS 2025 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13274 2026-02-17 cs.AI cs.CL 81%

ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs

ProMoral-Bench:评估大语言模型中道德推理与安全性的提示策略

Rohan Subramanian Thomas, Shikhar Shiromani, Abdullah Chaudhry, Ruizhe Li, Vasu Sharma, Kevin Zhu, Sunishchal Dev

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ProMoral-Bench通过统一道德安全评分评估多种提示策略,发现紧凑示例引导框架在道德和安全方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12968 2026-02-16 cs.IR cs.AI cs.CL 81%

RGAlign-Rec: Ranking-Guided Alignment for Latent Query Reasoning in Recommendation Systems

RGAlign-Rec: 基于排名引导的潜在查询推理中的对齐方法

Junhua Liu, Yang Jihao, Cheng Chang, Kunrong LI, Bin Fu, Kwan Hui Lim

机构 * Forth AI Singapore(Forth AI新加坡) Shopee Singapore(Shopee新加坡) Singapore Uni. of Tech. and Design(新加坡技术与设计大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RGAlign-Rec通过闭环对齐框架结合语义推理和增强查询模型,提升电子商务推荐系统的预测准确性和服务质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12422 2026-02-16 cs.AR cs.AI cs.LG 81%

CacheMind: From Miss Rates to Why -- Natural-Language, Trace-Grounded Reasoning for Cache Replacement

CacheMind: 从缺失率到原因 -- 基于自然语言和跟踪数据的缓存替换推理

Kaushal Mhapsekar, Azam Ghanbari, Bita Aslrousta, Samira Mirbagher-Ajorpaz

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CacheMind通过自然语言和跟踪数据推理提升缓存替换性能,实现高准确率和实际应用效果。

Comments 16 pages, 13 figures, ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12196 2026-02-13 cs.CL cs.AI 81%

Visual Reasoning Benchmark: Evaluating Multimodal LLMs on Classroom-Authentic Visual Problems from Primary Education

视觉推理基准:评估多模态大语言模型在小学课堂真实视觉问题上的能力

Mohamed Huti, Alasdair Mackintosh, Amy Waldock, Dominic Andrews, Maxime Lelièvre, Moritz Boos, Tobias Murray, Paul Atherton, Robin A. A. Ince, Oliver G. B. Garrod

机构 * Fab AI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出视觉推理基准,用于评估多模态大语言模型在小学课堂真实视觉问题上的能力,揭示模型在静态与动态任务上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12143 2026-02-13 cs.AI cs.LG 81%

STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction

STAR:连接统计推理与代理推理以提升大模型性能预测

Xiaoxiao Wang, Chunxiao Li, Junying Wang, Yijin Guo, Zijian Chen, Chunyi Li, Xiaohong Liu, Zicheng Zhang, Guangtao Zhai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 STAR框架通过结合统计推理与代理推理,有效提升大模型性能预测的准确性与可靠性,尤其在数据稀疏情况下表现突出。

Comments 10 pages, 8 figures, 17 tables. Code available at https://github.com/xiaoxiaostudy/star

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16858 2026-02-12 cs.CL cs.AI 81%

MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering

MTBench: 一种多模态时间序列基准,用于时间推理和问答

Jialin Chen, Aosong Feng, Ziyu Zhao, Juan Garza, Gaukhar Nurbek, Cheng Qin, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying

机构 * Yale University, New Haven, CT, USA(耶鲁大学) McGill University, Montreal, QC, Canada(麦吉尔大学) University of Texas Rio Grande Valley, TX, USA(德克萨斯大学里奥格兰德谷分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MTBench是一种多模态时间序列基准,用于评估大型语言模型在金融和天气领域的时间推理和问答能力。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16814 2026-02-12 cs.LG cs.CL 81%

From Belief Entrenchment to Robust Reasoning in LLM Agents

从信念固化到LLM代理的稳健推理

Jihwan Oh, Minchan Jeong, Jongwoo Ko, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 DReaMAD通过引入多样化推理和动态辩论机制,有效缓解了LLM代理中的信念固化问题,提升了推理准确性与胜率。

Comments Accepted to TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14986 2026-02-12 cs.AI cs.CL 81%

Implicit Probabilistic Reasoning Does Not Reflect Explicit Answers in Large Language Models

隐式概率推理不反映大语言模型中的显式答案

Manuel Mondal, Ljiljana Dolamic, Gérôme Bovet, Philippe Cudré-Mauroux, Julien Audiffren

机构 * University of Fribourg, Switzerland(弗里堡大学) armasuisse S+T, Switzerland(armasuisse S+T)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大语言模型在显式概率推理中表现良好,但在隐式概率推理中预测与真实情况存在显著差异,且传统评估方法无法检测此类错误。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08382 2026-02-10 cs.CL cs.AI 81%

Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning

通过端到端强化学习实现压缩内存中的动态长上下文推理

Zhuoen Chen, Dongfang Li, Meishan Zhang, Baotian Hu, Min Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于端到端强化学习的框架,通过分块压缩和选择性记忆回溯实现高效长上下文推理,提升了多跳推理任务的准确性和效率。

Comments 26 pages, 7 figures. Code and models will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20694 2026-02-10 cs.AI astro-ph.SR cs.LG physics.space-ph 81%

Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning

用恒星进行推理:一个用于代理科学推理的太阳物理数据集和基准

Kevin Lee, Russell Spiewak, James Walsh

机构 * Frontier Development Lab(前沿发展实验室) Department of Mechanical and Aerospace Engineering, UCLA(机械与航空航天工程系,加州大学洛杉矶分校) Trillium Technologies Inc.(Trillium技术公司) Department of Engineering, University of Cambridge(工程系,剑桥大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一个太阳物理数据集和基准,用于评估代理在科学推理中的表现,发现系统工程原则在演绎推理任务中优于直接提示方法。

Comments Accepted at NeurIPS 2025 Machine Learning and the Physical Sciences (ML4PS) Workshop. Dataset: https://huggingface.co/datasets/SpaceML/ReasoningWithAStar

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07820 2026-02-10 cs.AI cs.CL 81%

Certainty-Guided Reasoning in Large Language Models: A Dynamic Thinking Budget Approach

在大语言模型中的确定性引导推理:一种动态思维预算方法

João Paulo Nogueira, Wentao Sun, Alonso Silva, Laith Zumot

机构 * Nokia Bell Labs, France(诺基亚贝尔实验室,法国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CGR通过动态调整推理预算,在保持准确性的同时减少token使用,通过确定性评估实现高效的推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15487 2026-02-10 cs.CL cs.AI 81%

ExpliCa: Evaluating Explicit Causal Reasoning in Large Language Models

ExpliCa:评估大型语言模型中的显式因果推理

Martina Miliani, Serena Auriemma, Alessandro Bondielli, Emmanuele Chersoni, Lucia Passaro, Irene Sucameli, Alessandro Lenci

机构 * CoLing Lab, Department of Philology, Literature, and Linguistics, University of Pisa, Italy(皮尔森大学哲学、文学与语言学系协作语言实验室) Department of Informatics, University of Pisa, Italy(皮尔森大学信息学系) Department of Chinese and Bilingual Studies, The Hong Kong Polytechnic University(香港理工大学中文与双语研究系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ExpliCa数据集用于评估大型语言模型在显式因果推理中的能力,发现顶级模型在准确率上仍存在显著不足,且模型性能受语言顺序和大小影响明显。

Comments Accepted for publication in Findings of ACL 2025

Journal ref In Findings of the Association for Computational Linguistics: ACL 2025, pages 17335-17355, Vienna, Austria. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11239 2026-02-10 cs.AI cs.CL 81%

Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs

非确定多项式时间问题挑战:为大语言模型构建的持续扩展推理基准

Chang Yang, Ruiyu Wang, Junzhe Jiang, Qi Jiang, Qinggang Zhang, Yanchen Deng, Shuxin Li, Shuyue Hu, Bo Li, Florian T. Pokorny, Xiao Huang, Xinrun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) KTH Royal Institute of Technology(皇家理工学院) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Singapore Management University(新加坡管理学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 NPPC是一个持续扩展的推理基准,通过三个模块评估LLMs的推理能力,揭示其性能极限和改进方向。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02581 2026-02-04 cs.LG cs.AI 81%

QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals

QuantLRM:通过微调信号对大推理模型进行量化

Nan Zhang, Eugene Kwek, Yusen Zhang, Muyu Pan, Suhang Wang, Prasenjit Mitra, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 QuantLRM通过微调信号对大推理模型进行量化,通过拟合二次函数保护两端,提升量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02497 2026-02-04 cs.CL cs.AI 81%

STEMVerse: A Dual-Axis Diagnostic Framework for STEM Reasoning in Large Language Models

STEMVerse: 一种用于大型语言模型中STEM推理的双轴诊断框架

Xuzhao Li, Xuchen Li, Jian Zhao, Shiyu Hu

机构 * NTU(国立科技大学) ZGCA(智能计算协会) ZGCI(智能计算研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 STEMVerse通过双轴诊断框架系统分析LLM在STEM领域的推理能力,揭示其结构失败模式,提供科学推理的深入理解。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02125 2026-02-04 cs.AI cs.CL 81%

Do AI Models Perform Human-like Abstract Reasoning Across Modalities?

AI模型在不同模态下是否能进行类人抽象推理?

Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

机构 * Santa Fe Institute, New Mexico, USA(圣菲研究所) Sandia National Laboratories, New Mexico, USA(桑迪亚国家实验室) Advanced Micro Devices Inc., Texas, USA(先进微器件公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了AI模型在不同模态下进行抽象推理的能力,发现其在文本和视觉模态中的表现存在显著差异,表明仅依赖准确率评估抽象推理能力存在偏差。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01477 2026-02-03 cs.LG cs.AI 81%

Achieving Time Series Reasoning Requires Rethinking Model Design, Tasks Formulation, and Evaluation

实现时间序列推理需要重新思考模型设计、任务制定和评估

Yaxuan Kong, Yiyuan Yang, Shiyu Wang, Chenghao Liu, Yuxuan Liang, Ming Jin, Stefan Zohren, Dan Pei, Yan Liu, Qingsong Wen

机构 * University of Oxford, UK(牛津大学) Hong Kong University of Science(香港科学大学) Griffith University, Australia(格里菲斯大学) Tsinghua University, China(清华大学) University of Southern California, USA(南加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文指出时间序列推理需重新审视模型设计、任务制定和评估,提出统一框架以提升现实应用中的鲁棒性、可解释性和决策相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15746 2026-02-03 cs.CL cs.AI cs.CV 81%

End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning

端到端代理RAG系统训练用于可追溯的诊断推理

Qiaoyu Zheng, Yuze Sun, Chaoyi Wu, Weike Zhao, Pengcheng Qiu, Yongguo Yu, Kun Sun, Jian Zhang, Yanfeng Wang, Ya Zhang, Weidi Xie

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Deep-DxSearch通过端到端强化学习训练代理RAG系统,实现可追溯的诊断推理,显著提升诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06822 2026-02-02 cs.AI cs.CL 81%

RAFFLES: Reasoning-based Attribution of Faults for LLM Systems

基于推理的LLM系统故障归因

Chenyang Zhu, Spencer Hong, Jingyu Wu, Kushal Chawla, Charlotte Tang, Youbing Yin, Nathan Wolfe, Erin Babinsky, Daben Liu

机构 * Capital One

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RAFFLES通过整合迭代推理的离线评估架构,实现了对LLM系统中步骤级故障的自动化检测,显著提高了故障识别的准确率。

Comments Accepted at EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21000 2026-01-30 cs.CL cs.AI 81%

UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop

UrduBench: 一种基于上下文融合翻译的人工参与推理基准测试

Muhammad Ali Shafique, Areej Mehboob, Layba Fiaz, Muhammad Usman Qadeer, Hamza Farooq

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出UrduBench,通过上下文融合翻译和人工参与验证,构建乌尔都语推理基准测试,评估不同模型在多种提示策略下的表现,揭示多步骤推理在乌尔都语中的挑战及语言对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20221 2026-01-29 cs.AI cs.CL 81%

Scaling Medical Reasoning Verification via Tool-Integrated Reinforcement Learning

通过工具集成强化学习扩展医学推理验证

Hang Zhang, Ruheng Wang, Yuelyu Ji, Mingu Kwak, Xizhi Wu, Chenyu Li, Li Zhang, Wenqi Shi, Yifan Peng, Yanshan Wang

机构 * University of Pittsburgh(匹兹堡大学) UT Southwestern Medical Center(西南医学中心) Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出$\method$,通过工具集成强化学习实现医学推理验证的扩展,显著提升验证效果并降低采样预算需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18984 2026-01-28 cs.LG cs.CL 81%

Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning

保存好的前缀:通过过程监督强化学习实现精确误差惩罚以增强大语言模型推理

Haolin Liu, Dian Yu, Sidi Lu, Yujun Zhou, Rui Liu, Zhenwen Liang, Haitao Mi, Chen-Yu Wei, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Virginia(弗吉尼亚大学) University of Notre Dame(圣母大学) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 通过过程监督强化学习实现精确误差惩罚,提升大语言模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15600 2026-01-28 cs.AI cs.CL 81%

Unleashing Scientific Reasoning for Bio-experimental Protocol Generation via Structured Component-based Reward Mechanism

通过结构化组件奖励机制解锁生物实验协议生成中的科学推理

Haoran Sun, Yankai Jiang, Zhenyu Tang, Yaning Pan, Shuang Gu, Zekai Lin, Lilong Wang, Wenjie Lou, Lei Liu, Lei Bai, Xiaosong Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过结构化组件奖励机制,Thoth在多个基准测试中超越了现有LLMs,实现了更准确的生物实验协议生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10132 2026-01-27 cs.AI cs.LG 81%

Is More Context Always Better? Examining LLM Reasoning Capability for Time Interval Prediction

更多上下文总是更好吗?检验LLM在时间间隔预测中的推理能力

Yanan Cao, Farnaz Fallahi, Murali Mohana Krishna Dandu, Lalitesh Morishetti, Kai Zhao, Luyi Ma, Sinduja Subramaniam, Jianpeng Xu, Evren Korpeoglu, Kaushiki Nag, Sushant Kumar, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM在时间间隔预测中的推理能力,发现尽管LLM在某些任务中表现良好,但其在捕捉定量时间结构方面存在局限,且过多上下文反而可能降低性能。

Comments Accepted at The Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15338 2026-01-27 cs.AI cs.CL 81%

HeartLLM: Discretized ECG Tokenization for LLM-Based Diagnostic Reasoning

HeartLLM: 12导联心电图离散化编码用于基于大语言模型的诊断推理

Jinning Yang, Wenjie Sun, Wen Shi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 HeartLLM通过离散化ECG信号生成令牌,使LLM能处理心电图与自然语言输入,实现医疗诊断推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13680 2026-01-26 cs.CL cs.LG 81%

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

VMMU:一个多任务多模态理解和推理基准

Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

机构 * KAIST(韩国科学技术院) MBZUAI(慕布扎伊大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 VMMU是一个评估视觉语言模型在非英语环境下多模态理解和推理能力的基准,通过2500个多模态问题测试模型对视觉和文本信息的整合与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10883 2026-01-23 cs.AI cs.CL 81%

Chat-TS: Enhancing Multi-Modal Reasoning Over Time-Series and Natural Language Data

Chat-TS: 提升时间序列与自然语言数据的多模态推理能力

Paul Quinlan, Qingguo Li, Xiaodan Zhu

机构 * Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程学院) Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程学院) Ingenuity Labs Research Institute, Queen’s University(皇后大学创新实验室研究 institute)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Chat-TS通过整合时间序列标记提升多模态推理能力,提供新数据集和训练策略,在保持自然语言能力的同时增强时间序列推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15279 2026-01-22 cs.LG cs.AI 81%

MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs

MolecularIQ: 通过分子图上的符号验证来表征化学推理能力

Christoph Bartmann, Johannes Schimunek, Mykyta Ielanskyi, Philipp Seidl, Günter Klambauer, Sohvi Luukkonen

机构 * ELLIS Unit Linz and LIT AI Lab, Institute for Machine Learning, Johannes Kepler University, Linz, Austria(林茨ELLIS单元和LIT人工智能实验室,机器学习研究所,约翰·凯撒大学,林茨,奥地利) Clinical Research Institute Medical Artificial Intelligence, Johannes Kepler University, Linz, Austria(医学人工智能临床研究研究所,约翰·凯撒大学,林茨,奥地利)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MolecularIQ是一个专注于分子图符号验证的化学推理基准测试,旨在评估模型对分子结构推理能力的细粒度评估并揭示模型在特定任务和分子结构上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13761 2026-01-22 cs.AI cs.CL 81%

DARC: Decoupled Asymmetric Reasoning Curriculum for LLM Evolution

DARC:解耦的非对称推理课程用于LLM进化

Shengda Fan, Xuyan Ye, Yankai Lin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DARC通过解耦的非对称推理课程框架,提升大型语言模型的自我进化能力,实现无需人工标注的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏