arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2607.00531 2026-07-02 cs.LG cs.AI q-bio.BM stat.ML 新提交 84%

Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization

Active-GRPO:用于分子优化的自适应模仿与自我改进推理

Xuefeng Liu, Mingxuan Cao, Qinan Huang, Thomas Brettin, Rick Stevens, Le Cong

机构 * School of Medicine, Stanford University(斯坦福大学医学院) Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学普利兹克分子工程学院) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) Argonne National Laboratory(阿贡国家实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Active-GRPO方法,通过主动模仿-强化和主动参考机制,在分子优化中自适应平衡模仿与自我改进,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23404 2026-06-23 cs.CL cs.AI 新提交 84%

ReasoningLens: Hierarchical Visualization and Diagnostic Auditing for Large Reasoning Models

ReasoningLens:大型推理模型的分层可视化与诊断审计

Jun Zhang, Jiasheng Zheng, Boxi Cao, Yaojie Lu, Hongyu Lin, Jia Zheng, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory(中国信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出ReasoningLens框架,通过分层结构、智能审计和系统分析,将长思维链转化为可操作洞察,用于解释、调试和优化大型推理模型。

Comments Our project is available at https://github.com/icip-cas/ReasoningLens

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15419 2026-06-16 cs.CL cs.AI 新提交 84%

Let LLMs Judge Each Other: Multi-Agent Peer-Reviewed Reasoning for Medical Question Answering

让LLMs互相评判:面向医学问答的多智能体同行评审推理

Zaifu Zhan, Shuang Zhou, Rui Zhang

机构 * University of Minnesota(明尼苏达大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体同行评审推理方法,让多个LLM独立生成思维链推理并相互评估,选择最优推理链输出答案,在三个医学问答数据集上优于单模型和多数投票方法。

Comments Accepted by the Journal of the American Medical Informatics Association

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12608 2026-06-12 cs.CL cs.LG 新提交 84%

Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants

购物推理基准:面向多轮对话购物助手的专家编写基准

Shuxian Fan, Seonwoo Min, Youna Hu, Botao Xia, Jayakrishnan Unnikrishnan, Rowan Musselmann, Yifan Gao, Qingyu Yin, Priyanka Nigam, Bing Yin

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出一个由零售专家编写的525个任务的多轮对话购物推理基准,包含10863个加权评分标准,评估9个模型显示通过率仅57-77%,多轮任务性能下降4-18分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31446 2026-06-01 cs.CL cs.AI 84%

Fine-grained Verification via Diagnostic Reasoning Supervision for Aspect Sentiment Triplet Extraction

面向方面情感三元组抽取的诊断推理监督细粒度验证

Wenna Lai, Haoran Xie, Guandong Xu, Qing Li, S. Joe Qin

机构 * The Hong Kong Polytechnic University(香港理工大学) Lingnan University(岭南大学) Education University of Hong Kong(香港教育大学)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出FiVeD框架,通过诊断推理监督进行细粒度验证,利用质量评分和错误分类等辅助任务提升ASTE三元组抽取的可靠性。

Comments 25 pages, 13 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29192 2026-05-29 cs.AI cs.CL 84%

ReasonOps: Operator Segmentation for LLM Reasoning Traces

ReasonOps: 大语言模型推理轨迹的算子分割

Daniel Lee, Owen Queen, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出无监督方法ReasonOps,从思维链轨迹中提取7种通用推理算子,揭示模型推理结构并用于模型识别与正确性预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18871 2026-05-20 cs.LG cs.AI 84%

Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning

基于不确定性感知的结构LLM推理的分布能量模型

Shireen Kudukkil Manchingal, Abhey Kalia, Fernanda Gonçalves, Shebin Rawther

机构 * Oxford Dynamics Harwell Science and Innovation Campus(牛津动力学哈威尔科学与创新校园)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种分解的能量函数,结合了学习的质量评分器和确定性分析约束惩罚,用于验证结构LLM输出。该方法通过两步推理循环触发目标再生或 abstention,能够在多个基准测试中超越单次Qwen-72B,并减少约束违反。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14665 2026-05-18 cs.AI cs.CL cs.IR 84%

Falkor-IRAC: Graph-Constrained Generation for Verified Legal Reasoning in Indian Judicial AI

Falkor-IRAC:用于印度司法AI的图约束生成:在验证法律推理中的应用

Joy Bose

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Falkor-IRAC框架,通过图约束生成解决印度法律AI中的验证法律推理问题,利用IRAC知识图谱进行结构化推理,并通过验证代理检查生成路径的正确性。

Comments 20 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15016 2026-05-15 cs.CL cs.AI 84%

COTCAgent: Preventive Consultation via Probabilistic Chain-of-Thought Completion

COTCAgent:通过概率性思维链完成实现预防性咨询

Zihan Deng, Xiaozhen Zhong, Chuanzhi Xu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(中国电子科学与技术大学深圳高级研究所) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出COTCAgent框架,通过概率性思维链完成实现纵向电子健康记录的预防性咨询,解决了现有大语言模型在纵向EHR推理中的统计学推理不足和时间序列依赖性捕捉困难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11019 2026-05-13 cs.LG cs.AI 84%

Efficient LLM Reasoning via Variational Posterior Guidance with Efficiency Awareness

通过变分后验指导实现高效的LLM推理:具有效率意识

Zizhao Chen, Yuying Li, Siting Lin, Lianxi Wang

机构 * Guangdong University of Foreign Studies(广东外语外贸大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VPG-EA框架,通过变分推断和效率感知证据下界提升LLM推理效率,实验显示在不同模型规模下效率指标提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19070 2026-04-22 cs.CL cs.LG 84%

TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only

TRN-R1-Zero:通过仅强化学习的LLM进行文本丰富网络推理

Yilun Liu, Ruihong Qiu, Zi Huang

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院) The University of Queensland(昆士兰大学) Brisbane, Queensland, Australia(昆士兰州布里斯班)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 TRN-R1-Zero通过仅强化学习训练LLM,在文本丰富网络上实现零样本推理,无需监督微调或链式思维数据,实验验证其优越性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20209 2026-04-02 cs.CL cs.AI 84%

Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs

儿童智力测试对大语言模型构成挑战?KidGym:一种基于二维网格的推理基准测试用于大语言模型

Hengwei Ye, Yuanting Guan, Yuxuan Ge, Tianying Zhu, Zhenhan Guan, Yijia Zhong, Yijing Zhang, Han Zhang, Yingna Wu, Zheng Tian

机构 * ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KidGym,一种基于二维网格的推理基准测试,用于评估大语言模型的执行、感知推理、学习、记忆和规划能力,通过12个独特任务测试模型适应性和发展潜力,揭示当前模型的局限性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03004 2026-04-01 cs.CL cs.AI 84%

SemioLLM: Evaluating Large Language Models for Diagnostic Reasoning from Unstructured Clinical Narratives in Epilepsy

SemioLLM:评估用于癫痫诊断推理的大型语言模型在无结构临床叙述中的表现

Meghal Dani, Muthu Jeyanthi Prakash, Filip Rosa, Zeynep Akata, Stefanie Liebe

机构 * University of Tübingen(蒂宾根大学) Technical University of Munich(慕尼黑工业大学) University Clinic Tübingen(蒂宾根大学医院) Hertie Institute for Clinical Brain Research(赫蒂临床脑研究所) Excellence Cluster Machine Learning, Tübingen University(蒂宾根大学机器学习卓越集群) Hertie Institute for AI in Brain Health (Hertie AI)(赫蒂人工智能脑健康研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了八个大型语言模型在癫痫诊断任务中的表现,通过过滤和标准化 seizure 描述短语,将其映射到七个可能的癫痫发作起始区。结果显示,经过提示工程后,多数模型表现接近临床水平,但临床情境下的表现受语言上下文影响显著,需改进模型的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11128 2026-03-24 cs.CL cs.AI 84%

Theory-Grounded Evaluation of Human-Like Fallacy Patterns in LLM Reasoning

基于理论的LLM推理中人类似 fallacy 模式的评估

Andrew Keenan Richardson, Ryan Othniel Kearns, Sean Moss, Vincent Wang-Mascianica, Philipp Koralus

机构 * The Laboratory for Human-Centered AI, Institute for Ethics in AI, Faculty of Philosophy, University of Oxford, UK(以人为中心的人工智能实验室,人工智能伦理研究所,哲学学院,牛津大学,英国) Oxford Internet Institute, University of Oxford, UK(牛津互联网研究所,牛津大学,英国) School of Computer Science, University of Birmingham, UK(计算机科学学院,伯明翰大学,英国)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过ETR理论和PyETR工具,评估LLM推理错误是否符合人类fallacy模式,发现模型能力与错误类型相关,且反转前提顺序可减少fallacy生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06533 2026-03-18 cs.AI cs.CL 84%

LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language Models

LogicSkills: 一个用于大语言模型形式推理的结构化基准

Brian Rabern, Philipp Mondorf, Barbara Plank

机构 * Niche, Inc.(Niche公司) Oregon State University – Cascades(俄勒冈州立大学-卡斯卡德分校) MaiNLP Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogicSkills基准,评估大语言模型在形式符号化、反例构造和有效性评估三项核心逻辑技能中的表现,揭示高任务准确率可能掩盖核心技能弱点。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11896 2026-03-13 cs.CV cs.AI cs.CL 84%

Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models

边看边想:多轮视频推理的在线流式段级内存

Lu Wang, Zhuoran Jin, Yupu Hao, Yubo Chen, Kang Liu, Yulong Ao, Jun Zhao

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Think While Watching框架,通过段级内存保持多轮视频推理连续性,提升流式视频理解的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07218 2026-03-04 cs.LG cs.AI cs.CV 84%

Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward

Perception-R1: 通过视觉感知奖励提升多模态大语言模型的多模态推理能力

Tong Xiao, Xin Xu, Zhenya Huang, Hongyu Gao, Quan Liu, Qi Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK AI Research(iFLYTEK人工智能研究院) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 Perception-R1通过引入视觉感知奖励提升多模态大语言模型的多模态推理能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03135 2026-03-03 cs.CV cs.AI cs.CL 84%

OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models

OmniSpatial:迈向视觉语言模型的空间推理综合基准

Mengdi Jia, Zekun Qi, Shaochen Zhang, Wenyao Zhang, Xinqiang Yu, Jiawei He, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Xian Jiaotong University(西安交通大学) Shanghai Jiao Tong University(上海交通大学) Galbot Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 OmniSpatial是一个基于认知心理学的综合性空间推理基准,通过动态推理、复杂空间逻辑等四个类别,评估视觉语言模型在空间推理上的能力与局限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23610 2026-03-02 cs.CL cs.AI 84%

LLM-Driven Multi-Turn Task-Oriented Dialogue Synthesis for Realistic Reasoning

基于大语言模型的多轮任务导向对话合成用于真实推理

Yu Zhu, Kai Yang

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的多轮任务导向对话合成框架,通过三级优化生成真实推理场景下的对话,提升LLM的逻辑推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22828 2026-02-27 cs.CL cs.AI 84%

TCM-DiffRAG: Personalized Syndrome Differentiation Reasoning Method for Traditional Chinese Medicine based on Knowledge Graph and Chain of Thought

基于知识图谱和推理链的TCM-DiffRAG:一种用于传统中医个性化辨证的推理方法

Jianmin Li, Ying Chang, Su-Kit Tang, Yujia Liu, Yanwen Wang, Shuyuan Lin, Binkai Ou

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 TCM-DiffRAG结合知识图谱与推理链,提升中医个性化诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20117 2026-02-24 cs.AI cs.LG 84%

ReSyn: Autonomously Scaling Synthetic Environments for Reasoning Models

ReSyn:自主扩展合成环境以增强推理模型

Andre He, Nathaniel Weir, Kaj Bostrom, Allen Nie, Darion Cassel, Sam Bayless, Huzefa Rangwala

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 ReSyn通过生成多样化推理环境,利用验证器监督和任务多样性提升推理语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16928 2026-02-20 cs.AI cs.LG cs.RO 84%

Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning

超越实体 haystack 中的针(针):环境、架构和训练考虑因素在长上下文推理中的应用

Bosung Kim, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 $\infty$-THOR 框架,通过长上下文推理任务和数据集提升实体 AI 的长期推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07833 2026-02-10 cs.CV cs.AI cs.CL 84%

SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models

SPD-Faith Bench: 诊断和改进多模态大语言模型中的推理忠实性

Weijiang Lv, Yaoxuan Feng, Xiaobo Xia, Jiayu Wang, Yan Jing, Wenchao Chen, Bo Chen

机构 * Xidian University(西安电子科技大学) National University of Singapore(新加坡国立大学) Xi’an Jiaotong University(西安交通大学)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SPD-Faith Bench通过细粒度图像差异推理诊断并改进多模态大语言模型中的推理忠实性,揭示了感知盲区和感知-推理脱节的系统性失败模式,并提出SAGE框架提升视觉路由和推理与感知的一致性。

Comments 53 pages, 42 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03516 2026-02-05 cs.LG cs.AI 84%

Not All Negative Samples Are Equal: LLMs Learn Better from Plausible Reasoning

并非所有负样本都平等:LLM通过合理推理学习更好

Zixiang Di, Jinyi Han, Shuo Zhang, Ying Liao, Zhi Li, Xiaofeng Ji, Yongqi Wang, Zheming Yang, Ming Gao, Bingdong Li, Jie Wang

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PNS方法,通过合成高质量负样本提升LLM推理能力,实验显示其在多个基准测试中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22035 2026-01-30 cs.CL cs.AI 84%

Thinking Out of Order: When Output Order Stops Reflecting Reasoning Order in Diffusion Language Models

脱离顺序思考:当输出顺序不再反映推理顺序时扩散语言模型的表现

Longxuan Yu, Yu Fu, Shaorong Zhang, Hui Liu, Mukund Varma T, Greg Ver Steeg, Yue Dong

机构 * University of California, Riverside, CA, USA(加州大学河滨分校) Independent Researcher(独立研究者) University of California, San Diego, CA, USA(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出屏蔽扩散语言模型(MDLMs)在处理输出顺序与推理顺序不一致时展现出的顺序鲁棒性,通过实验验证其在不同基准上的稳定性能。

Comments 18 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21157 2026-01-30 cs.AI cs.CL 84%

Bridging the Arithmetic Gap: The Cognitive Complexity Benchmark and Financial-PoT for Robust Financial Reasoning

弥合算术鸿沟:认知复杂性基准与金融-PoT用于稳健的金融推理

Boxiang Zhao, Qince Li, Zhonghao Wang, Yi Wang, Peng Cheng, Bo Lin

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出认知复杂性基准和金融-PoT框架,通过架构解耦提升金融推理的鲁棒性,使Qwen3-235B模型在复杂任务中的准确率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08848 2026-01-15 cs.CL cs.AI 84%

PediaMind-R1: A Temperament-Aware Language Model for Personalized Early Childhood Care Reasoning via Cognitive Modeling and Preference Alignment

PediaMind-R1: 一种基于气质的个性化婴幼儿护理推理语言模型:通过认知建模与偏好对齐

Zihe Zhang, Can Zhang, Yanheng Xu, Xin Hu, Jichao Leng

机构 * School of Future Information and Innovation, Fudan University(未来信息与创新学院,复旦大学) Corporate Research, Bosch (China) Investment Ltd.(博世(中国)投资有限公司研发部)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 PediaMind-R1通过整合认知建模与偏好对齐,实现基于婴幼儿气质的个性化护理推理。

Comments Accepted at EMNLP 2025 PALS Workshop (PALS: EXPLORING ACTIVE AND PASSIVE LLM PERSONALIZATION)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07199 2026-01-13 cs.LG cs.AI 84%

Forward versus Backward: Comparing Reasoning Objectives in Direct Preference Optimization

正向与反向:在直接偏好优化中比较推理目标

Murtaza Nikzad, Raghuram Ramanujan

机构 * Department of Math and Computer Science(数学与计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文通过直接偏好优化比较正向与反向推理目标,发现正向训练提升准确性,反向训练降低误报率,两者互补提升模型推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07328 2026-01-07 cs.LG cs.AI cs.CE physics.chem-ph 84%

Bridging the Plausibility-Validity Gap by Fine-Tuning a Reasoning-Enhanced LLM for Chemical Synthesis and Discovery

通过微调增强推理的LLM弥合合理性-有效性差距以用于化学合成与发现

Malikussaid, Hilal Hudan Nuha, Isman Kurniawan

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 通过微调增强推理的LLM,提升化学合成与发现的合理性-有效性,实现高准确率和透明高效的方法。

Comments 8 pages, 1 equation, 5 tables, to be published in IEEE MCSoC 2025, unabridged version exists as arXiv:2507.07328v1

Journal ref Proc. 2025 IEEE 18th Int. Symp. Embedded Multicore/Many-core SoCs (MCSoC), 2025, pp. 538-545

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20595 2025-12-24 cs.CL cs.AI cs.CV 84%

Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs

Cube Bench: 一个用于多模态大语言模型空间视觉推理的基准测试

Dhruv Anand, Ehsan Shareghi

机构 * Department of Data Science and AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 推理评测 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 Cube Bench通过评估多模态大语言模型在空间视觉推理中的能力,揭示了模型在复杂任务中的表现差异及自我纠正的局限性。

Comments 27 pages, 5 figures, 9 tables. Cube available at https://github.com/dana-23/cube-bench

详情

展开后加载摘要…

URL PDF HTML 收藏