arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2607.29062 2026-08-03 cs.AI 新提交 85%

On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness

论用于思维链忠实性的引导向量的泛化性

Matthew Nguyen, Kyle Cox, Austin Meek, Iván Arcuschin

机构 * University of Virginia(弗吉尼亚大学) University of Delaware(特拉华大学) Poseidon Research(波塞冬研究院)

专题命中 推理评测 :chain-of-thought(title);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 该研究针对三个模型探究提升思维链忠实性的引导向量的泛化性,发现其效果主要由评估设置决定,且仅对最大型模型有效,引导可减少未被确认的提示使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19877 2026-07-17 cs.CL 版本更新 85%

Scaling Evaluation-time Compute with Reasoning Models as Evaluators

通过推理模型作为评估器来提升评估时的计算能力

Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Mingyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck

机构 * CMU(卡内基梅隆大学) UIUC(伊利诺伊大学) KAIST AI(韩国科学技术院人工智能研究所) NEC Laboratories Europe(日本 NEC 欧洲实验室) Ss.Cyril and Methodius University of Skopje(斯科普里塞尔吉尔和梅蒂乌斯大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL

AI总结 本文探讨了通过增加评估时的计算量来提升语言模型的评估能力,利用推理模型作为评估器,分别评估响应整体和每个步骤,从而提高评估效果。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07883 2026-07-10 cs.AI 新提交 85%

Nigeria Machinery: A Low-Resource Industrial Dataset with a Domain-Grounded Reasoning Layer

尼日利亚机械:一个具有领域基础推理层的低资源工业数据集

Gospel Bassey, Vincent Fakiyesi

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 针对非洲经济体工业机械数据缺乏问题,发布尼日利亚机械数据集及构建思维链推理示例的方法,解决语言模型构建数据集时领域不明确问题,提升领域基础提示比例,虽有局限性,但为相关研究提供参考。

Comments 10pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22862 2026-06-23 cs.CV cs.LG 新提交 85%

Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME

看得见的链,答不出的答案:针对视频MME上强制思维链的多方面评估方案

Zhichao Fan, Yanhang Li, Zexin Zhuang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northeastern University(东北大学) Southern Methodist University(南卫理公会大学)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.LG

AI总结 提出三探针评估方案检验强制思维链在视频问答中的可靠性,应用于Qwen2.5-VL发现思维链强依赖视频但未提升准确率,甚至在小模型上导致下降。

Comments 10 pages, 5 figures. To appear at The 2nd Workshop on Evaluation for Multimodal Generation @ SIGIR 2026 (EvalMG '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21123 2026-06-23 cs.CL 新提交 85%

A Multi-Agent Audit Framework for High-Stakes Reasoning: Evaluation and Interpretability in Clinical Mental Health Screening

面向高风险推理的多智能体审计框架:临床心理健康筛查中的评估与可解释性

Jingchen Ye, Yanpei Yu, Luyao Zhang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 提出多智能体审计框架,通过感知、知识检索、思维链推理和审计验证的多步协作,在临床心理健康筛查中降低PHQ-8抑郁预测误差,提升可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00412 2026-04-15 cs.CR cs.AI 85%

Red Teaming Large Reasoning Models

对大型推理模型进行红队测试

Jiawei Chen, Yang Yang, Chao Yu, Yu Tian, Zhi Cao, Xue Yang, Linghao Li, Hang Su, Zhaoxia Yin

机构 * Shanghai Key Laboratory of Multidimensional Information Processing, East China Normal University(上海多维信息处理关键实验室,东华大学) Zhongguancun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Dept. of Comp. Sci. and Tech., THBI Lab, Tsinghua University(计算机科学与技术系,清华THBI实验室) Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出RT-LRM基准,评估大型推理模型的可信度,揭示其在面对推理风险时的脆弱性,并发布工具箱支持未来研究。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10506 2026-04-14 cs.AI 85%

A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning

一种用于对抗具身推理中时空幻觉的渐进训练策略

Xiaoda Yang, Shuai Yang, Can Wang, Jingyang Xue, Menglan Tang, Checheng Yu, Xunzhe Zhou, Sashuai Zhou, Tao Jin, Lixin Yang, Xiangyu Yue, Zhou Zhao

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学) Qingdao University(青岛大学) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) University of YYY(YYY大学) Institute of WWW(WWW研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出一种渐进训练框架,通过构建CoT数据集和弱标签数据提升视觉语言模型的时空推理能力,有效缩小了正反向性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12623 2026-04-10 cs.CV cs.CL 85%

Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space

思维中的推理:潜在空间中的动态多模态交错

Chengzhi Liu, Yuzhe Yang, Yue Fan, Qingyue Wei, Sheng Liu, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出DMLR框架,通过动态潜在策略梯度优化和视觉注入策略,在潜在空间中实现视觉与文本的动态交错推理,提升多模态推理性能并保持高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21652 2026-03-31 cs.CL 85%

UnsafeChain: Enhancing Reasoning Model Safety via Hard Cases

UnsafeChain: 通过困难案例增强推理模型安全性

Raj Vardhan Tomar, Preslav Nakov, Yuxia Wang

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Cluster Innovation Centre, University of Delhi(德里大学集群创新中心) INSAIT

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 UnsafeChain通过构建包含困难提示的对齐数据集,提升模型安全性并保持推理能力,实验显示其在多个基准测试中表现优异。

Journal ref The Asian Federation of Natural Language Processing and The Association for Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25412 2026-03-27 cs.AI cs.CR 85%

Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models

超越内容安全:大型语言模型推理漏洞的实时监控

Xunguang Wang, Yuguang Zhou, Qingyue Wang, Zongjie Li, Ruixuan Huang, Zhenlan Ji, Pingchuan Ma, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出实时监控方法,识别大型语言模型推理过程中的安全漏洞,定义九类不安全推理行为,并通过实验验证其有效性,展示了推理安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21705 2026-03-24 cs.LG 85%

Data-Free Layer-Adaptive Merging via Fisher Information for Long-to-Short Reasoning LLMs

无需数据的层自适应融合:通过信息论实现长到短推理LLM

Tian Xia

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出FIM-Merging方法,通过计算Fisher信息矩阵来分配每层融合系数,提升长到短推理LLM的性能,减少响应长度,且无需校准数据。

Comments 14 pages, NeurIPS 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01038 2026-03-23 cs.CV cs.AI 85%

From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofing

从直觉到探究:一种工具增强的推理MLLM框架用于可推广的面部反伪装

Haoyuan Zhang, Keyao Wang, Guosheng Zhang, Haixiao Yue, Zhiwen Tan, Siran Peng, Tianshuo Zhang, Xiao Tan, Kunbin Chen, Wei He, Jingdong Wang, Ajian Liu, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(UCAS智能科学研究院) MAIS, CASIA(CASIA模式识别与智能信息处理研究院) Baidu Inc(百度公司) CAIR, HKISI, CAS(HKISI CAS计算机视觉研究院) M.U.S.T

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出TAR-FAS框架,通过整合外部视觉工具提升面部反伪装的泛化能力,采用CoT-VT范式使MLLM深入分析细微伪装线索,实验表明其在跨域协议下达到SOTA性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05400 2026-03-06 cs.CL 85%

An Exploration-Analysis-Disambiguation Reasoning Framework for Word Sense Disambiguation with Low-Parameter LLMs

基于低参数LLM的探索-分析-消歧推理框架用于词义消歧

Deshan Sumanathilaka, Nicholas Micallef, Julian Hough

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本研究提出基于低参数LLM的探索-分析-消歧推理框架,通过推理驱动的微调策略,在零样本设置中实现与GPT-4-Turbo相当的词义消歧性能,并展示了对未见词义的稳健泛化能力。

Comments Accepted at LREC 2026, 15 pages, 11 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10265 2026-02-19 cs.AI cs.RO 85%

SurgRAW: Multi-Agent Workflow with Chain of Thought Reasoning for Robotic Surgical Video Analysis

SurgRAW:基于链式推理的多智能体工作流用于机器人手术视频分析

Chang Han Low, Ziyue Wang, Tianyi Zhang, Zhu Zhuo, Zhitao Zeng, Evangelos B. Mazomenos, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) Bioinformatics Institute (BII), Agency for Science, Technology and Research (A*STAR)(生物信息研究所(BII),科技研究局(A*STAR)) Wellcome/EPSRC Centre for Interventional and Surgical Sciences (WEISS) and the Department of Medical Physics and Biomedical Engineering, University College London(Wellcome/EPSRC介入与外科科学中心(WEISS)及伦敦大学学院医学物理与生物医学工程系)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 SurgRAW通过基于链式推理的多智能体工作流,在机器人手术视频分析中实现零样本多任务推理,提升准确性和临床相关性。

Journal ref IEEE Robotics and Automation Letters, 2026, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02410 2026-02-17 cs.LG 85%

OpenTSLM: Time-Series Language Models for Reasoning over Multivariate Medical Text- and Time-Series Data

OpenTSLM:用于多变量医学文本和时间序列数据推理的时间序列语言模型

Patrick Langer, Thomas Kaar, Max Rosenblattl, Maxwell A. Xu, Winnie Chow, Martin Maritsch, Robert Jakob, Ning Wang, Juncheng Liu, Aradhana Verma, Brian Han, Daniel Seung Kim, Henry Chubb, Scott Ceresnak, Aydin Zahedivash, Alexander Tarlochan Singh Sandhu, Fatima Rodriguez, Daniel McDuff, Elgar Fleisch, Oliver Aalami, Filipe Barata, Paul Schmiedmayer

机构 * Stanford Mussallem Center for Biodesign(斯坦福 Mussallem 生物设计中心) Centre for Digital Health Interventions(数字健康干预中心) Agentic Systems Lab(代理系统实验室) National University of Singapore(新加坡国立大学) Microsoft(微软) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Research(谷歌研究) Stanford University(斯坦福大学) Amazon(亚马逊) Division of Cardiovascular Medicine(心血管医学部) Division of Cardiology(心内科部) Pediatric Cardiology(儿童心内科) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 OpenTSLM通过整合时间序列作为原生模态,提升对多变量医学文本和时间序列数据的推理能力,其模型在多个任务中均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03346 2026-02-17 cs.AI 85%

Making Slow Thinking Faster: Compressing LLM Chain-of-Thought via Step Entropy

让慢思考更快:通过步骤熵压缩LLM的链式思考

Zeju Li, Jianyuan Zhong, Ziyang Zheng, Xiangyu Wen, Zhijian Xu, Yingying Cheng, Fan Zhang, Qiang Xu

机构 * The Chinese University of Hong Kong(中国香港大学) Huawei Technologies Co., Ltd(华为技术有限公司) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 通过步骤熵压缩LLM的链式思考,提升推理效率并保持准确性。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23126 2026-02-10 cs.CL 85%

PBEBench: A Multi-Step Programming by Examples Reasoning Benchmark inspired by Historical Linguistics

PBEBench: 一个受历史语言学启发的多步编程-by-例子推理基准

Atharva Naik, Prakam, Yash Mathur, Darsh Agrawal, Manav Kapadnis, Yuwei An, Clayton Marr, Carolyn Rose, David Mortensen

机构 * Carnegie Mellon University(卡内基梅隆大学) Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL

AI总结 PBEBench是一个受历史语言学启发的多步编程-by-例子推理基准,用于评估LLMs的归纳推理能力,发现模型在复杂任务中的表现存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14305 2026-01-27 cs.CL 85%

MathMist: A Parallel Multilingual Benchmark Dataset for Mathematical Problem Solving and Reasoning

MathMist: 一种用于数学问题解决和推理的平行多语言基准数据集

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Tasnim Mohiuddin, Md Mofijul Islam, Swakkhar Shatabda

机构 * BRAC University(布拉克大学) United International University(国际联合大学) Qatar Computing Research Institute(卡塔尔计算研究所) Center for Computational & Data Sciences, Independent University, Bangladesh(计算与数据科学中心,独立大学,孟加拉国) Amazon GenAI(亚马逊生成人工智能) University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 MathMist是一个用于评估多语言数学推理能力的平行多语言基准数据集,涵盖多种语言和资源设置,测试了不同模型在零样本、链式思维等范式下的表现。

Comments Accepted for publication in Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04339 2026-01-22 cs.AI 85%

Deliberative Reasoning Network: An Uncertainty-Driven Paradigm for Belief-Tracked Inference with Pretrained Language Models

辩证推理网络:一种基于不确定性的信念跟踪推理范式,用于预训练语言模型

Anran Xu, Jincheng Wang, Baigen Cai, Tao Wen

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 DRN通过不确定性最小化范式提升预训练语言模型的逻辑推理能力,实现高准确率和强泛化性能。

Comments This submission represents an early exploratory draft and was uploaded prematurely. The authors have decided to withdraw it because the current version does not accurately reflect the intended scope and technical formulation of the work, and may be misleading if cited

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13243 2026-01-21 cs.LG 85%

A Comprehensive Evaluation of LLM Reasoning: From Single-Model to Multi-Agent Paradigms

大语言模型推理的全面评估:从单模型到多智能体范式

Yapeng Li, Jiakuo Yu, Zhixin Liu, Xinnan Liu, Jing Yu, Songze Li, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本研究全面评估了LLM推理范式,包括单模型和多智能体系统,通过新基准测试揭示了不同范式在成本与准确率之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24816 2026-01-21 cs.CV cs.AI 85%

Perception, Understanding and Reasoning, A Multimodal Benchmark for Video Fake News Detection

感知、理解和推理,一个用于视频虚假新闻检测的多模态基准

Cui Yakun, Peng Qi, Fushuo Huo, Hang Du, Weijie Shi, Juntao Dai, Zhenghao Zhu, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出POVFNDB多模态基准,通过10个任务系统评估MLLMs在视频虚假新闻检测中的感知、理解和推理能力,并通过微调Qwen2.5VL-7B-Instruct达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04714 2026-01-09 cs.AI 85%

ThinkDrive: Chain-of-Thought Guided Progressive Reinforcement Learning Fine-Tuning for Autonomous Driving

ThinkDrive: 基于链式推理的渐进强化学习微调框架用于自动驾驶

Chang Zhao, Zheming Yang, Yunqing Hu, Qi Guo, Zijian Wang, Pengcheng Li, Wen Ji

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 ThinkDrive通过结合显式推理与难度感知的自适应策略优化,提升了自动驾驶中的决策透明度和泛化能力,实验显示其在多个指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20059 2026-01-07 cs.CL 85%

Enhancing Reasoning Skills in Small Persian Medical Language Models Can Outperform Large-Scale Data Training

增强小规模波斯语医疗语言模型的推理能力可超越大规模数据训练

Mehrdad Ghassabi, Sadra Hakim, Hamidreza Baradaran Kashani, Pedram Rostami

机构 * Faculty of Computer Engineering University of Isfahan(计算机工程系 布鲁金斯大学) School of Computer Science University of Windsor(计算机科学学院 温莎大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 通过RLAIF和DPO方法,提升小规模波斯语医疗模型推理能力,使其在有限数据下超越大规模训练模型。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01470 2025-12-29 cs.CL 85%

BARD: budget-aware reasoning distillation

BARD: 带预算意识的推理蒸馏

Lujie Niu, Lei Shen, Yi Jiang, Caixia Yuan, Xiaojie Wang, Wenbo Su, Bo zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 BARD通过两阶段训练实现推理能力蒸馏与预算控制,使模型在不同预算下高效完成推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01700 2025-12-16 cs.AI 85%

DeepVIS: Bridging Natural Language and Data Visualization Through Step-wise Reasoning

DeepVIS: 通过分步推理连接自然语言与数据可视化

Zhihao Shuai, Boyan Li, Siyu Yan, Yuyu Luo, Weikai Yang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 DeepVIS通过整合分步推理提升自然语言到可视化的质量,提供透明的推理过程以增强用户理解与调整能力。

Comments IEEE VIS 2025 full paper

Journal ref IEEE Transactions on Visualization and Computer Graphics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10072 2025-12-09 cs.CL 85%

Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inference

Unilaw-R1:基于强化学习和迭代推理的法律推理大语言模型

Hua Cai, Shuang Zhao, Liang Zhang, Xuli Shen, Qing Xu, Weilin Shen, Zihao Wen, Tianke Ban

机构 * UniDT Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 Unilaw-R1通过强化学习和迭代推理,提升法律推理能力,在多个基准测试中超越同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00974 2025-12-09 cs.CL 85%

RPRO: Ranked Preference Reinforcement Optimization for Enhancing Medical QA and Diagnostic Reasoning

RPRO:基于优先级的强化优化用于增强医学问答与诊断推理

Chia-Hsuan Hsu, Jun-En Ding, Hsin-Ling Hsu, Chih-Ho Hsu, Li-Hung Yao, Chun-Chieh Liao, Feng Liu, Fang-Ming Hung

机构 * Department of Computer Science and Information Engineering, National Taiwan University of Science and Technology(计算机科学与信息工程系,台湾科技大学) Department of Systems Engineering, Stevens Institute of Technology(系统工程系,史蒂文斯理工学院) Department of Management Information Systems, National Chengchi University(管理信息系,National Chengchi University) AI Research Center, Agaruda System(Agaruda系统人工智能研究中心) Department of Computer Science, Stevens Institute of Technology(计算机科学系,史蒂文斯理工学院) Far Eastern Memorial Hospital(东部纪念医院) Smart Healthcare Interdisciplinary College, National Taipei University of Nursing and Health Sciences(智慧医疗跨领域学院,台北大学护理及健康科学学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 RPRO通过结合强化学习与优先级驱动的推理细化,提升医疗问答和诊断推理的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01725 2025-12-02 cs.CL 85%

Beware of Reasoning Overconfidence: Pitfalls in the Reasoning Process for Multi-solution Tasks

警惕推理过度自信:多解任务中推理过程的陷阱

Jiannan Guan, Qiguang Chen, Libo Qin, Dengyun Peng, Jinhao Liu, Liangyu Huo, Jian Xie, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science and Engineering(计算机科学与工程学院) Central South University(中南大学) Du Xiaoman (Beijing) Science Technology Co., Ltd.(杜小蔓(北京)科技有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文指出LLMs在多解任务中存在推理过度自信问题,通过引入MuSoBench基准测试发现Short-CoT方法存在过度自信,而Long-CoT方法通过迭代探索缓解此问题,并提出认知刚性假说解释其成因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03408 2025-12-01 cs.CL 85%

Efficient Reasoning via Thought-Training and Thought-Free Inference

通过思维训练和无思维推理实现高效推理

Canhui Wu, Qiong Cao, Chao Xue, Wei Xi, Xiaodong He

机构 * Xi’an Jiaotong University(西安交通大学) JD Future Academy(京东未来学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 3TF通过训练混合模型实现高效推理,使模型能在无显式推理生成的情况下进行高质量推理。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20471 2025-11-27 cs.AI 85%

Universe of Thoughts: Enabling Creative Reasoning with Large Language Models

思想宇宙:通过大语言模型实现创造性推理

Yuto Suzuki, Farnoush Banaei-Kashani

机构 * Department of Computer Science and Engineering University of Colorado Denver(计算机科学与工程系科罗拉多大学丹佛分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 通过引入思想宇宙框架,UoT提出了三种创造性推理范式,以提升大语言模型在复杂问题中的创造性解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏