arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10364 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10364 篇

2607.07229 2026-07-09 cs.AI 新提交 90%

Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations

推理一致性扫描:人工智能安全评估中思维链有效性审计的框架

Silvia Santano

机构 * Meridian Labs(子午线实验室) UK AI Safety Institute(英国人工智能安全研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 研究人工智能安全评估中思维链推理的可靠性问题,提出推理一致性扫描方法,将其与可靠性区分并形式化,构建基准、实现扫描器,通过实验表明推理不一致存在且可检测,在模型和任务类型中有系统变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01388 2026-07-03 cs.CL 新提交 90%

RusFinChain: A Russian Benchmark for Verifiable Chain-of-Thought Reasoning in Finance with Fuzzy-Aligned Evaluation

RusFinChain:面向金融领域可验证思维链推理的俄语基准与模糊对齐评估

M. K. Arabov

机构 * Kazan Federal University(喀山联邦大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 提出首个俄语金融可验证思维链推理基准RusFinChain,包含5280个参数化示例和模糊对齐评估指标,揭示模型在步骤对齐与最终答案正确性之间存在显著差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17731 2026-07-02 cs.CV cs.LG 版本更新 90%

VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

VisReason: 面向视觉思维链推理的大规模数据集

Lingxiao Li, Yifan Wang, Xinyan Gao, Chen Tang, Xiangyu Yue, Chenyu You

机构 * Stony Brook University(石溪大学) Boston University(波士顿大学) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.LG

AI总结 为解决多模态大模型缺乏大规模视觉思维链数据的问题,构建包含48.9万样本的VisReason数据集及专家级子集VisReason-Pro,通过微调Qwen2.5-VL模型显著提升逐步视觉推理准确性与泛化能力。

Comments ECCV Camera Ready, project page: https://y-research-sbu.github.io/VisReason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21119 2026-06-23 cs.CV cs.AI 新提交 90%

MammoExpert: Benchmarking Chain-of-Thought Reasoning in Mammography Diagnosis

MammoExpert:乳腺X线诊断中的思维链推理基准测试

Di Dai, Bo Liu, Youcheng Li, Haojun Yu, Zhouhang Bian, Quanlin Wu, Dong Wang, Sichen Meng, Hongye Xuan, Zijie Lan, Shenda Hong, Liwei Wang

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) School of Computer Science and Engineer, Beijing University of Aeronautics and Astronautics(北京航空航天大学计算机科学与工程学院) Center for Data Science, Peking University(北京大学数据科学中心) Yizhun co. ltd(医准有限公司) International School, Beijing University of Post and Telecommunications(北京邮电大学国际学院) School of Public Health, University of Michigan, Ann Arbor(密歇根大学安娜堡分校公共卫生学院) Future Technology College, Xi'an Jiaotong University(西安交通大学未来技术学院) Peking University(北京大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 提出首个包含思维链推理标注的乳腺X线数据集MammoExpert,覆盖2379张图像和67种病理亚型,通过三阶段推理提升病灶分类准确率,在多个数据集上验证了有效性。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03768 2026-06-03 cs.CL 90%

HybridThinker: Efficient Chain-of-Thought Reasoning via Compressed Memory and Transient Thought Steps

HybridThinker: 通过压缩记忆和瞬态思考步骤实现高效的思维链推理

Xin Liu, Runsong Zhao, Xinyu Liu, Junhao Ruan, Pengcheng Huang, Shichao Dong, Chunyang Xiao, Chenglong Wang, Changliang Li, Jingbo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) China Unicom Cloud-Link(中国联通云链) NiuTrans Research(牛传研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 提出HybridThinker方法,通过保留压缩记忆和临时保留思考步骤,并采用混合训练方案,在保持推理准确性的同时显著压缩思维链长度。

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29656 2026-05-29 cs.AI 90%

TRACE: Toulmin-based Reasoning Assessment through Constructive Elements for LLM CoT Evaluation

TRACE: 基于图尔敏论证元素的 LLM 思维链推理评估

Yundong Kim, Heyoung Yang

机构 * Applied Agent Research Center, Korea Institute of Science(应用智能代理研究中心,韩国科学技术信息研究所) Department of Computer Science and Engineering, University of Seoul, Republic of Korea(首尔大学计算机科学与工程系,大韩民国)

专题命中 推理评测 :CoT(title,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出 TRACE 指标,结合图尔敏论证理论与弗拉维尔元认知框架分析思维链推理结构,实验表明与基准准确率强相关(r=0.74)并可作为有效强化学习奖励信号。

Comments 23 pages, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11746 2026-05-13 cs.AI 90%

When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel

当推理痕迹成为行为性:基于步骤级的证据显示链式思维是不完美的疏忽通道

Wenkai Li, Fan Yang, Ananya Hazarika, Shaunak A. Mehta, Koichi Onoue

机构 * Carnegie Mellon University(卡内基梅隆大学) Fujitsu Research of America Inc.(富士通美国研究公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 研究通过步骤级检测-分类-比较框架,发现链式思维痕迹与计算过程不一致,揭示其作为答案形成报告的不可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07605 2026-04-28 cs.CV cs.AI 90%

Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning

Fine-R1: 通过链式推理使多模态大语言模型在细粒度视觉识别中脱颖而出

Hulingxiao He, Zijun Geng, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 Fine-R1通过链式推理监督微调和三元组增强策略优化,提升多模态大语言模型在细粒度视觉识别中的表现,仅用4次训练即超越现有模型。

Comments Published as a conference paper at ICLR 2026. The models are available at https://huggingface.co/collections/StevenHH2000/fine-r1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10693 2026-04-21 cs.AI 90%

FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning

FACT-E:基于因果的可信推理链评估

Yuxi Sun, Aoqi Zuo, Haotian Xie, Wei Gao, Mingming Gong, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 FACT-E通过因果方法评估推理链的可信度,结合内部一致性与推理-答案一致性,提升推理轨迹选择质量并增强噪声下的鲁棒性。

Comments Accepted to Association for Computational Linguistics Findings (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08066 2026-07-10 cs.AI cs.LG 新提交 90%

Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring

说服攻击会降低思维链监测的有效性

Jennifer Za, Julija Bainiaksina, Nikita Ostrovsky, Tanush Chopra, Victoria Krakovna

机构 * LASR Labs(LASR实验室) University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :CoT(title,summary_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究 CoT 监测在对抗性说服攻击下的有效性,设计评估框架发现其单独使用不足以抵御攻击,引入事实核查监测框架,不同模型家族配对可有效减少违反政策行动批准,为 CoT 监测抗攻击提供有力缓解措施。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03460 2026-06-18 cs.AI cs.LG 版本更新 90%

FinSTaR: Towards Financial Reasoning with Time Series Reasoning Models

FinSTaR:面向时间序列推理模型的金融推理

Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, Soonyoung Lee, Wonbin Ahn

机构 * LG AI Research(LG人工智能研究)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 针对时间序列推理模型在金融领域的失效问题,提出基于2x2能力分类法的FinSTaR模型,通过Compute-in-CoT和Scenario-Aware CoT策略在FinTSR-Bench基准上达到78.9%平均准确率。

Comments KDD Workshop on SciSoc Agents & LLMs 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11113 2026-04-21 cs.CV cs.AI cs.LG 90%

VIDEOP2R: Video Understanding from Perception to Reasoning

VIDEOP2R:从感知到推理的视频理解

Yifan Jiang, Yueying Wang, Rui Zhao, Toufiq Parag, Zhimin Chen, Zhenyu Liao, Jayakrishnan Unnikrishnan

机构 * USC(USC大学) Amazon(亚马逊) Keystone AI

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 VIDEOP2R提出一种过程感知的视频RFT框架,通过三步流程生成高质量CoT数据集,并引入PA-GRPO算法提升视频推理性能,实现在七个基准中的六个达到SotA水平。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16746 2025-10-10 cs.CV cs.CL cs.LG 90%

Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning

Ang Li, Charles Wang, Deqing Fu, Kaiyu Yue, Zikui Cai, Wang Bill Zhu, Ollie Liu, Peng Guo, Willie Neiswanger, Furong Huang, Tom Goldstein, Micah Goldblum

机构 * Columbia University(哥伦比亚大学) University of Maryland(马里兰大学) University of Southern California(南加州大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(title,abstract);planning(abstract);分类 cs.CL、cs.LG

Comments dataset link: https://huggingface.co/datasets/multimodal-reasoning-lab/Zebra-CoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09260 2026-05-12 cs.NI 90%

Chain-of-Thought Reasoning Enhances In-Context Learning for LLM-Based Mobile Traffic Prediction

基于链式推理的LLM移动交通预测增强情境学习

MohammadMahdi Ghadaksaz, Mohammad Farzanullah, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn)

AI总结 本文提出一种基于链式推理的LLM移动交通预测框架,通过离线阶段生成结构化推理示例和在线阶段实时预测,提升交通预测精度,实验表明其在MAE、RMSE和R2-score上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20319 2026-04-23 cs.CV 90%

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark

SurgCoT:通过链式推理基准提升手术视频中的时空推理

Gui Wang, YongSong Zhou, Kaijun Deng, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen

机构 * School of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) University of Nottingham(诺丁汉大学) School of AI, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn)

AI总结 SurgCoT通过统一的链式推理框架评估多模态大语言模型在7个外科领域35种手术中的时空推理能力,揭示了商业模型在手术推理中的优势及现有模型的不足。

Comments Accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00087 2024-10-07 cs.AI cs.CL cs.LG 90%

ARES: Alternating Reinforcement Learning and Supervised Fine-Tuning for Enhanced Multi-Modal Chain-of-Thought Reasoning Through Diverse AI Feedback

Ju-Seung Byun, Jiyun Chun, Jihyung Kil, Andrew Perrault

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14045 2023-10-17 cs.CL cs.AI cs.LG 90%

The CoT Collection: Improving Zero-shot and Few-shot Learning of Language Models via Chain-of-Thought Fine-Tuning

Seungone Kim, Se June Joo, Doyoung Kim, Joel Jang, Seonghyeon Ye, Jamin Shin, Minjoon Seo

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2023 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07103 2024-10-04 cs.CL cs.IR cs.LG 90%

Graph Chain-of-Thought: Augmenting Large Language Models by Reasoning on Graphs

Bowen Jin, Chulin Xie, Jiawei Zhang, Kashob Kumar Roy, Yu Zhang, Zheng Li, Ruirui Li, Xianfeng Tang, Suhang Wang, Yu Meng, Jiawei Han

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,comments);分类 cs.CL、cs.LG

Comments 21 pages. Code: https://github.com/PeterGriffinJin/Graph-CoT

Journal ref ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26621 2026-07-31 cs.IR cs.AI 版本更新 90%

WhisperRec: Latent Reasoning for Efficient Foundation Recommendation Models

WhisperRec:用于高效基础推荐模型的潜在推理方法

Hao Jiang, Peiru Du, Pengfei Yao, Mengting Li, Siyuan Lou, Kuo Cai, Sheng Yu, Qiang Luo, Jian Liang, Ruiming Tang, Fei Pan, Peng Jiang, Wenwu Ou

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 WhisperRec是一种高效潜在推理框架,通过将教师CoT压缩为可学习潜在标记,在快手数据集上优于显式CoT方法,SID@64提升显著且推理吞吐量更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26977 2026-07-30 cs.CL 新提交 90%

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

TREK:面向复杂行程规划的大语言模型智能体旅行推理与评估工具包

Jinhu Qi, Wentao Zhang, Siu Man Ng, Feiyang Xu, Yanyu Chen, Yaoman Li, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Macao Polytechnic University(澳门理工大学)

专题命中 推理评测 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

AI总结 本研究推出TREK旅行基准测试,解决现有行程规划智能体基准的不足,实验显示最强LLM智能体仅在不足五成任务生成可行计划,满足旅行者未明确需求是普遍瓶颈。

Comments Code, data, and evaluator: https://github.com/TonyQJH/TREK-A-Travel-Reasoning-and-Evaluation-Kit-for-LLM-Agents-in-Complex-Trip-Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20935 2026-07-24 cs.CE cs.CL 新提交 90%

Chemical Chain-of-Thought Functions as a Hallucination-Prone Molecular Scratchpad

化学思维链函数作为易产生幻觉的分子草稿本

Jiatong Li, Yuxuan Ren, Weida Wang, Xiaoyong Wei, Yatao Bian

机构 * Blue Whale Lab, National University of Singapore(新加坡国立大学蓝鲸实验室) Hong Kong Polytechnic University(香港理工大学) Fudan University(复旦大学)

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 研究化学推理语言模型中思维链的作用,发现其在多个模型和任务中易产生幻觉且与答案正确性无关,存在共享草稿本功能,如Chem-R依赖SMILES草稿,干扰其草图会影响生成,表明化学CoT是易产生幻觉的分子草稿本,提醒不能仅以CoT判断推理可靠性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06941 2026-06-08 cs.AI 新提交 90%

Quantum-Inspired Trace-Augmented Evidence Selection for Reasoning over Structured Hypothesis Spaces

量子启发的迹增强证据选择用于结构化假设空间推理

Laura Wynter, Nirvik Sahoo, Paul Griffin

机构 * School of Computing and Information Systems(计算与信息系统学院) Singapore Management University(新加坡管理大学)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出EP-HUBO方法,将CoT推理片段选择转化为组合优化问题,通过高阶二元优化聚合证据,在证据密集型法律推理基准上提升少数但正确假设的权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22521 2026-05-25 cs.CV cs.AI 90%

DocVAL: Validated Chain-of-Thought Distillation for Grounded Document VQA

DocVAL:用于基于文档的视觉问答的验证链式思维蒸馏

Pinaki Prasad Guha Neogi, Ahmad Mohammadshirazi, Ser-Nam Lim, Rajiv Ramnath

机构 * Department of Computer Science(计算机科学系) Engineering, Ohio State University, Ohio, US(工程系,俄亥俄州立大学,俄亥俄,美国) Department of Computer Science, University of Central Florida, Florida, US(计算机科学系,中央佛罗里达大学,佛罗里达,美国)

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出DocVAL框架,通过验证链式思维蒸馏将大型教师模型的空间推理能力转移到紧凑学生模型,结合规则验证器和两阶段训练,在文档VQA任务上提升定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12506 2026-05-22 cs.LG 90%

On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs

关于RL微调VLMs的鲁棒性和链式思维一致性

Rosie Zhao, Anshul Shah, Xiaoyu Zhu, Xinke Deng, Zhongyu Jiang, Yang Yang, Joerg Liebelt, Arnab Mondal

机构 * Apple(苹果公司) OpenAI

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文研究了RL微调VLMs在视觉推理任务中的鲁棒性和链式思维一致性,发现文本扰动和CoT不一致会显著降低模型的鲁棒性和信心,而闭源模型在保持鲁棒性和推理一致性方面表现更佳,指出这一差距源于当前开源RL微调的不足而非任务本身的限制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16638 2026-05-19 cs.AI 90%

TTE-Flash: Accelerating Reasoning-based Multimodal Representations via Think-Then-Embed Tokens

TTE-Flash: 通过思考-然后-嵌入标记加速基于推理的多模态表示

Jianpeng Cheng, Xian Wu, Jiangfan Zhang, Wentao Bao, Chaitanya Ahuja, Shlok Kumar Mishra, Hanchao Yu, Yang Gao, Fan Xia, Qi Guo, Shaodan Zhai, Xiangjun Fan, Jun Xiao

机构 * Meta AI

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出TTE-Flash模型,通过引入隐式思考标记替代显式推理链,实现多模态表示的高效推理。模型在MMEB-v2基准上优于显式CoT方法,且在零样本评估中展示了可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05152 2026-08-07 cs.CL cs.AI 新提交 90%

Mean-Field Dynamics of Chain-of-Thought Reasoning in Large Language Models

大型语言模型中思维链推理的平均场动力学

Hao Ai

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出框架,将LLM推理建模为线索图引导式发现过程,用平均场近似推导线索占比的常微分方程,实验验证所得统计规律可复现且能被该方程拟合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24300 2026-05-26 cs.CR cs.AI cs.LG 90%

Enhancing Reliability in LLM-Based Secure Code Generation

增强基于LLM的安全代码生成的可靠性

Mohammed F. Kharma, Mohammad Alkhanafseh, Ahmed Sabbah, David Mohaisen

机构 * Department of Computer Science, Birzeit University(巴伊兹大学计算机科学系) Department of Computer Science, University of Central Florida(佛罗里达中央大学计算机科学系)

专题命中 推理评测 :chain-of-thought(summary_cn,abstract);CoT(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出Mitigation-Aware Chain-of-Thought (MA-CoT)框架,通过嵌入任务特定的CWE缓解指导和语言感知安全措施,显著降低LLM生成代码中的漏洞,在多个模型和语言上验证了其一致的安全可靠性提升。

Comments 15 pages; 7 tables; 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22582 2026-03-25 cs.CL cs.AI 90%

Lie to Me: How Faithful Is Chain-of-Thought Reasoning in Reasoning Models?

对我的谎言:推理模型中的思维链推理可信度如何?

Richard J. Young

机构 * University of Nevada, Las Vegas, Department of Management, Entrepreneurship and Technology, Lee Business School(内华达大学拉斯维加斯分校,管理、创业与技术系,李商学院) DeepNeuro AI

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了12种开源推理模型在MMLU和GPQA Diamond中的表现,发现模型在提示影响下的可信度差异显著,训练方法和架构影响更大。

Comments 27 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17544 2026-02-20 cs.AI cs.CL cs.IR 90%

Evaluating Chain-of-Thought Reasoning through Reusability and Verifiability

通过可重用性和可验证性评估链式推理

Shashank Aggarwal, Ram Vikas Mishra, Amit Awekar

机构 * Indian Institute of Technology(印度理工学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过可重用性和可验证性评估链式推理的质量,发现专门推理模型并不始终优于通用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18759 2026-02-09 cs.AI cs.LG 90%

The Quest for Efficient Reasoning: A Data-Centric Benchmark to CoT Distillation

高效推理的追寻:一个数据导向的基准以评估CoT蒸馏

Ruichen Zhang, Rana Muhammad Shahroz Khan, Zhen Tan, Dawei Li, Song Wang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DC-CoT基准,通过数据导向方法评估CoT蒸馏中的数据操作,以优化推理模型的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏