arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10364 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10364 篇

2604.21396 2026-08-06 cs.CV cs.AI 95%

VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought

VG-CoT:通过 grounded Chain-of-Thought 实现可信的视觉推理

Byeonggeuk Lim, Kyeonghyun Kim, JungMin Yun, YoungBin Kim

机构 * Graduate School of Advanced Imaging Science, Multimedia & Film, Chung-Ang University(高级影像科学、多媒体与电影研究生院, Chung-Ang 大学) Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学)

专题命中 推理评测 :CoT(title,title_cn);chain-of-thought(title,title_cn);reasoning(title,abstract);分类 cs.AI

AI总结 本文提出 VG-CoT 数据集,通过自动化三阶段流程将推理步骤与图像真实视觉证据联系起来,提升大视觉-语言模型的可信度和推理能力。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13171 2026-06-12 cs.CL cs.AI 新提交 94%

NTS-CoT: Mitigating Hallucinations in LLM-based News Timeline Summarization with Chain-of-Thought Reasoning

NTS-CoT: 基于思维链推理减轻大模型新闻时间线摘要中的幻觉

Feng Lyu, Huiqin Yan, Sijing Duan, Hao Wu, Shuang Gu, Xue Qiao, Weixu Zhang, Haolun Wu

机构 * Central South University(中南大学) Tsinghua University(清华大学) Nanjing University(南京大学) Suzhou Aerospace Information Research Institute(苏州空天信息研究院) McGill University(麦吉尔大学)

专题命中 推理评测 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大模型在新闻时间线摘要中产生内容不忠实和信息遗漏两类幻觉,提出NTS-CoT框架,通过元素思维链、日期选择和因果思维链三个模块有效缓解幻觉,在三个基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10744 2026-05-12 cs.CV cs.RO 93%

C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving

C-CoT:基于视觉-语言模型的反事实链式推理用于安全自动驾驶

Kefei Tian, Yuansheng Lian, Kai Yang, Xiangdong Chen, Shen Li

机构 * College of Transportation, Tongji University(同济大学交通运输学院) Department of Civil Engineering, Tsinghua University(清华大学土木工程系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Department of Civil and Environmental Engineering, National University of Singapore(新加坡国立大学土木与环境工程系)

专题命中 推理评测 :CoT(title,title_cn);chain-of-thought(title,abstract);reasoning(abstract);planning(abstract)

AI总结 本文提出C-CoT框架,利用视觉-语言模型将驾驶决策分解为五个阶段,通过反事实推理提升自动驾驶在复杂环境中的安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21856 2026-05-22 cs.LG cs.AI 93%

The Illusion of Reasoning: Exposing Evasive Data Contamination in LLMs via Zero-CoT Truncation

推理的幻觉:通过零CoT截断揭示LLM中的逃避数据污染

Yifan Lan, Yuanpu Cao, Hanyu Wang, Lu Lin, Jinghui Chen

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出零CoT探针(ZCP)方法,通过截断整个推理过程来暴露模型中的潜在捷径映射,以检测LLM中的直接和逃避数据污染,提出了 contamination confidence 指标来量化污染的可能性和严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05747 2026-07-07 cs.AI 版本更新 93%

CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization

CoT-X: 一种跨模型思维链迁移与优化的自适应框架

Ziqian Bi, Yinzhi Wang, Tianyang Wang, Junfeng Hao, Benji Peng, Wenqian Weng, Jiayi Gu, Jacqueline Pang, Xinyuan Song

机构 * Purdue University(普渡大学) Baruch College, City University of New York(纽约市立大学巴鲁克学院) The Ohio State University(俄亥俄州立大学) AI Agent Lab(AI Agent实验室) Appcubic Emory University(埃默里大学)

专题命中 推理评测 :CoT(title,title_cn);chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出自适应推理摘要框架,通过语义分割、预算感知压缩和连贯性重建,在减少token用量的同时保留关键推理步骤,实现跨模型高效CoT迁移,在7501道医学题上准确率提升40%,评估成本降低84%。

Comments TKDD 2025 minor revision version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08879 2026-07-21 cs.CL 版本更新 92%

GRASP: Grounded CoT Reasoning with Dual-Stage Optimization for Multimodal Sarcasm Target Identification

GRASP:基于双阶段优化的 grounded CoT 推理用于多模态讽刺目标识别

Faxian Wan, Xiaocui Yang, Yifan Cao, Shi Feng, Daling Wang, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 推理评测 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL

AI总结 GRASP通过整合视觉定位与显式Co-T推理,解决多模态讽刺目标识别中的细粒度定位问题,提出MSTI-MAX数据集和双阶段联合优化策略,实验表明其在多模态讽刺目标识别中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23253 2026-05-19 cs.AI 92%

AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture

AgroCoT:用于评估农业中视觉语言模型推理能力的推理链基准

Yibin Wen, Qingmei Li, Zi Ye, Jiarui Zhang, Xiaoya Fan, Zurong Mai, Jing Wu, Shuohong Lou, Yuhang Chen, Henglian Huang, Yang Zhang, Defeng Gu, Lingyuan Zhao, Yutong Lu, Haohuan Fu, Jianxi Huang, Juepeng Zheng

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Southwest University(西南大学) HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);logical reasoning(abstract)

AI总结 本文提出AgroCoT基准,通过整合推理链(CoT)方法,评估视觉语言模型在农业复杂场景中的推理和问题解决能力,发现现有模型在推理能力上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09709 2026-06-09 cs.CL 新提交 92%

IS-CoT: Breaking the Long-form Generation Collapse via Interleaved Structural Thinking

IS-CoT: 通过交错结构思维打破长文本生成崩溃

Zechen Sun, Yuyang Sun, Zecheng Tang, Juntao Li, Wenpeng Hu, Wenliang Chen, Zhunchen Luo, Guotong Geng, Min Zhang

机构 * Institute of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Information Research Center of Military Science, PLA Academy of Military Science(军事科学院军事科学信息研究中心)

专题命中 推理评测 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 针对大语言模型在长文本生成中因静态层次规划导致长度崩溃的问题,提出交错结构思维链(IS-CoT)框架,通过动态规划-写作-反思循环实现持续策略调整,训练IS-Writer-8B模型在长文本基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08228 2025-12-10 cs.CV cs.AI 92%

MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models

MM-CoT:一种用于探测多模态模型中视觉链式推理的基准测试

Jusheng Zhang, Kaitong Cai, Xiaoyang Guo, Sidi Liu, Qinhan Lv, Ruiqi Chen, Jing Yang, Yijia Fan, Xiaofei Sun, Jian Wang, Ziliang Chen, Liang Lin, Keze Wang

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) Snap Inc(Snap公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);logical reasoning(abstract)

AI总结 MM-CoT是一种用于评估多模态模型视觉链式推理能力的基准测试,通过验证推理链的视觉一致性和逻辑一致性,揭示生成模型在真实推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01977 2025-12-17 cs.CL cs.AI 92%

TIBSTC-CoT: A Multi-Domain Instruction Dataset for Chain-of-Thought Reasoning in Language Models

TIBSTC-CoT:一种用于语言模型链式推理的多领域指令数据集

Fan Gao, Cheng Huang, Nyima Tashi, Yutong Liu, Xiangxiang Wang, Thupten Tsering, Ban Ma-bao, Renzeg Duojie, Gadeng Luosang, Rinchen Dongrub, Dorje Tashi, Xiao Feng, Hao Wang, Yongbin Yu

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL、cs.AI

AI总结 TIBSTC-CoT通过链式推理提示法构建多领域藏语数据集,开发出具备推理能力的藏语LLM,提升低资源语言处理性能。

Comments We will merge this paper with arXiv:2503.18288

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20701 2025-11-27 cs.AI cs.LG 92%

Cross Domain Evaluation of Multimodal Chain-of-Thought Reasoning of different datasets into the Amazon CoT Framework

跨领域评估不同数据集的多模态链式推理在Amazon CoT框架中的表现

Nitya Tiwari, Parv Maheshwari, Vidisha Agarwal

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了多模态链式推理在不同数据集上的表现,发现视觉整合减少幻觉但不同问题类型对推理有效性影响显著,为多模态推理系统改进提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21786 2026-02-26 cs.CL 92%

D-COT: Disciplined Chain-of-Thought Learning for Efficient Reasoning in Small Language Models

D-COT:为小语言模型高效推理的纪律性推理学习

Shunsuke Ubukata

机构 * Shunsuke Ubukata(独立研究者)

专题命中 推理评测 :CoT(title,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

AI总结 D-CoT通过引入控制标签强制结构化推理,提升小语言模型在推理任务中的性能并减少计算成本。

Comments 9 pages, 3 figures. Code: https://github.com/gitpullpull/DisciplinedChainOfThought | Benchmarks: https://huggingface.co/datasets/gitpullpull/D-CoT-Benchmarks | Dataset: https://huggingface.co/datasets/gitpullpull/D-CoT-datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09502 2026-05-12 cs.CL cs.AI cs.LG 92%

Hidden Error Awareness in Chain-of-Thought Reasoning: The Signal Is Diagnostic, Not Causal

链式推理中的隐藏错误意识:信号是诊断性的,而非因果性的

Aojie Yuan, Zhiyuan Julian Su, Haiyue Zhang, Yi Nian, Yue Zhao

机构 * University of Southern California, Los Angeles, CA, USA(南加州大学,洛杉矶,加利福尼亚州,美国)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);self-correction(abstract)

AI总结 研究揭示链式推理中模型内在检测自身推理错误但外在表现自信的现象,通过隐藏状态线性探针显示其正确性预测能力,但无法通过干预修复错误,表明信号为诊断而非因果。

Comments 10 pages, 5 figures, 10 tables.Mechanistic Interpretability @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14140 2026-04-16 cs.LG cs.AI 92%

LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning

LongCoT:长周期链式推理基准测试

Sumeet Ramesh Motwani, Daniel Nichols, Charles London, Peggy Li, Fabio Pizzati, Acer Blake, Hasan Hammoud, Tavish McDonald, Akshat Naik, Alesia Ivanova, Vignesh Baskaran, Ivan Laptev, Ruben Glatt, Tal Ben-Nun, Philip Torr, Natasha Jaques, Ameya Prabhu, Brian Bartoldson, Bhavya Kailkhura, Christian Schroeder de Witt

机构 * University of Oxford(牛津大学) Lawrence Livermore National Laboratory (LLNL)(劳伦斯利弗莫尔国家实验室) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);planning(abstract)

AI总结 LongCoT通过2500个专家设计的问题评估长周期链式推理能力,揭示前沿模型在长时间推理中的不足。

Comments Long-Horizon Reasoning Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00014 2026-08-04 cs.AI 新提交 92%

CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection

CoT-Core:通过感知思维链的核心集选择加速大语言模型评估

Qihua Pan, Zhenheng Tang, Peijie Dong, Xiang Liu, Huacan Wang, Bo Li, Xiaowen Chu

机构 * Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 CoT-Core是无训练的核心问题选择框架,通过感知大语言模型的思维链推理轨迹聚类问题,可大幅降低LLMs评估成本,且在GSM8K等多数据集上维持高保真度分数估计。

Comments 23 pages, 3 figures, 10 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12748 2026-04-15 cs.CL 92%

Generating Effective CoT Traces for Mitigating Causal Hallucination

生成有效的CoT轨迹以缓解因果幻觉

Yiheng Zhao, Jun Yan

机构 * Concordia University(康科迪亚大学)

专题命中 推理评测 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文研究了生成有效CoT轨迹以缓解小模型因果幻觉的问题,设计了生成管道并提出新的量化指标CHR,实验表明生成的CoT轨迹能有效减少幻觉并提升准确性。

Comments 11 pages, 2 figures. Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13166 2025-10-17 cs.CL 92%

CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning

Kehua Feng, Keyan Ding, Zhihui Zhu, Lei Liang, Qiang Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙大杭州国际科技创新中心) AntGroup(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11818 2025-08-19 cs.SD cs.LG 92%

Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding

Zhifeng Kong, Arushi Goel, Joao Felipe Santos, Sreyan Ghosh, Rafael Valle, Wei Ping, Bryan Catanzaro

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12893 2025-02-28 cs.CL 92%

H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking

Martin Kuo, Jianyi Zhang, Aolin Ding, Qinsi Wang, Louis DiValentin, Yujia Bao, Wei Wei, Hai Li, Yiran Chen

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL

Comments Website: https://maliciouseducator.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08647 2026-06-04 cs.CL cs.AI 91%

Can Reasoning Path still be Effective as Input? Bridging Post-Reasoning to Chain-of-Thought Compression

推理路径作为输入仍然有效吗?将后推理与思维链压缩连接起来

Chengzhengxu Li, Xiaoming Liu, Zhaohan Zhang, Shengchao Liu, Guoxin Ma, Yu Lan, Cong Wang, Chao Shen

机构 * Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院) Queen Mary University of London(伦敦大学玛丽女王学院) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出后推理范式,通过将思维链作为上下文输入来简化推理任务,并设计UCoT框架训练轻量级压缩器生成软令牌形式的上下文思维链,从而在保持推理能力的同时显著压缩输出长度。

Comments ACL 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19610 2026-07-01 cs.CE 91%

V2T-CoT: From Vision to Text Chain-of-Thought for Medical Reasoning and Diagnosis

V2T-CoT:从视觉到文本链式推理用于医学推理与诊断

Yuan Wang, Jiaxiang Liu, Shujian Gao, Bin Feng, Zhihang Tang, Xiaotang Gai, Jian Wu, Zuozhu Liu

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract)

AI总结 本文提出V2T-CoT方法,通过自动化定位生物医学图像中的偏好区域并将其整合到区域级像素注意力中,提升医学诊断的可解释性与准确性。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12455 2025-08-19 cs.CV 91%

X-Ray-CoT: Interpretable Chest X-ray Diagnosis with Vision-Language Models via Chain-of-Thought Reasoning

Chee Ng, Liliang Sun, Shaoqing Tang

机构 * Universiti Teknologi Malaysia(马来西亚技术大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11211 2026-06-11 cs.CL cs.AI cs.LG 新提交 91%

Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models

推理下的校准漂移:思维链预算如何导致大型语言模型过度自信

Prakul Sunil Hiremath, Harshit R. Hiremath

机构 * Department of Computer Science and Engineering, Visvesvaraya Technological University, Belagavi(维斯瓦拉亚科技大学计算机科学与工程系,贝拉加维) Department of Computer Science and Business System, SG Balekundri Institute of Technology, Belagavi(SG巴莱昆德里理工学院计算机科学与商业系统系,贝拉加维)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现,增加思维链推理预算超过任务特定阈值会导致模型对错误答案过度自信,提出校准漂移现象并引入CABStop停止规则。

Comments 31 pages, 4 figures, 3 tables. Introduces Calibration Drift Under Reasoning (CDUR) with theoretical analysis and preliminary experiments; includes CABStop; code and data available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28674 2026-08-03 cs.AI cs.CL cs.LG 新提交 91%

How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories

它认为有多难?分析大型语言模型思维链轨迹中感知步骤的推理能量

Hui Wei, Junda Wu, Sheldon Yu, Sizhe Zhou, Yizhu Jiao, Ming Zhong, Bowen Jin, Tong Yu, Shijia Pan, Jiawei Han, Julian McAuley

机构 * UC Merced(加州大学默塞德分校) UC San Diego(加州大学圣迭戈分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(奥多比研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出SARE框架量化LLM思维链各步骤的推理能量,发现推理能量不均匀、错误轨迹关键节点能量更低,SARE特征性能优于或匹配输出置信度基线,揭示内部几何动态含预测信息。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07035 2026-05-20 cs.CL 91%

Unified Deployment-Aware Evaluation of Open Reasoning Language Models

统一的部署感知开放推理语言模型评估

Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(理海理工学院计算机科学系) Department of Biomedical Engineering, Rensselaer Polytechnic Institute(理海理工学院生物医学工程系)

专题命中 推理评测 :reasoning(title,abstract);CoT(summary_cn,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出了一种统一的开放推理语言模型评估方法,通过四个基准测试(ARC-Challenge、GSM8K、MATH 1-3级和TruthfulQA MC1)对七种配置进行评估,结合零样本、链式思维(CoT)和少量样本CoT提示策略,分析模型在准确率、延迟、内存使用等多目标下的表现,强调部署感知的多目标优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05167 2026-06-15 cs.CL cs.AI 版本更新 91%

C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning

C2-Faith: 为思维链推理中的因果和覆盖忠实性基准测试LLM评判者

Avni Mittal, Rauno Arike

机构 * SPARAI

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出C2-Faith基准,通过因果和覆盖两个维度评估LLM评判者对思维链推理过程忠实性的判断能力,发现模型在错误定位和覆盖评分上存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25954 2026-05-26 cs.LG cs.AI 91%

Step-TP: A Grounded, Step-Level Dataset with Chain-of-Thought Reasoning for LLM-Guided Tensor Program Optimization

Step-TP: 一个基于步骤级、带有思维链推理的 LLM 引导张量程序优化数据集

Mengfan Liu, Da Zheng, Junwei Su, Chuan Wu

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 为解决 LLM 在张量程序优化中缺乏可验证步骤级监督的问题,提出 Step-TP 数据集,通过结构化思维链推理和原子步骤监督实现可靠的多步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20410 2026-05-21 cs.CL cs.AI 91%

Mechanics of Bias and Reasoning: Interpreting the Impact of Chain-of-Thought Prompting on Gender Bias in LLMs

偏见与推理的力学:分析链式推理提示对大语言模型中性别偏见的影响

Edie Pearman, Sophia Osborne, Mira Kandlikar-Bloch, Mina Arzaghi, Florian Carichon, Golnoosh Farnadi

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) HEC Montreal(蒙特利尔HEC)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文研究了链式推理提示对大语言模型中性别偏见的影响,结合基准测试评估与机制可解释性技术,发现链式推理并未有效减少偏见,偏见仍存在于隐藏表示中。

Comments 24 pages, 6 figures, including appendix. Accepted at the ICLR 2026 Workshop on Algorithmic Fairness Across Alignment Procedures and Agentic Systems. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17163 2026-05-27 cs.LG cs.AI cs.CL cs.CV 90%

OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning

OCR-Reasoning基准:揭示MLLMs在复杂文本丰富图像推理中的真实能力

Mingxin Huang, Yongxin Shi, Dezhi Peng, Songxuan Lai, Zecheng Xie, Lianwen Jin

机构 * South China University of Technology(华南理工大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 推理评测 :reasoning(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OCR-Reasoning基准,包含1069个人工标注样本,覆盖6种核心推理能力和18个实际推理任务,通过双标注(最终答案和逐步推理过程)评估多模态大语言模型在文本丰富图像推理中的能力,发现最先进模型准确率均低于50%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16999 2024-11-05 cs.CV 90%

Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning

Hao Shao, Shengju Qian, Han Xiao, Guanglu Song, Zhuofan Zong, Letian Wang, Yu Liu, Hongsheng Li

专题命中 推理评测 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(title)

Comments Project Page: https://hao-shao.com/projects/viscot.html

详情

展开后加载摘要…

URL PDF HTML 收藏