arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 958 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 958 篇

2606.13171 2026-06-12 cs.CL cs.AI 新提交 94%

NTS-CoT: Mitigating Hallucinations in LLM-based News Timeline Summarization with Chain-of-Thought Reasoning

NTS-CoT: 基于思维链推理减轻大模型新闻时间线摘要中的幻觉

Feng Lyu, Huiqin Yan, Sijing Duan, Hao Wu, Shuang Gu, Xue Qiao, Weixu Zhang, Haolun Wu

机构 * Central South University(中南大学) Tsinghua University(清华大学) Nanjing University(南京大学) Suzhou Aerospace Information Research Institute(苏州空天信息研究院) McGill University(麦吉尔大学)

专题命中 推理评测 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大模型在新闻时间线摘要中产生内容不忠实和信息遗漏两类幻觉,提出NTS-CoT框架,通过元素思维链、日期选择和因果思维链三个模块有效缓解幻觉,在三个基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09709 2026-06-09 cs.CL 新提交 92%

IS-CoT: Breaking the Long-form Generation Collapse via Interleaved Structural Thinking

IS-CoT: 通过交错结构思维打破长文本生成崩溃

Zechen Sun, Yuyang Sun, Zecheng Tang, Juntao Li, Wenpeng Hu, Wenliang Chen, Zhunchen Luo, Guotong Geng, Min Zhang

机构 * Institute of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Information Research Center of Military Science, PLA Academy of Military Science(军事科学院军事科学信息研究中心)

专题命中 推理评测 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 针对大语言模型在长文本生成中因静态层次规划导致长度崩溃的问题,提出交错结构思维链(IS-CoT)框架,通过动态规划-写作-反思循环实现持续策略调整,训练IS-Writer-8B模型在长文本基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00014 2026-08-04 cs.AI 新提交 92%

CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection

CoT-Core:通过感知思维链的核心集选择加速大语言模型评估

Qihua Pan, Zhenheng Tang, Peijie Dong, Xiang Liu, Huacan Wang, Bo Li, Xiaowen Chu

机构 * Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 CoT-Core是无训练的核心问题选择框架,通过感知大语言模型的思维链推理轨迹聚类问题,可大幅降低LLMs评估成本,且在GSM8K等多数据集上维持高保真度分数估计。

Comments 23 pages, 3 figures, 10 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11211 2026-06-11 cs.CL cs.AI cs.LG 新提交 91%

Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models

推理下的校准漂移:思维链预算如何导致大型语言模型过度自信

Prakul Sunil Hiremath, Harshit R. Hiremath

机构 * Department of Computer Science and Engineering, Visvesvaraya Technological University, Belagavi(维斯瓦拉亚科技大学计算机科学与工程系,贝拉加维) Department of Computer Science and Business System, SG Balekundri Institute of Technology, Belagavi(SG巴莱昆德里理工学院计算机科学与商业系统系,贝拉加维)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现,增加思维链推理预算超过任务特定阈值会导致模型对错误答案过度自信,提出校准漂移现象并引入CABStop停止规则。

Comments 31 pages, 4 figures, 3 tables. Introduces Calibration Drift Under Reasoning (CDUR) with theoretical analysis and preliminary experiments; includes CABStop; code and data available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28674 2026-08-03 cs.AI cs.CL cs.LG 新提交 91%

How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories

它认为有多难?分析大型语言模型思维链轨迹中感知步骤的推理能量

Hui Wei, Junda Wu, Sheldon Yu, Sizhe Zhou, Yizhu Jiao, Ming Zhong, Bowen Jin, Tong Yu, Shijia Pan, Jiawei Han, Julian McAuley

机构 * UC Merced(加州大学默塞德分校) UC San Diego(加州大学圣迭戈分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(奥多比研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出SARE框架量化LLM思维链各步骤的推理能量,发现推理能量不均匀、错误轨迹关键节点能量更低,SARE特征性能优于或匹配输出置信度基线,揭示内部几何动态含预测信息。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07229 2026-07-09 cs.AI 新提交 90%

Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations

推理一致性扫描:人工智能安全评估中思维链有效性审计的框架

Silvia Santano

机构 * Meridian Labs(子午线实验室) UK AI Safety Institute(英国人工智能安全研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 研究人工智能安全评估中思维链推理的可靠性问题,提出推理一致性扫描方法,将其与可靠性区分并形式化,构建基准、实现扫描器,通过实验表明推理不一致存在且可检测,在模型和任务类型中有系统变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01388 2026-07-03 cs.CL 新提交 90%

RusFinChain: A Russian Benchmark for Verifiable Chain-of-Thought Reasoning in Finance with Fuzzy-Aligned Evaluation

RusFinChain:面向金融领域可验证思维链推理的俄语基准与模糊对齐评估

M. K. Arabov

机构 * Kazan Federal University(喀山联邦大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 提出首个俄语金融可验证思维链推理基准RusFinChain,包含5280个参数化示例和模糊对齐评估指标,揭示模型在步骤对齐与最终答案正确性之间存在显著差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21119 2026-06-23 cs.CV cs.AI 新提交 90%

MammoExpert: Benchmarking Chain-of-Thought Reasoning in Mammography Diagnosis

MammoExpert:乳腺X线诊断中的思维链推理基准测试

Di Dai, Bo Liu, Youcheng Li, Haojun Yu, Zhouhang Bian, Quanlin Wu, Dong Wang, Sichen Meng, Hongye Xuan, Zijie Lan, Shenda Hong, Liwei Wang

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) School of Computer Science and Engineer, Beijing University of Aeronautics and Astronautics(北京航空航天大学计算机科学与工程学院) Center for Data Science, Peking University(北京大学数据科学中心) Yizhun co. ltd(医准有限公司) International School, Beijing University of Post and Telecommunications(北京邮电大学国际学院) School of Public Health, University of Michigan, Ann Arbor(密歇根大学安娜堡分校公共卫生学院) Future Technology College, Xi'an Jiaotong University(西安交通大学未来技术学院) Peking University(北京大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 提出首个包含思维链推理标注的乳腺X线数据集MammoExpert,覆盖2379张图像和67种病理亚型,通过三阶段推理提升病灶分类准确率,在多个数据集上验证了有效性。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08066 2026-07-10 cs.AI cs.LG 新提交 90%

Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring

说服攻击会降低思维链监测的有效性

Jennifer Za, Julija Bainiaksina, Nikita Ostrovsky, Tanush Chopra, Victoria Krakovna

机构 * LASR Labs(LASR实验室) University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :CoT(title,summary_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究 CoT 监测在对抗性说服攻击下的有效性,设计评估框架发现其单独使用不足以抵御攻击,引入事实核查监测框架,不同模型家族配对可有效减少违反政策行动批准,为 CoT 监测抗攻击提供有力缓解措施。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26977 2026-07-30 cs.CL 新提交 90%

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

TREK:面向复杂行程规划的大语言模型智能体旅行推理与评估工具包

Jinhu Qi, Wentao Zhang, Siu Man Ng, Feiyang Xu, Yanyu Chen, Yaoman Li, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Macao Polytechnic University(澳门理工大学)

专题命中 推理评测 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

AI总结 本研究推出TREK旅行基准测试,解决现有行程规划智能体基准的不足,实验显示最强LLM智能体仅在不足五成任务生成可行计划,满足旅行者未明确需求是普遍瓶颈。

Comments Code, data, and evaluator: https://github.com/TonyQJH/TREK-A-Travel-Reasoning-and-Evaluation-Kit-for-LLM-Agents-in-Complex-Trip-Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20935 2026-07-24 cs.CE cs.CL 新提交 90%

Chemical Chain-of-Thought Functions as a Hallucination-Prone Molecular Scratchpad

化学思维链函数作为易产生幻觉的分子草稿本

Jiatong Li, Yuxuan Ren, Weida Wang, Xiaoyong Wei, Yatao Bian

机构 * Blue Whale Lab, National University of Singapore(新加坡国立大学蓝鲸实验室) Hong Kong Polytechnic University(香港理工大学) Fudan University(复旦大学)

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 研究化学推理语言模型中思维链的作用,发现其在多个模型和任务中易产生幻觉且与答案正确性无关,存在共享草稿本功能,如Chem-R依赖SMILES草稿,干扰其草图会影响生成,表明化学CoT是易产生幻觉的分子草稿本,提醒不能仅以CoT判断推理可靠性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06941 2026-06-08 cs.AI 新提交 90%

Quantum-Inspired Trace-Augmented Evidence Selection for Reasoning over Structured Hypothesis Spaces

量子启发的迹增强证据选择用于结构化假设空间推理

Laura Wynter, Nirvik Sahoo, Paul Griffin

机构 * School of Computing and Information Systems(计算与信息系统学院) Singapore Management University(新加坡管理大学)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出EP-HUBO方法,将CoT推理片段选择转化为组合优化问题,通过高阶二元优化聚合证据,在证据密集型法律推理基准上提升少数但正确假设的权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05152 2026-08-07 cs.CL cs.AI 新提交 90%

Mean-Field Dynamics of Chain-of-Thought Reasoning in Large Language Models

大型语言模型中思维链推理的平均场动力学

Hao Ai

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出框架,将LLM推理建模为线索图引导式发现过程,用平均场近似推导线索占比的常微分方程,实验验证所得统计规律可复现且能被该方程拟合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10740 2026-06-16 cs.AI cs.CL cs.LG 新提交 89%

When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models

当思维链更清楚时:多轮推理模型的失败模式

Sai Kartheek Reddy Kasu, Nils Lukas, Samuele Poppi

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CoT-Output 2x2安全矩阵诊断多轮推理模型隐藏的时间动态失败,发现监督悖论和上下文注入失败两种可复现漏洞。

Comments Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08640 2026-08-11 cs.AI 新提交 89%

SkillReason: Reasoning-Enhanced Agent Skill Retrieval for Implicit User Requests

SkillReason:面向隐式用户请求的推理增强型智能体技能检索

Donghong Jiang, Endian Lin, Luoping Cui, Hanqing Liu, Mingjie Liu, Fan Yang, Hong Wang, Zhao Yang, Chuang Zhu

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 针对隐式用户请求的技能检索难题,提出两阶段框架SkillReason,结合推理增强训练,在SkillReason-Bench等三个基准上取得最优性能,缩小任务目标与技能能力的语义差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04735 2026-08-06 cs.AI 新提交 89%

Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings

思维链监控在隐含影响场景中可能不可靠

Agatha Duzan, Asa Cooper Stickland

机构 * EPFL(洛桑联邦理工学院) UK AI Security Institute(英国人工智能安全研究院)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 该研究引入首个基准对比显式与隐含影响场景下思维链监控的可检测性,发现显式场景下检测率为60%-94%,隐含场景下下降41-46个百分点,善意部署选择还会进一步降低检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21821 2026-06-23 cs.LG cs.CL 新提交 88%

Local Causal Attribution of Chain-of-Thought Reasoning

链式思维推理的局部因果归因

Dennis Wei, Yannis Belkhiter, Erik Miehling, Radu Marinescu

机构 * IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.LG

AI总结 提出AttriCoT算法,通过结构因果模型对链式思维推理中的单元进行局部因果归因,仅需O(U)次前向传播即可获得忠实于模型行为的归因结果。

Comments Camera-ready version for the Mechanistic Interpretability Workshop at ICML 2026. 37 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13239 2026-08-14 cs.CV 新提交 88%

Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

社会视听问答的推理:我们处于什么阶段?

Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera, Stéphane Lathuilière

机构 * Inria(法国国家信息与自动化研究所) Univ. Grenoble Alpes(格勒诺布尔大学) CNRS(法国国家科学研究中心) University of Twente(特文特大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn)

AI总结 本文针对社会视听问答研究,发现IntentBench存在高噪声,Vanilla SFT基线性能优于现有推理方法,仅用文本模态即可实现与视频相当的性能,并发布了IntentBench-Prime等资源。

Comments Accepted at HCMIW ECCV workshop. Code available here: https://github.com/koenv759/VanillaSFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25182 2026-07-29 cs.CL cs.AI cs.IR 新提交 88%

TabRank: Chain-of-Thought Distillation for Table Re-Rankers

TabRank:表格重排器的思维链蒸馏

Adarsh Singh, Kushal Raj Bhandari, Jianxi Gao, Soham Dan, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) Scale AI

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对表格检索训练推理重排器的问题,提出TabRank框架,通过构建数据集并探索两种训练紧凑推理模型的变体,经压力测试,该方法在多表格检索数据集上显著提升性能,有效推广到多表格推理。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26952 2026-07-30 cs.CL 新提交 87%

Credit Cards, Confusion, Computation, and Consequences: What Can We Uncover About Language Model Reasoning?

信用卡、困惑、计算与后果:我们能从语言模型推理中发现什么?

Arnav Hiray, Agam Shah, Caleb Lu, Meghaj Tarte, Harsit Mittal, Sudheer Chava

机构 * College of Computing(计算机学院) Scheller College of Business(舍勒商学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 该研究构建了首个基于真实信用卡协议的数值推理金融素养基准CreditCardQA,评估发现程序思维(PoT)提示可提升模型推理性能,错误多源于金融规则误用等,边缘案例易影响财务脆弱群体。

Comments Accepted at CoLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23458 2026-07-28 cs.CL 新提交 87%

Two Regimes of Chain-of-Thought Unfaithfulness: Behavioral Detection Fails Where Models Are Wrong

思维链不忠实的两种模式:模型错误时行为检测失效

Suramya R. Angdembay, Dikshant Aryal, Nick Rahimi

机构 * The University of Southern Mississippi(南密西西比大学)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 研究思维链不忠实检测,发现答案正确性影响检测效果,分正确与错误答案两种模式。仅答案不正确性表现优,跨模式无共享正向对齐方向,指示轨迹难转移,还解决了基准标签语义不匹配问题。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11266 2026-07-14 cs.AI 新提交 87%

Valid $\ne$ Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought

有效≠必要:诊断思维链中的潜在低效率

Daeyeop Lee, Hwanjo Yu

机构 * KT Corporation(KT公司) Pohang University of Science and Technology(浦项科技大学)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 研究思维链提示中存在的有效但低效推理问题,提出基于信息论的CAID度量,应用于PACE策略,能在保持准确率时减少令牌消耗,成功从推理链中去除冗余信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09033 2026-06-09 cs.CV cs.CL 新提交 87%

CRANE: Knowledge Editing for Reasoning MLLMs

CRANE:面向推理多模态大语言模型的知识编辑

Han Huang, Hao Wang, Mengqi Zhang, Shu Wu, Qiang Liu, Liang Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) New Laboratory of Pattern Recognition (NLPR), CASIA(中国科学院自动化研究所模式识别国家重点实验室) Harbin Institute of Technology(哈尔滨工业大学) Shandong University(山东大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 针对推理多模态大语言模型在知识编辑中出现的结构崩溃、认知失调和浅层内化三种失败模式,提出检索增强框架CRANE,无需逐编辑参数修改,通过模态感知双库检索系统和两阶段训练策略实现高成功率。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03745 2026-08-05 cs.AI cs.CL 新提交 87%

Risky Business: Measuring The Faithfulness-Safety Tension

危险的业务:测量忠实度与安全性之间的张力

Dominik Meier, Luca Joshua Francis, Marco Bernhard Kaiser, Terry Ruas, Jan Philip Wahle, Bela Gipp

专题命中 推理评测 :reasoning(abstract,abstract_cn);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对大型推理模型中忠实度与安全性的张力,构建HazMart数据集,提出TRR技术,发现QwQ-32B的反相关内部方向,并通过表征引导提升安全行为9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09666 2026-08-11 cs.AI 新提交 86%

Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models

开放评估智能体:视觉生成模型的高效且可提示的评估

Shulin Tian, Ziqi Huang, Fan Zhang, Hongyuan Zhu, Yu Qiao, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) Agency for Science, Technology and Research (A*STAR)(科学、技术与研究局(A*STAR)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出Evaluation Agent框架及基于其构建的Open-EA,可高效评估视觉生成模型,将评估时间减至传统方法的10%,还通过EA-CoT-10K和EA-3B减少对专有骨干的依赖,验证了其在多基准及跨家族的有效性。

Comments Journal extension of our ACL 2025 paper (arXiv:2412.09645). 12 pages. Code: https://github.com/Vchitect/Evaluation-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15127 2026-06-23 cs.LG 新提交 86%

Beyond Accuracy: Measuring Bias Acknowledgment in Chain-of-Thought Reasoning for Responsible AI Evaluation

超越准确率:在负责任AI评估中衡量思维链推理中的偏见承认

Xian Sun, Wei Gao, Yingshuo Wang, Lingdong Kong, Yanhang Li, Zhichao Fan, Zexin Zhuang, Wenlong Dong, Zhiyuan Zheng, Hrishikesh Paranjape, Abhishek Mandal, Johnny R. Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title);分类 cs.LG

AI总结 针对仅用准确率评估忽略推理链中偏见承认的问题,提出包含易感性(susceptibility)和承认(acknowledgment)两个维度的诊断方法,实验发现不同模型在准确率相近时承认率差异显著。

Comments ICML 2026 Workshop on Trustworthy AI for Good

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04524 2026-08-06 cs.CL cs.LG 新提交 86%

ODRA: Synthesizing Cognitive Behavioral Therapy Sessions with Structured Chain-Of-Thought and Dynamic Patient Resistance

ODRA:结合结构化思维链与动态患者阻抗的认知行为治疗会话合成

Javier Rodriguez-Juan, Hiba Arnaout, Jose Garcia-Rodriguez, David Tomás, Iryna Gurevych

机构 * University of Alicante(阿利坎特大学) Technische Universität Darmstadt(达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究提出ODRA框架,结合结构化思维链与动态患者阻抗建模合成CBT会话,解决现有方法的顺从性问题,其生成的会话及微调数据集可提升下游治疗性能。

Comments 39 pages, 23 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26397 2026-07-30 cs.CL cs.LG q-bio.QM 新提交 86%

Knowledge before Reasoning: EC-Reason-Bench, a Training-Free Diagnostic Benchmark for LLM Enzyme Classification

推理前的知识:EC-Reason-Bench,一种用于大语言模型酶分类的无训练诊断基准

Linyu Li, Zhi Jin, Yichi Zhang, Dongming Jin, Yuanpeng He, Huanyao Zhang, Xuan Zhang, Gadeng Luosang, Nyima Tashi

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究针对通用LLM酶分类中EC编号二至四级准确率近乎为零的问题,提出无训练诊断基准EC-Reason-Bench,分解四个维度评估,发现外部知识优先于推理等关键结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15307 2026-06-16 cs.CL cs.AI 新提交 86%

Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

利用思维链监督的强化学习进行仇恨和宣传模因的可解释检测

Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor, Abul Hasnat, Firoj Alam

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) Qatar University(卡塔尔大学)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出基于强化学习的后训练方法,结合任务特定奖励和组相对策略优化(GRPO),提升思考型多模态大语言模型在仇恨和宣传模因检测中的分类性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01783 2026-08-04 cs.SD cs.HC stat.AP 新提交 86%

Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias

GPT-4o-mini与教师平均评分在音乐分析回答自动评分中的比较验证:单次部署、可重复性及策略特异性偏差

Baicheng Lin, Lingxi Jin, Kyung-Seok Min

机构 * Sejong University(世宗大学) Ewha Womans University(梨花女子大学)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 本研究以教师平均评分为基准,评估GPT-4o-mini对音乐分析回答的自动评分能力,发现Fs+CoT策略与教师评分一致性最强,不同策略评分特征不同,实际应用需针对性校准与人工监督。

Comments Proceedings of the International Meeting of the Psychometric Society: The 91st Annual Meeting, Seoul, Republic of Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏