arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2605.24960 2026-05-26 cs.CL cs.AI cs.LG 87%

Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization

探究优化下上下文与参数化思维链忠实性之间的相互作用

Jingyi Sun, Qianli Wang, Pepa Atanasova, Nils Feldhus, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学) Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD – 柏林学习与数据基础研究院)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 通过提出统一偏好对齐接口FaithMate,研究上下文与参数化两种思维链忠实性范式在优化下的相互作用,发现两者正相关但不对称,且上下文忠实性指标间存在权衡。

Comments The first two authors contributed equally and share first-authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12201 2026-04-15 cs.IR 87%

AdversarialCoT: Single-Document Retrieval Poisoning for LLM Reasoning

AdversarialCoT:单文档检索污染用于LLM推理

Hongru Song, Yu-An Liu, Ruqing Zhang, Jiafeng Guo, Maarten de Rijke, Yixing Fan, Xueqi Cheng

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 研究针对RAG系统中的知识库污染攻击,提出AdversarialCoT方法,通过单文档污染影响LLM推理,揭示其安全风险并提供改进方案。

Comments 6 pages,accepted by SIGIR 2026 short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20172 2026-03-25 cs.CL cs.AI cs.LG 87%

Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation

衡量忠实性取决于如何测量:分类器敏感性在LLM链式推理评估中的应用

Richard J. Young

机构 * University of Nevada, Las Vegas, Department of Management, Entrepreneurship and Technology, Lee Business School(内华达大学拉斯维加斯分校管理、创业与技术系,Lee商学院) DeepNeuro AI

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过不同分类器对10276个推理轨迹的分析,揭示了模型忠实性评估中分类器选择对结果的影响,指出不同方法导致的忠实性差异显著,需采用多种方法进行评估。

Comments 14 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06749 2026-03-03 cs.CV cs.AI cs.CL cs.LG 87%

Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Vision-R1: 促进多模态大语言模型推理能力的激励方法

Wenxuan Huang, Bohan Jia, Zijie Zhai, Shaosheng Cao, Zheyu Ye, Fei Zhao, Zhe Xu, Xu Tang, Yao Hu, Shaohui Lin

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Vision-R1通过构建高质量多模态CoT数据集和渐进性思维抑制训练策略,提升多模态推理能力,在数学推理基准中取得显著成绩。

Comments Accepted to ICLR 2026. Code is available at https://github.com/Osilly/Vision-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13853 2026-02-13 cs.CV 87%

Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark

世界模拟器能推理吗?Gen-ViRe:一个生成性视觉推理基准

Xinxin Liu, Zhaopan Xu, Ming Li, Kai Wang, Yong Jae Lee, Yuzhang Shang

机构 * University of Central Florida(中央佛罗里达大学) National University of Singapore(新加坡国立大学) UW-Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 Gen-ViRe提出一个生成性视觉推理基准,通过分解CoF推理为六个认知维度和24个子任务,评估视频模型的推理能力,揭示视觉质量与推理深度的差异。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16505 2026-01-06 cs.CV cs.MM 87%

TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning

TraveLLaMA: 一种基于大规模数据集和结构化推理的多模态旅行助手

Meng Chu, Yukang Chen, Haokun Gui, Shaozuo Yu, Yi Wang, Jiaya Jia

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 TraveLLaMA通过结构化推理框架和大规模数据集,提升旅行推荐和场景理解能力,实现用户满意度和系统性能的显著提升。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23594 2025-12-02 cs.CV 87%

PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection

PRISM-Bench: 一个包含推理错误检测的基于谜题的视觉任务基准

Yusu Qian, Cheng Wan, Chao Jia, Yinfei Yang, Qingyu Zhao, Zhe Gan

专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)

AI总结 PRISM-Bench通过检测推理错误评估多模态模型的视觉推理能力,揭示了流畅生成与忠实推理之间的差距。

Comments This paper's first error detection task's ground truth data contains hallucination introduced by gpt and needs to be withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12495 2025-11-13 cs.CL cs.AI cs.LG 87%

Mitigating Hallucinations in Large Language Models via Causal Reasoning

Yuangang Li, Yiqing Shen, Yi Nian, Jiechao Gao, Ziyi Wang, Chenxiao Yu, Shawn Li, Jie Wang, Xiyang Hu, Yue Zhao

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04477 2025-10-07 cs.CV cs.AI cs.CL cs.LG 87%

MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models

Soo Yong Kim, Suin Cho, Vincent-Daniel Yun, Gyeongyeon Hwang

机构 * A.I.MATICS Inc(A.I.MATICS公司) Boston University(波士顿大学) University of Southern California(南加州大学) Heuron(Heuron公司) MODULABS, Open Neural Networks Research Lab(MODULABS,开放神经网络研究实验室)

专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10440 2025-07-22 cs.CV 87%

LLaVA-CoT: Let Vision Language Models Reason Step-by-Step

Guowei Xu, Peng Jin, Ziang Wu, Hao Li, Yibing Song, Lichao Sun, Li Yuan

专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)

Comments 17 pages, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13206 2025-07-11 cs.LG cs.AI cs.CL 87%

Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models

James Chua, Jan Betley, Mia Taylor, Owain Evans

机构 * Truthful AI Center on Long-term Risk(长期风险中心) UC Berkeley(加州大学伯克利分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01943 2024-10-04 cs.LG cs.AI cs.CL cs.DB 87%

CHASE-SQL: Multi-Path Reasoning and Preference Optimized Candidate Selection in Text-to-SQL

Mohammadreza Pourreza, Hailong Li, Ruoxi Sun, Yeounoh Chung, Shayan Talaei, Gaurav Tarlok Kakkar, Yu Gan, Amin Saberi, Fatma Ozcan, Sercan O. Arik

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20945 2026-03-23 cs.CL cs.AI 87%

The Art of Efficient Reasoning: Data, Reward, and Optimization

高效推理的艺术:数据、奖励与优化

Taiqiang Wu, Zenan Xu, Bo Zhou, Ngai Wong

机构 * The University of Hong Kong(香港大学) LLM Department, Tencent(腾讯人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文系统研究了大型语言模型的高效推理机制,通过精细化指标评估发现训练过程分为长度适应与推理优化两阶段,提出保持正奖励密度以避免短即正确陷阱,并验证了在不同领域和难度下的通用性。

Comments Tech Report, Insights on Efficient Reasoning via Reward Shaping

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09666 2026-08-11 cs.AI 新提交 86%

Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models

开放评估智能体:视觉生成模型的高效且可提示的评估

Shulin Tian, Ziqi Huang, Fan Zhang, Hongyuan Zhu, Yu Qiao, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) Agency for Science, Technology and Research (A*STAR)(科学、技术与研究局(A*STAR)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出Evaluation Agent框架及基于其构建的Open-EA,可高效评估视觉生成模型,将评估时间减至传统方法的10%,还通过EA-CoT-10K和EA-3B减少对专有骨干的依赖,验证了其在多基准及跨家族的有效性。

Comments Journal extension of our ACL 2025 paper (arXiv:2412.09645). 12 pages. Code: https://github.com/Vchitect/Evaluation-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15127 2026-06-23 cs.LG 新提交 86%

Beyond Accuracy: Measuring Bias Acknowledgment in Chain-of-Thought Reasoning for Responsible AI Evaluation

超越准确率:在负责任AI评估中衡量思维链推理中的偏见承认

Xian Sun, Wei Gao, Yingshuo Wang, Lingdong Kong, Yanhang Li, Zhichao Fan, Zexin Zhuang, Wenlong Dong, Zhiyuan Zheng, Hrishikesh Paranjape, Abhishek Mandal, Johnny R. Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title);分类 cs.LG

AI总结 针对仅用准确率评估忽略推理链中偏见承认的问题,提出包含易感性(susceptibility)和承认(acknowledgment)两个维度的诊断方法,实验发现不同模型在准确率相近时承认率差异显著。

Comments ICML 2026 Workshop on Trustworthy AI for Good

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06168 2026-04-22 cs.AI 86%

Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models

思维链作为镜像:评估大语言模型与人类偏好之间结构化推理的对齐

Boxuan Wang, Zhuoyun Li, Xinmiao Huang, Xiaowei Huang, Yi Dong

机构 * School of Computer Science and Informatics, University of Liverpool, United Kingdom(利物浦大学计算机科学与信息学学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title);分类 cs.AI

AI总结 本文提出一种量化评估大语言模型多步结构化推理与人类偏好对齐的方法,引入对齐分数指标,通过构建基于语义熵的矩阵比较模型生成的思维链与人类偏好参考,发现对齐分数在2步推理时达到峰值,支持其作为诊断信号。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-04-20 cs.AI 86%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10303 2025-11-14 cs.CL 86%

Rectify Evaluation Preference: Improving LLMs' Critique on Math Reasoning via Perplexity-aware Reinforcement Learning

Changyuan Tian, Zhicong Lu, Shuang Qian, Nayu Liu, Peiguang Li, Li Jin, Leiyi Hu, Zhizhao Zeng, Sirui Wang, Ke Zeng, Zhi Guo

专题命中 推理评测 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23368 2025-09-25 cs.CL 86%

Threading the Needle: Reweaving Chain-of-Thought Reasoning to Explain Human Label Variation

Beiduo Chen, Yang Janet Liu, Anna Korhonen, Barbara Plank

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL

Comments Accepted by EMNLP 2025 Main (Oral), 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04524 2026-08-06 cs.CL cs.LG 新提交 86%

ODRA: Synthesizing Cognitive Behavioral Therapy Sessions with Structured Chain-Of-Thought and Dynamic Patient Resistance

ODRA:结合结构化思维链与动态患者阻抗的认知行为治疗会话合成

Javier Rodriguez-Juan, Hiba Arnaout, Jose Garcia-Rodriguez, David Tomás, Iryna Gurevych

机构 * University of Alicante(阿利坎特大学) Technische Universität Darmstadt(达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究提出ODRA框架,结合结构化思维链与动态患者阻抗建模合成CBT会话,解决现有方法的顺从性问题,其生成的会话及微调数据集可提升下游治疗性能。

Comments 39 pages, 23 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26397 2026-07-30 cs.CL cs.LG q-bio.QM 新提交 86%

Knowledge before Reasoning: EC-Reason-Bench, a Training-Free Diagnostic Benchmark for LLM Enzyme Classification

推理前的知识:EC-Reason-Bench,一种用于大语言模型酶分类的无训练诊断基准

Linyu Li, Zhi Jin, Yichi Zhang, Dongming Jin, Yuanpeng He, Huanyao Zhang, Xuan Zhang, Gadeng Luosang, Nyima Tashi

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究针对通用LLM酶分类中EC编号二至四级准确率近乎为零的问题,提出无训练诊断基准EC-Reason-Bench,分解四个维度评估,发现外部知识优先于推理等关键结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21571 2026-07-29 cs.CL cs.AI cs.CR 版本更新 86%

Towards Understanding the Cognitive Habits of Large Reasoning Models

迈向理解大型推理模型的认知习惯

Jianshuo Dong, Yujia Fu, Chuanrui Hu, Chao Zhang, Han Qiu

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究大型推理模型是否展现类人认知习惯,基于“思维习惯”框架引入CogTest基准测试,对16个语言模型评估发现LRMs有类人习惯且能自适应运用,还揭示了习惯异同模式及与有害回答的关联,为理解模型不当行为提供重要依据。

Comments Published at Machine Intelligence Research vol.23, no.4, pp.873-886

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01858 2026-07-07 cs.CL cs.AI 版本更新 86%

Web-CogReasoner: Towards Multimodal Knowledge-Induced Cognitive Reasoning for Web Agents

Web-CogReasoner:迈向用于网络智能体的多模态知识诱导认知推理

Yuhan Guo, Cong Guo, Aiwen Sun, Hongliang He, Xinyu Yang, Yue Lu, Yingji Zhang, Xuntao Guo, Dong Zhang, Jianzhuang Liu, Jiang Duan, Yijia Xiao, Liangjian Wen, Hai-Ming Xu, Yong Dai

机构 * Southwestern University of Finance and Economics(西南财经大学) Shanghai Jiao Tong University(上海交通大学) Central South University(中南大学) Hithink Research(Hithink研究) Westlake University(西湖大学) Harbin Institute of Technology(哈尔滨工业大学) University of Manchester(曼彻斯特大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Adelaide(阿德莱德大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Chengdu Everimaging Science and Technology Co., Ltd(成都亿联科技有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究将网络智能体能力分解为知识内容学习和认知过程两阶段,提出框架分类知识,构建数据集,基于此用新推理框架开发训练智能体,实验显示其优势,还引入评估套件。

Comments Accepted to ICLR 2026. Our code and data is released at https://github.com/Gnonymous/Web-CogReasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09388 2026-06-23 cs.LG cs.CL 版本更新 86%

Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts

不要告诉答案,真正引导RL Rollout期间的推理

Xinyi Wang, Jinyi Han, Zishang Jiang, Tingyun Li, Jiaqing Liang, Sihang Jiang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学教育人工智能研究所) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 针对强化学习中任务难度超出模型能力导致奖励稀疏的问题,提出HINT框架,通过元提示和亲和力感知策略优化,提升模型推理能力并保持训练稳定性。

Comments Accepted to Findings of ACL 2026. 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15307 2026-06-16 cs.CL cs.AI 新提交 86%

Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

利用思维链监督的强化学习进行仇恨和宣传模因的可解释检测

Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor, Abul Hasnat, Firoj Alam

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) Qatar University(卡塔尔大学)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出基于强化学习的后训练方法,结合任务特定奖励和组相对策略优化(GRPO),提升思考型多模态大语言模型在仇恨和宣传模因检测中的分类性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27901 2026-05-28 cs.CL cs.AI 86%

The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages

跨类型多样语言的思维链监控脆弱性

Eric Onyame, Runtao Zhou, Kowshik Thopalli, Bhavya Kailkhura, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究通过13种语言和7个前沿模型家族的评估,发现思维链监控在语言分布偏移下普遍不可靠(平均不可信率95.9%),模型会进行策略性操纵,且低资源语言中欺骗模式完全存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03471 2026-05-27 cs.CL cs.AI 86%

EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning

EpiQAL:大型语言模型在流行病学问答与推理中的基准测试

Mingyang Wei, Dehai Min, Zewen Liu, Yuzhang Xie, Guanchen Wu, Ziyang Zhang, Carl Yang, Max S. Y. Lau, Qi He, Lu Cheng, Wei Jin

机构 * Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Microsoft(微软公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出EpiQAL基准,通过三个子集(事实回忆、多步推理、不完整信息下结论重建)评估LLM在流行病学推理中的表现,发现当前模型在多步推理上表现有限。

Comments 31 pages, 7 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00319 2026-05-22 cs.LG cs.AI 86%

DecepChain: Inducing Deceptive Reasoning in Large Language Models

DecepChain: 在大型语言模型中诱导欺骗性推理

Wei Shen, Han Wang, Haoyu Li, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究探讨了大型语言模型是否能够生成看似合理但错误的推理链,并提出DecepChain方法通过放大模型自身的幻觉来诱导欺骗性推理,同时保持表面合理性和有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05942 2026-05-21 cs.CL cs.AI 86%

EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models

EvalMORAAL: 可解释的链式推理与大语言模型道德对齐的LLM-as-Judge评估

Hadi Mohammadi, Anastasia Giachanou, Robert A. Bagheri

机构 * Department of Methodology and Statistics, Utrecht University(方法论与统计学系,乌得勒支大学)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出EvalMORAAL框架,通过两种评分方法和模型作为裁判的同行评审,评估20个大语言模型的道德对齐情况,发现西方与非西方地区存在显著的道德对齐差距。

Comments Accepted as a poster at *SEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17794 2026-04-21 cs.CL cs.AI 86%

Bridging the Reasoning Gap in Vietnamese with Small Language Models via Test-Time Scaling

通过测试时间扩展弥合越南语中的推理差距

Bui The Trung, Do Minh Duc, Nguyen Van Vinh, Bui Nguyen Quoc Trinh

机构 * Computer Science and Engineering(计算机科学与工程) Information Science Faculty(信息科学系) Faculty of Information(信息学院) Faculty of Advanced Technologies and Engineering(先进技术和工程学院) VNU Vietnam(越南VNU) Japan University(日本大学) JAIST VNU University of Engineering and Technology(VNU工程大学) VNU Vietnam Japan University(越南日本大学) Hanoi, Vietnam(越南河内) Ishikawa, Japan(日本石川)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在越南小学数学中通过测试时间扩展策略提升小语言模型推理能力,提出Vi-S1K和Vi-Elementary-Bench基准,发现SFT显著提升解释质量,证明简化测试时间扩展优于复杂代理流程。

Comments FJICAI conference

详情

展开后加载摘要…

URL PDF HTML 收藏