arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2602.20094 2026-06-29 cs.AI 版本更新 81%

CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching

CausalFlip: 超越语义匹配的LLM因果判断基准

Yuzhe Wang, Yaochen Zhu, Jundong Li

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出CausalFlip基准,通过构建语义相似但因果答案相反的问题对和噪声前缀评估,揭示LLM依赖语义匹配而非因果推理,并验证内化因果推理方法可提升因果基础。

Comments 8 pages plus references, 3 figures, 3 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24759 2026-06-24 cs.CV cs.AI 新提交 81%

UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving

UniDrive: 面向自动驾驶可解释风险理解的统一视觉-语言与定位框架

Xiaowei Gao, Pengxiang Li, Yitai Cheng, Ruihan Xu, James Haworth, Stephen Law, Yun Ye

机构 * organization= Department of Earth Science \& Engineering, Imperial College London , city= London , postcode= SW7 2AZ , country= United Kingdom organization= SpaceTimeLab, Department of Civil, Environmental Geomatic Engineering, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom organization= Department of Computing, The Hong Kong Polytechnic University , city= Hong Kong , country= China organization= Trinity College, University of Oxford , city= Oxford , postcode= OX1 3BH , country= United Kingdom organization= Department of Geography, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom organization= Centre for Global Infrastructure Resilience, The Bartlett School of Sustainable Construction, University College London , city= London , postcode= WC1E 7HB , country= United Kingdom

专题命中 推理评测 :reasoning(summary_cn,abstract);分类 cs.AI

AI总结 提出UniDrive框架,通过融合时序推理与高分辨率感知分支,联合生成风险描述和边界框定位,在DRAMA-Reasoning基准上超越现有方法,提升小目标定位和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22363 2026-06-18 cs.LG eess.AS 版本更新 81%

Investigating Faithfulness in Large Audio Language Models

大型音频语言模型中的忠实性研究

Pooneh Mousavi, Lovenya Jain, Mirco Ravanelli, Cem Subakan

机构 * Concordia University(康科迪亚大学) Mila - Quebec AI Institute(魁北克人工智能研究院) Université Laval(拉瓦尔大学) Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,皮兰尼)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 提出系统框架评估大型音频语言模型在推理链忠实性上的表现,定义三个音频忠实性标准,并通过基准测试发现模型推理与音频输入存在脱节。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17281 2026-06-17 cs.CL cs.SD eess.AS 新提交 81%

Are you speaking my languages? On spoken language adherence in multimodal LLMs

你在说我的语言吗?多模态大语言模型中的口语遵循问题

Hyungwon Kim, Kandarp Joshi, Lillian Zhou, Pavel Golik, Petar Aleksic

机构 * Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对多模态大语言模型在自动语音识别中输出语言识别错误的问题,提出软提示方法、监督微调和思维链推理三种缓解策略,并引入新指标量化语言违背,比较各方法在减少违规和保持ASR性能上的效果。

Comments 7 pages, 3 tables in the main body

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05844 2026-06-05 cs.CR cs.AI 81%

GenTI: Benchmarking LLMs for Autonomous IDPS Rule Generation for Unseen Attacks

GenTI: 针对未知攻击的自主IDPS规则生成的LLM基准测试

Hassan Jalil Hadi, Rehana Yasmin, Ali Shoker

机构 * Cyber Security and Resilience Technology (CyberSaR), King Abdullah University of Science and Technology (KAUST)(网络安全与韧性技术(CyberSaR),国王阿卜杜勒·阿齐兹大学科学与技术学院(KAUST))

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出GenTI框架,通过构建包含15万条检测与防御规则的数据集GTI,并设计基于LLM的流水线(含结构化提示工程、思维链推理和验证循环),实现针对未知攻击的IDPS规则自动生成,将未知攻击检测率从45%提升至87.4%,误报率从8.5%降至2.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03116 2026-06-03 eess.AS cs.AI cs.SD 81%

AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

AnyAudio-Judge:基于动态评分标准的音频指令跟随基准与评估器

Haitao Li, Tian Tan, Yuguang Yang, Shan Yang, Xie Chen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文脉)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 针对指令引导音频生成中复杂指令解耦困难、评估缺乏可解释性和细粒度属性匹配的问题,提出基于动态评分标准的评估范式,通过自适应分解音频描述为可验证的二元评分项,并构建包含7920个样本的双语基准和105K训练语料,结合SFT与GRPO训练专用评估器,在零样本对齐检测和下游强化学习指令对齐中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27916 2026-05-28 cs.CV cs.CL 81%

OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models

OphIn-500K:策划网络规模的视觉指令以扩展眼科多模态大语言模型

Xuanzhao Dong, Wenhui Zhu, Xiwen Chen, Hao Wang, Xin Li, Yujian Xiong, Jiajun Cheng, Jingjing Wang, Xiaobing Yu, Haiyu Wu, Shao Tang, Zhipeng Wang, Langechuan Liu, Shan Lin, Oana Dumitrascu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Notre Dame(诺特丹大学) Florida State University(佛罗里达州立大学) Rice University(里德大学) NVIDIA(英伟达) Mayo Clinic(梅奥诊所)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出OphIn-Engine流水线从网络视频中构建高质量眼科指令数据,生成包含50万+指令实例的OphIn-500K数据集,并基于此开发眼科专用多模态大语言模型OphIn-VL,在多项任务上超越现有通用医学和专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18288 2026-05-27 cs.CL 81%

TFD: A Comprehensive Structured Tibetan Foundation Dataset for Low-Resource Language Processing and Large-Scale Modeling

TFD:面向低资源语言处理和大规模建模的综合结构化藏语基础数据集

Cheng Huang, Fan Gao, Nyima Tashi, Yutong Liu, Yadi Liu, Wenbin Wei, Xiangxiang Wang, Yongbin Yu

机构 * University of Electronic Science and Technology of China(电子科技大学) Xizang University(西藏大学) ZenWeave AI The State Key Laboratory of Tibetan Intelligence(藏语智能国家重点实验室) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 为解决藏语大语言模型开发中缺乏覆盖预训练、指令微调、安全对齐、偏好优化和推理监督等完整流程的数据集问题,提出首个结构化、大规模、专家精选的藏语基础数据集TFD,包含超过110亿词元的统一语料库及链式推理数据集,通过训练Sun-Shine系列藏语模型在理解、安全、推理和生成基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00250 2026-05-27 cs.CL cs.IT math.IT 81%

PersianMedQA: Evaluating Large Language Models on a Persian-English Bilingual Medical Question Answering Benchmark

PersianMedQA: 在波斯语-英语双语医学问答基准上评估大型语言模型

Mohammad Javad Ranjbar Kalahroodi, Amirhossein Sheikholselami, Sepehr Karimi, Sepideh Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

机构 * School of Electrical and Computer Engineering, University of Tehran(德黑兰大学电气与计算机工程学院) Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医学科学大学) Institute for Research in Fundamental Sciences (IPM)(基础科学研究所(IPM))

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出PersianMedQA数据集,包含20,785道波斯语医学多选题,用于评估41个LLM在零样本和思维链设置下的双语医学推理能力,发现闭源通用模型表现最佳,而波斯语模型性能较差,且翻译会丢失文化临床线索。

Comments Accepted at LREC 2026 (The Fifteenth Language Resources and Evaluation Conference), Palma, Mallorca, Spain, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22109 2026-05-22 cs.AI cs.CV cs.CY 81%

Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?

感知还是偏见:大语言模型能否超越个性的第一印象?

Caixin Kang, Tianyu Yan, Sitong Gong, Mingfang Zhang, Liangyang Ouyang, Ruicong Liu, Bo Zheng, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang

机构 * The University of Tokyo(东京大学) Shanda AI Research Tokyo(Shanda AI 研究所东京) Dalian University of Technology(大连理工大学)

专题命中 推理评测 :reasoning(summary_cn,abstract);分类 cs.AI

AI总结 本文探讨了多模态大语言模型(MLLMs)在感知个性方面的能力,提出了一种新的任务Grounded Personality Reasoning(GPR),并构建了一个新的数据集MM-OCEAN,通过三重评估体系揭示了MLLMs在人格推理中的偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03227 2026-05-08 cs.AI 81%

Evaluating Prompting and Execution-Based Methods for Deterministic Computation in LLMs

评估基于提示和执行的方法在LLM中确定性计算中的表现

Hongkun Yu

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文评估了多种提示策略在需要精确输出的任务中的表现,发现PoT通过生成可执行代码实现完美准确率,而其他方法存在误差积累或计算开销大等问题。

Comments 8 pages, 1 figure. Code and dataset available at https://github.com/bigbird231/llm-exact-computation-dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26511 2026-04-30 cs.CR cs.AI 81%

Tatemae: Detecting Alignment Faking via Tool Selection in LLMs

Tatemae:通过工具选择检测LLMs中的对齐欺骗

Matteo Leonesi, Francesco Belardinelli, Flavio Corradini, Marco Piangerelli

机构 * Department of Computer Science(计算机科学系) University of Camerino(坎皮诺大学) Department of Computing(计算系) Imperial College London(伦敦帝国学院)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文通过可观测的工具选择检测LLMs中的对齐欺骗,分析了在监控和无监控状态下工具选择的变化,并展示了不同领域和压力类型下的漏洞特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10072 2026-04-24 cs.CL 81%

Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty

仅在必要时推理:通过模型内部不确定性实现高效的生成奖励建模

Chao Xue, Yao Wang, Mengqiao Liu, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Chenyao Lu, Lei Jiang, Yu Lu, Haibo Shi, Shuang Liang, Minlong Peng, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Tencent Hunyuan(腾讯文言) Tencent Yuanbao(腾讯元宝) UESTC(电子科技大学) Peking University(北京大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出E-GRM框架,利用模型内部不确定性选择性触发推理,减少计算成本并提升答案准确性。

Comments accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02626 2026-04-20 cs.CL 81%

Understanding New-Knowledge-Induced Factual Hallucinations in LLMs: Analysis and Interpretation

理解大语言模型中新知识诱导的事实幻觉:分析与解释

Renfei Dang, Peng Hu, Zhejian Lai, Changjiang Gao, Min Zhang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Huawei Translation Services Center(华为翻译服务中心)

专题命中 推理评测 :reasoning(summary_cn,abstract);分类 cs.CL

AI总结 研究探讨了新知识微调导致的大语言模型事实幻觉现象,通过设计Biography-Reasoning数据集,分析不同知识类型和任务类型中的幻觉表现,发现知识类型中不熟悉程度是幻觉的主要驱动因素。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14525 2026-04-17 cs.AI 81%

Quantifying Cross-Query Contradictions in Multi-Query LLM Reasoning

量化多查询LLM推理中的跨查询矛盾

Rohit Kumar Salla, Ramya Manasa Amancherla, Manoj Saravanan

机构 * Virginia Tech(弗吉尼亚理工大学) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI;logical reasoning(comments)

AI总结 本文研究多查询推理中的逻辑一致性,提出包含390个实例的基准测试,引入集级指标,通过提取承诺、验证全局可满足性及反例引导修复,减少跨查询矛盾并保持单查询准确性。

Comments Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 9 pages, 6 tables, code and data at https://huggingface.co/datasets/rohitspider/cross_query_benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05891 2025-03-14 cs.CL 81%

MastermindEval: A Simple But Scalable Reasoning Benchmark

Jonas Golde, Patrick Haller, Fabio Barth, Alan Akbik

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL;planning(comments)

Comments 9 pages, 2 figures, 4 tables. In: ICLR 2025 Workshop on Reasoning and Planning for Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05262 2024-10-08 cs.CL 81%

TurtleBench: Evaluating Top Language Models via Real-World Yes/No Puzzles

Qingchen Yu, Shichao Song, Ke Fang, Yunfeng Shi, Zifan Zheng, Hanyu Wang, Simin Niu, Zhiyu Li

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14310 2024-02-23 cs.CL 81%

Hint-before-Solving Prompting: Guiding LLMs to Effectively Utilize Encoded Knowledge

Jinlan Fu, Shenzhen Huangfu, Hang Yan, See-Kiong Ng, Xipeng Qiu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09521 2026-08-18 cs.CL cs.AI 版本更新 81%

PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning

PEER:统一的过程-结果强化学习用于结构化共情推理

Yunxiao Wang, Meng Liu, Sicheng Zhao, Lizi Liao, Liqiang Nie

机构 * Shandong University(山东大学) Shandong Jianzhu University(山东建筑大学) Singapore Management University(新加坡管理大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出PEER,通过结构化共情推理框架提升情感支持对话的 empathy、策略一致性及人性表现,采用GRPO与UnifiReward模型,结合数据增强减少重复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21219 2026-08-18 cs.CL cs.AI 版本更新 81%

Reasoning-Based Personalized Generation for Users with Sparse Data

基于推理的稀疏数据用户个性化生成

Bo Ni, Branislav Kveton, Samyadeep Basu, Subhojyoti Mukherjee, Leyao Wang, Franck Dernoncourt, Sungchul Kim, Seunghyun Yoon, Zichao Wang, Ruiyi Zhang, Puneet Mathur, Jihyung Kil, Jiuxiang Gu, Nedim Lipka, Yu Wang, Ryan A. Rossi, Tyler Derr

机构 * Vanderbilt University(范德比尔特大学) Adobe Research(Adobe研究) Yale University(耶鲁大学) University of Oregon(俄勒冈大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 GraSPer通过预测用户未来交互并生成文本来增强稀疏上下文中的个性化生成,提升用户个性化输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14107 2026-08-18 cs.CL cs.AI 版本更新 81%

DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models

DiagnosisArena:面向大型语言模型的诊断推理基准测试

Yakun Zhu, Zhongzhen Huang, Linjie Mu, Yutong Huang, Wei Nie, Jiaji Liu, Shaoting Zhang, Pengfei Liu, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) SII SPIRAL Lab(SPIRAL实验室) Generative AI Research Lab (GAIR)(生成式AI研究实验室) Shanghai Chest Hospital(上海胸科医院) Beijing Anzhen Hospital, Capital Medical University(北京安贞医院,首都医科大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出DiagnosisArena基准,评估大型语言模型的临床诊断推理能力,发现顶尖模型准确率仅最高51.12%,凸显其泛化瓶颈,旨在推动AI诊断推理进步。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13476 2026-08-14 cs.AI cs.CL 新提交 81%

MARC v1: An Open-Source Multi-Agent Framework for Clinical AI Reasoning and Coordination

MARC v1:一个用于临床AI推理与协作的开源多智能体框架

Saisha Shetty, Satvik Tripathi, Austin Lin, Colin Zhao, Theodore Kim, Don Enwerem, Jacinta Arnold, Shahriar Faghani, Tessa S Cook

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出开源多智能体框架MARC v1,以确定性多智能体编排替代整体式LLM提示用于临床推理,含角色专业化智能体与分解器模块,支持多部署方式,具备模型无关、可解释等特性。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22282 2026-08-14 cs.CV cs.AI cs.CL 版本更新 81%

CityRiSE: Reasoning Urban Socio-Economic Status in Large Vision-Language Models via Reinforcement Learning

CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架

Tianhui Liu, Hetian Pang, Xin Zhang, Jie Feng, Pan Hui, Yong Li

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出CityRiSE框架,结合强化学习与大视觉语言模型,提升城市社会经济感知的预测准确性与泛化能力,尤其在未见城市和指标上表现优异。

Comments Accepted by ACM MM 2026, https://github.com/tsinghua-fib-lab/CityRiSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07801 2026-08-13 cs.CL cs.AI 版本更新 81%

TEMPER: Testing Emotional Perturbation in Quantitative Reasoning

TEMPER:量化推理中的情感扰动测试

Atahan Dokme, Benjamin Reichman, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过构建TEMPER基准,研究情感框架对量化推理准确性的影响,发现情感扰动降低准确率2-10个百分点,但通过中性化可恢复性能,揭示情感风格影响而非内容腐败。

Comments Published as a conference paper at COLM 2026. 30 pages, 4 figures, 29 tables. Dataset: https://huggingface.co/datasets/atahandokme/temper-5400 Code: https://github.com/atahandokme/temper-colm2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16057 2026-08-12 cs.CL cs.AI 版本更新 81%

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning

跨商业学科的前沿人工智能性能:基于案例的知识工作和分析推理基准

Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani

机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) Carnegie Mellon University(卡内基梅隆大学) Harvard Business School, Harvard University(哈佛大学哈佛商学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对人工智能在白领分析性知识工作衡量上的差距,利用顶尖商学院案例教学法构建BusinessCaseBench基准,发现前沿AI模型在此基准上得分高且能力提升快,为商学院及相关职业角色带来启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09888 2026-08-11 cs.NE cs.AI cs.LG stat.ML 新提交 81%

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

BDH-CQ:结合循环潜态推理的上下文学习

Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański, Junlin Jiang, Rohan Phadke, Remigiusz Kinas, Richard Zhong

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出BDH-CQ模型,结合上下文学习与循环潜态推理,在ARC-AGI-1评估集上实现高成本效率,突破了该基准的成本-准确率帕累托前沿。

Comments https://github.com/pathwaycom/arc-task-gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08447 2026-08-11 cs.CL cs.AI 新提交 81%

Hidden Language Consistency Phenomena in Reasoning LLMs

推理大语言模型中的隐藏语言一致性现象

Muhammad Ali Shafique, Kelly Marchisio

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究以PolyMath基准测试集探究推理模型的语言一致性,发现难度提升会导致多语言模型输出语言一致性骤降,量化对一致性的影响独立于准确率,多语言能力需结合准确率、一致性与难度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19625 2026-08-11 cs.CL cs.LG 版本更新 81%

Capability Provenance in Language Models: A Case Study in Social Reasoning

社会推理从何而来?语言模型中的能力来源

Glenn Matlin, Chandreyi Chakraborty, Saehee Eom, Mika Okamoto, Rayan Castilla, Louis Jaburi, Alvin Deng, Taywon Min, Lucia Quirke, Stella Biderman, Mark Riedl

机构 * Georgia Institute of Technology, College of Computing(佐治亚理工学院计算学院) MATS Program(MATS项目) EleutherAI KAIST AI(韩国科学技术院人工智能学院) Georgia Tech AI Safety Initiative(佐治亚理工学院人工智能安全倡议)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 通过训练数据归因方法,发现OLMo3-7B中社会推理和STEM推理依赖于不同的预训练语料区域,且推理层面的差异比知识层面更显著。

Comments 120 pages. Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22087 2026-08-11 cs.AR cs.AI cs.LG cs.SE 版本更新 81%

QuArch: A Benchmark for Evaluating LLM Reasoning in Computer Architecture

QuArch:评估计算机体系结构中大型语言模型推理的基准

Shvetank Prakash, Andrew Cheng, Mark Mazumder, Arya Tschand, Varun Gohil, Jeffrey Ma, Jason Yik, Zishen Wan, Jessica Quaye, Elisavet Lydia Alvanaki, Avinash Kumar, Chandrashis Mazumdar, Tuhin Khare, Alexander Ingare, Ikechukwu Uchendu, Radhika Ghosal, Abhishek Tyagi, Chenyu Wang, Andrea Mattia Garavagno, Sarah Gu, Alice Guo, Grace Hur, Luca P. Carloni, Tushar Krishna, Ankita Nayak, Amir Yazdanbakhsh, Vijay Janapa Reddi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出QuArch基准,用于评估LLM在计算机体系结构中的推理能力。它包含2671个问答对,发现前沿模型在高阶思维技能上有差距。经微调可提升内存层次结构设计任务性能,为构建和衡量LLM能力提供基础,推动计算系统创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05660 2026-08-07 cs.LG cs.CL 新提交 81%

Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMs

推理错误在大语言模型(LLMs)残差流轨迹中具有特定区域与方向

Hamed Damirchi, Ignacio Meza De la Jara, Damith Ranasinghe, Yuhang Liu, Javen Shi

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学) Naval Group Pacific(太平洋海军集团) Responsible AI Research Centre(负责任人工智能研究中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大语言模型推理错误检测的权衡问题,提出三流检测器,在推理基准上提升选择准确率,还适用于事实类任务,验证了运动、区域、方向信号的互补性。

详情

展开后加载摘要…

URL PDF HTML 收藏