arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 548 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 548 篇

2607.11192 2026-07-16 cs.CV 版本更新 79%

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

GDP.pdf:针对专业PDF文档的基础多模态推理基准测试

Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

机构 * Surge AI

专题命中 推理评测 :reasoning(title,abstract)

AI总结 该研究针对专业PDF文档构建多模态推理基准测试GDP.pdf,由专业人员编写问题-文档对,通过严格筛选保留问题,有详细评分标准和能力分类。评估七个前沿模型,发现多数错误源于特定模式,公开了完整基准测试。

Comments 9 pages. v2: results updated to July 2026 leaderboard (17 models). Accepted at the 2nd Workshop on Knowledge-Intensive Multimodal Reasoning (KnowledgeMR) at CVPR 2026 (non-archival), under the former title "PDFParse: A Benchmark for Grounded Multimodal Reasoning over Professional PDF Documents". Dataset: https://huggingface.co/datasets/surgeai/GDP.pdf ; Code: https://github.com/surge-ai/gdp-pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03059 2026-07-28 cs.LG cs.AI 版本更新 79%

Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers

Loong:通过验证器大规模合成长思维链

Xingyue Huang, Rishabh, Gregor Franke, Ziyi Yang, Jiamu Bai, Weijie Bai, Jinhe Bi, Zifeng Ding, Yiqun Duan, Chengyu Fan, Wendong Fan, Xin Gao, Ruohao Guo, Yuan He, Zhuangzhuang He, Xianglong Hu, Neil Johnson, Bowen Li, Fangru Lin, Siyu Lin, Tong Liu, Yunpu Ma, Hao Shen, Hao Sun, Beibei Wang, Fangyijie Wang, Hao Wang, Haoran Wang, Yang Wang, Yifeng Wang, Zhaowei Wang, Ziyang Wang, Yifan Wu, Zikai Xiao, Chengxing Xie, Fan Yang, Junxiao Yang, Qianshuo Ye, Ziyu Ye, Guangtao Zeng, Yuwen Ebony Zhang, Zeyu Zhang, Zihao Zhu, Bernard Ghanem, Philip Torr, Guohao Li

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究针对将LLMs推理能力扩展到其他领域的挑战,提出Loong项目这一开源框架,由LoongBench和LoongEnv组成,通过它们形成强化学习的智能体-环境循环,经实验评估及对合成数据的分析,推动推理密集型领域发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00658 2026-06-23 cs.CL cs.AI 版本更新 79%

Sarc7: Evaluating Sarcasm Detection and Generation with Seven Types and Emotion-Informed Techniques

Sarc7: 基于七种类型和情感感知技术评估讽刺检测与生成

Raina Gao, Alyssa Jeong, Lang Xiong, Yicheng Fu, Sean O'Brien, Vasu Sharma, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出Sarc7基准,将MUStARD数据集标注为七种讽刺类型,并通过零样本、少样本、思维链及新型情感提示技术进行分类评估,同时开发基于情感的生成方法,实验表明情感提示技术优于其他设置。

Comments Accepted to EMNLP WiNLP and COLM Melt, Solar, PragLM, and Origen

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19341 2026-08-11 cs.CV 版本更新 78%

ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

ExpertVerse:知识密集型视觉合成中专家级推理的通用基准

Yuan Wang, Yongchao Du, Mengting Chen, Jinsong Lan, Jiaxuan Luo, Xuetao Feng, Xiaoyong Zhu

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15574 2026-08-06 cs.CV 版本更新 78%

MI-CXR: A Benchmark for Longitudinal Reasoning over Multi-Interval Chest X-rays

MI-CXR:多区间胸部X光片纵向推理基准

Sunghwan Steve Cho, Yunseok Han, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 MI-CXR基准旨在评估多visit胸部X光片的纵向推理能力,通过五选一问题和三个互补任务家族,揭示现有视觉语言模型在时间维度上的局限性。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15097 2026-07-21 cs.SE cs.CR 版本更新 78%

Veritas: Grounding LLM Agents for Reliable Vulnerability Reasoning over Stripped Binaries

Veritas:一种语义导向的代理框架,用于二进制中的内存破坏漏洞检测

Xinran Zheng, Alfredo Pesoli, Marco Valleri, Suman Jana, Lorenzo Cavallaro

专题命中 推理评测 :reasoning(title,abstract)

AI总结 Veritas通过结合静态切片、双视角LLM检测器和多代理验证器,利用语义基础和运行时证据检测二进制中的内存破坏漏洞,实现了90%的召回率,并在实际应用中发现了一个未知的Apple漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18146 2026-07-17 cs.IR 版本更新 78%

Think When Needed: Model-Aware Reasoning Routing for LLM-based Ranking

按需思考:基于大语言模型排序的模型感知推理路由

Huizhong Guo, Tianjun Wei, Dongxia Wang, Yingpeng Du, Ziyan Wang, Jie Zhang, Zhu Sun

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究基于大语言模型排序时推理时机与效果问题,提出推理路由框架,利用生成前信号决定推理与否,能自适应选策略,经实验验证该框架可提高排序效用并减少令牌消耗,解决准确性与效率权衡问题。

Comments Accepted by SIGIR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12818 2026-07-16 cs.CV 版本更新 78%

Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning

打破似曾相识:通过视觉语言推理对视觉场所识别进行独立审计

Sania Waheed, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) School of Electrical Engineering and Computer Science, Queensland University of Technology(昆士兰科技大学电气工程与计算机科学学院) School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究针对视觉场所识别中图像匹配阈值在环境变化下不可靠的问题,引入视觉场所识别审计框架,利用视觉语言模型通过联合推理评估检索匹配,经实验验证该方法有效提升召回率并降低误接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17868 2026-07-16 cs.SE 版本更新 78%

UniCode: Augmenting Evaluation for Code Reasoning

UniCode: 增强代码推理的评估

Xinyue Zheng, Haowei Lin, Shaofei Cai, Yaodong Yang, Zilong Zheng, Yitao Liang

专题命中 推理评测 :reasoning(title,abstract)

AI总结 UniCode通过多维增强和自动化测试生成框架,揭示了大语言模型在代码推理中的性能下降问题,强调模型对捷径的依赖而非真正的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09076 2026-07-15 cs.CV 版本更新 78%

Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

超越标量奖励:将推理内化到分数分布中

Xin Jin, Huanqia Cai, Zhen Li, Zechao Zhan, Dengyang Jiang, Aiming Hao, Yuming Jiang, Xiangpeng Yang, Chunle Guo, Peng Gao, Ming-Ming Cheng, Steven C. H. Hoi

机构 * Alibaba Group(阿里巴巴集团) Nankai University(南开大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出Z-Reward框架,通过教师-学生模型将推理型奖励内化为紧凑VLM的分数分布,实现高效且准确的文本到图像优化。

Comments Z-Image Team Technical Report. Project page: https://srameo.github.io/projects/z-reward/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03075 2026-07-10 cs.RO 版本更新 78%

A Collaborative Reasoning Framework for Anomaly Diagnostics in Underwater Robotics

水下机器人异常诊断的协作推理框架

Markus Buchholz, Niamh Ellis, Rahaf Abu Hara, Ignacio Carlucho, Yvan R. Petillot

机构 * School of Engineering & Physical Sciences, Heriot-Watt University(工程与物理科学学院,赫瑞斯泰大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究水下机器人异常诊断,提出AURA协作框架,集成大语言模型、数字孪生和人在回路交互,通过两个代理进行异常检测与诊断,经人类验证的诊断转化为训练示例完善模型,建立可信赖、不断改进的人机团队模式。

Comments Paper was submitted for ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06445 2026-07-09 cs.CV 版本更新 78%

What if? Emulative Simulation with World Models for Situated Reasoning

如果呢?基于世界模型的仿真模拟用于情境推理

Ruiping Liu, Yufan Chen, Yuheng Zhang, Junwei Zheng, Kunyu Peng, Chengzhi Wu, Chenguang Huang, Di Wen, Jiaming Zhang, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zürich(苏黎世联邦理工学院) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) RAI Institute(RAI研究所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出WanderDream数据集,利用世界模型进行心理探索的仿真模拟,使代理无需主动探索即可回答空间假设问题,实验证明心理探索对情境推理至关重要。

Comments Accepted at ECCV 2026. The data and code are available at: https://github.com/RuipingL/WanderDream

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23216 2026-07-03 cs.CV 版本更新 78%

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering

CaST-Bench:面向视频问答的因果链时空推理基准

Mingfang Zhang, Jingjing Pan, Ashutosh Kumar, Rajat Saini, Mustafa Erdogan, Hsuan-Kung Yang, Caixin Kang, Yifei Huang, Yoichi Sato, Quan Kong

机构 * Woven by Toyota(丰田公司) The University of Tokyo(东京大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出CaST-Bench基准,通过构建包含因果链时空标注的数据集和评估指标,系统评测视觉语言模型在视频因果推理中的细粒度证据定位能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18011 2026-07-02 cs.CV 版本更新 78%

RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

RoadBench: 在城市道路场景下对多模态大语言模型进行细粒度空间理解与推理的基准测试

Jun Zhang, Xin Zhang, Jie Feng, Long Chen, Junhui Wang, Zhicheng Liu, Depeng Jin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心) Zhongguancun Academy(中关村学院) Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 针对城市复杂场景中多模态大语言模型在细粒度空间理解与推理能力上的不足,提出RoadBench基准,包含8个任务、3040个测试用例,通过鸟瞰图和第一人称视角图像评估模型性能,揭示现有模型在此类任务上的显著缺陷。

Comments Accepted by ECCV 2026, the code and data are publicly available at: https://github.com/tsinghua-fib-lab/RoadBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17294 2026-07-01 cs.CL cs.AI cs.LG 版本更新 78%

From Multimodal Perception to Strategic Reasoning: A Survey on AI-Generated Game Commentary

从多模态感知到策略推理:AI生成游戏评论综述

Qirui Zheng, Xingbo Wang, Keyuan Cheng, Yunlong Lu, Muhammad Asif Ali, Lingfeng Li, Yongyi Wang, Wenxin Li

机构 * Peking University(北京大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出统一框架,将AI生成游戏评论分为描述性、分析性和背景性三类,综述方法、数据集和评估指标,并指出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07298 2026-06-23 cs.CV 版本更新 78%

Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding

模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架

Jianghao Yin, Qingbin Li, Kun Sun, Cheng Ding, Jie Wang, Qin Chen, Jie Zhou, Nan Wang, Changqing Li, Pei Wu, Jian Xu, Zheming Yang, Liang He

机构 * East China Normal University(华东师范大学) ByteDance(字节跳动)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05128 2026-06-18 eess.AS cs.SD 版本更新 78%

PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio

PolyBench:多声部音频中组合推理的基准测试

Yuanjian Chen, Yang Xiao, Han Yin, Xubo Liu, Jinjie Huang, Ting Dang

机构 * Harbin University of Science and Technology(哈尔滨理工大学) The University of Melbourne(墨尔本大学) KAIST(韩国成均馆大学) University of Surrey(萨里大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 针对多声部音频中组合推理评估缺失的问题,提出PolyBench基准,包含计数、分类、检测、并发和时长估计五个子集,评估发现现有大音频语言模型在多声部场景下性能持续下降。

Comments Accepted by INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16978 2026-06-17 cs.CV 版本更新 78%

A Benchmark for Omni-Modal Reasoning in Long Videos

长视频全模态推理基准

Mohammed Irfan Kurpath, Jaseel Muhammad Kaithakkodan, Jinxing Zhou, Sahal Shaji Mullappilly, Mohammad Almansoori, Noor Ahsan, Beknur Kalmakhanbet, Sambal Shikhar, Rishabh Lalla, Jean Lahoud, Mariette Awad, Fahad Shahbaz Khan, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) American University of Beirut(贝鲁特美国大学) Linköping University(利尔贝里大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出LongShOTBench基准,用于评估长视频中视觉、语音和环境音频的全模态推理,并引入无训练的全模态证据搜索代理LongShOTAgent,在105个模型上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08856 2026-08-11 cs.SE cs.AI 版本更新 77%

LAUDE: LLM-Assisted Unit Test Generation and Debugging of Hardware DEsigns

LAUDE: 基于LLM的硬件设计单元测试生成与调试

Deeksha Nandal, Riccardo Revalor, Soham Dan, Debjit Pal

机构 * Dept. of Electrical and Computer Engineering, University of Illinois Chicago(伊利诺伊大学芝加哥分校电子与计算机工程系) Microsoft(微软公司)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 LAUDE利用大语言模型能力,实现硬件设计的单元测试生成与调试,有效检测和修复设计中的错误。

Comments 11 Pages, 9 Figures, 9 Tables Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10453 2026-08-11 cs.CL cs.AI 版本更新 76%

Reasoning about Intent for Ambiguous Requests

意图推理以应对歧义请求

Irina Saparina, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 本文提出生成结构化响应以枚举歧义请求的不同解释,通过强化学习训练模型提升覆盖有效解释的召回率和抑制虚假解释的精确率,实验表明方法在覆盖有效答案方面优于基线方法。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29738 2026-08-10 cs.CL cs.AI 版本更新 76%

Multi-Legal-Bench: Evaluating LLMs on Legal Reasoning Across Jurisdictions, Languages, and Legal Traditions

Multi-Legal-Bench: 跨司法管辖区、语言和法律传统的法律推理评估LLM

Volodymyr Ovcharov

机构 * SecondLayer

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 提出Multi-Legal-Bench,首个跨司法管辖区法律基准,在6个国家、4个语系和1.34亿份法院判决上评估LLM,发现少样本效果跨辖区复制、无单一模型主导所有语言、跨语言迁移不遵循语言邻近性、分词器效率不显著预测跨语言准确率。

Comments 17 pages, 5 figures, 9 tables. v2 corrects scorer and taxonomy defects, adds no-model baselines showing label leakage, re-runs the Lithuanian cells on de-leaked text, and withdraws the claim that few-shot helps on judgment-form classification everywhere; all tables and figures regenerated. Dataset: https://huggingface.co/datasets/overthelex/multi-legal-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-08-03 cs.CL cs.AI 版本更新 76%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25600 2026-07-30 cs.IR cs.AI cs.CL 版本更新 76%

Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs

超越自我认知:在语言模型中跨推理与检索传播不确定性

Chandan Kumar Sah, Li Zhang, Xiaoli Lian

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 研究在知识密集型问答中,利用黑盒语言模型的置信度指导检索路由。核心方法是BeyondUncertainty,先得临时答案和置信度,依阈值决定检索策略。该方法提升了平均词元级F1,减少检索段落,在多数设置中优于随机分配,揭示了证据获取与词元效率的权衡。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09995 2026-06-09 cs.CL cs.AI 版本更新 76%

Context Over Compute Human-in-the-Loop Outperforms Iterative Chain-of-Thought Prompting in Interview Answer Quality

上下文胜过计算 人类在环优于迭代思维链提示在面试回答质量上的表现

Kewen Zhu, Zixi Liu, Yanjing Li, Jing Chen

专题命中 推理评测 :chain-of-thought(title);分类 cs.CL、cs.AI

AI总结 本文通过对比人类在环和自动思维链提示方法,发现人类在环在面试回答质量评估中表现更优,且迭代次数更少,同时具有更高的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27733 2026-08-12 cs.SE 版本更新 75%

BashCoder-R1: Towards Robust and Explainable Bash Code Generation with Robustness-Aware Group Relative Policy Optimization

BashCoder-R1: 面向鲁棒且可解释的Bash代码生成——鲁棒感知组相对策略优化

Lei Yu, Peng Wang, Jia Xu, Jingyuan Zhang, Xin Wang, Jiajia Ma, Li Yang, Changzhi Deng, Zenghua Wang, Fengjun Zhang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract_cn)

AI总结 提出BashCoder-R1框架,结合持续预训练、长思维链监督微调和鲁棒感知组相对策略优化,在BashBench基准上实现高语法通过率、低鲁棒警告率和功能完整率,显著超越DeepSeek-V3.2。

Comments Accepted to ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24235 2026-08-07 cs.AI 版本更新 74%

SP-Mind: An Autonomous Reasoning Agent for Spatial Proteomics Analysis

SP-Mind: 用于空间蛋白质组学分析的自主推理智能体

Yucheng Yuan, Yuanfeng Ji, Zhongxiao Li, Ruijiang Li

机构 * Department of Computer Science, Stanford University, Stanford, USA(计算机科学系,斯坦福大学,斯坦福,美国) Department of Radiation Oncology, Stanford University, Stanford, USA(放射肿瘤学系,斯坦福大学,斯坦福,美国)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 提出首个自主AI智能体SP-Mind,统一空间蛋白质组学分析流程,通过自然语言查询实现端到端分析,在SP-Bench基准上达到最优性能。

Comments 24 pages, 6 figures. Accepted to ICML 2026. Equal contribution by Yucheng Yuan and Yuanfeng Ji

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02027 2026-08-06 cs.AI cs.ET 版本更新 74%

Zero-shot reasoning for simulating scholarly peer-review

模拟学术同行评审的零样本推理

Khalid M. Saqr

机构 * College of Engineering and Technology(工程与技术学院) Arab Academy for Science, Technology, and Maritime Transport(阿拉伯科学、技术与海运学院)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本研究构建同行评审模拟基准 xPeer,对比其与人类评审的特征差异,发现 xPeer 报告针对性等更优,人类报告显式推理等更强,成果存档于 Zenodo。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29007 2026-07-21 cs.CL 版本更新 74%

Taxonomy-Targeted Error Generation for Quantitative Reasoning

错误作为透镜:通过合成误解生成探究LLM推理

Xinming Yang, Jun Li

机构 * CUNY Graduate Center(纽约大学研究生中心) CUNY Queens College(纽约市立大学皇后学院)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 提出一个框架,通过生成针对Bloom分类学五类错误的合成误解,以诊断LLM推理能力,并发现目标错误生成比自由形式错误生成更难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07650 2026-08-11 cs.AI cs.CL 版本更新 73%

A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges

大型语言模型有多独立?一种用于审计行为纠缠和重加权验证者集合的统计框架

Chenchen Kuai, Jiwan Jiang, Zihao Zhu, Hao Wang, Keshu Wu, Zihao Li, Yunlong Zhang, Chenxi Liu, Zhengzhong Tu, Zhiwen Fan, Yang Zhou

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种统计框架,用于审计大型语言模型之间的行为纠缠,通过多分辨率层次结构和信息理论度量,分析行为纠缠对验证性能的影响,并通过重加权验证者集合减少相关偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31483 2026-08-07 cs.CL cs.AI 版本更新 73%

BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali

BenHalluEval:孟加拉语大语言模型的多任务幻觉评估框架

Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham, Ajwad Abrar, Ishmam Tashdeed, Md Taukir Azam Chowdhury

机构 * Department of Computer Science and Engineering, Islamic University of Technology(伊斯兰科技大学计算机科学与工程系) Department of Computer Science and Engineering, University of California(加州大学计算机科学与工程系)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 针对孟加拉语大语言模型幻觉评估的空白,提出BenHalluEval框架,涵盖四项任务,构建12000个幻觉候选,并提出双轨校准指标BenHalluScore,揭示模型间幻觉校准的显著差异。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏