arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-05 至 2026-08-05 共收录 155 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 43 篇

2608.03401 2026-08-05 cs.LG cs.AI 新提交 81%

Shorter Reasoning, Earlier Answers? An Evaluation of Reasoning Interfaces

更短的推理,更早的答案?对推理接口的评估

Francesca Carlon, Vincent Ginis, Andres Algaba

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究评估大型语言模型的推理接口,测试提示词和训练设置对推理长度、准确率的影响,发现早答指令和低 effort 推理在特定 token 限制下可提升部分数据集准确率,需综合报告多维度评估指标。

Comments 52 pages, 13 figures, 30 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11996 2026-08-05 cs.CL cs.AI 版本更新 81%

Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces

过滤推理得分:在模型最自信的轨迹上评估推理质量

Manas Pathak, Xingyao Chen, Shuozhe Li, Amy Zhang, Liu Leqi

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出过滤推理得分,用于评估模型推理质量,区分相似准确率的模型,并提高对输入提示和生成配置变化的鲁棒性。

Comments Accepted at the Conference on Language Modeling (COLM) 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03038 2026-08-05 cs.CL stat.AP 新提交 79%

Beyond Accuracy: A Multidimensional Evaluation of Statistical Reasoning in Large Language Models

超越准确率:大型语言模型统计推理的多维度评估

Monnie McGee, Mateo Langston Smith, Julian Cabrera

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究结合多维度分析框架评估15款LLMs的统计推理,发现仅用准确率无法全面描述其统计推理能力,且存在厂商专属解释风格差异。

Comments 15 pages, 5 tables, 2 figures, presented at JSM 2026 and submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02615 2026-08-05 cs.CL cs.AI 新提交 76%

OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reasoning

OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准

Ahnaf Munir, Dannong Wang, Michael W. McDonald, Mubarak Shah, Pegah Khosravi, Yu Tian

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 本文提出OncoTriad-QA多模态癌症问答基准及OncoVLM模型,实验显示OncoVLM经微调后在泛癌问答任务上优于现有模型,该基准可用于相关模型的训练与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07850 2026-08-05 physics.comp-ph math-ph math.MP 版本更新 71%

PDE-Agents: An LLM-Orchestrated Multi-Agent Framework for Automated Finite Element Simulations with Knowledge Graph-Augmented Reasoning

PDE-Agents: 一种基于知识图谱增强推理的LLM编排多智能体框架,用于自动化有限元模拟

Sayan Adhikari, Gulshan Noorsumar, Øyvind Jensen

专题命中 推理评测 :reasoning(title)

AI总结 提出PDE-Agents多智能体系统,通过LLM编排实现偏微分方程/有限元模拟全流程自动化,采用GraphRAG知识图谱增强,在50个任务消融实验中KG Smart模式达100%成功率,并验证了二阶空间收敛性。

Comments 19 pages, 9 figures, 10 tables, 1 algorithm. Code and evaluation artifacts: https://github.com/MatPro-IFE/pde-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02975 2026-08-05 cs.CL cs.AI cs.LG 新提交 67%

TQLite: Multi-LLM Jury Guided Distillation for Real-time MQM Translation Quality Evaluation

TQLite:多大语言模型评审团引导的蒸馏用于实时MQM翻译质量评估

Bhavin Jawade, Cameron R. Wolfe

机构 * Netflix(网飞公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出TQLite蒸馏框架,通过多LRM评审团生成合成训练数据,使SLMs的MQM翻译质量评估性能远超普通SLM,成为LLM/LRM评估器的高性价比替代方案。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02613 2026-08-05 cs.CL cs.AI cs.LG cs.MA 新提交 67%

MemArena: An Ego-Centric Benchmark for On-Device Agentic Personal Memory Assistants at Scale

MemArena:面向移动端智能体个人记忆助手的大规模自我中心基准测试

Jiadong Zhang, Xiaosong Ma

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对现有记忆基准测试的不足,构建了MemArena基准,评估了不同记忆后端对移动端个人记忆助手的影响,发现后端选择对内容准确性影响更大,权限感知访问失效,搜索延迟仅在阅读器规模极小时有影响。

Comments 48 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08442 2026-08-05 cs.CR cs.AI cs.LG 版本更新 66%

Injection-Execution Dissociation: A Mechanistic Evaluation of Persistent Memory Attacks and Defenses in Stateful LLM Agents

多层架构中的防御效果:对持久内存攻击状态机LLM代理的机制性评估

Jun Wen Leong

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI、cs.LG

AI总结 本文评估了六种防御措施在九个开源模型上的延迟触发攻击效果,发现输入级和检索级过滤器效果不佳,而内存层工具门控(Memory Sandbox)显著降低攻击成功率,揭示了不同防御类别的失效原因。

Comments v4: Added double dissociation (reasoning-mode ablation), content-layer defense (RATG), loaded-corpus frontier evaluation (21 models, 3 providers, N=40), 7B judge capability bound, reproducibility validity criterion, ethics/disclosure statement. Gemini 3.1 Pro Preview 95% ASR; GPT-5.1 regression (22.5%); tripartite vendor divergence. Code: github.com/junwenleong/stateful-agent-security-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03842 2026-08-05 cs.CL cs.LG 新提交 62%

Sensitivity, Causality, and Repair Dissociate: A Layer-Wise Analysis of Perturbation Robustness and Its Scaling

敏感性、因果性与修复能力的分离:扰动鲁棒性的逐层分析及其缩放规律

Nathan Labiosa, David Buff, Ena Nayak, Erica Donno

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 该研究分析了语言模型的扰动鲁棒性,发现敏感性、因果性、补偿能力三种层映射分离,识别两种传播机制,提出级联中断机制,给出实用指导并指出方法学警示。

Comments 29 pages, 18 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03803 2026-08-05 cs.CL cs.LG 新提交 62%

M-GATE: Multilingual Grammar, Accuracy in Translation, and Efficiency Benchmark for Large Language Models

M-GATE:面向大语言模型的多语言语法、翻译准确性与效率基准

Tomáš Burkert, Angelika Peljak-Łapińska, David Zelený

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出多语言基准M-GATE,评估50余种模型的80余种配置,发现翻译与语法能力分离,低资源语言惩罚随模型迭代缩小,推理对翻译提升显著。

Comments 45 pages (97 incl. appendices), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03794 2026-08-05 cs.DB cs.AI cs.CL 新提交 62%

Evaluating LLMs in Database Scenarios: A Lifecycle Benchmark for Assessing Their Potential in Core Database Tasks

评估数据库场景下的大语言模型:用于评估其在核心数据库任务中潜力的生命周期基准

Shunfan Zheng, Dongsheng Shi, Yue Li, Xin Yi, Linlin Wang, Gerard de Melo

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有LLM数据库评估基准仅聚焦Text-to-SQL任务的缺陷,推出覆盖数据库全生命周期的DBLifeBench基准,还提出Progressive-Text2SQL任务,发现专用Text-to-SQL模型在非编码阶段存在灾难性遗忘,为全栈数据库智能构建奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12787 2026-08-05 cs.AI cs.CL cs.CV cs.MM 版本更新 62%

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

我们真的需要参数超过10亿的多模态情感语言模型吗?

Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 质疑多模态情感识别需参数超10亿模型的假设,提出轻量级MER框架Light-MER,通过知识蒸馏及两种优化策略,在九个基准数据集实验中实现最优性能并显著提高推理效率,凸显小模型潜力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03898 2026-08-05 cs.CL 新提交 57%

ANNOTARES: A Dataset for Extracting Logical Structures from German Statutory Texts

ANNOTARES:用于从德国法定文本中提取逻辑结构的数据集

Ronja Schwarz, Jannik Strötgen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文针对德国法定文本逻辑成分提取难题,构建ANNOTARES数据集并测试多种模型,发现BERT与LLM模型表现更优,将发布数据集以推动自动法律推理研究。

Comments Accepted at KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03892 2026-08-05 cs.AI 新提交 57%

Intertemporal Preference Steering in Qwen3 via Contrastive Activation Addition

通过对比激活加法实现Qwen3的跨期偏好调控

Michal Mráz, Justin Shenk

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本研究针对Qwen3-32B大模型,通过对比线性探针识别时间范围方向,利用对比激活加法调控实现跨期偏好的双向大幅改变,还提升了规划相关能力,为相关AI系统及安全问题提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03817 2026-08-05 cs.CV cs.AI 新提交 57%

UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

UHP检测:大型视觉语言模型(LVLMs)在一致性空间中具有独特的幻觉模式

Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia, Mohamad Amin Yousefi, Asal Mohammadjafari Mamaqani, Behrad Samimi, Mohammad Hossein Rohban

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对LVLMs的幻觉问题,提出UHP检测框架,通过图像与文本扰动模态、陈述与否定逻辑极性构建四组一致性特征,训练分类器,在AMBER和PhD数据集上显著优于现有基线。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03691 2026-08-05 cs.SE cs.AI cs.CV 新提交 57%

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

像素上的模式:测量多模态代码生成中的模式完成偏差

Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对多模态代码生成中存在的模式完成偏差问题,构建了首个视觉模式完成偏差基准,评估发现前沿MLLMs均存在严重偏差,且偏差与视觉显著性密切相关。

Comments 41st IEEE/ACM International Conference on Automated Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03605 2026-08-05 cs.AI 新提交 57%

FraQ: Efficient Coordinate-Space Recompression for Federated Low-Rank Adaptation

FraQ:用于联邦低秩适配的高效坐标空间重压缩方法

Shenghui Li, Thiemo Voigt

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 FraQ是一种联邦低秩适配的高效坐标空间重压缩方法,可在接近未压缩基线准确率的同时减少下行通信,降低服务器端重压缩开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03591 2026-08-05 cs.CR cs.AI 新提交 57%

DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction

DiagChain:用于评估大语言模型智能体基于证据的攻击链重构的诊断基准

Xuyang Liu, Yibin Han, Zhenwei Zhang, Kai Chang, Zhiwei Xu, Tian Qiu, Weixian Deng, Jiabao Gao, Xiaolin Peng, Hai Wan, Xibin Zhao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对LLM智能体攻击链重构基准的不足,提出DiagChain基准与ECRAG方法,经6种LLM评估发现模型在证据整合与排序环节存在瓶颈,为网络安全智能体改进提供了诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03501 2026-08-05 cs.AI 新提交 57%

Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Autonomous Experimental Design

大语言模型(LLM)能否设计高质量实验?一项针对自主实验设计的全面系统基准测试

Zejun Liu, Jian Wu, Ru Peng, Yuliang Ji, Dongyuan Li, Renhe Jiang, Yue Zhang

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本研究构建SCOPE基准评估LLM的自主实验设计能力,发现多数LLM无法直接设计高质量实验,低层配置存在瓶颈,进而提出OptED工作流缓解该瓶颈。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03340 2026-08-05 cs.CL 新提交 57%

Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks

基准测试基准:测试常识基准的预测有效性

Ine Gevers, Walter Daelemans

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究评估了23种模型在多类常识基准、对照任务及下游推理任务上的表现,发现常识基准仅对少数下游任务有一致预测性,修改基准未提升预测能力,其仅提供任务相关的下游常识能力证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03275 2026-08-05 cs.CL 新提交 57%

MoEGen: Mixture-of-Experts for Instance-Adaptive LoRA Generation

MoEGen:用于实例自适应LoRA生成的混合专家模型

Yiming Zeng, Lei Lu, Zexin Li, Zhuochun Li, Shuoqiu Li, Shuyi Liao, Xidong Wu, Zeyu Zhang, Minmei Wang, Yu Zhao, Tingting Yu, Shangqian Gao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MoEGen是一种将MoE-based PEFT从专家选择转向专家条件参数生成的框架,通过将专家表示为可学习向量,解耦专家容量与适配器存储,在8个常识推理基准及医学、法律领域适配中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03119 2026-08-05 cs.AI 新提交 57%

Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR

请勿偷看答案:用于无标签RLVR的结果掩码组相对策略优化

Yongshi Ye, Liang Zhang, Yidong Chen, Xiaodong Shi, Biao Fu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对无标签RLVR中模型易强化答案标记的问题,提出OM-GRPO框架,解耦奖励估计与策略优化,结合对比增强奖励,在多推理基准及测试时训练场景中性能优于现有方法。

Comments 25 pages, 16 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03071 2026-08-05 cs.AI 新提交 57%

Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls

参数优化:面向大语言模型工具调用的难度分级基准与探测引导训练

Guoyao Yu, Xiaoqing Sun, Ziqi Huang, Shaojing Fan, Zhongyi Zhang, Xiaomeng Hu, Xiaobo Xue, Yangyang Shi, Xiong Xiao, Yang Song, Biao Lyu, Rong Wen, Xing Li, Qinming He, Shunming Zhu, Zhenguang Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对大语言模型工具调用参数填写关注度不足的问题,提出含PBT和PGR的探测引导框架,发布ParamBench基准,使5个开放模型在多基准上的参数生成平均精确匹配率从19.7%升至59.6%。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03018 2026-08-05 cs.AI 新提交 57%

UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks

UrbanAgent:面向跨系统城市任务的工具增强型智能体

Jiayu Cao, Xingyuan Zeng, feiyu Li, Zhijing Huang, Xujie Yuan, Rongxiang Chen, Shimin Di, Libin Zheng, Jian Yin

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对城市数字服务碎片化问题,提出工具增强型智能体UrbanAgent,结合大语言模型与多类工具,引入基准Urban-Eval评估,在多模型上任务成功率达71%,领先基线10个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02911 2026-08-05 cs.LG 新提交 57%

Forecasting Revenue with its Customer-Base Drivers: When and Why Coordination Helps

基于客户群驱动因素的收入预测:协同何时及为何有帮助

Kyeongbin Kim, Daniel McCarthy, Dokyun Lee

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Maryland(马里兰大学) Boston University(波士顿大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 该研究针对收入预测无法拆解驱动因素的问题,开发CBMT模型,利用966家公司数据验证其准确性优于多数基准,发现客户群协同变动强时联合预测更有效,同时指出高波动下模型优势缩小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02877 2026-08-05 cs.LG 新提交 57%

GoT-CD: Graph-of-Thoughts Causal Discovery and the Fragility of Post-hoc Path-Specific Fairness Audits

GoT-CD:思维图因果发现与事后路径特定公平性审计的脆弱性

Nitish Nagesh, Elahe Khatibi, Thomas Dean Hughes, Mahdi Bagheri, Pratik Gajane, Amir M. Rahmani

机构 * University of California, Irvine(加利福尼亚大学欧文分校) University of Orléans(奥尔良大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出GoT-CD方法,其生成的DAG在因果发现基准中表现优异,但研究发现事后路径特定公平性审计对因果发现的结构误差较为脆弱,需结合结构发现开展路径特定公平性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02805 2026-08-05 cs.CV cs.AI 新提交 57%

A Unified 2D Framework for DeepLesion Detection, Segmentation and Short Report Generation

用于DeepLesion检测、分割及简短报告生成的统一二维框架

Ruida Cheng, Tejas S. Mathai, Benjamin Hou, Qingqing Zhu, Zhiyong Lu, Matthew McAuliffe, Ronald M. Summers

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究开发了一个整合LLM推理、病变检测、分割及报告生成的统一二维框架,在DeepLesion数据集上取得了各项指标提升,解决了其分割难题并开源了相关资源。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02683 2026-08-05 cs.CR cs.AI 新提交 57%

$S^3$: Improving Agent Safety through Multi-Stage Defense

$S^3$:通过多阶段防御提升智能体安全性

Zibo Xiao, Haoyu Wang, Jun Sun

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体工作流的跨阶段安全风险问题,提出多阶段防御框架$S^3$,引入阶段特定安全技能,构建MSRB基准,实验显示其安全有效性和效用保留均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02643 2026-08-05 cs.SE cs.AI 新提交 57%

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

CUADebug:计算机使用智能体故障的诊断与修复

Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。

Comments 23 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02639 2026-08-05 cs.SE cs.AI 新提交 57%

Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt Compilation

指令堆叠崩溃:基准测试集与提示词编译的能力依赖价值

Atul Anand, Sourav Chattaraj

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 本研究构建了含24个指令的基准测试集,发现指令遵循率随堆叠指令数增加非线性下降,提出无需训练的指令编译器可提升较弱生产级LLM的指令遵循率,且该收益与模型能力相关。

Comments 13 pages, 11 figures. Benchmark, deterministic verifiers, and cached model responses released for full reproduction

详情

展开后加载摘要…

URL PDF HTML 收藏