arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-19 至 2026-08-19 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 23 篇

2608.17895 2026-08-19 cs.CL cs.AI 新提交 84%

BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models

BEAR-Bench:面向多模态模型的双语企业与学术推理基准

Liubov Chubarova, Alexandra Kuleshova, Daniil Volkov, Kirill Sultanov, Alexey Zaytsev

机构 * Yandex Applied AI Institute(Yandex应用人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文针对多模态大语言模型在文本密集专业文档推理能力评估的不足,推出英俄双语的BEAR-Bench基准,评估16个多模态大语言模型并对比幻觉检测方法,发现最强模型仍有明显性能提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18011 2026-08-19 cs.CL 新提交 79%

The IOL-AI Challenge: An Open Challenge towards Advancing Linguistic Reasoning

IOL-AI挑战赛:一项旨在推进语言推理的开放挑战赛

Eduardo Sánchez, Rita Berrada, Dan-Mircea Mirea, Sara Rajaee, Alexander Piperski, Ana Meta Dolinar, Boris Iomdin, Andrey Nikulin, Mariya Shmatova, Marzieh Fadaee, Julia Kreutzer

机构 * University College London(伦敦大学学院) Meta CentraleSupélec(中央高等电力学院) McGill University(麦吉尔大学) Cohere Labs(Cohere实验室) Princeton University(普林斯顿大学) University of Amsterdam(阿姆斯特丹大学) Stockholm University(斯德哥尔摩大学) Faculty of Liberal Arts and Sciences(文理学院) Universidade Federal de Goiás(戈亚斯联邦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文介绍基于2026年IOL个人赛未公开题目的IOL-AI挑战赛,评估含自动与评审团评分,测试显示模型能力不由规模决定,语言推理是泛化推理技能的强基准代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08093 2026-08-19 cs.AI 版本更新 79%

A Multimodal Agentic Pathology Co-pilot via Evidence Grounded Reasoning

面向证据基础计算病理学的多模态智能体协同助手

Zhe Xu, Zhengyu Zhang, Zhiyuan Cai, Jiahao Xu, Yijie Lin, Ziyi Liu, Junlin Hou, Hongyi Wang, Yuxiang Nie, Yihui Wang, Jiabo Ma, Ling Liang, Yingxue Xu, Zhengrui Guo, Guanghao Wu, Danyi Li, Ziqi Zhou, Donglin Tan, Zhijian Cen, Ying Tan, Xiaolin Liu, Qi Xie, Xiaoying Tang, Xi Peng, Cheng Deng, Lijuan Qu, Ronald Cheong Kin Chan, Li Liang, Hao Chen

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Department of Pathology, Nanfang Hospital, Southern Medical University(南方医科大学南芳医院病理科) Department of Pathology, School of Basic Medical Sciences, Southern Medical University(南方医科大学基础医学学院病理科) Department of Anatomical and Cellular Pathology, Chinese University of Hong Kong(香港中文大学解剖与细胞病理学系) Guangdong Provincial Key Laboratory of Molecular Tumor Pathology(广东省分子肿瘤病理学重点实验室) Jinfeng Laboratory(锦风实验室) Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) Division of Life Science, Hong Kong University of Science and Technology(香港科技大学生命科学系) State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology(香港科技大学神经系统疾病国家重点实验室) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute, The Hong Kong University of Science and Technology(香港科技大学深圳-香港协同创新研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出PathPocket,一种多模态AI协同助手,通过构建包含11万文档的病理证据语料库和455万实体的超图,实现基于证据的病理诊断,在20万真实案例上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17607 2026-08-19 cs.CV 新提交 78%

PathoArgus: Advancing Evidence-Grounded Long-Context Visual Reasoning across Gigapixel Whole-Slide and Multi-Slide Case Contexts

PathoArgus:推进千兆像素全切片与多切片病例语境下基于证据的长上下文视觉推理

Bowen Liu, Qixiang Zhang, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究针对病理视觉推理的证据基础评估缺口,构建PathoArgus-Bench基准与ESG受控集,发现现有模型准确率高但证据基础弱,提出PathoArgus阅读器,呼吁转向证据导向的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12781 2026-08-19 cs.CV 版本更新 67%

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

超越正确性:混合思维多模态大语言模型(MLLM)的响应行为基准测试与对齐

Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Large Language Model Department, Tencent(腾讯大语言模型部) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究针对混合思维 MLLM 的思维与非思维模式响应错位问题,构建 PatternEval 基准并开发 PatternRL 方法,可减轻跨模式错位且任务性能损失极小。

Comments 8 tables and 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18062 2026-08-19 cs.CL cs.LG 新提交 62%

TokEval: A Tokenizer Evaluation Suite

TokEval:一个分词器评估套件

Clara Meister

机构 * EPFL(洛桑联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。

Comments Published as a conference paper at COLM 2026; Library hosted at this https URL (https://github.com/cimeister/tokenizer-intrinsic-evals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17810 2026-08-19 cs.CL cs.AI cs.HC 新提交 62%

Interpretable Humans, Alien LLMs: Expert Analysis of Latent Structures in Assessment Responses

可解释的人类,陌生的大语言模型:对评估响应中潜在结构的专家分析

Alona Strugatski, Licol Zeinfeld, Jason Cooper, Shelley Rap, Gil Schwarts, Giora Alexandron

机构 * Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究结合探索性因子分析与学科专家盲审,发现6个LLMs的评估响应潜在因子与人类认知结构的可解释性存在显著差异,多数LLM因子无法被人类专家解读,揭示其机制与人类推理不同。

Comments Accepted for publication at AIME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17379 2026-08-19 cs.CL cs.AI 新提交 62%

PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTX

PTXBench:用于结合架构特定PTX优化GPU内核的大型语言模型基准测试与适配

Genghan Zhang, Yixin Dong, Chengze Fan, Zhichen Zeng, Yueming Yuan, Shaowei Zhu, Kunle Olukotun

机构 * Carnegie Mellon University(卡内基梅隆大学) RadixArk Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究提出PTXBench基准测试,评估LLM结合架构特定PTX优化GPU内核的能力,发现现有模型能力不均衡,经微调Qwen3.6-27B可改善部分任务但泛化仍不均,该基准为相关研究提供可审计测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17168 2026-08-19 cs.CL cs.AI 新提交 62%

Can LLMs Reason in a Legally Meaningful Manner? A Small-scale Study on European Court of Human Rights Cases

大语言模型能否以具有法律意义的方式进行推理?针对欧洲人权法院案件的小规模研究

Amogh Raina, Ilias Chalkidis, Daniel Hershcovich, Henrik Palmer Olsen

机构 * University of Copenhagen(哥本哈根大学) Faculty of Law, University of Copenhagen(哥本哈根大学法学院) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究以欧洲人权法院案件为测试平台,评估OpenAI GPT 5.4的法律推理表现,发现其推理质量不足、LLM评估不可替代人工,且专家提示未提升预测准确率。

Comments 24 pages, 4 figures, 4 tables, Submitted to AI4LAW Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15382 2026-08-19 cs.AI cs.CL cs.IR q-bio.QM 交叉投稿 62%

Grounding Healthcare LLMs in a Causal Knowledge Graph: Framework, Metrics, and a Cardiovascular Pilot

将医疗大语言模型(LLM)基于因果知识图谱:框架、指标与心血管试点研究

Ummara Mumtaz, Aimen Noor, Awais Ahmed

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出以因果知识图谱为核心的医疗LLM评估框架,在心血管试点中验证其有效性,发现集成条件C4在因果推理相关指标上表现最优,未基于图的C1原始干预准确性最高但缺乏因果与证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02118 2026-08-19 cs.AI cs.CL 版本更新 62%

TSQueryBench: LLM-as-a-Judge for Time Series Explanations

基于时间序列的LLM作为裁判

Preetham Sivalingam, Murari Mandal, Dhruv Kumar, Saurabh Deshpande

机构 * BITS Pilani(比拉理工学院皮拉尼校区) KIIT(KIIT大学) Birla AI Labs(比拉人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在无参考情况下,利用大语言模型作为生成和评估时间序列解释的工具,通过构造合成基准测试,评估模型在生成解释、相对排序、独立评分和多异常检测任务中的表现,发现评估任务比生成任务更稳定。

Comments Accepted at ICML FMSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17534 2026-08-19 cs.CL 新提交 57%

ArborMem: Navigating Interaction States with Memory Forests

ArborMem:用记忆森林导航交互状态

Zongwei Lv, Yuemeng Xu, Yilun Yao, Siyi Ding, Xinyu Tan, Yaoming Li, Guangxiang Zhao, Weihong Lin, Lin Sun, Xiangzheng Zhang, Tong Yang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ArborMem是一种在线记忆框架,将对话表示为可导航的交互状态森林,在LongMemEval等基准上优于最强基线,还引入了分支结构诊断基准BranchMemEval。

Comments 24 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17220 2026-08-19 cs.CR cs.AI 新提交 57%

PACE: Policy-Attested Contract Execution for Safe AI Agents in Decentralized Finance

PACE:用于去中心化金融中安全AI智能体的策略验证合约执行

Rabimba Karanjai, Yang Lu, Richard Williamson, Hemanth Hm, Prakhar Mehrotra, Lei Xu, Weidong (Larry)Shi

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 该研究提出PACE框架,通过引入类型化交易意图等机制,实现去中心化金融中AI智能体的安全交易授权,在确定性沙箱中实现0.00不安全执行率和0.00误报率,提升了DeFi场景下AI智能体的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17162 2026-08-19 cs.LG 新提交 57%

OraclePhys: A Systematic Framework for LLM Fine-Tuning on Structural Mechanics

OraclePhys:面向结构力学的大语言模型微调系统框架

Mingyu Li, Guorui Song, Jing Lin, Haoqian Wang

机构 * University of Houston(休斯顿大学) Tsinghua University(清华大学)

专题命中 推理评测 :verifier(abstract);分类 cs.LG

AI总结 本研究提出OraclePhys,一种面向结构力学的大语言模型微调系统框架,含自动评分基准、多形式监督数据集及对照训练研究,发现标签答案形式而非比特数决定微调效果,训练所得8B模型达空间结构响应任务数据精度前沿。

Comments 18 pages, 8 figures, 9 tables. Under review at ACL Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16890 2026-08-19 cs.AI 新提交 57%

GxP-Agent: Process-DAG Topology for Reliable Clinical Trial Programming with LLM Agents

GxP-Agent:基于流程有向无环图拓扑结构的可靠临床试验编程大模型智能体

Jaime Yan

机构 * Harrisburg University of Science and Technology(哈里斯堡科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出基于流程DAG拓扑的多智能体系统GxP-Agent,在临床试验编程任务上显著优于现有方法,实现了高结构匹配率,验证了编码领域流程知识为图拓扑的有效性。

Comments Preprint. 9 pages main text, 3 figures, plus references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12313 2026-08-19 cs.CV cs.CL 版本更新 57%

AVA-Encoder: Towards Agent-Native Video Representation Learning

AVA-Encoder:面向智能体原生的视频表示学习

Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li, Shuqi Gu, Kan Ren, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Computing Technology(中国科学院计算技术研究所) Southeast University(东南大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23119 2026-08-19 cs.CL 版本更新 57%

Dripper: Token-Efficient Main HTML Extraction with a Lightweight LM

Dripper:一种轻量级的HTML主内容提取框架

Mengjie Liu, Jiahui Peng, Wenchang Ning, Pei Chu, Jiantao Qiu, Ren Ma, He Zhu, Rui Min, Lindong Lu, Linfeng Hou, Kaiwen Liu, Yuan Qu, Zhenxiang Li, Chao Xu, Zhongying Tu, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Dripper通过轻量级框架实现高效HTML主内容提取,兼顾效率与准确性,开源模型促进高质量数据集构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02876 2026-08-19 cs.CL 版本更新 57%

Eval4Sim: An Evaluation Framework for Persona Simulation

Eval4Sim: 一种用于人设模拟的评估框架

Eliseo Bao, Anxo Perez, Javier Parapar, Xi Wang

机构 * University of Sheffield(谢菲尔德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Eval4Sim提出了一种评估框架,用于衡量模拟对话与人类对话模式的契合度,通过三个互补维度评估人设的忠实性、一致性和自然性。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17546 2026-08-19 cs.SE 新提交 50%

REST API Testing with Verified LLM-Inferred Dependencies and Response-Driven Refinement

基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试

Tu Nguyen, Thanh Nguyen, Huy Nguyen, Viet Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。

Comments Submitted to ICSE 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17386 2026-08-19 cs.RO 新提交 50%

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件

Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) William & Mary(威廉玛丽学院)

专题命中 推理评测 :planning(abstract)

AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17328 2026-08-19 cs.CV 新提交 50%

MS-MFAD: Multimodal large language models for Face Anti-spoofing Detection

MS-MFAD:用于人脸活体检测的多模态大语言模型

Xiaoyong Yu, Rongzhen Li, Shuming Shi, Xinge You

机构 * Mashang Consumer Finance Co., Ltd.(马上消费金融股份有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对人脸活体检测的复合威胁与现有方法瓶颈,提出基于多模态大语言模型MFAD的可解释系统,通过细粒度像素-语义锚定机制与少量语义标注实现优异检测性能,鲁棒性与效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17018 2026-08-19 cs.SE 新提交 50%

ORCA: Observability-Grounded Program Repair for Microservice Incidents

ORCA:基于可观测性的微服务故障程序修复

Yuanchen Gao, Yifang Tian, Yiran Li, Charles Zhang, Hans-Arno Jacobsen

专题命中 推理评测 :verifier(abstract)

AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00162 2026-08-19 eess.IV cs.CV cs.HC 版本更新 50%

GazeXPErT: An Expert Eye-tracking Dataset for Interpretable and Explainable AI in Oncologic FDG-PET/CT Scans

GazeXPErT: 一种用于肿瘤FDG-PET/CT扫描可解释和可解释AI的专家眼动数据集

Joy T Wu, Daniel Beckmann, Sarah Miller, Alexander Lee, Elizabeth Theng, Stephan Altmayer, Ken Chang, David Kersting, Tomoaki Otani, Brittany Z Dashevsky, Hye Lim Park, Matteo Novello, Kip Guja, Curtis Langlotz, Ismini Lourentzou, Daniel Gruhl, Benjamin Risse, Guido A Davidzon

专题命中 推理评测 :reasoning(abstract)

AI总结 GazeXPErT通过专家眼动数据提升肿瘤FDG-PET/CT图像的可解释AI性能,包括病变分割和意图预测。

详情

展开后加载摘要…

URL PDF HTML 收藏