arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-17 至 2026-08-17 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2509.14704 2026-08-17 cs.AI 版本更新 83%

The Metacognitive Bottleneck: Japanese Riddles Reveal Fundamental Limits of Machine Insight and Self-Evaluation in Reasoning AI

日式儿童谜语作为机器洞察与元认知的基准

Masaharu Mizumoto, Dat Nguyen, Zhiheng Han, Xingfu Li, Yo Nakawake, Le Minh Nguyen

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract_cn);分类 cs.AI

AI总结 该研究通过日本儿童谜语构建基准,揭示机器在洞察推理和元认知控制方面的不足,为提升AI的自我评估能力提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14015 2026-08-17 cs.CV cs.AI 新提交 79%

MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

MedClaw:用于长程手术视频推理的启发式智能体框架

Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang

机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) University of Maryland(马里兰大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) University of British Columbia(不列颠哥伦比亚大学) Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出MedClaw智能体框架,通过分离推理与感知、启发式技能蒸馏循环,在仅需约100个标注示例的情况下,于自建及公开手术视频基准MedClawBench上,显著优于现有一次性VLM和通用视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13667 2026-08-17 cs.AI cs.SE 新提交 79%

Second Thought: Reasoning in Parallel as LLM Agents Act and Observe

Second Thought:LLM智能体行动与观察时的并行推理

Zhensu Sun, Chengran Yang, Yunbo Lyu, Jieke Shi, David Lo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出无需训练的推理框架Second Thought,利用LLM智能体行动与观察的空闲窗口并行推理,在多基准测试中降低轮次、减少主线程解码量,且Pass@1表现优于计算匹配对照组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13766 2026-08-17 cs.CV 新提交 78%

ChartProbe: A Diagnostic Study on Visual Reasoning through Perception, Grounding, and Simple Reasoning

ChartProbe:通过感知、定位与简单推理开展视觉推理的诊断研究

Mahsa Khoshnoodi, Sarah Adel Bargal

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出诊断框架ChartProbe,发现视觉-语言模型可通过单独监督感知、定位等简单技能,在无需复杂推理数据的情况下提升复杂图表推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13606 2026-08-17 cs.AI cs.CL cs.LG cs.MA cs.MM 新提交 67%

MobileMem: Learning from a Year of Mobile Experiences

MobileMem:从一年的移动体验中学习

Xinle Deng, Yida Xue, Xiangyuan Ru, Haoming Xu, Shuofei Qiao, Mengru Wang, Yijun Chen, Buqiang Xu, Chen Jiang, Yuchen Eleanor Jiang, Lizhong Wang, Jianfeng Wang, Li Zeng, Haofen Wang, Guilin Qi, Huajun Chen, Ningyu Zhang

机构 * OPPO OpenKG

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。

Comments Technical Report; Project Page: this http URL (http://mobilemem.openkg.cn/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14465 2026-08-17 cs.CL cs.LG 新提交 62%

You Only Pass Once: Answering and Abstaining Together in a Single Forward Pass of a Frozen Language Model

仅前向传播一次:在冻结语言模型的单次前向传播中同时完成回答与弃权(不执行)

Ziyang Luo, Zhongyao Chu, Xinjie He, Youting Wang, Xukui Qin, Runxiong Wu, Yan-Syuan Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出YOPO系统,通过训练小型网络重构残差流,在冻结Qwen2.5模型单次前向传播中同时实现回答、引导与弃权,性能优于两次前向传播基准,且在跨域等场景表现出色。

Comments 24 pages. Ziyang Luo and Zhongyao Chu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14109 2026-08-17 cs.AI cs.LG cs.MA 新提交 62%

A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents

面向自主大语言模型智能体中结构化漂移诊断与恢复的基于图的强化学习框架

Ismail El Hamraoui, Sagar Jose, Nicolas Bureau, Robert Plana

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对自主LLM智能体的运行时行为漂移问题,提出基于图的强化学习即插即用恢复框架,经AppWorld基准验证,该框架可利用漂移信息做出正确恢复决策且输出符合要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13712 2026-08-17 cs.CY cs.AI cs.CL 新提交 62%

Reading Between The Lines: Modeling and Evaluating Behavioral Realism in Legal Simulation

字里行间:法律模拟中行为真实性的建模与评估

Divya Vetticaden, Arya Gupta, Julian Nyarko, Megan Ma

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出可控法律角色驱动的证词采集模拟器WitnessSim,采用分离行为真实性与教学实用性的评估框架,证实其行为保真度,为法律模拟性能评估提供框架。

Comments Accepted at ICML 2026 AI4Law. 47 pages, 26 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13698 2026-08-17 cs.CL cs.LG 新提交 62%

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

超越英语的GRPO:非英语与多语言场景下GRPO的大规模研究

Konstantin Dobler, Federico Scozzafava, Jonathan Janke, Mohamed Ali, Simon Lehnerer

机构 * Apple(苹果公司) Hasso Plattner Institute(哈索·普拉特纳研究所) ELLIS Unit Potsdam(波茨坦ELLIS单元)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对非英语及多语言场景开展GRPO大规模实证,发现母语训练推理与英语训练差距小、存在跨语言迁移但趋势依赖模型语言,指出非英语RLVR有跨语言增益但需全面评估退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01591 2026-08-17 eess.AS cs.AI cs.CL cs.SD 版本更新 62%

BAT: Learning to Reason about Spatial Sounds with Large Language Models

BAT:基于大语言模型的空间声音推理学习

Zhisheng Zheng, Puyuan Peng, Ziyang Ma, Xie Chen, Eunsol Choi, David Harwath

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出结合Spatial-AST与LLaMA-2 7B的BAT模型,通过合成数据集训练,实现了超越SELD任务的空间声音感知与推理,展现了LLM在空间音频领域的应用潜力。

Comments Accepted to ICML 2024. Our demo, dataset, code and model weights are available at: this https URL (https://zhishengzheng.com/bat)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14270 2026-08-17 cs.AI 新提交 57%

TimeSage-EV: A Live Benchmark for Agentic Time Series Analysis in Evolving Environments

TimeSage-EV:面向动态环境下智能体时间序列分析的实时基准测试集

Qingren Yao, Yaxuan Kong, Yuqi Nie, Yichen Li, Stefan Zohren, Anna Vettoruzzo, Qingsong Wen, Ming Jin, Joaquin Vanschoren

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of Oxford(牛津大学) VulpiVox Intelligence(VulpiVox智能公司) Squirrel Ai Learning(Squirrel AI学习公司) Griffith University(格里菲斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对现有时间序列基准未评估时间有效性等问题,推出动态环境智能体时间序列分析基准TimeSage-EV,含多领域真实场景,实验揭示模型性能差距及失败模式,提供研究资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14179 2026-08-17 cs.AI 新提交 57%

Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding

语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试

Jeongwan Shin, Jaehyeon Kim, Donguk Ko, Jaeho Choi

机构 * DGIST(大邱庆北科学技术院) KAIST(韩国科学技术院) InnoCORE LLM

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14130 2026-08-17 cs.MM cs.AI cs.CV cs.HC 新提交 57%

AlignFace: Human-Aligned Face Similarity Metric with Interpretable Concept Relations

AlignFace:具有可解释概念关系的人类对齐人脸相似度度量

Ying Huang, Wencan Zhang, Brian Y. Lim

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。

Comments 10 pages, 10 figures, 2 tables, ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14094 2026-08-17 cs.CR cs.AI 新提交 57%

P2Skill: Privacy Preserving Skill Distillation for Cloud-Local LLM Inference Systems

P2Skill:面向云-本地大语言模型推理系统的隐私保护技能蒸馏

Myunghoon Ryu, Geunpyo Park, Sungjoon Lee, XinYu Piao, Jong-Kook Kim

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对云-本地LLM推理系统的P2Skill,通过技能提示实现本地SLM自主处理PII相关操作,无需隐私微调,在四领域基准上的隐私保护推理质量较基线提升1.69倍、3.66倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14075 2026-08-17 cs.AI cs.CV cs.DL 新提交 57%

A Pathway to General-Purpose Scientific AI: Multimodal Comprehension of Scientific Images

通用科学人工智能的实现路径:科学图像的多模态理解

Jennifer D'Souza, Fahad Ahmed, Cecilia Andrea Bustamante Andrade, Lina Frolova, Poorani Gnanasambandan, Dilshad Hussain, Muhammad Uzair Khan, Nkembeng Kevin Nkengfoa, Paul Praveen J., Fabio Priante, Sjoerd Franciscus van der Werf, Thomas Frederik Jan van Roeden

机构 * TIB Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心(TIB)) Eindhoven University of Technology(埃因霍温理工大学) Freie Universität Berlin(柏林自由大学) International Center for Chemical and Biological Sciences, University of Karachi(卡拉奇大学国际化学与生物科学中心) National University of Sciences and Technology(国家科技大学) University of Warwick(华威大学) PSG College of Technology(PSG理工学院) Aalto University(阿尔托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出以科学图像多模态理解构建通用科学AI的路径,依托ALD/E-ImageMiner基准与2026年ICDAR竞赛,明确相关任务能力检验维度及长期研究方向,推动可机器执行的科学视觉知识与可验证多模态科学AI发展。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13883 2026-08-17 cs.AI 新提交 57%

MemoryLake on MemoryArena: A Matched Study of Agent Memory Backends

基于MemoryArena的MemoryLake研究:智能体记忆后端的匹配对比

Chaoqun Zhan, Qiang Zhou, Guannan Li, Zhenqiang Huang, Qianjin Wang

机构 * MemoryLake Team(MemoryLake团队)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 该研究在MemoryArena的五个任务领域中,对比MemoryLake等三种智能体记忆后端,发现MemoryLake在数学等三个领域成功率最高,整体平均成功率领先,且性能与工作负载相关。

Comments 16 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12343 2026-08-17 cs.CL 版本更新 57%

Lost in Historical Time? A Polish History Matura Benchmark for Large Language Models

大语言模型通过了历史考试却遗漏了《历史》:波兰高中毕业考试Matura基准测试

Adrian Trzoss, Kacper Dudzic, Wiktor Werner, Marcin Moskalewicz

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学) IDEAS Research Institute(IDEAS研究院) AMU Center for Artificial Intelligence(亚当·密茨凯维奇大学人工智能中心) Poznań University of Medical Sciences(波兹南医科大学) Maria Curie-Skłodowska University(玛丽·居里-斯克洛多夫斯卡大学) WSB Merito University(WSB梅里托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对波兰Matura历史考试评估8款LLM,发现其总分远超人类考生,但存在波兰历史得分惩罚、源内容混淆等缺陷,推出了首个基于波兰国家课程的LLM历史基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14616 2026-08-17 cs.AI cs.CV 版本更新 57%

SportD: How do VLMs physically strategize?

SportD:视觉语言模型能进行物理策略制定吗?

Jasin Cekinmez, Addison J. Wu, Haotian Xia, Kyumin Andrew Shim, Anay Putty, Jinglin Xiao, Zhuohan Liu, Leo Liu, Weining Shen

机构 * Princeton University(普林斯顿大学) Rice University(莱斯大学) UC Irvine(加州大学欧文分校) POSTECH(浦项科技大学) NYU Shanghai(纽约大学上海分校) UC Santa Barbara(加州大学圣塔芭芭拉分校) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究视觉语言模型在足球场景中能否进行物理策略制定,引入SportD基准,通过控球价值模型评估模型决策,发现模型表现低于职业球员,有偏好低方差低回报动作等问题,为衡量模型物理策略推理提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01793 2026-08-17 cs.CL 版本更新 57%

Research-Oriented Human-Centric Evaluation for Foundation Models

面向研究的基础模型以人为中心的评估

Yijin Guo, Kaiyuan Ji, Xiaorong Zhu, Junying Wang, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对现有基础模型评估忽视用户主观体验的问题,提出Human-Centric Evaluation框架,通过604次人类评估会话及LLM-as-a-judge实验,证实人类主观评估不可替代,为基础模型研究提供新评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13024 2026-08-17 cs.CE 版本更新 50%

TIEM: Temporal Integration of Hypergraph Evidence and Skill Memory for Event-Driven Financial Forecasting

TIEM:用于事件驱动金融预测的超图证据与技能记忆的时间整合框架

Wenjin Liu, Shen Pang, Chenxi Wang, Tiesunlong Shen, Zhe Cui, Xiaobao Wu, Anh Tuan Luu, Haoran Luo

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究针对事件驱动金融预测中大型语言模型智能体存在的证据鸿沟问题,提出带时间戳门控的TIEM框架,引入FinPURE基准,经多组金融基准验证其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08705 2026-08-17 cs.CV 版本更新 50%

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales

HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准

Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Ziqi Sheng, Wei Lu

专题命中 推理评测 :reasoning(abstract)

AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09953 2026-08-17 cs.CV 版本更新 50%

J-RAS: Mutual Adaptation for Medical Image Segmentation via Contrastive Retrieval-Augmented Joint Optimization

J-RAS:基于对比检索增强联合优化的医学图像分割互适应方法

Salma J. Ahmed, Emad A. Mohammed, Azam Asilian Bidgoli

机构 * Laurier University(劳里尔大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出J-RAS框架,通过交替对比学习和监督学习联合优化分割与检索模型,实现检索与分割的互适应,提升医学图像分割的边界描绘、鲁棒性和跨数据集泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏