arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-03 至 2026-04-03 共收录 95 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 19 篇

2604.01535 2026-04-03 cs.CL 57%

Read More, Think More: Revisiting Observation Reduction for Web Agents

多读多想:重新审视网络代理中的观察缩减

Masafumi Enomoto, Ryoma Obara, Haochen Zhang, Masafumi Oyamada

机构 * NEC Corporation(日本电气股份有限公司)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文研究网络代理中观察缩减的优化问题,发现模型能力和思考token预算影响观察表示选择,高能力模型适合详细HTML观察,低能力模型适合紧凑的访问树观察,同时引入diff-based表示提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29353 2026-04-03 cs.AI 57%

Nomad: Autonomous Exploration and Discovery

Nomad:自主探索与发现

Bokang Jia, Samta Kamboj, Satheesh Katipomu, Seung Hun Han, Neha Sengupta, Andrew Jackson

机构 * Inception, G42(G42 的 Inception) G42 MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划推理 :verifier(abstract);分类 cs.AI

AI总结 Nomad通过探索优先架构,构建领域探索地图,系统遍历以平衡广度与深度,生成并验证假设,最终生成可信报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01915 2026-04-03 cs.CV 50%

Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts

通过知识引导的空间提示增强医学视觉 grounding

Yifan Gao, Tao Zhou, Yi Zhou, Ke Zou, Yizhe Zhang, Huazhu Fu

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Yong Yoo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出KnowMVG框架,通过知识增强提示和全局局部注意力机制提升医学视觉 grounding的精度,实验显示在四个基准上优于现有方法。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02289 2026-04-03 cs.DB 50%

Multi-Objective Agentic Rewrites for Unstructured Data Processing

多目标代理重写用于无结构数据处理

Lindsey Linxi Wei, Shreya Shankar, Sepanta Zeighami, Yeounoh Chung, Fatma Ozcan, Aditya G. Parameswaran

专题命中 规划推理 :planning(abstract)

AI总结 MOAR通过引入新的指令类别和全局搜索算法,提升DocETL在准确性和成本上的优化能力,实现更高的准确性并匹配最佳成本。

Comments 24 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00911 2026-04-03 cs.SE 50%

Foundation Models for Autonomous Driving System: An Initial Roadmap

自动驾驶系统中的基础模型:初步路线图

Xiongfei Wu, Mingfei Cheng, Xiaoning Ren, Qiang Hu, Jianlang Chen, Yuheng Huang, Maxime Cordy, Yao Zhang, Xiaofei Xie, Lei Ma, Yves Le Traon

专题命中 规划推理 :reasoning(abstract)

AI总结 本文探讨了基础模型在自动驾驶系统中的应用,分析了在基础设施、车载集成和实际部署三个维度中的现状、挑战和研究方向,旨在为构建安全可靠的自动驾驶系统提供指导。

Comments To appear in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 13 篇

2601.02991 2026-04-03 cs.CV cs.AI 85%

Towards Faithful Reasoning in Comics for Small MLLMs

面向小规模MLLMs的漫画中忠实推理方法

Chengcheng Feng, Haojie Yin, Yucheng Jin, Kaizhu Huang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出一种两阶段框架,通过MoCoT和VERA提升小规模MLLMs在漫画理解中的推理忠实性,实验表明在4B参数范围内表现优异,优于7B基线,提升四个小模型12.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02318 2026-04-03 cs.RO cs.CV 82%

Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning

停止游荡:通过元认知推理实现高效的视觉-语言导航

Xueying Li, Feng Lyu, Hao Wu, Mingliu Liu, Jia-Nan Liu, Guozi Liu

机构 * Central South University(中南大学) Nanjing University(南京大学) State Grid Hubei Electric Power Research Institute(国网湖北省电力有限公司电力科学研究院) Dongguan University of Technology(东莞理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出MetaNav,通过整合空间记忆、历史感知规划和反思修正,提升视觉-语言导航的效率与鲁棒性,实验显示其在多个基准上表现优异,减少了20.7%的VLM查询。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01610 2026-04-03 cs.AI 79%

GraphWalk: Enabling Reasoning in Large Language Models through Tool-Based Graph Navigation

GraphWalk: 通过基于工具的图导航在大语言模型中实现推理

Taraneh Ghandi, Hamidreza Mahyar, Shachar Klaiman

机构 * McMaster University(麦克马斯特大学) BASF Digital Solutions(巴斯夫数字解决方案)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 GraphWalk通过基于工具的图导航框架,使大语言模型能够高效进行多跳推理,提升在不同任务中的性能,尤其在大规模知识图谱中表现更优。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01764 2026-04-03 cs.CV 79%

Hidden Meanings in Plain Sight: RebusBench for Evaluating Cognitive Visual Reasoning

显而易见的隐含意义:RebusBench用于评估认知视觉推理

Seyed Amir Kasaei, Arash Marioriyad, Mahbod Khaleti, MohammadAmin Fazli, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出RebusBench基准,用于评估模型在需要多步推理的隐含意义理解能力,发现现有模型在认知连接方面存在缺陷。

Comments Accepted at ICLR 2026 Workshop: From Human Cognition to AI Reasoning (HCAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01882 2026-04-03 cs.CV 78%

A3R: Agentic Affordance Reasoning via Cross-Dimensional Evidence in 3D Gaussian Scenes

A3R: 通过跨维度证据进行3D高斯场景中的代理 affordance 推理

Di Li, Jie Feng, Guanbin Li, Ronghua Shang, Yuhui Zheng, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Sun Yat-sen University(中山大学) Qinghai Normal University(青海师范大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出A3R框架,通过跨维度证据获取提升复杂3D高斯场景中细粒度affordance推理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02071 2026-04-03 cs.CV cs.AI cs.LG 62%

Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection

挖掘实例导向的视觉-语言上下文以实现人-物交互检测

Soo Won Seo, KyungChae Lee, Hyungchan Cho, Taein Son, Nam Ik Cho, Jun Won Choi

机构 * Seoul National University(首尔国立大学) Hanyang University(汉阳大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出InCoM-Net框架,通过整合VLM提取的语义知识与实例特征,提升人-物交互检测的交互推理能力,实验表明其在HICO-DET和V-COCO基准上达到最优性能。

Comments Accepted to CVPR 2026. Code: https://github.com/nowuss/InCoM-Net

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02296 2026-04-03 cs.CV cs.AI 57%

VOID: Video Object and Interaction Deletion

VOID:视频对象和交互删除

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

机构 * Netflix

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 VOID通过物理合理填充解决复杂场景下的视频对象删除问题,结合视觉语言模型和视频扩散模型,提升场景动态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01371 2026-04-03 cs.CV cs.AI cs.RO eess.IV 57%

AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction

AffordTissue: 密集的工具-动作特定组织交互 affordance 预测

Aiza Maksutova, Lalithkumar Seenivasan, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Yiqing Shen, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AffordTissue框架,通过多模态方法预测手术中工具-动作特定的组织affordance区域,改进了视觉语言模型在密集手术affordance预测中的表现,为安全手术自动化提供空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10853 2026-04-03 cs.AI cs.HC 57%

Advanced Assistance for Traffic Crash Analysis: An AI-Driven Multi-Agent Approach to Pre-Crash Reconstruction

交通碰撞分析的高级辅助:一种基于AI的多智能体方法用于碰撞前重建

Gerui Xu, Boyou Chen, Huizhong Guo, Dave LeBlanc, Arpan Kusari, Efe Yarbasi, Ananna Ahmed, Zhaonan Sun, Shan Bao

机构 * Industrial and Manufacturing Systems Engineering Department, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校工业与制造系统工程系) University of Michigan Transportation Research Institute(密歇根大学交通研究所) Toyota Motor Engineering & Manufacturing North America, Inc.(丰田汽车工程与制造北美公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的多智能体框架,通过多模态输入生成碰撞前场景重建,并结合事件数据记录器信号识别碰撞车辆,验证了该框架在碰撞前行为推断中的高准确率。

Comments 36 pages, 14 figures

Journal ref SAE International Journal of Transportation Safety, 14(1), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02252 2026-04-03 cs.CV 50%

SPAR: Single-Pass Any-Resolution ViT for Open-vocabulary Segmentation

SPAR:单次通过任意分辨率ViT用于开放词汇分割

Naomi Kombol, Ivan Martinović, Siniša Šegvić, Giorgos Tolias

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SPAR通过单次通过任意分辨率ViT实现高效高分辨率推理,提升开放词汇分割的mIoU性能,无需架构改动或像素级监督。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02020 2026-04-03 cs.CV 50%

Are VLMs Lost Between Sky and Space? LinkS$^2$Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence

VLMs在天空与空间之间迷失了吗?LinkS$^2$Bench用于无人机-卫星动态跨视角空间智能

Dian Liu, Jie Feng, Di Li, Yuhui Zheng, Guanbin Li, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Qinghai Normal University(青海师范大学) Sun Yat-sen University(中山大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出LinkS$^2$Bench,首个评估VLMs跨视角空间智能的综合基准,通过动态无人机视频与高分辨率卫星图像构建17.9k高质量问题-答案对,揭示VLMs在动态跨视角对齐中的性能瓶颈,并提出跨视角对齐适配器提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01678 2026-04-03 cs.CV 50%

Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding

Director: 用于动态场景建模与理解的实例感知高斯点云

Yuheng Jiang, Yiwen Cai, Zihao Wang, Yize Wu, Sicheng Li, Zhuo Su, Shaohui Jiao, Lan Xu

机构 * ShanghaiTech University(上海科技大学) ByteDance(字节跳动)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Director通过联合建模人类性能、高保真渲染和实例级语义,实现动态场景的时空高斯表示,提升动态场景理解的稳定性与准确性。

Comments Project page: https://caiyw2023.github.io/Director/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01421 2026-04-03 cs.CV 50%

EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

EgoFlow:基于梯度的流匹配用于第一人称6自由度物体运动生成

Abhishek Saroha, Huajian Zeng, Xingxing Zuo, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML(慕尼黑机器学习中心) ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出EgoFlow,通过多模态第一人称观察生成物理合理的物体运动轨迹,结合Mamba-Transformer-Perceiver架构和梯度引导推理,提升运动生成的准确性和物理真实性。

Comments CVPR 2026: https://abhi-rf.github.io/egoflow/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 1 篇

2604.01430 2026-04-03 cs.LG 83%

Improving Latent Generalization Using Test-time Compute

通过测试时间计算提升潜在泛化能力

Arslan Chaudhry, Sridhar Thiagarajan, Andrew Lampinen

机构 * Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文研究如何通过测试时间计算('思考')提升语言模型的潜在泛化能力,利用强化学习训练模型生成长链思考以改进泛化,实验显示该方法在分布内知识和分布外知识上均有效,但对纯反转任务仍逊于上下文学习。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 9 篇

2604.02155 2026-04-03 cs.CL 85%

Brief Is Better: Non-Monotonic Chain-of-Thought Budget Effects in Function-Calling Language Agents

简洁即更好:函数调用语言代理中的非单调链式思维预算效应

Xuan Qi

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 研究探讨了链式思维预算对函数调用代理性能的影响,发现简短的链式思维显著提升准确性,而延长的链式思维反而降低性能,提出Function-Routing CoT方法提升可靠性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02230 2026-04-03 cs.AI 79%

Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs

回答错误的问题:用于LLMs中退避的推理轨迹逆向

Abinitha Gourabathina, Inkit Padhi, Manish Nagireddy, Subhajit Chaudhury, Prasanna Sattigeri

机构 * MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出轨迹逆向方法,通过分析模型推理轨迹来改进LLMs的退避能力,实验表明其在多个数据集上显著提升退避性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01600 2026-04-03 cs.AI 79%

MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction

MM-ReCoder:通过强化学习和自我校正推进图表到代码生成

Zitian Tang, Xu Zhang, Jianbo Yuan, Yang Zou, Varad Gunjal, Songyao Jiang, Davide Modolo

机构 * Brown University(布朗大学) Amazon AGI(亚马逊AGI)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.AI

AI总结 MM-ReCoder通过强化学习和自我校正机制提升图表到代码生成能力,其两阶段多轮自我校正策略基于Group Relative Policy Optimization,提升代码准确性和可执行性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07995 2026-04-03 cs.IR cs.AI 79%

DIVER: A Multi-Stage Approach for Reasoning-intensive Information Retrieval

DIVER:一种用于推理密集型信息检索的多阶段方法

Duolin Sun, Meixiu Long, Dan Yang, Junjie Wang, Yecheng Luo, Yue Shen, Jian Wang, Hualei Zhou, Chunxiao Guo, Peng Wei, Jiahai Wang, Jinjie Gu

机构 * Ant Group(蚂蚁集团) Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 DIVER通过多阶段流程提升推理密集型信息检索性能,包含文档预处理、查询扩展、检索和重排序四个环节,有效应对需要抽象推理和多步推理的复杂查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24458 2026-04-03 cs.CV 78%

OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning

OmniWeaving:迈向统一视频生成的自由组合与推理

Kaihang Pan, Qi Tian, Jianwei Zhang, Weijie Kong, Jiangfeng Xiong, Yanxin Long, Shixue Zhang, Haiyi Qiu, Tan Wang, Zheqi Lv, Yue Wu, Liefeng Bo, Siliang Tang, Zhao Zhong

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出OmniWeaving模型,通过大规模预训练数据学习多模态组合与推理能力,引入IntelligentVBench基准测试,展示其在开放源码统一视频生成中的领先性能。

Comments 32 pages, 22 figures. Project Page: https://omniweaving.github.io. Github: https://github.com/Tencent-Hunyuan/OmniWeaving. Model: https://huggingface.co/tencent/HY-OmniWeaving

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00261 2026-04-03 cs.CL 77%

Can Large Language Models Self-Correct in Medical Question Answering? An Exploratory Study

大语言模型能否在医疗问答中自我纠正?一项探索性研究

Zaifu Zhan, Mengyuan Cui, Rui Zhang

机构 * Department of Electrical and Computer Engineering, University of Minnesota(明尼苏达大学电气与计算机工程系) Division of Computational Health Sciences, Department of Surgery, University of Minnesota(明尼苏达大学外科学系计算健康科学部) Department of Software Engineering, University of St. Thomas(圣托马斯大学软件工程系)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文探讨大语言模型在医疗问答中的自我反思能力,通过比较标准Co-T提示与迭代自我反思循环,发现自我反思并不总能提升准确性,且效果依赖于数据集和模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01529 2026-04-03 cs.AI cs.MA 77%

A Role-Based LLM Framework for Structured Information Extraction from Healthy Food Policies

基于角色的LLM框架用于从健康食品政策中提取结构化信息

Congjing Zhang, Ruoxuan Bao, Jingyu Li, Yoav Ackerman, Shuai Huang, Yanfang Su

机构 * University of Washington(华盛顿大学) Shanghai University(上海大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出基于角色的LLM框架,通过分配专门角色提升健康食品政策信息提取的准确性与透明度,对比零样本、少样本和推理链基线,展现更优的复杂推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23752 2026-04-03 cs.CV 67%

ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks

ThinkGeo: 评估用于遥感任务的工具增强代理

Akashah Shabbir, Muhammad Akhtar Munir, Akshay Dudhane, Muhammad Umer Sheikh, Muhammad Haris Khan, Paolo Fraccaro, Juan Bernabe Moreno, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) IBM Research(IBM研究院) Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)

AI总结 ThinkGeo是一个针对遥感任务设计的代理基准,评估LLM驱动代理在结构化工具使用和多步骤规划中的能力,通过人类 curated 查询和专家验证的推理步骤测试不同模型的工具准确性和规划一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11298 2026-04-03 cs.RO 50%

ThinkGrasp: A Vision-Language System for Strategic Part Grasping in Clutter

ThinkGrasp: 一种用于杂乱环境战略部件抓取的视觉-语言系统

Yaoyao Qian, Xupeng Zhu, Ondrej Biza, Shuo Jiang, Linfeng Zhao, Haojie Huang, Yu Qi, Robert Platt

机构 * Northeastern University(东北大学) Boston Dynamics AI Institute(波士顿动力人工智能研究所)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ThinkGrasp利用GPT-4o的上下文推理能力,在复杂环境中实现高效抓取,通过目标导向语言逐步清除障碍物,提升抓取成功率。

Comments Accepted at CoRL 2024. Project Website:(https://h-freax.github.io/thinkgrasp_page/)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 27 篇

2604.01657 2026-04-03 cs.CL 83%

What Do Claim Verification Datasets Actually Test? A Reasoning Trace Analysis

声明验证数据集实际上测试什么?一种推理跟踪分析

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 研究通过分析24K个验证案例的推理轨迹,发现数据集主要测试直接证据提取,而多句综合和数值推理不足,不同领域存在显著偏差,提出改进评估体系的建议。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01754 2026-04-03 cs.CL cs.AI cs.LG 82%

LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches

LiveMathematicianBench: 一个用于数学家级推理的实时基准

Linyang He, Qiyao Yu, Hanze Dong, Baohao Liao, Xinxing Xu, Micah Goldblum, Jiang Bian, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学) Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LiveMathematicianBench,一个基于近期arXiv论文的动态多选基准,用于评估大语言模型的数学推理能力,通过证明草图指导的干扰项生成机制,提升对真实理解的检测。

Comments Project page: https://livemathematicianbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏