arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-30 至 2026-04-30 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 8 篇

2601.13606 2026-04-30 cs.CV 90%

ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch

ChartVerse: 通过从零开始可靠程序合成实现图表推理的扩展

Zheng Liu, Honglin Lin, Chonghan Qin, Xiaoyang Wang, Xin Gao, Yu Li, Mengzhang Cai, Yun Zhu, Zhanping Zhong, Qizhi Pei, Zhuoshi Pan, Xiaoran Shang, Bin Cui, Conghui He, Wentao Zhang, Lijun Wu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京市软件与硬件协同人工智能系统重点实验室)

专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract,abstract_cn)

AI总结 ChartVerse通过从零开始生成复杂图表和可靠推理数据,解决开放源模型开发中高质量训练数据缺乏的问题,采用RPE量化图表复杂度并生成高复杂度图表,结合truth-anchored inverse QA合成和CoT蒸馏提升推理深度。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26649 2026-04-30 cs.IR cs.AI cs.CL 81%

When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models

在推理中何时检索:面向大推理模型的自适应检索

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Brain Investing Limited(Brain Investing有限公司) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReaLM-Retrieve框架,通过三方面创新解决推理模型与检索增强生成的不匹配问题,提升答案F1分数并减少检索调用次数。

Comments 12 pages, 3 figures, 9 tables. Accepted at SIGIR 2026 (49th International ACM SIGIR Conference on Research and Development in Information Retrieval), Melbourne, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14438 2026-04-30 cs.CL 79%

WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models

WebAggregator:增强深度研究代理基础模型的组合推理能力

Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

机构 * MoE Lab, The Chinese University of Hong Kong(莫埃实验室,香港中文大学) Tencent AI Lab(腾讯AI实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出WebAggregator数据合成管道,通过主动探索和组合逻辑提案,提升深度研究代理的组合推理能力,并在多个基准测试中超越GPT-4.1和Claude-3.7-Sonnet。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26250 2026-04-30 cs.CV 78%

Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning

超越捷径:通过定性推理缓解冻结VLM中的视觉错觉

Hao Guo, Fei Wang, Junjie Chen, Yiqi Nie, Jiaqi Zhao, Qiankun Li, Subin Huang

机构 * Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥国家科学中心) Anhui Polytechnic University(安徽理工大学) Hefei University of Technology(合肥工业大学) Anhui University(安徽大学) IGS, Imperial College London(帝国理工学院伦敦分校)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出SQI框架,通过定性约束提升冻结VLM的视觉 grounding,解决视觉错觉问题,实验显示在DataCV 2026挑战中表现优异,提升准确率并提供更好的可解释性。

Comments 4 pages, 2 figures, and 1 table. This is a methodology paper for the DataCV 2026 Challenge (CVPR Workshops), Task 1, where our method ranked 2nd

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16496 2026-04-30 cs.CL 57%

AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents

AdaMem:面向长时对话代理的自适应用户导向记忆

Shannan Yan, Jingchen Ni, Leqi Zheng, Jiajun Zhang, Peixi Wu, Dacheng Yin, Jing Lyu, Chun Yuan, Fengyun Rao

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 AdaMem通过自适应用户导向记忆框架提升长时对话代理的长时推理与用户建模能力,采用统一框架整合工作记忆、事件记忆、人格记忆和图记忆,实现高效信息组织与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11295 2026-04-30 cs.CL 57%

The Prompt Engineering Report Distilled: Quick Start Guide for Life Sciences

提示工程报告精简:生命科学领域的快速入门指南

Valentin Romanov, Steven A Niederer

机构 * National Heart & Lung Institute, Faculty of Medicine, Imperial College London(英国伦敦帝国学院医学院国家心脏和肺研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文总结了生命科学领域中6种核心提示工程技巧,包括零样本、少样本、思考生成等,旨在提升LLM在文献总结、数据提取等任务中的效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25931 2026-04-30 cs.CL 57%

Anchored Confabulation: Partial Evidence Non-Monotonically Amplifies Confident Hallucination in LLMs

锚定编造:部分证据非单调放大LLM中的自信幻觉

Ashish Balkishan Lathkar

机构 * Florida State University(佛罗里达州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型中一种新校准特性:提供一个确认的中间事实可非单调放大自信错误答案率。通过六个证据线证明了参数幻觉信心(PHC)概念,并在RAG路由中应用,显著提升性能。

Comments 62 pages, 5 figures. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26462 2026-04-30 cs.CV 50%

A Multistage Extraction Pipeline for Long Scanned Financial Documents: An Empirical Study in Industrial KYC Workflows

一种多阶段提取流水线用于长扫描金融文档:工业KYC工作流的实证研究

Yuxuan Han, Yuanxing Zhang, Yushuo Wang, Yichao Jin, Kenneth Zhu Ke, Jingyuan Zhao

机构 * OCBC

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出多阶段提取框架,整合图像预处理、多语言OCR、混合页面级检索和紧凑VLM基于结构化提取,提升复杂多页文档的提取精度,实验证明在工业KYC工作中性能优于直接PDF到VLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏