arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-05 至 2026-08-05 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 13 篇

2608.02833 2026-08-05 cs.CV cs.AI cs.CL 新提交 86%

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

CURV:通过课程可视化接地推理增强图表理解

Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04007 2026-08-05 cs.CL cs.AI 新提交 81%

TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

TurnSight:面向工具集成推理的回合级事后自蒸馏方法

Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对工具集成推理中现有方法缺乏细粒度监督的问题,提出TurnSight框架,通过回合级事后自蒸馏生成可靠监督信号,在三个基准上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03048 2026-08-05 cs.CL cs.AI 新提交 81%

PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory

PI-Mem:通过并行迭代式记忆将长上下文推理推向360万 tokens

Dawei Liu, Haixu Song, Shuang Cheng, Shijie Wang, Haozheng Hou, Kaifeng Liu, Ermo Hua, Zhonghang Yuan, Zhijie Zhong, Yuchen Fan, Biqing Qi, Bowen Zhou

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出PI-Mem并行迭代记忆机制,在360万 tokens长上下文下,使Qwen系列模型在HotpotQA基准上较循环记忆基线实现准确率提升与推理加速,打破长上下文推理的准确率-效率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03972 2026-08-05 cs.AI 新提交 79%

ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

ReflectRL:通过反思到直接推理从优质负轨迹中学习

Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri, Shuo Lu, Wenke Huang, Hu Cao, Xun Xiao, Zhihong Zhu, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 ReflectRL是一种轻量即插即用框架,将专家失败的优质负轨迹作为反思对象而非丢弃,经反思推理与策略转换,在多基准、多模型及多训练方法上以极小开销提升大语言模型推理性能。

Comments Project page: https://github.com/bibisbar/ReflectRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03134 2026-08-05 cs.CR cs.SE 新提交 78%

CLEAR: Causal Context-Based Agentic Reasoning for Vulnerability Detection

CLEAR:基于因果上下文的智能体推理漏洞检测

Sungju Yun, Sijune Hwang, Yeonjoon Lee, Kyungtae Kang, Sungbin Park

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 该研究针对现有漏洞检测方法无法捕捉漏洞复杂因果依赖的问题,提出CLEAR多智能体框架,通过构建VCKG并结合四类智能体协同推理,在C/C++和Java基准上性能显著优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20144 2026-08-05 cs.DB 版本更新 78%

An Agentic Approach to Metadata Reasoning

元数据推理的代理方法

Jiani Zhang, Sercan O. Arik, Cosmin Arad, Fatma Ozcan, Alon Halevy

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出元数据推理代理,通过检索候选表和自主咨询元数据,有效筛选数据源。在KramaBench和合成基准测试中,其在数据选择和避免低质量数据方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02941 2026-08-05 cs.CL 新提交 77%

Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

形式对齐而非意义对齐:低资源孟加拉语贬损言论中大型语言模型(LLM)安全的理解-遏制解耦

Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel, Adib Sakhawat

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 复杂问题求解 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 该研究针对5个前沿LLM,在6种协议下对孟加拉语贬损言论审计,验证了LLM安全的理解-遏制解耦假设,发现高资源基准无法保障低资源安全,需基于意义的遏制。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00482 2026-08-05 cs.CL 版本更新 70%

Know When to Stop: Segment-Level Credit Assignment for Reducing Overthinking

知止:用于减少过度思考的片段级信用分配

Chia-Hsuan Lee, Sihui Dai, Mingyang Zhou, Isha Slavin, Hsuan Su, Shi-Xiong Zhang, Sambit Sahu, William Campbell

机构 * Capital One(第一资本)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 提出DASH方法,通过将推理轨迹中的最终答案候选与真实值比较,实现片段级信用分配,减少推理语言模型过度思考行为,在AIME25上准确率达50.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03569 2026-08-05 cs.AI cs.CY cs.LG cs.MA 新提交 62%

Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Capabilities

对抗性快速变化的真实世界领域:用于基准测试AI科学家能力的测试床

William Bolton, Philip Torr

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出以F1、MTG等对抗性快速变化的真实世界领域为测试床,发现AI科学家的核心能力差距是想法过滤、优先级排序而非生成。

Comments Accepted at the AI for Science workshop at ICML 2026. 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01168 2026-08-05 cs.LG cs.AI 版本更新 62%

SphUnc: Hyperspherical Uncertainty Decomposition and Causal Identification via Information Geometry

SphUnc:通过信息几何的超球面不确定性分解与因果识别

Rong Fu, Chunlei Meng, Jinshuo Liu, Dianyu Zhao, Yongtai Liu, Yibo Meng, Xiaowen Ma, Wangyu Wu, Yangchen Zeng, Shuaishuai Cao, Simon Fong

机构 * University of Macau(澳门大学) Fudan University(复旦大学) Hangzhou Dianzi University(杭州电子科技大学) Renmin University of China(中国人民大学) Hanyang University(翰阳大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Liverpool(利物浦大学) Southeast University(东南大学) Central South University(中南大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SphUnc结合超球面表示学习与结构因果建模,通过信息几何融合分解不确定性为epistemic和aleatoric成分,并通过样本模拟实现因果识别,提升多智能体系统中的预测准确性和不确定性校准能力。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02919 2026-08-05 cs.CL 新提交 57%

FLARE: Few-shot Learning-based Adaptive Reflective Engine

FLARE:基于小样本学习的自适应反思引擎

Dhanasekar Sundararaman, Bharat Gandhi, Aashna Garg, Minjie Li

机构 * Microsoft(微软)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出FLARE框架,利用小样本学习与反思机制优化指令,在多基准任务中优于GEPA,数据效率更高且稳定性更强,凸显小样本学习策略优化对提升LLM性能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27703 2026-08-05 cs.AI 版本更新 57%

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理

Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen, Caijun Yan, Jianyao Xu, Shunyu Liu, Weijie Fu, Peiliang Li, Xiaozhi Chen, Yuxiang Cai

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15428 2026-08-05 cs.IR 版本更新 50%

Fault Cause Identification across Manufacturing Lines through Ontology-Guided and Process-Aware FMEA Graph Learning with LLMs

基于本体引导和流程感知FMEA图学习结合大语言模型的跨生产线故障原因识别

Sho Okazaki, Kohei Kaminishi, Takuma Fujiu, Yusheng Wang, Manu Sasidharan, Jun Ota

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究针对跨生产线故障原因识别难题,提出OGPAL框架,结合LLM与RGCN实现FMEA知识复用,在汽车压力传感器装配线案例中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏