arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-18 至 2026-08-18 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 15 篇

2601.03506 2026-08-18 cs.CL cs.AI 版本更新 88%

QA-Merging: Query-Adaptive Reasoning via Layer Selective Model Merging

适应性推理的推理模式对齐融合

Zhaofeng Zhong, Wei Yuan, Tong Chen, Liang Qu, Xiangyu Zhao, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) City University of Hong Kong(香港城市大学) Griffith University(格里菲斯大学)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RPAM,通过融合长链式思考和短链式提示模型,实现高效的查询自适应推理,减少推理成本并保持高性能。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20357 2026-08-18 cs.CL 版本更新 86%

Language Models that Think, Chat Better

能思考、对话更出色的语言模型

Adithya Bhaskar, Xi Ye, Danqi Chen

机构 * Princeton Language and Intelligence(普林斯顿语言与智能研究所) Princeton University(普林斯顿大学)

专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出RLMT方法,将RLVR扩展至开放式任务,使语言模型生成长CoT推理,在多基准测试中优于RLHF,仅用少量提示训练的基础模型性能超多阶段后训练的指令微调模型

Comments COLM 2026; we release our code, data, and artifacts publicly at this https URL (https://github.com/princeton-pli/RLMT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14659 2026-08-18 cs.AI cs.LG cs.SE 新提交 81%

When Uncertainty Isn't Enough: An Empirical Study of Self-Correction in Code Generation

当不确定性还不够时:代码生成中自校正的实证研究

Pranav Rakasi, Maanas Lalwani, Arnav Srivastava, Arya Palanivel, Tinuade Adeleke, Ruizhe Li, Sean Wu

机构 * University of Michigan(密歇根大学) New York University(纽约大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Algoverse AI University of Aberdeen(阿伯丁大学) University of Oxford(牛津大学)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过实证发现,针对代码生成的不确定性估计方法难以可靠提升生成准确率,仅基于验证的自校正策略可显著提升Pass@1指标,廉价不确定性估计器仅适合作为校正循环的门控信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16742 2026-08-18 cs.SE cs.AI 新提交 79%

TDD-Agent: Test-Driven Reasoning for Code Generation

TDD-Agent:用于代码生成的测试驱动推理

Hongyue Yu, Kefan Li, Jiakun Li, Hongzheng Chai, Yuan Yuan, Rui He, Junyi Wei

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14804 2026-08-18 cs.AI 新提交 79%

Generated Context versus Governed State: Functional Conditions for Accountable Longitudinal Clinical Reasoning

生成式上下文与受控状态:可问责纵向临床推理的功能条件

Augusto Bernardo Pissarra, Victor Lorena de Farias Souza

机构 * MyndwareMed(迈恩德韦尔医疗)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文区分生成式上下文与受控状态,定义可问责临床AI的审计标准与信息要求,提出六级成熟度框架,将当前LLM临床实践定位于高能力低成熟度,为可问责临床AI提供概念与审计工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16002 2026-08-18 cs.CL cs.AI 新提交 62%

From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

从序列到结构:面向大语言模型智能体的关系型不确定性传播

Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27599 2026-08-18 cs.LG cs.AI cs.AR cs.DC cs.PF 版本更新 62%

The Energy Blind Spot: NVIDIA's Flagship Edge AI Hardware Cannot Support Process-Level Energy Attribution

能源盲点:NVIDIA 旗舰边缘 AI 硬件无法支持进程级能源归因

Deepak Panigrahy, Aakash Tyagi

机构 * Independent Researcher(独立研究者) Texas A&M University(德克萨斯农工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文审计了 ASUS Ascent GX10 (GB10 SoC) 平台的能源可观测性,发现其缺乏 CPU 能源计数器等关键接口,导致无法像 x86 的 RAPL 那样进行进程级能源归因,并提出通过外部直流计量和 GPU 减法进行校准的临时方案,呼吁将能源可观测性作为硬件的一等要求。

Comments 5 pages, 0 figures. Accepted at the 2nd International Workshop on Low Carbon Computing (LOCO 2026), Lancaster University, United Kingdom, 10-11 September 2026. Part of the LOCO 2026 proceedings, arXiv:2608.02072 (https://arxiv.org/abs/2608.02072)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17510 2026-08-18 cs.LG cs.AI 版本更新 62%

LORA-CRAFT: Cross-layer Rank Adaptation via Frozen Tucker Decomposition of Pre-trained Attention Weights

LORA-CRAFT:通过冻结预训练注意力权重的跨层秩适应进行Tucker分解

Kasun Dewage, Marianna Pensky, Suranadi De Silva, Shankadeep Mondal

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LORA-CRAFT通过冻结预训练注意力权重的Tucker分解实现跨层秩适应,以轻量级可训练变换调整模型,在GLUE基准测试中达到与现有方法相当的性能,仅需41K参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06286 2026-08-18 cs.CL cs.AI 版本更新 62%

Bactrainus: Optimizing Large Language Models for Multi-hop Complex Question Answering Tasks

Bactrainus:为多跳复杂问答任务优化大型语言模型

Iman Barati, Arash Ghafouri, Behrouz Minaei-Bidgoli

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对多跳问答的证据瓶颈,提出模块化选择器-阅读器框架Bactrainus,经实验验证其在HotpotQA任务中表现优异,为该领域提供了可审计的证据接口方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16578 2026-08-18 cs.AI cs.MA cs.SI 新提交 57%

Physics of Agents: Statistical Mechanics Predicts Collective Behavior of AI Agents

智能体物理学:统计力学预测AI智能体的集体行为

Batu El, Jinhee Paeng, Fatih Dinc, Shiye Su, Mete Erdogan, Aneesh Pappu, Haotian Ye, Wanjia Zhao, Surya Ganguli, James Zou

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究以10000余个语言模型智能体社区为对象,用统计力学模型将其集体动态分为三种状态,预测个体轨迹优于基线,揭示了AI智能体集体行为遵循可预测动力学规律。

Comments 51 pages, 20 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16461 2026-08-18 cs.ET cs.AI cs.CE cs.CY 新提交 57%

A Human-LLM Teaming Framework for Privacy Risk Analysis: An Illustration with CBDC-Based Welfare Schemes

一种用于隐私风险分析的人-大语言模型(LLM)协同框架:以基于央行数字货币(CBDC)的福利方案为例

Sourya Joyee De, Abdessamad Imine

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出用于隐私风险分析的人-LLM协同框架PRIAM,以CBDC福利方案为例验证,该框架通过人机迭代协作优化隐私风险评估,为相关领域提供基础贡献。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15394 2026-08-18 cs.CL 新提交 57%

The Machine's Internal Clock: Do LLMs Share Human Temporal Illusions?

机器的内部时钟:大型语言模型(LLMs)是否会共享人类的时间错觉?

Catherine Bao, Vivek Srikumar

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究构建含5种错觉的6684个叙事对基准,发现人类仅在2种错觉中偏好预期场景,而14个LLMs在4种错觉中与文献预测一致,其一致性源于心理学研究检索而非类人时间偏差。

Comments 25 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14707 2026-08-18 cs.AI 新提交 57%

Semantic Uncertainty-Guided Orchestration in Hierarchical Multi-Agent Systems

分层多智能体系统中基于语义不确定性的协调策略

John Knowlton, Aritra Guha, Risto Miikkulainen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AT&T Chief Data Office(AT&T首席数据办公室) Cognizant AI Lab(高知特人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HASSUM框架,利用语义熵和密度估计不确定性实现多智能体自适应协调,在StrategyQA等基准上验证其可提升复杂推理任务的可靠性。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14668 2026-08-18 cs.MA cs.AI 新提交 57%

BRA-Audit: Budgeted Runtime Auditing for LLM Multi-Agent Systems via Cumulative-Exposure Audit-Point Placement

BRA-Audit:基于累积暴露审计点放置的LLM多智能体系统预算运行时审计

Kaixiang Wang, Yidan Lin, Jiong Lou, Jie Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 BRA-Audit是一种预算感知的LLM多智能体系统运行时审计框架,通过贪心调度放置审计点,在保障防护性能的同时降低了17.2%-40.6%的端到端token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14065 2026-08-18 cs.SE cs.AI 版本更新 57%

Rethinking Automated Program Repair: The Impact of Bug Complexity, Fault Localization, and LLM Cost-efficiency

重新思考自动程序修复:缺陷复杂度、缺陷定位与大语言模型成本效率的影响

Junchi Liu, Ali Bigdeli, Roya Daneshi, Atu Ambala, Sudipto Ghosh, Fabio Santos

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过实证分析,发现中等复杂度缺陷可超50%由低成本LLM修复,不精确缺陷定位会扩大APR技术差距,高成本LLM与强推理设置并非总能提升成本效率,DeepSeek-V3.2成本效率最优。

Comments 20 pages, 6 figures, 10 tables. Accepted at ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏