arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-10 至 2026-06-10 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 12 篇

2604.01993 2026-06-10 cs.CL cs.AI 版本更新 88%

SAFE: An LLM-as-Verifier Framework for Evidence-Grounded Multi-Hop Reasoning

SAFE: 一种基于LLM作为验证器的证据驱动多跳推理框架

Daeyong Kwon, Soyoung Yoon, Seung-won Hwang

机构 * Seoul National University(首尔国立大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI

AI总结 提出SAFE框架,通过将推理分解为知识图谱三元组,在生成过程中逐步验证中间步骤,以解决多跳问答中模型通过无效推理得到正确答案的问题,平均准确率提升8.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09926 2026-06-10 cs.LG cs.AI 新提交 84%

Sample Where You Struggle: Sharpening Base Model Reasoning via Entropy-Guided Power Sampling

在你挣扎处采样:通过熵引导的幂采样增强基础模型推理

Hong Guo, Nianhui Guo, Christoph Meinel, Haojin Yang

机构 * Hasso Plattner Institut(霍普夫纳研究所) German University of Digital Science(德国数字科学大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出熵引导的幂采样(EGPS),一种无需训练和验证器的采样方法,通过利用前向传播中的token级熵将MCMC移动定位到高熵区域,在多个基准上以高达12.6倍加速达到最优或并列最优准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02240 2026-06-10 cs.CL 版本更新 79%

Lightweight Latent Reasoning for Narrative Tasks

面向叙事任务的轻量级潜在推理

Alexander Gurung, Esmeralda S. Whitammer, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) CIFAR Fellow

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 提出LiteReason方法,通过轻量级推理投影器生成连续潜在令牌,在强化学习中动态切换潜在与离散推理,将推理长度减少77-92%,同时保持接近非潜在RL的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10279 2026-06-10 cs.AI cs.CL cs.LG 新提交 67%

Supervised Fine-tuning with Synthetic Rationale Data Hurts Real-World Disease Prediction

使用合成理由数据进行监督微调损害真实世界疾病预测

Buxin Su, Bingxuan Li, Cheng Qian, Yiwei Wang, Jin Jin, Bingxin Zhao

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Merced(加州大学默塞德分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现,在临床预测任务中,使用合成理由数据进行监督微调反而显著降低模型性能,根本原因在于叙事合理性与判别优化之间的结构性冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09635 2026-06-10 cs.CL cs.LG 交叉投稿 62%

Gradient-Guided Reward Optimization for Inference-time Alignment

梯度引导的推理时对齐奖励优化

Hankun Lin, Ruqi Zhang

机构 * Purdue University(普渡大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出梯度引导奖励优化(GGRO)方法,通过解码时注入梯度信号生成的引导令牌,在推理时微调生成轨迹,提升安全性、有用性和推理性能,并增强对奖励攻击的鲁棒性。

Comments Accepted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02603 2026-06-10 cs.CL 版本更新 61%

CGES: Confidence-Guided Early Stopping for Efficient and Accurate Self-Consistency

CGES:面向高效准确自一致性的置信引导早停方法

Ehsan Aghazadeh, Ahmad Ghasemi, Hedyeh Beyhaghi, Hossein Pishro-Nik

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.CL

AI总结 提出贝叶斯框架CGES,通过自适应停止采样减少自一致性推理调用次数,在5个推理基准上平均减少58%调用且精度损失仅0.4个百分点。

Comments Extended version. A preliminary version was accepted at the Efficient Reasoning Workshop @ NeurIPS 2025. Code: https://github.com/EhsanAghazadeh/cges

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11176 2026-06-10 cs.CV cs.CL cs.CY cs.HC 新提交 57%

Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories

数据记者智能体:将数据转化为可验证的多模态故事

Kevin Qinghong Lin, Batu EI, Yuhong Shi, Pan Lu, Philip Torr, James Zou

机构 * University of Oxford(牛津大学) Stanford University(斯坦福大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 提出多智能体框架Data2Story,通过证据链验证声明并自动生成多模态文章,在18篇文章上评估,证明其在透明性和可审计性上接近人类记者。

Comments Project page: https://data2story.github.io Github: https://github.com/QinghongLin/data2story-skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10875 2026-06-10 cs.CL 新提交 57%

Pushing the Limits of LLM Tool Calling via Experiential Knowledge Integration and Activation

通过经验知识集成与激活推动LLM工具调用极限

Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 研究如何通过经验知识获取、激活和内化提升LLM多步工具调用性能,提出知识增强工具执行框架KATE,结合宽度扩展推理与知识感知训练,在BFCL-V3和AppWorld上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10662 2026-06-10 cs.MA cs.AI 新提交 57%

Decentralized Multi-Agent Systems with Shared Context

具有共享上下文的去中心化多智能体系统

Yuzhen Mao, Azalia Mirhoseini

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出DeLM框架,通过并行智能体、共享上下文和任务队列去中心化协调,解决集中式MAS的瓶颈,在软件工程和长上下文推理中提升性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20098 2026-06-10 cs.AI 版本更新 57%

Neurosymbolic Learning for Inference-Time Argumentation

用于推理时间论证的神经符号学习

Gabriel Freedman, Adam Dejl, Adam Gould, Mansi, Lihu Chen, Junqi Jiang, Francesca Toni

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种用于三元主张验证的可训练神经符号框架,通过在训练和推理过程中结合形式论证语义来指导大语言模型生成论证并分配基础分数,从而提高三元预测的准确性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23443 2026-06-10 cs.CL 版本更新 57%

Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

重新审视视觉问答中的贪婪解码:一种校准视角

Boqi Chen, Xudong Liu, Yunke Ao, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MBZUAI(穆桑比克人工智能研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10724 2026-06-10 cs.CR 新提交 50%

Fingerprinting All AI Cluster I/O Without Mutually Trusted Processors

无需互信处理器的所有AI集群I/O指纹识别

Naci Cankaya, Jakub Kryś, Jonathan Ng, Luke Marks, Felix Krückel

专题命中 测试时计算 :verifier(abstract)

AI总结 提出一种通过网络分流器计算哈希来加密承诺进出数据中心所有信息的方法,并设计“安全网关设备”消除隐蔽信道,以实现对AI集群I/O的可验证审计。

详情

展开后加载摘要…

URL PDF HTML 收藏