arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-16 至 2026-04-16 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 5 篇

2510.14232 2026-04-16 cs.LG cs.AI cs.CL 85%

Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models

通过扩展测试时间计算实现IOI金牌奖章的开放权重模型

Mehrzad Samadi, Aleksander Ficek, Sean Narenthiran, Siddhartha Jain, Wasi Uddin Ahmad, Somshubra Majumdar, Vahid Noroozi, Boris Ginsburg

机构 * NVIDIA

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GenCluster框架,利用开放权重模型在有限预算下高效探索解决方案空间,实现IOI金牌级性能,缩小开放与闭合系统差距。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13398 2026-04-16 cs.CL cs.AI 81%

From Prediction to Justification: Aligning Sentiment Reasoning with Human Rationale via Reinforcement Learning

从预测到论证:通过强化学习对齐情感推理与人类推理

Shihao Zhang, Ziwei Wang, Jie Zhou, Yulan Wu, Qin Chen, Zhikai Lei, Liyang Yu, Liang Dou, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai Qiji Zhifeng Co., Ltd.(上海启智丰科技有限公司) Ocean University of China(中国海洋大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ABSA-R1框架,通过强化学习使模型具备生成自然语言论证的能力,提升情感分类和三元组提取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11465 2026-04-16 cs.AI 57%

Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents

三种角色,一个模型:推理时的角色编排以缩小小规模与大规模代理之间的性能差距

S. Aaron McClendon, Jorge Gallego-Feliciano, Stavros Zervoudakis, Antonios Saravanos

机构 * Aimpoint Digital Labs(Aimpoint数字实验室) New York University(纽约大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI

AI总结 本文研究在推理时仅使用架构支撑是否能提升小模型在复杂多步骤环境中的性能,通过三阶段推理架构使小模型在AppWorld基准测试中任务完成率提升近一倍,展示了结构化推理干预使小模型能与大模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13786 2026-04-16 cs.CL 57%

QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs

QuantileMark:一种消息对称的多比特水印用于大语言模型

Junlin Zhu, Baizhou Huang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 QuantileMark通过在连续累积概率区间[0,1)内嵌入信息,实现消息对称的多比特水印,提升水印检测的鲁棒性和生成质量的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13403 2026-04-16 cs.CV 50%

Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks

为何多模态上下文学习滞后?揭示内部机制和瓶颈

Yu Wang, Sharon Li

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文分析了多模态上下文学习在零样本设置中表现与少样本演示下退化的原因,揭示了模型在视觉与文本表示对齐和任务映射转移方面的不足,并提出改进方法。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏