arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-28 至 2026-04-28 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 5 篇

2509.00084 2026-04-28 cs.LG cs.AI cs.CL 82%

Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs

学习以细化:LLMs中并行推理的自我细化

Qibin Wang, Pu Zhao, Shaohan Huang, Fangkai Yang, Lu Wang, Furu Wei, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Microsoft(微软) Peking University(北京大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Generative Self-Refinement方法,通过并行生成候选答案并细化最终答案,提升LLM推理性能,实验显示其在多个数学基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24443 2026-04-28 cs.AI 80%

PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model

PhysNote: 为视觉-语言模型中的可进化物理推理提供自我知识笔记

Sinin Zhang, Yunfei Xie, Yuxuan Cheng, Haoyu Zhang, Tong Zhang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Rice University(里奇大学) City University of Hong Kong(香港城市大学) Fudan University(复旦大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出PhysNote框架,通过自我生成的知识笔记提升视觉-语言模型在动态物理推理中的表现,实验显示其在PhysBench上达到56.68%的准确率,优于多智能体基线。

Comments 11 pages. Accepted by ICLR 2026 Workshop ES-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00626 2026-04-28 cs.SD cs.CL 79%

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models

沉默也重要:无关音频对大音频-语言模型文本推理的影响

Chen-An Li, Tzu-Han Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能研究中心)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 研究探讨无关音频对大音频-语言模型文本推理的影响,发现非信息性音频会降低准确率并增加预测波动,提出自一致性策略能提升稳定性但增加计算成本。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17590 2026-04-28 cs.AI cs.CL cs.CV cs.CY cs.LG 78%

MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning

MERIT:基于网络基础推理的多模态虚假信息检测模块化框架

Mir Nafis Sharear Shopnil, Sharad Duwal, Abhishek Tyagi, Adiba Mahbub Proma

机构 * University of Rochester(罗切斯特大学)

专题命中 测试时计算 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 MERIT通过四个专用模块提升多模态虚假信息检测性能,采用GPT-4o-mini在MMFakeBench上取得81.65% F1得分,优于零样本基线,验证了其架构设计的有效性。

Comments 18 pages, 4 tables, 3 figures. Major revision with updated title, framing, methodology, experiments, and error analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25562 2026-04-28 cs.LG cs.AI cs.CL 67%

Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes

重新审视在线策略蒸馏:经验性失败模式及简单修复

Yuqian Fu, Haohuan Huang, Kaiwen Jiang, Jiacai Liu, Zhuo Jiang, Yuanheng Zhu, Dongbin Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中科院自动化所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) Fudan University(复旦大学) Independent Researcher(独立研究者)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在线策略蒸馏的失败模式,提出改进方法提升训练稳定性,实验显示改进方法在多个任务中提升性能19.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏