arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-08 至 2026-05-08 共收录 144 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 14 篇

2605.05566 2026-05-08 cs.AI cs.CL cs.LG 82%

Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration

无意义帮助:提示空间扰动拓宽推理探索

Langlin Huang, Chengsong Huang, Jinyuan Li, Donghong Cai, Yuyi Yang, Jiaxin Huang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LoPE框架,通过任务无关的提示空间扰动提升LLM推理能力,实验显示其在不同规模模型上均优于传统重采样方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19918 2026-05-08 cs.AI cs.LG 81%

Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models

Meta-Reasoner:用于大型语言模型推理时间优化的动态指导

Yuan Sui, Yufei He, Tri Cao, Simeng Han, Yulin Chen, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Yale University(耶鲁大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Meta-Reasoner框架,通过动态调整推理策略提升大语言模型的推理效率,实验显示在数学和科学任务中准确率提升9-12%,推理时间减少28-35%。

Comments Accepted by ACL'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05810 2026-05-08 cs.CV 67%

CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs

CXR-ContraBench:医疗视觉语言模型中否定选项吸引力的基准测试

Zhengru Fang, Yanan Ma, Yu Guo, Senkang Hu, Yixian Zhang, Hangcheng Cao, Wenbo Ding, Yuguang Fang

机构 * City University of Hong Kong(香港城市大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 测试时计算 :chain-of-thought(abstract);verifier(abstract)

AI总结 研究医疗视觉语言模型在否定选项吸引力问题上的表现,通过CXR-ContraBench基准测试发现模型在面对矛盾图像和问题时易产生极性反转,提出QCCV-Neg方法有效修复极性混淆问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05873 2026-05-08 stat.ML cs.AI cs.LG math.ST stat.ME stat.TH 62%

CITE: Anytime-Valid Statistical Inference in LLM Self-Consistency

CITE: 在大语言模型自我一致性中实现任意时间有效的统计推断

Hirofumi Ota, Naoto Iwase, Yuki Ichihara, Junpei Komiyama, Masaaki Imaizumi

机构 * Komaba Institute for Science, Graduate School of Arts and Sciences, The University of Tokyo(东京大学艺术科学研究生院Komaba研究所) Nagoya University(名古屋大学) NARA Institute of Science and Technology (NAIST) / Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(NAIST科学与技术研究所 / 摩洛哥本·泽德人工智能大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) / RIKEN AIP(摩洛哥本·泽德人工智能大学 / RIKEN AIP) Graduate School of Arts and Sciences, The University of Tokyo / RIKEN AIP / Kyoto University(东京大学艺术科学研究生院 / RIKEN AIP / 京都大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CITE算法,通过交并检验与E过程实现任意时间有效的模型响应分布唯一模式认证,无需预先知道可能答案集,并在扩散尾设置中提升认证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03379 2026-05-08 cs.LG cs.CL 62%

Two Calls, Two Moments, and the Vote-Accuracy Curve of Repeated LLM Inference

两次调用、两次矩与重复LLM推理的投票准确性曲线

Yi Liu

机构 * York University(约克大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 研究重复LLM推理的二元正确性层,在条件独立同分布调用下,通过两次调用确定第二矩和相同示例正确性相关性,从而为固定多数投票预算提供分布无关的两调用区间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00751 2026-05-08 cs.AI cs.CL 62%

Self-Consistency Is Losing Its Edge: Diminishing Returns and Rising Costs in Modern LLMs

自一致性正在失去优势:现代大语言模型中的边际效益递减与成本上升

Chiyan Loo

机构 * Chiyan Loo

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究指出,随着模型增强,自一致性技术变得低效且可能降低性能,通过实验显示增加推理路径数量带来的准确率提升有限,而成本却显著增加,建议仅在单次可靠度不足的问题上使用多路径采样。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23629 2026-05-08 cs.AI cond-mat.dis-nn cond-mat.stat-mech cs.LG physics.soc-ph 62%

Emergent Slow Thinking in LLMs as Inverse Tree Freezing

大语言模型中涌现的慢思考作为逆树冻结

Sihan Hu, Xiansheng Cai, Yuan Huang, Zhiyuan Yao, Linfeng Zhang, Pan Zhang, Youjin Deng, Kun Chen

机构 * Hefei National Laboratory, University of Science and Technology of China(中国科学技术大学合肥微尺度物质科学国家实验室) Hefei National Laboratory for Physical Sciences at the Microscale and Department of Modern Physics, University of Science and Technology of China(中国科学技术大学合肥微尺度物质科学国家实验室和现代物理系) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所) School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS(杭州高等研究院基础物理与数学科学学院) DP Technology(DP技术) Lanzhou Center for Theoretical Physics, Key Laboratory of Theoretical Physics of Gansu Province, Key Laboratory of Quantum Theory and Applications of MoE, Gansu Provincial Research Center for Basic Disciplines of Quantum Physics, Lanzhou University(兰州理论物理中心、甘肃省理论物理重点实验室、教育部量子理论与应用重点实验室、甘肃省量子物理基础学科省重点实验室、兰州大学) AI for Science Institute, Beijing(北京人工智能科学研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过统计物理视角揭示大语言模型中慢思考的涌现机制,提出逆树冻结结构,并提出Annealed-RLVR方法提升模型性能。

Comments 34 pages, 17 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05777 2026-05-08 cs.CL 57%

Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation

通过分布对齐对抗蒸馏估计黑盒大语言模型的不确定性

Huizi Cui, Huan Ma, Qilin Wang, Yuhang Gao, Changqing Zhang

机构 * School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院) School of Future Technology, Tianjin University, China(天津大学未来技术学院) Georgia Tech Shenzhen Institute, Tianjin University, China(Georgia Tech深圳研究院) School of Artificial Intelligence, Tianjin University, China(天津大学人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出DisAAD方法,通过生成-判别架构引导轻量级代理模型学习黑盒LLM的输出分布高质量区域,从而有效估计其不确定性。实验表明,即使代理模型仅占目标LLM大小的1%,也能实现可靠的不确定性量化。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06847 2026-05-08 cs.SE 50%

Characterizing Faults in Agentic AI: A Taxonomy of Types, Symptoms, and Root Causes

代理AI中的故障特征化:故障类型、症状和根本原因的分类

Mehil B Shah, Mohammad Mehdi Morovati, Mohammad Masudur Rahman, Foutse Khomh

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文通过实证研究,提出代理AI系统故障的分类体系,涵盖34种故障类型,揭示其在结构化输出解释、工具调用、运行时执行和异常处理中的表现,以及数据模式不匹配、依赖漂移等根本原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05501 2026-05-08 cs.CR 50%

SOCpilot: Verifying Policy Compliance for LLM-Assisted Incident Response

SOCpilot: 验证LLM辅助事件响应中的政策合规性

Sidnei Barbieri, Leonardo Vaz de Meneses, Ágney Lopes Roth Ferraz, Lourenço Alves Pereira Júnior

专题命中 测试时计算 :verifier(abstract)

AI总结 SOCpilot通过固定事件包、行动目录、政策规则和验证器,验证LLM辅助事件响应计划的合规性,评估两个LLM提供商在金融行业案例中的表现,去除非合规动作并提供零成本准备检查。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 17 篇

2510.02312 2026-05-08 cs.LG 87%

KaVa: Latent Reasoning via Compressed KV-Cache Distillation

KaVa:通过压缩KV缓存蒸馏实现潜在推理

Anna Kuzina, Maciej Pioro, Paul N. Whatmough, Babak Ehteshami Bejnordi

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG

AI总结 KaVa通过压缩KV缓存蒸馏实现潜在推理,利用连续潜在标记的表示灵活性对齐逐步KV轨迹,有效提升复杂自然语言推理任务的性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28192 2026-05-08 cs.RO cs.CV 87%

LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning

LaST-R1:通过自适应物理潜在推理强化机器人操作

Hao Chen, Jiaming Liu, Zhonghao Yan, Nuowei Han, Renrui Zhang, Chenyang Gu, Jialin Gao, Ziyu Guo, Siyuan Qian, Yinxi Wang, Peng Jia, Shanghang Zhang, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机学院) Simplexity Robotics Project(Simplexity机器人项目)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出LaST-R1,一种基于强化学习的后训练框架,通过联合优化潜在推理过程和动作生成,提升机器人在动态环境中的适应性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05737 2026-05-08 cs.AI cs.CL 86%

ReFlect: An Effective Harness System for Complex Long-Horizon LLM Reasoning

ReFlect:一种有效的复杂长周期LLM推理Harness系统

Fan Huang

机构 * Indiana University Bloomington(印第安纳大学布卢明顿)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 ReFlect通过创建确定性封装逻辑,有效检测和恢复LLM推理中的错误,提升多阶段任务的成功率,尤其在SWE-bench中显著提高代码补全质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05678 2026-05-08 cs.AI 83%

Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering

风险链:大型推理模型中的安全故障及通过自适应多原则引导的缓解

Xiaomin Li, Jianheng Hou, Zheyuan Deng, Zhiwei Zhang, Taoran Li, Binghang Lu, Bing Hu, Yunhan Zhao, Yuexing Hao

机构 * Harvard University(哈佛大学) University of Southern California(南加州大学) Brown University(布朗大学) Pennsylvania State University(宾夕法尼亚州立大学) Texas A&M University(德克萨斯阿姆大学) Purdue University(普渡大学) University of California, Irvine(加州大学 Irvine 分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究发现大型推理模型在推理轨迹中存在额外安全风险,提出自适应多原则引导方法降低不安全内容出现率,提升整体安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06285 2026-05-08 cs.CL cs.LG 81%

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG

LatentRAG: 基于潜在空间的高效代理RAG推理与检索

Yijia Zheng, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 LatentRAG通过将推理与检索从离散语言空间转移到连续潜在空间,提升代理RAG的效率,实验表明其在七种基准数据集上性能与显式方法相当,推理延迟降低约90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11509 2026-05-08 cs.CL cs.AI cs.CV 81%

Multimodal Fact-Level Attribution for Verifiable Reasoning

多模态事实级归因用于可验证推理

David Wan, Han Wang, Ziyang Wang, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MuRGAt基准,用于评估多模态事实归因能力,要求模型在复杂推理中生成明确推理和精确引用,揭示强模型在正确推理下仍易产生幻觉,且增加推理深度或结构化归因会降低准确性。

Comments Accepted to ICML 2026. Code and data are available at https://github.com/meetdavidwan/murgat

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05495 2026-05-08 cs.LG 79%

Shortcut Solutions Learned by Transformers Impair Continual Compositional Reasoning

由Transformer学习的快捷方案损害连续组合推理能力

William T. Redman, Erik C. Johnson, Brian Robinson

机构 * Johns Hopkins Applied Physics Lab(约翰霍普金斯应用物理实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 研究探讨了Transformer模型在连续学习中的表现,发现BERT学习快捷方案限制了泛化能力,而ALBERT通过循环结构提升了连续学习性能,但两者在跨经验组合任务中均表现不足。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21187 2026-05-08 cs.CV cs.LG 79%

FRISM: Fine-Grained Reasoning Injection via Subspace-Level Model Merging for Vision-Language Models

FRISM:通过子空间级模型融合实现细粒度推理注入用于视觉-语言模型

Chenyu Huang, Peng Ye, Xudong Tan, Jinhan Mu, Shenghe Zheng, Li Shen, Tao Chen

机构 * College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院,中国) Shanghai Innovation Institute, China(上海创新研究院,中国) The Chinese University of Hong Kong, China(香港中文大学,中国) Harbin Institute of Technology, China(哈尔滨工业大学,中国) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) Sun Yat-Sen University, Shenzhen, China(暨南大学深圳校区,中国)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 FRISM通过子空间级模型融合实现细粒度推理注入,有效提升视觉-语言模型的推理能力并保持视觉能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20670 2026-05-08 cs.CL cs.AI 73%

CAMEL: Confidence-Gated Reflection for Reward Modeling

CAMEL:基于置信度的反思机制用于奖励建模

Zirui Zhu, Hailun Xu, Yang Luo, Yong Liu, Kanchan Sarkar, Kun Xu, Yang You

机构 * National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 CAMEL通过置信度门控机制实现轻量级偏好决策,并选择性地对低置信度实例进行反思,采用反事实前缀增强的强化学习训练,提升了奖励建模的准确性和效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05920 2026-05-08 cs.AR cs.AI cs.PF 70%

LLM-Driven Design Space Exploration of FPGA-based Accelerators

基于FPGA的加速器的LLM驱动的设计空间探索

Vinamra Sharma, Xingjian Fu, Jude Haris, José Cano

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出SECDA-DSE框架,利用大语言模型自动化FPGA加速器的设计空间探索,通过结构化探索器和LLM栈实现高效配置生成与优化。

Comments Accepted to the Workshop on Intelligent System Design (InSyDe) co-located with EuroSys '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06614 2026-05-08 cs.AI cs.CL 62%

SkillOS: Learning Skill Curation for Self-Evolving Agents

SkillOS: 为自演化代理学习技能编目

Siru Ouyang, Jun Yan, Yanfei Chen, Rujun Han, Zifeng Wang, Bhavana Dalvi Mishra, Rui Meng, Chun-Liang Li, Yizhu Jiao, Kaiwen Zha, Maohao Shen, Vishy Tirumalashetty, George Lee, Jiawei Han, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SkillOS通过经验驱动的强化学习方法,解决自演化代理中复杂长期技能编目的学习问题,优于记忆-free和强记忆基线,在效果和效率上均表现优异,技能库逐步演变成更丰富的Markdown文件。

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05716 2026-05-08 cs.AI cs.CL 62%

More Is Not Always Better: Cross-Component Interference in LLM Agent Scaffolding

更多并不总是更好:LLM代理构建中的跨组件干扰

Ming Liu

机构 * Amazon(亚马逊)

专题命中 复杂问题求解 :planning(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM代理系统中组件交互导致的性能下降,发现最优组件数量依赖任务和模型规模,贪心选择不可靠,需通过交互分析进行任务特定子集选择。

Comments 10 pages, 5 tables; preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01627 2026-05-08 cs.LG 57%

Importance-Guided Basis Selection for Low-Rank Decomposition of Large Language Models

基于重要性的基选择用于大型语言模型的低秩分解

Daniel Agyei Asante, Ernie Chang, Yang Li

机构 * Iowa State University(爱荷华州立大学) Meta

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出BSI框架,通过估计移除每个基所导致的损失增加来选择和剪枝基,提升低秩分解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18738 2026-05-08 cs.CL 57%

Remask, Don't Replace: Token-to-Mask Refinement in Diffusion Large Language Models

重新标记,而非替换:扩散大语言模型中的令牌到标记细化

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL

AI总结 本文提出Token-to-Mask(T2M)方法,通过重新标记可疑令牌而非覆盖来提升扩散大语言模型的准确性,在AIME 2025和CMATH上分别提升13.33和8.56个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22382 2026-05-08 cs.LG 57%

Purely Agent-Driven Black-Box Optimization for Biological Design

纯粹的基于代理的黑盒优化用于生物设计

Natalie Maus, Yimeng Zeng, Haydn Thomas Jones, Yining Huang, Gaurav Ng Goel, Alden Rose, Kyurae Kim, Hyun-Su Lee, Marcelo Der Torossian Torres, Fangping Wan, Cesar de la Fuente-Nunez, Mark Yatskar, Osbert Bastani, Jacob R. Gardner

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出PABLO框架,通过基于语言的代理方法在生物设计中实现高效黑盒优化,提升样本效率和目标值,展示其在抗微生物肽优化中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04378 2026-05-08 cs.LG cs.CV stat.ML 57%

Aligned explanations in neural networks

神经网络中的对齐解释

Corentin Lobet, Francesca Chiaromonte

机构 * Institute of Economics and L’EMbEDS, Sant’Anna School of Advanced Studies(经济学研究所和L’EMbEDS,圣安娜高级研究院) Dept. of Statistics and Huck Institutes of the Life Sciences, Penn State University(统计系和生命科学学院,宾夕法尼亚州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出PiNets,一种伪线性架构,通过实例级线性模型实现解释与预测的对齐,验证了其在图像分类和分割任务中解释的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00117 2026-05-08 cs.RO cs.AI 57%

PEPA: a Persistently Autonomous Embodied Agent with Personalities

PEPA:具有个性的持续自主体

Kaige Liu, Yang Li, Lijun Zhu, Weinan Zhang

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PEPA框架,通过三层认知架构实现持续自主,利用个性特质自主生成目标并维持行为演化,实验证明其在动态环境中稳定运行。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 36 篇

2605.06165 2026-05-08 cs.AI 87%

Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost

事后推理:在不增加成本的情况下提升非思考模型的性能

Richmond Sin Jing Xuan, Rishabh Bhardwaj, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,summary_cn);分类 cs.AI

AI总结 本文提出Post-Reasoning方法,通过在生成最终回答后让模型解释答案,提升指令微调模型的性能,且不增加延迟或token成本,在117种模型-基准设置中提升了88.19%的性能,平均相对提升17.37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07830 2026-05-08 cs.AI 87%

Time Series Reasoning via Process-Verifiable Thinking Data Synthesis and Scheduling for Tailored LLM Reasoning

通过过程可验证的思维数据合成与调度实现时间序列推理

Jiahui Zhou, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Lin Li, Zhuomin Chen, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米公司) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出VeriTime框架,通过数据合成、调度和强化学习训练,提升LLM在时间序列推理任务中的性能,使小模型达到或超越大模型效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03227 2026-05-08 cs.AI 81%

Evaluating Prompting and Execution-Based Methods for Deterministic Computation in LLMs

评估基于提示和执行的方法在LLM中确定性计算中的表现

Hongkun Yu

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文评估了多种提示策略在需要精确输出的任务中的表现,发现PoT通过生成可执行代码实现完美准确率,而其他方法存在误差积累或计算开销大等问题。

Comments 8 pages, 1 figure. Code and dataset available at https://github.com/bigbird231/llm-exact-computation-dataset

详情

展开后加载摘要…

URL PDF HTML 收藏