arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-17 至 2026-03-17 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 10 篇

2603.14636 2026-03-17 cs.SD cs.AI cs.CL eess.AS 90%

Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models

引导隐藏状态:用于大音频-语言模型链式推理的无训练模型引导

Lok-Lam Ieong, Chia-Chien Chen, Chih-Kai Yang, Yu-Han Huang, An-Yu Cheng, Hung-yi Lee

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究通过无训练的模型引导方法提升大音频-语言模型的推理能力,采用多种信息源策略在四个模型和四个基准上进行评估,结果显示推理准确率提升达4.4%,并发现跨模态迁移效应。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13274 2026-03-17 cs.LG cs.AI 88%

Learning from Partial Chain-of-Thought via Truncated-Reasoning Self-Distillation

通过截断推理自蒸馏学习部分推理链

Gianluigi Silvestri, Edoardo Cetin

机构 * Radboud University(拉德堡德大学) Sakana AI(萨卡纳人工智能)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TRSD方法,通过自蒸馏提升模型在截断推理下的鲁棒性,减少计算开销并提高推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07685 2026-03-17 cs.CV cs.AI cs.LG 86%

Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought

增强推理的多模态链式推理

Shin'ya Yamaguchi, Kosuke Nishida, Daiki Chijiwa

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RED方法,通过KL约束奖励最大化提升多模态链式推理的准确性和忠实度,实验表明其在多个基准和模型上显著优于传统方法。

Comments Accepted to CVPR 2026 (Main); Code is available at https://github.com/yshinya6/red/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20072 2026-03-17 cs.CL cs.AI 86%

Incentivizing Strong Reasoning from Weak Supervision

通过弱监督激励强推理

Yige Yuan, Teng Xiao, Shuchang Tao, Xue Wang, Jinyang Gao, Bolin Ding, Bingbing Xu

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文研究如何在无需高成本示范和强化学习的情况下,通过弱监督模型激励大语言模型的推理能力,发现弱监督能有效提升推理性能,接近强化学习的效果,且成本更低。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15417 2026-03-17 cs.LG cs.AI cs.CL cs.CR 82%

Amplification Effects in Test-Time Reinforcement Learning: Safety and Reasoning Vulnerabilities

测试时强化学习中的放大效应:安全性和推理漏洞

Vanshaj Khattar, Md Rafi ur Rashid, Moumita Choudhury, Jing Liu, Toshiaki Koike-Akino, Ming Jin, Ye Wang

机构 * Penn State University(宾夕法尼亚州立大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了测试时训练方法的安全性漏洞,发现测试时强化学习中有害提示注入会放大模型行为,导致推理能力下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14745 2026-03-17 cs.LG 79%

CAMD: Coverage-Aware Multimodal Decoding for Efficient Reasoning of Multimodal Large Language Models

CAMD:面向多模态大语言模型高效推理的覆盖感知多模态解码

Huijie Guo, Jingyao Wang, Lingyu Si, Jiahuan Zhou, Changwen Zheng, Wenwen Qiang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CAMD,通过动态分配计算资源提升多模态大语言模型的推理效率与可靠性,解决解码方法在易例和难例间的计算不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14367 2026-03-17 cs.CV 67%

HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task

HomeGuard: 基于视觉-语言模型的具身安全防护系统用于识别家庭任务中的上下文风险

Xiaoya Lu, Yijin Zhou, Zeren Chen, Ruocheng Wang, Bingrui Sima, Enshen Zhou, Lu Sheng, Dongrui Liu, Jing Shao

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出HomeGuard系统,通过Context-Guided Chain-of-Thought机制,结合定制数据集和强化微调策略,提升家庭任务中风险识别精度,减少误判,同时为后续规划提供空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14825 2026-03-17 cs.CV cs.AI 57%

Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection

双鸟归一投影:通过推理时特征投影在LVLMs中调和安全与效用

Yewon Han, Yumin Seol, EunGyung Kong, Minsoo Jo, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Mobilint

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了安全与效用在LVLMs中的对抗性,提出通过推理时投影消除模态偏差方向以提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12248 2026-03-17 cs.LG 57%

Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models

匹配特征而非标记:基于能量的语言模型微调

Samy Jelassi, Mujin Kwun, Rosie Zhao, Yuanzhi Li, Nicolo Fusi, Yilun Du, Sham M. Kakade, Carles Domingo-Enrich

机构 * Harvard University, Kempner Institute(哈佛大学凯普纳研究所) Microsoft Research New England(微软研究院新英格兰分部)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本文提出基于能量的语言模型微调方法,通过匹配序列级统计信息提升模型表现,无需任务特定验证器或偏好模型,在多个任务中优于传统微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14633 2026-03-17 cs.CR cs.PF 50%

When Scanners Lie: Evaluator Instability in LLM Red-Teaming

当扫描器撒谎:在LLM红队测试中的评估者不稳定性

Lidor Erez, Omer Hofman, Tamir Nizri, Roman Vainshtein

专题命中 测试时计算 :verifier(abstract)

AI总结 本文研究了LLM安全评估中评估者不稳定性问题,提出了一种可靠性意识的评估框架,通过量化评估者分歧和验证方法提升评估准确性,发现22个攻击类别存在评估不稳定现象,使评估准确率从72%提升至89%。

Comments Submitted to the EvalEval Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏