arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-19 至 2026-03-19 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 6 篇

2603.17070 2026-03-19 cs.CL cs.AI 81%

Large Reasoning Models Struggle to Transfer Parametric Knowledge Across Scripts

大推理模型在不同脚本间转移参数知识时面临困难

Lucas Bandarkar, Alan Ansell, Trevor Cohn

机构 * Google Research(谷歌研究) University of California, Los Angeles(加州大学洛杉矶分校) University of Melbourne(墨尔本大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现,大模型在跨语言知识转移中主要受脚本差异影响,通过分析数据和实验表明,提升模型对转写歧义的推理能力可改善跨脚本知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14077 2026-03-19 cs.CL cs.LG 81%

GTS: Inference-Time Scaling of Latent Reasoning with a Learnable Gaussian Thought Sampler

GTS:基于可学习高斯思维采样器的推理时缩放

Minghan Wang, Ye Bai, Thuy-Trang Vu, Ehsan Shareghi, Gholamreza Haffari

机构 * Department of Data Science & AI, Monash University(墨尔本大学数据科学与人工智能系) Faculty of Medicine Dentistry and Health Sciences, University of Melbourne(墨尔本大学医学牙科与健康科学学院) Department of Computer Science, University College London(伦敦大学学院计算机科学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出GTS,通过学习条件分布实现更可控的推理时缩放,改进了传统启发式扰动方法,提升了推理质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17832 2026-03-19 cs.CL cs.AI cs.LG 67%

Text-to-Stage: Spatial Layouts from Long-form Narratives

文本到舞台:从长篇叙述中生成空间布局

Jefferson Hernandez, Swarnadeep Saha, Chenxi Whitehouse, Sanjeel Parekh, Calvin Murdock, Yuliang Li, W. Owen Brimijoin, Vamsi Krishna Ithapu, Ishwarya Ananthabhotla

机构 * Rice University(里士大学) Meta FAIR Meta Reality Labs Research(Meta现实实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究如何通过语言模型从无结构文本推断戏剧舞台布局,提出确定性评估体系和结合拒绝SFT与RL的训练方法,在多个指标上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17811 2026-03-19 cs.LG cs.AI 62%

Dropout Robustness and Cognitive Profiling of Transformer Models via Stochastic Inference

通过随机推断分析变换器模型的丢弃鲁棒性与认知分析

Antônio Junior Alves Caiado, Michael Hahsler

机构 * Lyle School of Engineering, Southern Methodist University, Dallas, TX, USA(莱尔工程学院,南方 Methodist 大学,德克萨斯州达拉斯)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过随机推断分析19种变换器模型的丢弃鲁棒性,揭示其在不确定性应用中的可靠性差异,提出认知分解框架以指导模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05960 2026-03-19 cs.CL 57%

Distilling Feedback into Memory-as-a-Tool

将反馈转化为记忆-as-a-工具

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出通过文件式记忆系统和智能体控制的工具调用来将临时批评转化为可检索的指导方针,从而降低推理时间的推理成本。在Rubric Feedback Bench数据集上实验表明,增强型LLM在测试时能快速匹配精炼管道性能,同时大幅降低推理成本。

Comments Code: https://github.com/vicgalle/feedback-memory-as-a-tool Data: https://huggingface.co/datasets/vicgalle/rubric-feedback-bench

Journal ref ICLR 2026 Workshop on Memory for LLM-Based Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16600 2026-03-19 cs.CV 50%

Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLM Reward Models

原因至关重要:通过代理引导的批评学习可转移的评分标准用于视觉语言模型奖励模型

Weijie Qiu, Dai Guan, Junxin Wang, Zhihang Li, Yongbo Gai, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出Proxy-GRM,通过代理引导的评分标准验证提升视觉语言模型奖励模型的评分质量,利用轻量级代理代理进行评分标准验证,实现评分标准的可转移性和一致性,实验表明其在多个基准测试中表现优异。

Comments 25 pages, 10 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏