arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-13 至 2026-05-13 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 11 篇

2605.11467 2026-05-13 cs.LG cs.AI 90%

Drop the Act: Probe-Filtered RL for Faithful Chain-of-Thought Reasoning

摒弃表演:用于忠实推理链的探针过滤强化学习

Swapnil Parekh

机构 * Intuit

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ProFIL方法,通过探针过滤强化学习减少推理链中的表演现象,提升推理链的忠实度并缩短链长,同时在多个领域和模型架构中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11629 2026-05-13 cs.CL 87%

OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models

OmniThoughtVis: 一种可扩展的蒸馏流水线,用于可部署的多模态推理模型

Yuanhao Yue, Chengyu Wang, Yuanjie Lyu, Lei Shen, Jun Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出OmniThoughtVis流水线,通过大规模多模态Co T监督将高容量教师模型的推理能力转移到小型部署模型,实现了在多个基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11011 2026-05-13 cs.LG cs.AI 73%

LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models

LoopUS: 将预训练大语言模型转换为循环潜在细化模型

Taekhyun Park, Yongjae Lee, Dohee Kim, Hyerim Bae

机构 * Department of Data Science(数据科学系) Department of Industrial Engineering(工业工程系) Pusan National University(釜山国立大学) Changwon National University(昌原国立大学)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 LoopUS通过循环架构提升LLM推理性能,无需重新训练,采用四个核心组件稳定模型并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12446 2026-05-13 cs.LG cs.CL 62%

ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models

ORCE:面向大型语言模型中明确自信度的顺序感知对齐

Chen Li, Xiaoling Hu, Songzhu Zheng, Jiawei Zhou, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Morgan Stanley(摩根大通)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种解耦且顺序感知的明确自信度校准框架,通过分离自信度估计与答案生成过程,提升校准和失败预测性能,同时保持答案准确性。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03206 2026-05-13 cs.AI cs.CL 62%

Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner

连续离散扩散:使你的扩散语言模型成为潜在推理器

Cai Zhou, Chenxiao Yang, Yi Hu, Chenyu Wang, Chubin Zhang, Muhan Zhang, Lester Mackey, Tommi Jaakkola, Stephen Bates, Dinghuai Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院) Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥)) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CCDD模型,结合连续和离散空间,提升扩散语言模型的表达能力和训练效果,通过联合多模态扩散过程实现高质量的生成与推理。

Comments 29 pages. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11986 2026-05-13 cs.AI 57%

On the Limitations of Large Language Models for Conceptual Database Modeling

大型语言模型在概念数据库建模中的局限性

Arthur F. Siqueira, Carlos D. S. Nogueira, Eduarda Farias, Claudio E. C. Campelo, Júlia Menezes

机构 * Systems and Computing Department(系统与计算系)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型在生成实体关系图方面的能力,发现其在复杂场景中可靠性下降,存在不一致和模糊性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11882 2026-05-13 cs.AI 57%

On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment

通过失败轨迹实现的在线自我进化以实现代理安全对齐

Bo Yin, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出FATE框架,通过将验证者评分的失败轨迹转化为修复监督,结合Pareto-Front Policy Optimization方法,提升代理安全性同时保持有用行为,实验显示在不同模型和规模上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10235 2026-05-13 cs.CL 57%

Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection

在检索前路由:激活大语言模型的潜在路由能力用于RAG与长上下文选择

Yiwen Chen, Kuan Li, Fuzhen Zhuang, Deqing Wang, Zhao Zhang, Liwen Zhang, Yong Jiang, Shuai Wang, Minhao Cheng

机构 * Beihang University(北航) HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Pre-Route框架,通过结构化推理提前决策,利用轻量级元数据进行任务分析和信息需求预测,实现可解释且高效的路由决策,实验表明其在成本效益上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01202 2026-05-13 cs.IT cs.AI math.IT 57%

Forget BIT, It is All about TOKEN: Towards Semantic Information Theory for LLMs

忘掉BIT,一切关于TOKEN:面向大语言模型的语义信息理论

Bo Bai

机构 * Bo Bai(白波)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出语义信息理论,将TOKEN作为意义载体,重构注意力机制和Transformer模型,建立预训练、强化学习和推理中的信息度量方法,明确下一token预测与格兰杰因果推断的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03853 2026-05-13 cs.CV 50%

UGround: Towards Unified Visual Grounding with Unrolled Transformers

UGround: 向统一视觉接地迈进的展开变换

Rui Qian, Xin Yin, Chuanhang Deng, Zhiyuan Peng, Jian Xiong, Wei Zhai, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Zhejiang University(浙江大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 UGround通过引入Policy-Prompted Masking机制,动态选择展开变换层作为掩码提示,解决传统方法依赖固定最后一层和隐式投影的问题,统一了从传统参照表达分割到新提出的推理分割等多种视觉接地任务。

Comments This work has been accepted to ICML 2026, please refer to https://github.com/rui-qian/UGround

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11664 2026-05-13 cs.CR 50%

Safety Context Injection: Inference-Time Safety Alignment via Static Filtering and Agentic Analysis

安全上下文注入:通过静态过滤和代理分析实现推理时的安全对齐

Zhenhao Xu, Wenhan Chang, Yichuan Chen, Yuxin Fang, Junhao Liu, Tianqing Zhu

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出Safety Context Injection框架,通过静态过滤和代理分析在推理阶段提升模型安全性,减少攻击成功率和毒性。

Comments 17pages, 6 figures, 8tables

详情

展开后加载摘要…

URL PDF HTML 收藏