arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-08 至 2026-05-08 共收录 144 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 22 篇

2605.05329 2026-05-08 cs.AI cs.LG 62%

Understanding Annotator Safety Policy with Interpretability

通过可解释性理解标注者安全政策

Alex Oesterling, Donghao Ren, Yannick Assogba, Dominik Moritz, Sunnie S. Y. Kim, Leon Gatys, Fred Hohman

机构 * Harvard University(哈佛大学) Apple(苹果公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Annotator Policy Models,通过学习标注行为揭示安全政策差异,解决标注分歧根源问题,提升安全政策设计的透明性和包容性。

Comments 38 pages, 13 figures, ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00742 2026-05-08 cs.AI cs.LG stat.ML 62%

Position: agentic AI orchestration should be Bayes-consistent

位置:代理AI协调应具有贝叶斯一致性

Theodore Papamarkou, Pierre Alquier, Matthias Bauer, Wray Buntine, Andrew Davison, Gintare Karolina Dziugaite, Maurizio Filippone, Andrew Y. K. Foong, Vincent Fortuin, Dimitris Fouskakis, Jes Frellsen, Eyke Hüllermeier, Theofanis Karaletsos, Mohammad Emtiyaz Khan, Nikita Kotelevskii, Salem Lahlou, Yingzhen Li, Fang Liu, Clare Lyle, Thomas Möllenhoff, Konstantina Palla, Maxim Panov, Yusuf Sale, Kajetan Schweighofer, Artem Shelmanov, Siddharth Swaroop, Martin Trapp, Willem Waegeman, Andrew Gordon Wilson, Alexey Zaytsev

机构 * ESSEC Business School(ESSEC商学院) VinUniversity(文大学) Imperial College London(伦敦帝国理工学院) Mila - Quebec AI Institute(魁北克人工智能研究所) Technical University of Denmark(丹麦技术大学) Pyramidal Inc.(Pyramidal公司) University of Notre Dame(诺特大学) Cognizant AI Lab(Cognizant人工智能实验室) University College London(伦敦大学学院) KTH Royal Institute of Technology(瑞典皇家理工学院) Ghent University(根特大学) New York University(纽约大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在代理AI系统中,贝叶斯原则在协调层的应用,而非LLM参数,以提升决策一致性和协作效率。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19043 2026-05-08 cs.AI 61%

Learning Lifted Action Models from Unsupervised Visual Traces

从无监督视觉轨迹中学习提升的动作模型

Kai Xi, Stephen Gould, Sylvie Thiébaux

机构 * School of Computing, The Australian National University(澳大利亚国立大学计算机学院)

专题命中 规划推理 :planning(abstract,comments);分类 cs.AI

AI总结 本文提出一种深度学习框架,通过无监督视觉轨迹学习状态预测、动作预测及提升的动作模型,并引入混合整数线性规划防止预测崩溃,提升模型在多领域中的全局一致性。

Comments Accepted to the 36th International Conference on Automated Planning and Scheduling (ICAPS-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10729 2026-05-08 cs.AI 61%

Contestable AI needs Computational Argumentation

可争议的AI需要计算论辩

Francesco Leofante, Hamed Ayoobi, Adam Dejl, Gabriel Freedman, Deniz Gorur, Junqi Jiang, Guilherme Paulino-Passos, Antonio Rago, Anna Rapberger, Fabrizio Russo, Xiang Yin, Dekai Zhang, Francesca Toni

机构 * Computational Logic and Argumentation Group, Department of Computing, Imperial College London, UK(计算逻辑与论证组,计算系,伦敦帝国学院,英国)

专题命中 规划推理 :reasoning(abstract,journal_ref);分类 cs.AI

AI总结 本文探讨如何通过计算论辩实现可争议的AI,强调动态可解释性和决策过程的重要性,以支持机器与人类或机器间的互动和争议解决。

Comments Accepted at KR 2024

Journal ref Proceedings of the International Conference on Principles of Knowledge Representation and Reasoning, 21, 888-896. 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03213 2026-05-08 cs.CR cs.AI 57%

When Agents Handle Secrets: A Survey of Confidential Computing for Agentic AI

当代理处理秘密:关于代理AI的保密计算调查

Javad Forough, Marios Kogias, Hamed Haddadi

机构 * Department of Computing Imperial College London London, United Kingdom(计算系帝国理工学院伦敦英国)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文探讨了代理AI中保密计算的应用,分析了六个TEE平台的设计,提出了基于代理的威胁模型,并指出了六个开放挑战,旨在为生产级代理AI提供安全基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05702 2026-05-08 cs.AI 57%

Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents

知识图谱路径作为自演化搜索代理的中间监督

Huyu Wu, Jun Liu, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过利用知识图谱路径作为中间监督,改进自演化搜索代理的提问生成和奖励塑造,解决传统方法中提问孤立和奖励信息不足的问题,提升多跳问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05643 2026-05-08 cs.AI cs.IR 57%

Text-Graph Synergy: A Bidirectional Verification and Completion Framework for RAG

文本-图协同:一种双向验证与完成框架用于RAG

Jiarui Zhong, Hong Cai Chen

机构 * School of Automation, Southeast University(自动化学院,东南大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TGS-RAG框架,通过双向机制融合文本与图结构,解决传统RAG中信息孤岛问题,提升多跳推理性能。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05544 2026-05-08 cs.LG cs.RO 57%

Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning

自适应Q分块用于离线到在线强化学习

Nandiraju Gireesh, Yuanliang Ju, He Wang

机构 * Peking University(北京大学) Galbot University of Toronto(多伦多大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出自适应Q分块方法,通过动态选择不同分块大小的 critic 来解决离线到在线强化学习中的偏置问题,提升在 OGBench 和 Robomimic 上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05538 2026-05-08 cs.AI cs.IR 57%

AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases

AgenticRAG:企业知识库中的代理检索

Susheel Suresh, Hazel Mak, Shangpo Chou, Fred Kroon, Sahil Bhatnagar

机构 * Microsoft Corporation(微软公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AgenticRAG通过在现有企业检索基础设施上叠加轻量级代理框架,使语言模型能够自主迭代检索信息、导航文档并分析证据,提升了检索准确率和事实性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05499 2026-05-08 cs.AI 57%

FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis

FoodCHA:多模态LLM代理用于细粒度食物分析

Woojin Lee, Pranav Mekkoth, Ye Tian, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出FoodCHA,一种多模态代理框架,通过分层决策过程提升食物识别的细粒度属性区分能力,实验显示其在类别和子类识别精度上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05475 2026-05-08 cs.AI 57%

Intentionality is a Design Decision: Measuring Functional Intentionality for Accountable AI Systems

意图性是一种设计决策:测量功能意图性以实现可问责的AI系统

Allessia Chiappetta, Robert Mahari

机构 * CodeX, The Stanford Center for Legal Informatics(CodeX,斯坦福法律信息学中心)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出功能意图性测试(FIT)框架,用于量化AI系统意图性行为,通过五维指标评估系统意图性,以实现对高自主性系统的可控问责。

Journal ref AutomationXP26 Workshop of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05242 2026-05-08 cs.IR cs.AI 57%

Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

超越语义相似性:通过直接语料交互重新思考代理搜索的检索

Zhuofeng Li, Haoxiang Zhang, Cong Wei, Pan Lu, Ping Nie, Yi Lu, Yuyang Bai, Shangbin Feng, Hangxiao Zhu, Ming Zhong, Yuyu Zhang, Jianwen Xie, Yejin Choi, James Zou, Jiawei Han, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(圣地亚哥大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Verdent AI Lambda

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出直接语料交互(DCI)方法,通过通用终端工具直接搜索原始语料,无需嵌入模型或检索接口,有效提升代理搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08403 2026-05-08 cs.AI 57%

Owen-Shapley Policy Optimization: A Principled RL Algorithm for Generative Search LLMs

Owen-Shapley策略优化:一种为生成搜索语言模型设计的原理性强化学习算法

Abhijnan Nath, Alireza Bagheri Garakani, Tianchen Zhou, Fan Yang, Yan Gao, Nikhil Krishnaswamy

机构 * Amazon Science(亚马逊科学) Situated Grounding and Natural Language (SIGNAL) Lab, Colorado State University(情境 grounding 和自然语言(SIGNAL)实验室,科罗拉多州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Owen-Shapley策略优化算法,通过基于令牌边际贡献的序列优势再分配,解决生成搜索语言模型中因稀疏序列奖励导致的信用分配问题,实验表明其在Amazon ESCI和H&M Fashion数据集上表现优异。

Comments Added additional experiments, computational analysis and further revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06537 2026-05-08 cs.CV 50%

MedHorizon: Towards Long-context Medical Video Understanding in the Wild

MedHorizon:迈向真实场景下的长上下文医学视频理解

Bodong Du, Bowen Liu, Yang Yu, Xinpeng Ding, Zhiheng Wu, Shuning Wang, Shuo Nie, Naiming Liu, Qifeng Chen, Yangqiu Song, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Baidu Inc.(百度公司) Xidian University(西安电子科技大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 MedHorizon提出一个真实场景下的长上下文医学视频理解基准,通过稀疏证据和多跳临床推理评估,揭示当前系统在完整流程理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26240 2026-05-08 cs.RO cs.MA cs.NE 50%

SwarmCoDe: A Scalable Co-Design Framework for Heterogeneous Robot Swarms via Dynamic Speciation

SwarmCoDe:一种通过动态种群划分实现异构机器人群规模化协同设计的框架

Andrew Wilhelm, Josie Hughes

机构 * Department of Mechanical Engineering, École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑分校机械工程系)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出SwarmCoDe框架,通过动态种群划分自动扩展机器人群异质性以匹配任务复杂度,实现大规模异构机器人群的协同设计优化。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17419 2026-05-08 cs.CV 50%

EAGLE: Expert-Augmented Attention Guidance for Tuning-Free Industrial Anomaly Detection in Multimodal Large Language Models

EAGLE:专家增强的注意力引导用于多模态大语言模型中的无调优工业异常检测

Xiaomeng Peng, Xilang Huang, Seon Han Choi

机构 * Ewha Womans University(峨山女子大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 EAGLE通过整合专家异常检测器与冻结的MLLM,提出无调优框架,提升多模态大语言模型在工业异常检测中的准确率,且在MVTec-AD和VisA数据集上达到94.4%和88.1%的异常鉴别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 10 篇

2605.06308 2026-05-08 cs.AI 87%

Measuring Black-Box Confidence via Reasoning Trajectories: Geometry, Coverage, and Verbalization

通过推理轨迹测量黑盒置信度:几何、覆盖度与 verbalization

Marc Boubnovski Martell, Josefa Lia Stoisser, Kaspar Märtens, Jialin Yu, Robert Kitchen, Philip Torr, Jesper Ferkinghoff-Borg

机构 * Novo Nordisk(诺华北欧) University of Oxford(牛津大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出一种通过推理轨迹测量黑盒置信度的方法,结合几何、覆盖度和 verbalization 通道,在多个基准测试中提升了置信度估计的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07516 2026-05-08 cs.AI cs.CL 84%

CompassLLM: A Multi-Agent Approach toward Geo-Spatial Reasoning for Popular Path Query

CompassLLM: 一种面向流行路径查询的多智能体方法

Md. Nazmul Islam Ananto, Shamit Fatin, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) University of Utah(犹他大学) Monash University(莫纳什大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CompassLLM通过多智能体框架解决流行路径查询问题,结合空间推理能力提升搜索和生成性能,实验显示其在准确性和成本效益方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06121 2026-05-08 cs.CV 83%

Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning

Pest-Thinker: 通过强化学习学习像昆虫学家一样思考和推理

Xueheng Li, Yu Wang, Tao Hu, Ji Huang, Ke Cao, Qize Yang, Rui Li, Jie Zhang, Chengjun Xie

机构 * Institute of Intelligent Machines, Hefei Institute of Physical Science, Chinese Academy of Sciences(智能机器研究所、合肥物理科学研究所、中国科学院) University of Science and Technology of China(中国科学技术大学) Zhongke Hefei Institute of Technology Innovation Engineering(中科创新合肥科技研究院) Hefei University of Technology(合肥工业大学)

专题命中 视觉空间推理 :chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);reasoning(abstract)

AI总结 本文提出Pest-Thinker框架,通过强化学习提升多模态大语言模型对害虫形态的细粒度理解,构建了两个高精度害虫基准数据集,并通过监督微调和GRPO优化提升模型在农业害虫识别中的表现。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01719 2026-05-08 cs.CL 79%

What MLLMs Learn about When they Learn about Multimodal Reasoning

大语言模型在学习多模态推理时所学的内容

Jiwan Chung, Neel Joshi, Pratyusha Sharma, Youngjae Yu, Vibhav Vineet

机构 * Microsoft Research AI Frontiers(微软研究院人工智能前沿) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MathLens基准测试,通过分解性能为感知、推理和多模态特定组件,揭示多模态推理模型评估中隐含的假设。研究显示,不同训练策略导致的能力谱系不同,多模态特定错误占比上升,表明进展反映的是子技能平衡变化而非统一提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05953 2026-05-08 cs.CL cs.AI 62%

Hallucination as an Anomaly: Dynamic Intervention via Probabilistic Circuits

幻觉作为异常:通过概率电路进行动态干预

Erik Nielsen, Elia Cunegatti, Marcus Vukojevic, Giovanni Iacca

机构 * Department of Information Engineering and Computer Science(信息工程与计算机科学系) University of Trento(特伦托大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PCNET,通过概率电路估计LLM残差流密度,检测幻觉作为几何异常,从而改进幻觉纠正,减少错误生成并提升事实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05593 2026-05-08 cs.AI 57%

Causal Probing for Internal Visual Representations in Multimodal Large Language Models

多模态大语言模型内部视觉表征的因果探测

Zehao Deng, Tianjie Ju, Zheng Wu, Liangbo He, Jun Lan, Huijia Zhu, Weiqiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Ant Group(蚂蚁集团)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过激活引导框架系统干预四个视觉概念类别,揭示实体记忆局部化与抽象概念全局分布的差异,发现模型深度对复杂抽象概念编码至关重要,且反向引导揭示感知与生成之间的补偿机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03989 2026-05-08 cs.AI 57%

An Agent-Oriented Pluggable Experience-RAG Skill for Experience-Driven Retrieval Strategy Orchestration

面向经验的可插拔经验型RAG技能:用于经验驱动的检索策略编排

Dutao Zhang, Tian Liao

机构 * Macao Polytechnic University(澳门理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出经验型RAG技能,通过分析场景和经验记忆选择合适检索策略,提升多任务检索效果,实测在多个数据集上优于固定检索基线。

Comments Preprint. 6 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06624 2026-05-08 cs.CV 50%

Chameleon: Benchmarking Detection and Backtracking on Commercial-Grade AI-Generated Videos

Chameleon:商业级AI生成视频的检测与回溯基准测试

Xingming Liao, Meiyu Zeng, Canyu Chen, Nankai Lin, Zhuowei Wang, Aimin Yang

机构 * School of Computer Science and Technology, Guangdong University of Technology(广东工业大学计算机科学与技术学院) School of Information Science and Technology, Guangdong University of Foreign Studies(广东外国语言文化大学信息科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Chameleon基准测试,针对商业级AI生成视频进行检测与回溯,包含1700个视频,涵盖新闻、语音、推荐三大领域,评估模型在真实场景下的检测与溯源能力。

Comments Accepted by ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05886 2026-05-08 cs.CV 50%

Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models

无需训练的多模态大语言模型密集手部接触估计

Daniel Sungho Jung, Kyoung Mu Lee

机构 * IPAI Dept. of ECE & ASRI, Seoul National University(电子工程与自动控制研究所,首尔国立大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出ContactPrompt,利用多模态大语言模型进行无需训练的密集手部接触估计,通过引入详细的部位分割和部分顶点网格表示,结合多阶段结构化接触推理,实现高精度的接触预测。

Comments Project page: https://contactprompt-release.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22812 2026-05-08 cs.CV 50%

LC4-DViT: Land-cover Creation for Land-cover Classification with Deformable Vision Transformer

LC4-DViT:基于变形视觉Transformer的土地覆盖创建用于土地覆盖分类

Kai Wang, Siyi Chen, Weicong Pang, Chenchen Zhang, Renjun Gao, Ziru Chen, Cheng Li, Dasa Gu, Rui Huang, Alexis Kai Hon Lau

机构 * HKUST(香港科技大学) SSE, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)电子工程系) JHU(约翰·霍普金斯大学) NUS(新加坡国立大学) MUST(慕斯大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出LC4-DViT框架,结合生成数据创建与变形感知视觉Transformer,提升高分辨率土地覆盖制图精度,优于基线模型和传统网络。

Comments This work has been submitted to the IEEE for possible publication.The project is available at https://github.com/weicongpang/LVC2-DViT.git

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 14 篇

2508.16745 2026-05-08 cs.LG cs.AI 88%

Beyond Memorization: Extending Reasoning Depth with Recurrence, Memory and Test-Time Compute Scaling

超越记忆:通过递归、记忆和测试时计算扩展推理深度

Ivan Rodkin, Daniil Orel, Konstantin Smirnov, Arman Bolatov, Bilal Elbouardi, Besher Hassan, Yuri Kuratov, Aydar Bulatov, Preslav Nakov, Timothy Baldwin, Artem Shelmanov, Mikhail Burtsev

机构 * MBZUAI(马克斯·普朗克智能研究院) MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室) London Institute for Mathematical Sciences(伦敦数学科学研究所)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过细胞自动机框架探讨多步推理机制,发现LLM在推理步骤增加时性能下降,递归、记忆和测试时计算能提升结果但有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05893 2026-05-08 cs.CL cs.AI 88%

Logic-Regularized Verifier Elicits Reasoning from LLMs

逻辑正则化的验证器激发大语言模型的推理

Xinyu Wang, Changzhi Sun, Lian Cheng, Yuanbin Wu, Dell Zhang, Xiaoling Wang, Xuelong Li

机构 * Department of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术系) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LOVER,一种基于逻辑规则的无监督验证器,通过内在激活和三个逻辑约束提升LLM推理能力,实验表明其性能优于无监督基线,接近监督验证器水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06116 2026-05-08 cs.AI 87%

Policy-Guided Stepwise Model Routing for Cost-Effective Reasoning

基于策略的分步模型路由以实现高效推理

Wenwen Si, Insup Lee, Osbert Bastani

机构 * Department of Computer and Information Science(计算机与信息科学系)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出了一种基于策略的分步模型路由方法,通过强化学习和阈值校准优化性能与效率的平衡,提升了数学基准测试中的准确率与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05561 2026-05-08 cs.AI 83%

BitCal-TTS: Bit-Calibrated Test-Time Scaling for Quantized Reasoning Models

BitCal-TTS:用于量化推理模型的位校准测试时间缩放

Sai Babu Patarlapalli, Surya Teja Avvaru

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出BitCal-TTS,一种轻量级运行时控制器,通过在线代理、位条件置信度重缩放和位感知后标记确认范围,提升量化推理模型的准确率和稳定性。

Comments 17 pages, 5 figures, 4 tables. Code and reproducibility materials at https://github.com/Saibabu7770/bitcal-tts

详情

展开后加载摘要…

URL PDF HTML 收藏