arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2607.24300 2026-07-28 cs.CL cs.MA 新提交 57%

Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents

在启发式自我改进智能体中自我编写的验证不可靠

Diandian Guo, Cong Cao, Fangfang Yuan, Yingqi Wang, Yueshan Wang, Dakui Wang

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23273 2026-07-28 cs.IR cs.AI cs.ET 新提交 57%

Statistically Supported LLM Ingredient and Recipe Data Collection in Computational Nutrition

计算营养中统计支持的大语言模型成分与食谱数据收集

James Izzard, Hassan Eshkiki, Fabio Caraffini

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究针对计算营养中成分数据问题,提出结合统计估计、不变性检查和网络获取的大语言模型管道。通过该管道可获取精确数据,在参考集上实现高匹配度并大幅降低误差,将大语言模型辅助数据库构建变为可控流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22602 2026-07-28 cs.AI 新提交 57%

DeepLook: Deeper Thinking with Lookahead

DeepLook:通过前瞻进行更深入思考

Tingxin Yang, Zefeng Wang, Mengyue Wang, Xingcheng Zhou, Yunpu Ma

机构 * Technical University of Munich(慕尼黑工业大学) LMU Munich(慕尼黑大学) MCML, LMU, MemAgents Lab(慕尼黑大学机器学习中心、记忆代理实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在改进大语言模型推理,提出无需训练的DeepLook框架,通过将前瞻计算集中在不确定性瓶颈处,聚合令牌级置信度为段级信号并排序投票。在四个数学基准测试中,该方法改变准确率与令牌成本的帕累托前沿,提升准确率并减少令牌生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22556 2026-07-28 cs.AI 新提交 57%

MIITA: Memory-Induced Inference-Time Adaptation for Continual Learning with Small Language Models

MIITA:用于小语言模型持续学习的内存诱导推理时间自适应

Dong Li, Yanchi Liu, Xujiang Zhao, Wei Cheng, Zhengzhang Chen, Xintao Wu, Zhong Chen, Chen Zhao, Haifeng Chen

机构 * Baylor University(贝勒大学) NEC Laboratories America(美国 NEC 实验室) University of Arkansas(阿肯色大学) Southern Illinois University(南伊利诺伊大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 针对小语言模型持续学习中参数更新致灾难性遗忘及内存不足问题,提出MIITA框架,它通过存储校正方向原型并在推理时检索应用,结合理论分析,在多种设置实验中提升性能并减轻遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21453 2026-07-27 cs.LG 版本更新 57%

Test-Time Scaling via Error Localization

通过错误定位进行测试时缩放

Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta, Deepanway Ghosal, Aravindan Raghuveer

机构 * Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究针对大型语言模型复杂任务性能提升问题,提出通过错误定位进行测试时缩放(TTEL)算法,利用反馈定位错误步骤,截断轨迹并分支新一代,重用有效前缀,在多个基准测试中优于竞争基线。

Comments 10 pages, 8 figures (With appendix: 27 pages, 11 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20852 2026-07-24 cs.AI 新提交 57%

Code Monitor Red Teaming for Public-Test-Passing Code

用于通过公开测试的代码的代码监控红队

Junchi Liao, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究公开测试通过后代码隐藏错误监控问题,引入代码监控红队协议并实例化为代码监控基准。通过大量实验发现弱验证器虽能改进但仍易漏错,对抗性压力影响验证效果,GLM - 5.1验证器缩小部分差距,揭示了验证器故障与证据限制的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20527 2026-07-24 cs.AI 新提交 57%

Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis

评估和保障智能科学合成中的引用忠实性

Taewan Goo, Junsik Kim, Kyulhee Han, GwonYul Jo, Jong-Soo Kim, Tae-Hyung Kim

机构 * Seoul National University(首尔国立大学) BioNexus(生物 Nexus)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究智能语言模型系统引用答案检查的可靠性问题,提出黄金锚定评估协议和可部署防护措施,能验证验证者、测量重新归因,为无支撑引用设限,经多模型和管道验证后作为单GPU工具包发布。

Comments 20 pages, 5 figures. Includes supplementary material (Appendices S1-S6). Open single-GPU reproducibility kit included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20506 2026-07-24 cs.AI 新提交 57%

Optimizing Hypergraph-Based RAG: Toward Better Fact Extraction and Chunk Retrieval

优化基于超图的RAG:迈向更好的事实提取和块检索

Houda Khrouf, Pedro Fillastre, Sebastiao Correia

机构 * Qlik(思略特)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在优化基于超图的RAG,以解决事实提取和块检索问题。方法是采用自一致性提示改进提取,运用个性化PageRank算法增强块检索,贡献在于提升了相关任务的性能。

Comments APIA 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20481 2026-07-24 cs.AI 新提交 57%

Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating

无需训练的路由:通过可靠性门控实现可控比例的大语言模型卸载

Evan Chen, Shiqiang Wang, Kevin S Chan, Su Wang, Christopher Brinton

机构 * Purdue University(普渡大学) University of Exeter(埃克塞特大学) Army Research Laboratory(陆军研究实验室) Princeton University(普林斯顿大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究在资源受限下本地-云端协作部署大语言模型的问题,提出无需训练的CARGO路由框架,通过提示多样化采样等方法估计一致性并控制不确定性,在多任务和模型上表现出色,证明可从本地模型内在行为实现有效协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20439 2026-07-24 cs.CL 新提交 57%

AsymVerify at SemEval-2026 Task 6: Asymmetric Confidence-Gated Verification for Political Evasion Detection

SemEval-2026任务6中的AsymVerify:用于政治逃避检测的非对称置信门控验证

Sebastien Kawada

机构 * Kaons 𝑲 ∗

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 研究针对政治逃避检测难题,提出AsymVerify系统用于SemEval-2026任务6的三元分类。核心方法是对问答对分类后对低置信预测进行非对称验证,主要贡献是取得高排名,在不同数据集上提升宏F1分数,且降低推理成本。

Comments Accepted to SemEval-2026 Task 6 (CLARITY) at ACL 2026. Team AsymVerify placed 2nd of 41 teams on the official Subtask 1 leaderboard. Task: https://konstantinosftw.github.io/CLARITY-SemEval-2026/. Code: https://github.com/kaons-research/AsymVerify-ACL. Website: https://kaons.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19653 2026-07-23 cs.SE cs.AI 新提交 57%

PerfAgent: Profiler-Guided Iterative Refinement for Repository-Level Code Optimization

PerfAgent:用于仓库级代码优化的分析器引导迭代优化

Ryan Deng, Yuanzhe Liu, Bastian Lipka, Yao Ma, Xuhao Chen, Tim Kaler, Jatin Ganhotra

机构 * Massachusetts Institute of Technology(麻省理工学院) Rensselaer Polytechnic Institute(罗切斯特理工学院) IBM(IBM公司) Michigan State University(密歇根州立大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究针对仓库级代码优化难题,提出PerfAgent分析器引导迭代优化方法,该方法能让编码代理找到热点并改进,在两个优化基准测试中大幅提升专家匹配补丁率,且以低成本超越基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16300 2026-07-23 cs.AI 版本更新 57%

Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection

循环代码取证:面向图像伪造检测的代理工具使用

Fanrui Zhang, Qiang Zhang, Sizhuo Zhou, Jianwen Sun, Chuanhao Li, Jiaxin Ai, Yukang Feng, Yujie Zhang, Wenjie Li, Zizhen Li, Yifan Chang, Jiawei Liu, Kaipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ForenAgent框架,通过多轮交互使MLLM自主生成并迭代优化Python工具,提升图像伪造检测的灵活性和可解释性,构建FABench数据集进行系统训练和评估。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18310 2026-07-22 physics.soc-ph cs.AI 新提交 57%

Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling

分布优先的总体模拟:非怪异大语言模型角色建模中的崩溃、校准和召回

Gurkan Ozkan

机构 * Istanbul Technical University(伊斯坦布尔技术大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究非怪异LLM角色建模中独立代理范式的问题,提出分布优先校正方法,通过言语化采样等进行实验,发现原范式有崩溃等问题,校正方法能测量内部不一致性及校准条件。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17715 2026-07-21 cs.CL 新提交 57%

C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference

C$^2$KV:用于高效大语言模型推理的压缩可组合键值缓存重用

Chuheng Du, Junyi Chen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Chaoyue Niu, Shengzhong Liu, Guihai Chen, Fan Wu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 研究针对长上下文LLM推理成本高问题,提出C$^2$KV框架,联合优化KV提取与推理拼接,学习可组合压缩的KV缓存流形,引入轻量级边车提取器及协同训练策略,显著降低缓存成本,实现推理加速并保持生成质量。

Comments 12 pages, 9 figures, accepted by ACM SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16673 2026-07-21 cs.CL 新提交 57%

SpecLA: Efficient Speculative Decoding for Linear-Attention Models

SpecLA:线性注意力模型的高效推测解码

Zhibin Wang, Xuying Han, Zhaohua Yang, Fuliang Liu, Xue Li, Rong Gu, Sheng Zhong, Chen Tian

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 研究针对线性注意力模型自回归解码效率低的问题,提出SpecLA推测解码运行时,通过拓扑感知内核验证、存储紧凑因子及置信度修剪等方法,在NVIDIA H100上实现了比自回归解码高达1.70倍的端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16431 2026-07-21 cs.CL 新提交 57%

RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation

RIMS:通过平滑多对聚合进行偏好优化以实现小规模语言模型检索增强生成

Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, Haoyu Wang

机构 * Columbia University(哥伦比亚大学) Rutgers University(罗格斯大学) Purdue University(普渡大学) SUNY Albany(纽约州立大学奥尔巴尼分校)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL

AI总结 研究针对小规模语言模型检索增强生成中对噪声证据敏感的问题,提出RIMS框架,通过合成偏好数据、软聚合机制及偏好优化,实现更好性能,在多基准测试中优于现有方法

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16251 2026-07-21 cs.LG 新提交 57%

Learning Spatio-Temporal Foundation Models from Pure Synthetic Data

从纯合成数据中学习时空基础模型

Yutong Feng, Shiyuan Piao, Yutong Xia, Xu Liu, Wenqi Fan, Fugee Tsung, See-Kiong Ng, Yuxuan Liang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究旨在学习时空基础模型,提出NeoST,通过在程序生成的合成系统上预训练,引入可扩展语料库、潜在空间推理架构和目标,实验证明其在多样真实世界时空系统中性能优越,有长期稳定性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15660 2026-07-20 cs.AI 新提交 57%

ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

ToolVerse:为智能强化学习解锁大规模环境和长时任务

Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu, Yuanzhe Shen, Chenyang Zhang, feng hong, Cao Liu, Ke Zeng

机构 * LongCat Interaction Team, Meituan(美团长猫互动团队) Peking University(北京大学) Fudan University(复旦大学) Wuhan University(武汉大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究针对LLM智能体在复杂环境中工具集成问题,提出ToolVerse框架。通过构建大规模训练环境、设计任务策略及提出新算法,经实验验证该框架能增强LLM长时工具使用能力,提升性能与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10128 2026-07-20 cs.LG stat.ML 版本更新 57%

Energy-guided Recursive Model

能量引导递归模型

Yifei Zhao, Ying Tang

机构 * Institute of Fundamental and Frontier Sciences, University of Electronic Science and Technology of China(电子科技大学基础与前沿研究院) School of Physics, University of Electronic Science and Technology of China(电子科技大学物理学院) Key Laboratory of Quantum Physics and Photonic Quantum Information, Ministry of Education, University of Electronic Science and Technology of China(电子科技大学量子物理与光子量子信息教育部重点实验室) Non-classical Information Science Basic Discipline Research Center of Sichuan Province, University of Electronic Science and Technology of China(四川省非经典信息科学基础学科研究中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究递归推理模型测试时扩展缺乏原则机制的问题,提出能量引导递归模型(ERM),利用霍普菲尔德能量定义选择器,与能量技术集成,在数独等问题上达最优解,优于其他模型,为有效推理提供途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09421 2026-07-20 cs.CL 版本更新 57%

What Should a Skill Remember? Quality--Cost Trade-offs in Cost-Aware Skill Rewriting for Language Model Agents

技能应记住什么?语言模型代理中成本感知技能重写的质量-成本权衡

Qinghua Xing, Yinda Chen, Yaping Jin, Zhenhe Wu, Bohan Lin, Hang Zhou, Xinghao Chen, Hanting Chen, Zhiwei Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies(华为技术有限公司) Tianjin University(天津大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 研究语言模型代理中技能重写的质量-成本权衡,提出信息保留策略,在SkillsBench上实现成本降低7%-14.7%且保持验证质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01185 2026-07-17 cs.AI 版本更新 57%

"Skill Issues'': Data-Centric Optimization of Lakehouse Agents

技能问题:湖仓代理的数据中心优化

Nicole Rose Schneider, Davide Ghilardi, Giacomo Piccinini, Jacopo Tagliabue

机构 * University of Maryland(马里兰大学) Università Milano Bicocca(米兰Bicocca大学) Bauplan Labs(Bauplan实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 针对分支湖仓Bauplan上的编码代理,提出数据中心的优化流程,通过生成任务验证器对、在隔离沙箱中执行候选技能并利用追踪信号和程序化检查评分,将准确率提升31.9%。

Comments Pre-print of paper accepted at ADS @ VLDB 2026, Boston

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12963 2026-07-16 cs.CL 版本更新 57%

The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context

稳健性的错觉:聚合准确率掩盖了与任务无关的上下文下的预测翻转

Yanzhe Zhang, Sanmi Koyejo, Diyi Yang

机构 * Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

AI总结 研究大语言模型在含无关上下文环境中的表现,发现聚合准确率掩盖了单个示例预测的不稳定性,如随机伪词会改变部分预测,且此不稳定性受多种因素调节,揭示了尾部风险,推动对模型进行单个示例可靠性评估。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12605 2026-07-15 cs.SE cs.AI 新提交 57%

Multi-Perspective Agentic Program Repair via Code Property Graphs and Temporal Execution Graphs

通过代码属性图和时间执行图进行多视角智能程序修复

Zhili Huang, Ling Xu, Hongyu Zhang

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型在自动程序修复中的局限,提出CT-Repair框架,通过代码属性图和时间执行图表示证据,利用三阶段过滤管道及多视角智能体分析错误并生成修复策略,实验证明该方法能有效提高修复有效性。

Comments 12 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12422 2026-07-15 cs.AI 新提交 57%

Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting

接受前缀并非全部所需:基于PEFT的块扩散草稿生成的负面结果

Abdurrahman Javat, Allan Kazakov

机构 * Bahçeşehir University(巴赫切希尔大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究基于PEFT - BD的推测性解码方法,虽有避免分词器不匹配等优点,但在Qwen3 - 0.6B实验中未实现实际加速,因草稿生成器计算不高效。结果表明成功推测性解码需草稿生成器执行成本远低于验证器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10113 2026-07-14 cs.AI 新提交 57%

Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries

动态智能体技能:不断演进的技能库的生命周期调查与分类法

Yubo Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体中技能库随时间的变化,通过分类法、生命周期架构和技能记录模式等工具组织文献,合成证据分级模式,指出相关问题并提出报告标准及开放问题。

Comments Accepted by TMLR (2026.07), OpenReview Link: https://openreview.net/forum?id=cjU3YbcRr8

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30616 2026-07-14 cs.CL 版本更新 57%

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent

扩展视野而非参数:以35B智能体达到万亿参数性能

Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du, Yue Fan, Shiyang Feng, Zijie Guo, Haonan He, Liang He, Xiaohan He, Shuyue Hu, Yusong Hu, Songtao Huang, Yichen Jiang, Hao Li, Xin Li, Dahua Lin, Weihao Lin, Fenghua Ling, Dongrui Liu, Zhuo Liu, Wenjie Lou, Runmin Ma, Chunjiang Mu, Haoyang Peng, Tianshuo Peng, Jinxin Shi, Luohe Shi, Boyuan Sun, Zelin Tan, Shengji Tang, Yan Teng, Qianyi Wang, Xiaosong Wang, Yiming Wu, Yi Xie, Xiangchao Yan, Jingqi Ye, Peng Ye, Fangchen Yu, Jiakang Yuan, Bihao Zhan, Bo Zhang, Chen Zhang, Shufei Zhang, Shuaiyu Zhang, Wenlong Zhang, Yiqun Zhang, Junpeng Zhao, Zhijie Zhong, Bowen Zhou, Yuhao Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 提出35B混合专家智能体模型Agents-A1,通过扩展智能体视野(长程轨迹与异构能力)达到万亿参数级别性能,采用三阶段训练(全领域微调、领域教师模型、多教师领域路由策略蒸馏)在多个长程基准上取得领先或竞争力结果。

Comments The model checkpoints and evaluation codebase are available at https://huggingface.co/collections/InternScience/agents-a1 and https://github.com/InternScience/Agents-A1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09544 2026-07-13 cs.CV cs.LG 新提交 57%

The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

计数存在但未对齐:理解和纠正视觉语言模型中的计数失败

Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh, Nikolai Rozanov, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Imperial College London(伦敦帝国学院)

专题命中 测试时计算 :self-correction(abstract);分类 cs.LG

AI总结 研究视觉语言模型计数失败问题,通过对VLM激活进行探测训练及分析,发现其虽常编码正确计数但输出错误,提出探测器引导的自校正方法,在不更新参数时提高计数准确率,揭示内部知识与模型输出差距并提供改进工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09366 2026-07-13 cs.SE cs.AI cs.LO 新提交 57%

Diversifying to Verify: When Task-Equivalent Programs Differ in Verifiability

多样化以进行验证:当任务等效程序在可验证性上存在差异时

Shirley Yu, Ruben Martins

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究任务等效程序的可验证性差异,提出基于大型语言模型的Diversify2Verify管道,通过推断契约、生成测试不同实现并修复注释来验证,构建基准测试,结果表明实现多样性有助于验证,提高了验证成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08774 2026-07-13 cs.AI cs.HC 新提交 57%

CogniConsole: Externalizing Inference-Time Control as a Formal Abstraction for Reliable LLM Interactions

CogniConsole:将推理时控制作为可靠大语言模型交互的形式化抽象进行外化

Vanessa Figueiredo, Wilter Franceschi

机构 * University of Regina(里贾纳大学) Orbital Sea(轨道海)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究挑战大语言模型可靠性仅取决于模型能力的观点,引入CogniConsole将推理时控制外化为结构化接口,通过489个探针实验表明增加结构支架可降低输出方差和故障率,为LLM系统设计评估开辟新方向。

Comments Revised version focusing on the CogniConsole system architecture and empirical evaluation of inference-time control probes (N=489)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08665 2026-07-13 cs.LG 新提交 57%

Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models

重采样还是重新路由?大语言模型的预算感知测试时模型选择

Teng-Ruei Chen

机构 * Institute of Bioinformatics and Systems Biology, National Yang Ming Chiao Tung University(国立阳明交通大学生物信息与系统生物学研究所) Krixvon(克瑞克斯冯)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 研究大语言模型测试时模型选择问题,提出预算感知测试时模型选择方法,通过在重采样和重新路由间分配预算单位最大化预期正确性,提出RoR分配策略,实验表明该策略在成本-质量方面优于多种基线。

Comments 10 pages, 3 figures. v2: corrected Phi-4 cost (14.7B) and re-ran all replays; conclusions unchanged. Code: github.com/luka-krixvon/resample-or-reroute-experiment

详情

展开后加载摘要…

URL PDF HTML 收藏