PIVOT: Preference-based Intervention Vectors for Pedagogical Tutor Steering
PIVOT:用于教学导师引导的基于偏好的干预向量
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究针对LLM对话辅导缺乏教学策略推理时控制的问题,提出PIVOT框架,通过偏好干预向量实现导师动作控制,在用户研究中获多数教师认可。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
PIVOT:用于教学导师引导的基于偏好的干预向量
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究针对LLM对话辅导缺乏教学策略推理时控制的问题,提出PIVOT框架,通过偏好干预向量实现导师动作控制,在用户研究中获多数教师认可。
面向长 horizon 智能体的可靠上下文压缩:执行不稳定性的实证研究
机构 * University of Virginia(弗吉尼亚大学) ; Nokia(诺基亚公司)
专题命中 测试时计算 :verifier(abstract);分类 cs.LG
AI总结 该研究针对长 horizon 智能体上下文压缩的执行不稳定性问题,提出了验证器引导框架 TRACE,在 AppWorld 上的实验显示其在任务性能等指标上优于现有基线,为可靠上下文压缩提供了新方向。
Comments 31 pages, 6 figures
大模型提出方案,执行体处理:一种自验证智能体工具,可将长程智能体中的承诺漂移与绑定漂移分离
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本研究提出一种自验证智能体工具,可分离长程智能体的承诺漂移与绑定漂移,通过实验揭示消融承诺机制会提升目标放弃率,且贡献了可量化漂移分解的智能体验证方法论。
Comments 7 pages
面向大语言模型测试时缩放的可解释自适应采样
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对LLM测试时推理的固定计算预算不灵活、不可解释的问题,提出带轻量级模糊控制器的自适应采样方法,在问答和数学任务上提升性能并减少平均采样数,为高效测试时推理提供实用方向。
MutMem:持久智能体内存中的密码学授权突变
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本研究针对持久智能体内存的授权与防篡改问题,提出HOM-AIMOS中的MutMem协议,经实验验证其在多个基准任务中表现良好,可有效抵御中毒攻击。
Comments https://github.com/wallidsaydi-creator/HOM-AIMOS. 32 Pages
MDArena:面向真实分子动力学工作流的编码智能体评估基准
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 MDArena基准评估了6种编码智能体在真实分子动力学任务上的表现,发现其在精细科学工作流细节上存在不足,为追踪其可靠性进展提供了平台。
Comments 17 pages including appendices, 4 figures
MedSAM2-Anatomy:面向肌肉骨骼分割的无训练推理时优化方法
专题命中 测试时计算 :planning(abstract);分类 cs.LG
AI总结 MedSAM2-Anatomy是一种无训练的推理时优化框架,通过融合专家模型生成的自动解剖提示,提升冻结分割模型的髋部、肩部肌肉骨骼分割性能,无需人工提示或模型重训。
Comments Original research manuscript (13 pages, 4 figures, 2 tables). No prior publication
用小型策略模型个性化大型语言模型智能体
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出轻量级策略层FABLE,通过在线学习用户执行策略实现LLM智能体个性化,在多类评估中改进偏好敏感行为且保持端到端任务性能。
自改进大语言模型智能体中的记忆奖励膨胀
机构 * University Of North Texas(北得克萨斯大学) ; Edge Hill University(边山大学) ; University of Cincinnati(辛辛那提大学) ; Iran University of Science and Technology(伊朗科技大学) ; Islamic Azad University(伊斯兰阿扎德大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 该研究发现自改进大语言模型智能体存在记忆奖励膨胀的“回声差距”问题,提出误差独立性假设(EIA),并通过LUCID算法在BIRD文本到SQL基准上提升了执行准确率。
TransMem:将隐藏状态转换为大语言模型的记忆
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 针对长上下文LLM智能体的历史信息未充分利用问题,提出轻量级记忆模块TransMem,结合证据条件自蒸馏,在多基准测试中显著提升性能。
Comments 12 pages, 4 figures
面向回合级智能体强化学习的科学发现环境扩展
机构 * Shanghai AI Lab(上海人工智能实验室)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本文提出可扩展框架SciDisco,结合SciThèque与DiscoPO,训练出的SciDisco-14B在假设驱动的科学数据分析基准上实现了当前最优性能。
一致性并非质量:当人类共识并非真值时,对人类与大语言模型定性编码的盲专家验证
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 该研究发现以人类共识为标准的一致性评估无法准确衡量LLM定性编码质量,盲专家验证显示部分LLM编码优于人类,提出了可迁移的验证协议与编码分工框架。
VeriSkill:一种用于程序验证技能的自进化框架
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本文提出专为程序验证设计的自进化框架VeriSkill,可将验证失败归因于技能缺陷并迭代优化技能,实验显示其在多种场景下均优于基线方法。
提示词为何构成图:提示词图工程的充要条件
机构 * Federal Institute of Goiás(戈亚斯联邦学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本研究通过文献分析构建了将提示词视为图节点的定义,提出提示词图工程的四个条件及操作化测试,明确其边界并应用于六个系统,为相关实践提供可操作定义与共享术语。
超越KV重建:推测解码中MLA草稿模型的功能重建
专题命中 测试时计算 :verifier(abstract);分类 cs.LG
AI总结 针对推测解码中MHA/GQA转MLA导致草稿令牌接受率降低的问题,提出功能重建方法优化转换后的MLA注意力模块,在多数任务中提升了草稿令牌接受率。
初探编码智能体在开源社区中对AI贡献规则的合规性
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。
在启发式自我改进智能体中自我编写的验证不可靠
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。
Comments 9 pages, 6 figures
计算营养中统计支持的大语言模型成分与食谱数据收集
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究针对计算营养中成分数据问题,提出结合统计估计、不变性检查和网络获取的大语言模型管道。通过该管道可获取精确数据,在参考集上实现高匹配度并大幅降低误差,将大语言模型辅助数据库构建变为可控流程。
DeepLook:通过前瞻进行更深入思考
机构 * Technical University of Munich(慕尼黑工业大学) ; LMU Munich(慕尼黑大学) ; MCML, LMU, MemAgents Lab(慕尼黑大学机器学习中心、记忆代理实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究旨在改进大语言模型推理,提出无需训练的DeepLook框架,通过将前瞻计算集中在不确定性瓶颈处,聚合令牌级置信度为段级信号并排序投票。在四个数学基准测试中,该方法改变准确率与令牌成本的帕累托前沿,提升准确率并减少令牌生成。
MIITA:用于小语言模型持续学习的内存诱导推理时间自适应
机构 * Baylor University(贝勒大学) ; NEC Laboratories America(美国 NEC 实验室) ; University of Arkansas(阿肯色大学) ; Southern Illinois University(南伊利诺伊大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 针对小语言模型持续学习中参数更新致灾难性遗忘及内存不足问题,提出MIITA框架,它通过存储校正方向原型并在推理时检索应用,结合理论分析,在多种设置实验中提升性能并减轻遗忘。
用于通过公开测试的代码的代码监控红队
机构 * University of Electronic Science and Technology of China(电子科技大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究公开测试通过后代码隐藏错误监控问题,引入代码监控红队协议并实例化为代码监控基准。通过大量实验发现弱验证器虽能改进但仍易漏错,对抗性压力影响验证效果,GLM - 5.1验证器缩小部分差距,揭示了验证器故障与证据限制的问题。
评估和保障智能科学合成中的引用忠实性
机构 * Seoul National University(首尔国立大学) ; BioNexus(生物 Nexus)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究智能语言模型系统引用答案检查的可靠性问题,提出黄金锚定评估协议和可部署防护措施,能验证验证者、测量重新归因,为无支撑引用设限,经多模型和管道验证后作为单GPU工具包发布。
Comments 20 pages, 5 figures. Includes supplementary material (Appendices S1-S6). Open single-GPU reproducibility kit included
优化基于超图的RAG:迈向更好的事实提取和块检索
机构 * Qlik(思略特)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究旨在优化基于超图的RAG,以解决事实提取和块检索问题。方法是采用自一致性提示改进提取,运用个性化PageRank算法增强块检索,贡献在于提升了相关任务的性能。
Comments APIA 2026 conference
无需训练的路由:通过可靠性门控实现可控比例的大语言模型卸载
机构 * Purdue University(普渡大学) ; University of Exeter(埃克塞特大学) ; Army Research Laboratory(陆军研究实验室) ; Princeton University(普林斯顿大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究在资源受限下本地-云端协作部署大语言模型的问题,提出无需训练的CARGO路由框架,通过提示多样化采样等方法估计一致性并控制不确定性,在多任务和模型上表现出色,证明可从本地模型内在行为实现有效协作。
SemEval-2026任务6中的AsymVerify:用于政治逃避检测的非对称置信门控验证
机构 * Kaons 𝑲 ∗
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 研究针对政治逃避检测难题,提出AsymVerify系统用于SemEval-2026任务6的三元分类。核心方法是对问答对分类后对低置信预测进行非对称验证,主要贡献是取得高排名,在不同数据集上提升宏F1分数,且降低推理成本。
Comments Accepted to SemEval-2026 Task 6 (CLARITY) at ACL 2026. Team AsymVerify placed 2nd of 41 teams on the official Subtask 1 leaderboard. Task: https://konstantinosftw.github.io/CLARITY-SemEval-2026/. Code: https://github.com/kaons-research/AsymVerify-ACL. Website: https://kaons.com/
PerfAgent:用于仓库级代码优化的分析器引导迭代优化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; IBM(IBM公司) ; Michigan State University(密歇根州立大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究针对仓库级代码优化难题,提出PerfAgent分析器引导迭代优化方法,该方法能让编码代理找到热点并改进,在两个优化基准测试中大幅提升专家匹配补丁率,且以低成本超越基线。
分布优先的总体模拟:非怪异大语言模型角色建模中的崩溃、校准和召回
机构 * Istanbul Technical University(伊斯坦布尔技术大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 研究非怪异LLM角色建模中独立代理范式的问题,提出分布优先校正方法,通过言语化采样等进行实验,发现原范式有崩溃等问题,校正方法能测量内部不一致性及校准条件。
Comments 8 pages, 8 figures
C$^2$KV:用于高效大语言模型推理的压缩可组合键值缓存重用
机构 * Alibaba Group(阿里巴巴集团)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 研究针对长上下文LLM推理成本高问题,提出C$^2$KV框架,联合优化KV提取与推理拼接,学习可组合压缩的KV缓存流形,引入轻量级边车提取器及协同训练策略,显著降低缓存成本,实现推理加速并保持生成质量。
Comments 12 pages, 9 figures, accepted by ACM SIGKDD 2026
SpecLA:线性注意力模型的高效推测解码
机构 * Alibaba Group(阿里巴巴集团)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 研究针对线性注意力模型自回归解码效率低的问题,提出SpecLA推测解码运行时,通过拓扑感知内核验证、存储紧凑因子及置信度修剪等方法,在NVIDIA H100上实现了比自回归解码高达1.70倍的端到端加速。
RIMS:通过平滑多对聚合进行偏好优化以实现小规模语言模型检索增强生成
机构 * Columbia University(哥伦比亚大学) ; Rutgers University(罗格斯大学) ; Purdue University(普渡大学) ; SUNY Albany(纽约州立大学奥尔巴尼分校)
专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL
AI总结 研究针对小规模语言模型检索增强生成中对噪声证据敏感的问题,提出RIMS框架,通过合成偏好数据、软聚合机制及偏好优化,实现更好性能,在多基准测试中优于现有方法
Journal ref COLM 2026