arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Imperial College London(帝国理工学院)

2026-07-13 至 2026-07-13 共收录 3
2607.09544 2026-07-13 cs.CV cs.LG 新提交

The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

计数存在但未对齐:理解和纠正视觉语言模型中的计数失败

Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh, Nikolai Rozanov, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Imperial College London(伦敦帝国学院)

AI总结 研究视觉语言模型计数失败问题,通过对VLM激活进行探测训练及分析,发现其虽常编码正确计数但输出错误,提出探测器引导的自校正方法,在不更新参数时提高计数准确率,揭示内部知识与模型输出差距并提供改进工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09153 2026-07-13 cs.AI 新提交

KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

KV-PRM:通过KV缓存转移实现高效的过程奖励建模以进行多智能体测试时扩展

Peng Kuang, Haibo Jin, Xiaoyu Han, Yanli Wang, Xiaopeng Yuan, Ye Yu, Kaidi Xu, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Imperial College London(伦敦帝国理工学院) City University of Hong Kong(香港城市大学)

AI总结 研究针对现有基于文本的过程奖励模型在长多智能体展开中评分成本高的问题,提出KV-PRM,通过读取KV缓存降低评分成本,经理论证明和实验验证,该模型在多基准测试及多种TTS方法下表现优异,大幅减少计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14130 2026-07-13 cs.LG cs.MA 新提交

Contract-Based Compositional Shielding for Safe Multi-Agent Reinforcement Learning

基于合约的组合屏蔽实现安全多智能体强化学习

Omar Adalat, Edwin Hamel-De le Court, Francesco Belardinelli

机构 * Imperial College London(伦敦帝国学院) University of Manchester(曼彻斯特大学)

AI总结 提出一种去中心化屏蔽方法,通过合约机制协调智能体局部LTL安全义务,在无集中运行时控制下保证全局安全并优化团队奖励。

Comments Accepted to EUMAS 2026, the 23rd European Conference on Multi-Agent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏