Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
检验推理LLM作为裁判在不可验证LLM后续训练中的表现
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过受控合成设置检验推理LLM作为裁判在非验证LLM后续训练中的效果,发现推理裁判能生成高性能策略,但易受对抗性输出影响,揭示了其在实际政策训练中的潜力与挑战。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
检验推理LLM作为裁判在不可验证LLM后续训练中的表现
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过受控合成设置检验推理LLM作为裁判在非验证LLM后续训练中的效果,发现推理裁判能生成高性能策略,但易受对抗性输出影响,揭示了其在实际政策训练中的潜力与挑战。
混合策略强化学习可调节探索用于多模态推理
机构 * Aberystwyth University(阿伯里斯特维斯大学) ; Institute of Artificial Intelligence (TeleAl)(人工智能研究所) ; China Telecom(中国电信) ; Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出CalibRL框架,通过分布感知优势加权和非对称激活函数实现可控探索,提升多模态推理模型的探索与利用平衡。
Comments Published as a conference paper at ICLR 2026
现实世界点跟踪中的验证者引导伪标签方法
机构 * Department of Computer Engineering, Koç University(科卡大学计算机工程系) ; KUIS AI Center(KUIS人工智能中心) ; School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
专题命中 测试时计算 :verifier(title,abstract)
AI总结 本文提出验证者引导伪标签方法,通过元模型评估跟踪器预测可靠性,生成高质量伪标签以提升现实世界点跟踪性能,实验证明其在数据效率和性能上的优势。
Comments CVPR 2026
超越单样本:面向视频理解的可靠多样本蒸馏
机构 * University of Electronic Science and Technology of China & Robotics Center(电子科技大学 & 机器人中心)
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出R-MSD方法,通过任务自适应教师池和对抗蒸馏目标提升视频理解任务的蒸馏稳定性,实验显示在多个基准上优于单样本蒸馏方法。
边缘-云协同语音情绪描述 via 令牌级推测解码在音频-语言模型中
专题命中 测试时计算 :verifier(abstract)
AI总结 本文提出基于不确定性引导推测解码的边缘-云协同框架,通过轻量级边缘模型和云验证器的协同,提升语音情绪描述的准确率和效率,同时降低延迟和隐私风险。
GUIDES: 利用教师蒸馏嵌入进行预训练机器人策略增强
机构 * University of California, Riverside(加州大学河滨分校) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 GUIDES通过教师蒸馏嵌入提升预训练机器人策略,实现语义增强与高效升级
Comments IEEE International Conference on Robotics and Automation (ICRA 2026)