arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Princeton University(普林斯顿大学)

2026-05-18 至 2026-05-18 共收录 5
2512.00417 2026-05-18 cs.CL

CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency

CryptoBench: 一种动态基准,用于评估LLM代理在加密货币领域的专家级能力

Jiacheng Guo, Suozhi Huang, Zixin Yao, Yifan Zhang, Yifu Lu, Jiashuo Liu, Zihao Li, Nicholas Deng, Qixin Xiao, Jia Tian, Kanghong Zhan, Tianyi Li, Xiaochen Liu, Jason Ge, Chaoyang He, Kaixuan Huang, Lin Yang, Wenhao Huang, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Zenith Lab(Zenith实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

AI总结 本文提出CryptoBench,首个专家 curated 的动态基准,用于严格评估LLM在加密货币领域的真实能力。通过50题/月的动态任务,细分子类评估数据获取与预测能力,揭示LLM在检索与预测上的不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15692 2026-05-18 cs.CL cs.LG

TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning

TemplateRL: 结构化模板引导的强化学习用于大语言模型推理

Jinyang Wu, Chonghua Liao, Mingkuan Feng, Shuai Zhang, Zhengqi Wen, Haoran Luo, Ling Yang, Huazhe Xu, Jianhua Tao

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Princeton University(普林斯顿大学) Shanghai AI Lab(上海人工智能实验室) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

AI总结 TemplateRL通过结构化模板引导强化学习提升大语言模型推理能力,通过MCTS构建问题解决模板库并整合到RL训练中,提高轨迹命中率并减少无效探索,实验显示在AIME和AMC上表现优于GRPO。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15384 2026-05-18 cs.LG cs.AI

Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory

一个评分够吗?重新思考序列演进LLM记忆的评估

Songwei Dong, Zihan Chen, Chengshuai Shi, Peng Wang, Jundong Li, Cong Shen

机构 * University of Virginia(弗吉尼亚大学) Princeton University(普林斯顿大学)

AI总结 本文提出SeqMem-Eval框架,通过评估记忆状态的演变、泛化、经验巩固和信息保留,揭示传统指标无法捕捉的记忆质量差异。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18134 2026-05-18 cs.AI cs.CL cs.CV

VideoGameBench: Can Vision-Language Models complete popular video games?

VideoGameBench: 能否让视觉-语言模型完成流行视频游戏?

Alex L. Zhang, Thomas L. Griffiths, Karthik R. Narasimhan, Ofir Press

机构 * Princeton University(普林斯顿大学)

AI总结 VideoGameBench通过10款经典游戏测试视觉-语言模型在无辅助信息下的实时游戏完成能力,发现前沿模型受推理延迟限制,仅能完成极少量游戏内容。

Comments 10 pages, 38 pages including supplementary

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21850 2026-05-18 cs.CV

Visual Compositional Tuning

视觉组合调谐

Xindi Wu, Hee Seung Hwang, Polina Kirichenko, Esin Tureci, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Meta AI

AI总结 本文提出COMPACT方法,通过组合多个基本视觉能力提升视觉指令调谐数据效率,减少训练样本数量并提升多模态任务性能。

Comments See the project website at this [URL](https://princetonvisualai.github.io/compact/)

详情

展开后加载摘要…

URL PDF HTML 收藏