iAgentBench: Benchmarking Sensemaking Capabilities of Information-Seeking Agents on High-Traffic Topics
iAgentBench: 信息检索代理在高流量话题上的理解能力基准测试
机构 * University of Washington(华盛顿大学)
AI总结 iAgentBench通过整合多源证据来评估信息检索代理在高流量话题中的理解能力,强调证据使用而非单纯检索的重要性。
高校专区
iAgentBench: 信息检索代理在高流量话题上的理解能力基准测试
机构 * University of Washington(华盛顿大学)
AI总结 iAgentBench通过整合多源证据来评估信息检索代理在高流量话题中的理解能力,强调证据使用而非单纯检索的重要性。
PrefDisco:主动个性化推理的基准测试
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能联盟)
AI总结 PrefDisco提出了一种评估方法,通过心理基础的人设将静态基准转化为互动个性化任务,定义PrefAlign作为细粒度的偏好对齐度量,揭示个性化推理需要专门开发而非自然产生。
Comments 65 pages, 6 figures
消除未来依赖:联合频域学习用于时空预测
机构 * University of Washington(华盛顿大学) ; Arizona State University(亚利桑那州立大学)
AI总结 本文提出FreST损失,通过联合频域学习有效消除时空依赖,提升时空预测性能。