arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Washington(华盛顿大学)

2026-07-15 至 2026-07-15 共收录 3
2607.12886 2026-07-15 cs.AI 新提交

A Multi-Agent System for Autonomous, Fine-Tuning-Free Clinical Symptom Detection: Development and Validation Study

一种用于自主、无需微调的临床症状检测的多智能体系统:开发与验证研究

Cameron Cagan, Pedram Fard, Jiazi Tian, Jingya Cheng, Shawn N. Murphy, Hossein Estiri

机构 * Massachusetts General Hospital(麻省总医院) University of Washington(华盛顿大学)

AI总结 研究针对临床症状检测中信息难结构化及现有方法不足的问题,提出多智能体系统Pythia,无需人工提示工程或微调,能自主优化提取提示。通过与词汇表比较,验证其在临床记录症状提取上的有效性及推广性,优于部分传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12520 2026-07-15 cs.AI 新提交

The Model Knows Your Project, Not You: Measuring Recognition in LLMs with NameRank

模型了解你的项目,而非你本人:使用NameRank衡量大语言模型中的识别度

Bojie Li, Noah Shi

机构 * Pine AI(松树人工智能公司) University of Washington(华盛顿大学)

AI总结 研究用NameRank衡量大语言模型对实体的识别度,通过对多实体多模型探测及独立评判获取分数,发现识别关注可索引工件,奥运资质与知名奖项情况不同,独立创作者中工具与创造者排名有别等,并指出文献计量法难测识别度等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12227 2026-07-15 cs.AI 新提交

Rethinking the Evaluation of Harness Evolution for Agents

重新思考智能体的 harness 进化评估

Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti Senthil, Hannaneh Hajishirzi, Yulia Tsvetkov, Pradeep Dasigi, Teng Xiao

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

AI总结 研究重新审视大语言模型智能体的自动 harness 进化评估,通过在可比条件下与基线比较及在保留任务上测试,发现其不总优于简单方法且泛化有限,对其有效性提出质疑,强调需更公平评估协议和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏