arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Washington(华盛顿大学)

2026-08-07 至 2026-08-07 共收录 7
2608.05850 2026-08-07 cs.CL cs.AI 新提交

MameLoshnLM: Yiddish Language Model and Evaluation Benchmark

MameLoshnLM:意第绪语语言模型与评估基准

Uri Katz, Omer Goldman, Tomasz Limisiewicz, Reut Tsarfaty, Noah A. Smith

机构 * Bar-Ilan University(巴伊兰大学) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

AI总结 该研究推出首个专为意第绪语构建的开源8B参数语言模型MameLoshnLM,通过自研语料库与基准优化Llama 3.1 8B,其表现优于同规模开源基线,为意第绪语NLP及低资源语言模型开发提供了基础与模板。

Comments Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05716 2026-08-07 cs.AI 新提交

BlockPython: A Process-Aware Agent-Supported Platform for the Transition from Block-Based to Python Programming

BlockPython:一种支持从积木式编程向Python编程过渡的进程感知智能体平台

Jesse Yusuf Chan, Haoming Wang, Mingwei Xu, Xianlong Xu

机构 * East China Normal University(华东师范大学) Tsinghua University(清华大学) University of Washington(华盛顿大学)

AI总结 BlockPython是支持从积木式编程向Python过渡的平台,以双向转换为核心,通过四阶段引导学习者,利用进程证据诊断困难,为相关系统设计提供参考。

Comments AIED 2026 Interactive Event Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05122 2026-08-07 cs.CV 版本更新

IRIS: A Visual Cortex-Inspired Framework for Analyzing Orientation Selectivity in Vision Transformers

IRIS:一种受视觉皮层启发的用于分析视觉Transformer中方向选择性的框架

Vaishnavi B Mohan, Vijayakrishna Naganoor, Yashas Annadani, Shashank Hegde

机构 * University of Washington(华盛顿大学) Microsoft(微软公司) TU Munich(慕尼黑工业大学) Gladstone Institute(格拉德斯通研究所) Nvidia(英伟达公司)

AI总结 该研究提出受视觉皮层启发的IRIS框架,通过RSS等神经科学指标分析ViT中方向选择性的形成,发现训练范式决定方向选择性、层的方向选择性变化规律,且指标可指导解冻层数以优化下游泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04511 2026-08-07 cs.SD 版本更新

A Dual Evaluation for Music Transcription

音乐转录的双重评估

Ping Wang, Guang Yang, Nazif Can Tamer, Victoria Ebert, Noah A. Smith

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(艾伦人工智能研究所)

AI总结 该研究针对音乐转录系统提出记谱相似度与回放相似度的双重评估框架,发现CLEWS指标相关性佳且成本低,不同评估维度偏好不同系统,新系统Rubato记谱相似度提升且回放具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12519 2026-08-07 cs.CL cs.AI 版本更新

Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models

通过可验证的推理过程监督获得正确答案:语言模型的可验证过程监督

Kyuyoung Kim, Kevin Wang, Yunfei Xie, Peiyang Xu, Peiyao Sheng, Chen Wei, Zhangyang Wang, Jinwoo Shin, Pramod Viswanath, Sewoong Oh

机构 * KAIST AI(KAIST人工智能研究所) University of Texas, Austin(德克萨斯大学奥斯汀分校) Rice University(里士满大学) Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Sentient Labs(Sentient实验室)

AI总结 本文提出VPS框架,通过联合优化预测准确性和推理质量,在可验证领域使语言模型同时获得准确和可靠的推理能力。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23565 2026-08-07 cs.LG cs.MA 版本更新

Dynamics of Learning under User Choice: Overspecialization and Peer-Model Probing

学习动态中的用户选择:过度专业化与同伴模型探测

Adhyyan Narang, Sarah Dean, Lillian J Ratliff, Maryam Fazel

机构 * Electrical and Computer Engineering, University of Washington(华盛顿大学电气与计算机工程学院) Computer Science, Cornell University(康奈尔大学计算机科学系)

AI总结 本文研究了用户选择对学习动态的影响,提出通过探测同伴模型预测来避免过度专业化陷阱,从而提升模型的全局性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16763 2026-08-07 cs.AI 版本更新

When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

当AI基准测试达到平台期:基准饱和的系统性研究

Mubashara Akhtar, Anka Reuel, Prajna Soni, Sanchit Ahuja, Pawan Sasanka Ammanamanchi, Ruchit Rawal, Vilém Zouhar, Srishti Yadav, Chenxi Whitehouse, Dayeon Ki, Jennifer Mickel, Leshem Choshen, Marek Šuppa, Jan Batzner, Jenny Chim, Jeba Sania, Yanan Long, Hossein A. Rahmani, Christina Knight, Yiyang Nan, Jyoutir Raj, Yu Fan, Shubham Singh, Subramanyam Sahoo, Eliya Habba, Usman Gohar, Siddhesh Pawar, Robert Scholz, Arjun Subramonian, Jingwei Ni, Mykel Kochenderfer, Sanmi Koyejo, Mrinmaya Sachan, Stella Biderman, Zeerak Talat, Avijit Ghosh, Irene Solaiman

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学) University of Washington(华盛顿大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究定义并分析了60个语言模型基准的饱和现象,发现近半数基准出现饱和,且专家策划而非公开测试数据影响抗饱和能力,为延长基准寿命提供了设计建议。

Comments Published at ICML 2026 (Forty-Third International Conference on Machine Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏