arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Princeton University(普林斯顿大学)

2026-04-10 至 2026-04-10 共收录 2
2604.07569 2026-04-10 cs.LG cs.AI cs.CL cs.IT math.IT

Learning is Forgetting: LLM Training As Lossy Compression

学习是遗忘:LLM训练作为有损压缩

Henry C. Conklin, Tom Hosking, Tan Yi-Chern, Julian Gold, Jonathan D. Cohen, Thomas L. Griffiths, Max Bartolo, Seraphina Goldfarb-Tarrant

机构 * Princeton University(普林斯顿大学) Cohere

AI总结 本文提出LLM训练可视为有损压缩过程,通过保留训练数据中与目标相关的信息,揭示模型表示结构与下游性能的联系。

Comments 12 page core paper, 16 page Appendix - A shorter version with fewer visuals appears at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08637 2026-04-10 cs.CY cs.AI cs.CR

How Do Data Owners Say No? A Case Study of Data Consent Mechanisms in Web-Scraped Vision-Language AI Training Datasets

数据所有者如何说不?Web抓取视觉-语言AI训练数据集中的数据同意机制案例研究

Chung Peng Lee, Rachel Hong, Harry H. Jiang, Aster Plotnik, William Agnew, Jamie Morgenstern

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Amazon AWS AI/ML(亚马逊AWS AI/ML)

AI总结 研究探讨了数据所有者在AI训练数据集中的同意表达方式,分析了DataComp数据集中样本层面和网络层面的信息,揭示了当前数据收集流程对数据同意的不尊重问题。

详情

展开后加载摘要…

URL PDF HTML 收藏