arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-07-03 至 2026-07-03 共收录 7
2607.02459 2026-07-03 cs.CL 新提交

Language Models as Measurement Apparatus for Culture

语言模型作为文化测量仪器

Kent K. Chang

机构 * School of Information University of California, Berkeley(信息学院加州大学伯克利分校)

AI总结 本文提出语言模型的文化测量是物质-话语实践,通过Karen Barad的能动切割概念,论证模型设计选择构成所测量的文化现实,并通过三个案例和三个仪器检查展示这一观点。

Comments Accepted to the Big Picture workshop co-located with ACL 2026. This version expands the camera-ready (adding Fig. 3 and section 6.3, as well as correcting minor typos) in Proceedings of The Big Picture v2: Crafting a Research Narrative, pp. 131--143, San Diego, CA, USA. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02369 2026-07-03 cs.CL cs.AI 新提交

World Wide Models: Literary Tools for Cultural AI

世界模型:文化人工智能的文学工具

Nina Begus

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出分层框架,利用文学工具(比较阅读、叙事分析、世界文学等)解决AI文化素养问题,强调文学与AI的自然交叉,并通过宏观结构、流通和不可译性应对全球AI文本性。

Comments 15 pages

Journal ref Forthcoming in MFS Modern Fiction Studies in 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01538 2026-07-03 cs.CL 新提交

Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale

语言模型真的能进行上下文检索吗?在百万Token规模的文档中淹没

Siddharth Gollapudi, Nilesh Gupta, Prasann Singhal, Sewon Min

机构 * UC Berkeley(加州大学伯克利分校) UT Austin(得克萨斯大学奥斯汀分校)

AI总结 本文首次系统研究百万Token语料库上的上下文检索,提出0.6B参数的BlockSearch模型,通过注意力稀释分析引入长度感知调整,在MS MARCO和NQ上匹配稠密检索,在LIMIT上得分高出3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01283 2026-07-03 cs.LG cs.AI 新提交

Scaling Laws for Grid-Based Approximate Nearest Neighbor Search in High Dimensions

高维空间中基于网格的近似最近邻搜索的缩放定律

Matthew J Liu, Wei Hang Zheng, Vidhan Purohit, Siqi Xie, Chieh-En Li, Jerry Li, Noah Flynn

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto, St. George(多伦多大学圣乔治校区) Independent Researcher(独立研究员) University of Waterloo(滑铁卢大学)

AI总结 本研究系统刻画了多探针网格算法在数据集大小N和维度d上的缩放行为,发现其在GloVe嵌入上具有恒定的维度缩放指数,优于图、树和分区方法,且索引成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31174 2026-07-03 cs.AI 新提交

ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents

ClawArena-Team: 语言模型智能体中子智能体编排与动态工作流的基准测试

Kaiwen Xiong, Haonian Ji, Shi Qiu, Zeyu Zheng, Cihang Xie, Xinyu Ye, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克鲁兹分校)

AI总结 提出ClawArena-Team基准,通过41个多轮多模态多目录场景,评估单个LLM作为管理者编排子智能体的能力,发现管理瓶颈在于权限授予而非感知,且成本与质量解耦。

Comments 24 pages, 10 figures, website: https://www.clawarena.cc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15313 2026-07-03 eess.AS cs.SD 新提交

DDPO-VC: Speaker De-Identification via Diffusion Denoising Policy Optimization

DDPO-VC:基于扩散去噪策略优化的说话人去识别

Liming Wang, Cody Karjadi, Rhoda Au, James Glass

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出DDPO-VC框架,通过强化学习后训练扩散模型,利用隐私与效用教师奖励信号,在说话人去识别中平衡隐私保护与下游任务效用,优于多种强基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08236 2026-07-03 cs.CL cs.LG 新提交

Shared Semantics, Divergent Mechanisms: Unsupervised Feature Discovery by Aligning Semantics and Mechanisms

共享语义,不同机制:通过对齐语义与机制的无监督特征发现

Hyunjin Cho, Youngji Roh, Jaehyung Kim

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出一种无监督方法,通过语义嵌入和归因签名聚类模型续写,发现隐藏的机制模式,补充电路分析。

Comments 40 pages; accepted as an ICML 2026 Spotlight; project page: https://merenova.github.io/distribution-level-feature-discovery/

Journal ref ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏