arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Databricks

共收录 4
2607.18603 2026-07-22 cs.IR cs.AI cs.CL 新提交

AutoIndex: Learning Representation Programs for Retrieval

AutoIndex:学习用于检索的表示程序

Sam O'Nuallain, Nithya Rajkumar, Ramya Narayanasamy, Hanna Jiang, Shreyas Chaudhari, Andrew Drozdov

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Databricks Mosaic Research(Databricks Mosaic研究)

AI总结 AutoIndex框架通过搜索对文档进行多种操作的程序来优化文档表示,在CRUMB基准上评估,相比BM25基线显著提升召回率,证明文档表示应作为优化目标,而非固定预处理选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13037 2026-07-16 cs.AI 新提交

OriginBlame: Record- and Token-Level Data Provenance for AI Training Datasets

OriginBlame:人工智能训练数据集的记录级和令牌级数据溯源

Haolin Xue

机构 * HuggingFace(拥抱脸) Datatrove(数据宝库) The Linux Foundation(Linux基金会) Databricks(Databricks公司) Weights & Biases(权重与偏差公司)

AI总结 研究针对模型训练者在数据删除时无法精准定位记录所属作者的问题,提出OriginBlame系统,通过记录级和令牌级溯源及确定性查询解决,评估显示能消除过度删除并提升遗忘效果,增加少量吞吐量开销。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13757 2026-07-08 cs.CR cs.AI 新提交

SEVRA-BENCH: Social Engineering of Vulnerabilities in Review Agents

SEVRA-BENCH:审查智能体中的社会工程漏洞

Rui Melo, Riccardo Fogliato, Sean Zhou, Pratiksha Thaker, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能) Amazon AWS(亚马逊AWS) Databricks

AI总结 提出SEVRA-BENCH基准,通过社会工程攻击框架评估LLM代码审查智能体拒绝恶意PR的能力,发现闭源与开源模型间存在显著安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13741 2026-06-15 cs.LG 新提交

High-Frequency Pricing at Scale for E-Commerce

电子商务中的大规模高频定价

Stefan Birr, Tobias Huelden, Mones Raslan, Adele Gouttes, Andreas Schmitt, Mateusz Koren, Johannes Stephan, Robert Streek, Manuel Kunz, Tim Januschowski

机构 * Zalando SE Databricks

AI总结 提出一种预测-优化框架,结合梯度提升树与多目标优化,实现时尚电商促销活动的每日高频定价,通过23次A/B测试验证,利润提升约6%。

详情

展开后加载摘要…

URL PDF HTML 收藏