arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Databricks

共收录 18
2607.18603 2026-07-22 cs.IR cs.AI cs.CL 新提交

AutoIndex: Learning Representation Programs for Retrieval

AutoIndex:学习用于检索的表示程序

Sam O'Nuallain, Nithya Rajkumar, Ramya Narayanasamy, Hanna Jiang, Shreyas Chaudhari, Andrew Drozdov

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Databricks Mosaic Research(Databricks Mosaic研究)

AI总结 AutoIndex框架通过搜索对文档进行多种操作的程序来优化文档表示,在CRUMB基准上评估,相比BM25基线显著提升召回率,证明文档表示应作为优化目标,而非固定预处理选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13037 2026-07-16 cs.AI 新提交

OriginBlame: Record- and Token-Level Data Provenance for AI Training Datasets

OriginBlame:人工智能训练数据集的记录级和令牌级数据溯源

Haolin Xue

机构 * HuggingFace(拥抱脸) Datatrove(数据宝库) The Linux Foundation(Linux基金会) Databricks(Databricks公司) Weights & Biases(权重与偏差公司)

AI总结 研究针对模型训练者在数据删除时无法精准定位记录所属作者的问题,提出OriginBlame系统,通过记录级和令牌级溯源及确定性查询解决,评估显示能消除过度删除并提升遗忘效果,增加少量吞吐量开销。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13757 2026-07-08 cs.CR cs.AI 新提交

SEVRA-BENCH: Social Engineering of Vulnerabilities in Review Agents

SEVRA-BENCH:审查智能体中的社会工程漏洞

Rui Melo, Riccardo Fogliato, Sean Zhou, Pratiksha Thaker, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能) Amazon AWS(亚马逊AWS) Databricks

AI总结 提出SEVRA-BENCH基准,通过社会工程攻击框架评估LLM代码审查智能体拒绝恶意PR的能力,发现闭源与开源模型间存在显著安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24050 2026-06-24 cs.SE cs.AI stat.AP 版本更新

More Skills, Worse Agents? Skill Shadowing Degrades Performance When Expanding Skill Libraries

更多技能,更差智能体?扩展技能库时技能遮蔽降低性能

Hongwen Song, Song Wei

机构 * Databricks Inc.(Databricks公司)

AI总结 本文研究LLM智能体技能库扩展导致性能下降的现象,提出将性能下降分解为技能遮蔽和上下文开销两种效应,并通过实验证明技能遮蔽是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13741 2026-06-15 cs.LG 新提交

High-Frequency Pricing at Scale for E-Commerce

电子商务中的大规模高频定价

Stefan Birr, Tobias Huelden, Mones Raslan, Adele Gouttes, Andreas Schmitt, Mateusz Koren, Johannes Stephan, Robert Streek, Manuel Kunz, Tim Januschowski

机构 * Zalando SE Databricks

AI总结 提出一种预测-优化框架,结合梯度提升树与多目标优化,实现时尚电商促销活动的每日高频定价,通过23次A/B测试验证,利润提升约6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22661 2026-04-27 cs.IR cs.CL

Can QPP Choose the Right Query Variant? Evaluating Query Variant Selection for RAG Pipelines

QPP能否选择正确的查询变体?评估RAG流水线中的查询变体选择

Negar Arabzadeh, Andrew Drozdov, Michael Bendersky, Matei Zaharia

机构 * UC Berkeley(伯克利大学) Databricks(Databricks公司)

AI总结 本文研究了在RAG流水线中如何选择最佳查询变体,通过大规模实验评估了预检索和后检索预测器的性能,发现检索相关性与生成保真度之间存在'效用差距',但QPP能有效提升端到端质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08801 2026-04-13 cs.LG cs.CL

$p1$: Better Prompt Optimization with Fewer Prompts

用更少提示实现更好的提示优化

Zhaolin Gao, Yu, Wang, Bo Liu, Thorsten Joachims, Kianté Brantley, Wen Sun

机构 * Cornell University(康奈尔大学) Microsoft(微软) Harvard University(哈佛大学) Databricks AI Research(Databricks AI研究)

AI总结 研究揭示提示优化有效性取决于系统提示与响应方差,提出$p1$过滤方法提升优化效果,实验显示其在推理基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05744 2026-04-13 cs.CL cs.SE

CodeScout: Contextual Problem Statement Enhancement for Software Agents

CodeScout: 为软件代理提供上下文化的问题陈述增强

Manan Suri, Xiangci Li, Mehdi Shojaie, Songyang Han, Chao-Chun Hsu, Shweta Garg, Aniket Anand Deshmukh, Varun Kumar

机构 * University of Maryland, College Park(马里兰大学帕克分校) Amazon Web Services (AWS)(亚马逊云服务(AWS)) Databricks

AI总结 CodeScout通过轻量级预探索将模糊请求转化为完整问题陈述,提升软件代理性能,实验表明其在解决率上提升20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23349 2026-03-13 cs.LG cs.AI

FlashOptim: Optimizers for Memory-Efficient Training

FlashOptim: 用于内存高效训练的优化器

Jose Javier Gonzalez Ortiz, Abhay Gupta, Christopher Rinard, Davis Blalock

机构 * Databricks AI Research(Databricks AI研究院)

AI总结 FlashOptim通过减少每参数内存消耗50%以上,同时保持模型质量和API兼容性,显著提升内存高效训练性能。

Comments Source code is available at https://github.com/databricks/flashoptim

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08655 2026-03-10 cs.AI cs.CL cs.IR

OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning

OfficeQA Pro:一个企业级端到端 grounded 推理基准测试

Krista Opsahl-Ong, Arnav Singhvi, Jasmine Collins, Ivan Zhou, Cindy Wang, Ashutosh Baheti, Owen Oertell, Jacob Portes, Sam Havens, Erich Elsen, Michael Bendersky, Matei Zaharia, Xing Chen

机构 * Databricks AI Research(Databricks人工智能研究)

AI总结 OfficeQA Pro 是一个企业级基准测试,评估 AI 代理在大规模文档语料库上进行端到端 grounded 推理的能力,发现结构化文档表示可显著提升性能。

Comments 24 pages, 16 figures. Introduces the OfficeQA Pro benchmark for grounded reasoning over enterprise documents

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05218 2026-03-06 cs.AI cs.LG

KARL: Knowledge Agents via Reinforcement Learning

通过强化学习的知识代理:KARL

Jonathan D. Chang, Andrew Drozdov, Shubham Toshniwal, Owen Oertell, Alexander Trott, Jacob Portes, Abhay Gupta, Pallavi Koppol, Ashutosh Baheti, Sean Kulinski, Ivan Zhou, Irene Dea, Krista Opsahl-Ong, Simon Favreau-Lessard, Sean Owen, Jose Javier Gonzalez Ortiz, Arnav Singhvi, Xabi Andrade, Cindy Wang, Kartik Sreenivasan, Sam Havens, Jialu Liu, Peyton DeNiro, Wen Sun, Michael Bendersky, Jonathan Frankle

机构 * Databricks AI Research(Databricks人工智能研究)

AI总结 KARL通过强化学习训练企业搜索代理,结合多任务学习和定制合成数据,实现高效且高性能的知识代理,在多个复杂任务中表现优异。

Comments 77 pages, 43 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20543 2026-02-25 cs.CV

Beyond Human Performance: A Vision-Language Multi-Agent Approach for Quality Control in Pharmaceutical Manufacturing

超越人类表现:一种视觉-语言多智能体方法用于制药制造中的质量控制

Subhra Jyoti Mandal, Lara Rachidi, Puneet Jain, Matthieu Duvinage, Sander W. Timmer

机构 * GSK, Enterprise AI(葛兰素史克、企业人工智能) Databricks

AI总结 本文提出一种结合深度学习与视觉-语言模型的多智能体框架,用于提高制药制造中菌落形成单位检测的准确性和效率,实现高质量的质量控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03310 2026-01-13 cs.AI cs.SE

app.build: A Production Framework for Scaling Agentic Prompt-to-App Generation with Environment Scaffolding

app.build:一种用于扩展基于代理的提示到应用程序生成的生产框架

Evgenii Kniazev, Arseny Kravchenko, Igor Rekun, James Broadhead, Nikita Shamgunov, Pranav Sah, Pratik Nichite, Ivan Yamshchikov

机构 * Databricks THWS University of Applied Sciences Würzburg-Schweinfurt (CAIRO)(THWS应用科学大学沃尔夫斯堡-施维林(CAIRO))

AI总结 app.build通过结构化环境和系统验证提升基于代理的应用程序生成效率,实现高可行性与质量,为生产级代理系统提供参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13650 2025-12-09 eess.IV cs.CV

Tyche: Stochastic In-Context Learning for Medical Image Segmentation

Tyche: 医疗图像分割的随机上下文学习

Marianne Rakic, Hallee E. Wong, Jose Javier Gonzalez Ortiz, Beth Cimini, John Guttag, Adrian V. Dalca

机构 * CSAIL MIT(MIT计算机科学与人工智能实验室) MIT Broad Institute(MITBroad研究所) MGH(麻省总医院) MosaicML DataBricks MIT HMS, MGH(哈佛医学院、麻省总医院)

AI总结 Tyche通过上下文学习方法,无需重新训练即可为医疗图像分割生成随机预测,提升分割任务的灵活性和鲁棒性。

Comments Accepted at IEEE / CVF Computer Vision and Pattern Recognition Conference (CVPR) 2024 as a highlight. Code available at https://github.com/mariannerakic/tyche

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14919 2025-10-17 cs.CL cs.AI cs.LG

Predicting Task Performance with Context-aware Scaling Laws

Kyle Montgomery, David Park, Jianhong Tu, Michael Bendersky, Beliz Gunel, Dawn Song, Chenguang Wang

机构 * UC Santa Cruz(加州大学圣克ruz分校) Washington University in St. Louis(华盛顿大学圣路易斯分校) Databricks(Databricks公司) Google DeepMind(谷歌DeepMind) UC Berkeley(加州大学伯克利分校)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11823 2025-10-15 cs.CR cs.AI

BlackIce: A Containerized Red Teaming Toolkit for AI Security Testing

Caelin Kaplan, Alexander Warnecke, Neil Archibald

机构 * Databricks

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13128 2025-06-16 cs.IR cs.AI cs.CL

FreshStack: Building Realistic Benchmarks for Evaluating Retrieval on Technical Documents

Nandan Thakur, Jimmy Lin, Sam Havens, Michael Carbin, Omar Khattab, Andrew Drozdov

机构 * University of Waterloo(滑铁卢大学) Databricks(Databricks公司)

Comments 21 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04612 2025-04-25 cs.LG cs.AI cs.CL

Regressing the Relative Future: Efficient Policy Optimization for Multi-turn RLHF

Zhaolin Gao, Wenhao Zhan, Jonathan D. Chang, Gokul Swamy, Kianté Brantley, Jason D. Lee, Wen Sun

机构 * Cornell University(康奈尔大学) Princeton University(普林斯顿大学) Databricks Mosaic Research(Databricks 混合研究) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学)

详情

展开后加载摘要…

URL PDF HTML 收藏