arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

2026-05-27 至 2026-05-27 共收录 5
2605.25507 2026-05-27 cs.AI

Credit Assignment with Resets in Language Model Reasoning

语言模型推理中带有重置的信用分配

Ankur Samanta, Akshayaa Magesh, Ayush Jain, Youliang Yu, Daniel Jiang, Kavosh Asadi, Kaveh Hassani, Paul Sajda, Jalaj Bhandari, Yonathan Efroni

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室) Tel Aviv University(特拉维夫大学)

AI总结 提出随机重置策略优化(RRPO)和自重置策略优化(SRPO)两种方法,通过重置到中间状态并重新采样反事实延续来改进语言模型多步推理中的信用分配,SRPO在多个推理基准上优于标准GRPO和RRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24219 2026-05-27 cs.AI

Beyond Final Answers: Auditing Trajectory-Level Hallucinations in Multi-Agent Industrial Workflows

超越最终答案:多智能体工业工作流中的轨迹级幻觉审计

Harshada Badave, Santosh Borse, Andrea Gomez, Harshitha Narahari, Sara Carter, Vishwa Bhatt, Aishani Rachakonda, Shuxin Lin, Dhaval Patel

机构 * IBM Columbia University(哥伦比亚大学)

AI总结 提出Trajel数据集和评估框架,通过五类幻觉分类法审计多智能体工业工作流中的轨迹级幻觉,发现现有基准忽略的常见失败模式,并证明轨迹感知检测优于标准事后验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26413 2026-05-27 stat.ME cs.AI cs.LG stat.ML

Confounder Detection via Treatment Intent: A New Observational Study Design

通过治疗意图进行混杂检测:一种新的观察性研究设计

Drago Plecko, Patrik Okanovic, Torsten Hoefler, Elias Bareinboim

机构 * UCLA(加州大学洛杉矶分校) ETH Zurich(苏黎世联邦理工学院) Columbia University(哥伦比亚大学)

AI总结 提出一种通过询问治疗决策者比较配对单元来揭示未观测混杂因素的新研究设计,并在ICU数据中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18915 2026-05-27 cs.DS cs.LG

Testing Support Size More Efficiently Than Learning Histograms

比学习直方图更高效地测试支撑大小

Renato Ferreira Pinto, Nathaniel Harms

机构 * Columbia University, USA(哥伦比亚大学,美国) University of British Columbia, Canada(不列颠哥伦比亚大学,加拿大) University of Waterloo(多伦多大学) EPFL(苏黎世联邦理工学院)

AI总结 针对未知概率分布p的支撑大小测试问题,提出一种基于切比雪夫多项式的方法,仅需O(n/(ε log n) log(1/ε))个样本,优于学习直方图的Θ(n/(ε^2 log n))样本,并给出支撑大小的更大下界。

Comments 42 pages. This is the TheoretiCS journal version

Journal ref TheoretiCS, Volume 5 (May 21, 2026) theoretics:16717

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17774 2026-05-27 cs.CL

Internalizing Tool Knowledge in Small Language Models via QLoRA Fine-Tuning

通过QLoRA微调将工具知识内化到小型语言模型中

Yuval Shemla, Ayal Yakobe, Tanmay Agarwal, Dhaval Patel, Kaoutar El Maghraoui

机构 * Columbia School of General Studies, Columbia University, NY, USA(哥伦比亚大学泛研学院) Columbia Engineering, Columbia University, NY, USA(哥伦比亚大学工程学院) IBM Research, NY, USA(IBM研究院)

AI总结 本文研究通过QLoRA参数高效微调将工具知识内化到小型语言模型中,在AssetOpsBench基准上,微调后的Gemma 4 E4B和Qwen3-4B模型在无描述推理下优于有完整工具描述的未微调基线,输入长度减少82.6%,规划分数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏