arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

2026-07-01 至 2026-07-01 共收录 4
2606.31630 2026-07-01 cs.LG 新提交

Calibration, Not Compilation: Detecting and Repairing Misspecified Probabilistic Programs Written by Language Models

校准,而非编译:检测和修复语言模型编写的错误指定概率程序

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS RIKEN AIP South China University of Technology(南方科技大学) Columbia University(哥伦比亚大学)

AI总结 本文提出用贝叶斯工作流(后验预测检查、模拟校准等)作为验证器,检测和修复LLM编写的概率程序中的统计错误,在检测(AUC 0.97)和修复(显著优于单元测试反馈)上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30923 2026-07-01 cs.LG cs.AI stat.ML 新提交

Behavior Cloning is Not All You Need: The Optimality of On-Policy Distillation for Noisy Expert Feedback

行为克隆并非万能:带噪声专家反馈的在线策略蒸馏的最优性

Ved Sriraman, Peihan Liu, Daniel Hsu, Adam Block

机构 * Columbia University(哥伦比亚大学)

AI总结 针对噪声专家反馈场景,理论证明离线模仿学习样本复杂度指数增长,而在线策略蒸馏可实现多项式依赖,解释了为何在线方法优于离线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30850 2026-07-01 cs.AI 新提交

BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation

BayesBench: 评估多轮证据积累下LLM信念轨迹

Ankur Samanta, Akshayaa Magesh, Tal Lancewicki, Ayush Jain, Youliang Yu, Paul Sajda, Kaveh Hassani, Aditya Modi, Daniel R. Jiang, Yonathan Efroni

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超级智能实验室) Tel Aviv University(特拉维夫大学)

AI总结 提出BayesBench基准,通过三个渐进复杂任务评估LLM在多轮证据积累中的信念更新是否接近贝叶斯理性,发现规模提升改善潜在推理但未可靠转化为预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25086 2026-07-01 cs.LG cs.AI stat.ML 新提交

Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models

为返回的模型进行训练:改进迭代平均语言模型的优化

Kwok Chun Au, Adam Block

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系)

AI总结 针对返回迭代平均而非最终迭代的语言模型,提出PACE方法,通过最优控制理论优化平均估计器,在二次模型中证明其能显著降低均方误差,并在1-2B参数LM微调和GPT-2预训练中优于AdamW。

详情

展开后加载摘要…

URL PDF HTML 收藏