arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

2026-07-01 至 2026-07-01 共收录 6
2606.31630 2026-07-01 cs.LG 新提交

Calibration, Not Compilation: Detecting and Repairing Misspecified Probabilistic Programs Written by Language Models

校准,而非编译:检测和修复语言模型编写的错误指定概率程序

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS RIKEN AIP South China University of Technology(南方科技大学) Columbia University(哥伦比亚大学)

AI总结 本文提出用贝叶斯工作流(后验预测检查、模拟校准等)作为验证器,检测和修复LLM编写的概率程序中的统计错误,在检测(AUC 0.97)和修复(显著优于单元测试反馈)上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30923 2026-07-01 cs.LG cs.AI stat.ML 新提交

Behavior Cloning is Not All You Need: The Optimality of On-Policy Distillation for Noisy Expert Feedback

行为克隆并非万能:带噪声专家反馈的在线策略蒸馏的最优性

Ved Sriraman, Peihan Liu, Daniel Hsu, Adam Block

机构 * Columbia University(哥伦比亚大学)

AI总结 针对噪声专家反馈场景,理论证明离线模仿学习样本复杂度指数增长,而在线策略蒸馏可实现多项式依赖,解释了为何在线方法优于离线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30850 2026-07-01 cs.AI 新提交

BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation

BayesBench: 评估多轮证据积累下LLM信念轨迹

Ankur Samanta, Akshayaa Magesh, Tal Lancewicki, Ayush Jain, Youliang Yu, Paul Sajda, Kaveh Hassani, Aditya Modi, Daniel R. Jiang, Yonathan Efroni

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超级智能实验室) Tel Aviv University(特拉维夫大学)

AI总结 提出BayesBench基准,通过三个渐进复杂任务评估LLM在多轮证据积累中的信念更新是否接近贝叶斯理性,发现规模提升改善潜在推理但未可靠转化为预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25086 2026-07-01 cs.LG cs.AI stat.ML 新提交

Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models

为返回的模型进行训练:改进迭代平均语言模型的优化

Kwok Chun Au, Adam Block

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系)

AI总结 针对返回迭代平均而非最终迭代的语言模型,提出PACE方法,通过最优控制理论优化平均估计器,在二次模型中证明其能显著降低均方误差,并在1-2B参数LM微调和GPT-2预训练中优于AdamW。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11894 2026-07-01 eess.SY cs.LG cs.SY eess.IV nlin.CD 版本更新

Automated Discovery of Operable Dynamics from Videos

从视频中自动发现可操作的动力学

Kuang Huang, Dong Heon Cho, Boyuan Chen

机构 * Columbia University(哥伦比亚大学) Duke University(杜克大学)

AI总结 提出一种无需先验领域知识、直接从视频自动发现低维可操作动力学表示(包括紧凑状态变量和可微向量场)的框架,通过定量和定性分析验证其在识别稳定平衡、预测固有频率及检测混沌和极限环行为方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00305 2026-07-01 stat.ME cs.LG math.ST stat.ML stat.TH 版本更新

Multiple Testing of Linear Forms for Noisy Matrix Completion

噪声矩阵补全中线性形式的多元检验

Wanteng Ma, Lilun Du, Dong Xia, Ming Yuan

机构 * University of Pennsylvania(宾夕法尼亚大学) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology(香港科技大学) Columbia University(哥伦比亚大学)

AI总结 针对大规模推荐系统中噪声矩阵补全的多元线性形式检验问题,提出一种数据分割与对称聚合方法,通过构造具有锐利渐近性质的统计量控制错误发现率,在近最优样本量下实现有效FDR控制与统计功效。

详情

展开后加载摘要…

URL PDF HTML 收藏