arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

2026-06-24 至 2026-06-24 共收录 10
2606.24839 2026-06-24 cs.AI stat.AP 新提交

Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System

给评分者打分:评估智能数据分析系统的经验教训

Tian Zheng, Kai-Tai Hsu

机构 * Columbia University(哥伦比亚大学)

AI总结 针对智能数据分析系统输出复杂、难以评估的问题,提出三层人机评分级联(严格正则匹配、LLM宽松评分、基于片段的人工检查),在153个任务上实现100%精确率,宽松评分召回率97%,并通过迭代提示机制将评分成功率从36%提升至97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24516 2026-06-24 cs.CV 新提交

What Do Flow-Based Inverse Solvers Approximate? A Posterior-Transport View

基于流的逆求解器近似了什么?一种后验传输视角

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS(日本理化学研究所跨学科理论数学科学项目) RIKEN AIP(日本理化学研究所人工智能项目) South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

AI总结 本文从后验传输角度分析基于流的逆问题求解器,证明源分布重加权可精确采样后验,而轨迹引导方法存在偏差,并提出一种高效的修正求解器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24256 2026-06-24 cs.CV 新提交

Trimming the Long-Tail of Visual World Modeling Evaluation

修剪视觉世界建模评估的长尾

Bingxuan Li, Yining Hong, Cheng Qian, Hyeonjeong Ha, Jiateng Liu, Zhenhailong Wang, Yue Guo, Yunzhu Li, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

AI总结 针对视觉世界模型在罕见物理交互上泛化不足的问题,提出Tailor-Bench基准,通过常规、非常规和不可能三种场景模式系统评估模型推理能力,揭示长尾性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24160 2026-06-24 cs.AI 新提交

An Introduction to Causal Reinforcement Learning

因果强化学习导论

Elias Bareinboim, Junzhe Zhang, Sanghack Lee

机构 * Columbia University(哥伦比亚大学) Graduate School of Data Science(数据科学研究生院)

AI总结 本文提出将因果推断与强化学习统一在结构因果模型框架下,引入广义策略学习、模仿学习和反事实学习等新任务,形成因果强化学习(CRL)领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23913 2026-06-24 cs.LG 新提交

Closing the Loop: Formally Verified Law as a Reward Signal for Self-Improving Legal AI

闭环:形式化验证的法律作为自我改进法律AI的奖励信号

Armin Heydari, Torben Leowald

机构 * Harvard University(哈佛大学) Columbia University(哥伦比亚大学)

AI总结 提出一种架构,通过LLM驱动的形式化转换和验证内核,为法律AI提供可验证的奖励信号,实现闭环强化学习,并在多个法律领域展示其优势。

Comments 14 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22775 2026-06-24 stat.ME cs.LG 新提交

Target-Aware Linear Regression Under Distribution Shift

分布漂移下的目标感知线性回归

Zhewen Hou, Tian Zheng

机构 * Department of Statistics(统计学系) Columbia University(哥伦比亚大学)

AI总结 针对训练与部署间的分布漂移,提出混合损失估计器作为目标感知基准,并开发了约束矩匹配和两阶段估计两种计算可行方案,推导渐近均方误差并比较性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21894 2026-06-24 cs.SE cs.AI 新提交

Skills for the future software profession: beyond agentic AI!

未来软件职业的技能:超越智能体AI!

Sungmin Kang, Baishakhi Ray, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学)

AI总结 本文通过2026年在纽约和新加坡举行的两场圆桌会议,总结未来软件工程师所需的核心技能,强调验证与确认在智能体处理实现时的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19416 2026-06-24 cs.LG 新提交

MortarBench: Evaluating Mortgage Loan Origination Agents

MortarBench: 评估抵押贷款发起代理

Matthew Toles, Yunan Lu, Manav Munjal, Bojun Liu, Yuanhao Deng, Stephanie Selig, Derek Rindner, Cheng Li, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Tidalwave

AI总结 提出MortarBench基准,通过金融数据合成与变异管道生成覆盖边缘案例的示例,评估大语言模型在贷款发起任务中的表现,发现模型准确率低且存在偏见,并引入CRIT校准框架提升准确率至80.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00069 2026-06-24 cs.CY cs.AI cs.CL 版本更新

Societal Alignment Frameworks Can Improve LLM Alignment

社会对齐框架可以改进大语言模型对齐

Karolina Stańczak, Nicholas Meade, Mehar Bhatia, Hattie Zhou, Konstantin Böttinger, Jeremy Barnes, Jason Stanley, Jessica Montgomery, Richard Zemel, Nicolas Papernot, Nicolas Chapados, Denis Therien, Timothy P. Lillicrap, Ana Marasović, Sylvie Delacroix, Gillian K. Hadfield, Siva Reddy

机构 * ETH Zurich(苏黎世联邦理工学院) Mila, McGill University(麦吉尔大学米尔人工智能实验室) University of Cambridge(剑桥大学) Columbia University(哥伦比亚大学) University of Toronto, Google DeepMind(多伦多大学与DeepMind) McGill University, ServiceNow(麦吉尔大学与ServiceNow) Google DeepMind(谷歌DeepMind) University of Utah(犹他大学) King's College London(伦敦国王学院) Johns Hopkins University(约翰霍普金斯大学) Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)

AI总结 本文提出借鉴社会、经济和契约对齐框架来改进大语言模型对齐,探讨不确定性在其中的作用,并将目标未指定性视为机遇而非缺陷,同时强调参与式对齐界面设计的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07761 2026-06-24 cs.LG cs.AI stat.ML 版本更新

Impatient Bandits: Optimizing for the Long-Term Without Delay

不耐烦的赌博机:无需延迟地优化长期目标

Kelly W. Zhang, Thomas Baldwin-McDonald, Kamil Ciosek, Lucas Maystre, Daniel Russo

机构 * Imperial College London(帝国理工学院伦敦分校) University of Manchester(曼彻斯特大学) Spotify Reflection AI Columbia University(哥伦比亚大学)

AI总结 针对推荐系统中长期用户满意度优化问题,提出一种结合贝叶斯滤波的延迟奖励预测模型和赌博机算法,利用短期代理信号加速学习,理论证明遗憾界依赖于渐进反馈价值,在播客推荐A/B测试中显著优于基线方法。

Comments To appear in Journal of Machine Learning (JMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏