arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Cornell University(康奈尔大学)

2026-05-19 至 2026-05-19 共收录 10
2602.02262 2026-05-19 cs.SE cs.AI cs.CL

OmniCode: A Benchmark for Evaluating Software Engineering Agents

OmniCode: 一个评估软件工程代理的基准

Atharv Sonwane, Eng-Shen Tu, Wei-Chung Lu, Claas Beger, Carter Larsen, Debjit Dhar, Simon Alford, Rachel Chen, Ronit Pattanayak, Tuan Anh Dang, Guohao Chen, Gloria Geng, Kevin Ellis, Saikat Dutta

机构 * Cornell University(康奈尔大学) Independent contributor(独立贡献者) UC Santa Barbara(加州大学圣巴巴拉分校) Jadavpur University(贾瓦伊普尔大学) New York University(纽约大学)

AI总结 本文提出OmniCode,一个涵盖更广泛任务类别的软件工程基准,旨在评估软件代理在不同软件开发方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03425 2026-05-19 cs.LG cs.AI

The Illusion of Specialization: Unveiling the Domain-Invariant "Standing Committee" in Mixture-of-Experts Models

领域专精的幻觉:揭示混合专家模型中的领域不变‘ standing committee ’

Yan Wang, Yitao Xu, Nanhan Shen, Jinyan Su, Jimin Huang, Zining Zhu

机构 * The Fin AI(Fin AI) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) Stevens Institute of Technology(史蒂文斯理工学院) The University of Manchester(曼彻斯特大学)

AI总结 本研究质疑混合专家模型通过稀疏路由实现领域专精的假设,提出COMMITTEEAUDIT框架分析专家组而非个体专家的路由行为,发现领域不变的standing committee,揭示模型存在向集中计算偏倚的结构倾向,表明混合专家模型中的专精程度远低于预期。

Comments Accepted by ACL 2026 main conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07347 2026-05-19 stat.ML cs.LG math.PR

Throughput-Optimal Scheduling Algorithms for LLM Inference and AI Agents

面向LLM推理和AI代理的吞吐量最优调度算法

J. G. Dai, Tianze Deng, Yueying Li, Tianyi Peng

机构 * School of Operations Research and Information Engineering, Cornell University(Cornell大学运筹学与信息工程学院) Operations Management, Booth School of Business, University of Chicago(芝加哥大学博斯商学院运营管理系) Decision, Risk and Operations, Columbia Business School, Columbia University(哥伦比亚大学哥伦比亚商学院决策、风险与运营系)

AI总结 本文从排队论角度研究了LLM推理系统的吞吐量优化问题,证明了工作保持调度算法在DAG和Fork-Join路由拓扑中能实现最大吞吐量,并揭示了批量处理网络中K-FCFS调度的流极限框架,评估了Orca和Sarathi-Serve的吞吐量最优性,同时指出批量大小限制和循环路由拓扑对吞吐量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16755 2026-05-19 cs.LG cs.AI

Learning Unbiased Permutations via Flow Matching

通过流匹配学习无偏排列

Yimeng Min, Carla P. Gomes

机构 * Department of Computer Science(计算机科学系) Cornell University(康奈尔大学)

AI总结 本文提出PermFlow框架,通过在具有单位行和列和的矩阵仿射子空间上直接操作,学习多模态排列分布,避免了基于熵正则化Sinkhorn方法在模糊性下的崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16719 2026-05-19 physics.soc-ph cs.AI cs.SI

Universal Dynamics of Punctuated Progress

突变进步的普遍动力学

Yian Yin, Dashun Wang

机构 * Department of Information Science, Cornell University(康奈尔大学信息科学系) Center for Science of Science and Innovation, Northwestern University(西北大学科学与创新中心) McCormick School of Engineering, Northwestern University(西北大学工程学院) Kellogg School of Management, Northwestern University(西北大学管理学院) Ryan Institute on Complexity, Northwestern University(西北大学复杂性研究院) Northwestern Innovation Institute, Northwestern University(西北大学创新研究院)

AI总结 本文研究了科学和技术前沿突变进步的动力学,通过分析9个不同领域的历史数据,发现三个普遍规律:突变间等待时间服从重尾分布,前沿记录积累速率呈亚线性增长,记录突破事件在时间上存在相关性。作者提出一个包含激进创新和渐进改进的模型,揭示了突变进步的普遍动力学机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07438 2026-05-19 cs.AI

How Wrong Can Your Counterfactual Be? Quantifying Confounding Bias for Continuous Treatments without a Control Group

你的反事实能错到什么程度?在没有对照组的情况下,为连续治疗量化混杂偏倚

Yu Wang, Xiangchen Liu, Siguang Li

机构 * Department of Economics, Cornell University(康奈尔大学经济学系) Department of Family and Consumer Sciences, California State University, Long Beach(加州州立大学长滩分校家庭与消费者科学系) Society Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)社会枢纽)

AI总结 本文提出一种因果压力测试框架,通过假设未观测混杂因素对结果和宏观经济变量的加性影响,量化连续治疗下的混杂偏倚,并分析两种估计方法的误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21185 2026-05-19 cs.LG

The Diffusion Duality, Chapter II: $Ψ$-Samplers

扩散对偶性,第二章:Ψ-采样器

Justin Deschenaux, Caglar Gulcehre, Subham Sekhar Sahoo

机构 * EPFL, Lausanne, Switzerland(苏黎世联邦理工学院,洛桑分校) Microsoft AI(微软人工智能) Cornell Tech, NY(康奈尔科技)

AI总结 本文提出了一种通用的预测-校正采样器,用于离散扩散模型,提升了语言和图像建模的生成质量,并展示了其在训练效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07191 2026-05-19 cs.RO cs.LG stat.ME

Curb Your Attention: Causal Attention Gating for Robust Trajectory Prediction in Autonomous Driving

抑制注意力:因果注意力门控用于自动驾驶中的鲁棒轨迹预测

Ehsan Ahmadi, Ray Mercurius, Soheil Alizadeh, Kasra Rezaee, Amir Rasouli

机构 * University of Alberta(阿尔伯塔大学) Noah’s Ark Laboratory, Huawei Technologies Canada(华为加拿大诺亚实验室) Cornell University(康奈尔大学)

AI总结 本文提出CRiTIC模型,通过因果发现网络识别agent间因果关系,并引入因果注意力门控机制提升轨迹预测的鲁棒性和泛化能力,实验表明模型在对抗非因果扰动时鲁棒性提升54%。

Comments Accepted ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16378 2026-05-19 cs.LG cs.AI

Mixing Times of Glauber Dynamics on Masked Language Models

掩码语言模型上Glauber动力学的混合时间

Suvadip Sana, Sami Wolf, Neer Mehta, Alina Shah, Aitzaz Shaikh, Janna Goodman, Lionel Levine

机构 * Department of Statistics and Data Science(统计与数据科学系) Cornell University(康奈尔大学) Department of Mathematics(数学系)

AI总结 研究掩码语言模型迭代生成时的全局分布行为,通过Glauber动力学马尔可夫链分析其混合时间,揭示在不同温度下混合行为的相变现象。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14068 2026-05-19 cs.CV cs.LG

CurveBench: A Benchmark for Exact Topological Reasoning over Nested Jordan Curves

CurveBench:一种用于嵌套乔丹曲线精确拓扑推理的基准

Amirreza Mohseni, Mona Mohammadi, Morteza Saghafian, Naser Talebizadeh Sardari

机构 * Maastricht University(马斯特里赫特大学) Cornell University(康奈尔大学) TU Wien(维也纳技术大学) Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 CurveBench是一个用于从视觉输入中进行层次拓扑推理的基准,包含756张非相交的乔丹曲线图像,通过结构预测任务恢复由曲线诱导的根树结构。

详情

展开后加载摘要…

URL PDF HTML 收藏