ORCA-bench: How Ready Are Language Model Agents for Oncall?
ORCA-bench:语言模型智能体的值班待命准备程度如何?
机构 * Cornell Tech(康奈尔科技学院) ; Traversal ; Columbia University(哥伦比亚大学)
AI总结 该研究推出ORCA-bench基准,评估编码智能体在生产级值班待命场景下的根本原因分析能力,发现现有前沿智能体表现不佳,凸显其距离安全胜任生产可靠性工作仍有较大差距。
高校专区
ORCA-bench:语言模型智能体的值班待命准备程度如何?
机构 * Cornell Tech(康奈尔科技学院) ; Traversal ; Columbia University(哥伦比亚大学)
AI总结 该研究推出ORCA-bench基准,评估编码智能体在生产级值班待命场景下的根本原因分析能力,发现现有前沿智能体表现不佳,凸显其距离安全胜任生产可靠性工作仍有较大差距。
AdaCorrection: 用于准确扩散变换器的自适应偏移缓存校正
机构 * Columbia University(哥伦比亚大学)
AI总结 本文提出AdaCorrection框架,通过自适应偏移缓存校正提升扩散变换器的生成质量与缓存复用效率,减少计算开销并保持高保真度。
语言模型输出分布中的尾部风险估计
机构 * Columbia University(哥伦比亚大学) ; Department of Computer Science, New York University(纽约大学计算机科学系) ; Center for Data Science, New York University(纽约大学数据科学中心)
AI总结 提出一种基于重要性采样的方法,通过创建不安全版本来高效估计语言模型产生有害输出的尾部概率,在10-20倍更少样本下匹配蒙特卡洛估计,并揭示模型对输入的敏感性。
Comments Accepted to ICML 2026
π-注意力:用于高效长上下文建模的周期性稀疏变换器
机构 * University of California - Los Angeles(加州大学洛杉矶分校) ; Columbia University(哥伦比亚大学)
AI总结 本文提出π注意力,通过周期性稀疏结构实现高效长上下文建模,相比环形注意力在接收场增长上更优,且在相同上下文长度下使用更少的GPU。
诊断视频生成中不可逆过程的欠发展问题
机构 * RIKEN iTHEMS(理化学研究所 iTHEMS) ; RIKEN AIP(理化学研究所 AIP) ; South China University of Technology(华南理工大学) ; Columbia University(哥伦比亚大学)
AI总结 本研究针对视频生成模型是否遵循物理不可逆性的问题,提出含进展与静态率的两部分协议,发现模型存在不可逆属性欠发展问题,并验证解耦属性潜空间的单调性构建可消除可操纵的读出引导。
随机薛定谔扩散模型用于纯态集合生成
机构 * RIKEN iTHEMS ; RIKEN AIP ; South China University of Technology(华南理工大学) ; Stanford University(斯坦福大学) ; Columbia University(哥伦比亚大学)
AI总结 本文提出随机薛定谔扩散模型(SSDMs),在复射影空间CP^{d-1}上构建基于分数的生成框架,通过局部欧几里得奥本海姆-乌尔申贝格近似实现无解析过渡密度的训练,提升量子机器学习的泛化能力。
纽约气味:一个大规模多模态数据集用于嗅觉
机构 * Columbia University(哥伦比亚大学) ; Cornell University(康奈尔大学) ; Osmo Labs(Osmo实验室)
AI总结 New York Smells 数据集通过多模态数据提升机器对嗅觉的感知能力,展示了视觉数据在跨模态学习中的作用。
Comments Project website at https://smell.cs.columbia.edu
机构 * Florida State University(佛罗里达州立大学) ; Harvard University(哈佛大学) ; Columbia University(哥伦比亚大学)
Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML 2025), Proceedings of Machine Learning Research 267:63690-63706, 2025
隐式世界模型能知晓什么?多模态预测表示中的物理参数可识别性
机构 * New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Columbia University(哥伦比亚大学)
AI总结 该研究通过可控实验揭示,隐式世界模型的目标函数结构决定其获取的物理参数,输入与预测目标分别限制和决定可获知的物理量,额外数据仅优化已获取的参数。
AI4BayesCode: 从自然语言描述到经过验证的模块化状态性贝叶斯采样器
机构 * Department of Biostatistics, Columbia University(哥伦比亚大学生物统计学系)
AI总结 该研究提出AI4BayesCode系统,通过自然语言描述生成可运行且验证过的MCMC采样器,采用模块化设计和递归状态性编码范式,提升了贝叶斯模型的可靠性和扩展性。
Orchard:一个开源的智能体建模框架
机构 * Microsoft Research(微软研究院) ; Columbia University(哥伦比亚大学) ; UIUC(伊利诺伊大学香槟分校)
AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。
具有边距的多面体学习的紧界
机构 * Columbia University(哥伦比亚大学) ; Georgia Tech(佐治亚理工学院)
AI总结 本文提出了一种在误差ε内学习k个半空间交集的算法,时间复杂度为多项式乘以指数项,改进了以往工作并匹配了密码学和统计查询下界。
DuplexGen:人机交替对话的自适应合成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Seoul National University(首尔大学) ; Columbia University(哥伦比亚大学) ; University of California, Berkeley(加州大学伯克利分校) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 DuplexGen框架通过将LLM预测与少量槽级人类偏好标注校准,生成场景自适应交替发言对话,契合人类偏好的效果优于未校准方法,证明人类校准对交替发言合成场景特定性的关键作用。
Comments Manuscript under review
VideoNorms:视频语言模型文化意识基准测试
机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)
AI总结 本研究推出VideoNorms数据集评估VideoLLMs的文化规范意识,发现模型中文表现逊于英文、提供非语言证据更困难,视频模态必要且规模扩大无分类分数提升,成果助力文化导向的视频模型训练与评估。
Comments 29 pages, 6 figures, 19 tables. IC2S2 2026, C3NLP@ACL 2026
Transformer Transformer:一种用于运动条件机器人协同设计的统一模型
机构 * Stanford University(斯坦福大学) ; Columbia University(哥伦比亚大学)
AI总结 研究运动条件机器人协同设计问题,提出基于RoboTokens训练的Transformer Transformer统一模型,能跨实体空间和用例,通过动力学自引导优化设计,实验显示其可零样本优化,制造的优化设计大幅降低跟踪误差。
Comments 26 pages, 12 figures, 20 tables. Project page: https://transformer-transformer.github.io
代码切换语音设置中人类与分类模型夹带行为的跨语言比较
机构 * Columbia University(哥伦比亚大学) ; Instagram(照片墙)
AI总结 研究代码切换语音设置中人类与分类模型夹带行为,通过跨语言分析发现词汇夹带具普遍性,声学韵律等方面有语境差异,分类器能检测夹带但优先考虑的特征与人类不同,引入评估模型决策框架并提出对话代理发展挑战。
PreDiff-LM:具有混合注意力的预训练离散掩码扩散语言模型
机构 * University of Southern California(南加州大学) ; New York University(纽约大学) ; Columbia University(哥伦比亚大学) ; University of California, Berkeley(加州大学伯克利分校) ; Stevens Institute of Technology(史蒂文斯理工学院) ; University of Notre Dame(圣母大学) ; Nanyang Technological University(南洋理工大学)
AI总结 研究离散掩码扩散语言模型中因果预训练与双向去噪协调问题,提出PreDiff-LM模型,通过混合注意力机制改进无条件困惑度等指标,在多方面优于先前扩散基线,明确与优化AR模型的差距,为预训练因果主干调整提供补充机制。
数据更少,对齐更好:用于偏好优化的数据中心多评估器一致性方法
机构 * University of Southern California(南加州大学) ; New York University(纽约大学) ; Columbia University(哥伦比亚大学) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; City College of New York, CUNY(纽约市立大学城市学院) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Nanyang Technological University(南洋理工大学)
AI总结 研究聚焦偏好优化,提出DMAPO方法,从目标策略生成候选响应,经多评估器评估、校正后保留高一致性示例。实验表明该方法数据效率高,能提升模型在MT - Bench等指标上的表现,且改变评估器或准则对下游性能影响小。
Comments 19 pages
对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应
机构 * New York University, New York, USA(纽约大学) ; Tsinghua University, Beijing, China(清华大学) ; Columbia University, New York, USA(哥伦比亚大学) ; University of Michigan, Ann Arbor, USA(密歇根大学)
AI总结 本文审计了五种前沿视觉-语言模型在医学视觉问答中的表现,发现定位失败和格式崩溃是信任瓶颈,通过领域适应可提升性能。
迈向电子健康记录中文档不一致性的自动检测
机构 * Duke University(杜克大学) ; Columbia University Medical Center(哥伦比亚大学医学中心) ; Vanderbilt University Medical Center(范德堡大学医学中心)
AI总结 研究旨在检测电子健康记录中文档不一致性,采用两阶段LLM管道对3000份出院小结进行分析,发现多种类型不一致及反复出现的失败模式,建立了方法基础和概念框架以指导后续大规模分析。
通过对数偏差对语言模型进行极其简单的黑箱适应
机构 * Tel Aviv University(特拉维夫大学) ; Google Research(谷歌研究院) ; Columbia University(哥伦比亚大学)
AI总结 研究如何通过简单API级控制调整语言模型,开发黑箱方法学习对数偏差向量,无需修改模型权重或梯度,该方法在数学和推理基准上优于基础模型,是一种轻量级的语言模型适应机制。
Comments 36 pages, 4 figures, 6 tables. Appendix included. Code available at https://github.com/Ofek-Israeli/logit_bias_lm_adaptation
用上下文提示调优个性化你的大型视觉语言模型
机构 * Brown University(布朗大学) ; Columbia University(哥伦比亚大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Purdue University(普渡大学) ; Rutgers University(罗格斯大学)
AI总结 提出上下文提示调优(ICPT)方法,通过轻量投影模块从多参考图像中提取细粒度视觉语义并转化为连续提示,结合几何正则化解决环境偏差和跨概念干扰,实现高效个性化。
Comments Accepted at ECCV 2026, 27 pages, 10 figures, 5 tables
通过误差反馈事件驱动缓存加速频域扩散模型
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Yale University(耶鲁大学) ; East China Normal University(华东师范大学) ; Columbia University(哥伦比亚大学)
AI总结 本文提出E²-CRF方法,利用频域扩散模型的频谱局部化和镜像对称性,通过事件驱动的残差动态实现自适应缓存,提升推理速度2.2倍并保持样本质量。
CSV-Decode: 可证的子词汇解码以实现高效的大型语言模型推理
机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) ; College of Engineering, Columbia University(哥伦比亚大学工程学院) ; Department of Statistics, University of Wisconsin-Madison(威斯康星大学麦迪逊分校统计学系)
AI总结 CSV-Decode通过构建子词汇表实现高效的大语言模型推理,提供精确的top-k认证和ε-认证的softmax近似,显著提升速度并保持分布保证。
GazeLT:胸部X光片中视觉注意力引导的长尾疾病分类
机构 * Department of Biomedical Informatics, Stony Brook University, NY, US(斯通比克大学生物医学信息学系) ; Department of Radiology, Columbia University, NY, US(哥伦比亚大学放射学系) ; Department of Computer Science, Stony Brook University, NY, US(斯通比克大学计算机科学系)
AI总结 研究针对胸部X光片中长尾疾病分类问题,提出GazeLT方法,通过整合和分解机制利用视觉搜索时间维度,在两个公开数据集上实验,其平均准确率超最佳长尾损失方法4.1%、基于视觉注意力基线方法21.7%。
Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://protect.checkpoint.com/v2/r01/___https://melba-journal.org/2026:020___.YzJ1OnN0b255YnJvb2s6YzpnOmI4YTI5YmRmZTQ0YjIxZjdhNzI0YWJhZDc5NDA0MzdhOjc6Njc3Nzo5YTc1NmVjZTg2MTcwMjA1MDI5NzM4MTczZGEwYTNkOWIwMTI3NDM2Yzg0MGU3ZmQxY2RmNmMyNDdmN2JkODExOnQ6VDpG
Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)
智能体真实到模拟:使用视觉语言智能体进行基于物理的世界建模
机构 * University of British Columbia(英属哥伦比亚大学) ; Johns Hopkins University(约翰·霍普金斯大学) ; National University of Singapore(新加坡国立大学) ; Columbia University(哥伦比亚大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; Style3D(无合适对应中文名)
AI总结 研究针对机器人与物体交互的真实到模拟转换难题,提出智能体真实到模拟框架,利用视觉语言智能体进行广义物理世界建模,能转换真实记录为可模拟孪生体,在多场景评估效果良好,成本低,可用于下游机器人任务。
Comments Authorship change
WHBench:通过专家在环验证评估前沿大语言模型在女性健康主题上的表现
机构 * Columbia University(哥伦比亚大学) ; Rubric AI
AI总结 本文提出WHBench,通过专家设计的47个场景评估22个模型,揭示临床重要失败模式,强调安全性和公平性的重要性。
通过在线推断学习层次化潜在结构
机构 * Center for Theoretical Neuroscience and Zuckerman Institute(理论神经科学中心和Zuckerman研究所) ; Columbia University(哥伦比亚大学) ; Department of Psychiatry, Columbia University Irving Medical Center(精神病学系,哥伦比亚大学伊万杰琳医学中心) ; New York State Psychiatric Institute(纽约州精神医学研究所) ; Columbia Data Science Institute(哥伦比亚数据科学研究所)
AI总结 本文提出HOLMES模型,通过在线推断学习层次化潜在结构,实现了在序列数据中发现层次结构的可行计算框架。
Comments 4 figures, 5 supplementary figures
用于联邦参数高效微调的三叉戟频谱控制
机构 * School of IT, Deakin University(迪肯大学信息技术学院) ; Columbia University(哥伦比亚大学)
AI总结 研究针对联邦参数高效微调在非IID客户端异质性下的脆弱性,提出TRISHUL频谱控制框架,通过共享冻结多头低秩基、核范数近端收缩及非均匀分配适应头,提升了收敛性、稳定性和最终性能。
Comments 18 pages, 17 figures, 11 tables
FELT:从视觉生成触觉信号用于视觉触觉操纵
机构 * Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院) ; Columbia University(哥伦比亚大学) ; Starpilot(星航)
AI总结 研究针对触觉数据稀缺问题,提出FELT框架,利用视觉编码器和查询解码器从RGB观测合成触觉图像,通过单独分支解码左右传感器面板,实验表明该方法能提升策略成功率,潜在特征训练和部署无需真实触觉传感器。
Comments 26 pages, including supplementary material