Towards Multi-Turn Dialog Systems for Industrial Asset Operations and Maintenance
面向工业资产运维的多轮对话系统
机构 * Columbia University(哥伦比亚大学)
AI总结 针对工业资产运维中的多轮、迭代问答问题,提出基于监督者-专家多智能体架构的多轮对话系统,通过结构化工件复用、动态重规划和并行工具执行,显著提升规划效果和任务完成率。
高校专区
面向工业资产运维的多轮对话系统
机构 * Columbia University(哥伦比亚大学)
AI总结 针对工业资产运维中的多轮、迭代问答问题,提出基于监督者-专家多智能体架构的多轮对话系统,通过结构化工件复用、动态重规划和并行工具执行,显著提升规划效果和任务完成率。
Reflect-Guard: 通过逻辑自我反思增强大语言模型对对抗性提示的防护
机构 * Yale University(耶鲁大学) ; Columbia University(哥伦比亚大学) ; Citigroup(摩根大通) ; Independent Researcher(独立研究者)
AI总结 提出Reflect-Guard方法,通过参数高效微调为大语言模型安全分类器注入链式思维自我反思能力,显著提升对对抗性越狱攻击的检测性能。
Comments 12 pages, 2 figures, and 4 tables
LLM-SAA:基于LLM人格生成分布的决策方法
机构 * Stern School of Business, New York University(纽约大学 Stern 商学院) ; Department of Computer Science, Columbia University(哥伦比亚大学 计算机科学系) ; Graduate School of Business and Data Science Institute, Columbia University(哥伦比亚大学 商学院和数据科学研究院)
AI总结 研究利用LLM生成分布(如模拟消费者支付意愿)支持下游决策,通过三个经典问题(分类优化、定价、报童模型)评估其实际效用,发现低数据场景下有效,且决策无关指标(如Wasserstein距离)可能误导。
深度研究的交互式范式
机构 * Adobe Research(Adobe研究院) ; Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)
AI总结 提出SteER框架,通过可解释的中间过程控制、成本效益决策和实时用户模型,在深度研究中实现用户对齐,性能优于现有基线。
AI辅助搜索中的通信与推荐集规模合理设定
机构 * Columbia Business School, Columbia University(哥伦比亚大学商学院) ; Amazon.com Inc.(亚马逊公司)
AI总结 通过建模用户与AI推荐系统的交互,研究在考虑通信成本和搜索成本时,如何优化消息精度和推荐集大小以最大化用户期望收益。
Claude AI 健康引用中的权威信号:基于权威信号框架的描述性分析
机构 * Department of Health and Human Performance, York College, The City University of New York(健康与人类绩效系,约克学院,纽约市立大学) ; Department of Health Studies & Applied Educational Psychology, Teachers College, Columbia University(健康研究与应用教育心理学系,哥伦比亚大学教师学院) ; Department of Accounting and Finance, York College, The City University of New York(会计与金融系,约克学院,纽约市立大学) ; Department of Public Health, William Paterson University(公共卫生系,威廉·帕特森大学)
AI总结 本研究使用权威信号框架,分析 Anthropic 的 Claude AI 在回答消费者健康问题时引用来源的权威信号,发现机构来源占主导地位(97.8%),并建立了 Claude 引用行为的基线。
Comments 10 pages, 2 figures, 2 tables
VineLM: 基于Trie的细粒度控制用于智能体工作流
机构 * Columbia University(哥伦比亚大学)
AI总结 提出VineLM工作流管理器,通过Trie结构动态选择每个阶段调用的模型,在请求级目标下优化成本-延迟-准确率边界,稀疏分析减少离线分析成本98-99.8%。
揭示自回归LLM在事件表示中主题适配性的知识
机构 * Imperial College London(伦敦帝国学院) ; Columbia University(哥伦比亚大学) ; University of Washington(华盛顿大学)
AI总结 通过多种提示设计、输入上下文操作、推理和输出形式,研究自回归大语言模型是否具有一致且可表达的事件参数主题适配性知识,并在基准测试上取得新最优结果。
Comments Significant update with massive changes: all experiments rerun with current LLMs; includes new probability estimate analysis and expanded results in Sections 4 and 5. The paper has been accepted to CoNLL-2026
训练数据教会RL记忆体代理什么:记忆增强问答中课程效应的实证研究
机构 * Columbia University(哥伦比亚大学) ; Independent Researcher(独立研究者) ; Johns Hopkins University(约翰霍普金斯大学) ; Northeastern University(东北大学)
AI总结 通过控制实验,研究训练课程(领域内、混合、领域外)对强化学习记忆体代理在记忆增强问答中的技能获取和专业化影响,发现课程组成作为专业化的细粒度杠杆,混合课程在整体F1上最优,而窄领域外课程可转移特定技能(如时间推理),并报告了将GRPO适配到单GPU环境的实用经验。
Comments 14 pages, 2 figures, 11 tables. Code, checkpoints, and evaluation artifacts available at https://github.com/EvaxHe/rl-memory-curriculum
守卫中的盲区:如何域伪装注入攻击在多智能体大语言模型系统中逃避检测
机构 * Data Science Institute(数据科学研究所) ; Columbia University(哥伦比亚大学)
AI总结 本文研究了在多智能体大语言模型系统中,域伪装注入攻击如何通过模仿目标文档的领域词汇和权威结构来逃避检测,揭示了检测器在静态和伪装负载之间的检测率差异(Camouflage Detection Gap, CDG),并展示了多智能体辩论架构对静态注入攻击的放大效应以及检测器增强的有限有效性。
Comments 8 pages, 3 figures, 2 tables. Submitted to EMNLP 2026 ARR cycle
ViPS: 为自动绑定网格的视频感知姿态空间
机构 * Columbia University(哥伦比亚大学) ; University of Toronto(多伦多大学) ; Adobe Research(Adobe研究) ; University of Cambridge(剑桥大学) ; University College London(伦敦大学学院)
AI总结 本文提出ViPS,一种通过视频扩散模型提取运动先验来发现自动绑定网格有效姿态分布的前馈框架,实现了对多样形状变化、逆向运动学和动画的关键帧生成的支持。
Comments Project page: https://honglin-c.github.io/vips/
TimeSRL: 通过语义RL调优的LLM实现通用的时间序列行为建模 -- 一项心理健康应用的案例研究
机构 * Columbia University(哥伦比亚大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Yale University(耶鲁大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Google(谷歌) ; University of Virginia(弗吉尼亚大学)
AI总结 本文提出TimeSRL,一种两阶段LLM框架,通过显式的语义瓶颈路由预测,将原始信号抽象为高级自然语言,从而预测行为结果,该方法在心理健康预测中实现了最先进的跨群体泛化性能。
因果机器学习并非万能:健康领域观察性因果推断的路线图
机构 * Division of Computer Science and Engineering, University of Michigan(密歇根大学计算机科学与工程系) ; Department of Electrical and Electronic Engineering, Imperial College London(伦敦帝国理工学院电子与电气工程系) ; Courant Institute of Mathematical Sciences, New York University(纽约大学Courant数学科学研究所) ; Center for Data Science, New York University(纽约大学数据科学中心) ; Department of Mathematics & Statistics, Elon University(埃洛伊大学数学与统计学系) ; Department of Ophthalmology, Cambridge University Hospitals(剑桥大学医院眼科部) ; Department of Biomedical Informatics, Columbia University(哥伦比亚大学生物医学信息学系) ; School of Engineering and Applied Science, Harvard University(哈佛大学工程与应用科学学院) ; Laboratory for Computational Physiology, Institute for Medical Engineering and Science, Massachusetts Institute of Technology(麻省理工学院医学工程与科学研究所计算生理学实验室) ; Department of Medicine, Beth Israel Deaconess Medical Center(贝斯以色列德aconess医疗中心医学部) ; Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛T.H. Chan公共卫生学院生物统计学系)
AI总结 本文探讨了因果机器学习在观察性数据中的应用,强调了验证有效性假设和合理使用因果机器学习的重要性,提出了加强因果分析严谨性和可解释性的模板。
可验证的环境:面向大规模评估奖励黑客的尝试
机构 * Tel Aviv University(特拉维夫大学) ; Columbia University(哥伦比亚大学) ; Taso Labs(Taso实验室)
AI总结 本文提出了一种新的评估方法来衡量奖励黑客,通过在环境中嵌入可检测的奖励黑客机会,使评估更加可靠和自动化,通过TextArena测试床分析了不同语言模型在多样化环境中的奖励黑客行为。
Comments Project Page - https://majoroth.github.io/hack-verifiable-environments/
评估代理计划-执行管道中的时间语义缓存和工作流优化
机构 * Columbia University(哥伦比亚大学) ; IBM ; IBM Research(IBM研究院)
AI总结 本文研究了在代理计划-执行管道中时间语义缓存和工作流优化的问题,提出两种互补的优化层以提高效率,并展示了其在工业资产操作工作流中的应用效果。
Comments 13 pages, 8 figures, 3 appendices
基于群体的矩阵估计与潜在子空间恢复
机构 * Department of Statistics, Columbia University(哥伦比亚大学统计系) ; Irving Institute for Cellular Dynamics, Zuckerman Institute Columbia University(Zuckerman研究所细胞动力学院,哥伦比亚大学) ; School of Data and Information Sciences, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校数据与信息科学学院)
AI总结 本文提出了一种针对异质数据中群体特定低秩矩阵估计的凸估计器GAME,通过重叠核范数惩罚正则化来恢复子群特定的子空间结构,同时在共享坐标系中保留局部潜在结构,并在不同数据集上验证了其在结构缺失情况下优于传统低秩方法的性能。
Comments 12 pages, 6 main figures, 1 main algorithm
数据更少,训练更快:重复较小的数据集通过采样偏差加速学习
机构 * Columbia University(哥伦比亚大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Harvard University(哈佛大学)
AI总结 研究探讨了'小数据与大数据差距'现象,即使用更少样本重复训练比使用更大数据集更节省计算资源,通过层间增长和采样偏差机制实现加速,为优化提供了新的归纳偏差。
Comments ICML 2026
在结构互动学习中模型崩溃何时发生?
机构 * School of Operations Research and Information Engineering, Cornell University(卡内基梅隆大学运营管理与信息工程学院) ; Department of Statistics, Columbia University(哥伦比亚大学统计系) ; Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计与数据科学系)
AI总结 研究探讨了在结构互动学习环境中,生成模型性能下降(模型崩溃)的发生条件,通过分析交互图拓扑结构,推导出模型崩溃的必要和充分条件,并通过数值实验验证理论结果。
Comments 57 pages, 12 figures
极简视觉惯性里程计
机构 * Department of Information Engineering, University of Padua(帕多瓦大学信息工程系) ; Computer Science Department, Columbia University(哥伦比亚大学计算机科学系)
AI总结 本文提出了一种极简的平面里程计方法,通过四个视觉测量和一个IMU实现差分驱动机器人的鲁棒运动估计,展示了极简传感在高效准确平面里程计中的应用。
Comments This work has been submitted to the IEEE for possible publication
无分布不确定性量化用于连续AI代理评估
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Columbia University(哥伦比亚大学)
AI总结 本文提出了一种无分布的不确定性量化方法,用于连续AI代理评估,通过适应性符合推断(ACI)提供预测质量分数的覆盖保证,并开发了多代理管道的组合不确定性界限、成对排名的符合回避规则以及领奖台规模多重检验的FDR校正回避方法。
Comments 6 pages, 7 figures, 2 tables. Accepted at the ICML 2026 Workshop on Agentic Uncertainty Quantification (AgenticUQ) - Poster
PiKV: 一种用于混合专家架构的键值缓存管理系统
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Yale University(耶鲁大学) ; Columbia University(哥伦比亚大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 本文提出PiKV,一种专为混合专家架构设计的并行分布式键值缓存服务框架,通过专家分片缓存、PiKV路由和PiKV调度来减少缓存访问开销,并通过压缩模块降低内存使用。
Comments Github Link: https://github.com/NoakLiu/PiKV
Tweedie's公式与超越高斯的扩散生成模型
机构 * Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运筹学系) ; Department of Finance and Risk Engineering, New York University(纽约大学金融与风险工程系)
AI总结 本文扩展了Tweedie公式以适用于重要的非高斯过程,如几何布朗运动、平方贝塞尔过程和Cox-Ingersoll-Ross过程,并利用这些公式在图像和金融时间序列生成以及经验贝叶斯估计中应用非高斯扩散模型,展示了非高斯模型的潜力。
Comments 27 pages, 18 figures
在慢速fMRI上微调语言编码模型以提高对快速ECoG的预测
机构 * Department of Computer Science(计算机科学系) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Zuckerman Mind Brain Behavior Institute(祖克曼心智-脑-行为研究所) ; Columbia University(哥伦比亚大学) ; Departments of Neuroscience and Statistics(神经科学与统计学系) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 该研究通过在慢速fMRI上微调语言编码模型,提高了对快速ECoG数据的预测性能,展示了慢速数据在构建快速脑数据模型中的价值。
DecisionBench: 一个用于长周期代理工作流中涌现委托的基准测试
机构 * OpenMesh AI ; University of Pennsylvania(宾夕法尼亚大学) ; Columbia University(哥伦比亚大学) ; Stanford University(斯坦福大学) ; MIT(麻省理工学院)
AI总结 本文提出DecisionBench基准测试,用于评估长周期代理工作流中涌现的委托机制,通过五个条件参考扫描发现委托质量、路由保真度和潜在性能上限等核心发现。
Comments 28 pages, 9 figures, 11 tables. Code and data: https://huggingface.co/decisionbench
AI 是否能像艺术史家一样看?解析视觉语言模型如何识别艺术风格
机构 * Columbia University, Department of Computer Science(哥伦比亚大学计算机科学系) ; Columbia University, Department of Art History & Archaeology(哥伦比亚大学艺术史与考古系) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 本文研究了视觉语言模型(VLMs)在识别艺术风格方面的机制,通过跨学科合作,分析VLMs如何预测艺术风格,并评估其与艺术史家判断艺术风格的标准的一致性。
Comments 20 pages, 18 figures
大型语言模型在医学研究中应用的入门指南
机构 * National Library of Medicine (NLM), National Institutes of Health (NIH)(国家医学图书馆(NLM)、国立卫生研究院(NIH)) ; Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) ; Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系) ; Department of Biomedical Informatics, Columbia University(哥伦比亚大学生物医学信息学系) ; School of Medicine, Yale University(耶鲁大学医学院) ; School of Information, Florida State University(佛罗里达州立大学信息学院) ; Department of Radiology and Imaging Sciences, NIH Clinical Center(国立卫生研究院临床中心放射学与影像科学部) ; Department of Population Health Sciences, Weill Cornell Medicine(韦尔医学院人口健康科学系)
AI总结 本文提出了一套可操作的指南,帮助医疗专业人员更高效地利用大型语言模型(LLMs)进行医学研究,涵盖任务制定、模型选择、提示工程、微调和模型部署等关键步骤,确保安全可靠地将LLMs应用于临床实践。
城市交叉口多行人安全预警的数字孪生应用案例
机构 * Department of Civil Engineering and Engineering Mechanics at Columbia University(哥伦比亚大学土木工程与工程力学系) ; Data Science Institute(数据科学研究院) ; Department of Electrical Engineering at Columbia University(哥伦比亚大学电气工程系)
AI总结 本文提出一种基于紧密耦合物理-数字孪生框架的城市交叉口多行人安全预警系统,通过COSMOS无线测试床进行实地部署和虚拟现实实验,验证了系统在提高安全预警准确性和响应效率方面的有效性。
无需基于分类的错误归类即可改进检索增强生成
机构 * Columbia University(哥伦比亚大学) ; Weill Cornell Medicine(韦尔·科恩医学中心)
AI总结 本文提出RePAIR方法,通过直接将错误的RAG输出映射到错误缓解行动计划,无需依赖细粒度错误分类和显式批评者监督,从而提升检索增强生成的性能。
EveryQuery: 通过电子健康记录上的任务条件预训练实现零样本临床预测
机构 * Harvard-MIT HST(哈佛-麻省理工学院HST) ; Columbia University(哥伦比亚大学) ; Harvard Medical School(哈佛医学院)
AI总结 本文提出EveryQuery,一种通过任务条件预训练实现零样本临床预测的电子健康记录基础模型,通过直接估计未来窗口内结果发生的可能性,而非生成未来事件,从而在多个预测任务中优于自回归基线模型。
SWING: 解锁隐式图表示用于图随机特征
机构 * Google Research(谷歌研究) ; Independent Researcher(独立研究者) ; Google DeepMind(谷歌DeepMind) ; Columbia University(哥伦比亚大学)
AI总结 SWING通过在连续空间中进行行走而非在图节点上进行行走,实现了对隐式图表示(i-graphs)中图随机特征的高效计算,其核心方法是结合随机特征和重要性采样技术的定制Gumbel-softmax采样机制,从而在不需显式图结构的情况下,提高了计算效率和精度。