Decoding Task Progress from VLA Representations
从视觉-语言-动作模型(VLA)表征中解码任务进度
机构 * Cornell University(康奈尔大学)
AI总结 该研究利用机制可解释性探究VLA的π₀.₅残差流,发现任务进度可从激活值线性读取,基于此构建的探测器可作为无标签OOD检测器,性能接近最先进方法,为监控部署的视觉运动策略提供轻量可解释路径。
高校专区
从视觉-语言-动作模型(VLA)表征中解码任务进度
机构 * Cornell University(康奈尔大学)
AI总结 该研究利用机制可解释性探究VLA的π₀.₅残差流,发现任务进度可从激活值线性读取,基于此构建的探测器可作为无标签OOD检测器,性能接近最先进方法,为监控部署的视觉运动策略提供轻量可解释路径。
ReconSpan:重建引导的自适应隐式分词
机构 * Cornell University(康奈尔大学)
AI总结 本文提出ReconSpan,一种重建引导的自适应隐式分词方法,可将文本划分为特定块并保留前缀码作为隐式token,在匹配平均长度下其边界比随机边界保留更多文本,能可靠传递主题信息但难以提取精确细节。
Comments 16 pages, 3 figures
哪个地点,以及何时:基于免费卫星数据的喜马拉雅冰川湖溃决、滑坡与冰洪测试
机构 * Cornell University(康奈尔大学) ; Institute of Engineering, Tribhuvan University(特里布万大学工程学院) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; University of Bristol(布里斯托大学)
AI总结 该研究利用免费卫星数据,构建模型预测喜马拉雅地区冰川湖溃决、滑坡等三类灾害的易感性地点与触发时间,发现简单梯度提升基线模型表现优于多数深度学习模型,还给出了尼泊尔灾害预警优先级清单。
CASE框架:用于管控企业智能体AI的多学科控制架构
机构 * Cornell University(康奈尔大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; AI71
AI总结 针对企业智能体AI管控的“涌现缺口”问题,提出含四层架构的CASE框架,经实证验证可提升治理有效性,满足欧盟AI法案要求。
Comments 34 pages in total, 4 figures, 2 tables, code at https://github.com/srinivastelukunta/case_framework_arxiv_codes
套娃语言模型套件
机构 * Cornell University(康奈尔大学)
AI总结 该研究提出Matryoshka训练框架,将尺寸递增的子模型堆叠为端到端嵌套架构,训练含5亿、15亿、30亿参数子模型的套件,其性能与基线相当,训练计算量减少36%,推测解码吞吐量提升14-26%。
并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩
机构 * The University of Sydney(悉尼大学) ; Tongji University(同济大学) ; University of Surrey(萨里大学) ; Nankai University(南开大学) ; Cornell University(康奈尔大学) ; City University of Hong Kong(香港城市大学)
AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。
HOPPER:用于线性化图序列模型的可学习跳提取方法
机构 * Carnegie Mellon University(卡内基梅隆大学) ; UC Berkeley(加州大学伯克利分校) ; Cornell University(康奈尔大学)
AI总结 HOPPER是LGSM的可学习扩展,可提取跳序列以实现自适应图传播,在ECHO-Synth基准表现最优或具竞争力,调整结构记忆窗口可优化LRIM基准准确率,为长距离图表示学习提供灵活方法。
Comments 24 pages, 1 figure, 4 tables
结构化参数环境下用于鲁棒导航策略的课程生成
机构 * Cornell University(康奈尔大学)
AI总结 本文针对结构化参数环境提出重参数化课程生成框架,结合分布偏移正则化,在OpenAI Gym的两类连续控制环境中,显著优于多种基线方法,提升了导航策略的鲁棒性。
Comments 22 pages, 5 figures
大语言模型上下文学习中数值序列表示的图信号处理视角
机构 * Cornell University(康奈尔大学) ; Goodfire AI(古德火人工智能公司) ; Imperial College London(伦敦帝国学院)
AI总结 本文从图信号处理视角研究LLM上下文学习中数值序列的表示,发现数值推理的内部特征随上下文长度和输入动态复杂性变化,且在不同模型家族间一致。
SoniSpeech:面向可穿戴静默语音接口的大规模开放词汇三模态数据集
机构 * Cornell University(康奈尔大学)
AI总结 针对可穿戴静默语音接口词汇量受限的问题,提出首个基于声学传感眼镜的大规模开放词汇三模态数据集SoniSpeech,构建了该任务的首个基准并取得26.3%的词错误率。
MetaRoute-Bench:评估智能体工作流路由的元决策策略
机构 * Anote AI(阿诺特人工智能公司) ; Cornell University(康奈尔大学) ; CUNY(纽约城市大学) ; Stevens Institute of Technology(史蒂文斯理工学院)
AI总结 该研究提出MetaRoute-Bench框架,构建含180个任务的基准,对比8种路由策略,发现任务感知组合策略成功率优于静态策略,明确路由组合与验证的关键作用,为智能体工作流路由评估提供可复现方法。
Comments 6 pages, 1 figure; DAI 2026 submission
PiDDM:用于锂离子电池健康状态预测的物理信息可微退化建模
机构 * University of Notre Dame(圣母大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Cornell University(康奈尔大学)
AI总结 该研究提出PiDDM框架,将退化物理纳入神经网络训练,在55块电池的6种协议数据及外推任务中,其预测误差与均方误差均优于基线模型,可实现准确且物理一致的电池SOH预测。
智能体AI中的OpenClaw与Ollama:迈向完全自主且可扩展的AI智能体系统
机构 * University of the Peloponnese(伯罗奔尼撒大学) ; Cornell University(康奈尔大学)
AI总结 该研究提出智能体AI的分层架构,分析OpenClaw与Ollama组成的全栈系统,验证系统集成可提升智能体能力,指出相关挑战并提供路线图,所有资源公开以支持研究。
评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理
机构 * Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院) ; Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院) ; Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院) ; System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院) ; Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学) ; RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) ; Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) ; Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学) ; School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学) ; Hospital of the University of Pennsylvania(宾夕法尼亚大学医院) ; Children’s Hospital of Philadelphia (CHOP)(费城儿童医院) ; Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院) ; Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校) ; Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
AI总结 研究针对现有多模态大语言模型评估难以捕捉现实临床诊断复杂性的问题,开发ClinMM-Bench基准,用两级框架评估15个模型,发现专有模型诊断准确性最高,但各模型完全正确诊断比例有限,当前模型诊断推理有局限并明确了失败模式。
统一主动学习和半监督学习用于医学图像分割
机构 * Weill Cornell Medicine(威尔康乃尔医学院) ; Cornell University(康奈尔大学)
AI总结 针对医学图像分割标注数据有限问题,提出RegAL统一框架,通过共享拓扑感知帕累托优化,结合样本获取与未标注数据利用,沿三个互补轴评估图像,在多数据集上于极端标注稀缺时表现稳定且优于基线。
标签问题与45种语言模型中谄媚现象的代际反转
机构 * Cornell Tech(康奈尔科技)
AI总结 研究在语言模型决策问题中附加标签的效应,通过特定实验设置在45个模型上测量,发现效应范围广且随代际反转,定位了抗性来源,表明标签极性更关键,工具能从模型行为读出反谄媚训练情况。
Comments 18 pages, 4 figures. Data, code, and raw model replies: https://github.com/tap2k/modelun. Interactive explorer: https://tap2k.github.io/modelun/suggestibility/
从预训练语言模型中提取算法:以隐马尔可夫模型为例
机构 * Cornell University(康奈尔大学)
AI总结 研究预训练语言模型从隐马尔可夫模型预测下一个观测值的能力背后算法,通过三阶段流程,先实证比较缩小候选算法范围,再推导理论联系并验证,最后引入主激活探针揭示低维线性表示及变化,将其上下文行为与内部机制联系起来。
基于模拟的经验贝叶斯
机构 * Department of Statistics University of Washington(统计学系华盛顿大学) ; Department of Computer Science Cornell University(计算机科学系康奈尔大学) ; School of Mathematical Sciences and Center for Statistical Science Peking University(数学科学学院与统计科学中心北京大学) ; Departments of Computer Science and Statistics Columbia University(计算机科学与统计学系哥伦比亚大学)
AI总结 研究针对似然只能通过模拟器获得的情况开发经验贝叶斯方法,引入基于模拟的经验贝叶斯(SBEB),通过观测数据、模拟器样本和推断网络计算估计,迭代细化先验,经实验证明其比固定先验的SBI提高了准确性。
上下文博弈的跨域离策略评估与学习
机构 * Hakuhodo DY Holdings, Inc.(博报堂DY控股公司) ; Cornell University(康奈尔大学)
AI总结 研究上下文博弈中离策略评估与学习问题,提出跨域OPE/L新设置,可利用目标域和其他域日志数据,开发新估计器和策略梯度方法,有效解决现有方法面临的挑战,增强离策略评估与学习能力。
Comments 21 pages, 10 figures, accepted to ICLR 2025
面向时间干预下个人语言模型代理的用户条件评估
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Cornell University(康奈尔大学) ; University of Glasgow(格拉斯哥大学)
AI总结 研究个人语言模型代理在时间干预下的用户条件评估,提出需在不同用户条件状态下重放时间干预并测量故障传播的协议,形式化四个条件,审查发现无满足条件的公开协议,进而提出最小基准设计和候选报告指标。
Comments 9 pages, 2 figures, and 8 tables. Accepted for oral presentation at the ACM SIGKDD KDD 2026 Workshop on Personal Intelligence in the Agentic AI Era (PILA 2026)
从不相交数据进行统一视频密集预测
机构 * Adobe Research(Adobe 研究院) ; Cornell University(康奈尔大学)
AI总结 研究旨在解决现有任务特定注释分散问题,提出统一视频模型UniD,从不相交特定领域数据集联合预测八个密集场景属性。通过简单蒸馏步骤,利用预训练扩散模型视觉先验弥合领域差距,性能优于特定任务专家和多任务基线,泛化能力强。
Comments ECCV 2026
展示GenDB:通过大语言模型代理实现实例优化和定制化查询处理代码生成
机构 * Cornell University(康奈尔大学)
AI总结 研究针对传统查询处理引擎扩展难题,提出GenDB生成式查询引擎,借助大语言模型代理生成代码。核心方法是通过LLM agents为特定场景生成优化代码,主要贡献是展示其工作流程、性能优势并提供用户探索平台。
Comments Accepted by VLDB 2026 (Demo)
高效跟踪与理解对象变换
机构 * Cornell University(康奈尔大学)
AI总结 研究如何高效跟踪与理解对象变换,提出FluxGraph方法,利用SAM2内部多掩码差异触发变换检测,无需跟踪视频所有实体,相比TubeletGraph速度大幅提升,在多个数据集上也有显著加速且性能良好。
用于本构模型中不确定性量化和传播的区间与模糊物理增强神经网络(iPANN和fPANN)
机构 * Cornell University(康奈尔大学) ; Ecole Polytechnique Federale de Lausanne (EPFL)(洛桑联邦理工学院) ; Sandia National Laboratories(桑迪亚国家实验室) ; University of Southern California(南加州大学) ; Pasteur Labs(巴斯德实验室)
AI总结 针对本构模型不确定性量化与传播难题,提出iPANN和fPANN,通过学习自由能密度分支、编码机械约束及两阶段转移学习训练模型,在合成数据上评估,能包围应力观测值并传播不确定性,提供了相关有效途径。
作为一种干预手段的大语言模型检测:战略用户行为下的下游影响
机构 * Stanford University(斯坦福大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Cornell University(康奈尔大学)
AI总结 研究LLM检测对下游指标的影响,开发程式化模型捕捉用户策略行为。发现不完善的检测器会扭曲LLM使用及输出质量,导致用户增加使用量且输出质量可能降低,还呈现“先升后降”检测模式,揭示了检测干预的失效模式。
结构化输出会削弱44种语言模型的答案多样性
机构 * Cornell Tech(康奈尔理工学院)
AI总结 研究语言模型在特定格式要求下答案多样性变化,通过对44个模型进行31个类别提示实验,发现结构化输出使答案收敛、多样性降低,存在寄存器梯度,揭示了模型对不同格式的响应差异及对答案多样性的影响。
Comments 12 pages, 1 figure. Companion to the One-Word Census (arXiv:2607.12796). Code, data, and interactive explorer: https://github.com/tap2k/modelun/tree/main/studies/structured
生成器即跟踪器:通过绘制持久身份颜色进行多目标跟踪
机构 * Cornell University(康奈尔大学)
AI总结 研究多目标跟踪问题,核心方法是用轻量级LoRA微调文本到视频扩散模型生成带持久身份颜色的视频,无需传统跟踪组件。主要贡献是在DanceTrack测试服务器上达到40.3 HOTA,有独特错误分布,颜色分配可在遮挡后重新识别身份。
统计算法的公开可验证证书
机构 * MIT(麻省理工学院) ; Cornell University(康奈尔大学)
AI总结 本文在Goldwasser等人的交互式学习证明框架基础上,定义公开可验证统计有效性证书(pvCSV),在自适应统计查询算法中构建pvCSV,认证k次自适应查询的SQ算法,样本复杂度为O(log k),并研究了SQ模型中的学习证明系统。
一次性系统识别的零一律
机构 * Imperial College London(帝国理工学院) ; New York University(纽约大学) ; Cornell University(康奈尔大学)
AI总结 研究一次性系统识别问题,通过规定字典项线性参数化解析系统,证明零一律,将问题简化为关于退化输入的问题,能从单轨迹数据恢复多种系统并检测额外探测需求。
Comments 8 pages, 2 figures
Dysco:动态子空间增强以减轻联邦学习中的LoRA干扰
机构 * University of Michigan(密歇根大学) ; Cornell University(康奈尔大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 研究针对联邦学习中异构客户端使LoRA聚合不稳定的问题,提出动态子空间增强方法Dysco,通过联邦动态分配特定客户端LoRA子空间,经实验验证其能减少干扰、降低训练损失、提升算法性能且开销小。
Comments 33 pages, 10 figures, 11 tables