Decoding Task Progress from VLA Representations
从视觉-语言-动作模型(VLA)表征中解码任务进度
机构 * Cornell University(康奈尔大学)
AI总结 该研究利用机制可解释性探究VLA的π₀.₅残差流,发现任务进度可从激活值线性读取,基于此构建的探测器可作为无标签OOD检测器,性能接近最先进方法,为监控部署的视觉运动策略提供轻量可解释路径。
高校专区
从视觉-语言-动作模型(VLA)表征中解码任务进度
机构 * Cornell University(康奈尔大学)
AI总结 该研究利用机制可解释性探究VLA的π₀.₅残差流,发现任务进度可从激活值线性读取,基于此构建的探测器可作为无标签OOD检测器,性能接近最先进方法,为监控部署的视觉运动策略提供轻量可解释路径。
ReconSpan:重建引导的自适应隐式分词
机构 * Cornell University(康奈尔大学)
AI总结 本文提出ReconSpan,一种重建引导的自适应隐式分词方法,可将文本划分为特定块并保留前缀码作为隐式token,在匹配平均长度下其边界比随机边界保留更多文本,能可靠传递主题信息但难以提取精确细节。
Comments 16 pages, 3 figures
哪个地点,以及何时:基于免费卫星数据的喜马拉雅冰川湖溃决、滑坡与冰洪测试
机构 * Cornell University(康奈尔大学) ; Institute of Engineering, Tribhuvan University(特里布万大学工程学院) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; University of Bristol(布里斯托大学)
AI总结 该研究利用免费卫星数据,构建模型预测喜马拉雅地区冰川湖溃决、滑坡等三类灾害的易感性地点与触发时间,发现简单梯度提升基线模型表现优于多数深度学习模型,还给出了尼泊尔灾害预警优先级清单。
代理神经符号协作用于数学发现:组合设计的一个案例研究
机构 * Algorithms and Complexity Group, TU Wien(算法与复杂性组,维也纳技术大学) ; Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)
AI总结 本文通过代理神经符号协作方法,在组合设计理论中发现了一个新的紧下界,展示了人类与AI协作在数学发现中的有效性。
先验意识记忆:一种区分记忆与泛化在大语言模型中的高效度量标准
机构 * Cornell University(康奈尔大学) ; Boston University(波士顿大学) ; NVIDIA(英伟达)
AI总结 本文提出Prior-Aware Memorization,一种基于模型先验的轻量级度量标准,用于区分大语言模型中的真实记忆与统计上常见序列,揭示低频率不足以证明记忆,强调需考虑模型先验以评估数据泄露风险。
Comments COLM 2026 Camera Ready
像素空间扩散变换器
机构 * Peking University(北京大学) ; Nanjing University(南京大学) ; Stanford University(斯坦福大学) ; Cornell University(康奈尔大学) ; University of Oulu(奥卢大学)
AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。
CASE框架:用于管控企业智能体AI的多学科控制架构
机构 * Cornell University(康奈尔大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; AI71
AI总结 针对企业智能体AI管控的“涌现缺口”问题,提出含四层架构的CASE框架,经实证验证可提升治理有效性,满足欧盟AI法案要求。
Comments 34 pages in total, 4 figures, 2 tables, code at https://github.com/srinivastelukunta/case_framework_arxiv_codes
评估AI代理在神经科学数据到发现流程中的案例研究
机构 * Cornell University(康奈尔大学) ; HHMI Janelia Research Campus(霍华德·休斯医学研究所贾雷尔研究园区)
AI总结 本研究评估通用编码代理在果蝇光遗传学数据到发现流程中的表现,发现代理能解决单个阶段任务,但端到端流程仍超出其能力,主要挑战包括缺乏预定义迭代标准和科学判断能力。
Comments Peer-reviewed conference paper
Journal ref Third Conference on Language Modeling (COLM 2026)
小纵向队列的验证合成患者生成:妊娠期间的凝血动力学
机构 * Robert F. Smith School of Chemical and Biomolecular Engineering, Cornell University(康奈尔大学罗伯特·F·史密斯化学与生物分子工程学院) ; Department of Biochemistry, The Robert Larner, M.D. College of Medicine, University of Vermont Medical Center(佛蒙特大学医学中心罗伯特·拉纳医学院生物化学系) ; Department of Obstetrics, Gynecology, and Reproductive Sciences, The Robert Larner, M.D. College of Medicine, University of Vermont Medical Center(佛蒙特大学医学中心罗伯特·拉纳医学院妇产科与生殖科学系)
AI总结 本文提出基于Hopfield网络理论的多重加权随机注意机制,用于生成小纵向队列的合成患者,通过Langevin动力学在连续能景中插值存储模式,保留原始队列的几何结构,并在推理时放大罕见临床亚组,验证了其在凝血动力学中的有效性。
套娃语言模型套件
机构 * Cornell University(康奈尔大学)
AI总结 该研究提出Matryoshka训练框架,将尺寸递增的子模型堆叠为端到端嵌套架构,训练含5亿、15亿、30亿参数子模型的套件,其性能与基线相当,训练计算量减少36%,推测解码吞吐量提升14-26%。
并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩
机构 * The University of Sydney(悉尼大学) ; Tongji University(同济大学) ; University of Surrey(萨里大学) ; Nankai University(南开大学) ; Cornell University(康奈尔大学) ; City University of Hong Kong(香港城市大学)
AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。
HOPPER:用于线性化图序列模型的可学习跳提取方法
机构 * Carnegie Mellon University(卡内基梅隆大学) ; UC Berkeley(加州大学伯克利分校) ; Cornell University(康奈尔大学)
AI总结 HOPPER是LGSM的可学习扩展,可提取跳序列以实现自适应图传播,在ECHO-Synth基准表现最优或具竞争力,调整结构记忆窗口可优化LRIM基准准确率,为长距离图表示学习提供灵活方法。
Comments 24 pages, 1 figure, 4 tables
结构化参数环境下用于鲁棒导航策略的课程生成
机构 * Cornell University(康奈尔大学)
AI总结 本文针对结构化参数环境提出重参数化课程生成框架,结合分布偏移正则化,在OpenAI Gym的两类连续控制环境中,显著优于多种基线方法,提升了导航策略的鲁棒性。
Comments 22 pages, 5 figures
PINNACLE:一种用于经典和量子PINN的开源计算框架
机构 * Faculty of Mechanical Engineering, Technion Israel Institute of Technology, Haifa, Israel(技术学院机械工程系,以色列技术学院,海法,以色列) ; Andrew and Erna Viterbi Faculty of Electrical & Computer Engineering, Technion Israel Institute of Technology, Haifa, Israel(安德鲁和伊尔纳·维特比电气与计算机工程学院,技术学院,海法,以色列) ; Helen Diller Quantum Center, Technion Israel Institute of Technology, Haifa, Israel(海伦·迪尔量子中心,技术学院,海法,以色列) ; Faculty of Electrical and Computer Engineering, Cornell University, Ithaca, NY, USA(电气与计算机工程学院,康奈尔大学,纽约州伊萨克,美国)
AI总结 PINNACLE框架整合了现代训练策略和混合量子经典架构,通过统一模块化工作流系统评估PINN在不同基准问题中的性能,支持多种增强方法并提供全面的基准研究。
从词语到小部件:可控制的LLM生成
机构 * Cornell University(康奈尔大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Loyola University Maryland(路易斯安那大学马里兰分校)
AI总结 本文提出Malleable Prompting技术,通过将自然语言提示中的偏好转化为可视化的小部件,使用户能更精确地控制LLM生成,提升可控性和透明度。
Comments UIST 2026
Raster2Seq:用于平面图重建的多边形序列生成
机构 * Cornell University(康奈尔大学)
AI总结 本文提出Raster2Seq,将平面图重建视为序列到序列任务,通过自回归解码器生成带有几何和语义信息的多边形序列,实现复杂平面图的高精度重建。
Comments Accepted to SIGGRAPH 2026. Project page: https://cornell-vailab.github.io/Raster2Seq/
学习动态中的用户选择:过度专业化与同伴模型探测
机构 * Electrical and Computer Engineering, University of Washington(华盛顿大学电气与计算机工程学院) ; Computer Science, Cornell University(康奈尔大学计算机科学系)
AI总结 本文研究了用户选择对学习动态的影响,提出通过探测同伴模型预测来避免过度专业化陷阱,从而提升模型的全局性能。
长期测量:迈向对人机交互的纵向理解
机构 * Google Research(谷歌研究院) ; Cornell University(康奈尔大学) ; Stanford University(斯坦福大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本研究针对语言模型融入生活引发的长期人机交互风险,结合社会科学测量与NLP计算方法,提出通过长期测量建模人类行为变化,实现问题行为在线检测以缓解用户长期风险。
ORCA-bench:语言模型智能体的值班待命准备程度如何?
机构 * Cornell Tech(康奈尔科技学院) ; Traversal ; Columbia University(哥伦比亚大学)
AI总结 该研究推出ORCA-bench基准,评估编码智能体在生产级值班待命场景下的根本原因分析能力,发现现有前沿智能体表现不佳,凸显其距离安全胜任生产可靠性工作仍有较大差距。
通过离线评估方法的A/B测试实现更准确的算法比较
机构 * Hakuhodo DY Holdings Inc.(博报堂DY控股公司) ; Cornell University(康奈尔大学)
AI总结 揭示A/B测试可能比离线评估产生更高算法选择错误率的反直觉现象,提出通过引入假设中间算法并逐步估计性能差异来诱导正相关,从而减少关键选择错误。
Comments 13 pages, 10 figures. Accepted at KDD 2026; this version extends the camera-ready with additional experiments in Appendix B
深奥语言模型:一类任意阶扩散LLM
机构 * Cornell University(康奈尔大学) ; NVIDIA(英伟达)
AI总结 提出Eso-LMs模型,融合自回归与掩码扩散范式,通过因果注意力实现精确似然计算和KV缓存,在速度-质量帕累托前沿上达到新最优。
Comments ICML 2026 Camera Ready
量子玻尔兹曼机学习的基本原理:可见单元与隐藏单元
机构 * School of Electrical and Computer Engineering, Cornell University(电气与计算机工程学院,康奈尔大学)
AI总结 本文提出量子玻尔兹曼机中可见和隐藏单元的梯度估计方法,通过模块化流生成的单元ary旋转实现量子算法,用于生成建模和量子态学习。
Comments v2: 62 pages, 1 figure, minor changes
大语言模型上下文学习中数值序列表示的图信号处理视角
机构 * Cornell University(康奈尔大学) ; Goodfire AI(古德火人工智能公司) ; Imperial College London(伦敦帝国学院)
AI总结 本文从图信号处理视角研究LLM上下文学习中数值序列的表示,发现数值推理的内部特征随上下文长度和输入动态复杂性变化,且在不同模型家族间一致。
SoniSpeech:面向可穿戴静默语音接口的大规模开放词汇三模态数据集
机构 * Cornell University(康奈尔大学)
AI总结 针对可穿戴静默语音接口词汇量受限的问题,提出首个基于声学传感眼镜的大规模开放词汇三模态数据集SoniSpeech,构建了该任务的首个基准并取得26.3%的词错误率。
MetaRoute-Bench:评估智能体工作流路由的元决策策略
机构 * Anote AI(阿诺特人工智能公司) ; Cornell University(康奈尔大学) ; CUNY(纽约城市大学) ; Stevens Institute of Technology(史蒂文斯理工学院)
AI总结 该研究提出MetaRoute-Bench框架,构建含180个任务的基准,对比8种路由策略,发现任务感知组合策略成功率优于静态策略,明确路由组合与验证的关键作用,为智能体工作流路由评估提供可复现方法。
Comments 6 pages, 1 figure; DAI 2026 submission
神经算子在Burgers方程上的定量Sobolev近似界及实证
机构 * Department of Mathematics, Cornell University(康奈尔大学数学系)
AI总结 本文提出基于Sobolev空间的算子学习框架,通过傅里叶神经算子在Burgers方程上的实证,证明了神经算子在Sobolev范数下的近似精度与参数数量的关系。
专家选择路由使扩散语言模型实现自适应计算
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Scitix ; Cornell University(康奈尔大学) ; Duke University(杜克大学) ; UC Davis(加州大学戴维斯分校) ; Southern University of Science and Technology(南方科技大学)
AI总结 本文提出专家选择路由方法,通过确定性负载平衡提升扩散语言模型的吞吐量和收敛速度,并展示如何通过时间步依赖的专家容量优化计算分配,从而在匹配FLOPs下提升性能。
Comments Accepted at COLM 2026
纽约气味:一个大规模多模态数据集用于嗅觉
机构 * Columbia University(哥伦比亚大学) ; Cornell University(康奈尔大学) ; Osmo Labs(Osmo实验室)
AI总结 New York Smells 数据集通过多模态数据提升机器对嗅觉的感知能力,展示了视觉数据在跨模态学习中的作用。
Comments Project website at https://smell.cs.columbia.edu
PiDDM:用于锂离子电池健康状态预测的物理信息可微退化建模
机构 * University of Notre Dame(圣母大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Cornell University(康奈尔大学)
AI总结 该研究提出PiDDM框架,将退化物理纳入神经网络训练,在55块电池的6种协议数据及外推任务中,其预测误差与均方误差均优于基线模型,可实现准确且物理一致的电池SOH预测。
智能体AI中的OpenClaw与Ollama:迈向完全自主且可扩展的AI智能体系统
机构 * University of the Peloponnese(伯罗奔尼撒大学) ; Cornell University(康奈尔大学)
AI总结 该研究提出智能体AI的分层架构,分析OpenClaw与Ollama组成的全栈系统,验证系统集成可提升智能体能力,指出相关挑战并提供路线图,所有资源公开以支持研究。