AA: A Multi-view Multimodal Dataset for Screen-based Gaze Estimation
AA: 用于屏幕式视线估计的多视角多模态数据集
机构 * Tsinghua University(清华大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出AA数据集,包含8个屏幕摄像头和2个侧视角摄像头的同步面部观测及精确视线目标,支持多视角多模态学习,解决单视角数据集的视角变化和遮挡问题。
高校专区
AA: 用于屏幕式视线估计的多视角多模态数据集
机构 * Tsinghua University(清华大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出AA数据集,包含8个屏幕摄像头和2个侧视角摄像头的同步面部观测及精确视线目标,支持多视角多模态学习,解决单视角数据集的视角变化和遮挡问题。
ShardNet: 训练具有硬非凸约束的神经控制器
机构 * Department of Mechanical Engineering, Georgia Institute of Technology(佐治亚理工学院机械工程系)
AI总结 提出ShardNet架构,通过可微投影层严格强制执行多面体约束,实现安全内嵌的神经网络控制器,在非凸约束下保持100%安全并降低目标损失。
Comments 11 pages, 4 figures
神经算子的实与复谱基:格林函数对齐的作用
机构 * Georgia Tech Research Institute(佐治亚理工学院研究 institute) ; University of Illinois at Chicago(伊利诺伊大学芝加哥分校)
AI总结 本文提出Hartley神经算子(HNO),作为傅里叶神经算子(FNO)的纯实值镜像,通过离散Hartley变换替代FFT,并基于格林函数对称性理论,揭示了椭圆型算子适合实谱基、时变算子适合复谱基的预测性规则。
Comments Submitted to/in consideration for the 62nd Allerton Conference on Communication, Control, and Computing
生理信号中的综合推理时增强框架:应用于基于PPG的房颤检测
机构 * Nell Hodgson Woodruff School of Nursing, Emory University(埃默里大学护理学院) ; Department of Computer Science, Emory University(埃默里大学计算机科学系) ; Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院生物医学工程系) ; Department of Biomedical Informatics, Emory University School of Medicine(埃默里大学医学学院生物医学信息学系)
AI总结 提出一个包含13种增强方法的统一推理时增强框架,通过贝叶斯优化超参数,在PPG房颤检测任务中显著提升AUROC和AUPRC,降低假阳性率。
Comments 22 pages, 11 figures, 4 tables. Under review at Physiological Measurement
稀疏POD模态选择与神经网络流形降维
机构 * School of Aerospace Engineering, Georgia Institute of Technology(航空航天工程学院,佐治亚理工学院) ; Computational Science Center, National Laboratory of the Rockies(岩石高原国家实验室计算科学中心)
AI总结 提出SparseModesNet框架,通过LassoNet实现线性POD模态的稀疏选择与非线性神经网络解码,在平流主导和混沌流中降低重构误差51-78%。
高效非凸采样的几何结构
机构 * Georgia Institute of Technology, College of Computing(佐治亚理工学院计算学院) ; Yale University, Department of Computer Science(耶鲁大学计算机科学系)
AI总结 提出一种在等周性和自然体积增长条件下从任意紧致体均匀采样的高效算法,统一了凸体和星形体的已知结果。
Comments Presented at the 39th Annual Conference on Learning Theory (COLT) 2026
基于关节角度运动图像与令牌-补丁后期交互的细粒度运动检索
机构 * Aalto University(阿尔托大学) ; Fudan University(复旦大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出一种可解释的关节角度运动表示,结合预训练视觉Transformer和令牌级后期交互机制,实现文本与3D运动之间的细粒度对齐,在HumanML3D和KIT-ML上超越现有方法。
EgoCogNav: 认知感知的人类自我中心导航
机构 * Cornell University(康奈尔大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出EgoCogNav多模态自我中心导航框架,联合预测路径不确定性、轨迹和头部运动,并引入CEN数据集,实验表明其能学习与人类扫描、犹豫等行为相关的感知不确定性。
Comments 15 pages, 4 figures
在 Lean 中形式化求解答案构造问题
机构 * University of Toronto(多伦多大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出 Enumerate-Conjecture-Prove (ECP) 框架,结合通用大语言模型和证明器大语言模型,在 Lean 中端到端地构造答案并生成形式化证明,解决数学竞赛中的答案构造问题。