MNet++: Extended 2D/3D Networks for Anisotropic Medical Image Segmentation
MNet++: 用于各向异性医学图像分割的扩展2D/3D网络
机构 * School of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)
AI总结 本文复现并扩展了混合2D/3D卷积网络MNet,引入自适应融合门控和VMamba状态空间模块,在保持各向异性鲁棒性的同时提升分割性能。
高校专区
MNet++: 用于各向异性医学图像分割的扩展2D/3D网络
机构 * School of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)
AI总结 本文复现并扩展了混合2D/3D卷积网络MNet,引入自适应融合门控和VMamba状态空间模块,在保持各向异性鲁棒性的同时提升分割性能。
使用AH-多面体的精确、高效且安全的遮挡感知规划
机构 * Honda Research Institute (HRI)(本田研究所) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出APRO框架,利用博弈论主动感知和AH-多面体可达性分析,通过线性规划实现精确安全验证,解决自动驾驶代客泊车中的遮挡问题,达到100%安全率且实时。
Comments 8 pages, 3 figures
面向LLM-Agent工作流中并行分支的直接潜在空间合成
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Meta
AI总结 提出Parallel-Synthesis框架,通过直接利用并行工作代理的KV缓存进行合成,避免文本拼接冗余,在9个数据集上匹配或超越文本合成,并将首令牌延迟降低2.5-11倍。
在应当稀疏处分解,在应当稠密处吸收
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 针对稀疏自编码器假设所有激活内容均可稀疏分解的缺陷,提出在标准SAE旁添加低秩线性瓶颈以吸收稠密成分,在Gemma-2-2B第12层上秩24瓶颈减少84%稠密潜变量,并揭示该成分是结构可识别、因果必要且被稀疏字典冗余编码的计算脚手架。
无皱鲁棒性:并行仿真与鲁棒MPC实现可认证的变形体操作
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出CORD-SLS实时控制方法,通过GPU并行可微仿真与接触平滑实现高效梯度规划,结合鲁棒模型预测控制与共形预测校准,在绳索和布料操作中达到毫秒级规划与高安全性。
锥优化器的可扩展深度展开
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出矩阵自由隐式微分和基于Dalečkii-Krein的PSD锥反向传播规则,解决深度展开应用于大规模半定规划时的内存和数值稳定性问题,实现轻量级超参数策略和热启动学习,在多种问题上取得高达50倍加速。
利用深度学习薛定谔桥改进月球地形
机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H. Milton Stewart工业与系统工程系) ; NASA Goddard Space Flight Center(美国国家航空航天局戈达德太空飞行中心) ; Center for Research and Exploration in Space Science and Technology (CRESST II), University of Maryland, College Park(马里兰大学帕克分校空间科学与技术研究与探索中心(CRESST II)) ; National Institute for Astrophysics (INAF), Astrophysical Observatory of Turin(意大利国家天体物理研究所(INAF)都灵天体物理天文台)
AI总结 提出基于扩散薛定谔桥的生成模型,结合光学影像约束,实现月球地形超分辨率重建,并提供像素级不确定性估计。
Journal ref The Planetary Science Journal 7.6 (2026): 139
让我们问高斯:改进的单次运行隐私审计
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Rensselaer Polytechnic Institute(伦斯勒理工学院) ; Purdue University(普渡大学)
AI总结 提出一种基于高斯渐近分布的差分隐私审计框架,利用白盒DP-SGD中金丝雀对齐信号的归一化和,从单次训练运行中获取更紧的隐私下界。
A2D2: 任意长度离散扩散模型的自适应解码微调
机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) ; Department of Bioengineering, University of Pennsylvania(宾夕法尼亚大学生物工程系) ; School of Mathematics, Georgia Institute of Technology(佐治亚理工学院数学学院)
AI总结 提出A2D2框架,通过联合优化插入和去掩蔽策略及基于质量的推理调度,实现任意长度离散扩散模型的奖励引导微调,理论上保证收敛到奖励倾斜分布,实验提升奖励优化与生成灵活性和准确性。
WT-UMI: 基于触觉的全身操控通过力监督的接触感知规划
机构 * The Institute for Robotics and Intelligent Machines, Georgia Institute of Technology(机器人与智能机械研究所,佐治亚理工学院)
AI总结 提出WT-UMI系统,结合人体演示与遥操作数据,通过力监督规划器预测末端执行器位姿和接触力轨迹,并利用触觉导纳控制器提升全身操控性能。
Comments 18 pages, 8 figures
构建程序性推理评估数据集:平衡自然性、基础性和多跳覆盖
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 研究基于任务-方法-知识(TMK)模型的问题生成策略对程序性和多跳推理数据集质量的影响,提出基础性验证框架,发现严格TMK生成策略在基础性和可用性上最优。
Comments 10 pages, 2 numbered figures. Workshop submission to HAIL @ AIED 2026
EgoEngine:从自我中心人类视频到高保真灵巧机器人演示
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Tsinghua University(清华大学)
AI总结 提出EgoEngine框架,通过视觉和动作桥接,将自我中心人类视频转化为高保真机器人数据,首次实现零样本灵巧策略学习。
TAHOE: 基于经验的自动提示优化文本到SQL系统
机构 * ByteDance Inc.(字节跳动公司) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出TAHOE系统,通过错误驱动的提示学习管道将调试痕迹转化为结构化提示库,结合策略层建模用户意图,在Spider 2.0-Snow上无需更新参数即可显著提升Text-to-SQL性能。
T2MM:一种支持基于探究建模的LLM架构
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出T2MM架构,利用LLM在生态建模软件VERA中生成交互式模型,优于全代码生成基线。
Comments 16 pages, 4 figures
利用课程先决条件图检测对话式AI交互中的知识缺口
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出一个流水线,通过少样本文本分类器将学生向对话式AI助教提出的问题映射到课程主题,并利用GPT-4提取的先决条件知识图谱,以检测主题级知识缺口。
Comments Accepted as a short paper at the 10th CSEDM Workshop, co-located with the 18th International Conference on Educational Data Mining (EDM 2026). 7 pages, 2 figures, 2 tables
ASTRA-sim 3.0:通过高保真GPU和基础设施建模实现下一代分布式机器学习模拟
机构 * AMD Research and Advanced Development(AMD研究与高级开发) ; Georgia Institute of Technology(佐治亚理工学院) ; Keysight ; Purdue University(普渡大学)
AI总结 针对分布式机器学习中延迟敏感通信建模的不足,提出ASTRA-sim 3.0,通过细粒度缓存行级负载存储模拟和标准化基础设施表示InfraGraph,实现高保真模拟,支持优化集合算法、网络需求和GPU架构的设计空间探索。
Comments 10 pages, 15 figures, one table
最大匹配精度:利用全局最优匹配的实例分割评估指标
机构 * College of Computing, Georgia Institute of Technology(佐治亚理工学院计算机学院) ; School of Materials Science and Engineering, Georgia Institute of Technology(佐治亚理工学院材料科学与工程学院) ; Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院生物医学工程系) ; George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology(佐治亚理工学院机械工程学院)
AI总结 提出最大匹配精度(MMA),通过全局最优一对一匹配和逐像素归一化,克服现有指标在细胞分割评估中的不连续、不敏感和匹配非最优问题,提供更稳定、敏感和可解释的评分。
一个镜头,多个世界:面向世界模型可解释性的能力类型接口
机构 * New York University(纽约大学) ; Independent Researcher(独立研究者) ; Veermata Jijabai Technological Institute(韦尔玛塔·吉贾拜技术学院) ; Mercity ; University of Southern California(南加州大学) ; Independent Researcher, MIT(麻省理工学院独立研究者) ; Independent Researcher, GITAM(GITAM独立研究者) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出WorldModelLens,通过能力类型适配器统一不同世界模型(如PlaNet、IRIS、I-JEPA)的可解释性分析,避免重复实现。
语言模型表示中假设的意识谱状态的可导航流形
机构 * School of Computer Science(计算机科学学院) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 研究语言模型嵌入空间中与意识谱相关的几何结构,发现嵌入形成可导航流形,高低层区域稳定,中间为过渡走廊,导航性为内在属性。
SIFT: 利用注意力不变性实现RAG预填充快速计算的索引选择
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Microsoft(微软)
AI总结 针对RAG查询中文档重复导致预填充计算冗余和TTFT增加的问题,提出SIFT方法,通过离线提取文档高注意力分数位置并利用注意力不变性,在预填充时仅计算标记位置,将TTFT提升1.71倍且精度损失在1%以内。
Video2Sim2Real:从单个人类视频实现全栈自主灵巧技能获取
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Pennsylvania(宾夕法尼亚大学) ; Toyota Research Institute(丰田研究所) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出Video2Sim2Real框架,从单个人类操作视频中重建数字孪生并提取运动先验,通过物体关键帧优化机器人配置,结合残差强化学习与碰撞感知规划,实现从仿真到真实世界的灵巧技能迁移。
Comments Website: https://video2sim2real.github.io/
通过训练感知的条件扩散模型改进贝叶斯优化
机构 * National University of Singapore(新加坡国立大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出利用条件扩散模型高效近似最优解分布,并开发贝叶斯优化固有的训练策略和基于扩散的模态搜索采集函数,理论保证次优性,实验优于标准基线。
无前向过程的扩散语言模型
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。
QueryWeaver: 基于LLM图生成的可靠多工具查询执行规划
机构 * School of Computational Science and Engineering, Georgia Institute of Technology, Atlanta, GA, USA(计算科学与工程学院,佐治亚理工学院,亚特兰大,GA,美国)
AI总结 提出将自然语言查询转换为结构化图并通过确定性规划器执行的系统,利用深度优先搜索解决跨工具依赖,实现高可靠性查询。
动力膝踝假肢的端到端控制:迈向统一、免调参的辅助
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Woodruff School of Mechanical Engineering(伍德拉夫机械工程学院) ; Institute for Robotics and Intelligent Machines(机器人与智能机器研究所)
AI总结 本文提出一种端到端假肢控制器,利用时序卷积网络从机载传感器估计连续执行器信号,无需意图分类器和个体调参,在多种地形和步态模式下实现统一、模式自适应的假肢辅助。
Comments 7 pages, 6 figures
SWE-Marathon: 智能体能否自主完成超长时程软件工作?
机构 * Abundant ; Zenity ; Harvard University(哈佛大学) ; University of Waterloo(滑铁卢大学) ; Gujarat Technological University(古吉拉特技术大学) ; Warping ; Stanford University(斯坦福大学) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Independent(独立) ; Refresh ; Soleda AI ; Near AI ; Georgia Tech(佐治亚理工学院) ; Comenius University in Bratislava(布拉迪斯拉发Comenius大学) ; UC San Diego(圣地亚哥大学) ; BenchFlow ; UC Santa Barbara(圣巴巴拉大学)
AI总结 提出SWE-Marathon基准,包含20个超长时程任务,平均消耗2720万token,评估智能体在规划、长上下文理解和记忆方面的能力,当前前沿编码智能体解决率低于30%。
大语言模型的序贯统计推断:表示、有效性与监控
机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院工业与系统工程系)
AI总结 本文提出将序贯统计推断应用于大语言模型可信赖性,围绕表示、有效性和监控三个任务展开,将LLM交互视为依赖随机过程,提供不确定性保证并检测行为变化。
Comments This article was prepared for a invited discussion in The American Statistician
PulseBench-Tab:基于图评估的多语言表格提取基准
机构 * Pulse AI ; Georgia Institute of Technology(佐治亚理工学院) ; S&P Global, Enterprise Data Organization(S&P全球企业数据部门)
AI总结 提出包含9种语言、1820个标注表格的多语言基准PulseBench-Tab,并设计基于单元格邻接有向图的新评估指标T-LAG,通过最优二分匹配统一衡量结构和内容保真度。
Comments 14 pages, 5 figures, 8 tables. Dataset: https://huggingface.co/datasets/pulse-ai/PulseBench-Tab Code: https://github.com/Pulse-Software-Corp/PulseBench-Tab
通过微调语言模型中的语义偏移检测社区特定俚语和实体
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出无监督方法,通过测量词在微调前后的语义偏移幅度,从在线社区文本中自动识别俚语、独特实体和民俗用语。
Comments 6 pages, 6 figures, 2 tables
评估领域自适应大语言模型中的幻觉现象
机构 * College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)
AI总结 本研究通过微调Llama-2模型,测试其记忆、回忆和推理能力,发现领域自适应大语言模型在生成新领域特定信息时存在幻觉问题,表明仅靠微调难以有效缓解幻觉。
Comments 13 pages, 2 figures, 3 tables