High-speed Networking for Giga-Scale AI Factories
面向十亿级AI工厂的高速网络
机构 * NVIDIA(英伟达) ; Technion - Israel Institute of Technology(技术ion-以色列理工学院)
AI总结 本文提出了一种面向大规模AI训练需求的高速网络架构,通过拓扑并行性替代传统层次结构,利用硬件加速的负载均衡技术,在微秒级动态网络条件下提供稳定性能,展示了在三大核心维度上的生产级AI基础设施性能。
高校专区
面向十亿级AI工厂的高速网络
机构 * NVIDIA(英伟达) ; Technion - Israel Institute of Technology(技术ion-以色列理工学院)
AI总结 本文提出了一种面向大规模AI训练需求的高速网络架构,通过拓扑并行性替代传统层次结构,利用硬件加速的负载均衡技术,在微秒级动态网络条件下提供稳定性能,展示了在三大核心维度上的生产级AI基础设施性能。
从线性查询中最优重建
机构 * Technion – Israel Institute of Technology(技术学院 – 以色列理工学院) ; Google Research(谷歌研究)
AI总结 研究如何从近似线性查询中重建未知点,分析查询数量、维度和噪声参数对重建误差的影响,并提出一种改进的重建问题变体。
Comments Accepted to COLT 2026. 46 pages, 4 figures
开放集域适应在背景分布偏移下的挑战:挑战与一种可证明高效的解决方案
机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) ; Faculty of Data and Decision Sciences, Technion(技术学院数据与决策科学学院) ; Center for Data Science, New York University(纽约大学数据科学中心) ; Bayesian Health(贝叶斯健康)
AI总结 本文研究了在背景分布偏移情况下开放集域适应的挑战,并提出了一种可证明高效的解决方案CoLOR,通过理论分析和实验证明其在简化过参数化设置中优于基线方法,同时展示了其在图像和文本数据上的广泛适用性。
Comments Project page at https://github.com/Shra1-25/CoLOR
Journal ref Transactions on Machine Learning Research (TMLR) 2026/May ISSN: 2835-8856
INSIGHTS: 时间序列预测器的基于演示的摘要
机构 * Technion Israel Institute of Technology(技术学院以色列理工学院) ; Tel-Aviv University(特拉维夫大学)
AI总结 本文提出INSIGHTS方法,一种模型无关、以用户为中心的方法,用于提供时间序列模型的全局解释。该方法通过生成样本摘要,平衡时间序列样本的重要性与多样性,为用户提供全面的模型行为概述。
具有密集权重的神经网络不是通用逼近器
机构 * Princeton University, Dept of CS(普林斯顿大学计算机科学系) ; MIT, Dept of EECS and CSAIL(麻省理工学院电子工程与计算机科学系及计算机科学与人工智能实验室) ; TUM, School of CIT, MCML, MDSI(技术大学(TUM)信息科技学院,MCML,MDSI) ; Technion – IIT, Faculty of Mathematics(技术学院–以色列理工学院数学学院)
AI总结 研究探讨了密集神经网络的逼近能力,指出在有限的权重约束下,密集连接的神经网络无法逼近任意连续函数,从而揭示了密集层神经网络的固有局限性,推动了稀疏连接在实现真正通用性中的必要性。
基于证据的前沿映射与代理假设生成在纳米医学中
机构 * ARIA Lab, Signal Processing Systems, Department of Electrical Engineering, Eindhoven University of Technology(ARIA实验室,信号处理系统,电气工程系,埃因霍温理工大学) ; Laboratory of Chemical Biology, Department of Biomedical Engineering, Eindhoven University of Technology(化学生物学实验室,生物医学工程系,埃因霍温理工大学) ; The Louis Family Laboratory for Targeted Drug Delivery and Personalized Medicine Technologies, Department of Chemical Engineering, Technion - Israel Institute of Technology(定向药物输送与个性化医学技术实验室,化学工程系,技术离子-以色列理工学院) ; Department of Nanomedicine and Theranostics, Institute for Experimental Molecular Imaging (ExMI), RWTH Aachen University Hospital(纳米医学与诊疗学系,实验分子成像研究所(ExMI),亚琛工业大学医院) ; Department of Internal Medicine and Radboud Center for Infectious Diseases (RCI), Radboud University Medical Center(内科学系和Radboud感染疾病中心(RCI),Radboud大学医学中心)
AI总结 该研究提出了一种结合文章嵌入、相似性图分析、稀疏前沿提取、结构化证据包检索和审计过的大型语言模型(LLM)工作流的系统pArticleMap,用于支持纳米医学研究方向的选择和假设生成,通过生成和评分基于引用的假设,实现了证据导向的研究辅助。
通过再生核来控制任意结构假设空间中的假发现
机构 * Technion – Israel Institute of Technology(技术Ion – 以色列理工学院) ; NVIDIA
AI总结 本文提出了一种基于再生核的框架,用于在任意结构的假设空间中控制假发现率,通过将结构FDR控制转化为正则化学习问题,实现了对连续域、图和层次结构的统一处理,提高了发现能力。
Comments 9 pages
旧习惯难改:对话历史如何几何学地困住大语言模型
机构 * Technion - Israel Institute of Technology(技术ion-以色列理工学院) ; University of Oxford(牛津大学) ; University of Zagreb, FER(Zagreb大学,FER) ; Kempner Institute, Harvard University(Kempner研究所,哈佛大学) ; University of Edinburgh(爱丁堡大学)
AI总结 研究探讨对话历史如何通过几何陷阱影响大语言模型的后续表现,提出History-Echoes框架从概率和几何两个角度分析对话历史偏差,并揭示行为持续性在潜在空间中的几何陷阱。
Comments Accepted to ICML 2026
在图神经网络中学习历史激活
机构 * Technion – Israel Institute of Technology(技术ion–以色列理工学院) ; NVIDIA ; Ben-Gurion University of the Negev(贝内-约尔根大学) ; University of Cambridge(剑桥大学)
AI总结 本文提出HISTOGRAPH,一种基于注意力的两阶段最终聚合层,通过层间和节点间的注意力机制,利用节点的激活历史和图结构来优化最终预测特征,从而在多个图分类基准上实现了优于传统方法的性能。
Comments ICLR 2026
先规划,后扩散:用于长视距扩散规划的外在图引导
机构 * Technion(技术Ion大学) ; Harvard(哈佛大学)
AI总结 本文提出了一种外在搜索引导的扩散模型(XDiffuser),通过在状态空间图上先规划再引导扩散过程,以提高长视距规划的效率和效果,尤其在低质量数据和未见任务中表现优异。
具有不可靠指导的在线算法
机构 * TU Berlin, Germany(柏林技术大学,德国) ; Technion, Israel(技术学院,以色列) ; Reykjavik University, Iceland(雷克雅未克大学,冰岛) ; TU Berlin and Weizenbaum Institute, Germany(柏林技术大学和魏泽恩鲍姆研究所,德国)
AI总结 本文提出了一种名为OAG的在线算法模型,通过请求-回答游戏的视角,分离预测与算法组件,构建了通用分析框架,从而开发出首个通用编译器DTB,将标准在线算法转化为学习增强型算法,并在三个经典问题中取得新的性能平衡和最优解。
信号与logits的耦合扩散模型联合增强与分类
机构 * Technion -- Israel Institute of Technology, Haifa, Israel(技术学院——以色列理工学院,海法,以色列) ; NTT, Inc., Japan(日本NTT公司)
AI总结 本文提出一种集成信号和logits扩散模型的框架,通过相互指导提升分类鲁棒性,有效应对噪声环境下的分类挑战。
分析和指导扩散模型中的零样本后验采样
机构 * Department of Electrical and Computer Engineering(电气工程系) ; Department of Computer Science(计算机科学系) ; Technion, Haifa, Israel(以色列海法技术学院)
AI总结 本文分析了扩散模型中零样本后验采样的方法,提出基于高斯假设的框架,通过频域分析实现参数设计,提升感知质量和信号保真度。
动作-梯度蒙特卡洛树搜索用于非参数连续(PO)MDPs
机构 * Technion – Israel Institute of Technology(技术学院 – 以色列理工学院)
AI总结 本文提出AGMCTS框架,结合全局树搜索与局部梯度优化,解决连续状态空间下的规划问题,理论贡献包括动作评分梯度定理、多重要性采样树和可计算的动作评分梯度。
为异步SGD带来秩序:在数据依赖延迟下趋向最优性
机构 * Technion – Israel Institute of Technology(技术学院 – 以色列理工学院)
AI总结 本文提出一种基于动量的异步框架,旨在保留延迟梯度信息并缓解滞后影响,首次在凸和非凸光滑设置中获得数据依赖延迟的最优收敛率,并提出鲁棒的学习率调度方案。
编辑推荐:通过原子实体分析评估图像编辑中的抽象意图
机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) ; Google Research(谷歌研究)
AI总结 本文提出通过原子实体分析评估图像编辑中抽象意图的方法,引入Entity-Rubrics框架并构建AbstractEdit基准,揭示现有模型在平衡意图与保留之间的挑战,强调结合先进LLM和迭代思维的重要性。
Realiz3D: 通过领域感知学习实现逼真3D生成
机构 * Technion(技术学院) ; Meta AI
AI总结 Realiz3D通过分离控制信号与视觉领域,提升生成图像的逼真度和3D一致性,适用于文本到多视角生成和3D输入纹理生成。
Comments Accepted to CVPR 2026. Project page: https://idosobol.github.io/realiz3d/
MILM:用于多模态不规则时间序列的大型语言模型与信息采样
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Technion-IIT(技术学院-以色列理工学院) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 本文提出MILM模型,通过两阶段策略处理多模态不规则时间序列,有效利用采样模式和观测值进行分类,提升医疗记录中住院死亡率预测性能。
尺度敏感的碎裂:在最优尺度上的可学习性与可评估性
机构 * University of Maryland(马里兰大学) ; Tel Aviv University and Google Research(特拉维夫大学和谷歌研究) ; Technion and Google Research(技术学院和谷歌研究)
AI总结 本文研究了实值函数类在最优尺度下的统一收敛和可学习性,证明了在特定尺度下,统一收敛、无偏可学习性和脂肪碎裂维度的有限性等概念等价,解决了可学习性精确尺度的问题,并改进了现有上界。
Comments 32 pages, 1 figure
超越过饱和:通过可观测量理解GNN中的信号传播
机构 * Technion - Israel Institute of Technology, Faculty of Mathematics(技术离子-以色列理工学院,数学系) ; Technical University of Munich, School of Computation, Information and Technology(慕尼黑技术大学,计算、信息与技术学院) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
AI总结 本文提出基于量子力学的可观测量方法,揭示标准谱GNN信号传播能力不足,并提出Schrödinger GNN改进信号路由能力。
测试时训练与KV绑定实际上是秘密的线性注意力
机构 * NVIDIA, Toronto, Ontario, Canada(NVIDIA,多伦多,安大略省,加拿大) ; University of Toronto, Toronto, Ontario, Canada(多伦多大学,多伦多,安大略省,加拿大) ; Vector Institute, Toronto, Ontario, Canada(向量研究所,多伦多,安大略省,加拿大) ; Technion -- Israel Institute of Technology, Haifa, Israel(技术ion -- 以色列理工学院,海法,以色列)
AI总结 本文揭示测试时训练与KV绑定实际上是学习的线性注意力,而非记忆,提出简化架构、并行计算和统一模型形式的改进方法。
Comments ICML 2026, Webpage: https://research.nvidia.com/labs/sil/projects/tttla/
学习一个持续思考标记以增强测试时扩展
机构 * Department of Computer Science, Technion – Israel Institute of Technology(计算机科学系,技术学院–以色列理工学院) ; Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术学院–以色列理工学院)
AI总结 本文研究了通过学习专用持续思考标记来提升测试时扩展性能的方法,实验表明该方法在数学基准测试中优于固定标记方法。
STRABLE:基于字符串的表格机器学习基准测试
机构 * SODA Team, INRIA Saclay(SODA团队,INRIA萨克莱实验室) ; Probabl ; University of Freiburg(弗赖堡大学) ; Prior Labs ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Technion – Israel Institute of Technology(技术ion-以色列理工学院)
AI总结 本文提出STRABLE基准数据集,通过评估445种表格学习管道,探讨字符串和数字混合数据的处理方法,发现基于字符串嵌入的模型在低计算成本下表现优异,而大语言模型在文本主导数据中更具竞争力。
通过多SAE层转换实现领域限制
机构 * Technion -- Israel Institute of Technology, Haifa, Israel(技术ion理工学院,海法,以色列)
AI总结 本文通过分析LLM内部动态,提出利用稀疏自编码器(SAE)层转换提取领域特征的方法,验证了其在区分out-of-domain文本中的有效性。
福利作为机器学习的指导原则——从指南针到镜头到路线图
机构 * Faculty of Computer Science(计算机科学学院) ; Technion – Israel Institute of Technology(技术ion–以色列理工学院) ; Department of Computer Science(计算机科学系) ; University of Chicago(芝加哥大学)
AI总结 本文提出将社会福利作为机器学习的指导原则,以促进社会福祉,补充传统优化、泛化和表达性核心标准。
NexOP:面向低场MRI的NEX感知k空间采样与图像重建联合优化
机构 * Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术学院–以色列理工学院) ; May-Blum-Dahl Technion Human MRI Research Center, Technion - Israel Institute of Technology(May-Blum-Dahl技术学院人类MRI研究中心,技术学院–以色列理工学院) ; Department of Biomedical Engineering, Technion – Israel Institute of Technology(生物医学工程系,技术学院–以色列理工学院)
AI总结 NexOP通过深度学习框架联合优化多NEX采集的k空间采样与重建,针对低信噪比场景提升图像质量,实验表明其在不同加速因子和组织对比度下均优于其他方法。
何时以及如何规范化:从一般化角度出发
机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院)
AI总结 本文从一般化角度分析了规范化的理论属性,提出通过覆盖数上界分析规范化的泛化误差,建立了规范化的泛化误差层次,并证明了Hilbert曲线规范化的有效性。
训练用于KV缓存压缩性的Transformer
机构 * University of Oxford(牛津大学) ; Technion – Israel Institute of Technology(技术ion理工学院) ; AITHYRA ; NVIDIA
AI总结 本文提出KV-CAT训练方法,通过训练时的KV稀疏化策略,引导模型学习可压缩的表示,提升下游压缩方法的质量-预算权衡。
Comments 32 pages, 4 figures
MulTaBench: 基于文本和图像的多模态表格学习基准测试
机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) ; Prior Labs(Prior实验室) ; NVIDIA ; SODA Team, INRIA Saclay, Palaiseau(SODA团队,INRIA萨克莱,帕莱索) ; University of Freiburg(弗赖堡大学) ; Probabl ; ELLIS Institute Tübingen(图宾根ELLIS研究所)
AI总结 MulTaBench通过40个数据集评估多模态表格学习,强调任务特定的表示学习,展示目标感知表示在文本和图像模态中的泛化能力。
通过低秩分解实现LLM评估中的最佳模型识别
机构 * Department of Computer Science, Technion – Israel Institute of Technology(计算机科学系,技术离子理工学院) ; Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术离子理工学院)
AI总结 本文提出结合多臂老虎机与低成本预测评分的框架,通过低秩分解减少方差,构建有效的置信区间,实现实验结果的准确识别与计算成本的降低。