arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-06-16 至 2026-06-16 共收录 7
2606.16131 2026-06-16 cs.CV cs.LG 新提交

Shift-and-Sum Quantization for Visual Autoregressive Models

Shift-and-Sum 量化用于视觉自回归模型

Jaehyeon Moon, Bumsub Ham

机构 * Yonsei University(延世大学) Articron

AI总结 提出针对视觉自回归模型的训练后量化框架,通过移位求和量化减少注意力值乘积误差,并采用重采样策略校准数据,在图像生成等任务上达到新最优。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15897 2026-06-16 cs.LG cs.AI stat.ML 新提交

Topological Flow Matching

拓扑流匹配

Kacper Wyrwal, İsmail İlkan Ceylan, Alexander Tong

机构 * University of Oxford(牛津大学) TU Wien(维也纳技术大学) AITHYRA

AI总结 提出拓扑流匹配,通过拉普拉斯漂移增强参考过程,在保留流匹配稳定性和无模拟目标的同时,捕捉底层域拓扑结构,适用于脑fMRI、洋流等结构化数据。

Comments Accepted at ICLR 2026. 26 pages, 24 figures. Code: https://github.com/KacperWyrwal/topological-flow-matching

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14971 2026-06-16 cs.LG cs.AI 新提交

FastMix: Fast Data Mixture Optimization via Gradient Descent

FastMix: 通过梯度下降实现快速数据混合优化

Haoru Tan, Sitong Wu, Yanfeng Chen, Jun Xia, Ruobing Xie, Bin Xia, Xingwu Sun, Xiaojuan Qi

机构 * University of Hong Kong(香港大学) Tencent(腾讯) Chinese University of Hong Kong(香港中文大学)

AI总结 提出FastMix框架,将数据混合选择重新表述为双层优化问题,通过联合优化混合系数和模型参数,实现高效、可扩展的数据混合发现,在预训练和后训练中均优于基线方法且大幅降低搜索成本。

Journal ref ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04212 2026-06-16 cs.LG cs.AI 版本更新

Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention

低精度Transformer训练失败的原因:对Flash Attention的分析

Haiquan Qiu, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) State Key laboratory of Space Network and Communications(空间网络与通信国家重点实验室)

AI总结 本文首次从机制上解释了低精度下Flash Attention导致训练崩溃的原因,揭示了相似低秩表示与有偏舍入误差的恶性循环,并通过最小化修改稳定训练。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24012 2026-06-16 cs.LG eess.SP 版本更新

InfoNCE Induces Gaussian Distribution

InfoNCE 诱导高斯分布

Roy Betser, Eyal Gofer, Meir Yossef Levi, Guy Gilboa

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院)

AI总结 本文证明对比学习中的 InfoNCE 损失函数会使表示学习产生高斯分布结构,通过理论分析和实验验证了这种高斯行为。

Comments Accepted to ICLR 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22935 2026-06-16 cs.LG cs.AI

Compute-Optimal Quantization-Aware Training

计算最优量化感知训练

Aleksandr Dremov, David Grangier, Angelos Katharopoulos, Awni Hannun

机构 * Apple(苹果公司)

AI总结 本文研究了量化感知训练与全精度训练的计算分配优化问题,通过实验发现QAT与FP训练比例随总计算量增加而上升,并提出新的冷却与QAT融合方法以提升效率。

Comments ICLR 2026

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25594 2026-06-16 cs.CV cs.AI 版本更新

K-Prism: A Knowledge-Guided and Prompt Integrated Universal Medical Image Segmentation Model

K-Prism: 一种知识引导与提示集成的通用医学图像分割模型

Bangwei Guo, Yunhe Gao, Meng Ye, Difei Gu, Yang Zhou, Leon Axel, Dimitris Metaxas

机构 * Rutgers University(罗格斯大学) Stanford University(斯坦福大学) The University of Texas at Arlington(德克萨斯大学阿灵顿分校) New York University(纽约大学)

AI总结 提出K-Prism统一分割框架,通过双提示表示和混合专家解码器整合语义先验、上下文知识和交互反馈三种知识范式,在18个数据集上实现语义、上下文和交互分割的最优性能。

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏