arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

共收录 7
2605.09825 2026-08-13 cs.LG cs.AI 版本更新

Pretraining large language models with MXFP4 on Native FP4 Hardware

使用MXFP4在原生FP4硬件上预训练大型语言模型

Musa Cim, Sarthak Arora, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 研究发现FP4训练不稳定主要由梯度路径的结构微缩放误差引起,通过MXFP4量化在Transformer训练中的受控研究,揭示了FP4在Fprop和Dgrad中对收敛影响较小,而Wgrad量化导致收敛退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18171 2026-08-11 cs.LG 版本更新

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

FlashRT:用于引导智能体部署实时多模态应用的智能体框架

Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) AMD(超威半导体公司) University at Buffalo(纽约州立大学水牛城分校)

AI总结 研究实时多模态应用部署难题,提出FlashRT智能体框架。通过新范式引导编码智能体多阶段转换,将参考实现转为高效部署,在不同GPU上显著提升性能,尤其在专家优化不成熟平台更具扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04115 2026-07-15 cs.LG cs.AI 版本更新

dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats

dMX: 低精度浮点格式的可微分混合精度分配

Giuseppe Franco, Ian Colbert, Pablo Monteagudo-Lago, Felix Marty, Nicholas Fraser

机构 * AMD

AI总结 提出可微分混合精度量化框架 dMX,通过连续优化每层浮点格式参数并配合退火调度和正则化项,实现硬件兼容的 MXFP 格式分配,在 LLM 上取得帕累托最优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12046 2026-07-07 cs.CV cs.AI 版本更新

Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking

通过结构化掩码的布局条件自回归文本到图像生成

Zirui Zheng, Takashi Isobe, Tong Shen, Xu Jia, Jianbin Zhao, Xiaomin Li, Mengmeng Ge, Baolu Li, Qinghe Wang, Haiwen Diao, Dong Li, Dong Zhou, Yunzhi Zhuge, Huchuan Lu, Emad Barsoum

机构 * Advanced Micro Devices Inc.(超威半导体公司) Dalian University of Technology(大连理工大学) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

AI总结 提出SMARLI框架,通过结构化掩码策略将布局约束注入自回归生成过程,并采用GRPO后训练缓解曝光偏差,实现高质量布局控制图像生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06817 2026-07-02 cs.CL 版本更新

SemEval-2026 Task 9: Detecting Multilingual, Multicultural and Multievent Online Polarization

SemEval-2026任务9:多语言、多文化、多事件在线极化检测

Usman Naseem, Robert Geislinger, Juan Ren, Sarah Kohail, Rudy Garrido Veliz, P Sam Sahil, Yiran Zhang, Marco Antonio Stranisci, Idris Abdulmumin, Özge Alaçam, Cengiz Acartürk, Aisha Jabr, Saba Anwar, Abinew Ali Ayele, Elena Tutubalina, Aung Kyaw Htet, Xintong Wang, Surendrabikram Thapa, Tanmoy Chakraborty, Dheeraj Kodati, Sahar Moradizeyveh, Firoj Alam, Ye Kyaw Thu, Shantipriya Parida, Ihsan Ayyub Qazi, Lilian Wanzare, Nelson Odhiambo Onyango, Clemencia Siro, Ibrahim Said Ahmad, Adem Chanie Ali, Martin Semmann, Chris Biemann, Shamsuddeen Hassan Muhammad, Seid Muhie Yimam

机构 * Macquarie University(麦考瑞大学) University of Hamburg(汉堡大学) Zayed University(扎耶德大学) HKBK College of Engineering(HKBK工程学院) University of Turin(都灵大学) aequa-tech University of Pretoria(比勒陀利亚大学) Bielefeld University(比勒费尔德大学) Jagiellonian University(雅盖隆大学) Bahir Dar University(巴赫达尔大学) AIRI KFU(喀山联邦大学) HSE University(高等经济大学) Virginia Tech(弗吉尼亚理工大学) IIT Delhi(印度理工学院德里分校) ABV-IIITM(ABV-印度信息技术与管理学院) Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Language Understanding Lab., Myanmar(缅甸语言理解实验室) AMD Silo AI Lahore University of Management Sciences(拉合尔管理科学大学) Maseno University(马塞诺大学) Centrum Wiskunde & Informatica(数学与计算机科学中心) Bayero University Kano(卡诺巴耶罗大学) Northeastern University(东北大学) Imperial College London(伦敦帝国学院)

AI总结 本文介绍了SemEval-2026任务9,旨在检测在线极化,涵盖22种语言,包含超过11万标注实例。任务包含三个子任务,吸引全球1000多参与者和10000多提交,最终有67支队伍提交了系统描述论文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07586 2026-06-10 cs.LG cs.AI cs.AR cs.MA 版本更新

From Human Guidance to Autonomy: Agent Skill System for End-to-End LLM Deployment on Spatial NPUs

从人类引导到自主:面向空间NPU上端到端LLM部署的智能体技能系统

Jiajie Li, Erwei Wang, Zhiru Zhang, Samuel Bayliss

机构 * AMD Research and Advanced Development(AMD研究与高级开发)

AI总结 提出两阶段方法,从人类引导的智能体辅助部署到自主技能系统,在AMD XDNA 2 NPU上实现8种LLM的端到端自动部署,性能超越或持平人工优化基线。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05751 2026-06-08 cs.CL cs.AI 版本更新

Analysing Differences in Persuasive Language in LLM-Generated Text: Uncovering Stereotypical Gender Patterns

分析LLM生成文本中说服性语言的差异:揭示刻板的性别模式

Amalie Brogaard Pauli, Maria Barrett, Max Müller-Eberstein, Isabelle Augenstein, Ira Assent

机构 * Department of Computer Science, Aarhus University(阿arhus大学计算机科学系) AMD Silo AI University of Tokyo(东京大学) IT University of Copenhagen(哥本哈根IT大学) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

AI总结 提出框架评估LLM生成说服性语言时受接收者性别、发送者意图和输出语言的影响,发现所有模型均存在显著的性别差异,反映性别刻板印象的语言倾向。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏