📖标题:MobileLLM-Flash: Latency-Guided On-Device LLM Design for Industry Scale 🌐来源:arXiv, 2603.15954v1 🛎️文章简介 🔸研究问题:如何在资源受限的移动设备上设计出既满足实时低延迟要求,又具备强大通用能力且无需定制算子的大语言模型? 🔸主要贡献:论文提出了基于硬件在环剪枝搜索的方法论,推出了 MobileLLM-Flash 模型家族,在移动 CPU 上实现了比现有最先进模型快 1.8 倍的预填充速度且精度更高。 📝重点思路 🔸采用两阶段贝叶斯优化策略,首先通过密集采样构建高精度的移动端延迟代理模型,随后利用该模型高效搜索质量与延迟的帕累托前沿,避免了对每个候选模型进行昂贵的完整训练评估。 🔸提出基于结构化剪枝的架构搜索空间,通过对预训练骨干网络进行剪枝并继承权重来初始化候选模型,利用激活能量指标自动确定层数、隐藏层维度及注意力模式,大幅降低了搜索的数据成本和计算开销。 🔸将搜索范围限定为标准移动运行时(如 Executorch)原生支持的注意力机制, specifically 引入跳过注意力(skip attention)和滑动窗口注意力,摒弃了需要定制内核的复杂算子以确保工业级部署的兼容性。 🔸联合优化模型架构形状与注意力分布模式,发现交错排列全局注意力与跳过注意力块的模式能在保持长上下文建模能力的同时最大化推理速度。 🔎分析总结 🔸实验表明模型参数量和 FLOPs 与真实移动端延迟的相关性较低(肯德尔系数仅约 0.4-0.5),证明直接基于硬件实测延迟进行优化是提升端侧性能的必要性条件。 🔸在同等参数量下,浅而宽的模型架构相比深而窄的架构能更好地平衡准确率与延迟,特别是在严格延迟约束下,浅层模型表现更优。 🔸跳过注意力机制在移动端 CPU 上的效率显著优于滑动窗口注意力,后者因实现机制限制在特定分块大小下反而导致计算变慢;但连续跳过超过三层会损害模型性能,需采用交错策略。 💡个人观点 论文摆脱了以参数量或 FLOPs 为代理指标的传统设计思路,提出“浅宽结构”与“交错跳过注意力”原则。 #LLM #大模型 #大模型推理 #论文分享 #Meta
Meta:移动端高效大模型设计
刘耀文的大沙雕
论文
降低AIGC
知网
作者:Meta:移动端高效大模型设计
上一篇
← 上一篇:没有上一篇
下一篇
下一篇:没有下一篇 →