Google 以 Apache 2.0 开源端侧 GPU 推理引擎 ML Drift,Gemma 内存开销最多低 12%
LiteRT 背后的 GPU 引擎单独开放,覆盖手机、网页和桌面。
// 要点
- ML Drift 是 LiteRT 的核心 GPU 加速引擎,也可作为独立库使用,Apache 2.0 许可,代码在 GitHub。
- 支持 OpenGL ES、OpenCL、Metal 和 WebGPU,覆盖 Android、iOS,以及通过 WebGPU 的 Windows、Linux 和通过 Metal 的 macOS(桌面为预览)。
- 针对端侧大模型按 prefill 和 decode 阶段切换内核;Gemma 基准中内存开销比其他框架最多低 12%,YouTube Shorts 平均帧延迟最多降低 40%。
- 旧的 TFLite GPU delegate 不再有新功能,LiteRT 加速器对现有模型完全向后兼容。
开发者视角和 10-07 的 EmbeddingGemma 2 放在一起看,端侧语义检索的模型和引擎都齐了。AI 云盘这类产品可以先在网页端用 WebGPU 试一版本地向量化,把隐私敏感文件留在用户设备上;还在用 TFLite GPU delegate 的项目,该排迁移计划了。