开源 #开源模型 2026-10-10 · 原文发布 10-08

Google 以 Apache 2.0 开源端侧 GPU 推理引擎 ML Drift,Gemma 内存开销最多低 12%

LiteRT 背后的 GPU 引擎单独开放,覆盖手机、网页和桌面。

一手来源 Google Developers Blog · developers.googleblog.com 读原文 ↗

// 要点

  • ML Drift 是 LiteRT 的核心 GPU 加速引擎,也可作为独立库使用,Apache 2.0 许可,代码在 GitHub。
  • 支持 OpenGL ES、OpenCL、Metal 和 WebGPU,覆盖 Android、iOS,以及通过 WebGPU 的 Windows、Linux 和通过 Metal 的 macOS(桌面为预览)。
  • 针对端侧大模型按 prefill 和 decode 阶段切换内核;Gemma 基准中内存开销比其他框架最多低 12%,YouTube Shorts 平均帧延迟最多降低 40%。
  • 旧的 TFLite GPU delegate 不再有新功能,LiteRT 加速器对现有模型完全向后兼容。

开发者视角和 10-07 的 EmbeddingGemma 2 放在一起看,端侧语义检索的模型和引擎都齐了。AI 云盘这类产品可以先在网页端用 WebGPU 试一版本地向量化,把隐私敏感文件留在用户设备上;还在用 TFLite GPU delegate 的项目,该排迁移计划了。

// 来龙去脉 · 来自 #开源模型 专题

看完整时间线 →
  1. 10-09 LightOn 开源 LightOnOCR-3:0.8B 到 4B 三个尺寸,Apache 2.0,olmOCR-Bench 最高 86.3
  2. 10-09 Liquid AI 开放 d1 决策模型:d1-3B 一次前向给出判断,RTX 4090 上单题 8 毫秒
  3. 10-09 NVIDIA 微调 Nemotron 拿下 IOI 2026 535.4/600、IMO 2026 30/42 金牌线成绩,并开放权重与训练数据