近日,开发者利用 Google 新推出的 TurboQuant 算法成功将 Gemma4 模型部署至浏览器本地环境,使无需 API 或订阅费用即可实现本地 AI 交互。此次技术核心为 TurboQuant 对 KV Cache 的压缩优化,可将缓存向量数据缩减至原体积的六分之一,并支持压缩状态下检索,大幅提升上下文记忆与推理效率。实测显示,在支持 WebGPU 的 Chrome134+ 浏览器中,Gemma4E2B 模型生成完整 Excalidraw 流程图仅需约32.9秒,生成速率约每秒24个 token,全程无需在线 Token 消耗。用户首次使用需下载约3.1GB 模型文件。该方案基于 WebAssembly 与算法压缩技术,为浏览器端 AI 本地化应用提供了低成本高效率的参考范本。