WebGPU & WebLLM Benchmark

Gauge your local GPU's LLM inference performance directly in your Chrome browser

1. Select Llama Model to use for testing

2. Run Benchmark

3. Metrics Dashboard

Tokens Per Second (TPS) --
Time to First Token (TTFT) --
Estimated VRAM Allocation --
GPU Execution Time --

4. WebGPU Adapter Limits

Max Buffer Size: --
Max Storage Buffer Size: --
Max Workgroup Size X: --
Max Workgroup Size Y: --
Max Workgroup Size Z: --