$

gpu-llm-sizing-calculator

Anggaran keperluan VRAM deployment LLM & padanan GPU pasaran — rujukan Lenovo LP2130

01. Model

Berat
Cari di Hugging Face ↗
KV cache

02. Beban kerja

Bila model tak muat dalam VRAM, lebihan di-offload ke RAM (llama.cpp / accelerate) — jauh lebih perlahan. Rujukan: DDR4-2400 dual ≈ 38 GB/s, DDR5-5600 dual ≈ 90 GB/s.

03. Arkitek model semasa

Keperluan VRAM

M_model 0.00 GB
M_KV 0.00 GB
M_total 0.00 GB
Model weights KV cache

Padanan GPU

* hover/tekan untuk nota ketepatan spesifikasi  ·  PC rumah  ·  pilihan office (hover untuk peranan)  ·  Offload RAM = lebihan yang tak muat dalam VRAM 1 unit  ·  tok/s = anggaran decode setiap pengguna (baris kecil: agregat semua pengguna), memory-bound pada MBU 70%, ±30%. Hover untuk faktor pengehad  ·  format berat tidak sepadan dengan engine/GPU (hover untuk sebab)  ·  klik baris untuk pilih GPU & simulasi

Tiada GPU dipilih — klik satu baris dalam jadual. simulasi tok/s & TTFT →