02. Beban kerja
Bila model tak muat dalam VRAM, lebihan di-offload ke RAM (llama.cpp / accelerate) — jauh lebih perlahan. Rujukan: DDR4-2400 dual ≈ 38 GB/s, DDR5-5600 dual ≈ 90 GB/s.
03. Arkitek model semasa
Keperluan VRAM
Padanan GPU
* hover/tekan untuk nota ketepatan spesifikasi · ★ PC rumah · ◆ pilihan office (hover untuk peranan) · Offload RAM = lebihan yang tak muat dalam VRAM 1 unit · tok/s = anggaran decode setiap pengguna (baris kecil: agregat semua pengguna), memory-bound pada MBU 70%, ±30%. Hover untuk faktor pengehad · ⚠ format berat tidak sepadan dengan engine/GPU (hover untuk sebab) · klik baris untuk pilih GPU & simulasi