$

inference-simulator

Rasa sendiri kelajuan anggaran: teks keluar pada tok/s yang dikira, dan beza TTFT antara permintaan pertama (cold) dengan soalan susulan (prefix cache).

02. Prompt

πŸ“„ Β·

Soalan 1

Soalan 2

Memuat tokenizer… (sementara guna anggaran ~4 aksara/token)

03. Anggaran

Prefill = 2 Γ— P Γ— N_prompt / (TFLOPS Γ— 50%), minimum satu bacaan penuh berat. Decode = tok/s sama seperti jadual kalkulator. Anggaran Β±30%; kos attention kuadratik untuk prompt sangat panjang diabaikan.

Simulasi streaming

Run 1 β€” cold

Prompt baru: prefill penuh dokumen + soalan

TTFTβ€”
Masaβ€”
Tokenβ€”
tok/sβ€”

Run 2 β€” susulan (prefix cache)

Dokumen + jawapan 1 sudah dalam KV cache β€” hanya soalan baru di-prefill

TTFTβ€”
Masaβ€”
Tokenβ€”
tok/sβ€”

Garis masa (skala sama)

Prefill (menunggu token pertama) Decode (teks keluar)