Run 1 β cold
Prompt baru: prefill penuh dokumen + soalan
TTFTβ
Masaβ
Tokenβ
tok/sβ
Rasa sendiri kelajuan anggaran: teks keluar pada tok/s yang dikira, dan beza TTFT antara permintaan pertama (cold) dengan soalan susulan (prefix cache).
Soalan 1
Soalan 2
Memuat tokenizer⦠(sementara guna anggaran ~4 aksara/token)
Prefill = 2 Γ P Γ N_prompt / (TFLOPS Γ 50%), minimum satu bacaan penuh berat. Decode = tok/s sama seperti jadual kalkulator. Anggaran Β±30%; kos attention kuadratik untuk prompt sangat panjang diabaikan.
Prompt baru: prefill penuh dokumen + soalan
Dokumen + jawapan 1 sudah dalam KV cache β hanya soalan baru di-prefill