Dokumen ini memperkenalkan Consistency Large Language Models (CLLMs), sebuah keluarga baru decoder paralel yang dapat secara efisien memecahkan kode urutan n-token per langkah inferensi, sehingga mengurangi latensi. Dijelaskan bahwa CLLM dilatih untuk melakukan decoding paralel dengan memetakan urutan n-token yang diinisialisasi secara acak ke hasil yang sama yang dihasilkan oleh decoding autoregresif (AR) dalam beberapa langkah sesedikit mungkin. Metode yang diusulkan menunjukkan peningkatan yang signifikan dalam kecepatan pembangkitan, sebanding dengan teknik inferensi cepat lainnya seperti Medusa2 dan Eagle, tanpa memerlukan biaya memori tambahan. Metode decoding Jacobi dibahas, yang mengubah proses pembangkitan berurutan menjadi sistem n persamaan non-linear yang dapat diselesaikan secara paralel. Dokumen ini juga merinci proses pelatihan untuk CLLM, termasuk kehilangan konsistensi global (GC), kehilangan konsistensi lokal (LC), dan kehilangan AR tradisional. Dokumen ini menyoroti bahwa CLLM mencapai percepatan yang signifikan dalam domain khusus dan tantangan percakapan domain terbuka, dengan biaya fine-tuning yang moderat. Selain itu, CLLM menunjukkan kemampuan untuk memprediksi token yang benar secara preemptive dan memperoleh kemahiran dalam berbagai kolokasi melalui tujuan pembuatan konsistensi.
