Apa yang dikira cache hitKonteks berulang boleh digunakan semula
Penggunaan semula cache meningkatkan kelajuan tindak balas dan mengurangkan kos penggunaan, terutamanya dalam sembang berbilang pusingan, panggilan aliran kerja berulang dan gelung pelengkapan kod.
- Input biasa: dicaj pada pengganda model.
- Input cache yang berulang: dicaj bermula 0.1x.
- Bagi model berkos tinggi, pengganda cache mungkin naik ke 0.2x atau dijeda semasa turun naik huluan yang melampau.
Contoh ringkasJika anda berulang kali menyertakan konteks kongsi yang besar sepanjang perbualan panjang, bahagian berulang yang sepadan boleh dicaj pada pengganda lebih rendah.
Cache hit bermula 0.1xBahagian cache yang sepadan hanya dicaj 10% daripada kos input biasa.
Sesi panjang boleh lebih jimatSoalan susulan, panggilan aliran kerja dan gelung pelengkapan kod lebih mudah menggunakan semula konteks berulang.
Model premium mungkin diselaraskanApabila kos huluan berubah mendadak, pengganda cache mungkin berubah dan boleh dijeda dalam kes melampau.