Qu'est-ce qu'un cache hitLe contexte répété peut être réutilisé
Réutiliser le cache améliore la vitesse de réponse et réduit le coût d'usage, surtout dans les conversations à plusieurs tours, les appels de workflow répétés et les boucles de complétion de code.
- Entrée normale : facturée au multiplicateur du modèle.
- Entrée en cache répétée : facturée à partir de 0.1x.
- Pour les modèles à coût élevé, le multiplicateur de cache peut monter à 0.2x ou être suspendu lors d'une forte volatilité amont.
Exemple simpleSi vous incluez à plusieurs reprises un grand contexte partagé au fil d'une longue conversation, la partie répétée correspondante peut être facturée à un multiplicateur plus bas.
Le cache hit démarre à 0.1xLa partie en cache correspondante n'est facturée qu'à 10% du coût d'entrée normal.
Les sessions longues peuvent coûter moins cherLes questions de suivi, les appels de workflow et les boucles de complétion de code réutilisent plus facilement le contexte répété.
Les modèles premium peuvent être ajustésLorsque les coûts amont varient fortement, les multiplicateurs de cache peuvent changer et être suspendus dans les cas extrêmes.