O que conta como acerto de cacheO contexto repetido pode ser reutilizado
Reutilizar o cache melhora a velocidade de resposta e reduz o custo de uso, especialmente em conversas de vários turnos, chamadas de fluxo de trabalho repetidas e loops de autocompletar código.
- Entrada normal: cobrada pelo multiplicador do modelo.
- Entrada em cache repetida: cobrada a partir de 0.1x.
- Em modelos de alto custo, o multiplicador de cache pode subir para 0.2x ou ser pausado durante volatilidade upstream extrema.
Exemplo simplesSe você incluir repetidamente um grande contexto compartilhado ao longo de uma conversa longa, a parte repetida que coincide pode ser cobrada com um multiplicador menor.
Acertos de cache a partir de 0.1xA parte de cache correspondente é cobrada por apenas 10% do custo normal de entrada.
Sessões longas podem custar menosPerguntas de acompanhamento, chamadas de fluxo de trabalho e loops de autocompletar código reutilizam mais facilmente o contexto repetido.
Modelos premium podem se ajustarQuando os custos upstream variam bruscamente, os multiplicadores de cache podem mudar e ser pausados em casos extremos.