Coste de inferencia

La inferencia barata empieza por limitar la carga

Usa el modelo más pequeño que complete la tarea de forma fiable y controla salida, reintentos y concurrencia.

Métodos de recarga previstos: Alipay y USDT. El cobro todavía no está habilitado.

Palancas reales

  • Modelo
  • Longitud del prompt
  • Máximo de salida
  • Caché
  • Reintentos
  • Agrupación cuando sea posible

No optimices solo la tarifa

Un modelo más barato puede salir caro si falla o exige mucha corrección.

Preguntas frecuentes

¿Qué métrica debo usar?

Coste por resultado aceptado, junto con latencia y tasa de error.

Recursos relacionados