Biaya inferensi

Inferensi murah dimulai dari workload yang dibatasi

Pilih model terkecil yang dapat menyelesaikan tugas dengan stabil, lalu batasi output, retry, dan concurrency.

Metode isi saldo yang direncanakan: Alipay dan USDT. Modul penerimaan pembayaran belum diaktifkan.

Pengungkit biaya

  • Pilihan model
  • Panjang prompt
  • Maksimum output
  • Cache
  • Retry
  • Batch bila sesuai

Jangan hanya melihat tarif

Model dengan tarif rendah dapat lebih mahal bila sering gagal atau membutuhkan banyak koreksi.

Pertanyaan umum

Metrik apa yang sebaiknya dipakai?

Biaya per hasil diterima, bersama latensi dan tingkat kegagalan.

Sumber terkait