TypeSafe AIのJev 1.13は入力トークンごとに料金がかかり、公式の現在の価格は100万トークンあたり0.042ドル、つまり10億トークンあたり42ドルです。出力トークンは無料です。実際の請求は、質問数や返答オプションだけでなく、州、発行品の説明、入力利用の候補基準に依存します。
この価格情報は、特に製品が現在初期の発売段階であるため、調整される可能性があります。予算を立てる際は、単に発売価格をビジネス設定に書くのではなく、コンソールの使用状況や最新の公式モデルページを読むべきです。
入力に含まれる内容はどれか
単一の要求における状態、質問、指示、基準はすべてモデルが処理しなければならない入力です。JEVは同一状態に対して複数の質問を並行して評価するため、関連する質問を1つのリクエストに統合する方が、同じ状態を繰り返し送信するよりも経済的です。出力選択、確率、信頼に対して追加の出力料金は課されません。
単純なコストアルゴリズム
月間コストを推定するには、「月間入力トークン総数×0.042 ÷ 1,000,000」と言えます。例えば、システムが毎日大量の短期作業指示を処理する場合、実際のコスト影響は各作業指示の入力長と問題標準です。コスト削減のために必要な境界条件を削除しないでください。重複フィールド、ログノイズ、判断に関係のない過去の内容の優先除去を優先してください。
現行モデルでまだ利用可能な制限はどれくらいありますか?
- JEV 1.13では、リクエストごとの総コンテキスト制限は64,000トークンです。
- 州と単問の最大トークン数は32,000トークンに制限されています。
- 公式モデルページには現在、レート上限が1秒あたり250,000トークン、1分間1,200件のリクエストが記載されています。
- レート制限を超えると429が戻ります。公式SDKはデフォルトで再試行を避け、再試行後に対応しています。
公式声明では、アーリーアクセス中のレート制限は動的に調整され、企業やカスタムプランはより高い上限を適用できると述べています。本番システムは制限が恒久的であると想定してはいけません。並行性、キュー、再試行パラメータはそれに応じて設定されるべきです。
コストとレイテンシーの両方を同時にコントロールする方法
- まず、コードから無関係なレコードをフィルタリングし、履歴ファイル全体を状態に詰め込むのを防ぎましょう。
- 同じ状態を共有する原子問題は統合され、重複入力を減らすために送信されます。
- 安定したデータの前処理結果はキャッシュしますが、古いビジネス判断はキャッシュしないでください。
- 各リクエストタイプごとにトークン、遅延、手動検証率を記録し、ワークフローごとに値を計算します。
jev-latestをアップグレードする前に、しきい値の静かな故障を避けるために固定バージョンでテストを戻してください。
単価が低いからといって、すべてのタスクがモデルを呼び出すべきではありません。正則表現、データベースクエリ、通常のコードで正確に完了できるステップはコードで続けるべきです。意味判断を必要とするステップのみをJEVに任せるべきであり、これによりコストと信頼性が向上します。