コスパ
| モデル | スコア | 実測タスク費用 |
|---|---|---|
| Claude Opus 5.5 · Max, Default Fallback | 58 | $5.98 |
| gpt-6-astra · Max | 53 | $3.26 |
| gpt-6.1-sol · Max | 52 | $0.72 |
| grok-4.7 · Xhigh | 46 | $3.74 |
| kimi-k3 · Max | 44 | $2.00 |
| gemini-3.8-flash · High | 41 | $1.24 |
| deepseek-v4-pro · Max | 36 | $0.67 |
| モデル | スコア | 実測タスク費用 |
|---|---|---|
| Claude Opus 5.5 · Max, Default Fallback | 58 | $5.98 |
| gpt-6-astra · Max | 53 | $3.26 |
| gpt-6.1-sol · Max | 52 | $0.72 |
| grok-4.7 · Xhigh | 46 | $3.74 |
| kimi-k3 · Max | 44 | $2.00 |
| gemini-3.8-flash · High | 41 | $1.24 |
| deepseek-v4-pro · Max | 36 | $0.67 |
同じ評価バージョン内でベンチマークスコアと実測タスク費用を比べ、各モデルの推論設定も確認してください。入出力料金だけでは性能を測れません。測定値がない場合は不明のままにします。
いいえ。ベンチマークスコアは特定の評価を表します。タスク、応答時間、推論設定、合計費用によって適したモデルは変わります。スコアと費用を合わせて確認し、条件はベンチマークの情報源を開いてください。
いいえ。このカタログで比較可能な確認済み測定値がないという意味です。モデル名やトークン料金からスコアをゼロにしたり推定したりしません。欠損値は実測結果と区別します。