性價比
| 模型 | 分數 | 實測任務成本 |
|---|---|---|
| Claude Opus 5.5 · Max, Default Fallback | 58 | US$5.98 |
| gpt-6-astra · Max | 53 | US$3.26 |
| gpt-6.1-sol · Max | 52 | US$0.72 |
| grok-4.7 · Xhigh | 46 | US$3.74 |
| kimi-k3 · Max | 44 | US$2.00 |
| gemini-3.8-flash · High | 41 | US$1.24 |
| deepseek-v4-pro · Max | 36 | US$0.67 |
| 模型 | 分數 | 實測任務成本 |
|---|---|---|
| Claude Opus 5.5 · Max, Default Fallback | 58 | US$5.98 |
| gpt-6-astra · Max | 53 | US$3.26 |
| gpt-6.1-sol · Max | 52 | US$0.72 |
| grok-4.7 · Xhigh | 46 | US$3.74 |
| kimi-k3 · Max | 44 | US$2.00 |
| gemini-3.8-flash · High | 41 | US$1.24 |
| deepseek-v4-pro · Max | 36 | US$0.67 |
在相同評測版本內比較基準測試分數和實測任務費用,同時查看各模型的推理設置。僅憑輸入/輸出價格無法衡量性能。缺少的測量值會保持未知。
不是。基準測試分數描述的是特定評測。你的任務、延遲、推理設置和總費用都會影響選擇。請結合分數與費用列,並打開基準測試來源查看條件。
不是。這表示目錄中沒有可比較且經覈實的測量值。我們不會把分數設為零,也不會根據模型名稱或token價格推算分數。缺失值與實測結果分開處理。