常見問題
如何比較 AI 模型性能和費用?
在相同評測版本內比較基準測試分數和實測任務費用,同時查看各模型的推理設置。僅憑輸入/輸出價格無法衡量性能。缺少的測量值會保持未知。
得分最高的模型總是最適合我嗎?
不是。基準測試分數描述的是特定評測。你的任務、延遲、推理設置和總費用都會影響選擇。請結合分數與費用列,並打開基準測試來源查看條件。
基準測試分數未知就表示模型表現不好嗎?
不是。這表示目錄中沒有可比較且經覈實的測量值。我們不會把分數設為零,也不會根據模型名稱或token價格推算分數。缺失值與實測結果分開處理。