Często zadawane pytania

Jak porównywać wydajność i koszty modeli AI?

Porównuj wyniki benchmarków i zmierzone koszty zadań w tej samej wersji ewaluacji, sprawdzając ustawienia rozumowania każdego modelu. Same ceny wejścia i wyjścia nie mierzą wydajności. Brakujące pomiary pozostają nieznane.

Czy model z najwyższym wynikiem zawsze będzie dla mnie najlepszy?

Nie. Wyniki benchmarków opisują konkretną ewaluację. Na wybór mogą wpływać zadanie, opóźnienie, ustawienia rozumowania i koszt całkowity. Korzystaj jednocześnie z kolumn wyniku i kosztu, a warunki sprawdź w źródle benchmarku.

Czy nieznany wynik benchmarku oznacza słabą wydajność modelu?

Nie. Oznacza to, że w katalogu nie ma porównywalnego, zweryfikowanego pomiaru. Nie przypisujemy zera ani nie szacujemy wyniku na podstawie nazwy modelu lub ceny tokenu. Brakujące wartości pozostają oddzielone od zmierzonych wyników.