Häufig gestellte Fragen

Wie lassen sich Leistung und Kosten von KI-Modellen vergleichen?

Vergleiche Benchmark-Punktzahlen und gemessene Aufgabenkosten innerhalb derselben Evaluierungsversion und prüfe die Reasoning-Einstellungen der einzelnen Modelle. Ein- und Ausgabepreise allein messen nicht die Leistung. Fehlende Messwerte bleiben unbekannt.

Ist das Modell mit der höchsten Punktzahl immer das beste für mich?

Nein. Benchmark-Punktzahlen beziehen sich auf eine bestimmte Evaluierung. Deine Aufgabe, Latenz, Reasoning-Einstellungen und Gesamtkosten können die Wahl beeinflussen. Betrachte Punktzahl und Kosten gemeinsam und öffne die Benchmark-Quelle, um die Bedingungen zu prüfen.

Bedeutet eine unbekannte Benchmark-Punktzahl, dass ein Modell schlecht abschneidet?

Nein. Das bedeutet, dass in diesem Katalog keine vergleichbare verifizierte Messung verfügbar ist. Wir setzen die Punktzahl nicht auf null und schätzen sie auch nicht anhand eines Modellnamens oder Tokenpreises. Fehlende Werte bleiben von gemessenen Ergebnissen getrennt.