常见问题
如何比较 AI 模型性能和费用?
在相同评测版本内比较基准测试分数和实测任务费用,同时查看各模型的推理设置。仅凭输入/输出价格无法衡量性能。缺少的测量值会保持未知。
得分最高的模型总是最适合我吗?
不是。基准测试分数描述的是特定评测。你的任务、延迟、推理设置和总费用都会影响选择。请结合分数与费用列,并打开基准测试来源查看条件。
基准测试分数未知就表示模型表现不好吗?
不是。这表示目录中没有可比较且经核实的测量值。我们不会把分数设为零,也不会根据模型名称或token价格推算分数。缺失值与实测结果分开处理。